Частотний список сучасної української мови за лемами, згрупований за покриттям, зібраний як відкриті дані. Він дає відповідь на практичне питання конкретним числом: яку частку прочитаного насправді відкриває певний обсяг словника?
Звіт, з якого почалася ця серія, прямо називав проблему: для української частотні списки, потрібні серйозному учневі, є неповними, часто побудованими за словоформами, а подекуди тихцем скальковані з російської. Список за словоформами розпорошує частоту одного слова на десяток і більше відмінюваних форм, тож занижує те, що дає певний обсяг словника.
Цей список натомість рахує леми, тобто словникову форму, яку учень і вивчає, разом із частиною мови. Його виведено з великого, сучасного, україномовного корпусу, тож він відображає те, як українці пишуть сьогодні, а не підручник середини минулого століття.
Для порівняння: в англійській близько 2800 слів General Service List дають у середньому близько 82% покриття. Українській потрібно значно більше лем, щоб дійти туди ж. Це і є податок словозміни, виміряний.
Найчастотніші леми з частиною мови та частотою на тисячу. Усі 12000 у файлі для завантаження.
| № | Лема | ЧМ | на тисячу |
|---|---|---|---|
| 1 | в | ADP | 20.7489 |
| 2 | на | ADP | 20.6735 |
| 3 | у | ADP | 18.6486 |
| 4 | і | CCONJ | 16.5815 |
| 5 | з | ADP | 15.259 |
| 6 | бути | VERB | 10.6332 |
| 7 | не | PART | 10.4292 |
| 8 | що | SCONJ | 10.3296 |
| 9 | до | ADP | 9.1939 |
| 10 | за | ADP | 8.5376 |
| 11 | та | CCONJ | 8.4347 |
| 12 | який | DET | 7.9025 |
| 13 | рік | NOUN | 6.6948 |
| 14 | про | ADP | 6.2134 |
| 15 | він | PRON | 6.1849 |
| 16 | Україна | PROPN | 5.8085 |
| 17 | це | PRON | 5.7827 |
| 18 | а | CCONJ | 4.994 |
| 19 | цей | DET | 4.3466 |
| 20 | як | SCONJ | 4.203 |
| 21 | для | ADP | 4.1004 |
| 22 | від | ADP | 3.9154 |
| 23 | я | PRON | 3.642 |
| 24 | вони | PRON | 3.403 |
Розподіл списку за частинами мови. Власні назви включено й позначено, тож їх можна відфільтрувати.
Нитка два мала позначити кожну високочастотну лему рівнем CEFR, і тепер може. Існує рівно один корпусно вивірений, експертно погоджений профіль лексики CEFR для української (Synchak і колеги, 2025, на платформі PULS), і співавтор дав дозвіл поширювати його рівні за лемами від A1 до C1. Приєднана до цього частотного списку, з урахуванням частини мови, ця вивірена карта тепер позначає 6207 з перших 12000 лем. Це головне в цій нитці, нижче.
Поруч стоять два чесні супутники. Опублікований у статті розподіл лишається цитованим (це заморожений вигляд, який жива карта вже перевершує), звірений із кривою покриття цього списку, щоб показати, чому ранг за частотою не є рівнем володіння. А відкрите, невивірене накладання курсу лишається як пряма звірка: щойно з'явилася вивірена карта, вільний сигнал можна виміряти проти неї. Вивірена карта це датований знімок, а не остаточний, бо профіль ще розширюють.
Леми, розміщені експертно погодженим процесом (Synchak та ін., 2025) проти цілі проєкту на кожен рівень. Повний до B1, попередній вище.
Вивірене ядро A1 та A2 (2363 леми) проти ядра того ж розміру, узятого прямо з цього частотного списку, за покриттям суцільного тексту. Їх виміряно на різних корпусах, тож сприймайте розрив як орієнтовний: педагогічний добір свідомо міняє сире покриття на придатність до навчання.
Чому вони розходяться: вивірений профіль виводить наперед комунікативно корисні слова, які не є найчастотнішими (борщ, зошит), і піднімає високочастотні абстрактні іменники (наука, освіта) до B1 через концептуальне навантаження. Частотний список оптимізує покриття; рівень CEFR кодує придатність до навчання. Саме тому не можна механічно перейменувати одне на інше, і саме тому справжнє накладання CEFR тут чекає на відкриті дані вище за B1.
Це головне в нитці два: єдиний корпусно вивірений, експертно погоджений профіль CEFR для української (Synchak та ін., 2025, платформа PULS), приєднаний до цього частотного списку за лемами. Співавтор дав дозвіл поширювати рівні за лемами від A1 до C1; зіставлення враховує частину мови, тож омограф відкидається, а не позначається хибно. Рівень кожної леми це рівень її появи, найраніший, на якому профіль її вводить.
Це датований знімок, а не остаточна карта. Профіль ще розширюють (у живому списку вже більше лем B2 і C1, ніж в опублікованій статті), тож сприймайте ці рівні як вивірені, але попередні.
6,207 з перших 12000 лем тепер мають вивірений рівень CEFR, від A1 до C1
Лише слабко, і це і є висновок. Рангова кореляція між вивіреним рівнем і частотою в корпусі дорівнює 0.379: медіанний ранг за частотою рівно зростає від A1 до C1, тож упорядкування притомне, але відповідність слабка. Рівень CEFR і ранг за частотою просто не одна вісь, і саме тому не можна перейменувати одне на інше.
Виміряно на 1,965 лемах, які покривають і вивірена карта, і відкрите накладання курсу, порівнюючи первинну здогадку курсу (перша поява) з вивіреним рівнем. Значно суворіша перевірка, ніж мала ручна еталонна вибірка: це весь перетин.
| № | Лема | CEFR |
|---|---|---|
| 1 | в | A1 |
| 2 | на | A1 |
| 3 | у | A1 |
| 4 | і | A1 |
| 5 | з | A1 |
| 6 | бути | A1 |
| 8 | що | A2 |
| 11 | та | A2 |
| 20 | як | A2 |
| 38 | під | A2 |
| 45 | по | A2 |
| 47 | після | A2 |
| 61 | заявити | C1 |
| 69 | повідомити | B1 |
| 72 | рада | B2 |
| 73 | і | B1 |
| 75 | ж | B1 |
| 78 | й | B1 |
| 80 | при | B1 |
| 83 | повідомляти | B1 |
| 121 | зазначити | B2 |
| 155 | представник | B2 |
| 213 | верховний | B2 |
| 225 | управління | B2 |
| 252 | примітка | B2 |
| 292 | глава | C1 |
| 411 | чин | C1 |
| 429 | розслідування | C1 |
| 622 | виборчий | C1 |
| 752 | законодавство | C1 |
Вивірена карта вище потребує дозволу авторів на поширення. Це накладання це цілком відкрита альтернатива: воно позначає наші леми з відкритого курсу learn-ukrainian (Krisztian Koos, CC-BY-SA), експертного добору на основі українського Держстандарту 2024, без потреби в дозволі. Рівень леми тут це перший урок курсу, де вона з'являється, тож сприймайте це як приблизний сигнал порядку навчання, а не рівень володіння.
Тепер його роль це звірка, а не запасний варіант. Вивірене накладання вище зіставляє їх на всьому перетині; ця картка зберігає власне калібрування відкритого накладання проти опублікованих еталонних точок. Ані відкрита карта сама, ані заморожені таблиці статті не є завершеним інструментом, на який заслуговує учень, і подолати цей розрив це і є мета серії.
2,326 з перших 12000 лем мають відкриту позначку CEFR, від A1 до B2
Synchak та ін. публікують конкретні рівні CEFR для окремих лем. Там, де вони перетинаються з цим накладанням, розбіжність вимірюється напряму, тож накладання відкалібровано, а не просто заявлено. Вибірка мала (кілька десятків еталонних лем), тож зважайте на інтервал, а не на точкову оцінку.
| Лема | Вивірено | Накладання | |
|---|---|---|---|
| бути | A1 | A1 | ✓ |
| рік | A1 | A1 | ✓ |
| він | A1 | A1 | ✓ |
| для | A1 | B1 | ≠ |
| я | A1 | A1 | ✓ |
| вони | A1 | A1 | ✓ |
| також | A1 | A1 | ✓ |
| вона | A1 | A1 | ✓ |
| час | A1 | A1 | ✓ |
| мати | A1 | A1 | ✓ |
| могти | A1 | A1 | ✓ |
| людина | A1 | A1 | ✓ |
| після | A2 | A1 | ≠ |
| новий | A1 | A1 | ✓ |
| перший | A1 | A2 | ≠ |
| країна | A1 | A1 | ✓ |
| сказати | A1 | A1 | ✓ |
| стати | A1 | A2 | ≠ |
| особа | A2 | A1 | ≠ |
| через | A1 | B1 | ≠ |
| область | A1 | B1 | ≠ |
| заявити | C1 | B1 | ≠ |
| або | A1 | A1 | ✓ |
| щоб | A2 | A1 | ≠ |
| голова | A1 | A1 | ✓ |
| два | A1 | A1 | ✓ |
| місто | A1 | A1 | ✓ |
| повідомити | B1 | A2 | ≠ |
| слово | A1 | A1 | ✓ |
| день | A1 | A1 | ✓ |
| місце | A1 | A1 | ✓ |
| робота | A1 | A1 | ✓ |
| повідомляти | B1 | B1 | ✓ |
| себе | A2 | A2 | ✓ |
| якщо | A1 | A1 | ✓ |
| питання | A1 | A1 | ✓ |
| великий | A1 | A1 | ✓ |
| щодо | B1 | B1 | ✓ |
| рішення | B1 | B1 | ✓ |
| компанія | A1 | A2 | ≠ |
| район | A1 | A1 | ✓ |
| раніше | A2 | A1 | ≠ |
| отримати | A1 | A2 | ≠ |
| частина | A1 | A1 | ✓ |
| партія | B1 | B2 | ≠ |
| хто | A1 | A1 | ✓ |
| працювати | A1 | A1 | ✓ |
| результат | A1 | A2 | ≠ |
| можна | A1 | A1 | ✓ |
| дитина | A1 | A1 | ✓ |
| головний | A1 | A2 | ≠ |
| село | A1 | A1 | ✓ |
| склад | B1 | A1 | ≠ |
| держава | A2 | B2 | ≠ |
| чоловік | A1 | A1 | ✓ |
| хотіти | A1 | A1 | ✓ |
| життя | A1 | A2 | ≠ |
| право | B1 | B2 | ≠ |
| сьогодні | A1 | A1 | ✓ |
| уряд | B1 | B2 | ≠ |
| між | A2 | A2 | ✓ |
| вибори | B1 | B1 | ✓ |
| тисяча | A1 | A1 | ✓ |
| знати | A1 | A1 | ✓ |
| дія | B1 | A1 | ≠ |
| ситуація | A1 | B2 | ≠ |
| тут | A1 | A1 | ✓ |
| зараз | A1 | A1 | ✓ |
| центр | A1 | A1 | ✓ |
| становити | B1 | B2 | ≠ |
| допомога | A1 | A1 | ✓ |
| три | A1 | A1 | ✓ |
| березень | A1 | A1 | ✓ |
| зробити | A1 | B1 | ≠ |
| місцевий | A2 | A2 | ✓ |
| кількість | B1 | A2 | ≠ |
| початок | A1 | A1 | ✓ |
| другий | A1 | B1 | ≠ |
| почати | A1 | B1 | ≠ |
| гривня | A1 | A1 | ✓ |
| стан | B1 | B1 | ✓ |
| там | A1 | A1 | ✓ |
| писати | A1 | A1 | ✓ |
| мета | B1 | A2 | ≠ |
| освіта | B1 | A2 | ≠ |
| жити | A1 | A1 | ✓ |
| написати | A1 | A2 | ≠ |
| чорний | A1 | A1 | ✓ |
| наука | B1 | A2 | ≠ |
| білий | A1 | A1 | ✓ |
| підписати | A2 | B1 | ≠ |
| займатися | A2 | A2 | ✓ |
| червоний | A1 | A1 | ✓ |
| стіл | A1 | A1 | ✓ |
| зелений | A1 | A1 | ✓ |
| традиція | A1 | A2 | ≠ |
| підпис | A1 | B1 | ≠ |
| ліжко | A1 | A1 | ✓ |
| синій | A1 | A1 | ✓ |
| крісло | A1 | A1 | ✓ |
| годинник | A1 | B1 | ≠ |
| помаранчевий | A2 | A1 | ≠ |
| цікавитися | A2 | A2 | ✓ |
| типовий | A2 | A1 | ≠ |
| стілець | A1 | A1 | ✓ |
| меблі | A1 | A2 | ≠ |
| захоплюватися | A2 | A2 | ✓ |
| посуд | A1 | B1 | ≠ |
| допис | B1 | B1 | ✓ |
| лампа | A1 | A1 | ✓ |
| шафа | A1 | B1 | ≠ |
| холодильник | A1 | A2 | ≠ |
| рушник | A1 | A1 | ✓ |
| диван | A1 | A1 | ✓ |
Лише 114 з 200 еталонних лем потрапляють у перші 12000 і мають ту саму частину мови, що й накладання; решта це рідші слова або омографи іншого значення. Промахи йдуть в обидва боки: частіше курс ставить конкретний, але рідкісний у корпусі іменник (шафа, посуд) вище, ніж вивірений профіль, який виводить його на A1 для початківця; рідше він ставить абстрактний іменник (наука, освіта) на рівень нижче. Значна частина цього розриву це не помилка, а дві філософії: курс іде за тим, де слово викладають, а профіль робить свідомі винятки на користь початківця.
Зіставлення враховує частину мови, тож 75 омографів (наприклад, риба і числівник з однаковим написанням) відкинуто, а не позначено хибно. А там, де вивірений профіль публікує рівень, беремо саме його й позначаємо як вивірений, тож 114 позначок тут це власні рівні Synchak, а не евристики. Погодженість вище виміряно на евристиці ДО цих замін, тож число ними не прикрашене.
Слабко, і це чесна відповідь. Рангова кореляція між призначеним рівнем і частотою в корпусі дорівнює 0.283 (рівень CEFR це не частота, тож слабка відповідність очікувана), але медіанний ранг за частотою таки зростає від A1 до B2, тож упорядкування принаймні напрямково притомне.
| № | Лема | CEFR |
|---|---|---|
| 1 | в | A1 |
| 2 | на | A1 |
| 3 | у | A1 |
| 4 | і | A1 |
| 5 | з | A1 |
| 6 | бути | A1 |
| 9 | до | B1 |
| 10 | за | A2 |
| 22 | від | B1 |
| 38 | під | A2 |
| 45 | по | B1 |
| 47 | після | A2 |
| 57 | особа | A2 |
| 61 | заявити | C1 |
| 63 | щоб | A2 |
| 69 | повідомити | B1 |
| 83 | повідомляти | B1 |
| 85 | себе | A2 |
| 90 | щодо | B1 |
| 123 | дані | B2 |
| 284 | матч | B2 |
| 330 | парламент | B2 |
| 337 | акція | B2 |
| 401 | порушення | B2 |
| 406 | належати | B2 |
Огляд поля нижче раніше позначав лексичний мінімум A1 «1000 й 1 слово» (Ксенія Бородін і Оксана Туркевич, Школа української мови та культури, Український католицький університет) як замурований: ліцензія CC-BY-4.0, але публікація лише у форматі PDF, недосяжному для екстрактора, тож єдиний незалежний, емпірично обґрунтований орієнтир A1 для української не можна було приєднати, і модель строгості накладання чесно називала цю відсутню звірку прогалиною. Ця сторінка попросила в авторів машиночитану таблицю, і співавторка Ксенія Бородін надіслала список сама. Ця картка це той список, приєднаний до частотного списку й переопублікований як відкриті дані з атрибуцією, за власною ліцензією посібника.
Зіставлення чесне щодо своєї зернистості. Одиниця авторів це опублікована стаття словника (окреме слово, видова пара, пара чоловічого й жіночого роду, часом ціла фраза), список не має частин мови, тож зіставлення йде за рядком леми на найкращому ранзі, грубіше за накладання вище, які враховують частину мови. Фразові статті пораховано, а не приєднано силоміць, і слово для початківця, якого корпус не ранжує, чесно лишається поза списком.
838 з 929 унікальних статей A1 приєднуються до перших 12000, сягаючи 833 окремих лем
З 768 приєднаних лем, які покриває й вивірена карта PULS, 75.4 відсотка мають вивірений рівень A1, а 96.5 відсотка сидять на A1 або A2. Два незалежні зусилля, корпусно вивірений профіль і експертний лексичний мінімум, сходяться на тому, що таке українська для початківця. Кілька слів вище за A2 це здебільшого ціна грубішого зіставлення: автомат з A1 (квитковий) пишеться так само, як автомат із C1 (зброя), і без частини мови цей список їх не розрізнить.
833 зіставлені леми покривають близько 34.7 відсотка суцільного тексту; 833 найчастотніших лем покрили б близько 57.5 відсотка. Це той самий висновок, що й для вивіреного ядра вище, тепер виміряний на джерелі, якого ця сторінка не будувала: педагогічний добір A1 свідомо міняє сире покриття на конкретні, придатні до навчання слова, і 72 його словникових статей (апельсин, виделка, бутерброд) взагалі не входять у ці новинно-важкі перші 12000.
| № | Опублікована стаття | Лема | PULS |
|---|---|---|---|
| 1 | в, у | в | A1 |
| 2 | на | на | A1 |
| 4 | і, й, та | і | A1 |
| 5 | з, із, зі | з | A1 |
| 6 | бути | бути | A1 |
| 7 | не | не | A1 |
| 1536 | готель | готель | A1 |
| 1545 | стать | стать | A2 |
| 1546 | дочка | дочка | A1 |
| 1549 | готувати | готувати | A1 |
| 1566 | папір | папір | A1 |
| 1570 | купувати – купити | купити | A1 |
| 11650 | цукерка | цукерка | A1 |
| 11758 | курка | курка | A1 |
| 11839 | крем | крем | A2 |
| 11871 | фотографувати | фотографувати | A1 |
Картка A1 вище закрила одну прогалину. Її примітка про походження чесно фіксувала й іншу, відкриту: том A2 тієї самої серії існував, але машиночитаного списку A2 ніхто не надавав. Відтоді цей том опублікували у відкритому доступі за ліцензією CC-BY-4.0 Ксенія Бородін і Олеся Лазаренко в Європейському університеті Віадріна, тож прогалина закривається публікацією, а не послугою. Ця картка це його реєстр на 1000 статей, видобутий із PDF самої публікації, приєднаний до частотного списку так само грубо й переопублікований як відкриті дані з атрибуцією.
Тепер можна відповісти на два питання, недосяжні раніше. Оскільки це наступний том тих самих авторок, два списки разом вимірюють, чого насправді коштує один крок CEFR, у частотних рангах, а не в кількості слів. А оскільки книжка A2 друкує всю свою лексику ще й перегрупованою за власною 51 темою, це перше джерело на цій сторінці, яке може сказати, ЯКІ семантичні поля пропускає новинно-важкий частотний список, а не лише скільки слів він пропускає.
708 з 1,000 опублікованих статей A2 приєднуються до перших 12000, сягаючи 707 окремих лем
Лише 45 статей A2 це слова, які вже мав мінімум A1 тих самих авторок, і майже всі вони дієслова, що доростають до видової пари. Решта 955 (95.5 відсотка) нові на A2, і вони відчутно глибші в корпусі: медіанний ранг 2,902 проти 1,643 для слів, піднятих із A1. Крок CEFR це не більша купа тих самих слів. Це рух назовні, до рідкісніших.
Книжка групує свої 1,124 тематичних одиниць під 51 темами. У зіставленні з частотним списком 21.6 відсотка з них узагалі не входять у перші 12000, і пропуски розподілені нерівномірно. Найгірше покриті поля конкретні, побутові, тілесні: їжа, особиста гігієна, побутова техніка й числівники, де поза списком опиняються і збірні форми, і порядкові, які авторки свідомо довели до тридцятого, щоб можна було назвати дату. Корпус опублікованих українських новин погано описує кухню.
З 656 приєднаних лем, які покриває й вивірена карта PULS, 70.3 відсотка сидять на A1 або A2, а 29.7 відсотка вище за A2, майже всі на B1. Це слабша згода, ніж знайшла картка A1, і так і має бути: саме на A2 два експертні зусилля починають розходитися щодо межі, а грубе зіставлення за рядком леми додає власного шуму. Сторінка показує це розходження, а не підганяє його.
707 зіставлені леми покривають близько 11.9 відсотка суцільного тексту; 707 найчастотніших лем покрили б близько 55.1 відсотка. Обмін, який виміряла картка A1, різко ширшає на A2, і 229 словникових статей узагалі не входять у ці новинно-важкі перші 12000, проти 72 на A1. Це чесна стеля навчання за частотою: за межами ядра для початківців частотний список і програма курсу перестають описувати ту саму мову.
| № | Опублікована стаття | Лема | PULS |
|---|---|---|---|
| 9 | до | до | A1 |
| 21 | для | для | A1 |
| 22 | від | від | A1 |
| 25 | свій | свій | · |
| 27 | Бува́й(те)! | те | A1 |
| 35 | той | той | A1 |
| 2771 | дах | дах | A2 |
| 2814 | Бе́льгія | Бельгія | · |
| 2823 | звук (Р.в. одн. зву́ка) | звук | A2 |
| 2837 | відві́дувач / відві́дувачка | відвідувач | B1 |
| 2841 | зустріча́ти(ся) – зустрі́ти(ся) | зустріти | A1 |
| 2844 | підзе́мний | підземний | B1 |
| 11797 | А́рктика | Арктика | · |
| 11811 | волейбо́л | волейбол | A2 |
| 11925 | симпати́чний | симпатичний | B1 |
| 11969 | па́ска | паска | A2 |
Картка вище каже, що 229 словникових статей мінімуму A2 не входять у перші 12000 цього списку, і читає це як стелю навчання за частотою. Але це прочитання спирається на неперевірене припущення. Цей список побудовано на ОБ’ЄДНАНОМУ корпусі UberText 2.0, а найбільша його частина з великим відривом це новини. Тож слово поза списком може бути рідкісним в українській, а може бути звичайним і просто відсутнім у журналістиці, яка нечасто говорить про виделки, гарбузи чи краватки. Ці два прочитання дають протилежні поради тому, хто укладає словник, і ніщо вище не може їх розрізнити.
Тому ми побудували два частотні списки замість одного, з художнього та новинного підкорпусів UberText: та сама збірка, те саме очищення, той самий лематизатор, та сама форма вибірки, обидва обмежені однаковою кількістю токенів. Різниться лише жанр. Ранги нижче зіставні між собою і свідомо НЕ зіставні з основним списком на цій сторінці, який зробив інший лематизатор.
Новини сягають 658 статей (70.3 відсотка). Художня література 648 (69.2 відсотка). Майже стільки ж, і не ті самі слова: разом вони сягають 744 (79.5 відсотка). Другий жанр того самого розміру дає 9.2 пункти, яких не дало б збільшення першого. Для педагогічної мети різноманіття корпусу вартує більше за його розмір.
Обмін майже симетричний, і саме це робить його справжнім результатом, а не більшим молотком: художня література сягає 30.9 відсотків того, що пропускають новини, а новини 33.3 відсотків того, що пропускає художня література. Жоден жанр не кращий. Вони дивляться на різні частини мови.
Прочитайте два рядки разом, і механізм стає очевидним. Журналістика дає інституційне й географічне; художня література дає побутове, тілесне й чуттєве. Жодна з них сама по собі не є описом мови.
Ці ранги отримано нашим власним лематизатором на двох підкорпусах, а не тим, що стоїть за основним списком на цій сторінці. Вони зіставні між собою і більше ні з чим тут, і жодна цифра вище не змішує їх з основним списком. Лематизатор також хибно обробляє кілька частотних займенників, однаково в обох жанрах, тож він не може створити різницю між ними.
Нитка два тепер приєднує вивірений профіль (за дозволом авторів), наданий авторами лексичний мінімум A1 і відкрите накладання курсу. Те, що для цього знадобилося два прямі запити, і є суть: відкритий список за лемами з рівнями CEFR, стандартний ресурс для вивчення мови, зробили приблизно для десятка мов і жодного разу не опублікували як відкриті українські дані. Ось усе поле.
| Джерело | Доступ | Рівні |
|---|---|---|
| Ukrainian Vocabulary Profile (PULS)вивірено | за дозволом | A1-C1 (до B1) |
| State Standard 2024 (SLSUFL) | лише документи | A1-C2 |
| CEFR & Ukrainian-English Language Portfolios (PCUH) | лише документи | A1-B1 |
| learn-ukrainian course | відкрито, CC-BY-SA | A1-B2 |
| 1000+1 Words (Borodin, Turkevych) | надано авторами | A1 |
| 1000+1 Words A2 (Borodin, Lazarenko) | відкрито, CC-BY | A2 |
Ця сторінка долучить відкритий український список CEFR, щойно він з'явиться, і це не гіпотеза: мінімум A1 вище надійшов саме так, бо його автори відповіли на лист. Потрібна схема проста: лема, частина мови та рівень CEFR, у форматі CSV чи JSON.
Частотний список каже, які слова вчити. Але він не каже, що частина слів, які ви зустрінете в реальному українському тексті, це форми, які уважний редактор замінив би: русизми, суржик і кальки, що їх тихцем передавали старіші навчальні матеріали. Нитка три позначає їх на тому самому списку, з якого ви вчитеся.
Єдиного усталеного списку русизмів для звірки немає. Є натомість відкритий і підтримуваний інструментарій української стилістики: таблиці замін LanguageTool для української (проєкт brown-uk, той самий, що стоїть за морфологією VESUM). Ця нитка приєднує той інструментарій до частотного списку і для кожної з перших 12000 лем, які він позначає, показує питомий відповідник, який він радить.
Читайте це так само, як відкрите накладання CEFR з нитки два: це ВІДКРИТИЙ, придатний до звірки сигнал, але невивірений і приписовий. Це те, що замінив би стилістичний перевіряч, редакторська думка, а не усталений мовний присуд. Його ядро це дерусифікація, але обсяг інструментарію ширший за суто російські запозичення, і кілька позицій (поліцейський, безкоштовний) це живі дискусії про вжиток. Власні назви та правописні виправлення відкинуто. Кожна запропонована форма це власна форма інструментарію, збережена дослівно.
87 з перших 12000 лем мають позначку від стилістичного інструментарію
З 74 позначених форм, чий питомий відповідник це одне слово, 48 (64.9%) мають позначену форму щонайменше настільки ж частотною в реальному тексті, як її відповідник: питоме слово рідше або й узагалі поза першими 12000. Це і є унаочнення того, як старіші матеріали навчали кальки, а корпус досі її несе.
По одному рядку на частотну смугу, від найнижчого рангу. Кожна позначена форма, питомий відповідник, який радить інструментарій, і де цей відповідник лежить у списку. Повний список у файлі для завантаження.
| № | Позначена форма | Радять | Ранг питомої |
|---|---|---|---|
| 1,255 | поліцейськийNOUN | →поліційний | поза 12000 |
| 2,204 | прийомNOUN | →приймання | поза 12000 |
| 3,086 | безкоштовнийADJ | →безплатний | поза 12000 |
| 4,188 | безкоштовноADV | →безплатно | поза 12000 |
| 5,251 | передвиборнийADJ | →передвиборчий | #4,420↑ |
| 6,676 | недостовірнийADJ | →невірогідний | поза 12000 |
| 7,121 | місцезнаходженняNOUN | →місце | #81↑ |
| 8,004 | кримчанинNOUN | →кримець | поза 12000 |
| 9,167 | достовірнийADJ | →вірогідний | поза 12000 |
| 10,308 | подаліADV | →трохи далі | конструкція |
| 11,027 | благополуччяNOUN | →добра доля | конструкція |
11 із позначених прикметників це калька активного дієприкметника (діючий, існуючий): форми на -ючий, які має російська, а стандартна українська передає підрядним реченням (що діє). Інструментарій ставить таку перебудову першою.
Кожна нитка досі працювала з голою лемою, словниковою формою. Але учень мови з розвиненою словозміною зустрічає в тексті не заголовки, а форми. рік з'являється як року, роки, років, рокам. Дієслово має десятки форм. Нитка чотири додає ці форми, і звук, до всього списку з перших 12000 лем.
Джерело відкрите й машиночитне: таблиці відмінювання й дієвідмінювання Вікісловника (через видобуток kaikki.org), а також транскрипція IPA й аудіо носіїв, що лежать у тих самих статтях на Wikimedia Commons. Форми збережено дослівно, з наголосами; аудіо саме прилінковане, а не перерозміщене; а покриття оцінене чесно, а не припущене.
Вікісловник + Wikimedia, CC BY-SA8,339 лем із перших 12000, що відмінюються, розгортаються у 125,380 окремих словоформ, у середньому 15 на лему. Нитка один виміряла податок словозміни як повільне покриття тексту; це той самий податок, полічений у поверхневих формах, які треба впізнавати. Іменник має близько десяти форм, дієслово ближче до тридцяти.
Кілька частотних слів, відмінених чи дієвідмінених, з IPA й відкритим аудіо носія. Виберіть слово; форми це власні форми Вікісловника.
Саме це перетворює основу колоди Anki з нитки один із простого списку заголовків на колоду, що навчає кожне слово разом із його формами та звучанням.
Усі п'ять ниток уже вийшли. Кожна називає відкрите джерело, на якому побудована, і кожна цифра на цій сторінці перераховується з наявного релізу. Жодна нитка не заявляє результату, якого не може показати.
Дванадцять тисяч найуживаніших лем сучасної української, упорядкованих за частотою в корпусі, кожна з частиною мови, частотою на тисячу, накопиченим покриттям тексту та смугою за рангом. Виходить як CSV і JSON, а також основа колоди для Anki.
Вивчайте спершу ті слова, що справді окупляться, у правильному порядку, як леми, а не розпорошені словоформи. Бачте, скільки покриття тексту дає певний обсяг словника.
Звірити частотний список з єдиним корпусно вивіреним профілем CEFR для української (Synchak та ін., 2025): що покриває вивірена карта, де вона зупиняється (усталена до B1) і чому ранг за частотою не є рівнем володіння. Профілює цей ресурс чесно, а не вигадує рівні, яких вивірені дані ще не мають.
Побачити, як далеко насправді веде вивірений словник рівнів A1 та A2 і чому частотні смуги не є рівнями CEFR.
Позначити русизми та суржикові форми у списку й дати до них питомий український відповідник, спираючись на відкритий морфологічний і стилістичний інструментарій (VESUM і LanguageTool Правописник).
Вивчати питоме слово, а не скальковане, якому тихцем навчають старіші матеріали.
Додати до кожної з перших 12000 лем вимову й парадигму відмінювання з відкритих таблиць Вікісловника (kaikki.org) та відкритого аудіо Wikimedia, щоб лему подавали як її форми, а не сам заголовок. Покриття оцінене чесно, а множник словозміни виміряний.
Чути слово, бачити, як воно змінюється за сімома відмінками та видовими парами (там, де словозміна ускладнює), і бачити, у скільки словоформ насправді розгортаються слова, які ви вчите.
Самооцінний тест обсягу словника за принципом так чи ні на основі цього списку: 60 реальних лем і 60 сконструйованих псевдослів, розподілених по 12 частотних смугах, оцінені стандартною поправкою на хибні спрацювання й переведені в криву покриття. Готового українського відповідника немає.
Вимірювати свій словник проти реального індикатора рівня, а не вгадувати, і бачити, скільки тексту цей словник насправді відкриває.
Усе на цій сторінці перераховується з цих файлів. Вони версіоновані та хешовані. Список під ліцензією CC-BY: користуйтеся, форкайте, будуйте далі.
Файл lemmas.anki.tsv імпортується прямо в Anki як основа частотної колоди.
Lawrence, J. (2026). Ukrainian Frequency: a lemma-based, coverage-graded open frequency list (v0.1.0). jakelawrence.xyz/research/ukrainian-frequency. Derived from UberText 2.0 (Chaplynskyi, 2023).
Ці перевірки виконуються у вашому браузері проти опублікованих чисел. Якщо якась не проходить, реліз неузгоджений, і сторінка це показує.
Джерело частотності це словник лем UberText 2.0 (lang-uk). Цей реліз перевидає похідні агреговані підрахунки, які є фактами, а не текст вихідного корпусу. Рядки відфільтровано до українських кириличних лем із лінгвістичною частиною мови за Universal Dependencies; пунктуацію, символи, цифрові токени, чужомовні чи некласифіковані токени та односимвольні власні назви відкинуто.
Покриття тут перераховано з сирих підрахунків уживань, а не взято з власних частотних колонок вихідного файлу, чия нормалізація не задокументована. Частотні смуги це прозорі кошики по тисячі за рангом, і це НЕ рівні CEFR; вивірене вирівнювання за CEFR це нитка 2, яка профілює єдиний вивірений ресурс, а не вигадує рівні. Корпус насичений новинами й довідковими текстами, тож воєнна та цивільна лексика посідає помітні місця. Це розкрито, а не згладжено.
Частина сталої роботи над подоланням розриву в цифровому інструментарії для української мови.