EnglishУкраїнською
Українська частотність / Польові дані

Слова, які окупляться найперше

Частотний список сучасної української мови за лемами, згрупований за покриттям, зібраний як відкриті дані. Він дає відповідь на практичне питання конкретним числом: яку частку прочитаного насправді відкриває певний обсяг словника?

Відкритий набір данихОновлено 2026-07-28 · v0.1.0 · CC-BY-4.0

Навіщо частотний список і чому за лемами

Звіт, з якого почалася ця серія, прямо називав проблему: для української частотні списки, потрібні серйозному учневі, є неповними, часто побудованими за словоформами, а подекуди тихцем скальковані з російської. Список за словоформами розпорошує частоту одного слова на десяток і більше відмінюваних форм, тож занижує те, що дає певний обсяг словника.

Цей список натомість рахує леми, тобто словникову форму, яку учень і вивчає, разом із частиною мови. Його виведено з великого, сучасного, україномовного корпусу, тож він відображає те, як українці пишуть сьогодні, а не підручник середини минулого століття.

12,000
лем упорядковано
1.5B
слововживань у вихідному корпусі
60.74%
покривають перші 1000 лем
82%
покривають перші 5000 лем
Покриття

Крива покриття

0%25%50%75%100%1005001,0005,00012,000Вивчено лем (від найчастотніших)
Яку частку слововживань у тексті дають перші N лем. Крива є чесною відповіддю на те, як далеко сягає словник.

Для порівняння: в англійській близько 2800 слів General Service List дають у середньому близько 82% покриття. Українській потрібно значно більше лем, щоб дійти туди ж. Це і є податок словозміни, виміряний.

Список

Сам список

Найчастотніші леми з частиною мови та частотою на тисячу. Усі 12000 у файлі для завантаження.

ЛемаЧМна тисячу
1вADP20.7489
2наADP20.6735
3уADP18.6486
4іCCONJ16.5815
5зADP15.259
6бутиVERB10.6332
7неPART10.4292
8щоSCONJ10.3296
9доADP9.1939
10заADP8.5376
11таCCONJ8.4347
12якийDET7.9025
13рікNOUN6.6948
14проADP6.2134
15вінPRON6.1849
16УкраїнаPROPN5.8085
17цеPRON5.7827
18аCCONJ4.994
19цейDET4.3466
20якSCONJ4.203
21дляADP4.1004
22відADP3.9154
23яPRON3.642
24вониPRON3.403
Де лежать віхи
60.74%
Перші 1,000 лем: 60.74% тексту
#1,000: тощо PART
70.5%
Перші 2,000 лем: 70.5% тексту
#2,000: ліквідація NOUN
82%
Перші 5,000 лем: 82% тексту
#5,000: перевозити VERB
88.39%
Перші 10,000 лем: 88.39% тексту
#10,000: безсмертний ADJ

Які це слова

Розподіл списку за частинами мови. Власні назви включено й позначено, тож їх можна відфільтрувати.

NOUN5,154 (43%)
ADJ2,418 (20.2%)
VERB2,109 (17.6%)
PROPN1,335 (11.1%)
ADV641 (5.3%)
PART87 (0.7%)
ADP80 (0.7%)
DET48 (0.4%)
SCONJ32 (0.3%)
NUM31 (0.3%)
PRON30 (0.3%)
CCONJ25 (0.2%)
INTJ10 (0.1%)
Українська частотність / Вирівнювання за CEFR

Що вивірена карта CEFR може, а чого не може сказати

Нитка два мала позначити кожну високочастотну лему рівнем CEFR, і тепер може. Існує рівно один корпусно вивірений, експертно погоджений профіль лексики CEFR для української (Synchak і колеги, 2025, на платформі PULS), і співавтор дав дозвіл поширювати його рівні за лемами від A1 до C1. Приєднана до цього частотного списку, з урахуванням частини мови, ця вивірена карта тепер позначає 6207 з перших 12000 лем. Це головне в цій нитці, нижче.

Поруч стоять два чесні супутники. Опублікований у статті розподіл лишається цитованим (це заморожений вигляд, який жива карта вже перевершує), звірений із кривою покриття цього списку, щоб показати, чому ранг за частотою не є рівнем володіння. А відкрите, невивірене накладання курсу лишається як пряма звірка: щойно з'явилася вивірена карта, вільний сигнал можна виміряти проти неї. Вивірена карта це датований знімок, а не остаточний, бо профіль ще розширюють.

Вивірений профіль за рівнями
A1969 / 700
A21,394 / 1,000
B12,141 / 1,500
B21,140 / 1,900
C1220 / 2,300
C227 / 2,600
розміщено (A1–B1) розміщено (B2–C2) ціль

Леми, розміщені експертно погодженим процесом (Synchak та ін., 2025) проти цілі проєкту на кожен рівень. Повний до B1, попередній вище.

Ранг за частотою не є рівнем володіння

Вивірене ядро A1 та A2 (2363 леми) проти ядра того ж розміру, узятого прямо з цього частотного списку, за покриттям суцільного тексту. Їх виміряно на різних корпусах, тож сприймайте розрив як орієнтовний: педагогічний добір свідомо міняє сире покриття на придатність до навчання.

Чому вони розходяться: вивірений профіль виводить наперед комунікативно корисні слова, які не є найчастотнішими (борщ, зошит), і піднімає високочастотні абстрактні іменники (наука, освіта) до B1 через концептуальне навантаження. Частотний список оптимізує покриття; рівень CEFR кодує придатність до навчання. Саме тому не можна механічно перейменувати одне на інше, і саме тому справжнє накладання CEFR тут чекає на відкриті дані вище за B1.

Вивірено / Знімок

Вивірена карта CEFR, приєднана до списку

Знімок 2026-07-23

Це головне в нитці два: єдиний корпусно вивірений, експертно погоджений профіль CEFR для української (Synchak та ін., 2025, платформа PULS), приєднаний до цього частотного списку за лемами. Співавтор дав дозвіл поширювати рівні за лемами від A1 до C1; зіставлення враховує частину мови, тож омограф відкидається, а не позначається хибно. Рівень кожної леми це рівень її появи, найраніший, на якому профіль її вводить.

Це датований знімок, а не остаточна карта. Профіль ще розширюють (у живому списку вже більше лем B2 і C1, ніж в опублікованій статті), тож сприймайте ці рівні як вивірені, але попередні.

6,207 з перших 12000 лем тепер мають вивірений рівень CEFR, від A1 до C1

Вивірені позначки за рівнями
A1812
A2956
B11,564
B22,130
C1745
Яку частку перших N вивірено
Перші 1,000: 827 вивірено (82.7%)
Перші 2,000: 1,612 вивірено (80.6%)
Перші 5,000: 3,495 вивірено (69.9%)
Перші 12,000: 6,207 вивірено (51.7%)
Чи корелює вивірений рівень із частотою?

Лише слабко, і це і є висновок. Рангова кореляція між вивіреним рівнем і частотою в корпусі дорівнює 0.379: медіанний ранг за частотою рівно зростає від A1 до C1, тож упорядкування притомне, але відповідність слабка. Рівень CEFR і ранг за частотою просто не одна вісь, і саме тому не можна перейменувати одне на інше.

A11,595
A23,185
B13,788
B25,093
C17,550
медіанний ранг

Наскільки добре відкрите накладання з нею погоджується?

Виміряно на 1,965 лемах, які покривають і вивірена карта, і відкрите накладання курсу, порівнюючи первинну здогадку курсу (перша поява) з вивіреним рівнем. Значно суворіша перевірка, ніж мала ручна еталонна вибірка: це весь перетин.

45.6%
точний збіг (896/1,965)
86.6%
у межах одного рівня (1,701/1,965)
Зразок вивіреного накладання
ЛемаCEFR
1вA1
2наA1
3уA1
4іA1
5зA1
6бутиA1
8щоA2
11таA2
20якA2
38підA2
45поA2
47післяA2
61заявитиC1
69повідомитиB1
72радаB2
73іB1
75жB1
78йB1
80приB1
83повідомлятиB1
121зазначитиB2
155представникB2
213верховнийB2
225управлінняB2
252приміткаB2
292главаC1
411чинC1
429розслідуванняC1
622виборчийC1
752законодавствоC1
Вивірене накладання узгоджується
Відкрите / Невивірене, для звірки

Відкрите накладання, тепер як звірка вивіреної карти

Вивірена карта вище потребує дозволу авторів на поширення. Це накладання це цілком відкрита альтернатива: воно позначає наші леми з відкритого курсу learn-ukrainian (Krisztian Koos, CC-BY-SA), експертного добору на основі українського Держстандарту 2024, без потреби в дозволі. Рівень леми тут це перший урок курсу, де вона з'являється, тож сприймайте це як приблизний сигнал порядку навчання, а не рівень володіння.

Тепер його роль це звірка, а не запасний варіант. Вивірене накладання вище зіставляє їх на всьому перетині; ця картка зберігає власне калібрування відкритого накладання проти опублікованих еталонних точок. Ані відкрита карта сама, ані заморожені таблиці статті не є завершеним інструментом, на який заслуговує учень, і подолати цей розрив це і є мета серії.

2,326 з перших 12000 лем мають відкриту позначку CEFR, від A1 до B2

Наскільки воно точне? Звірка з вивіреним еталоном

Synchak та ін. публікують конкретні рівні CEFR для окремих лем. Там, де вони перетинаються з цим накладанням, розбіжність вимірюється напряму, тож накладання відкалібровано, а не просто заявлено. Вибірка мала (кілька десятків еталонних лем), тож зважайте на інтервал, а не на точкову оцінку.

63.2% ± 8.9
точний збіг (72/114)
86.8%
у межах одного рівня (99/114)
ЛемаВивіреноНакладання
бутиA1A1
рікA1A1
вінA1A1
дляA1B1
яA1A1
вониA1A1
такожA1A1
вонаA1A1
часA1A1
матиA1A1
могтиA1A1
людинаA1A1
післяA2A1
новийA1A1
першийA1A2
країнаA1A1
сказатиA1A1
статиA1A2
особаA2A1
черезA1B1
областьA1B1
заявитиC1B1
абоA1A1
щобA2A1
головаA1A1
дваA1A1
містоA1A1
повідомитиB1A2
словоA1A1
деньA1A1
місцеA1A1
роботаA1A1
повідомлятиB1B1
себеA2A2
якщоA1A1
питанняA1A1
великийA1A1
щодоB1B1
рішенняB1B1
компаніяA1A2
районA1A1
ранішеA2A1
отриматиA1A2
частинаA1A1
партіяB1B2
хтоA1A1
працюватиA1A1
результатA1A2
можнаA1A1
дитинаA1A1
головнийA1A2
селоA1A1
складB1A1
державаA2B2
чоловікA1A1
хотітиA1A1
життяA1A2
правоB1B2
сьогодніA1A1
урядB1B2
міжA2A2
вибориB1B1
тисячаA1A1
знатиA1A1
діяB1A1
ситуаціяA1B2
тутA1A1
заразA1A1
центрA1A1
становитиB1B2
допомогаA1A1
триA1A1
березеньA1A1
зробитиA1B1
місцевийA2A2
кількістьB1A2
початокA1A1
другийA1B1
початиA1B1
гривняA1A1
станB1B1
тамA1A1
писатиA1A1
метаB1A2
освітаB1A2
житиA1A1
написатиA1A2
чорнийA1A1
наукаB1A2
білийA1A1
підписатиA2B1
займатисяA2A2
червонийA1A1
стілA1A1
зеленийA1A1
традиціяA1A2
підписA1B1
ліжкоA1A1
синійA1A1
кріслоA1A1
годинникA1B1
помаранчевийA2A1
цікавитисяA2A2
типовийA2A1
стілецьA1A1
мебліA1A2
захоплюватисяA2A2
посудA1B1
дописB1B1
лампаA1A1
шафаA1B1
холодильникA1A2
рушникA1A1
диванA1A1

Лише 114 з 200 еталонних лем потрапляють у перші 12000 і мають ту саму частину мови, що й накладання; решта це рідші слова або омографи іншого значення. Промахи йдуть в обидва боки: частіше курс ставить конкретний, але рідкісний у корпусі іменник (шафа, посуд) вище, ніж вивірений профіль, який виводить його на A1 для початківця; рідше він ставить абстрактний іменник (наука, освіта) на рівень нижче. Значна частина цього розриву це не помилка, а дві філософії: курс іде за тим, де слово викладають, а профіль робить свідомі винятки на користь початківця.

Зіставлення враховує частину мови, тож 75 омографів (наприклад, риба і числівник з однаковим написанням) відкинуто, а не позначено хибно. А там, де вивірений профіль публікує рівень, беремо саме його й позначаємо як вивірений, тож 114 позначок тут це власні рівні Synchak, а не евристики. Погодженість вище виміряно на евристиці ДО цих замін, тож число ними не прикрашене.

Чи взагалі рівні корелюють із частотою?

Слабко, і це чесна відповідь. Рангова кореляція між призначеним рівнем і частотою в корпусі дорівнює 0.283 (рівень CEFR це не частота, тож слабка відповідність очікувана), але медіанний ранг за частотою таки зростає від A1 до B2, тож упорядкування принаймні напрямково притомне.

A11,612
A22,526
B13,570
B24,197
медіанний ранг
Позначки за рівнями
A1639
A2422
B1821
B2443
C11
Яку частку перших N позначено
Перші 1,000: 522 позначено (52.2%)
Перші 2,000: 893 позначено (44.7%)
Перші 5,000: 1,588 позначено (31.8%)
Перші 12,000: 2,326 позначено (19.4%)
Кожна позначка має ступінь довіри
вивірено (рівень Synchak) 114типове за частотою 2,184викид за частотою 28
Зразок накладання
ЛемаCEFR
1вA1
2наA1
3уA1
4іA1
5зA1
6бутиA1
9доB1
10заA2
22відB1
38підA2
45поB1
47післяA2
57особаA2
61заявитиC1
63щобA2
69повідомитиB1
83повідомлятиB1
85себеA2
90щодоB1
123даніB2
284матчB2
330парламентB2
337акціяB2
401порушенняB2
406належатиB2
Накладання узгоджується
Надано авторами / Консенсус A1

Друге джерело A1: автори надіслали список

Знімок 2026-07-27

Огляд поля нижче раніше позначав лексичний мінімум A1 «1000 й 1 слово» (Ксенія Бородін і Оксана Туркевич, Школа української мови та культури, Український католицький університет) як замурований: ліцензія CC-BY-4.0, але публікація лише у форматі PDF, недосяжному для екстрактора, тож єдиний незалежний, емпірично обґрунтований орієнтир A1 для української не можна було приєднати, і модель строгості накладання чесно називала цю відсутню звірку прогалиною. Ця сторінка попросила в авторів машиночитану таблицю, і співавторка Ксенія Бородін надіслала список сама. Ця картка це той список, приєднаний до частотного списку й переопублікований як відкриті дані з атрибуцією, за власною ліцензією посібника.

Зіставлення чесне щодо своєї зернистості. Одиниця авторів це опублікована стаття словника (окреме слово, видова пара, пара чоловічого й жіночого роду, часом ціла фраза), список не має частин мови, тож зіставлення йде за рядком леми на найкращому ранзі, грубіше за накладання вище, які враховують частину мови. Фразові статті пораховано, а не приєднано силоміць, і слово для початківця, якого корпус не ранжує, чесно лишається поза списком.

838 з 929 унікальних статей A1 приєднуються до перших 12000, сягаючи 833 окремих лем

Де вивірена карта розміщує ці слова
A1579
A2162
B125
B21
C11
Де мінімум A1 сидить у списку
Перші 1,000: 307 його лем (30.7%)
Перші 2,000: 480 його лем (24%)
Перші 5,000: 688 його лем (13.8%)
Перші 12,000: 833 його лем (6.9%)

З 768 приєднаних лем, які покриває й вивірена карта PULS, 75.4 відсотка мають вивірений рівень A1, а 96.5 відсотка сидять на A1 або A2. Два незалежні зусилля, корпусно вивірений профіль і експертний лексичний мінімум, сходяться на тому, що таке українська для початківця. Кілька слів вище за A2 це здебільшого ціна грубішого зіставлення: автомат з A1 (квитковий) пишеться так само, як автомат із C1 (зброя), і без частини мови цей список їх не розрізнить.

Обмін покриття на навчальність, на незалежному інструменті

833 зіставлені леми покривають близько 34.7 відсотка суцільного тексту; 833 найчастотніших лем покрили б близько 57.5 відсотка. Це той самий висновок, що й для вивіреного ядра вище, тепер виміряний на джерелі, якого ця сторінка не будувала: педагогічний добір A1 свідомо міняє сире покриття на конкретні, придатні до навчання слова, і 72 його словникових статей (апельсин, виделка, бутерброд) взагалі не входять у ці новинно-важкі перші 12000.

Слова для початківця, яких корпус не ранжує
автовокзалалергіяалфавітапельсинбананблокнотблузкабутербродвареникивегетаріанськийвечерятивиделка
Зразок зіставлення
Опублікована статтяЛемаPULS
1в, увA1
2нанаA1
4і, й, таіA1
5з, із, зізA1
6бутибутиA1
7ненеA1
1536готельготельA1
1545статьстатьA2
1546дочкадочкаA1
1549готуватиготуватиA1
1566папірпапірA1
1570купувати – купитикупитиA1
11650цукеркацукеркаA1
11758куркакуркаA1
11839кремкремA2
11871фотографуватифотографуватиA1
Зіставлення узгоджується
Відкритий доступ / A2 і тематична вісь

Наступний рівень і перший погляд на те, які поля корпус пропускає

Знімок 2026-07-28

Картка A1 вище закрила одну прогалину. Її примітка про походження чесно фіксувала й іншу, відкриту: том A2 тієї самої серії існував, але машиночитаного списку A2 ніхто не надавав. Відтоді цей том опублікували у відкритому доступі за ліцензією CC-BY-4.0 Ксенія Бородін і Олеся Лазаренко в Європейському університеті Віадріна, тож прогалина закривається публікацією, а не послугою. Ця картка це його реєстр на 1000 статей, видобутий із PDF самої публікації, приєднаний до частотного списку так само грубо й переопублікований як відкриті дані з атрибуцією.

Тепер можна відповісти на два питання, недосяжні раніше. Оскільки це наступний том тих самих авторок, два списки разом вимірюють, чого насправді коштує один крок CEFR, у частотних рангах, а не в кількості слів. А оскільки книжка A2 друкує всю свою лексику ще й перегрупованою за власною 51 темою, це перше джерело на цій сторінці, яке може сказати, ЯКІ семантичні поля пропускає новинно-важкий частотний список, а не лише скільки слів він пропускає.

708 з 1,000 опублікованих статей A2 приєднуються до перших 12000, сягаючи 707 окремих лем

Чого коштує один крок CEFR

Лише 45 статей A2 це слова, які вже мав мінімум A1 тих самих авторок, і майже всі вони дієслова, що доростають до видової пари. Решта 955 (95.5 відсотка) нові на A2, і вони відчутно глибші в корпусі: медіанний ранг 2,902 проти 1,643 для слів, піднятих із A1. Крок CEFR це не більша купа тих самих слів. Це рух назовні, до рідкісніших.

Які поля пропускає частотний список

Книжка групує свої 1,124 тематичних одиниць під 51 темами. У зіставленні з частотним списком 21.6 відсотка з них узагалі не входять у перші 12000, і пропуски розподілені нерівномірно. Найгірше покриті поля конкретні, побутові, тілесні: їжа, особиста гігієна, побутова техніка й числівники, де поза списком опиняються і збірні форми, і порядкові, які авторки свідомо довели до тридцятого, щоб можна було назвати дату. Корпус опублікованих українських новин погано описує кухню.

Їжа69%
Числівники63.2%
Особиста гігієна60%
Технології59.1%
Українська культура58.3%
Способи приготування їжі57.1%
Одяг, взуття, аксесуари56.4%
Продукти, фрукти, овочі53.8%
Тема / Поза списком
Де вивірена карта розміщує ці слова
A1148
A2313
B1161
B232
C12
Слова A2, яких корпус не ранжує
абе́ткаабрико́саквапа́ркАлло́!анана́сапо́строфбанду́рабезалкого́льнийбезглюте́новийбезлакто́знийбіле́тблонди́н / блонди́нка

З 656 приєднаних лем, які покриває й вивірена карта PULS, 70.3 відсотка сидять на A1 або A2, а 29.7 відсотка вище за A2, майже всі на B1. Це слабша згода, ніж знайшла картка A1, і так і має бути: саме на A2 два експертні зусилля починають розходитися щодо межі, а грубе зіставлення за рядком леми додає власного шуму. Сторінка показує це розходження, а не підганяє його.

Обмін покриття на навчальність, на рівень вище

707 зіставлені леми покривають близько 11.9 відсотка суцільного тексту; 707 найчастотніших лем покрили б близько 55.1 відсотка. Обмін, який виміряла картка A1, різко ширшає на A2, і 229 словникових статей узагалі не входять у ці новинно-важкі перші 12000, проти 72 на A1. Це чесна стеля навчання за частотою: за межами ядра для початківців частотний список і програма курсу перестають описувати ту саму мову.

Зразок зіставлення
Опублікована статтяЛемаPULS
9додоA1
21длядляA1
22відвідA1
25свійсвій·
27Бува́й(те)!теA1
35тойтойA1
2771дахдахA2
2814Бе́льгіяБельгія·
2823звук (Р.в. одн. зву́ка)звукA2
2837відві́дувач / відві́дувачкавідвідувачB1
2841зустріча́ти(ся) – зустрі́ти(ся)зустрітиA1
2844підзе́мнийпідземнийB1
11797А́рктикаАрктика·
11811волейбо́лволейболA2
11925симпати́чнийсимпатичнийB1
11969па́скапаскаA2
Зіставлення узгоджується
Нитка 06 / Жанр

Частотний список успадковує жанр свого корпусу

Знімок 2026-07-28

Картка вище каже, що 229 словникових статей мінімуму A2 не входять у перші 12000 цього списку, і читає це як стелю навчання за частотою. Але це прочитання спирається на неперевірене припущення. Цей список побудовано на ОБ’ЄДНАНОМУ корпусі UberText 2.0, а найбільша його частина з великим відривом це новини. Тож слово поза списком може бути рідкісним в українській, а може бути звичайним і просто відсутнім у журналістиці, яка нечасто говорить про виделки, гарбузи чи краватки. Ці два прочитання дають протилежні поради тому, хто укладає словник, і ніщо вище не може їх розрізнити.

Тому ми побудували два частотні списки замість одного, з художнього та новинного підкорпусів UberText: та сама збірка, те саме очищення, той самий лематизатор, та сама форма вибірки, обидва обмежені однаковою кількістю токенів. Різниться лише жанр. Ранги нижче зіставні між собою і свідомо НЕ зіставні з основним списком на цій сторінці, який зробив інший лематизатор.

Де мінімум A2 опиняється в кожному жанрі
в обох жанрах 562лише новини 96лише художня література 86в жодному 192

Новини сягають 658 статей (70.3 відсотка). Художня література 648 (69.2 відсотка). Майже стільки ж, і не ті самі слова: разом вони сягають 744 (79.5 відсотка). Другий жанр того самого розміру дає 9.2 пункти, яких не дало б збільшення першого. Для педагогічної мети різноманіття корпусу вартує більше за його розмір.

Обмін майже симетричний, і саме це робить його справжнім результатом, а не більшим молотком: художня література сягає 30.9 відсотків того, що пропускають новини, а новини 33.3 відсотків того, що пропускає художня література. Жоден жанр не кращий. Вони дивляться на різні частини мови.

Де два жанри розходяться найбільше
Способи приготування їжі14.3%85.7%
Сімʼя та родина57.1%100%
Людина: зовнішність, характер, емоції та стани57.7%88.5%
Частини тіла75%100%
Посуд та інше40%60%
Природа: рослини і тварини81.8%100%
Людина: особиста інформація50%66.7%
Комунікативні фрази7.7%23.1%
Новини / Художня
Ранжують лише новини
анке́таАнтаркти́даА́рктикабале́тбанкома́тбезкошто́внийБе́льгіябланкбрита́нець / брита́нкабуря́квиши́ва́нкавідмі́нно
Ранжує лише художня література
банду́рабігборода́брова́бу́ряваре́нийвари́ти – звари́тивго́лос, уго́лосвесе́лкави́рібви́шнявідро́

Прочитайте два рядки разом, і механізм стає очевидним. Журналістика дає інституційне й географічне; художня література дає побутове, тілесне й чуттєве. Жодна з них сама по собі не є описом мови.

Чим цей вимір не є

Ці ранги отримано нашим власним лематизатором на двох підкорпусах, а не тим, що стоїть за основним списком на цій сторінці. Вони зіставні між собою і більше ні з чим тут, і жодна цифра вище не змішує їх з основним списком. Лематизатор також хибно обробляє кілька частотних займенників, однаково в обох жанрах, тож він не може створити різницю між ними.

Розподіл узгоджується
Числа збігаються

Чому так порожньо: відкритого українського CEFRLex досі немає

Нитка два тепер приєднує вивірений профіль (за дозволом авторів), наданий авторами лексичний мінімум A1 і відкрите накладання курсу. Те, що для цього знадобилося два прямі запити, і є суть: відкритий список за лемами з рівнями CEFR, стандартний ресурс для вивчення мови, зробили приблизно для десятка мов і жодного разу не опублікували як відкриті українські дані. Ось усе поле.

Що є для української
ДжерелоДоступРівні
Ukrainian Vocabulary Profile (PULS)вивіреноза дозволомA1-C1 (до B1)
State Standard 2024 (SLSUFL)лише документиA1-C2
CEFR & Ukrainian-English Language Portfolios (PCUH)лише документиA1-B1
learn-ukrainian courseвідкрито, CC-BY-SAA1-B2
1000+1 Words (Borodin, Turkevych)надано авторамиA1
1000+1 Words A2 (Borodin, Lazarenko)відкрито, CC-BYA2
Зроблено для інших мов, не для української
KELLY · 9 мов, без української версії
CEFRLex · кілька мов, без української версії
UniversalCEFR · 13 мов, без української версії
Маєте те, чого бракує?

Ця сторінка долучить відкритий український список CEFR, щойно він з'явиться, і це не гіпотеза: мінімум A1 вище надійшов саме так, бо його автори відповіли на лист. Потрібна схема проста: лема, частина мови та рівень CEFR, у форматі CSV чи JSON.

лемачастина мовирівень CEFRНаписати
Українська частотність / Дерусифікація

Слово, яке старіші матеріали тихцем подавали хибно

Частотний список каже, які слова вчити. Але він не каже, що частина слів, які ви зустрінете в реальному українському тексті, це форми, які уважний редактор замінив би: русизми, суржик і кальки, що їх тихцем передавали старіші навчальні матеріали. Нитка три позначає їх на тому самому списку, з якого ви вчитеся.

Єдиного усталеного списку русизмів для звірки немає. Є натомість відкритий і підтримуваний інструментарій української стилістики: таблиці замін LanguageTool для української (проєкт brown-uk, той самий, що стоїть за морфологією VESUM). Ця нитка приєднує той інструментарій до частотного списку і для кожної з перших 12000 лем, які він позначає, показує питомий відповідник, який він радить.

Відкрите / Невивірене

Читайте це так само, як відкрите накладання CEFR з нитки два: це ВІДКРИТИЙ, придатний до звірки сигнал, але невивірений і приписовий. Це те, що замінив би стилістичний перевіряч, редакторська думка, а не усталений мовний присуд. Його ядро це дерусифікація, але обсяг інструментарію ширший за суто російські запозичення, і кілька позицій (поліцейський, безкоштовний) це живі дискусії про вжиток. Власні назви та правописні виправлення відкинуто. Кожна запропонована форма це власна форма інструментарію, збережена дослівно.

87 з перших 12000 лем мають позначку від стилістичного інструментарію

Висновок: калька часто і є частотнішою формою

64.9%48 / 74

З 74 позначених форм, чий питомий відповідник це одне слово, 48 (64.9%) мають позначену форму щонайменше настільки ж частотною в реальному тексті, як її відповідник: питоме слово рідше або й узагалі поза першими 12000. Це і є унаочнення того, як старіші матеріали навчали кальки, а корпус досі її несе.

Де лежить питома форма (заміни одним словом)
Пари

По одному рядку на частотну смугу, від найнижчого рангу. Кожна позначена форма, питомий відповідник, який радить інструментарій, і де цей відповідник лежить у списку. Повний список у файлі для завантаження.

Позначена формаРадятьРанг питомої
1,255поліцейськийNOUNполіційнийпоза 12000
2,204прийомNOUNприйманняпоза 12000
3,086безкоштовнийADJбезплатнийпоза 12000
4,188безкоштовноADVбезплатнопоза 12000
5,251передвиборнийADJпередвиборчий#4,420
6,676недостовірнийADJневірогіднийпоза 12000
7,121місцезнаходженняNOUNмісце#81
8,004кримчанинNOUNкримецьпоза 12000
9,167достовірнийADJвірогіднийпоза 12000
10,308подаліADVтрохи даліконструкція
11,027благополуччяNOUNдобра доляконструкція

11 із позначених прикметників це калька активного дієприкметника (діючий, існуючий): форми на -ючий, які має російська, а стандартна українська передає підрядним реченням (що діє). Інструментарій ставить таку перебудову першою.

Наскільки твердо інструментарій позначає
стандартна заміна 66м'яка порада 21
Яку частку перших N позначено
Перші 1,000: 0 позначено (0%)
Перші 2,000: 2 позначено (0.1%)
Перші 5,000: 24 позначено (0.5%)
Перші 12,000: 87 позначено (0.7%)
Зіставлення узгоджується
Українська частотність / Аудіо та парадигми

Одна лема це багато слів, і тепер її можна почути

Кожна нитка досі працювала з голою лемою, словниковою формою. Але учень мови з розвиненою словозміною зустрічає в тексті не заголовки, а форми. рік з'являється як року, роки, років, рокам. Дієслово має десятки форм. Нитка чотири додає ці форми, і звук, до всього списку з перших 12000 лем.

Джерело відкрите й машиночитне: таблиці відмінювання й дієвідмінювання Вікісловника (через видобуток kaikki.org), а також транскрипція IPA й аудіо носіїв, що лежать у тих самих статтях на Wikimedia Commons. Форми збережено дослівно, з наголосами; аудіо саме прилінковане, а не перерозміщене; а покриття оцінене чесно, а не припущене.

Вікісловник + Wikimedia, CC BY-SA

Податок словозміни, полічений у формах

15×125,380 forms / 8,339 lemmas

8,339 лем із перших 12000, що відмінюються, розгортаються у 125,380 окремих словоформ, у середньому 15 на лему. Нитка один виміряла податок словозміни як повільне покриття тексту; це той самий податок, полічений у поверхневих формах, які треба впізнавати. Іменник має близько десяти форм, дієслово ближче до тридцяти.

Форм на лему, за частиною мови
дієслова30 / 1,910 lem
займенники23.1 / 35 lem
прикметники14.4 / 1,727 lem
іменники9.2 / 4,601 lem
інше6 / 1 lem
числівники5.8 / 21 lem
прислівники2.2 / 44 lem

Подивіться парадигму

Кілька частотних слів, відмінених чи дієвідмінених, з IPA й відкритим аудіо носія. Виберіть слово; форми це власні форми Вікісловника.

бути[ˈbute]
infinitiveбу́ти
1sg presentє
2sg presentє
3sg presentє
3pl presentє
past mбув
past fбула́
imperative 2sgбудь
Аудіо: дописувачі Wikimedia Commons, CC BY-SA

Саме це перетворює основу колоди Anki з нитки один із простого списку заголовків на колоду, що навчає кожне слово разом із його формами та звучанням.

Скільки вдалося додати, з перших 12000
мають повну парадигму69.5% (8,339)
мають транскрипцію IPA75% (9,002)
мають відкрите аудіо носія61.7% (7,398)
Зіставлення узгоджується
Плани

Дорожня карта серії

Усі п'ять ниток уже вийшли. Кожна називає відкрите джерело, на якому побудована, і кожна цифра на цій сторінці перераховується з наявного релізу. Жодна нитка не заявляє результату, якого не може показати.

01

Частотний список лем

Вийшло

Дванадцять тисяч найуживаніших лем сучасної української, упорядкованих за частотою в корпусі, кожна з частиною мови, частотою на тисячу, накопиченим покриттям тексту та смугою за рангом. Виходить як CSV і JSON, а також основа колоди для Anki.

Вивчайте спершу ті слова, що справді окупляться, у правильному порядку, як леми, а не розпорошені словоформи. Бачте, скільки покриття тексту дає певний обсяг словника.

Для кого: учні, викладачі, розробники інструментів, дослідникиlang-ukЗавантажити реліз
02

Вирівнювання за CEFR

Вийшло

Звірити частотний список з єдиним корпусно вивіреним профілем CEFR для української (Synchak та ін., 2025): що покриває вивірена карта, де вона зупиняється (усталена до B1) і чому ранг за частотою не є рівнем володіння. Профілює цей ресурс чесно, а не вигадує рівні, яких вивірені дані ще не мають.

Побачити, як далеко насправді веде вивірений словник рівнів A1 та A2 і чому частотні смуги не є рівнями CEFR.

Для кого: учні, викладачі, дослідникиSynchak, Starko, Burak and Svystun, eLex 2025Дивитися накладання CEFR
03

Прохід дерусифікації

Вийшло

Позначити русизми та суржикові форми у списку й дати до них питомий український відповідник, спираючись на відкритий морфологічний і стилістичний інструментарій (VESUM і LanguageTool Правописник).

Вивчати питоме слово, а не скальковане, якому тихцем навчають старіші матеріали.

Для кого: учні, викладачі, розробники інструментівbrown-uk (Andriy Rysin and contributors), via LanguageToolДивитися прохід дерусифікації
04

Аудіо та парадигми

Вийшло

Додати до кожної з перших 12000 лем вимову й парадигму відмінювання з відкритих таблиць Вікісловника (kaikki.org) та відкритого аудіо Wikimedia, щоб лему подавали як її форми, а не сам заголовок. Покриття оцінене чесно, а множник словозміни виміряний.

Чути слово, бачити, як воно змінюється за сімома відмінками та видовими парами (там, де словозміна ускладнює), і бачити, у скільки словоформ насправді розгортаються слова, які ви вчите.

Для кого: учні, розробники інструментівWiktionary contributors; extraction by Tatu Ylonen (kaikki.org)Дивитися парадигми
05

Тест словникового запасу

Вийшло

Самооцінний тест обсягу словника за принципом так чи ні на основі цього списку: 60 реальних лем і 60 сконструйованих псевдослів, розподілених по 12 частотних смугах, оцінені стандартною поправкою на хибні спрацювання й переведені в криву покриття. Готового українського відповідника немає.

Вимірювати свій словник проти реального індикатора рівня, а не вгадувати, і бачити, скільки тексту цей словник насправді відкриває.

Для кого: учні, викладачіMeara, P. and Buffery, C.Пройти тест
Завантажити

Реліз відкритих даних

Усе на цій сторінці перераховується з цих файлів. Вони версіоновані та хешовані. Список під ліцензією CC-BY: користуйтеся, форкайте, будуйте далі.

Файл lemmas.anki.tsv імпортується прямо в Anki як основа частотної колоди.

Версіяv0.1.0
ЛіцензіяCC-BY-4.0
Цитування
Lawrence, J. (2026). Ukrainian Frequency: a lemma-based, coverage-graded open frequency list (v0.1.0). jakelawrence.xyz/research/ukrainian-frequency. Derived from UberText 2.0 (Chaplynskyi, 2023).
Перевірка

Перевірте самі

Ці перевірки виконуються у вашому браузері проти опублікованих чисел. Якщо якась не проходить, реліз неузгоджений, і сторінка це показує.

Методи

Методи та походження

Джерело частотності це словник лем UberText 2.0 (lang-uk). Цей реліз перевидає похідні агреговані підрахунки, які є фактами, а не текст вихідного корпусу. Рядки відфільтровано до українських кириличних лем із лінгвістичною частиною мови за Universal Dependencies; пунктуацію, символи, цифрові токени, чужомовні чи некласифіковані токени та односимвольні власні назви відкинуто.

Покриття тут перераховано з сирих підрахунків уживань, а не взято з власних частотних колонок вихідного файлу, чия нормалізація не задокументована. Частотні смуги це прозорі кошики по тисячі за рангом, і це НЕ рівні CEFR; вивірене вирівнювання за CEFR це нитка 2, яка профілює єдиний вивірений ресурс, а не вигадує рівні. Корпус насичений новинами й довідковими текстами, тож воєнна та цивільна лексика посідає помітні місця. Це розкрито, а не згладжено.

Джерела
Universal Dependencies (UD) part-of-speech scheme · Universal Dependencies · 2026-07-14
Corpus-Based Vocabulary Profiling for Ukrainian: From Lexical Analysis to CEFR · Synchak, Starko, Burak and Svystun, eLex 2025 · 2026-07-14
The Checklist Method for Testing Vocabulary Size (X_Lex / Y_Lex) · Meara, P. and Buffery, C. · 2026-07-14
dict_uk (Ukrainian hunspell dictionary, via LibreOffice dictionaries) · Andriy Rysin and contributors, brown-uk / dict_uk · 2026-07-14
LanguageTool Ukrainian replacement tables (replace.txt, replace_soft.txt) · brown-uk (Andriy Rysin and contributors), via LanguageTool · 2026-07-22
VESUM: a large morphological dictionary of Ukrainian · brown-uk (Andriy Rysin, Vasyl Starko and contributors) · 2026-07-22
Wiktionary Ukrainian, machine-readable extraction (wiktextract / kaikki.org) · Wiktionary contributors; extraction by Tatu Ylonen (kaikki.org) · 2026-07-22
Wikimedia Commons Ukrainian pronunciation audio · Wikimedia Commons contributors · 2026-07-22
1000 and 1 Words: Lexical Minimum in Ukrainian (A1) · Borodin, K. and Turkevych, O., Slavic Language Education 3 (LANGUAGE-LAB) · 2026-07-27
1000 and 1 Words: Lexical Minimum in Ukrainian (A2) · Borodin, K. and Lazarenko, O., Europa-Universitat Viadrina Frankfurt (Oder) · 2026-07-28
UberText 2.0 subcorpora: fiction and news, read separately · lang-uk (Chaplynskyi, D.) · 2026-07-28
Lexical Minimums for Levels A1 and A2 in Learning Ukrainian: Methodology and Practical Challenges · Borodin, K. and Lazarenko, O., in New Directions in Slavic Studies (T. Portnova, I. A. Gonzalez-Hidalgo, M. P. Pena-Molina, eds.), Editorial Universidad de Granada, ISBN 978-84-338-7814-4, pp. 41-52 · 2026-07-28
State Language Standard: Ukrainian as a Foreign Language, Levels A1 to C2 (SLSUFL) · Ministry of Education and Science of Ukraine · 2026-07-22
Teacher's Guide: Using the CEFR and Ukrainian-English Language Portfolios · Prokopchuk, N. and Huzar, O., Prairie Centre for the Study of Ukrainian Heritage (PCUH), University of Saskatchewan · 2026-07-27
KELLY project: keywords for language learning (CEFR-graded lists) · Sprakbanken, University of Gothenburg · 2026-07-22
CEFRLex: CEFR-graded receptive lexical resources · CENTAL, UCLouvain · 2026-07-22
Пов'язане

Частина сталої роботи над подоланням розриву в цифровому інструментарії для української мови.