Українська частотність · відкриті дані · v1.1.0

Зіставлення українських лексичних мінімумів

Кожна лема з двох опублікованих українських джерел базової лексики для початківців, з’єднана й зіставлена.

10,366 рядків9 стовпцівзнімок 2026-09-13CC-BY-SA-4.0

Навіщо це

Українська тепер має дві незалежні відкриті відповіді на питання, на яке кожен курс для початківців мусить відповісти першим, і побудовано їх для відповіді на різні питання.

МінімумиПрофіль
що«1000 і 1 слово», A1 і A2Профіль української лексики (PULS)
хтоБородін і Туркевич; Бородін і ЛазаренкоСинчак, Старко, Бурак, Свистун
типнавчальна програмаописова карта
обсягблизько 2 000 слів10,194 записи лем, від A1 до C1
методекспертний добір на основі корпусної частотності, зважений за корисністю на етапі навчаннякорпусно вивірені рівні CEFR

Досі їх ніхто не з’єднав. Навчальна програма й описовий профіль мають право не погоджуватися, і найцікавіше саме там, де вони розходяться, тож краще було це виміряти, ніж здогадуватися.

Що виявилося

По одному рядку на лему, на корпусній частотній основі (UberText 2.0, перші 12 000 лем).

КласРядкиЗначення
agree1,200обидва ставлять слово на той самий рівень
earlier583програма викладає слово раніше, ніж профіль його вивіряє
later174програма викладає слово пізніше
absent776вивірене на A1 (84) або A2 (692), але немає в жодному томі
unprofiled172є в томі, але поза межами профілю
beyond7,461вивірене на B1 або вище, поза програмою на 2 000 слів

Два проєкти, побудовані різними методами, ставлять 1,200 слів на той самий рівень CEFR. Це результат збіжності: базове ядро української лексики є реальним об’єктом, який можуть знайти два незалежні методи.

Найгостріша розбіжність

Чотири прийменники й сполучник

Профіль вивіряє всі п’ять слів на A1. Том A1 відкладає кожне з них до A2.

СловоРанг у корпусіПрофільТом
до9A1A2
для21A1A2
від22A1A2
якщо87A1A2
без130A1A2

Водночас том A1 містить по, про і через. Отже, це проведена межа, а не пропуск.

Майже напевно це свідоме методичне рішення, і слушне: що учень може зробити з прийменником, доки не знає відмінків, які після нього стоять? Але саме такі міркування не доживають до опублікованого списку слів, і саме тому зіставлення варто мати.

Чого воно не може сказати

Три обмеження. Жодне прочитання не витримає, якщо ними знехтувати.

  1. У мінімумах немає частин мови. Опубліковані списки їх не подають, тож з’єднання йде за написанням леми, і омографи зливаються в один рядок.
  2. Поява, а не значення. Рівень у профілі це рівень найранішого значення лексеми. Слово може бути вивірене на A1 у значенні, якого програма не викладає.
  3. Три джерела по-різному розуміють, що таке одна лема. те очолює список відсутніх на ранзі 27 і не є забутим словом: частотний список і профіль вважають його лемою, а мінімуми вважають його формою середнього роду від той, а той є в томі A2.

Тож стовпець absent це перелік кандидатів на перевірку, а ніколи не перелік пропусків. Слів із вивіреним рівнем A1, яких немає в жодному томі, 84; у 40 з них немає жодного спорідненого слова в жодному з томів, і саме з них варто почати: ситуація, кожний, момент, музей, ну, мільярд, продукт, герой.

Ще в 19 рядках класу absent названо сполуку, через яку слово таки потрапляє до томів, тож такий читається разом із такий самий, а жаль разом із На жаль.

Як цим користуватися

По одному рядку на лему. Відфільтруйте стовпець class відповідно до свого питання.

  • Готуєте нове видання? later і absent це ваші списки кандидатів.
  • Перевіряєте власний розподіл за рівнями? earlier показує, де програма випереджає вивірений профіль, із частотним рангом біля кожного слова.
  • Розширюєте профіль? unprofiled це те, що програма викладає, а профіль не охоплює. Здебільшого власні назви та утворені від них прикметники, тобто питання меж профілю, а не прогалина.
lemma, rank, pos, volume, entry, validatedLevel, class, relative, relativeVia

Стовпець entry дослівно містить опублікований рядок словникової статті, тож кожен рядок можна простежити до книжки, з якої він походить.

Завантажити зіставлення (CSV)Як його побудовано (англійською) →Перевірити текст за цими мінімумами

Зіставлення поширюється на умовах CC-BY-SA-4.0: кожен рядок містить рівень PULS, а рівні PULS мають ліцензію CC-BY-SA-4.0, тож умова поширення на тих самих умовах переходить на всю об’єднану таблицю. Томи Бородіна самі по собі лишаються під CC-BY-4.0. Цитуйте джерела, які тут поєднано, а не лише файл.

  • Мінімуми (CC-BY-4.0): Бородін і Туркевич, A1, 10.18452/28236; Бородін і Лазаренко, A2, 10.11584/opus4-1448.
  • Вивірені рівні (CC-BY-SA-4.0, поширюються з дозволу авторів): Синчак, Старко, Бурак і Свистун, Профіль української лексики / PULS.
  • Частотні ранги (CC-BY-4.0): UberText 2.0, Чаплинський 2023, lang-uk.

Інше в цьому інструменті

Огляд
Список, крива покриття і висновки кожного напряму.
Тест словника
120 слів так чи ні, з поправкою на вгадування: приблизна кількість знаних лем.
Профілювач текстів
Вставте текст і побачте, яку частку прочитає учень певного рівня.
Метод зіставленняEN
Як побудовано зіставлення, крок за кроком, з кожною цифрою.
API лематизатора
POST /api/lemmatize: леми за конвенцією цього списку.

На огляд · Усі дослідження