В Україні з'явився окремий інструмент для перевірки глобальних систем штучного інтелекту – Ukrainian LLM Leaderboard. Це національний рейтинг великих мовних моделей, який оцінює їх не за презентаціями розробників, а за фактичними результатами роботи українською мовою.
Про це повідомляє Мінцифри.
Потреба в такому тестуванні виникла через нерівномірну якість моделей у різних мовах. Нейромережа може показувати високі результати у міжнародних бенчмарках, але під час роботи українською змінювати зміст, помилятися у граматиці, використовувати неприродні конструкції або вигадувати факти. Новий рейтинг має зробити такі відмінності видимими.
Перевірятимуть не словник, а здатність розуміти
Учасників тестують за кількома групами завдань. Моделі повинні опрацьовувати великі масиви тексту, перекладати та стискати інформацію, знаходити відповіді у документах, вирішувати логічні й математичні задачі та виконувати складні послідовності інструкцій.
До системи також включили завдання шкільного рівня, зокрема тести формату ЗНО. Такий набір дозволяє оцінити одразу кілька характеристик — від мовної точності до здатності правильно інтерпретувати запит і працювати з фактажем.
Рейтинг не приховує правила гри
Ініціативу реалізували WINWIN AI Center of Excellence при Мінцифрі, Український католицький університет і спільнота lang-uk. Автори відкрили для користувачів не лише підсумки, а й дані та код тестування на Hugging Face. Це дає можливість перевірити підхід, зіставити результати та використовувати напрацювання у власних дослідженнях.
Для компаній та державних установ такий рейтинг може стати практичним фільтром: перш ніж впроваджувати конкретну модель, можна оцінити, наскільки добре вона справляється саме з українськомовними завданнями.
Від чат-ботів – до державних систем
У Мінцифрі вже планують розширювати тестування. Наступними напрямами мають стати робота із зображеннями, етичні характеристики моделей та економічна ефективність використання ШІ українською.
Окрему увагу приділять державному сектору. Моделі перевірятимуть на роботі з нормативними текстами, адміністративними процедурами та персональними даними.
Нагадаємо, в Україні з'явився окремий інструмент для перевірки глобальних систем штучного інтелекту – Ukrainian LLM Leaderboard. Це національний рейтинг великих мовних моделей, який оцінює їх не за презентаціями розробників, а за фактичними результатами роботи українською мовою.

