Техно

Мінцифра та партнери запустили Ukrainian LLM Leaderboard для оцінки ШІ українською

Центр компетенцій WINWIN AI при Міністерстві цифрової трансформації України спільно з Українським католицьким університетом (УКУ) та ініціативою lang-uk запустили Ukrainian LLM Leaderboard — перший національний відкритий рейтинг, який об’єктивно вимірює рівень володіння українською мовою у різних великих мовних моделях.

Ініціатива покликана вирішити проблему, коли користувачі при взаємодії з глобальними системами штучного інтелекту отримують відповіді з русизмами, помилковою граматикою чи спотвореними фактами про Україну. Раніше вітчизняний бізнес і розробники обирали великі мовні моделі фактично «наосліп», орієнтуючись на маркетингові матеріали корпорацій та англомовні бенчмарки, де українська мова оцінювалася через машинний переклад.

Ukrainian LLM Leaderboard оцінює, як нейромережі виконують різні завдання українською мовою в умовах, наближених до реального використання у B2B- та B2G-секторах. Перевіряються чотири основні напрями: аналіз та обробка текстів (переклад, резюмування та стислий виклад великих масивів документів), логіка та пошук даних (відповіді у документах на основі RAG-систем і розв’язання логічних задач), оцінка знань (проходження тестів зі шкільної програми на рівні ЗНО/НМТ), а також складні обчислення з чітким дотриманням багатоетапних інструкцій.

Методологію тестування розробили дослідники Юрій Панів з УКУ, керівник розробки української мовної моделі Lapa, та Дмитро Чаплинський зі спільноти lang-uk. Напрацьовані підходи вже застосували під час навчання моделі Lapa LLM і представили на міжнародних наукових конференціях з обробки природної мови (NLP). Усі вихідні дані, тестові датасети та код методології є відкритими та опублікованими на платформі HuggingFace.

Розробники лідерборду наголошують на його практичній цінності: рейтинг може стати об’єктивною базою для державних закупівель, а також допомогти при виборі ШІ-рішень для банківського сектору та бізнесу. У фокусі проєкту — також B2G-сегмент, зокрема перевірка безпеки персональних даних і коректної обробки нормативних актів. Надалі планується додати модулі з оцінки мультимодальності (робота з візуальним контентом), етичності моделей та вартості токенів.

Юрій Панів пояснює, що після появи великих мовних моделей було незрозуміло, наскільки добре вони працюють з українською мовою і для яких завдань краще підходять різні рішення. Метою створення Ukrainian LLM Leaderboard він називає спробу дати відповідь на ці питання, зібравши наявні бенчмарки від спільноти українського NLP та доповнивши їх новими.

Chief AI Officer у WINWIN AI Center of Excellence Роман Кислий підкреслює, що неможливо керувати процесами, які не вимірюються. За його словами, інтегруючи штучний інтелект у сервіси для мільйонів користувачів, необхідно ухвалювати рішення на основі доказів, а не обіцянок, а лідерборд робить якість української мови в моделях публічним і підтвердженим показником.

Джерело: Expert.ua

Читайте нас : наш канал в GoogleNews та Facebook сторінка - Новини України