Українську ШІ-модель «Сяйво» використають у «Дії» та «Мрії»


        Від "Дії" до "Мрії": де працюватиме українська ШІ-модель "Сяйво"

Національну мовну модель «Сяйво» розробляють як українськомовну систему штучного інтелекту, здатну враховувати не лише граматику, а й місцевий культурний, історичний та суспільний контекст. Проєкт передбачає створення власної бази даних, комплексне тестування та подальше використання моделі у державних і комерційних сервісах.

На чому будують українську мовну модель

Технологічною основою «Сяйва» стала модель Gemma 3 від Google. Її адаптують до особливостей української мови, зокрема до словникового запасу, мовних норм, реалій українського життя та історико-культурної спадщини.

«Київстар» забезпечує проєкт обчислювальними ресурсами, фінансуванням і необхідною організаційною підтримкою. Водночас значна частина роботи зосереджена не лише на програмному коді, а й на підготовці якісних даних для навчання.

Як формують національний корпус даних

Одне з найскладніших завдань — зібрати, перевірити й належно підготувати українські тексти для тренування моделі. Команда працює приблизно з 90 державними установами, науковими організаціями, університетами та медіа.

До корпусу мають увійти різні типи матеріалів: від історичних документів і нормативних актів до наукових публікацій та сучасних медійних текстів. Такий підхід потрібен, щоб модель краще розуміла як повсякденне мовлення, так і спеціалізовану термінологію.

  • Архівні матеріали. Укрдержархів передав понад 10 ТБ даних, серед яких історичні документи, державні акти й наукові праці. Частину цих матеріалів ще потрібно оцифрувати з паперових носіїв.
  • Очищення та перевірка даних. Тексти необхідно впорядкувати, усунути дублікати, технічні помилки й сумнівні фрагменти, а також перевірити їхню якість.
  • Налаштування токенізатора. Розробники оптимізують компонент, який розбиває текст на частини для обробки моделлю. Це має підвищити швидкість і точність роботи саме з українською мовою.
  • Правила використання контенту. Окремо формують юридичні процедури щодо доступу до матеріалів, авторських прав та інтелектуальної власності.

Якість і збалансованість корпусу безпосередньо впливатимуть на поведінку «Сяйва». Якщо дані міститимуть помилки, упередження або недостатньо представлять окремі галузі, це може позначитися і на відповідях моделі.

Хто та як перевіряє «Сяйво»

Для оцінювання системи створили експертний комітет, до якого входять понад 70 фахівців. Вони аналізують модель із різних поглядів, адже для національної LLM важлива не тільки технічна точність, а й відповідність мовним, культурним та правовим нормам.

Напрям перевірки Що оцінюють
Мовознавчий Граматику, лексику, стилістику та коректність української мови.
Культурно-історичний Розуміння української історії, культури й локального контексту.
Етико-правовий Безпечність відповідей, відсутність дискримінації та дотримання правових вимог.
Науково-технічний Стабільність, продуктивність і результати порівняльних тестів.
Читайте також:  Чому ЄС і НАТО досі не мають заміни технологіям Palantir

Ключові критерії оцінювання

Експерти перевіряють, наскільки глибоко модель розуміє українську мову та контекст, а не просто відтворює статистично ймовірні фрази. Окрему увагу приділяють здатності працювати з історичними, культурними й суспільно важливими темами.

Безпекові випробування мають виявити схильність до так званих галюцинацій, поширення дезінформації, упереджених або дискримінаційних відповідей. Також результати «Сяйва» порівнюють з показниками інших великих мовних моделей за допомогою автоматичних бенчмарків і міжнародних рейтингів.

У червні 2025 року експериментальний прототип пройшов попереднє навчання, supervised fine-tuning, закрите бета-тестування та перевірку архітектури. Це був один із проміжних етапів розробки, а не завершення всього проєкту.

Відкритий код і майбутнє використання

Після завершення тестування та передачі проєкту державі планують відкрити базову версію «Сяйва» для вільного доступу. Разом із моделлю мають опублікувати й українські датасети, створені в процесі роботи.

Відкритий формат дасть змогу розробникам, компаніям і науковцям адаптувати модель під власні завдання. Для цього вони зможуть використовувати підготовлений технічний процес донавчання, не створюючи всю інфраструктуру з нуля.

У державному секторі модель розглядають як технологічну основу для низки цифрових продуктів. Серед потенційних напрямів — «Дія AI», освітній асистент у застосунку «Мрія» та інструменти для пошуку й аналізу законодавства.

Отже, «Сяйво» має стати не лише україномовним чатботом, а відкритою інфраструктурою для розвитку локальних ШІ-рішень. Її практична цінність залежатиме від якості підготовлених даних, результатів незалежного тестування та того, наскільки прозоро модель використовуватимуть у державних сервісах.