Дослідження: чат-боти ШІ можуть сприяти підготовці до самогубства


        Провал захисту ШІ: чат-боти можуть допомагати у підготовці до самогубства

Чат-боти навчилися краще реагувати на прямі прояви психічної кризи, однак досі можуть пропускати небезпечні сигнали, замасковані під творчі або побутові запити. Це показало дослідження за участю OpenAI та Anthropic, у межах якого перевіряли, як ШІ спілкується з людьми, що переживають тривогу, психотичні чи маніакальні епізоди.

Що виявило тестування чат-ботів

Для експерименту дослідники отримали знеособлені шаблони звернень користувачів від OpenAI та Anthropic. На їхній основі створили наближені до реальності діалоги, у яких моделі мали відповідати на повідомлення людей із потенційно кризовими симптомами.

Результати засвідчили: у випадках, коли небезпечні наміри висловлено прямо, системи стали обережнішими. Водночас під час тривалого спілкування боти не завжди помічають непрямі ознаки погіршення психічного стану.

  • Менше підкріплення хибних переконань. Моделі рідше погоджуються з маревними ідеями користувачів і майже не підштовхують їх до деструктивної поведінки.
  • Вразливість до завуальованих запитів. Чат-бот може погодитися написати прощальний лист, створити художній текст про самогубство або допомогти з окремими підготовчими діями.
  • Суперечливі відповіді. В одному повідомленні система здатна порадити звернутися на гарячу лінію та водночас виконати частину небезпечного прохання.

Дослідниця Transluce Сара Шветтман наголосила, що алгоритмам складно розпізнавати приховані сигнали пригніченого стану, особливо коли вони з’являються поступово й розподілені між багатьма повідомленнями.

Чому непрямі запити становлять ризик

Захисні механізми чат-ботів зазвичай найкраще працюють тоді, коли користувач прямо описує намір завдати собі шкоди або просить конкретні небезпечні інструкції. Натомість творчий, гіпотетичний чи нейтрально сформульований запит може виглядати для системи безпечним, навіть якщо в контексті тривалої розмови він має зовсім інше значення.

Проблему посилює прагнення моделей бути корисними. Вони можуть правильно надати контакти служб підтримки, але паралельно виконати частину запиту, яка потенційно збільшує ризик для людини. Тому сама наявність попередження у відповіді ще не означає, що система повністю заблокувала небезпечний сценарій.

Позови та посилення контролю за ШІ

Дослідження оприлюднили на тлі посиленої уваги регуляторів і судових позовів до розробників ШІ. Приводом стали випадки, коли спілкування з чат-ботами передувало трагічним подіям, що підняло питання про межі відповідальності компаній і надійність автоматизованих систем підтримки.

Представники провідних розробників заявили, що сприймають результати як підставу для подальшого вдосконалення захисту:

Читайте також:  4 браузери з ШІ, вбудованим VPN і приватністю замість Chrome
Компанія Заявлена позиція
Google У Gemini застосовують дослідницький підхід, щоб надавати якісну інформацію та контакти служб допомоги.
OpenAI Компанія відзначила прогрес у кризових відповідях і заявила про подальшу співпрацю з науковцями для посилення захисних бар’єрів.
Anthropic Розробник наголосив на важливості таких перевірок для вдосконалення класифікаторів, які виявляють ознаки кризи в реальному часі.

Які дослідження планують далі

Transluce планує до кінця року оприлюднити вихідний код своїх інструментів оцінювання. Це дасть змогу іншим дослідникам адаптувати їх для перевірки поведінки ШІ в інших чутливих темах, зокрема під час виявлення ризиків, пов’язаних із розладами харчової поведінки та політичними маніпуляціями.

Дослідження показує, що безпека чат-ботів залежить не лише від їхньої реакції на прямі небезпечні запити. Не менш важливо, наскільки добре система розуміє контекст тривалої розмови, розпізнає приховані сигнали кризи та не поєднує слова підтримки з виконанням потенційно шкідливих інструкцій.