OpenAI змінила Astra: експерти побоюються втрати контролю


        OpenAI навчила Astra думати інакше: експерти бояться втратити контроль

Штучний інтелект може демонструвати правильний результат, але залишати незрозумілим шлях, яким до нього дійшов. Саме ця проблема загострилася після обговорення підходу, відомого як «непрозора рекурентність»: він дає змогу моделям виконувати складні міркування у внутрішньому латентному просторі, недоступному для прямого спостереження. Для фахівців із безпеки це означає потенційне послаблення контролю над поведінкою ШІ.

Чому приховане мислення викликає занепокоєння

Послідовний ланцюг думок, або Chain of Thought, тривалий час вважався одним із ключових інструментів для перевірки роботи мовних моделей. Аналізуючи проміжні кроки, дослідники можуть виявити логічні помилки, спроби маніпуляції чи ознаки небезпечної поведінки.

За використання «непрозорої рекурентності» модель може багаторазово обробляти інформацію без формування зрозумілого для людини пояснення. У результаті зовнішній спостерігач бачить переважно вхідні дані та фінальну відповідь, але не має доступу до повної послідовності внутрішніх операцій.

Це створює кілька потенційних ризиків:

  • складніше перевірити, чи не містить процес міркування помилкових або небезпечних припущень;
  • важче помітити спроби моделі обійти встановлені обмеження;
  • зменшується ефективність аудитів і систем зовнішнього нагляду;
  • дослідникам складніше пояснити, чому система обрала конкретне рішення.

Саме тому інформація про можливе масштабування такої технології викликала різку реакцію серед фахівців із безпеки ШІ. Вони побоюються, що за відсутності доступних логів традиційні методи моніторингу можуть виявитися недостатніми.

Що говорять експерти

Баг Шлегеріс, генеральний директор Redwood Research, назвав перспективу подальшого розвитку цієї технології надзвичайно тривожною. На його думку, масштабування прихованого мислення може істотно обмежити здатність людей контролювати поведінку потужних моделей.

Фахівець із безпеки ШІ Цві Мушовіц наголосив на необхідності законодавчих запобіжників. Він вважає, що регулювання має стримати перегони між лабораторіями, у яких компанії можуть надавати перевагу продуктивності моделей над їхньою прозорістю.

Головний науковець Redwood Research Раян Грінблат також висловив побоювання, що штучний інтелект поступово перейде до повністю прихованого міркування у латентному просторі. За такого сценарію люди не матимуть доступу до зрозумілих журналів, які дають змогу відтворити логіку роботи системи.

Подібні підходи, за наявною інформацією, вже обговорюють і в інших провідних лабораторіях, зокрема в Anthropic та Google DeepMind. Це посилює дискусію про те, чи повинна прозорість внутрішніх процесів бути обов’язковою умовою для розробки та запуску потужних моделей.

Якою є позиція OpenAI

У OpenAI запевняють, що не планують відмовлятися від зрозумілих ланцюгів міркувань. Головний науковий співробітник компанії Якуб Пачоцький заявив, що розробник і надалі підтримуватиме підходи, які дають змогу відстежувати та перевіряти роботу моделей.

Читайте також:  Вперше розкрили чип Apple: що зміниться в наступних iPhone

Представники OpenAI підкреслюють, що використання нелінійного мислення в Astra наразі має обмежений характер. За їхніми словами, система повинна залишатися достатньо читабельною, щоб фахівці могли проводити моніторинг і виявляти потенційно небезпечні відхилення.

Компанія також заявила, що не збирається повністю переходити на закриті формати міркування. Паралельно OpenAI продовжує розробляти масштабні системи нагляду, тестування та оцінювання безпеки власних продуктів.

Головне питання для всієї галузі полягає в тому, як поєднати здатність моделей виконувати складні завдання з можливістю перевіряти їхні рішення. Якщо внутрішнє мислення ШІ стане повністю недоступним для аналізу, контроль і незалежний аудит таких систем можуть значно ускладнитися.