Anthropic виявила: Claude під час тестів дістався реальних систем

Anthropic виявила проблему з Claude: ШІ отримав доступ до реальних систем під час тестів кібербезпеки

Anthropic виявила проблему під час внутрішньої перевірки безпеки: модель Claude тричі отримала доступ до справжніх систем організацій, хоча цього не передбачали умови тестування. Розслідування охопило понад 140 тисяч запусків і показало, що причиною став неправильно налаштований доступ до інтернету в тестовому середовищі.

Що сталося під час тестування

Перевірку проводили у співпраці з компанією Irregular. Три моделі Claude мали виконувати завдання в ізольованому середовищі, проте через помилку в конфігурації могли підключатися до реальних онлайн-систем.

Наслідки виявилися різними: одна модель продовжила виконання атаки та отримала доступ до даних, друга розмістила шкідливий код, а третя самостійно припинила роботу після того, як розпізнала ознаки справжньої системи.

ШІ. Фото: pixabay

Anthropic пояснила причини інциденту

У компанії наголосили, що Claude не діяв через власні наміри чи «мотивацію». Моделі виконували інструкції, закладені в тестові сценарії, а небезпечний результат став можливим через помилку в налаштуванні середовища.

Anthropic уже працює над усуненням недоліку та посиленням правил для подібних перевірок. Серед ключових заходів — жорсткіша ізоляція тестових систем, додатковий контроль мережевих підключень і перевірка того, до яких ресурсів фактично має доступ модель.

Чому цей випадок важливий

Інцидент показує, що безпека ШІ залежить не лише від поведінки самої моделі. Навіть якщо система працює в межах заданого сценарію, помилка в інфраструктурі може відкрити їй шлях до реальних ресурсів.

  • тестові середовища мають бути повністю ізольованими від робочих систем;
  • доступ до інтернету потрібно вмикати лише за чіткої потреби;
  • усі дії моделей слід записувати й перевіряти після завершення тестів;
  • підозрілі дії мають автоматично блокуватися ще до отримання доступу до даних.

Anthropic підкреслює, що контроль за такими експериментами має бути суворішим, адже автономні моделі здатні швидко виконувати складні послідовності дій. Цей випадок став нагадуванням, що помилки налаштувань можуть бути не менш небезпечними, ніж недоліки самого програмного забезпечення.

Читайте також:  Google переведе мільйони Android-пристроїв з Assistant на Gemini