Anthropic розробила непомітний спосіб виявлення текстів Claude


        Anthropic знайшла спосіб викривати тексти Claude: користувач нічого не помітить

Як працюватиме маркування текстів і медіафайлів

Anthropic планує використовувати для текстів технологію SynthID-Text — розробку Google DeepMind. Її завдання полягає не в тому, щоб змінювати вигляд відповіді Claude, а в тому, щоб залишати в ній непомітний для читача статистичний слід.

Прихований патерн у виборі слів

Під час генерації модель часто має кілька близьких за значенням варіантів. Наприклад, у реченні можна використати слова «хмарно» або «похмуро». SynthID-Text впливає на вибір таких варіантів за допомогою спеціального ключа, пов’язаного з генерацією випадкових чисел.

У результаті формується математичний патерн, який не виглядає як окремий напис, набір символів чи технічна мітка. Читач не бачить жодних візуальних змін, а сам процес не має збільшувати час створення відповіді або її вартість.

За задумом розробників, водяний знак не міститиме персональних даних, відомостей про компанію чи історії конкретного діалогу. Тобто його не планують використовувати для розкриття особи користувача або змісту попередніх запитів.

Окремий підхід для зображень і файлів

Для медіаконтенту Anthropic розглядає інший механізм — стандарт C2PA. Він додає до файлів криптографічно захищені метадані, які можуть містити інформацію про походження контенту.

Такий запис не повинен змінювати саме зображення або файл. Підхід може застосовуватися, зокрема, до форматів .png, .jpg і .svg.

Наскільки водяний знак захищений від редагування

Маркування розраховане на те, щоб переживати звичайні зміни тексту, але воно не є незнищенним. Якщо користувач трохи відредагує відповідь, переставить окремі фрази або замінить кілька слів, прихований патерн може зберегтися частково.

Натомість повне переписування матеріалу з новою побудовою речень і заміною практично всіх слів, найімовірніше, зітре водяний знак. Тому система має оцінювати не абсолютний факт авторства, а статистичні ознаки, які вказують на можливу участь Claude.

  • легке редагування може не прибрати маркування повністю;
  • глибоке перефразування здатне зруйнувати прихований патерн;
  • результат перевірки не доводитиме, що весь текст написала саме модель;
  • водяний знак не встановлюватиме особу користувача.

Чому технологія має обмеження для коду й точних даних

SynthID-Text найкраще працює там, де модель може вибирати між кількома рівнозначними формулюваннями. У текстах із жорсткими вимогами до точності така свобода значно менша.

Читайте також:  Вчений припустив, що біблійні істоти могли бути прибульцями

Наприклад, у фактичних відповідях важливо не замінювати терміни довільними синонімами, а в програмному коді кожен символ може впливати на результат виконання. Через це водяний знак буде малоефективним у коді, формулах, числових даних та інших структурованих матеріалах.

Певний простір для маркування можуть залишати лише елементи, які не впливають на роботу програми: назви змінних, коментарі або текстові пояснення. Проте навіть у таких випадках застосування технології залежатиме від конкретної відповіді.

Як перевірятимуть наявність водяного знака

Anthropic планує надати спеціальний API для виявлення маркування. Сервіс аналізуватиме текст і розраховуватиме ймовірність того, що його було створено за участю Claude.

Водночас така перевірка не зможе достовірно визначити автора матеріалу, встановити особу користувача або сказати, що весь текст без винятку написала модель. Результат слід трактувати як імовірнісну оцінку, а не як остаточний доказ походження контенту.

Отже, водяні знаки Anthropic мають поєднати непомітність для читача з можливістю технічної перевірки. Вони можуть бути корисними для виявлення машинно згенерованих матеріалів, але матимуть обмежену надійність після глибокого редагування, а також у коді й текстах, де важлива максимальна точність.