Anthropic розкрила деталі нової системи водяних знаків для контенту, який генерує чатбот Claude. Компанія заявила, що технологія не впливатиме на якість відповідей і буде непомітною для звичайного читача, але спеціальна система з ключем зможе визначити наявність водяного знака.
Водяні знаки Anthropic впроваджує для виконання вимог Кодексу прозорості ЄС щодо ШІ. Він передбачає використання технологій, які дозволяють ідентифікувати контент, створений штучним інтелектом.
Компанія використовуватиме підхід SynthID-Text, розроблений командою Google DeepMind і представлений у 2024 році. Anthropic також планує випустити API, за допомогою якого можна буде перевіряти тексти на наявність водяних знаків.
Механізм працюватиме завдяки певним закономірностям у тексті. Наприклад, коли Claude має можливість вибрати між кількома словами з однаковим значенням, система може використовувати ці “низькоризикові” вибори для формування прихованого шаблону. Для читача текст із водяним знаком не відрізнятиметься від звичайного.
При цьому водяний знак можна частково або повністю видалити редагуванням. Anthropic стверджує, що легке редагування, ймовірно, не прибере його повністю. Натомість повне переписування тексту із заміною практично кожного слова дозволить позбутися водяного знака.
Якщо Claude лише трохи відредагував текст, написаний людиною, виявити водяний знак буде складніше. За словами компанії, у такому випадку більшість слів залишаються написаними людиною, тому системі практично немає на що накладати маркування.
Для програмного коду водяний знак буде менш вираженим. Це пов’язано з тим, що під час написання коду модель має менше свободи вибору між рівнозначними варіантами. Водночас маркування може застосовуватися до елементів на кшталт коментарів.
Anthropic також підкреслила, що Claude не стане єдиним ШІ-чатботом із водяними знаками. Інші великі розробники моделей, які підписали відповідний європейський Кодекс практики, також планують впроваджувати власні системи маркування.
До речі, така зміна сподобалася не всім користувачам. Деякі з них поскаржилися на Reddit, назвавши нові водяні знаки способом стежити за користувачами та безпідставно їх підозрювати. Інші вважають таке маркування лицемірним – особливо з огляду на те, що сам Claude створює контент за допомогою технологій, розроблених іншими компаніями.
Читайте також: Anthropic може побити рекорд SpaceX за найбільшим IPO в історії – інвестори очікують $2 трлн




