Користувачі Claude обговорюють цей крок відтоді, як минулого тижня компанія оголосила, що запроваджує маркування водяними знаками для виконання вимог Кодексу прозорості Закону ЄС про штучний інтелект (EU AI Act). Цей документ зобов’язує AI-компанії використовувати системи, які дають змогу ідентифікувати згенерований ШІ контент.
Новий допис Anthropic починається із загального огляду концепції водяних знаків. У ньому пояснюється, що під час виконання «некритичних завдань» — наприклад, вибору між словами «хмарно» та «сіро» для опису погоди — Claude може створювати у своїх відповідях візерунок, який «непомітний для читача, але виявляється за наявності ключа, у якому він закодований».
«Водяні знаки не впливають на якість відповідей Claude, — зазначають у компанії. — Для читача відповідь із водяним знаком нічим не відрізняється від відповіді без нього».
Зокрема, Anthropic заявила, що використовуватиме підхід SynthID-Text, розроблений командою Google DeepMind у 2024 році, а також планує випустити API для виявлення водяних знаків, пише TechCrunch. Компанія також підкреслила, що маркування водяними знаками принципово відрізняється від методів AI-детекції, які пропонують компанії на кшталт Pangram. Останні шукають у тексті стилістичні «маркери» (наприклад, конструкцію «це не [X], це [Y]»), щоб виявити використання ШІ: «Виявлення таких паттернів докорінно відрізняється від перевірки на наявність водяного знака».
«Чи може хтось просто переписати текст, щоб приховати водяний знак? В Anthropic зазначили, що це можливо, однак «легке редагування, ймовірно, не прибере водяний знак повністю», тоді як «повне переписування, де замінено кожне слово, дійсно це зробить».
«У останньому випадку, звісно, спірно, чи можна такий текст узагалі вважати згенерованим ШІ», — додали в компанії.
Що стосується того, чи буде виявлятися водяний знак у тексті, який Claude лише вичитував або редагував, в Anthropic відповіли, що це залежатиме від «довжини тексту та глибини внесених ШІ правок». Якщо редагування було мінімальним, «майже всі слова» залишаться написаними людиною, тож «водяному знаку просто не буде до чого прив’язатися (або майже не буде)».
Тим часом програмний код матиме менш виражене маркування, ніж звичайний текст. Причина в тому, що модель зобов’язана створювати робочий код і не має такої свободи вибору серед безлічі однаково правильних варіантів синонімів.
«Тим часом програмний код матиме менш помітний водяний знак, ніж звичайний текст, оскільки модель має створювати робочий код і не має такої свободи вибору серед безлічі однаково правильних варіантів.
«З огляду на це, у місцях, де є довільний вибір між конкретними словами чи термінами всередині коду — наприклад, у коментарях — водяний знак може використовуватися, — зазначили в Anthropic. — Але за визначенням він матиме незначний вплив на самий згенерований код».
В Anthropic також додали, що Claude буде не єдиним чат-ботом, який маркує текст, оскільки «інші провідні розробники моделей підписали той самий Кодекс практики й також впроваджуватимуть власні водяні знаки».
/
У своєму блозі компанія Anthropic спробувала відповісти на основні запитання про те, як вона маркуватиме водяними знаками текст, згенерований її чат-ботом Claude. Зокрема: як саме працюватимуть водяні знаки, чи можна їх приховати за допомогою редагування та як це вплине на програмний код.




