Anthropic объясняет, как именно она будет помечать тексты, созданные ИИ

Компания Anthropic опубликовала подробности внедрения «водяных знаков» в тексты Claude. Система использует технологию SynthID для статистического анализа последовательности токенов, что позволяет идентифицировать ИИ-контент без ущерба для качества текста.

GeektimeАвтор: Янив Авиталь
Источник
Anthropic объясняет, как именно она будет помечать тексты, созданные ИИ
Фото: Geektime / תמונה: Unsplash

В минувшие выходные Anthropic опубликовала пост в своем блоге, разъясняющий решение компании внедрить «водяные знаки» в тексты, создаваемые ботом Claude. До сих пор подобные маркеры использовались в основном в генераторах изображений. Теперь же, чтобы соответствовать требованиям европейского закона об ИИ, компания начнет помечать и текстовый контент.

Технология Google

Anthropic поясняет, что при генерации текста модель не просто заменяет слова случайным образом, а вмешивается в процесс выбора следующего токена на основе вероятностей. Используя «псевдослучайный ключ», система создает в ответах тонкий шаблон. Этот узор незаметен для человека, но распознаваем при наличии «ключа дешифровки».

В ситуациях с «низким риском» (где выбор слов предсказуем, например, «погода в Лондоне — облачная/серая») энтропия низка, и модель может внедрить маркер. В случаях с высокой энтропией, где вариантов продолжения множество, система скрывает водяной знак без ущерба для синтаксиса.

Для этого используется технология SynthID, разработанная Google DeepMind в 2024 году. Система выполняет обратное математическое вычисление на последовательности токенов. Если совокупная оценка превышает статистический порог, текст идентифицируется как созданный ИИ. Чем длиннее фрагмент, тем выше точность идентификации.

Можно ли удалить маркер?

Легкое редактирование текста, скорее всего, не удалит водяной знак. Полная переработка, при которой заменяется почти каждое слово, может сработать, однако в таком случае возникает вопрос: можно ли считать такой текст продуктом ИИ?

Если Claude используется лишь для корректуры человеческого текста, результат будет зависеть от глубины правок. При минимальных изменениях (расстановка знаков препинания) система не сможет внедрить достаточное количество маркеров, и текст не будет помечен как ИИ-контент. Однако глубокая переработка текста неизбежно приведет к появлению тега «написано ИИ».

Что касается программного кода, Anthropic отмечает, что в нем будет содержаться меньше водяных знаков. Это связано с жесткими требованиями синтаксиса, ограничивающими свободу выбора модели. Маркировка может затрагивать лишь документацию, комментарии или имена переменных. В завершение компания напоминает, что внедрение подобных стандартов прозрачности вскоре станет общеотраслевой практикой.

Читайте также