Anthropic объяснила водяные знаки в Claude

Anthropic опубликовала в пятницу пост с ответами на основные вопросы о том, как будет работать водяной знак в текстах Claude. Компания пояснила механизм, рассказала, можно ли скрыть такую метку редактированием, и отдельно описала, как это скажется на коде.

Ранее на этой неделе Anthropic сообщила, что вводит водяные знаки для соответствия EU AI Act’s Transparency Code. Этот кодекс требует от ИИ-компаний использовать системы, которые позволяют определить, был ли контент создан нейросетью.

После анонса решение вызвало споры у пользователей Claude. На Reddit один из участников назвал это заговором против обычных пользователей сервиса, а другой написал: «Единственная причина, по которой это может не нравиться, — желание лгать людям». Business Insider также сообщает, что «десятки» пользователей X заявили об отмене подписки на Claude.

В новом материале Anthropic сначала кратко объяснила сам принцип водяного знака. Компания пишет, что при «низкорисковом» выборе слов, например между “overcast” и “grey” при описании погоды, Claude может формировать в ответах скрытый шаблон, который незаметен читателю, но определяется теми, у кого есть специальный ключ.

«Watermarking does not impact the quality of Claude’s output», — заявила компания. По её словам, для читателя ответ с водяным знаком неотличим от ответа без него.

Anthropic уточнила, что будет использовать подход SynthID-Text, который команда Google DeepMind описала в 2024 году. Компания также планирует выпустить API для проверки водяных знаков.

Отдельно Anthropic подчеркнула, что водяные знаки отличаются от сервисов для определения ИИ-текста, которые ищут характерные признаки письма. В качестве примера компания упомянула Pangram и конструкции вроде «this isn’t [X], it’s [Y]». «Picking up on these patterns is fundamentally different from checking for a watermark», — говорится в посте.

На вопрос о том, можно ли скрыть водяной знак переписыванием текста, Anthropic ответила, что это возможно. При этом лёгкая правка, вероятно, не уберёт метку полностью, а полная переработка с заменой каждого слова — уберёт.

«In the latter case, of course, it’s arguable whether the text can any longer be described as AI-generated», — отметила компания.

Если Claude лишь вычитывал или редактировал текст, наличие водяного знака будет зависеть от длины текста и степени правок. Если изменения были минимальными, почти все слова останутся авторскими, и метке будет почти не к чему привязаться, пояснила Anthropic.

Для кода водяной знак должен проявляться слабее, чем в обычном тексте, поскольку модели нужно писать работающий код и у неё меньше свободы выбора между равнозначными вариантами.

«Having said that, in areas where there is an arbitrary choice between particular words or terms within the code, the watermark can be used, such as comments within code», — заявила Anthropic. По её словам, влияние на сам код будет незначительным.

Компания также добавила, что Claude не станет единственным чат-ботом с такой системой. По данным Anthropic, другие крупные разработчики моделей подписали тот же кодекс практики и будут внедрять собственные водяные знаки.

Источник: TechCrunch, Anthropic.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai