Как работает скрытый водяной знак в тексте Gemini

Водяной знак на AI-картинке представить легко: логотип, метка или данные внутри файла. С текстом всё интереснее. Google научилась оставлять скрытый след непосредственно в том, как Gemini выбирает токены при генерации ответа. Человек этого не замечает, но система обнаружения может распознать получившийся статистический паттерн.
Чтобы понять принцип, достаточно знать одну особенность LLM. Модель не пишет предложение целиком. Она последовательно выбирает токены — небольшие фрагменты текста. Токеном может быть слово, часть слова, символ или знак препинания. Для каждого следующего токена модель оценивает, насколько хорошо разные варианты подходят к уже созданному тексту.
Нередко сразу несколько вариантов оказываются вполне подходящими. Например, в определённом контексте слова «большой» и «крупный» могут почти одинаково хорошо передавать смысл. Именно там, где у модели остаётся свобода выбора, появляется возможность для скрытой маркировки.
Для этого Google использует SynthID-Text. Технология вмешивается непосредственно в процесс генерации и изменяет процедуру выбора токенов так, чтобы в последовательности решений модели появился дополнительный статистический сигнал. Смысл и качество текста при этом должны оставаться практически неизменными для читателя.
Когда такие небольшие изменения повторяются на протяжении ответа, возникает рисунок, который затем можно обнаружить статистически. Это и есть скрытый водяной знак SynthID. При этом общий принцип технологии не является секретом: Google DeepMind опубликовала техническое описание SynthID-Text, а сама схема была подробно разобрана в научной работе в Nature.
Это важное отличие от метаданных в файле. Метаданные можно потерять при копировании содержимого, тогда как текстовый водяной знак формируется непосредственно во время выбора последовательности токенов. Поэтому обычное копирование текста из чата само по себе не обязательно уничтожает признаки маркировки.
У метода есть ограничения. SynthID лучше работает с более длинными ответами, где у модели достаточно вариантов выбора. Короткие фактические ответы определить сложнее: если на вопрос существует практически единственный естественный вариант ответа, возможностей встроить статистический сигнал становится меньше.
Редактирование тоже имеет значение. Небольшие изменения, удаление части текста или лёгкое перефразирование не обязательно уничтожают водяной знак полностью. Но глубокая переработка текста или перевод на другой язык способны заметно снизить уверенность детектора.
Важно и другое: привычный «стиль нейросети» сам по себе не является водяным знаком. Повторяющиеся конструкции, чрезмерно аккуратные перечисления или характерные обороты могут быть особенностью конкретной модели или её настроек, но SynthID работает на другом уровне — внутри процесса выбора токенов.
Получается довольно необычная ситуация: текст может выглядеть совершенно естественно, не содержать логотипов или видимых меток, но всё равно сохранять машинный след. При этом SynthID — не неуничтожимая цифровая подпись, а статистический механизм, надёжность которого зависит от длины текста, характера ответа и того, насколько сильно его изменили после генерации.
Источники: Google DeepMind, Nature.