Что будет сделано?
Пользователи могут включить отображение текстовых водяных знаков для некоторых моделей ИИ; по умолчанию эта опция отключена. Компания также откроет доступ к детектору водяных знаков, при этом в индивидуальном порядке доступ получат исследователи и экспертные организации. Меры касаются только текстовых файлов.
В OpenAI увязали запуск маркировки с требованиями законодательства ЕС об искусственном интеллекте, которое предусматривает машиночитаемую идентификацию контента. По словам разработчиков, изменения призваны выполнить нормы Евросоюза и повысить прозрачность.
Технология textGrain добавляет к словам, которые выбирает модель, невидимые стилистические сигналы. Детектор будет искать эти сигналы и определять, создан ли текст инструментами OpenAI. Компания предупреждает, что детекторы могут как не заметить существующий водяной знак, так и ошибочно сообщить о его наличии.
Что это такое?
Речь идет не о видимых символах, метках или скрытых знаках в тексте, а о невидимом статистическом "водяном знаке": система слегка меняет вероятности выбора слов при генерации так, чтобы в длинном фрагменте возник распознаваемый паттерн. OpenAI называет эту технологию textGrain.
Как это работает?
Языковая модель при написании текста каждый раз выбирает следующее слово или фрагмент слова (токен) из нескольких правдоподобных вариантов. textGrain с помощью секретного ключа незаметно смещает этот выбор: там, где несколько слов подходят одинаково хорошо, модель чуть чаще выбирает "нужные" варианты. Для читателя текст выглядит обычным, но статистически в нем накапливается скрытая закономерность.
Детектор, располагающий ключом и алгоритмом OpenAI, проверяет, соответствует ли последовательность слов этому паттерну. Водяной знак "живет" в самих словах, поэтому сохраняется при копировании и вставке текста.
Важно то, что это не невидимые символы Unicode, пробелы или метаданные файла. Именно поэтому такая метка не исчезает при обычном копировании текста, но может ослабевать или пропадать после редактуры.
Что детектор может определить?
Положительный результат означает, что фрагмент, вероятно, содержит водяной знак OpenAI, то есть был сгенерирован или обработан ее системой с включенной маркировкой. Но он не доказывает:
- кто именно пользовался ChatGPT;
- какую долю текста написал человек, а какую – ИИ;
- кто владеет правами на текст;
- правдив ли текст;
- насколько текст был отредактирован человеком.
Можно ли выявлять со 100-процентной точностью?
Нет. OpenAI прямо указывает, что детектор может допускать два типа ошибок: ложноположительные срабатывания – находить водяной знак там, где его нет, – и ложноотрицательные – пропускать реально присутствующий знак.
По опубликованным OpenAI оценкам, при настройке детектора на уровень ложных срабатываний 1% он находил водяной знак примерно в 95% фрагментов объемом 400 токенов и около 80% фрагментов объемом 200 токенов – на материале, где у модели достаточно свободы в выборе слов. Для математики и других жестко структурированных текстов точность заметно ниже, поскольку там мало вариантов формулировок.
Почему редактура мешает?
Поскольку сигнал распределен по выбору слов, замена части слов способна разрушить паттерн. В тестах OpenAI замена 10% слов синонимами снижала обнаружение фрагментов в 400 токенов с примерно 92% до 66%, а замена четверти слов – до 17%.
Поэтому технология лучше подходит как вспомогательный сигнал происхождения текста, а не как доказательство "сгенерирован / не сгенерирован". Для редакционной проверки ее результаты стоит рассматривать вместе с другими признаками: источниками, стилистикой, фактологией, метаданными и контекстом появления материала.