В ближайшие недели OpenAI начнёт автоматически ставить водяной знак на подходящий текст, который ChatGPT и Codex создают для пользователей в ЕС. Так компания собирается выполнить требования закона ЕС об искусственном интеллекте. Клиенты API по всему миру уже могут включить водяной знак для отдельных моделей, но по умолчанию он отключён.[1][2][3]
Система называется textGrain. Она встраивает в текст «статистический сигнал», слегка влияя на то, какие слова выбирает модель. Детектор не станет публичным, доступ к нему получат только одобренные исследователи и экспертные организации. OpenAI планирует открыть исходный код технологии, чтобы «другие могли развивать её и помочь улучшить водяные знаки в тексте».[4][5][6]
Издания приводят разные цифры точности. По данным The New Stack, OpenAI сообщает, что детектор распознаёт около 80% отрывков из 200 токенов и 95% отрывков из 400 токенов при целевом уровне ложных срабатываний 1%. BeInCrypto со ссылкой на тесты компании пишет о другом: около 66% неотредактированных ответов объёмом примерно 150 слов и около 92% при объёме около 300 слов. Если заменить синонимами 10% слов в отрывке из 400 токенов, распознаваемость падает с 92% до 66%, а при замене 25% слов снижается до 17%. По словам OpenAI, отсутствие водяного знака не доказывает, что текст написал человек.[7][8][9][10]
OpenAI утверждает, что textGrain распознаёт водяные знаки не хуже, чем SynthID от Google DeepMind, или превосходит его. Модель Astra с водяным знаком и без него компания проверила на DeepSWE, AutomationBench и Terminal-Bench и заметной разницы в производительности не нашла. Код, по словам OpenAI, помечать сложнее, потому что вариантов продолжения в нём меньше, чем в обычной прозе.[11][12][13]
Anthropic, как пишет The New Stack, поступает иначе и применяет водяные знаки для Claude по всему миру, объясняя это тем, что надёжного способа ограничить технологию по регионам у неё пока нет.[14]
По материалам
Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.
To comply with the EU AI Act, OpenAI plans to add text watermarking for ChatGPT and Codex users in the EU and an opt-in setting for API customers globally (OpenAI)
Starting today, API customers globally will be able to opt in to text watermarking for select models. Text watermarking will remain off by default in the API,
the company details a new system dubbed textGrain, which embeds a “statistical signal” into generated text by subtly influencing the words a model chooses
OpenAI says its detector catches around 80% of watermarked 200-token passages, and 95% of 400-token passages in domains such as psychology, at a target false-positive rate of 1%.
In OpenAI’s tests, replacing 10% of the words in a 400-token passage with synonyms reduced its detection rate from around 92% to 66%. Replacing 25% brought it down to just 17%.
OpenAI tested its Astra model with and without watermarking against several coding and agent benchmarks, including DeepSWE, AutomationBench and Terminal-Bench, and says it found no meaningful difference in performance.
Anthropic said it would apply watermarking globally to supported Claude models, explaining that it didn’t yet have a reliable way to limit the technology by region.