ChatGPT будет помечать тексты невидимыми водяными знаками
Новости Безопасность
Компания OpenAI, разработчик ChatGPT, объявила о новом подходе к маркировке текста, сгенерированного искусственным интеллектом, в соответствии с требованиями EU AI Act (Закон Евросоюза об искусственном интеллекте). Компания запускает технологию поэтапно, открыто признает ограничения и не делает водяные знаки глобальными по умолчанию, отмечается в сообщении OpenAI.
Технология: textGrain
OpenAI разработала собственную систему водяных знаков — textGrain. Она встраивает невидимый статистический сигнал в выбор слов моделью. Детектор ищет этот сигнал и оценивает, содержит ли фрагмент водяной знак OpenAI. Технический отчет уже опубликован, а саму технологию планируют открыть, опубликовав исходный код.
По результатам внутренних оценок, textGrain соответствует или превышает показатели других подходов, в том числе SynthID для текста от Google.
Три шага запуска
- Опционально для API — глобально, с 5 октября. Клиенты API по всему миру могут включить водяные знаки для выбранных моделей. По умолчанию функция выключена.
- Автоматически для ChatGPT и Codex — только в ЕС, ближайшие недели. Водяной знак добавится к тексту пользователей всех тарифных планов, но только в Евросоюзе.
- Доступ к детектору — для исследователей. Заявки открыты, но доступ ограничен одобренными исследовательскими организациями. Публичный запуск отложен из-за риска ложных срабатываний и пропусков.
Что водяной знак не показывает
OpenAI прямо перечисляет, чего водяной знак не делает:
- Не измеряет вклад человека — не определяет, насколько текст прошел редактуру или насколько серьезно человек участвовал в его создании.
- Не устанавливает авторство или ответственность — не говорит, кому принадлежит текст, законно ли его использование и кто за него отвечает.
- Не идентифицирует пользователя — не связывает текст с конкретным человеком, аккаунтом или диалогом.
- Не проверяет точность — не говорит, правдив текст или нет.
- Отсутствие водяного знака не доказывает человеческое авторство — текст может быть слишком коротким, отредактированным, переведенным, сгенерированным другой моделью или до введения маркировки.
OpenAI приводит конкретные цифры по надежности детектора. Как отмечается в сообщении компании, замена 10% слов синонимами снижает обнаружение с ~92% до ~66%. Замена 25% — снижает до 17%.
Это первый конкретный ответ OpenAI на требование EU AI Act о маркировке сгенерированного текста. Позиция компании прагматичная: водяные знаки работают, но ненадежно, поэтому детектор не показывают публике, а маркировку включают только там, где закон требует, — в ЕС. При этом OpenAI честно признаёт, что замены 25% слов достаточно, чтобы детектор почти перестал работать. По сути, компания делает ровно то, что требует регулятор, — и тут же объясняет, почему этого недостаточно.
|
|
|