Для маркировки OpenAI намерена использовать собственную технологию textGrain. Она добавляет к выбору слов модели невидимый статистический сигнал, который впоследствии может быть обнаружен специальным детектором. Таким образом, речь идёт не о видимом логотипе или специальной строке в тексте, а о статистической особенности самого сгенерированного материала.
По данным OpenAI, textGrain по эффективности сопоставима с другими современными подходами к маркировке ИИ-контента или превосходит их, включая технологию SynthID, разработанную Google. При этом компания признаёт, что результаты, полученные в контролируемых условиях, не гарантируют столь же высокой надёжности при использовании технологии в реальных сценариях.
В частности, короткие тексты значительно сложнее идентифицировать: успешность обнаружения в таких случаях составляет около 80%. Проблемы возникают и с материалами определённых типов, например с математическими текстами. Дополнительные изменения человеком также могут снижать вероятность корректного обнаружения встроенного сигнала.
OpenAI намерена сделать технологию textGrain открытой, чтобы исследователи и разработчики могли изучать её, совершенствовать алгоритмы маркировки и создавать собственные средства обнаружения.
При этом маркировка не станет универсальной функцией для всех продуктов компании. По умолчанию она будет применяться к определённым текстовым результатам ChatGPT и Codex, предоставляемым пользователям в Европейском союзе. OpenAI также говорит о возможности выбора отдельных моделей, однако пока не уточняет, какие именно модели получат такую возможность.
Система обнаружения будет распространяться ещё осторожнее. На первоначальном этапе доступ к ней планируется предоставить только одобренным исследователям и экспертным организациям. При этом детектор не должен позволять установить личность пользователя, а также не будет предоставлять доступ к его запросам или истории разговоров.
Требования к такой маркировке предусмотрены статьёй 50 EU AI Act. Она устанавливает обязанность поставщиков генеративных ИИ-систем обеспечивать возможность идентификации созданного ими текстового контента с помощью машиночитаемой маркировки. Для уже работающих систем предусмотрен переходный период: соответствующие требования должны начать применяться к ним с 2 декабря 2026 года.
Таким образом, OpenAI присоединяется к формирующейся практике технической маркировки результатов генеративного ИИ. Аналогичный подход ранее начала внедрять Anthropic. Под действие европейских требований попадают не только эти компании, но и другие крупные разработчики ИИ-систем, включая Microsoft, Google и Meta.
Главная проблема, однако, остаётся прежней: если изменение текста человеком или его сокращение уже способно существенно снизить вероятность обнаружения водяного знака, насколько надёжным инструментом прозрачности окажется такая маркировка в реальном информационном потоке?
Источник: https://www.engadget.com/2277866/openai-will-add-a-digital-watermark-to-text-and-code-generated-in-t...Если вам понравился материал, кликните значок — вы поможете нам узнать, каким статьям и новостям следует отдавать предпочтение. Если вы хотите обсудить материал —не стесняйтесь оставлять свои комментарии : возможно, они будут полезны другим нашим читателям!

