Материалы были опубликованы в рамках ходатайства издателей о вынесении решения в порядке упрощённого производства по иску, который The New York Times подала против OpenAI и Microsoft в конце 2023 года. Издатели обвиняют компании в масштабном использовании защищённых авторским правом материалов без разрешения для обучения ИИ-моделей. Microsoft и OpenAI, в свою очередь, считают такое использование подпадающим под доктрину fair use — добросовестного использования произведений, предусмотренную американским законодательством.
На этом фоне особый интерес представляют внутренние документы, в которых сотрудники самих компаний ещё до появления нынешних ИИ-продуктов обсуждали возможные последствия такой модели.
«Крупнейшая кража труда в истории»
Одним из наиболее резонансных документов стало внутреннее сообщение Брента Хехта (Brent Hecht), директора по прикладным исследованиям Microsoft. В нём он описывал массовый сбор интернет-контента для обучения ИИ как «поразительную кражу беспрецедентных масштабов» и предполагал, что речь может идти о «крупнейшей краже труда в истории человечества».
В другом документе Хехт ставил под сомнение аргумент о fair use, предполагая, что масштабное копирование новостного контента может противоречить самой идее добросовестного использования. Эти высказывания особенно важны для истцов, поскольку они показывают, что внутри Microsoft риски подобной модели обсуждались задолго до нынешнего судебного спора.
При этом Microsoft подчёркивает, что документы Хехта отражают его личную позицию, а не официальную юридическую позицию компании. Представитель Microsoft заявил, что позиция корпорации изложена в её судебных документах, где компания утверждает, что использование материалов является преобразующим и соответствует законодательству об авторском праве.
«Экзистенциальная угроза» для издателей
Похожие опасения обсуждались и внутри OpenAI.
Ник Тёрли (Nick Turley), руководивший разработкой ChatGPT, в июне 2023 года написал, что ИИ представляет «экзистенциальную угрозу» для издателей. В другой внутренней переписке он охарактеризовал ИИ-продукты как преимущественно замещающие и предположил, что по мере совершенствования моделей этот эффект будет усиливаться.
В документах приводится и ещё одна показательная оценка: сотрудник OpenAI писал коллегам, что пользователи не будут переходить по ссылкам на источники независимо от того, насколько заметно они представлены в ответе чат-бота.
Смысл этих наблюдений имеет непосредственное отношение к спору об авторском праве. Если ИИ не просто использует публикацию для обучения, а затем формирует ответ, который позволяет пользователю не посещать исходный сайт, возникает вопрос о том, превращается ли такая система в конкурента самого источника. Именно на эффекте «замещения» издатели строят значительную часть своей аргументации.
Microsoft сама увидела «петлю обречённости»
Особенно примечательным оказался внутренний документ Microsoft, описывающий своеобразную «doom loop» — замкнутый цикл, при котором ИИ-продукты одновременно подрывают собственную информационную базу и экономику сайтов, создающих этот контент.
Логика проста. Если пользователи получают новости непосредственно от ИИ-систем и реже переходят на сайты издателей, у СМИ снижаются аудитория и доходы. Это уменьшает стимулы производить качественный оригинальный контент. В результате ИИ-системы в перспективе сами получают меньше новых достоверных материалов, на которых строится их информационная база.
В одном из документов эта проблема описывалась как необычная ситуация, при которой конечный продукт угрожает экономической основе поставщиков, необходимых для работы самого бизнеса.
По данным Microsoft, приведённым в судебных материалах, переход пользователей от традиционного поиска к ИИ-ответам действительно сопровождался резким снижением кликабельности некоторых новостных сайтов. Для отдельных истцов падение CTR составляло от 83 до 93%, для других — от 51 до 94% по сравнению с традиционным поиском Bing. При этом сами показатели относятся к конкретным тестам и источникам и не означают, что трафик всех новостных сайтов снизился на такие величины.
«Чат-боты в основном заменяют новости»
Важной частью аргументации издателей стали показания Сатьи Наделлы. В рамках дачи показаний генеральный директор Microsoft признал, что взаимодействие с чат-ботами может заменить переход пользователя на исходный сайт: человек получает информацию непосредственно в ИИ-сервисе, не обращаясь к первоисточнику.
Эта формулировка сама по себе не является признанием нарушения авторского права. Однако для издателей она важна в контексте одного из критериев fair use — влияния использования произведения на существующий или потенциальный рынок оригинала.
Внутренние документы OpenAI содержат похожие оценки. Тёрли писал, что продукты компании являются «в основном замещающими» и со временем могут становиться ещё более замещающими. В других документах сотрудники обсуждали способность моделей воспроизводить содержание новостных публикаций и решать задачи, связанные с журналистскими материалами.
Проблема не ограничивается обучением моделей
Издатели в ходатайстве приводят не только аргументы о масштабном сборе данных для обучения. Они утверждают, что компании использовали новостной контент и на других этапах развития ИИ-продуктов.
В частности, материалы дела затрагивают Project Taxi и Project Mango — инициативы, в рамках которых Microsoft и OpenAI обменивались данными, включая материалы, полученные из поискового индекса Bing. Согласно аргументам истцов, таким образом в обучающие наборы могли попадать произведения издателей, которые изначально предоставлялись поисковой системе в совершенно другом контексте.
По данным, представленным в судебных материалах, связанные с этими процессами наборы содержали копии как минимум 160 903 уникальных произведений новостных издателей. В одном из наборов, полученных на основе Common Crawl, обнаружено более двух миллионов документов с домена nytimes.com.
Истцы также утверждают, что сотрудники OpenAI обсуждали способы получать материалы, находящиеся за платным доступом, и что компания использовала набор данных NYT, полученный от третьей стороны. Эти утверждения относятся к предмету спора и ещё не являются установленными судом фактами.
Воспроизводимость статей стала отдельным аргументом
Издатели представили суду результаты собственных тестов, пытаясь показать, что ИИ-системы способны воспроизводить значительные фрагменты опубликованных материалов.
В одних экспериментах чат-боты выдавали длинные фрагменты статей в ответ на запросы о содержании публикации. В других исследователи просили систему перечислить ключевые положения конкретного материала или оценить его возможную предвзятость. Отдельные эксперименты были построены вокруг выбора статьи с главной страницы определённого новостного сайта.
Для издателей это важно по двум причинам. Во-первых, они пытаются показать наличие значительного дословного совпадения между оригиналом и ответами ИИ. Во-вторых, они связывают воспроизведение контента с его возможным замещающим эффектом: пользователь получает существенную часть материала, не переходя к его автору.
Именно сочетание этих двух обстоятельств — копирование и конкуренция с оригинальным источником — издатели считают одним из наиболее сильных аргументов против позиции Microsoft и OpenAI о fair use.
Microsoft: слова сотрудников не определяют позицию компании
Microsoft не согласилась с такой интерпретацией документов.
Представитель компании заявил, что высказывания Хехта отражают точку зрения отдельного сотрудника и не являются юридическим анализом. По позиции Microsoft, заявления Наделлы также следует рассматривать как общие наблюдения о том, как меняется способ поиска и потребления информации, а не как вывод о нарушении авторского права.
OpenAI публично не ответила на запрос Ars Technica о комментарии к этим материалам. При этом обе компании продолжают отстаивать позицию, согласно которой использование материалов для обучения ИИ подпадает под fair use.
Таким образом, рассекреченные документы не означают, что суд уже установил незаконность действий Microsoft или OpenAI. Они показывают другое: внутри обеих компаний задолго до нынешнего разбирательства обсуждалась возможность того, что ИИ-продукты будут конкурировать с издателями, снижать переходы на оригинальные сайты и в перспективе подрывать экономику производства новостей.
Именно этот аспект делает дело принципиальным далеко за пределами отношений между двумя технологическими компаниями и конкретными издателями. Если качественный новостной контент действительно является одной из ключевых составляющих информационной базы ИИ, возникает парадокс: чем эффективнее ИИ заменяет посещение первоисточников, тем сильнее он может ослаблять экономическую модель тех, кто эти первоисточники создаёт.
Но если ИИ-системы действительно способны одновременно использовать журналистику как источник для обучения и постепенно оттеснять её как источник дохода, не создаёт ли индустрия ИИ собственную зависимость от контента, производство которого сама же делает экономически менее выгодным? А что об этом думаете вы?
Если вам понравился материал, кликните значок — вы поможете нам узнать, каким статьям и новостям следует отдавать предпочтение. Если вы хотите обсудить материал —не стесняйтесь оставлять свои комментарии : возможно, они будут полезны другим нашим читателям!

