У справі New York Times розсекретили заяви Microsoft про ШІ-скрейпінг
У матеріалах позову New York Times наведено твердження про збирання контенту для ШІ та ризики для видавців.
У розсекреченій частині матеріалів у позові The New York Times проти OpenAI та Microsoft містяться твердження про масове збирання контенту медіа для навчання моделей штучного інтелекту. Як повідомляє TechCrunch, у поданні газети наведено внутрішні висловлювання представників компаній про ризики таких практик для видавців і журналістів.
Зокрема, директор Microsoft із прикладної науки Брент Гехт у внутрішній записці за січень 2023 року нібито назвав це «приголомшливою крадіжкою безпрецедентних масштабів» і «найбільшою крадіжкою праці в історії людства». Водночас видання зазначає, що значна частина нових відомостей походить із самого подання The New York Times, а первинні додатки до нього досі залишаються закритими. Наведені цитати подано без початкового контексту.
Дані про трафік і контент
Згідно з матеріалами позову, внутрішні дані Microsoft показали, що пошуковий сервіс відповідей Copilot зменшував переходи на домен The New York Times до 93% порівняно зі звичайним пошуком Bing. У презентації Гехта від січня 2024 року це описано як «петлю приреченості», яка може одночасно погіршити роботу моделей і становище всього вебу.
Позивачі також стверджують, що проміжні набори даних OpenAI містили понад 91 692 копії матеріалів The New York Times, Daily News і Center for Investigative Reporting. Набір даних, сформований на основі Common Crawl, нібито включав понад 2 млн документів із nytimes.com. За твердженням у позові, у наборі Project Mango були копії щонайменше 160 903 унікальних робіт новинних видавців.
Твердження про обхід платного доступу
У поданні стверджується, що OpenAI та Microsoft отримували контент, зокрема через індекс Bing, а працівники OpenAI обговорювали спосіб обійти платний доступ The New York Times непомітно. Там само йдеться про нібито вилучення повідомлень про авторські права з навчальних даних, аби моделі не відтворювали їх користувачам.
Генеральний директор Microsoft Сатья Наделла раніше під час свідчень заявив, що матеріали за платним доступом мають ліцензуватися для використання в навчанні або для надання відповідей. За його словами, якби він дізнався про навчання OpenAI на такому контенті, то скористався б правом Microsoft вимагати повторного навчання моделей. OpenAI та Microsoft не відповіли на запити про коментар, пише TechCrunch.