У Microsoft називали навчання ШІ на новинах “найбільшою крадіжкою праці”
Розсекречені матеріали судової справи між американськими видавцями, OpenAI та Microsoft показали, що всередині технологічних компаній роками обговорювали ризики використання мільйонів газетних статей для навчання штучного інтелекту. Один із керівників Microsoft називав масове копіювання контенту потенційно "найбільшою крадіжкою праці в історії людства", а в OpenAI попереджали, що ШІ може стати "екзистенційною загрозою" для видавців. Документи були оприлюднені в межах позову The New York Times та інших американських медіакомпаній проти OpenAI і Microsoft.
Видавці звинувачують технологічні компанії у використанні захищених авторським правом статей без дозволу та оплати для створення й навчання великих мовних моделей. Microsoft і OpenAI заперечують порушення та стверджують, що навчання моделей підпадає під американську доктрину fair use – допустимого використання захищених творів. Найбільш різкі оцінки містяться у внутрішніх документах директора Microsoft з прикладних наук Брента Гехта.
У 2023 році він писав, що мільйони людей можуть сприйняти використання їхніх робіт великими моделями як безпрецедентну крадіжку, а сам процес називав потенційно "найбільшою крадіжкою праці в історії людства". В іншій внутрішній презентації Microsoft Гехт попереджав про ризик своєрідного "замкненого кола". На його думку, ШІ-сервіси можуть скорочувати трафік і доходи видавців, послаблюючи бізнес компаній, які створюють якісний контент, необхідний самим розробникам ШІ для навчання майбутніх моделей.
Microsoft зафіксувала падіння переходів на сайти окремих видавців із Copilot на 83-93% порівняно з традиційним пошуком Bing, випливає з матеріалів, наведених позивачами. Схожі побоювання існували й усередині OpenAI. Керівник ChatGPT Нік Терлі в червні 2023 року писав, що штучний інтелект становить "екзистенційну загрозу" для видавців.
У лютому 2024 року він зазначав, що ШІ-продукти вже значною мірою замінюють першоджерела і з розвитком технології робитимуть це дедалі більше. Масштаб використаного контенту також став одним із ключових аргументів медіакомпаній. За даними судових матеріалів, один лише набір даних на основі Common Crawl містив понад 2 млн документів із домену The New York Times.
В інших наборах для додаткового навчання моделей позивачі нарахували десятки тисяч копій матеріалів NYT, Daily News та Center for Investigative Reporting. Окрема частина претензій стосується матеріалів за платним доступом. У судових документах наводиться внутрішнє листування, в якому співробітник OpenAI повідомляв співзасновнику та президенту компанії Грегу Брокману про спосіб обходу платного доступу The New York Times.
Водночас саме позивачі трактують ці матеріали як доказ свідомого обходу обмежень, а значна частина первинних додатків до судових документів досі залишається закритою. Генеральний директор Microsoft Сатья Наделла під час свідчень заявив, що матеріали, які перебувають за paywall, мають ліцензуватися для використання у навчанні або роботі ШІ. За його словами, якби йому було відомо, що OpenAI навчала моделі на отриманих таким чином матеріалах, Microsoft могла б вимагати перенавчання моделей.
Microsoft наголосила, що висловлювання Гехта є особистою позицією одного співробітника, а не юридичною оцінкою чи офіційною позицією компанії. Корпорація продовжує наполягати, що використання матеріалів для ШІ є трансформативним і відповідає законодавству про авторське право, а Copilot не є заміною журналістським матеріалам. Справу розглядає федеральний суд Південного округу Нью-Йорка.
Суддя Сідні Стайн зараз розглядає клопотання сторін про винесення рішення без повноцінного судового розгляду. Для видавців внутрішні документи стали важливим аргументом у спробі довести, що ШІ-продукти не лише використовують їхній контент, а й можуть безпосередньо конкурувати з першоджерелами. Остаточного рішення щодо законності такого використання матеріалів суд поки не ухвалив.
За матеріалами: The New York Times, TechCrunch, Ars Technica
