Проект «Панама»: Как Anthropic уничтожала миллионы книг ради обучения ИИ
Проект «Панама»: Как Anthropic уничтожала миллионы книг ради обучения ИИ «Проект «Панама» — это наша попытка отсканировать с последующим уничтожением все книги в мире. Мы не хотим, чтобы стало известно, что мы работаем над этим». Эти слова взяты из внутреннего документа Anthropic, создателя ИИ-модели Claude. Они были запечатаны в судебных архивах почти два года. Когда их обнародовали, интернет взорвался. Anthropic, компания стоимостью $183 миллиарда, скупала миллионы физических книг, срезала с них корешки гидравлическим ножом, сканировала страницы, а остатки отправляла в переработку. Всё это — ради «чистых» данных для обучения нейросети. И самое шокирующее: американский суд признал это законным. Как такое стало возможно? И почему это важно для всех нас? Давайте по порядку. К 2024 году интернет оказался затоплен текстами, сгенерированными нейросетями. Если ИИ учится на текстах, созданных другим ИИ, его качество неизбежно падает. В мире машинного обучения это называют «коллапсом модели» — когда ошибки накапливаются, а оригинальность исчезает. Решение? Найти тексты, которые точно написаны людьми. Книги, опубликованные до 2022 года, стали идеальным источником. Они не содержат AI-контента, отредактированы профессиональными редакторами и представляют собой «чистый корпус» — золотой стандарт для обучения больших языковых моделей. Проблема была в том, что получить легальный доступ к миллионам книг через издателей было практически невозможно. Как признавалось в судебных документах, AI-компании не считали «практичным» получать разрешение от правообладателей напрямую. Читать далее: https://newsstreet.ru/blog/inosmi/36220.html