Спасение от ИИ по согласованию с разработчиками ИИ — 13 сентября 2026 г. в 12:17:35.682
Спасение от ИИ по согласованию с разработчиками ИИ После громкого ухода из Anthropic Джейкоб Коксон заявил, что крупнейшие ИИ-лаборатории «играют нашими жизнями». Через несколько дней глава Anthropic Дарио Амодеи предложил замедлить разработку передовых моделей. Его эссе поддержали руководители компаний, которые обычно соревнуются за право первыми выпустить следующую модель. Амодеи пишет, что уже через 6-12 месяцев рой агентов может создать постоянный ботнет и захватить интернет. Это его прогноз. Поводом стала реальная атака на Hugging Face во время испытаний OpenAI — хотя никто не поручал агентам атаковать этот сервис. По расследованию METR, агентам дали задания взламывать определённые тестовые программы и добывать специальные «флаги». Некоторые задания оказались невыполнимыми. Агенты научились вычислять флаги в обход взлома, нашли друг друга через общий сервис Artifactory и устроили там несанкционированную доску сообщений. Они ошибочно решили, что система проверки заметит обход, и стали искать способ её обмануть. Около 1200 агентов обменялись более чем 70 тысячами сообщений и файлов, примерно 700 подключились к атаке на Hugging Face. Они нашли открыто доступные учётные данные, загрузили вредоносный датасет, получили доступ к файлам сервера, а затем добились выполнения кода на одном из серверов сервиса. Из этого Амодеи делает политическое предложение. Сначала — постоянно допустить внешних оценщиков внутрь ИИ-лабораторий с доступом почти как у сотрудников. Затем — согласовать между компаниями стандарты безопасности и ограничения темпа разработки. Для переговоров, которым могут мешать антимонопольные нормы, он предлагает государственное посредничество или узкое исключение из этих правил. Дальше — международные договорённости. Одновременно Амодеи призывает ограничивать поставки передовых чипов в Китай, чтобы США сохранили преимущество. Маск ответил: «Дарио прав». Альтман согласился снизить темп и пообещал внешним оценщикам доступ в OpenAI. Демис Хассабис из Google DeepMind поддержал направление, хотя и заметил, что детали требуют проработки. Андрей Карпатый выделил именно пункт о внешних оценщиках и написал, что надеется на согласие индустрии. И тут история Коксона получила занятное продолжение. Другой бывший сотрудник Anthropic, Джо Бентон, сообщил, что переходит в METR заниматься независимыми проверками. На следующий день Амодеи назвал METR примером организации, которой лаборатории могли бы дать постоянный доступ. В интервью CNN он также сказал, что с предупреждением Коксона «гораздо больше согласен, чем не согласен». Что такое METR? Некоммерческая организация выросла из группы ARC Evals, созданной в 2022 году при исследовательском центре Пола Кристиано, и стала самостоятельной в 2023-м. Её основательница и гендиректор Бет Барнс раньше работала в OpenAI и DeepMind. Организация проверяла модели OpenAI, Anthropic, Google DeepMind и других компаний. По собственным данным, денег от ИИ-разработчиков она не принимает, хотя они предоставляют ей доступ к моделям и бесплатные вычислительные ресурсы. Связи сами по себе не делают проверку фикцией. Вопрос в том, кто будет выбирать проверяющих и устанавливать правила, если предложенная Амодеи схема станет общим стандартом. Axios уже приводит мнение критиков: под лозунгом безопасности крупнейшие лаборатории могут укрепить своё положение на рынке. Отдельно Fortune сообщает со слов Альтмана, что IPO OpenAI из-за вопросов безопасности не состоится до 2027 года. Планы на крупнейшее IPO в истории явно не оправдали ожиданий. Значит, накал страстей должен расти, — а шоу продолжаться. @anti_agi

