Хвост научился вилять собакой — 17 августа 2026 г. в 16:45:29.036
Хвост научился вилять собакой Большие coding-агенты умеют быстро писать код, но легко срезают путь, если научный эксперимент оказывается слишком сложным. Бороться с этим увеличением числа параметров — мера неэффективная. Поэтому в Inherent Laboratories решили просто поставить над GPT‑5.5 компактного руководителя, который будет решать, что именно проверять. Так появилась Faraday — дообученная Qwen3.6 на 27 млрд параметров. Она читает научную статью, планирует эксперимент и поручает GPT‑5.5 Codex написать и запустить код. Затем изучает результаты, исправляет план и отправляет исполнителя на следующий круг. Для её обучения собрали Replica: 310 заданий по 100 научным статьям 1990-2026 годов. Из каждой статьи удаляли изображение одного графика, но оставляли подпись, описание методики и обсуждение результатов. Самих кривых и значений агент не видел. По оставшимся сведениям ему предстояло не угадать пропавшую картинку, а повторить стоящий за ней эксперимент: реализовать метод из статьи с нуля, запустить его и построить новый график по собственным данным. Оригинал видел только судья, который после завершения работы проверял также код и всю последовательность действий агента. На задачу давали 60 минут и одну из семи изолированных виртуальных секций ускорителя H200. Полные эксперименты часто не помещались в такой бюджет, поэтому Faraday приходилось решать, что уменьшить — модель, датасет или число запусков, — не потеряв при этом смысл проверки. Например, в работе ChemVAE удалённый график показывал поиск молекул с заданными свойствами внутри пространства, выученного генеративной моделью. Faraday обучила уменьшенную версию такой модели, провела поиск и преобразовала найденные точки в новые молекулы. Codex упростил архитектуру так, что генерировать молекулы она уже не могла, и вместо этого подбирал ближайшие варианты из исходной базы. Похожую иллюстрацию построили оба, но только Faraday повторила заявленный опыт. В другом задании нужно было воспроизвести эксперимент Darwin–Gödel Machine по эволюционному улучшению coding-агентов. Faraday действительно запустила поиск, создала архив мутировавших агентов и перенесла лучший вариант на новые модели, тесты и языки. Конкурирующая модель просто прописала якобы найденного агента вручную, фактически перескочив через саму эволюцию. Faraday обучили на 242 задачах, а протестировали на 68 работах из незнакомых ей областей AI for Science. В 60% заданий она получила более высокую оценку, чем одновременно Claude Opus 4.8 и GPT‑5.5, работавшие самостоятельно. В среднем преимущество составило 6% над Claude и 8% над Codex. Основным судьёй в работе тоже выступал Codex. Когда его попросили расставить несколько попыток от лучших к худшим, получившийся порядок лишь слабо совпал с мнением экспертов. В отдельной проверке люди всё же предпочли Faraday в 29 из 41 специально отобранного случая, где автоматический судья видел её сильное преимущество. По оценке, на которую ссылаются авторы, Codex может насчитывать около 5 трлн параметров — почти в 200 раз больше своего научного руководителя. Но чтобы руководить, китайскому брату необязательно знать об этом мире всё. @anti_agi

