Могут ли топовые языковые модели предсказывать научные открытия? — 3 июня 2026 г. в 06:12:03.601
Могут ли топовые языковые модели предсказывать научные открытия? Исследовательская группа из Оксфорда, Стэнфорда, Allen Institute и Sakana AI проверила, насколько современные LLM способны прогнозировать ход научного прогресса. Результаты получились отрезвляющими. Как был устроен эксперимент Авторы разработали специальный бенчмарк CUSP: модели намеренно «возвращали в прошлое» и просили предсказать события, которые ещё не произошли на момент их обучения. В основу теста легли 4 760 научных событий за период с января 2024 по март 2026 года из журналов Nature, Science, Cell и подборок ключевых работ по ИИ. Итого 17 429 заданий. В тестировании участвовали GPT-5.4, Claude Sonnet 4.5, DeepSeek R1 и GPT-OSS 20B. Что показали результаты С выбором общего направления исследований модели справились неплохо: GPT-5.4 набрала 81,9% на вопросах с вариантами ответа. Но предсказать, состоится ли конкретное открытие вообще, оказалось практически непосильной задачей. Точность держалась в диапазоне 45–52%, то есть на уровне случайного угадывания. Сроки все модели называли с заметным опозданием. Медианная ошибка GPT-5.4 составила 14 месяцев, Claude Sonnet 4.5 - 17 месяцев. Неожиданно лучший результат показала LLaMA 3.3 - всего 4 месяца погрешности. В задачах на проектирование решения даже лидер (GPT-5.4 с оценкой 5,04 из 10) не угадывал реально применённый технический подход. Примечательная деталь: качество прогноза почти не зависело от того, относится ли событие к периоду до или после «среза знаний» модели. Это говорит о том, что проблема не просто в нехватке данных. Дополнительный контекст улучшал результаты, но не устранял разрыв. Кроме того, все модели систематически переоценивали уверенность в собственных ответах. Вывод Языковые модели пока остаются ретроспективными толкователями, они хорошо объясняют уже известное, но плохо справляются с подлинным предвидением. Для амбициозного образа «автономного учёного на базе ИИ», который активно обсуждается в индустрии, это серьёзное ограничение. 📄 Полный текст исследования: https://arxiv.org/abs/2605.22681 ✅ Мы в Вконтакте 💬 МАХ 👉 Канал 🌐 Сайт 🤖 Бот

