Исследователи провели первый количественный бенчмарк автономных AI Scientist-систем. Пр... — 3 августа 2026 г. в 09:45:17.689
Исследователи провели первый количественный бенчмарк автономных AI Scientist-систем. Протокол включает автоматизированное рецензирование 60 статей (4 фреймворка: Sakana AI v1/v2, CycleResearcher, Data-to-Paper) и 15 эталонных работ от FARS по критериям оригинальности, строгости, ясности и значимости. Оценку проводили три модели: GPT-5.4, Gemini и Claude. Результаты показали, что статьи FARS значительно превосходят конкурентов: средние баллы 2.14–2.47 против 1.00–1.87. По оценкам Gemini и Claude показатели FARS более чем в 2 раза выше. Между Gemini и Claude выявлено сильное согласие (ρ = 0.907), что подтверждает надежность автоматической оценки. Однако GPT-5.4 демонстрирует слабую корреляцию (ρ ≈ 0.32), указывая на использование иных критериев. 🔹 Первый Нейронный