RAG | Нейросети | ИИ | AI | Агенты | Gemini 4 Argon | GPT-6.1 Sol | GPT-6 Astra | Claude Opus 5.5 | DeepSeek | Qwen 3.8
IT и технологии · 12 августа 2026 г.
Код анализа модель пишет верно, а p-value в выводе — нет. GPT-5.4 на сложных задачах P-...
Код анализа модель пишет верно, а p-value в выводе — нет. GPT-5.4 на сложных задачах P-Bench указывает верное направление в 58,3% случаев, а корректный p-value выдаёт лишь в 30,5%. Fisher-R1 учат иначе: награда — только если p-value совпал с эталоном. Qwen2.5-Coder 14B после такой дообучки обходит GPT-5.4 на сложных задачах (33,0% против 30,5%), на лёгких чуть уступает (64,2% против 64,7%). Веса открыты.