RAG | Нейросети | ИИ | AI | Агенты | Gemini 4 Argon | GPT-6.1 Sol | GPT-6 Astra | Claude Opus 5.5 | DeepSeek | Qwen 3.8
IT и технологии · 12 августа 2026 г.
RLVR учит модель не ошибаться. Но вместе с ошибками она перестаёт искать альтернативы.
RLVR учит модель не ошибаться. Но вместе с ошибками она перестаёт искать альтернативы. Прогнали четыре модели через BODHI-деревья до и после RL-тренировки. Семантическое разнообразие схлопнулось: модель выдаёт один путь вместо веера. Не догадка — замер через ΔCPE, подтверждён на Qwen3-8B и Gemma3-12B. RLVR даёт точность ценой вариативности. Для креативных задач — спорный инструмент.