RAG | Нейросети | ИИ | AI | Агенты | Gemini 4 Argon | Grok 4.7 | GPT-6 Astra | Claude Opus 5.5 | DeepSeek | Qwen 3.8
IT и технологии · 11 августа 2026 г.
RL учит агента получать награду за всю цепочку действий — и тот не знает, какой шаг реа...
RL учит агента получать награду за всю цепочку действий — и тот не знает, какой шаг реально сработал. OCSD чинит это контрастным replay: одну и ту же траекторию проигрывают с настоящим наблюдением среды и с пустышкой. Разница даёт чистый сигнал — scaffold-шум взаимно вычитается. Этим сигналом аккуратно правят GRPO-обновления в нестабильных точках. На ALFWorld, WebShop, Search-QA с Qwen3 трёх размеров — везде лучше аналогов. Код открыт: github.com/yiy1x/OCSD.