🌟 TencentHY открыла фреймворк для RL-дообучения мультимодальных моделей — 11 июня 2026 г. в 04:00:01.866
🌟 TencentHY открыла фреймворк для RL-дообучения мультимодальных моделей TencentHY представила новый фреймворк UniRL, адаптированный для RL-дообучения мультимодальных моделей. Основная концепция фреймворка заключается в универсальном цикле, включающем генерирование примеров, оценку, подсчет преимуществ и обновление политики. UniRL обеспечивает поддержку множества модальностей, включая text2image и video, что позволяет расширить функционал по сравнению с традиционными RL-стеками, заточенными под одну модальность. Проект сопровождается двумя новыми авторскими алгоритмами, такими как Flow-DPPO, направленный на улучшение взаимодействия с диффузионными моделями, и DRPO для текстовых LLM. Оба алгоритма показали лучшие результаты в сравнении с базовыми методами, такими как Flow-GRPO и GRPO-Guard, итогом чего стало повышение качества обучения и устойчивости моделей. UniRL уже поддерживает ряд известных моделей, таких как Stable Diffusion 3 и Qwen-VL, а команда планирует дальнейшее расширение функционала и поддержку новых алгоритмов.

