CVRR (DMIS-Lab — KAIST) — 14 сентября 2026 г. в 11:14:44.409
CVRR (DMIS-Lab — KAIST) Принудительное визуальное мышление: модель не может ответить на вопрос по картинке, не подумав скрытым состоянием, отделенным от прямого доступа к визуальным данным Обычная #VLM может жульничать — ответ приходит прямым путем из визуальных токенов. CVRR перекрывает этот обход: ответный декодер видит только рекуррентное скрытое состояние, а не оригинальные визуальные ряды. Если модель ответила — значит она действительно рассуждала через латент. - Доступны чекпоинты на Qwen2.5-VL-7B, Qwen3-VL-8B, Gemma3-4B/12B, Gemma4-12B, InternVL3-9B - Apache 2.0 Гитхаб HF

