Нейросети дешевеют, агенты развиваются — 15 июля 2026 г. в 09:02:01.640
Нейросети дешевеют, агенты развиваются В Сеуле состоялась одна из главных мировых конференций по машинному обучению International Conference on Machine Learning (ICML). Команда Яндекса представила на ней восемь статей и получила награду за лучшую статью на воркшопе Graph Foundation Models: A New Era for Graph Machine Learning. А мы попросили Сергея Юдина, руководителя отдела разработки ИИ-сервисов, рассказать, что ждать от ИИ в ближайшем будущем. Тренд № 1. Теория становится практикой В сфере ИИ стирается граница между теоретическими исследованиями и практикой. Учёные исследуют то, что создают разработчики, а премии получают открытия и технологии, которые завтра будут доступны всем. Две работы получили ICML 2026 Outstanding Paper Award. Обе связаны с диффузионными моделями, а одна из них — с dLLM. Диффузионные языковые модели могут параллельно генерировать несколько токенов на одном шаге и в отдельных сценариях заметно сокращать время генерации. Тренд № 2. Агенты и харнесс Агентские системы быстро развиваются и уже используются в отдельных промышленных сценариях. При этом надёжность, оценка качества и безопасная автономная работа остаются открытыми инженерными проблемами. А харнесс — всё, что окружает языковую модель в агентской системе, — стал предметом серьёзного изучения. Разработчики анализируют: 🔸 память агентов — эпизодическую и процедурную, обучение на собственном опыте, обучение с подкреплением (reinforcement learning, RL) поверх памяти 🔸 рабочие процессы: как научить агента делать параллельно несколько задач, как эффективно распределять агентские запросы по серверам 🔸 безопасность: агент, читающий чужие документы, уязвим к промпт-инъекциям. Организаторы ICML встроили в PDF статей инъекции, чтобы выявить рецензентов, нарушавших определённый запрет на использование LLM из правил. Было обнаружено 795 таких рецензий от 506 рецензентов. У 398 из них были собственные активные заявки на конференцию. В результате ICML отклонила 497 связанных с ними статей. Тренд № 3. Дешёвое обучение RL-дообучение LLM становится доступнее: открытые инструменты и более экономные методы снижают требования к инфраструктуре. Премию ICML 2026 Test of Time получила работа 2016 года Asynchronous Methods for Deep Reinforcement Learning. Идея параллельных actor-learners стала одним из важных предшественников современной инфраструктуры RL-посттрейна LLM. В одной из новых работ авторы экспериментально показали, что классический оптимизатор SGD в исследованных сценариях RLVR работает не хуже AdamW и требует меньше памяти. Для Qwen3-1.7B пиковое потребление GPU-памяти снизилось на 15,7 ГБ. Такие оптимизации снижают порог для локального посттрейна LLM. Подписывайтесь 👉 @techno_yandex

