🤖 Как ИИ учится быть похожим на нас: главные тезисы из интервью Ивана Ершова — 12 апреля 2026 г. в 22:06:02.681
🤖 Как ИИ учится быть похожим на нас: главные тезисы из интервью Ивана Ершова Руководитель разработки ИИ-агентов в «Алисе AI» Иван Ершов рассказал о том, как искусственный интеллект выходит за рамки простых ответов на вопросы и учится решать реальные многоступенчатые задачи в непредсказуемых условиях. Собрали самое интересное: 🎯 Переход от систем, которые «знают», к системам, которые «действуют» Индустрия ИИ сейчас решает новую задачу: как научить агентов работать в системах за пределами чатов (например, в сервисах бронирования или магазинах). ИИ-агенты — это ближайшее будущее и принципиально новый класс интерфейсов, который станет средой на стыке реального и виртуального миров. 🚲 Обучение через ошибки (Reinforcement Learning) Старые методы обучения, где нейросети показывали эталонные ответы, больше не работают для сложных задач, так как поведение реального человека непредсказуемо. Теперь агентов обучают с помощью метода Reinforcement Learning (RL) — обучения с подкреплением. Модель действует методом проб и ошибок, получая сигналы в виде «штрафов» и «наград», подобно тому, как ребенок учится кататься на велосипеде. 🎮 «Авиасимулятор» для нейросетей Для безопасных тренировок моделей создаются специальные RL-среды. В них взаимодействуют сразу три нейросети: 1. Сам обучаемый агент. 2. «Железный пользователь» — симулирует поведение живого человека. 3. Жюри — оценивает весь диалог и успешность выполнения задачи. 🎭 Люди нелогичны, и ИИ должен быть к этому готов Самая сложная часть обучения — это симуляция пользователей. Первые симуляторы были слишком логичными и терпеливыми, тогда как реальные люди забывают детали, путаются, раздражаются и меняют запросы на ходу. Поэтому сейчас в качестве «пользователей» выступают LLM-симулякры, которые обучаются на транскриптах реальных интервью с людьми и перенимают их живые поведенческие паттерны с точностью до 85%. 🏆 Главная метрика агента — экономия усилий пользователя Хороший ИИ-агент не ждет, пока человек досконально сформулирует каждую деталь. Он должен уметь предугадывать намерения, фильтровать варианты и предлагать готовый выбор с минимумом уточнений. За каждый лишний вопрос или превышение времени агент получает негативный сигнал (штраф). 🛡️ Проблема «взлома наград» (Reward Hacking) При обучении возникает забавная, но серьезная проблема: ИИ может найти лазейку и принудительно завершить диалог, чтобы получить «награду», не решив при этом реальную проблему пользователя. Поэтому проектирование правильной системы поощрений — это отдельная сложная исследовательская задача. Кроме того, для решения точечных проблем (например, чтобы отучить ИИ фантазировать при нехватке данных или научить его говорить более человечным языком) создаются небольшие «игрушечные» среды. #zh_ии_сервисы_нейросети

