📢 В эфире майский хабродайджест! — 22 мая 2026 г. в 08:00:19.892
📢 В эфире майский хабродайджест! Собрали для вас свежие классные гайды. Сегодня тестируем агентов без иллюзий, заглядываем под капот токенизатора видео, создаем production-ready ASR и мультиагентный конвейер без хаоса. Всё для тех, кто строит надежные ИИ-системы и хочет разобраться в деталях оценки и оркестрации. ➡️ Как оценивать работу агентов Туториал Raft о подходах к оценке надежности AI-агентов в продакшене: метрики, фреймворки контроля и сценарии тестирования. Целевая аудитория — компании, которые решают, можно ли встраивать агента в реальный рабочий процесс и как его потом контролировать. ➡️ Театр одного агента: режиссура мультиагентной системы Разбираемся, почему «один большой агент» — это путь к галлюцинациям и хаосу, а мультиагентная постановка с жесткими ограничениями («не выдумывай файлы, используй только входные данные») дает воспроизводимость и масштабируемость. С шаблонами промптов и реальными примерами реплик между агентами. ➡️ Evals: мегастатья для фаундера, чей AI-агент работает как попало Подробное руководство по построению evals для AI-агентов: как определить, что значит «хорошо», как сочетать code-based assertions с LLM-as-Judge и где начинается harness engineering. Опирается на материалы Hamel Husain, Eugene Yan, гайды Anthropic и реальный опыт автора с AI-ассистентом для встреч. ➡️ Мультиагентный хаос: как мы собрали команду AI-сотрудников, а получили бесконечное совещание ни о чем Команда отказывается от классических мультиагентных фреймворков (AutoGen, CrewAI и подобных) и собирает оркестрацию агентов как конечный автомат с явными узлами Planner и Workers на Python. Описано, как через ограничение контекста и явные условия перехода превратить хаотичные дебаты агентов в детерминированный конвейер. ➡️ Обновленный токенизатор видео K-VAE 2.0 от Сбера Очередной шаг в развитии генеративного ИИ — улучшенный токенизатор видео. Модель в открытом доступе: она лучше конкурентов восстанавливает детали и позволяет быстрее обучать генеративные модели за счет продуманного латентного пространства. ➡️ От MVP на Whisper до собственной ASR: как мы построили платформу субтитров для RUTUBE Эволюция сервиса автогенерации субтитров RUTUBE от MVP на Whisper к собственной микросервисной ASR-платформе. Разобраны причины отказа от Whisper, перестройка архитектуры под пользовательский контент длиной до 24 часов и выход на производительность около 1200 видео в час на один сервис. #tech_inside

