Я слеп, но я вижу, что ты тратишь слишком много — 8 мая 2026 г. в 18:49:03.763
Я слеп, но я вижу, что ты тратишь слишком много ИИ, который тыкает кнопки в визуальном интерфейсе, может быть эффектным демо. Но в проде это часто превращается в дорогой театр одного актёра: модель смотрит на экран, угадывает структуру страницы, скроллит, кликает, ошибается, снова смотрит — и платит за каждое движение токенами. Свежий бенчмарк Reflex показал это на простой задаче в CRM. Claude Sonnet попросили найти клиента Смита с наибольшим числом заказов, принять его незавершённые отзывы и отметить последний заказ как доставленный. В одном случае агент работал через browser-use и скриншоты. В другом — через инструменты и API. Результат получился слегка унизительный для мечты об “уверенном пользователе ПК”. API-агент справился за восемь вызовов и около 20 секунд. Визуальный агент сначала не добрался до части отзывов, потому что они лежали ниже видимой области страницы, а после подробного 14-шагового промта всё-таки выполнил задачу, но потратил на работу около 17 минут. Итоговый разрыв достиг 45 раз по входным токенам: 12 против 500 тысяч у API и визуального агента соответственно. В общем, уверенный пользователь ПК из LLM за полтора года с релиза Operator так и не вышел. Хотя и от классического RPA мы тоже далеко ушли. В Reflex на этом фоне продвигают плагин, который автоматически превращает обработчики действий в веб-приложениях в API-команды с описанием в OpenAPI. Но если у компании уже есть нормальный бэкенд, похожую схему можно собрать и на open source: например, FastAPI-MCP или FastMCP превращают существующие FastAPI/OpenAPI-эндпоинты в MCP-инструменты для агента. 🔤🔤 Если у агента есть структурированный вход, он работает как автоматизация. В остальных случаях, мы получаем продукт от студии Лебедева — обещают долго, дорого, офигенно, а выходит дорого и офигенно долго. @anti_agi

