Как сократить расход токенов на 30–60% — 13 августа 2026 г. в 13:32:55.533
Как сократить расход токенов на 30–60% У AI-агентов быстро растёт контекст: история диалогов, результаты поиска, логи инструментов и промежуточные версии. Это не только удорожает работу — перегруженный контекст ухудшает качество выполнения длинных задач. А это влечёт за собой невероятный рост расходов на ИИ в компаниях. И все ищут способы как оптимизировать затраты. Tencent открыла исходный код TencentDB Agent Memory — системы памяти для агентов под MIT-лицензией. Она убирает тяжёлые логи из активного контекста, оставляя агенту компактную карту задачи: что сделано, что выяснено и где при необходимости найти исходные данные. ✅ Заявленные эффекты Tencent в длинных сессиях с OpenClaw: WideSearch: на 61,38% меньше токенов, а успешность задач выросла с 33% до 50%. SWE-bench: на 33,09% меньше токенов, успешность — с 58,4% до 64,2%. AA-LCR: на 30,98% меньше токенов. PersonaMem: понимание пользовательских предпочтений — с 48% до 76%. Идея проста: не отправлять модели весь архив при каждом шаге. В контексте остаётся короткая структурированная карта, а подробности извлекаются только по запросу. Это может одновременно снизить стоимость, уменьшить риск «забывания» цели и повысить устойчивость агента на многошаговых задачах.github Оговорка: это результаты тестов самой Tencent, а не гарантированная экономия для любого стека. Считать нужно полную стоимость — включая LLM/embeddings для сжатия, хранение и извлечение. Но сам паттерн управления контекстом выглядит практичным и особенно полезен для агентов, которые работают долго или вызывают много инструментов. Документация Tencent Cloud Качнуть бесплатно можно отсюда GitHub ❗️Зеркалюсь здесь Max | VK | TG

