Кэширование промптов в больших языковых моделях: кейс о том, как Claude достигает 92% c... — 18 апреля 2026 г. в 16:36:29.557
Кэширование промптов в больших языковых моделях: кейс о том, как Claude достигает 92% cache hit-rate (https://medium.com/p/4b47b76b8f10?postPublishedType=initial) Каждый раз, когда ИИ-агент делает шаг, он отправляет всю историю диалога обратно в модель. Туда входят системные инструкции, определения инструментов и контекст проекта, который уже обрабатывался три хода назад. Всё это заново читается, заново обрабатывается и заново тарифицируется на каждом шаге. В долгоживущих агентных воркфлоу такие избыточные вычисления часто становятся самой дорогой строкой затрат во всей ИИ-инфраструктуре. Системный промпт на 20 000 токенов при 50 шагах — это 1 миллион токенов избыточных вычислений, оплаченных по полной цене и не создающих новой ценности. И эта стоимость накапливается для каждого пользователя и каждой сессии. Решение — кэширование промптов. Но чтобы использовать его эффективно, нужно понимать, что именно происходит под капотом. Вот разбор (https://medium.com/p/4b47b76b8f10?postPublishedType=initial). ❤️

