💡 Сэкономить на ИИ 50% — не меняя модель?
💡 Сэкономить на ИИ 50% — не меняя модель? Вчера спорил с коллегой, куда утекает бюджет на LLM. Он винил модель, я — обвязку. И тут, как по заказу, TechCrunch пишет: Writer выпустил флагман Palmyra X6 — по сути дообученная открытая GLM-5.2 от Z.ai. А фишка не в самой модели, а в том, что компания перетрясла свой «харнесс» — всю инфраструктуру вокруг агентов. Смотрите, что интересно. У них исследование: правки в обвязке давали в среднем минус 40% затрат, и это работало надёжнее, чем выбор другой модели. Потому что харнесс тянется через каждую модель, которую ты гоняешь — сегодня одну, завтра другую. Writer обещает клиентам до 50% экономии на простых задачах. Меня как сисадмина это цепляет: мы привыкли менять модель ради цены, а выигрыш часто лежит в промптах, кэшировании и том, как агенты жуют токены. Прежде чем платить за новую LLM — посмотри, что вокруг неё. А вы на чём экономите — на модели или на обвязке? 👇 #ИИ #LLM #инференс