Модель может быть быстрой, а сервис всё равно выглядит как уставший банкомат. Иногда ег... — 2 октября 2026 г. в 17:04:53.924
Модель может быть быстрой, а сервис всё равно выглядит как уставший банкомат. Иногда его убивает не ИИ, а очередь перед ИИ. Alibaba разобрала именно такой случай в Model Studio: поток разделили по связке «пользователь + модель», а всплески начали гасить лёгкими очередями RocketMQ LiteTopic. Идея простая: один шумный клиент не должен занять весь дефицитный ресурс и превратить остальных в зрителей загрузочного кружка. Команда Alibaba пишет, что доля запросов, упиравшихся в троттлинг, после переделки упала в 10 раз. Это их метрика, не независимый замер, но сам разбор полезнее очередного «у нас теперь агент»: архитектура шлюза и живой пример LiteTopic лежат в открытом доступе.