📈 Вирусный Kronos и файн-тюнинг LLM под биржу: почему больше данных сломали предсказания — 21 сентября 2026 г. в 21:15:30.657
📈 Вирусный Kronos и файн-тюнинг LLM под биржу: почему больше данных сломали предсказания Модель Kronos наделала много шума: публикация на AAAI, тысячи звезд на GitHub и громкие обещания прогнозирования рынков. Архитектурно это классический авторегрессионный трансформер, но вместо слов его токенизатор превращает в токены свечи (OHLCV), предобученные на 12+ млрд свечей с мировых бирж. Дата-сайентист Сумит Пандей провел независимый стресс-тест Kronos на акциях SPY и Bitcoin, дообучил модель на собственных данных и вскрыл фундаментальные архитектурные грабли таймсериес-LLM. 📉 Тест из коробки: проверка гипотезой Random Walk Главная ошибка оценки финансовых моделей — сравнение прогноза с нулем, а не с наивным базовым уровнем (Random Walk: «завтра цена будет такой же, как сегодня»). ▫️ Направление тренда (Direction Accuracy): Kronos на BTC показал результат 50 из 100 — эквивалент подбрасывания монетки. ▫️ Иллюзия уверенности: Разброс сгенерированных траекторий (сэмплирование) должен был покрывать реальный исход в 80% случаев. На практике реальная цена попадала в доверительный интервал всего в 21% случаев. Модель ошибалась согласованно и сверхуверенно. 🧨 Парадокс файн-тюнинга: больше данных — хуже результат Интуиция инженера подсказывает: если дообучить базовую модель на локальных свечах за 3 года (228 000 баров), точность должна вырасти. Результат оказался обратным: дообученная модель показала результаты заметно хуже оригинальной. В чем причина сбоя? 1. Модель выучила волатильность: В базе Kronos занижал амплитуду (предсказывал среднее движение ~0.27% в день при реальном ~0.8%). После файн-тюнинга он стал идеально угадывать размах колебаний (0.76%). 2. Направление осталось случайным: Точность угадывания «вверх/вниз» осталась на уровне 50%. 3. Финансовый коллапс: Модель научилась делать крупные ставки в неверную сторону. Базовый Kronos казался «лучше» лишь потому, что робко предсказывал околонулевые движения, маскируясь под Random Walk. 🛠 Инженерные выводы для AI-Архитектора • Data Leakage в скользящих окнах: Нельзя наивно конкатенировать историю разных тикеров в один непрерывный батч. Окно контекста не должно пересекать границу разных инструментов. • Разделяйте таргеты: Авторегрессионный трансформер отлично моделирует плотность распределения и волатильность, но не извлекает причинно-следственные связи для предсказания направления. Прогнозирование дисперсии и тренда нужно декомпозировать на разные модули. • Опасность метрик MSE/RMSE: Ошибка в предсказании амплитуды на спокойном рынке может быть низкой, но в реальном пайплайне генерировать катастрофический убыток. 🔗 Материалы и бенчмарки Time-Series Foundation Models: • 📦 Модели временных рядов: Chronos: Time Series Foundation Models (Amazon Science — вероятностное прогнозирование на базе языковых моделей. • 📊 Фреймворк бенчмаркинга: Time-Series-Library на GitHub — открытая библиотека для валидации трансформеров на временных рядах. • 🧠 Материалы исследований: AAAI Conference Proceedings — публикации по фундаментальным моделям в прогнозировании. #AIArchitecture #TimeSeries #MachineLearning #DeepLearning #FinanceAI #Quant #LLM #Forecasting