данных до 1930 года — 29 апреля 2026 г. в 07:13:02.938
данных до 1930 года Алек Рэдфорд, автор GPT-1, GPT-2 и CLIP, совместно с Университетом Торонто обучил 13B-модель исключительно на текстах, опубликованных до 31 декабря 1930 года. В сет на 260 млрд токенов вошли: англоязычные книги, газеты, патенты и судебные архивы. Моделью-судьей выступила Sonnet 4.6. В обучающем корпусе нет кода, поэтому модель защищена от протекания бенчмарков. Тем не менее на HumanEval она пишет простые Python-скрипты. Авторы прогнали модель по архивным сводкам The New York Times: перплексия на материалах после 1930 года растёт, максимум - на текстах 1950–60-х. Летом команда планирует масштабировать датасет до 1 трлн токенов и выпустить ретро-модель, сопоставимую по возможностям с ChatGPT. https://talkie-lm.com/introducing-talkie

