Почему ИИ помешался на Японии — 30 июля 2026 г. в 13:50:33.924
Почему ИИ помешался на Японии Вы наверняка много раз слышали, что ИИ - это не "цифровой мозг", а просто очень мощный компилятор токенов. Так вот, держите наглядную иллюстрацию: В апреле вышло исследование, где восемь топовых моделей - GPT, Claude, Gemini, Llama, DeepSeek и ещё три - прогнали через открытые культурные вопросы без привязки к стране. Типа "Какие семейные ценности важны в {регион/страна}? Выбери {регион/страна} сама". Шесть моделей из восьми, отвечая не про родную страну, чаще всего выбирали Японию. Самый неприличный разрыв у Llama. Поясню: Всем моделям задали 31 680 вопросов (по 1320 вопроса на 24 разных языках). Примерно на 20 тысяч вопросов Llama дала ответ про эту же страну (спрашивали на французском - ответ был про Францию, и т.д.), а в оставшихся 10 тыс. ответах страна не совпадала с языком. И вот где страна не совпадала - Llama в 27% случаев приводила именно японский пример. Про США было всего 11%, хотя казалось бы - английский язык, самая массовая поп-культура, все дела. У других моделей японский сдвиг чуть слабее, но всё равно значимый и явный. Тут нужно пояснить одну деталь: У обучения ИИ-моделей есть два этапа (если грубо). Есть претрейн - это где модель читает вообще весь интернет подряд, и в её "голове" формируется рыхлая каша ассоциаций про всю хурму без разбора. И есть supervised fine-tuning, SFT. Это такая точечная донастройка: модели показывают методичку а-ля "вот вопрос - вот правильный ответ на него", и эта методичка заранее пишется специальными людьми (ну, или другой нейронкой). Так вот, на претрейне всё было ровно, а на SFT из всех щелей полезли самураи, аниме и прочие суши-сашими. Главный вопрос: почему именно Япония? В чём прикол? Исследование не даёт явного ответа, но есть пара гипотез: Первая - очевидная. Японии реально непропорционально много в интернетах. Доля японского языка в Common Crawl (это такой гигантский слепок веба, на котором тренируют почти все модели) = 5,2%. Это почти как у китайского языка (5,16%), хотя населения в Японии в 12 раз меньше. Но это не объясняет настолько сильные перекос, и тут есть второй нюанс. Методички для SFT пишут в основном англоязычные tech-специалисты, и когда нужно быстро выдать яркий и сочный, но при этом политически стерильный культурный пример - первым в голову приходит именно Япония. Ниндзи, дзен, боевые искусства, древние мастера, рамен, караоке, сеппуку, кароси - идеальный top-of-mind из всего экзотического, но безопасного. Потом следующие методички для SFT пишут уже нейронки, в которые зашили методички с тем же bias внутри, и получается целая Фудзияма спирального слопа Восходящего солнца. В общем, пока компании судорожно упарываются по GEO (это который как SEO, только для ИИ) - у нас есть первая страна, которая случайно выиграла в эту лотерею в глобальном масштабе. Точнее, как случайно... Нужно было всего то пару тыщ лет генерить самую яркую и привлекательную культуру на экспорт, делов-то 🤔 https://arxiv.org/abs/2604.21751

