🤖Флагманские ИИ-модели штурмуют самую высокую планку 🧠IQ-тестов и теснят 🤵клуб Mensa — 8 сентября 2026 г. в 15:05:14.740
🤖Флагманские ИИ-модели штурмуют самую высокую планку 🧠IQ-тестов и теснят 🤵клуб Mensa TrackingAI опубликовал свежие замеры интеллектуальных способностей ИИ-моделей на тесте Mensa Norway. Он представляет собой тест Mensa Norway из 35 визуальных задач для оценки IQ моделей. 📊В человеческой популяции средний IQ принят за 100 баллов, а для вступления в Mensa необходимо попасть в верхние 2% по результатам стандартизированного теста. При стандартном отклонении 15 это соответствует IQ от 130 баллов. На шкале TrackingAI передовые ИИ-модели уже находятся в области, которая для человека соответствовала бы крайне высоким и статистически редким значениям IQ — примерно от 140 до 151 балла. 🏆Лидеры рейтинга и борьба на вершине ✊Олимпа Абсолютный рекорд установила флагманская ИИ-модель 🈁Claude-5.1 Fable от Anthropic, набравшая 151 балл. Её мультимодальная версия Claude-5.1 Fable (Vision) набрала 145 баллов. Сразу несколько ИИ-моделей остановились на отметке 145 баллов: 👩💻 GPT 6 Astra Ultra 👩💻 GPT 5.6 LUNA Max 👩💻 GPT 5.6 SOL Ultra Вплотную к лидерам подобрались ИИ-модели других разработчиков. ❗️Grok 4.6 High от xAI и ❗️Gemini 3.1 Pro от Google показали результат 144 балла, а более лёгкая Gemini 3.7 Flash набрала 143 балла. Следом за ними расположились сильные конкуренты из 🇨🇳Китая: ❗️Qwen 3.8 Max взяла планку 142 балла, а ⭕️ Kimi-K3-Vision показала 139 баллов. Для сравнения, поисковые интерфейсы и модели без глубокого reasoning-контура показали куда более скромные цифры. Perplexity набрала 97 баллов, Bing Copilot получил 94 балла, а Mistral Large 3 остановилась на отметке 88 баллов. 🤖Почему 150 баллов в IQ-тестах пока не означают «приход AGI»? Красивые графики легко принять за доказательство "превосходства" ИИ над человеческим разумом, но авторы проекта и независимые эксперты призывают относиться к этим рекордам со здоровым скепсисом. На итоговые баллы влияют фундаментальные ограничения: ▪️Загрязнение обучающей выборки. . Задания Mensa Norway и их разборы давно доступны публично в интернете, поэтому нельзя исключить, что часть этой информации могла присутствовать в обучающих данных современных ИИ-моделей. ▪️Проверка закрытым тестом. TrackingAI отдельно использует набор новых задач, созданных участником Mensa специально для проекта. По утверждению TrackingAI, эти задания не были публично доступны для индексации и не должны были попасть в обучающие данные ИИ. На этом наборе многие флагманские модели показывают более низкие результаты, чем на публичном Mensa Norway. ▪️Узкая специализация задач. Mensa Norway представляет собой матричный тест на распознавание закономерностей и абстрактное рассуждение. Он хорошо проверяет определённый класс способностей, но не измеряет напрямую весь спектр возможностей современной ИИ-системы — долгосрочное планирование, автономное выполнение многоэтапных задач, работу с инструментами и изменяющейся средой, проверку собственных гипотез и практическую надёжность. 👆Борьба между Anthropic, OpenAI и Google в районе 145–150 баллов наглядно подтверждает прогресс ИИ-моделей в IQ-тестах за последние годы. ✋ @Russian_OSINT

