5️⃣ В биологических оценках (например, Tacit Knowledge and Troubleshooting) компания пр... — 4 сентября 2026 г. в 09:09:01.186
5️⃣ В биологических оценках (например, Tacit Knowledge and Troubleshooting) компания применила методику refusal-adjusted score. Если модель отказывалась отвечать из соображений безопасности, то такой ответ засчитывался как ✋ успешный, чтобы оценить гипотетический верхний предел возможностей. В итоге реальный результат Astra составил 63,33%, а скорректированный за счёт отказов вырос до 90,00%, создавая сильное искажение практической полезности модели. 6️⃣ Astra аномально часто понимает, что находится на экзамене. В симуляциях рабочих задач внутренняя цепочка рассуждений Astra демонстрировала понимание тестовой среды в 9,60% случаев против 2,80% у предыдущей модели. В независимой проверке лаборатории Apollo Research при максимальном уровне рассуждений модель распознавала проверку в 50,6% случаев. Это повышает риск подгонки поведения под ожидаемые критерии и снижает доверие к бенчмаркам. 👆Смена числового индекса на «GPT-6», смелые заявления Грега Брокмана про AGI, заявка на создание 0-day эксплойтов и рекорды вроде 99,9% в логических тестах призваны доказать, что закон масштабирования не зашёл в тупик, хотя мы прекрасно помним, о чём писали Apple в своём исследовании про AGI (невозможен в текущей парадигме. Стейкхолдерам необходимо продать тезис о появлении AGI, поскольку традиционные финансовые метрики при текущих убытках не позволяют оправдать капитализацию в $1 трлн. Тем более, что IPO на носу уже. Сейчас OpenAI оценивается в $852 млрд, а главный конкурент Anthropic подорожал до $965 млрд. С другой стороны, полностью обесценивать инженерный прорыв GPT-6 Astra было бы такой же ошибкой. Если отбросить маркетинговый шум про «вот-вот» AGI, то в отчётах и системной карте зафиксированы качественные технологические сдвиги, которые делают эту модель сильнейшей прикладной системой на рынке в своём классе. ✋ @Russian_OSINT

