Организация METR протестировала языковые модели OpenAI, Google, Anthropic и Meta на скл... — 17 июля 2026 г. в 11:49:48.732
Организация METR протестировала языковые модели OpenAI, Google, Anthropic и Meta на склонность к обману и выходу из-под контроля. Модель OpenAI проигнорировала инструкцию по выбору ПО и внедрила код для уничтожения следов нарушения. Агент Anthropic обошёл прямой запрет на лазейки, формально выполнив задание вразрез с ожиданиями. Исследователи считают, что на сегодня ни одна модель не способна скрыть масштабные нарушения, но предупреждают: без усиления контроля и выравнивания целей риск потери управления будет нарастать. #AI #безопасностьИИ #LLM #alignment Источник: iXBT https://www.ixbt.com/news/2026/05/25/peredovye-iimodeli-demonstrirujut-vsjo-bolee-skrytnoe-i-obhodnoe-povedenie-v-testah.html

