Детальные клинические рассуждения остаются пока недоступны даже для самых продвинутых б... — 7 мая 2026 г. в 07:50:09.661
Детальные клинические рассуждения остаются пока недоступны даже для самых продвинутых больших языковых моделей (LLM). К такому выводу пришла группы исследователей, которая в течение 2025 года протестировала 21 готовую модель LLM на 29 клинических примерах. Использованные модели считались «передовыми» на момент проведения исследования. В их число вошли последние версии ChatGPT-5 (от OpenAI), Claude 4.5 Opus (Anthropic), Gemini 3.0 Flash и Pro (Google) и Grok 4 (xAI). 🔹 Для оценки качества ответов использовался «Пропорциональный индекс медицинской оценки для LLM» (PrIME-LLM), включающий 5 областей клинического мышления: дифференциальную диагностику, диагностическое тестирование, постановку окончательного диагноза, назначение лечения и клиническое рассуждение. 🔹 Результаты PrIME-LLM варьировались от 0,64 (Gemini 1.5 Flash) до 0,78 (Grok 4), при этом модели, оптимизированные для логического мышления, превосходили модели, не использующие логическое мышление, а модели GPT показали наивысшие общие результаты. 🔹 Дифференциальная диагностика была менее точной, чем диагностическое тестирование, в то время как окончательный диагноз, лечение и прочие рассуждения были более точными. 🔹 Частота ошибок превышала 0,80 для дифференциальной диагностики во всех моделях, но была менее 0,40 для окончательного диагноза. 🔹 Большинство моделей показали рост точности ответов в мультимодальном режиме работы (когда дополнительно к текстовым данным подгружались медицинские изображения). Анализируя полученные результаты, ученые пришли к выводу, что существующие передовые LLM-модели далеко не бесполезны для врачей. На самом деле, они демонстрируют впечатляющую точность при постановке окончательных диагнозов. Однако имеется проблема в том, что они плохо подбирают возможные диагнозы в «размытых» случаях. По мнению авторов, риск использования врачами существующих LLM заключается не столько в том, что LLM иногда ошибаются, а в том, что их рассуждения становятся ненадежными именно там, где неопределенность и нюансы имеют наибольшее значение для правильного принятия врачебных решений. Результаты исследования были опубликованы в статье «Large Language Model Performance and Clinical Reasoning Tasks» в журнале JAMA Network Open, ссылка: https://jamanetwork.com/journals/jamanetworkopen/fullarticle/2847679

