Насколько точно современные большие языковые модели (LLM) решают узкоспециализированные... — 31 августа 2026 г. в 10:14:43.508
Насколько точно современные большие языковые модели (LLM) решают узкоспециализированные тестовые задания на русском языке по анестезиологии и реаниматологии по сравнению с командами врачей-ординаторов? Какая из семи протестированных моделей (GPT-4o, GPT-5, Alisa AI, DeepSeek V-3.2, GigaChat, Gemini 2.5 Flash, Qwen3-Max) показывает наилучший результат и как их результаты соотносятся с медианным и максимальным баллом участников конкурса «Профессионалы»? Насколько согласованы (воспроизводимы) ответы разных LLM между собой — то есть дают ли модели одинаковые ответы на одни и те же вопросы при повторных запросах и относительно друг друга? Насколько ответы LLM статистически отличаются друг от друга — есть ли значимые различия в точности между моделями-лидерами? Насколько структура ответов LLM совпадает с коллективным выбором большинства ординаторов — то есть повторяют ли модели наиболее вероятный «человеческий» вариант ответа? Могут ли LLM полностью заменить или дополнить оценку знаний ординаторов в системе медицинского образования и аккредитации, и какие у этого подхода ограничения? Ответы – по ссылке: https://doi.org/10.21320/1818-474X-2026-2-176-185 Климов А.А., Карелин А.В., Ляпустин С.Б., Рудницкий С.И., Толстова М.А., Шамонин А.Е., Субботин В.В. Использование больших языковых моделей для решения тестовых заданий по анестезиологии и реаниматологии: сравнительное исследование. Вестник интенсивной терапии им. А.И. Салтанова. 2026; 2:176–185. https://doi.org/10.21320/1818-474X-2026-2-176-185

