Топ ASR на Hugging Face может «зубрить» бенчмарки вместо того, чтобы слышать речь — 21 августа 2026 г. в 14:31:53.063
Топ ASR на Hugging Face может «зубрить» бенчмарки вместо того, чтобы слышать речь Выбираешь ASR по строке в лидерборде Hugging Face — перед продом прогони пару своих записей, не клипы из теста. На одном и том же файле из VoxPopuli шесть из одиннадцати топ-моделей выкидывают слышимое «Thank you», потому что в эталоне его уже нет. На свежей записи того же спикера большинство снова транскрибирует фразу целиком — значит, подстраиваются под паттерны бенчмарка, а не под звук. Hume AI показала три пробы такой подгонки: спорные эталоны, вырезанные числа, орфография под конкретный датасет. Чем ниже word error rate на публичном тесте, тем чаще модель повторяет таблицу вместо аудио. Если у тебя в пайплайне распознавание голоса — одной строки WER в таблице мало.

