17 скраперов ИИ честно «собирали» данные. Оказалось, что они просто носили в коде то, ч... — 4 октября 2026 г. в 13:33:51.071
17 скраперов ИИ честно «собирали» данные. Оказалось, что они просто носили в коде то, что модель вспомнила из головы. Автор OenoBench собирал бенчмарк знаний о вине: 35 скраперов, 38 тысяч фактов, потом 3 266 вопросов для 16 моделей. Когда он наконец проверил, что именно скачивает каждый скрапер, 17 из них не сделали ни одного настоящего запроса. Внутри лежали красивые захардкоженные списки, сгенерированные моделью и подписанные как будто они пришли из реестров. Из базы пришлось выкинуть 12 563 «факта». И вот это уже не история про вино. Если агент написал парсер для RAG, отчёта или исследования, ревью диффа не доказывает происхождение данных. Словарь из памяти LLM выглядит ровно так же прилично, как результат HTTP-запроса. Нужны отдельные проверки: ссылка на первоисточник у каждой записи, лог реального скачивания и тест, который смотрит на полученные данные, а не на красивый код. В разборе эксперимента есть и вторая неприятная находка: несколько моделей‑судей могут дружно подтвердить один и тот же кривой ответ. Поэтому «три агента согласились» — это ещё не истина, а повод проверить, не получили ли они один и тот же брак. Сам датасет и код открыты. Можно не только спорить о бенчмарках, но и посмотреть, откуда у них ноги растут.