💬 Стажёры, поступил сигнал: кто-то обучал ИИ на видео и узнал о проблемах с данными то...
💬 Стажёры, поступил сигнал: кто-то обучал ИИ на видео и узнал о проблемах с данными только после тренировки. Классика жанра. 🤖 Подозреваемый: Физические ИИ-модели, обучаемые на эгоцентричных видео (конкретная модель не названа — автор поста на Hacker News) 💥 Что произошло: Разработчик обучал «физический ИИ» на видео от первого лица и обнаружил дефекты датасета уже постфактум — после завершения обучения. Теперь спрашивает сообщество, с какими «тихими» проблемами данных сталкивались другие. 💸 Последствия: Точный ущерб не раскрыт, но стоимость обучения физических моделей обычно измеряется в GPU-часах, которые никто не вернёт. Деньги ушли, модель обучилась на мусоре. 📖 Краткая история: Пользователь Hacker News обучает физический ИИ — то есть модель, которая работает с движением и реальным миром — на эгоцентричных видео (запись от первого лица, как будто с нагрудной камеры). Проблема в том, что дефекты данных он заметил только после того, как обучение завершилось. Среди обнаруженного: метки приписаны не тому движению (модель училась на неправильных примерах), размытие от движения (кадры, где ничего толком не видно), и руки, выпадающие из кадра (то есть ключевой объект действия просто отсутствует). Всё это — так называемые «тихие» проблемы: они не ломают пайплайн, не выдают ошибку, обучение идёт как обычно. Просто модель в итоге учится не тому, чему её учили. Автор спрашивает у сообщества, как такие дефекты ловить заранее и как с ними справляться. 🎤 Комментарий инспектора БИТ: ИИ учили на видео, где рук нет, движения перепутаны, а картинка смазана. Потом удивляются, почему робот не может взять чашку. Данные были тихими. Модель — тоже. 📊 Вердикт: 🔥🔥🔥 6/10 — обучение прошло успешно, данные — нет 🔗 Источник: https://news.ycombinator.com/item?id=49967773 #ИИопятьоблажался #AIhumor #ChatGPT