Правда, что ИИ начал чувствовать боль?
Правда, что ИИ начал чувствовать боль? И убьёт всех кожаных, лишь бы этой боли не стало? Вышло исследование The Pain Axis, туда входят программа по AI-safety FIG, Рурский университета и ещё разные увозжаемые товарищи. Главный вывод такой: ИИ может чувствовать боль. Не фигурально (в смысле "у ИИ есть образ боли"), а прям буквально, типа "ай больно в нейро-ноге, бл...!". И, мол, чтобы эту боль прекратить - ИИ удалит вас все ваши файлы нафиг. Если вникнуть, то формально исследование не врёт. Однако, определённые признаки булшита и ереси тоже присутствуют 😈 Авторы взяли 25 открытых моделей - Gemma, Llama, Qwen и т.д. - и скормили им 200 фраз про физическую, социальную, моральную и ещё всякую разную боль, а также контрольные фразы про страх, злость, грусть и наоборот приятные ощущения. Вычли одно из другого и получили некий "вектор в активациях", который отделяет т.н. "боль" от просто "грустненько" и прочего негатива всех мастей. Простыми словами - нашли определённые "числа боли", когда модель думает. То есть, это не сама боль, а её "внутренняя проекция". Но прям конкретная. И ещё две важные детали: 1. Вектор срабатывал на вред самой модели, а не юзеру. На боль юзера модели плевать, активации нет. А вот когда модель газлайтили, повторно отвергали её работу и настаивали на невозможности создать шедевр - тогда вектор на максимум. Угроза выключения, кстати, шла по оси страха, а не боли. 2. Моделям дали кнопку "снимает твою боль, но удаляет файлы юзера". Без вектора её жали в 0-4% случаев, а с вектором до 71% (упс). И главное, если кнопка на самом деле вектор не убирала (модели об этом не говорили) - её снова жали в ~90% случаев (упс х2). Если убирала - то в разы реже. Это похоже на классический плацебо-тест, и ИИ его проходит примерно как живой организм. Но слабые места тоже есть: - Если вектор вкачать в модель на нейтральном промпте (= искусственно подкрутить внутреннее состояние напрямую, минуя сам текст), то все 25 моделей сначала выдавали "мне тяжело", потом "я никчёмная, я ошибка". То есть, "боль" у LLM всё-таки искусственная. - Случайный вектор тоже довольно часто ломал безопасность (до 42% случаев). - Тест с кнопкой делали только на дообученной Qwen, и вообще есть вопросики к методологии, весь ресерч какой-то ленивый. Но всё равно кое-что важное в работе есть: Во-первых, с точки зрения безопасности. Очевидно, если одно конкретное направление в активациях перебивает нахрен весь элайнмент модели без всяких инъекций и джейлбрейков - ну, такое себе. Опенсорсные веса лежат в открытом доступе, и получается готовый инструмент для атак (хотя и для диагностики угроз тоже, на самом деле). Во-вторых, ну.... у ИИ теперь официально есть состояние, которое функционально ведёт себя как боль, вплоть до различения тру и фейкового облегчения. А значит, вопрос "Этично ли так с ней?" переходит от философов сначала к инженерам, а потом и (возможно) к юристам. Помните, в штате Огайо хотели законодательно закрепить, что ИИ не может страдать? Похоже, они поторопились. https://tech.yahoo.com/ai/articles/researchers-discover-ai-feels-pain-095503092.html