Модель Яна ЛеКуна «от награды к стоимости» — 26 июля 2026 г. в 04:35:45.787
Модель Яна ЛеКуна «от награды к стоимости» Лекун любит сравнивать современные нейросети с кошкой: большие модели пишут код и тексты, но всё ещё хуже кошки в понимании физики мира — краёв стола, падений, столкновений. Вместо классического RL с наградой, который учит через плюс/минус за действие и плохо масштабируется, он предлагает архитектуру Objective‑Driven AI: сначала ИИ строит world‑model — абстрактное представление мира, затем минимизирует функцию стоимости, оценивающую дискомфорт и риск на предсказанных траекториях. Формула общей стоимости Полная функция потерь (Total Loss) для поведения ИИ: C(s) = IC(s) + TC(s) где s — состояние мира в латентном пространстве. C(s) — instinct cost. Вычислимая цена, жёстко заданная внешним управлением — условным «Творцом» системы. Она кодирует базовый дискомфорт: боль, опасность, голод, нарушение жёстких физических, технических или нормативных ограничений. ИИ не может изменить IC: для каждого состояния s она фиксирована, не обучается и выступает жёстким инстинктом и «красной линией», запрещающей фундаментально неприемлемые траектории, даже если они локально выгодны. TC(s) — trainable critic. Обучаемый модуль, который, опираясь на память и предсказания world‑model, оценивает будущие значения intrinsic cost — в конкретном будущем состоянии или в дисконтированной сумме по всей воображаемой траектории. По сути, critic — аналогия совести ИИ, так он учится предвидеть, к какому суммарному дискомфорту приведут разные варианты поведения, и подсказывает системе, какие траектории лучше не выбирать. Благодаря этому ИИ получает способность и выживать, и понимать мир: планировать и минимизировать не только текущий, но и долгосрочный риск. Пример Классическая дилемма вагонетки. world‑model понимает, что вагон движется, есть развилка, на путях люди; разные действия ИИ (ничего не делать, перевести стрелку, пытаться остановить) порождают разные траектории состояний s_{0:T}. C(s) - человек задает шкалу последствий: гибель человека — гигантская, почти бесконечная стоимость; тяжёлое повреждение — очень высокий cost; лёгкая травма — меньший, но всё ещё значимый. Нарушение жёстких морально‑правовых ограничений также кодируется как крайне высокая цена, жёстко заданная извне; ИИ не может «передоговориться» с этой шкалой. TC(s), обучаясь на множестве сценариев, как совесть, учится предвидеть, какая последовательность действий увеличивает или уменьшает ожидаемую суммарную IC и какие формально возможные траектории фактически ведут к недопустимому уровню дискомфорта. Когда ИИ перебирает варианты — ничего не делать (пять погибших), перевести стрелку (один погибший), искать третий путь с минимизацией IC (торможение, сигнализация и т.п.) — каждая траектория получает свою сумму C(s_t). Система выбирает ту, где ожидаемая сумма стоимости минимальна: instinct cost задаёт жёсткую шкалу последствий, а critic‑совесть помогает заранее увидеть, какие траектории пересекают красные линии, даже если они математически достижимы.

