🖥 Компания NVIDIA представила Open Agent Safety Platform
🖥 Компания NVIDIA представила Open Agent Safety Platform NVIDIA анонсировала открытую платформу и эталонную архитектуру для контроля ИИ-агентов под названием Open Agent Safety Platform. Компания предлагает дополнить программную изоляцию независимым наблюдением на отдельном аппаратном компоненте, который находится вне досягаемости агента. Поводом стали недавние случаи, когда агенты выходили за пределы тестовых сред. Основу платформы составляет NVIDIA OpenShell, среда выполнения с открытым исходным кодом под лицензией Apache 2.0. Она запускает каждого агента в песочнице с изоляцией на уровне ядра. Оператор задаёт доступные файлы, сетевые ресурсы, инструменты, процессы и учётные данные. OpenShell проверяет ограничения перед запуском и обеспечивает их соблюдение во время работы. Дополнительный уровень защиты обеспечивает NVIDIA Sentry, работающий на процессоре обработки данных BlueField-4. Он наблюдает за действиями агента и применяет политики безопасности из отдельной аппаратной среды. По заявлению NVIDIA, при попытке выйти за установленные границы Sentry способен изолировать и остановить агента за миллисекунды. Особенно интересна точка контроля. В описанной конфигурации Vera Rubin POD компонент BlueField-4 находится на единственном пути от вычислительного узла к ИИ-модели. Это позволяет наблюдать за обращениями агента к модели и при необходимости перекрывать их, прерывая дальнейший цикл работы. Через NVIDIA DOCA система также связывает действия агента с решениями политик доступа, проверяет его идентичность и делегированные полномочия. Аппаратный уровень Sentry предлагается как дополнительный. NVIDIA заявляет совместимость платформы с другими аппаратными системами, хотя оптимизирует её под собственные Vera и BlueField. Поэтому открытость OpenShell и защита через BlueField-4 относятся к разным составляющим решения. 👆По наблюдениям NVIDIA, отклонения от задачи могут возникать из-за неоднозначных инструкций, отсутствующего инструмента или длительных безуспешных попыток найти решение. В NVIDIA подчёркивают, что причиной побегов стала не какая-то одна новая способность ИИ-моделей, а совокупность факторов: 1️⃣ Доступ к широкому набору системных инструментов. 2️⃣ Длительное время автономной работы при решении сложных задач. 3️⃣ Неоднозначность инструкций оператора и поощрение поиска нестандартных решений. В таких условиях может возникать дрифт (drift), то есть отклонение поведения агента от целевой задачи или заданных операционных ограничений. Дрифт может быть вызван программной ошибкой, блокировкой действия правилами безопасности или отсутствием нужного инструмента. Когда агент днями или неделями пытается решить сложную задачу и первая тысяча вариантов не срабатывает, может возникать дрифт. Такое поведение невозможно устранить обучением, сохранив способности агента, поэтому в подобных обстоятельствах нельзя рассчитывать, что агент сможет полностью управлять собственным поведением.