💻Бенчмарк SRE-Bench раскрыл истинный предел возможностей автономных ИИ-агентов в ревер... — 14 августа 2026 г. в 09:30:47.567
Вложенный файл
Откройте файл в новой вкладке
💻Бенчмарк SRE-Bench раскрыл истинный предел возможностей автономных ИИ-агентов в реверс-инжиниринге? В новом исследовании научная группа под руководством исследователей Джереми Спенса и Чжо Чжана при участии компании Vals AI представила SRE-Bench. Утверждается, что это первый бенчмарк для всесторонней оценки автономных ИИ-агентов в задачах обратной разработки бинарного кода, полностью защищённый от утечки обучающих данных. Авторы обосновали необходимость новой тестовой среды тем, что около 46,5% эксплуатируемых в реальных кибератаках уязвимостей и свыше 48% уязвимостей нулевого дня приходятся на закрытое коммерческое ПО и прошивки, доступные специалистам исключительно в скомпилированном виде. Для устранения проблемы распознавания кода по памяти авторы потратили более 5 000 экспертных часов на создание с нуля 19 оригинальных программ общим объёмом свыше 320 000 строк кода (в среднем 16 915,8 строк на проект) на языках C, C++, Rust и Go в пяти ключевых доменах, включая сетевые протоколы, файловые форматы, прошивки микроконтроллеров и анализ вредоносного ПО. Базу дополнил собственный комплекс защиты из 44 передовых примитивов обфускации и антианализа объёмом 27 000 строк кода, что позволило сформировать 262 бинарных инстанса и 1 572 строго верифицируемые задачи. 📊Тестирование пяти ведущих систем (GPT-5.6-sol, Claude-Opus-5, GPT-5.5, Grok-4.5 и GLM-5.2) в стандартизированной среде с инструментами Ghidra, GDB и angr обошлось в $31 400 и 1 812 часов работы изолированных контейнеров, продемонстрировав неготовность автономных агентов к полноценному бинарному анализу. Наиболее результативная ИИ-модель GPT-5.6-sol набрала в среднем 61,4% баллов и смогла полностью решить только 31,5% предоставленных инстансов, тогда как Claude-Opus-5 справилась лишь с 12,5% инстансов, а GLM-5.2 не смогла решить ни одного бинарного инстанса со средним результатом 3,4%. Применение авторского набора защитных механизмов, построенного на принципах ленивой постраничной расшифровки и виртуализации логики загрузчика, снизило показатели лидера почти в два раза и свело к околонулевым значениям результативность остальных участников. Если для эксперта-человека классическими барьерами остаются оптимизация компилятора и статическая линковка библиотек, то для ИИ-моделей эти факторы практически не снизили итоговую оценку. При этом удаление отладочных символов привело к падению показателей GPT-5.5 более чем в два раза (с 2,53 до 1,14 балла), что подтверждает критическую зависимость современных языковых моделей от лексических текстовых якорей в декомпилированном листинге, а не от способности логически осмысливать цепочки машинных инструкций. Контрольный эксперимент с модификацией открытого архиватора gzip доказал, что поверхностно изменённый публичный код решается агентами за считаные минуты при затратах всего в $2 за счёт извлечения архитектуры из обучающей выборки, тогда как закрытый проект аналогичной сложности потребовал свыше $31 на запуск и вызвал глубокие системные затруднения. Исследование наглядно показало, что успехи ИИ-агентов в поиске уязвимостей на уровне открытого исходного кода не транслируются в бинарный реверс-инжиниринг, а SRE-Bench можно считать надёжным эталоном для измерения реального прогресса автономных ИИ-систем. ✋ @Russian_OSINT

