OpenAI выпустила бенчмарк для оценки способности ИИ-агентов взламывать смарт-контракты

Компания OpenAI совместно с Paradigm представила EVMbench — бенчмарк для оценки способности ИИ-агентов выявлять, исправлять и эксплуатировать бреши в смарт-контрактах.

ЭТО ИНТЕРЕСНО

Google выпустила ИИ-модель для генерации музыки Lyria 3

19.02.2026

Вайб-кодинг через Claude Opus привел к взлому DeFi-проекта Moonwell

19.02.2026

Инструмент основан на 120 отобранных уязвимостях из 40 аудитов. Большинство примеров взяты из открытых платформ по анализу кода. Также он включает несколько сценариев атак из проверки безопасности блокчейна Tempo — специализированной сети первого уровня, разработанной Stripe и Paradigm для высокопроизводительных и недорогих платежей в стейблкоинах.

Интеграция с Tempo позволила добавить в бенчмарк платежные смарт-контракты — сегмент, где ожидается активное применение «стабильных монет» и ИИ-агентов.

«Смарт-контракты защищают криптоактивы на сумму более $100 млрд. По мере того, как ИИ-агенты совершенствуются в чтении, написании и исполнении кода, становится все важнее измерять их возможности в реальных экономических условиях и поощрять использование искусственного интеллекта в защитных целях — для аудита и укрепления уже развернутых протоколов», — говорится в анонсе.

Для создания тестовой среды OpenAI адаптировала существующие эксплойты и скрипты, предварительно убедившись в их практической применимости.

EVMbench оценивает три режима возможностей:

Detect — обнаружение уязвимостей;
Patch — устранение проблем;
Exploit — использование для кражи средств.

Результативность ИИ-моделей

OpenAI протестировала передовые модели во всех трех режимах. В категории Exploit модель GPT-5.3-Codex достигла 72,2%, GPT-5 — 31,9%. При этом показатели обнаружения и исправления уязвимостей оказались скромнее — многие проблемы по-прежнему сложно находить и устранять.

В Detect ИИ-агенты иногда останавливаются после нахождения одной уязвимости вместо проведения полного аудита. В режиме Patch им пока сложно закрывать неочевидные проблемы так, чтобы сохранить полную функциональность контракта.

«EVMbench не отражает всей сложности реальной безопасности смарт-контрактов. Хотя они реалистичны и критичны, многие протоколы проходят более строгий аудит и могут быть сложнее для эксплуатации», — подчеркнули в OpenAI.

Напомним, в ноябре 2025 года Microsoft представила среду для тестирования ИИ-агентов и выявила уязвимости, присущие современным цифровым помощникам.

OpenAI выпустила бенчмарк для оценки способности ИИ-агентов взламывать смарт-контракты

Google выпустила ИИ-модель для генерации музыки Lyria 3

Вайб-кодинг через Claude Opus привел к взлому DeFi-проекта Moonwell

Читайте так-же

Google выпустила ИИ-модель для генерации музыки Lyria 3

Вайб-кодинг через Claude Opus привел к взлому DeFi-проекта Moonwell

Anthropic выпустила Claude Sonnet 4.6 с контекстным окном на миллион токенов

У страха глаза великИИ

СМИ узнали о планах Apple выпустить ИИ-кулон и наушники с камерами

ТОП НОВОСТИ

Samsung грозится победить инсайдерские утечки. Снова

Создатель DayZ призвал нормализовать переносы игр, а разработчиков выходить на честный диалог с сообществом

Ученые официально признали новый вид психического расстройства: страх, что вас заменит ИИ

OpenAI выпустила бенчмарк для оценки способности ИИ-агентов взламывать смарт-контракты

В League of Legends может появиться командный голосовой чат – спустя 17 лет после релиза игры

ПОПУЛЯРНОЕ

Эксперты раскритиковали инициативу с запретом современных протоколов шифрования — это может угрожать стабильности Рунета

Electronic Arts привезет на E3 2017 новые Star Wars: Battlefront и Need for Speed

Hasbro опровергла слухи об отмене игры про Снейк Айза из GI Joe

Снимайте: исследователи ToxFREE обнаружили опасные вещества в 64-х моделях наушников, они якобы вызывают рак

Крис Хемсворт не прощается с Тором – актер намекнул на несколько появлений после «Доктор Дум» и уникальную эволюцию персонажа