← Все репозитории

Новый проект

Nexis-AI/NexBench

Воспроизводимо оценивает автономных Web3-агентов на 214 ончейн-задачах с детерминированными средами, программными проверками и защитой результатов от подделки.

Открыть GitHub
Stars
99
Forks
52
Язык
TypeScript
Статус
В канале 1 янв. 1 г.

AI-разбор

NEXBENCH — TypeScript-фреймворк для воспроизводимой оценки автономных агентов, выполняющих действия в Web3 и DeFi. Набор включает 214 задач в 8 категориях: исполнение транзакций, обмены, мосты, DeFi-операции, исследование рынка, обнаружение угроз, анализ портфелей и управление казначейством. Задачи запускаются пять раз в детерминированных форках Ethereum, Base, Arbitrum, Optimism, Polygon, BNB, Solana и Sui с замороженными корпусом исследований и ценовыми оракулами; результаты проверяются по состоянию цепочки, балансам, журналам событий и числовым эталонам. Оценивание учитывает pass@1, надёжность pass⁵, нарушения безопасности SVR и доверительный интервал, а манифесты защищаются хешем SHA-256, проверками достижимой сетки, архивами с Merkle-корнями и дополнительной аттестацией Ed25519. В репозитории опубликованы 24 спецификации задач, из которых только 6 имеют локальные среды и верификаторы, а остальные 18 требуют эталонного набора окружений и не выполняются локальной командой run.

Кому подойдёт

Исследователи автономных агентов и Web3, разработчики моделей и инструментов для блокчейна, команды безопасности, создатели DeFi-автоматизации и инженерные команды, которым нужны воспроизводимые тесты и CI-контроль качества.

Что внутри

  • CLI для инициализации агента, запуска испытаний, формирования отчётов, проверки манифестов и расчёта отпечатка окружений.
  • Каталог из 214 задач в 8 категориях для проверки транзакций, маршрутизации обменов, мостов, DeFi, исследований, безопасности, анализа данных и управления.
  • Детерминированные форки нескольких блокчейнов, замороженные исследовательские данные и оракулы, а также блокировка внешнего доступа кроме собственного API модели.
  • Программные верификаторы, проверяющие состояние цепочки, балансы, журналы событий, числовые ответы и нарушения безопасности без LLM-судей.
  • Формат манифеста nexbench.run/2.1 с SHA-256 идентификатором, проверками целостности, Merkle-доказательствами и поддержкой Ed25519-аттестаций.
  • Адаптеры агентов на TypeScript, Python и любом языке через HTTP-эндпоинт, интеграция с GitHub Actions как порогом регрессий.

Где применять

  • Сравнение автономных Web3-агентов по единой воспроизводимой методике перед исследовательской публикацией или внутренним тестированием.
  • Регрессионная проверка изменений в моделях, промптах и инструментах через запуск бенчмарка в GitHub Actions.
  • Тестирование безопасности агентов, которые работают с переводами, разрешениями токенов, подозрительными адресами и DeFi-позициями.
  • Оценка закрытых коммерческих агентов через локальный процесс или HTTP-адаптер без передачи их весов и промптов.
  • Подготовка проверяемых результатов для рейтинга агентов и отправки манифеста с доказательствами в таблицу лидеров.

Темы