Новый проект
Nexis-AI/NexBench
Воспроизводимо оценивает автономных Web3-агентов на 214 ончейн-задачах с детерминированными средами, программными проверками и защитой результатов от подделки.
- Stars
- ★ 99
- Forks
- ⑂ 52
- Язык
- TypeScript
- Статус
- В канале 1 янв. 1 г.
AI-разбор
NEXBENCH — TypeScript-фреймворк для воспроизводимой оценки автономных агентов, выполняющих действия в Web3 и DeFi. Набор включает 214 задач в 8 категориях: исполнение транзакций, обмены, мосты, DeFi-операции, исследование рынка, обнаружение угроз, анализ портфелей и управление казначейством. Задачи запускаются пять раз в детерминированных форках Ethereum, Base, Arbitrum, Optimism, Polygon, BNB, Solana и Sui с замороженными корпусом исследований и ценовыми оракулами; результаты проверяются по состоянию цепочки, балансам, журналам событий и числовым эталонам. Оценивание учитывает pass@1, надёжность pass⁵, нарушения безопасности SVR и доверительный интервал, а манифесты защищаются хешем SHA-256, проверками достижимой сетки, архивами с Merkle-корнями и дополнительной аттестацией Ed25519. В репозитории опубликованы 24 спецификации задач, из которых только 6 имеют локальные среды и верификаторы, а остальные 18 требуют эталонного набора окружений и не выполняются локальной командой run.
Исследователи автономных агентов и Web3, разработчики моделей и инструментов для блокчейна, команды безопасности, создатели DeFi-автоматизации и инженерные команды, которым нужны воспроизводимые тесты и CI-контроль качества.
Что внутри
- CLI для инициализации агента, запуска испытаний, формирования отчётов, проверки манифестов и расчёта отпечатка окружений.
- Каталог из 214 задач в 8 категориях для проверки транзакций, маршрутизации обменов, мостов, DeFi, исследований, безопасности, анализа данных и управления.
- Детерминированные форки нескольких блокчейнов, замороженные исследовательские данные и оракулы, а также блокировка внешнего доступа кроме собственного API модели.
- Программные верификаторы, проверяющие состояние цепочки, балансы, журналы событий, числовые ответы и нарушения безопасности без LLM-судей.
- Формат манифеста nexbench.run/2.1 с SHA-256 идентификатором, проверками целостности, Merkle-доказательствами и поддержкой Ed25519-аттестаций.
- Адаптеры агентов на TypeScript, Python и любом языке через HTTP-эндпоинт, интеграция с GitHub Actions как порогом регрессий.
Где применять
- Сравнение автономных Web3-агентов по единой воспроизводимой методике перед исследовательской публикацией или внутренним тестированием.
- Регрессионная проверка изменений в моделях, промптах и инструментах через запуск бенчмарка в GitHub Actions.
- Тестирование безопасности агентов, которые работают с переводами, разрешениями токенов, подозрительными адресами и DeFi-позициями.
- Оценка закрытых коммерческих агентов через локальный процесс или HTTP-адаптер без передачи их весов и промптов.
- Подготовка проверяемых результатов для рейтинга агентов и отправки манифеста с доказательствами в таблицу лидеров.
Темы