Новый проект
UiPath/coder_eval
Фреймворк для воспроизводимой проверки coding-агентов и их навыков в изолированных средах с YAML-задачами, метриками, телеметрией и CI-ограничениями.
- Stars
- ★ 116 ↗ +2 за 7 дней
- Forks
- ⑂ 2
- Язык
- Python
- Статус
- В канале 1 янв. 1 г.
AI-разбор
Coder Eval запускает реальных ИИ-агентов, включая Claude Code, Codex и Google Antigravity с Gemini, в изолированной среде и проверяет созданные ими файлы и выполненные команды. Сценарии описываются декларативными YAML-файлами, где задаются запрос, конфигурация агента, среда выполнения и критерии успеха. Проект поддерживает взвешенное непрерывное оценивание от 0,0 до 1,0, проверку активации навыка через критерий skill_triggered, сравнение конфигураций в A/B-экспериментах и сбор данных о вызовах инструментов, токенах и стоимости. Для интеграции с автоматизацией предусмотрены интерфейс командной строки, составное действие GitHub Actions, JUnit-отчёты, пороги минимальной оценки и потоковая выдача данных. Проект требует Python 3.13 или новее и собственные учётные данные моделей; временный каталог не является границей безопасности, поэтому непроверенные задачи рекомендуется запускать только через контейнерный драйвер.
Проект предназначен для разработчиков CLI и навыков, инженеров по качеству ИИ-агентов, команд DevOps и исследователей, которым нужны воспроизводимые проверки реальной работы агентных систем в изолированной среде и автоматические критерии регрессий.
Что внутри
- Декларативные YAML-задачи с зависимостями, настройками агента, песочницей и критериями успеха
- Изолированное выполнение через временный каталог или контейнерный драйвер с настраиваемыми образами
- Взвешенное оценивание с дробным начислением баллов, порогами и несколькими типами критериев
- Поддержка Claude Code, Codex и Google Antigravity с Gemini через расширяемый интерфейс подключаемых компонентов
- A/B-эксперименты для сравнения моделей, инструментов и запросов на одинаковых задачах
- Телеметрия вызовов инструментов, токенов, стоимости и результатов с возможностью отключения
Где применять
- Разработчикам навыков Claude Code — проверять, запускается ли нужный навык и сохраняется ли его работоспособность после изменений
- Командам, создающим ИИ-агентов, — сравнивать Claude Code, Codex и Gemini или разные модели, запросы и наборы инструментов
- Инженерам по качеству — собирать воспроизводимые наборы задач и измерять работу агентов по файлам, командам и пользовательским критериям
- Командам DevOps — запускать регулярные проверки в GitHub Actions и блокировать сборку при снижении качества
- Исследователям агентных систем — расширять наборы данных, подключать собственные агенты и анализировать стоимость выполнения
Темы