← Все репозитории

Новый проект

UiPath/coder_eval

Фреймворк для воспроизводимой проверки coding-агентов и их навыков в изолированных средах с YAML-задачами, метриками, телеметрией и CI-ограничениями.

Открыть GitHub
Stars
116
+2 за 7 дней
Forks
2
Язык
Python
Статус
В канале 1 янв. 1 г.

AI-разбор

Coder Eval запускает реальных ИИ-агентов, включая Claude Code, Codex и Google Antigravity с Gemini, в изолированной среде и проверяет созданные ими файлы и выполненные команды. Сценарии описываются декларативными YAML-файлами, где задаются запрос, конфигурация агента, среда выполнения и критерии успеха. Проект поддерживает взвешенное непрерывное оценивание от 0,0 до 1,0, проверку активации навыка через критерий skill_triggered, сравнение конфигураций в A/B-экспериментах и сбор данных о вызовах инструментов, токенах и стоимости. Для интеграции с автоматизацией предусмотрены интерфейс командной строки, составное действие GitHub Actions, JUnit-отчёты, пороги минимальной оценки и потоковая выдача данных. Проект требует Python 3.13 или новее и собственные учётные данные моделей; временный каталог не является границей безопасности, поэтому непроверенные задачи рекомендуется запускать только через контейнерный драйвер.

Кому подойдёт

Проект предназначен для разработчиков CLI и навыков, инженеров по качеству ИИ-агентов, команд DevOps и исследователей, которым нужны воспроизводимые проверки реальной работы агентных систем в изолированной среде и автоматические критерии регрессий.

Что внутри

  • Декларативные YAML-задачи с зависимостями, настройками агента, песочницей и критериями успеха
  • Изолированное выполнение через временный каталог или контейнерный драйвер с настраиваемыми образами
  • Взвешенное оценивание с дробным начислением баллов, порогами и несколькими типами критериев
  • Поддержка Claude Code, Codex и Google Antigravity с Gemini через расширяемый интерфейс подключаемых компонентов
  • A/B-эксперименты для сравнения моделей, инструментов и запросов на одинаковых задачах
  • Телеметрия вызовов инструментов, токенов, стоимости и результатов с возможностью отключения

Где применять

  • Разработчикам навыков Claude Code — проверять, запускается ли нужный навык и сохраняется ли его работоспособность после изменений
  • Командам, создающим ИИ-агентов, — сравнивать Claude Code, Codex и Gemini или разные модели, запросы и наборы инструментов
  • Инженерам по качеству — собирать воспроизводимые наборы задач и измерять работу агентов по файлам, командам и пользовательским критериям
  • Командам DevOps — запускать регулярные проверки в GitHub Actions и блокировать сборку при снижении качества
  • Исследователям агентных систем — расширять наборы данных, подключать собственные агенты и анализировать стоимость выполнения

Темы