Новый проект
bridge-mind/bridgebench
Открытый бенчмарк, где модели соревнуются в реальных инженерных сценариях, проходят слепое судейство и получают рейтинг Elo с проверяемым журналом.
- Stars
- ★ 127
- Forks
- ⑂ 7
- Язык
- TypeScript
- Статус
- В канале 1 янв. 1 г.
AI-разбор
BridgeBench оценивает модели как партнёров для разработки программного обеспечения на едином наборе из 336 публичных задач. В каждом матче два конкурента получают идентичный контекст, а три независимых судьи вслепую сравнивают анонимные ответы; победитель определяется большинством голосов и влияет на общий рейтинг Elo, начиная с 1000 баллов и коэффициентом K=32. Проект включает движок арены, загрузчик задач, систему судейства, проверку журналов, воспроизведение рейтингов, отчёты, командный интерфейс и локальную панель. Задачи охватывают семь направлений: рассуждение, выявление галлюцинаций, безопасность, проверку предпосылок, рефакторинг, отладку и генерацию. Результаты опираются на публичные задачи, манифесты запусков, неизменяемый журнал матчей, скрытые эталоны и производные таблицы лидеров. Ограничения прямо указаны в README: проверка подтверждает внутреннюю согласованность, но не подлинность издателя и не гарантирует правильность качественного решения судьи; запросы проходят через OpenRouter с закреплёнными идентификаторами моделей.
Исследователи и инженеры, оценивающие языковые модели для разработки, авторы бенчмарков и задач, разработчики инструментария для агентов, а также операторы, которым нужны воспроизводимые и проверяемые рейтинги.
Что внутри
- Единый пул из 336 публичных задач в семи оцениваемых направлениях.
- Очные матчи двух моделей с одинаковым контекстом и параллельным выполнением.
- Слепое судейство тремя моделями с анонимизацией участников и перестановкой порядка ответов.
- Подсчёт побед большинством голосов, обработка отказов и обновление рейтинга Elo.
- Проверка журналов, манифестов и хешей с воспроизведением результатов и рейтинга.
- TypeScript-исходники арены, CLI, тестовые фикстуры, документация и локальная панель.
Где применять
- Сравнение моделей для выбора инструмента в задачах программной инженерии.
- Аудит опубликованного результата через публичную задачу, манифест и журнал матча.
- Исследование устойчивости моделей к ошибочным предпосылкам, уязвимостям и скрытым ловушкам.
- Разработка и проверка новых задач, методологии и компонентов движка бенчмарка.
- Локальный запуск проверок и панели для разработчиков и операторов арены.
Темы