← Все репозитории

Новый проект

bridge-mind/bridgebench

Открытый бенчмарк, где модели соревнуются в реальных инженерных сценариях, проходят слепое судейство и получают рейтинг Elo с проверяемым журналом.

Открыть GitHub
Stars
127
Forks
7
Язык
TypeScript
Статус
В канале 1 янв. 1 г.

AI-разбор

BridgeBench оценивает модели как партнёров для разработки программного обеспечения на едином наборе из 336 публичных задач. В каждом матче два конкурента получают идентичный контекст, а три независимых судьи вслепую сравнивают анонимные ответы; победитель определяется большинством голосов и влияет на общий рейтинг Elo, начиная с 1000 баллов и коэффициентом K=32. Проект включает движок арены, загрузчик задач, систему судейства, проверку журналов, воспроизведение рейтингов, отчёты, командный интерфейс и локальную панель. Задачи охватывают семь направлений: рассуждение, выявление галлюцинаций, безопасность, проверку предпосылок, рефакторинг, отладку и генерацию. Результаты опираются на публичные задачи, манифесты запусков, неизменяемый журнал матчей, скрытые эталоны и производные таблицы лидеров. Ограничения прямо указаны в README: проверка подтверждает внутреннюю согласованность, но не подлинность издателя и не гарантирует правильность качественного решения судьи; запросы проходят через OpenRouter с закреплёнными идентификаторами моделей.

Кому подойдёт

Исследователи и инженеры, оценивающие языковые модели для разработки, авторы бенчмарков и задач, разработчики инструментария для агентов, а также операторы, которым нужны воспроизводимые и проверяемые рейтинги.

Что внутри

  • Единый пул из 336 публичных задач в семи оцениваемых направлениях.
  • Очные матчи двух моделей с одинаковым контекстом и параллельным выполнением.
  • Слепое судейство тремя моделями с анонимизацией участников и перестановкой порядка ответов.
  • Подсчёт побед большинством голосов, обработка отказов и обновление рейтинга Elo.
  • Проверка журналов, манифестов и хешей с воспроизведением результатов и рейтинга.
  • TypeScript-исходники арены, CLI, тестовые фикстуры, документация и локальная панель.

Где применять

  • Сравнение моделей для выбора инструмента в задачах программной инженерии.
  • Аудит опубликованного результата через публичную задачу, манифест и журнал матча.
  • Исследование устойчивости моделей к ошибочным предпосылкам, уязвимостям и скрытым ловушкам.
  • Разработка и проверка новых задач, методологии и компонентов движка бенчмарка.
  • Локальный запуск проверок и панели для разработчиков и операторов арены.

Темы