Тематическая подборка
benchmark
4 open-source проекта с AI-разборами, метриками и прямыми ссылками на GitHub.
011 янв. 1 г.
bridge-mind/bridgebench
Открытый бенчмарк, где модели соревнуются в реальных инженерных сценариях, проходят слепое судейство и получают рейтинг Elo с проверяемым журналом.
021 янв. 1 г.
Saivineeth147/lora-speedrun
Открытый бенчмарк для сравнения скорости LoRA-тонкой настройки языковых моделей на фиксированных задачах и одной видеокарте L40S.
031 янв. 1 г.
Nexis-AI/NexBench
Воспроизводимо оценивает автономных Web3-агентов на 214 ончейн-задачах с детерминированными средами, программными проверками и защитой результатов от подделки.
041 янв. 1 г.
david-g-3654/homebench
Консольный бенчмарк для сравнения локальных LLM по качеству, скорости, задержке и памяти с интерактивной таблицей результатов.