Тематическая подборка
evaluation
4 open-source проекта с AI-разборами, метриками и прямыми ссылками на GitHub.
011 янв. 1 г.
Sahir619/fable-method
Набор навыков и проверок для ИИ-агентов: классифицировать задачу, собрать доказательства, выполнить минимальные изменения и подтвердить результат.
021 янв. 1 г.
bridge-mind/bridgebench
Открытый бенчмарк, где модели соревнуются в реальных инженерных сценариях, проходят слепое судейство и получают рейтинг Elo с проверяемым журналом.
031 янв. 1 г.
david-g-3654/homebench
Консольный бенчмарк для сравнения локальных LLM по качеству, скорости, задержке и памяти с интерактивной таблицей результатов.
041 янв. 1 г.
Kane-Wan/oss-maintainer-kit
CLI и GitHub Action для безопасного анализа pull request, сортировки issues и подготовки структурированных release notes через OpenAI Responses API.