Тематическая подборка
llm-evaluation
2 open-source проекта с AI-разборами, метриками и прямыми ссылками на GitHub.
013 нед. назад
i3T4AN/KADATH
Среда, в которой популяции автономных агентов проходят проверку, отбор и мутации, чтобы постепенно улучшать достижение заданной измеримой цели.
021 янв. 1 г.
jsdhwfmax/EvalForge
Evaluator-neutral AI evaluation evidence, baseline regression gates, and JSON, JUnit, and SARIF reports for CI.