Тематическая подборка
2 open-source проекта с AI-разборами, метриками и прямыми ссылками на GitHub.
vLLM — высокопроизводительный и экономичный по памяти движок инференса и обслуживания больших языковых моделей с поддержкой 200+ архитектур.
The fastest way to run Qwen3.8-Flash-Next on Strix Halo (gfx1151)