Тематическая подборка
cuda
3 open-source проекта с AI-разборами, метриками и прямыми ссылками на GitHub.
011 янв. 1 г.
vllm-project/vllm
vLLM — высокопроизводительный и экономичный по памяти движок инференса и обслуживания больших языковых моделей с поддержкой 200+ архитектур.
021 янв. 1 г.
giannisanni/pulsar
Rust + CUDA-движок потокового инференса MoE-моделей, который хранит экспертов на NVMe и автоматически распределяет внимание и вычисления между GPU.
031 янв. 1 г.
kyegomez/Latent-MoE
Однофайловый слой PyTorch, который переносит экспертов MoE в латентное пространство, снижая коммуникационные и параметрические затраты.