Популярный проект
vllm-project/vllm
vLLM — высокопроизводительный и экономичный по памяти движок инференса и обслуживания больших языковых моделей с поддержкой 200+ архитектур.
- Stars
- ★ 90.2k ↗ +1k за 7 дней
- Forks
- ⑂ 21.3k
- Язык
- Python
- Статус
- В канале 1 янв. 1 г.
AI-разбор
vLLM — открытая библиотека для запуска и обслуживания больших языковых моделей, изначально разработанная в UC Berkeley. Использует технологию PagedAttention для эффективного управления памятью ключей и значений внимания, что даёт высокую пропускную способность при низком потреблении памяти. Поддерживает квантизацию (FP8, INT8, INT4, GPTQ, AWQ и др.), speculative decoding, распределённый инференс и совместимый с OpenAI API-сервер, работая на GPU NVIDIA, AMD, TPU, Intel Gaudi и других ускорителях.
ML-инженеры и исследователи, разворачивающие LLM-сервисы; команды, которым нужен быстрый и экономичный по памяти инференс на разном оборудовании
Что внутри
- PagedAttention и непрерывная пакетная обработка запросов с chunked prefill и prefix caching
- Квантизация FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ, AWQ, GGUF и другие форматы
- Оптимизированные ядра внимания (FlashAttention, FlashInfer, TRTLLM-GEN) и GEMM/MoE-ядра
- Speculative decoding (n-gram, EAGLE, DFlash) и torch.compile для автогенерации ядер
- Совместимый с OpenAI API-сервер, поддержка структурированного вывода, вызова инструментов и multi-LoRA
Где применять
- Запуск production-сервиса LLM с API, совместимым с OpenAI
- Локальный или облачный инференс моделей Llama, Qwen, DeepSeek-V3, Mixtral и других
- Распределённый инференс больших MoE-моделей на кластере GPU
- Генерация структурированных ответов и интеграция вызова инструментов в пайплайны
Темы