← Все репозитории

Популярный проект

vllm-project/vllm

vLLM — высокопроизводительный и экономичный по памяти движок инференса и обслуживания больших языковых моделей с поддержкой 200+ архитектур.

Открыть GitHub
Stars
90.2k
+1k за 7 дней
Forks
21.3k
Язык
Python
Статус
В канале 1 янв. 1 г.

AI-разбор

vLLM — открытая библиотека для запуска и обслуживания больших языковых моделей, изначально разработанная в UC Berkeley. Использует технологию PagedAttention для эффективного управления памятью ключей и значений внимания, что даёт высокую пропускную способность при низком потреблении памяти. Поддерживает квантизацию (FP8, INT8, INT4, GPTQ, AWQ и др.), speculative decoding, распределённый инференс и совместимый с OpenAI API-сервер, работая на GPU NVIDIA, AMD, TPU, Intel Gaudi и других ускорителях.

Кому подойдёт

ML-инженеры и исследователи, разворачивающие LLM-сервисы; команды, которым нужен быстрый и экономичный по памяти инференс на разном оборудовании

Что внутри

  • PagedAttention и непрерывная пакетная обработка запросов с chunked prefill и prefix caching
  • Квантизация FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ, AWQ, GGUF и другие форматы
  • Оптимизированные ядра внимания (FlashAttention, FlashInfer, TRTLLM-GEN) и GEMM/MoE-ядра
  • Speculative decoding (n-gram, EAGLE, DFlash) и torch.compile для автогенерации ядер
  • Совместимый с OpenAI API-сервер, поддержка структурированного вывода, вызова инструментов и multi-LoRA

Где применять

  • Запуск production-сервиса LLM с API, совместимым с OpenAI
  • Локальный или облачный инференс моделей Llama, Qwen, DeepSeek-V3, Mixtral и других
  • Распределённый инференс больших MoE-моделей на кластере GPU
  • Генерация структурированных ответов и интеграция вызова инструментов в пайплайны

Темы