← Все репозитории

Новый проект

giannisanni/pulsar

Rust + CUDA-движок потокового инференса MoE-моделей, который хранит экспертов на NVMe и автоматически распределяет внимание и вычисления между GPU.

Открыть GitHub
Stars
210
+5 за 7 дней
Forks
26
Язык
Rust
Статус
В канале 1 янв. 1 г.

AI-разбор

Pulsar — движок локального инференса крупных Mixture-of-Experts-моделей на Linux с NVIDIA GPU, рассчитанный на запуск моделей, не помещающихся целиком в видеопамять. Маршрутизируемые эксперты хранятся на NVMe и подгружаются для каждого токена, тогда как механизмы принятия решений, часть внимания, KV-кэш и наиболее востребованные эксперты остаются в VRAM или оперативной памяти. Проект написан на Rust и CUDA, поддерживает несколько архитектур моделей, стандартные GGUF-файлы, различные форматы квантования, разделённые наборы файлов и совместимый с OpenAI HTTP-сервер. При старте измеряется фактическая пропускная способность PCIe, после чего GPU получают роли потоковой загрузки экспертов, хранения внимания и выполнения горячих экспертных слоёв. Доступны интерактивный чат, веб-интерфейс, потоковая генерация, сохранение KV-кэша, MCP-интеграция и CPU-путь для части экспертных вычислений. Подтверждённые ограничения включают работу движка только на Linux, необходимость CUDA toolkit, совместимого компилятора, NVIDIA GPU от GTX 10-й серии и быстрого NVMe, а производительность потоковых моделей зависит от скорости диска, объёма RAM, длины генерации и прогрева статистики маршрутизации.

Кому подойдёт

Проект предназначен для разработчиков inference-систем, исследователей LLM и энтузиастов локального запуска моделей, располагающих Linux-системой, NVIDIA GPU, CUDA, быстрой NVMe и достаточным объёмом оперативной памяти.

Что внутри

  • Потоковая загрузка маршрутизируемых экспертов с NVMe по мере генерации токенов.
  • Автоматическое распределение ролей между несколькими NVIDIA GPU на основе измеренной пропускной способности PCIe.
  • Поддержка крупных MoE-архитектур, включая Hy3, GLM-5.2, Kimi K2.7, Qwen3, DeepSeek-V4-Flash, MiniMax M3, Gemma 4, gpt-oss, Laguna-S и Ornith.
  • Работа со стандартными GGUF, шардированными моделями, tied embeddings и наборами квантования q2_K, q3_K, q4_K, IQ2 и другими форматами.
  • CLI для одноразовой генерации, чата, teacher forcing, выгрузки логитов и проверки согласованности декодирования.
  • OpenAI-совместимый сервер с веб-интерфейсом, потоковыми ответами и опциональным подключением MCP-серверов.

Где применять

  • Локальный запуск гигантских MoE-моделей на одной или нескольких потребительских NVIDIA GPU с ограниченной VRAM.
  • Исследование производительности, корректности и длинного контекста квантованных языковых моделей.
  • Развёртывание локального OpenAI-совместимого сервера для приложений, которым нужны чат, потоковая генерация и сохранение контекста.
  • Эксперименты с распределением экспертных вычислений между GPU, NVMe и CPU на рабочих станциях с быстрым хранилищем.
  • Подключение локальной модели к MCP-инструментам через встроенный веб-интерфейс и конфигурацию сервера.

Темы