Новый проект
giannisanni/pulsar
Rust + CUDA-движок потокового инференса MoE-моделей, который хранит экспертов на NVMe и автоматически распределяет внимание и вычисления между GPU.
- Stars
- ★ 210 ↗ +5 за 7 дней
- Forks
- ⑂ 26
- Язык
- Rust
- Статус
- В канале 1 янв. 1 г.
AI-разбор
Pulsar — движок локального инференса крупных Mixture-of-Experts-моделей на Linux с NVIDIA GPU, рассчитанный на запуск моделей, не помещающихся целиком в видеопамять. Маршрутизируемые эксперты хранятся на NVMe и подгружаются для каждого токена, тогда как механизмы принятия решений, часть внимания, KV-кэш и наиболее востребованные эксперты остаются в VRAM или оперативной памяти. Проект написан на Rust и CUDA, поддерживает несколько архитектур моделей, стандартные GGUF-файлы, различные форматы квантования, разделённые наборы файлов и совместимый с OpenAI HTTP-сервер. При старте измеряется фактическая пропускная способность PCIe, после чего GPU получают роли потоковой загрузки экспертов, хранения внимания и выполнения горячих экспертных слоёв. Доступны интерактивный чат, веб-интерфейс, потоковая генерация, сохранение KV-кэша, MCP-интеграция и CPU-путь для части экспертных вычислений. Подтверждённые ограничения включают работу движка только на Linux, необходимость CUDA toolkit, совместимого компилятора, NVIDIA GPU от GTX 10-й серии и быстрого NVMe, а производительность потоковых моделей зависит от скорости диска, объёма RAM, длины генерации и прогрева статистики маршрутизации.
Проект предназначен для разработчиков inference-систем, исследователей LLM и энтузиастов локального запуска моделей, располагающих Linux-системой, NVIDIA GPU, CUDA, быстрой NVMe и достаточным объёмом оперативной памяти.
Что внутри
- Потоковая загрузка маршрутизируемых экспертов с NVMe по мере генерации токенов.
- Автоматическое распределение ролей между несколькими NVIDIA GPU на основе измеренной пропускной способности PCIe.
- Поддержка крупных MoE-архитектур, включая Hy3, GLM-5.2, Kimi K2.7, Qwen3, DeepSeek-V4-Flash, MiniMax M3, Gemma 4, gpt-oss, Laguna-S и Ornith.
- Работа со стандартными GGUF, шардированными моделями, tied embeddings и наборами квантования q2_K, q3_K, q4_K, IQ2 и другими форматами.
- CLI для одноразовой генерации, чата, teacher forcing, выгрузки логитов и проверки согласованности декодирования.
- OpenAI-совместимый сервер с веб-интерфейсом, потоковыми ответами и опциональным подключением MCP-серверов.
Где применять
- Локальный запуск гигантских MoE-моделей на одной или нескольких потребительских NVIDIA GPU с ограниченной VRAM.
- Исследование производительности, корректности и длинного контекста квантованных языковых моделей.
- Развёртывание локального OpenAI-совместимого сервера для приложений, которым нужны чат, потоковая генерация и сохранение контекста.
- Эксперименты с распределением экспертных вычислений между GPU, NVMe и CPU на рабочих станциях с быстрым хранилищем.
- Подключение локальной модели к MCP-инструментам через встроенный веб-интерфейс и конфигурацию сервера.
Темы