Новый проект
formetaohy/Thuban
Быстрый движок инференса больших языковых моделей на Rust и WGPU с вычислениями через переносимые шейдеры без зависимости от CUDA.
- Stars
- ★ 48 ↗ +20 за 7 дней
- Forks
- ⑂ 1
- Язык
- Rust
- Статус
- В канале 1 янв. 1 г.
AI-разбор
Flint — движок инференса больших языковых моделей, написанный на чистом Rust поверх WGPU. Вычисления выполняются на GPU через переносимые вычислительные шейдеры, поэтому проект заявляет поддержку Windows, Linux и Android, macOS и iOS, а также веб-среды через WASM. Внутри предусмотрено ядро инференса с оптимизациями, поддержка форматов safetensors, ONNX и квантованных GGUF. Проект совместим с семействами моделей Qwen, LLaMA, Mistral, Phi, Gemma и Phi-MoE, включая указанные в README версии и варианты архитектур. Для практического запуска предоставлены отдельные исполняемые примеры. Поддержка новых моделей ещё расширяется, поэтому перечень совместимых архитектур не является окончательным.
Разработчики на Rust, инженеры по машинному обучению и создатели кроссплатформенных приложений, которым нужен локальный GPU-инференс поддерживаемых LLM на десктопных, мобильных и веб-платформах.
Что внутри
- Реализован движок инференса LLM на чистом Rust.
- Используется WGPU и переносимые вычислительные шейдеры для работы на GPU.
- Поддерживаются Windows, Linux, Android, macOS, iOS и веб через WASM.
- Обрабатываются форматы safetensors, ONNX и квантованные GGUF.
- Поддержаны модели семейств Qwen, LLaMA, Mistral, Phi, Gemma и Phi-MoE.
- В репозитории есть запускаемые примеры для знакомства с движком.
Где применять
- Запуск поддерживаемых больших языковых моделей на настольных системах Windows, Linux и macOS.
- Встраивание GPU-инференса в приложения на Rust с единым кроссплатформенным кодом.
- Эксперименты с инференсом моделей на мобильных устройствах Android и iOS.
- Запуск совместимых моделей в браузерных или веб-приложениях через WASM.
- Проверка и использование моделей в форматах safetensors, ONNX и GGUF без привязки к CUDA.
Темы