← Все репозитории

Новый проект

formetaohy/Thuban

Быстрый движок инференса больших языковых моделей на Rust и WGPU с вычислениями через переносимые шейдеры без зависимости от CUDA.

Открыть GitHub
Stars
48
+20 за 7 дней
Forks
1
Язык
Rust
Статус
В канале 1 янв. 1 г.

AI-разбор

Flint — движок инференса больших языковых моделей, написанный на чистом Rust поверх WGPU. Вычисления выполняются на GPU через переносимые вычислительные шейдеры, поэтому проект заявляет поддержку Windows, Linux и Android, macOS и iOS, а также веб-среды через WASM. Внутри предусмотрено ядро инференса с оптимизациями, поддержка форматов safetensors, ONNX и квантованных GGUF. Проект совместим с семействами моделей Qwen, LLaMA, Mistral, Phi, Gemma и Phi-MoE, включая указанные в README версии и варианты архитектур. Для практического запуска предоставлены отдельные исполняемые примеры. Поддержка новых моделей ещё расширяется, поэтому перечень совместимых архитектур не является окончательным.

Кому подойдёт

Разработчики на Rust, инженеры по машинному обучению и создатели кроссплатформенных приложений, которым нужен локальный GPU-инференс поддерживаемых LLM на десктопных, мобильных и веб-платформах.

Что внутри

  • Реализован движок инференса LLM на чистом Rust.
  • Используется WGPU и переносимые вычислительные шейдеры для работы на GPU.
  • Поддерживаются Windows, Linux, Android, macOS, iOS и веб через WASM.
  • Обрабатываются форматы safetensors, ONNX и квантованные GGUF.
  • Поддержаны модели семейств Qwen, LLaMA, Mistral, Phi, Gemma и Phi-MoE.
  • В репозитории есть запускаемые примеры для знакомства с движком.

Где применять

  • Запуск поддерживаемых больших языковых моделей на настольных системах Windows, Linux и macOS.
  • Встраивание GPU-инференса в приложения на Rust с единым кроссплатформенным кодом.
  • Эксперименты с инференсом моделей на мобильных устройствах Android и iOS.
  • Запуск совместимых моделей в браузерных или веб-приложениях через WASM.
  • Проверка и использование моделей в форматах safetensors, ONNX и GGUF без привязки к CUDA.

Темы