← Все репозитории

Новый проект

drumih/turbo-fieldfare

Swift и Metal-рантайм для запуска Gemma 4 26B-A4B на Apple Silicon с использованием около 2 ГБ памяти и потоковой загрузкой экспертов с SSD.

Открыть GitHub
Stars
6.6k
+167 за 7 дней
Forks
422
Язык
Swift
Статус
В канале 1 янв. 1 г.

AI-разбор

TurboFieldfare — специализированный Swift и Metal-рантайм для локального текстового вывода instruction-модели Gemma 4 26B-A4B на Mac с Apple Silicon. Вместо загрузки всей модели в память он хранит общий 1,35-гигабайтный блок и FP16 KV-кэш, а необходимые маршрутизируемые эксперты потоково читает с SSD через ограниченный кэш. Проект включает собственные Metal-ядра для квантованных вычислений, внимания, MoE, нормализации, RoPE и сэмплирования, а также поэтапный prefill и генерацию токен за токеном. В состав входят нативное Mac-приложение, CLI, Swift-библиотека, установщик и проверяющий репакер модели, локальный OpenAI-совместимый сервер и отдельный decode-сервис. Поддерживаются текстовые сообщения, потоковая выдача, повторное использование префикса и вызовы функций через сервер, но модельные вызовы инструментов должен подтверждать и выполнять клиент. Подтверждённые ограничения: только Apple Silicon, macOS 26 или новее, Metal 4, Swift 6.2, минимум 8 ГБ RAM, около 14,3 ГБ дискового пространства; изображения, аудио и видео не поддерживаются.

Кому подойдёт

Разработчики Swift и Metal, инженеры on-device AI, исследователи локального инференса и владельцы Apple Silicon Mac, которым нужен текстовый запуск Gemma 4 без облачного сервиса и с жёстким ограничением оперативной памяти.

Что внутри

  • Потоковая установка и проверка модели в формате .gturbo без размещения полного исходного чекпойнта на диске.
  • Квантованные 4-битные веса MLX affine с группой 64 и 8-битным маршрутизатором для Gemma 4 26B-A4B.
  • SSD-подсистема загрузки routed-экспертов с ограниченным LFU-кэшем и bounded parallel pread.
  • Собственные Metal-ядра для GEMV, внимания, MoE, нормализации, RoPE, сэмплирования и объединённых вычислительных этапов.
  • Нативное SwiftUI/AppKit-приложение для установки модели, настройки генерации и интерактивного чата.
  • CLI и loopback OpenAI-совместимый сервер с Chat Completions, потоковой выдачей и поддержкой function tools.

Где применять

  • Локальный чат и генерация текста на MacBook с 8 ГБ оперативной памяти без удалённого API.
  • Эксперименты разработчиков с инференсом MoE-моделей, Metal-ядрами, кэшированием экспертов и ограниченной памятью.
  • Интеграция локальной Gemma 4 с клиентами, поддерживающими OpenAI-совместимый Chat Completions API.
  • Воспроизводимые командные тесты генерации через CLI с заданными параметрами температуры, seed и ограничениями вывода.
  • Изучение архитектуры on-device AI по документации, журналу из 103 экспериментов и опубликованным бенчмаркам.

Темы