← Все репозитории

Новый проект

swellweb/reame

CPU-first сервер инференса на llama.cpp с дисковым KV-кэшем, спекулятивным декодированием и OpenAI-совместимым API для недорогих ARM-серверов.

Открыть GitHub
Stars
108
+1 за 7 дней
Forks
9
Язык
C++
Статус
В канале 1 янв. 1 г.

AI-разбор

Reame — сервер инференса больших языковых моделей, рассчитанный прежде всего на CPU, общие виртуальные ядра и недорогие ARM-серверы. Он использует llama.cpp, повторно применяет сохранённые на диске KV-снимки общих префиксов, архивирует результаты генерации и применяет саморегулируемое спекулятивное декодирование с моделью-черновиком или n-граммами. В состав входят межпользовательское пакетирование, режим Conclave с несколькими вариантами ответа, Redis-совместимый демон ARCA, CLI для загрузки и запуска GGUF-моделей, а также REST API с потоковой выдачей, сессиями, метриками и bearer-аутентификацией. Проект поддерживает macOS и Linux на x64 и ARM64, требует C++17, CMake, Boost, nlohmann-json и zstd при сборке из исходников. Ограничения подтверждены авторами: один процесс обслуживает одну модель, GPU-ускорение, обучение и развитое управление моделями не входят в цели, а для широкого рассуждения и универсального диалога малые CPU-модели не предназначены.

Кому подойдёт

Разработчики и инженеры инфраструктуры, которым нужен самостоятельный OpenAI-совместимый сервер для повторяющихся узких задач на CPU, бесплатных ARM-тарифах, общих VPS или локальных компьютерах с ограниченной памятью.

Что внутри

  • Дисковый общий KV-кэш с zstd, контрольными суммами, LRU-ограничением и восстановлением после перезапуска.
  • Palimpsest — архив ранее созданных n-грамм для формирования черновиков будущих ответов без отдельной модели.
  • Саморегулируемое спекулятивное декодирование с моделью-черновиком или локальным n-граммным поиском.
  • Conclave с параметром --best-of N, копированием KV-префикса, межпоточным выполнением и голосованием за результат.
  • ARCA — Redis-совместимый демон с кэшем точных ответов и общим корпусом генераций для нескольких узлов.
  • OpenAI-совместимый REST API, SSE-поток, сессии, метрики, health-проверка, bearer-аутентификация и CLI без обязательного конфигурационного файла.

Где применять

  • Локальное извлечение фактов, классификация документов, обработка счетов, заявок и результатов скрапинга на собственном сервере.
  • Ночные пакетные конвейеры для тегирования товаров, создания метаописаний и сортировки почты без оплаты токенов внешнему API.
  • Встраивание узких AI-функций в SaaS с небольшим бюджетом на инфраструктуру и повторяющимися запросами к одним типам данных.
  • Обработка конфиденциальных юридических, медицинских и государственных документов без передачи данных стороннему провайдеру.
  • Приватное автодополнение кода и пакетные SEO-аудиты через OpenAI-совместимый API на локальной или ARM-инфраструктуре.

Темы