Новый проект
swellweb/reame
CPU-first сервер инференса на llama.cpp с дисковым KV-кэшем, спекулятивным декодированием и OpenAI-совместимым API для недорогих ARM-серверов.
- Stars
- ★ 108 ↗ +1 за 7 дней
- Forks
- ⑂ 9
- Язык
- C++
- Статус
- В канале 1 янв. 1 г.
AI-разбор
Reame — сервер инференса больших языковых моделей, рассчитанный прежде всего на CPU, общие виртуальные ядра и недорогие ARM-серверы. Он использует llama.cpp, повторно применяет сохранённые на диске KV-снимки общих префиксов, архивирует результаты генерации и применяет саморегулируемое спекулятивное декодирование с моделью-черновиком или n-граммами. В состав входят межпользовательское пакетирование, режим Conclave с несколькими вариантами ответа, Redis-совместимый демон ARCA, CLI для загрузки и запуска GGUF-моделей, а также REST API с потоковой выдачей, сессиями, метриками и bearer-аутентификацией. Проект поддерживает macOS и Linux на x64 и ARM64, требует C++17, CMake, Boost, nlohmann-json и zstd при сборке из исходников. Ограничения подтверждены авторами: один процесс обслуживает одну модель, GPU-ускорение, обучение и развитое управление моделями не входят в цели, а для широкого рассуждения и универсального диалога малые CPU-модели не предназначены.
Разработчики и инженеры инфраструктуры, которым нужен самостоятельный OpenAI-совместимый сервер для повторяющихся узких задач на CPU, бесплатных ARM-тарифах, общих VPS или локальных компьютерах с ограниченной памятью.
Что внутри
- Дисковый общий KV-кэш с zstd, контрольными суммами, LRU-ограничением и восстановлением после перезапуска.
- Palimpsest — архив ранее созданных n-грамм для формирования черновиков будущих ответов без отдельной модели.
- Саморегулируемое спекулятивное декодирование с моделью-черновиком или локальным n-граммным поиском.
- Conclave с параметром --best-of N, копированием KV-префикса, межпоточным выполнением и голосованием за результат.
- ARCA — Redis-совместимый демон с кэшем точных ответов и общим корпусом генераций для нескольких узлов.
- OpenAI-совместимый REST API, SSE-поток, сессии, метрики, health-проверка, bearer-аутентификация и CLI без обязательного конфигурационного файла.
Где применять
- Локальное извлечение фактов, классификация документов, обработка счетов, заявок и результатов скрапинга на собственном сервере.
- Ночные пакетные конвейеры для тегирования товаров, создания метаописаний и сортировки почты без оплаты токенов внешнему API.
- Встраивание узких AI-функций в SaaS с небольшим бюджетом на инфраструктуру и повторяющимися запросами к одним типам данных.
- Обработка конфиденциальных юридических, медицинских и государственных документов без передачи данных стороннему провайдеру.
- Приватное автодополнение кода и пакетные SEO-аудиты через OpenAI-совместимый API на локальной или ARM-инфраструктуре.
Темы