Тематическая подборка
inference
6 open-source проектов с AI-разборами, метриками и прямыми ссылками на GitHub.
vllm-project/vllm
vLLM — высокопроизводительный и экономичный по памяти движок инференса и обслуживания больших языковых моделей с поддержкой 200+ архитектур.
MaincodeHQ/from-tin-to-tokens
Бесплатный учебник о создании с нуля стека вывода больших языковых моделей на Rust — от интерфейса драйвера до HTTP-сервиса.
antonellof/ferrox
Чистый Rust-движок для запуска плотных и MoE-моделей GGUF на CPU, Apple Metal и CUDA через CLI и OpenAI-совместимый сервер.
swellweb/reame
CPU-first сервер инференса на llama.cpp с дисковым KV-кэшем, спекулятивным декодированием и OpenAI-совместимым API для недорогих ARM-серверов.
MADEVAL/FerryAI
Библиотека для локального запуска ONNX, GGUF и RubixML-моделей внутри PHP через FFI с чатами, эмбеддингами, RAG и векторным поиском.
pur4v/p2ptokens
Rust-платформа для peer-to-peer вывода LLM: узлы одновременно обслуживают и используют запросы, обменивая вычислительный ресурс через подписанный баланс.