Тематическая подборка
llm-inference
9 open-source проектов с AI-разборами, метриками и прямыми ссылками на GitHub.
FareedKhan-dev/kimi-k3-in-c
Портативный движок на C99 запускает инференс Kimi K3 с 2,78 трлн параметров на Linux x86-64 без GPU и внешних фреймворков.
drumih/turbo-fieldfare
Swift и Metal-рантайм для запуска Gemma 4 26B-A4B на Apple Silicon с использованием около 2 ГБ памяти и потоковой загрузкой экспертов с SSD.
formetaohy/Thuban
Быстрый движок инференса больших языковых моделей на Rust и WGPU с вычислениями через переносимые шейдеры без зависимости от CUDA.
patchy631/time-to-first-token
Практическая программа по запуску, измерению и оптимизации сервиса инференса LLM на базе vLLM и SGLang с воспроизводимыми нагрузочными тестами.
antonellof/ferrox
Чистый Rust-движок для запуска плотных и MoE-моделей GGUF на CPU, Apple Metal и CUDA через CLI и OpenAI-совместимый сервер.
zeraix/zeraix
Открытое настольное приложение для запуска локальных моделей, работы с файлами, инструментами и агентами на macOS и Windows.
amitshekhariitbhu/llm-inference-engineering
Learn LLM Inference Engineering step by step - from KV cache, PagedAttention, and continuous batching to vLLM, SGLang, and GPUs.
MADEVAL/FerryAI
Библиотека для локального запуска ONNX, GGUF и RubixML-моделей внутри PHP через FFI с чатами, эмбеддингами, RAG и векторным поиском.
pur4v/p2ptokens
Rust-платформа для peer-to-peer вывода LLM: узлы одновременно обслуживают и используют запросы, обменивая вычислительный ресурс через подписанный баланс.