← Весь каталог

Тематическая подборка

llm-inference

9 open-source проектов с AI-разборами, метриками и прямыми ссылками на GitHub.

012 нед. назад

FareedKhan-dev/kimi-k3-in-c

Портативный движок на C99 запускает инференс Kimi K3 с 2,78 трлн параметров на Linux x86-64 без GPU и внешних фреймворков.

6.3kC
021 янв. 1 г.

drumih/turbo-fieldfare

Swift и Metal-рантайм для запуска Gemma 4 26B-A4B на Apple Silicon с использованием около 2 ГБ памяти и потоковой загрузкой экспертов с SSD.

6.3kSwift
031 янв. 1 г.

formetaohy/Thuban

Быстрый движок инференса больших языковых моделей на Rust и WGPU с вычислениями через переносимые шейдеры без зависимости от CUDA.

47Rust
041 нед. назад

patchy631/time-to-first-token

Практическая программа по запуску, измерению и оптимизации сервиса инференса LLM на базе vLLM и SGLang с воспроизводимыми нагрузочными тестами.

754HTML
051 янв. 1 г.

antonellof/ferrox

Чистый Rust-движок для запуска плотных и MoE-моделей GGUF на CPU, Apple Metal и CUDA через CLI и OpenAI-совместимый сервер.

39Rust
061 янв. 1 г.

zeraix/zeraix

Открытое настольное приложение для запуска локальных моделей, работы с файлами, инструментами и агентами на macOS и Windows.

354TypeScript
071 янв. 1 г.

amitshekhariitbhu/llm-inference-engineering

Learn LLM Inference Engineering step by step - from KV cache, PagedAttention, and continuous batching to vLLM, SGLang, and GPUs.

214Markdown
081 янв. 1 г.

MADEVAL/FerryAI

Библиотека для локального запуска ONNX, GGUF и RubixML-моделей внутри PHP через FFI с чатами, эмбеддингами, RAG и векторным поиском.

39PHP
091 янв. 1 г.

pur4v/p2ptokens

Rust-платформа для peer-to-peer вывода LLM: узлы одновременно обслуживают и используют запросы, обменивая вычислительный ресурс через подписанный баланс.

28Rust