Новый проект
Red-EAD/FlowBlock
Обучение не требуется: FlowBlock ускоряет блочную генерацию LLaDA за счёт волнового планирования, совместного уточнения блоков и эффективной пакетной обработки на GPU.
- Stars
- ★ 122
- Forks
- ⑂ 2
- Язык
- Python
- Статус
- В канале 1 янв. 1 г.
AI-разбор
FlowBlock — фреймворк без дополнительного обучения для параллельного декодирования блочных диффузионных языковых моделей, включая LLaDA-2.1. Он заменяет строго последовательное ожидание завершения предыдущего блока волновым планированием: следующий блок запускается по порогу готовности, получает информативный черновик и уточняется совместно с активными блоками. Механизм Gated Wavefront Decoding управляет окном активных блоков, применяет редактирование T2T, сохраняет порядок фиксации и повторно использует KV-кэш замороженного префикса через блочно-каузальную маску. Heterogeneous Wavefront Packing поддерживает отдельные волновые окна для запросов и объединяет их в плотные пакетные проходы со стабильными формами, используя SGLang и CUDA-графы в модельном исполнителе. В репозитории есть декодеры FlowBlock и последовательных базовых методов LLaDA, реализация моделей LLaDA-2 MoE, сценарии оценки через lm-eval и инструменты агрегации результатов; для запуска требуются Linux, NVIDIA GPU примерно с 80 ГБ памяти для контрольных точек 16B-A1B, драйвер CUDA 12.x и Python 3.11, а выполнение тестов кода запускает сгенерированный Python и должно проходить в изолированной среде.
Исследователи и инженеры, работающие с диффузионными языковыми моделями, ускорением инференса, пакетным обслуживанием запросов и оценкой математических или программных способностей LLM на GPU.
Что внутри
- Волновое планирование GWD с порогом готовности SPAWN_TH и ограниченным размером окна.
- Совместное уточнение активных блоков с использованием M2T и T2T-декодирования и фиксацией блоков по порядку.
- Пакетирование HWP для объединения независимых волновых окон разных запросов в плотные GPU-проходы.
- Интеграция с SGLang, CUDA-графами, KV-кэшем и моделями LLaDA-2 MoE.
- Сценарий run_eval.sh для сравнения FlowBlock с LLaDA-2.0 и LLaDA-2.1 на математических и программных тестах.
Где применять
- Оценка ускорения диффузионных языковых моделей на GSM8K, MATH500, Algebra и ASDIV.
- Пакетное серверное выполнение генерации ответов с повышением пропускной способности GPU.
- Сравнение скорости, задержки и точности LLaDA-2.0, LLaDA-2.1 и FlowBlock на задачах генерации кода.
- Исследовательские эксперименты с размером блока, размером волнового окна, порогами фиксации и пакетной обработкой.
Темы