Новый проект
Saivineeth147/lora-speedrun
Открытый бенчмарк для сравнения скорости LoRA-тонкой настройки языковых моделей на фиксированных задачах и одной видеокарте L40S.
- Stars
- ★ 147
- Forks
- ⑂ 10
- Язык
- Python
- Статус
- В канале 1 янв. 1 г.
AI-разбор
Проект задаёт воспроизводимую площадку для ускорения LoRA-тонкой настройки языковых моделей с измерением реального времени обучения. В Track 1 модель Qwen2.5-1.5B обучается на GSM8K до точности не менее 57%, а в Track 2 SmolLM2-1.7B на SQuAD v1.1 до 75,5% exact match; оба трека используют одну L40S с 48 ГБ памяти и ограничение в 30 млн обучаемых параметров. В репозитории есть эталонные и пользовательские submissions, спецификации YAML, локальный и Modal-запуск, автоматическая оценка, аудит адаптера и проверка хешей модели и данных. Каждый кандидат проверяется три раза с разными начальными значениями в изолированной среде без сети, а официальным результатом считается среднее время при успешном прохождении всех запусков. Таблица лидеров и отчёты фиксируют применённые методы, включая упаковку последовательностей, маскирование loss только по ответу, pruning данных, объединённые GEMM-операции и покомпонентное вычисление cross-entropy.
Исследователи и инженеры по машинному обучению, разработчики LoRA и PEFT, специалисты по оптимизации GPU-кода, авторы обучающих пайплайнов и участники открытых технических бенчмарков.
Что внутри
- Два фиксированных трека для GSM8K и SQuAD v1.1 с заданными моделями, метриками и порогами качества
- Публичная таблица лидеров с историей результатов, временем обучения, точностью и описанием техник ускорения
- Harness для запуска и проверки submissions на Modal L40S, включая режим одного запуска и трёхкратную верификацию
- Статическая проверка кода, автоматический security screen, сетевой sandbox и аудит отсутствия вмешательства в модель и данные
- Поддержка локальной отладки на видеокартах от 24 ГБ с отделением неофициального времени от рейтингового
- Примеры оптимизаций LoRA: sequence packing, completion-only loss, pruning данных, fused GEMM и chunked cross-entropy
Где применять
- Сравнение вариантов LoRA, QLoRA, DoRA, rsLoRA и собственных ядер на одинаковой задаче и оборудовании
- Проверка, дают ли оптимизации загрузки данных, упаковки последовательностей и вычисления loss измеримое ускорение
- Публикация воспроизводимого результата в открытом рейтинге с независимым повторением и отчётом о механизме ускорения
- Локальная разработка и предварительное тестирование скриптов тонкой настройки перед официальным запуском на Modal
- Обучение исследователей и инженеров методам честного бенчмаркинга ускорителей обучения языковых моделей
Темы