← Все репозитории

Новый проект

Saivineeth147/lora-speedrun

Открытый бенчмарк для сравнения скорости LoRA-тонкой настройки языковых моделей на фиксированных задачах и одной видеокарте L40S.

Открыть GitHub
Stars
147
Forks
10
Язык
Python
Статус
В канале 1 янв. 1 г.

AI-разбор

Проект задаёт воспроизводимую площадку для ускорения LoRA-тонкой настройки языковых моделей с измерением реального времени обучения. В Track 1 модель Qwen2.5-1.5B обучается на GSM8K до точности не менее 57%, а в Track 2 SmolLM2-1.7B на SQuAD v1.1 до 75,5% exact match; оба трека используют одну L40S с 48 ГБ памяти и ограничение в 30 млн обучаемых параметров. В репозитории есть эталонные и пользовательские submissions, спецификации YAML, локальный и Modal-запуск, автоматическая оценка, аудит адаптера и проверка хешей модели и данных. Каждый кандидат проверяется три раза с разными начальными значениями в изолированной среде без сети, а официальным результатом считается среднее время при успешном прохождении всех запусков. Таблица лидеров и отчёты фиксируют применённые методы, включая упаковку последовательностей, маскирование loss только по ответу, pruning данных, объединённые GEMM-операции и покомпонентное вычисление cross-entropy.

Кому подойдёт

Исследователи и инженеры по машинному обучению, разработчики LoRA и PEFT, специалисты по оптимизации GPU-кода, авторы обучающих пайплайнов и участники открытых технических бенчмарков.

Что внутри

  • Два фиксированных трека для GSM8K и SQuAD v1.1 с заданными моделями, метриками и порогами качества
  • Публичная таблица лидеров с историей результатов, временем обучения, точностью и описанием техник ускорения
  • Harness для запуска и проверки submissions на Modal L40S, включая режим одного запуска и трёхкратную верификацию
  • Статическая проверка кода, автоматический security screen, сетевой sandbox и аудит отсутствия вмешательства в модель и данные
  • Поддержка локальной отладки на видеокартах от 24 ГБ с отделением неофициального времени от рейтингового
  • Примеры оптимизаций LoRA: sequence packing, completion-only loss, pruning данных, fused GEMM и chunked cross-entropy

Где применять

  • Сравнение вариантов LoRA, QLoRA, DoRA, rsLoRA и собственных ядер на одинаковой задаче и оборудовании
  • Проверка, дают ли оптимизации загрузки данных, упаковки последовательностей и вычисления loss измеримое ускорение
  • Публикация воспроизводимого результата в открытом рейтинге с независимым повторением и отчётом о механизме ускорения
  • Локальная разработка и предварительное тестирование скриптов тонкой настройки перед официальным запуском на Modal
  • Обучение исследователей и инженеров методам честного бенчмаркинга ускорителей обучения языковых моделей

Темы