Новый проект
amitshekhariitbhu/transformers-explained
Учебная серия о полной архитектуре Transformer: механизмах внимания, позиционных представлениях, нормализации, MoE и Vision Transformer.
- Stars
- ★ 184 ↗ +6 за 7 дней
- Forks
- ⑂ 19
- Язык
- n/a
- Статус
- В канале 1 янв. 1 г.
AI-разбор
Проект представляет собой структурированную учебную серию статей и видео о том, как устроена архитектура Transformer и современные большие языковые модели. Материал начинается с токенизации, встраивания, позиционного кодирования, Encoder и Decoder, а затем подробно разбирает Self Attention, Query, Key, Value, Multi-Head Attention, Cross Attention и причинное маскирование. Отдельные разделы посвящены Grouped-Query Attention, Multi-Query Attention, Flash Attention, RoPE, Feed-Forward Networks, Layer Normalization и RMSNorm. Также рассматриваются варианты Mixture of Experts и Vision Transformer с обработкой изображений через патчи и токены. README не указывает на программную библиотеку, исполняемые примеры или внешние интеграции; проект распространяется по лицензии Apache License 2.0.
Студенты, начинающие и практикующие разработчики машинного обучения, инженеры по LLM и исследователи, которым нужно системно разобраться в устройстве Transformer без привязки к конкретному программному фреймворку.
Что внутри
- Пошаговое описание полной архитектуры Transformer и потока данных между её компонентами
- Разбор формул и числовых примеров для Attention, Query, Key, Value и масштабирования на квадратный корень из размера ключа
- Сравнение Self Attention, Cross Attention, Multi-Head Attention, Multi-Query Attention и Grouped-Query Attention
- Объяснение позиционных представлений, включая RoPE, а также причинного маскирования и Flash Attention
- Разбор Feed-Forward Networks, Layer Normalization, Batch Normalization, RMSNorm и их места в Transformer-блоке
- Материалы о вариантах Mixture of Experts и Vision Transformer
Где применять
- Изучение архитектуры Transformer перед разработкой или обучением языковых моделей
- Подготовка к собеседованиям и техническим обсуждениям по Attention, LLM и нейросетевым архитектурам
- Разбор математических основ механизмов внимания через последовательные объяснения и числовые примеры
- Знакомство с оптимизациями и вариантами архитектуры, включая Flash Attention, GQA, MoE и RMSNorm
- Понимание применения Transformer к изображениям через архитектуру Vision Transformer
Темы