← Все репозитории

Новый проект

amitshekhariitbhu/transformers-explained

Учебная серия о полной архитектуре Transformer: механизмах внимания, позиционных представлениях, нормализации, MoE и Vision Transformer.

Открыть GitHub
Stars
181
+19 за 7 дней
Forks
17
Язык
n/a
Статус
В канале 1 янв. 1 г.

AI-разбор

Проект представляет собой структурированную учебную серию статей и видео о том, как устроена архитектура Transformer и современные большие языковые модели. Материал начинается с токенизации, встраивания, позиционного кодирования, Encoder и Decoder, а затем подробно разбирает Self Attention, Query, Key, Value, Multi-Head Attention, Cross Attention и причинное маскирование. Отдельные разделы посвящены Grouped-Query Attention, Multi-Query Attention, Flash Attention, RoPE, Feed-Forward Networks, Layer Normalization и RMSNorm. Также рассматриваются варианты Mixture of Experts и Vision Transformer с обработкой изображений через патчи и токены. README не указывает на программную библиотеку, исполняемые примеры или внешние интеграции; проект распространяется по лицензии Apache License 2.0.

Кому подойдёт

Студенты, начинающие и практикующие разработчики машинного обучения, инженеры по LLM и исследователи, которым нужно системно разобраться в устройстве Transformer без привязки к конкретному программному фреймворку.

Что внутри

  • Пошаговое описание полной архитектуры Transformer и потока данных между её компонентами
  • Разбор формул и числовых примеров для Attention, Query, Key, Value и масштабирования на квадратный корень из размера ключа
  • Сравнение Self Attention, Cross Attention, Multi-Head Attention, Multi-Query Attention и Grouped-Query Attention
  • Объяснение позиционных представлений, включая RoPE, а также причинного маскирования и Flash Attention
  • Разбор Feed-Forward Networks, Layer Normalization, Batch Normalization, RMSNorm и их места в Transformer-блоке
  • Материалы о вариантах Mixture of Experts и Vision Transformer

Где применять

  • Изучение архитектуры Transformer перед разработкой или обучением языковых моделей
  • Подготовка к собеседованиям и техническим обсуждениям по Attention, LLM и нейросетевым архитектурам
  • Разбор математических основ механизмов внимания через последовательные объяснения и числовые примеры
  • Знакомство с оптимизациями и вариантами архитектуры, включая Flash Attention, GQA, MoE и RMSNorm
  • Понимание применения Transformer к изображениям через архитектуру Vision Transformer

Темы