← Все репозитории

Популярный проект

microsoft/markitdown

Python-утилита от Microsoft для конвертации PDF, Word, Excel, PowerPoint, изображений и аудио в Markdown, оптимизированный для LLM.

Открыть GitHub
Stars
176.6k
+2.5k за 7 дней
Forks
13k
Язык
Python
Статус
В канале 10 июл. 2026 г.

AI-разбор

MarkItDown — лёгкая Python-библиотека для преобразования различных файлов в Markdown с сохранением структуры документа: заголовков, списков, таблиц и ссылок. Поддерживает PDF, PowerPoint, Word, Excel, изображения (с OCR и EXIF), аудио (с транскрипцией), HTML, CSV, JSON, XML, ZIP, EPub и YouTube-ссылки. Результат ориентирован на подачу в LLM и текстовые пайплайны, а не на финальную вёрстку для людей.

Кому подойдёт

Python-разработчики и инженеры по данным, строящие пайплайны с LLM, RAG-системы и инструменты текстовой аналитики

Что внутри

  • Поддержка PDF, DOCX, PPTX, XLSX, изображений, аудио, HTML, CSV, JSON, XML, ZIP, EPub и YouTube
  • Сохранение структуры документа: заголовки, списки, таблицы, ссылки
  • Интеграция с Azure Document Intelligence и Azure Content Understanding для облачного распознавания
  • Описание изображений через LLM (OpenAI и совместимые клиенты) и OCR-плагин
  • CLI, Python API, Docker и система сторонних плагинов

Где применять

  • Подготовка офисных документов и PDF для подачи в LLM и RAG-пайплайны
  • Извлечение текста и структуры из PDF, презентаций и таблиц для аналитики
  • Транскрибация аудио и распознавание текста на изображениях через облачные сервисы Azure
  • Пакетная конвертация файлов из ZIP-архивов в Markdown

Темы