Популярный проект
PaddlePaddle/PaddleOCR
PaddleOCR превращает PDF и изображения в структурированные данные для LLM: Markdown, JSON, поддержка 100+ языков.
- Stars
- ★ 88.1k ↗ +423 за 7 дней
- Forks
- ⑂ 11.2k
- Язык
- Python
- Статус
- В канале 1 янв. 1 г.
AI-разбор
PaddleOCR — это лёгкий и мощный OCR-инструментарий на Python, который преобразует PDF и изображения в структурированные данные (Markdown/JSON), готовые для подачи в большие языковые модели. Проект включает флагманскую модель PaddleOCR-VL-1.6 (0.9B) с точностью 96.3% на бенчмарке OmniDocBench v1.6, а также пайплайн PP-StructureV3 для извлечения таблиц, формул и текста с координатами. Подходит для построения RAG-систем, агентов и интеллектуальной обработки документов на 100+ языках.
Разработчики RAG-систем и AI-агентов, инженеры по обработке документов, исследователи в области Document AI и OCR, команды, которым нужно многоязычное распознавание текста в прода…
Что внутри
- PaddleOCR-VL-1.6 (0.9B) — компактная VLM для разбора документов с SOTA-результатами на OmniDocBench v1.6
- PP-StructureV3 — структурное преобразование PDF и изображений в Markdown/JSON с координатами ячеек таблиц и текста
- PP-OCRv6 — распознавание текста на 100+ языках, единая модель для 50 языков (китайский, английский, японский, 46 латинских)
- Глубокая интеграция с экосистемой AI-агентов: Dify, RAGFlow, Pathway, Cherry Studio
- Развёртывание на CPU, NVIDIA GPU, Intel CPU, Kunlunxin XPU, NPU, а также в браузере через PaddleOCR.js
Где применять
- Подготовка данных для RAG-пайплайнов и LLM-агентов из PDF и сканов
- Пакетное распознавание многоязычных документов (формы, таблицы, формулы, печати, графики)
- OCR сцен: уличные вывески, документы, ID-карты, промышленные компоненты
- Конвертация Word, Excel, PowerPoint и PDF в Markdown с экспортом в DOCX
Темы