← Все репозитории

Популярный проект

PaddlePaddle/PaddleOCR

PaddleOCR превращает PDF и изображения в структурированные данные для LLM: Markdown, JSON, поддержка 100+ языков.

Открыть GitHub
Stars
88.1k
+423 за 7 дней
Forks
11.2k
Язык
Python
Статус
В канале 1 янв. 1 г.

AI-разбор

PaddleOCR — это лёгкий и мощный OCR-инструментарий на Python, который преобразует PDF и изображения в структурированные данные (Markdown/JSON), готовые для подачи в большие языковые модели. Проект включает флагманскую модель PaddleOCR-VL-1.6 (0.9B) с точностью 96.3% на бенчмарке OmniDocBench v1.6, а также пайплайн PP-StructureV3 для извлечения таблиц, формул и текста с координатами. Подходит для построения RAG-систем, агентов и интеллектуальной обработки документов на 100+ языках.

Кому подойдёт

Разработчики RAG-систем и AI-агентов, инженеры по обработке документов, исследователи в области Document AI и OCR, команды, которым нужно многоязычное распознавание текста в прода…

Что внутри

  • PaddleOCR-VL-1.6 (0.9B) — компактная VLM для разбора документов с SOTA-результатами на OmniDocBench v1.6
  • PP-StructureV3 — структурное преобразование PDF и изображений в Markdown/JSON с координатами ячеек таблиц и текста
  • PP-OCRv6 — распознавание текста на 100+ языках, единая модель для 50 языков (китайский, английский, японский, 46 латинских)
  • Глубокая интеграция с экосистемой AI-агентов: Dify, RAGFlow, Pathway, Cherry Studio
  • Развёртывание на CPU, NVIDIA GPU, Intel CPU, Kunlunxin XPU, NPU, а также в браузере через PaddleOCR.js

Где применять

  • Подготовка данных для RAG-пайплайнов и LLM-агентов из PDF и сканов
  • Пакетное распознавание многоязычных документов (формы, таблицы, формулы, печати, графики)
  • OCR сцен: уличные вывески, документы, ID-карты, промышленные компоненты
  • Конвертация Word, Excel, PowerPoint и PDF в Markdown с экспортом в DOCX

Темы