← Все репозитории

Новый проект

scenepilotLLM/scenepilot

Самостоятельно размещаемый API на TypeScript для очистки HTML, преобразования страниц в Markdown и JSON, а также рекурсивного обхода сайтов.

Открыть GitHub
Stars
48
+2 за 7 дней
Forks
9
Язык
Python
Статус
В канале 1 янв. 1 г.

AI-разбор

SparkFetch получает веб-страницы по URL и преобразует необработанный HTML в чистый Markdown, структурированный JSON или обычный текст. Проект предоставляет отдельные операции для извлечения одной страницы, рекурсивного обхода сайта с ограничением глубины и числа страниц, а также обнаружения доступных URL на домене. В ответах могут присутствовать заголовок, описание, исходный URL, код состояния, время загрузки, ссылки и содержимое страницы; для очистки предусмотрены включение и исключение HTML-тегов. API реализован на TypeScript с использованием Node.js 24 и Express 5, а маршруты организованы как версионируемый API. В репозитории также находятся OpenAPI 3.1 спецификация, сгенерированные схемы валидации Zod, схема базы данных для Drizzle ORM и рабочий процесс CI GitHub Actions. Проект поддерживает самостоятельное размещение, требует Node.js 18 или новее, pnpm 9 или новее и переменную DATABASE_URL для запуска конфигурации с базой данных.

Кому подойдёт

Разработчики AI-приложений, RAG-систем, исследовательских инструментов и поисковой индексации, которым нужен self-hosted API для программного сбора и очистки веб-контента.

Что внутри

  • Извлечение одной веб-страницы через POST /api/v1/scrape с выдачей Markdown и метаданных
  • Рекурсивный обход сайтов через POST /api/v1/crawl с ограничением глубины, количества страниц и исключаемых путей
  • Проверка состояния фоновой задачи обхода через GET /api/v1/crawl/:jobId
  • Обнаружение URL на домене через POST /api/v1/map
  • Очистка содержимого от навигации, рекламы и служебной разметки с настройкой включаемых и исключаемых тегов
  • OpenAPI 3.1, схемы валидации Zod, Drizzle ORM и endpoint проверки состояния сервиса

Где применять

  • Подготовка очищенного Markdown для контекста LLM и RAG-конвейеров
  • Пакетный сбор материалов из исследовательских источников с извлечением структурированных данных
  • Периодический мониторинг содержимого веб-страниц и отслеживание изменений
  • Формирование наборов данных из открытых веб-сайтов в формате структурированного JSON
  • Индексация сайтов с документацией для последующего поиска

Темы