Новый проект
scenepilotLLM/scenepilot
Самостоятельно размещаемый API на TypeScript для очистки HTML, преобразования страниц в Markdown и JSON, а также рекурсивного обхода сайтов.
- Stars
- ★ 48 ↗ +2 за 7 дней
- Forks
- ⑂ 9
- Язык
- Python
- Статус
- В канале 1 янв. 1 г.
AI-разбор
SparkFetch получает веб-страницы по URL и преобразует необработанный HTML в чистый Markdown, структурированный JSON или обычный текст. Проект предоставляет отдельные операции для извлечения одной страницы, рекурсивного обхода сайта с ограничением глубины и числа страниц, а также обнаружения доступных URL на домене. В ответах могут присутствовать заголовок, описание, исходный URL, код состояния, время загрузки, ссылки и содержимое страницы; для очистки предусмотрены включение и исключение HTML-тегов. API реализован на TypeScript с использованием Node.js 24 и Express 5, а маршруты организованы как версионируемый API. В репозитории также находятся OpenAPI 3.1 спецификация, сгенерированные схемы валидации Zod, схема базы данных для Drizzle ORM и рабочий процесс CI GitHub Actions. Проект поддерживает самостоятельное размещение, требует Node.js 18 или новее, pnpm 9 или новее и переменную DATABASE_URL для запуска конфигурации с базой данных.
Разработчики AI-приложений, RAG-систем, исследовательских инструментов и поисковой индексации, которым нужен self-hosted API для программного сбора и очистки веб-контента.
Что внутри
- Извлечение одной веб-страницы через POST /api/v1/scrape с выдачей Markdown и метаданных
- Рекурсивный обход сайтов через POST /api/v1/crawl с ограничением глубины, количества страниц и исключаемых путей
- Проверка состояния фоновой задачи обхода через GET /api/v1/crawl/:jobId
- Обнаружение URL на домене через POST /api/v1/map
- Очистка содержимого от навигации, рекламы и служебной разметки с настройкой включаемых и исключаемых тегов
- OpenAPI 3.1, схемы валидации Zod, Drizzle ORM и endpoint проверки состояния сервиса
Где применять
- Подготовка очищенного Markdown для контекста LLM и RAG-конвейеров
- Пакетный сбор материалов из исследовательских источников с извлечением структурированных данных
- Периодический мониторинг содержимого веб-страниц и отслеживание изменений
- Формирование наборов данных из открытых веб-сайтов в формате структурированного JSON
- Индексация сайтов с документацией для последующего поиска
Темы