← Все репозитории

Новый проект

William-Lu-stack/Flawless

Управляет инцидентами Kubernetes и облачной инфраструктуры через доказательную диагностику, согласованные изменения, проверку восстановления и аудит действий.

Открыть GitHub
Stars
781
Forks
165
Язык
Python
Статус
В канале 1 янв. 1 г.

AI-разбор

Flawless — управляющая платформа SRE для Kubernetes и облачной инфраструктуры, которая объединяет обнаружение инцидента, сбор доказательств, анализ топологии, согласование изменений, контролируемое исправление и проверку восстановления. Архитектура включает веб-консоль, API управляющего контура, конвейер доказательств, конечный автомат заданий по исправлению, контроль релизов и SLO, реестры знаний и моделей, а также MCP-инструменты Kubernetes и специализированных агентов. Платформа интегрируется с Rancher, Prometheus, Loki, Tempo, Grafana, CMDB, eBPF-потоками и Langfuse, поддерживает Skills, базу знаний и сравнение результатов моделей. Изменения защищены RBAC, предварительным просмотром, ручным подтверждением, аудитом, ограничениями риска, откатом и обязательной проверкой симптома после выполнения. Для запуска доступны Docker Compose и нативный режим с Python 3.11+ и Node.js 20+, при этом модель и доступ к Kubernetes можно подключить отдельно; лицензия PolyForm Noncommercial ограничивает коммерческое использование.

Кому подойдёт

SRE-инженеры, DevOps-команды, платформенные инженеры и администраторы Kubernetes, которым нужны проверяемая автоматизация инцидентов, управляемые изменения, контроль рисков и полный аудит восстановления.

Что внутри

  • Консоль SRE Chat с контекстом кластера, пространства имён, рабочей нагрузки и уровня риска.
  • Очередь инспекций для плановых и ручных проверок областей Rancher и Kubernetes с ранжированием серьёзности.
  • Контролируемое исправление: сбор доказательств, предварительный просмотр, ручное подтверждение, выполнение, проверка восстановления и повторное планирование.
  • Анализ топологии, зависимостей и радиуса воздействия с поддержкой CMDB, eBPF и потоков данных.
  • Управление релизами через SLO, бюджет ошибок, канареечные развёртывания, риск-шлюзы и аудит изменений.
  • Библиотека Skills, база знаний, подключение совместимых с OpenAI шлюзов моделей и сохранение истории эффективности исправлений.

Где применять

  • Диагностика и безопасное устранение сбоев Pod, Deployment и других ресурсов Kubernetes с обязательным подтверждением оператора.
  • Проверка влияния релиза и поэтапное развёртывание изменений с контролем SLO, канареечными ограничениями и автоматическим откатом.
  • Анализ инцидентов, затрагивающих сервисы, хранилища, узлы, базы данных, сетевые зависимости и наблюдаемость.
  • Создание внутренней базы эксплуатационных знаний и повторное использование Skills для стандартизации работы SRE-команд.
  • Сравнение моделей и накопление доказательств эффективности исправлений после перезапусков и последовательных заданий.

Темы