Новый проект
William-Lu-stack/Flawless
Управляет инцидентами Kubernetes и облачной инфраструктуры через доказательную диагностику, согласованные изменения, проверку восстановления и аудит действий.
- Stars
- ★ 781
- Forks
- ⑂ 165
- Язык
- Python
- Статус
- В канале 1 янв. 1 г.
AI-разбор
Flawless — управляющая платформа SRE для Kubernetes и облачной инфраструктуры, которая объединяет обнаружение инцидента, сбор доказательств, анализ топологии, согласование изменений, контролируемое исправление и проверку восстановления. Архитектура включает веб-консоль, API управляющего контура, конвейер доказательств, конечный автомат заданий по исправлению, контроль релизов и SLO, реестры знаний и моделей, а также MCP-инструменты Kubernetes и специализированных агентов. Платформа интегрируется с Rancher, Prometheus, Loki, Tempo, Grafana, CMDB, eBPF-потоками и Langfuse, поддерживает Skills, базу знаний и сравнение результатов моделей. Изменения защищены RBAC, предварительным просмотром, ручным подтверждением, аудитом, ограничениями риска, откатом и обязательной проверкой симптома после выполнения. Для запуска доступны Docker Compose и нативный режим с Python 3.11+ и Node.js 20+, при этом модель и доступ к Kubernetes можно подключить отдельно; лицензия PolyForm Noncommercial ограничивает коммерческое использование.
SRE-инженеры, DevOps-команды, платформенные инженеры и администраторы Kubernetes, которым нужны проверяемая автоматизация инцидентов, управляемые изменения, контроль рисков и полный аудит восстановления.
Что внутри
- Консоль SRE Chat с контекстом кластера, пространства имён, рабочей нагрузки и уровня риска.
- Очередь инспекций для плановых и ручных проверок областей Rancher и Kubernetes с ранжированием серьёзности.
- Контролируемое исправление: сбор доказательств, предварительный просмотр, ручное подтверждение, выполнение, проверка восстановления и повторное планирование.
- Анализ топологии, зависимостей и радиуса воздействия с поддержкой CMDB, eBPF и потоков данных.
- Управление релизами через SLO, бюджет ошибок, канареечные развёртывания, риск-шлюзы и аудит изменений.
- Библиотека Skills, база знаний, подключение совместимых с OpenAI шлюзов моделей и сохранение истории эффективности исправлений.
Где применять
- Диагностика и безопасное устранение сбоев Pod, Deployment и других ресурсов Kubernetes с обязательным подтверждением оператора.
- Проверка влияния релиза и поэтапное развёртывание изменений с контролем SLO, канареечными ограничениями и автоматическим откатом.
- Анализ инцидентов, затрагивающих сервисы, хранилища, узлы, базы данных, сетевые зависимости и наблюдаемость.
- Создание внутренней базы эксплуатационных знаний и повторное использование Skills для стандартизации работы SRE-команд.
- Сравнение моделей и накопление доказательств эффективности исправлений после перезапусков и последовательных заданий.
Темы