本系列以概念+實作,從 SRE 基礎打造 AI SRE Lab。使用 FastAPI、Docker、Prometheus、Grafana、Loki、OpenTelemetry 與 LLM Tracing,實作 SLI/SLO、Error Budget、可觀測性、告警、事故處理與 CI/CD。
並探討 LLM、RAG、Agent 的 TTFT、檢索失敗、語意品質、安全與成本。Production AI 不會取代 SRE,而是將可靠性從 API 延伸到 Workflow、Model Behavior 與使用者任務成功。
Github連結Setting Up the Lab Before We Break Things 在 Day 1,我們會建立第一條 AI Workflow T...
Day 01--用 LLM Trace 看見一次 AI Workflow 的完整生命週期 Using LLM Tracing to See Inside an...
Building an SRE Lab with FastAPI, Docker, Prometheus, Grafana, Loki, Tempo, and...