本系列以概念+實作,從 SRE 基礎打造 AI SRE Lab。使用 FastAPI、Docker、Prometheus、Grafana、Loki、OpenTelemetry 與 LLM Tracing,實作 SLI/SLO、Error Budget、可觀測性、告警、事故處理與 CI/CD。
並探討 LLM、RAG、Agent 的 TTFT、檢索失敗、語意品質、安全與成本。Production AI 不會取代 SRE,而是將可靠性從 API 延伸到 Workflow、Model Behavior 與使用者任務成功。
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:好的 alert 指向使用者影響、可由明確 owner 處...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:alert 寫對條件只是一半,另一半是通知真的送到對的人手...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:AI alerting 要依影響範圍與可行動性分流;mod...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:分流政策要能落地,還得再過三關——資料契約撐不撐得住 pa...