本系列以概念+實作,從 SRE 基礎打造 AI SRE Lab。使用 FastAPI、Docker、Prometheus、Grafana、Loki、OpenTelemetry 與 LLM Tracing,實作 SLI/SLO、Error Budget、可觀測性、告警、事故處理與 CI/CD。
並探討 LLM、RAG、Agent 的 TTFT、檢索失敗、語意品質、安全與成本。Production AI 不會取代 SRE,而是將可靠性從 API 延伸到 Workflow、Model Behavior 與使用者任務成功。
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:availability 要以有效使用者請求的結果計算;只...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:availability 不能只看 28 天的長期比率,也...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:平均 latency 能掩蓋少數非常慢的請求;互動服務要同...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:histogram 埋對了只是起點,dashboard 要...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:好的 SLI 靠近使用者結果、能驅動動作,且不需要為了好看...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:規格寫得再漂亮,沒有查詢跟反例驗證過,都只是紙上的承諾;這...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:LLM application 要同時定義 system...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:事件契約定義好只是起點;真正決定值班工程師能不能在深夜迅速...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:AI 的 task success、quality 與 s...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:把 task success、quality、safety...