本系列以概念+實作,從 SRE 基礎打造 AI SRE Lab。使用 FastAPI、Docker、Prometheus、Grafana、Loki、OpenTelemetry 與 LLM Tracing,實作 SLI/SLO、Error Budget、可觀測性、告警、事故處理與 CI/CD。
並探討 LLM、RAG、Agent 的 TTFT、檢索失敗、語意品質、安全與成本。Production AI 不會取代 SRE,而是將可靠性從 API 延伸到 Workflow、Model Behavior 與使用者任務成功。
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:Fault、Error、Failure 位在不同層次。先壓...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:failure mode 不是一張「可能出錯」的清單,而...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:因果鏈只有寫在文章裡不算數,要能在 telemetry 裡...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:configuration failure 最快發生也最...
GitHub:darkstar1227/learning-sre-for-ai-era **一句話先講完:**AI workflow 的 failure...
GitHub:darkstar1227/learning-sre-for-ai-era **一句話先講完:**同一個 request 能不能被安全交付,不...
GitHub:darkstar1227/learning-sre-for-ai-era **一句話先講完:**只要一個元件失效就讓使用者工作無法完成,它就...
GitHub:darkstar1227/learning-sre-for-ai-era **一句話先講完:**failover 能不能真的接手,不能只看架...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:SLI 是量測結果,SLO 是團隊的目標,SLA 是對外承...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:分子分母定義得再漂亮,沒量出來、沒告警規則接住,也只是一份...