本系列以概念+實作,從 SRE 基礎打造 AI SRE Lab。使用 FastAPI、Docker、Prometheus、Grafana、Loki、OpenTelemetry 與 LLM Tracing,實作 SLI/SLO、Error Budget、可觀測性、告警、事故處理與 CI/CD。
並探討 LLM、RAG、Agent 的 TTFT、檢索失敗、語意品質、安全與成本。Production AI 不會取代 SRE,而是將可靠性從 API 延伸到 Workflow、Model Behavior 與使用者任務成功。
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:error budget 不是故障額度,而是 SLO 留下...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:算出 burn rate 只是前半段,真正決定行為的是把它...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:metrics 回答「有沒有問題」,logs 回答「發生了...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:trace 要拆到能做決定、metrics label 要...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:Golden Signals、RED、USE 是選問題的框...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:框架選對只是起點,真正驗證它有沒有用,要靠實作把三套框架接...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:LLM trace 的目標不是蒐集 prompt,而是用最...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:schema 只是紙上談兵,真正決定一條 trace 能不...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:好的 dashboard 由使用者影響往下鑽,第一頁先回答...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:一張圖光有正確的位置還不夠,query 語意、drill-...