本系列以概念+實作,從 SRE 基礎打造 AI SRE Lab。使用 FastAPI、Docker、Prometheus、Grafana、Loki、OpenTelemetry 與 LLM Tracing,實作 SLI/SLO、Error Budget、可觀測性、告警、事故處理與 CI/CD。
並探討 LLM、RAG、Agent 的 TTFT、檢索失敗、語意品質、安全與成本。Production AI 不會取代 SRE,而是將可靠性從 API 延伸到 Workflow、Model Behavior 與使用者任務成功。
GitHub:darkstar1227/learning-sre-for-ai-eraSetting Up the Lab Before We Break T...
GitHub:darkstar1227/learning-sre-for-ai-era Using LLM Tracing to See Inside an...
GitHub:darkstar1227/learning-sre-for-ai-era Building an SRE Lab with FastAPI,...
GitHub:darkstar1227/learning-sre-for-ai-era 昨天,我們建立了一套看起來很健康的 SRE Lab: Client...
GitHub:darkstar1227/learning-sre-for-ai-era What Is Site Reliability Enginee...
GitHub:darkstar1227/learning-sre-for-ai-era DevOps, SRE, and Platform Enginee...
GitHub:darkstar1227/learning-sre-for-ai-era Reliability Is More Than Uptime:...
GitHub:darkstar1227/learning-sre-for-ai-era 結論先說:HTTP 200、模型回覆完成、trace 全綠,都只能...
GitHub:darkstar1227/learning-sre-for-ai-era **先講結論:**AI 服務的 HTTP 200,只能說這次請求沒...
GitHub:darkstar1227/learning-sre-for-ai-era **先講結論:**Service 是為使用者完成一項工作所需的系統...