嗨嗨大家好!今天我們終於要進入 SRE 方法論的最後一條:效率與性能,這裡是今天讀的原文出處:Introduction,那我們開始囉! 書中提到: 一個服務的...
前言 前面介紹的 P0 事件中,經過調查後,大部分的成因來自於公司外部,因此相對沒有什麼下手的空間。當然,第二個事件中還有 memory leak 的問題,而該...
嗨嗨大家好!這週是漫長的一週!今天我們要繼續 SRE 方法論的第六條:資源部署,這裡是今天讀的原文出處:Introduction,那我們開始囉! 書中提到資源部...
前言 這個 P0 事件是在筆者參賽鐵人賽時發生的,而發生事件的當下,筆者正準備想要趕一下鐵人賽進度^^ 事件經過 警報與初步處置 這個事件本身與上一篇文章中提到...
終於週五了!!!今天我們要繼續 SRE 方法論的第五條:需求預測和容量規劃,這裡是今天讀的原文出處:Introduction,那我們開始囉! 需求預測和容量規...
前言 前面已經介紹過了一個非常有趣的 P0 事件,這次則要介紹另一個同樣非常值得分享的事件。而且該事件的根本成因一直到現在都沒有完全解決,每隔一段時間就有可能再...
大家週四好,今天我們要繼續 SRE 方法論的第五條:變更管理,這裡是今天讀的原文出處:Introduction,往後偷翻幾頁發現這週應該可以把第一章完成(歡呼!...
前言 上一篇談到了這次 P0 事件中的警報過程,以及具體的事件成因。在這一篇中,就要介紹接下來的一連串處理流程,以及在整個流程中筆者自己有學到,也認為值得分享的...
大家週三好,嗚嗚這週要上六天班好漫長,今天我們要繼續 SRE 方法論的第四條:緊急事件處理,這裡是今天讀的原文出處:Introduction,話不多說,我們開始...
前言 P0 事件並不常發生,但只要一發生就非常刺激,說起鬼故事來一個比一個還要精彩。因此,這類型的故事講起來常常都能津津樂道一番。不過,如同戰爭中真正交火的時間...
週二安安,今天進到了 SRE 方法論的第三條:監控系統,這裡是今天讀的原文出處:Introduction,話不多說,我們開始囉! 書中提到一個監控系統裡會有三類...
前言 在日常維運系列中可以看到非常多的自動化小工具,無論是在〈維護模式〉提到為了快速進出維護模式和調整白名單而開發的小工具,還是上一篇單純為了省時間而開發的小工...
週一大家好!今天繼續來閱讀第二條 SRE 方法論:在保障服務 SLO 的前提下最大化迭代速度,這裡是今天讀的原文出處:Introduction,話不多說,我們開...
前言 之前的文章中帶到了 3 個大型的維運工作,接下來緩口氣,來分享一些比較單純的日常維運工作,帶給各位更日常的感受,也同時為接下來即將進入的 P0 事件系列暖...
前言 前面介紹完了註冊 OpsWorks 失敗的解決方案。這篇文章想分享一些在處理過程中值得分享的事情。 Userdata 的挑戰 shell script 第...
嗨嗨!大家週日好!昨天提到傳統 Dev 與 Ops 會產生的矛盾與衝突,並將內容延伸到為了解決這個問題, Google 組建了 SRE 團隊,期望將技術能力結合...
沒想到一開賽就遇到週末,週末最適合配著書,喝個下午茶拉!那麼今天先來了解一下傳統開發部門跟維運部門,以及 SRE 的前世今生吧!這裡是今天讀的原文出處:Intr...
前言 前一篇提到了 userdata 中透過 AWS CLI 來下達註冊 OpsWorks 的指令,會有失敗的可能性。這篇主要會來分享實驗過程與解決方式。 主文...
距離上次參加鐵人賽竟然已經過了三年!上次是寫跟專案管理有關的內容,這次竟然要挑戰 SRE 的系列文章?!「小姐,你是不是也太跳 Tone」 XD,沒錯!我就是一...
前言 介紹了兩個日常維運的系列之後,接下來想分享給各位的,是與部署工具相關的維運。SRE 和 DevOps 有時候相當難區分的地方就在於,維運本身有許多工作難以...
前言 前一篇文章提到了維護模式工具的改善結果,這篇文章主要分享的則會是 在整個過程中遇到的困難與挑戰,以及寫文章的當下,預期未來要改善方向。 困難 困難有大有小...
新工具簡介 在上一篇文章中分享了舊的維護模式工具的運作機制,以及該工具遇到的問題。 這篇文章將分享筆者重新設計後的維護模式工具,請見下圖: 上圖呈現了同一套架...
前言 之前提到的日常維運工作,主要源自於某個重大的 P0 事件。雖然我們一般會有大型維運工作都是因為某些不能忽視的 P0 事件,但也不全然是如此,比如接下來要分...
前言 上一篇文章中提到了關於棒球賽的改善策略以及針對改善策略的監控結果。這篇文章主要想分享的是在整個事件中額外觀察到的一些值得分享的兩件事情。 主文 負載平衡的...
前言 上一篇文章有提到棒球賽的事件本身,這篇開始,要提到調查的過程以及改善的策略。 雖然事件的主因看起來是很明顯的,也就是短時間內因為活動而大量湧入的使用者,對...
前言 之前的文章中提到了各種監控系統,但警報不會天天響, P0 事件也不會天天發生,因此筆者日常的工作,大多反而是與維運相關的事務。因此,接下來將進入日常維運系...
前言 上篇文章已經介紹了一個客製化的特別監控系統,這篇文章則會是另外一個,希望能夠藉由這2個系統,讓大家可能理解SRE是為了什麼而做監控。 這個監控系統主要是為...
背景 前一篇文章提到了第一波針對 APIGW 的監控修正,但因為最後發現的各種問題,導致我們要進行第二波針對這個監控的修正。 主要是,在某一次緊急的 P0 事件...
之前的文章有提到了基本的監控系統,接下來會是介紹為了專案各自的狀況而建立的特別監控系統。 背景故事 首先是監控客戶系統的部分,背景故事其實相當單純。我們的系統在...
在上一篇文章中介紹了基本的監控系統,並簡單帶到在發生警報時值班工程師的必須要做到的行動。這篇文章主要會介紹比較詳細的警報SOP,以及設置警報時的各種考量。 警報...