在 BigQuery 的費用監控中,其實大部分都是運算費用居多,儲存費用是占比很小的。 不過我們還是有監控資料表的靜態資訊,看看容量大、又長時間沒有人更新的資料...
還記得我們第一次寫的 first_dag 嗎?當時只是基本的寫了一個 DAG 的雛形,在經過這幾天更了解 DAG 各個元件之後,大家是不是覺得躍躍欲試呢,相信大...
到目前為止我們了解,DAG 如何建立,如何設定關聯關係,如何傳遞變數。而在Data pipeline 當中還有很重要的一個部分是與外部系統溝通。 Airflow...
前言 mentor:幫我研究一下ETLETL 的介紹ETL有哪些套件( 幫我比較至少三個ETL的套件 ) 由於之後專案需求要做到多項系統整合,因此會有各種資...
啊今天先來簡單介紹一下什麼事ArrayType()ArrayType()主要是將Array放入整個dataframe 中,然後Do Re Mi So你的Data...
相信經過前一篇落落長的說明後,應該很了解regular expression是在幹嘛了吧那我們今天就開始來進入Pyspark與regular expressio...
昨天講完了如何處理timestamp()的時間格式該如何處理,今天就讓我們來看看,最大宗的部分,字串!講到字串,最常使用的就是大名鼎鼎的split(),subs...
在多數情況下,使用to_timestamp(),幾乎可以解決掉所有的時間轉換問題,但Data Cleaning 是永遠不會讓你好過的,那這時候可以怎麼做呢?這時...
各種各樣的轉換,時間今天是星期五,應該是容許水一天的吧 1. to_timestamp(col,format) 基本上就是針對日期格式做相對應的轉換! 詳細情...
在資料處理的領域,除了前幾天說的那些overview之外,了解了整個宏觀的資料集,我們還是會需要深入去確認資料的樣態,當資料集有排序性的時候,使用show(),...
過濾一些選擇,可以得到更好的資訊,或許也可以成為一個更好的人吧?就像你要找一個非常優秀的吹風機時,你也會在購物網站下一些特定的filter()讓你能夠更快速的選...
在前幾天的內容當中,我們陸續介紹了 Data pipeline、Data pipeline 的種類、資料處理,資料品質等主題,相信大家對於 Data pipel...
管線無所不在,雖然說日常生活中常常不會注意到其存在,但是卻對我們的生活影響非常大。舉例來說,在做裝潢時,就必須要把未來房屋的使用情景進行評估。並且需要針對屋主進...
21天可以養成一個好習慣, 但3天就可以放棄, 但我今天還是準時坐在這裡, 所以今天你的選擇是什麼呢?我們今天要來討論的是,選擇阿不是啦是select() 其實...
"那個Timmy啊,廠商那邊又有多一組類型的資料,你再幫忙收一下""Jerry,資料好像有少喔,幫忙看一下是哪邊的問題,以後看到類...
上一篇簡述了5個讀取資料的方法,是不是開始迫不及待的想要馬上開始進行Data的操作啦先別急先別急,在我們開始實際針對DataFrame 進行操作之前, 先來看看...
啊,忽然不知不覺就是第二天挑戰了,但是腦子還是一片混亂, 所以我們還是就來簡單説説作為一個資料工程師,在胡搞瞎搞馬上要入手時,第一個該開始的地方Create(至...
前言 1. What is Pyspark ? PySpark 顧名思義,也就是Python 的一個Spark Library,主要是利用Python語法結合S...
資料的層次 2020 年受邀到台北商業大學授課,當時為了讓同學們了解「資料的層次」,以及“data”、“information”、“file”與“Big dat...
前言 滿多預計要討論的其他Task最後都沒有實作到,居然意外變成是純粹以Classification為例的深度學習實作範例了!在此作為系列篇的最後一篇,打算分享...
前文 我們前兩天介紹完Azure的基本Az-900,以及有關Azure在人工智慧、機器學習方面的檢測,就是特化版的AI-900,今天要來介紹另一個特化版,有關資...
前言 那其實我這次報名競賽的題目為Azure的介紹以及應用,主題選的是AI&Data,那問題就來了,AI跟Data到底跟Azure有什麼關係呢? Azu...
Hi, day16 也是tableau desktop的第一篇文章, 相信大家都會製作圓餅圖了, 若今天要製作雙層的呢? 也就是甜甜圈圖(dount chart...
前言 上一篇介紹完雲端服務後,這一篇文章我想要介紹Azure雲端服務到底提供什麼功能,讓大家知道它可以運用在什麼地方,但其Azure可以延伸應用非常多,這邊只是...
Hi, day15來到了tableau prep的最後一篇文章 前面介紹了14篇關於tableau prep的操作, 這邊或許有些人會有疑問為什麼需要做資料清理...
前言 如果你是個在資訊科系中打滾的大學生,或是在科技業中游走的上班族,無可避免地會接觸到雲端這塊,其實這幾年雲端的發展越來越完整,趨勢也越來越好,企業端對雲端的...
Hi, day14我們來講當我們將資料清理成我們的需求格式後, 該如何輸出檔案? 在tableau prep中提供了三種輸出的選項 輸出至本機端的檔案(exc...
Hi, day13快要到本次系列文tableau prep的部分尾聲了前面幾篇主要是在解說資料ETL的T(Transform)的部分, 也是最核心的 今天來講解...
前言 再介紹Azure是什麼之前,我們要先了解什麼是雲端服務 雲端服務 雲端服務:是一種符合商業需求的網路作業服務,讓使用者不用購買軟體,只需透過電腦連接遠端伺...
Hi, day12我們來講更進階的正則表達式這次會用到以下這兩個函式REGEXP_REPLACE(多重自訂規則取代字元)REGEXP_EXTRACT(多重自訂規...