iT邦幫忙

data engineer相關文章
共有 159 則文章
鐵人賽 Software Development DAY 9

技術 Day 9|Schema、Array 與 RecordBatch

在 Apache Arrow 中,一張資料表不是一個模糊的「表格物件」,而是由三個核心概念組成: Schema → 定義欄位名稱、資料型別與欄位順序 Arra...

鐵人賽 Software Development DAY 8

技術 Day 8|認識 Apache Arrow:DataFusion 的資料基礎

Apache Arrow 是一套跨語言的欄式記憶體格式。 它不是資料庫,也不是只用來保存資料的檔案格式;它處理的是另一個問題: 資料進入記憶體後,要如何排列,...

鐵人賽 Software Development DAY 2

技術 Day 2|Stage 0(2/3):從零建立資料工程專案,先把專案架構和 Python 虛擬環境準備好

現在終於可以開啟 VS Code。還沒有 VS Code 的朋友可以先到官方網站下載安裝(這裡)。這裡就不另外介紹安裝流程,我們直接開始建立專案。 先建立專案架...

鐵人賽 Software Development DAY 1

技術 Day 1|Stage 0(1/3):資料工程到底在做什麼?

好,系列正式開始。不過我們還沒有要立刻寫程式。在開始寫 Python、PostgreSQL、dbt、Airflow、Docker 之前,我想先花一篇文章把這張「...

鐵人賽 Software Development DAY 1

技術 Day 0|簡介:數據專案從頭做起,跟著一個專案學資料工程

本系列主要聚焦於資料工程(Data Engineering),透過建立一條完整的資料處理 Pipeline,學習如何擷取、儲存、轉換與管理資料的相關概念。Pyt...

鐵人賽 Software Development DAY 7

技術 Day 7|Row-based vs Columnar:為什麼分析系統偏好欄式資料?

先說結論 分析系統偏好欄式資料(Columnar),主要是因為分析查詢常常會: 掃描大量資料。 但只使用其中少數幾個欄位。 進行篩選、分組與聚合,例如 WHE...

鐵人賽 Software Development DAY 6

技術 Day 6|為分析而生的 Parquet

前幾天收到一些讀者回饋,希望文章可以更像教材:先把概念與資料處理流程說清楚,再進入程式實作。 我覺得這個建議很好,謝謝大家給我回饋~ 對資料工程來說,成功把資料...

鐵人賽 Software Development DAY 5

技術 Day 5|JSON 資料也能直接 SQL 查詢

昨天我們將 CSV 註冊成 DataFusion 中的 Table,並使用 SQL 執行欄位選擇與資料篩選。 今天換成另一種常見的資料格式:JSON。 JSON...

鐵人賽 Software Development DAY 4

技術 Day 4|從 CSV 開始:讓檔案變成可以 SQL 查詢的 Table

昨天我們建立了第一個 DataFusion 專案,並使用 SessionContext 執行一段不需要外部資料的 SQL。 今天要開始處理真正的資料檔案。 我們...

鐵人賽 Software Development DAY 3

技術 Day 3|建立第一個 DataFusion 專案:相同結果的 SQL,真的一樣快嗎?

前兩天,我們先從概念上認識了 Query Engine,也知道 DataFusion 是一套使用 Rust 與 Apache Arrow 建立的查詢引擎。 今天...

鐵人賽 Software Development DAY 2

技術 Day 2|為什麼是 Rust × Apache DataFusion?

大家好,我是 Cady,目前就讀資管系,也正在參與 Apache DataFusion 的開源貢獻。 發現 Day 1 忘記介紹自己,來補充一下,免得很像 AI...

鐵人賽 Software Development DAY 1

技術 Day 1|資料工程不只是 ETL:SQL 背後發生了什麼?

前言 提到資料工程,你最先想到的可能是 ETL: 從 API、資料庫或檔案擷取資料 清理缺失值與錯誤格式 轉換欄位型別 將資料寫入 Data Warehous...

技術 BigQuery :: Reducing Storage Cost

簡單的幾個操作,降低 BigQuery 大筆的存儲費用!(理想情境中可以節省九成左右) BigQuery 的表格存儲一直以來都有很多項計費的模式,而主要分成兩...

技術 BigQuery :: Continuonus Query

BigQuery 近年來一直不斷擴充它功能的廣度,讓他遠遠不只是 Data Warehouse 這麼簡單,而是功能強大的 Data Platform(成本也越來...

徵才 【SHOPLINE 招募中】Backend (RoR, Go) / Data Engineer (Batch, Streaming) / Frontend (React) / SRE / QA

【關於工程團隊】SHOPLINE 台灣研發團隊有超過百位工程師,分為前後端、測試、數據、雲端維運等團隊,台北辦公室採混合辦公模式,目前 Backend、Fron...

技術 【Day 32】 蒐集證交所公開資料 / 取得每日成交量排行前二十大股票

在沒有行情的收盤或假日時段,也可以找點事情來做。 好比是回顧歷史,借古鑑今。 判斷一檔股票是否熱絡,可以直接從「交易量排行榜」很直觀地看出。 而去撈取交易量 “...

技術 【Day 29】 做題庫小試身手 - 11

先前我們針對 ExamTopics 的免費 32 題進行了準備。接下來,你還可以註冊 AWS Skill Builder 去看免費的課程,做免費題庫。(雖然根據...

鐵人賽 AI/ ML & Data DAY 30

技術 DAY 30 Dbt 跟文件說的不一樣!你真的需要 dbt 嗎?

為什麼我們需要 dbt?我們真的需要它嗎? 今天又在 Medium 看到這篇 No, Data Engineers Don’t NEED dbt.,在談論到底需...

技術 【Day 29】 做題庫小試身手 - 10

題目 題庫 Questions Q33 A company has a frontend ReactJS website that uses Amazo...

技術 Databricks Certified Data Engineer Associate 高分備考指南- Overview

前言 這是一篇關於如何取得Databricks Data Engineer Associate的備考指南,希望可以通過這一篇文章幫助大家也可以取得證照。 Pre...

技術 【Day 28】 做題庫小試身手 - 9

題目 題庫 Questions Q30 A company is migrating a legacy application to an Amazon...

技術 【Day 27】 做題庫小試身手 - 8

題目 題庫 Questions Q27 A company wants to implement real-time analytics capabil...

技術 【Day 26】 做題庫小試身手 - 7

題目 題庫 Questions Q23 A company currently stores all of its data in Amazon S3...

技術 【Day 25】 做題庫小試身手 - 6

題目 題庫 Questions Q19 A data engineer must orchestrate a series of Amazon Athe...

技術 【Day 24】 Amazon MQ / Amazon Managed Streaming for Apache Kafka (MSK)

RabbitMQ 是由 Rabbit 公司所開發。 不過因為公司被 VMware 收購再被 Broadcom 收購,是誰的好像不是那麼重要。 Apache Ka...

技術 【Day 23】 Amazon Kinesis Firehose 的簡單介紹

前一回,稍微看過了 Amazon Kinesis Data Streams,今天來說說另外一個也冠名 Kinesis 的服務 - Amazon Kinesis...

技術 【Day 22】 Amazon Kinesis Data Streams 的簡單介紹

在前面做題庫的部分,出現了關於 「Amazon Kinesis Data Streams」,所以今天來說說這個服務。 REF Amazon Kinesis...

技術 【Day 21】 做題庫小試身手 - 5

題目 題庫 Questions Q15 A data engineer needs to securely transfer 5 TB of data...

技術 【Day 20】 做題庫小試身手 - 4

題目 題庫 Questions Q11 A data engineer needs Amazon Athena queries to finish fa...

技術 【Day 19】 Hadoop / Spark / Amazon EMR

考古 Hadoop 是在 2006 時,就已經問世的老東西了。 而大概在十年前的時候,Spark 針對記憶體的方面進行優化和改良,利用物理的方式超車了 Hado...