iT邦幫忙

data science相關文章
共有 252 則文章
鐵人賽 自我挑戰組 DAY 28

技術 Day 28|Interview Query - Complete Addresses

■ 題目|Interview Query - Complete Addresses You’re given two dataframes. One conta...

鐵人賽 自我挑戰組 DAY 27

技術 Day 27|Interview Query - Impute Median

■ 題目|Interview Query - Impute Median You’re given a dataframe df_cheeses contain...

鐵人賽 自我挑戰組 DAY 26

技術 Day 26|Interview Query - Rain on Rainy Days

■ 題目|Interview Query - Rain on Rainy Days You’re given a dataframe df_rain conta...

鐵人賽 自我挑戰組 DAY 25

技術 Day 25|Interview Query - Over 100 Dollars

■ 題目|Interview Query - Over 100 Dollars You’re given two dataframes: transaction...

鐵人賽 自我挑戰組 DAY 24

技術 Day 24|Interview Query - Good Grades and Favorite Color

  先前,我們大約花了三週的時間學習 Pandas 的操作,是時候好好驗收學習成果了!從今天開始,我將每天和大家分享一道題目,親自撰寫解法,並提出我的解題思維,...

鐵人賽 自我挑戰組 DAY 23

技術 Day 23|資料視覺化 - Seaborn

  Python 中,除了 Matplotlib 適合用於資料視覺化之外,Seaborn 也是一個好用的函式庫,兩者經常會放在一起介紹或者使用,今天就和大家聊聊...

鐵人賽 自我挑戰組 DAY 22

技術 Day 22|資料視覺化 - Matplotlib

  Pandas 是 Python 生態系中,適合用來做資料分析或機器學習的套件,上一篇文章介紹 Pandas 中對新手相當友善的繪圖函數 plot( ) ,讓...

鐵人賽 AI & Data DAY 22

技術 『Day22』Operator 介紹

在對於外部的連結之後,我們再細部介紹一下 Operator 的使用,其實在 Operator 層級也可以有不同的使用方法。Operator 本身有多種種類,其作...

鐵人賽 自我挑戰組 DAY 21

技術 Day 21|Pandas 一招帶你快速製圖

  簡報時,我們常會聽到「用數字說話」這句話,面對主管、同事真的是講出每個數字就能讓聆聽者理解嗎?錯!大部分的人單看數字都容易眼花撩亂,想讓對方理解你的報告,圖...

鐵人賽 自我挑戰組 DAY 20

技術 Day 20|在 VS Code 印出漂亮的 DataFrame

  VS Code 的使用者應該有發現 Pandas 的輸出結果有時並不是那麼好閱讀,對於一個有版面強迫症的我來說,曾經因為 DataFrame 歪掉的格式十分...

鐵人賽 自我挑戰組 DAY 19

技術 Day 19|用 Pandas 快速完成樞紐分析

  Excel 本身提供方便的樞紐分析,但你有想過用程式該如何撰寫嗎?今天就來分享一下 Pandas 中的樞紐分析:pivot_table( ) 一起透過交叉分...

鐵人賽 自我挑戰組 DAY 18

技術 Day 18|資料的分組和聚合

  在大型數據當中,有時我們會需要透過群組的方式概括整體資料,除了用以觀察之外,也能進一步深入處理,本文將分享如何使用資料的分組和聚合操作,內容包含: 資料分...

鐵人賽 自我挑戰組 DAY 17

技術 Day 17|資料合併的三種常用語法

  在茫茫數據海當中,資料散布在各種不同的地方,可能是資料庫、網站、文件等,為了要有效統一資料集,方便後續的分析和報告,資料合併的操作是不可不學的,以下將以案例...

鐵人賽 自我挑戰組 DAY 16

技術 Day 16|自定義轉換必學的apply()函數

  在昨天標籤編碼法(Label Encoding)的舉例中,我們可以透過 sklearn 中的函數 LabelEncoder 將類別型態轉為數值型態,那大家是...

鐵人賽 自我挑戰組 DAY 15

技術 Day 15|資料清理-型態轉換

  在進行資料專案時,模型是基於數學設計的,有些資料型態不適合模型存取,為了提高數據的可用性和模型的處理,本文將以案例說明如何進行資料型態轉換,內容包含: 介...

鐵人賽 自我挑戰組 DAY 14

技術 Day 14|資料清理-填補篇

  除了採用「刪除」的方式清理資料外,為確保數據的完整性,「填補」的操作也是另一種常見的方式,本文將說明資料清理中有關填補的操作方法,內容包含: 常數填補 統...

鐵人賽 自我挑戰組 DAY 13

技術 Day 13|資料清理-刪除篇

  在處理資料集時,資料清理是不可或缺的步驟,刪除不需要的數據或特徵以確保數據的品質是常見的操作,本文將說明資料清理中有關刪除的操作方法,內容包含: 刪除缺失...

鐵人賽 自我挑戰組 DAY 12

技術 Day 12|觀察資料中的缺失值

  資料在產生或蒐集時可能因為各種原因出現缺失值(Missing Value),導致資料集中缺少某些觀測值或該值無法表示或測量,因此,處理缺失值是數據分析中很重...

鐵人賽 自我挑戰組 DAY 11

技術 Day 11|資料快速排序操作

  完成資料篩選後,我們可以針對特定欄位進行排序,幫助我們快速整理與觀察,以下將透過案例替大家介紹兩種資料排序的方式,內容包含: 根據數值(value)排序...

鐵人賽 自我挑戰組 DAY 10

技術 Day 10|資料的篩選與過濾

  在進行大量的資料處理時,有時會需要取得符合特定條件的資料,以利後續的觀察與操作,此時就會使用到資料篩選和過濾的技能,今天將以案例搭配 loc[] 函數和大家...

鐵人賽 AI & Data DAY 14

技術 資料處理 Python Pandas 好用的function - Part 2

繼續上一章資料處理 Python Pandas 好用的function - Part 1 #1. pd.to_datetime(df['Date']) /pd....

鐵人賽 自我挑戰組 DAY 9

技術 Day 9|資料運算的常見函數

  資料的運算除了基本的加減乘除之外,也能透過函數快速觀察和取得常見的統計值,完成資料匯總,以下將以實例介紹六種常見函數,包含: 最大值與最小值 資料加總與筆...

鐵人賽 自我挑戰組 DAY 8

技術 Day 8|資料運算的加減乘除

  資料的運算是整理大型數據常見的操作,本篇將搭配新增資料的操作,以案例分享 DataFrame 的加減乘除,方便我們利用 Pandas 快速整理數據,以下內容...

鐵人賽 AI & Data DAY 17

技術 『Day17』DAG 執行方式與排程

經過前幾天的介紹,相信大家應該都有一個基本的概念輪廓,知道如何透過 Airflow DAG 建立所需要的 Data pipeline了。今天來談談 DAG 如何...

鐵人賽 AI & Data DAY 14

技術 『Day14』第一個 Airflow Data Pipeline

安裝完環境之後,想必在讀本系列文章的你,對於開發 Data pipeline 必定是躍躍欲試!如果對 Airflow 有點熟悉的朋友,這幾天可以簡單瀏覽過或是當...

鐵人賽 自我挑戰組 DAY 7

技術 Day 7|新增 Series 或 DataFrame

  嗨!大家好!了解完如何載入和觀察資料後,接著將開始一系列對資料內容的操作,今天的主題為「新增資料」,內容分別以Pandas兩種常見的數據結構說明,包含:...

鐵人賽 自我挑戰組 DAY 6

技術 Day 6|實戰讀取並觀察外部資料

  在進行數據分析前,需要先了解資料的內容,以利後續資料清理、特徵工程等處理,因此本篇將延續昨日主題,以實際案例實作一次讀取外部資料,並使用基本語法觀察資料內容...

鐵人賽 AI & Data DAY 10

技術 『Day10』 如何設計實作 Data pipeline

在前幾天的內容當中,我們陸續介紹了 Data pipeline、Data pipeline 的種類、資料處理,資料品質等主題,相信大家對於 Data pipel...

鐵人賽 AI & Data DAY 9

技術 『Day9』 資料品質

在上一篇當中我們常常談到資料的品質,因為在資料處理的其中一個目的就是我們要提升資料的品質。那我們要如何判斷資料的品質呢?這篇想要來聊聊資料品質,幫助大家在實作...

鐵人賽 AI & Data DAY 8

技術 『Day8』 資料處理

在前一天跟大家分享了 Data pipeline 的種類,在每種 Data pipeline 當中多半都有資料處理的步驟。實際上在各種資料應用的場景,從資料分析...