現在網路上有大量的資料,像是商品價格、電影資訊、新聞、天氣、股票等,但這些資料通常分散在不同網站。如果能夠利用程式自動取得這些資料,再進一步整理、分析,最後用圖表呈現,就能把原本零散的網路資料轉換成更有價值的資訊。
因此,我決定利用這 30 天學習 Python 爬蟲與資料分析,從 Python 基礎開始,逐步接觸網路爬蟲、HTML 資料解析、Pandas、SQLite、資料清理以及資料視覺化。
這次的學習路線大致會是:
Python 基礎
↓
了解 HTTP / HTML
↓
Requests
↓
BeautifulSoup
↓
網路爬蟲
↓
資料清理
↓
Pandas
↓
SQLite / SQL
↓
Matplotlib / Seaborn
↓
完整資料分析專案
為什麼選擇 Python?
Python 的語法相對容易理解,而且在資料分析與網路爬蟲方面有許多成熟的套件,例如:
Requests:取得網頁資料
BeautifulSoup:解析 HTML
Pandas:資料處理與分析
Matplotlib:資料視覺化
Selenium:處理需要瀏覽器操作的網頁
因此我希望透過這次 30 天的學習,不只是學會幾個 Python 套件,而是了解一個完整的資料處理流程。
今天先做什麼?
Day 1 先把基本環境準備好。
我會使用:
Python
VS Code
Jupyter Notebook
確認 Python 可以正常執行後,也先簡單了解之後會使用到的套件。
例如:
import requests
from bs4 import BeautifulSoup
import pandas as pd
今天還不急著寫出完整的爬蟲,先把環境和學習方向建立起來。
30 天的目標
希望到了 Day 30,我可以自己完成一個小型的資料分析專案,從網站取得資料開始,經過資料整理、儲存與分析,最後製作出可以讓人看懂的圖表。
今天先從環境準備開始,下一篇正式進入 Python 基礎。