iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
Software Development

LLM infra 學習日記 系列

作者學習LLM infra的日記,預計會涵蓋各種LLM inference, data, RL 相關開源專案的探索。

參賽天數 20 天 | 共 20 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文 團隊源來適愛開緣
DAY 1

LLM Infra 到底在做什麼?

平常在看 vLLM、SGLang、PagedAttention、speculative decoding,或是一些 CUDA kernel 的時候,常常會有一種...

2026-08-17 ‧ 由 ryankert01 分享
DAY 2

為什麼 LLM 都跑在 GPU?

現在的大型語言模型,大部分都是跑在 GPU 上。 那第一個問題就是: 為什麼是 GPU,而不是 CPU? CPU 當然也可以跑模型,只是 LLM 裡有大量可...

2026-08-18 ‧ 由 ryankert01 分享
DAY 3

GPU Memory Hierarchy:為什麼算得快,還是要等資料?

昨天提到,當一個 Warp 在等 memory 的時候,GPU 可以先去執行其他 ready 的 Warp,用這種方式把等待時間藏起來。 但這邊其實會冒出另一個...

2026-08-19 ‧ 由 ryankert01 分享
DAY 4

GPU 到底是在等計算,還是在等資料?Roofline Model

上一篇提到,GPU optimization 很多時候不只是讓運算本身變快,還要想辦法減少資料搬移。 那要怎麼知道一個程式到底是: 算不夠快,還是資料搬不夠快...

2026-08-20 ‧ 由 ryankert01 分享
DAY 5

第一次寫 GEMM

前幾天一路從 GPU 的 Thread、Warp、Memory Hierarchy 講到 Roofline Model。 今天終於可以真的來寫一個 CUDA k...

2026-08-21 ‧ 由 ryankert01 分享
DAY 6

GEMM 優化第一步:Shared Memory Tiling

昨天在 LeetGPU 上寫了最簡單的 GEMM: C = alpha * (A × B) + beta * C 做法也很直覺: 一個 Thread 算一個...

2026-08-22 ‧ 由 ryankert01 分享
DAY 7

Tensor Core 到底是什麼?

前兩天我們一直在優化 GEMM: Naive GEMM ↓ Shared Memory Tiling ↓ Register / Thread T...

2026-08-23 ‧ 由 ryankert01 分享
DAY 8

一個 Transformer Layer 在 GPU 上到底跑了什麼?

前幾天一路從 GPU、Memory Hierarchy 講到 GEMM 和 Tensor Core。 但真的跑 LLM 時,GPU 並不是只做矩陣乘法。 今天先...

2026-08-24 ‧ 由 ryankert01 分享
DAY 9

Prefill 與 Decode 為什麼是兩種不同的 Workload?

上一篇把一個 Transformer Layer 拆成 GEMM、elementwise、reduction 和 data movement。 但同一個 Lay...

2026-08-25 ‧ 由 ryankert01 分享
DAY 10

FlashAttention 解決了什麼?從 Tiling 到 Online Softmax

上一篇看到,Prefill 有大量 tokens 可以組成大型 GEMM。 但 context 變長後,Attention 會產生另一個問題: 不是算太多,而...

2026-08-26 ‧ 由 ryankert01 分享