我這一生如履薄冰,你說我能優化這個 Kernel 嗎?
「我這版一定比較快。」——每個開始改 CUDA Kernel 的人,應該都曾經這麼想過。然後打開 Profiler:蛤,怎麼更慢了。
這 30 天想拿一些實際的 Kernel(以及以前寫過的東西)出來鞭屍。大概每三天一個小循環:實作 → Profile 抓戰犯 → 優化 → 看數字,試著從數據裡找出「為什麼慢」以及「憑什麼覺得還能更快」。
Memory、Warp、Occupancy、PTX……能踩的坑應該都會踩一點。
P.S. 重賽板我回盡量有趣一點ㄉ
這次能不能順利完賽...我也不知道...
(笑死,前幾天都直接用不講,現在才突然間在那邊補這些知識,也不知道是什麼心態。但總之還是補了,雖然也沒有補得很好.. 唉,這玩意兒是真的很難寫...AI slo...
Day 10 寫了AI。 Day 11 講了更多AI。 Day 12 還是AI,這人帆布凡?煩 。但暫時還沒處理好跟AI的關係同時也放棄跟cublass比較了太...
2.5條梧曾經說過 前幾天我們一直在想一件事: 能不能用 INT8 Tensor Core 做出比 FP64 更快的高精度 GEMM?原生的硬體贏了但 額 人...
請允許我再水一篇XD 一直水這個主題XD我明天,我希望啦,從明天開始我會水其他一個主題了。然後我之後我會花個一兩三天,認認真真地把這東西寫一個我覺得好的技術 b...
Day 15:換一個題目,這次我們要算 Hadamard 前面幾天我們一直在處理 GEMM。 那條主線的問題很清楚:我們想用 INT8 Tensor Core...
昨天我們把題目換掉了(換題目水 嘿嘿)。 一樣 先ai slob 然後我再看時間修 。 總之 先勉強看個 這次不是 GEMM,而是: y = H^{\otime...
淑樺說得好你放不下的 別人已經進去了(X哈哈哈 今天還是ai slob 抱歉 昨天根莖葉昨天跟今天的稿子還沒修好 麻煩先擔待一下2026/09/08 有小更新了...
Day 18:把 Hadamard 塞進 Tensor Core,問題在哪裡 問題在哪裡?別人就都沒問題 怎麼就你問題最多??你怎麼不找找你自己的問題?? ![...
今天還是AI slob 我如果之後有寫好 改完 會附上更正是寫作版本的連結ㄉ希望這不是ㄍflag 前面三天把三條路拆開了。Day 16 是一個 block 裡...
還是先AI slob 剩下的 我們之後再說這幾天在參加活動@@希望過幾天還有存量可以繼續QAQ可能要有四天的 這個 先等我一下 我後續補給你ㄌ 昨天兩張表已經...