iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
Claude AI

一個人的 AI 團隊:Claude Code 當組長,帶四家引擎做教學工作的實測與踩坑 系列

我是大學通識課老師。今年五月底開始把五種不同底層的 AI 組成一隊:Claude Code 當組長,帶著 Codex、Antigravity、OpenCode、Grok,讀同一份主指令、共用同一份記憶,做我的教學與行政工作。兩個多月、七百多個 commit。

這 30 天不寫「效率提升幾倍」,寫實測紀錄:主指令怎麼餵給五種引擎、怎麼按失敗風險派工、記憶放哪裡才找得回來,以及最重要的——怎麼在它們胡說八道時抓到。

有很多難看的部分。某顆模型讀完檔案卻不吐一個字;某位隊友交回排版最漂亮的報告,裡面五筆假引用;畫面顯示「已儲存」其實沒落地。每則都有日期、數字和錯誤訊息。

參賽天數 14 天 | 共 30 篇文章 | 2 人訂閱 訂閱系列文 RSS系列文
DAY 14

Day 21|純文字審查抓不到「跟外部真相打架」

昨天那道 DOI 閘門有個明顯的盲區:引用真實存在的文獻,但把它的結論講反。DOI 驗證全綠,內容全錯。 今天講我們怎麼撞見這個盲區的。 一份講義的兩次審查 2...

2026-09-01 ‧ 由 tedchen1027 分享
DAY 14

Day 22|問「這條對不對」,他會順著你講

第四幕第三層:問法會污染答案。 同一位隊友、同一份稿子、同一個錯誤,問法不同,結論相反。今天講怎麼問。 三次同型的失誤 我派複驗的標準句型長這樣:「以下這段引述...

2026-09-02 ‧ 由 tedchen1027 分享
DAY 14

Day 23|來源附了,但只附到首頁

今天講一種很體面的偷懶。 2026 年 8 月 7 日,我請一位隊友做一份國際對標研究,主題是災時的公民科技協作。他交回來的東西看起來很紮實:分國家、分案例、有...

2026-09-03 ‧ 由 tedchen1027 分享
DAY 14

Day 24|誰會主動說「我沒查到」

連續講了幾天出包,今天講反過來的:誰會主動承認自己不確定。 這件事我覺得比「誰比較聰明」重要得多。一位會說「這條我沒查到」的隊友,他交回來的其他部分你才敢用;一...

2026-09-04 ‧ 由 tedchen1027 分享

Day 25|一隊 AI 去打 Kaggle:0.14 到 0.9 的路

最後一幕,把前面二十四天的東西拿去打一場真的比賽。 起因很隨興(跟這系列的起頭一樣):信箱跳出一封 Kaggle 的競賽通知,我本來只是想測測看,現在的 AI...

2026-09-06 ‧ 由 tedchen1027 分享

Day 26|「顯示同分」不等於「沒效果」

今天講一個我差點做錯的判斷。 比賽到後期,改動的幅度越來越小。你調一個參數、送出去,排行榜回給你的分數——跟上一次一模一樣。 到小數點第三位都一樣。 直覺的結論...

2026-09-07 ‧ 由 tedchen1027 分享

Day 27|我宣布到頂的那天,公開解法早就在那裡了

今天這篇是檢討。 比賽中期(那時我們已經站在重現來的古典底座上),我帶著隊友埋頭調參。一週下來,從 0.8 出頭一路掃到 0.843,每一步都有實驗數據支撐。...

2026-09-08 ‧ 由 tedchen1027 分享

Day 28|多開幾個 AI 一起跑,為什麼常常不會更快

前面講了很多「全員並進」的好處。今天講它的天花板。 我做過一件事:把一個大型研究任務拆成很多份,同時派出去,想說平行處理總比一個一個做快。 結果是整個工作沒跑完...

2026-09-09 ‧ 由 tedchen1027 分享

Day 29|畫面說「已儲存」,資料其實沒進去

倒數第二天,講一個貫穿這三十天的坑,用兩個發生在不同地方的例子。 例子一:一個管理台 我有一個自己做的活動管理小工具,資料先寫在瀏覽器本機、再同步到雲端表格。...

2026-09-10 ‧ 由 tedchen1027 分享

Day 30|算總帳:救了什麼、沒救到什麼、重來我會怎麼開頭

最後一天。 從 5 月 29 日第一個提交到今天,這支團隊存在了差不多一百天。三十天前我說要寫的不是它們多好用,是它們怎麼壞掉的。寫完了,來算帳。 救了什麼 一...

2026-09-12 ‧ 由 tedchen1027 分享