模型一直更新,哪些使用生成式 AI 的原則仍值得保留?本系列從模型選擇、需求表達與上下文管理出發,逐步進入證據判讀、代理執行、多步可靠度與協作成本。每篇以一條有明確成立前提的原則,搭配可重做的小實驗或工程示範;由 Claude 與 Codex 分工設計、交叉檢查並獨立執行,保留原始紀錄、失敗案例與反例。我們會區分長期核心與版本相關的效果,讓讀者看懂一個判斷如何得到支持、哪些結論仍不能推出,並把結果用在自己的 AI 工作流程。
昨天談驗證的依據。今天談「完成」的依據。 你叫模型整理一份名單。它整理完,最後寫「完成」。完成什麼? 定律 我目前把它寫成這樣: 要一致判定工作完成,必須有可共...
昨天談「完成」的依據。今天談「每個部分都完成了」之後的事。 三個模組,各自的測試都過。組起來,報告說平均長度 152.5 公尺。實際是 152.5 公分。 定律...
前兩天談「完成」的依據和各部分組起來對不對。今天談更根本的一件事:它說做了,做了嗎? 「已儲存。」這兩個字出現在畫面上。硬碟上有沒有那個檔案,是另一個問題。 定...
昨天談「說做了」和「真的做了」。今天談「做得到」和「可以做」。 一個代理有寫檔工具。你告訴它:這個資料夾你不能寫。它會寫嗎? 定律 我目前把它寫成這樣: 做得到...
前幾天談單一動作。今天談一串動作。 五個步驟,每步 95% 可靠。整件事多可靠?不是 95%。 定律 我目前把它寫成這樣: 若整體成功定義為所有必要步驟皆成功,...
昨天談一串步驟。今天談一群代理。 三個模型都說正式環境是 Python 3.11.4。三個一致。這是三份證據嗎? 定律 我目前把它寫成這樣: 把同一份證據重複呈...
昨天談一群代理。今天談回饋。 「這份寫得不太好,再改一版。」模型改了。改了之後,好了嗎? 定律 我目前把它寫成這樣: 回饋若要指出哪個成果更符合需求,必須包含可...
昨天談回饋。今天談中斷。 一個批次工作跑到一半停了。重新啟動之後,它知道自己做到哪裡嗎? 定律 我目前把它寫成這樣: 若要求系統在指定故障後仍能交付,就必須有能...
昨天談中斷。今天談成本。 模型十秒回了一個答案。你接下來一小時在做什麼? 定律 我目前把它寫成這樣: 流程效率要在相同交付標準與成本邊界下比較,不能用其中一個便...