這張綜合評測表的意義
過去四天,同一顆 gpt-oss-120b 在同一台 DGX Spark 上被三個引擎輪流跑過一遍:llama.cpp(Day 8)、v...
上一篇文章,我們替這個系列畫出清楚的範圍:要打造的是一個以繁體中文 Markdown 技術文件為知識來源,能夠回答技術問題、引用相關內容,並在資料不足時拒答的...
晚上十一點,手機跳出一則 Telegram 通知:
🌡️ 主臥濕度 78%,超過警戒值,自動啟動除濕機。
發這則訊息的不是我太太,也不是什麼訂閱服務——是...
為什麼不能只看排行榜?
過去一週測了四款地端 AI 模型,每一款在某個排行榜上都當過第一。如果排行榜能回答「我該用哪款模型?」,這個系列可以少寫十天。它不能,...
昨天我們先建立了一個基本觀念:
模型負責判斷,Harness 負責讓判斷可以被執行、觀察與限制。
但還有一個問題沒有回答:
為什麼一般聊天模型回答一次就停...
Physical AI Studio 的第一步:把流程寫成可追問的腳本
開啟 Physical AI Studio
開啟模擬工作室
觀看電鍍吊...