儘管生圖模型會最大層度的影響產生的簡報,但文字模型整理的大綱也是不可忽視的一部分。另外,我自己實測發現,在素材資源多,context接近150k的情況,小模型的整理和歸納能力會顯著下降,這對於從大量文件找出關鍵內容並產生大綱是十分致命的,所以今天我想比較一下不同文字模型的表現。
測試方法我下載OpenAI GPT系列白皮書,這些文件幾乎超過35頁,內容繁多,對於模型從長文件理解、整理出重點是一個考驗。
首先GPT-5.6-Sol整理的大綱內容相當豐富,可以整理出數據表格重點,細節處理的好
GPT-5.6-Luna的表現稍差,整體的資訊量較少,數據稀疏。所以對長資料,還是需要大模型整理較為完整
Gemini 3.6 Flash這邊也是,資訊內容比較空泛,並且因為大綱的內容較少,導致排版也比較空泛
除了資訊密度以外,也可以觀察到大綱的風格,對於簡報也有重要影響: GPT系列模型喜歡在結尾放上簡短總結,這也是之前說過GPT有的特殊風格由來;Gemini系列的資訊量較少,可能也是導致NotebookLM生成簡報空泛的原因。
總結來說,這邊整理了大模型、小模型在長文本下的表現,原本以為整理大綱的簡單任務可以交給小模型作,但實測後發現大模型的多文件、長上下文專注度都會比較好、且對指令的遵循度較好。所以對於複雜的簡報,建議不要為了節省成本而犧牲大綱品質。