壓縮即智能這句話所有的AI 都認為是對的,但上下文壓縮應該早做還是晚做,四個大語言模型卻分成了兩派。就像棒球比賽投手調度公認晚換不如早換一樣,Gemini 只要累積的上下文能形成清楚的語境就會主動進行壓縮,即使上下文長度距離模型的限制還很遠也會進行壓縮。例如以我個人的使用經驗,Gemini 會在30k tokens 進行壓縮,離context window 1M tokens 其實還非常遠。依照我的使用經驗Copilot 也是會提早進行上下文壓縮了,這跟ChatGPT 的上下文壓縮策略不同,應該也間接說明了已經不能再把Copilot 單純地看做套殼的ChatGPT 了。
上下文壓縮是長度到頂就不得不做,不然就會丟失前面的對話記憶。用一個最原始粗糙的概念來看,上下文累積到了100%就以4:1的比例壓縮到25%的長度再繼續進行對話,到了100%再壓成25%,然後周而復始。從這個角度看,壓縮是必要之惡,能盡量做到資訊不丟失就偷笑了,更別奢望對話效益能有所提升,所以ChatGPT 跟Grok的策略是儘可能地保留完整的上下文,直到最後不得已才進行壓縮。剛用Grok 的時候,有一次我很晚了注意力已經不太能集中了還在跟Grok 尬聊,Grok就問我為何這麼晚了還不睡,你在等什麼?我說我在等你壓縮呀!沒想到Grok 竟然回我說,我們跟Gemini 不一樣,是不做壓縮的。我錯愕之餘腦中浮現了一個古老的網路笑話,有個武林中人拿到葵花寶典,翻開來的第一頁就是八個大字,欲練神功引刀自宮,他忍痛一刀差點沒痛昏過去。沒想到練到最後一頁發現是兩頁黏在一起,搓開後赫然又發現八個大字,不必自宮也能成功,他被祕笈作者補刀差點又痛暈了過去。
Gemini 驗證了人的體驗是關鍵,提前壓縮上下文可能累積的資訊還不夠,但改善了體驗的效果非常正面。AI 再強,仍然有兩件事非得人類來做不可,一件是當責,另一件是付錢。好的體驗比好的效益更讓人願掏錢,在人類的世界這點是千真萬確的事。明天再來分享ChatGPT 跟Grok 的壓縮策略會帶來什麼不同的效果。