大語言模型(LLM)在近年來取得令人矚目的進展,尤其2026,其能力邊界不斷拓展,應用場景日益豐富。然而,這些成就的背後,離不開對模型規模、數據量和計算資源之間關係的理解,即縮放法則(Scaling Laws)。
同時,作為新興技術,LLM也面臨著諸多挑戰和侷限性。
縮放法則是近年來LLM領域最重要的發現之一。它揭示著模型性能與模型參數量、訓練數據量以及計算間存在的可預測性冪律關係#註1。
這一發現為LLM的持續發展提供理論指導,這闡明了增加資源投入能夠系統性提升模型性能的底層邏輯。
研究發現,在對數-對數坐標系下,模型的性能(通常以loss function衡量)與參數量(B)、數據量和計算量這3個因素都呈現平滑的冪律關係。
簡單來說,只要我們持續、按比例增加這3個要素,模型的性能就會可預測第、平滑地提升,而不會出現明顯的瓶頸。這一發現為大模型的訓練提供了清晰的指導:在資源允許的範圍內,盡可能的擴大模型規模和訓練數據量。(目前來看是精準命中)
早期的研究更側重於增加模型參數量,但DeepMind在2022提出的"Chinchilla定律"對此進行了修正。該定律指出,在既定的預算額度下,為達到最佳效能,模型參數量與訓練數據量之間存在一個最優配比(概念有點像是供需法則的平衡點)。具體來說,最優模型應該比之前普遍認為的還小,但須要用更多的數據進行訓練。例如:一個70B參數的Chinchilla模型,由於使用了比GPT-3(175B參數)多4倍的數據進行訓練,其性能反而超過後者。這一發現糾正了"越大越好"的片面知識,強調了數具效率的重要性,並指導後續許多高效大模型(ex.Llama系列)的設計。
縮放法則最令人驚奇的產物是之前提過的"能力的湧現"。
這邊再解釋一下,所謂"能力湧現",即指當模型規模到一定閾值之後,會突然展現出在小規模模型中完全不存在或是表現不佳的新能力。例如:鍊式思考、指令遵循、多步推理、程式生成等能力,都是在模型規模達到數百億或是千億後才能"顯著"出現。這種現象表明,大語言模型和推理能力不僅是簡單地記憶和復述,它們在學習過程中可能形成某種更深層次的抽象和推理能力。對於AI開發者而言,能力的湧現意味著選擇一個足夠大規模的模型,是實現複雜的自主決策和規劃能力的前提。
前幾天提到的DeepSeek Harness上周發布,這幾天就有插件清單的repo了,有許多功能像是UI增強、模型接入、記憶、瀏覽器、工作流、程式審查,如果有在用DSH的朋友可以試試。
GitHub: https://github.com/awesome-dsh-plugin/awesome-dsh-plugin
註1:冪律關係是一種變數之間的數學關係,表示一個量隨另一個量的變化,遵循「某個次方」的規律。
一般公式:y = a * x^b
其中:
y:依變數 x:自變數
a:比例常數 b: 冪次
簡單說明:正方形面積 A = L^2,這就有冪律關係
比例常數a=1,冪次b=2。 若邊長增加2倍,面積會增加4倍。