在講AI Agent之前,有2個坑要先填,分別是LLM(大語言模型,這邊就用LLM)跟Generative AI(生成式AI,這邊用Gen AI)。
LLM,Large Language Model,中文翻譯即大語言模型。是一種處理自然語言的Gen AI。
它透過大量文字資料訓練後,學會:
那LLM是怎麼學會以上的東西呢?人工智慧是真的就像人的大腦嗎?
要了解這個問題,就得先知道LLM的架構與核心的概念,可以直白的講,LLM就是一個猜token的大型系統,那又是怎麼猜的呢?
LLM目前主流的架構是Transformer這個神經網絡架構(深度學習),Transformer最重要的幾個機制:
1.自注意力 2.多頭注意力
一、自注意力是讓句子裡的每個字都去參照其他所有字,算出彼此的關聯強弱,再依這個強弱把全場資訊加權整合成新的理解,重點在於它不是只挑出最相近的,而是融合了全句的資訊。
二、多頭注意力則是把上面這件事同時做好幾組,每組看的角度不同(文法、語意、指代等等),最後匯總。多頭的"多",就多在同時從不同角度看同一句話。
這樣的機制相較於前面的深度學習模型(RNN/LSTM/GRU等..)更能完成NLP的任務(有時間我再開解釋深度學習還有自然語言處理(NLP)的文章)
還有向量化的處理,接著,有巨量的資料提供給模型訓練(從23年到現在26年,模型語意解析的進步不用技術人員都了解),接著有後訓練等..(這個後面的文章會講解)。
所以說人工智慧就像人的大腦一樣運作嗎?
這也是有爭議的地方,小弟我的拙見是"不是"。
因為它是從大量人類產出的文字裡,學到語言的統計規律去運作,怎麼運行是取決於模型的訓練,而不是像人一樣思考;另外是世界模型、神經符號人工智慧,這種想要以建立世界觀的角度去打造人工智慧。
這些類別我覺得沒有對錯,取決於你怎麼看,不過主流的還是資料驅動為主。
講這麼多又愛挖坑,是怎樣==
這邊分享一個學習程式語言/資訊處理的地方,內容有超級多,還有50多萬的stars,對想要學習很有幫助
GitHub: https://github.com/codecrafters-io/build-your-own-x
Transformer:這是2017由google提出的 https://poloclub.github.io/transformer-explainer/