先跟大家說,這個系列會用到的工具是 Obsidian + AI。大家想跟著做的話,需要自己準備一套能「直接操作電腦上檔案」的 AI(我自己用的是 Claude,其他能做到同樣事情的 agent 應該也行)。
.
.
.
在兩個問題以內讓大家自己暴露出來
第一個問題:
你覺得把一萬篇 PDF 論文貼給 chatGPT 叫它整理,算不算一種知識庫?
.
.
.
說「算」的讀者,心裡可能在想:
「不算」的讀者,心裡可能在想:
不論你選哪個,相信你有自己的一套邏輯,下面第二個問題,讀者可以依據上一題的答案選擇:
如果你剛剛答「算」——要做到什麼程度,你才會改口說「不算」?
如果你剛剛答「不算」——要補上什麼,你才會改口說「算」?
——答得比較久、甚至答不出來對吧?
會覺得「好像有一個方向,但沒辦法具體講完。」
你知道知識庫 = 知識 + 庫,但是你從來沒往下走得更深
知識庫到底是什麼?
要不是吃飽太閒,我也不會主動往下探討這個問題的答案。
如果說知識庫是一個需要治理的國家、軍隊,那麼使用者,你
就是國家的王、是將軍,甚至是神
然後你這個神現在問我,「國家是什麼?」
.
C8
其實啊,想過知識庫的定義可能是你建構知識庫的整個過程中,最重要,最值得花時間做的事情,而不是把一堆 prompt 丟給 AI 然後躺在沙發上說「挖我今天做了好多事」。
因為沒想過定義,就沒有標準,沒有標準,就怎樣都好。
而怎樣都好,是弄不好知識庫的,我知道講得有點絕對了,但我繼續講下去,舉個例子:
假設你今天已經有一個弄得很好的知識庫了,放在 Notion。
這時候你在網路上看到「第二大腦讓你變成超人」、「PARA 讓你的知識庫爽到升天」,你看完想說,屌爆了!
然後你直接著手照著影片改了,花了三個小時,整個下午都在幹這件事,主管看你忙了那麼久,想說怎麼這麼認真,年終可以給你考慮加個五百塊,總之主管很欣慰。
但是改完第二天,你的知識庫反而變難用了。
原本熟悉的分類被拆掉,以前三秒找得到的東西,現在要先想「這算 Project 還是 Area?」;現有的工作流程,也因為硬套一套別人的架構,多了好幾個你其實根本不需要的步驟。
這還不是最嚴重的,嚴重的是兩個禮拜以後,另一支影片的作者說:
「PARA 已死,AI 時代根本不需要分類。」
乾你老師。
然後你又把前兩個禮拜才改好的東西全部拆掉。
到了這個地步,你真的必須要想想
你到底有沒有節操?有沒有標準?有沒有想過:
「這個方法,究竟改善了我知識庫的什麼?(跟我的知識庫有什麼關係)」
沒有人提醒你,所以你沒有想過知識庫到底是什麼。
A 說這樣好,你就導入 A。
B 說那樣更好,你就換成 B。
明天 C 出現,你再重構一次。
這是我遇過的問題,我知道這行不通。
我不是在說你在網路上看到的方法有多糟,我說的是:很多方法,你在搞清楚之前就用了,而這個做法走不長遠。
這是維基百科對於知識庫的解釋,很短,但就是因為短,抓重點更容易了。
知識庫的底層邏輯,就是資訊的採集、整理及提取。
把知識庫做為一個系統、一個「個體」看待,採集的定義也很簡單:
「把原本不在系統內的資訊帶入系統內的過程」
這短短一句話重點在:過程。
採集做得好,過程中一定有相應的設計與細節,對於「個人知識庫」的建立而言,採集就是「戰場」的入口。
你的習慣是什麼?使用場景是什麼?目前的採集有什麼問題?
每個人都不一樣,這代表「採集」的流程定義不是一套 SOP 複製貼上就能完成的。
必須想過,實踐才知道有沒有效、好不好用。
好消息是現在你只需要先想過,不需要寫一篇論文出來。
你會想放到知識庫的內容,可能包括網路文章擷取、Youtube 逐字稿或筆記、Podcast 摘要、使用者的靈感、疑問、經驗、觀察、待驗證假設等等。
把資訊大致分為兩個方向:
分類基準是:資訊從哪裡來?
舉個例子,外部資訊是:
「我平常從哪裡取得資訊?是文章、影片、PDF、社群,還是別的東西?我現在怎麼把它們留下來?哪一步最麻煩?這要怎麼派上用場?」
內部資訊:
「我的想法通常在什麼時候出現?走路、工作、洗澡、看書?現在想到東西時,我怎麼把它留下來?有多少想法其實在能記之前就消失了?這要怎麼派上用場?」
像我說的,這個階段你不需要想得很完整,因為實際情況跟你想像可能還有差距,只要想出一個「方向」就算成功了,剩下的讓時間、使用者和 AI 慢慢完善。
想完之後問自己這個問題:「我為什麼要留下這個資訊?」 如果回答不出來,那麼這可能是個不需要入庫的資訊。
想完之後你會有一串「可能派得上用場」的資訊,這個時候你就有知識庫的需求了,那麼我的系列文章你可以繼續看下去。
資訊入庫後需要整理,定義是:
「把已經採集入庫的資訊,處理成更容易理解、找到、連結、判斷與使用的狀態。」
怎麼又那麼長啊? 縮短
「把資訊,處理成更好用的狀態」我做個分類哦,看看有沒有感覺:
這系列教的知識庫其中一個主要「讀者」會是 AI,所以整理這個動作,最好能整理得 AI 更好理解、更容易檢索。
如果 AI 能判斷來源、時間、事實與觀點、最新版本,甚至知道一個結論背後的思路,那麼 AI 更有機會真正放大知識庫的價值,也可省很多麻煩。
寫得有點長了,熊與我(Bear with me)
「提取」基本上就是查詢的意思。如果採集和整理做得好,到這一步問題就比較少了
高機率不需要 AI 你也能直接找到。但有 AI 比較快嘛,而且在大部分使用情境下,你是「有事想做」需要 AI 幫你查,然後跟你討論,從這個角度來看,知識庫是一個超大型上下文管理工具。
離題了,提取的定義是:「從知識庫找出需要的資訊」
很單純,不用拆解。
這個步驟你會遇到最主要的困難會是 AI 協作的問題。
舉個例子,我已經跟 AI 講好,每篇文章都要貼 tag,想說之後 AI 搜尋就會沿著標籤去找。
有一次我跟 AI 說:「你好棒哦,找得好快,你都怎麼找的啊?」
結果 AI 跟我說它根本沒在用 tag,我跟它說「在那裡」之後 AI 就整包掃過。
我心裡想說沙小啊,那 tag 是貼心酸的膩?結果 AI 還印翠印記跟我說,這不是我的錯,是你沒定義過。
提取這一步,就是會遇到這種問題。
到這邊「三動作」定義就都講完了,別看我講得雲蛋風清,這三步驟對於知識庫來說是很重要的,本質上,知識庫是一個檔案系統,但因為有了 AI 它變成了一個專屬使用者與 AI 的「遊樂場」,用的好的話,所有使用情境、所有需要的資訊都在一個地方完成,不僅如此,還比以前更快、更好、更完整。
吹牛吹飽了,說說我自己的使用經驗:真他媽麻煩
說真的,我從大概五月弄到現在就是為了弄一個自己滿意的個人知識庫,過程中真的有很多問題,總共弄了兩三個知識庫吧,之前做的統統廢棄,最新的這個最近才終於「有點樣子」了,要不是在過程中有嚐到一點甜頭,我才懶得把原本放在 Notion 的資料統統搬到 Obsidian 勒。
不好意思發了點牢騷,下一篇繼續講。