iT邦幫忙

2026 iThome 鐵人賽

DAY 7
0
Claude AI

用Claude打造我的AI校園助理:從需求到實作的30天實驗系列 第 7

【Day 07】收尾補測,專案改成只給自己用

  • 分享至 

  • xImage
  •  

今天要做的事
今天測試了昨天需要驗證的內容:iPhone 能不能送圖片、分享版給別人開會怎樣、匯出匯入備份、資料隔夜還在不在、原始 PDF 單頁補測。另外還有兩組提示詞要設計。
補測做下來,發現我需要更改計劃。所以今天的主軸是補測揪出了什麼、我和 Claude 怎麼一路修正方向、想過哪些替代方案、又各自卡在哪。

改想法
與 Claude 對話:
請詳細檢閱過進度表及目前為止的每篇文章後,告訴我今日的計劃與構思,在我看完今日的計劃與構思後,我會先將想法或目標的更動告訴你,並且需要你幫我分析可行性,以及如果可行,該怎麼做。完成以上內容後,再開始今日Day07的動作。

Claude 讀完 Day01~06 和進度總覽後,提出幾個重點:

  1. 待辦塞太滿,5 項補測、2 組提示詞、1 個「預覽版要不要測」,一天做不完。它建議今天只做「補測 + 摘要提示詞 v1」,排程提示詞順延。
  2. 兩個小漏洞,總覽要我沿用 Day04 的課名代稱,卻沒有記錄代稱是什麼,我回覆:Day04 的課名本來就是代稱,不用擔心。另一個是,Day30 大約落在十月中旬,早於十一月初的期中考,「實際拿它備考」會撞不上考前兩週,之後要改成前瞻式驗證:用真實資料在考前幾週先排一份複習排程,看合不合理。
  3. 補測順序不照原本編號,先做最便宜、影響最大的:分享設定(決定「給大家用」做不做得到)、iPhone 圖片,最後才做要 20 分鐘的原始 PDF 單頁。

難題一:iPhone 上圖片 ✗,而我想再試一次 PDF
與 Claude 對話:
iPhone 開個人版測試頁「送圖片」那行是 ✗,所以這個部分需要處理。需要修改成可以傳圖片、純文字跟PDF。Day06是說無法傳PDF,我希望可以再試看看。

我的直覺是「改頁面」。Claude 沒有直接動手,而是先做三件事:讀平台最新的執行規格、把個人版測試頁的程式碼讀回來檢查、查 Claude API 官方文件的 PDF 說明。

它的判斷有兩個:

  1. 圖片 ✗ 不是頁面的錯。 測試頁的寫法是先問平台「這個檢視能不能送圖片」,能才開放,寫法沒問題。規格明寫圖片只在該檢視支援時才開放,不支援就回報 images_unavailable。所以是「開頁面的那個環境不支援」,改頁面內容無法讓它變 ✓。這同時推翻了它上一輪的猜測(以為跟 Mac 或開啟方式有關),因為現在 Mac 和 iPhone 都是 ✗。
  2. PDF 在發布頁確實送不了。 規格寫的圖片格式只有 JPEG、PNG、WebP、GIF,沒有 PDF,Day06 的結論在最新規格上仍然成立。

它列出三條可以再試的路:

  1. 換檢視環境,用 Claude iPhone App、Mac 桌面 App 開同一頁,看「送圖片」會不會變 ✓。困難:規格沒寫哪種檢視支援,只能實測。預期 Safari 仍 ✗,App 未知。
  2. PDF 轉圖片,頁面在瀏覽器裡用 pdf.js(cdnjs 是允許載入的來源)把選定的幾頁畫成圖片,再當圖片送出。使用者看到的是「上傳 PDF、選頁碼」,底層其實是圖片。困難:它完全取決於上一條有沒有 ✓,而且 pdf.js 在這種受限頁面能不能跑也要測。
  3. 聊天視窗內的預覽版 Artifact,Claude 這邊的平台說明寫它可以直接呼叫 Claude 並傳 base64 PDF,API 端確定支援 PDF。困難:iPhone 上開不開得起來、能不能分享、用量算在哪裡,都是未知。

後來我在 Chrome 上重測了電腦和手機的個人版,Safari 和 Chrome 都不行,「瀏覽器內的檢視不支援送圖片」可以確立。連帶兩個結果:第二條(pdf.js)跟著取消,因為它依賴圖片;而就算 Claude App 內開是 ✓,同學用連結在瀏覽器開還是 ✗。

難題二:隔夜之後,本機儲存不見了
Claude 從測試頁程式確認,A1 是「存在這台裝置」(瀏覽器本機儲存),A2 是「存在我的帳號」(帳號資料庫)。所以結果是本機儲存過一晚就在兩台裝置上都消失,帳號資料庫完整保留。

原因目前無法確定,兩台我用的都是 Safari,分不出是 Safari 的儲存規則,還是 Artifact 檢視器的做法。Claude 提了兩個分辨方法:在 Chrome 存一次、隔天看還在不在;或對照「裝置代碼」有沒有變(代碼也存在本機,變了代表整個本機儲存被清掉,沒變代表只有 A1 那格被清)。

影響有兩個:

  1. 只存本機的版本不能當主要儲存,匯出匯入要從「備案」升級成核心功能。
  2. 帳號資料庫是目前唯一可靠的儲存,但用了它的頁面只限組織內。

Claude 的回答:

  1. 用發布頁的 AI 功能,同學一定要有 Claude 帳號。 規格寫明呼叫 Claude 花的是檢視者自己的用量,沒有權限的帳號會被擋。免費帳號能不能用,沒有查證。
  2. 要繞開,有兩個方向。 一是自己架網站加 Claude API:同學不需要帳號,但 API 是另外計費(和訂閱分開),費用由我付。二是降低對 AI 的依賴:課表、倒數、番茄鐘、收藏庫本來就不需要 AI,排程分配也能用規則計算,Claude 只補理由,只有摘要需要 AI。
  3. 免費自架網頁也可行,但頁面內就沒有 AI。 只能「產生提示詞、貼到自己的 Claude、再貼回結果」,所以除非同學大多沒有 Claude 帳號,否則不建議為此離開 Artifact。

我特別請它查了 API 的 PDF 支援。官方文件寫明可以用網址、base64、Files API 三種方式送 PDF,單次請求上限 32 MB,頁數上限是 100 頁(context window 到 1M 時是 600 頁),每頁文字約 1,500–3,000 token 再加圖片成本,沒有額外的 PDF 費用。依這個數字算,一份 35 頁的講義整份送出去,光文字就約 5 到 10 萬 token,這也是「一次只處理一小段」的另一個理由。

如果走自架路線,Claude 列的步驟是:建 API 帳號並設花費上限;前端放靜態網站;後端只放一支小型雲端函式,金鑰存環境變數、絕不放前端;資料先存瀏覽器、不建資料庫;加邀請碼與每日次數上限防濫用;不保存上傳的講義並告知使用者。它同時指出三個代價:難度超出我的「看得懂、改得動」區間;它的環境沒有對外網路,無法替我測試部署,所有錯誤都得由我貼回去;而且題目簡介的重心是 Skills 和 Artifacts,全端部署會讓後半段文章變成除錯部署。它當時建議分三層:個人版、AI 選用的分享版、第四階段的 API 最小驗證,理由是摘要提示詞在三條路都能沿用。這個建議後來被「只給自己用」取代,見下一節。

難題四:只給自己用
圖片走不通,我開始想換個方向,提出一個新構想:不提供匯入圖片之類的資料再統整重點,而是提供一個「訓練好的模型,專門回答學術問題的模型」,讓使用者在網頁裡的對話框提問。我當時不確定這算不算 LLM 功能,也擔心:這樣是否會太過簡單,以至於會比原訂30天完成多出好幾天不知道要做什麼?同時我劃了預算線,要花錢的事情請幫我留到下下策,我目前只有訂閱claude,但API我沒有額度可用。

Claude 的分析:

  1. 是 LLM,但不是「訓練」。 有三個層次:訓練或微調模型,我做不到也不需要;寫提示詞,規定它怎麼答、不確定時怎麼辦;提供參考資料,把我的講義重點一起送進去。我能做的是後兩個,對這個專案已經夠用。
  2. 可行,而且不用 API 額度。 頁面呼叫 Claude 支援多輪對話(對話紀錄由頁面自己保存),花的是使用者自己的用量。限制有四個:只能傳文字、不能拍題目照片;回答要等 5 到 60 秒;沒有獨立的系統提示,指令要放在第一輪訊息;對話框只能活在 Artifact 裡,自架網頁要有對話框就得用 API。
  3. 光一個通用問答框會太簡單。 它和直接開 Claude 聊天沒有差別,還多了限制。但接上我自己的資料就不一樣了。
    它提了四個方向:
    a. 有依據的問答: 程式挑出相關卡片一起送出,答案要標明依據哪張卡,卡片沒有的內容標「講義沒有」。可以做對照實驗:同一批問題「給卡片」和「不給卡片」的錯誤率差多少。
    b. 出題、作答、批改、弱點: 弱點主題自動排進複習排程,把摘要、排程、紀錄三個模組串成一個迴圈,直接回應「不知道該複習什麼」。
    c. 提示詞評測: 訂評分表,把 v1、v1.1 跑同一批講義頁,用數字比較。打包成 Skill。
  4. 30 天撐得到嗎? 我說「總覺得撐不到30天就會做完」。Claude 的看法是寧可太滿:Day07 到 Day30 還有 24 篇,而且很多篇的實質內容是實驗和失敗,不是蓋功能。

補測:原始 PDF 單頁,結果出現 Day06 沒有的狀況
前面都是方向問題,最後回到今天原定的主菜。Day06 的 PDF 版是「截圖轉成的 PDF」,沒有文字層,測到的是「頁面圖像」,不是「原始講義 PDF」。今天要補的是這個變數。

做法:

  1. 從電腦匯出單頁 PDF。
  2. 兩個對話都在專案外、用同一個模型:一個上傳這一頁 PDF,一個貼從同一頁複製的純文字。
  3. 提示詞用 Day06 的 v0 原文。
  4. 先寫預期和備案:預期公式仍然全對,因為 Claude 讀 PDF 時是文字和頁面圖像一起看,但文字層本身是碎的,可能干擾判讀,這正是要測的。備案是公式全對就直接上傳原始 PDF、不必截圖,出錯或大量警示就改成「轉成圖像再傳」。

純文字:

  1. 重組出錯。 Day06 是三處公式全部標警示、公式欄留空,這次它把公式重組出來了,p 的範圍卻寫成 0 ≤ p ≤ 1,原文是 0 < p < 1。它有明說「不等號無法確定」,所以「讀不準就標警示」這條有效,但「不要猜」沒守住:錯的值已經寫進卡片,如果我沒讀警示就會照抄。
  2. 改寫定義。 定義 23 裡被插入「(見下方公式)」,和 Day06 PDF 版的「(如下)」是同一類違規。
  3. 卡片外多餘文字。 開頭有標題行,結尾還多一句邀請我貼截圖。
    https://ithelp.ithome.com.tw/upload/images/20260920/20178861sGy6qWp5AT.png
    原文是 f(x) = p^x (1 − p)^(1−x),x = 0, 1,0 < p < 1。等號、小於號都不見了,次方和括號被拆散。

PDF:

  1. 公式全對,機率函數、範圍 0 < p < 1、符號 X ~ Ber(1, p) 三處,Claude 對照我上傳的頁面圖像逐一確認過。文字層雖然是碎的,沒有干擾判讀。備案的第一條成立:不必截圖,直接上傳原始 PDF。
  2. 手寫標註有讀到,它把 Ber(1, p) 旁邊的手寫讀成「1 → 試驗次數」「p → 成功機率」,並自己標了警示。語意和 Ber(1, p) 吻合,但箭頭指哪個符號,連 Claude 對照圖也不敢百分之百。
  3. 標記讀取不穩定,這次只提到手寫,沒提打勾、底線、螢光筆,而 Day06 的圖像版有讀。同一段提示詞、不同 run,行為不同。
  4. 缺點,定義裡已經有公式,「公式」欄又重列一次;多出一個「備註」區塊,裡面有處理過程的說明,還有一句「二項分配本身的定義還沒出現」,這是推論,不是講義內容。

PDF 路線比純文字可靠,而且純文字路線這次有了「猜錯但標警示」的實例,這是 Day06 沒有的。但每種條件我只跑了一次,只能說「有這種現象」,不能說「發生率」。多次重跑放到 Day09 的評測。

今天沒做完、沒驗證的

  1. Claude App 內開測試頁,圖片會不會變 ✓(可選,不押注)。
  2. Chrome 上的本機儲存隔夜驗證,以及裝置代碼對照:本機儲存為什麼消失,原因未解。
  3. 預覽版 Artifact 的 PDF 實測:iPhone 能不能開、用量算在哪、資料隔夜還在不在。
  4. 帳號資料「放久之後」還在不在:隔夜已過關,更久沒測。
  5. 匯出匯入備份和 .ics 行事曆匯出:自用後降為保險,不急著測。.ics 預期被擋,若日後走自架網頁才有機會。
  6. iThome 對作品形式的規定(例如是否需要公開可用),Claude 沒看過,我自己還沒對照。
  7. 兩個 v1 預設(標記預設「讀」、公式允許重複)尚未確認。
  8. 單頁、每種條件一次的 PDF 補測,不能推論發生率。

這一天學到的

  1. 先查環境,再改頁面。 圖片 ✗ 如果我直接叫 Claude 改頁面,會白費一輪。它先讀規格和程式,才發現問題不在頁面。
  2. Claude 的猜測也要實測。 今天它有兩次被實測推翻:圖片 ✗ 的成因,以及本機儲存的風險大小。我補回來的觀察,每一次都改變了設計。
  3. 平台限制會逼出需求修正,這不算失敗。 從「給大家用」退到「只給自己用」,是三個限制加在一起之後的結論,不是放棄。
  4. 新名詞第一次出現就要定義。 「卡片」用了兩天沒人定義,我一問才補。之後每個新名詞第一次出現,就附上定義和範例。
  5. 對照組乾淨的標準。 同一個模型、專案外的新對話、同一段提示詞、只改一個變數,這次落實之後,馬上看到 Day06 沒有的新現象(純文字版猜錯)。
  6. 單次觀察不是發生率。 這次的所有結果只說明「有這種可能」,量化留給 Day09。

今日總結
今天原本是補測日,結果變成方向修正日。圖片在 Safari 和 Chrome 都無法送出,發布頁也不收 PDF,這兩條路結案;本機儲存過一晚就在兩台裝置上消失,只有帳號資料庫可靠。想讓同學也能用的念頭,帶我把自架網站加 API 完整評估了一遍,結論是不是做不到,而是費用、複雜度和主題偏移的代價太高,最後決定專案改成只給我自己用。原始 PDF 單頁補測則證實直接上傳 PDF 比純文字可靠,但也出現純文字版「猜錯但有標警示」的新現象。今天沒有寫出 v1,但補測和決定讓 v1 的方向更清楚了。

明日內容

  1. 確認今天留下的兩個 v1 預設(標記預設「讀」、公式允許重複),然後正式撰寫摘要提示詞 v1。
  2. 用專案外的兩個新對話(同一個模型)實跑 v1,一個上傳單頁 PDF、一個貼純文字,並照 Day06、Day07 的五個比對標準,再加「格式穩定,能不能用標籤切出欄位」第六項來評分。
  3. 穿插兩個小測試:預覽版 Artifact 的 PDF 實測,以及 Chrome 上的本機儲存隔夜驗證。

上一篇
【Day 06】需求分析收尾:跟 Claude 一起實測三個假設
系列文
用Claude打造我的AI校園助理:從需求到實作的30天實驗7
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言