iT邦幫忙

2026 iThome 鐵人賽

DAY 6
0

昨天剛好和幾個最近這 1 個月剛開始接觸 AI,迷上 vibe coding 的朋友交流了一下。

事後我覺得自己的習慣沒有跟上 agent 的飛速發展,我和 AI 還是有太多的討論回合。現在手上既然已經有一個 todo item dashboard,應該叫 AI 在遇到衝突之前把所有的 item 做完。

悟出這一點之後,我把指令改成把所有可以獨立或平行實作的 item 全部挑出來做,遇到必須人工審核的節點就換下一顆。那些反正和我解釋我也一知半解的底層邏輯就啪地變成了 60 多顆 commit 了。

不過瓶頸還是在我。

口說功能

接下來要正式攻略口說功能了。我們大概是把口說的核心功能定義成以下三個:

  1. 可捕捉使用者「原本說了什麼」,AI 不能直接把英文校正成流暢英文,但也要能適當的去除重複
  2. 根據使用者的「原話」,在不改選字、語序,做最小程式的文法修正建議
  3. 給出「同樣的意思,母語使用者會怎麼講」的範例

功能 1 是純粹的錄音功能 & 模型選擇,雛型之前就做好了。

今天我和 Astra 再詳細討論一下下一步,這是 Astra 拆出來的 todo:

## 單人版・口說:錄完就能看懂修正與自然說法(Speaking Tool)〔Codex · `speaking-feedback`〕

成果:每次錄音後,能對照自己的原話、保留完整原意的文法修正與自然口語表達。口說工具的日常優化可獨立推進,不等待詞庫學習或證據回寫完成。2026-09-12 Ellen 已授權實作本節雙階段回饋、狀態處理、介面與驗證;未勾選項目尚未完成。

- [x] 已有錄音、ASR、標點切句、自動最小文法修正、逐句原音回放與歷史;母語說法已有獨立生成與儲存。現有介面需展開有修正的句子再點擊生成,尚未達成下列預設雙階段體驗。管線 · 現有介面。本輪聚焦測試 35 passed,未重驗真實錄音/AI 品質。
- [x] 〔Codex · `dashboard-safe-batch`〕補 Core 禁止載入的獨立伺服器 smoke:合成音檔上傳、轉檔、回饋、歷史及回放;口說離線組 110 passed。ASR/AI 用替身,不冒充真人品質驗收。
- [ ] 強化 Grammar correction:保留完整原意,以文法正確為目標、盡量保留原句型與用字;區分必要文法修正與可選潤飾,提供改動對照及簡短理由。原意不明時標示,不自行補情節;驗收不能只靠編輯數。
- [ ] 每句預設自動產出並顯示「Say it like a native speaker」,包含文法完全正確的句子,不需再點生成按鈕。與文法修正分開呼叫,使用原話、必要上下文及修正結果維持原意;已有結果可重用。原句已自然時可保留並說明,不為製造差異硬改。
- [ ] 區分文法「已檢查無須修正/有修正/未完成」與自然說法的生成狀態;漏句、空回應、解析失敗不能顯示 Nothing to fix。提供補跑/重試,任一路失敗仍可閱讀原文及另一個已完成結果。
- [ ] 優化直覺閱讀與操作:原話 → Grammar correction → Say it like a native speaker,兩個功能區預設可見;長錄音保持逐句對應、清楚的原音播放入口,細節解說可展開,不把核心結果藏在多層操作後。
- [ ] 完成極簡、自然配色的手機優先介面提案與響應式實作;配色提案為暖白、柔和鼠尾草綠與深灰文字,具體色票待畫面確認。手機採單欄、清楚觸控目標與足夠文字對比,桌面延伸同一閱讀順序;窄螢幕下錄音、結果及歷史入口都能使用,不只縮小桌面版。
- [ ] 建立雙階段品質驗收案例:文法正確但不自然、已自然無須改動、多處文法錯誤、否定/時態/程度保留、語意模糊、跨句指涉及模型漏回;包含 `help me learn`/`help me to learn` 都正確的案例。先用公開合成句驗功能,再以私人錄音驗實際品質與手機/桌面閱讀體驗。
- [ ] `backlog`:依本輪需求同步口說子目錄的 spec/frontend-plan/舊 dashboard,收斂「母語說法僅點擊生成」等過時敘述;贅詞清理與未完成尾句沿既有規格另行細拆。跨回合 ERRANT 聚合與詞庫證據回寫仍列於第三階段,不重複認領。

這是 20 分鐘後做出的 Mockup - 我和他說手機電腦版都要做,所以他先做了手機版:

https://ithelp.ithome.com.tw/upload/images/20260912/20129237CVk4Y2COGz.png

思考:我的口說練習需求

在等 AI 實作核心功能的過程中,我在思考自己的口說需求到底是什麼。以及為什麼我不太喜歡和目前巿面上的 AI 教練練習。

先講需求,其實有幾種情境:

  1. 沒有預設主題,只是想練習英文
  2. 有自選主題:想練面試情境、點餐情境
  3. 考試導向:我要用英檢題庫來練習

沒有自選主題的,目前看到就是有一個 AI 虛擬教練和你聊天。這個我目前體驗上做得最流暢的是 Loora,AI 教練其實自己還是有主題庫,只是他是 random 選的。

至於自選主題,就是設定很多不同情境。而 Speak 的體驗是使用者可以在進入對話時自選情境,最早我去用 Speak 就是因為聽到別人推薦這個功能:

https://ithelp.ithome.com.tw/upload/images/20260912/20129237cdvdu1CGwI.png

在一年前這個功能讓我覺得很驚艷,因為英文口說真的有一個很大痛點就是無法靠自言自語來練習。

但密集用了一段時間後,不滿足的感覺開始出現,因為和 AI 教練聊天真的太無聊了。和 ChatGPT 語言聊天有趣很多,但 ChatGPT 不會幫你抓文法錯誤。這種英文 app 裡的校正很有價值,但他們的對話很無聊。

所以最後我還是覺得直接練英檢考題比較實在。劍橋英檢的單人口說有兩種題型:

  1. 考官出問題,例如「你最近看了什麼電影」或「你上次在特殊節日吃了什麼」
  2. 給你一張圖片,問你從圖片上觀察到什麼,例如「圖片中的人為何高興」

在這種情境下大腦需要一邊即時思考如何回答問題,同時說對文法。

因為大腦都在考慮要怎麼回答問題,沒有錄音的話根本無法記得我說了什麼,我個人想要的口說工具其實是針對這個。

之前我在準備英檢時也有用 ChatGPT 語音練習,那時候感覺是 ChatGPT 也很懂劍橋英檢的官方評分標準是什麼。我開始和 AI 討論要怎麼把這些 prompt 做成「考試模式」的口說練習⋯⋯

鐵人第一週小結

平安到 Day 6 了。趁著鐵人賽把這個在我心裡放了很久的題目開工了,但我發現每天即時 vibe coding 還要留時間寫筆記的壓力好大啊啊啊啊啊。

而且我發現我開始進入到「考試模式」的功能打造了,扮演使用者的時候還需要加入英文練習,啊啊怎麼要做的事愈來愈多了(暈)

我感覺自己現在還是沒有掌握到這個專案該怎麼和 AI 協作。雖然 AI 愈來愈聰明,但我覺得我使用他的方式還是挺笨的。


上一篇
Claude 謎語之戰|Profile 準備 & 講義重取測試
系列文
Vibe 30: 我的聽說讀寫英文助手6
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言