iT邦幫忙

2026 iThome 鐵人賽

DAY 3
0

又多花了一整天整理資料後,我一直在思考我犯的錯誤。

其實在參考各大字典的資料設計,重新建立規則後,果斷地把資料庫刪掉,重新注入 121 份單字筆記。會是更乾淨的作法。

但人類有時候會沉迷在很細微的手工作業裡,我也不知不覺沉迷在在各種單字整理小規則的堆疊⋯⋯

(是的,我其實很有幸福感,這是辦公室文明進化史中,足以毀滅人類文明的「無價值產出的勞動驅動」,反價值的事情有時候做起來更開心。)

不過因為鐵人賽還在進行,只好被迫用一種歡快的語氣記錄這段毫無意義的整理工程。

詞庫

進度:

  1. 「單字」的資料格式昨天處理好了,基本上就是參考了各大詞典的處理方式。
  2. 今天繼續討論「非單字」要怎麼處理。和 AI 討論後,我們暫時把這類資料定義成「詞組 (multiword),對應的分類系統是:
    1. 搭配詞(collocation):如 saving account,非母語的人有時候不知道要這樣說。
    2. 慣用語(idiom):如 beat around the bush 這種
    3. 片語動詞(phrasal verb):如 give something up 、get well on,這種對練習劍橋英檢蠻重要的,因為劍橋英檢在聽力裡卡了很多這種片語,聽不懂就會完全錯判。所以我在準備時有下載專門的 app 來做複習。
    4. 俚語(slang)

一邊參考字典的作法,一邊區分種子資料中有效 v.s. 無效的內容。漸漸變成這樣

前端:

https://ithelp.ithome.com.tw/upload/images/20260909/201292372xyMEKiFOv.png

相關資料表:

https://ithelp.ithome.com.tw/upload/images/20260909/20129237civk0ZfGWV.png

我覺得還需要花 5 小時左右清理一下。希望今天睡前可以再處理一下。

明天無論如何要碰到新功能!

口說功能核心

因為單字本整理會需要等 AI 清理、試用、抓 bug 再修。

在等待的過程中開了另一個獨立支線,先把口說功能做了一個原型。

這年我試用了一些付費口語 AI 教練 app,其中我最喜歡的是 Loora:

https://ithelp.ithome.com.tw/upload/images/20260909/20129237OeleBWm3Im.png

核心功能是:

  1. 抓到我「原始說了什麼」,AI 不能直接把英文校正成流暢英文
  2. 標記出文法錯誤
  3. 給出「建議怎麼說會更流暢」的範例

至於有一個爽朗的 AI 教練互動,那個是考試導向的我,目前不需要的功能。(而且我真的覺得,和 這種 app 裡的 AI 教練聊天很無聊)

總之,AI 幫我選了適合的模型:ASR:parakeet-ctc-0.6b(NVIDIA FastConformer-CTC,經 MLX 跑 Apple Silicon)

跑了幾輪測試後還算滿意。我們就先把一個最小可用的介面做出來。

第一版,直接套用 Python 函式庫的介面:

https://ithelp.ithome.com.tw/upload/images/20260909/20129237FVoBfF31jx.png

然後把前端做起來:

https://ithelp.ithome.com.tw/upload/images/20260909/20129237LMNsquRgu8.png

這個前端我沒有很滿意,但今天的進度只改到這邊!

口說是一個比較獨立的工具。目前我的主線任務是在單字本上面,希望明天可以解脫!


上一篇
種子單字匯入 & 漫長的清理
下一篇
討論:價值與量化機制
系列文
Vibe 30: 我的聽說讀寫英文助手 共 30 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言