前面說到AI生成簡報目前有幾種方案-「直接生成PPT」、「生成圖片」、「網頁形式簡報」,主流的平台ChatGPT. Claude採用「直接生成PPT」,NBLM採用「生成圖片」、開源專案Open-Slide採用「網頁形式簡報」,各自有不同優勢。
| Slide-Maker + GPT-Image2 | Slide-Maker + NanoBanana2 |
|---|---|
![]() |
![]() |
而這份專案最終選用「生成圖片」,原因是生成圖像的整體畫面品質比較好,尤其是搭配GPT-Image2,畫面豐富度、文字細節表現都比較好,而且畫面可以加入插圖。這些是PPT和網頁方案目前比較難做到的。
但相應的需要解決一些圖片方案的缺點:
我把解決這些問題的架構分為工程面向(OCR套件、OpenCV畫面重構、UIUX)、提示詞面向(System Prompt限制、Context管理、搜尋工具),從兩個方面解決這些問題。同時搭建了一套完全模組化、可抽換的架構,包含core核心功能實作、Backend API管理、UI編輯器設計、專案管理,搭建出一套平台。希望把圖片簡報提升到好用、好修改的狀態。
