第十天 09/24
在量化交易與自動化技術分析的領域中,將函式型技術指標(Deterministic Math-based Indicators)與 Gemini Vision 多模態視覺辨識相結合,能完美補足「純數值演算法缺乏全景空間感」與「純視覺 LLM 缺乏精確數值微觀計算」的各自短板。
然而,在實作「技術代理(Technical Agent)」的程式模型時,要讓兩者無縫對接並提供高品質的 K 線圖態辨識(如頭肩頂、雙重底、三角收斂等),需要特別注意系統整合的細節與優化策略。
一、 結合過程中需特別注意的核心事項
座標軸與幾何失真問題 (Resolution & Aspect Ratio Distortion)
Gemini Vision 在辨識圖表時,極度依賴影像中的幾何特徵。
• 縮放與變形:若將 K 線圖直接強制縮放到特定比例(如 $512 \times 512$),會造成 K 線的實體與影線長度比例失真,導致視覺模型誤判波高與斜率。
• 視覺噪聲干擾:過多的輔助線(如過密的 MA 均線、網格線、成交量柱線)會增加 LLM 視覺 attention 的噪聲。建議輸出給 Gemini 的圖表應保留純淨的 K 線與極簡特徵點標註,複雜運算交由函式型指標處裡。
時間維度的幻覺與邊界效應 (Temporal Hallucination)
視覺模型容易將「右側邊界」誤判為突破點,或對沒有顯示完整歷史資料的圖像產生「幻覺式」預測。
• 資訊不對稱:視覺模型無法像演算法一樣「逐點讀取歷史陣列」。因此,必須在 Prompt 中明確提供當前圖表對應的時間區間(如:「此圖為 2026 年 1 月至 9 月的日 K 線」),避免模型混淆時間尺度(15 分鐘線與日線的形態意義截然不同)。
確定性算術與機率性視覺的邏輯衝突
函式型指標(如以 Python 算出的 RSI、MACD 數值)是絕對確定(Deterministic)的,而 Gemini Vision 的輸出是機率性(Probabilistic)的。當視覺判定為「頭肩頂突破」,但函式型指標算出「RSI 底背離」時,代理系統必須具備明確的衝突仲裁機制(Arbitration Rules),避免策略輸出混亂。
二、 圖表型態辨識的四大關鍵優化策略
為了大幅提升 Gemini Vision 辨識幾何型態的精準度,可從以下四個維度進行優化:
┌────────────────────────┐
│ Raw K-Line Chart Data │
└───────────┬───────────┘
│
┌─────────────────────┴─────────────────────┐
▼ ▼
┌─────────────────┐ ┌──────────────────┐
│ 技術指標演算法 │ │ 圖像語意增強模組 │
│ (SMA, RSI, Pivot) │ │ (Bounding Boxes) │
└─────────┬──── ──┘ └─────────┬───────┘
│ │
│ ┌───────────────────────────────┐ │
└────> │ Gemini Vision 雙重檢索Prompt │<────┘
└───────────────┬──────────── ─┘
│
▼
┌───────────────────────────────┐
│ 多模態衝突仲裁與驗證機制 │
└───────────────────────────────┘
JSON
{
"pattern_detected": "Head_and_Shoulders",
"visual_confidence": 0.88,
"key_levels": {
"neckline_price": 142.5,
"target_price": 128.0
},
"indicator_alignment": {
"macd_divergence_confirmed": true,
"volume_breakout_valid": false
},
"final_action": "WATCH_FOR_CONFIRMATION"
}
三、 結論
技術代理(Technical Agent)的終極目標,不是讓 LLM 完全取代傳統的量化指標,而是透過 Gemini Vision 彌補演算法對於複雜幾何圖態(如旗形、楔形)抽象概念的不足。透過「動態視覺標註」、「演算法預先過濾」以及「確定性與機率性的衝突仲裁機制」,工程團隊能建構出一套兼具高精度算力與人類交易員般靈敏視覺感知的高階自動化交易系統。
雖然是由AI Agent寫出程式的內容,但我認為這個程式還是要保留擴充的彈性。