iT邦幫忙

2026 iThome 鐵人賽

DAY 5
0
Build on Google AI

基本面與技術面組合投資模型建置系列 第 9 篇

設定技術代理:結合函式型指標與 Gemini Vision,進行多模態圖表型態辨識。

  • 分享至 

  • xImage
  •  

第十天 09/24
在量化交易與自動化技術分析的領域中,將函式型技術指標(Deterministic Math-based Indicators)與 Gemini Vision 多模態視覺辨識相結合,能完美補足「純數值演算法缺乏全景空間感」與「純視覺 LLM 缺乏精確數值微觀計算」的各自短板。
然而,在實作「技術代理(Technical Agent)」的程式模型時,要讓兩者無縫對接並提供高品質的 K 線圖態辨識(如頭肩頂、雙重底、三角收斂等),需要特別注意系統整合的細節與優化策略。
一、 結合過程中需特別注意的核心事項

  1. 座標軸與幾何失真問題 (Resolution & Aspect Ratio Distortion)
    Gemini Vision 在辨識圖表時,極度依賴影像中的幾何特徵。
    • 縮放與變形:若將 K 線圖直接強制縮放到特定比例(如 $512 \times 512$),會造成 K 線的實體與影線長度比例失真,導致視覺模型誤判波高與斜率。
    • 視覺噪聲干擾:過多的輔助線(如過密的 MA 均線、網格線、成交量柱線)會增加 LLM 視覺 attention 的噪聲。建議輸出給 Gemini 的圖表應保留純淨的 K 線與極簡特徵點標註,複雜運算交由函式型指標處裡。

  2. 時間維度的幻覺與邊界效應 (Temporal Hallucination)
    視覺模型容易將「右側邊界」誤判為突破點,或對沒有顯示完整歷史資料的圖像產生「幻覺式」預測。
    • 資訊不對稱:視覺模型無法像演算法一樣「逐點讀取歷史陣列」。因此,必須在 Prompt 中明確提供當前圖表對應的時間區間(如:「此圖為 2026 年 1 月至 9 月的日 K 線」),避免模型混淆時間尺度(15 分鐘線與日線的形態意義截然不同)。

  3. 確定性算術與機率性視覺的邏輯衝突
    函式型指標(如以 Python 算出的 RSI、MACD 數值)是絕對確定(Deterministic)的,而 Gemini Vision 的輸出是機率性(Probabilistic)的。當視覺判定為「頭肩頂突破」,但函式型指標算出「RSI 底背離」時,代理系統必須具備明確的衝突仲裁機制(Arbitration Rules),避免策略輸出混亂。
    二、 圖表型態辨識的四大關鍵優化策略
    為了大幅提升 Gemini Vision 辨識幾何型態的精準度,可從以下四個維度進行優化:

                          ┌────────────────────────┐
               │ Raw K-Line Chart Data    │
               └───────────┬───────────┘
                                    │
       ┌─────────────────────┴─────────────────────┐
       ▼                                                       ▼
    

┌─────────────────┐ ┌──────────────────┐
│ 技術指標演算法 │ │ 圖像語意增強模組 │
│ (SMA, RSI, Pivot) │ │ (Bounding Boxes) │
└─────────┬──── ──┘ └─────────┬───────┘
│ │
│ ┌───────────────────────────────┐ │
└────> │ Gemini Vision 雙重檢索Prompt │<────┘
└───────────────┬──────────── ─┘
│
▼
┌───────────────────────────────┐
│ 多模態衝突仲裁與驗證機制 │
└───────────────────────────────┘

  1. 導入「動態語意標註」(Visual Prompting & Dynamic Bounding Boxes)
    不要只把原始 K 線圖傳給 Gemini,而是在將圖像送入 Vision API 前,先利用 Python 的 Matplotlib 或 Plotly 演算法,在圖表上自動繪製輔助特徵:
    • 標示出關鍵的樞紐點(Pivot Highs / Pivot Lows)與切線。
    • 將潛在的圖態區塊以透明彩色矩形(Bounding Box)框起,並加上文字標籤(例如在左肩、頭部、右肩處標註 A、B、C)。這能大幅提高 Gemini 視線聚焦(Attention)的準確度。
  2. 雙重驗證 Prompt 設計(Chain-of-Thought Validation)
    在要求 Gemini Vision 給出結論前,強制其執行 CoT(思維鏈)分析,步驟如下:
  3. 特徵列舉:要求模型先列出圖中觀察到的高點與低點座標(如:「點 1 為高點 $150,點 2 為次高點 $145」)。
  4. 幾何邏輯校驗:回答「右肩高點是否低於頭部高點?」、「突破頸線時的成交量是否放大?」。
  5. 型態結論:通過前述邏輯檢驗後,才能輸出 최종 型態名稱與信心指數。
  6. 函式指標作為「視覺錨定過濾器」(Deterministic Pre-filtering)
    利用函式型指標作為第一關 Pass/Fail 門檻,節省 Token 並提升效率:
    • 例如,若要辨識「雙重底(W 底)」,先由 Python 演算法對價格陣列進行掃描,確認近 50 根 K 線內確實存在兩個相近的局部極小值(極小值相差 $< 2%$)。
    • 僅在演算法觸發潛在候選區間時,才截圖並呼叫 Gemini Vision 進行視覺型態確認。這樣能實現「演算法算得快、AI 視覺看的準」的雙重優勢。
  7. 建立結構化多模態JSON輸出與信心評分
    結合 Gemini 1.5/2.0 的結構化輸出功能,要求模型將視覺判讀與邏輯結合,輸出帶有信心分數的 JSON:

JSON
{
"pattern_detected": "Head_and_Shoulders",
"visual_confidence": 0.88,
"key_levels": {
"neckline_price": 142.5,
"target_price": 128.0
},
"indicator_alignment": {
"macd_divergence_confirmed": true,
"volume_breakout_valid": false
},
"final_action": "WATCH_FOR_CONFIRMATION"
}

三、 結論
技術代理(Technical Agent)的終極目標,不是讓 LLM 完全取代傳統的量化指標,而是透過 Gemini Vision 彌補演算法對於複雜幾何圖態(如旗形、楔形)抽象概念的不足。透過「動態視覺標註」、「演算法預先過濾」以及「確定性與機率性的衝突仲裁機制」,工程團隊能建構出一套兼具高精度算力與人類交易員般靈敏視覺感知的高階自動化交易系統。

雖然是由AI Agent寫出程式的內容,但我認為這個程式還是要保留擴充的彈性。


上一篇
設定事件與產業代理-->事件發生時對價格影響與敏感度分析
下一篇
實作主要風險代理:在系統提示中制定嚴格的風險界線, 會遇到那些困難及如何突破
系列文
基本面與技術面組合投資模型建置 共 16 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言