iT邦幫忙

evaluation相關文章
共有 3 則文章
鐵人賽 Build on Google AI DAY 15

技術 【Day 22】離線評測體系:如何為 LLM 金融 Agent 建立客觀的 Evaluation 指標

「在 AI Agent 的工程週期中,『沒有量測,就無法改善』。要確保每一次 Prompt 調整或 API 重構不會造成性能退化,必須在腳本內部實作決定性的格式...

技術 計算 LLM 的 Perplexity 困惑度

簡介 困惑度 (Perplexity, PPL) 是個評估語言模型相當實用的指標,用來表示語言模型對一句話的困惑程度。什麼叫困惑程度呢?當我們看到一句話會產生困...

鐵人賽 AI & Data DAY 21
PyTorch 生態鏈實戰運用 系列 第 21

技術 [Day21] EVALUATION ON TEST SET

前言 前幾日的文章,已經利用scheduler訓練出在Validation上還不錯的結果,今天就來test一下,順帶討論一下test的一些哲學吧! 什麼是Tes...