人工智慧 核心 B · 官方指南或詞彙 平台: AI

AI Evaluation

AI 評測

AI 評測是一套可以重複進行的測試方法。它會使用明確的任務、測試資料、評分規則和安全門檻。

看看怎麼運作
也有人這樣說 AI EvaluationAI eval模型評測

看看怎麼運作

原創情境範例AI 評測

另一個例子

團隊用 300 筆留有版本紀錄的客服案例,以及人工核准的答案測試候選模型。他們評量品質、安全、延遲和拒答表現;只有吸睛的展示,不算完整評測。

主要部分

  1. 01版本化資料集
  2. 02評分規準
  3. 03發布門檻

什麼時候用

依照清楚規則比較模型、提示、檢索變更或發布版本時,可以使用這個詞。

什麼時候不要用

不要把評測縮成一個總分,也不要只用幾個沒有版本紀錄的零散提示。

程式裡的名稱

dataset × rubric × evaluator × threshold

上線前要檢查

檢查模型與提示詞版本、參考資料、有版本編號的評估集與指標。驗證答案能否連回來源證據,也要檢查工具權限與隱私。再檢查常見失敗、拒答、安全退路與人工覆核。也要檢查監控、成本、速度與回復方式。

可以直接複製的需求

預期成果:使用或評估 AI 評測 (AI Evaluation),讓 AI 行為可以衡量,也能連回證據。 使用者情境:團隊用 300 筆留有版本紀錄的客服案例,以及人工核准的答案測試候選模型。他們評量品質、安全、延遲和拒答表現;只有吸睛的展示,不算完整評測。 AI 方法或概念:AI 評測 (AI Evaluation)。 適用理由:依照清楚規則比較模型、提示、檢索變更或發布版本時,可以使用這個詞。 不應使用的情況:不要把評測縮成一個總分,也不要只用幾個沒有版本紀錄的零散提示。 AI 要求:定義輸入與參考證據。設定模型和工具權限。使用有版本編號的評估資料與指標。說明失敗、拒答、隱私、速度與成本限制。 營運防護:保留可查詢記錄,並隱藏其中的敏感資料。提供使用者看得懂的安全退路。標出必須由人員覆核的步驟,並定義模型或提示詞的回復方式。 驗收條件:在有版本編號的評估集上記錄目前基準與目標。測試邊界案例與惡意輸入。驗證安全退路、監控、權限與回復方式。 證據與限制(證據邊界):它只代表該來源的官方說法。其他平台或團隊可能有不同用法。 待確認:目標任務、模型與版本、評估負責人、參考資料、風險門檻、工具權限,以及正式環境的安全退路。

檢查這份需求

請 AI 程式助手檢查目前如何使用 AI 評測 (AI Evaluation)。 定義:AI 評測是一套可以重複進行的測試方法。它會使用明確的任務、測試資料、評分規則和安全門檻。 正式環境檢查:檢查模型與提示詞版本、參考資料、有版本編號的評估集與指標。驗證答案能否連回來源證據,也要檢查工具權限與隱私。再檢查常見失敗、拒答、安全退路與人工覆核。也要檢查監控、成本、速度與回復方式。 修改程式前,先列出看到的證據、缺口、嚴重程度,以及最小且安全的修正。

B
這個術語有多正式?

官方指南或詞彙

列出的平台、框架、專案或專業組織,有發布這個術語的官方指南。

它只代表該來源的官方說法。其他平台或團隊可能有不同用法。

適用範圍
只包含來源有說明的內容:正式名稱、定義、使用指南、避免事項
文件狀態
穩定
查證日期
2026-07-30

證據來源與適用範圍

正式來源 + 術語參考資料 · NIST · 穩定 Artificial Intelligence Risk Management Framework (AI RMF 1.0) 適用範圍: 正式名稱、定義、使用指南、避免事項 本頁用途: 直接術語參考 來源涵蓋內容: 正式名稱, 定義, 使用指南, 避免事項

自行複製

瀏覽器無法自動複製。請選取下方文字,再自行複製。