人工智能 核心 B · 官方指南或术语 平台: AI

AI Evaluation

AI 评测

AI 评测是一套可以重复进行的测试方法。它会使用明确的任务、测试数据、评分规则和安全门槛。

看看怎样运作
也有人这样说 AI EvaluationAI eval模型评测

看看怎样运作

原创情境示例AI 评测

另一个例子

团队用 300 条留有版本记录的客服案例,以及人工批准的答案测试候选模型。他们评估质量、安全、延迟和拒答表现;只有吸引眼球的演示,不算完整评测。

主要部分

  1. 01版本化数据集
  2. 02评分规则
  3. 03发布阈值

什么时候用

按照清楚规则比较模型、提示、检索改动或发布版本时,可以使用这个词。

什么时候不要用

不要把评测缩成一个总分,也不要只用几个没有版本记录的零散提示。

代码里的名称

dataset × rubric × evaluator × threshold

上线前要检查

检查模型与提示词版本、参考数据、有版本号的评估集与指标。验证答案能否连回来源证据,也要检查工具权限与隐私。再检查常见失败、拒答、安全备用做法与人工复核。也要检查监控、成本、速度与恢复方式。

可以直接复制的需求

预期结果:使用或评估 AI 评测 (AI Evaluation),让 AI 行为可以衡量,也能连回证据。 用户场景:团队用 300 条留有版本记录的客服案例,以及人工批准的答案测试候选模型。他们评估质量、安全、延迟和拒答表现;只有吸引眼球的演示,不算完整评测。 AI 方法或概念:AI 评测 (AI Evaluation)。 适用理由:按照清楚规则比较模型、提示、检索改动或发布版本时,可以使用这个词。 不应使用的情况:不要把评测缩成一个总分,也不要只用几个没有版本记录的零散提示。 AI 要求:定义输入与参考证据。设置模型和工具权限。使用有版本号的评估数据与指标。说明失败、拒答、隐私、速度与成本限制。 运营防护:保留可查询记录,并隐藏其中的敏感数据。提供用户看得懂的安全备用做法。标出必须由人工复核的步骤,并定义模型或提示词的恢复方式。 验收标准:在有版本号的评估集上记录当前基线与目标。测试边界案例与恶意输入。验证安全备用做法、监控、权限与恢复方式。 证据与限制(证据边界):它只代表该来源的官方说法。其他平台或团队可能有不同用法。 待确认:目标任务、模型与版本、评估负责人、参考数据、风险阈值、工具权限,以及生产环境的安全备用做法。

检查这份需求

请 AI 编程助手检查当前如何使用 AI 评测 (AI Evaluation)。 定义:AI 评测是一套可以重复进行的测试方法。它会使用明确的任务、测试数据、评分规则和安全门槛。 生产环境检查:检查模型与提示词版本、参考数据、有版本号的评估集与指标。验证答案能否连回来源证据,也要检查工具权限与隐私。再检查常见失败、拒答、安全备用做法与人工复核。也要检查监控、成本、速度与恢复方式。 修改程序前,先列出看到的证据、缺口、严重程度,以及最小且安全的修正。

B
这个术语有多正式?

官方指南或术语

列出的平台、框架、项目或专业组织,发布了这个术语的官方指南。

它只代表该来源的官方说法。其他平台或团队可能有不同用法。

适用范围
只包含来源有说明的内容:正式名称、定义、使用指南、避免事项
文档状态
稳定
核验日期
2026-07-30

证据来源与适用范围

正式来源 + 术语参考资料 · NIST · 稳定 Artificial Intelligence Risk Management Framework (AI RMF 1.0) 适用范围: 正式名称、定义、使用指南、避免事项 本页用途: 直接术语参考 来源涵盖内容: 正式名称, 定义, 使用指南, 避免事项

自行复制

浏览器无法自动复制。请选择下方文字,再自行复制。