> For the complete documentation index, see [llms.txt](https://doc.duaer.com/zh/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://doc.duaer.com/zh/advanced-ai/evaluations/overview.md).

# 在 Duaer 里理解为什么要做评估

在 Duaer 里，用评估对照已知测试样例，确认 AI 数字组织在多种输入下仍然可靠。
## 评估是什么

评估是检查 AI 数字组织是否可靠的方法。它可以把脆弱的演示做成能上线的流程。搭建阶段和发布之后都需要。

评估的基础是把一份测试集跑过数字组织。测试集里有多条用例；每条至少有一份输入，常常还带期望输出。

- 在多种输入下试跑，看到边界情况表现如何
- 改提示或模型时更有把握，避免修好一处坏了别处
- 对照不同模型或提示的表现

## 为什么需要评估

模型不像普通代码那样可推演。它们像黑箱，只能靠多条真实输入跑出来再看输出。

只有覆盖生产里会遇到的边界样例之后，才能相信这条数字组织在线上也稳。

## 两种评估

轻量评估（上线前）：先手写少量样例就够迭代到可发布或可演示。并排看输出即可，不必先上正式指标。步骤见 [轻量评估](/zh/advanced-ai/evaluations/light-evaluations.md)。

基于指标的评估（上线后）：用生产执行补大测试集。发现 bug 就把那次输入加进集；修好后再整集回归。样例太多时用数字指标汇总质量，并在评估页追踪变化。见 [用指标衡量质量](/zh/advanced-ai/evaluations/metric-based-evaluations.md)。

## 两种方式怎么对照

- 每次改动的提升：轻量阶段通常很大；指标阶段通常较小
- 测试集规模：轻量小；指标大
- 数据来源：轻量多为手写或少量生成；指标常来自生产执行，也可再生成
- 实际输出：两种都需要
- 期望输出：轻量可选；指标通常需要
- 评估指标：轻量可选；指标必需

接线卡壳或结果空着时，先看 [常见问题](/zh/advanced-ai/evaluations/tips-and-common-issues.md)。画布「评测」页的「更多信息」也指到这一页。
## Questions

### Duaer 里的评估是做什么的？

在 Duaer 里，评估用测试集反复跑同一条 AI 数字组织，对照输出是否可靠。构建期和上线后都要用。

### 轻量评估和基于指标的评估怎么选？

样本少、还在改提示时用轻量评估，肉眼对照输出即可。样本变多、要回归时改用指标评估，把分数记进评估页。

