选择应用需要返回的结果
分析长文档、返回经过验证的结构化数据,或解释已核对的计算结果。进入与目标输出一致的任务。
- 用于文档分析的 LLM API
- 用于结构化数据抽取的 LLM API
- 用于数学推理的 LLM API
文档与数据使用场景
分析长文档、返回经过验证的结构化数据,或解释已核对的计算结果。进入与目标输出一致的任务。

生产方案
| 需要衡量什么 | 需要记录什么 |
|---|---|
| 真实任务集准确率 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
| 输出一致性 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
| 延迟预算 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
| 重试和验证成本 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
分析长文档、返回经过验证的结构化数据,或解释已核对的计算结果。进入与目标输出一致的任务。
使用已知答案、证据缺失与冲突样例、严格 Schema 和确定性检查。只有应用能够验证关键字段或结果时才接受响应。
计入重试、工具调用、验证、升级和人工修正。应该比较应用实际能够接受的结果总成本,而不是只看 Token 单价。
优先选择请求量最大或风险最高,而且已经具备代表性输入和明确成功条件的工作流。
先测试推荐模型和一个备用模型。只有两者都无法达到质量、延迟或成本要求时,再加入其他候选。
所有模型应使用相同输入、上下文、工具、输出限制、验证规则和停止条件。
使用相同的应用输入和验证规则,对比主路由与备用路由。