选择 Agent 需要执行的操作
调用应用函数、操作浏览器工具,或协调多步骤工作流。从最接近产品动作边界的任务开始。
- 用于函数调用的 LLM API
- 用于浏览器 Agent 的 LLM API
- 用于工作流自动化的 LLM API
Agent 使用场景
调用应用函数、操作浏览器工具,或协调多步骤工作流。从最接近产品动作边界的任务开始。

生产方案
| 需要衡量什么 | 需要记录什么 |
|---|---|
| 工具选择是否正确 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
| Schema 遵循情况 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
| 工具报错后的恢复能力 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
| 完整循环成本 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
调用应用函数、操作浏览器工具,或协调多步骤工作流。从最接近产品动作边界的任务开始。
检查工具选择、参数、权限、重试、确认步骤和最终应用状态。消息看起来正确,并不代表实际操作正确。
计入重试、工具调用、验证、升级和人工修正。应该比较应用实际能够接受的结果总成本,而不是只看 Token 单价。
优先选择请求量最大或风险最高,而且已经具备代表性输入和明确成功条件的工作流。
先测试推荐模型和一个备用模型。只有两者都无法达到质量、延迟或成本要求时,再加入其他候选。
所有模型应使用相同输入、上下文、工具、输出限制、验证规则和停止条件。
使用相同的应用输入和验证规则,对比主路由与备用路由。