编码使用场景

适合编码的 LLM API

生成功能、审查 Pull Request,或规划跨文件重构。进入与你要修改的代码最接近的任务。

代码编辑器中展示 AI 生成的补丁和已通过的测试
适合编码的 LLM API

生产方案

API、主模型与故障切换配置

需要衡量什么需要记录什么
在真实仓库中的修改正确率结果、延迟、Token 用量,以及接受或拒绝输出的原因
工具调用可靠性结果、延迟、Token 用量,以及接受或拒绝输出的原因
迭代过程中的延迟结果、延迟、Token 用量,以及接受或拒绝输出的原因
每次有效修改的成本结果、延迟、Token 用量,以及接受或拒绝输出的原因
01

选择你要完成的编码任务

生成功能、审查 Pull Request,或规划跨文件重构。进入与你要修改的代码最接近的任务。

  • 用于代码生成的 LLM API
  • 用于代码审查的 LLM API
  • 用于仓库重构的 LLM API
02

在真实代码仓库中测试

使用真实需求、仓库规范、构建命令和审查规则。结果必须能在你的代码库中工作,而不只是看起来合理。

  • 在真实仓库中的修改正确率
  • 工具调用可靠性
  • 迭代过程中的延迟
  • 每次有效修改的成本
03

计算可用结果的完整成本

计入重试、工具调用、验证、升级和人工修正。应该比较应用实际能够接受的结果总成本,而不是只看 Token 单价。

常见问题

应该先做哪个工作流?

优先选择请求量最大或风险最高,而且已经具备代表性输入和明确成功条件的工作流。

第一轮应该测试多少个模型?

先测试推荐模型和一个备用模型。只有两者都无法达到质量、延迟或成本要求时,再加入其他候选。

比较模型时哪些条件必须一致?

所有模型应使用相同输入、上下文、工具、输出限制、验证规则和停止条件。

为这项工作选择模型

使用相同的应用输入和验证规则,对比主路由与备用路由。

浏览模型