选择你要完成的编码任务
生成功能、审查 Pull Request,或规划跨文件重构。进入与你要修改的代码最接近的任务。
- 用于代码生成的 LLM API
- 用于代码审查的 LLM API
- 用于仓库重构的 LLM API
编码使用场景
生成功能、审查 Pull Request,或规划跨文件重构。进入与你要修改的代码最接近的任务。

生产方案
| 需要衡量什么 | 需要记录什么 |
|---|---|
| 在真实仓库中的修改正确率 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
| 工具调用可靠性 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
| 迭代过程中的延迟 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
| 每次有效修改的成本 | 结果、延迟、Token 用量,以及接受或拒绝输出的原因 |
生成功能、审查 Pull Request,或规划跨文件重构。进入与你要修改的代码最接近的任务。
使用真实需求、仓库规范、构建命令和审查规则。结果必须能在你的代码库中工作,而不只是看起来合理。
计入重试、工具调用、验证、升级和人工修正。应该比较应用实际能够接受的结果总成本,而不是只看 Token 单价。
优先选择请求量最大或风险最高,而且已经具备代表性输入和明确成功条件的工作流。
先测试推荐模型和一个备用模型。只有两者都无法达到质量、延迟或成本要求时,再加入其他候选。
所有模型应使用相同输入、上下文、工具、输出限制、验证规则和停止条件。
使用相同的应用输入和验证规则,对比主路由与备用路由。