生产使用场景

用于代码生成的 LLM API

产品团队收到一个小型功能需求:为现有报表页增加 CSV 导出,同时保持公共 API 不变。模型获得需求、仓库规范、受影响文件和测试命令,返回统一 Diff 以及证明功能有效的测试。

将功能需求转成经过测试、可审查的代码补丁
用于代码生成的 LLM API

生产方案

API、主模型与故障切换配置

生产选择推荐配置原因
APIPOST /v1/chat/completions从服务端发送 OpenAI 兼容请求
主模型gpt-5.6-terraTerra 作为默认模型,因为该流程需要理解仓库并生成可用补丁,但不是每个需求都需要 Sol 级推理。
备用模型gpt-5.4小型隔离修改可降级到 gpt-5.4;修改跨越架构边界,或 Terra 连续两次未通过同一验收测试时升级到 Sol。
升级模型gpt-5.6-sol只有主路由越过已定义的质量或复杂度边界时才使用
输出契约场景专用文本或补丁可干净应用的统一 Diff,以及覆盖每条验收标准的测试。
01
业务场景

代码生成在生产应用中的实际场景

产品团队收到一个小型功能需求:为现有报表页增加 CSV 导出,同时保持公共 API 不变。模型获得需求、仓库规范、受影响文件和测试命令,返回统一 Diff 以及证明功能有效的测试。

LLMFly AI 只负责生成。应用仍需在一次性 Worktree 中检查补丁、运行 Lint 和测试,并把失败结果作为新消息返回。第一次响应不会直接合并。

02
应用架构

代码生成工作流怎样运行

  • 检索需求、仓库规范、受影响文件和测试命令。
  • 要求返回统一 Diff 以及新增或修改的测试。
  • 只在一次性 Worktree 中应用补丁。
  • 运行确定性验证;失败时只允许一次有边界的修复。
  • 把通过验证的补丁交给人工审查。
03
API 请求

通过 LLMFly AI 调用 gpt-5.6-terra

请求应从服务端发送。请将示例内容和占位工具 Schema 替换为应用中的真实数据与工具。

request.example可复制示例
curl https://app.llmfly.ai/v1/chat/completions \
  -H "Authorization: Bearer $LLMFLY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-terra",
    "messages": [
      {"role": "system", "content": "You are editing an existing repository. Return only a unified diff. Preserve public APIs, follow the supplied conventions, and include tests for every acceptance criterion."},
      {"role": "user", "content": "Add CSV export to the report page. Files and acceptance criteria follow below."}
    ]
  }'
04
模型选择

为什么主模型选择 gpt-5.6-terra

Terra 作为默认模型,因为该流程需要理解仓库并生成可用补丁,但不是每个需求都需要 Sol 级推理。

小型隔离修改可降级到 gpt-5.4;修改跨越架构边界,或 Terra 连续两次未通过同一验收测试时升级到 Sol。

05
验收

代码生成的验收条件

指标通过条件
构建与测试通过率补丁能在隔离环境构建,且所有受影响测试通过
需求覆盖率每条验收标准都能对应到修改文件或测试
不必要的文件修改没有未经说明的无关文件、依赖或公共接口修改
每个可接受补丁的成本生成、重试、测试和审查总成本不超过团队单次修改预算
06
失败处理

上线前必须处理的失败情况

  • 只测试玩具提示词
  • 接受能编译但未满足需求的代码
  • 给候选模型不等量的上下文
  • 忽略审查和修复成本
07
输出

返回结果与运行记录

可干净应用的统一 Diff,以及覆盖每条验收标准的测试。

每次生产运行都应记录模型 ID、Request ID、Token 用量、重试、验证结果和最终处理状态。

常见问题

代码生成基准应该包含什么?

使用来自真实仓库的任务,并固定需求、测试命令和审查标准。

生成代码可以自动合并吗?

应把它视为不受信任的补丁,在隔离环境构建和测试,再按风险审查。

只比较 Token 单价够吗?

不够。应比较计入重试、测试、审查和修复后的每个可接受补丁成本。

使用你的真实输入测试这套方案

让主模型和备用模型使用相同请求、工具和验证规则。

比较模型