跑一组决策测试,不要只发演示提示词
- 准备 20–50 条有代表性的应用样例。
- 看模型输出前先写清通过标准。
- 系统指令、工具和输出限制保持等价。
- 记录重试、延迟、Token 与人工修正。
- 比较每个通过结果的成本。
模型对比
Claude 与 Gemini 使用不同的请求协议。比较长上下文、工具或多模态能力前,先确认客户端实际使用的模型 ID 和协议。
同一标准、同一任务、同一限制
| 决策项 | Claude 5 | Gemini 3.7 Flash |
|---|---|---|
| 当前官方 ID | claude-sonnet-5(通用起点) | gemini-3.7-flash |
| 状态 | 可用 | 正式稳定版 |
| 厂商协议 | Anthropic Messages | Gemini Interactions / Generate Content |
| 公开上下文 | 按具体模型与平台确认 | 输入 1M / 输出 64K |
| 厂商公开价 | 查看 Anthropic 当前价格 | 2026 年内输入 $0.75 / 输出 $3.75 每百万 |
| 第一组测试 | 编码或长文审查 | 多模态、编码或 AI Agent 工作流 |
只有另一条路由改善了真实工作负载关心的指标——质量、延迟、模态、上下文、工具可靠性或完成任务成本——才值得切换。模型名更新本身不是迁移理由。
不会。表格只帮助缩小第一轮测试,最终由应用评估结果决定。
不能。平台扣费要看模型广场和真实用量记录。
模型版本、当前价格、提示词、工具 Schema 或任务发生明显变化时重跑。
先从模型广场复制两个准确名称,再运行测试集。