Google 模型系列
Gemini API 模型:价格、上下文与型号选择
根据多模态输入、长上下文、编码、网页搜索溯源、结构化输出和生产级 AI Agent 需求选择 Gemini API 模型。
核心规格规格复核于 2026 年 9 月 1 日
gemini-3.7-flash1M / 64K · 截至 2026-12-31 为 $0.75 / $3.75 · 正式稳定版
gemini-3.6-flash查看当前模型页 · 查看当前价格页 · 正式稳定版
gemini-3.1-pro-preview1M / 64K · 输入低于 200K 时 $2 / $12 · 预览版
可选模型
从系列进入具体模型页
02
按决策阅读
Gemini API 型号怎么选
先选择最有可能满足任务的最小型号,再用同一批任务与一个更高能力候选比较,最后根据通过结果质量、延迟、可靠性和总成本决定。
- 多模态编码和 AI Agent 工作流可优先测试正式版 Gemini 3.7 Flash。
- 如果稳定行为比最新能力更重要,可继续评估 Gemini 3.6 Flash。
- 预览版模型必须可以快速切换,并准备经过测试的备用型号。
Gemini API 支持哪些能力
- Gemini 3.7 Flash 接受文本、图片、视频、音频与 PDF 输入,并输出文本。
- 公开输入上限为 1,048,576 Token,输出上限为 65,536 Token。
- 能力包括函数调用、结构化输出、代码执行、网页搜索溯源(Search Grounding)、文件搜索和指定网页内容读取(URL Context)。
- 推理强度支持 low、medium、high,文档默认值为 medium。
Gemini 价格与上下文应该怎么看
不要只比较输入单价。还应计入输出、缓存读写、长上下文档位、推理 Token、工具调用、重试,以及每轮重复发送的历史内容。
- 重复使用大型前缀时评估上下文缓存,并用真实流量核对缓存成本。
- 异步工作负载可评估 Batch 降低厂商成本,但需确认路由是否支持。
- 生产环境固定准确稳定 ID,不要依赖会变化的 Preview 别名。
Gemini 适合哪些工作负载
- 在同一请求中处理视频、音频和文档。
- 结合结构化工具与大上下文的编码 Agent。
- 需要最新网页信息的搜索溯源分析。
- 带明确 Schema 的大批量抽取与分类。
Gemini API 限制与迁移风险
- Gemini 3.7 Flash 不提供音频或图片生成,也不支持 Live API。
- Computer use 属于 Preview 能力,需要单独的风险控制。
- 价格和 Preview 状态会随时间变化,上线前必须重新核对。
从型号研究进入实际调用
先打开上方具体型号页查看厂商模型 ID,再到模型广场确认当前 API Key 可用的模型 ID。把 ID 保存在配置中,方便审查、测试和回滚,而不必重写应用。
常见问题
Gemini API 应该选哪个型号?
先选择公开能力符合任务的最小候选,再用真实测试集与一个更强型号比较。
Gemini API 价格是多少?
价格属于具体型号和路由。请进入准确型号页查看厂商价,再到模型广场确认 LLMFly AI 路由费率。
Gemini 的上下文窗口多大?
上下文限制取决于准确型号,不能根据系列名称推断。请查看具体型号页和实时目录。
Gemini 可以使用兼容 OpenAI 的客户端吗?
模型广场标记为兼容的路由可以使用,但必须测试应用需要的 Endpoint、流式输出、工具、结构化输出与错误行为。
为什么要把模型 ID 放在配置中?
这样可以测试、回滚和切换路由,避免厂商 ID 散落在代码各处。
选择一个 Gemini 模型
打开模型广场,确认模型 ID、API Key 权限、可用状态和当前价格。