提供商模型

Google Gemini 模型

Gemini 3.7 Flash 是 Google 面向生产环境的 Flash 模型,适合编码、AI Agent 与多模态推理,上下文窗口为 1M Token。

核心规格数据源复核于 2026 年 9 月 1 日
gemini-3.7-flash1M / 64K · 截至 2026-12-31 为 $0.75 / $3.75 · 正式稳定版
gemini-3.6-flash查看当前模型页 · 查看当前价格页 · 正式稳定版
gemini-3.1-pro-preview1M / 64K · 输入低于 200K 时 $2 / $12 · 预览版

可选模型

从系列进入具体模型页

Google 具体型号

Gemini 3.7 Flash

Google 面向生产环境的 Flash 主力模型,适合编码、多模态推理、AI Agent 工作流和大规模调用。

1,048,576 context · $0.75 input / $3.75 output through Dec 31, 2026
02

按决策阅读

01

如何选择系列内的型号

先确定工作负载和服务目标,再选择能通过真实测试集的最小型号。

  • 多模态编码和 AI Agent 工作流可优先测试正式版 Gemini 3.7 Flash。
  • 如果稳定行为比最新能力更重要,可继续评估 Gemini 3.6 Flash。
  • 预览版模型必须可以快速切换,并准备经过测试的备用型号。
02

输入、输出、上下文与工具

  • Gemini 3.7 Flash 接受文本、图片、视频、音频与 PDF 输入,并输出文本。
  • 公开输入上限为 1,048,576 Token,输出上限为 65,536 Token。
  • 能力包括函数调用、结构化输出、代码执行、网页搜索溯源(Search Grounding)、文件搜索和指定网页内容读取(URL Context)。
  • 推理强度支持 low、medium、high,文档默认值为 medium。
03

适合哪些工作负载

这些是优先测试方向,不是放之四海而皆准的结论。请使用自己的提示词、工具和验收条件。

  • 在同一请求中处理视频、音频和文档。
  • 结合结构化工具与大上下文的编码 Agent。
  • 需要最新网页信息的搜索溯源分析。
  • 带明确 Schema 的大批量抽取与分类。
04

推理、上下文与成本控制

  • 重复使用大型前缀时评估上下文缓存,并用真实流量核对缓存成本。
  • 异步工作负载可评估 Batch 降低厂商成本,但需确认路由是否支持。
  • 生产环境固定准确稳定 ID,不要依赖会变化的 Preview 别名。
05

发送一个最小请求

示例使用表格中的第一个厂商模型 ID。如果模型广场显示的 ID 不同,请改用当前 API Key 可用的模型 ID。

request.example可复制示例
curl https://app.llmfly.ai/v1/chat/completions \
  -H "Authorization: Bearer $LLMFLY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [{"role": "user", "content": "Explain this request in three bullets."}],
    "stream": false
  }'
06

限制与兼容性说明

  • Gemini 3.7 Flash 不提供音频或图片生成,也不支持 Live API。
  • Computer use 属于 Preview 能力,需要单独的风险控制。
  • 价格和 Preview 状态会随时间变化,上线前必须重新核对。
07

生产上线评估清单

  • 准备 20–50 条有代表性的任务,并在测试前写明通过条件。
  • 记录首 Token 延迟、总延迟、输入输出 Token、工具重试和完整任务成本。
  • 验证应用实际使用的 Endpoint、流式模式、工具 Schema 与结构化输出。
  • 验证 400、401、404、429 和临时 5xx 的处理方式,并限制重试次数。
  • 将模型 ID 放进配置,并在正式切换前验证备用模型。
08

哪些信息必须在 LLMFly AI 中确认

模型广场会显示当前 API Key 可用的模型 ID、计费倍率、可用状态、支持的接口和兼容说明。部署前请确认这些信息,并发送一个小请求验证。

  • Gemini 3.7 Flash 支持 low、medium 与 high 三档 thinking level。
  • 公开输入模态包括文本、图片、视频、文件和音频。
  • Preview 别名可能变化;生产环境应优先选择满足任务的稳定准确 ID。

常见问题

表里的模型 ID 可以直接发给 LLMFly AI 吗?

不一定。它们是厂商 ID,请使用模型广场中当前 API Key 可用的模型 ID。

表里是 LLMFly AI 的价格吗?

不是。它们是厂商参考价,实际扣费以模型广场和用量记录为准。

上下文窗口越大,回答一定越好吗?

不一定。经过筛选的上下文通常有更好的相关性、延迟和成本表现。公开窗口是上限,不是目标。

推理强度应该怎么选?

先使用文档默认值,只有测试显示质量或延迟有明确收益时再调整。

生产备用模型需要满足什么?

备用模型必须通过相同的请求格式、工具 Schema 与安全检查,并由应用明确何时允许切换。

确认当前路由

把模型名写入生产配置前,先打开模型广场核对。

打开模型广场