提供商模型

xAI Grok 模型

xAI 将 Grok 4.6 定位为旗舰模型,适合编码、对话、可配置推理与 Agent 工具调用。

核心规格数据源复核于 2026 年 9 月 1 日
官方模型 IDgrok-4.6
上下文500K
推理可配置
输入 / 输出每百万 Token$2 / $6

可选模型

从系列进入具体模型页

xAI 具体型号

Grok 4.6

xAI 旗舰模型,面向编码、Agent 任务、知识工作、长流程工具调用与视觉交互。

500K context · $2 input / $6 output
02

按决策阅读

01

如何选择系列内的型号

先确定工作负载和服务目标,再选择能通过真实测试集的最小型号。

  • 编码、知识工作和需要大上下文的工具型 Agent 可优先测试 Grok 4.6。
  • 交互任务先用 low 或 medium;只有质量提升足以覆盖延迟和输出成本时才使用 high 或 xhigh。
  • 简单分类或抽取若测试无明显收益,应选择更轻量的路由。
02

输入、输出、上下文与工具

  • 通过 Responses 与 Chat Completions API 接收文本和图片,并输出文本。
  • 500K 上下文适合大型代码库、长文档和较长的 Agent 历史。
  • 公开工具包括函数调用、网页搜索、X 搜索与代码执行。
  • 推理强度支持 low、medium、high、xhigh,文档默认值为 high。
03

适合哪些工作负载

这些是优先测试方向,不是放之四海而皆准的结论。请使用自己的提示词、工具和验收条件。

  • 多文件编码、调试和仓库分析。
  • 结合网页搜索、X 搜索与结构化工具的研究 Agent。
  • 跨大量资料的长篇知识工作。
  • 需要代码执行与函数调用的多步骤流程。
04

推理、上下文与成本控制

  • 长时间 Agent 循环可使用 prompt_cache_key 或 Chat Completions 会话 Header 提升缓存命中稳定性。
  • 接近 500K 前应压缩或总结上下文,不要持续重发无限增长的完整历史。
  • 实时互联网或 X 信息必须启用对应搜索工具;基础模型本身不是实时数据源。
05

发送一个最小请求

示例使用表格中的第一个厂商模型 ID。如果模型广场显示的 ID 不同,请改用当前 API Key 可用的模型 ID。

request.example可复制示例
curl https://app.llmfly.ai/v1/chat/completions \
  -H "Authorization: Bearer $LLMFLY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.6",
    "messages": [{"role": "user", "content": "Explain this request in three bullets."}],
    "stream": false
  }'
06

限制与兼容性说明

  • 达到厂商长上下文阈值后,请求价格会翻倍;需确认所选路由如何计费。
  • 图片输入受格式和大小限制,上线前应验证预处理流程。
  • 新版 Grok 并不支持所有旧采样参数,包括 log probabilities。
07

生产上线评估清单

  • 准备 20–50 条有代表性的任务,并在测试前写明通过条件。
  • 记录首 Token 延迟、总延迟、输入输出 Token、工具重试和完整任务成本。
  • 验证应用实际使用的 Endpoint、流式模式、工具 Schema 与结构化输出。
  • 验证 400、401、404、429 和临时 5xx 的处理方式,并限制重试次数。
  • 将模型 ID 放进配置,并在正式切换前验证备用模型。
08

哪些信息必须在 LLMFly AI 中确认

模型广场会显示当前 API Key 可用的模型 ID、计费倍率、可用状态、支持的接口和兼容说明。部署前请确认这些信息,并发送一个小请求验证。

  • Grok 4.6 提供 500K 上下文。
  • 可按任务需要配置推理强度。
  • 请求中的模型 ID 必须对当前 API Key 可用;不可用的名称会返回 404。

常见问题

表里的模型 ID 可以直接发给 LLMFly AI 吗?

不一定。它们是厂商 ID,请使用模型广场中当前 API Key 可用的模型 ID。

表里是 LLMFly AI 的价格吗?

不是。它们是厂商参考价,实际扣费以模型广场和用量记录为准。

上下文窗口越大,回答一定越好吗?

不一定。经过筛选的上下文通常有更好的相关性、延迟和成本表现。公开窗口是上限,不是目标。

推理强度应该怎么选?

先使用文档默认值,只有测试显示质量或延迟有明确收益时再调整。

生产备用模型需要满足什么?

备用模型必须通过相同的请求格式、工具 Schema 与安全检查,并由应用明确何时允许切换。

确认当前路由

把模型名写入生产配置前,先打开模型广场核对。

打开模型广场