xAI Grok 模型

xAI Grok 模型可在 Gemini Enterprise Agent Platform 上作为受管理的 API 使用。您可以流式传输回答,以降低最终用户对延迟时间的感知度。流式回答使用服务器发送的事件 (SSE) 来逐步流式传输回答。

受管理的 xAI 模型

xAI 提供了以下模型,可在 Gemini Enterprise Agent Platform 中使用。如需访问 xAI 模型,请前往其 Model Garden 模型卡片。

Grok 4.7 xAI 推出的高能力模型,专为编码和知识工作而打造。在处理困难任务时,它会花费更多时间,并检查自己的工作。
Grok 4.6 xAI 推出的高能力模型,专为编码、智能体任务和知识工作而打造。
Grok 4.3 xAI 提供的高性能模型。
Grok 4.20(推理) xAI 的高性能模型,具有低幻觉率。擅长处理文档理解任务和长周期代理工具调用。
Grok 4.20(非推理) xAI 的高性能非思考模型,具有低幻觉率。在对延迟敏感的应用场景(例如客户支持和分类)中表现出色。
Grok 4.1 Fast(推理) (已弃用)xAI 推出的经济高效型模型,具有强大的工具调用功能和高效的知识库整合能力。擅长处理涉及网络数据和内部知识库工具的搜索任务。
Grok 4.1 Fast(非推理) (已弃用)xAI 推出的经济实惠的非推理模型,针对低延迟性能进行了优化。擅长处理汇总和分类等大批量任务。

使用 xAI 模型

如需了解如何对 xAI 模型进行流式调用和非流式调用,请参阅调用开放模型 API。

对于受管模型,您可以使用 curl 命令通过以下模型名称向 Gemini Enterprise Agent Platform 端点发送请求:

  • 对于 Grok 4.7,请使用 grok-4.7
  • 对于 Grok 4.6,请使用 grok-4.6
  • 对于 Grok 4.3,请使用 grok-4.3
  • 对于 Grok 4.20(推理),请使用 grok-4.20-reasoning
  • 对于 Grok 4.20(非推理),请使用 grok-4.20-non-reasoning
  • 对于 Grok 4.1 Fast(推理),请使用 grok-4.1-fast-reasoning
  • 对于 Grok 4.1 Fast(非推理),请使用 grok-4.1-fast-non-reasoning

Grok 配额

Grok 模型具有单一的全局配额,该配额适用于每个基础模型,而不是每个端点:对全球端点和美国多区域端点的请求会使用相同的底层限额。配额以每分钟查询次数 (QPM) 和每分钟令牌数 (TPM) 为单位指定,其中 TPM 包括输入和输出令牌。

为了保持整体服务性能和可接受的使用情况,配额上限可能会因账号而异,并且在某些情况下,访问可能会受到限制。在 Google Cloud 控制台的配额和系统限制页面上查看项目的配额。您还必须拥有以下可用配额:

  • global_generate_content_requests_per_minute_per_project_per_base_model 定义您的 QPM 配额。

  • 对于 TPM,有两个配额值适用于特定模型:global_generate_content_input_tokens_per_minute_per_base_model 定义了输入 TPM 配额,global_generate_content_output_tokens_per_minute_per_base_model 定义了输出 TPM 配额。

如需了解哪些模型会分别统计输入和输出 token,请参阅特定模型页面。

后续步骤