xAI Grok 模型可在 Gemini Enterprise Agent Platform 上作为受管理的 API 使用。您可以流式传输回答,以降低最终用户对延迟时间的感知度。流式回答使用服务器发送的事件 (SSE) 来逐步流式传输回答。
受管理的 xAI 模型
xAI 提供了以下模型,可在 Gemini Enterprise Agent Platform 中使用。如需访问 xAI 模型,请前往其 Model Garden 模型卡片。
使用 xAI 模型
如需了解如何对 xAI 模型进行流式调用和非流式调用,请参阅调用开放模型 API。
对于受管模型,您可以使用 curl 命令通过以下模型名称向 Gemini Enterprise Agent Platform 端点发送请求:
- 对于 Grok 4.7,请使用
grok-4.7 - 对于 Grok 4.6,请使用
grok-4.6 - 对于 Grok 4.3,请使用
grok-4.3 - 对于 Grok 4.20(推理),请使用
grok-4.20-reasoning - 对于 Grok 4.20(非推理),请使用
grok-4.20-non-reasoning - 对于 Grok 4.1 Fast(推理),请使用
grok-4.1-fast-reasoning - 对于 Grok 4.1 Fast(非推理),请使用
grok-4.1-fast-non-reasoning
Grok 配额
Grok 模型具有单一的全局配额,该配额适用于每个基础模型,而不是每个端点:对全球端点和美国多区域端点的请求会使用相同的底层限额。配额以每分钟查询次数 (QPM) 和每分钟令牌数 (TPM) 为单位指定,其中 TPM 包括输入和输出令牌。
为了保持整体服务性能和可接受的使用情况,配额上限可能会因账号而异,并且在某些情况下,访问可能会受到限制。在 Google Cloud 控制台的配额和系统限制页面上查看项目的配额。您还必须拥有以下可用配额:
global_generate_content_requests_per_minute_per_project_per_base_model定义您的 QPM 配额。对于 TPM,有两个配额值适用于特定模型:
global_generate_content_input_tokens_per_minute_per_base_model定义了输入 TPM 配额,global_generate_content_output_tokens_per_minute_per_base_model定义了输出 TPM 配额。
如需了解哪些模型会分别统计输入和输出 token,请参阅特定模型页面。
后续步骤
- 了解如何调用开放模型 API。
- 了解如何调用 Responses API。