Gemini Enterprise Agent Platform 合作伙伴模型(适用于 MaaS)

Gemini Enterprise Agent Platform 支持一组精选的由 Google 合作伙伴开发的模型。合作伙伴模型可与 Gemini Enterprise Agent Platform 搭配,作为模型即服务 (MaaS) 使用,并作为托管式 API 提供。使用合作伙伴模型时,您可以继续向 Gemini Enterprise Agent Platform 端点发送请求。合作伙伴模型是无服务器服务,因此您无需预配或管理基础设施。

您可以使用 Model Garden 发现合作伙伴模型,还可以使用 Model Garden 部署模型。如需了解详情,请参阅在 Model Garden 中探索 AI 模型。您可以在 Model Garden 中的模型卡片上找到每个可用合作伙伴模型的信息,但本指南仅记录了与 Gemini Enterprise Agent Platform 搭配,作为 MaaS 执行的第三方模型。

Anthropic 的 Claude 和 Mistral 模型是可在 Gemini Enterprise Agent Platform 上使用的第三方托管式模型的示例。

合作伙伴模型

以下合作伙伴模型在 Gemini Enterprise Agent Platform Model Garden 上以托管式 API 的形式 (MaaS) 提供:

模型名称 模态 说明 快速入门
Grok 4.3(预览版 语言 xAI 的高性能模型。 模型卡片
Grok 4.20(推理)(预览版 语言 Grok 4.20(推理)是 xAI 的高性能模型,具有业界领先的低幻觉率。擅长处理文档理解任务和长期限代理工具调用。 模型卡片
Grok 4.20(非推理)(预览版) 语言 Grok 4.20(非推理)是 xAI 的一款高性能非思考模型,具有业界领先的低幻觉率。在对延迟敏感的应用场景(例如客户支持和分类)中表现出色。 模型卡片
Grok 4.1 Fast(推理)(预览版 语言 Grok 4.1 Fast(推理)是 xAI 最具成本效益的模型,具有强大的工具调用功能和高效的知识库整合能力。擅长执行涉及网络数据和内部知识库工具的搜索任务。 模型卡片
Grok 4.1 Fast(非推理)(预览版) 语言 Grok 4.1 Fast(非推理)是 xAI 最具成本效益的非思考模型,针对低延迟性能进行了优化。擅长处理数据量较大的任务,例如总结和分类。 模型卡片
Google Cloud 上的 Claude Sonnet 5 语言、视觉 Google Cloud 上的 Claude Sonnet 5 是 Anthropic 迄今为止功能最强大的 Sonnet 模型,专为大规模编码、智能体和专业工作打造。 模型卡片
Google Cloud 上的 Claude Fable 5 语言、视觉 Google Cloud 上的 Claude Fable 5 是 Anthropic 推出的模型,专为自主知识工作和编码而设计,适用于复杂的多天项目。 模型卡片
Google Cloud 上的 Claude Opus 4.8 语言、视觉 Claude Opus 4.8 是一款高智能 Opus 模型,专为编码和智能体而打造,能够为企业级工作流提供更深层次的推理。 模型卡片
Google Cloud 上的 Claude Opus 4.7 语言、视觉 Google Cloud 上的 Claude Opus 4.7 是 Anthropic 推出的一款高智能模型,在编码、代理、计算机使用和企业工作流方面均表现卓越。 模型卡片
Google Cloud 上的 Claude Sonnet 4.6 语言、视觉 Google Cloud 上的 Claude Sonnet 4.6 具备大规模前沿智能能力,专为编码、代理和企业工作流而打造。 模型卡片
Google Cloud 上的 Claude Opus 4.6 语言、视觉 Google Cloud 上的 Claude Opus 4.6 是 Anthropic 提供的高智能模型,在编码、代理、计算机使用和企业工作流方面均表现卓越。 模型卡片
Google Cloud 上的 Claude Opus 4.5 语言、视觉 Google Cloud 上的 Claude Opus 4.5 是 Anthropic 推出的一款高智能模型,在编码、代理、计算机使用和企业工作流方面均表现卓越。 模型卡片
Google Cloud 上的 Claude Sonnet 4.5 语言、视觉 Anthropic 的中型模型,可为实际应用中的智能体提供在编码、计算机使用、网络安全和处理电子表格等办公文件方面的功能。 模型卡片
Google Cloud 上的 Claude Opus 4.1 语言、视觉 编码领域的行业领导者。它在需要集中精力并执行数千个步骤的长时间运行任务中可提供持续的性能,从而显著扩展了 AI 智能体的解决能力。非常适合为前沿代理产品和功能提供支持。 模型卡片
Google Cloud 上的 Claude Haiku 4.5 语言、视觉 Google Cloud 上的 Claude Haiku 4.5 在各种应用场景中都能提供接近前沿的性能,是全球最出色的编码模型之一。它能够以合适的速度和成本为免费产品和大批量用户体验提供支持。 模型卡片
Google Cloud 上的 Claude Opus 4 语言、视觉 Google Cloud 上的 Claude Opus 4 在需要集中精力并执行数千个步骤的长时间运行任务中可提供持续的性能,从而显著扩展了 AI 智能体可以解决的问题范围。 模型卡片
Google Cloud 上的 Claude Sonnet 4 语言、视觉 Anthropic 的中型模型,具有出色的智能水平,适合大批量使用,例如编码、深入研究和智能体。 模型卡片
Google Cloud 上的 Anthropic 的 Claude 3.5 Sonnet v2 语言、视觉 Google Cloud 上的 Claude 3.5 Sonnet 是一款高性能模型,可用于处理实际的软件工程任务和智能体功能。Google Cloud 上的 Claude 3.5 Sonnet 依靠与其前代产品相同的价格和速度实现了这些进步。 模型卡片
Google Cloud 上的 Anthropic 的 Claude 3.5 Sonnet 语言 在 Google Cloud 上,Claude 3.5 Sonnet 凭借 Anthropic 的中端模型 Claude 3 Sonnet 在 Google Cloud 上的速度和成本,在 Anthropic 的多种评估中优于 Anthropic 的 Claude 3 Opus 在 Google Cloud 上的表现。 模型卡片
Jamba 1.5 Large(预览版 语言 AI21 Labs 的 Jamba 1.5 Large 旨在提供优质的回答、高吞吐量,并且价格与同类别的其他模型相比具有竞争力。 模型卡片
Jamba 1.5 Mini(预览版 语言 AI21 Labs 的 Jamba 1.5 Mini 在质量、吞吐量和低成本方面取得了良好的平衡。 模型卡片
Mistral Medium 3 语言 Mistral Medium 3 是一款多用途的模型,可以处理包括编程、数学推理、理解长文档、总结和对话在内的各种任务。 模型卡片
Mistral OCR (25.05) 语言、视觉 Mistral OCR (25.05) 是一款用于文档理解的光学字符识别 API。模型能够理解文档的每个元素,例如媒体、文本、表格和方程式。 模型卡片
Mistral Small 3.1 (25.03) 语言 Mistral Small 3.1 (25.03) 是 Mistral Small 模型的一个版本,具有多模态功能和更长的上下文长度。 模型卡片
Codestral 2 语言、代码 Codestral 2 是 Mistral 的代码生成专用模型,专门用于高精确度的中间填充 (FIM) 补全,可通过共享指令和补全 API 端点帮助开发者编写代码并与代码交互。 模型卡片

使用 Gen AI Evaluation Service 评估合作伙伴模型

Gen AI Evaluation Service 支持评估合作伙伴模型,例如 Anthropic 和 Llama 模型。Model Garden 支持合作伙伴模型评估,因此您必须先启用模型,然后才能针对合作伙伴模型运行评估。

如需了解详情,请参阅使用控制台执行评估

具有容量保证的 Gemini Enterprise Agent Platform 合作伙伴模型价格

Google 为部分合作伙伴模型提供预配吞吐量,可为您的模型预留吞吐量容量,费用固定。您可以决定吞吐量容量,以及在哪些区域预留该容量。由于预配吞吐量请求的优先级高于标准随用随付请求,因此预配吞吐量可提高可用性。当系统过载时,只要吞吐量不超过预留吞吐量容量,您的请求仍可完成。如需详细了解或订阅此服务,请与销售人员联系

区域端点、全球端点和多区域端点

对于区域端点,请求会在您指定的区域中处理。如果您有数据驻留要求,或者模型不支持全球端点,请使用区域端点。

使用全球端点时,Google 可以使用您所用模型支持的任何区域来处理和响应您的请求,这在某些情况下可能会导致延迟时间更长。全球端点有助于提高整体可用性并减少错误。

借助多区域端点,您可以高可用性地访问合作伙伴模型,同时将数据驻留在更广阔的地理区域(例如美国)内。

价格因所选端点类型而异。如需详细了解配额和功能,请查看相关的第三方模型页面。

全球端点

如需使用全球端点,请将区域设置为 global

例如,curl 命令的请求网址采用以下格式: https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/PUBLISHER_NAME/models/MODEL_NAME

对于 Agent Platform SDK,区域端点是默认设置。将区域设置为 GLOBAL 以使用全球端点。

全球端点支持的模型

以下模型支持使用全球端点:

限制全球 API 端点用量

为了帮助强制使用区域端点,请使用 constraints/gcp.restrictEndpointUsage 组织政策限制条件来阻止对全球 API 端点的请求。如需了解详情,请参阅限制端点用量

多区域端点

借助多区域端点,您可以在更广阔的地理区域(例如美国或欧盟)内保持数据驻留的同时,以高可用性方式访问合作伙伴模型。

选择要使用的多区域对应的标签页:

美国

如需使用美国多区域端点,请将端点网址设置为 aiplatform.us.rep.googleapis.com

curl 命令的请求网址采用以下格式: https://aiplatform.us.rep.googleapis.com/v1/projects/PROJECT_ID/locations/us/publishers/anthropic/models/MODEL_NAME

欧盟

如需使用欧盟多区域端点,请将端点网址设置为 aiplatform.eu.rep.googleapis.com

curl 命令的请求网址采用以下格式: https://aiplatform.eu.rep.googleapis.com/v1/projects/PROJECT_ID/locations/eu/publishers/anthropic/models/MODEL_NAME

如需详细了解 MODEL_NAME 格式,请参阅 Anthropic 文档

多区域端点支持的模型

多区域端点支持版本为 4.7 及更高版本的所有 Claude 模型(例如 claude-opus-4-7claude-opus-4-8claude-fable-5)。请尽可能使用包含版本日期的完整模型 ID。

请求示例

以下展示了如何使用 curl 调用多区域端点:

export PROJECT_ID="YOUR_PROJECT_ID"
# Example using claude-opus-4-7

# Option 1: US Region
export LOCATION="us"
export ENDPOINT="aiplatform.us.rep.googleapis.com"

# Option 2: EU Region
# export LOCATION="eu"
# export ENDPOINT="aiplatform.eu.rep.googleapis.com"

export MODEL_ID="claude-opus-4-7"

curl -X POST \
  -H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
  -H "Content-Type: application/json" \
  "https://${ENDPOINT}/v1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL_ID}:rawPredict" \
  -d '{
    "max_tokens": 300,
    "messages": [
      {
        "role": "user",
        "content": [
          {
            "type": "text",
            "text": "Why is the sky blue?"
          }
        ]
      }
    ],
    "anthropic_version": "vertex-2023-10-16"
  }'

多区域配额

系统会强制执行专用多区域配额。您可以在 Google Cloud 控制台中查看这些默认配额值,并申请增加配额。

  • 美国配额示例

    • UsOnlinePredictionInputTokensPerMinutePerBaseModel
    • UsOnlinePredictionOutputTokensPerMinutePerBaseModel
    • UsOnlinePredictionRequestsPerMinPerProjectPerBaseModel
    • UsOnlinePredictionWebSearchRequestsPerProjectPerPublisher
  • 欧盟配额示例

    • EuOnlinePredictionInputTokensPerMinutePerBaseModel
    • EuOnlinePredictionOutputTokensPerMinutePerBaseModel
    • EuOnlinePredictionRequestsPerMinPerProjectPerBaseModel
    • EuOnlinePredictionWebSearchRequestsPerProjectPerPublisher

向用户授予对合作伙伴模型的访问权限

为了让您能够启用合作伙伴模型并发出提示请求, Google Cloud管理员必需设置所需的权限验证组织政策是否允许使用所需的 API

设置使用合作伙伴模型所需的权限

使用合作伙伴模型需要具有以下角色和权限:

  • 您必须具有 Consumer Procurement Entitlement Manager Identity and Access Management (IAM) 角色。任何被授予此角色的用户都可以在 Model Garden 中启用合作伙伴模型。

  • 您必须拥有 aiplatform.endpoints.predict 权限。此权限包含在 Agent Platform User IAM 角色中。如需了解详情,请参阅 Gemini Enterprise Agent Platform User访问权限控制

控制台

  1. 如需向用户授予 Consumer Procurement Entitlement Manager IAM 角色,请转到 IAM 页面。

    进入 IAM

  2. 主账号列中,找到要为其启用合作伙伴模型访问权限的用户主账号,然后在对应的行中点击  修改主账号

  3. 修改权限窗格中,点击  添加其他角色

  4. 选择角色中,选择 Consumer Procurement Entitlement Manager

  5. 修改权限窗格中,点击  添加其他角色

  6. 选择角色中,选择 Agent Platform User

  7. 点击保存

gcloud

  1. 在 Google Cloud 控制台中,激活 Cloud Shell。

    激活 Cloud Shell

  2. 授予在 Model Garden 中启用合作伙伴模型所需的 Consumer Procurement Entitlement Manager 角色

    gcloud projects add-iam-policy-binding  PROJECT_ID \
    --member=PRINCIPAL --role=roles/consumerprocurement.entitlementManager
    
  3. 授予包含发出提示请求所需的 aiplatform.endpoints.predict 权限的 Agent Platform User 角色:

    gcloud projects add-iam-policy-binding  PROJECT_ID \
    --member=PRINCIPAL --role=roles/aiplatform.user
    

    PRINCIPAL 替换为主账号的标识符。标识符的格式为 user|group|serviceAccount:emaildomain:domain,例如 user:cloudysanfrancisco@gmail.comgroup:admins@example.comserviceAccount:test123@example.domain.comdomain:example.domain.com

    输出是一个政策绑定列表,其中包含以下内容:

    -   members:
      -   user:PRINCIPAL
      role: roles/roles/consumerprocurement.entitlementManager
    

    如需了解详情,请参阅授予单个角色和 gcloud projects add-iam-policy-binding

设置组织政策以访问合作伙伴模型

如需启用合作伙伴模型,您的组织政策必须允许以下 API:Cloud Commerce Consumer Procurement API - cloudcommerceconsumerprocurement.googleapis.com

如果您的组织将组织政策设置为限制服务的使用,则组织管理员必须通过设置组织政策来验证是否允许 cloudcommerceconsumerprocurement.googleapis.com

此外,如果您的组织政策对 Model Garden 中模型的使用进行了限制,则该政策必须允许访问合作伙伴模型。如需了解详情,请参阅控制模型访问权限

合作伙伴模型监管合规性

当合作伙伴模型通过 Gemini Enterprise Agent Platform 用作受管理的 API 时,Gemini Enterprise Agent Platform 上的生成式 AI认证仍然适用。 如果您需要了解模型本身的详细信息,可以在相应的模型卡片中找到更多信息,也可以联系相应的模型发布方。

对于 Gemini Enterprise Agent Platform 上的合作伙伴模型,您的静态数据会存储在所选的区域或多区域内,但数据处理的区域化程度可能会有所不同。如需详细了解合作伙伴模型的数据处理承诺,请参阅合作伙伴模型的数据驻留

使用 Gemini Enterprise API(包括合作伙伴模型)时,客户提示和模型回答不会与第三方共享。Google 仅会按照客户的指示处理客户数据,详见我们的《云端数据处理附录》