News

Google Cloud Vertex AI: verwaltete RAG-Lösungen

3. Mai 2026
6 Minuten Lesezeit
Ailog Team

Google Cloud führt neue RAG-Funktionen in Vertex AI ein: RAG Engine, Grounding API und native Integration mit Gemini.

Google Cloud beschleunigt das Enterprise-RAG

Google Cloud kündigt bedeutende Weiterentwicklungen seiner RAG-Funktionen auf Vertex AI an. Die neue RAG Engine vereinfacht die Bereitstellung, die Grounding API verbessert die Zuverlässigkeit, und die Integration mit Gemini 2.5 bietet unerreichte Leistung.

"Vertex AI RAG Engine macht Enterprise-RAG für alle zugänglich", sagt Thomas Kurian, CEO von Google Cloud. "Man muss kein KI-Experte mehr sein, um hochwertige Lösungen zu implementieren."

Neue Funktionen

RAG Engine

Ein verwalteter Service für End-to-End-RAG:

FunktionBeschreibung
Data IngestionPDF, HTML, DOCX, Sheets, Drive
Automatisches ChunkingSemantisch, adaptiv
Embeddingstext-embedding-005, multimodal
Vector StoreManaged, skalierbar
RetrievalIntegrierte Hybrid Search
GenerationGemini 1.5/2.5
DEVELOPERpython
from google.cloud import aiplatform # Initialisierung aiplatform.init(project="my-project", location="us-central1") # RAG-Corpus erstellen rag_corpus = aiplatform.RagCorpus.create( display_name="company-docs", embedding_model="text-embedding-005", chunking_config={ "strategy": "semantic", "chunk_size": 512, "overlap": 50 } ) # Dokumente importieren rag_corpus.import_files( gcs_source="gs://my-bucket/documents/", import_config={ "file_types": ["pdf", "docx", "html"], "ocr_enabled": True } ) # RAG-Anfrage response = rag_corpus.query( text="Wie konfiguriere ich das Produkt?", model="gemini-2.5-pro", retrieval_config={ "top_k": 5, "reranking": True } )

Grounding API

Die Validierung der Antworten wird nativ:

DEVELOPERpython
from google.cloud import aiplatform # Grounding-Konfiguration grounding_config = { "grounding_source": { "type": "RETRIEVAL", "retrieval_config": { "rag_corpus": rag_corpus.resource_name, "threshold": 0.7 } }, "grounding_enforcement": { "level": "STRICT", # STRICT, MODERATE, PERMISSIVE "citation_required": True } } # Generierung mit Grounding response = aiplatform.Gemini.generate( model="gemini-2.5-pro", prompt="Erkläre die Rückgaberichtlinie", grounding_config=grounding_config ) # Ergebnis mit Grounding-Metadaten print(response.grounding_metadata) # { # "grounding_score": 0.92, # "citations": [...], # "unsupported_claims": [] # }

Diese Funktion passt zu unserem Leitfaden zur Erkennung von Halluzinationen.

Gemini 2.5-Integration

Die Integration mit Gemini 2.5 bringt:

FähigkeitGemini 1.5Gemini 2.5
Kontext1M Tokens1M Tokens
MultimodalText, Bilder+Audio, Video
Latenz2s800ms
Grounding-Score85%94%
ZitateBasisInline mit Konfidenz
DEVELOPERpython
# Multimodales RAG mit Gemini 2.5 response = rag_corpus.query( inputs=[ {"type": "text", "value": "Welches Produkt entspricht diesem Bild?"}, {"type": "image", "value": "gs://bucket/product-image.jpg"} ], model="gemini-2.5-pro", multimodal_config={ "image_understanding": True, "cross_modal_retrieval": True } )

Agent Builder RAG

Erstellung von RAG-Agenten ohne Code:

  1. Visuelle Oberfläche: Komponenten per Drag & Drop
  2. Vorkonfigurierte Connectors: Drive, Confluence, Salesforce
  3. Workflows: Visuelle Orchestrierung
  4. Deployment: Ein Klick zur Produktion
DEVELOPERpython
# Oder per API agent = aiplatform.Agent.create( display_name="support-agent", rag_corpus=rag_corpus.resource_name, instructions="Du bist ein Support-Agent. Antworte unter Angabe deiner Quellen.", tools=[ {"type": "rag_retrieval"}, {"type": "code_execution"}, {"type": "web_search"} ] ) # Bereitstellen agent.deploy( endpoint="support-agent-endpoint", min_replica_count=1, max_replica_count=10 )

Architektur

Empfohlene Architektur

Cloud Storage / Drive / BigQuery
              ↓
    [RAG Engine - Ingestion]
              ↓
    [Chunking + Embedding]
              ↓
    Vertex AI Vector Search
              ↓
    [Retrieval + Reranking]
              ↓
    [Gemini + Grounding]
              ↓
    Cloud Run / GKE

Native GCP-Integration

DienstRAG-Integration
Cloud StorageDatenquelle
BigQueryMetadaten, Analytics
Cloud FunctionsVor-/Nachverarbeitung
Pub/SubEchtzeit-Sync
Cloud RunAPI-Deployment
IAMZugriffskontrolle

Leistung

Benchmarks

MetrikRAG Engine
Latenz P501.2s
Latenz P992.8s
Durchsatz200 req/s
Grounding-Genauigkeit94%
Zitiergenauigkeit91%

Beschränkungen

LimitWert
Corpus pro Projekt100
Dokumente pro Corpus1M
Max. Dokumentgröße100MB
Anfragen pro Minute600
Tokens pro Anfrage128K

Preise

Preisgestaltung

KomponentePreis
Speicher (GB/Monat)$0.20
Embedding (1K Docs)$0.10
Retrieval (1K Anfragen)$0.05
Grounding (1K Anfragen)$0.10
Gemini 2.5 Pro (Input)$1.25/M Tokens
Gemini 2.5 Pro (Output)$10/M Tokens

Vergleich

LösungGeschätzte Monatskosten*
Vertex AI RAG$350-700
Azure AI Search + OpenAI$400-800
AWS Bedrock KB$400-800
Ailog$50-200

*Für 100K Anfragen/Monat, 10GB Daten (Gemini-Preise: Juli 2026)

Lesen Sie auch unseren Leitfaden zur Optimierung der RAG-Kosten.

Anwendungsfälle

Wann Vertex AI RAG verwenden

Ideal für:

  • GCP-first-Unternehmen
  • Bedarf an fortgeschrittenem Multimodal
  • Integration BigQuery/Data Analytics
  • Kritisches Grounding

Weniger geeignet für:

  • Multi-Cloud-Umgebungen
  • Begrenztes Budget
  • Bedarf an Open-Source-Modellen

Komplettes Beispiel

DEVELOPERpython
from google.cloud import aiplatform # 1. Setup aiplatform.init(project="my-project") # 2. RAG-Corpus erstellen corpus = aiplatform.RagCorpus.create( display_name="knowledge-base", embedding_model="text-embedding-005" ) # 3. Dokumente importieren corpus.import_files(gcs_source="gs://docs/") # 4. Endpoint erstellen endpoint = corpus.deploy_rag_endpoint( model="gemini-2.5-pro", grounding_config={"level": "STRICT"} ) # 5. Anfrage stellen response = endpoint.predict( instances=[{"query": "Wie lautet das Verfahren?"}] )

Unsere Einschätzung

Vertex AI RAG Engine ist eine solide Option:

Stärken:

  • GCP-native Integration
  • Leistungsfähiges Gemini 2.5
  • Einzigartige Grounding API
  • Fortgeschrittenes Multimodal

Zu beachten:

  • Vendor-Lock-in bei Google Cloud
  • Hohe Kosten
  • Anfangskomplexität

Für GCP-first-Unternehmen ist es eine natürliche Wahl. Die native Integration mit BigQuery und dem Google Data-Ökosystem ist ein entscheidender Vorteil.

Plattformen wie Ailog bieten eine cloud-agnostische Alternative mit Hosting in Frankreich.

Lesen Sie auch unseren Leitfaden zu den besten RAG-Plattformen.

FAQ

Die Grounding API prüft, dass die Antworten von Gemini in den Quelldokumenten verankert sind. Sie vergibt einen Grounding-Score (0-1) und listet nicht unterstützte Aussagen auf. Im Modus STRICT werden Antworten mit einem Score unterhalb der Schwelle abgelehnt, was die Zuverlässigkeit gewährleistet.
Ja, mit Gemini 2.5 können Sie Text, Bilder, Audio und Video in Ihren RAG-Anfragen kombinieren. Das cross-modal retrieval ermöglicht es, Bilder anhand textlicher Beschreibungen zu suchen und umgekehrt, wodurch innovative Anwendungsfälle entstehen.
RAG Engine ist die programmatische API zum Aufbau von RAG-Pipelines. Agent Builder ist eine No-Code-Oberfläche, um RAG-Agenten visuell mit vorkonfigurierten Connectors zu erstellen. Beide verwenden dieselbe zugrunde liegende Infrastruktur.
Die native Integration ermöglicht die Nutzung von BigQuery als Metadatenquelle, die Analyse von RAG-Anfragelogs und die Verknüpfung der Performance mit Ihren Geschäftsdaten. Das ist ein entscheidender Vorteil für datengetriebene Unternehmen auf GCP.
Die Kosten sind vergleichbar (350-700$/Monat für 100K Anfragen). Der Vorteil von Vertex AI liegt in der nativen Integration mit Gemini 2.5 (Kontext 1M tokens, multimodal) und der einzigartigen Grounding API. Die Wahl hängt vor allem von Ihrem bestehenden Cloud-Ökosystem ab.

Tags

RAGGoogle CloudVertex AIGeminienterprise

Verwandte Artikel

Ailog Assistant

Ici pour vous aider

Salut ! Pose-moi des questions sur Ailog et comment intégrer votre RAG dans vos projets !