Google Cloud Vertex AI: verwaltete RAG-Lösungen
Google Cloud führt neue RAG-Funktionen in Vertex AI ein: RAG Engine, Grounding API und native Integration mit Gemini.
Google Cloud beschleunigt das Enterprise-RAG
Google Cloud kündigt bedeutende Weiterentwicklungen seiner RAG-Funktionen auf Vertex AI an. Die neue RAG Engine vereinfacht die Bereitstellung, die Grounding API verbessert die Zuverlässigkeit, und die Integration mit Gemini 2.5 bietet unerreichte Leistung.
"Vertex AI RAG Engine macht Enterprise-RAG für alle zugänglich", sagt Thomas Kurian, CEO von Google Cloud. "Man muss kein KI-Experte mehr sein, um hochwertige Lösungen zu implementieren."
Neue Funktionen
RAG Engine
Ein verwalteter Service für End-to-End-RAG:
| Funktion | Beschreibung |
|---|---|
| Data Ingestion | PDF, HTML, DOCX, Sheets, Drive |
| Automatisches Chunking | Semantisch, adaptiv |
| Embeddings | text-embedding-005, multimodal |
| Vector Store | Managed, skalierbar |
| Retrieval | Integrierte Hybrid Search |
| Generation | Gemini 1.5/2.5 |
DEVELOPERpythonfrom google.cloud import aiplatform # Initialisierung aiplatform.init(project="my-project", location="us-central1") # RAG-Corpus erstellen rag_corpus = aiplatform.RagCorpus.create( display_name="company-docs", embedding_model="text-embedding-005", chunking_config={ "strategy": "semantic", "chunk_size": 512, "overlap": 50 } ) # Dokumente importieren rag_corpus.import_files( gcs_source="gs://my-bucket/documents/", import_config={ "file_types": ["pdf", "docx", "html"], "ocr_enabled": True } ) # RAG-Anfrage response = rag_corpus.query( text="Wie konfiguriere ich das Produkt?", model="gemini-2.5-pro", retrieval_config={ "top_k": 5, "reranking": True } )
Grounding API
Die Validierung der Antworten wird nativ:
DEVELOPERpythonfrom google.cloud import aiplatform # Grounding-Konfiguration grounding_config = { "grounding_source": { "type": "RETRIEVAL", "retrieval_config": { "rag_corpus": rag_corpus.resource_name, "threshold": 0.7 } }, "grounding_enforcement": { "level": "STRICT", # STRICT, MODERATE, PERMISSIVE "citation_required": True } } # Generierung mit Grounding response = aiplatform.Gemini.generate( model="gemini-2.5-pro", prompt="Erkläre die Rückgaberichtlinie", grounding_config=grounding_config ) # Ergebnis mit Grounding-Metadaten print(response.grounding_metadata) # { # "grounding_score": 0.92, # "citations": [...], # "unsupported_claims": [] # }
Diese Funktion passt zu unserem Leitfaden zur Erkennung von Halluzinationen.
Gemini 2.5-Integration
Die Integration mit Gemini 2.5 bringt:
| Fähigkeit | Gemini 1.5 | Gemini 2.5 |
|---|---|---|
| Kontext | 1M Tokens | 1M Tokens |
| Multimodal | Text, Bilder | +Audio, Video |
| Latenz | 2s | 800ms |
| Grounding-Score | 85% | 94% |
| Zitate | Basis | Inline mit Konfidenz |
DEVELOPERpython# Multimodales RAG mit Gemini 2.5 response = rag_corpus.query( inputs=[ {"type": "text", "value": "Welches Produkt entspricht diesem Bild?"}, {"type": "image", "value": "gs://bucket/product-image.jpg"} ], model="gemini-2.5-pro", multimodal_config={ "image_understanding": True, "cross_modal_retrieval": True } )
Agent Builder RAG
Erstellung von RAG-Agenten ohne Code:
- Visuelle Oberfläche: Komponenten per Drag & Drop
- Vorkonfigurierte Connectors: Drive, Confluence, Salesforce
- Workflows: Visuelle Orchestrierung
- Deployment: Ein Klick zur Produktion
DEVELOPERpython# Oder per API agent = aiplatform.Agent.create( display_name="support-agent", rag_corpus=rag_corpus.resource_name, instructions="Du bist ein Support-Agent. Antworte unter Angabe deiner Quellen.", tools=[ {"type": "rag_retrieval"}, {"type": "code_execution"}, {"type": "web_search"} ] ) # Bereitstellen agent.deploy( endpoint="support-agent-endpoint", min_replica_count=1, max_replica_count=10 )
Architektur
Empfohlene Architektur
Cloud Storage / Drive / BigQuery
↓
[RAG Engine - Ingestion]
↓
[Chunking + Embedding]
↓
Vertex AI Vector Search
↓
[Retrieval + Reranking]
↓
[Gemini + Grounding]
↓
Cloud Run / GKE
Native GCP-Integration
| Dienst | RAG-Integration |
|---|---|
| Cloud Storage | Datenquelle |
| BigQuery | Metadaten, Analytics |
| Cloud Functions | Vor-/Nachverarbeitung |
| Pub/Sub | Echtzeit-Sync |
| Cloud Run | API-Deployment |
| IAM | Zugriffskontrolle |
Leistung
Benchmarks
| Metrik | RAG Engine |
|---|---|
| Latenz P50 | 1.2s |
| Latenz P99 | 2.8s |
| Durchsatz | 200 req/s |
| Grounding-Genauigkeit | 94% |
| Zitiergenauigkeit | 91% |
Beschränkungen
| Limit | Wert |
|---|---|
| Corpus pro Projekt | 100 |
| Dokumente pro Corpus | 1M |
| Max. Dokumentgröße | 100MB |
| Anfragen pro Minute | 600 |
| Tokens pro Anfrage | 128K |
Preise
Preisgestaltung
| Komponente | Preis |
|---|---|
| Speicher (GB/Monat) | $0.20 |
| Embedding (1K Docs) | $0.10 |
| Retrieval (1K Anfragen) | $0.05 |
| Grounding (1K Anfragen) | $0.10 |
| Gemini 2.5 Pro (Input) | $1.25/M Tokens |
| Gemini 2.5 Pro (Output) | $10/M Tokens |
Vergleich
| Lösung | Geschätzte Monatskosten* |
|---|---|
| Vertex AI RAG | $350-700 |
| Azure AI Search + OpenAI | $400-800 |
| AWS Bedrock KB | $400-800 |
| Ailog | $50-200 |
*Für 100K Anfragen/Monat, 10GB Daten (Gemini-Preise: Juli 2026)
Lesen Sie auch unseren Leitfaden zur Optimierung der RAG-Kosten.
Anwendungsfälle
Wann Vertex AI RAG verwenden
Ideal für:
- GCP-first-Unternehmen
- Bedarf an fortgeschrittenem Multimodal
- Integration BigQuery/Data Analytics
- Kritisches Grounding
Weniger geeignet für:
- Multi-Cloud-Umgebungen
- Begrenztes Budget
- Bedarf an Open-Source-Modellen
Komplettes Beispiel
DEVELOPERpythonfrom google.cloud import aiplatform # 1. Setup aiplatform.init(project="my-project") # 2. RAG-Corpus erstellen corpus = aiplatform.RagCorpus.create( display_name="knowledge-base", embedding_model="text-embedding-005" ) # 3. Dokumente importieren corpus.import_files(gcs_source="gs://docs/") # 4. Endpoint erstellen endpoint = corpus.deploy_rag_endpoint( model="gemini-2.5-pro", grounding_config={"level": "STRICT"} ) # 5. Anfrage stellen response = endpoint.predict( instances=[{"query": "Wie lautet das Verfahren?"}] )
Unsere Einschätzung
Vertex AI RAG Engine ist eine solide Option:
Stärken:
- GCP-native Integration
- Leistungsfähiges Gemini 2.5
- Einzigartige Grounding API
- Fortgeschrittenes Multimodal
Zu beachten:
- Vendor-Lock-in bei Google Cloud
- Hohe Kosten
- Anfangskomplexität
Für GCP-first-Unternehmen ist es eine natürliche Wahl. Die native Integration mit BigQuery und dem Google Data-Ökosystem ist ein entscheidender Vorteil.
Plattformen wie Ailog bieten eine cloud-agnostische Alternative mit Hosting in Frankreich.
Lesen Sie auch unseren Leitfaden zu den besten RAG-Plattformen.
FAQ
Tags
Verwandte Artikel
Analyse der RAG-Kosten 2026: Budget optimieren
Detaillierte Analyse der RAG-Kosten im Jahr 2026: Aufschlüsselung nach Komponenten, Optimierungsstrategien und Vergleich von Lösungen zur Kontrolle des Budgets.
Azure AI Search: Entwicklungen für RAG
Microsoft erweitert Azure AI Search um fortschrittliche RAG-Funktionen: verbesserte vector search, native integrations und semantic ranking.
AWS Bedrock: native RAG-Funktionen
AWS erweitert Bedrock um native RAG-Funktionen: verbesserte Knowledge Bases, RAG Agents und nahtlose S3-Integration.