News

Cohere Embed v4: Das erste produktionsreife multimodal Embedding

23. April 2026
6 min Lesezeit
Equipe Ailog

Cohere bringt Embed v4 Multimodal heraus, das erste Embeddings-Modell, das Text, Bilder und interleaved Dokumente vektorisieren kann. Revolution für multimodal RAG.

Cohere revolutioniert Embeddings mit Multimodalität

Cohere hat soeben die allgemeine Verfügbarkeit von Embed v4 Multimodal angekündigt, ein bedeutender Fortschritt in der Welt der Embeddings. Zum ersten Mal kann ein Produktionsmodell Text, Bilder und gemischte Dokumente (PDFs, Slides, Tabellen) im selben semantischen Raum vektorisieren.

"Embed v4 eliminiert die Komplexität des Dokumenten-Parsings", erklärt Aidan Gomez, CEO von Cohere. "Sie können jetzt ein PDF unverändert vektorisieren, mit Bildern, Tabellen und Text, ganz ohne Preprocessing."

Benchmark-Performance

MTEB-Ergebnisse

ModellMTEB-ScoreTypKontext
Cohere Embed v465.2Multimodal128K
Google Gemini Embedding68.3Text2K
Qwen3-Embedding-8B70.6Text8K
OpenAI text-embedding-3-large64.6Text8K
Voyage-363.8Text16K

Die eigentliche Innovation: Multimodalität

Der MTEB-Score erzählt nicht die ganze Geschichte. Embed v4 glänzt dort, wo andere Modelle gar nicht existieren:

FähigkeitEmbed v4Andere Modelle
Reiner TextJaJa
Nur BilderJaNein*
Natives PDFJaNein
Visuelle TabellenJaNein
PräsentationsfolienJaNein

*Nur wenige experimentelle Modelle unterstützen Bilder

Um die Bedeutung der Multimodalität bei Embeddings zu verstehen, lesen Sie unseren Leitfaden zu multimodalem RAG.

Technische Innovationen

Einheitliches Text-Bild-Embedding

Embed v4 schafft einen Vektorraum, in dem Text und Bilder koexistieren:

DEVELOPERpython
import cohere co = cohere.ClientV2('your-api-key') # Text-Embedding text_response = co.embed( texts=["Produktbeschreibung"], model="embed-v4.0", input_type="search_document", embedding_types=["float"] ) # Bild-Embedding (base64 oder URL) image_response = co.embed( images=["data:image/jpeg;base64,..."], model="embed-v4.0", input_type="image", embedding_types=["float"] ) # Beide Embeddings befinden sich im selben semantischen Raum!

Technische Spezifikationen

SpezifikationWert
Dimensionen1536 (konfigurierbar 256-1536)
Text-Kontext128K Tokens
Max. Bildgröße2 Megapixel
Unterstützte Sprachen100+
BildformateJPEG, PNG, WebP, GIF

Matryoshka Embeddings

Embed v4 unterstützt Matryoshka-Embeddings, die eine Reduzierung der Dimensionen ohne erneutes Encoding ermöglichen:

DEVELOPERpython
# Vollständige Dimensionen (1536) full_embedding = co.embed( texts=["Ihr Text"], model="embed-v4.0", embedding_types=["float"] ) # Reduzierte Dimensionen (256) - gleicher, gekürzter Vektor compact_embedding = co.embed( texts=["Ihr Text"], model="embed-v4.0", embedding_types=["float"], output_dimension=256 # Matryoshka-Kürzung )
DimensionenQualitätsverlustSpeicherreduktion
15360%Baseline
1024-0.5%33%
512-1.2%67%
256-2.8%83%

Dieser Ansatz erlaubt es, den Kompromiss zwischen Kosten und Qualität zu optimieren, ohne alle Embeddings neu generieren zu müssen.

Auswirkung auf RAG-Pipelines

Das Ende des komplexen Parsings

Vor Embed v4 erforderte die Vektorisierung eines PDFs:

  1. Textextraktion (PyPDF, pdfplumber)
  2. OCR der Bilder (Tesseract, Azure Vision)
  3. Tabellenerkennung (Camelot, Tabula)
  4. Rekonstruktion des Kontexts
  5. Separates Chunking und Embedding

Mit Embed v4:

  1. Screenshot oder Bild des PDFs
  2. Direktes Embedding

"Wir haben 80% unserer Preprocessing-Pipeline eliminiert", berichtet Marie Laurent, CTO eines französischen Legaltech-Startups. "Die Retrieval-Qualität hat sich verbessert, weil das Modell Dokumente so sieht wie ein Mensch."

Transformierte Anwendungsfälle

Visueller E-Commerce

  • Suche per Produktbild
  • PDF-Kataloge unverändert vektorisiert
  • Datenblätter mit Schaubildern

Technische Dokumentation

  • Handbücher mit Diagrammen
  • Architekturschemata
  • Annotierte Screenshots

Recht und Finanzen

  • Gescannte Verträge
  • Berichte mit Diagrammen
  • Ausgefüllte Formulare

Konkrete Beispiele finden Sie in unserem Leitfaden zu RAG im E-Commerce.

Preise und Verfügbarkeit

Preisübersicht

Cohere-Preise: Juli 2026.

Input-TypPreis/Million Einheiten
Text$0.12 / 1M Tokens
Bilder$0.47 / 1M Bild-Tokens

Vergleich mit der Konkurrenz

AnbieterPreis/1M TokensMultimodal
Cohere Embed v4$0.12Ja
OpenAI text-embedding-3-large$0.13Nein
Voyage-3$0.06Nein
Google Gemini Embedding$0.15Nein

Verfügbarkeit

Embed v4 ist verfügbar über:

  • Direkte Cohere-API
  • Amazon Bedrock
  • Amazon SageMaker JumpStart
  • Azure AI Foundry
  • Google Cloud Vertex AI

Praktische Integration

Vollständiges Beispiel: Multimodales RAG

DEVELOPERpython
import cohere from qdrant_client import QdrantClient co = cohere.ClientV2('your-api-key') qdrant = QdrantClient(url="http://localhost:6333") # Eine PDF-Seite als Bild indexieren def index_pdf_page(image_base64, metadata): response = co.embed( images=[f"data:image/png;base64,{image_base64}"], model="embed-v4.0", input_type="image", embedding_types=["float"] ) qdrant.upsert( collection_name="documents", points=[{ "id": metadata["id"], "vector": response.embeddings.float[0], "payload": metadata }] ) # Suche per Text (cross-modal) def search_by_text(query): query_embedding = co.embed( texts=[query], model="embed-v4.0", input_type="search_query", embedding_types=["float"] ) # Findet relevante Bilder/PDFs mit einer Textanfrage results = qdrant.search( collection_name="documents", query_vector=query_embedding.embeddings.float[0], limit=5 ) return results

Best Practices

1. Den richtigen input_type wählen

  • search_document: Zu indexierender Text
  • search_query: Nutzeranfrage
  • image: Zu indexierende oder zu suchende Bilder

2. Bilder optimieren

  • Ideale Auflösung: 1024x1024 Pixel
  • Maximum: 2 Megapixel
  • Formate: JPEG für Fotos, PNG für Screenshots

3. Batching

DEVELOPERpython
# Bis zu 96 Texte oder 1000 Bilder pro Anfrage response = co.embed( images=list_of_images[:1000], model="embed-v4.0", input_type="image" )

Unsere Einschätzung

Embed v4 Multimodal ist ein entscheidender Fortschritt für RAG-Anwendungen, die mit umfangreichen Dokumenten arbeiten. Die Fähigkeit, PDFs, Präsentationen und Bilder ohne komplexes Preprocessing zu vektorisieren, vereinfacht die Architekturen radikal.

Stärken:

  • Erstes produktionsreifes multimodales Modell
  • 128K Tokens Kontext
  • Matryoshka zur Kostenoptimierung
  • Native Cloud-Integration

Schwachpunkte:

  • MTEB-Score bei reinem Text niedriger als Qwen3/Gemini
  • Höherer Preis bei großen Bildmengen

Für neue Projekte mit visuellen Dokumenten ist Embed v4 unsere Empfehlung. Für reinen Text mit sehr großem Volumen sollten Sie Qwen3-Embedding (Open Source) oder Google Gemini Embedding in Betracht ziehen.

Vertiefen Sie diese Entscheidung mit unserem vollständigen Leitfaden zur Auswahl von Embedding-Modellen.

FAQ

Ja, in den meisten Fällen. Embed v4 vektorisiert Dokumentbilder (PDFs, Scans, Screenshots) direkt, ohne vorherige Textextraktion. Die Retrieval-Qualität ist oft besser, da das Modell den visuellen Kontext erfasst (Layout, Tabellen, Diagramme). Nur Fälle, die eine explizite Textextraktion erfordern (zur Anzeige oder Bearbeitung), rechtfertigen weiterhin OCR.
Embed v4 erreicht 65.2 auf MTEB (reiner Text), hinter Qwen3-Embedding (70.6) und Google Gemini (68.3). Dieser Vergleich ist jedoch unvollständig: Embed v4 ist das einzige Modell, das nativ Multimodalität unterstützt. Für gemischte Dokumente (Text + Bilder) gibt es kein Äquivalent. Bewerten Sie es anhand Ihres tatsächlichen Anwendungsfalls.
Matryoshka-Embeddings ermöglichen es, die Dimensionen von 1536 auf 256 zu reduzieren, bei nur 2,8% Qualitätsverlust. Das reduziert den Vektorspeicher um 83%. Empfohlene Strategie: Indexieren Sie mit 1536 Dimensionen und experimentieren Sie dann mit reduzierten Dimensionen an Ihrem Testdatensatz, um die optimale Schwelle zu finden.
Ja. Da Text und Bilder denselben Vektorraum teilen, können Sie Bild-zu-Bild-, Text-zu-Bild- oder Bild-zu-Text-Suchen durchführen. Das ist ideal für visuellen E-Commerce, Produktkataloge oder die Suche nach ähnlichen Dokumenten.
Das Maximum liegt bei 2 Megapixel. Für ein gutes Gleichgewicht zwischen Qualität und Kosten verwenden Sie 1024x1024 Pixel. Bei Dokumenten mit feinem Text (Verträge, Rechnungen) sollten Sie höhere Auflösungen bevorzugen. Bei einfachen Bildern (Produktfotos) reichen oft 512x512. --- **Möchten Sie Embed v4 in Ihre RAG-Anwendung integrieren?** [Ailog](https://ailog.fr) bietet eine RAG-as-a-Service-Plattform, die automatisch die besten Embedding-Modelle integriert, darunter Cohere Embed v4 Multimodal. Setzen Sie Ihren KI-Assistenten in wenigen Minuten live.

Tags

RAGCohereembeddingsmultimodalMTEB

Verwandte Artikel

Ailog Assistant

Ici pour vous aider

Salut ! Pose-moi des questions sur Ailog et comment intégrer votre RAG dans vos projets !