News

Embedding-Modelle Rangliste 2026: Top 20 MTEB-Modelle (vollstaendige Scores)

27. August 2026
20 Min. Lesezeit
Ailog Team

Vollstaendiges Ranking der besten Embedding-Modelle 2026. Top 20 MTEB mit Retrieval-, Clustering-, Klassifikations-Scores, Dimensionen, Preise. Open-Source vs proprietaer.

TL;DR

Die MTEB-Rangliste 2026 ist umgekrempelt. Gemini Embedding 001 von Google dominiert mit einem Gesamtscore von 68,32, dicht gefolgt von Qwen3-Embedding von Alibaba. Auf der Open-Source-Seite bleiben NV-Embed-v2 von NVIDIA und BGE-Large-v2 starke Referenzen. Die Preise reichen von $0 (Open-Source) bis $0,20/Million Tokens (Voyage). Dieser Leitfaden beschreibt die Top 20 Modelle, ihre aufgabenspezifischen Scores und hilft Ihnen bei der Wahl des richtigen Embeddings fuer Ihren Anwendungsfall.


Die MTEB 2026 Rangliste: Top 20

Der Massive Text Embedding Benchmark (MTEB) bleibt der Goldstandard fuer die Bewertung von Embedding-Modellen. Hier ist das vollstaendige Ranking vom Juni 2026.

Gesamtranking

RangModellGesamt-ScoreRetrievalClusteringKlassifikationDimsMax TokensOpen-SourcePreis/1M Tokens
1Gemini Embedding 00168,3264,552,187,330722048Nein$0,15
2Qwen3-Embedding-8B67,8963,851,486,9409632768JaKostenlos
3NV-Embed-v267,3162,950,886,1409632768JaKostenlos
4Voyage-Large-266,9862,550,285,8153616000Nein$0,20
5Cohere Embed v466,7262,149,885,51536128000Nein$0,10
6text-embedding-3-large66,4561,849,585,230728191Nein$0,13
7BGE-Large-v265,8961,248,984,710248192JaKostenlos
8Jina-Embeddings-v365,5260,848,584,310248192JaKostenlos
9E5-Mistral-7B65,2360,448,184,0409632768JaKostenlos
10Arctic-Embed-L-v264,9860,147,883,710248192JaKostenlos
11mxbai-embed-large64,7259,847,583,41024512JaKostenlos
12Nomic-Embed-v264,4559,447,183,07688192JaKostenlos
13Mistral-Embed64,2159,146,882,810248192Nein$0,10
14Stella-400M-v563,9858,846,582,510248192JaKostenlos
15GTE-Qwen2-7B63,7258,546,282,2358432768JaKostenlos
16text-embedding-3-small63,4558,145,881,815368191Nein$0,02
17UAE-Large-V163,2157,845,581,51024512JaKostenlos
18SFR-Embedding-262,9857,545,281,2409632768JaKostenlos
19Cohere Embed v362,7257,144,880,91024512Nein$0,10
20BGE-M362,4556,844,580,510248192JaKostenlos

MMTEB Mehrsprachige Scores

Der Multilingual MTEB (MMTEB) bewertet die Leistung bei Aufgaben in ueber 100 Sprachen. Entscheidend fuer internationale Anwendungen.

Top 10 MMTEB

RangModellGesamt-ScoreFranzoesischDeutschSpanischChinesisch
1Gemini Embedding 00164,1863,262,863,561,9
2Qwen3-Embedding63,7562,161,562,864,2
3Cohere Embed v463,4163,862,163,060,5
4Jina-Embeddings-v362,8961,561,862,160,2
5BGE-M362,3460,860,261,562,8
6Voyage-Large-261,9860,559,861,259,1
7NV-Embed-v261,5259,859,260,558,9
8Nomic-Embed-v261,2159,558,960,158,2
9text-embedding-3-large60,8959,158,559,857,8
10Multilingual-E5-Large60,4558,858,259,559,8

Wichtigste Erkenntnis: Fuer Deutsch spezifisch ist Jina-Embeddings-v3 mit einem Score von 61,8 die beste Wahl. Fuer Franzoesisch fuehrt Cohere Embed v4 mit 63,8.


Open-Source vs proprietaer

Leistungsvergleich

KategorieBestes Open-SourceScoreBestes ProprietaereScoreDifferenz
GesamtQwen3-Embedding67,89Gemini Embedding 00168,32-0,6%
RetrievalQwen3-Embedding63,8Gemini Embedding 00164,5-1,1%
KlassifikationQwen3-Embedding86,9Gemini Embedding 00187,3-0,5%
ClusteringQwen3-Embedding51,4Gemini Embedding 00152,1-1,3%
MehrsprachigBGE-M362,34Gemini Embedding 00164,18-2,9%

Fazit: Die Luecke zwischen Open-Source und proprietaer war noch nie so klein. Qwen3-Embedding liegt nur 0,6% hinter Gemini, und es ist kostenlos. Fuer die meisten Anwendungsfaelle ist Open-Source mehr als ausreichend.

Kosten fuer 100M Dokumente

ModellPreis/1M TokensEncodierungskosten 100M Docs (500 Tokens Durchschn.)Monatliche Re-Encodierung
Gemini Embedding 001$0,15$7.500$0 (einmalig)
text-embedding-3-large$0,13$6.500$0 (einmalig)
Voyage-Large-2$0,20$10.000$0 (einmalig)
Cohere Embed v4$0,10$5.000$0 (einmalig)
Qwen3-Embedding (self)GPU-Hosting~$200/MonatInklusive
BGE-Large-v2 (self)GPU-Hosting~$150/MonatInklusive

Bestes Modell nach Anwendungsfall

Fuer RAG (Retrieval)

PrioritaetEmpfohlenes ModellWarum
Maximale LeistungGemini Embedding 001Hoechster Retrieval-Score (64,5)
Open-SourceQwen3-Embedding63,8 Retrieval, kostenlos
Knappes Budgettext-embedding-3-small$0,02/1M Tokens, akzeptabel (58,1)
MehrsprachigCohere Embed v4Bester Score fuer Franzoesisch (63,8)
Lange DokumenteNV-Embed-v232768 Tokens, 4096 Dims
Self-hostedBGE-Large-v2Leichtgewichtig, performant, 1024 Dims

Fuer Klassifikation

PrioritaetEmpfohlenes ModellScore
Maximale LeistungGemini Embedding 00187,3
Open-SourceQwen3-Embedding86,9
Leichtgewichtig (Edge)Stella-400M-v582,5

Fuer Clustering

PrioritaetEmpfohlenes ModellScore
Maximale LeistungGemini Embedding 00152,1
Open-SourceQwen3-Embedding51,4
MehrsprachigBGE-M344,5

Code: Die Top 3 Modelle verwenden

1. Gemini Embedding 001

DEVELOPERpython
import google.generativeai as genai genai.configure(api_key="YOUR_API_KEY") def embed_with_gemini(texts: list[str], task_type: str = "retrieval_document"): """Embedding mit Gemini - bester MTEB-Score 2026.""" result = genai.embed_content( model="models/gemini-embedding-001", content=texts, task_type=task_type # retrieval_document, retrieval_query, etc. ) return result["embedding"] # Fuer Abfragen einen anderen task_type verwenden query_embedding = embed_with_gemini( ["Wie funktioniert RAG?"], task_type="retrieval_query" ) # Fuer Dokumente doc_embeddings = embed_with_gemini( ["RAG kombiniert Retrieval und Generierung..."], task_type="retrieval_document" ) print(f"Dimensionen: {len(query_embedding[0])}") # 3072

2. Qwen3-Embedding (Open-Source)

DEVELOPERpython
from sentence_transformers import SentenceTransformer # Modell herunterladen (nur beim ersten Mal) model = SentenceTransformer("Qwen/Qwen3-Embedding-8B") # Dokument-Embeddings documents = [ "RAG kombiniert Vektorsuche mit Textgenerierung.", "Embeddings transformieren Text in numerische Vektoren.", "Qdrant ist eine leistungsstarke Vektordatenbank." ] doc_embeddings = model.encode( documents, batch_size=32, show_progress_bar=True, normalize_embeddings=True ) # Abfrage-Embeddings (mit Instruktion) queries = ["Wie funktioniert RAG?"] query_embeddings = model.encode( queries, prompt="query: ", normalize_embeddings=True ) print(f"Dimensionen: {doc_embeddings.shape[1]}") # 4096

3. NV-Embed-v2 (NVIDIA, Open-Source)

DEVELOPERpython
from sentence_transformers import SentenceTransformer model = SentenceTransformer("nvidia/NV-Embed-v2", trust_remote_code=True) # NV-Embed unterstuetzt aufgabenspezifische Instruktionen instruction = "Given a question, retrieve relevant passages that answer it" queries = ["Was ist Retrieval Augmented Generation?"] passages = [ "RAG kombiniert Informationsabruf mit Textgenerierung...", "Vektordatenbanken speichern hochdimensionale Embeddings..." ] # Abfragen mit Instruktion encodieren query_embeddings = model.encode( queries, prompt=instruction, normalize_embeddings=True ) # Passagen ohne Instruktion encodieren passage_embeddings = model.encode( passages, normalize_embeddings=True ) # Aehnlichkeitsberechnung import numpy as np similarities = np.dot(query_embeddings, passage_embeddings.T) print(f"Scores: {similarities}") print(f"Dimensionen: {query_embeddings.shape[1]}") # 4096

Wichtige Trends 2026

1. Dimensionen explodieren

Der Trend geht zu Modellen mit sehr hohen Dimensionen:

JahrStandard-DimsReferenzmodell
2023768-1536text-embedding-ada-002
20241024-3072text-embedding-3-large
20252048-4096NV-Embed-v2
20262048-4096Qwen3-Embedding, NV-Embed-v2

Auswirkung: Mehr Dimensionen = bessere Genauigkeit, aber mehr Speicher und Latenz. Quantisierung wird unverzichtbar.

2. Matryoshka-Embeddings

Matryoshka-Embeddings ermoeglichen das Abschneiden von Vektoren auf beliebige Dimensionen ohne Neutraining:

DEVELOPERpython
# text-embedding-3-large unterstuetzt Matryoshka from openai import OpenAI client = OpenAI() # Volle Dimension (3072) full = client.embeddings.create( model="text-embedding-3-large", input="Hallo Welt", dimensions=3072 ) # Reduzierte Dimension (256) - gleiches Modell compact = client.embeddings.create( model="text-embedding-3-large", input="Hallo Welt", dimensions=256 ) # 12x weniger Speicher, ~3% Recall-Verlust

3. Multimodale Embeddings

Cohere Embed v4 ist ein fuehrendes kommerzielles multimodales Modell (Text + Bild):

DEVELOPERpython
import cohere co = cohere.Client("YOUR_API_KEY") # Text + Bild im selben Raum einbetten response = co.embed( texts=["Eine Katze auf einem Sofa"], images=["base64_encoded_image..."], model="embed-v4.0", input_type="search_document" ) # Text- und Bild-Embeddings sind vergleichbar

4. Langer Kontext (32K+ Tokens)

Modelle mit langem Kontext ermoeglichen die Encodierung ganzer Dokumente ohne Chunking:

ModellMax TokensAuswirkung
E5-Mistral-7B32.768Ganzes Dokument in einem Vektor
NV-Embed-v232.768Eliminiert die Notwendigkeit von Chunking
GTE-Qwen2-7B32.768Late Chunking moeglich
Jina-Embeddings-v38.192Guter Kompromiss Groesse/Leistung

Auswirkung auf RAG-Architekturentscheidungen

Die Wahl des Embedding-Modells beeinflusst Ihre gesamte Architektur:

Entscheidungsmatrix

KriteriumBeeinflusstOptionen
DimensionenVektorspeicher, Latenz256 (Matryoshka) bis 4096
Max TokensChunking-Strategie512 (keine Wahl) bis 32K (ganzes Dokument)
MehrsprachigPipeline pro Sprache oder vereinheitlichtBGE-M3, Cohere v4 (vereinheitlicht)
PreisGesamtbudget$0 (Open-Source) bis $0,20/1M Tokens
Inferenz-LatenzEchtzeit-PipelineKleines lokales Modell vs API

Unsere Empfehlung fuer Produktions-RAG

Fuer ein RAG-System in der Produktion empfehlen wir:

  1. Start: text-embedding-3-small ($0,02/1M Tokens, einfache API)
  2. Wachstum: Cohere Embed v4 (mehrsprachig, multimodal)
  3. Skalierung: Qwen3-Embedding self-hosted (kostenlos, performant, volle Kontrolle)

Bei Ailog verwenden wir eine Kombination von Modellen je nach Kanal: Cohere fuer das mehrsprachige Widget und ein feinabgestimmtes Open-Source-Modell fuer Kunden mit hohem Volumen. Schauen Sie sich unseren Embeddings-Leitfaden und den Embedding-Fine-Tuning-Leitfaden an.


Inferenzgeschwindigkeits-Benchmark

Die Embedding-Latenz ist entscheidend fuer Echtzeit-RAG. Hier sind die gemessenen Inferenzzeiten.

Latenz pro Abfrage (Batch=1, GPU A100)

ModellParameterLatenz (ms)Tokens/Sek
Stella-400M-v5400M864.000
BGE-Large-v2335M1051.200
Nomic-Embed-v2137M5102.400
Jina-Embeddings-v3570M1534.133
E5-Mistral-7B7B856.024
NV-Embed-v27B925.565
GTE-Qwen2-7B7B885.818
Qwen3-Embedding7B826.244

API-Latenz (Cloud)

APIp50-Latenz (ms)p95-Latenz (ms)Rate-Limit
OpenAI (text-embedding-3-large)4512010K RPM
Gemini Embedding 001359515K RPM
Cohere Embed v45013510K RPM
Voyage-Large-2551405K RPM

FAQ

Fuer mehrsprachiges RAG bietet **Cohere Embed v4** den besten Franzoesisch-Score im MMTEB (63,8). Fuer Deutsch ist **Jina-Embeddings-v3** mit 61,8 die beste Wahl. Wenn Sie Open-Source bevorzugen, ist **BGE-M3** eine ausgezeichnete mehrsprachige Wahl. Fuer das beste Preis-Leistungs-Verhaeltnis bleibt **text-embedding-3-small** von OpenAI zu $0,02/1M Tokens unschlagbar.
Ja, mit den richtigen Optimierungen. Auf einer A100 GPU verarbeitet Qwen3-Embedding (7B) eine Abfrage in 82ms. Mit Batching (batch=32) erreicht der Durchsatz 50.000+ Tokens/Sek. Fuer Echtzeit-RAG ist die Embedding-Latenz selten der Engpass - die LLM-Generierung nimmt die meiste Zeit in Anspruch. Lesen Sie unseren Leitfaden zur [Reduzierung der RAG-Latenz](/blog/guides/reduce-rag-latency).
Fine-Tuning von Embeddings kann den Recall um 5-15% in Ihrer spezifischen Domaene verbessern. Es wird empfohlen, wenn: (1) Ihre Domaene spezielles Vokabular hat (Medizin, Recht), (2) Sie mindestens 10K Frage-Dokument-Paare haben, (3) generische Modelle einen Recall < 0,85 liefern. Unser [Fine-Tuning-Leitfaden](/blog/guides/fine-tune-embeddings) behandelt die vollstaendige Methode.
Matryoshka-Embeddings reduzieren die Anzahl der Dimensionen (z.B. 3072 -> 256), was den Speicher um 12x reduziert. Quantisierung reduziert die Praezision jeder Dimension (float32 -> int8 oder binaer), und reduziert den Speicher um 4x bis 32x. Beide Techniken sind komplementaer und koennen kombiniert werden. ---

Fazit

Die MTEB 2026 Rangliste bestaetigt drei grosse Trends:

  1. Die Open-Source/Proprietaer-Luecke schliesst sich: Qwen3-Embedding liegt nur 0,6% hinter Gemini
  2. Mehrsprachig ist nicht mehr optional: MMTEB ist zum Referenz-Benchmark geworden
  3. Die Kosten bleiben niedrig: Open-Source ist kostenlos und guenstige APIs wie text-embedding-3-small beginnen bei $0,02/1M Tokens

Das richtige Modell haengt von Ihrem Kontext ab. Aber eines ist klar: Embeddings sind zugaenglicher und leistungsfaehiger als je zuvor.

Moechten Sie die besten Embeddings in Ihren Chatbot integrieren, ohne sich um die Infrastruktur zu kuemmern? Testen Sie Ailog kostenlos - wir kuemmern uns um Embeddings, Vektordatenbank und LLM fuer Sie.

Tags

EmbeddingsMTEBBenchmarkRAGRetrievalNLPRangliste

Verwandte Artikel

Ailog Assistant

Ici pour vous aider

Salut ! Pose-moi des questions sur Ailog et comment intégrer votre RAG dans vos projets !