Mistral LLM-Kosten und Performance im Vergleich
Stand: 2026-10-07. Preise in USD pro 1 Mio. Token (Mistral Studio/API, eigener Key). Benchmarks aus der Mistral-Ankündigung zu Large 4 (Preview) und öffentlichen Quellen; mit Vorsicht genießen, soweit nicht unabhängig bestätigt.
1. Preisvergleich (USD / M Token)
| Modell | Input | Cached Input | Output | Anmerkung |
|---|---|---|---|---|
| Mistral Large 4 (Preview v26.10) | $0.68 | $0.07 | $2.09 | Preview-Preis, ca. 50 % Rabatt |
| Mistral Large 4 (regulär nach GA) | $1.36 | $0.14 | $4.18 | Weights/GA Ende Oktober 2026 erwartet |
| GLM-5.3 (Z.ai, gehostet von Mistral) | $1.40 | $0.14 | $4.40 | 1M Kontext, 128K max. Output, text-only |
| Mistral Medium 3.5 (26.04) | $0.40 | $0.04 | $1.20 | Günstigstes “ernsthaftes” Mistral-Modell |
| Ministral 3 8B (25.12) | $0.15 | — | $0.15 | Edge/Kleinmodell, günstigstes Mistral-Modell; kein Cached-Input-Preis gelistet |
Kontextfenster (laut API/Doku): ML4 Preview = 512K (Doku bewirbt 1M), GLM-5.3 = 1M / 128K Output, Medium 3.5 = 128K, Ministral 8B = 256K.
Faustregel für Agenten-Workloads: Der Condenser (Kontextverdichtung) frisst hauptsächlich Input-Token (lange Prompts) und produziert kurze Outputs. Dort zählt also fast nur der Input-Preis. GLM-5.3 (1.36 — praktisch gleichauf), aber im Preview-Fenster ist ML4 (0.15 Input/Output)** wäre für den Condenser die mit Abstand günstigste Wahl (ca. 9× günstiger als GLM-5.3 Input).
2. Performance-Vergleich (Auswahl)
| Benchmark / Eval | Mistral Large 4 (Preview) | GLM-5.3 | Mistral Medium 3.5 | Ministral 3 8B |
|---|---|---|---|---|
| Coding Agent Index (kombiniert) | 49.8 % | ~hinter ML4 (laut Mistral) | deutlich dahinter | deutlich dahinter |
| DeepSWE v1.1 | 61.7 % | — | — | — |
| Terminal-Bench 4 | 28.3 % | — | — | — |
| SWE-Atlas-QnA | 59.4 % | — | — | — |
| Blind Human-Eval Coding (Surge AI, 1–5) | 3.74 (Platz 2/5, hinter Claude Opus 5) | 3.60 | — | — |
| AutomationBench (657 Business-Workflows) | 59.9 % | dahinter (laut Mistral) | — | — |
| AA-Briefcase (Elo) | 1.393 | — | — | — |
| Cybench (Cyber, 40 Challenges) | 93 % | — | — | — |
| Artificial Analysis Cyber Index | Top 5 global, führend unter nicht-chinesischen Open-Weight-Modellen | — | — | — |
| SciCode-Verified | SOTA unter Open-Weight-Modellen | — | — | — |
| Internes STEM-Head-to-Head (Math/Physics) | vorgezogen vs. GLM-5.3 | Referenz | — | — |
| Human-Eval CAD | vorgezogen vs. GLM-5.3 | Referenz | — | — |
| Human-Eval Finance / Coding | auf par mit GLM-5.3 | Referenz | — | — |
| Vision / Visual Grounding (Dense 200) | 42 % (laut Mistral sogar vor GPT-6-Astra mit 41 %) | n/a (text-only) | Vision ja, aber schwächer | Vision ja (“best-in-class text and vision” für Edge-Klasse, laut Mistral) |
| Halluzination/Safety (B3 Agent Security) | 93.3 % Resistenz, KORA 1.691 (“Exemplary”) | gute Werte, teils dahinter | — | — |
3. Einordnung
- ML4 (Preview) ist Mistrals stärkstes Modell: klar vor GLM-5.3 in Coding-Agenten, STEM, CAD, Cyber und Vision; auf par in Finance. Einziger Nachteil: kleineres Kontextfenster (512K vs. 1M) und Preview-Status.
- GLM-5.3 bleibt starkes, bewährtes Arbeitsmodell — besonders mit 1M Kontext für lange Sessions. Guter Default.
- Medium 3.5 ist das Preis-Leistungs-Modell für alltägliche Aufgaben; für Coding-Agenten deutlich schwächer.
- Ministral 3 8B ist das Budget-Modell: 8B Parameter, für Edge/lokal gedacht, mit Vision und Function Calling. Für einfache Chat-, Zusammenfassungs- und Klassifikationsaufgaben (z. B. als dedizierter Condenser) ausreichend und preislich unschlagbar ($0.15/M). Als Haupt-Agent für komplexe Coding-/Reasoning-Aufgaben nicht konkurrenzfähig.
- Preview-Falle:
mistral-large-latestzeigt aktuell noch auf Large 3 (2512), nicht auf ML4. ML4 nur viamistral-large-4/mistral-large-4-0adressieren.
Quellen
- Mistral Ankündigung: https://mistral.ai/news/mistral-large-4/
- Model-Karten: https://docs.mistral.ai/models/mistral-large-4-0, https://docs.mistral.ai/models/zai-glm-5-3, https://docs.mistral.ai/models/mistral-medium-3-5-26-04, https://docs.mistral.ai/models/ministral-3-8b-25-12
- Preise gegen
GET https://api.mistral.ai/v1/models(eigener Key) geprüft. - Hinweis: Viele ML4-Benchmarks stammen aus Mistrals eigener Ankündigung (Vendor-Eval). Unabhängige Gesamtrankings (z. B. Artificial Analysis Intelligence Index) waren zum Zeitpunkt der Erstellung paywalled.