Mistral LLM-Kosten und Performance im Vergleich

Stand: 2026-10-07. Preise in USD pro 1 Mio. Token (Mistral Studio/API, eigener Key). Benchmarks aus der Mistral-Ankündigung zu Large 4 (Preview) und öffentlichen Quellen; mit Vorsicht genießen, soweit nicht unabhängig bestätigt.

1. Preisvergleich (USD / M Token)

ModellInputCached InputOutputAnmerkung
Mistral Large 4 (Preview v26.10)$0.68$0.07$2.09Preview-Preis, ca. 50 % Rabatt
Mistral Large 4 (regulär nach GA)$1.36$0.14$4.18Weights/GA Ende Oktober 2026 erwartet
GLM-5.3 (Z.ai, gehostet von Mistral)$1.40$0.14$4.401M Kontext, 128K max. Output, text-only
Mistral Medium 3.5 (26.04)$0.40$0.04$1.20Günstigstes “ernsthaftes” Mistral-Modell
Ministral 3 8B (25.12)$0.15—$0.15Edge/Kleinmodell, günstigstes Mistral-Modell; kein Cached-Input-Preis gelistet

Kontextfenster (laut API/Doku): ML4 Preview = 512K (Doku bewirbt 1M), GLM-5.3 = 1M / 128K Output, Medium 3.5 = 128K, Ministral 8B = 256K.

Faustregel für Agenten-Workloads: Der Condenser (Kontextverdichtung) frisst hauptsächlich Input-Token (lange Prompts) und produziert kurze Outputs. Dort zählt also fast nur der Input-Preis. GLM-5.3 (1.36 — praktisch gleichauf), aber im Preview-Fenster ist ML4 (0.15 Input/Output)** wäre für den Condenser die mit Abstand günstigste Wahl (ca. 9× günstiger als GLM-5.3 Input).

2. Performance-Vergleich (Auswahl)

Benchmark / EvalMistral Large 4 (Preview)GLM-5.3Mistral Medium 3.5Ministral 3 8B
Coding Agent Index (kombiniert)49.8 %~hinter ML4 (laut Mistral)deutlich dahinterdeutlich dahinter
DeepSWE v1.161.7 %———
Terminal-Bench 428.3 %———
SWE-Atlas-QnA59.4 %———
Blind Human-Eval Coding (Surge AI, 1–5)3.74 (Platz 2/5, hinter Claude Opus 5)3.60——
AutomationBench (657 Business-Workflows)59.9 %dahinter (laut Mistral)——
AA-Briefcase (Elo)1.393———
Cybench (Cyber, 40 Challenges)93 %———
Artificial Analysis Cyber IndexTop 5 global, führend unter nicht-chinesischen Open-Weight-Modellen———
SciCode-VerifiedSOTA unter Open-Weight-Modellen———
Internes STEM-Head-to-Head (Math/Physics)vorgezogen vs. GLM-5.3Referenz——
Human-Eval CADvorgezogen vs. GLM-5.3Referenz——
Human-Eval Finance / Codingauf par mit GLM-5.3Referenz——
Vision / Visual Grounding (Dense 200)42 % (laut Mistral sogar vor GPT-6-Astra mit 41 %)n/a (text-only)Vision ja, aber schwächerVision ja (“best-in-class text and vision” für Edge-Klasse, laut Mistral)
Halluzination/Safety (B3 Agent Security)93.3 % Resistenz, KORA 1.691 (“Exemplary”)gute Werte, teils dahinter——

3. Einordnung

  • ML4 (Preview) ist Mistrals stärkstes Modell: klar vor GLM-5.3 in Coding-Agenten, STEM, CAD, Cyber und Vision; auf par in Finance. Einziger Nachteil: kleineres Kontextfenster (512K vs. 1M) und Preview-Status.
  • GLM-5.3 bleibt starkes, bewährtes Arbeitsmodell — besonders mit 1M Kontext für lange Sessions. Guter Default.
  • Medium 3.5 ist das Preis-Leistungs-Modell für alltägliche Aufgaben; für Coding-Agenten deutlich schwächer.
  • Ministral 3 8B ist das Budget-Modell: 8B Parameter, für Edge/lokal gedacht, mit Vision und Function Calling. Für einfache Chat-, Zusammenfassungs- und Klassifikationsaufgaben (z. B. als dedizierter Condenser) ausreichend und preislich unschlagbar ($0.15/M). Als Haupt-Agent für komplexe Coding-/Reasoning-Aufgaben nicht konkurrenzfähig.
  • Preview-Falle: mistral-large-latest zeigt aktuell noch auf Large 3 (2512), nicht auf ML4. ML4 nur via mistral-large-4 / mistral-large-4-0 adressieren.

Quellen