Trainingsaufwand der Modelle im Vergleich

Stand: 2026-10-11. Vergleich über Primärquellen (offizielle Ankündigungen und technische Papers), keine Marketing-Grafiken. AA-Index-Werte: Artificial Analysis Intelligence Index v4.3.2, Snapshot 11.10.2026.

Vergleichstabelle

Mistral Large 4 (Preview, 10/2026)DeepSeek V3 (12/2024)Llama 3.1 405B (07/2024)
Artificial Analysis Intelligence Index (v4.3.2)3887
Parameter1.000 Mrd. (52 Mrd. aktiv, MoE)671 Mrd. (37 Mrd. aktiv, MoE)405 Mrd. (dense)
Trainings-Cluster3.800 NVIDIA Grace Blackwell (eigene DCs, Europa)2.048 NVIDIA H800bis zu 16.384 NVIDIA H100
GPU-Stunden (gesamt)nicht publiziert2.788 Tsd. (2.664K Pre-Training / 119K Kontext / 5K Post-Training)nicht publiziert
Trainingskosten (USD)nicht publiziert5,58 Mio. (bei angenommenen 2 $/GPU-h)nicht publiziert
Trainings-FLOPsnicht publiziertnicht publiziert3,8 × 10²⁵
Trainingsdatennicht publiziert14,8 Bio. Token15,6 Bio. Token
Herkunft der ZahlenVendor-AnkündigungTech Report (Peer-Community)Tech Report (Peer-Community)

Spaltensortierung: Mistral @2026mistrallarge4 @2026mistralhasreleased · DeepSeek V3 @deepseek-ai2024deepseekv3technicalreport · Llama 3.1 @metaaillamateam2024llama3herd. AA-Index für alle drei: Artificial Analysis @2026mistralhasreleased. Vollständige Quelleinträge im Quellenverzeichnis, Sektion „KI-Modelle — Training, Compute, Benchmarks”.

Erklärung

Warum diese drei Modelle? Sie sind die einzigen Frontier- bzw. Open-Weight-Modelle, zu denen belastbare Primärquellen mit unterschiedlichen Transparenz-Ebenen existieren — und sie spannen genau das Spektrum auf, das für den Diskurs relevant ist: ein europäischer Anbieter (Mistral), der aus Souveränitätsgründen bewusst europäische Infrastruktur betont, und zwei Anbieter, die technische Rechenschaft über den Trainingsaufwand ablegen.

Die Kennzahlen sind nicht gleichwertig — sie messen Verschiedenes:

  • Clustergröße (Mistral: 3.800 GB200) ist eine Infrastruktur-Angabe. Sie sagt nichts über den tatsächlichen Aufwand: Dazu bräuchte man Dauer und Auslastung des Trainings. 3.800 Grace-Blackwell-Systeme sind eindrucksvoll, aber ohne GPU-Stunden bleibt unklar, wie lange und wie intensiv gerechnet wurde. Mistrals Angabe ist damit primär ein Souveränitäts-Signal („in Mistral’s own datacenters in Europe”), keine Aufwands-Rechenschaft.
  • GPU-Stunden (DeepSeek: 2,788 Mio.) sind die direkteste Aufwagsgröße: tatsächlich verbrauchte Rechenzeit, hardwarerelativiert. DeepSeek legt sie phasenaufgeschlüsselt vor und rechnet sie sogar in Dollar um (5,58 Mio. bei angenommenen 2 $/GPU-h) — die einzige öffentliche Kostenangabe für ein Frontier-Training überhaupt. Deshalb stammt die berühmte „DeepSeek war so billig”-Erzählung nicht aus Marketing, sondern aus Tabelle 1 des Papers.
  • FLOPs (Llama: 3,8 × 10²⁵) sind die hardwareunabhängigste Einheit: Gesamtrechenleistung, egal ob H100 oder etwas anderes sie liefern. Meta ist das US-Gegenstück zu DeepSeek auf dieser Ebene — Clustergröße und FLOPs und Tokenmenge und sogar Betriebserfahrungen (466 Job-Unterbrechungen in einem 54-Tage-Fenster) werden offengelegt.

Die Tabelle zeigt die Asymmetrie: DeepSeek V3 füllt fast jede Zeile, Llama 3.1 alle bis auf GPU-Stunden/Kosten, Mistral Large 4 nur Cluster und Parameter. Das ist kein Zufall, sondern Kommunikationspolitik: Wo der Trainingsaufwand publiziert wird, wird er auch angreifbar — angreifbar in der Effizienz-Debatte, aber auch zitierbar als Rechenschaft. Mistral kauft sich mit der Clusterangabe Souveränitätsglaubwürdigkeit ein, ohne Aufwandszahlen offenzulegen.

Und die anderen? OpenAI publiziert zu GPT-6 Astra gar keine Trainings-Compute-Angaben (Volltext geprüft @2026gpt6astranew); Anthropic ebenso wenig — von Anthropic-Trainingscompute ist nur die Cluster-Infrastruktur bekannt, die AWS als Betreiber angibt (Project Rainier: zunächst ~500.000 Trainium2-Chips, später >1 Mio. @2025awssprojectrainier). DeepSeek selbst hat die Transparenz der V3-Ära zurückgefahren: Im V4-Report fehlt die GPU-Anzahl @deepseek-ai2026deepseekv4highlyefficient, ebenso bei Kimi K3 @moonshotaikimiteam2026kimik3open.

Für den Diskurs folgt daraus: Aussagen über „Effizienz” oder „Trainingsaufwand” von Modellen sind nur so belastbar wie die zugrundeliegende Kennzahl-Ebene. Die Reddit-Grafik „72 % Intelligence / 3,8 % GPUs” (r/MistralAI) scheitert genau hier: Sie vergleicht Mistrals Clustergröße mit unbelegten GPU-Zahlen der Konkurrenz und normiert auf einen Index, der selbst auf Vendor-Benchmarks basiert. Solche Vergleiche tragen nur, wenn — wie bei DeepSeek V3 und Llama 3.1 — GPU-Stunden bzw. FLOPs aus Primärquellen belegt sind. Der AA Intelligence Index (38/8/7) zeigt unabhängig davon, dass die Modelle generationsweise nicht vergleichbar sind: ML4 tritt gegen GPT-6-Astra-Klasse an (Astra max: 53), DeepSeek V3 und Llama 405B sind 2024er-Modelle. Compute-Vergleiche über Modellgenerationen hinweg sind deshalb ohnehin mit Vorsicht zu lesen.