Agentic Relations

Mixtral (Sparse Mixture-of-Experts)

Sparse-Mixture-of-Experts-Sprachmodell von Mistral AI, das im Dezember 2023 die erste hochwertige offene MoE-Architektur etabliert hat und damit den Industrie-Standard für effiziente Frontier-Modelle prägte.

Definition

Mixtral ist ein Sparse-Mixture-of-Experts-Sprachmodell des französischen KI-Labors Mistral AI, das erstmals im Dezember 2023 als Mixtral 8x7B veröffentlicht wurde. Es kombiniert 8 Experten-Netzwerke zu je 7 Milliarden Parametern und nutzt ein Gating-Netzwerk, das pro Token nur zwei dieser Experten aktiviert. Damit erreicht das Modell eine effektive Gesamt-Parameter-Zahl von 46.7 Milliarden bei einer aktiven Last von nur 12.9 Milliarden pro Forward-Pass. Mixtral war die erste hochwertige offene MoE-Implementierung und prägte den Industrie-Standard für effiziente Frontier-Modelle.

Mixtral 8x22B folgte im April 2024 mit derselben Architektur, aber grösseren Experten. Beide Varianten sind unter Apache 2.0 lizenziert, was kommerzielle Nutzung, Modifikation und Weiterverbreitung erlaubt. Die offene Verfügbarkeit zusammen mit der starken Performance pro Compute-Einheit machte Mixtral zu einem der einflussreichsten offenen Modelle des Jahres 2024 und zur bevorzugten Basis vieler Community-Fine-Tunes.

Geschichte und Architektur

Die Mixture-of-Experts-Idee reicht bis in die 1990er-Jahre zurück (Jacobs et al., 1991), wurde aber erst durch Sparse-Activation-Techniken wie Switch Transformer (Fedus et al., 2022) für Deep Learning praktikabel. GPT-4, Claude 3 und Gemini 1.5 nutzen laut Branchen-Quellen MoE-Architekturen, hatten aber keine offene Implementierung freigegeben. Mixtral schloss diese Lücke.

Architektur-Details:

  • Basis: Decoder-only Transformer wie Mistral 7B.
  • MoE-Schicht: ersetzt das übliche Feedforward Network (FFN) jeder Transformer-Schicht durch 8 parallele FFNs (Experten).
  • Router: ein linearer Layer berechnet Logits pro Token, ein Softmax und Top-k-Selection wählen die k=2 Experten aus.
  • Gewichtung: die Top-2-Experten-Ausgaben werden mit ihren Routing-Gewichten kombiniert.
  • Load Balancing: ein Auxiliary Loss sorgt dafür, dass alle Experten gleichmässig genutzt werden, sonst verkümmern unbenutzte Experten.

Die Trainings-Pipeline folgt dem Standard-Schema: Pretraining auf grossen Textkorpora, Supervised Fine-Tuning und Direct Preference Optimization (DPO) als Alignment-Phase. Die offiziellen Mixtral-Instruct-Varianten sind nach diesem Schema trainiert und in Chat-Anwendungen einsatzbereit.

Mixtral 8x22B erweitert die Architektur auf 22 Milliarden Parameter pro Experte, womit das Gesamt-Modell 141 Milliarden Parameter umfasst, von denen 39 Milliarden pro Token aktiv sind. Der Kontext wurde von 32k auf 64k erweitert, und Function Calling sowie JSON-Mode wurden im Pretraining berücksichtigt.

Praxis und Anwendung

Mixtral hat sich in zahlreichen Production-Szenarien etabliert:

  • Hosted-Anbieter: Together AI, Anyscale, Fireworks, Replicate, Groq, Perplexity und DeepInfra bieten Mixtral als Pay-per-Token-Service an, oft zu Bruchteilen der GPT-4-Preise.
  • Self-Hosting: mit vLLM, TGI, llama.cpp oder Ollama läuft Mixtral auf eigener Infrastruktur, was Datensouveränität und Kostenkontrolle bietet.
  • Fine-Tuning-Basis: Community-Projekte wie Dolphin, Nous-Hermes und OpenChat nutzen Mixtral als Foundation und liefern spezialisierte Varianten.
  • RAG-Pipelines: das gute Reasoning-zu-Latenz-Verhältnis macht Mixtral attraktiv für Retrieval-Augmented Generation in Enterprise-Settings.

Hardware-Anforderungen: Mixtral 8x7B benötigt in FP16 etwa 90 GB GPU-Speicher, was zwei A100 80GB oder zwei H100 80GB erfordert. Mit 4-Bit-Quantisierung (GGUF Q4_K_M, AWQ, GPTQ) sinkt der Bedarf auf etwa 26 GB, was eine einzelne Karte mit 32 oder 48 GB Speicher (etwa eine L40) ermöglicht; auf 24-GB-Karten wie der RTX 4090 ist Offloading eines Teils der Schichten nötig. Mixtral 8x22B braucht 280 GB FP16 oder 70 GB 4-Bit.

Inferenz-Performance: dank Sparse-MoE liegt der Compute-Bedarf pro Token bei nur 25 Prozent (8x7B) bzw. 28 Prozent (8x22B) eines dichten Modells gleicher Gesamt-Parameter-Zahl. Auf Groq erreicht Mixtral 8x7B über 500 Tokens pro Sekunde, was es zum schnellsten Modell seiner Klasse machte.

Häufige Fehler

  • Aktive Parameter mit Gesamt-Parametern verwechseln: für Speicher-Anforderungen zählen alle Parameter, für Compute nur die aktiven. Dieser Unterschied verwirrt bei Hardware-Planung.
  • Mixtral als reinen Skalierungs-Trick sehen: MoE ist kein Gratis-Skalierung. Schlechtes Load Balancing zerstört Performance, und Inferenz-Software muss MoE explizit unterstützen.
  • Quantisierung ohne Benchmark: 4-Bit-Quantisierung senkt Speicher, kostet aber je nach Variante 2 bis 5 Prozent Benchmark-Score. Eigene Tests sind Pflicht.
  • Function Calling nur in 8x22B: Mixtral 8x7B unterstützt Function Calling nicht nativ. Wrapper wie LangChain emulieren es, weniger zuverlässig.
  • Apache 2.0 mit Marken-Freiheit verwechseln: Lizenz erlaubt Nutzung, aber Mistral behält Markenrechte am Namen Mixtral.

Abgrenzung

  • Mistral 7B: dichtes Modell des gleichen Anbieters, kleiner und ohne MoE.
  • Mistral Large: proprietäres Frontier-Modell von Mistral, nicht offen.
  • Switch Transformer (Google): akademische MoE-Architektur, nie als Production-Modell veröffentlicht.
  • DeepSeek V3, V4: chinesische MoE-Modelle, deutlich grösser (671B total), 2025-2026 stärkste offene MoE-Architekturen.
  • GPT-4, Claude, Gemini: vermutlich MoE-basiert, aber proprietär, keine offene Implementation.

Weiter im KI-Lexikon

← Zurück zum Lexikon

Häufige Fragen

Was ist Mixtral?+

Mixtral ist ein Sparse-Mixture-of-Experts-Sprachmodell von Mistral AI, erstmals im Dezember 2023 als Mixtral 8x7B veröffentlicht. Es kombiniert 8 Experten zu je 7 Milliarden Parametern, was zu 46.7 Milliarden Gesamt-Parametern führt, von denen pro Token nur 12.9 Milliarden aktiv sind. Das Modell war die erste hochwertige offene MoE-Architektur und wurde unter Apache 2.0 publiziert.

Wie funktioniert Sparse Mixture-of-Experts?+

Bei Sparse-MoE wird die Feedforward-Schicht des Transformers durch mehrere parallele Experten ersetzt. Ein Gating-Netzwerk wählt pro Token die k besten Experten aus (bei Mixtral k=2 von 8) und gewichtet deren Ausgaben. Dadurch wird die Kapazität des Modells stark erhöht, ohne dass alle Parameter pro Forward-Pass aktiviert werden, was Inferenz-Kosten erheblich senkt.

Welche Mixtral-Varianten gibt es?+

Es existieren zwei offizielle Hauptvarianten: Mixtral 8x7B (Dezember 2023, 46.7B Parameter total, 12.9B aktiv) und Mixtral 8x22B (April 2024, 141B Parameter total, 39B aktiv). Beide sind Apache 2.0 lizenziert. Zusätzlich gibt es zahlreiche Community-Fine-Tunes wie Dolphin-Mixtral, Nous-Hermes-Mixtral und spezialisierte Varianten für Code, Math und Konversation.

Wie schneidet Mixtral in Benchmarks ab?+

Mixtral 8x7B übertraf zum Launch Llama 2 70B und GPT-3.5 in vielen Benchmarks, bei deutlich geringerer Inferenz-Last. Mixtral 8x22B erreichte 2024 nahe an GPT-4-Niveau in mehreren Benchmarks. In MMLU lag 8x22B bei rund 77 Prozent, in HumanEval (Coding) bei 45 Prozent. Reasoning-lastige Tasks wie GSM8K und MATH waren weiterhin Schwächen.

Warum ist Sparse-MoE wichtig?+

Sparse-MoE ist die wichtigste Architektur-Innovation seit dem Transformer für Skalierung. Sie erlaubt Frontier-Modelle mit Billionen Parametern, ohne dass Inferenz proportional teurer wird. GPT-4, Claude und Gemini nutzen vermutlich MoE-Varianten, hatten aber keine offene Implementierung. Mixtral demokratisierte diese Architektur und machte sie für die offene Community greifbar.

Wie betreibt man Mixtral lokal?+

Mixtral 8x7B benötigt etwa 90 GB GPU-Speicher in FP16, mit 4-Bit-Quantisierung (GGUF, AWQ, GPTQ) etwa 26 GB. FP16 erfordert also zwei A100 oder H100 mit je 80 GB; das 4-Bit-Modell läuft auf einer Karte mit 32 oder 48 GB Speicher, auf 24-GB-Karten wie der RTX 4090 nur mit Offloading eines Teils der Schichten. Tools wie llama.cpp, vLLM, TGI (Text Generation Inference) und Ollama unterstützen Mixtral nativ. 8x22B benötigt entsprechend mehr, etwa 280 GB FP16 oder 70 GB 4-Bit.

Was sind die Schwächen von Mixtral?+

Mixtral hat moderates Reasoning, schwächer als Claude oder GPT-4 in mehrstufigen logischen Aufgaben. Das Kontextfenster ist mit 32k (8x7B) bzw. 64k (8x22B) kleiner als bei Frontier-Konkurrenten. Inferenz erfordert die volle Gesamt-Parameter-Zahl im Speicher, nicht nur die aktiven Experten. Multimodalität fehlt, dafür gibt es separate Modelle wie Pixtral.

Wer nutzt Mixtral?+

Mixtral wird breit in der Open-Source-Community eingesetzt, sowohl als Basis für Fine-Tuning als auch direkt in Production. Anbieter wie Together AI, Anyscale, Fireworks, Replicate, Groq und Perplexity hosten Mixtral. Enterprise-Kunden mit Self-Hosting-Bedarf bevorzugen es wegen der offenen Lizenz und der starken Performance pro Compute-Einheit.

Verwandte Begriffe

Quellen

  • Jiang et al. (2024) Mixtral of Experts
  • Mistral AI Mixtral 8x7B Model Card
  • Mistral AI Mixtral 8x22B Model Card
  • Fedus et al. (2022) Switch Transformer

Wikidata: Q126193488 · Zuletzt geprüft: 2026-07-02