Llama (Meta)
Open-Source-LLM-Familie von Meta, die mit Llama 2, 3 und 4 den Standard für lokal lauffähige und kommerziell nutzbare Sprachmodelle gesetzt hat.
Definition
Llama (Large Language Model Meta AI) ist die offen verfügbare LLM-Familie von Meta, die im Februar 2023 erstmals als reines Forschungs-Release veröffentlicht wurde. Mit Llama 2 (Juli 2023) wurde sie unter kommerziell nutzbarer Lizenz freigegeben, Llama 3 (April 2024) und Llama 4 (2025) folgten in regelmässigen Abständen. Llama ist 2026 das de facto Standard-Modell für lokale, Self-Hosted und Edge-Deployments und hat den offenen LLM-Markt fast im Alleingang geöffnet.
Strategisch ist Llama Metas Antwort auf die Closed-Source-Modelle von OpenAI, Anthropic und Google. CEO Mark Zuckerberg argumentiert, dass eine offene Modell-Basis die Marktmacht der Closed-Source-Anbieter bricht, einen breiteren Talent-Pool ans Llama-Ökosystem bindet und Sicherheits-Forschung durch breite Inspektion verbessert.
Architektur
Llama folgt der klassischen Decoder-only-Transformer-Architektur, ergänzt um eine Reihe von Verbesserungen:
- Rotary Position Embeddings (RoPE): Statt absolute Position-Embeddings werden Rotations-Matrizen verwendet, die besser auf lange Kontexte verallgemeinern.
- Grouped-Query Attention (GQA): Reduziert KV-Cache-Speicherbedarf bei Inferenz mit minimalem Qualitätsverlust.
- SwiGLU-Aktivierung: Modifizierte FFN-Aktivierung mit empirisch besserer Trainingsdynamik.
- RMSNorm: Lightweight-Alternative zu LayerNorm, schneller und numerisch stabiler.
Llama 3 wurde auf etwa 15 Billionen Tokens trainiert (Llama 2: 2 Billionen), was eine massive Skalierung darstellt. Llama 3.1 405B ist mit etwa 16.000 H100-GPUs über mehrere Monate trainiert worden. Llama 4 führt Mixture-of-Experts, native Multimodalität und iRoPE ein, wodurch Inferenz-Effizienz und Fähigkeiten gleichzeitig steigen.
Praxis
Llama-Modelle sind in vielfältigen Formaten und Anbietern verfügbar:
- Lokale Inferenz: Ollama für einfache CLI-Workflows, LM Studio für GUI, llama.cpp für CPU- und Apple-Silicon-Inferenz, vLLM und TGI für GPU-Production-Server.
- Cloud-API-Anbieter: Groq mit extremer Latenz dank LPU-Hardware, Together AI, Fireworks, Replicate, Perplexity Sonar und AWS Bedrock.
- Edge-Deployment: Llama 3.2 1B und 3B sind für On-Device-Inferenz auf Mobilgeräten konzipiert, etwa Smartphones oder Robotik-Plattformen.
- Vision-Varianten: Llama 3.2 11B und 90B verarbeiten Text und Bild, vergleichbar mit GPT-4o auf Vision-Benchmarks.
Die Preisstruktur bei Cloud-Anbietern liegt deutlich unter den Closed-Source-Frontier-Modellen: Llama 3 70B kostet typischerweise 0.05 bis 0.30 Dollar pro Million Tokens, ein Bruchteil von GPT-4o oder Claude. Lokal ist Llama kostenlos abgesehen von Compute. Ein quantisiertes Llama 3 8B Q4 läuft auf jedem MacBook M-Series mit 8 GB RAM.
Häufige Fehler
- Lizenz nicht prüfen: Die Llama Community License erlaubt nicht jeden Use Case. Insbesondere Branding-Vorgaben (Llama-Branding bei Derivaten) und die 700-Millionen-MAU-Schwelle müssen geprüft werden.
- Safety unterschätzen: Out-of-the-box-Llama-Modelle haben moderates Safety-Tuning. Für Production-Einsatz mit Endkunden ist Llama Guard oder ein eigenes Filter-Tuning notwendig.
- Quantisierung übertreiben: Q2 oder Q3 Quantisierung reduziert Qualität sichtbar. Q4 ist meist der süsse Spot, Q5 und Q8 sind für hochwertige Anwendungen vorzuziehen.
- Fine-Tuning ohne Eval: Llama-Fine-Tunes sind einfach, aber Qualität schnell zu verschlechtern. Ohne strukturierte Eval-Suite produziert Fine-Tuning häufig schlechtere Modelle als die Basis.
- Kontextfenster überfordern: Llama 3 hat 8k bis 128k Tokens je nach Variante. Bei sehr langen Kontexten sinkt Recall-Qualität, RAG bleibt oft die robustere Lösung.
Abgrenzung
- GPT-4 / Claude / Gemini: Closed-Source-Frontier-Modelle mit höherer Reasoning-Qualität, aber proprietär, teurer und nicht lokal lauffähig.
- Mistral (Mistral AI): französischer Open-Source-Konkurrent mit starken Modellen wie Mixtral 8x22B und Codestral, oft etwas effizienter pro Parameter.
- Qwen (Alibaba): chinesischer Open-Source-Konkurrent, sehr stark bei Coding und Mathematik, multilinguale Stärken.
- DeepSeek: chinesisches Open-Weight-Modell, mit DeepSeek-R1 ein Reasoning-Modell auf o1-Niveau, das die Open-Source-Welt 2025 geöffnet hat.
- Phi (Microsoft): spezialisierte kleine Modelle, sehr stark bei Reasoning pro Parameter, vor allem für Edge interessant.
- Falcon (TII Abu Dhabi): früher Open-Source-Kandidat, seit Llama 2 deutlich überholt.
Weiter im KI-Lexikon
← Zurück zum LexikonHäufige Fragen
Was ist Llama?+
Llama (Large Language Model Meta AI) ist die offene LLM-Familie von Meta, die im Februar 2023 erstmals als Forschungs-Release erschien. Mit Llama 2 (Juli 2023) wurde sie kommerziell nutzbar, Llama 3 (April 2024) und Llama 4 (2025) folgten. Llama ist heute das de facto Standard-Modell für lokale und Self-Hosted-Anwendungen.
Welche Llama-Varianten gibt es?+
Die Hauptvarianten 2026: Llama 3 in 8B und 70B Parametern, Llama 3.1 (mit 405B), 3.2 (mit Vision in 11B und 90B), 3.3 (verbesserte 70B), Llama 4 (MoE und native Multimodalität). Dazu kommen Code Llama für Programmierung und spezialisierte Fine-Tunes wie Llama Guard für Safety-Filtering.
Ist Llama wirklich Open Source?+
Llama ist offen verfügbar mit Modellgewichten unter der Llama Community License, aber nicht im strengen OSI-Sinn Open Source. Die Lizenz erlaubt kommerzielle Nutzung bis 700 Millionen monatlich aktive Nutzer und verbietet bestimmte Use Cases. Für die meisten Unternehmen ist das praktisch Open Source.
Wie gross ist Llama im Vergleich zu GPT-4?+
Llama 3.1 405B ist das grösste offen verfügbare Modell und nähert sich GPT-4o auf vielen Benchmarks. Llama 3 70B ist auf den meisten Tasks vergleichbar mit GPT-3.5 oder besser. Llama 3 8B läuft auf Consumer-Laptops und ist für viele Anwendungen ausreichend, insbesondere mit Fine-Tuning.
Wie nutze ich Llama lokal?+
Beliebte Wege sind Ollama (einfachster CLI-Wrapper), LM Studio (GUI), llama.cpp (C++ -Inferenz, läuft auf CPU und Apple Silicon) und vLLM (GPU-Server für Production). Quantisierung auf 4-Bit (Q4) reduziert RAM-Bedarf deutlich, ein Llama 3 8B Q4 läuft auf jedem modernen Laptop mit 8 GB RAM.
Was kostet Llama-Inferenz?+
Lokal ist Llama kostenlos abgesehen von Compute. Bei Cloud-Anbietern wie Groq, Together AI, Fireworks und Replicate liegen Preise bei 0.05 bis 0.30 Dollar pro Million Tokens für Llama 3 70B, deutlich unter GPT-4o. Groq bietet zudem extrem niedrige Latenzen via spezialisierter LPU-Hardware.
Was sind Schwächen von Llama?+
Llama ist auf reine Benchmark-Werte etwas hinter Frontier-Modellen, bei sehr komplexem Reasoning (Mathematik, Physik) schwächer als GPT-4 oder Claude, und die Multilinguale Qualität ist trotz Verbesserungen geringer. Out-of-the-box-Safety ist moderat, für Production-Use ist Llama Guard oder eigenes Filter-Tuning Pflicht.
Wer nutzt Llama in der Praxis?+
Llama ist die Default-Wahl für Self-Hosted-LLM-Workflows: Banken und Healthcare wegen Datenschutz, Forschung wegen Reproduzierbarkeit, Startups wegen Kostenkontrolle und Edge-Deployments (Llama 3.2 1B/3B). Meta selbst nutzt Llama in Meta AI auf Instagram, WhatsApp und Facebook.
Verwandte Begriffe
Quellen
- Meta AI (2023) Llama 2 Open Foundation and Fine-Tuned Chat Models
- Meta AI (2024) The Llama 3 Herd of Models
- Meta AI Llama Documentation
- Hugging Face Llama Model Cards
Wikidata: Q116894231 · Zuletzt geprüft: 2026-07-02