LangSmith
Hostete Observability- und Evaluations-Plattform für LLM-Anwendungen von LangChain Inc., die Tracing, Datasets, Evaluationen, Prompt-Hub und Monitoring in einem Stack vereint und sich 2026 als verbreitetes Tool für produktive LLM-Stacks etabliert hat.
Definition
LangSmith ist eine hostete Plattform für Observability, Evaluation und Prompt-Management von LLM-Anwendungen. Sie wird von LangChain Inc. entwickelt, der Firma hinter den Open-Source-Bibliotheken LangChain und LangGraph. Die erste Public Beta startete 2023, die GA-Version folgte Anfang 2024, und 2026 zählt LangSmith zu den meistgenutzten Tools im Bereich LLM-Ops.
Im Unterschied zu klassischer Application Observability ist LangSmith auf LLM-Spezifika ausgerichtet: Tracing einzelner Prompts und Tool-Calls, Token- und Kostenmetriken, Evaluator-Frameworks, Prompt-Versionierung, Dataset-Management und Human-Feedback-Workflows. Das Tool ist proprietär und sowohl als Cloud-Service als auch in Self-Hosted-Varianten verfügbar.
Architektur und Features
LangSmith besteht aus mehreren Schichten:
- Tracing: detaillierte Spans pro LLM-Call, Retrieval-Schritt oder Tool-Call, mit Inputs, Outputs, Tokens, Latenz und Kosten.
- Datasets: kuratierte Sammlungen von Beispielen mit Input-Output-Paaren, geeignet für Regressions- und Vergleichstests.
- Evaluations: Evaluator-Funktionen, LLM-as-Judge, String-Match, Embedding-Similarity, Custom-Code, Pairwise-Vergleiche.
- Prompt Hub: versionierte Prompt-Templates mit Variablen, Releases und Diff.
- Annotations: Human-Feedback-Workflows mit Inline-Kommentaren, Rating, Tagging.
- Monitoring: Dashboards für Production-Traffic, Fehlerraten, Latenz, Token-Volumen, Kosten pro Feature.
- Alerting: Schwellenwert-basierte Benachrichtigungen via Slack, E-Mail oder Webhook.
- Playground: interaktives Experimentieren mit Prompts und Modellen, direkter Transfer in Datasets.
- OpenTelemetry-Ingestion: Anbindung von Non-LangChain-Stacks wie Vercel AI SDK, OpenAI SDK oder Anthropic SDK.
Die Datenhaltung ist projektbezogen, mit Workspaces, Teams und Rollen. Für regulierte Umgebungen gibt es Self-Hosted-Deployments via Helm-Chart auf Kubernetes.
Praxis und Anwendung
Typische Anwendungsfelder:
- Tracing in Produktion: jede LangChain-, LangGraph- oder LangSmith-instrumentierte Anwendung sendet Traces, die im Detail nachvollziehbar sind.
- Debugging komplexer Agents: mehrstufige Tool-Use-Loops sind ohne Trace praktisch nicht debugbar, LangSmith zeigt jeden Schritt mit Inputs und Outputs.
- Regressionstests in CI: Datasets dienen als Goldstandard, Evaluations laufen pro Commit und schlagen bei Verschlechterung Alarm.
- Prompt-Tuning: Pairwise-Vergleiche zweier Prompt-Versionen mit denselben Beispielen, Aggregat-Metriken über Datasets.
- Modell-Migrationen: Vergleich Claude vs. GPT-5 vs. Gemini auf realen Traces, datengetriebene Entscheidung.
- Annotations und Human Feedback: Domain-Experten reviewen Traces, vergeben Labels, daraus entstehen neue Datasets.
- Cost-Allocation: Kostenmetriken pro Feature, Kunde oder Modell, sauber zugeordnet via Metadata.
- Prompt-Hub-Workflows: Prompts werden zentral gepflegt, Apps laden eine bestimmte Version per Pinned Tag.
Erfahrene Teams etablieren typischerweise eine kleine Set an Goldstandards-Datasets, ein paar LLM-as-Judge-Evaluators und ein Monitoring-Dashboard, das die wichtigsten Health-Metriken zeigt.
Häufige Fehler
- Alles tracen: Standardprojekte produzieren riesige Trace-Volumen, Sampling und Filter sind nötig.
- LLM-as-Judge ungeprüft vertrauen: Judge-Modelle haben eigene Biases, sie müssen gegen Human Labels kalibriert werden.
- Datasets nicht kuratieren: Datasets müssen aktiv gepflegt werden, sonst spiegeln sie veraltete Anforderungen.
- PII in Traces: ohne Redaktion landen sensible Daten in Logs, PII-Filter und Hashing einsetzen.
- Self-Hosted unterschätzt: Self-Hosting bringt Compliance, kostet aber Ops-Aufwand für Postgres, Redis und Kubernetes.
- Prompt Hub als Code-Ersatz: Prompts gehören in einen Review-Workflow, nicht in eine UI-only-Welt ohne Tests.
- Evaluations nur einmalig: Evaluations müssen Teil von CI sein, sonst verfallen sie als Theaterstück.
Abgrenzung
- Langfuse: Open-Source-Konkurrent mit starkem Self-Hosting-Profil und ähnlichem Feature-Set.
- Helicone: Proxy-basiertes Observability-Tool mit Fokus auf Cost-Tracking und einfacher Integration.
- Braintrust: Evaluations-fokussierte Plattform mit Fokus auf Datasets und CI-Workflows.
- Phoenix (Arize): Open-Source-Trace-Tool, integriert mit OpenInference und OpenTelemetry.
- Weights and Biases Weave: Erweiterung von W&B für LLM-Tracing, stärker im ML-Research-Stack verankert.
- Datadog LLM Observability: klassische APM-Plattform mit eigenem LLM-Modul, breiter im Application Monitoring.
- OpenTelemetry direkt: rein offen, aber ohne Evaluations-, Dataset- oder Prompt-Hub-Features.
Weiter im KI-Lexikon
← Zurück zum LexikonHäufige Fragen
Was ist LangSmith?+
LangSmith ist eine hostete Observability- und Evaluations-Plattform von LangChain Inc. für LLM-Anwendungen. Sie sammelt Traces, organisiert Datasets, führt Evaluationen aus, verwaltet Prompts und liefert Monitoring-Dashboards. Die Public Beta startete 2023, die GA-Version folgte im Februar 2024; seither hat sich LangSmith neben LangChain und LangGraph als drittes Standbein des Unternehmens etabliert.
Wer steht hinter LangSmith?+
LangSmith ist ein Produkt von LangChain Inc., der Firma hinter den Open-Source-Bibliotheken LangChain und LangGraph. Gegründet wurde das Unternehmen 2023 in San Francisco, CEO ist Harrison Chase. Anders als LangChain ist LangSmith proprietär, sowohl als Cloud-Service als auch in Self-Hosted-Varianten verfügbar.
Wofür wird LangSmith verwendet?+
Typische Use Cases sind Tracing einzelner LLM-Calls und Agent-Schritte, das Anlegen von Evaluations-Datasets, das Vergleichen von Prompt- oder Modell-Varianten, das Spüren von Regressionen in CI sowie Monitoring von Latenz, Kosten und Fehlern in Produktion. Daneben dient LangSmith als Prompt-Versionierung.
Welche Tracing-Mechanismen gibt es?+
LangSmith unterstützt drei Wege: automatisches Tracing über LangChain und LangGraph, manuelles Tracing über das LangSmith SDK (Python und TypeScript) sowie OpenTelemetry-Ingestion für Non-LangChain-Stacks wie Vercel AI SDK, OpenAI SDK oder Anthropic SDK. Traces enthalten Inputs, Outputs, Tokens, Kosten und Metadata.
Wie funktionieren Evaluationen?+
Evaluationen kombinieren Datasets aus Beispielen mit Evaluators wie LLM-as-Judge, String-Match, Embedding-Similarity oder Custom-Functions. Sie laufen lokal via SDK oder in CI/CD, Ergebnisse werden in LangSmith aggregiert. Pairwise-Vergleiche, Aggregate-Metriken und Regressions-Reports sind Standard.
Was ist der Prompt Hub?+
Der Prompt Hub ist ein zentraler Speicher für Prompt-Templates mit Versionierung, Kollaboration und semantischem Diff. Prompts können öffentlich oder team-intern geteilt, in Code referenziert und über Releases gepinnt werden. Damit lassen sich Prompt-Changes wie Code-Changes reviewen.
Wie verhält sich LangSmith zu Langfuse oder Helicone?+
Langfuse ist Open-Source und stärker im Self-Hosting-Bereich verbreitet, Helicone fokussiert auf einfache Proxy-Integration und Cost-Tracking. LangSmith ist tiefer in das LangChain-Ökosystem integriert und liefert stärkere Evaluations-Features, ist aber proprietär und an LangChain Inc. gebunden.
Welche Datenschutz- und Hosting-Optionen gibt es?+
LangSmith Cloud läuft in EU- und US-Regionen, mit SOC-2-Compliance. Für regulierte Branchen gibt es Self-Hosted-Deployments via Kubernetes mit identischem Feature-Set. PII-Filter, Daten-Retention-Policies und Role-Based Access Control sind in Pro- und Enterprise-Tiers enthalten.
Verwandte Begriffe
Quellen
- LangSmith Documentation (docs.smith.langchain.com)
- LangChain Blog
- LangChain Inc. Whitepapers
Zuletzt geprüft: 2026-07-02