Agentic Relations

LangSmith

Hostete Observability- und Evaluations-Plattform für LLM-Anwendungen von LangChain Inc., die Tracing, Datasets, Evaluationen, Prompt-Hub und Monitoring in einem Stack vereint und sich 2026 als verbreitetes Tool für produktive LLM-Stacks etabliert hat.

Definition

LangSmith ist eine hostete Plattform für Observability, Evaluation und Prompt-Management von LLM-Anwendungen. Sie wird von LangChain Inc. entwickelt, der Firma hinter den Open-Source-Bibliotheken LangChain und LangGraph. Die erste Public Beta startete 2023, die GA-Version folgte Anfang 2024, und 2026 zählt LangSmith zu den meistgenutzten Tools im Bereich LLM-Ops.

Im Unterschied zu klassischer Application Observability ist LangSmith auf LLM-Spezifika ausgerichtet: Tracing einzelner Prompts und Tool-Calls, Token- und Kostenmetriken, Evaluator-Frameworks, Prompt-Versionierung, Dataset-Management und Human-Feedback-Workflows. Das Tool ist proprietär und sowohl als Cloud-Service als auch in Self-Hosted-Varianten verfügbar.

Architektur und Features

LangSmith besteht aus mehreren Schichten:

  • Tracing: detaillierte Spans pro LLM-Call, Retrieval-Schritt oder Tool-Call, mit Inputs, Outputs, Tokens, Latenz und Kosten.
  • Datasets: kuratierte Sammlungen von Beispielen mit Input-Output-Paaren, geeignet für Regressions- und Vergleichstests.
  • Evaluations: Evaluator-Funktionen, LLM-as-Judge, String-Match, Embedding-Similarity, Custom-Code, Pairwise-Vergleiche.
  • Prompt Hub: versionierte Prompt-Templates mit Variablen, Releases und Diff.
  • Annotations: Human-Feedback-Workflows mit Inline-Kommentaren, Rating, Tagging.
  • Monitoring: Dashboards für Production-Traffic, Fehlerraten, Latenz, Token-Volumen, Kosten pro Feature.
  • Alerting: Schwellenwert-basierte Benachrichtigungen via Slack, E-Mail oder Webhook.
  • Playground: interaktives Experimentieren mit Prompts und Modellen, direkter Transfer in Datasets.
  • OpenTelemetry-Ingestion: Anbindung von Non-LangChain-Stacks wie Vercel AI SDK, OpenAI SDK oder Anthropic SDK.

Die Datenhaltung ist projektbezogen, mit Workspaces, Teams und Rollen. Für regulierte Umgebungen gibt es Self-Hosted-Deployments via Helm-Chart auf Kubernetes.

Praxis und Anwendung

Typische Anwendungsfelder:

  • Tracing in Produktion: jede LangChain-, LangGraph- oder LangSmith-instrumentierte Anwendung sendet Traces, die im Detail nachvollziehbar sind.
  • Debugging komplexer Agents: mehrstufige Tool-Use-Loops sind ohne Trace praktisch nicht debugbar, LangSmith zeigt jeden Schritt mit Inputs und Outputs.
  • Regressionstests in CI: Datasets dienen als Goldstandard, Evaluations laufen pro Commit und schlagen bei Verschlechterung Alarm.
  • Prompt-Tuning: Pairwise-Vergleiche zweier Prompt-Versionen mit denselben Beispielen, Aggregat-Metriken über Datasets.
  • Modell-Migrationen: Vergleich Claude vs. GPT-5 vs. Gemini auf realen Traces, datengetriebene Entscheidung.
  • Annotations und Human Feedback: Domain-Experten reviewen Traces, vergeben Labels, daraus entstehen neue Datasets.
  • Cost-Allocation: Kostenmetriken pro Feature, Kunde oder Modell, sauber zugeordnet via Metadata.
  • Prompt-Hub-Workflows: Prompts werden zentral gepflegt, Apps laden eine bestimmte Version per Pinned Tag.

Erfahrene Teams etablieren typischerweise eine kleine Set an Goldstandards-Datasets, ein paar LLM-as-Judge-Evaluators und ein Monitoring-Dashboard, das die wichtigsten Health-Metriken zeigt.

Häufige Fehler

  • Alles tracen: Standardprojekte produzieren riesige Trace-Volumen, Sampling und Filter sind nötig.
  • LLM-as-Judge ungeprüft vertrauen: Judge-Modelle haben eigene Biases, sie müssen gegen Human Labels kalibriert werden.
  • Datasets nicht kuratieren: Datasets müssen aktiv gepflegt werden, sonst spiegeln sie veraltete Anforderungen.
  • PII in Traces: ohne Redaktion landen sensible Daten in Logs, PII-Filter und Hashing einsetzen.
  • Self-Hosted unterschätzt: Self-Hosting bringt Compliance, kostet aber Ops-Aufwand für Postgres, Redis und Kubernetes.
  • Prompt Hub als Code-Ersatz: Prompts gehören in einen Review-Workflow, nicht in eine UI-only-Welt ohne Tests.
  • Evaluations nur einmalig: Evaluations müssen Teil von CI sein, sonst verfallen sie als Theaterstück.

Abgrenzung

  • Langfuse: Open-Source-Konkurrent mit starkem Self-Hosting-Profil und ähnlichem Feature-Set.
  • Helicone: Proxy-basiertes Observability-Tool mit Fokus auf Cost-Tracking und einfacher Integration.
  • Braintrust: Evaluations-fokussierte Plattform mit Fokus auf Datasets und CI-Workflows.
  • Phoenix (Arize): Open-Source-Trace-Tool, integriert mit OpenInference und OpenTelemetry.
  • Weights and Biases Weave: Erweiterung von W&B für LLM-Tracing, stärker im ML-Research-Stack verankert.
  • Datadog LLM Observability: klassische APM-Plattform mit eigenem LLM-Modul, breiter im Application Monitoring.
  • OpenTelemetry direkt: rein offen, aber ohne Evaluations-, Dataset- oder Prompt-Hub-Features.

Weiter im KI-Lexikon

← Zurück zum Lexikon

Häufige Fragen

Was ist LangSmith?+

LangSmith ist eine hostete Observability- und Evaluations-Plattform von LangChain Inc. für LLM-Anwendungen. Sie sammelt Traces, organisiert Datasets, führt Evaluationen aus, verwaltet Prompts und liefert Monitoring-Dashboards. Die Public Beta startete 2023, die GA-Version folgte im Februar 2024; seither hat sich LangSmith neben LangChain und LangGraph als drittes Standbein des Unternehmens etabliert.

Wer steht hinter LangSmith?+

LangSmith ist ein Produkt von LangChain Inc., der Firma hinter den Open-Source-Bibliotheken LangChain und LangGraph. Gegründet wurde das Unternehmen 2023 in San Francisco, CEO ist Harrison Chase. Anders als LangChain ist LangSmith proprietär, sowohl als Cloud-Service als auch in Self-Hosted-Varianten verfügbar.

Wofür wird LangSmith verwendet?+

Typische Use Cases sind Tracing einzelner LLM-Calls und Agent-Schritte, das Anlegen von Evaluations-Datasets, das Vergleichen von Prompt- oder Modell-Varianten, das Spüren von Regressionen in CI sowie Monitoring von Latenz, Kosten und Fehlern in Produktion. Daneben dient LangSmith als Prompt-Versionierung.

Welche Tracing-Mechanismen gibt es?+

LangSmith unterstützt drei Wege: automatisches Tracing über LangChain und LangGraph, manuelles Tracing über das LangSmith SDK (Python und TypeScript) sowie OpenTelemetry-Ingestion für Non-LangChain-Stacks wie Vercel AI SDK, OpenAI SDK oder Anthropic SDK. Traces enthalten Inputs, Outputs, Tokens, Kosten und Metadata.

Wie funktionieren Evaluationen?+

Evaluationen kombinieren Datasets aus Beispielen mit Evaluators wie LLM-as-Judge, String-Match, Embedding-Similarity oder Custom-Functions. Sie laufen lokal via SDK oder in CI/CD, Ergebnisse werden in LangSmith aggregiert. Pairwise-Vergleiche, Aggregate-Metriken und Regressions-Reports sind Standard.

Was ist der Prompt Hub?+

Der Prompt Hub ist ein zentraler Speicher für Prompt-Templates mit Versionierung, Kollaboration und semantischem Diff. Prompts können öffentlich oder team-intern geteilt, in Code referenziert und über Releases gepinnt werden. Damit lassen sich Prompt-Changes wie Code-Changes reviewen.

Wie verhält sich LangSmith zu Langfuse oder Helicone?+

Langfuse ist Open-Source und stärker im Self-Hosting-Bereich verbreitet, Helicone fokussiert auf einfache Proxy-Integration und Cost-Tracking. LangSmith ist tiefer in das LangChain-Ökosystem integriert und liefert stärkere Evaluations-Features, ist aber proprietär und an LangChain Inc. gebunden.

Welche Datenschutz- und Hosting-Optionen gibt es?+

LangSmith Cloud läuft in EU- und US-Regionen, mit SOC-2-Compliance. Für regulierte Branchen gibt es Self-Hosted-Deployments via Kubernetes mit identischem Feature-Set. PII-Filter, Daten-Retention-Policies und Role-Based Access Control sind in Pro- und Enterprise-Tiers enthalten.

Verwandte Begriffe

Quellen

  • LangSmith Documentation (docs.smith.langchain.com)
  • LangChain Blog
  • LangChain Inc. Whitepapers

Zuletzt geprüft: 2026-07-02