Agentic Relations

Wikidata

Offene, multilinguale Wissensdatenbank der Wikimedia Foundation, die 2026 mit über 110 Millionen Entitäten als zentraler Identitäts- und Faktenanker für das semantische Web und für LLM-Grounding fungiert.

Definition

Wikidata ist die offene, multilinguale Wissensdatenbank der Wikimedia Foundation, die strukturierte Fakten über Entitäten der realen Welt speichert. Sie wurde 2012 gestartet und ist 2026 mit über 110 Millionen Entitäten der grösste offene Knowledge Graph der Welt. Jede Entität ist eindeutig durch eine QID identifiziert, jede Eigenschaft durch eine PID. Beziehungen werden als Aussagen modelliert, ergänzt um Quellen, Qualifikatoren und Ranks.

Im Unterschied zu Wikipedia, die für menschliche Leser optimiert ist, ist Wikidata für maschinelle Verarbeitung gebaut. Die Daten sind sprachneutral abgelegt, mit Übersetzungen der Labels in über 300 Sprachen. Diese Architektur macht Wikidata zum bevorzugten Identitäts- und Grounding-Anker für Suchmaschinen, Knowledge Panels und Sprachmodelle.

Struktur und Mechanismus

Wikidata folgt einem strikten Datenmodell, das auf RDF aufsetzt, aber durch Qualifikatoren und Quellen über klassisches RDF hinausgeht:

  • Items: Entitäten der realen Welt, identifiziert durch QIDs wie Q937 für Albert Einstein.
  • Properties: Eigenschaftstypen, identifiziert durch PIDs wie P31 für instance_of oder P569 für date_of_birth.
  • Statements: Aussagen über ein Item, bestehend aus Property und Wert, beispielsweise Q937 P569 1879-03-14.
  • Qualifiers: Zusatzinformationen zu Statements, etwa zeitliche Gültigkeit oder Rolle.
  • References: Quellen, die ein Statement belegen. Eine Aussage ohne Quelle ist weniger vertrauenswürdig.
  • Ranks: Kennzeichnung als preferred, normal oder deprecated, etwa bei mehreren konkurrierenden Werten.

Das Datenmodell wird über die Wikibase-Software bereitgestellt, die als Open Source verfügbar ist. Wikidata exportiert seine Daten zusätzlich als RDF-Dumps und über einen SPARQL-Endpoint, was Integration in beliebige Knowledge-Graph-Pipelines erlaubt.

Praxis und Anwendung

Wikidata erfüllt 2026 mehrere zentrale Funktionen im digitalen Ökosystem:

  • Identitätsanker: Marken, Personen und Organisationen nutzen ihre Wikidata-QID als kanonische Identität, verlinkt über Schema.org sameAs.
  • LLM-Grounding: Wikidata ist Teil der Trainingsdaten grosser Sprachmodelle und ein wichtiger Knoten im Knowledge-Graph-Ökosystem; zur Antwortzeit konsultieren LLMs es jedoch nicht als Faktenbasis.
  • Knowledge Panels: Google, Bing und DuckDuckGo speisen ihre Antwortboxen direkt aus Wikidata.
  • Forschung: Wikidata liefert die Faktenbasis für bibliometrische, biografische und geografische Forschung.
  • Bibliotheken und Museen: GLAM-Institutionen verknüpfen Sammlungen über Wikidata, was Discovery und Linked Open Data ermöglicht.
  • Eigene Knowledge Graphs: Unternehmen betreiben Wikibase-Instanzen, die mit Wikidata-QIDs verknüpft sind.

Eine typische Pipeline für Citation Infrastructure sieht so aus. Erstens identifiziert das Unternehmen die eigene Wikidata-QID. Zweitens werden alle relevanten Statements ergänzt, etwa Gründungsdatum, Hauptsitz, offizielle Website. Drittens wird auf der eigenen Website Schema.org-Markup mit sameAs-Verweis auf die QID hinterlegt. Damit ist die Brücke zwischen offenem Web und Knowledge Graph geschlossen.

Häufige Fehler

  • Notability verletzen: Selbstdarsteller-Items für irrelevante Personen oder Firmen werden gelöscht. Notability muss extern belegt sein.
  • Aussagen ohne Quellen: Statements ohne References sind technisch erlaubt, aber praktisch wertlos für Audits und Vertrauensbildung.
  • Sprachgebundene Labels statt sprachneutraler QIDs: Wer in Statements englische Strings statt QIDs verwendet, bricht das Datenmodell.
  • Duplikate erzeugen: Vor dem Anlegen einer neuen Entität ist Pflicht, mit Wikidata-Suche und externen Identifiern auf Existenz zu prüfen.
  • Property-Missbrauch: Properties haben strikte Constraints, etwa instance_of P31 erwartet eine Klasse, nicht eine Person.
  • Fehlende eigene sameAs-Verknüpfung: Ohne sameAs-Property auf der eigenen Website bleibt die Brücke zwischen Marke und QID unsichtbar.

Abgrenzung

  • Wikipedia: Volltext-Enzyklopädie für Menschen, Wikidata ist die zugehörige strukturierte Datenbank.
  • DBpedia: extrahiert Fakten aus Wikipedia-Infoboxen, Wikidata wird hingegen direkt redaktionell gepflegt.
  • Google Knowledge Graph: proprietäre, geschlossene Datenbank, Wikidata ist offen und unter CC0 lizenziert.
  • Schema.org: Vokabular für Markup, Wikidata ist eine konkrete Wissensdatenbank, die mit Schema.org verknüpft ist.
  • Wikibase: die Software, auf der Wikidata läuft, kann aber für eigene Instanzen unabhängig betrieben werden.
  • Freebase: historische Wissensdatenbank von Google; die Einstellung wurde 2014 angekündigt, abgeschaltet wurde Freebase im Mai 2016, die Migration nach Wikidata gelang nur teilweise.

Weiter im KI-Lexikon

← Zurück zum Lexikon

Häufige Fragen

Was ist Wikidata?+

Wikidata ist eine kollaborativ gepflegte, mehrsprachige Wissensdatenbank der Wikimedia Foundation. Sie speichert strukturierte Fakten über Personen, Orte, Organisationen, Werke und Konzepte als Aussagen mit Quellen und Qualifikatoren. 2026 enthält Wikidata über 110 Millionen Entitäten und ist die zentrale offene Identitätsbasis des Webs.

Wie unterscheidet sich Wikidata von Wikipedia?+

Wikipedia ist eine Volltext-Enzyklopädie für Menschen, Wikidata ist eine strukturierte Datenbank für Maschinen. Wikipedia-Artikel beschreiben Albert Einstein in Fliesstext, Wikidata speichert dieselben Fakten als Triples: Q937 (Einstein) place_of_birth Q3012 (Ulm). Beide Projekte ergänzen sich, viele Wikipedia-Infoboxen ziehen heute aus Wikidata.

Was ist eine QID?+

Eine QID ist die eindeutige Wikidata-Kennung für eine Entität, beispielsweise Q937 für Albert Einstein oder Q39 für die Schweiz. QIDs sind sprachneutral und stabil, was sie zum De-facto-Standard für Entity-Linking macht. Eigenschaften haben PIDs (z. B. P31 für instance_of), Werte können wiederum QIDs, Literale oder externe Identifier sein.

Warum ist Wikidata für LLMs wichtig?+

Wikidata fliesst in die Trainingsdaten grosser Sprachmodelle ein und ist ein wichtiger Knoten im Knowledge-Graph-Ökosystem — zur Antwortzeit konsultieren LLMs es aber nicht als Faktenbasis. Wer seine eigene Marke, Person oder Organisation via sameAs-Property an eine Wikidata-QID anbindet, signalisiert Crawlern und LLMs eindeutige Identität. Ohne Wikidata-Anker bleibt Content für Sprachmodelle mehrdeutig und schwerer zitierbar.

Wie frage ich Wikidata ab?+

Wikidata bietet einen öffentlichen SPARQL-Endpoint unter query.wikidata.org. Damit lassen sich komplexe Abfragen formulieren, etwa alle Frauen, die einen Nobelpreis für Physik erhielten und in der Schweiz geboren wurden. Zusätzlich existieren REST-APIs für einzelne Entitäten und das Wikibase-Datenmodell für eigene Instanzen.

Was ist Wikibase?+

Wikibase ist die Open-Source-Software, auf der Wikidata läuft. Organisationen können eigene Wikibase-Instanzen betreiben, um interne Knowledge Graphs aufzubauen, die strukturell kompatibel zu Wikidata sind. Beispiele sind Rhizome, FactGrid und die Deutsche Nationalbibliothek, die Wikibase als Backbone nutzen.

Wie kommt eine Entität auf Wikidata?+

Jede Person kann nach Anmeldung Entitäten anlegen, sofern sie das Notability-Kriterium erfüllen. Notability bedeutet entweder einen bestehenden Wikipedia-Artikel, eine strukturelle Rolle (z. B. in einer Referenzdatenbank) oder belegte öffentliche Relevanz. Anlegen erfolgt im Wikidata-UI oder via QuickStatements und OpenRefine für Bulk-Imports.

Welche Lizenz hat Wikidata?+

Wikidata steht unter CC0, der maximal offenen Lizenz ohne Urheberrechtsanspruch. Daten dürfen ohne Einschränkung kopiert, modifiziert und kommerziell genutzt werden. Diese Lizenz ist einer der Gründe, warum Wikidata sich als gemeinsame Faktenbasis vieler Anbieter, von Google bis Anthropic, etabliert hat.

Verwandte Begriffe

Quellen

  • Wikimedia Foundation
  • W3C RDF Specification
  • Wikidata SPARQL Endpoint

Wikidata: Q2013 · Zuletzt geprüft: 2026-07-02