Digital resources in the Social Sciences and Humanities OpenEdition Our platforms OpenEdition Books OpenEdition Journals Hypotheses Calenda Libraries OpenEdition Freemium Follow us

Firmin Forster: Lost in Noise? Perspektiven auf Datenqualität auf der DHNB 2026

      „Aus Mangel ist Überfluss geworden.“

Mit diesen Worten eröffnet Kristoffer Nielbo, Professor und Direktor des Center for Humanities Computing (CHC) der Universität Aarhus, die Tagung der Digital Humanities in the Nordic and Baltic Countries (DHNB) im März 2026 in Aarhus. Zahlreiche Digitalisierungsprojekte der letzten Jahrzehnte haben zu einer Fülle an digitalem Material im Bereich des kulturellen Erbes geführt, so Nielbo weiter, die nun Forschungsrichtungen ermöglicht, die noch vor wenigen Jahren undenkbar waren, und den Blick auf einen viel weiteren kulturellen Horizont eröffnet. Dabei spielen Archive eine zentrale Rolle, die Nielbo als Ergebnis früherer archivalischer Entscheidungen versteht. Diese Entscheidungen lassen sich auch durch die Digitalisierung nicht rückgängig machen. Zugleich bringt diese Fülle eine neue Herausforderung mit sich: darin verloren zu gehen – im Motto der Tagung zusammengefasst: „Lost in Abundance“.

Umso mehr spielen die Datenqualität und Repräsentativität dieser Daten eine zentrale Rolle. Nicht alle Informationen, die digital vorliegen, sind gleichermaßen aussagekräftig und bergen zudem viel Rauschen und viele Unschärfen; sie lassen sich mit dem englischen Ausdruck als Noise charakterisieren. Die Fülle an Noise prägt den Alltag mit digitalen Daten. Zum Umgang damit fand im Rahmen der DHNB 2026 der Workshop Lost in Noise? Data Quality and Representativeness in Cultural Heritage Collections statt, an dem ich dank des Early Career Travel Grant von 4Memory teilnehmen und eigene Ergebnisse präsentieren konnte (dazu unten mehr). Der Workshop brachte Interessierte aus Wissenschaft und aus GLAM-Institutionen zusammen, um gemeinsam über den Umgang mit Noise anhand verschiedener Fallbeispiele zu diskutieren.

Repräsentativität in digitalen Archiven (Eetu Mäkelä)

Eetu Mäkelä, Professor an der Universität Helsinki, untersucht die Repräsentativität digitaler Archive.1 Bei seinem Vergleich eines digitalen Archivs frühneuzeitlicher englischer Drucke (Early English Books Online (EEBO)) mit dem English Short Title Catalogue (ESTC), einem umfassenden Verzeichnis überlieferter Drucke, konnte er zwar eine hohe Abdeckung anhand verschiedener Kriterien feststellen; bei genauerem Hinsehen zeigen sich jedoch verschiedene Unterrepräsentationen. So sind beispielsweise lateinische Texte und Autoren weniger stark vertreten, was deren Einfluss auf die englische Literatur verschleiert.

Deshalb betont Mäkelä die Wichtigkeit, die Zusammenstellung digitaler Archive kritisch zu hinterfragen: „If you take any collection at face value you’ll likely be wrong.“ Damit machte er deutlich, dass statistische Auswertungen stets die Repräsentativität der Datengrundlage berücksichtigen müssen – und dazu ist es nötig zu wissen, in welcher Weise die Daten verzerrt sind

Inkonsistenzen in Linked Open Data (Eero Hyvönen)

SampoSampo (https://samposampo.fi/) ist ein Service, der Linked Open Data zusammenbringt.2 Das in Finnland entwickelte Projekt vernetzt zahlreiche auf Finnland bezogene Datenquellen mit weiteren, international verbreiteten Normdatenbanken wie Wikidata. Der Anspruch des Projekts wird bereits im Untertitel Connecting Everything to Everything Else deutlich: Es will eine übergreifende Datenquelle sein, steht dabei jedoch durch die vielfältigen und verschiedenartigen Beschaffenheiten der Daten vor Herausforderungen.

„I was amazed how many different opinions exist“, berichtet Eero Hyvönen, Professor an der Aalto Universität in Helsinki und Leiter des Projekts. Er verweist darauf, dass im Online-Portal ein eigener Filter implementiert wurde, mit dem nach Inkonsistenzen gefiltert werden kann. Zudem werden in der Detailansicht widersprüchliche Informationen nebeneinander angezeigt und visuell hervorgehoben. Die durchgängige Angabe von Quellen für die jeweiligen Informationen ist positiv hervorzuheben und erleichtert die Nachvollziehbarkeit. Hyvönen verdeutlicht dies am Beispiel von Mikael Agricola: Für den Begründer der finnischen Schriftsprache sind in SampoSampo zwei verschiedene Geburtsdaten (22. Dezember 1509 und 1510) sowie drei Sterbedaten (1557, 30. März 1557, 9. April 1557) zusammen mit allen Quellenangaben (etwa BiographySampo, BookSampo, aber auch Wikipedia und Wikidata) angegeben. Die wahrscheinlichste, weil durch die meisten Quellen bezeugte, Information wird in schwarzer Schrift angezeigt, die am seltensten bezeugte Information wird rot hervorgehoben.

Offenheit und Community-basierte Datenbereinigung (Merete Sanderhoff)

Die Offenheit und der öffentliche Zugang zu den vorhandenen Daten sind auch für Museen und Galerien zentral, wie Merete Sanderhoff, Kuratorin der Nationalgalerie in Dänemark, betont. Die Nationalgalerie, kurz SMK, hat ihren kompletten Bestand im Rahmen von SMK Open online öffentlich zur Verfügung gestellt. So wird es für die Öffentlichkeit erstmals möglich, alle 260.000 Objekte der SMK einzeln zu betrachten. Die Zugänglichkeit geht dabei über die traditionelle Metadaten-Suche hinaus, indem bei der Suche ähnliche Schreibweisen vorgeschlagen werden oder nach Farb- und Helligkeitswerten gesucht werden kann. Diese Offenheit der Daten zeigt sich auch in der CC0-Lizenz, die es erlaubt, die Werke ohne Einschränkungen zu verwenden.

Diese Offenheit bedeutet aber auch, alle Daten so zu zeigen, wie sie sind: unvollständig, uneindeutig, teils auch falsch. Hier setzt die SMK auf einen Community-basierten Ansatz, um den Fehlern und Unschärfen zu begegnen. Jeder Datensatz verfügt über die Möglichkeit, Fehler direkt an die SMK zu melden und so aktiv zur Datenbereinigung beizutragen. Erste Erfahrungen damit sind erfolgsversprechend: So konnten bereits falsch zugeordnete Bilddateien identifiziert und korrigiert werden.

Unschärfen in musealen Sammlungsdaten (Firmin Forster)

In meiner eigenen wissenschaftlichen Arbeit beschäftige ich mich ebenfalls mit Unschärfen in musealen Daten. Ausgehend von einem Hackathon der Staatsbibliothek zu Berlin3 habe ich mich im Rahmen meines Masterstudiums Digital Humanities mit Sammlungsdaten des Ethnologischen Museums in Berlin beschäftigt. Dabei interessierte mich besonders die räumliche und zeitliche Dimension der Sammlungsinteressen des Museums.4

Dazu habe ich geographische Informationen zu den Sammelgebieten verschiedener Personen und Körperschaften mit Bezug zum Museum mit Wikidata abgeglichen, um Koordinaten für eine anschließende Visualisierung zu gewinnen. Aufgrund der verschiedenen Präzisionsgrade der Ortsbezeichnungen wählte ich eine Heatmap, um eine einheitliche Darstellung zu gewährleisten.

Die Sammlungsdaten des Ethnologischen Museums zeichnen sich durch zahlreiche Unschärfen und Biases aus, was die digitale Verarbeitung und Visualisierung vor erhebliche Herausforderungen stellt. In meinem Vortrag mit dem Titel „What is not counted becomes invisible“. Navigating Uncertainties in Museum Collection Data – the Example of the Ethnological Museum Berlin fokussierte ich mich, auch im Sinne von Eetu Mäkelä, auf verschiedene Arten von Unschärfen.5 Der koloniale Kontext, in dem die Daten ursprünglich entstanden sind (pre-existing bias), spielt dabei ebenso eine Rolle wie die digitalen Methoden zur Datenverarbeitung, besonders hinsichtlich der systematischen Verzerrung durch technische Systeme (technical bias).6

Geisteswissenschaftliche Daten sind geprägt von verschiedenen Arten von Unschärfen, wie Conroy et al. 2024 herausgearbeitet haben.7 Diese konnte ich auch in den Daten des Ethnologischen Museums fassen. Die Ortsbezeichnung Bali ist ein Beispiel für einen mehrdeutigen Wert: Bei Bali handelt es sich zum einen um eine Insel bzw. Provinz in Indonesien, zum anderen aber auch um ein Stadtviertel und ein ehemaliges Königreich im heutigen Kamerun; im Kontext des deutschen Kolonialismus sind beide Ortsangaben plausibel, weshalb sich eine Zuordnung nicht automatisieren lässt, sondern kontextabhängig erfolgen muss.

Bei unpräzisen Werten handelt es sich um Angaben, die nicht falsch sind, aber deren Granularität variiert, wodurch ein Vergleich nur eingeschränkt möglich ist. Als Sammelgebiet einiger Personen ist der Kontinent „Afrika“ angegeben (Dr. Perper oder Marcell Zelasko), bei anderen Personen sind es einzelne Städte, etwa Tunis (Richard Fuchs). Bei diesen Angaben handelt es sich nicht um faktisch falsche Informationen, sondern um Werte von unterschiedlichen Präzisionsgraden, was die visuell einheitliche Darstellung auf einer Karte erschwert. Dafür habe ich die Verwendung einer Heatmap vorgeschlagen, die durch die Angabe eines Radius den Einflussbereich einzelner Punkte harmonisiert. Dadurch treten bei Punktehäufungen Cluster deutlicher hervor, die die Sammelinteressen des Museums darstellen.

Beim Abgleich mit Wikidata habe ich – ungewollt, aber kaum zu vermeiden – durch falsche Zuordnungen auch Fehler gemacht. Durch den Ansatz des Distant Viewing fallen einzelne, falsch zugeordnete Angaben nicht allzu sehr ins Gewicht. Auch fehlende Werte führen zu einer Verzerrung der Ergebnisse. Im Fall des Ethnologischen Museums ist nur etwa 25 % der Entitäten (950 von 3.872) ein Sammelgebiet zugeordnet. Damit bleiben drei Viertel in der Visualisierung unsichtbar.

Fazit: Someone‘s Noise is someone else‘s data

Im Kontext von Data Feminism schreiben D’Ignazio und Klein treffend: „What is not counted […] becomes invisible.“8 Anknüpfend daran konnte ich mit meinem Vortrag ein Bewusstsein für Datenlücken und die Einschränkungen durch technische Systeme schaffen. Weitergehend verstehe ich Unschärfen in den Sammlungsdaten als Untersuchungsgegenstand, der Einblicke in die historische Wahrnehmung räumlicher Unschärfe gibt.

In diesem Sinne lässt sich auch das Ergebnis des Workshops Lost in Noise verstehen: Die Vorträge und Diskussionen haben verschiedene, komplementäre Perspektiven zum Umgang mit Noise in den Daten deutlich gemacht. Während Eetu Mäkelä dafür plädiert, die Repräsentativität digitaler Archive kritisch zu hinterfragen, steht bei Eero Hyvönen und SampoSampo die Transparenz über Mehrdeutigkeiten in Linked Open Data im Fokus. Die Nationalgalerie in Dänemark vertritt mit SMK Open einen Ansatz der Offenheit, um Datenlücken und Fehlern zu begegnen, und bei den Sammelinteressen des Ethnologischen Museums Berlin habe ich eine Kombination aus Normdaten und GIS gewählt, um verschiedene Präzisionsgrade einheitlich visualisieren zu können. Der Workshop hat verschiedene Ebenen im Umgang mit Noise besprochen: von Reflexion und Transparenz über Offenheit bis hin zu Visualisierung. Dadurch wurde deutlich, dass verrauschte Daten nicht mehr nur eine Herausforderung für wissenschaftliche Forschungen sind, sondern auch zum Untersuchungsgegenstand selbst werden können. Dr. Alie Lassche, Chair des Workshops und Postdoc am CHC, fasst zusammen: „Someone‘s noise is someone else‘s data.“

Die Teilnahme an der DHNB 2026 und insbesondere am Workshop Lost in Noise war für mich eine wertvolle Erfahrung, die mir die Möglichkeit geboten hat, am Ende meines Masterstudiums mit eigenen Ergebnissen in den Dialog mit der internationalen Fachcommunity zu treten. Die Vernetzung mit Forschenden und Mitarbeitenden an GLAM-Einrichtungen über den deutschsprachigen Raum hinaus hat mir die Relevanz meiner eigenen Forschung und die Dringlichkeit eines reflektierten Umgangs mit Noise in geisteswissenschaftlichen Daten noch deutlicher bewusst gemacht: Die Fragen, die ich am Beispiel des Ethnologischen Museums bearbeite, sind keine Einzelfälle, sondern stehen im Zentrum breiter methodischer Diskussionen in den Digital Humanities, denen ich mich auch über mein Masterstudium hinaus widmen möchte.


Firmin Forster ist Masterabsolvent der Digital Humanities. Er studierte im Bachelor Klassikstudien an der Universität Regensburg, gefolgt von einem Masterstudium der Historischen Wissenschaften im Schwerpunkt Digital History und Digital Humanities an den Universitäten Passau und Göttingen. Während seines Studiums beschäftigte er sich intensiv mit Unschärfen in Erwerbungsdaten des Ethnologischen Museums in Berlin. Seine Ergebnisse zu den Sammelinteressen des Museums präsentierte er dank des NFDI4Memory Early Career Travel Grant auf der DHNB 2026 in Aarhus.

Forster ist als studentische Hilfskraft in der DFG-geförderten Forschungsgruppe STRATA zur Erforschung mythischer Stoffe tätig und übernimmt dort neben Recherchetätigkeiten besonders die Bearbeitung der projektinternen Mythos-Datenbank. Zudem war er am Institut für Digital Humanities der Universität Göttingen beschäftigt. Dort war er für die Annotation griechischer Vasenbilder zum Training eines künstlichen neuronalen Netzes zuständig, hat Workflows zur Datenbereinigung in Python entwickelt und eine Webseite zur digitalen Bildanalyse gestaltet. Seine Forschungsschwerpunkte liegen in den Unschärfen historischer Daten, die er nicht (nur) als technische Herausforderungen, sondern als geisteswissenschaftlichen Untersuchungsgegenstand begreift, sowie in der digitalen Bildverarbeitung und -analyse.

Die Konferenzteilnahme wurde durch einen Early Career Travel Grant der Task Area Data Culture des Konsortiums NFDI4Memory gefördert.


  1. Mäkelä, E., Misson, J., Singh, D., & Tolonen, M. (2026). Opening the black box of EEBO. Digital Scholarship in the Humanities41(1), 236–254. https://doi.org/10.1093/llc/fqaf086. ↩︎
  2. Hyvönen, E., Ahola, A., Leskinen, P., & Tuominen, J. (2026). Connecting everything to everything else in a cloud of cultural heritage knowledge graphs: SampoSampo data linking service and semantic portal (abstract). Infrastructures to reassemble data scattered across domains, borders and media: an encounter between researchers and memory organisations, workshop at DHNB-2026. DHNB 2026. ↩︎
  3. Forster, F., Goswami Choudhury, P., Süberkrüb, K., & Ziegler-Efimova, E. (2026, Januar 19). Uncertainties in the Archives. SBB Aktuell. Das Blog-Netzwerk der Staatsbibliothek zu Berlin – Beiträge für Forschung Und Kulturhttps://blog.sbb.berlin/uncertainties-in-the-archives/. ↩︎
  4. GitHub – uncertainguineapick/ethnologisches-museum-berlin-sammelinteressen: Datenbasis für die GIS-basierte Analyse der Sammelinteressen des EM Berlin · GitHub. ↩︎
  5. Link zu den Folien der Präsentation: https://doi.org/10.5281/zenodo.19629975. ↩︎
  6. Friedman, B., & Nissenbaum, H. (1996). Bias in Computer Systems. ACM Transactions on Information Systems, 14(3), 330–347 . https://doi.org/10.1145/230538.230561. ↩︎
  7. Conroy, M., Gillmann, C., Harvey, F., Mchedlidze, T., Fabrikant, S. I., Windhager, F., Scheuermann, G., Tangherlini, T. R., Warren, C. N., Weingart, S. B., Rehbein, M., Börner, K., Elo, K., Jänicke, S., Kerren, A., Nöllenburg, M., Dwyer, T., Eide, Ø., Kobourov, S., & Betz, G. (2024). Uncertainty in Humanities Network Visualization. Frontiers in Communication8, 1–10. https://doi.org/10.3389/fcomm.2023.1305137. ↩︎
  8. D’Ignazio, C., & Klein, L. F. (2020). Data Feminism. The MIT Press, S. 97. https://doi.org/10.7551/mitpress/11805.001.0001. ↩︎

Digital History Berlin (Redaktion)
Digital History Berlin (Redaktion)

OpenEdition schlägt Ihnen vor, diesen Beitrag wie folgt zu zitieren:
Digital History Berlin (Redaktion) (13. Mai 2026). Firmin Forster: Lost in Noise? Perspektiven auf Datenqualität auf der DHNB 2026. Digital History Berlin. Abgerufen am 15. September 2026 von https://doi.org/10.58079/167ni


Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

This site uses Akismet to reduce spam. Learn how your comment data is processed.