Titel: Natural Language Processing in Large-Scale Text Collections for the Digital Humanities & Computational Social Science
Sprache: Englisch
Autor*in: Petersen-Frey, Fynn
Schlagwörter: natural language processing; quotation detection; coreference resolution; research software engineering
GND-Schlagwörter: InformatikGND
SprachverarbeitungGND
Maschinelles LernenGND
Software EngineeringGND
Digital HumanitiesGND
Computational social scienceGND
Erscheinungsdatum: 2026
Tag der mündlichen Prüfung: 2026-06-23
Zusammenfassung: 
Humans and machines produce ever-growing amounts of data, including text written in natural languages, at an increasing rate every day. In the Digital Humanities (DH) and Computational Social Science (CSS), the sheer amount of textual data is impossible to work through manually. For example, when analyzing the effects of climate change on societies, researchers have to analyze a variety of text types in large quantities such as news articles, (non-)governmental reports, law texts, regulations, contracts, and social media data. Thus, automation with natural language processing (NLP) is essential to deal with large-scale text collections. The DH are an interdisciplinary area of research combining humanities and computer science by applying computational methods to humanities research, often using computing methods to produce large-scale digital text collections or analyze them to gain an understanding of the researched phenomenon. CSS is an interdisciplinary field at the intersection of social science and computer science that tests and develops scientific theories about human behavior by applying computational methods on large, often textual data from the internet. NLP is a subfield of computer science that deals with the processing of natural language by computers, and is nowadays closely connected with machine learning (ML) and artificial intelligence (AI). NLP approaches have been applied to many DH or CSS use cases by supporting the exploration and analysis of textual data at scale, but require integration into easily applicable software to make them accessible to domain experts. Although NLP has seen groundbreaking success with pre-trained language models (PLMs) and large language models (LLMs), this development is often not reflected in DH or CSS to the same degree due to black-box behavior, limited applicability, or lacking availability in ready-to-use software. To improve this situation, this dissertation has the goal to bring state-of-the-art NLP methods for large-scale text collections to DH and CSS. First, we review available NLP-assisted research tools and methods for DH and CSS. Second, we develop novel NLP methods based on neural PLMs that are broadly applicable in many DH and CSS contexts; to assist researchers with large-scale text collections to answer their research questions. Third, we develop a suitable research platform architecture, implement necessary key functionalities, and integrate the NLP methods into the user-friendly research platform. We describe methods using PLMs and their contextualized word embeddings to improve semantic similarity search for DH, detect and attribute quotations, perform coreference resolution in German, and semi-automatically scale manual annotations. First, we present a configurable similarity search providing insights into which aspects of documents are similar, and a method to search for sub-sentence text spans using semantic search as a modern alternative to KWIC (Key Word in Context). Second, we work on quotation detection and attribution by creating a new manually annotated dataset, and develop a novel ML model performing high-quality quotation detection and attribution with vast improvements over other systems. Third, we present two neural coreference resolution models for German that improve substantially on previous systems while being computationally efficient even for long documents. Last, we show a way to semi-automatically scale manual annotations to large corpora by designing a suitable user interface and developing an interactive annotation method based on contextualized word embeddings and 𝑘-nearest neighbors.

Täglich werden immer größere Datenmengen, wie beispielsweise Texte in natürlicher Sprache, mit steigender Geschwindigkeit produziert. Auch in den digitalen Geisteswissenschaften (Digital Humanities, DH) und computergestützten Sozialwissenschaften (Computational Social Science, CSS) ist die schiere Menge an Textdaten manuell unmöglich zu verarbeiten. Beispielsweise müssen Forschende bei der Analyse der Auswirkungen des Klimawandels auf Gesellschaften eine Vielzahl von Textarten in großen Mengen analysieren, u.a. Nachrichtenartikel, staatliche Berichte, Gesetzestexte, Vorschriften, Verträge und Daten aus sozialen Medien. Daher ist eine Automatisierung mittels der automatischen Verarbeitung natürlicher Sprache (natural language processing, NLP) essentiell um mit großen Textsammlungen zu arbeiten. Die DH sind ein interdisziplinäres Forschungsgebiet, das Geisteswissenschaften und Informatik verbindet, indem es computergestützte Methoden in geisteswissenschaftlicher Forschung anwendet. Dabei werden oft Methoden eingesetzt um große digitale Textsammlungen zu erstellen oder diese zu analysieren, um das untersuche Phänomen zu verstehen. CSS ist ein interdisziplinäres Forschungsfeld zwischen Sozialwissenschaft und Informatik, welches wissenschaftliche Theorien über das menschliche Verhalten entwickelt und testet, indem computergestützte Methoden auf große zumeist Textdaten aus dem Internet angewandt werden. NLP ist eine Teildisziplin der Informatik, die untersucht wie natürliche Sprache mit Computern verarbeitet werden kann, wobei heutzutage oft maschinelles Lernen (ML) und künstliche Intelligenz zum Einsatz kommen. NLP-Ansätze wurden in vielen DH oder CSS Anwendungsfällen genutzt, um Textdaten zu untersuchen und die Textdatenanalyse zu skalieren. Jedoch müssen diese in nutzbare Software integriert werden, damit sie für die Fachexperten zugänglich sind. Obwohl NLP mit vortrainierten Sprachmodellen (pre-trained language models, PLMs) bzw. großen Sprachmodellen (large language models, LLMs) bahnbrechende Erfolge erzielt hat, spiegelt sich diese Entwicklung oftmals aufgrund des Black-Box-Verhaltens, der begrenzten Anwendbarkeit oder der mangelnden Verfügbarkeit in nutzbarer Software nicht in gleichem Maße in DH oder CSS wider. Um diese Situation zu verbessern, hat diese Dissertation das Ziel, modernste NLP-Methoden für große Textsammlungen in die DH und CSS zu bringen. Erstens wird ein Überblick über verfügbare NLP-gestützte Forschungswerkzeuge und -methoden für die DH und CSS gegeben. Zweitens werden neuartige NLP-Methoden auf Basis neuronaler PLMs entwickelt, die in vielen DH- und CSS-Kontexten einsetzbar sind, um Forschern mit umfangreichen Textsammlungen bei der Beantwortung ihrer Forschungsfragen zu helfen. Drittens wird eine geeignete Forschungsplattformarchitektur entwickelt, die erforderlichen zentralen Funktionen implementiert und die NLP-Methoden in die benutzerfreundliche Software integriert. In dieser Arbeit werden Methoden beschrieben, die auf PLMs und deren kontextualisierten Wort-Embeddings (contextualized word embeddings, CWEs) basieren, um die semantische Ähnlichkeitssuche für die DH zu verbessern, Zitate zu erkennen und zuzuordnen, die Koreferenzauflösung auf Deutsch durchzuführen und manuelle Annotationen halbautomatisch zu skalieren. Erstens zeigt diese Arbeit eine konfigurierbare Ähnlichkeitssuche, die Aufschluss darüber gibt, welche Aspekte von Dokumenten ähnlich sind, und eine Methode zur Suche nach Textabschnitten innerhalb von Sätzen unter Verwendung der semantischen Suche als moderne Alternative zu KWIC (Key Word in Context, Schlüsselwörter im Kontext). Zweitens wird die Erkennung und Zuordnung von Zitaten automatisiert, indem ein neuer manuell annotierten Datensatz erstellt und ein neuartiges ML-Modell entwickelt wird, das eine hochwertige Erkennung und Zuordnung von Zitaten ermöglicht, wobei es gegenüber anderen Systemen erhebliche Verbesserungen aufweist. Drittens werden zwei neuronale Modelle zur Auflösung von Koreferenzen für Deutsch vorgestellt, die gegenüber vorherigen Systemen enorme Verbesserungen aufweisen und selbst bei langen Dokumenten effizient zu berechnen sind. Viertens zeigt diese Arbeit eine Möglichkeit manuelle Annotationen mit einer grafischen Anwendung und interaktiven Methode auf der Grundlage von contextualized word embeddings und 𝑘-NN (𝑘-nearest neighbors, 𝑘-nächste-Nachbarn) halbautomatisch auf große Korpora zu skalieren. Zur Entwicklung der Plattform führen wir eine Anforderungsanalyse durch, um daraus die Designziele für die Plattform abzuleiten, und entwickeln geeignete Architekturen für alle Teile der Plattform, um eine wartbare, benutzerfreundliche Software für die Bearbeitung einer Vielzahl von Forschungsfragen mit umfangreichen Textsammlungen zu ermöglichen. Wir stellen wichtige Details zur Implementierung vor und erläutern die Integration der NLP-Methoden in die Plattform. Wir haben festgestellt, dass unsere entwickelten Methoden auf viele Forschungsfragen anwendbar sind, da sie unabhängig vom jeweiligen Anwendungsfall sind und sowohl isoliert als auch in Kombination mit anderen Methoden eingesetzt werden können. Dadurch können Forschende auf den Ergebnissen der Methoden aufbauen, um ihre spezifischen Analysen durchzuführen. Wir haben gesehen, dass eine geeignete Softwarearchitektur erforderlich ist, um verschiedene NLP-Methoden, sowohl interaktive als auch langlaufende Vorgänge, mit einem einheitlichen Datenmodell zu integrieren, um die Kompositionalität der Methoden zu verbessern. Unsere entwickelte Plattform bietet eine geeignete Grundlage für die Integration einer Vielzahl von NLP-Methoden mit Unterstützung für große Datenmengen und einer benutzerfreundlichen Oberfläche für DH- und CSS-Forschende, wodurch diese ihre Daten analysieren können, um individuelle Forschungsfragen zu beantworten. Insgesamt bringt diese Dissertation modernste NLP-Methoden zur Analyse umfangreicher Textsammlungen mit einer Vielzahl von Forschungsfragen in die DH und CSS, indem sie allgemein anwendbare Methoden in einer benutzerfreundlichen Softwareplattform bereitstellt, die große Datenmengen verarbeiten kann.
URL: https://ediss.sub.uni-hamburg.de/handle/ediss/12490
URN: urn:nbn:de:gbv:18-ediss-139123
Dokumenttyp: Dissertation
Betreuer*in: Biemann, Chris
Enthalten in den Sammlungen:Elektronische Dissertationen und Habilitationen

Dateien zu dieser Ressource:
Datei Beschreibung Prüfsumme GrößeFormat  
dissertation-stabi.pdf02f10bb3d7cab9f59274d5dc840fd2676.31 MBAdobe PDFMiniaturbild
Öffnen/Anzeigen
Zur Langanzeige

Info

Seitenansichten

Letzte Woche
Letzten Monat
geprüft am null

Download(s)

Letzte Woche
Letzten Monat
geprüft am null
Werkzeuge

Google ScholarTM

Prüfe