Bibliographische Beschreibung
Titel: Graphdatenbanken für die textorientierten e-Humanities
Autor: Thomas Efer
http://d-nb.info/gnd/1125649186
http://orcid.org/0000-0002-8376-3884
Ausgabe: 18. August 2017
Fachgebiet: Informatik
Sprache: Deutsch
Umfang: 194 Seiten Hauptteil, 45 Abbildungen, 4 Tabellen, 6 Quelltexte
Schlagwörter:
Graphdatenbanken, Datenmodellierung, Recherchesysteme, e-
Humanities, Text Mining, Korpusexploration, Information Retrieval
Notiz:
Dieses Buch enthält eine leicht überarbeitete Version der gleichnamigen
Dissertationsschrift, welche am 15. Februar 2017 auf dem sächsischen Doku-
mentenserver unter der Adresse
http://nbn-resolving.de/urn:nbn:de:
bsz:15-qucosa-219122
veröffentlicht wurde. Für wissenschaftliche Zitatio-
nen ist bevorzugt die Originalfassung zu verwenden.
I
Abstract
English Version
In light of the recent massive digitization efforts, most of the humanities disciplines
are currently undergoing a fundamental transition towards the widespread application
of digital methods. In between those traditional scholarly fields and computer science
exists a methodological and communicational gap, that the so-called "e-Humanities" aim
to bridge systematically, via interdisciplinary project work. With text being the most
common object of study in this field, many approaches from the area of Text Mining
have been adapted to problems of the disciplines. While common workflows and best
practices slowly emerge, it is evident that generic solutions are no ultimate fit for many
specific application scenarios. To be able to create custom-tailored digital tools, one
of the central issues is to digitally represent the text, as well as its many contexts and
related objects of interest in an adequate manner.
This book introduces a novel form of text representation that is based on Property Graph
databases an emerging technology that is used to store and query highly interconnected
data sets. Based on this modeling paradigm, a new text research system called "Kadmos" is
introduced. It provides user-definable asynchronous web services and is built to allow for
a flexible extension of the data model and system functionality within a prototype-driven
development process. With Kadmos it is possible to easily scale up to text collections
containing hundreds of millions of words on a single device and even further when using
a machine cluster. It is shown how various methods of Text Mining can be implemented
with and adapted for the graph representation at a very fine granularity level, allowing
the creation of fitting digital tools for different aspects of scholarly work. In extended
usage scenarios it is demonstrated how the graph-based modeling of domain data can be
beneficial even in research scenarios that go beyond a purely text-based study.
II
Deutsche Version
Vor dem Hintergrund zahlreicher Digitalisierungsinitiativen befinden sich weite Teile
der Geistes- und Sozialwissenschaften derzeit in einer Transition hin zur großflächigen
Anwendung digitaler Methoden. Zwischen den Fachdisziplinen und der Informatik zei-
gen sich große Differenzen in der Methodik und bei der gemeinsamen Kommunikation.
Diese durch interdisziplinäre Projektarbeit zu überbrücken, ist das zentrale Anliegen der
sogenannten e-Humanities“. Da Text der häufigste Untersuchungsgegenstand in diesem
Feld ist, wurden bereits viele Verfahren des Text Mining auf Problemstellungen der Fächer
angepasst und angewendet. Während sich langsam generelle Arbeitsabläufe und Best Prac-
tices etablieren, zeigt sich, dass generische Lösungen für spezifische Teilprobleme oftmals
nicht geeignet sind. Um für diese Anwendungsfälle maßgeschneiderte digitale Werkzeuge
erstellen zu können, ist eines der Kernprobleme die adäquate digitale Repräsentation
von Text sowie seinen vielen Kontexten und Bezügen.
In diesem Buch wird eine neue Form der Textrepräsentation vorgestellt, die auf Pro-
perty-Graph-Datenbanken beruht einer aktuellen Technologie für die Speicherung
und Abfrage hochverknüpfter Daten. Darauf aufbauend wird das Textrecherchesystem
„Kadmos“ vorgestellt, mit welchem nutzerdefinierte asynchrone Webservices erstellt
werden können. Es bietet flexible Möglichkeiten zur Erweiterung des Datenmodells und
der Programmfunktionalität und kann Textsammlungen mit mehreren hundert Millionen
Wörtern auf einzelnen Rechnern und weitaus größere in Rechnerclustern speichern. Es
wird gezeigt, wie verschiedene Text-Mining-Verfahren über diese Graphrepräsentation
realisiert und an sie angepasst werden können. Die feine Granularität der Zugriffsebene
erlaubt die Erstellung passender Werkzeuge für spezifische fachwissenschaftliche An-
wendungen. Zusätzlich wird demonstriert, wie die graphbasierte Modellierung auch über
die rein textorientierte Forschung hinaus gewinnbringend eingesetzt werden kann.
III
Inhaltsverzeichnis
Bibliographische Beschreibung I
Abstract (Englisch und Deutsch) II
Inhaltsverzeichnis IV
1 Einleitung 2
1.1 Motivation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
1.2 Forschungsfragen . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
1.3 Beiträge zum Forschungsfeld . . . . . . . . . . . . . . . . . . . . . . . . . . 10
1.4 Aufbau des Buches . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13
2 Forschungskontext und relevante Technologien 14
2.1 e-Humanities . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
2.1.1 Entwicklung und Selbstverständnis des Fachgebiets . . . . . . . . . 15
2.1.2 Forschungsmethodik und aktuelle Entwicklungen . . . . . . . . . . 20
2.1.3 Forschungsressourcen und -infrastrukturen . . . . . . . . . . . . . . 24
2.2 Text- und Korpusrepräsentation . . . . . . . . . . . . . . . . . . . . . . . . 28
2.2.1 Charakterisierung von Forschungskorpora . . . . . . . . . . . . . . 28
2.2.2 Zeichenrepräsentation . . . . . . . . . . . . . . . . . . . . . . . . . . 31
2.2.3 Repräsentation der Struktur von Text . . . . . . . . . . . . . . . . . 34
2.2.4 Textrepräsentation im Text Mining . . . . . . . . . . . . . . . . . . . 39
2.2.5 Dokumentrepräsentation . . . . . . . . . . . . . . . . . . . . . . . . 41
2.2.6 Repräsentation von Metadaten und Annotationen . . . . . . . . . . 43
2.3 Graphdatenbanken . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 46
2.3.1 NoSQL-Datenbanken . . . . . . . . . . . . . . . . . . . . . . . . . . . 46
2.3.2 Netzwerke, Graphen und ihre Anwendungsgebiete . . . . . . . . . . 50
2.3.3 Formalisierung und graphentheoretische Zugänge . . . . . . . . . . 52
2.3.4 Property-Graph-Datenbanken . . . . . . . . . . . . . . . . . . . . . . 55
IV
2.3.5 Semantic-Web-Technologien . . . . . . . . . . . . . . . . . . . . . . 58
2.3.6 Abfragesprachen . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
2.4 Vorarbeiten und verwandte Gebiete . . . . . . . . . . . . . . . . . . . . . . 64
2.5 Ableitbare Systemanforderungen . . . . . . . . . . . . . . . . . . . . . . . . 69
3 Kadmos ein graphbasiertes Recherchesystem 72
3.1 Entwicklungsziele . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 73
3.2 Daten- und Domänenmodell . . . . . . . . . . . . . . . . . . . . . . . . . . . 75
3.3 Technologie und Systemarchitektur . . . . . . . . . . . . . . . . . . . . . . 79
3.4 Asynchrone Webservicearchitektur . . . . . . . . . . . . . . . . . . . . . . 84
3.5 Datenimport . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 87
3.6 Zeichennormalisierung . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 91
3.7 Flexibles graphbasiertes Information Retrieval . . . . . . . . . . . . . . . . 95
3.7.1 Retrievalverfahren und Textrepräsentation . . . . . . . . . . . . . . 95
3.7.2 Facettierung über nutzerspezifische Metadaten . . . . . . . . . . . 99
3.7.3 Von Schlagwörtern zur konzeptbasierten Suche . . . . . . . . . . . 102
3.7.4 Ergebnisrepräsentation und Retrievalstrategien . . . . . . . . . . . 107
3.8 Graphbasierte Korpusexploration . . . . . . . . . . . . . . . . . . . . . . . 109
3.9 Evaluierung . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 114
3.10 Erweiterungsmöglichkeiten . . . . . . . . . . . . . . . . . . . . . . . . . . . 122
3.10.1 Anlegen neuer Service-Endpunkte . . . . . . . . . . . . . . . . . . . 122
3.10.2 Gekapselte Erweiterung mit dem Plugin-System . . . . . . . . . . . 125
4 Modellerweiterungen und komplexere Anwendungsfälle 130
4.1 Erweiterbarkeit und Konstruktive Voraussicht . . . . . . . . . . . . . . . . 131
4.2 Entitäten-Netzwerke . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 134
4.2.1 Navigationsunterstützung und Netzwerkanalyse . . . . . . . . . . . 134
4.2.2 Erzeugung und Exploration von Toponymnetzwerken . . . . . . . . 140
4.2.3 Eigennamenübersetzung aus lokal alignierten Paralleltexten . . . . 145
4.3 Systematisierung und Filterung bibliographischer Daten . . . . . . . . . . 149
4.4 Struktur und Komplexität von Dramen . . . . . . . . . . . . . . . . . . . . 160
4.4.1 Extraktion, Analyse und Visualisierung von Struktur . . . . . . . . 160
4.4.2 Informationstheoretische Komplexitätsbetrachtungen . . . . . . . 166
4.5 Aufbau interner Indexstrukturen für lexikalische Ähnlichkeit . . . . . . . 173
4.6 Das Graphenparadigma als interdisziplinäres Kommunikationsmittel . . . 177
V
5 Schlussbetrachtungen 184
5.1 Zusammenfassung . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 185
5.2 Technologische und methodische Grenzen . . . . . . . . . . . . . . . . . . 187
5.3 Ausblick . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 190
Literaturverzeichnis 196
Abkürzungsverzeichnis 229
Abbildungsverzeichnis 238
Quelltextverzeichnis 240
Tabellenverzeichnis 241
A Verwendete Korpora 242
B Ergänzende Grafiken 246
C Anleitung zur Inbetriebnahme der Kadmos-Umgebung 251
VI
Kapitel 1
Einleitung
The world has arrived at an age of cheap
complex devices of great reliability;
and something is bound to come of it.
Vannevar Bush
US-amerikanischer Ingenieur und Professor für Elektrotechnik
aus dem Essay „As We May Think“ (1945) [Bus45]
2
Kapitel 1 Einleitung
1.1 Motivation
Die häufige Charakterisierung unserer heutigen Epoche als das „Digitale Zeitalter“ ist ein
Beleg für den großen Einfluss und die zentrale Bedeutung digitaler Technologien für die
gesamte Gesellschaft. Der Informatik als grundsätzlich eigenständiger und unabhängiger
akademischer Disziplin kommt damit die immer wichtigere und mit großer Verantwor-
tung verbundene Rolle zu, geeignete Rahmenbedingungen für effiziente Prozesse in
zentralen Sektoren, wie Produktion, Handel und Logistik, Wissenschaft und Verwaltung,
aber auch Kommunikation und Kultur zu schaffen.
Während die Informatik sich bereits seit langem mit Fragen von gesellschaftlicher Dimen-
sion auseinandersetzt ab den 1950er Jahren etwa, mit den in der Kybernetik wurzelnden
Überlegungen zur künstlichen Intelligenz ist die praktische Anwendbarkeit solcher
Forschungsfelder und die soziale Relevanz der Informatik erst in den letzten Jahren für
die Breite der Gesellschaft greifbar geworden.
Die Geistes- und Sozialwissenschaften auf der anderen Seite, welche seit jeher die Rolle
kritischer Betrachter sozialer Themen einnehmen, und deren Forschen und Wirken grund-
sätzlich als gesellschaftliches Korrektiv dienen soll, haben die rasanten Entwicklungen der
Informationstechnologie bislang nur sehr zögerlich aufgegriffen. Viele Disziplinen, die
über Jahrzehnte oder gar Jahrhunderte lang Forschungsmethodik tradiert und Theorien
gepflegt haben, stehen im Zuge des „digitalen Wandels“ heute vor einem grundlegenden
Transformationsprozess. Egal, ob ein Fachgebiet der Adaption digitaler Methoden offen
oder eher ablehnend gegenübersteht, so wandeln sich doch in jedem Fall Umfeld und
Bedingungen der Forschung, wie auch die Erwartungen an sie.
Ohne diese allgemeine Entwicklung grundsätzlich werten zu wollen, lässt sich feststel-
len, dass die voranschreitende Digitalisierung einige unbestreitbare Vorteile mit sich
bringt und einmalige Chancen für die akademische Welt insgesamt eröffnet. Durch die
zahlreichen Möglichkeiten der digitalen Kommunikation zwischen Individuen und Grup-
pen wird eine globale Kollaboration innerhalb von Forschungs-Communities und über
Disziplinen-Grenzen hinweg gefördert. Es bieten sich direktere Reaktionsmöglichkeiten
auf neue Trends und Strömungen, wodurch nicht zuletzt auch der wissenschaftliche
Diskurs angeregt wird. Dieser wird zudem durch neue Kommunikationsformate und
-plattformen gleichzeitig öffentlicher und transparenter.
1
1
vgl. etwa [Nie11] und [SS13]
3
1.1 Motivation
Die technologischen Fortschritte und veränderten Kommunikationswege läuten überdies
eine Liberalisierung des wissenschaftlichen Publikationswesens ein. Die enorm gesun-
kenen Aufwände für das Veröffentlichen und Verbreiten von Inhalten sorgen für ein
stark erhöhtes Publikationsaufkommen, besonders im Bereich digitaler Journals. Da-
durch wird ein Pluralismus divergenter Meinungen gefördert und eine angemessene
Abdeckung von Nischenthemen erstmals möglich. Die Schattenseite dieser Entwicklung
ist die zunehmende Unsicherheit über die Verantwortlichkeiten und konkreten Durch-
führungsbedingungen der wissenschaftlichen Qualitätskontrolle für die publizierten
Inhalte. Die schon immer schwierige Position traditioneller Verlagshäuser zwischen mo-
netären Eigeninteressen und ihrer wichtigen Rolle als externe Überwacher und Lenker
des akademischen Wissensaustauschs wird angesichts immer neuer digitaler Konkur-
renz verschärft. Aktuelle Diskussionen im Zuge der Hinwendung zum Prinzip des
Open
Access
betrachten bislang hauptsächlich Fragen des möglichst breiten Zugangs zu wis-
senschaftlichen Veröffentlichungen. In naher Zukunft wird sich auch die Suche nach
geeigneten Konzepten für die (Selbst-)Kontrolle der wissenschaftlichen Qualität in diese
Überlegungen einreihen müssen.
2
Gleichzeitig zu diesen Umwälzungen in den organisatorischen Rahmenbedingungen
für wissenschaftliche Publikationen entwickeln sich durch die Nutzung neuer Medien
auch zahlreiche weitergreifende Möglichkeiten für die Dokumentation des Forschungs-
prozesses, etwa über das Bereitstellen umfangreicher (und teils interaktiv nutzbarer)
Zusatzmaterialien für Fachveröffentlichungen. Durch das Publizieren von Forschungsda-
ten und Forschungssoftware wird das Verständnis der Herleitung neuer Erkenntnisse
gefördert, das Ableiten alternativer Interpretationen erleichtert sowie eine Reproduzier-
barkeit und objektivere Vergleichbarkeit von Forschungsarbeiten in einem bisher nicht
dagewesenen Detailgrad ermöglicht. Es etabliert sich zudem langsam ein neuer Modus der
Kollaboration durch die Nutzung von Forschungsinfrastrukturen, wo verwendete Daten
und Verfahren gesichert, ausgetauscht, veröffentlicht und (ggf. in ganz unerwarteten
Kontexten) nachgenutzt werden können.
Während die neuen Publikations- und Kollaborationsmöglichkeiten für sich genommen
bereits großen Einfluss auf die Wissenschaftswelt ausüben, so zeigen sich die größten
Auswirkungen des technologischen Wandels auf viel grundlegenderer Ebene: in der Art
und Weise, wie geforscht wird. Im Hinblick auf die quellenorientierte Forschung ist die
2
vgl. z. B. [Cav12] und [Ris14] und s. auch entsprechende Überlegungen aus dem
WRoTe Digital Humanities Dialog“, 2013,
http://dialog.e-humanities.net/assets/dialog/wrote-2013/Gruppendiskussion.pdf
4
Kapitel 1 Einleitung
Adaption einer digitalen Arbeitsweise im Forschungsprozess immer dann unausweichlich,
wenn die Analyse großer Quellenbestände nötig wird, sowie, wenn eine umfassendere
und systematisierte Sicht auf bisher traditionell ausgewertete Primärquellen und die
dabei entstandene Sekundärliteratur möglich werden soll.
Wichtigste Triebfeder dieses digitalen Wandels in den quellenorientierten Geistes- und
Sozialwissenschaften ist die derzeit großflächig durchgeführte Digitalisierung analoger
Bestände in Bibliotheken, Museen, Stiftungen und Archiven. Momentan ist diese primär
motiviert durch konservatorische Überlegungen zur dauerhaften Bewahrung kulturellen
Erbes und mithin des wertvollen Wissens, das bisher nur physisch auf, in, und in Form
von (teils fragilen) Objekten hinterlegt ist
3
. Daran ist jedoch oft auch der Wunsch einer
besseren Kategorisierung, Verwaltung und Beschreibung der eigenen Bestände über digi-
tale Methoden verknüpft. Zudem wird bei Digitalisierungsinitiativen (besonders, wenn
sie aus Mitteln der öffentlichen Hand finanziert werden) häufig auch die Wissenschaft
als Hauptnutzer der entstehenden digitalisierten Sammlungen adressiert. In solchen
erweiterten Nutzungsszenarien muss die Konzeption und Durchführung der Digitali-
sierungsarbeiten entsprechend qualifiziert ablaufen, um eine Eignung für die jeweils
avisierte Form der Weiterverarbeitung zu gewährleisten.
Die Deutsche Forschungsgemeinschaft (DFG) hat mit [
DFG13
] entsprechende Empfeh-
lungen erstellt, in denen Regeln und Richtwerte für die digitale Erfassung von Objekten
(primär als Bild) und die Anreicherung dieser Digitalisate mit den zugehörigen Zusatz-
informationen (so genannten Metadaten, durch welche der entsprechende Datensatz
auffindbar gemacht werden soll) enthalten sind.
Mit dem Hinzufügen immer weiterer und feingliedriger Metadaten verschiebt sich auch
der Fokus vom reinen Erhalt von Sammlungen hin zu ihrer digitalen Erschließung. Simple
Katalogerfassung wird dabei durch subjektivere Vorgänge und fachwissenschaftliche
Interpretation ergänzt, durch welche der Digitalisierungsprozess nah an die Forschung
selbst heranrückt. Auch hier stellt sich die Frage nach einem angemessenen Umgang mit
den sich bietenden Möglichkeiten. Besonders die historisch arbeitenden Wissenschaften
sehen sich mit einem plötzlich massiv auftretenden Bedarf an wissenschaftlicher Erschlie-
ßung großer Bestände konfrontiert. Der dabei zu beobachtende Paradigmenwechsel wird
in [Mic16] treffend beschrieben:
3
In dieser Betrachtung werden inhärent „oberflächliche“ Mass-Digitization-Projekte aus dem kommer-
ziellen Umfeld (z. B. Google Book Search) wegen ihres grundsätzlich umstrittenen Nutzens für die
Wissenschaft (vgl. [GTW13] für eine detaillierte Analyse) zunächst ausgeklammert.
5
1.1 Motivation
[...]
the advent of the digital library and other digital resources has profoundly al-
tered the historian’s relationship to information. The common prior condition of in-
formation scarcity has given way to overabundance.
Der Umgang mit einem plötzlichen Überfluss an Information ist für die Gelehrtenwelt
nichts fundamental Neues,
4
doch das derzeitige Ausmaß angesichts der relativ kurzen
Zeitspanne, seit der die Digitalisierung Einzug in die Fachgebiete hält, macht ihn weit
weniger beherrschbar
5
. Ganz allgemein gesehen fehlt in der Wissenschaft wie auch in
anderen zentralen Sektoren vielfach die nötige Digitalkompetenz. Eine qualifizierte Her-
angehensweise an die Lösung von Problemen mit digitalen Mitteln hat sich noch nicht als
Kulturtechnik etabliert. Entsprechend werden derzeit auch in den Geisteswissenschaften
verstärkt Experten benötigt, die entsprechende Werkzeuge bereitstellen können.
Hier ergibt sich ein starker Berührungspunkt zur traditionell eher naturwissenschaftlich
geprägten Technikwelt und zur Informatik. Während frühere Vorhaben zur Adaption
digitaler Werkzeuge, wie Datenbanken, Katalogsysteme und Statistik-Software teils noch
autark innerhalb der Fachdisziplinen umgesetzt werden konnten, stoßen diese Ansätze
nun langsam an ihre Grenzen. Die Notwendigkeit zur interdisziplinären Arbeit eröffnet
derzeit für alle Seiten neue Chancen für Kollaborationen jenseits des eigenen Fachge-
biets. Aufgrund geringer inhaltlicher Schnittmengen und fundamental unterschiedlicher
Wissenschaftstraditionen nehmen die Fachwissenschaften und die Informatik jedoch in
gemeinsamen Forschungsvorhaben naturgemäß die Rollen von Antagonisten ein, welche
bestrebt sind, den Entwicklungsprozess vom eigenen Standpunkt her zu beschreiben und
zu lenken. Daraus ergibt sich nicht selten Konfliktpotential, insbesondere, wenn damit
eine Reduzierung der Informatik auf einen reinen Technik-Dienstleister oder umgekehrt
die technologieinduzierte Beschränkung des Einflusses der Fachwissenschaften auf eine
simple massenhafte Dateneingabe verbunden ist.
Um diese Hürden zu umschiffen, widmen sich die
e-Humanities
bzw.
Digital Humanities
einer gemeinsamen Erarbeitung von Forschungsmethodik für ein angenehmeres, produk-
tiveres, zielgerichtetes und adäquates Arbeiten in diesem emergenten Feld überlappender
Forschungsinteressen. Die Aktivitäten setzen sowohl bei der Entwicklung allgemeiner
4
siehe z. B. [
Bla10
] zum Einfluss der (subjektiv wahrgenommenen und objektiv belegbaren) Schwemme
gedruckter Bücher ab dem beginnenden 16. Jahrhundert auf die europäischen Gelehrten und die
Wissensproduktion
5
An dieser Stelle soll zur Fokussierung der einleitenden Überlegungen nicht detaillierter auf die abzuse-
henden Probleme zukünftiger Historiker im Umgang mit den Artefakten unserer heutigen digitalen
Wissensproduktion eingegangen werden, jedoch sei beispielhaft auf [
Ros03
] für eine kritische Be-
trachtung dieser Thematik verwiesen.
6
Kapitel 1 Einleitung
Theorien als auch beim anwendungsnahen Sammeln von
Best Practices
an, wobei auch
da die Arbeit an generischen und an spezialisierten Werkzeugen unterschieden werden
kann.
In diese Prozesse können beide Seiten ihre jeweiligen Stärken einbringen. Wichtige
Kompetenzen der Informatik liegen dabei u. a. in der formell korrekten und technisch
effizienten Modellierung von Daten, im Umgang mit sehr großen Datenmengen, der Ver-
netzung von Wissensressourcen, der Entwicklung von Analyseverfahren und -werkzeugen
sowie der Visualisierung von Analyseergebnissen. Die Geisteswissenschaften bringen
dagegen u. a. sorgfältige manuelle Arbeitsweisen, theoriegeleitete Auswertungs- und
Interpretations-Frameworks, ein hohes Verständnis für relevante Kontexte der Quellen
und Daten sowie Erfahrung im Umgang mit unscharfen und unterspezifizierten Kategori-
en ein.
Während in diesem derzeit populären Bereich auch viele neue Ansätze entwickelt werden,
befindet sich aus Sicht der Informatik (bis auf einige löbliche Ausnahmen) die Groß-
zahl der bisher in den Geisteswissenschaften breit eingesetzten digitalen Werkzeuge im
Hinblick auf Datenmodellierung, Datenhaltung, Abfragemöglichkeiten und Interaktions-
schnittstellen noch auf dem Forschungsstand der 1990er Jahre.
Um diesen Zustand nachhaltig zu verändern, bedarf es einer Analyse der aktuellen tech-
nologischen Entwicklung. Abseits der sozial- und geisteswissenschaftlichen Anwendungs-
domäne (und teils auch ohne starke Verbindung zur Informatik-Forschung) prosperieren
derzeit viele neue wissens- und datenverarbeitende Gebiete. Berufsbezeichnungen, wie
Data Analyst
und
Data Scientist
durchziehen die Stellenangebote in fast allen Branchen.
Allgegenwärtige Datenquellen (in Unternehmen, öffentlichen Stellen und über offene
digitale Kommunikationskanäle) machen Daten zu einem wichtigen und gut verfügbaren
„Rohstoff“, dessen Verarbeitung und Erschließung
6
sowie Auswertung Wettbewerbsvor-
teile verspricht.
Es werden hierbei Technologien benötigt, mit denen Wichtiges von Unwichtigem ge-
trennt, der Grad der Strukturierung erhöht sowie der Kontext der Daten zunächst isoliert
erfasst und anschließend durch eine Verknüpfung mit bereits Bekanntem erweitert wer-
den kann. Das Auffinden und die Anreicherung großer Datensammlungen sind dabei an
der Tagesordnung, so dass Schlagworte wie
Big Data
mittlerweile allgemeine Bekanntheit
(und im Bereich personenbezogener Daten auch erste berechtigte Kritik) erlangt haben.
6
passenderweise oft als Data Mining bezeichnet bei textuellen Daten als Text Mining
7
1.1 Motivation
Angesichts enorm großer Bestände von über das Internet verfügbaren, verknüpften
Informationsressourcen und nicht zuletzt durch die wirkmächtige Popularisierung von
„Sozialen Netzwerken“ wird begreiflich, dass auf gewisse Weise „alles mit allem vernetzt
ist“
7
. Wird diese Beobachtung konsequent verinnerlicht, wird dadurch eine Auswertung
von Daten in ihrem Kontext bzw. in ihren vielen Kontexten zum einen erst möglich und
zum anderen dringend erforderlich.
Das vorliegende Buch greift sich im Folgenden mit der Fokussierung auf Graphdaten-
banken eine Technologie aus der aktuellen Entwicklung heraus, die dieser Sichtweise in
besonderem Maße gerecht werden kann und die ein aktueller Forschungsgegenstand der
Informatik ist. Sie wird auf die Speicherung und Verarbeitung von Text, als der primären
Quellenform der Geisteswissenschaften, erweitert. Auch Metadaten, lexikalisches Wissen
und nutzerdefinierte Konzeptualisierungen werden damit abbildbar. Das System bildet
die Basis für vielseitige Rechercheanwendungen.
Trotz prinzipiell technischer Ausrichtung des Buches und der grundsätzlich universellen
Anwendbarkeit der vorgestellten Verfahren für textorientierte Recherchen wird bewusst
der Bezug zu den Sozial- und Geisteswissenschaften hergestellt, da der Autor eine Annä-
herung auf digitalem Terrain als perspektivisch wichtig ansieht: Die Qualifizierung der
Informatik in Richtung des tieferen Verständnisses gesellschaftlich relevanter Fragestel-
lungen und dem adäquaten Umgang mit kulturellen Artefakten insbesondere textuellen
Quellen muss sich ebenso vollziehen, wie die Qualifizierung der Geisteswissenschaften
in Richtung der informierten und zweckmäßigen Nutzung aktueller Technologien.
Oft wurde in der Vergangenheit schon thematisiert, dass beiden Seiten ein breiteres
Gespür für die relevanten Fragestellungen der jeweils anderen fehlt. Diesem Buch liegt
die Hoffnung zugrunde, dass diese Hürden durch die gemeinsame, schrittweise und for-
schungsgeleitete Entwicklung von adäquaten Werkzeugen im Rahmen der e-Humanities
abgebaut werden können. Letztendlich soll mit der Urbarmachung neuer und moderner
technologischer Basiskomponenten eine Grundlage für eben solche gemeinschaftlichen
Projekte geschaffen werden.
7
vgl. [Bar02] als Ausdruck der „neuen Wissenschaft von Netzwerken“
8
Kapitel 1 Einleitung
1.2 Forschungsfragen
Im Angesicht der oben beschriebenen Ausgangslage kommen auf die Informatik viele
neuartige Problemstellungen zu, die sowohl im Bereich der anwendungsbezogenen For-
schung (speziell im interdisziplinären Kontext) angesiedelt sind, als auch Kernthemen der
Informatik, wie Datenmodellierung und -repräsentation sowie Algorithmik betreffen. In
dieser Arbeit soll nicht vorrangig ein konkretes Teilproblem fokussiert gelöst werden. Das
wichtigere Ziel ist es, eine grundsätzliche, teils technologisch motivierte, teils von offenen
Fachfragen der Geisteswissenschaften gelenkte Ergänzung bisheriger Problemlösungen
und Lösungsstrategien zu ermöglichen. Um die breite Anwendbarkeit der vorgestellten
Überlegungen und Lösungen zu sichern, wird im Laufe der Ausführungen unterschiedli-
chen Fragestellungen nachgegangen. Über diesen spezialisierten Aspekten stehen jedoch
einige grundsätzliche Fragen, zu denen in diesem Buch Erkenntnisse gewonnen werden
sollen.
Die untersuchte Technologie der Graphdatenbanken stellt einen vergleichsweise neuen
und sehr vielversprechenden Zweig der Datenbanktechnologie dar. Insbesondere für
hochkomplexe Anwendungsdomänen (zu denen die Verarbeitung geisteswissenschaftli-
cher Daten zweifellos gehört) mit auf inhaltlicher Ebene eng verwobenen Datensätzen
und Quellen gelten Graphdatenbanken als geeignete Speicher- und Abfragemöglichkeit.
Deswegen besteht die grundlegende Annahme, dass Graphdatenbanken gewinnbringend
im Bereich der e-Humanities angewendet werden können. Bezogen auf die Arbeit mit
Textkollektionen ergeben sich nun eine Reihe konkreter Forschungsfragen:
Können alternative Formen der Text- und Metadaten-Repräsentationen helfen,
den Forschungsprozess flexibler zu gestalten?
Wie bedingen sich digitale Repräsen-
tationsform und Analysemöglichkeiten? Verbessern feingliedrigere Modelle die Abfrag-
barkeit und Interpretierbarkeit von Daten? Welches Maß an zusätzlicher Komplexität
bringt die alternative Repräsentation mit sich?
Graphdatenbanken werden erfolgreich als Backend für komplexe hochskalierende
Websysteme verwendet. Kann die textorientierte Forschung von dieser Technolo-
gie profitieren?
Kann der parallele Zugriff auf große Textkollektionen über Graphdaten-
banken realisiert werden? Können interaktive und reaktive Webportale auf Grundlage
solcher Zugriffsverfahren erstellt werden?
9
1.3 Beiträge zum Forschungsfeld
Sind Graphdatenbanken eine geeignete Technologie für die Entwicklung von Ver-
fahren für das Zusammenspiel quantitativer und qualitativer Betrachtungswei-
sen?
Welche Möglichkeiten für explorative Datenanalyse bieten sich? Wie können die
Verfahren verständlich kommuniziert werden? Wie kann die Dokumentation des For-
schungsprozesses unterstützt werden?
Welche Aspekte der automatischen Sprachverarbeitung können durch die Textre-
präsentation in Graphdatenbanken abgebildet werden?
Sind
Text-Mining
-Verfahren
weiterhin anwendbar? Welche Chancen und Grenzen ergeben sich für das
Information
Retrieval?
Welche über Textdaten hinausgehenden Modellerweiterungen ermöglicht die Nut-
zung von Graphdatenbanken?
Welche Domänen und Arten von Datensammlungen
lassen sich abbilden? Welche erweiterten Modelle eignen sich für graphbasierte Netz-
werkanalysen? Welche zusätzlichen Aufwände entstehen im Rahmen der Anpassungen?
1.3 Beiträge zum Forschungsfeld
Für die zielgerichtete Weiterentwicklung der Digitalen Geisteswissenschaften als Anwen-
dungsdomäne der Informatik ist die Identifizierung bisheriger technologischer Hürden
und Unzulänglichkeiten eine wichtige Hilfestellung. Aus interdisziplinärer Sicht leistet
das Buch darüber hinaus einen Beitrag zur Klärung der drängenden Frage, welche Art
von neuartigen Werkzeugen sich aus aktuellen technologischen Entwicklungen ableiten
lassen. Dadurch werden Impulse gegeben, einige der bislang durch konventionelle Analy-
semethoden bedingten Limitierungen der Forschungsmöglichkeiten für (textbasierte)
Untersuchungsgegenstände durch alternative Ansätze zu überwinden. Die Ausarbeitung
ergänzt die Demonstration der Leistungsfähigkeit neuer Methoden bewusst auch um Hin-
weise zu den jeweiligen Nachteilen und gibt schließlich Anregungen für interdisziplinäre
Arbeitsmodi, mit denen eine projektbezogene und zielgerichtete Auswahl geeigneter
Technologien stattfinden kann.
Als Teil der in diesem Buch vorgestellten Arbeiten wird ein flexibles und erweiterbares
Datenmodell vorgestellt, welches geeignet ist, Texte sowie die damit verknüpften Zusatz-
informationen und Analyseobjekte auf sehr feingranularer Ebene abzubilden. Es wird
gezeigt, wie dieses hinsichtlich unterschiedlicher Anforderungen an die Datenabfrage
10
Kapitel 1 Einleitung
und -analyse angepasst werden kann. Dabei wird ausdrücklich nicht die Standardisierung
einer einzelnen Repräsentationsform angestrebt, sondern vielmehr ein „Baukasten“ ge-
schaffen, mit dem sich ein Pluralismus verwandter (und grundsätzlich interoperabler)
Datenmodelle anhand konkreter Anforderungen herausentwickeln kann.
Auf dieser Basis wird die enge Verzahnung von digitaler Repräsentation mit der Operatio-
nalisierung digitaler Arbeitsschritte, wie etwa Persistierung, Normalisierung, Suche und
Aggregation sowie mit den forschungsgeleiteten Auswertungs- und Recherche-Verfahren
verdeutlicht. Die Arbeiten legen damit den Grundstein für neue Verfahren, bei denen
ein stärkerer Fokus auf der Nutzung von Verknüpfungen innerhalb der Datenbasis liegt.
Diese neue, „vernetzte“ Sichtweise bezieht viele unterschiedliche Aspekte in die Analy-
sen ein und betrachtet Analyseeinheiten, wie etwa Wörter mit ihren lokalen Kontexten,
ergänzende nutzerspezifische Annotationen, automatisch identifizierbare Entitäten und
sprachgrenzenüberschreitende Vokabulareinheiten. Dies sind wichtige Bausteine für eine
Weiterentwicklung von sprachverarbeitenden Methoden innerhalb der angewandten
Informatik, insbesondere im Text Mining und Information Retrieval.
Für die Implementierung und Untersuchung dieser Verfahren wird eine prototypische
Plattform entwickelt und detailliert beschrieben. Diese Plattform ist ein wichtiges Hilfs-
mittel, um neuartige Herangehensweisen an die Analyse von Textdaten nicht nur auf
theoretischer Ebene zu diskutieren, sondern in Form nutzbarer Software in eine diszipli-
nenübergreifende Debatte einzubringen. Sie ermöglicht die Erprobung solcher Verfahren
anhand konkreter Textkollektionen und im Kontext tatsächlich existierender Forschungs-
fragen. Dabei besteht der Anspruch, mit dem System ein ergänzendes Werkzeug zu
schaffen, das komplementär zur bestehenden Technologie eingesetzt werden kann und
eine explorative Beschäftigung mit dem Datenbestand, seiner Struktur und alternativen
Zugangsformen für die Analyse ermöglicht. Es soll nicht als ein Ersatz für vorhandene
Werkzeuge dienen.
Darüber hinaus wird durch die Vorstellung konkreter Fallbeispiele ein Eindruck von der
breiten Anwendbarkeit der entwickelten Technologie vermittelt. Anhand diverser Frage-
stellungen werden einerseits Querschnittsaspekte, wie der Umgang mit Metadaten und
benannten Entitäten thematisiert, deren gute Verallgemeinerbarkeit auf andere Projekte
offensichtlich ist. Andererseits werden auch tiefergehende spezifische Anforderungen
einzelner Projekte beleuchtet und dafür technologisch kohärente Lösungswege vorge-
stellt, um das großes Potential der Technologie für Spezialentwicklungen aufzuzeigen. Es
wird gezeigt, das Graphdatenbanken eine Bearbeitung komplexer Problemstellungen aus
11
1.3 Beiträge zum Forschungsfeld
den Geistes- und Sozialwissenschaften erlauben, ohne dass es zu technologischen und
konzeptionellen „Medienbrüchen“ kommt.
Für die Informatik selbst ergeben sich aus den vorgestellten Arbeiten unter anderem
die folgenden Impulse: Zunächst ist zu erkennen, dass die Konzeption von Textdatenmo-
dellen stärker als bisher in die informatische Disziplin getragen werden sollte. Während
aus den digitalen Geisteswissenschaften umfangreiche Vorarbeiten zum Wesen“ von
Text, seinen verschiedenen konkurrierenden Lesarten, der Anfertigung werksgetreuer
Editionen sowie einer menschen- wie maschinenlesbaren Abbildung dieser Aspekte vor-
liegen, sind die Aspekte einer effizienten Auswertbarkeit von (großen und sehr großen)
Textkollektionen auf feingranularer Ebene bisher wenig berücksichtigt. Hier besitzt die
Informatik mit profunder Kenntnis von Algorithmik, Komplexitätslehre, Textstatistik
und einer etablierten Praxis des Software Engineering viele Kompetenzen, die bislang zu
wenig genutzt werden.
Zum anderen wird deutlich, dass die paritätische interdisziplinäre Arbeitsweise, die sich
etwa in der Wirtschafts-, Bio- und anderen Formen erfolgreicher „Bindestrich-Informatik“
bereits etabliert hat, im Bereich von sozial- und geisteswissenschaftlichen Anwendungen
noch gefunden werden muss. Ein Beitrag zu diesem Prozess wird mit einer technolo-
gisch transparenten, prototypenzentrischen Herangehensweise an die Entwicklung von
Datenmodellen und Werkzeugen geleistet, deren digitale Artefakte über die gesamte
gemeinsame Projektarbeitszeit als Kommunikationsmittel zwischen den beteiligten Dis-
ziplinen dienen können.
Der Nutzen für die Informatik aus der Beschäftigung mit den e-Humanities ist vielfäl-
tig: Neue Anwendungsgebiete mit neuen Problemen beleuchten immer auch Bereiche
der Kerndisziplin, in denen weitere innovative Verfahren entwickelt werden müssen.
Gleichzeitig sorgen konkrete Anwendungsfälle dafür, dass neue Verfahren aus der theo-
retischen wie anwendungsbezogenen Forschung in einer Weise implementiert werden,
die ihre breitere Nutzung, Optimierung, Erweiterung und Dissemination fördert. An-
gesichts explodierender Datenmengen unterschiedlichster Strukturierungsgrade sind
davon zahlreiche Teildisziplinen der Informatik berührt. Die e-Humanities mit ihrer stark
quellenorientierten Arbeitsweise verlangen nach gut dokumentierten (im besten Fall
selbstdokumentierenden) Verfahren und Prozessketten, die eine Provenienz für Daten
sicherstellt und eine reproduktionsbereite Beschreibung relevanter Teilschritte enthält.
Es kommt bei neuen Verfahren in diesem Umfeld also keinesfalls nur auf die Ausgabe,
sondern auf den kompletten Prozess an.
12
Kapitel 1 Einleitung
1.4 Aufbau des Buches
An die bis hierhin vorgestellten einleitenden Überlegungen schließt sich mit Kapitel 2 eine
Einordnung der Arbeiten in den interdisziplinären Forschungskontext der e-Humanities
an. Darin werden relevante Begriffe eingeführt und theoretisch verortet sowie die Be-
sonderheiten der Anwendungsdomäne analysiert. Weiterhin wird der konzeptionelle
und technologische Rahmen abgesteckt und ein Überblick über verwandte Felder und
Ansätze gegeben.
Unter Berücksichtigung der dabei entwickelten Anforderungen und Ziele für eine me-
thodische und technologische Weiterentwicklung von Rechercheanwendungen wird
in Kapitel 3 ein graphbasiertes Datenmodell für die flexible Repräsentation von for-
schungsrelevanten Textkollektionen konzipiert und im Kontext üblicher Text-Mining-
und Information-Retrieval-Aufgaben positioniert. Darüber hinaus wird die Architektur
und Funktionsweise des Recherche-Systems „Kadmos“ vorgestellt, welches durch die Nut-
zung dieses Datenmodells eine Vielzahl flexibler Abfrageszenarien sowie die Auslieferung
vorberechnungsfreier Textstatistiken erlaubt.
In Kapitel 4 werden erweiterte Anwendungsfälle für den Einsatz von Graphdatenbanken
zur Unterstützung digitaler geistes- und sozialwissenschaftlicher Forschung vorgestellt,
womit gezeigt wird, dass Ihre Anwendbarkeit auch deutlich über die Mindestanforderun-
gen an forschungszentrierte Textrepräsentation hinausgeht.
Schließlich folgt im letzten Kapitel eine Zusammenfassung und kritische Betrachtung der
in der Arbeit geleisteten technologischen und konzeptionellen Beiträge. Daran schließt
sich ein Ausblick zu möglichen Erweiterungen und zur Einbindung in Forschungsprojekte
und -infrastrukturen an.
Ein Überblick über die für dieses Buch relevanten Sammlungen von Textquellen (so
genannte Korpora) wird in Tabelle A im Anhang gegeben.
13
Kapitel 2
Forschungskontext und relevante
Technologien
[...] think of the relationship between computing technology and the
disciplines of the humanities as a moment by moment becoming of
their futures, to some degree unpredictably, through an ongoing
contest between the disciplines’ strong sense of themselves on the one
hand and all that contingently affects them, including the relentless
development of digital technologies, on the other.
Willard McCarty
Professor of Humanities Computing, King’s College London
aus dem Essay
The Future of Digital Humanities Is a Matter of Words“ [McC13b]
14
Kapitel 2 Forschungskontext und relevante Technologien
2.1 e-Humanities
2.1.1 Entwicklung und Selbstverständnis des Fachgebiets
Die Anfänge digitaler Methoden in den Geisteswissenschaften lassen sich recht präzise
zurückverfolgen und sollen hier nur kurz entsprechend [
Hoc04
] wiedergegeben werden.
Einen detaillierteren Überblick über die Arbeiten der 1960er Jahre (aus US-amerikanischer
Perspektive) bietet z. B. [Hin13].
Als Ausgangspunkt der zunächst unter dem Namen
Humanities Computing
bekannt
gewordenen Aktivitäten wird sehr oft das Vorhaben von Roberto Busa genannt, eine
Konkordanz
1
zu den Schriften des Thomas von Aquin (und ausgewählter Texte ähnlicher
Autoren) anzulegen. Da jener ein sehr umfangreiches Werk hinterlassen hat, wäre eine
manuelle Bearbeitung dieses Problems sehr aufwändig: Für die Konkordanz müssen rund
11 Millionen laufende Wortformen nach ihrer Oberflächenform gruppiert und innerhalb
der lexikalisch sortierten Gruppen anschließend mitsamt ihrer Positionsangaben und
Umgebungswörter abgetragen werden.
Für seinen
Index Thomisticus
entschied sich Busa im Jahr 1949 deshalb, die Kooperation
mit universitären Rechenzentren in den USA zu suchen, um die Arbeiten mit Unter-
stützung von Großrechneranlagen zu vereinfachen. Allerdings wurde sein Vorhaben
von diesen Institutionen durchweg als nicht durchführbar verworfen. Schließlich fand
Busa im Bereich der kommerziellen Rechentechnik in Thomas J. Watson (dem damaligen
Geschäftsführer von IBM) einen großzügigen Unterstützer, der ihm die benötigte Technik
und entsprechend geschultes Personal zur Verfügung stellen konnte.
2
Die Arbeiten im
Humanities Computing
begannen also bereits in der frühen Anfangszeit des
industriellen Großrechners, als die weithin verfügbare Technologie den Anforderungen
an die Verarbeitung einer solch großen Datenmenge im Grunde noch nicht gewachsen
war. Eine „Datenbank“ des
Index Thomisticus
in der damals üblichen Speicherform auf
Lochkarten hätte laut Busa [
Bus04
] ca. 500 Tonnen gewogen.
3
Das ganze Projekt war
daher sehr stark auf technische Neuentwicklungen angewiesen, welche sich im Laufe der
1
ein Verzeichnis von in Texten vorkommenden Wörtern (index verborum), meist unter Angabe der jewei-
ligen Wortumgebungen (Satz oder Ausschnitt mit konstanter Anzahl an Vorgänger- und Nachfolge-
wörtern)
2
Details zu dieser Kooperation können in [Bus80] nachgelesen werden.
3
Aus den dort beigefügten hypothetischen Größenangaben ergibt sich allerdings ein reines Papiergewicht
von maximal 90 metrischen Tonnen.
15
2.1 e-Humanities
Zeit auch nach und nach einstellten und welche jeweils schnell adaptiert wurden dazu
Busa z. B.:
In His mercy, around 1955, God led men to invent magnetic tapes.
“. Im Jahr 1980
konnte das Gesamtwerk schließlich (digital, im automatischen Offset-Verfahren) gedruckt
werden. Es entstanden 56 Konkordanzbände mit insgesamt 65000 Seiten und gegen Ende
der 1980er Jahre wurde begonnen, den
IndexThomisticus
in Form einer einzelnen Daten-CD
digital zur Verfügung zu stellen.
Über Jahrzehnte hinweg wurden so enorme Aufwände in Kauf genommen, um eine wich-
tige Textquelle zu erschließen und in ihrer Gesamtheit besser verständlich zu machen.
Dabei stellt das ursprüngliche Ziel, die Schaffung einer Konkordanz, aus heutiger Sicht
nur eine sehr simple Arbeitshilfe für den Zugang zu Vokabular und seiner Nutzung in
Texten dar. Durch die Digitalisierung der Texte lassen sich heutzutage alle erdenklichen
Verfahren auf diese Version der Quelle anwenden. Während anfangs also ein spezifisches
Werkzeug geplant war, birgt die digitale Edition das Potential, zum universellen Basis-
werkzeug zu werden. Wie eingangs in dieser Arbeit beschrieben, sind aktuell unzählige
Digitalisierungsinitativen damit beschäftigt, die Grundlage für digitale Forschung in ei-
ner großen Bandbreite an Forschungsfeldern zu legen. Die Möglichkeiten der späteren
Nutzung und Auswertung dieser Daten sind zum Teil noch nicht vollständig abzusehen,
jedoch kann, wie gezeigt, bereits von sehr einfachen Werkzeugen großer Nutzen ausge-
hen. Die fachwissenschaftlichen Quellen in ihrer digitalen Form geben daher quer durch
die Disziplinen neue Impulse für den Forschungsprozess.
Diese Entwicklung reiht sich in eine lange Historie von Wendepunkten geisteswissen-
schaftlicher Forschung ein, die unter markanten Schlagwörtern, wie dem
Linguistic Turn
(ab ca. 1900) oder dem
Spatial Turn
(ab ca. 1980) bekannt geworden sind, vgl. [
BM14
].
Scharloth, Eugster und Bubenhöfer verwenden in [
SEB13
] den Begriff
Data-driven Turn
zur Charakterisierung neuer Forschungsansätze, die „auf vorgängige Hypothesen ver-
zichten und mit Datenmengen arbeiten, die so umfangreich sind, dass sie von keinem
wissenschaftlichen Individuum mehr in eine Gesamtschau gebracht werden können“.
Unter Berücksichtigung der im Einleitungskapitel genannten Transformationsprozesse
kann derzeit sicher ganz allgemein vom Digital Turn gesprochen werden.
Die von dieser Entwicklung berührten Disziplinen leisten nun unter dem Dach der
Digital
Humanities
Beiträge für die Entwicklung einer gemeinsamen digitalen Methodensamm-
lung. Dabei wird sowohl die Erprobung neuer Methodik für die Beantwortung bekannter
Fragestellungen als auch das Finden neuer Forschungsfragen durch den Einsatz daten-
basierter Herangehensweisen vorangetrieben. Bestehende Theorien können dadurch
16
Kapitel 2 Forschungskontext und relevante Technologien
kritisch hinterfragt, bestätigt oder erweitert werden und alternative Interpretationsan-
sätze können sich herausbilden.
Der Dachverband für Aktivitäten der digitalen Geistes- und Sozialwissenschaften ist die
Alliance of Digital Humanities Organizations (ADHO), in welcher viele regionale Verbände
organisiert sind. Die weltweit agierende Community richtet über diesen Verband eine
jährliche Konferenz aus. Weitere interne wie auch überregionale Konferenzen der Mit-
gliedsverbände und eine große Zahl themenspezifischer Veranstaltungen von großen
Konferenzen bis zu kleinen Workshops, Kolloquien und Vortragsreihen erweitern das
Angebot an physischen Begegnungs- und Austauschmöglichkeiten.
Was sind nun die Kernfragen und das Kernanliegen der Digital Humanities? Zur Diskussion
der Ziele, Probleme und Ausrichtung dieser Disziplin sind bereits unzählige Einführungen,
Leitartikel, Selbstbeschreibungen, Kompilationen, Gegenentwürfe und Manifeste erschie-
nen, so beispielsweise [
SSU04
], [
Kir10
], [
BDL
+
12
], [
Sve12
], [
Gol12
], [
AB14
] und [
Kön16
]
sowie viele weitere im Verlauf dieses Buches referenzierte Beiträge. Dennoch fällt es sehr
schwer, die Charakteristika der digitalen Geistes- und Sozialwissenschaften abschließend
zu definieren. Im Jahr 2012 wurden anlässlich des „DH-Tages“ die Teilnehmer gefragt:
How do you define digital humanities?
“. Anhand der 256 Antworten, die daraufhin gesam-
melt wurden
4
lässt sich ableiten, dass es auf der einen Seite eine Vielzahl (fachbezogener
wie fachübergreifender) Hoffnungen und Wünsche an diese Forschungsrichtung gibt und
allgemeine, wie auch sehr fachspezifische Sichtweisen vorherrschen auf der anderen
Seite aber auch oft gar kein Bedürfnis nach einer abschließenden Definition besteht
(Antwort: I don’t.“).
Letztlich bleiben die
Digital Humanities
daher ein Sammelbegriff für diverse Arbeiten
und Ansätze, die durch meist interdisziplinär aufgestellte und mehr oder weniger stark
institutionalisierte Verbünde von Forschern repräsentiert werden. Für den fachlichen
Austausch haben sich zahlreiche (meist digital erscheinende) Journals
5
und Online-Com-
munity-Systeme, wie z. B. die
DH Commons
6
oder der
Global Outlook DH
7
konstituiert.
Auf die parallel dazu geschaffenen (technischen sowie organisatorischen) Forschungsin-
frastrukturen wird noch in Abschnitt 2.1.3 auf Seite 24 genauer eingegangen.
4
http://archive.artsrn.ualberta.ca/Day-of-DH-2012/dh/
5
für eine Liste ohne Anspruch auf Vollständigkeit s. z. B. hier:
http://digitalhumanities.berkeley.edu/resources/digital-humanities-journals
6
http://dhcommons.org/
7
http://www.globaloutlookdh.org/
eine Initiative, die sich speziell für den Abbau von Kommunika-
tions- und Kollaborationsbarrieren für Forscher und Forscherinnen aus Ländern mit unterschiedli-
chen Einkommensniveaus einsetzt
17
2.1 e-Humanities
Die Charakterisierung all dieser Institutionen und Aktivitäten als „interdisziplinär“ wird
stellenweise wegen der starken Abhängigkeiten und heterogenen Forschergemeinschaft
sowie häufigen Mischqualifikationen der einzelnen Forscher sogar durch das Prädikat
„transdisziplinär“ ersetzt. So beschreibt Lin etwa in [
Lin12
] unter Bezugnahme auf die
Untersuchungen zur Wissensproduktion in [
GLN
+
94
] eine sich neu herausbildende Ar-
beitsweise,
which is context-driven, problem-focused, and transdisciplinary, involves multidis-
ciplinary teams with heterogeneous backgrounds working together. This differs from traditional
[...] research that is academic, investigator-initiated and discipline-based knowledge produc-
tion.“.
Die Wahrnehmung der
Digital Humanities
als aufstrebende Fachdisziplin oder neue wis-
senschaftliche Strömung stößt im heutigen akademischen Umfeld allerdings auf eine
sehr gemischte Rezeption:
[...]
it bloomed into an umbrella for a range of work taking place across the human-
ities, an intellectual turn towards both exploiting and understanding computational
and networked technology, and depending on who you ask a category of research
that either holds in its hands the future of the humanities or is complicit in a neo-
liberal agenda intent on destroying higher education and all that humanists hold
dear.
8
Der Großteil der Kritik zielt dabei vorrangig auf Aspekte der übermäßigen Institutiona-
lisierung und der damit verbundenen Verschiebung von Förderprioritäten ab, einige
Beiträge beziehen darin jedoch explizit auch die gesamte Praxis und Community der
Digital Humanities ein, wie etwa [ABG16].
Ungeachtet dieser Punkte kann die offene fachübergreifende Kommunikation und Kol-
laboration, wie sie in den Digital Humanities praktiziert wird, als wichtiges, fruchtba-
res und zukunftsträchtiges Forschungsmodell angesehen werden. Bei der Suche nach
adäquaten mathematischen, technologischen und informationswissenschaftlichen Rah-
menbedingungen für künftige Arbeiten eröffnet sich insbesondere für die Informatik ein
vielschichtiges, komplexes, datenreiches und innovationsbereites Anwendungsfeld. Das
stetig wachsende Interesse innerhalb der Informatik verdeutlicht sich u. a. auch durch ent-
sprechende Schwerpunktsetzungen für etablierte Konferenzen und Publikationsreihen.
In [
HHSH15
] wird als einleitender Beitrag zum Problemkreis des „Informationsmanage-
ment für Digital Humanities“ betont, dass dabei als zwei untrennbare Aspekte die „[...]
8
aus einem Buch-Review von James Baker: http://www.history.ac.uk/reviews/review/1634
18
Kapitel 2 Forschungskontext und relevante Technologien
Unterstützung geisteswissenschaftlicher Forschungsarbeiten mit Methoden der digita-
len Informationsverarbeitung sowie Forschungsfragen, die sich dadurch auch für die
Informatik ergeben“, relevant sind.
Einen Schritt weiter gehen die
Computational Humanities
, in deren Kern die Entwicklung
neuer Algorithmen, Formalismen und generischer Methoden zur Verarbeitung von Quel-
lenmaterial steht. Hier ist die konkrete Anwendung der erstellten Werkzeuge in den
Geistes- und Sozialwissenschaften zum Teil erst ein nachgelagerter Schritt einer eigentli-
chen informatiknahen Grundlagenforschung.
Aus dieser Vielfalt an Perspektiven ergibt sich auch die Verwendung des (sonst eher
seltener genutzten) Begriffs e-Humanities im Kontext dieses Buches. Wie in Abbildung 2.1
verdeutlicht, wird damit eine beide „Pole“ berücksichtigende Gesamtbetrachtung und
Mediation zwischen den aus historischen und methodischen Gründen zum Teil weit
entfernten Forschungsparadigmen beabsichtigt.
Abbildung 2.1: Einordnung der e-Humanities ins Fächergefüge, sinngemäß
übernommen aus [HI14]
Ein weiterer positiver Aspekt dieser Bezeichnung ist die direkte begriffliche Assoziation zu
den e-Sciences. Diese stehen für eben jenes neue und universelle Forschungsverständnis,
das eine offene Kollaboration von Fachwissenschaftlern über digitale Infrastrukturen in
den Mittelpunkt stellt. Nicht zuletzt kann auch die dort propagierte Reproduzierbarkeit
von Analysen
9
als wünschenswerter Input für digitale geisteswissenschaftliche Forschung
angesehen werden.
9
vgl. z. B. die zahlreichen Anwendungsfälle in [FFR16]
19
2.1 e-Humanities
2.1.2 Forschungsmethodik und aktuelle Entwicklungen
Die aktuellen Diskussionen und neuen Methoden in den e-Humanities stehen stark unter
dem Einfluss der von Franco Moretti geprägten Einteilung von analysierenden und in-
terpretierenden Forschungsaktivitäten in ein
Close Reading
und ein
Distant Reading
, vgl.
[
Mor13
]. Damit wird ein Kontinuum zwischen qualitativen und quantitativen Verfah-
ren sowie deren Anwendung auf große, allgemeine aber auch kleine und spezialisierte
Quellensammlungen sowie zwischen automatischen und manuellen Analyseprozessen
aufgespannt. Projekte, die neue Ansätze zur Adaption digitaler Methodik entwickeln,
positionieren sich oft in feststehende Nischen innerhalb dieses Raums, um damit ihre
generelle Ausrichtung und ggf. Anknüpfung an bestehende Arbeitsweisen zu kommuni-
zieren.
Die literaturwissenschaftlich geprägte Richtungsvorgabe Morettis sollte darüber hinaus
jedoch vielmehr als Anregung für eine flexible und bedarfsgerechte Methodensuche
und Methodenkombination sowie die Definition von
Best Practices
innerhalb des sich
neu ergebenden Spektrums digitaler Ansätze und Werkzeuge dienen. Stulpe und Lemke
schlagen in diesem Sinne für die Sozialwissenschaften (in welchen Texte selbst nur
als sekundäre Forschungsgegenstände gelten können) unter der Bezeichnung
Blended
Reading
eine Verbindung (semi-)automatischer Verfahren und manueller Detailanalyse
vor, welche auf die Nutzung tatsächlich vorhandener „Erkenntnispotenziale“ abzielt, s.
[SL16].
Entsprechende breitere Ansätze werden auch in der Literaturwissenschaft selbst disku-
tiert, etwa unter dem Stichwort der
Macroanalysis
bei [
Joc13
] oder mit den in [
Ram11
]
beschriebenen Ansätzen
toward an algorithmic criticism
“. Während die theoretischen
Überlegungen dort sehr weitreichend und aus Sicht der Fachwissenschaft sehr anregend
sind, bewegen sich der Grad der Formalisierung und die algorithmischen Beiträge (anders
als in den Sozialwissenschaften) dort eher auf niedrigem Niveau etwa bei einfachs-
ter Wortstatistik. Auch in seinem (aus Sicht der Informatik) zunächst sehr technisch
klingenden Buch
Graphs, Maps, Trees: Abstract Models for a Literary History
[
Mor05
] führt
Moretti keine eigentlichen Formalismen im Sinne der „exakten“ Wissenschaften ein. Es
werden unter diesem Titel lediglich Kartierung und das Anfertigen von Diagrammen
als Arbeitstechnik des
Distant Reading
charakterisiert
10
. Allgemein ist in einer Vielzahl
10
Mit dem Terminus Graphs werden in Morettis Buch Diagramme und Schaubilder bezeichnet, nicht
Graphen im Sinne dieses Buches.
20
Kapitel 2 Forschungskontext und relevante Technologien
von Arbeiten jedoch allmählich auch ein Trend zur Adaption komplexerer Verfahren zu
erkennen.
In jedem Fall ist ein wesentlicher Aspekt für die Etablierung digitaler Forschungsansätze
die damit erreichbare methodische Transparenz. Eine in diesem Umfeld häufig genutzte
Begrifflichkeit ist die der
Black Boxes
“, die informell in etwa so beschrieben werden kön-
nen: Werkzeuge, die für die Bearbeitung einer bestimmten Fragestellung herangezogen
werden, wobei deren interne Wirkmechanismen dem Nutzer nicht oder nur ungenügend
bekannt sind.
Dabei handelt es sich grundsätzlich um abgeschlossene Systeme, deren Verhalten zwar un-
tersucht und beschrieben werden kann, deren Wirkweise jedoch unklar ist. Die Ursprünge
dieser Betrachtungsweise liegen in der Systemtheorie und Kybernetik. Im gleichnamigen
Kapitel in [
Ash56
] wird die
Black Box
als ein experimenteller Untersuchungsgegenstand
vorgestellt, der mit verschiedenem
Input
konfrontiert werden kann und dessen
Output
sich messen oder beobachten und in Bezug zum Input protokollieren lässt. Daraus können
Hypothesen über die Wirkweise (und somit indirekt über den inneren Aufbau) entwickelt
werden.
In den e-Humanities ist der eigentliche Untersuchungsgegenstand jedoch nicht die
Black
Box
selbst, sondern deren Input (oder die Objekte, aus denen sich der Werkzeug-Input
ableitet). Die Unkenntnis der
Black Box
macht Ergebnisinterpretation in diesen Fällen
schwierig: Wenn nicht klar ist, welche Aspekte der Eingaben wie verarbeitet werden,
um eine Ausgabe zu generieren, kann das Werkzeug nicht sinnstiftend verwendet wer-
den. Eine methodische Transparenz erfordert insbesondere auch eine Transparenz der
verwendeten Datenrepräsentation und Datentransformation. McCarty schreibt dazu in
[McC13a]
Thus digital representation does not matter to the person interested only in output
or effects. But it is crucial to the person, [...] who wants to know what is lost in
translation, and more importantly what that loss illumines.
Daraus lässt sich ableiten, dass nicht nur ein Verständnis der grundsätzlichen Funktions-
weise und Ausgabe eines Verfahrens notwendig ist, sondern auch die Art und Weise der
Ableitung von Informationen über den Aussagegegenstand, dessen Diskretisierbarkeit
und Formalisierbarkeit bedacht werden muss. Die Repräsentation muss relevante Aspek-
te abbilden können und in einer Form vorhalten, die verständliche, nachvollziehbare
Analysen ermöglicht.
21
2.1 e-Humanities
Diese Sichtweise reiht sich in aktuelle Bestrebungen ein, Arbeitsabläufe und Methoden
in den e-Humanities systematisiert zu beschreiben und ihr Zusammenspiel mit ver-
schiedenen Formen von Datenquellen zu charakterisieren. Beispielsweise wird aktuell
mit der Taxonomy of Digital Research Activities in the Humanities (TaDiRAH)
11
ein
Versuch der (mehrsprachigen) Definition von typischen geisteswissenschaftlichen For-
schungsaktivitäten unternommen, s. u. a. [
BDPS16
]. Solche Bestrebungen zur Ordnung
und stückweisen Formalisierung zentraler Arbeitsabläufe sind seit der Jahrtausendwende
im Gespräch, vgl. etwa [
Uns00
]. Eine direkte Umsetzung in Interaktionsmuster mit digi-
talen Werkzeugen existiert jedoch bisher nicht, zumal noch nicht abschließend geklärt
ist, wie in Forschungsprojekten üblicherweise das Verhältnis von (gut verallgemeinerba-
ren) Kernabläufen zu (thematisch und methodisch sehr diversen) vorhabensspezifischen
Arbeitsschritten gewichtet ist. Generell trägt die explizite Beschreibung aber zur indi-
viduellen Projektplanung auch im Hinblick auf die zu wählende Repräsentationsform
bei.
Die Entwicklung von Vorgehensmodellen kann die methodische Transparenz befördern,
wenn es dabei gelingt,
Best Practices
aus der generischen Methodenentwicklung und
vorhergehenden Projekterfahrungen mit einer zielstrebigen, stark von den Forschungs-
fragen geleiteten Herangehensweise zu kombinieren. Als ein erster Schritt hin zu solchen
„Projekt-Blaupausen“ kann beispielsweise die in [Fec16] vorgestellte Data Adaption an-
gesehen werden, welche ein mehrschichtiges Vorgehensmodell, bestehend aus Phasen
der Beschäftigung mit den folgenden Aspekten vorsieht:
Forschungsziel und Quellen
Beschreibungsmodell
Datenmodell
Datensammlung und Anpassung
Exploration
Detailanalyse
Die einzelnen Schritte bauen jeweils auf den in der vorhergehenden Ebene gewonnenen
Erkenntnissen und getroffenen Entscheidungen auf. Diese sollten jeweils auch phasen-
weise dokumentiert werden, um in dieser Form als weitere Orientierungshilfe für die
nachfolgenden Arbeiten zu dienen.
Da in diesem Buch ein generisches Werkzeug beschrieben wird, lässt sich der Fokus nicht
11
http://tadirah.dariah.eu/vocab/index.php
22
Kapitel 2 Forschungskontext und relevante Technologien
auf die ersten beiden (projektspezifischen) Schritte legen. Die Beiträge setzen daher
als erstes bei der Entwicklung eines flexiblen Datenmodells an. Der Begriff des Daten-
modells wird dabei in Anlehnung an die in [
FJ15
] verwendeten Definitionen wie folgt
verstanden: Erstens als Ausdruck einer konzeptuellen und logischen Sicht auf die zu
erforschenden Daten, zweitens als Kommunikations- und Konkretisierungs-Werkzeug
für die datengetriebene fachliche Bearbeitung der Fragestellung und drittens als techni-
sche Beschreibungsform für die (inhärente oder angenommene) Struktur von Daten. Für
letzteren Aspekt positionieren Flanders und Jannidis das Datenmodell zwischen Modell-
instanzen, also die konkreten im Modell gespeicherten Daten, und ein Metamodell, also
die „Modellierungssprache“ mit ihren als Bausteine dienenden Modellierungskonstruk-
ten. Zurecht bemerken sie den oft sehr unterschiedlich ausgeprägten Grad der Nutzung
der im Datenmodell definierten Konstrukte in einzelnen Instanzdatensätzen. Nicht im-
mer sind Datensammlungen tatsächlich so komplex wie das ihnen zu Grunde liegende
Schema.
Am Ende der Projektentwicklung in den e-Humanities steht üblicherweise die Detail-
analyse. Oft ist zumindest zu Beginn dieses Stadiums der thematische Fokus und der zu
betrachtende Ausschnitt der Quellen noch nicht so genau eingegrenzt, dass eine klare
Forschungsagenda für die schrittweise Abarbeitung von Einzelbelegen nach einem fes-
ten Schema erstellt werden könnte. Abweichend zu [
Fec16
] soll hier die Exploration der
Quellen bis zuletzt als Bestandteil des Forschungsprozesses angesehen werden.
Den Ressourcen-Zugriff ab einem bestimmten Zeitpunkt hauptsächlich auf bereits be-
kannte oder durch Vorsondierung stark eingegrenzte Teilbereiche der Quellensammlung
zu beschränken, ist sicher konform mit traditionellen, forschungsfragengeleiteten Her-
angehensweisen, sollte aber durch datengetriebene Ansätze und alternative, explorative
Zugänge zu den Daten ergänzt werden. Aus dem Bereich der explorativen Suche ist be-
kannt, dass sich damit natürlich nicht unerhebliche Entwicklungsaufwände ergeben. So
heißt es etwa in [Mar06]:
Research tools critical for exploratory search success involve the creation of new in-
terfaces that move the process beyond predictable fact retrieval.
Aus der Schaffung explorativer Zugänge erwachsen jedoch nicht selten unerwartet Er-
kenntnisse über Einzelinformationen oder Zusammenhänge in den Daten, die mit ziel-
gerichteteren Verfahren (ohne Kenntnis ihrer Existenz) nicht gefunden worden wä-
ren. Dieser sogenannte Serendipitätseffekt kann eine wesentliche Rolle im Forschungs-
23
2.1 e-Humanities
prozess spielen. Er ist z. B. in [
BQHR12
] näher beschrieben, dort im Bezug auf Online-
Recherchewerkzeuge.
Die Recherchetätigkeit ist somit weniger als Ansammeln von Fakten, sondern als schritt-
weises Definieren von Kontexten anzusehen, innerhalb derer sich potentiell interessante
Fakten ergeben. Zur Detektion, Modellierung und Analyse dieser Kontexte kann auf
etablierte Methoden der Informatik zurückgegriffen werden. Beispielsweise haben sich
statistische Methoden zur Analyse unstrukturierter Daten, vgl. [
MS99
], im Kontext der
e-Humanities bewährt. Es werden aber verstärkt komplexere Werkzeuge benötigt, so dass
sich aus der Anwendungsdomäne heraus auch innerhalb der Informatik disziplinenüber-
schreitende Problemstellungen ergeben. Das betrifft neben der Sprachverarbeitung auch
die Forschung an Datenbanken, Datenintegration, Datenmodellierung und Wissensreprä-
sentation, Informationsvisualisierung und Big Data. In diesen Schwerpunkten ergibt sich
jeweils weiterer Forschungsbedarf sowie allgemein die Notwendigkeit eines Austauschs
der Gebiete untereinander.
Eine weitere aktuelle und in diesem Zusammenhang wichtige Entwicklung ist die ver-
stärkte explizite Betrachtung komplexerer Zusammenhänge im Forschungsprozess. Eng
gekoppelt daran ist eine Interpretation der Quellen und Forschungsobjekte in Form von
Netzwerken. Diese Herangehensweise wird später in diesem Kapitel noch ausführlicher
vorgestellt. Werkzeuge, die einen interaktiven und visuellen Zugang zu (kleinen und
mittelgroßen) Netzwerken bieten, werden in den e-Humanities immer populärer, allen
voran Gephi [
BHJ09
]. Dadurch ist ein sehr intuitiver Umgang mit Netzwerken möglich.
Dieser Umstand blendet jedoch möglicherweise aus, dass bisher nur wenige Arbeiten
zu grundlegenden Aspekten der Datenmodellierung und Formalisierung für die Arbeit
mit Netzwerken kultureller Artefakte und geistes- wie auch sozialwissenschaftlicher
Forschungsgegenstände existieren.
2.1.3 Forschungsressourcen und -infrastrukturen
Wie bereits in der Einleitung angeklungen ist, kann Forschung im Kontext der e-Huma-
nities nur selten als solitäre Aktivität einzelner Akteure durchgeführt werden. Größere
Projekte, aber auch individuelle Forschungstätigkeit, werden Teil eines allgemeineren
Forschungsprozesses, der innerhalb einer Forschungscommunity stattfindet wobei die
traditionellen, nicht auf Kollaboration ausgerichteten Forschungstätigkeiten dadurch
nicht ersetzt, aber um viele perspektiverweiternde Möglichkeiten und digitale Werkzeuge
24
Kapitel 2 Forschungskontext und relevante Technologien
ergänzt und damit unterstützt werden.
Aus Sicht der Wissenschaftsförderung ist diese Tendenz eine willkommene Entwicklung,
wird darin doch die Möglichkeit zur Synergiebildung und Vermeidung von Mehrfach-
aufwendungen für gleiche Arbeiten gesehen. Gerade für die grundlegenden Digitalisie-
rungsprozesse und die daraus resultierenden Datenbestände wird eine breite Nutzung in
verschiedensten Fachkontexten angestrebt. Das umfasst insbesondere auch die gleichzei-
tige Nutzung von Daten aus mehreren Digitalisierungsinitiativen und Datenrepositorien.
Nach den DFG-Praxisregeln“ ist das Ziel systematischer Digitalisierung „[...] nicht nur
das Bereitstellen, sondern auch und vor allem das Vernetzen der unterschiedlichen
Ressourcen zu einer virtuellen Forschungsinfrastruktur.“ [DFG13]
Bei der Vielzahl der verfügbaren, meist verteilt erstellten Ressourcen fällt es im For-
schungsprozess oft schwer, einen umfassenden Überblick über relevantes Material zu
erhalten. Damit durch die Ressourcen auch tatsächlich Mehrwerte für die Forschung ent-
stehen können, müssen sie zuallererst gut auffindbar vorgehalten werden. Verschlagwor-
tung, Kategorisierung und die Erstellung von Beschreibungstexten bilden dabei wichtige
Zugangsmechanismen. Darüber hinaus wird es auch immer wichtiger, inhaltliche Verbin-
dungen zwischen Ressourcen und zu Forschungsgegenständen (Personen, Institutionen,
Epochen, Genres, etc.) nachvollziehbar und für das Auffinden der Ressource nutzbar zu
machen.
Um diesen Anforderungen gerechtwerdenzu können,istbeim Umgang mit Forschungsres-
sourcen und insbesondere bei ihrer Bereitstellung innerhalb von Forschungsinfrastruktu-
ren die Verwaltung von Metadaten eine wesentliche Schlüsselaufgabe. Dabei gilt es, eine
große Bandbreite an Aspekten zu erfassen, die irgendwann im Recherche-, Auswertungs-
oder Interpretationsprozess relevant werden könnten. Neben selbstverständlichen Anga-
ben, wie dem Autor eines Werks, der Sprache eines Textes oder dem Material eines Objekts,
kommen je nach Anwendungsfall viele weitere Informationen in Betracht, wie die wis-
senschaftliche Datierung, frühere Katalogisierungsnummern, Provenienzinformationen
und ggf. Erwerbungshistorie, Angaben zur Dokumentation des Digitalisierungsvorgangs,
Lizenzinformationen für die Verbreitung usw.
Als eine erste Erschließungsstufe auf dem Weg zur Forschungsinfrastruktur können in
dieser Beziehung Portale für die Vernetzung von Sammlungen kulturellen Erbes (wie
z. B. Gemälde, Texte, museale Objekte und Fotos) angesehen werden, beispielsweise das
25
2.1 e-Humanities
europäische Projekt Europeana
12
. Mit der Deutschen Digitalen Bibliothek
13
existiert ein
vergleichbares deutschlandweites Projekt mit einer Schwerpunktsetzung auf textuelle
Quellen. Bei diesen Portalen handelt es sich um einen virtuellen Zusammenschluss der
Bestände vieler einzelner Institutionen. Damit dies ohne ausufernde Zusammenführungs-
aufwände vonstatten gehen kann, wird für diese (verteilten) Systeme ein gemeinsames
konzeptionelles Modell benötigt.
Für diesen Zweck hat sich das (recht allgemein gehaltene) Conceptual Reference Model
(CRM) der International Committee for Documentation of the International Council of Mu-
seums (CIDOC) etabliert, zu welchem z. B. auch „Übersetzungen“ (sogenannte
Mappings
für das Europeana-Datenmodell) existieren. Auch für die konkreten Wertebereiche für
die Beschreibung von Objekten existieren Ressourcen, etwa die Vokabulare und Thesauri
des Getty Research Institute
14
. Für einige Eintragstypen, wie Künstlernamen, enthält
diese Sammlung auch Normdaten also Einträge mit Identifikationsnummer, Listen von
Benennungsvarianten und Zusatzinformationen. Für solche Normdatenrepositorien exis-
tieren ebenfalls Portale für den Zusammenschluss über Institutionsgrenzen hinweg. Im
Virtual International Authority File (VIAF) sind die gemeinsamen Normdatensätze vieler
Bibliotheken und anderer Forschungsinstitutionen zusammengefasst und verknüpft.
Eine Forschungsinfrastruktur umfasst jedoch mehr als nur vereinheitlichte Sammlun-
gen von Datenrepositorien und Referenzmodellen: Sie sind Ankerpunkt und Koordi-
nationsstelle für eine heterogene Landschaft aus Quellen, Services und Konsumenten.
Für die e-Humanties existieren auf europäischer Ebene in der Hauptsache zwei große
Infrastruktur“-Initiativen: Common Language Resources and Technologies Infrastructure
(CLARIN) und Digital Research Infrastructure for the Arts and Humanities (DARIAH).
Beide ergänzen sich in ihren Schwerpunkten und stehen auf technischer und organisato-
rischer Ebene in regem Austausch, unterstützt auch durch die europäische Initiative zur
Synergiebeförderung zwischen diesen Infrastrukturprojekten, namens Pooling Activities,
Resources and Tools for Heritage E-research Networking, Optimization and Synergies
(PARTHENOS).
Einen Einblick in das Servicekonzept einer solchen Forschungsinfrastruktur gibt z. B.
[
WAB
+
09
] mit der Vorstellung von (zu diesem Zeitpunkt bekannten) Anforderungen
an Webservices und Methoden der Prozesssteuerung in CLARIN. Damit Infrastrukturen
12
http://www.europeana.eu/
13
http://www.deutsche-digitale-bibliothek.de/
14
http://www.getty.edu/research/tools/vocabularies/
26
Kapitel 2 Forschungskontext und relevante Technologien
Einträge aus verstreuten Ressourcen und Repositorien auffinden können, existieren
Mechanismen zum
Harvesting
der relevanten Metadaten. Hierbei kommt häufig das von
der Open Archives Initiative (OAI) entwickelte und von zahlreichen Bibliotheken und
Archiven übernommene OAI Protocol for Metadata Harvesting (OAI-PMH) zum Einsatz.
Entsprechend müssen sie mit den vielen verschiedenen Modellierungsmöglichkeiten für
Metadaten und deren konkreter Semantik umgehen können Aspekte, die später im
Buch noch mehrfach zur Sprache kommen werden.
Für die textorientierten e-Humanities ergeben sich die meisten der für die Infrastruktur-
projekte relevanten Ressourcen aus der großflächigen Digitalisierung von Manuskripten
oder Retrodigitalisierung gedruckter Werke. Daraus entstehen allgemeine oder themen-
spezifische Textsammlungen, sogenannte Korpora, wie sie beispielsweise vom Deutschen
Textarchiv
15
in großem Umfang angeboten werden. Andere Arten von textuellen Quellen
bilden digitale (wissenschaftliche) Texteditionen bekannter Werke, an welchen stets neu-
er Bedarf herrscht. Mit fortschreitendem Forschungsstand werden immer neue Aspekte
für die Editionen wichtig und aus der z. T. komplexen Forschungsmaterie lässt sich nur
selten eine eindeutige oder „optimale“ Empfehlung zur Editionspraxis ableiten. In [
Cle15
]
heißt es darüber hinaus:
„[...]
how a text is edited, in respect of any norms and standardisations, is a state-
ment about the nature of the text and its tradition, transmission, and history; and
such a statement may be true or false.
Die damit verbundenen Entscheidungen und deren Implikationen sind vom Standpunkt
des Betrachters und vom konkreten Anwendungsfall abhängig. In der akademischen An-
wendungspraxis ist ein Pluralismus von diesbezüglichen Herangehensweisen durchaus er-
wünscht. Entsprechend existieren auch kleinere Infrastrukturprojekte für fachspezifische
Editionsbelange (sowie Projekte zur Korpuserstellung) s. z. B. [
Bab11
] für die „Digitalen
Altertumswissenschaften“. Die dort entwickelten Ressourcen, Werkzeuge und anderen
Services können perspektivisch mit größeren Initiativen zusammengeschlossen werden.
In CLARIN wurden für spezifische Anwendungsfelder sogenannte Facharbeitsgruppen
eingeführt, um solche Formen der Integration zu befördern. Von diesem methodischen
Übertrag profitieren im Idealfall auch andere Anwendergruppen.
Aus den angesprochenen Digitalen Altertumswissenschaften stammt z. B. aus dem Umfeld
der Edition klassischer griechischer Texte ein spezialisierter Service und eine darauf
15
http://www.deutschestextarchiv.de/
27
2.2 Text- und Korpusrepräsentation
aufbauende Infrastruktur namens Collections, Indices, Texts, and Extensions (CITE)“, s.
[
SW09
]. Diese definiert Canonical Text Services (CTS), in welcher Referenzierungen von
Textstellen über Webtechnologie in Form eines eindeutigen Uniform Ressource Name
(URN) möglich ist. Dieser Ansatz wird mittlerweile auch für Anwendungen außerhalb der
Altertumswissenschaften genutzt und soll perspektivisch in CLARIN integriert werden.
Aspekte, die ganz allgemein für die Nutzung von Textsammlungen in den e-Humanities
relevant sind, sowie die dafür derzeit verfügbaren digitale Repräsentationsformen werden
in den folgenden Abschnitten detaillierter vorgestellt.
2.2 Text- und Korpusrepräsentation
2.2.1 Charakterisierung von Forschungskorpora
Der in diesem Buch häufig verwendete Begriff des Korpus für Sammlungen von Texten
lehnt sich an die Verwendung großer Textsammlungen in der Korpuslinguistik an. Diese
zielt auf ein Verständnis der Funktionsweise von Sprachen (und Sprache an sich) über
datengeleitete Verfahren ab, wobei die Größe der genutzten Datensammlungen eine
Bearbeitung mit digitalen Mitteln erforderlich macht. In der Linguistik wurden bereits
seit den späten 1950ern zahlreiche Berührungspunkte mit der diskreten Mathematik und
der Informatik identifiziert und genutzt, etwa im Bereich formaler Grammatiken
16
. Die
Korpuslinguistik, die seit den 1990er Jahren stetig an Popularität gewinnt, macht sich
solche Vorarbeiten jedoch nicht unbedingt zu eigen, sondern orientiert sich eher an der
Statistik und an von Experten gelenkter Muster-Abfrage.
Diese Auffassung des Textbestandes als Arbeitsgrundlage für quantitative Betrachtungen
der Artefakte kultureller Prozesse hat sich in den letzten Jahren verstärkt in viele Gebiete
der Geisteswissenschaften übertragen. Korpora werden heutzutage in großem Maße für
die historische, politologische oder sozialwissenschaftliche Forschung herangezogen.
Den in diesem Buch beschriebenen Arbeiten liegt ebenfalls ein solcher erweiterter und
allgemeinerer Korpusbegriff zugrunde. Er umfasst kollaborative Text-Repositorien, digita-
lisierte Bucheditionen, abgeschlossene Textkollektionen aber auch dynamisch erweiterte
Quellensammlungen.
16
s. z. B. [Mar98]
28
Kapitel 2 Forschungskontext und relevante Technologien
Hauptziel beim Zusammentragen von Dokumenten und Erstellen digitaler Forschungs-
korpora ist das Anlegen großer Sammlungen relevanter Texte, in denen aussagekräftige
statistische Untersuchungen möglich sind. Je größer ein Textbestand, umso größer die
Chance zur Abdeckung des Gesuchten. Die (quantitativ und qualitativ) passende Auswahl
von Quellen zur Beantwortung einer Forschungsfrage ist ein immer wieder unterschätz-
ter Arbeitsschritt in den e-Humanities, wie schon in [Fec16] festgestellt wird. Auch hier
können Lehren aus der Korpuslinguistik übernommen werden. Sehr plakativ wird die-
ser Umstand z. B. in [
MH12
] mit dem Beispiel
[...] there would be little point in exploring
the noun classification system of Swahili by looking in a corpus of English newspaper texts.
um-
schrieben.
Die Rolle von Korpora im Forschungsprozess ähnelt in den e-Humanities der im lin-
guistischen Bereich. Köhler betrachtet diese in [
Köh05
] als eine Form von „Evidenzquel-
len“ und definiert eine Vielzahl von Anforderungen an die Stichproben-Eigenschaften
linguistischer Korpora
17
. Die Auswahlkriterien entsprechen dem Wunsch nach einer
wahrheitsgetreuen quantitativen Auswertung von Sprachphänomenen. In den meisten
anderen Disziplinen werden Korpora auch als Evidenzquelle angesehen, wobei jedoch
nicht in jedem Fall so strenge Anforderungen an die Stichprobeneigenschaft der Korpora
gestellt werden oder gestellt werden können. In historisch arbeitenden Disziplinen wird
in der Regel zu Anfang eines Forschungsvorhabens keine künstliche Verknappung des
Quellenmaterials durchgeführt. Jede einzelne Quelle kann auch wenn sie nicht als „re-
präsentativ“ gelten kann Informationen enthalten, die geeignet sind, die Interpretation
des Gesamtbestandes stark zu beeinflussen. Es soll mit Korpora dort also keine Form der
quantitativen Forschung betrieben werden, die sich vordergründig auf die Beschreibung
des Regelfalls (und damit ggf. des „Offensichtlichen“) konzentriert.
Angesichts des zum Teil extrem fragmentarischen und lückenhaften Materials, auf das für
spezifische Fragestellungen zurückgegriffen werden muss, kann weder Repräsentativität
noch Vollständigkeit (in irgendeinem Sinne außer im Bezug auf die Überlieferungslage)
als realistisches Ziel für den Korpusaufbau angegeben werden. Die teils schlechte Quellen-
lage ist jedoch nur ein Aspekt der potentiellen Hemmnisse für korpusbasierte sozial- und
geisteswissenschaftliche Forschung. Ebenso schwierig gestaltet sich Forschung im Ange-
sicht unklarer Lizenzfragen oder hoher Lizenzgebühren. Offene, frei nutzbare Korpora
mit wissenschaftlichem Anspruch hinsichtlich der Daten- und Metadatenkompilation
sind nach wie vor selten.
17
u.a. Repräsentativität, Homogenität und Normalverteiltheit von zu untersuchenden Phänomenen
29
2.2 Text- und Korpusrepräsentation
Auf der Seite der Werkzeuge kann festgestellt werden, dass sich aus einer Reihe von
Spezialentwicklungen für einzelne Korpora über die Zeit generische Ansätze entwickelt
haben. Solche Korpusverwaltungssysteme konnten sich bereits in den 1990er Jahren eta-
blieren und sind bis heute im Einsatz. Auf viele Systeme kann dabei über die Corpus Query
Language (CQL), s. z. B. [
CS96
], zugegriffen werden. Damit können je nach Datenbasis so-
wohl Texte bestehend aus mehreren Zeichenketten- und Annotationsebenen ausgewertet
werden als auch die Informationen aus Dependenzgraphen in die Abfrage einbezogen
werden. Als ein häufig genutztes Werkzeug dieser Kategorie ist Sketch Engine
18
sowie
eine eingeschränkte, aber frei nutzbare Version davon, namens NoSketch Engine
19
, aufzu-
führen. In der „XML Aware Indexing and Retrieval Architecture“
20
werden CQL-Anfragen
in einer auf der Extensible Markup Language (XML) basierten Form verarbeitet und die
Korpora werden im XML-Format vorgehalten.
Diese Werkzeuge konzentrieren sich in den meisten Fällen auf linguistische Aspekte der
einzelnen Texte und sind daher meist auf die Ausgabe von Textstellen und damit ver-
bundene Statistiken ausgelegt. Die explorative Erschließung von Dokumentkollektionen,
wie sie in den e-Humanities im Vordergrund steht, ist damit auch wegen unzureichen-
der Möglichkeiten, Metadaten innerhalb der Korpora zu verwalten nicht komfortabel
möglich. Auch für Verfahren des Text Mining sind die gebotenen Schnittstellen zu den
Korpusdaten oft nicht ausreichend.
Für die Arbeit mit Korpora in den e-Humanities existieren keine umfassenden generischen
Werkzeuge, da sich die Anwendungsfälle und Vorgehensweisen oft stark unterscheiden.
In diesem Umfeld kommen oft verschiedene Ansätze zur Formalisierung der Fragestellung
zur Anwendung, welche auch unterschiedliche Anforderungen an die digitale Repräsen-
tation der Daten und an Möglichkeiten für den Zugriff darauf stellen. Die Texte sollen
nicht nur maschinenlesbar, sondern maschinenauswertbar vorgehalten werden. Das
heißt, dass darauf Verfahren zur statistischen Auswertung angewendet werden sollen,
die die Korpusexploration lenken können. Das kann die Empfehlung „ähnlicher“ Doku-
mente oder Textstellen, „ähnlicher“ Vokabeln oder „ähnlicher“ Satzstrukturen sein. Die
gewünschten Ähnlichkeiten sind dabei meist projektspezifischer Natur.
Die explorative Arbeit führt üblicherweise zu interessanten Teilproblemen der Ausgangs-
fragestellung, welche dann isoliert betrachtet werden sollen. Dafür hat sich das Anlegen
18
http://www.sketchengine.co.uk/
19
http://nlp.fi.muni.cz/trac/noske
20
http://sourceforge.net/projects/xaira/
30
Kapitel 2 Forschungskontext und relevante Technologien
sogenannter Subkorpora etabliert. Diese sind Kopien von Teilen des Originalkorpus und
beschränken sich jeweils auf fest definierte Autoren, Genres, Zeiträume oder ähnliche
aus Metadatenabfragen oder manueller Auswahl gebildete Kriterien. Subkorpora kön-
nen sehr klein und speziell sein. Auf der anderen Seite ergeben sie sich zuweilen auch
durch das Weglassen kleiner spezieller Teile und gleichen so in Größe und Aufbau stark
dem Ursprungskorpus. Es lässt sich in diesem Umfeld tatsächlich wenig Verallgemei-
nerndes zur Nutzungsweise von Dokumentkollektionen sagen. Textkorpora in den e-
Humanities enthalten zudem verschiedenste Textgattungen, und decken Material diver-
ser Forschungsfelder ab. Wenig einheitlich sind letztlich auch die in ihnen verwendeten
Sprachen und Alphabete. In den folgenden Abschnitten sollen die in diesem Zusam-
menhang relevanten Aspekte der digitalen Repräsentationsformen für textuelle Quellen
vorgestellt werden.
2.2.2 Zeichenrepräsentation
Geschriebene Sprache hat sich als Kulturtechnik erst allmählich etabliert. Lange Zeit
wurde Sprache ausschließlich gesprochen und war damit ein direktes Kommunikations-
mittel, das keinen physischen Träger besitzt und so auch keine archivierende Form der
Externalisierung von Wissen darstellt. Während zu Beginn der Schriftnutzung haupt-
sächlich genau diese langfristig bewahrende Eigenschaft der Schrift zur Dokumentation
wichtiger staatsgeschichtlicher oder religiöser Aussagen im Vordergrund stand
21
, eta-
blierte sich nach und nach die Nutzung von Schrift in der alltäglichen Kommunikation
und als Verwaltungswerkzeug geschrieben auf leicht transportablen und massenweise
verfügbaren Trägermedien.
Über viele Kulturen und Sprachen hinweg hat sich der Prozess der Verschriftlichung über
die Jahrhunderte und Jahrtausende ganz unterschiedlich vollzogen und so existieren
in der Folge auch sehr unterschiedliche Systeme der Nutzung von Schriftzeichen. Im
Wesentlichen lassen sich zwei Schriftsysteme unterscheiden: In der Logographie weist
jedes Zeichen eine gesonderte Bedeutung auf, die sich mit der anderer Zeichen zu kom-
plexeren Bedeutungen kombinieren lässt. In der Phonographie dagegen besitzen die
Zeichen lautliche Werte, die so in Sequenzen kombiniert werden können, dass sie (mehr
oder weniger direkt) den Lauten gesprochener Wörter entsprechen. Phonographische
Systeme kommen dabei in der Regel mit einem deutlich geringeren Zeichenvorrat aus.
21
wozu Schriftzeichen sprichwörtlich „in Stein gemeißelt“ wurden
31
2.2 Text- und Korpusrepräsentation
Weitergehende Erläuterungen zur Historie und feingranulareren Systematisierung von
Schriftsystemen und Schriftzeichen als deren Basis können z. B. in [Haa01] nachgelesen
werden. Dort findet sich auch ein für die Verarbeitung von Texten wichtiger Hinweis:
„Schriftsysteme operieren nach eigenen Prinzipien, die in partieller, aber nicht vollstän-
diger Wechselbeziehung zu sprachlichen Strukturen stehen.“
Dieser Überblick deutet bereits auf einige Herausforderungen für die diskrete Repräsen-
tation von geschriebener Sprache hin. Sollen Schriftzeichen, die auf physischen Medien
abgetragen sind, digital repräsentiert werden, so wird für sie die Zuweisung zu einem
konkreten numerischen Code notwendig. Dieser muss allen Kommunikationspartnern
bekannt sein, ebenso wie die genaue Form, Bedeutung und somit „Identität“ des dadurch
repräsentierten Zeichens. Für die Codierung eines Schriftsystems ist daher die Auflösung
von graphisch existierenden Mehrdeutigkeiten sowie eine Idealisierung von Symbolen
als Zusammenfassung hinreichend ähnlicher stilistischer Varianten notwendig, um einen
diskreten Satz von Zeichen festzulegen.
In der Anfangszeit der elektronischen Datenverarbeitung wurden Daten auf Lochkarten
gespeichert, wie im Exkurs zu den Wurzeln des
Humanities Computing
bereits erwähnt
wurde. Entsprechend des vorrangigen Einsatzgebiets im nordamerikanischen Raum ha-
ben sich zuerst Zeichensätze für das Lateinische Alphabet herausgebildet, wobei anfangs
zunächst keine Unterscheidung in Groß- und Kleinschreibung vorgenommen wurde.
Das Hinzufügen von weiteren Zeichen zum präferierten Zeichensatz ließ Formate mit
sieben Bit langer Kodierung (und damit 128 unterscheidbaren Zuständen) entstehen, bis
später eine Repräsentation mit acht Bit (also genau einem Byte) genutzt wurde. Die damit
abgedeckten Zahlen waren über verschiedene Codetabellen dann konkreten Alphabeten
zugeordnet. Die Angabe der Codetabelle war dabei nicht Bestandteil des Textinhalts und
somit in den meisten Fällen nicht eindeutig aus dem Inhalt ersichtlich.
Erst zu Beginn der 1990er Jahre wurde mit Unicode ein System für das Encoding aller er-
denklichen Alphabete und Schriftzeichen in einer gemeinsamen Codetabelle eingeführt.
Dabei wurde ein universellerer Ansatz der Repräsentation von der Graphemen und Gra-
phemgruppen, welche als Buchstaben verstanden werden, genutzt. Basis der Kodierung
ist eine konzeptionelle Trennung in Glyphen (
glyphs
), Zeichen (
characters
) und abstrakte
Zeichen (
abstract character
). Ein Überblick über die teils recht komplexe Kategorisierung
und die damit verbundene Nomenklatur findet sich im Glossary of Unicode Terms
22
.
22
http://unicode.org/glossary/
32
Kapitel 2 Forschungskontext und relevante Technologien
Mit dem Unicode Transformation Format (UTF) wurde eine Familie von konkreten Binär-
kodierungen für die Codepunkte von Unicode-Zeichen eingeführt, die teils eine variable
Bytelänge aufweisen und dennoch in Sequenz geschrieben und eindeutig ausgelesen
werden können. Für die Speicherung einzelner Zeichen werden dabei bis zu 32 Bit ver-
wendet. Übliche Varianten von Buchstaben, die meist durch das Hinzufügen sogenannter
„Diakritischer Zeichen“ entstehen, können oft als Einzelzeichen, daneben aber auch
stets als sequenzielle Kombination aus einer Basisglyphe und dem Zusatzzeichen kodiert
werden. Für diese Fälle enthält Unicode vier Normalformen, wovon die wichtigsten die
Normalization Form Canonical Composition (NFC) und die Normalization Form Cano-
nical Decomposition (NFD) sind. Beide sind „kanonisch äquivalent“
23
, stehen also trotz
unterschiedlicher bitweiser Darstellung auf logischer Ebene für die selben Zeichen und
sollten bei Zeichenkettenvergleichen (auf dieser Ebene) als identisch gewertet werden.
Darüber hinaus ergibt sich durch die binäre Speicherung und die diskrete Kodierung, dass
Zeichenähnlichkeit sich nicht aus numerischer Ähnlichkeit der Repräsentation ableiten
lässt. Auch in uneindeutigen Fällen muss jedoch eine der Kodierungsvarianten ausgewählt
werden, weshalb z. B. die Suche nach Wörtern mit einem speziellen Zeichen in beliebiger
Variante, die jeweils anderen nicht einschließt. In Abschnitt 3.6 auf Seite 91 wird die damit
verbundene Problematik der Normalisierung noch ausführlicher dargelegt. Insbesondere
zeitliche Aspekte und die damit verbundene Evolution von Schrift erzeugt uneindeutige
Situationen bezüglich Form und Verwendung einzelner Zeichen. Dabei können in der
Zeichentabelle immer nur klar abgrenzbare Verwendungskontexte einfangen werden.
Die Entwicklung des römischen V zum gerundeten U, deren Doppelung zum W, dessen
Transformation zum diakritischen hochgestellten Kleinbuchstaben
w
etc. sind in genau
diesen festen Stufen abbildbar nicht jedoch ihr Kontinuum von Zwischenschritten. Das
Beispiel ist aus
Unicode Explained
[
Kor06
] entlehnt, wobei die Problematik universeller
ist und z. B. auch analog für Ligaturen und daraus entstehende Buchstaben, wie das ß
oder veraltete Buchstabenvarianten, wie ſ (das lange „s“ im Deutschen) umfasst.
Vor der Standardisierung von Unicode wurden für die Eingabe und Speicherung von
Texten in nicht-lateinischen Alphabeten zum Teil auch nicht-standardisierte Hilfskons-
trukte geschaffen. Ein Beispiel ist die Verwendung von sogenanntem Betacode, einer
systematischen Umdeutung lateinischer Zeichen zur „sekundären“ Kodierung antiker
griechischer Texte: Κάδµος wird darin z. B. als
*
ka/dmos abgebildet.
23
siehe auch http://unicode.org/reports/tr15/
33
2.2 Text- und Korpusrepräsentation
Während für diese Problematik mit Unicode eine umfassende und saubere Lösung ge-
schaffen wurde (die jedoch eine komplette Neukodierung erfordert), enthält Unicode
andererseits noch viele Relikte aus früheren Zeichentabellen, mit z. T. recht kurioser
Bedeutung. An prominenter Codeposition Nummer Sieben findet sich z. B. ein Sonder-
zeichen namens „Bell“, das für eine akustische Meldung (Glockenschlag) anstatt eines
lesbaren, gedruckten Zeichens steht eine Praxis, die bis in die Zeit der Fernschreiber
zurückreicht. Auch weitere funktionale Codepunkte regeln Ausgabemodalitäten, so et-
wa der Wagenrücklauf und der Zeilenumbruch, die (neben Leerzeichen) Funktionen
für die Strukturierung von Text haben. Diese Strukturbildung als wichtiger Aspekt der
Textrepräsentation soll im Folgenden noch eingehender untersucht werden.
2.2.3 Repräsentation der Struktur von Text
In diesem Buch werden Texte als Analyseeinheiten angesehen, welche aus diskret be-
schreibbaren Einzelteilen bestehen, die selbst wiederum als Analyseeinheiten dienen
können. Mit dieser Sichtweise wird ein eher technisches Modell von Text entwickelt,
um Methoden der Informatik auf Texte anwenden zu können. Natürlich umfasst der
Textbegriff viele weitere Ebenen, welche als Lesarten (
Readings
) und tiefer greifende In-
terpretationen bei einer manuellen Analyse zum Ausdruck gebracht werden können. Für
die Erfassung von Texten in digitalen Systemen bedarf es jedoch einfacher und präziser
Beschreibungen, die dabei möglichst wenige Grundannahmen enthalten sollten.
Der Inhalt von Texten ergibt sich über die Abfolge von einzelnen Schriftzeichen und
Leerstellen. Über diese können in vielen Sprachen Wörter als sinntragende Einheiten
gebildet werden, welche ggf. noch von Interpunktion umgeben sind. Darüber können (je
nach Verwendungsmuster der Schriftsprache) noch größere Sequenz-Abschnitte, wie
Sätze, abgegrenzt und so direkt oder mittelbar aus der Einzelzeichenfolge abgeleitet
werden.
Die Sprache selbst besitzt eine komplexe, teils durchaus mehrdeutige Struktur, die Pro-
dukt der kulturellen Entwicklung der Menschheit sowie der Historie einzelner Spre-
chergruppen ist und die seit der Antike Untersuchungsgegenstand der „Grammatik“ ist.
Heute betreibt die Linguistik vielschichtige und nicht immer zueinander kompatible
Forschungen zu den Strukturen von Sprache. Die Abbildung solcher Strukturen wird
im Abschnitt 2.2.6 auf Seite 45 bei der Beschreibung von Annotationen vertieft. Hier
soll zunächst nur die zusätzliche Strukturierung innerhalb von Texten (als linearisierte
34
Kapitel 2 Forschungskontext und relevante Technologien
Form von Sprache) betrachtet werden, welche sich als „beabsichtigte“ Strukturierung
(vgl.
Intentional Structure
in [
GMPM13
]) auffassen lässt. Diese tritt im Wesentlichen als
Abschnittsbildung der oben beschriebenen Sequenzen hervor.
In Sequenzen existieren lokale Kontexte: Zeichen folgen auf andere Zeichen und Wörter
befinden sich in der Nachbarschaft anderer Wörter. Sätze stehen im Kontext vorheriger
(und nachfolgender) Sätze. Die Bildung größerer Einheiten (Zeichen, Wort, Satz, Absatz,
Kapitel, etc.) hat jeweils den Zweck, die natürlichen lokalen Kontexte an geeigneter Stelle
absichtlich zu unterbrechen.
Die Entscheidung über solche Trennungen inhaltlich schwächer zusammenhängender
Teile ist auf den kleinteiligeren Ebenen stark sprachabhängig. Zum Beispiel ist die Tren-
nung von Mehrwortbegriffen (
Multiword Units
) im Englischen gängige Praxis und im
Deutschen eher die Ausnahme. Auch die Untergliederung von Wortfolgen in Sätze ist
nicht beliebig möglich, sondern in großem Maße den Strukturen der Sprache geschuldet.
Auf höherer Ebene können Abschnittsbildungen als Strukturierungsmittel jedoch im
Wesentlichen frei verwendet werden. Konkret können inhaltliche Gründe oder stilistische
Entscheidungen für die Untergliederung sprechen. Jedoch sind oft auch die Limitierun-
gen und Eigenheiten des physischen (oder digitalen) Mediums ausschlaggebend für eine
Untergliederung von Texten das Platzangebot auf den Seiten eines Buches, das Format
von Karteikarten oder Formularvordrucken, die symmetrisch zu beschriftenden Seiten
des Sockels einer Statue, die Prägeflächen von Münzen, zeichenzahlbeschränkte Kurz-
mitteilungen und noch vieles mehr. Oft ist ein Zusammenspiel von „logischen“ als auch
„physischen“ Aspekten für die Untergliederung von Text verantwortlich.
24
Unterschiedliche Textgattungen bringen zum Teil ihre eigenen Strukturmerkmale mit,
wie z. B. Verse (ggf. mit Zäsuren) und Strophen. Größere Texte erfordern oft eine ge-
schachtelte Untergliederung in thematische Abschnitte, wie Kapitel und Unterkapitel.
Noch größere Textwerke sprengen die Limitationen von Trägermedien, so dass etwa
mehrbändige Buchveröffentlichungen entstehen. In [
RMD96
] werden weitere Beispiele
für solche Strukturelemente unter der Bezeichnung text objects gegeben.
Sequenztrennungen unterschiedlicher Stärke markieren die Grenzen unterschiedlicher
Hierarchiestufen der Strkturelemente. Dadurch entstehen Gruppierungseffekte für die
24
Stede und Suriyawongkul beschreiben in [
SS09
] neben der Logical Structure noch die sogenannte Content
Structure, durch welche der „Kommunikative Zweck“ des Textes transportiert wird. Diese Form der
Textstruktur als Ergebnis inhaltlicher Analysen wird im Kontext dieses Buches eher als eine Form
von Annotation angesehen und daher an dieser Stelle nicht detaillierter besprochen.
35
2.2 Text- und Korpusrepräsentation
Zuordnung kleinerer zu größeren Einheiten und alle diese zusätzlichen Ebenen tragen
ein Stück zur Auflösung der (z. T. mediengeschuldeten) Linearität des Textflusses bei. Das
Verständnis von Text als Mischung von Inhalten und Strukturinformationen ist wichtig
bei der diskreten Repräsentation in digitalen Systemen. Sie führt nicht zuletzt auch
Einheiten ein, auf die in der externen Kommunikation über den Text verwiesen werden
kann.
Unter Berücksichtigung dieser Vorüberlegungen ist klar, dass über die im letzten Ab-
schnitt vorgestellte Zeichenrepräsentation hinausgehend umfangreiche Methoden zur
maschinenlesbaren Repräsentation der Strukturen von Texten geschaffen werden müs-
sen, um sie für wissenschaftliche Analysen adäquat abzuspeichern.
Im Jahr 1990 untersuchten DeRose und Kollegen die Frage
What is Text really?
[
DDMR90
]
und erstellten dabei das bis dahin fortschrittlichste Textrepräsentations-Modell, welches
Text als Ordered Hierarchy of Content Objects (OHCO) auffasst. Dabei nutzen sie die
Modellierungsparadigmen der (sich damals noch in intensiver Entwicklung befindlichen)
Standard Generalized Markup Language (SGML). Die technische Umsetzung von Text-
strukturierung über die Auszeichnung des rohen Fließtextes (das sogenannte
Markup
)
mit einem hierarchischen Tag-System ist nach wie vor übliche Praxis. Das damit verbun-
dene Verständnis von Text als schriftlichen Inhalten in Zeichenkettenform, welche eine
singuläre Hierarchie und eine festgelegte lineare Reihenfolge besitzen, ist bis heute eine
populäre Vorstellung. Daran hat auch die bereits zwei Jahre nach dem Verfassen des oben
genannten Artikels in [RMD96] vorgenommene Neubewertung des gewählten Modellie-
rungskonzepts nichts geändert. Diese war unter dem Eindruck aufkommender Zweifel,
insbesondere bezüglich der mangelnden Eignung des OHCO-Modells für den Umgang mit
überlappenden Hierarchien notwendig geworden. Neben dem Aufzeigen von Gegenbei-
spielen, bei denen unifizierte Hierarchien nicht als geeignete Struktur-Repräsentation
gelten können, wird dort auch noch viel grundsätzlicher dagegen argumentiert, dass sich
eine umfassende, mehrere „Perspektiven“ (und damit Hierarchien) umfassende Struktu-
rierung überhaupt in geeigneter Weise in eine OHCO umformen lässt (decomposition).
Während dieser Umstand noch vor einiger Zeit als praktisch weniger relevant eingestuft
wurde (z. B. in [
Wit04
] für Anwendungen der Linguistischen Informationsmodellierung
25
),
kann er heute angesichts des Wunsches, immer mehr Annotationsebenen und Struktu-
rierungsvarianten gleichzeitig digital abzubilden, nicht mehr ignoriert werden. Bereits
25
In der Praxis ergeben sich durch diese Restriktion relativ selten Probleme, da verschiedene Strukturen häufig in
einer Hierarchie repräsentiert werden können.
36
Kapitel 2 Forschungskontext und relevante Technologien
2010 schrieb Schmidt in [
Sch10
] unmissverständlich:
Overlap is a serious problem in the
encoding of cultural heritage texts
Hieraus wird auch deutlich, dass keine zwei Perspektiven auf die Kodierung von Textstruk-
tur einander gleichen. Soll der Pluralismus von Strukturierungsansätzen für konkrete
Anwendungsfälle bei der Schaffung allgemeingültiger Textmodelle berücksichtigt wer-
den, erfordert dies einen intensiven inhaltlichen Austausch in der Forschungscommunity.
Diese Aufgabe wird seit den 1980er Jahren von der Text Encoding Initiative (TEI) übernom-
men. Das Gremium entwickelt das gleichnamige Auszeichnungsmodell für die Kodierung
von Textquellen. In [
Bur14
] wird die TEI zurecht als
one of the longest-lived and most influ-
ential projects in the field now known as the Digital Humanities beschrieben.
Die aktuellen TEI Gudelines P5 2.0“, s. [
TEIP5
], umfassen 1636 Seiten, auf denen die
verschiedensten Überlegungen und Probleme dokumentiert sind, die im Kontext der
Abbildung von textuellem Quellenmaterial für den Einsatz in den e-Humanities relevant
sind. Für eine Vielzahl an Editions-Methoden und -Szenarien wird ein Schema für die
Erzeugung von TEI-Dokumenten in XML, angegeben
26
. Es wird also gewissermaßen ein
Vokabular und die Grammatik vorgegeben, mit denen sich um maschinenlesbares Markup
ergänzte Texte erfassen und verarbeiten lassen.
Angesichts des großen Umfangs des TEI-Standards mit unzähligen nicht standardisierten
Kombinationsvarianten von Markup für die Modellierung von Sonderfällen wurden zahl-
reiche, „handlichere“ und strengere Unterformate erstellt. Das vom Deutschen Textarchiv
konzipierte Basisformat
27
, das vom Institut für deutsche Sprache entwickelte und mit TEI-
Entwicklungen synchronisierte Textmodell
28
, aber auch das von der TEI selbst entwickelte
TEI-Simple
29
versuchen, eine Ausgangsbasis für einheitliche TEI-konforme Dokumente
zu schaffen.
Als ganz ähnlich zu TEI ist die im CTS vertretene Auffassung der Struktur von Text als
Hierarchie zitierbarer Einheiten anzusehen, die im Wesentlichen auch der OHCO folgt.
Für kanonischen Text ist diese Sichtweise unbedenklich, da sie genau die Wissenschafts-
kultur widerspiegelt, in der eine Primärhierarchie herausgegriffen und als Zugangsform
festgelegt wird. Diese kann auch als Grundlage für Editionen verwendet werden und
gewährleistet die Möglichkeit zur standardisierten Referenzierung von Einheiten.
26
Frühere TEI-Versionen nutzen noch die SGML.
27
http://www.deutschestextarchiv.de/doku/basisformat
28
http://www1.ids-mannheim.de/kl/projekte/korpora/textmodell.html
29
http://github.com/TEIC/TEI-Simple
37
2.2 Text- und Korpusrepräsentation
Für andere, allgemeinere Anwendungsfälle häuft sich aber wie bereits erwähnt spätes-
tens ab der Jahrtausendwende die Kritik an der Textrepräsentation als OHCO. Grundsätz-
licher Konsens ist, dass die digitale Textrepräsentation das Vorhandensein eines Modells
voraussetzt, wie z. B. Buzzetti in [Buz02] schreibt:
In and of itself, every representation and, consequently, every form of text represen-
tation entails the implicit or explicit assumption of a model, at least if we accept the
postulate that the "map is not the territory".
Zur Definition eines adäquaten Modells für Text wird eine geeignete Abstraktionsstufe
benötigt, welches die Defizite der OHCO-Sichtweise ausgleicht. Dafür wurde allerdings
bis heute keine allgemeingültige Lösung gefunden.
In [
Bra05
] wird die Ergänzung von hierarchischen XML-basierten Textrepräsentatio-
nen um nicht-hierarchische Elemente vorgeschlagen, wobei die damit eingeführten
Verknüpfungen und Querverweise stets als Modellierungskonstrukte „zweiter Klasse“
angesehen werden müssen, die über Standardwerkzeuge im XML-Umfeld nur unbefriedi-
gend genutzt werden können. Daher gibt die gewählte Primärhierarchie immer noch die
dominierende Modellierungs- und Analyse-Sichtweise vor. Auch die in Abschnitt 2.2.6
auf Seite 43 näher vorgestellten Methoden zur Annotation von Texten können grund-
sätzlich für Strukturauszeichnungen verwendet werden in der Praxis ist dies jedoch
ebenfalls mit Problemen und fehlender Werkzeugunterstützung verbunden, so dass diese
Repräsentationsmöglichkeit selten genutzt wird.
Auchandere Formen der Verknüpfungvon Strukurelementen wurden untersucht.HyTime
z. B. arbeitet mit Hyperreferenzen und verfügt laut Selbstbeschreibung über very effec-
tive constructs to support the basic hierarchical component structure of most documents
[
DD94
].
Allerdings handelt es sich auch hierbei um ein frühes, SGML-basiertes Format ohne nen-
nenswerte Werkzeugunterstützung. Generell soll zur Fokussierung des in diesem Buch
beschriebenen Textmodells eine Abgrenzung gegenüber Hypertexten stattfinden. Hy-
pertextualität in schwacher Form wie bei Webseiten genutzt, bis hin zu ausgeklügelten
Kozepten, wie beim Project Xanadu
30
ist typischerweise (noch) kein breiter Forschungs-
gegenstand der e-Humanities. Zudem wurden moderne Formen von Hypertext beispiels-
weise in [Meh09] bereits mit graphbasierten Modellen beschrieben.
30
http://www.xanadu.net/
ein seit 1960 laufendes Projekt mit der Vision von Dokumenten, die Teile
anderer Dokumente „virtuell“ enthalten können, inklusive einer Verbreitungs-, Lizensierungs- und
Abrechnungsinfrastruktur, vgl. [Nel93]
38
Kapitel 2 Forschungskontext und relevante Technologien
Die digitale Text- und Strukturrepräsentation dient, wie am Beispiel der TEI gezeigt,
als explizites konzeptionelles Modell, aber auch als Speicherformat. In den weiteren
Ausführungen werden solche Formen der technischen Textrepräsentation ausgeklam-
mert, die kein allgemeineres Modell von Text beinhalten, etwa Strukturen wie Text-
Buffer
von Editoren zum effizienten interaktiven Editieren und Transformieren von Zeichen-
ketten. Dagegen besitzen die ebenfalls eher technischen Ansätze in der automatischen
Textanalyse, wie beschrieben, sehr große Relevanz für die beschriebenen Arbeiten. Die
dort üblichen Repräsentationsformen werden daher gesondert im folgenden Abschnitt
vorgestellt.
2.2.4 Textrepräsentation im Text Mining
Die digitale Textrepräsentation kann vielfältig geschehen und wird meist aufgabenorien-
tiert festgelegt. In den informatiknahen Bereichen der e-Humanities steht die maschinelle
Auswertung der Texte im Vordergrund: Das
Text Mining
stellt Werkzeuge für die Extrak-
tion relevanter sachlicher und inhaltlicher Zusammenhänge aus digital vorliegenden
Texten bereit, vgl. [
HQW08
]. Bei Texten handelt es sich (aus dieser Sichtweise betrachtet)
im Grunde um unstrukturierte Daten, auf die statistische und regelbasierte Verfahren
angewendet werden. Es handelt sich allerdings um eine spezielle Form des
Data Mining
, bei
welchem die Besonderheiten natürlicher Sprache sowie heterogener und unstrukturier-
ter Quellen berücksichtigt werden müssen. Es bewegt sich damit im Forschungsbereich
des Natural Language Processing (NLP), also der automatischen Sprachverarbeitung.
Computerlinguistische Forschung wird dabei nicht primär betrieben, wobei einzelne
Ergebnisse oder digitale Werkzeuge aus diesem Forschungsbereich bei entsprechender
Eignung durchaus in Text-Mining-Verfahren einfließen können.
Im Text Mining werden die in persistierter Form vorliegenden Daten üblicherweise trans-
formiert und in einen anderen Verarbeitungs-Zustand überführt, bevor die eigentlichen
Verfahren und Analysen zur Anwendung kommen. Übliche Schritte sind die Untertei-
lung und Diskretisierung der Zeichensequenzen in untersuchungswürdige Einheiten.
Oft wird für diese aus Effizienzgründen eine (meist fortlaufende) numerische
Feature
-ID
vergeben und damit von der buchstabengetreuen Repräsentationsform abstrahiert. Über
die zu untersuchenden Analyseeinheiten werden dann häufig Matrizen gebildet, die das
Vorkommen innerhalb größerer Einheiten ausdrücken. Dabei kann es sich um Struktur-
elemente mit logischer Entsprechung (wie im vorigen Abschnitt beschrieben) handeln,
39
2.2 Text- und Korpusrepräsentation
aber auch um rein künstlich segmentierte Einheiten, wie „Buchstaben-
n
-gramme“
31
, die
statistisch erfasst werden sollen.
Als theoretische Basis und methodischer Ausgangspunkt für die Analyse der Bedeutung
von Wörtern (bzw. Wortbestandteilen) über Methoden der Statistik wird meist die Vor-
stellung von einer „Distributionellen Semantik“ genannt. Diese geht auf Überlegungen
von Ferdinand de Saussure aus dem frühen 20. Jahrhundert zurück, die dem sogenann-
ten Strukturalismus einer Strömung in der Linguistik zugerechnet werden.
32
Die
Bedeutung von Wörtern hängt demnach wesentlich von den Kontexten ab, in denen es
verwendet wird und somit auch von den Bedeutungen (und Kontexten) der gemeinsam
mit ihnen auftretenden Wörtern.
Zur Bedeutungsanalyse werden daher oft kookkurrenzbasierte Verfahren herangezogen,
die gemeinsames Auftreten von Wörtern in irgend geeigneter Form quantifizieren (und
dabei meist eine Art statistischer Signifikanz erfordern). Auch Verfahren, die Wörter
nach ihren Kontexten gruppieren, leiten sich direkt aus diesen Überlegungen ab. Durch
diskrete Untersuchungseinheit der Wörter kann wenn man diese als unabhängige
Dimensionen betrachtet ein Vektorraum aufgespannt werden. Ein detaillierter und sehr
informativer Überblick über die so formulierbaren
Vector-Space
-Modelle wird in [
TP10
]
gegeben
33
.
Wird die Vektorrepräsentation von Wörtern für alle Kontexte gesondert vorgenommen,
ergibt sich eine Matrix, deren einzelne Werte das Vorkommen des jeweiligen Wortes
im jeweiligen Kontext anzeigen. Automatische Analysen der Wortbedeutung versuchen
oft, eine kondensierte Kontextrepräsentation zu finden, aus der sich die Originalmatrix
in möglichst ähnlicher Form rekonstruieren lässt, wobei verschiedene Formen der Di-
mensionsreduktion zum Einsatz kommen. Generell werden im Text Mining Verfahren
aus verschiedensten Bereichen angewendet, wie der linearen Algebra, der statistischen
Approximation, den künstlichen neuronalen Netzen oder der Optimierungsprobleme.
Aktuell gilt einiges Forschungsinteresse den Arbeiten zu sogenannten
Word Embeddings
.
Deren Entwicklung kann in [
Sah15
] detailliert nachgelesen werden. In diesem Artikel
werden insbesondere auch die konzeptionellen Beiträge von einigen Wegbereitern des
Text Mining, wie Zellig Harris, John Rupert Firth und Ludwig Wittgenstein, angesprochen.
31
n
-gramme sind Teilsequenzen der Länge
n
Buchstaben-
n
-gramme sind also alle Teilzeichenketten,
die aus n nacheinander in der Originalzeichenkette auftretenden Buchstaben gebildet sind.
32
Diese eine Einschätzung wird mittlerweile z. T. auch hinterfragt, wie etwa in [Jäg07].
33
Wobei die dort geäußerte alleinige Zuschreibung der grundlegenden Idee zu Gerard Salton von anderen
Autoren bezweifelt wird, vgl. [Dub04].
40
Kapitel 2 Forschungskontext und relevante Technologien
Diese hier umfassend nachzuzeichnen, würde den Rahmen des Buches jedoch sprengen.
Beim Erfassen von Kontexten wird häufig der sogenannte
Bag-of-Words
-Ansatz gewählt,
der innerhalb der Kontexte reine Frequenzen (also Anzahlen) betrachtet und dabei die
Reihenfolge von Wörtern ignoriert. Um die syntaktische (speziell nach de Saussure „syn-
tagmatische“) Struktur der Texte dennoch berücksichtigen zu können, geschieht neben
der Betrachtung von Wörtern teils auch eine Bildung von Wort-
n
-Grammen. Auch ei-
gene Repräsentationsformen für gleichzeitige Abbildung von Wortbedeutung und Rei-
henfolgeinformationen ist möglich, wie z. B. in [
JM07
] durch ein „zusammengesetztes
holographisches Lexikon“.
Inhaltsbestimmung, Ähnlichkeitsbestimmung und Gruppierung von Dokumenten sind
eng miteinander verwandt. Die oben angesprochene Dimensionsreduktion des Auftretens
von Wörtern in Kontexten kann auch genutzt werden, um die Kontexte zu vergleichen,
wobei Dokumente (wenn sie in einer homogenen Kollektion vorliegen) natürlich ge-
eignete Kontexte für die Analyse darstellen. Entsprechend haben sich mit dem
Latent
Semantic Indexing
(bzw.
Latent Semantic Analysis
) [
DDL
+
90
], dessen probabilistischer Vari-
ante [
Hof99
] und den auf bayesscher Statistik beruhenden Topic Models allen voran der
Latent Dirichlet Allocation
[
BNJ03
] Verfahren entwickelt, die die Zusammensetzung von
Dokumenten aus (wenigen) latenten „Bedeutungsclustern“ von Wörtern postulieren und
diese aus Daten errechnen. Für Aufgaben des
Information Retrieval
, also des Auffindens re-
levanter Dokumente angesichts eines Informationsbedürfnisses liefert diese kondensierte
Repräsentationsform eine geeignete zusätzliche Entscheidungshilfe. Die klassischen For-
men der Textrepräsentation im Information Retrieval sowie Formen der Indizierung von
Dokumenten in Kollektionen werden noch eingehender in Abschnitt 3.7.1 auf Seite 95
beschrieben. Eine Abgrenzung zu erweiterten „Dokument“-Begriffen wird im folgenden
Abschnitt vorgenommen.
2.2.5 Dokumentrepräsentation
Als Dokumente werden üblicherweise Einheiten textueller Inhalte bezeichnet, die oft
in weitestgehend statischer Form vorgehalten werden. Klassische Dokumente sind auf
physischen Trägern festgehaltene Texte, die dort in visueller Form mitsamt ihrer Struktur
ablesbar sind, wozu das Verständnis des gewählten Layouts (z. B. zweispaltige Artikel mit
eingerückten Zitaten) erforderlich ist. Digitale Dokumente sind Sammlungen von Einzel-
informationen, aus denen sich bei Bedarf ein (elektronisch angezeigtes oder gedrucktes)
41
2.2 Text- und Korpusrepräsentation
Dokument ableiten lässt. Welche Prozesse an dieser Ableitung beteiligt sind und wie
explizit das Dokument Informationen über die spätere visuelle Dokumentenerscheinung
enthält, ist dabei sehr stark von Technologie und dem jeweiligen Einzelfall abhängig.
Bei E-Books liegt der Fokus neben dem reinen Text zusätzlich auch auf der Repräsentation
der Textstruktur und der dokumentbegleitenden Metadaten. Die konkrete Anzeige richtet
sich jedoch in der Hauptsache nach den Einstellungen und (physischen) Eigenschaften des
E-Book-Readers, wie präferierter Schriftart, Displaygröße oder der Bildschirmausrichtung
bei tragbaren Endgeräten. In dieser Hinsicht sind E-Books vergleichbar mit Dokumenten,
die in der im World Wide Web (WWW) verwendeten Hypertext Markup Language (HTML)
verfasst sind. Diese unterstützt Querverweise (
Hyperlinks
) zwischen WWW-Ressourcen,
aber auch zwischen Dokumentteilen. Darüber hinaus erlaubt sie die Einbindung von
Bildern, Audio- und Videodateien über die Uniform Ressource Locator (URL) genannte
Webadresse einer solchen Mediendatei. In HTML wird das Aussehen im Wesentlichen über
sogenannte Cascading Style Sheets (CSS) definiert, in denen die Layoutinformationen
deklarativ auf Grundlage der Dokumentstruktur notiert sind.
HTML ist ein ehemals SGML-basiertes Markupformat, das zwischenzeitlich in XML neu-
formuliert wurde, bevor es nun wieder losgelöst davon weiterentwickelt wird. Im Umfeld
von XML existieren mit der XML Stylesheet Language (XSL) weitere Werkzeuge zur
Umformung von strukturierten inhaltstragenden Dokumenten in alternative (ggf. um
Layoutinformationen ergänzte) Repräsentationsformen. Die Erstellung anzeigbarer Doku-
mente aus XML-basierten Daten- oder Textsammlungen geschieht durch Transformation
(gegebenenfalls auch erst auf Anfrage
on-the-fly
“) über die XSL Transformation (XSLT).
Mit den XSL Formatting Objects (XSL-FO) steht ein Formatierungen tragendes Dokumen-
tenformat für diesen Prozess zur Verfügung. Auch gängige Büroanwendungen verwenden
zum Teil XML-basierte Formate, in denen Inhalt, Struktur, Layout und Metadaten in auf
den Funktionsumfang und die Bedürfnisse des jeweiligen Programms abgestimmter Form
abgebildet werden. Beim Prozess der Optical Character Recognition (OCR), bei dem aus
Bilddateien digitalisierter Druckerzeugnisse maschinenlesbare Texte generiert werden,
wird ebenfalls eine um Aspekte des Dokumentlayouts erweiterte Repräsentationsform
benötigt. In der Praxis wird dafür z. B. das HTML-basierte Format „hOCR“
34
verwendet.
Abseits der auch menschenlesbaren Formate hat sich aus dem Bereich der technischen
Buchherstellung (der sogenannten Druckendstufe) heraus das Portable Document Format
(PDF) als ein effizientes Binärformat etabliert. Dieses wird seit Längerem auch für die
34
http://kba.github.io/hocr-spec/1.2/
42
Kapitel 2 Forschungskontext und relevante Technologien
elektronische Betrachtung und den digitalen Austausch von Dokumenten eingesetzt.
Wegen weithin fehlender Möglichkeiten, Änderungen an den Dokumenten vorzunehmen,
wird ihnen gemeinhin ein gewisser „Urkundencharakter“ zugesprochen, was z. B. ihren
Einsatz für bestimmte Zwecke der Verwaltung befördert hat.
Wie gezeigt, existieren zahlreiche Formate und Konzepte zur anzeigenahen Repräsentati-
on von Dokumenten. Das Erfassen von Informationen über Layout, physische Beschaffen-
heit und Aussehen von Dokumenten ist jedoch nicht Gegenstand dieses Buches, da das
Recherchesystem auf eine semantische Repräsentation der Texte ausgerichtet sein soll.
Zwar sind, etwa in [
Aud08
], bereits Ansätze beschrieben worden, die maschinenlesbare
Repräsentationsformen und Analysemodi insbesondere für komplexe Dokumente entwi-
ckeln
35
noch sind diese jedoch nicht Gegenstand breiter Forschung. Zudem bringen sie
einen stark erhöhten Komplexitätsgrad für die Auswertung mit sich, der hier zunächst
vermieden werden soll.
2.2.6 Repräsentation von Metadaten und Annotationen
Die bereits in Abschnitt 2.1.3 auf Seite 25 vorgestellte inhaltliche, strukturelle und fach-
spezifische Vielfalt der zu erfassenden Metadaten führt dazu, dass sich für diesen Aspekt
der Datenverarbeitung viele unterschiedliche Lösungsansätze entwickelt haben. Bevor
einige davon genauer vorgestellt werden, soll zunächst noch einmal kurz erörtert wer-
den, worum es sich bei Metadaten überhaupt handelt. Die informelle Beschreibung als
„Daten über Daten“ greift in vielen Anwendungsszenarien deutlich zu kurz. Ob z. B. eine
Autorenangabe ein Metadatum ist, hängt von der konkret eingenommenen Perspekti-
ve ab. Für einen Datenbestand, in dem Zeitungstexte verwaltet werden, ist sie eine (in
vielen Fällen verzichtbare) Zusatzinformation. In bibliographischen Datensätzen ist der
Buchautor dagegen Teil der verwalteten Kerninformation: „Daten über Bücher“ nicht
„über Daten“. Der Teilbegriff der Meta-„Daten“ ist zudem etwas unglücklich gewählt, da
Daten meist eine sehr rohe und wenig interpretierbare Einheit darstellen, aus der ohne
Kenntnis ihrer genauen Struktur keine Information abgeleitet werden kann. Im Rahmen
dieser Arbeit soll im Hinblick auf diese beiden Aspekte allerdings keine allzu strenge
Abgrenzung erfolgen. Alle „zusätzlichen“ Informationen in einer Wissensbasis, deren
schematische Bedeutung erklärbar ist
36
, werden hier als Metadaten bezeichnet.
35
wie etwa digitalisierte Handschriften, Notizen, Skizzen, Logbücher, Collagen usw.
36
Das heißt, es soll bekannt sein, welchen Aspekt ein Metadatum beschreibt. Die genaue Bedeutung des
eingetragenen Wertes muss dabei nicht näher spezifiziert (oder bekannt) sein.
43
2.2 Text- und Korpusrepräsentation
Im Kontext dieses Buches handelt es sich bei Metadaten meist um allgemeine Zusatzinfor-
mationen zu einem Text oder zu größeren Teilen davon. Damit besitzen sie eine gewisse
Nähe zu Markup, worüber wieder eine enge Verknüpfung mit der Strukturrepräsentation
entsteht. Beispielsweise ist die Metainformation „Das Buch ist in fünf Kapitel gegliedert.“
vollständig aus der Struktur ableitbar.
Textbezogene Metadaten sind das wichtigste Zugangsinstrument zu digitalisierten Text-
kollektionen. In [
Nun09
] wird in diesem Zusammenhang massive Kritik an der oberfläch-
lichen Digitalisierungsweise im Google-Books-Projekt
37
geübt, welches große Defizite
hinsichtlich der Qualität (insbesondere Vollständigkeit und Korrektheit) der erfassten
Metadaten aufweist. Solche ungenügend kuratierten Zugriffsmechanismen behindern
die wissenschaftliche Arbeit mit Korpora enorm.
Metadaten sollten im Idealfall maschinenlesbare Inhalte besitzen und eine angemessene
digitale Repräsentation der jeweiligen Zusatzinformationen darstellen. Für viele Quer-
schnittsaspekte, wie Ort und Zeit sowie Angaben zu deren jeweiligen Granularitäten und
der Unsicherheit seitens des Erfassers konnte jedoch noch kein allgemeingültiger Reprä-
sentationsstandard erstellt werden. Auch für fachbezogene Aussagen fällt es oft schwer,
einheitliche Standards für Metadaten zu etablieren. Um eine Einigung hinsichtlich der Be-
deutung konkreter Metadatensätze zu erreichen, bietet es sich an, sogenannte Ontologien
zu modellieren, eine Form semantischer Netze, auf die später noch genauer eingegangen
wird. Die Modellierung kann dabei ausgehend von grundsätzlichen Überlegungen zur
konzeptuellen Einteilung der Anwendungsdomäne (
top down
) oder ausgehend von der
Gruppierung einzelner Phänomene und Datensätze (
bottom up
) erfolgen. Für die Etablie-
rung standardisierter Ontologien ist in der Regel eine inhaltliche und organisatorische
Zusammenarbeit in größeren Gremien und Konsortien notwendig.
Im Bibliothekssektor haben sich Metadatenmodelle wie das MAchine-Readable Cataloging
(MARC) und das Metadata Object Description Schema (MODS) herausgebildet. Viele Insti-
tutionen haben dabei eigene Erweiterungen an diesen Modellen vorgenommen, stimmen
jedoch im Kernbereich mit dem Einheitsmodell überein. Allgemeine Referenzmodelle,
wie das bereits angesprochene CIDOC-CRM, ermöglichen eine konzeptuelle Zusammen-
führung von Modellen unterschiedlicher, aber verwandter Ressorts, etwa von Archiven
und Museen oder Bibliotheken und digitalen Textrepositiorien. Für die dadurch ermög-
lichte Nutzung von Infrastrukturen stellt sich die Frage, ob aus allen Teilmodellen ein
einziges zentralisiertes Modell erzeugt werden soll, oder die Infrastruktur eine logische
37
http://books.google.de/
44
Kapitel 2 Forschungskontext und relevante Technologien
Verknüpfung dezentralisierter Metadatenrepositorien vornimmt. In CLARIN kommt mit
der Component Metadata Infrastructure (CMDI) eine Technologie für letzteres Szenario
zum Einsatz, die nachnutzbare Schema-Komponenten für die Definition eigener Metada-
tenformate bereitstellt. Auf diese Weise gelingt es in der föderierten Umgebung gleiche
Metadatenteile zusammenzuführen und unterschiedliche Teile als solche zu isolieren
und für spezifische Abfragen dennoch nutzbar vorzuhalten.
Annotationen sind eine spezielle Form von Metadaten, die für kleine Ausschnitte der
Daten, wie Textstellen, Bildregionen, Einzeltonfolgen usw. notiert werden. Auch sie sind
eng mit dem Begriff des Markup verbunden. Es zeigt sich in der Praxis jedoch häufig
eine leicht unterschiedliche Ausrichtung: Annotationen sagen meist etwas über einen
(externen) digital abzubildenden Text aus, während mittels Markup üblicherweise eher
deklariert wird, wie ein bestimmter Textteil (durch eine Maschine) zu interpretieren ist.
Renear kritisiert in [
Ren01
] im Hinblick auf die TEI grundsätzlich die Unterscheidung
von Markup in die Kategorien
descriptive
und
procedural
. Schmidt weist in [
Sch14
] auf
das
TEI-Paradox
hin, indem er aufzeigt, dass, obwohl die XML-basierte Technologie auf
vollständige Interoperabilität ausgelegt ist, ein einzelnes TEI-kodiertes Dokument auf
der Ebene der Bedeutung von Tags nicht interoperabel ist.
Auch durch solche Erkenntnisse hat sich die Praxis des Notieren von Annotationen direkt
im Dokument (
inline
) schrittweise zur Nutzung von losgelösten Annotationen (
stand-off
)
gewandelt, vgl. z. B. [
BW09
]. Stand-Off-Annotation können, wie bereits angesprochen,
auch zur Auszeichnung von Struktur verwendet werden. Für alle Anwendungsgebie-
te benötigen sie eine eindeutige Positionierungsmöglichkeit in den Dokumenten, um
Beginn und Ende einer Annotation korrekt numerisch angeben zu können. Für den Po-
sitionierungs-
Offset
werden genaue Angaben zur Zählweise benötigt graphemweise,
codepunktweise, byteweise, wortweise oder über per Markup definierte Anker.
Annotationen können durch automatische Verfahren vorgenommen werden oder durch
manuelle Bearbeiter ergänzt werden. Während im Bereich der e-Humanities durch große
Korpora oft sehr umfangreiche Annotationsaufwände anfallen, die nur selten mit auto-
matischen Hilfsmitteln in ausreichender Qualität bewältigt werden können, ist in diesem
Bereich für die manuelle Annotation nicht immer tiefes Fachwissen nötig. Dies eröffnet
Möglichkeiten für die Beteiligung von fachfremden Freiwilligen, in Form von
Citizen-
Science
-Projekten und in
Crowdsourcing
-Umgebungen, wobei ein mehrfaches Annotieren
der gleichen Stellen durch verschiedene Bearbeiter zur Vermeidung sporadischer Fehler
angeraten ist.
45
2.3 Graphdatenbanken
Nachdem die Komplexität der Text- und Korpusrepräsentation nun auf verschiedenen
Ebenen vorgestellt wurde angefangen bei der Codierung einzelner Zeichen bis hin
zur Repräsentation von heterogenen Sammlungen annotierter Dokumente soll in den
nächsten Abschnitten untersucht werden, welche Technologien für Speicherung und Ab-
frage solcher Daten zur Verfügung stehen. Ausgehend von der Transition der traditionell
relationalen Datenbanklandschaft zu einem Ökosystem aus einer Vielzahl neuer Ansätze
und Systeme sollen insbesondere die Paradigmen zum Umgang mit hochverknüpften Da-
tensammlungen herausgegriffen werden, denn: Eine flexible Textrepräsentation benötigt
flexible Formen der Verknüpfung von Daten.
2.3 Graphdatenbanken
2.3.1 NoSQL-Datenbanken
Um die aktuellen Entwicklungen im Datenbanksektor besser einordnen zu können, bedarf
es zunächst eines kurzen Rückblicks auf die Historie dieser Technologie. Einen lesens-
werten, weil sehr breiten (und entsprechend wenig tiefgreifenden) Abriss über relevante
Entwicklungen gibt z. B. [
LC13
]. An dieser Stelle sollen nur kurz Schlaglichter auf einzelne
relevante Entwicklungsschritte geworfen werden:
Während der Bedarf an Speicherung und Prozessierung großer Mengen von Daten bis in
die Anfangszeit der Rechnersysteme zurückreicht die Geschichte des
Index Thomisticus
ist dafür nur ein Beispiel von vielen so waren die damaligen Rechnersysteme nicht
mit unserer heutigen Vorstellung von Datenbanksystemen vergleichbar. Eingabe und
Ausgabe erfolgten rein sequenziell, ein Zugriff auf einzelne
Records
war zwar bei Kartei-
karten theoretisch noch möglich, jedoch bei Magnetbändern nicht effizient (und damit
ökonomisch vertretbar) zu bewerkstelligen.
Erst mit dem Aufkommen von wahlfreiem Zugriff auf gespeicherte Dateien nach der Erfin-
dung von Festplatten wurden Aufgaben der individuellen Datenspeicherung und Abfrage
relevant. Als Analogie für die neuen Zugriffsmechanismen wurde (auch aus Gründen der
Kontinuität) hauptsächlich die Karteikarte und die Tabelle gewählt. Formelle mathema-
tische Beschreibungen wurden in Form der Relationalen Algebra eingeführt, während
sich in der Praxis Create, Read, Update, Delete (CRUD) als die vier Grundoperationen für
persistierte Daten etablierten.
46
Kapitel 2 Forschungskontext und relevante Technologien
Mit wachsendem Verständnis der mathematischen Implikationen und mit steigender Zahl
an Anwendungsszenarien wurde der Fokus dann auf die Formulierung und Prüfung von
Konsistenzbedingungen für die Datenbestände gelegt. Zur Vermeidung von Redundanzen
durch die nicht wenige Inkonsistenzen hervorgerufen werden können wurde der Fokus
auf die Forschung an sogenannten Normalformen für die Datenmodellierung gelegt. Zu
Beginn der 1970er Jahre wurde die bis heute relevante, auf früheren Arbeiten aufbauende
(und teils zu vorhergehenden Definitionen äquivalente) Boyce-Codd-Normalform
38
vor-
gestellt, vgl. [
Cod74
]. Um die Konsistenz der Daten auch in Mehrbenutzerszenarien mit
konkurrierenden Zugriffsmustern zu gewährleisten, wurden Transaktionskonzepte und
grundsätzliche Systemanforderungen, wie Atomicity, Consistency, Isolation, Durability
(ACID) definiert, vgl. [HR83].
Das relationale Datenbankmodell war zu diesem Zeitpunkt bereits das am häufigsten
verwendete und es wurden viele Werkzeuge und Vorgehensmodelle für den Umgang
damit geschaffen, etwa das Entity-Relationship Model (ERM) zur abstrakten (graphischen)
Formulierung von Daten- und Domänenmodellen, vgl. [
Che76
]. Mit der Standardisierung
der Structured Query Language (SQL) als herstellerübergreifende Abfragesprache wurden
die relationalen Datenbanken der Quasi-Standard für Datenhaltung. Da parallel zu diesen
Entwicklungen in großer Zahl Arbeitsplätze mit Bürorechnern ausgestattet wurden
und immer mehr Planungs-, Verwaltungs- und Kommunikationsaufgaben in digitalen
Systemen erledigt wurden, konnten sich diese Datenbanksysteme als Speicher-
Backend
für eine Vielzahl von Fachanwendungen durchsetzen, wodurch das Marktvolumen für
Datenbanktechnologien noch einmal enorm anstieg.
Seitdem wurden kommerzielle Weiterentwicklungen hauptsächlich innerhalb des da-
durch abgesteckten Technologierahmens umgesetzt und es konnten viele (auch aus Sicht
der Informatik wertvolle) Optimierungen umgesetzt werden allerdings waren seitdem
wenige „die Grundfesten erschütternde“ Neuerungen zu verzeichnen. Im Geschäftsbe-
trieb haben sich im Wesentlichen zwei Anwendungsfälle herauskristallisiert, die auch in
technologischer Hinsicht zu unterschiedlichen Produkten geführt haben. Datenhaltung
und Abfrage im Umfeld von Geschäftsanwendungen verfolgen entweder die Strategie
des On-line Transaction Processing (OLTP) oder die des On-line Analytical Processing
(OLAP), s. [
HW05
]. OLTP setzt den Fokus auf interaktive Abfragen, während OLAP die Mög-
lichkeit für aufwändige Analysen auf dem gesamten Datenbestand in einer verzögerten
Ausführung bietet.
38
nach Raymond F. Boyce und Edgar F. Codd
47
2.3 Graphdatenbanken
OLAP-Systeme, die auch als
Data Warehouses
bezeichnet werden, gewinnen zunehmend
an Bedeutung für die Forschung, wenn Auswertungen im Bereich von Big Data notwendig
sind. Bei sehr großen Datenmengen ist eine Verteilung auf mehrere physische Rechnersys-
teme notwendig, wobei es (aus der Theorie ableitbare) grundsätzliche Einschränkungen
im Bezug auf die Leistungsfähigkeit des Gesamtsystems im verteilten Szenario gibt. Das
als Consistency, Availability, Partition tolerance (CAP) bekannte Theorem besagt, dass
die Konsistenz der verteilten Daten (C), die Verfügbarkeit und Geschwindigkeit des Sys-
tems (A) sowie dessen Toleranz gegenüber Ausfällen und Störungen (P) nicht gleichzeitig
optimal sein können, sondern maximal zwei davon.
Diese Ausgangssituation einer omnipräsenten, weitestgehend statischen Datenbanktech-
nologie, die vor erhebliche Skalierungsprobleme gestellt war, bildete den Nährboden für
unabhängige Neuentwicklungen. Hauptsächlich im Rahmen von
Open-Source
-Projekten
wurde an Alternativen zu relationalen Datenbanken gearbeitet, bis eine Vielzahl solcher
Ansätze schließlich in einer Initiative namens Not only SQL (NoSQL) zusammengefasst
wurde. Ausdrücklich wenden sich die dort gebündelten Projekte nicht gegen relationale
Datenbanken an sich, sondern gegen die Monokultur, die von diesen begründet wurde und
durch welche Auswahlmöglichkeiten beschränkt wurden. Nicht jeder Anwendungsfall be-
nötigt ACID-Eigenschaften, nicht jeder Anwendungsfall benötigt alle CRUD-Operationen
und die Abwägungen, die hinsichtlich der CAP-Eigenschaften getroffen werden müssen,
sollten auch vom Anwendungsfall abhängig gemacht werden.
NoSQL-Systeme umfassen unter anderem:
Key-Value Stores
, die für numerische Schlüssel oder Schlüssel aus Zeichenketten
meist primitive Werttypen speichern und oft Abfragen über Wertebereiche oder
Teilzeichenketten der Schlüssel zulassen,
Wide Column Stores
, die für die Kombination aus Zeilenschlüssel und Spaltenschlüs-
sel (für potentiell sehr viele Zeilen und Spalten) Werte hinterlegen können
Dokumentdatenbanken, in denen geschachtelte Schlüssel-Wert-Container als „Do-
kumente“ gespeichert werden, z. B. in der JavaScript Object Notation (JSON),
Graphdatenbanken (und Hypergraphdatenbanken), in denen zwei (oder mehr)
Einträge, welche Schlüssel-Wert-Paare enthalten, direkt miteinander in Beziehung
gesetzt werden können, ohne dass diese Assoziation auf der Ebene von Klassen
oder Tabellen definiert werden muss und
48
Kapitel 2 Forschungskontext und relevante Technologien
Tuple Stores
für die Speicherung prädikatbasierter Ausdrücke (sogenannte Tripel“
aus Subjekt, Prädikat und Objekt). Soll über diese Aussagen wiederum etwas aus-
gesagt werden, müssen sie in referenzierbarer Form als Quadrupel gespeichert
werden. Um diese zu referenzieren, werden Quintupel verwendet, ...
Darüber hinaus werden teils auch spezialisierte Systeme im textorientierten Bereich bei-
spielsweise XML-Datenbanken
39
und Volltext-Suchmaschinen
40
die über entsprechende
Speicherfunktionen verfügen, zu den NoSQL-Systemen gerechnet.
Die meisten dieser Systeme zeichnen sich durch weniger rigide Anforderungen an die
Definition eines Datenbankschemas aus, als es bei relationalen Systemen üblich ist oder
bieten überhaupt keine Möglichkeit zur Schemadefinition. Grundsätzlich gilt, dass je
komplexer die abbildbaren Strukturen sind, umso weniger Daten für effiziente (komplexe)
Abfragen im Echtzeitzugriff vorgehalten werden können. Daneben kann als Merkmal
vieler Systeme eine Unterstützung für
Sharding
-Mechanismen und den Betrieb auf Rech-
nerclustern festgestellt werden. In diesem Zusammenhang werden teils eigene Lösungen,
zum anderen aber nicht selten auch Komponenten aus dem Big-Data-Ökosystem um
Apache Hadoop
41
genutzt, welches als eine der ersten Ausführungsumgebungen für
MapReduce [DG04] frei zur Verfügung steht.
Die dabei oft angewendete Form der Systemskalierung unter Aufweichungoder gänzlicher
Aufgabe der strengen ACID-Bedingungen wird unter der Bezeichnung Basically Available,
Soft state, Eventually consistent (BASE) in [Pri08] wie folgt eingeführt:
BASE is diametrically opposed to ACID. Where ACID is pessimistic and forces consis-
tency at the end of every operation, BASE is optimistic and accepts that the data-
base consistency will be in a state of flux. Although this sounds impossible to cope
with, in reality it is quite manageable and leads to levels of scalability that cannot
be obtained with ACID
In der Anwendung wird allgemein eine „elastische“ Skalierung bevorzugt. Die Elastizität
bezieht sich auf die Fähigkeit zur Skalierung des Systems von einem physischen Einzel-
rechner zu großen (in wenigen Minuten bedarfsgerecht anmietbaren) Rechnerclustern,
im laufenden Betrieb und ohne dass dafür initiale Vorkehrungen nötigt sind.
39
z. B. eXistdb (http://www.exist-db.org/) und BaseX (http://basex.org/)
40
z. B. Elasticsearch (http://www.elastic.co/de/products/elasticsearch) und
Apache Solr (http://lucene.apache.org/solr/)
41
http://hadoop.apache.org/
49
2.3 Graphdatenbanken
Die NoSQL-Initiative hat viele technologische Neuerungen und Rekonzeptualisierungen
im Datenbankbereichmit sich gebracht, oft jedoch zum Preis fehlender Anschlussfähigkeit
und Kompatibilität zu bestehenden Fachanwendungen. Allerdings kann sich mittlerweile
auch in der Welt der NoSQL-Ansätze für Datenmodellierung die Abfrage über SQL wieder
positionieren. SQL kann über eine intermediäre Zugriffsschicht für verschiedene Daten-
speicher genutzt werden, wie sie etwa in Apache Drill
42
umgesetzt ist, s. [
HN13
]. Beim
kommerziellen Datenbanksystem NuoDB
43
wird eine skalierbare Systemarchitektur mit
SQL-Funktionalität z. B. als NewSQL beworben.
Der im Zentrum dieser Arbeit stehende Begriff des Graphdatenbanksystems kann eine
Vielzahl verschiedener Nuancen dieser Technologie bezeichnen. Der Praxis aus [
RWE13
]
folgend,
44
werden hier damit vorrangig „Property-Graph-Datenbanken“ bezeichnet, de-
ren Datenmodell später noch ausführlicher besprochen wird. Zunächst sollen die Be-
sonderheiten von Graphen jenen komplexen Strukturen, die sich in solchen Systemen
abbilden lassen in den folgenden Abschnitten vorgestellt werden.
2.3.2 Netzwerke, Graphen und ihre Anwendungsgebiete
Die Beschreibung und Analyse von Netzwerken lässt sich keiner einzelnen Disziplin
zuordnen. Zum einen sind diese Aktivitäten oft Teil interdisziplinärer Forschung, zum
anderen bilden sie aus methodischer Sicht einen eigenständigen Querschnittsaspekt
der Forschung insgesamt. Eine mit vielen Beispielen und historischen Meilensteinen
unterfütterte Einführung in Netzwerke und Netzwerkforschung sowie deren Bedeutung
für unser tägliches Leben gibt Barabási in [Bar02].
Erste Aufmerksamkeit erhielt die Netzwerkforschung durch sozialwissenschaftlich ge-
prägte Studien. Mitte der 1960er Jahre berichtete Milgram in [
Mil67
] von seinen Ex-
perimenten zur (oft erstaunlich kurzen) Pfadlänge zwischen Personen über (indirekte)
Bekanntschaften. Diese Sichtweise hatte eine große Ausstrahlwirkung in die breite Öffent-
lichkeit und es entwickelte sich daraus später die Vorstellung von
six degrees of separation
,
über welche (angeblich) alle Teile der Weltbevölkerung miteinander verbunden seien.
Wenig später wurden ebenfalls aus soziologischer Motivation heraus wichtige Beiträge
42
http://drill.apache.org/
43
http://www.nuodb.com/
44
wohl wissend, dass deren Autoren großes wirtschaftliches Interesse an der Förderung genau dieses
Graphdatenbank-Typs haben
50
Kapitel 2 Forschungskontext und relevante Technologien
im Bereich kleiner Netzwerke und direkter Interaktionen zwischen Personen geleistet.
Prominentestes Beispiel ist die von Zachary durchgeführte Untersuchung der persönli-
chen Relationen zwischen den Mitgliedern eines Karateclubs von 1970 bis 1972, s. [
Zac77
].
Die sozialen Interaktionen und persönlichen Spannungen wurden festgehalten und es
konnte exemplarisch nachgewiesen werden, dass Sie zum Zeitpunkt der Abspaltung eines
neuen Karateclubs einen entscheidenden Einfluss auf den Verbleib oder die Abwanderung
einzelner Mitglieder hatten. Daraus entwickelten sich nach und nach fortgeschrittenere
Methoden der Netzwerkanalyse, die gemeinsam mit anderen Modellen in der Soziologie
bis heute Anwendung finden.
In die selbe Zeit fallen auch allgemeinere Untersuchungen zu topologischen Aspekten
großerNetzwerke,die sich bis in die heutige Forschungfortsetzen. Speziell zum Verhältnis
vonStrukturen auf der Mikroebene zu Effekten auf der Makroebene wurden z. B. in [
Gra73
]
Überlegungen zu
Weak Ties
veröffentlicht. Diese sind eine Form topologisch induzierter
und grundsätzlich eher kontraintuitiver Effekte, die besagen, dass der größte Einfluss auf
wesentliche Elemente der Netzwerkstruktur nicht von stark miteinander verknüpften
Regionen, sondern von einzelnen, potentiell fragilen, Querverknüpfungen ausgeht.
Neben der Soziologie sind auch Physik, Biologie, Informatik, Logistik, Energiewirtschaft
und Telekommunikation wichtige Impulsgeber für die Entwicklung der Netzwerkfor-
schung zu nennen. Noch vor zehn Jahren war zu bemängeln, dass verschiedene For-
schungs- und Anwendungsgebiete der Netzwerkanalyse sich untereinander nur mangel-
haft abstimmen, von den Resultaten der anderen Bereiche kaum profitieren und folglich
auch eine stark heterogene Forschungslandschaft bilden
45
, vgl. [
Jac06
]. In seitdem neu
entstandenen Feldern, wie etwa den „Computational Social Sciences“, vgl. [
LPA
+
09
],
wird versucht, die bestehenden Methoden anderer Disziplinen (so weit dies sinnvoll
umzusetzen ist) in den Forschungsprozess zu übernehmen.
Es lassen sich viele Arten von Netzwerken unterscheiden. Neben Untergliederungen
nach Anwendungsgebiet kann eine Klassifizierung auch über die Art der abgebildeten
Aussagegegenstände erfolgen: So kann es materielle, immaterielle oder hypothetische
Objekte oder Akteure enthalten und die Verbindungen zwischen Ihnen können als Ähn-
lichkeit, Nähe, Affinität, Erreichbarkeit oder als konkrete Wege für den Fluss von Gütern,
Werten oder Information angesehen werden. Eine allumfassende Einteilung mit genauer
Dokumentation für die damit verbundenen Implikationen hinsichtlich einer Auswertung
ist schwierig und liegt bislang nicht vor.
45
„[...] they are still largely distinct in their methods, interests, and goals.
51
2.3 Graphdatenbanken
Während die Bezeichnung „Netzwerk“ oft einen stärkeren Anwendungsbezug ausdrückt,
hat sich für eine eher abstrakte, technische und auf die reine Struktur ausgerichtete Sicht
auf Netzwerke die Bezeichnung „Graph“ etabliert. Graphen und Netzwerke sind Modelle
verschiedener Abstraktionsstufen, die eine systematische Sicht auf Zusammenhänge in
einer Anwendungsdomäne bieten können. Die Überführung von theoretischen Überle-
gungen zu dieser Domäne in passende Modelle und einzelner Beobachtungen in diskrete
Datensätze innerhalb dieses Modells wird auch als
Graph Induction
bezeichnet. Auf die
Graphinduktion in konkreten Anwendungsszenarien wird später in diesem Buch noch
häufiger eingegangen.
Graphstrukturen finden sich nicht zuletzt auch häufig in der Informatik, etwa in Form
von Listen, Bäumen und vielen komplexeren Datenstrukturen. Letztlich lassen sich auch
die Gesamtheit der Objektinstanzen und -referenzen in der objektorientierten Program-
mierung als Graph ansehen, was insbesondere für die automatische Speicherbereinigung
(
Garbage Collection
) von großer Relevanz ist. Ein unverzichtbares Werkzeug zur formellen
Beschreibung solcher abstrakter Strukturen wird im folgenden Abschnitt vorgestellt.
2.3.3 Formalisierung und graphentheoretische Zugänge
Die Graphentheorie ist eine im 18. Jahrhundert wurzelnde Forschungsrichtung, die im
Laufe des 19. Jahrhunderts systematisch mit anderen Teilen der Mathematik verknüpft
wurde. Die ersten Kernprobleme und frühen Entwicklungen als Disziplin sind z. B. in
[
BLW79
] ausführlich dargelegt. Die Graphentheorie wurde erst spät, im Jahr 1936 mit
[
Kön36
] der ersten diesbezüglichen Veröffentlichung in Buchform als eigenständiges
Wissensgebiet etabliert. Seitdem wurden innerhalb der Mathematik, aber auch durch die
Informatik, viele neue Erkenntnisse zu Graphen gewonnen. Gleichzeitig half die Beschrei-
bung als Graphen-Problem auch beim Finden neuer Lösungsansätze für verschiedene
externe Fragestellungen. Nicht selten fand dabei ein methodischer Übertrag in andere
Gebiete statt so etwa in die natur- und sozialwissenschaftliche Forschung, wie bereits
im letzten Anschnitt beschrieben.
Im Kontext von Graphdatenbanken ist die reine Graphentheorie allerdings nur ungenü-
gend als Formalismus geeignet. Der Autor schließt sich der in [
RN11
] geäußerten Kritik
an einer beinahe „reflexhaften“ Angabe eines übersimplifizierten Graphen-Formalismus
am Anfang vieler diesbezüglicher Veröffentlichungen an. Wie Rodriguez und Neubauer
weiterhin feststellen, ist in praktischen Anwendungsszenarien (die vielleicht im Gegen-
52
Kapitel 2 Forschungskontext und relevante Technologien
satz zur Mathematik in der Informatik häufiger anzutreffen sind) die Realisierung einer
graphförmigen Struktur und die Interaktion mit ihr oft wichtiger, als die formelle Analyse
ihrer graphentheoretischen Eigenschaften.
Problematisch ist weiterhin, dass die schon angesprochene Universalität des Graphen-
Begriffs dazu beigetragen hat, dass eine Vielzahl intuitiv entstandener Definitionen
parallel existieren, die nicht immer kompatibel zueinander sind. Eine Einführung in die
heute gebräuchlichen Formalisierungen für Graphen geben z. B. [
Die16
] und [
GS12
]. An
dieser Stelle sollen die Kernbegriffe zunächst kurz informell vorgestellt werden:
Bei der Beschreibung von Graphen existieren zwei zentrale Konzepte: Ein
Knoten
46
kann
Objekte der realen Welt bzw. menschlichen Vorstellung repräsentieren oder einfach als
anonymes und bedeutungsloses Element einer Menge angesehen werden. Eine
Kante
47
verbindet zwei Knoten miteinander.
Der Graph ergibt sich im einfachsten Fall aus einer Menge von Knoten und einer Menge
von Kanten. Die Graphentheorie nutzt zur Definition dieser Grundelemente und ihrer
Eigenschaften Konstrukte der Mengentheorie üblicherweise jedoch, ohne auf eine be-
stimmte Axiomatisierung näher einzugehen. In Anbetracht der in [
Lei14
] vorgebrachten
Kritik
48
kann dies durchaus problematisch sein: Generell beantwortet die Graphentheorie
nicht die Frage, welche (mathematischen) Konstrukte die Knoten eines Graphen eigent-
lich konkret darstellen. Für Graphdatenbanken, bei denen direkt in Knoten Informationen
persistent gespeichert werden sollen, ist diese Unterspezifikation besonders ungünstig.
Für die sehr einfache Definition von Graphen existieren zahlreiche Erweiterungen: Ge-
richtete Graphen, in denen bei Kanten die Reihenfolge der verbundenen Knoten beachtet
wird; gewichtete Graphen, deren Kanten um Zahlwerte ergänzt sind; Hypergraphen,
deren Kanten mehr als zwei Knoten verbinden; Multigraphen, die mehrere Kanten zwi-
schen den selben Knoten erlauben, und noch vieles mehr. Allerdings verändern all diese
Variationen auch die mathematischen Konstrukte in der Graphen-Definition. Die Aussage
„Ein gerichteter Graph ist ein Graph.“ ist daher strenggenommen (je nach konkreter
Definition) entweder nicht formell untersuchbar oder gar falsch! Darüber hinaus exis-
tieren verschiedene (nicht in allen Belangen äquivalente) Möglichkeiten der konkreten
46
auch: „Ecke“, englisch: node oder vertex
47
auch: „Bogen“, englisch: edge
48
Kurz zusammengefasst: Beim „traditionellen“ Axiomsystem für Mengen, Zermelo-Fraenkel with Choice“,
sind alle Elemente von Mengen selbst Mengen. Da die Identität von Mengen sich über ihre Elemente
ergibt, können „Primitive Elementtypen“, wie Zahlen, prinzipiell nicht einfach in diesem System
verwendet werden.
53
2.3 Graphdatenbanken
Ausgestaltung der Erweiterung, etwa um für gerichtete Graphen die Richtung einer Kante
anzugeben: Bei Diestel wird ein ungerichteter Graph um zwei Abbildungsfunktionen
(von Kanten auf Knoten) ergänzt, die jeweils Start- und Zielknoten bestimmen. Andere
Veröffentlichungen und Einführungswerke definieren bei gerichteten Graphen die Kan-
tenmenge als Menge von Mengen der Mächtigkeit
2
zu Mengen von Paaren um (so z. B.
auch Griffin), oder beschreiben die Änderungen überhaupt nicht in formaler Form. Ähn-
lich heterogen werden in der Literatur auch die anderen angesprochenen Erweiterungen
gehandhabt.
Neben der Graphentheorie existieren weitere Zweige der Mathematik bzw. der theoreti-
schen Informatik, die sich mit Graphen beschäftigen, etwa die (allgemeine sowie endliche)
Modelltheorie und die Kategorientheorie [
BW95
]. Diese Betrachtungsweisen erlauben
grundsätzlich eine Verallgemeinerung auf andere Arten von Strukturen, wodurch sich
neue Anwendungsmöglichkeiten ergeben. Es wurde z. B. in [
SK12
] bereits gezeigt, dass
die Kategorientheorie auch zur Wissensrepräsentation geeignet ist. Daneben existieren
weitere mathematische Zugänge, wie die spektrale Graphentheorie, die tatsächlich nütz-
liche Aussagen für die Abfrage sehr großer graphförmiger Daten in Datenbanken liefern
kann, wie z. B. in [
ZCYL08
] festgestellt wurde. Dennoch stellen auch diese Formalisierun-
gen im Umfeld von Graphdatenbanken keine geeigneten Zugänge zur mathematischen
Beschreibung der Gesamtsysteme dar.
Aus der klassischen Sichtweise der Informatik ergeben sich zum Umgang mit Graphen
jedoch vor allem Fragestellungen der digitalen Repräsentationsform. Dabei werden im
Bereich der Algorithmen und Datenstrukturen einführend vorrangig Adjazenzmatrizen,
Adjazenzlisten und Inzidenzmatrizen sowie Knoten- und Kantenlisten betrachtet. Diese
anschaulichen und gut verstandenen Repräsentations- und Speicherformen haben aller-
dings so gut wie keine praktische Relevanz im Datenbankumfeld. Spinrad gibt in [
Spi03
]
einen Überblick über
Efficient Graph Representations
“. Doch letztlich sind auch solche
Betrachtungsweisen beschränkt, da sie sich jeweils fast ausschließlich nur auf einfache
strukturelle Aspekte der zu speichernden Elemente konzentrieren, während Datenmodel-
lierung, -speicherung und -abfrage sich nicht unmittelbar und für die anwendungsnahe
Forschung gewinnbringend in den klassischen Formalismen der Graphentheorie abbilden
lässt. Im Umfeld von Graphdatenbanken lassen sich jedoch andere, passendere formelle
Beschreibungen finden, wie im nächsten Abschnitt noch erläutert wird.
54
Kapitel 2 Forschungskontext und relevante Technologien
2.3.4 Property-Graph-Datenbanken
Graphdatenbanken sind keine Erfindung der letzten Jahre. Allerdings sind sie erst durch
die Dynamik der NoSQL Bewegung wieder in den Fokus von Forschung und Industrie
geraten. Warum ihre spezialisierte Herangehensweise an die Modellierung von Daten und
deren Relationen nicht früher breitere Anwendung gefunden hat, lässt sich nur schwer
abschließend ergründen. In [Bue12] etwa heißt es dazu:
The research of graphdatabases was popular in the early 1990s with database models
like LDM, GOOD, O2, and GraphDB. However, this interestdied off with the insurgence
of XML and the Internet. Not until recently have graph databases again become a
topic of interest. This re-emergence is due in part to the large amounts of graph data
introduced by the Web.
Diese Beschreibung wirkt in sich recht widersprüchlich: Das WWW hat gerade durch
seine emergente Verlinkungsstruktur schnell große (netzwerkförmige) Datenmengen
produziert und sich nicht zuletzt durch dieses „verbindende“ Merkmal als prominentester
Service im Internet etabliert. Um die Strukturen des WWW detailliert zu erforschen,
wären Graphdatenbank-Systeme bereits in den 1990er Jahren hilfreich gewesen.
Ein möglicher Aspekt, der zur zwischenzeitlichen Abwendung von der Forschung an
Graphdatenbanken geführt hat, könnte im großen Entwicklungsvorsprung relationaler
Systeme (bei relativ ähnlichem Funktionsumfang) begründet liegen. Beim unvorein-
genommenen Vergleich des relationalen Modells mit Graphenmodellen lassen sich im
Grunde nur wenige fundamentale Unterschiede ausmachen:
Zum einen betrifft dies die Schematisierung der Daten: Einträge sind nicht mehr in Rela-
tionen zusammengefasst, über die die ihnen zuweisbaren Eigenschaften definiert werden,
ähnlich wie über Klassen in der objektorientierten Programmierung. Stattdessen kann
für jeden einzelnen Eintrag eine beliebige Menge an Eigenschaftsschlüsseln verwendet
werden. Zum anderen betrifft es die Art der Indizierung von Werten. Neben globalen (in
relationalen Systemen tabellenzentrischen) Indizes stehen zusätzlich also knotenzen-
trische (
vertex centric
) Indizes zur Verfügung, wie in [
RN11
] detaillierter vorgestellt wird.
Verknüpfung wird so zum „Modellierungskonstrukt erster Klasse“, über das sich effizient
und ohne die Notwendigkeit von
Join
-Operationen zwischen Datensätzen navigieren lässt.
Jedoch ist laut [
SFSK15
] auch eine effiziente Emulation einer Graphdatenbank über das
relationale Modell möglich.
55
2.3 Graphdatenbanken
Letztlich können die Unterschiede auf technischer Ebene (anders als aus konzeptioneller
Sicht) demnach nicht wirklich fundamental sein. Auch etablierte Modellierungswerk-
zeuge, wie das ERM sind mit nur geringen Modifikationen für die Nutzung mit Graph-
datenbanken geeignet. Datenmodelle zum Speichern von vernetzten Daten kommen
in verschiedenen Ausprägungsformen zum Einsatz. In [
Bue12
] und [
Ang12
] werden die
Modellierungsansätze und -konstrukte gängiger Graphdatenbank-Systeme beschrieben
und verglichen. Im Wesentlichen bilden diese Auflistungen aus dem Jahr 2012 auch die
noch heute genutzten Modell-Varianten ab.
Property Graphs stellen dabei eine recht kleinteilige und minimalistische Sicht auf Ein-
träge und Zusammenhänge zwischen ihnen dar. Sie haben sich zu einem populären
Modell entwickelt, für das auch kommerzielle Software entwickelt wird. In ihrer jetzi-
gen Form sind sie als eine Art „Industrie-Standard“ anzusehen, wobei mit der von der
Apache Foundation verwalteten Programmbibliothek TinkerPop
49
eine quasi-normative
Instanz existiert. Die dort enthaltene Schnittstellenbeschreibung „Blueprints“ definiert
eine gemeinsame Application Programming Interface (API) für viele Graphdatenbanken
unterschiedlicher Hersteller.
In [
JV13
] wird das Property-Graph-Datenmodell als
directed, edge-labeled, attributed, multi-
graph
beschrieben
50
. In Multi-Graphen können die selben zwei Knoten über mehrere
verschiedene Kanten verbunden sein. Die Kanten in Property-Graphen sind stets gerich-
tet und besitzen einen Kantentyp (
Edge Label
). Proerty-Graphen sind zudem „attributiert“,
Knoten und Kanten besitzen Eigenschaften (
Properties
51
), die in Form von Schlüssel-Wert-
Paaren hinterlegt werden. Die Schlüssel von Eigenschaften sind (wie auch die Kantenla-
bels) Teil des Schemas der Graphdatenbank. Das Datenbankschema schränkt nicht ein,
welchen Knoten oder Kanten welche Eigenschaften zugewiesen werden dürfen, oder wel-
che Kantenlabels in welchen Kontexten verwendet werden dürfen. Diese Restriktionen
sind durch die Anwendungslogik vorzunehmen und gegebenenfalls bei der Abfrage zu
berücksichtigen.
Im Folgenden wird ein Vorschlag für einen geeigneten Formalismus zur Abbildung der
wesentlichen Merkmale von Property-Graphen entwickelt, der sich auf die Herange-
49
http://tinkerpop.apache.org/
50
wobei der dort dafür angegebene Formalismus (offenbar aus Gründen der Übersichtlichkeit) weder
Kantenlabels noch Attribut-Wert-Paare incl. deren Zuweisungsfunktionen zu Kanten bzw. Knoten
und Kanten berücksichtigt
51
nicht zu verwechseln mit graph properties, also den mathematisch bestimmbaren Eigenschaften von
Graphen im graphentheoretischen Sinne, etwa „enthält ein Dreieck (
K
3
) als Subgraph“., vgl. [
Die16
]
56
Kapitel 2 Forschungskontext und relevante Technologien
hensweise und Symbolbezeichnungen in [
RN11
] stützt, in welchem jedoch Schema und
Instanzdaten getrennt betrachtet werden:
Ein Property-Graph-Schema
Γ
ergibt sich aus einer Menge
Σ
von Kantenlabeln und einer
Menge R von Property-Schlüsseln:
Γ = (Σ, R)
Ein Property-Graph, der diesem Schema folgt, ergibt sich aus einer Menge
V
von Knoten,
einer Menge
E
von Kanten, einer Menge
P
von Property-Feldern, einer Menge
S
von
Property-Werten, einer Kanten-Label-Funktion
λ
und einer Property-Wertzuweisungs-
Funktion µ:
G
Γ
= (V, E, P, S, λ, µ)
Die Kanten sind gerichtet:
E (V × V)
Die Property-Felder stehen für Property-Schlüssel, die in einzelnen Elementen (Knoten
und Kanten) des Graphen vorkommen:
P (V E) × R
Jeder Kante wird genau ein Kantenlabel als „Kantentyp“ zugewiesen:
λ : E Σ
Jedem Property-Feld wird genau ein Property-Wert zugewiesen
52
.
µ : P S
In der Praxis wird die Anwendbarkeit von Property-Graphen wesentlich von der Indi-
zierung der Elemente bestimmt. Bei dieser wird meist eine Unterscheidung in Knoten-
und Kantenproperties getroffen. Im Schema würde das eine Unterteilung in
R
V
und
R
E
erfordern, die entsprechende Änderungen in der Definition des Graphen nach sich zöge,
indem dort in
µ
V
und
µ
E
unterschieden werden müsste, welche wiederum mit entspre-
chend definierten
P
V
= V × R
V
und
P
E
= E × R
E
zu versehen wären. Bei der Indizierung
52
In der aktuellen Version 3 von Apache TinkerPop können grundsätzlich für die selben Schlüssel zu den
selben Elementen multiple Werte zugewiesen werden, was in dieser Arbeit jedoch nicht genutzt und
noch nicht von allen Systemen unterstützt wird. Deshalb soll dieser Umstand zunächst auch keinen
Eingang in diesen Formalismus finden.
57
2.3 Graphdatenbanken
erfolgt zudem auf Schemaebene eine Zuweisung von Datentypen oder Wertebereichen
zu Property-Schlüsseln, die zusätzlich eine Segmentierung von
S
nach diesem Kriterium
erfordern würden.
Da in diesem Buch der Formalismus aus den im letzten Abschnitt erläuterten Gründen
nicht mehr aufgegriffen wird, wird an dieser Stelle auf eine allzu ausführliche formelle
Beschreibung verzichtet. Ebenso wird darauf verzichtet, den Formalismus von Rodri-
guez und Neubauer für die Graphentraversierung (als Operationen auf Multigraphen)
aufzugreifen.
Bevor in Abschnitt 2.3.6 auf Seite 62 noch eine detaillierte Übersicht über Abfragemöglich-
keiten und -sprachen für Property-Graphen gegeben wird, sollen zunächst ergänzende
Bemerkungen zu einem Gebiet erfolgen, das eng mit den bisher besprochenen Themen der
Markupsprachen, Ontologien, Netzwerke, Textkollektionen und Datenbanken verwandt
ist.
2.3.5 Semantic-Web-Technologien
Angesichts der erstaunlich schnellen und weitgreifenden Popularisierung des WWW hin
zum meistgenutzten Service im Internet, war es kurz nach der Jahrtausendwende an der
Zeit, neue Visionen für eine alltagstaugliche, global vernetzte Technologie zu schaffen.
Berners-Lee, Hendler und Lassila stellten im Jahr 2001 im Artikel [
BLHL01
] das
Semantic
Web
die nächste „Evolutionsstufe“ des Webs vor, das bis dahin nur universelle (und
somit unspezifische) Verknüpfungen zwischen genauso universellen (und unspezifischen)
Informationsressourcen ermöglichte. Mit der expliziten Modellierung von Bedeutungen
einzelner Aussagen sollte es damit möglich werden, eine logische Verbindung verteilt
vorliegender Aussagen (auch) durch Maschinen vornehmen zu lassen.
Als Grundlage für die maschinenlesbare Formulierung von Bedeutung wurden Tripel
aus Subjekt, Prädikat und Objekt gebildet. Ersteres steht für eine Ressource, also einen
Aussagegegenstand, dessen Identität durch einen
Identifier
gekennzeichnet werden kann.
Prädikate bilden semantische Ankerpunkte für Eigenschaften, welche das genaue Ver-
hältnis von Subjekt und Objekt spezifizieren. Das Objekt kann ein einfacher Wert eines
bestimmten Datentyps sein (eine Ganzzahl, ein Datum oder eine Zeichenkette), kann aber
auch (über deren Identifier) auf eine andere Ressource verweisen. Auf diese Weise kann
aus mehreren Aussagen ein Graph erstellt werden. (Entsprechend sind auch die NoSQL -
58
Kapitel 2 Forschungskontext und relevante Technologien
Technologien der Graphdatenbanken und Triple Stores im Grunde recht verwandt.)
Zur formalisierten Ressourcenbeschreibung wird im Semantic Web das Resource Descrip-
tion Framework (RDF) genutzt. In diesem werden Zeichenketten als Identifier verwendet,
die den Anforderungen an den Aufbau eines Uniform Ressource Identifier (URI) genügen.
Die nutzbaren Prädikate bilden dabei das sogenannte Vokabular“. Das Schema, das Aus-
sagen über die grundsätzliche Validität (nicht den Wahrheitsgehalt) möglicher Aussagen
angesichts eines Vokabulars tätigt, wird als RDF Schema (RDFS) abgebildet
53
. Hierbei zeigt
sich ein starker Zusammenhang zu Ontologien (im informatischen Sinne). In [
HFBPL09
]
werden diese so eingeführt:
Anontologyconsists of statementsthatdefine concepts, relationships,andconstraints.
It is analogous to a database schemaor an object-oriented class diagram. The ontolo-
gy forms an information domain model.
Es wird dort weiter darauf verwiesen, dass solche Ontologien für viele Anwendungsge-
biete bereits existieren und diese auf einfachem Wege (unverändert) nachgenutzt oder
angepasst werden können. Im Kontext des Semantic Web wird für die Beschreibung von
Ontologien die OWL Web Ontology Language (OWL) verwendet. Als Ontologiesprache
besitzt sie eine höhere Komplexität und höhere Ausdrucksstärke als RDFS. Wegen der
starken Bindung des Begriffs an diese Technologie wird im Folgenden die Bezeichnung On-
tologie eher sparsam verwendet und stattdessen öfter von Daten- und Domänenmodellen
gesprochen.
Das Semantic Web bringt eine Sammlung von Basisbedeutungen für Klassen von Aussa-
gegegenständen und für grundlegende Beziehungen mit sich. Über diese ist bereits eine
sogenannte Inferenz möglich. Das Inferieren von Aussagen bedeutet: „[...]
given some
stated information, we can determine other, related information that we can also consider as if it
had been stated.
[
AH08
] So sind z. B. Aussagen über Superklassen auch für die Subklassen
gültig, ohne das dies explizit notiert werden muss.
Darauf aufbauend kann ein
Reasoning
erfolgen, also eine logische Folgerung der Gültig-
keit von Ausdrücken, welche mittels OWL-Konstrukten der Beschreibungslogik oder in
einer Regelsprache notiert sind. Da das Semantic Web eine verteilte Wissensumgebung
darstellt, werden beim Umgang mit Daten nach diesem Paradigma eine Reihe impliziter
Annahmen getroffen. Am prominentesten ist die sogenannte
Open World Assumption
im
53
RDFS nutzt dabei RDF-Modellierungskonstrukte, das Schema ist also Teil der Daten
59
2.3 Graphdatenbanken
Bezug auf im Datenbestand nicht enthaltene Aussagen: In Datenbanken gelten nicht
auffindbare Einträge als inexistent, so dass damit verknüpfte, die Existenz des Eintrags
voraussetzende Aussagen folglich als falsch interpretiert werden. Für eine Behandlung
des Semantic-Web-Datenbestandes mit Konstrukten der elementaren Logik wäre ein
solches Verhalten nicht zielführend, da aus einer falschen Prämisse bekanntermaßen
jede beliebige Aussage gefolgert werden kann. Die
Open World Assumption
geht also davon
aus, dass die Aussage existieren könnte und nur momentan nicht im Datenbestand
zur Verfügung steht. Weitere Details zu in den Modellen gemachten Annahmen sowie
konkrete Anwendungsbeispiele für RDF-Vokabulare und in OWL modellierte Ontologien
können zum Beispiel in [HFBPL09] nachgelesen werden.
Aufbauend auf der Logik-Fähigkeit der Technologien sieht das Semantic Web auch die
Beweisbarkeit der Korrektheit von Domänenmodellen (
Proof
) sowie Schichten für das
Herstellen von Vertrauen (
Trust
) in Datenprovider, ebenso wie Querschnittsaspekte, wie
Verschlüsselung vor. In diesen Bereichen des sogenannten
Semantic Web Stack
sind bislang
jedoch keine breit adaptierten Entwicklungen vorgenommen worden. Im Bereich ma-
schinenlesbarer Semantik wurde bereits vor Aufkommen der Semantic-Web-Technologie
an Inferenzmechanismen gearbeitet, beispielsweise durch die Verknüpfung von SGML
und XML mit Prolog, vgl. [
SMHR00
]. Jedoch sind auch diese Ansätze nicht weiter verfolgt
worden.
Das Semantic Web definiert sich nicht nur durch seine Technologien, sondern in erster
Linie auch über die Wissensbasen und verteilten Ressourcen, die damit bislang realisiert
wurden. Als wichtigster Ankerpunkt für die Semantik von Begriffen und Entitäten aus
dem Bereich des enzyklopädischen Weltwissens kann das Projekt DBpedia
54
angesehen
werden, welches mittels eines hauptsächlich automatischen Transformationsprozesses
strukturierte Informationen aus der Wikipedia in RDF umwandelt, s. [
BLK
+
09
], bzw.
ausführlicher [LIJ
+
15].
Die Daten von DBpedia wurden auf dem Portal Freebase
55
mit weiteren Datenquellen
verknüpft und nach dessen Übernahme durch Google in deren Technologie zur semanti-
schen Suchunterstützung namens
Knowledge Graph
56
überführt. Mittlerweile sind die
(teils auch in Freebase durch Nutzereingaben angereicherten) Daten Teil des WikiDa-
ta-Projekts
57
. Freebase nutzte „graphd“ als Datenbank, eine Eigenentwicklung, die in
54
http://dbpedia.org/
55
http://freebase.com/
56
http://www.google.com/intl/bn/insidesearch/features/search/knowledge.html
57
http://www.wikidata.org
60
Kapitel 2 Forschungskontext und relevante Technologien
[
MDGM10
] näher beschrieben ist. Es handelt sich dabei um ein Speichersystem für Tupel
unterschiedlicher Länge ohne physische Lösch- oder Änderungsoption (append-only).
Diese Projekte sind Beispiele für den Trend zur leichtgewichtigen Nutzung von Semantic-
Web-Technologien, ohne komplexe Ontologie- und Logikmodelle dafür zu definieren. Bei
einer solchen Herangehensweise wird von Linked Data, bzw. bei offenen, frei verfügbaren
Datenquellen von Linked Open Data (LOD) gesprochen. Über die gemeinsame Nutzung von
Identifiern können verteilte Wissensspeicher ohne direkte Kommunikationsaufwände
„aufeinander referenzieren“. Es formiert sich bei entsprechend sorgfältiger Auswahl von
Identifiern ein Netz von auf Instanzebene verknüpften Datenquellen, die im Idealfall
viele gemeinsame und etablierte Vokabulare verwenden.
58
Während im Semantic Web der Fokus auf semantisch ausgezeichneten strukturierten
Informationen liegt, existieren Arbeiten, die eine enge Verzahnung mit unstrukturierten
Informationsquellen anstreben, s. etwa [
Lad13
] zum Umgang mit hybriden Datenbestän-
den aus textuellen Quellen und strukturierten Informationen mittels RDF -Technologien.
Das Semantic Web besitzt dabei eine große Nähe zu Markupsprachen. So existieren An-
sätze zur Nutzung der Graphstruktur von RDF für eine verbesserte Repräsentation von
markupbasierten Texten, z. B. mit Extremely Annotational RDF Markup (EARMARK) “,
vgl. [
DIPV11
], wo eine enge Anlehnung an Formate für
Wordprocessing
-Software stattfin-
det. Andererseits kann XML z. B. auch als Serialisierungsform für RDF und OWL verwendet
werden und viele der im Semantic Web verwendeten Techniken entstammen direkt oder
indirekt dem Umfeld von XSL und HTML. Dabei ist die Nutzung von Markupsprachen
nicht für alle Anwendungsfälle unumstritten, wie z. B. [SET09] anmerkt:
One of the major criticisms of semantic web formats like RDF/XML is that they are
too complicated and too much of a hassle for a designer or webmaster to bother im-
plementing.
Als Alternative für Web-
Publisher
wird dort weiter beschrieben, wie sich RDF -Prädikate in
Form sogenannter Mikroformate oder unter Nutzung von HTML-Attributen in Webseiten
ausdrücken lassen. Auch neue Strömungen innerhalb der Linked-Data-Community sagen
sich langsam von XML und textuellem Markup als Austauschformat los. Mittlerweile
existiert z. B. eine für Webservices einfach nutzbare JSON-basierte Serialisierung für
Linked Data, s. [SLK
+
14].
58
Für diese Szenario ist es hilfreich, für die Identifizierung von Aussagegegenständen stets mehrere
Identifier anzugeben und diese damit als äquivalente Bezeichner zu deklarieren.
61
2.3 Graphdatenbanken
Neben RDF -basierten oder auf Tupeln beruhenden Herangehensweisen wurden weite-
re alternative Semantikmodelle entwickelt. Mit Topic Maps [
ISO13250
] wurde ein ISO-
Standard geschaffen, der sich u. a. in das
Topic Maps Reference Model
mit grundlegenden
Aussagen zu Identität von Entitäten und das
Topic Maps Data Model
mit konkreten Model-
lierungskonstrukten gliedert. Das darin beschriebene Assoziationsmodell erlaubt es, in
einer einzigen Aussage mehr als zwei Aussagegegenstände in Beziehung zu bringen, wo-
bei es möglich ist, die jeweils von ihnen eingenommene Rolle genauer zu spezifizieren. Im
praktischen Einsatz konnte sich die Topic-Maps-Technologie jedoch nicht durchsetzen.
Trotz komplett unterschiedlicher Ausrichtung, divergierender Auffassung zur Festlegung
eines Datenschemas und stark getrennter Werkzeug-Umgebungen herrscht insgesamt
doch eine große Verwandtschaft zwischen Semantic-Web-Wissensbasen und Graphda-
tenbanken. Diese zeigt sich u. a. in den Abfragemöglichkeiten, die im nächsten Abschnitt
vorgestellt werden sollen.
2.3.6 Abfragesprachen
Wie in vielen Programmier- und Abfragesprachen wird auch im Umfeld der Graphdaten-
bankabfrage in deklarative und imperative Sprachen (bzw. Sprachteile) unterschieden.
Deklarativ wird notiert, welche Eigenschaften und Strukturen in den Ergebnissen ge-
wünscht sind, woraufhin eine Ausführungs-
Engine
die entsprechend dafür notwendigen
Berechnungsschritte selbstständig ermittelt und in selbst festgelegter Sequenz durch-
führt. Imperativ werden vom Nutzer einzelne Abarbeitungsschritte festgelegt, die dann
in vorgegebener Reihenfolge ausgeführt werden.
Die Abfrage von Graphdatenbanken ist aus wissenschaftlicher Sicht gut erforscht. Um-
fangreiche Vergleiche und eigene Weiterentwicklungen von Abfrageansätzen werden
z. B. in [
BLLW10
] und [
Woo12
] vorgenommen. Für das bereits vorgestellte Tupelsystem
„graphd“ wird in [
MDGM10
] eine Abfragesprache präsentiert, die einen sehr niedrigen
Abstraktionsgrad gegenüber der genutzten Speicherstruktur aufweist. In Freebase wurde
aufbauend darauf eine JSON-basierte Abfragesprache eingeführt, die Abfragen auf der
Ebene des logischen Datenbankschemas ermöglicht, vgl. [
Fla09
]. Dabei handelt es sich um
eine deklarative mit
Templates
arbeitende Sprache es werden dort Vorlagen“ für die Er-
gebnisausgabe erstellt, deren Lücken dann durch Bindung mit passenden realen Daten der
Abfrageergebnisse gefüllt werden. Grundsätzlich damit vergleichbar ist die von Facebook
62
Kapitel 2 Forschungskontext und relevante Technologien
vorgestellte (auf die Anfrage an Facebook-APIs beschränkte) Sprache GraphQL
59
.
Für die Mustersuche in Graphen wurden in den vergangenen Jahren viele theoretische
und technologische Fortschritte erzielt, s. z. B. [
FLM
+
10
]. Ein effizientes
Pattern Matching
bildet auch die Grundlage von SPARQL Protocol And RDF Query Language (SPARQL), einer
deklarativen Abfragesprache, die hauptsächlich im Umfeld des Semantic Web eingesetzt
wird, z. T. aber auch von Proprty-Graph-Systemen unterstützt wird. Für die im deklara-
tiven Bereich notwendige Ausführungsoptimierung für Anfragen ist die grundsätzlich
„schemafreie“ Natur von RDF-Graphen wenig geeignet. Werden die in RDF kodierten
Schemainformationen von der Datenbank nicht gesondert behandelt, kann ein einfaches
Tripel zwei verschiedene Klassen oder Eigenschaften gleichsetzen und damit Millionen
von Instanzdatensätzen beeinflussen, so dass die komplette Topologie des Graphen sich
ändert. Die für eine automatische
Query
-Optimierung nötige statistische Erfassung von
Häufigkeiten bezüglich Klassen, Eigenschaften und Eigenschaftswerten kann in einem so
freien Umfeld nicht effizient erfolgen.
Bei Property-Graph-Datenbanken ist das Schema zwar ebenfalls einfach anpassbar, wird
jedoch nicht in Form von Datenbankeinträgen verwaltet. Auch sind im laufenden Betrieb
keine willkürlichen Änderungen an bestehenden (und mit Indizes versehenen) Eigen-
schaften oder Kantentypen möglich. Das ermöglicht es deklarativen Abfragesprachen, wie
„Cypher“
60
, einen Auführungsplan statistisch informiert aufzustellen. Über das Projekt
openCypher
61
wird diese Abfragesprache derzeit auch für den Einsatz außerhalb von
Graphdatenbanken erweitert.
Auf der Seite der Abfragesprachen mit imperativem Anteil besitzt Gremlin, s. [
Rod15
], die
größte Verbreitung. Bei Gremlin-Abfragen wird üblicherweise eine Kette von Traversie-
rungsoperationen beschrieben, nach deren Ausführung die gesuchten Elemente selektiert
sind. Bei der Planung effizienter Abfragen wird Modell- und Domänenwissen benötigt.
Im Gegenzug fällt eine zielgerichtete Optimierung leichter, da innerhalb der Abfragen
alle Details der Ausführung einzeln gesteuert werden können. Gremlin ist Bestandteil
von Apache TinkerPop und kann daher als Basis genutzt werden, um mit der gleichen
Abfragesprache sowohl OLTP-Anfragen (in Graphdatenbanken im eigentlichen Sinne
dieser Arbeit) und OLAP-Anfragen (in sogenannten Graph Processors) zu formulieren.
59
http://graphql.org/learn/
60
http://neo4j.com/developer/cypher-query-language/
61
http://www.opencypher.org/
63
2.4 Vorarbeiten und verwandte Gebiete
Andere Daten- und Semantikmodelle bringen jeweils ihre eigenen Abfragemethoden mit
sich. Für Topic Maps existiert unter anderem die Topic Maps Query Language (TMQL). Die
Abfrage von Baumstrukturen z. B. über Pfadausdrücke kann in XML-Datenbanken über
Werkzeuge zur Elementselektion der XSL erfolgen. Letztlich sind auch Abfragesprachen
für relationale Datenbanksysteme (allen voran SQL) zur Graphabfrage geeignet, solange
zur Bestimmung des Ergebnisses nur überschaubar viele
Join-Statements
notwendig sind.
2.4 Vorarbeiten und verwandte Gebiete
Nach der ausführlichen Vorstellung der drei großen Themenkomplexe aus dem Titel
dieses Buches sollen nun Themen herausgegriffen werden, die eine besondere inhaltli-
che oder technologische Nähe zu den in dieser Arbeit vorgestellten Überlegungen und
Ergebnissen besitzen.
Eine umfangreiche und vielschichtige Betrachtung zum Wesen von Text und zu den
bisherigen Möglichkeiten der Textrepräsentation wird in [
Sah13
] aus Sicht der wissen-
schaftlichen und praktischen Editorik stellvertretend für viele textbezogene geisteswis-
senschaftliche Fachrichtungen vorgenommen. Es ist praktisch nicht möglich (und darüber
hinaus wohl auch nicht sinnvoll), für solche umfassenden Ansätze der Systematisierung
mit all ihren vielschichtigen Sichtweisen allgemeine digitale Repräsentationsformen zu
finden. Im Folgenden werden daher Ansätze und Werkzeuge vorgestellt, die Teilaspekte
der Textrepräsentation, Textanalyse und Textrecherche im Rahmen der e-Humanities
bearbeiten.
Zum einen existieren zahlreiche generische Text-Mining-Werkzeuge, allen voran die
die Voyant Tools
62
von Sinclair, Stéfan und Rockwell. Diese werden auf der Webseite
als
web-based reading and analysis environment for digital texts
vorgestellt. Sie bieten dem
Nutzer einen schnellen Einstieg in digitale Textanalyse, u. a. auch, weil bei webbasierten
Systemen keine Hürden für eine Softwareinstallation existieren und weil einige kleine
Beispielkorpora bereits im System angeboten werden und zum Einarbeiten in das Werk-
zeug einladen. Die Voyant Tools vereinen etablierte Visualisierungsansätze mit einfacher
frequenzbasierter Wortstatistik, berücksichtigen jedoch für die Analysen keine Metada-
ten, Strukturinformationen oder Annotationen. Der Funktionsumfang der Voyant-Tools
(und ihrer Vorgängersoftware „HyperPo“) werden in [
Joc13
] als
self-serve analysis tools for
62
http://voyant-tools.org/
64
Kapitel 2 Forschungskontext und relevante Technologien
traditional concording and co-occurrence alongside more experimental widgets for the processing
and deforming of textual data
beschrieben. Viele der experimentellen Funktionen wer-
den jedoch nicht länger angeboten, sind nicht gewartet oder nicht in neuere Versionen
übertragen worden. Aus der Entwicklung der Werkzeuge sind jedoch viele interessante
Erkenntnisse entstanden, die durch entsprechende Publikationen verbreitet werden.
Sinclair gibt z. B. in [
Sin03
] den wichtigen Denkanstoß:
Design of new tools [...] should give
full space to how literary critcs interact with texts, rather than simply focus on what computers
can do well.
Daneben gibt es noch eine große Zahl spezialisierter Rechercheumgebungen, welche an
einzelne Projekte oder Korpora gebunden sind oder welche für bestimmte Einsatzzwe-
cke in Forschungsinfrastrukturen vorgehalten werden. Erstere sind z. T. als
Open Source
Software
frei verfügbar und so (zumindest theoretisch) auf eigene Bedürfnisse anpassbar.
Letztere Systeme lassen sich durch die Serviceorientierung der Infrastrukturen meist
mit weiteren Werkzeugen kombinieren, dagegen aber in der Regel nicht umfassend
anpassen.
Die Erarbeitung eines Überblicks über alle existierenden Werkzeuge allein böte genügend
Stoff für eine eigenständige Dissertationsschrift, weshalb an dieser Stelle nur auf we-
sentliche Vorarbeiten im Sinne der vorgestellten Forschungsfragen eingegangen werden
kann. Für die Verbindung von Textmodell und Graphenrepräsentation existieren einige
Präzedenzfälle, die hier eine eingehendere Erwähnung finden sollen:
Seit 2006 existiert ein jährlich im Rahmen verschiedener Konferenzen abgehaltener
Workshop on Graph-based Algorithms for Natural Language Processing
63
. Dort liegt der Fo-
kus auf Algorithmik und dem Aufbau einer Graphstruktur als Vorverarbeitungsschritt
für Verfahren der automatischen Sprachverarbeitung. Auch im Rahmen anderer Veran-
staltungen und in Journalen wird diese Arbeitsweise zuweilen aufgegriffen.
Es kommen dabei z. T. sehr unterschiedliche Formen der Graphinduktion zum Einsatz,
da die Entscheidung, welche Analyseeinheiten durch Knoten und Kanten repräsentiert
werden sollen, in diesen Szenarien stark vom anzuwendenden Algorithmus (und natürlich
der Zielstellung) abhängt.
In [
MT04
], wo die Anwendung des PageRank-Algorithmus
64
auf graphförmige Textreprä-
sentationen vorgestellt wird, heißt es zu dieser Thematik:
63
http://www.textgraphs.org/
64
s. [PBMW99]
65
2.4 Vorarbeiten und verwandte Gebiete
Depending on the application at hand, text units of various sizes and characteristics
can be added as vertices in the graph, e.g. words, collocations, entire sentences, or
others. Similarly, it is the application that dictates the type of relations that are used
to draw connections between any two such vertices, e.g. lexicalor semantic relations,
contextual overlap, etc.
Oft wird dabei eine sehr kondensierende Sichtweise gewählt, die auf bestimmte An-
wendungsfälle abgestimmt ist, wie z. B. in [
RV13
], wo ein
Graph-of-word
“-Modell als
ungewichtetes gerichtetes Netzwerk von Kookkurrenztermen aus der Sequenz des Textes
abgeleitet wird.
Ansätze aus der Linguistik modellieren Texte meist feingliedriger, etwa unter Angabe
des Dependenzgraphen, Abbildung einzelner Wörter des Fließtexts, sequenzieller Ver-
knüpfung von Sätzen, aber auch weiteren relevanten Aspekten, wie einer verknüpften
Repräsentation von Koreferenz, vgl. [
MES07
]. Die Graphenrepräsentationen verschie-
dener gängiger Annotationsformate können in einer gemeinsamen Graphstruktur zu-
sammengeführt und vereinheitlicht werden, wie etwa in [
IS07
] vorgestellt. Seit diesen
Veröffentlichungen von 2007 ist jedoch keine universelle Adaption dieser Ideen innerhalb
der Computerlinguistik oder in die Korpuslinguistik hinein zu beobachten.
Neuere Arbeiten zur nicht-persistenten Repräsentation von Korpora mit mehrschichti-
gen linguistischen Annotationen umfassen z. B. die Arbeiten von Neumann, s. [
Neu15
],
für die verlustlose Konvertierung zwischen linguistischen Annotationsformaten. Eng
verwandt damit sind die Arbeiten zu „Salt“
65
, einem Theorie-neutralen Metamodell“ für
linguistische Annotationen, s. [ZR10].
Ansätze, in denen der Graph nicht nur als Speicherungsform oder Werkzeug zur For-
matkonvertierung angesehen wird, sondern als umfassender digitaler Repräsentant des
textuellen Untersuchungsgegenstandes, kommen insbesondere bei Textanalysen auf
lexikalisch-semantischer Ebene zum Einsatz. In [
MGWD10
] werden z. B. die Metadaten
der Dokumente verwendet, um die korpusweite zeitliche Dynamik der Interaktion von
Vokabular (in diesem Fall auf der Ebene von Lexemen) zu untersuchen. Der Fokus liegt
dabei auf einer Nutzung linguistischen Wissens für die Analyse der Texte, wobei die
Ideen für die Netzwerkinduktion von kookkurrenzbasierten Modellen bis zur Nutzung
von
Word Embeddings
weiterentwickelt wurden, vgl. [
EM16
]. Einen dazu passenden (nicht
auf Graphentechnologien basierenden) Beitrag zur feingranularen Aggregierung von
65
http://corpus-tools.org/salt/
66
Kapitel 2 Forschungskontext und relevante Technologien
Kollokationen (also Kookkurrenzwörtern in gewünschten Kontexten) in großen Korpora
auf der Basis von Dokumentzeitstempeln bietet das Werkzeug DiaCollo, s. [JGW16].
In einigen allgemeineren Ansätzen ohne Fokus auf das
Text Mining
wird versucht, das
abstrakte Modell der TEI-Spezifikation von XML losgelöst zu betrachten und z. B. mit
Semantic-Web-Methoden zu modellieren, wie etwa in [
TMK
+
06
] und [
CSFF16
]. Schmidt
fasst in [
Sch10
] umfassend die bestehenden Bedenken gegen das OHCO-Modell zusammen
und schlägt als Nachfolgetechnologie sogenannte
Multi-Version Documents
vor, die in
einer Graphrepräsentation vorliegen und mehrere Varianten und Lesarten gleichzeitig
abbilden können. Anwendungsfälle einer solchen Kodierung von Textvarianten in der
Manuskripterfassung wurden dabei bereits in [Sch06] vorgestellt.
Nicht nur Texte, sondern auch lexikalische Ressourcen, die für deren Analyse herangezo-
gen werden können, lassen sich gewinnbringend in Graphenform vorhalten und darin
zielgerichtet abfragen. Als konzeptuelle Weiterentwicklung“ digitaler Thesauri wurde
bereits Mitte der 1980er Jahre, mit WordNet
66
eine als Netzwerk strukturierte Ressource
geschaffen, in der Beziehungen nicht mehr nur auf der Ebene von Wörtern, sondern von
Wortbedeutungs-Einheiten
67
modelliert sind, s. z. B. [
Fel98
]. Seitdem wurde z. B. in [
Tri06
]
mit dem
Lexicon Graph
eine graphbasierte Lösung zur Zusammenführung verschiedener
lexikalischer Ressourcen geschaffen und mit UBY
68
ein sehr umfassende Datensammlung
erstellt, s. [
GEKH
+
12
], welche sich über einen RDF-Export in eine Graphdatenbank einle-
sen lässt, vgl. [
EKMC15
]. Eine gleichzeitige Betrachtung von lexikalischen Ressourcen und
Textannotationen ermöglicht die Arbeit von Damerow zu einer Forschungsumgebung,
die auf die „Meso-Skale“, also den Bereich zwischen Mikro- und Makrosicht auf Text,
abzielt, s. [Dam14]. Dort wird eine Graphstruktur aus Quadrupeln
69
modelliert.
Neben text- und wortbezogenen Modellen werden auch solche Ansätze verfolgt, die sich
bewusst auf Aspekte der Strukturrepräsentation beschränken. Im Jahr 2008 wurde von
Liu und Smith in Reaktion auf die Unzulänglichkeiten des OHCO für die digitale Erschlie-
ßung von Manuskripten auf Grundlage des relationalen Datenbankmodells in [
LS08
] eine
flexible Modellierung einzelner Text enthaltender Objekte unterschiedlicher Granularität
vorgestellt. Diese werden in Sequenz und als Netzwerk, welches aus unterschiedlichen
„Kantentypen“ aufgebaut ist, beschrieben. Die einzelnen „Sprachobjekte“ werden dabei
allerdings nicht genauer charakterisiert. Dazu heißt es:
66
http://wordnet.princeton.edu/
67
sogenannten Synsets, welche auf Synonymie basieren
68
http://www.ukp.tu-darmstadt.de/data/lexical-resources/uby/
69
welche als „kontextualisierte“ Tripel verstanden werden
67
2.4 Vorarbeiten und verwandte Gebiete
An alternate model might define text, therefore, as "a labelled network of language
objects." A "language object" is like the "content object" in the OHCO model; exam-
ples of language objects are chapters, lines, pages, paragraphs, words, [...]
This is a more flexible model than the hierarchical, where the relationships between
elements are implied by the hierarchical structure [...]
The network model is more useful for exploratory projects [...]
Ein Projekt mit ähnlichem Fokus auf die Modellierung von Struktur allein ist die bereits
erwähnte CITE-Infrastruktur mit den CTS-Zugriffsmöglichkeiten. Dort wird für kanoni-
schen Text, also Dokumente oder ganze Korpora mit jeweils wohl definierten Primär-
hierarchien für die Strukturierung eine technische Repräsetationsform über Semantic-
Web-Technologien geschaffen, die als Spiegel der traditionellen Editionspraxis fungieren
soll.
Aus den Reihen der Digitalen Geisteswissenschaften werden derzeit darüber hinaus einige
Experimente zur Nutzung von Graphdatenbanken durchgeführt. In [
KA16
] liegt dabei der
Schwerpunkt in der Stemmatologie, der netzwerkartigen Auflistung von handschriftlich
niedergeschriebenen Varianten eines Textes zur Rekonstruktion seiner Überlieferungs-
geschichte. Auch dort müssen dazu feingliedrigere Modellierungsebenen der einzelnen
Texte beachtet und abgebildet werden. Dabei wird der Text als dokumentübergreifend
verknüpfte Sequenz von Textteilen in der Graphdatenbank abgebildet, ohne dass je-
doch ein graphbasiertes Modell für diese Textteile selbst entwickelt wird. Es heißt dazu:
„So sind Einheiten, wie zum Beispiel Single-Wörter, Sätze oder ganze Paragraphen, etc.
vorstellbar.“
Aus einer Reihe weiterer Experimente zur Nutzung von Graphdatenbanken in den Geis-
teswissenschaften
70
ist ein kürzlich erschienener Beitrag im Bereich der digitalen Edi-
tionswissenschaft hervorzuheben: In [
Kuc16
] wird eine erste, sehr vielversprechende
Machbarkeitsstudie zur Abbildung von TEI-Editionen in Property-Graph-Datenbanken
vorgestellt. Auch hier wird jedoch kein besonderes Augenmerk auf eine Weiterverar-
beitung der Daten mittels
Text-Mining
-Verfahren oder die Abbildung großer Korpora
gelegt.
70
s. http://mittelalter.hypotheses.org/5089 und http://mittelalter.hypotheses.org/5995
68
Kapitel 2 Forschungskontext und relevante Technologien
2.5 Ableitbare Systemanforderungen
Unter Berücksichtigung der bis hierhin skizzierten Bedürfnisse digitaler geisteswissen-
schaftlicher Forschung und der aktuellen Entwicklung im technologischen Umfeld der
Textrepräsentation, lassen sich einige zentrale Anforderungen an ein neuartiges, ergän-
zendes Recherchesystem definieren.
Das Ziel, in dieser Arbeit die Grundlage für alternative Ansätze bei der Entwicklung
textbezogener Recherchesysteme zu schaffen, geht mit einer technologischen Abkopp-
lung von bisherigen Standardlösungen einher. Bei der Konzeption dieser Alternative
sollen die Stärken der verschiedenen oben gelisteten Vorarbeiten berücksichtigt werden.
Da die Entwicklung von Recherchewerkzeugen stets ein interdisziplinärer Prozess ist
(oder zumindest sein sollte), sind auf verschiedenen Ebenen auch unterschiedliche
Nutzergruppen involviert. Die Systemanforderungen aus Sicht von Informatikern, Pro-
grammierern und Nutzern aus den Sozial- und Geisteswissenschaften sind divers und
sicher nicht in jedem Fall miteinander vereinbar. Die Anwendungsgebiete sind darüber
hinaus deutlich zu breit für die Durchführung einer verallgemeinernden softwaretech-
nischen Domänenanalyse, z. B. entsprechend [
KCH
+
90
]. Die letztendliche Spezifikation
eines spezialisierteren Recherchesystems muss daher einzelfallbezogen in einem gemein-
samen Prozess enger Abstimmung stattfinden, der im Rahmen dieses Buches so nicht
vollzogen werden kann. Dem Autor ist bewusst, dass die Auswahl und Wichtung der
folgenden Aspekte daher durchaus subjektive Züge trägt.
Es wurde jedoch darauf geachtet, die Anforderungen so zu formulieren, dass sie nicht
einer konkreten finalen Spezifikation vorweggreifen, sondern vielmehr deren Findung
unterstützen. Über den vorgestellten Aspekten steht eine zentrale Kernanforderung: die
Schaffung einer flexiblen Technologie. Flexibilität ist dabei eine schwer zu definierende
Größe. Sie wird in [
NYSC00
] als
measure of the potential rather than performance
“,
user-
or situation specific
und zudem
difficult to determine a priori
beschrieben. Nur wenn die
erstellte Software durch Erweiterungsmöglichkeiten oder generische Lösungsansätze
auch außerhalb ihrer ursprünglichen Spezifikation einsetzbar ist, kann auf die Fülle an
Themen und Forschungsperspektiven sowie die Besonderheiten von Quellensammlun-
gen, welche die Anwendungsdomäne mit sich bringt, adäquat reagiert werden. Unter
Berücksichtigung dieser angestrebten systematischen Flexibilität und mit Blick auf die
bestehenden Werkzeuge und vorgestellten Vorarbeiten lassen sich im Einzelnen die
folgenden Schlagwörter herausgreifen:
69
2.5 Ableitbare Systemanforderungen
Non-destruktive Datenhaltung:
Die Akzeptanz eines Recherchesystems steht und fällt mit dem Vertrauen in seine Quel-
lentreue. Falls die ins System eingespeisten Roh-Textdaten für weitergehende Analysen
umgeformt werden müssen, (z. B. um nicht-standardisierte Orthographie zu vereinheitli-
chen), so muss jederzeit die Möglichkeit zur Rekonstruktion der Originaltexte aus der
internen Repräsentation heraus bestehen. Dabei sollte der Rückschluss von den transfor-
mierten auf die originalen Stellen möglichst direkt erfolgen können. Der Nutzer sollte
auch nach dem initialen Einlesen die Möglichkeit zur forschungsgeleiteten Anpassung
der internen Repräsentation haben, ohne das Original separat verändern zu müssen oder
seine Integrität unabsichtlich zu kompromittieren.
Vorberechnungsfreie Statistiken:
Da zu erwarten ist, dass sich in explorativen Untersuchungen der Textbasis häufig der
Analyseschwerpunkt ändert, und viele unterstützende statistische Auswertungen dann
am aussagekräftigsten sind, wenn Sie direkt den aktuellen Kontext betreffen, müssen
Möglichkeiten geschaffen werden, statistische Berechnungen so vorzunehmen, dass sie
diesen häufigen Kontextwechseln in besonderem Maße gerecht werden. Statt, wie üblich,
zunächst das manuelle Definieren von Subkorpora zu erfordern, um anschließend eine
Offline
-Neuberechnung von Statistiken auf Basis dieser eingeschränkten Textsammlung
vorzunehmen, sollten statistische Auswertungen möglichst ohne Vorberechnung und
direkt auf der bestehenden Datenbasis unter Einschränkung auf den aktuellen Kontext
durchführbar sein.
Interaktive Bedienung mit vertretbaren Antwortzeiten:
Die Steuerung des Analysevorgangs durch den Forscher muss zu jedem Zeitpunkt eine
Änderung von Parametern und Rückführung interessanter Resultate auf neue Recherchen
ermöglichen. Lange Wartezeiten zwischen dem Absetzen einer Anfrage und der Anzeige
von Ergebnissen hemmen dabei die Produktivität und stören überdies den immersiven
Recherchevorgang. Bei potentiell langen Vorgängen ist eine interaktive Rückmeldung
über den aktuellen Bearbeitungsstand wichtig. Zudem ist es wünschenswert, etwaige Zwi-
schenergebnisse ohne unnötige Wartezeiten bis zum Abschluss des Gesamtvorgangs zu
erhalten. Das Abbrechen von nicht länger gewünschten Anfragevorgängen soll jederzeit
möglich sein.
Unterstützung navigierender und explorierender Visualisierungstechniken:
Zusätzlich zu interaktiven und vorberechnungsfreien Abfragen muss ein exploratives
Recherchesystem in der Lage sein, eine lokale Sicht auf die Daten abzubilden. Angren-
70
Kapitel 2 Forschungskontext und relevante Technologien
zende Kontexte müssen direkt erreichbar und einfach aggregierbar sein. Eine Erhöhung
und Verringerung des Detailgrads ausgegebener Informationen sollte möglich sein, um
Abstraktion und das Aufdecken von Abhängigkeiten zu ermöglichen.
Gute Integrierbarkeit bei Vermeidung technologischer „Medienbrüche“:
Das System soll flexible Möglichkeiten für den Import von Daten aus Quellensammlun-
gen und Drittsystemen bieten. Ein großer Möglichkeitsraum für Transformation und
Abfrage soll die Notwendigkeit für einen gleichzeitigen Einsatz weiterer Analysesysteme
reduzieren, um eine schwer zu synchronisierende und potentiell inkonsistente Daten-
haltung in mehreren Systemen zu vermeiden. Um jedoch kein „Datensilo“ zu erzeugen,
soll das System ebenso flexible Möglichkeiten für die Serialisierung und den Export für
die Weiterverarbeitung von Daten und Rechercheartefakten in anderen Programmen zur
Verfügung stellen und unabhängig von konkreten Austauschformaten sein.
Weitestgehende Sprach- und Skriptunabhängigkeit:
Für eine breite Anwendbarkeit des Systems muss gewährleistet sein, dass es mit einer
Vielzahl an Quellensorten und Quellensammlungen kompatibel ist. Insbesondere sollten
keine Beschränkungen bei alternativen Schreibrichtungen (u.a. von rechts nach links), un-
gewöhnlichen Alphabeten oder Texten, die mit Sonderzeichen durchsetzt sind, auftreten.
Die Übertragbarkeit für die damit entwickelten Verfahren sollte durch die Entkopplung
von sprachabhängigen und sprachunabhängigen Aspekten im Datenmodell und im Ba-
sisprogramm begünstigt werden. Bei all dieser methodischen Offenheit sollte jedoch
berücksichtigt werden, dass keine voreilige Ausrichtung auf seltene Sonderfälle geschieht:
Standardfälle sollten sich sehr einfach handhaben lassen und komplexe Randphänomene
lediglich grundsätzlich (ggf. mit angemessenen Zusatzaufwänden) abbildbar sein.
71
Kapitel 3
Kadmos ein graphbasiertes
Recherchesystem
Οἱ δὲ Φοίνικες οὗτοι οἱ σὺν Κάδµῳ ἀπικόµενοι, τῶν ἦσαν οἱ
Γεφυραῖοι, ἄλλα τε πολλὰ οἰκήσαντες ταύτην τὴν χώρην ἐσήγαγον
διδασκάλια ἐς τοὺς ῞Ελληνας καὶ δὴ καὶ γράµµατα, οὐκ ἐόντα πρὶν
῞Ελλησι ὡς ἐµοὶ δοκέειν, πρῶτα µὲν τοῖσι καὶ ἅπαντες χρέωνται
Φοίνικες·
Diese Phönizier, die mit Kadmos kamen, unter denen sich auch die
Gephyräer befanden, haben mit sich viele Lehren zu den Hellenen
gebracht, insbesondere auch die Schriftzeichen welche diese vorher
nicht hatten, wie ich meine die anfangs gleich den phönizischen
waren.
Herodot von Halikarnassos
Griechischer Historiker und Geograph
[Hdt. 5.58.1], ins Deutsche, entsprechend des Herodot-Korpus
72
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
3.1 Entwicklungsziele
Bei der Entwicklung der Rechercheanwendung Kadmos
1
wird das Ziel verfolgt, die im
letzten Kapitel beschriebenen Technologien so einzusetzen, anzupassen und zu erweitern,
dass die herausgearbeiteten Systemanforderungen erfüllt sind. Konkret bedeutet das,
dass ein System geschaffen werden muss, durch welches eine breite Anwendbarkeit der
Technologie für eine Vielzahl denkbarer Anwendungsfällegewährleistetist. Entsprechend
sollte diese gewünschte Flexibilität anhand verschiedener Korpora in verschiedenen
Alphabeten und Sprachen nachgewiesen werden.
Da das System quantitative Aussagen für den Forschungsbereich ermöglichen soll, muss
die Korrektheit zurückgelieferter Ergebnisse gewährleistet sein, so dass keine Approxima-
tionen im Kern des Systems stattfinden dürfen. Sind (potentiell schneller zu erlangende)
Näherungen für einen Anwendungsfall zulässig, so sollten diese explizit vom Nutzer
angefordert werden. Das System muss dabei genügende Anpassbarkeit aufweisen, um
dafür gegebenenfalls nötige Hilfskonstrukte in das Datenmodell einfügen zu können
bzw. die entsprechenden Abfragen in einer alternativen Art und Weise zu formulieren,
so dass näherungsweise Resultate zurückgegeben werden können. Insgesamt soll das
Grundsystem so wenige Annahmen über die abzubildenden Quellen und die späteren
Anfrageszenarien tätigen, wie möglich.
Im Sinne universeller Nutzbarkeit und guter Wartbarkeit soll das System seine Funktionen
über serverbasierte Dienste anbieten, um eine lose Kopplung der Komponenten zu errei-
chen. Werden die Services dann über webbasierte Schnittstellen angeboten, erlaubt dies
eine flexible ortsungebundene Nutzung auch auf leistungsschwächeren Endgeräten.
Im Lichte allgemein steigender Anforderungen an serverbasierte Softwaresysteme, etwa
im Hinblick auf kurze Antwortzeiten, massiv-parallele Zugriffe, ständige Erreichbarkeit
und nur durch Hardwaregrenzen limitierte Erweiterbarkeit des Datenbestandes, haben
sich neue Entwurfsmuster für komplexe Anwendungen entwickelt. Der Aufbau von Kad-
mos soll sich an den Architektur- und Entwicklungsrichtlinien des 2014 konzipierten
Reactive Manifesto
2
orientieren, insoweit das für eine prototypische akademische Software
(mit perspektivisch zunächst eng umgrenzter Nutzerzahl) sinnvoll ist.
1
Der Name Kadmos leitet sich nicht von einem technischen Akronym ab, sondern ist von der gleichnami-
gen Sagengestalt des klassischen Altertums entlehnt, die hier symbolisch für den Technologietransfer
im Bereich verschriftlichter Sprache stehen soll.
2
http://www.reactivemanifesto.org/
73
3.1 Entwicklungsziele
Konkret bedeutet das zum einen, dass die angesprochene lose Kopplung von Programm-
teilen (wie sie in modularen Softwaresystemen und objektorientierten Umgebungen
bereits lange praktiziert wird) wo immer es möglich und sinnvoll ist, durch asynchrone
Anfrage-Ausführung und Kommunikation der Komponenten unterstützt werden soll.
Dadurch werden Latenzen verringert und Ressourcen effektiver genutzt. Weiterhin soll
eine Skalierung des Systems durch
Sharding
und
Replikation
auch auf Cluster aus meh-
reren Rechnern unterstützt werden. Dabei sollen Daten persistent gespeichert und in
konsistenter Form abgefragt werden können. Das Antwortverhalten für übliche Abfragen
soll sich zudem im Bereich der
Realtime
-Interaktion, also in der Regel maximal im Bereich
von Sekunden, nicht von Minuten bewegen.
Bei der Entwicklung von Kadmos soll zudem ein besonderes Augenmerk auf prototypische
Entwicklung gelegt werden. In [
GR10
] argumentieren Galey und Ruecker, dass Prototypen,
da sie so viel implizites Wissen, Abstraktionen und Vorannahmen enthalten, genau wie
wissenschaftliche Papiere (und zunehmend auch digitale Datensammlungen) einem
Peer-
Review
-Prozess unterzogen werden sollten. Für eine solche zukünftige Anforderung ist es
von Vorteil, über einheitliche Modellierungs- und Ausführungsumgebungen zu verfügen.
Hat das Kernsystem erst einmal im Review-Prozess bestanden, muss ggf. künftig nur
noch die jeweilige Erweiterung von Experten untersucht werden.
Ruecker unterscheidet in [
Rue15
] für das Umfeld von Digital-Humanities-Projekten drei
Arten der prototypischen Systementwicklung: Bei „produktionsgetriebenen“ Prototypen
steht die schrittweise Verfeinerung eines Rohprodukts hin zu einem stabil lauffähigen
Produktivsystem im Fokus. Bei „experimentellen“ Prototypen ist das Ziel eher, generali-
sierbares Wissen über Daten, Methodik und Forschungsfragen aus dem Erstellungsprozess
abzuleiten. Schließlich werden bei so genannten
provotypes
auf provokative Weise Ge-
wohnheiten und Erwartungen durch innovative Herangehensweisen hinterfragt und
herausgefordert, was sich meist in alternativen Nutzeroberflächen und Interaktionsfor-
men widerspiegelt.
Mit Kadmos soll eine geeignete Plattform für alle drei dieser Herangehensweisen ge-
schaffen werden. Ziel ist es, eine robuste technologische Grundlage für neuartige Recher-
chewerkzeuge über ein feingliedriges, viele Kontexte zugänglich machendes Datenbank-
system mit interaktiven Abfragemöglichkeiten und großem Erweiterungspotential zu
schaffen. Das dafür verwendete digitale Ordnungs- und Zugriffsschema wird im nächsten
Abschnitt vorgestellt.
74
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
3.2 Daten- und Domänenmodell
Für die Modellierung von Korpora, aber auch von Querschnittsaspekten, wie der Nutzer-
daten- und Rechteverwaltung, wird in Kadmos das Property-Graph-Modell verwendet.
Falls dabei für Knoten grundsätzlich mehrere Werte für eine Eigenschaft zugelassen
werden sollen (z. B. Namen von Autoren, Login-Identitäten von Nutzern), so werden die
entsprechenden Eigenschaften-Wert-Paare jeweils in einem neuen Knoten abgespeichert,
welcher über eine entsprechende Kante mit dem Original verbunden wird. So wird es
möglich, jeden der zugewiesenen Werte einzeln zu addressieren, und bei Bedarf z. B. in
einen Namensknoten eine Property zum Namensytyp (mit Werten, wie „Geburtsname“
oder „Krönungsname“) zu notieren oder der verknüpfenden Benennungs-Kante eine
Eigenschaft „bevorzugt als Anzeigename verwenden“ beizufügen.
Eigenschaftenwerte in Zeichenkettenform werden dabei durch ein externes Indexsystem
verwaltet, wobei die Synchronisierung mit der Datenbasis automatisch geschieht. In der
Theorie kann eine solche Indizierung auch direkt über Konstrukte der GraphDB gesche-
hen, wie z. B. [
RN11
] zeigt. Für die Anwendung in Kadmos ist jedoch die Separierung dieser
Aspekte in zwei spezialisierte und korrespondierende Systeme absolut zweckmäßig.
Im interaktiven prototypischen Entwicklungsszenario ist die Introspektionsfähigkeit
für momentan selektierte Objekte ein wichtiges Arbeitsinstrument: Einzelne Elemente
des Graphen sollten auch bei Abfragen mit reduziertem Kontext noch aussagekräftige
Konstrukte sein. Da das Property-Graph-Modell zwar Kantenlabels kennt, aber Knoten
keinen Typ besitzen, wird dieser in Kadmos für alle Knoten über eine Property (namens
node_type
) emuliert. Aus Effizienzgründen wird dabei ausnahmsweise bei Knoten vom
Typ Token (als am häufigsten auftretendem Knotentyp) auf die Speicherung einer solchen
Property verzichtet. Dadurch ist das Nicht-Vorhandensein der Property ein genauso
eindeutiges Knotentyp-Merkmal wie es ein entsprechender Propertywert wäre. Die Werte
werden platzsparend in numerischer Form gespeichert, sind im Programm aber über ihre
Namen nutzbar.
Die Grundzüge des im Folgenden beschriebenen Datenmodells für die Repräsentation von
Text wurden bereits in [
Efe15
] vorgestellt. Sie ergeben sich aus der intuitiven Abbildung
von Textelementen, deren Hierarchie und Sequenz sowie weiteren für die Recherche
notwendigen Angaben in Graphenform. Anders als etwa in [
Kuc16
] wird in Kadmos dabei
in Types und Tokens unterschieden. Zum einen verbessert dies die Ausnutzung von Spei-
75
3.2 Daten- und Domänenmodell
cherplatz, indem Redundanzen vermieden werden. Zum anderen ergibt sich darüber eine
wichtige Traversierungsachse für das
Text Mining
, wie später noch demonstriert wird.
Abbildung 3.1 zeigt (unter Ausblendung von Kantentypen) die wesentlichen Modellkon-
strukte, die für die Repräsentation eines Dokuments zum Einsatz kommen.
The quick brown fox jumps over the lazy dog. All
the leaves are brown. The ship leaves tonight.
Abbildung 3.1: Schematische Darstellung der Instanzdatensätze und
Verknüpfungen eines kurzen Beispieldokuments bei minimalistischem
Textdatenmodell
Die Unterteilung des Dokuments in Token erfolgt in diesem Beispiel an Leerstellen. Allge-
mein wird ein solches einfaches und relativ sprachunabhängiges Tokenisierungsmodell
bevorzugt, in denen nicht-freistehende Satz- und Sonderzeichen nicht als Einzeltoken
betrachtet werden. Solche Sonderzeichen innerhalb der verknüpften Types werden bei
der Normalisierung eliminiert. Die „bereinigten“ Versionen der Types werden als „nor-
malisierte Types“ abgespeichert und mit den entsprechenden Types verknüpft. Dieses
Verfahren wird noch in Abschnitt 3.6 auf Seite 91 detailliert vorgestellt.
Die Token sind die zentralen Elemente des Graphen, sie selbst besitzen standardmäßig
jedoch keine Eigenschaften. Ihre ganze Bedeutung ergibt sich aus Ihrem Kontext, welcher
über Kanten zu anderen Knoten hergestellt wird. Abbildung 3.2 auf der nächsten Seite
zeigt die verschiedenen Pfade, die vom Token ausgehend zum einen über Strukturie-
rungselemente in Richtung der Dokumente und Metadaten existieren, als auch die Pfade,
76
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
die über Types hin zu lexikalischem Wissen und nutzerdefinierten Konzepten führen. Die
Graphentraversierung ermöglicht es, über diese Pfade nicht nur unmittelbare Nachbar-
schaft als Kontext aufzufassen, sondern auch weiter entfernt liegende und nur indirekt
verknüpfte Elemente als Kontext zu betrachten.
Abbildung 3.2: Schema der tokenzentrierten Datenmodellierung mit möglicher
Definition von „Schichten“ innerhalb der verknüpften Umgebung
Im gesamten Modell werden immer wiederkehrende Aspekte wie Sequenz und Hierarchie
grundsätzlich immer mit den gleichen Kantentypen abgebildet. Ein Element ist über
eine ausgehende
next
-Kante mit seinem Nachfolger (bzw. seinen Nachfolgern) verknüpft
und über eine ausgehende
belongs_to
-Kante mit seinem übergeordneten Element (bzw.
mit mehreren). Für die genauen Ausprägungen dieser kontextdefinierenden Zugehö-
rigkeiten im Modell existieren verschiedene Varianten. Aus diesen ergeben sich jeweils
andere Implikationen für die generellen Traversierungsmöglichkeiten und für die Her-
stellung von effizienter Referenzierbarkeit einzelner Textstellen. In Abbildung 3.3 auf
der nächsten Seite sind die verschiedenen denkbaren Varianten abgebildet. Dazu wird in
Tabelle 3.1 auf Seite 79 eine Übersicht über die daraus resultierenden Auswirkungen auf
Speicherplatzbedarf und Zugriffsaufwände gegeben.
Zur Auswahl einer „korrekten“ Modellierungsart wird in dieser Arbeit keine Festlegung
getroffen. Letzten Endes handelt es sich dabei um eine in der Informatik übliche Abwä-
gung zwischen Speicherplatzbedarf und Bearbeitungsgeschwindigkeit. Dabei sind nicht
nur die Komplexitätsklassen, sondern insbesondere auch die konstanten Faktoren zu
berücksichtigen und so die Varianten anwendungsfallbasiert gegeneinander abzuwägen.
Innerhalb dieser Arbeit wird mit
(c)
, dem vollständigsten Modell, das ohne Positions-
Kanten-Properties auskommt, gearbeitet. Eine Abweichung davon macht gewisse Ände-
rungen an Basisabfragen nötig (bzw. Optimierungen möglich), welche sich sämtlichst in
Kadmos problemlos vornehmen lassen.
Eine explizite Nummerierung ist insbesondere dann interessant, wenn für viele Opera-
77
3.2 Daten- und Domänenmodell
(a)
(b)
(c)
(d)
(e)
Abbildung 3.3: Verknüpfungsvarianten für Hierarchie und Sequenz: (a) minimal,
(b) mit Struktursequenzen, (c) direkte Hierarchisierung, (d) Hierarchisierung ohne
Tokensquenz und (e) vollständig
tionen ein Überblick über die Lage von Fundstellen zueinander gewonnen werden soll,
wie es z. B. in [
NRR
+
12
] als Grundlage für komplexere Zugriffsszenarien verwendet wird
(„
combining the table of contents with semantic tagging, index items, and free-text searching
“).
Zusätzlich zu den Varianten zur Modellierung von direkten Hierarchie- und Sequenzbe-
ziehungen können verschiedene Formen der Verknüpfung über Hierarchiestufen hinweg
eingeführt werden, um die Traversierungsgeschwindigkeit zu erhöhen. Dies wird beispiel-
haft in Abbildung 3.4 auf Seite 80 gezeigt. Zur Optimierung von Laufzeiten kann zusätzlich
überlegt werden, eigene Kantentypen für die „Abkürzungen“ zu hohen Hierarchiestufen
(wie Dokumenten) einzuführen (im Gegensatz zum generischen
belongs_to
“), oder
den Knotentyp des Zielknotens als Kantenproperty zu speichern. Das tatsächliche Op-
timierungspotential ist dabei allerdings vom Anwendungsfall und vom verwendeten
Backend abhängig. Auch hierzu soll daher keine allgemeingültige Empfehlung abgegeben
werden.
78
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
(a) (b) (c) (d) (e)
Speicherbedarf
Knoten s+t s+t s+t s+t s+t
Kanten (Sequenz) t-1 s+t-2 s+t-2 s-1 s+t-2
Kanten (Hierarchie) s s t t t
Kanten (Gesamt) s+t-1 2s+t-1 s+2t-2 s+t-1 s+2t-2
Kantenproperties s t t
3 Zugriffsoperationen (unter Annahme eines konstanten Index-Lookups)
zu Vorgänger/Nachfolger-Token 1 1 1 2 1
Tokenfenster der Breite 7 ermitteln 6 6 6 7 6
Token zu Satz 2i-1 2i-1 1 1 1
Satz zu n-tem Token n n n 1 1
Token zu n-tem Token (selber Satz) i+n-2 i+n-2 i+n-2 2 2
analog, übernächster Satz 2k-i+n-1 i+n+2 n+3 4 4
letztes Token im selben Satz i+n+2 i+n-2 i+n-2 2 2
Legende: s Satzanzahl
t Tokenanzahl
i aktuelle Token-Position im Satz
k durchschnittliche Länge eines Satzes in Token
Tabelle 3.1: Speicherbelegung und Abfrageaufwände für verschieden Grade der
Verknüpfung im Textdatenmodell
3.3 Technologie und Systemarchitektur
Um das beschriebene Datenmodell in der Rechercheanwendung effizient nutzen zu kön-
nen, ist die Wahl eines geeigneten Graphdatenbanksystems (als zentraler Komponente
für Datenhaltung und -zugriff) von großer Bedeutung. Wie bereits in Abschnitt 2.3.4 auf
Seite 56 vorgestellt, existiert mit Apache TinkerPop eine universelle Schnittstelle für
Property-Graph-Systeme in einer Java-Umgebung. Die objektorientierte Programmier-
sprache Java verfügt in Verbindung mit ihrer dynamischen Ausführungsumgebung (
Java
Virtual Machine
) über nützliche Funktionen, wie
Just-In-Time
-Kompilierung und automati-
sche Speicherverwaltung (
Garbage Collection
) und ermöglicht zudem eine weitestgehend
plattformunabhängige Systementwicklung. Daher wurde Java auch als Ausführungsum-
gebung für Kadmos bevorzugt.
Kadmos soll auch Korpora unterstützen, deren digitale Repräsentation größer ist, als
der zur Verfügung stehende Hauptspeicher. Daneben soll das System schnell gestartet
79
3.3 Technologie und Systemarchitektur
(a) minimal (b) tokenzentriert (c) maximal
Abbildung 3.4: Verknüpfung von Knoten für direkte Hierarchiesprünge
werden können, ohne lange initialisierungsbedingte Wartezeiten aufzuweisen. Das Da-
tenbanksystem muss daher eine persistente Speicherung der Korpusdaten sowie der
nutzerspezifischen Änderungen und Ergänzungen erlauben. Deshalb können reine In-
Memory-Lösungen, wie das in [
JR13
] beschriebene „imGraph“, trotz hoher Abfragege-
schwindigkeiten nicht verwendet werden.
Aus der Reihe potentieller Datenbanklösungen wurde das System Titan
3
ausgewählt,
wobei auf die Vielzahl von Alternativen an dieser Stelle nicht im Detail eingegangen wer-
den kann. Als populärstes System ist hauptsächlich Neo4j
4
(das möglicherweise reifste
Produkt auf dem Markt) hervorzuheben
5
. Im Gegensatz zu diesem weist Titan jedoch den
Vorteil auf, unterschiedliche, grundsätzlich austauschbare Speicher-
Backends
zu unter-
stützen. Noch in [
Sri11
] wurden für die Klassifizierung von Graphdatenbanken anhand
ihrer Speichersysteme nur zwei Gruppen unterschieden: die Systeme, die auf relationa-
len Datenbanken aufsetzen und diejenigen mit einem nativem (und fest eingebauten)
Graphen-Speicher. Titan hat eine dritte Gruppe begründet, in der NoSQL-Systeme zur
Speicherung herangezogen werden.
Diese umfassen z. B. auch massiv verteilbare NoSQL-Datenbanken (mit weniger komplexen
Datenmodellen), was für eine hohe Flexibilität hinsichtlich der Skalierung des Systems auf
größere verteilte Rechnerarchitekturen sorgt. Verschiedene solcher Systeme bedienen
dabei unterschiedliche Bereiche des durch das CAP-Theorem aufgespannten Raums.
3
http://titan.thinkaurelius.com/
4
http://neo4j.com/
5
Das Unternehmen hinter Neo4j, die Neo Technologies Inc., richtet viele branchenweite Veranstaltungen,
z.B. die internationale Konferenz GraphConnect (
http://graphconnect.com/
) aus. Damit fördert
sie die allgemeine Entwicklung dieser Technologie, positioniert das eigene Produkt allerdings auch
geschickt als Vorreiter-Lösung.
80
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
Neben der Partitionierbarkeit steht bei Apache HBase
6
die Konsistenz im Vordergrund,
während es bei Apache Cassandra
7
die Verfügbarkeit ist darüber hinaus ähneln sich
beide Wide Column Stores allerdings sehr stark.
Als „Zwischenschicht“ zwischen Anwender und Speichersystem unterstützt Titan eine
große Untermenge der in der Blueprints-API definierten Funktionen. Es ist also grund-
sätzlich möglich, auch das Datenbanksystem selbst nachträglich durch ein anderes mit
Blueprints kompatibles System auszutauschen. In der Praxis unterscheiden sich alle
Systeme allerdings leicht in Details der Konfiguration und Ansteuerung. Insbesondere
die Mechanismen zur Index-Definition sind bei Titan sehr systemspezifisch, weshalb
ein Austausch nicht ohne zusätzliche Aufwände zu realisieren wäre ein Umstand, der
wahrscheinlich bei allen Systemen dieser Komplexität auf die ein oder andere Weise
festzustellen wäre.
Titan besitzt (auch bereits mit einem lokalem Speicher-Backend) eine gute Abfrageperfor-
mance sowie die angesprochene gute Skalierbarkeit in Clustern, s. z. B. [
JV13
]; wobei das
System (im Vergleich damaliger Versionen) auch laut [
KSM13
] nicht das schnellste der
untersuchten war. In [
MEP
+
14
] wird Titan mit anderen Graphdatenbanken, aber auch mit
In-Memory-Paketen ohne Persistenz-Funktionalität verglichen und dabei im Hinblick auf
die Antwortzeiten für vorgegebene Abfrageszenarien im Mittelfeld geführt. Es wird dort
allerdings als das langsamste bei Daten-Updates beschrieben. Da in Kadmos der lesende
Zugriff auf Daten im Vordergrund steht, kann diese Einschränkung jedoch hingenommen
werden.
In Anbetracht dieser zur Verfügung stehenden Komponenten ist Java eine adäquate Lauf-
zeitumgebung für Kadmos. Als Programmiersprache für prototypische Entwicklung ist
Java allerdings nur bedingt geeignet. Dynamische Programmier- und Scriptsprachen, wie
Python oder Ruby, sind grundsätzlich deutlich flexibler einsetzbar. Eine bei deren Verwen-
dung erforderliche separate Installation von Rechercheanwendung und Datenbanksystem
führt allerdings zu nicht unerheblichen prozessübergreifenden Kommunikationsauf-
wänden zwischen den Komponenten. Die im Rahmen dieser Arbeit vorgestellte Lösung
verwendet JRuby
8
, eine in Java geschriebene Implementierung der Programmiersprache
Ruby. Sie kann gemeinsam mit den auf TinkerPop basierenden Datenbankkomponenten
in der selben Laufzeitumgebung ausgeführt werden. Die Datenverarbeitung kommt so
6
http://hbase.apache.org/
7
http://cassandra.apache.org/
8
http://jruby.org/
81
3.3 Technologie und Systemarchitektur
ohne zusätzliche Serialisierungs- und Kommunikationsaufwände aus.
Für Ruby stehen zahlreiche gekapselte Programmbibliotheken zur Verfügung (soge-
nannte
Ruby Gems
), von denen die meisten ohne Anpassungsaufwände auch unter JRuby
genutzt werden können. Gems werden u. a. in einem zentralen Repositorium in aktuellen
und vergangenen Versionen vorgehalten. Über das Gem „Bundler“
9
können alle Gem-
Abhängigkeiten eines Projektes deklarativ erfasst und automatisch in den neuesten der
konfliktfrei kombinierbaren Versionen heruntergeladen und für das Projekt installiert
werden.
Abbildung 3.5 zeigt den prinzipiellen Aufbau des Systems. Die gestrichelten Linien sollen
andeuten, dass als Speicher-backends und Volltextindex-Systeme sowohl externe, auf
Rechnercluster skalierbare Lösungen als auch eingebettete Komponenten verwendet
werden können. Diese werden direkt von Titan entsprechend der Konfigurationsdatei
von Kadmos angesteuert. Durch Kadmos wird auch der angesprochene TinkerPop-Stack
geladen, dessen generische Abfragemechanismen dann für die JRuby-Komponenten
zur Verfügung stehen. Als eingebetteter Webserver wird der Java-Applikationsserver
„Glassfish“
10
über das JRuby-Gem „Mizuno“
11
geladen und mit der
Middleware
-fähigen
universellen Webserver-Schnittstelle „Rack“
12
verknüpft. Über dieses Konstrukt kann die
Threading
-Funktionalität von Glassfish in JRuby genutzt werden sowie eine synchrone
Anfragebeantwortung erfolgen.
Abbildung 3.5:
Architekturentwurf mit lokalen und entfernten Komponenten der
Kadmos-Umgebung
Die Rack-Middleware wird von mehreren weiteren Gems verwendet. Über den webba-
9
http://bundler.io/
10
http://glassfish.java.net/
11
http://github.com/matadon/mizuno
12
http://rack.github.io/
82
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
sierten Login-Mechanismus von „OmniAuth“
13
können viele verschiedene Authentifizie-
rungssysteme verwendet werden, um Accountinformationen fremder Identitätsprovider
in Kadmos zu nutzen. Diese werden internen Nutzerkonten zugeordnet, die im Graph-
datenbanksystem hinterlegt werden. Das Webframework „Sinatra“
14
setzt ebenfalls auf
der Rack-Funktionalität auf. Sinatra steuert das Anfrage-
Routing
, verwaltet die von au-
ßen erreichbaren APIs und beantwortet Anfragen von Webbrowsern mit dynamisch
erzeugten HTML -Seiten. Kadmos enthält noch viele weitere interne Komponenten und
eingebundene Gems, auf die an dieser Stelle nicht einzeln eingegangen werden kann.
Von zentraler Bedeutung ist jedoch die Komponente, die die effiziente Interaktion mit
der Graphdatenbank ermöglicht:
Wie bereits in Abschnitt 2.3.6 auf Seite 62 vorgestellt, existieren viele verschiedene Ansät-
ze für die Abfrage graphförmiger Daten. Dadurch, dass die Textdatendomäne, so wie hier
modelliert, einen klar umrissenen Aufbau mit gut abschätzbaren Eigenschaften besitzt,
ist die Wahl einer imperativen Abfragesprache möglich. Für Ruby steht mit dem Gem
„Pacer“
15
eine stark an Gremlin orientierte Abfragesprache zur Verfügung, welche ihre
Sprachkonstrukte direkt in JRuby integriert. Dabei werden als sogenannte
Routes
Daten-
verarbeitungsketten (über TinkerPop Pipes) erstellt, welche dann effizient ausgeführt
werden können. Zur Erzeugung der Routen existiert eine Domain Specific Language (DSL)
die über Methoden-
Chaining
deren schrittweisen Aufbau durch Traversierungsschritte,
Filterung,
Lookaheads
, Schleifen, Bedingungen, etc. unterstützt. Die Routen werden dann,
wenn auf ihre Ergebnisse zugegriffen wird,
lazy
im Blueprints-Framework evaluiert.
Die Eingenschaften der gewählten Laufzeitumgebung und Systemarchitektur kommen
der prototypzentrierten Entwicklung dabei sehr entgegen: Java unterstützt
Just-in-time
-
Kompilierung, kann also neuen Quelltext direkt zur Laufzeit in effizient ausführbaren
Maschinencode übersetzen, wodurch die Möglichkeit zum Hinzufügen von Programm-
funktionalität ohne Geschwindigkeitseinbußen (im Vergleich zum interpretierten Fall
reiner Scriptsprachen) besteht. JRuby erlaubt das Wiederöffnen von Klassen, so dass auch
bestehende Funktionalität zur Laufzeit angepasst werden kann. Daneben unterstützt es
eine Introspektion von beliebigen Instanzen. In Kombination mit den von Pacer bereitge-
stellten Funktionen bedeutet das, das zur Laufzeit eine Analyse von Abfrage-Routen und
deren konkreten Ausführungsstrategien stattfinden kann, was zur Geschwindigkeitsopti-
mierung unerlässlich ist.
13
http://github.com/omniauth/omniauth
14
http://www.sinatrarb.com/
15
http://github.com/pangloss/pacer
83
3.4 Asynchrone Webservicearchitektur
Über eine einfache aus Ruby-Konstrukten aufgebaute Definitionssprache können Knoten-,
Kanten- und Property-Typen beispielsweise so definiert werden:
1 node_property :string_value, :string, fulltext:true
2 node_type :name
3 edge_type :name
4 edge_property :name_type, :integer
5 edge_type :next
6 edge_type :belongs_to
7 edge_property :sequence_number, :long
Quelltext 3.1: Beispielcode für die Schemadefinition in Kadmos
Das Schema von Graphdatenbanken kennt, wie erwähnt, keine Knotentypen und erzwingt
daher auch keine festen Typen als Start- oder Endknoten einer Kante bestimmten Typs.
Ebenso wenig wird eine Zuweisung von Kantenproperties zu Kantentypen vorgenommen.
Diese Modellierungsfreiheit wird für die Schemadefinition in Kadmos übernommen. Die
obenstehenden Methodenaufrufe erzeugen lediglich neue numerische Knotentyp-IDs (als
effizient zu speichernder Wert für die
node_type
-Property), Kantentypen und Indexstruk-
turen für Properties. Daher muss für letztere zusätzlich ein Datentyp angegeben werden.
Weitere Wertebereichseinschränkungen, wie z. B.
uniq
für die Erzwingung eindeutiger
Werte, sind möglich. Die Schemadefinition erzeugt außerdem automatisch domänenspe-
zifische Abfragerouten für die Nutzung in Pacer-Abfragen, wie
create_kantentyp_node
oder find_kantentyp_node.
Kadmos ist als ein Recherchesystem mit Fokus auf Backendfunktionalität nicht ausschließ-
lich für die direkte Nutzung über eingebaute Bedienoberflächen konzipiert (auch wenn
diese in begrenzter Zahl bereits integriert sind), sondern ist insbesondere auf das Be-
reitstellen von über Netzwerkverbindungen nutzbaren Diensten ausgelegt. Die dafür
getroffenen Vorkehrungen und eingebauten Kommunikationsmechanismen werden im
nächsten Abschnitt vorgestellt.
3.4 Asynchrone Webservicearchitektur
Webservices sollen den Zugriff auf die Funktionalität und Ressourcen eines Systems über
etablierte Transportmechanismen und Protokolle des WWW ermöglichen. Sie stellen eine
grundsätzlich system- und implementierungsunabhängige Schnittstelle dar, die sich für
eine lose gekoppelte Interaktion zwischen Programmen und Programmteilen eignet.
84
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
Traditionell stellen Webservices eine komplexe, mehrschichtige Webtechnologie dar,
die etwa das Simple Object Access Protocol (SOAP) für XML-basiertes
Messaging
als Basis
für Schnittstellenbeschreibungen nach der Web Service Description Language bzw. Web
Service Definition Language (WSDL) nutzt. Darüber hinaus existieren Protokolle zum
automatisierten und maschinenlesbaren Veröffentlichen und Auffinden von Services in
Netzwerken, begleitet von einer darüber liegenden Schicht, die den
Service Flow
“, also
die Kombination und Orchestrierung mehrerer Teilservices betrifft und Protokolle, wie
(Web Services) Business Process Execution Language (BPEL) enthält, vgl. [Sha08].
In Kadmos sollen möglichst einfache Varianten von Webservices zum Einsatz kommen,
die schnell und unkompliziert von
Clients
genutzt werden können. Endpunkte sollen
dabei grundsätzlich ohne die Notwendigkeit zusätzlicher Abstraktionsschichten direkt
verwendet werden können etwa über einen einfachen Adressaufruf über Browser oder
über Standardsoftware auf der Betriebssystem-Kommandozeile.
Die Kommunikation zwischen zwei Endpunkten im Internet wird über verschiedene
übereinanderliegende Abstraktions- und Protokollschichten geregelt, s. z. B. [
Sha08
]. Die
genaue Einteilung von Protokollen in Schichten ist vom Referenzmodell abhängig, wobei
häufig das sieben Ebenen unterscheidende Modell der Open Systems Interconnection
(OSI) verwendet wird. Zwischen den hardwarenahen Schichten und den Protokollen
der Anwendungsebene findet mit dem Internet Protocol (IP) ein paketvermittelnder,
teilnetzübergreifend adressierender Versand von Teildaten über dynamische Routen
statt. Um eine vollständige und fehlerfreie Übermittlung und die korrekte Reihenfolge
der Pakete zu gewährleisten, überwacht und reguliert das Transmission Control Protocol
(TCP) den Datenfluss durch zusätzliche Steuerpakete. Dabei werden durch regelmäßige
Kontaktmeldungen zwischen den Kommunikationspartnern virtuelle TCP-“Verbindun-
gen“ aufrechterhalten, innerhalb derer eine effiziente Kommunikation möglich ist. Der
Aufbau einer solchen Verbindung benötigt eine gewisse Zeitspanne.
Das Hypertext Transfer Protocol (HTTP) ist ein statusloses Protokoll, das üblicherweise
TCP für den Datenaustausch verwendet. Es erlaubt einem
Client
(der meist ein Webbrow-
ser ist), Anfragen (
Requests
) an einen Rechner zu senden, welcher einen HTTP-Dienst
anbietet und mit
Responses
antwortet. Dieses Protokoll wird für leichtgewichtige Schnitt-
stellen nach den Prinzipien des Representational State Transfer (REST)“, vgl. [
Fie00
]
verwendet. Auch diese Schnittstellen werden in statusloser Kommunikation genutzt. Das
hat beispielsweise den Vorteil, dass ein
Load Balancing
mittels Verteilens der Anfragenlast
auf mehrere identische Systemkopien damit einfach umzusetzen ist, ohne, dass eine
85
3.4 Asynchrone Webservicearchitektur
bestehende „Kommunikationshistorie“ unter den Servern ausgetauscht werden muss.
In Kadmos sollen über Webservices angesteuerte APIs in der Lage sein, Zwischenstän-
de aufwändiger Berechnungen an den Browser des Nutzers zurückzumelden. Die dafür
denkbaren Kommunikationsmechanismen sind in Abbildung 3.6 schematisch abgebildet.
Bei Asynchronous JavaScript and XML (AJAX) müssten dabei periodisch Statusabfragen
gesendet werden, während Web Sockets eine vom Server ausgehende Meldung unterstüt-
zen, die neben der eigentlichen HTTP-Kommunikation abläuft. Schließlich ermöglichen
Server-Sent Events
(mit dem Beinamen
Event-Source
“), s. [
Hic15
], ein gestaffeltes, zeitver-
setztes Rücksenden des Nachrichteninhalts (im Sinne des HTTP Response Body).
Browser
HTTP
TCP
HTTP
Server
HTTP-Request
Verbindung Verbindung
HTTP-Request
Queue
HTTP-Response
SchließenSchließen
HTTP-Response
Wiederholtes AbfragenWiederholtes Abfragen
AJAX / XMLHttpRequest
Event
Nachrichten-Pakete
Nachrichten-Pakete
Direkte KommunikationDirekte Kommunikation
Websockets
Initaler Request
Verbindung Verbindung
Event
Teil-Response
NachnutzungNachnutzung
Javascript-Event
Event
Teil-Response
NachnutzungNachnutzung
Javascript-Event
Langlebende AnfrageLanglebende Anfrage
Server-Sent Events / Eventsource
Abbildung 3.6: Verschiedene Modelle der Client-Server-Kommunikation zum
asynchronen Nachladen von Inhalten
In Kadmos werden Server-Sent Events genutzt, da sie browserseitig einfach zu handhaben
sind und verzögerungsfreie Rückmeldungen ermöglichen. Ein Vorteil gegenüber Web-
sockets ist, dass keine explizite Behandlung von Aufruf-Abbrüchen stattfinden muss, z. B.
86
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
wenn das Browserfenster geschlossen wird. Da die „Ereignis-Quelle“ in diesem Anwen-
dungsszenario nicht kontinuierlich sendet, sondern nur anfragespezifische Rückgaben
an einzelne aufrufende Clients schicken soll, sollten beim Aufruf im Browser stets URL-
Query-Parameter angefügt werden, um ein automatisches
Pre-Fetching
zu verhindern. Als
Ersatzfunktion (
Fallback
) bei Nicht-Unterstützung von Event-Sources im Browser kann
ein sogenanntes
Polyfill
genutzt werden. Dieses realisiert die Anfrage als AJAX-Aufruf,
und feuert alle Events beim Schließen der Verbindung. Deshalb lohnt es sich, clientseitig
eingehende Zwischenergebnisse für einige Millisekunden zwischenzuspeichern (und auf
neuere Zwischenergebnisse zu warten), bevor visuelle Änderungen in der Seitendarstel-
lung angestoßen werden.
In Kadmos sind sowohl klassische synchrone REST-Abfragen
16
als auch Services mit
asynchronen Antworten realisierbar. Diese werden über die selben gekapselten Funk-
tionseinheiten implementiert, so dass ohne Mehrfachaufwände in der Programmierung
beide Schnittstellentypen gleichzeitig abgedeckt werden können. Intermediäre (asyn-
chrone) Ausgabe-Aufrufe werden dabei im synchronen Fall nicht versendet, sondern
verworfen, so dass die finale Ausgabe als einzige REST-Antwort zurückgegeben wird. Die
Schritte zur Implementierung einer einfachen Schnittstelle werden in Abschnitt 3.10
auf Seite 122 vorgestellt. In Abschnitt C auf Seite 252 im Anhang werden Beispielaufrufe
bereits vorhandener API-Endpunkte kurz vorgestellt.
3.5 Datenimport
Der Datenimport in Kadmos erfolgt direkt über Ruby-Programmcode, der innerhalb der
laufenden Kadmos-Instanz ausgeführt wird. Dadurch ist ein (je nach gewähltem Backend
mehr oder weniger unmittelbar) direktes Arbeiten mit dem partiell importierten Koprus
möglich. Es werden verschiedene Basisimporter (etwa für Verzeichnisse voller
Plain-
text
-Dateien) und spezialisierte Beispielimporter (etwa für das Reuters-Korpus oder
Voynich-Korpus) standardmäßig zur Verfügung gestellt. Der Import beliebiger weiterer
Formate und Dokumentsammlungen kann über eigens einzurichtende Module erfolgen,
welche auf eine umfangreiche Basisfunktionalität der
Importer
-Klasse zurückgreifen
können. In den vorliegenden Importmodulen kommen zum Teil bereits recht fortgeschrit-
tene Techniken zum Einsatz. So existiert die Möglichkeit, komprimierte Archivdateien
16
mit der Abwandlung, dass das Antwortformat auf JSON festgelegt ist so entfällt die Notwendigkeit
einer Content Negotiation
87
3.5 Datenimport
aus dem Internet zu laden und diese ohne Zwischenspeicherung auf der Festplatte im
Hauptspeicher zu entpacken und die einzelnen enthalten Dokumente schrittweise in die
Graphdatenbank einzulesen.
Der Einlesevorgang wird durch einzelne Methodenaufrufe gesteuert, die einer „event-
basierten“ Abarbeitung entsprechen: Das System besitzt einen internen Zustand, der
durch einfache Kommandos wie den Methodenaufruf
line
verändert werden kann
in diesem Fall um das Anlegen eines neuen Zeilen-Strukturelements, zu welchem die
dann folgenden Token zugewiesen werden. Der Import kann so „auf Zuruf“ erfolgen und
in dieser Konfiguration tatsächlich auch auf der Basis von
Events
oder
Streams
erfolgen.
Typischerweise werden die Methodenaufrufe aber in Schleifen ausgeführt, in denen auch
die Originalformate ausgelesen werden.
Das in Abbildung 3.1 auf Seite 76 gezeigte Beispieldokument kann programmatisch durch
wenige Methodenaufrufe in die Datenbank eingespeist werden, wie im folgenden Quell-
text 3.2 gezeigt wird:
1 document(string_value:"beispiel.txt").ensure_name("Beispieldokument")
2 author.ensure_name("Unbekannt")
3 chapter
4 line
5 sentence
6 "The quick brown fox jumps over the lazy dog.".split(" ").each{|s| token s}
7 sentence
8 token "All"
9 line
10 "the leaves are brown.".split(" ").each{|s| token s}
11 sentence
12 "The ship leaves tonight.".split(" ").each{|s| token s}
Quelltext 3.2: Import eines Dokuments über direkte Methodenaufrufe
Die Tokenisierung kann in Kadmos dabei, wie erwähnt, sehr simpel durchgeführt werden,
etwa durch ein Splitten an Leerstellen. Bei Sprach- und Schriftsystemen, in denen Wörter
überhaupt nicht oder nicht konsequent mit Leerzeichen getrennt werden (z. B. beim
Thailändischen) muss eine entsprechende Segmentierung entweder über die Auswertung
existierender Token-Annotationen im zu importierenden Dokument oder aber durch
die Nutzung von externen Tokenisierungswerkzeugen während des Importvorgangs
hergestellt werden.
88
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
Zugehörige Types werden beim Anlegen neuer Token selektiert oder automatisch neu
erzeugt und anschließend verknüpft. Im Importer kann ein beliebiger
Normalizer
ange-
geben werden, durch welchen die Erzeugung normalisierter Types durchgeführt wird.
Diese Funktionalität ist in einer eigenen Klasse gekapselt, damit sie später bei der Abfrage
auch zur Normalisierung von Nutzereingaben verwendet werden kann. Auf das Thema
der Normalisierung wird in Abschnitt 3.6 auf Seite 91 noch näher eingegangen.
Häufig verwendete Struktureinheiten, wie Zeile und Satz, sind in Kadmos standardmäßig
enthalten. Das Datenmodell kann jederzeit um weitere übliche Strukturierungselemente
erweitert werden. Die einzelnen logischen Struktureinheiten lassen sich zum Teil jedoch
nur schwer aus den zu importierenden Originaldokumenten extrahieren. Dieser Umstand
soll am Beispiel des BTL-Korpus, welches in Form von XML-Dateien
17
vorliegt (und so
grundsätzlich eine maschinenlesbare Strukturierung aufweist), demonstriert werden.
Da die XML-Repräsentation sich am Ausgabemedium der gedruckten Buchfassung orien-
tiert es sich dabei also um ein Arbeitsinstrument der so genannten „Druckvorstufe“
handelt wird die logische Struktur, die vorrangig in Kadmos importiert werden soll, von
ausgabebedingtem Markup überdeckt. Für kurze Abschnitte (in der Regel Sätze) erfolgt
jeweils eine (im XML in sich geschachtelte, jedoch nicht immer logisch hierarchische)
Auszeichnung. Diese wird teilweise durch nummerierte Referenzierungsinformationen
ergänzt. Die erste und zweite Beschreibungsebene bilden dabei immer der Autorenname
und der Werkstitel. Danach folgen verschiedenste strukturelle Untereinheiten. Zum Teil
sind in den Ebenen direkt Kapitelüberschriften oder Ähnliches vermerkt, meist aber nur
allgemeine Beschreibungen der Struktureinheit.
In diesen Vermerken von „level_3“, in einigen Fällen bis hin zu „level_8“ herrscht wenig
Kohärenz in der Hierarchisierung. Nur zum Teil bezieht sich die jeweilige Untergliede-
rungseinheit auf die der übergeordneten Ebene, ist also tatsächlich in diese zu schachteln,
wie z. B. die Zeile eines Paragraphen. Die Angabe von Vers, Brief, Strophe, Paragraph,
Zeile, Seite, usw. findet je nach Dokument in unterschiedlichen Ebenen statt und ändert
sich an einigen Stellen auch innerhalb eines Dokuments. In Tabelle 3.2 auf der nächsten
Seite ist die große Vielfalt der möglichen Angaben ablesbar.
Neben der so geschaffenen heterogenen Schachtelungssituation ist auch festzustellen,
dass die fortlaufende Nummerierung nicht immer direkt inkrementell abläuft. Zum
einen hat das historische Gründe der Editionspraxis (z.B. spätere Einfügungen in älte-
17
mit dem Dokumenttyp „NCBI Book 3.0“, http://dtd.nlm.nih.gov/book/3.0/book3.dtd
89
3.5 Datenimport
Ebene Häufige Bestandteile der Bezeichner
level_3:
fragm. vers. epigr. elegia carm. p. cap. § lib. decl.
incertarum incertorum nota fragmenta paradoxon oratio
actio scribae epist. fab. distichon sat. epil. prol. littera
Epist. suas. hexastichon incertae vol. ecloga stropha
laudes explicit
level_4:
vers. lin. p. cap. fragm. argum. § epist. lib. carm.
sat. epigr. fab. contr. sent. sermo
level_5: lin. p. vers. acrostichis § vol. cap.
level_6: lin. p. § (p.
level_7: lin. p.
level_8: lin.
Tabelle 3.2: Vorkommende Nummerierungspräfixe und allgemeine
Abschnittsbezeichner in verschiedenen Hierarchieebenen im BTL-Korpus
re Nummerierungsschemata) oder eine zu grobe Auflösung (z. B. wenn mehrere Sätze
oder Zeilen in der kleinsten untergliederten Einheit untergebracht sind). In solchen
für die Nachmodellierung im Graphen schwierigen Fällen bietet sich die Einführung
eines neutralen Strukturelements an, das die kompletten Informationen der aktuellen
„Hierarchieangaben“ als konkatenierte Zeichenkette speichert und welches als einziges
Strukturelement zwischen Dokument und Token positioniert wird. Damit ist eine Refe-
renzierung von Textstellen wie im gedruckten Buch möglich und der Analyseaufwand des
zu importierenden Dokumentenmodells wird verringert. Diese Lösung ist nicht ideal, da
aussagekräftige Statistiken zu Satzlängen oder Ähnlichem dann nicht mehr möglich sind,
aber als intermediäre Lösung im Sinne des
Prototypings
ist dieser Ansatz hervorragend
geeignet.
Neben der Übernahme von Textdaten mit ihren verschiedenen strukturellen Konfigura-
tionen wird bei Importvorgängen in Korpusverwaltungssystemen üblicherweise auch
die Zusammenführung und Korrektur von Metadaten vorgenommen. Das flexible Daten-
modell und der Verzicht auf Vorberechnungen ermöglichen es jedoch, diesen Aspekt
in Kadmos vollkommen losgelöst vom Import zu betrachten. Im laufenden Recherche-
betrieb und als Teil der Korpusexploration können die Metadaten jederzeit angepasst
werden, wobei manuelle Arbeiten durch etablierte Datenintegrationsmodelle
18
ergänzt
werden nnen, sobald externe Identifier, z. B. von Normdatenprovidern oder aus dem
18
Hierbei ist besonders das repräsentantenbasierte Modell von Topic Maps, das u. a. in Subject Identifiers
und Subject Locators unterscheidet, hervorzuheben.
90
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
LOD-Umfeld verwendet werden.
Beim Import von Textdaten sollten diese im System in einer Form repräsentiert werden,
die einen intuitiven Zugriff auf Zeichenkettenebene ermöglicht. Um angesichts der ange-
sprochenen Kodierungsvielfalt für Zeichensätze einen solchen Zugang zu ermöglichen,
findet oft bereits beim Import eine Normalisierung der Texte statt.
3.6 Zeichennormalisierung
Normalisierung ist generell gesprochen ein Verfahren, mit dem Varianten in der Form
einer Äußerung verringert werden sollen, um die Kernäußerung besser isoliert betrach-
ten, verarbeiten und quantitativ auswerten zu können. Es findet dabei eine Umformung
aller Elemente der Eingabe statt, die mengentheoretisch betrachtet als Abbildung ange-
sehen werden kann
19
. Bei der Normalisierung soll erreicht werden, dass im Wesentlichen
Gleichbedeutendes die gleiche Repräsentation erfährt und Unterschiedliches auch in der
Abbildung unterscheidbar bleibt.
Praktischen Nutzen hat die Normalisierung bei nicht-bitgenauen Vergleichen von Zei-
chenketten. Soll für eine Textsuche beispielsweise die Groß- und Kleinschreibung eines
Begriffs ignoriert werden, bietet es sich an, bei der Indizierung des Textes eine kom-
plette Umwandlung in Klein- oder Großbuchstaben vorzunehmen. Die selbe Operation
muss anschließend auch auf die Anfrage angewendet werden. Der Satz „Heute ist ein
schöner Tag!“ könnte zu
HEUTE IST EIN SCHÖNER TAG!
normalisiert werden. Ein ge-
suchtes Wort „tag“ würde die Zeichenfolge
TAG
ergeben, welche sich dann bitgenau im
indizierten Text wiederfinden lässt. Eine weitere Anforderung könnte die transparente
Behandlung von diakritischen Zeichen sein, wonach „Hallo“, „Hàllo“ und „Hállo“ einen
gemeinsamen Normalisierungsrepräsentanten erhalten sollen, welcher sich allerdings
von dem anderer ähnlicher Wörter, wie „Hello“ unterscheiden muss.
Eine einzige Normalisierungsregel, die alle Vorkommen von „a“ und „à“ durch „á“ ersetzt
und alle anderen Zeichen gleich belässt, würde für dieses Beispiel bereits eine valide
Normalisierung darstellen. Denkbar wäre auch, „a“, „à“ und „á“ durch „x“ zu ersetzen,
oder ganz zu löschen. Die „Hallo“-Varianten würden dabei zu „Hxllo“ oder „Hllo“, und
„Hello“ bliebe erhalten. Es ist jedoch leicht einzusehen, dass bei solchen, die Funktion der
19
Da die Bildmenge in der Praxis meist keine „ungenutzten“ Elemente enthält, ist die Normalisierung
ebenso eine surjektive Relation.
91
3.6 Zeichennormalisierung
Zeichen für die Sprache nicht berücksichtigenden Normalisierungsansätzen bei einer
Erweiterung des Vokabulars sehr schnell Probleme auftreten können. Die „x“-Substitu-
tion würde z. B. „Boa“ und „Box“ auf die selbe normalisierte Form abbilden, was ganz
offensichtlich nicht gewünscht ist. Ein guter Substituent lässt sich oft aus der Menge der
graphisch verwandten bzw. lautlich oder im Verwendungskontext „ähnlichen“ Zeichen
finden.
Dadurch wird auch eine manuelle Inspektion der Normalisierung vereinfacht, die im
Vergleich zur Abbildung auf Nominalzahlen oder abstrakte Zeichen
20
eine nach wie vor
„lesbare“ Variante des Ursprungstextes abbildet.
Die Bandbreite von potentiell zu normalisierenden Phänomenen in der Verschriftlichung
ist groß. Im Folgenden werden als Beispiel aus der Praxis einige der Besonderheiten
vorgestellt, die die Normalisierung historischer Dokumente in nicht-lateinischen Alpha-
beten mit sich bringen kann. Als Grundlage werden Wortkodierungen aus den Editionen
altgriechischer Texte des Papyri-Korpus, verwendet.
Abbildung 3.7: Auftretende Unicode-Zeichen in digitalen Editionen
altgriechischer Texte, sortiert nach Codepoint-Nummer
Abbildung 3.7 zeigt die Fülle der in den Texten vorkommenden Zeichen. Es werden über
1600 Unicode-Endpunkte
21
zur digitalen Kodierung der Texte verwendet. Während einige
der außergewöhnlichen Zeichen, etwa die Tierkreiszeichen
à
bis
ë
, durchaus im Rahmen
ihrer in Unicode erfassten Bedeutung verwendet werden, wurden andere offenbar nur
wegen ihrer äußeren Erscheinungsform eingefügt, wie der mathematische Operator
(
U+2297
). Als doppelte, öffnende, spitze Klammer wurde stellenweise ebenfalls die der
mathematischen Notation vorbehaltene Variante (
U+27EA
) statt der neutralen (
U+300A
)
20
Diese könnten etwa in den privaten Unicode-Bereichen (Private Use Areas) anwendungsspezifisch
definiert werden.
21
inklusive verschiedener Leerzeichen (Whitespaces) und sonstiger undruckbarer Zeichen
92
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
verwendet. In Abbildung B/1 auf Seite 246 im Anhang sind die Zeichen noch einmal nach
der Häufigkeit ihres Auftretens sortiert angegeben.
Für zahlreiche griechische Minuskeln
22
existieren Alternativ-Glyphen, die im Grunde
den selben Buchstaben beschreiben, durch die aber eine Formvariante codiert werden
soll: für Kappa
κ 7→ κ
(
U+03F0
), Epsilon
ε 7→
(
U+03F5
), Theta
θ 7→ ϑ
(
U+03D1
), Rho
ρ 7→ ρ
(
U+03F1
) sowie Phi
φ 7→ φ
(
U+03D5
). Im kompletten Unicode-Standard existieren darüber
hinaus derzeit
23
über 20 Codepunkte, die ein griechisches oder koptisches Phi als Text-
oder Formelzeichen repräsentieren
24
. Beim End-Sigma
ς
ist die Formvariante nicht nur
stilistischer Natur, sondern fest an die letzte Position im Wort gebunden.
Auch diakritische Zeichen sind oft in mehreren Varianten vorhanden: Es existieren typo-
graphisch bewusst identisch angelegte Zeichen für einen prinzipiell gleichen Verwen-
dungskontext, die sich doch in ihrer Bedeutung unterscheiden können: Eine Verwendung
des
Oxia
(z. B.
U+1FFD
) zeichnet eine Änderung in der Tonhöhe im polytonischen Grie-
chisch (im wesentlichen Altgriechisch) aus, wohingegen die Nutzung des
Tonos
(z. B.
U+0384
) für die Betonung im monotonischen Griechisch steht. Beide sollten identisch
dargestellt werden, es existieren jedoch sowohl unterschiedliche Einzelsymbole und
kombinierende Symbole, als auch zwei komplett eigenständige Sammlungen damit vor-
kombinierter Symbole für das gesamte griechische Alphabet in Unicode.
Für den Hauchlaut-Indikator für Vokale und Diphthonge (sowie den Buchstaben Rho)
am Wortanfang (
Spiritus asper
) existieren drei korrekte Kodierungsvarianten
25
. Hierbei
sind bei der Darstellung der kodierten Texte bestimmte Regeln zur Positionierung der
Indikatoren (bei Kombination mit anderen diakritischen Zeichen sowie die Verschiebung
vor Großbuchstaben oder auf Folgevokale) zu beachten. Teilweise wird versucht, dieses
Verhalten durch Ändern der Zeichenreihenfolge im Vorfeld der Darstellung zu erzwingen,
was nicht immer standardkonform ist.
Aus der Vielfalt aller möglichen Permutationen dieser Codepunkte ergibt sich eine enor-
me Varianz unterschiedlicher valider Kodierungsweisen. Das Griechische ist dabei unter
den historischen Sprachen kein besonderer Extremfall. Viele komplexe Regeln, Varianten
22
Damit sind Kleinbuchstaben gemeint, wobei in vielen Fällen nicht in den Manuskripten sondern erst in
den Editionen zwischen Groß- und Kleinschreibung unterschieden wird.
23
bezogen auf Version 9 vom 21. Juni 2016
24
U+0278
,
U+03A6
,
U+03C6
,
U+03D5
,
U+1D60
,
U+1D69
,
U+1DB2
,
U+2C77
,
U+1D6BD
,
U+1D6D7
,
U+1D6DF
,
U+1D6F7
,
U+1D711
,
U+1D719
,
U+1D731
,
U+1D74B
,
U+1D753
,
U+1D76B
,
U+1D785
,
U+1D78D
,
U+1D7A5
,
U+1D7BF
und
U+1D7C7
25
U+0314
(Combining Reversed Comma Above),
02BD
(Modifier Letter Reversed Comma) und
U+1ffe
(Greek Dasia)
93
3.6 Zeichennormalisierung
und Abhängigkeiten existieren auch in anderen Alphabeten durchaus auch in denen
moderner Sprachen.
Dieser kleine Exkurs in die praktischen Probleme der Zeichennormalisierung bringt die
Erkenntnis, dass für diese Aufgabe keine generische Lösung entwickelt werden kann.
Die Datenaufbereitung in Kadmos ist daher als ein frei anpassbares Verfahren angelegt,
welches für den Import verschiedene vordefinierte Normalisierungs-Komponenten be-
reithält, daneben aber auch die Implementierung eigener „Normalisierer“ ermöglicht.
Für die einfache Behandlung von diakritischen Zeichen im Standardnormalisierer wird
zunächst die NFD gebildet. Anschließend werden alle Zeichen entfernt, die selbst keine ho-
rizontale Ausdehnung besitzen (
nonspacing marks
, wie kombinierende und modifizierende
Zeichen). Es ist leicht einzusehen, dass dabei fürs Deutsche eine spezielle Behandlung
von Umlauten erfolgen sollte, oder bei der Verwendung dieser Normalisierungsstrategie
zuvor eine Umwandlung von Umlauten in Diphthonge angeraten ist. In Kadmos können
solche sprachabhängigen Funktionen in entsprechenden abgekapselten Teilmodulen
vorgehalten werden.
Es können grundsätzlich auch mehrere Normalisierungsvarianten parallel im Modell
erfasst werden, was natürlich bei Wortfrequenz-basierten Statistiken nach der Traversie-
rung des Modells berücksichtigt werden muss. In diesem Fall empfiehlt es sich, an die
Kante zwischen Type und normalisiertem Type die Normalisierungsart in Form einer spe-
ziellen, mit entsprechendem Wert versehenen Kanten-Property zu erfassen und bei der
Abfrage von normalisierten Types nur die Kanten aus einem einzelnen Normalisierungs-
Verfahren zu nutzen.
Die Zeichennormalisierung ist letztlich nur einer der Problemkreise bei der Schaffung
eines geeigneten Zugangs zu Vokabular und Textstellen. Andere Formen der Norma-
lisierung, z. B. zur Abdeckung aller Schreibvarianten von Wörtern, können ebenfalls
berücksichtigt werden. Wenn die normalisierten Formen einen sprachlich korrekten und
lesbaren Wert besitzen müssen und sie für Analysen direkt verwendbar sein sollen, bietet
es sich an, diese normalisierten Formen aufbauend auf der Zeichen-Normalisierung als
eigenständige Wort-Annotation abzuspeichern. Dies ist etwa der Fall bei einer Normalisie-
rung der Sprachstufe von alten in moderne Wortformen. Häufig existieren für diese Form
der Normalisierung sowohl manuelle, als auch statistische und regelbasierte Verfahren
26
,
die wie gerade schon angesprochen in Kadmos gleichzeitig hinterlegt und wechsel-
weise oder kombiniert verwendet werden können. Diese Form der Normalisierung ist
26
s. z. B. [BPD11] für die die Transformation vom Frühneuhochdeutschen zum Neuhochdeutschen
94
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
nicht an den Importvorgang gebunden, sondern kann auch zu einem späteren Zeitpunkt
unter Berücksichtigung der im Graphen abgebildeten Kontexte automatisiert erfolgen,
wie z. B. kürzlich in [Dem16] demonstriert wurde.
3.7 Flexibles graphbasiertes Information Retrieval
3.7.1 Retrievalverfahren und Textrepräsentation
Das Fachgebiet des Information Retrieval umfasst keine einzelne Technologie, sondern
eine Vielzahl von Ansätzen, mit denen sich verwandte Problemstellungen lösen lassen.
Baeza-Yates und Ribeiro-Neto umschreiben das Feld in [BYRN99] wie folgt:
Information retrieval deals with the representation, storage, organization of, and ac-
cess to information items such as documents, Web pages, online catalogs, structured
and semi-structured records, multimedia objects. The representation and organiza-
tion of the information items should be such as to provide the users with easy access
to information of their interest.
Manning, Raghavan und Schütze verwenden in [
MRS08
] eine kondensiertere Definition:
Informationretrieval(IR)is finding material (usually documents)ofanunstructured
nature (usually text) that satisfies an information need from within large collections
(usually stored on computers).
Der Begriff Information Retrieval selbst geht auf einen Technologiereport im Umfeld des
Bibliothekswesens aus den frühen 1950er Jahren zurück, s. [
Moo51
]. Seit dieser Zeit steht
der Begriff in größerem Maße für die gewünschten Resultate der Verfahren als für kon-
krete Umsetzungsstrategien. Schon seit langer Zeit hat sich die Verschlagwortung, also
das Vergeben von
Keywords
, als wichtiges Hilfsmittel zur Kategorisierung, Indizierung
und damit „Auffindbarmachung“ von Dokumenten bewährt. Van Rijsbergen verweist in
[
Rij79
] auf Arbeiten von Luhn, der in [
Luh57
] frequenzbasierte Auswertungen des Doku-
mentinhalts vornimmt, um darüber die Indizierung und das Auffinden von Dokumenten
zu vereinfachen.
Grundsätzlich stellt sich die Frage, ob relevante Dokumente allein durch ihren textuellen
Inhalt und ohne zusätzliche menschliche Kategorisierung gefunden werden können.
95
3.7 Flexibles graphbasiertes Information Retrieval
Schon in Arbeiten aus den 1980er und -90er Jahren wird festgestellt, dass das in einem
Dokument verwendete Vokabular bereits eine erstaunlich gute Basis für automatische
Indexsysteme bildet, welche einer manuellen Verschlagwortung (insbesondere, wenn sie
dezentral von vielen Bearbeitern durchgeführt wird) nicht unterlegen ist. In [
Lew92
] wird
dafür die Bezeichnung
Equal Effectiveness Paradox
verwendet. Interessant ist noch ein
zweiter in dieser Arbeit beschriebener Problemkreis, welcher als
Perfect Query Paradox
eingeführt wird:
Für beinahe beliebige (thematisch abgrenzbare) Untermengen einer Dokumentenkol-
lektion lässt sich eine stichwortbasierte Abfrage erstellen, die alle Dokumente dieser
Untermenge (und kein anderes Dokument) zurückliefert. Als Begründung dafür wird ange-
führt, dass bereits ein individuelles Dokument üblicherweise über wenige sehr spezifische
Wörter, die entweder gar nicht oder nur selten in anderen Dokumenten vorkommen,
identifiziert werden kann
27
. Eine Komposition solcher Keyword-„Signaturen“ ermöglicht
die Konstruktion einer „perfekten“ Abfrage für alle als relevant erachteten Dokumente.
Das Paradoxe daran ist, dass zum Finden einer perfekten Abfrage lexikalisch-inhaltliches
Wissen über die gesamte Kollektion und speziell über die aufzufindenden Dokumente
nötig ist was voraussetzen würde, dass sie bereits bekannt sind.
In der Praxis wird dieser Widerspruch durch eine iterative Suchstrategie aufgelöst: Eine
initiale, nicht perfekte Anfrage bietet Zugang zu einem Teil der Dokumentenkollektion,
in dem sich neben irrelevanten Dokumenten auch „Zufallstreffer“ finden, aus denen
sich dann weiteres zur Suchverfeinerung nutzbares Vokabular extrahieren lässt. Daraus
kann abgeleitet werden, dass Interaktion und Exploration bereits bei konventionellen
Recherchesystemen Teil des digitalen Recherche- und Forschungsprozesses sind, auch
wenn diese Aspekte dort in der Regel nicht explizit erwähnt oder durch Werkzeuge und
Bedienoberflächen unterstützt werden.
Aus der Erkenntnis, dass die Wortverwendung in den Dokumenten bereits einen aus-
reichenden Anhaltspunkt über deren inhaltliche Relevanz
28
darstellt, folgt direkt die
Anwendbarkeit automatischer Methoden mit deutlich verringerten Anforderungen an
eine manuelle Aufbereitung und Anreicherung der Korpora. Sie erlaubt die Erstellung uni-
verseller Verfahren auf der Basis von (im Allgemeinen sprachunabhängiger) Wortstatistik.
Das Information Retrieval teilt sich daher auch viele Textmodelle und Repräsentations-
27
Sehr spezifische und damit niederfrequente Terme gelten besonders auch in Anwendungsfällen der e-
Humanities als geeignet für das Auffinden interessanter und bisher noch nicht erforschter Textstellen.
Sie bilden damit wichtige „lokale Kontexte“.
28
angesichts eines konkreten Informationsbedürfnisses
96
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
formen mit anderen Gebieten des Text Minings, wie sie in Abschnitt 2.2.4 auf Seite 39
eingeführt wurden.
Information Retrieval kann über die Betrachtung von Ähnlichkeiten von Wortansammlun-
gen realisiert werden. Dazu können Methoden des semantischen Indizierens angewendet
werden, um Dokumente nach ihrer Bedeutung gruppiert zu „verorten“. Dabei lassen sich
die bereits angesprochenen Methoden zur Ermittlung latenter semantischer Dimensio-
nen und Topics sowie
Word Embeddings
anwenden. Oftmals ist bei solchen Verfahren die
Transformation großer Dokumente allerdings deutlich präziser möglich, als die der Anfra-
ge, da diese meist sehr kurz ist und der zur Errechnung der semantischen Positionierung
benötigte Kontext fehlt.
Für die Errechnung der Ähnlichkeit zwischen Dokumenten und Abfragen (als „Miniatur-
Dokumenten“) können jedoch auch direkt die vorkommenden Terme betrachtet werden.
Entsprechende Vergleichsvorschriften, wie das Cosinus-Maß, der Dice- oder der Jaccard-
Koeffizient, s. z. B. [
MS99
], sind für die Vektorähnlichkeit im Vektorraum-Modell, wie es
in [
SWY75
] beschrieben wurde, gut nutzbar. Dabei kann zusätzlich eine Termgewichtung
stattfinden, etwa nach dem ebenfalls in [SWY75] vorgestellten Tf-idf-Maß.
Ein sehr populäres Verfahren zur Gewichtung des Termfrequenz-Teils von Tf-idf, das
primär für
bag-of-words
-Ansätze verwendet wird, ist BM25, vgl. [
RWJ
+
94
]. Für BM25 exis-
tieren zahlreiche Erweiterungen und Parametrisierungen, die sich zum Teil aus (wenig
kritisch hinterfragten) empirischen Optimierungen ergeben haben. Im einfachsten Fall
errechnet sich die gewichtete Termfrequenz wtf laut der Veröffentlichung wie folgt:
wtf =
tf
c
k
1
(
1 b
)
+ b
dl
avdl

c
+ tf
c
mit
tf
, als der Termfrequenz im Dokument,
dl
als der Länge des aktuellen Dokuments in
Wörtern,
avdl
als der durchschnittlichen Dokumentlänge im Korpus sowie einem freien
Parameter
c
, der meist auf
1
oder als Funktion von dl und avdl festgelegt wird und
k
1
,
einem weiteren freien Parameter. Diese gewichtete Termfrequenz wird mit der inversen
Dokumentfrequenz (als
log
N+n+0,5
n+0,5
mit
N
als der Dokumentanzahl und
n
als der Zahl
der den Term enthaltenden Dokumente) multipliziert. Der so gebildete Wert wird über
alle Suchterme aufaddiert als Ranking eines Dokuments verwendet.
97
3.7 Flexibles graphbasiertes Information Retrieval
In diesen Rechenvorschriften zeigt sich eine sehr globale Sicht auf das Korpus, für welche
umfangreiche Vorberechnungs- und Indizierungsaufwände entstehen. Die durchschnitt-
liche Dokumentlänge ist global, denn jedes hinzukommende Dokument ändert diese
Größe und jede Abfrage dieses Wertes (ohne Vorberechnung) müsste alle Dokumente
(und alle Wörter darin) betrachten. Die Größe
n
ist in begrenzterem Umfang global,
da sie (je nach Worthäufigkeit) nur einen kleinen Ausschnitt des Korpus betrifft, und
über eine termspezifische Zählvariable abgebildet werden kann, die nicht für jedes neue
Dokument verändert werden muss. Lokal (bezogen auf das Dokument) ist nur die Term-
frequenz. Es zeigt sich, dass eine solche Gewichtungsstrategie im Zusammenhang mit
einer vorberechnungsfreien (und nur lokal effizient abfragbaren) Textrepräsentation in
Graphdatenbanken nicht geeignet ist.
Grundsätzlich existieren auch gewichtungsfreie Verfahren. Eine der ältesten
29
Herange-
hensweisen an das Information Retrieval verwendet eine „logische Verknüpfung“ von
Suchwörtern in einer Abfrage und wandelt diese in einfache Mengenoperationen der Er-
gebnismengen einzelner Stichwortanfragen um. Bereits Anfang der 1960er Jahre wiesen
Verhoeff, Goffman, und Belzer in [
VGB61
] anhand einer mathematischen Formulierung
des Retrievel-Prozesses nach, dass die (dort auch eingeführte) „Retrieval-Effizienz“ in
diesem Szenario nicht optimal ist:
If the system responds to a request asking for "a" and "b" by giving the intersection
of the responses it would have given to requests for "a" and "b" separately, it risks
giving too much irrelevant material. If in response to a request for "a" or "b" it gives
the union of the responses to the request for "a" and "b" if made separately, it risks
leaving out relevant material. In both cases it will result in a decrease of efficiency.
Dennoch gibt es auch Gegenstimmen, die den nicht geradewegs zielführenden Kurs der
booleschen Anfragen mit gegebenenfalls notwendigen Neuformulierungen der Anfrage
als eine Chance für explorative Auseinandersetzung mit den Daten sehen, s. z. B. [
Hjø15
],
wo es heißt:
Users may during the process explore how terms are used, how they co-occur and
how knowledge is organised.
Prinzipiell ist festzuhalten, dass Abfragen initial nicht perfekt sind und nicht sein kön-
nen und daher sukzessive erweitert werden müssen. Je mehr mögliche Schlagworte
29
und dabei heute noch (speziell auch bei Werkzeugen für die e-Humanities) gebräuchlichen
98
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
oder semantische Dimensionen während der Recherche dann als potentiell interessant
identifiziert werden, umso mehr Dokumente, die (partielle) Treffer aufweisen (und im
DH-Kontext nicht herausgefiltert werden können), werden zurückgeliefert. Dabei sollten
Mengenoperationen auf den Ergebnismengen eher vermieden werden. An ihre Stelle
kann ein geeignetes Ranking der Ergebnisse treten, welches keine Dokumente entfernt,
aber potentiell wichtigere Dokumente priorisiert zurückliefert. Weitere Überlegungen
zum (lokalen) Ranking werden noch in Abschnitt 3.7.4 auf Seite 108 angestellt.
Für den Rechercheprozess in den e-Humanities ergeben sich so grundsätzlich zwei Strate-
gien, um in Dokumentkollektionen alle relevanten Informationen möglichst vollständig
aufzufinden: Zum einen gilt es, das Korpus auf grundsätzlich interessante Teilbereiche
einzuschränken, wofür sich eine Filterung anhand von Metadaten anbietet. Zum ande-
ren soll die Suche nach Dokumenten stetig um zusätzliche relevante Aspekte erweitert
werden. Die optimalen Ergebnisse erhält der Nutzer, wenn beide Strategien gleichzeitig
verfolgt werden. In den folgenden Abschnitten werden die dafür benötigten Verfahren
mit Bezug auf das Textdatenmodell vorgestellt.
3.7.2 Facettierung über nutzerspezifische Metadaten
Um die Nutzung von Suchfacetten zu motivieren, stellt Sacco in [
Sac09
] den universellen
Wert eines explorativen Recherchevorganges heraus:
We contend that most "search" tasks are exploratory and imprecise in essence, and
that using a focalized search paradigm in this context leads perforce to inadequate
or frustrating user interactions.
Bei der Facettierung handelt es sich um das Identifizieren relevanter Inhaltskategorien
und Metainformationen, nach denen die zu durchsuchenden Objekte gruppiert werden
können. Dabei existieren kategoriale Facetten (z. B. der Name des Herstellers eines Produk-
tes) und skalare Facetten (z. B. der Produktpreis). Die von den Objekten angenommenen
Werte innerhalb dieser Facetten folgen einer bestimmten Verteilung, deren visuelle Dar-
stellung dem Nutzer aggregierte Informationen (durchaus im Sinne des Distant Reading)
über die Kollektion gibt.
Diese Facetten können darüber hinaus zur qualifizierten Festlegung von Filterungskri-
terien verwendet werden. In facettierten Oberflächen wird dann üblicherweise die Dar-
99
3.7 Flexibles graphbasiertes Information Retrieval
stellung der verbleibenden Facetten entsprechend an den neuen Ausschnitt angepasst.
Dadurch lassen sich systematische Abweichungen zur Gesamtverteilung erkennen und
so Hypothesen zu Korrelationen zwischen den Facetten aufstellen.
Durch die Nutzung des Graphenmodells lassen sich in Kadmos reichhaltige Filterungs-
und Aggregierungsmöglichkeiten aus den Daten ableiten. Nicht nur direkt an den Do-
kumenten verankerte Metadaten, wie Genre und Datierung, können genutzt werden,
sondern auch jede Art von durch Traversierung erreichbaren Kontexten. So können
„Berufe der Großväter der Dokumentautoren“ eine durchaus denkbare (und abhängig
von der Fragestellung eventuell sogar sinnvolle) Facette bilden falls im System ent-
sprechend auch biographische und prosopographische Daten in ausreichendem Umfang
erfasst sind.
Wie z. B. in [
HOH06
] angedeutet ist diese Vielfalt an Möglichkeiten nur schwer allgemein
zu handhaben:
Most facet browsers provide an interface to a single type of resource. Including mul-
tiple types, however, leads to an explosion in the number of corresponding properties
and thus the number of available facets.
Daher wird in Kadmos keine generische Oberfläche zur facettierten Suche bereitgestellt.
Entsprechende Funktionen sollten stets anwendungsfallspezifisch über spezialisierte
Schnittstellen realisiert werden, wozu später in diesem Buch noch technische Details zur
Sprache kommen.
Wenn in der explorativen Recherche ein so starker Fokus auf Metadatenfacetten ge-
legt wird, muss im Kontext der e-Humanities kritisch hinterfragt werden, ob diese den
Forschungsprozess nicht über Gebühr beeinflussen. Stammen die Metadaten aus (poten-
tiell intransparenter) externer Erfassung, so ist tatsächlich eine sorgfältige Prüfung auf
Vollständigkeit, Korrektheit und semantische Kohärenz mit der Forschungsfrage erfor-
derlich. Die dabei auffallenden Fehler können in Kadmos direkt durch entsprechende
Datenbankbefehle behoben werden. Letztlich ist jedoch gerade im historischen Kontext
ein Metadatum oft nicht eindeutig bestimmbar oder selbst Gegenstand kontroverser
Theorien und laufender Forschung.
Um diesem Umstand gerecht zu werden, erlaubt das in Kadmos verwendete Datenmodell
das Hinzufügen nutzerspezifischer Metadaten. In Abbildung 3.8 auf der nächsten Seite
ist dargestellt, wie über Kanten mit dem Label
private
nutzerspezifische Änderungen
100
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
an den Metadaten des Korpus ausgedrückt werden können: Der Nutzer mit der ID
1
hat
den Namen „Herodot“ eines Autors entfernt. Nutzer #
2
hat die Autorenschaft dieses
Autors zu einem Dokument entfernt und diesem stattdessen einen anderen Autoren
zugewiesen. Nutzer #
3
schließlich hat lediglich einen bestimmten Abschnitt mit diesem
Autoren verknüpft.
Abbildung 3.8: Schematische Übersicht nutzerspezifischer Metadaten
Sollen die nutzerspezifischen Angaben in einer Abfrage berücksichtigt werden, überla-
gern sie die Standard-Metadaten, falls die hinterlegte User-ID dem aktuell eingewählten
Nutzer entspricht. Alle anderen Nutzer sind von dieser geänderten Sichtweise auf das
Korpus nicht betroffen. Darüber hinaus ist auch denkbar, für diese Form der nutzerspezi-
fischen Metadaten zusätzlich zu Userkennungen auch Gruppenkennungen zuzulassen, so
dass die Angaben für mehrere Nutzer gelten können. Hierbei wäre noch zu klären, wie
widersprüchliche Angaben aus mehreren Gruppen eines Nutzers zu handhaben sind.
Die Manipulationsmöglichkeiten sind dabei nicht auf Kanten beschränkt. Zum Ersetzen
von Werten kann ein Knoten vom Typ
proxy
angelegt werden, in welchem der neue
Property-Wert eingetragen ist. Der Originalknoten kann dann auf diesen Stellvertreter-
knoten über eine
proxy
-Kante, in welcher die aktuelle Nutzer-ID hinterlegt ist, verweisen.
Anstatt solche Konstrukte direkt in den gemeinsamen Daten zu persistieren, ist generell
auch denkbar, die nutzerspezfischen Teile über die sogenannte
Partition Strategy
30
von
TinkerPop zu isolieren.
30
http://tinkerpop.apache.org/docs/current/reference/#_partitionstrategy
101
3.7 Flexibles graphbasiertes Information Retrieval
3.7.3 Von Schlagwörtern zur konzeptbasierten Suche
Während (wie bereits beschrieben) das Auffinden relevanter Dokumente über „relevante“
Teile des genutzten Vokabulars möglich ist, stellt sich für automatische Verfahren im
Information Retrieval die Frage, wie genau sich die Bedeutung einzelner Wörter auf die
Dokumente überträgt und worin diese Bedeutung überhaupt besteht. In der Wortbe-
deutungslehre (Semasiologie) wird diese Thematik bereits seit langem untersucht und
in diachroner Sichtweise im Rahmen der Begriffsgeschichte erforscht, s. z. B. [
Fri06
]. In
konkreten und speziellen Forschungskontexten gehen diese Ansätze jedoch meist nicht
weit genug und der Nutzer eines Recherchesystems muss sich die Bedeutung des Vokabu-
lars (parallel zur Suche nach relevanten Dokumenten) selbst erschließen. Auf praktische
Möglichkeiten dafür wird noch genauer in Abschnitt 3.8 auf Seite 109 eingegangen.
In konkreten Recherchesituationen ist die Problemlage zunächst jedoch meist umgekehrt:
Zu einer bestimmten Thematik sollen Dokumente gefunden werden, wofür Suchbegriffe
benötigt werden, deren Bedeutung zur Thematik passt. Diese Suchbegriffe liegen jedoch
(auch jenseits der strengen Sichtweise des
Perfect Query Paradox
) nicht vor. Piotrowski
umschreibt diesen Umstand in [Pio12] für die historische Forschung wie folgt:
When searching a collection of historical documents, the situation is rather like sear-
ching in a foreign language: One may have some ideas about which words may be
used, but one is not sure.
Der Nutzer hat also ein mentales Modell der zu untersuchenden Thematik und muss
dieses als ein abgrenzbares „Konzept“ externalisieren und so mit geeigneten Begriffen
unterfüttern, dass damit eine erfolgversprechende Abfrage des Korpus möglich wird. Ein
Konzept ist dabei eine schwer zu definierende Einheit. Es wird hier weniger im Sinne
einer „Konzeption“, also zielgerichteter Planung verwendet, als dass es als Grundgerüst
für eine Ansammlung von „Bedeutung“ gesehen werden soll. Da diese Bedeutung zu
großen Teilen mit sprachlichen Begrifflichkeiten umschrieben werden kann, zeigt sich
hier eine Nähe zur „Konzeptualisierung“ im Umfeld von Ontologien, s. z. B. [Leh09]:
Eine Konzeptualisierung ist eine abstrakte und vereinfachte Sicht auf einen
Teil der Welt, den man für einen bestimmten Zweck abbilden möchte. [Sie]
enthält Konzepte (Vorstellungen über reale und ideelle Dinge) bzw. die Be-
nennung dieser Konzepte durch Begriffe und die Beziehungen zwischen
ihnen[...]
102
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
In Kadmos wird eine ebenso simple wie effektive technische Lösung für eine solche Kon-
zeptualisierung vorgehalten. Bevor diese genauer beschrieben und anhand von Beispielen
demonstriert wird, sollen zunächst einige hinführende theoretische Überlegungen an-
gestellt werden. Neben den angesprochenen Arbeiten de Saussures zur Wortbedeutung
auf syntagmatischer und paradigmatischer Ebene existieren dabei weitere grundsätzlich
verwandte Vorarbeiten.
Zunächst kann auf die Theorie der Sprachlichen Felder (bzw. Wortfeldtheorie) zurückge-
griffen werden. Wie in [
Tri73
] nachzulesen ist, motivierte beispielsweise Jost Trier bereits
in den 1930er Jahren die Betrachtung von lokalen Wortkontexten zum Verständnis von
Wortbedeutung, indem er feststellte:
In einem Gefüge hat alles nur Sinn aus dem Ganzen heraus. So stehn die
Wörter einer Sprache nicht einzeln als Sinnträger da, sondern jedes Wort hat
seinen Sinn nur daher, daß andere neben ihm Sinn haben.
Verwendungskontexte können genutzt werden, um Wörter nach ihren Bedeutungen zu
gruppieren. In [
Fri05
] werden die Einflüsse des Ordnungsprinzips
31
des 1933 erschienenen
Übersichtswerks „Der deutsche Wortschatz nach Sachgruppen“ von Franz Dornseiff
[
Dor33
] auf diesen Teilbereich der Semantik hervorgehoben. Dornseiff bezeichnet seine
Begriffssammlung im Vorwort bereits u. a. als „Begriffsnetz“, was durchaus in passender
Analogie zu modernen lexikalischen Ressourcen steht.
In [
Hob70
] wird dargelegt, wie die aus solchen Vorarbeiten weiterentwickelten, zunächst
an formeller Logik orientierten Vorstellungen zur „Bedeutungsebene“ von Sprache nach
und nach um psychologische Erklärungen ergänzt und langsam durch diese verdrängt
wurden. In diesem Zusammenhang kamen Überlegungen zur sogenannten Frameseman-
tik auf, vgl. etwa [
Bus12
]. Frames stellen dabei Einheiten von Weltwissen dar, in denen
übliche Standardkontexte erfasst sind, und die Lücken aufweisen können, die mit konkre-
ten Bezeichnern in einer zum Frame passenden Bedeutung gefüllt werden können. Ziem
verbindet in [
Zie05
] die Framesemantik mit der sogenannten Diskursanalyse. Diese stellt
einen Überbegriff für viele (nicht immer theoretisch und methodisch vollständig kompa-
tible) Varianten der systematischen Beschäftigung mit Text in verschiedenen Zweigen
der Sozial- und Geisteswissenschaften dar.
Diese Kette ist bei weitem nicht vollständig und soll nicht als die Beschreibung einer
31
dort im inneren Titel als „synonymisch geordnet“ beschrieben
103
3.7 Flexibles graphbasiertes Information Retrieval
geradlinigen Entwicklung der Semantik-Forschung missverstanden werden. Dennoch
zeigt sie, dass eine Konzeptdefinition im Sinne der Onomasiologie
32
durchaus kohärent
mit Theorien über Semantik und Wortbedeutung ist, und diese Gebiete darüber hinaus
eine nicht geringe Verwandtschaft mit Analysemethoden der mit Kadmos adressierten
Fachwissenschaften aufweisen.
Die praktische Anwendbarkeit dieser Überlegungen soll nun am Beispiel der Erweiterung
von Suchvokabular bei der Stichwortsuche demonstriert werden. Dabei wird der Umgang
mit Bedeutungsähnlichkeit hier am einfachsten Fall, nämlich an orthographischen Vari-
anten verdeutlicht. Die Vorgehensweise ist jedoch unverändert auch für Synonyme und
Begriffe gleicher „Sachgruppen“ anwendbar.
Abbildung 3.9 auf der nächsten Seite zeigt einen exemplarischen Recherchefall, in wel-
chem quantitative Untersuchungen auf Basis der Artikeltexte und der Metadatenfacetten
des Veröffentlichungsdatums aller Zeitungsberichte des NYT-Korpus durchgeführt wer-
den. Dafür wird die Visualisierung einer
Calendar Heat Map
gewählt, in welcher hier
dunklere Kästchen eine höhere Anzahl pro Tag darstellen.
33
Für eine Recherche zu Alko-
holkonsum bei Teenagern wird zunächst eine Suche nach Dokumenten vorgenommen,
die sowohl den Begriff
teenagers
als auch den Begriff
alcohol
enthalten. Aus der Visua-
lisierung ist eine Häufung dieser Dokumente ca. ab der zweiten Hälfte des Jahres 1999
ersichtlich.
Bei einer sorgfältigen Recherche wird dieses Ergebnis auf vielen Ebenen hinterfragt, u. a.
auch durch Prüfung, ob ab diesem Zeitraum generell mehr über diese Bevölkerungsgruppe
berichtet wurde. Die Suche nach
teenagers
offenbart dann eine sprungartige Anhebung
des täglichen Dokumentenvolumens für dieses Suchwort ab dem 1. November 1999. Ein
solch starker, plötzlicher und dauerhafter Effekt ist entweder nur durch einen Fehler
in der Software oder Datenquelle zu begründen (was hier nicht zutrifft) oder sie ist
durch eine systematische Änderung in der Nutzung von Vokabular bei der Texterstellung
erklärbar.
34
Letzteres kann gezeigt werden, wenn nach der (nun veralteten) Schreibweise
teen-agers
gesucht wird: Diese besitzt einen vollständig komplementären Zeitverlauf.
Mit dieser Erkenntnis lässt sich nun eine erweiterte Anfrage zusammenstellen, deren
32
als dem oben angesprochenen Gegenstück zur Semasiologie zu diesem Feld und seinen Methoden
s. z. B. [Grz11]
33
Für Vor- und Nachteile dieser Visualisierungstechnik s. z. B. [Yau13]
34
In Abbildung B/2 auf Seite 247 im Anhang sind zwei Beispiele für Histogramme gegeben, in denen
tatsächliche Ereignisse eine sprunghafte Veränderung in der Zahl der Berichte zu einem Suchwort
hervorrufen. Dem sofortigen Anstieg folgt dabei meist ein graduelles Abflachen.
104
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
1 9 8 7
1 9 8 8
1 9 8 9
1 9 9 0
1 9 9 1
1 9 9 2
1 9 9 3
1 9 9 4
1 9 9 5
1 9 9 6
1 9 9 7
1 9 9 8
1 9 9 9
2 0 0 0
2 0 0 1
2 0 0 2
2 0 0 3
2 0 0 4
2 0 0 5
2 0 0 6
2 0 0 7
(a) teenagers
AND alcohol
1 9 8 7
1 9 8 8
1 9 8 9
1 9 9 0
1 9 9 1
1 9 9 2
1 9 9 3
1 9 9 4
1 9 9 5
1 9 9 6
1 9 9 7
1 9 9 8
1 9 9 9
2 0 0 0
2 0 0 1
2 0 0 2
2 0 0 3
2 0 0 4
2 0 0 5
2 0 0 6
2 0 0 7
(b) teenagers
1 9 8 7
1 9 8 8
1 9 8 9
1 9 9 0
1 9 9 1
1 9 9 2
1 9 9 3
1 9 9 4
1 9 9 5
1 9 9 6
1 9 9 7
1 9 9 8
1 9 9 9
2 0 0 0
2 0 0 1
2 0 0 2
2 0 0 3
2 0 0 4
2 0 0 5
2 0 0 6
2 0 0 7
(c) teen-agers
1 9 8 7
1 9 8 8
1 9 8 9
1 9 9 0
1 9 9 1
1 9 9 2
1 9 9 3
1 9 9 4
1 9 9 5
1 9 9 6
1 9 9 7
1 9 9 8
1 9 9 9
2 0 0 0
2 0 0 1
2 0 0 2
2 0 0 3
2 0 0 4
2 0 0 5
2 0 0 6
2 0 0 7
(d) (teenagers
OR teen-agers)
AND alcohol
Abbildung 3.9: Jahreskalender-Histogramme (1987–2007) für die
Zusammenfassung orthographischer Varianten in der Stichwortsuche des
NYT-Korpus: (a) initiale Suche, (b) Analyse eines Einzelterms, (c) Auffinden einer
Schreibvariante, (d) Kombinierte Suche mit beiden Varianten
Ergebnis keine klaren Hinweise auf quantitative Effekte über den abgedeckten Zeitraum
hinweg mehr enthält. Für spätere Suchanfragen ist es wünschenswert, für Teenager
immer beide Begriffe zu berücksichtigen. Zudem sollte auch die sprachliche Vielfalt
abgebildet werden und z. B. für die Suche nach Aspekten des Alkoholismus stets auch
Wörter wie
liquor
,
booze
und
drunk
abgefragt werden. Hier offenbart sich die direkte
Anwendbarkeit einer onomasiologischer Konzeptdefinition auf den in den e-Humanities
üblichen explorativen Recherchevorgang.
Für diese essenziellen Aufgaben der explorativen Suche wurde in Kadmos der Knoten-
typ
concept
eingeführt. Jedes dieser Konzepte ist einem Nutzer zugewiesen und besitzt
105
3.7 Flexibles graphbasiertes Information Retrieval
eine durch diesen vergebene Bezeichnung. In Konzepten können andere Konzepte
35
,
normalisierte Types oder unnormalisierte Types (und prinzipiell sogar einzelne Token)
zusammengefasst werden, indem ihnen diese über eine
belongs_to
-Kante zugewiesen
werden. Beim Einfügen von Konzepten in andere Konzepte ist über eine geeignete Abfrage
auszuschließen, dass dadurch direkte oder indirekte Zirkelreferenzen entstehen. Die Ge-
samtheit aller Konzeptknoten mit ihren entsprechenden Inklusionskanten besitzt somit
immer die Topologie eines gerichteten azyklischen Graphen. Übergeordnete Konzepte
„enthalten“ also andere in der Datenbank gespeicherte Elemente, weshalb sie um ihre
technische Natur hervorzuheben und sie vom Konzept als mentalem Modell abzugrenzen
auch als „Konzeptcontainer“ bezeichnet werden können.
In Abbildung 3.10 auf der nächsten Seite wird überblicksartig gezeigt, wie die vom Nutzer
definierten Konzepte zusammengestellt werden können und wie sie Vokabular nutzen,
welches im Graphen mittelbar mit Dokumenten verbunden ist, wodurch über sie Infor-
mation Retrieval im klassischen Sinne möglich wird. Es wird dabei auch deutlich, wie
die beiden Dokumente eine unterschiedliche thematische Abdeckung des gesuchten
Konzepts aufweisen. Für eine Suche mittels Konzepten können je nach Anwendungsfall
verschiedene Rankingkriterien aufgestellt werden, die Dokumente mit besonders breiter
(oder aber in auffälligem Maße punktueller) Übereinstimmung mit den enthaltenen
Subkonzepten bevorzugen.
Die gleichermaßen intuitive wie auch stark simplifizierte Konzeptmodellierung durch
(hierarchisierte) Wortgruppierung, wie sie mit den vorgestellten Konzeptcontainern
umgesetzt wurde, lässt sich nicht nur anhand der genannten theoretischen Vorarbeiten
rechtfertigen, sondern auch durch ähnliche Ansätze aus der Praxis des Wissensmanage-
ments stützen. Im Umfeld des Semantic Web wird unter dem Namen Simple Knowledge
Organization System (SKOS) ein Vokabular für die Wissensorganisation verwaltet, wel-
ches unter anderem mit den Konstrukten
Concept
und
Collection
auf ganz ähnliche
Weise arbeitet. Als nutzbare Relationen bietet SKOS u. a. die Prädikate
broader
und
narrower
(sowie explizit transitive Versionen davon), mit denen sich relative Granu-
laritäten der Konzepte untereinander modellieren lassen. Auch in Kadmos sind viele
weitere Ausprägungsformen von Relationen zwischen Konzepten denkbar und weitere
Bedeutungsunterscheidungen für die
belongs_to
-Beziehung von Sub- zu Superkonzept
leicht technisch umzusetzen. Die konkrete Semantik muss jedoch eng mit den jeweils
35
Konzepte des gleichen Nutzers oder mit einer dessen Nutzergruppen verbundene und damit „freigege-
bene“ Konzepte
106
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
Abbildung 3.10: Schematische Übersicht zur Verknüpfung von Konzepten und
Subkonzepten mit Vokabular sowie dessen Auftreten in Dokumenten
genutzten oder speziell dafür implementierten Retrievalverfahren abgestimmt werden.
Zu deren möglicher Ausrichtung werden im folgenden Abschnitt noch weitere wichtige
Aspekte genannt.
3.7.4 Ergebnisrepräsentation und Retrievalstrategien
Angesichts der zum Teil sehr heterogenen Korpora, mit denen in den e-Humanities
gearbeitet wird, entstehen neue Fragen für das Informataion Retrieval. Anders als im
Bereich von Zeitungstexten oder Webseiten existieren bei der forschungsfragengeleiteten
Recherche anhand spezieller Textgattungen beispielsweise viele mögliche Antworten auf
die Frage nach einem geeignete Anfrageergebnis:
Neben einer (rangsortierten) Liste der gefundenen Dokumente selbst können auch ag-
gregierte Werte der Facetten, wie Autor, Genre oder beliebige Resultate einer Metada-
tentravesierung, ausgegeben werden. Darüber hinaus ist genauso denkbar, nicht das
Dokument, sondern nur Teile davon, wie konkrete Textstellen, das im Kontext gesichtete
107
3.7 Flexibles graphbasiertes Information Retrieval
Vokabular, dessen Annotationen oder die damit verknüpften nutzerdefinierten Konzepte
zurückzuliefern und dabei anwendungsfallspezifisch zu gewichten. In Kadmos ist für
diese Zwecke eine flexible Abfrage solcher
Objects of Interest
möglich, wobei neben der
Nutzung von Basisstrukturelementen auch beliebige künstliche Kontexte, wie Wortab-
stands-Fenster, satzzeichensensitive Fenster, vorkommende Muster von Annotationen,
wie Part-of-Speech (POS)-Tags, uvm. definiert werden können. Nicht immer existiert
für solche Konstrukte ein externalisierbares Referenzierungsschema. Jedoch können
die internen Element-IDs zur Adressierung der jeweiligen Resultate über interaktive
Oberflächen verwendet werden.
Zur Ermittlung einer Rangfolge für die Ergebnisse muss wieder einzelfallabhängig ent-
schieden werden, welche Effekte dadurch erkannt, hervorgehoben oder eliminiert wer-
den sollen. Die Bandbreite reicht von einer einfachen Zählung der
Traverser
, die nach
der Anfrage auf den zurückgelieferten Knoten verweisen, bis hin zu komplexen Berech-
nungsvorschriften, welche auch globale Statistiken (oder Approximationen für diese)
berücksichtigen. Es existieren bereits graphbasierte Maße für Relevanzberechnungen bei
der Schlüsseltermextraktion [
Bou13
], der Termgewichtung [
BL12
] und der termbasierten
Dokumentgewichtung [
RV13
], die als Ausgangspunkt für domänen- und fachfragenzen-
trierte Ansätze dienen können.
Der vorberechnungsfreie Zugriff auf die Datenbasis führt bei komplexeren Abfragen, die
für solche Verfahren zum Teil nötig werden, zu Antwortzeiten jenseits einer wahrgenom-
menen direkten Interaktivität der Vorgang benötigt also mehr als nur wenige Sekunden,
bis die Ergebnisse vollständig vorliegen. Um dem Nutzer dennoch kein untätiges War-
ten zuzumuten, wird in Kadmos eine Retrievalstrategie bevorzugt, die an das in [
FG06
]
eingeführte
Interrupt-driven Retrieval
angelehnt ist. Dieses lässt den Nutzer intermediäre
Ergebnisse anfordern, welche den aktuellen, unvollständigen Abfragezustand abbilden,
jedoch bereits ein Ranking der Ergebnisse vornehmen. In Kadmos besteht die Möglichkeit,
solche Zwischenmeldungen periodisch liefern zu lassen, also die dafür notwendigen „Un-
terbrechungen“ des Retrievalvorgangs regelmäßig automatisch vorzunehmen. Durch die
asynchrone Schnittstelle ist darüber hinaus die Umsetzung von Retrievalabfragen mög-
lich, welche nicht extern unterbrochen werden müssen, sondern Zwischenergebnisse,
sobald genügend neue Ergebnisse vorliegen, selbsttätig zurückmelden.
Ein so geschaffenes interaktives System, das Ergebnisse auf verschiedenen Granulari-
tätsebenen und unter Berücksichtigung vieler Suchfacetten finden kann, erlaubt eine
explorative Recherche, in welcher in kurzen Iterationsschritten der Recherchefokus an-
108
Kapitel 3 Kadmos ein graphbasiertes Recherchesystem
gepasst werden kann. Die vielen Möglichkeiten der fachfragengeleiteten und dennoch
explorierenden Navigation durch das Korpus lassen die Recherche zu einem wertvollen
und individuellen Vorgang der Wissenserschließung werden. Daher sollten die dabei
erlangten Erkenntnisse und Entscheidungen möglichst explizit gemacht werden zum
späteren Nachschlagen, zur Projektdokumentation und als Kommunikationsmittel für
den fachlichen Austausch.
In Kadmos ist die wichtigste Form der Dokumentation des Recherchevorgangs die Samm-
lung der durch den Nutzer angelegten Konzepte. Diese sind Artefakte, die exportiert,
mitpubliziert, kritisch hinterfragt, verglichen, kommentiert usw. werden können. Der
Diskurs um Interpretationen der Korpora und einzelner Themen kann damit in der
Fachcommunity (falls gewünscht) auf expliziterer Ebene ablaufen.
Als Vannevar Bush im Jahr 1945 in einem visionären und vielbeachteten Essay das fiktive
System „Memex“ beschrieb, mit dem sich große Datenmengen
36
speichern, explorie-
ren und verknüpfen lassen, s. [
Bus45
], wies er bereits auf den größten Vorteil einer
solchen Wissenssammlung hin: Das bewusste Verknüpfen von thematisch verwandten
Informationsressourcen bei der Recherche in Form sogenannter
Trails
zur persönlichen
Wissensorganisation. Eine ähnliche persistente Gruppierungsfunktion für Dokumente
und Textstellen wird durch die Konzepte bereits jetzt geleistet. Eine Erweiterung dieser
um Kommentare, den Verweis auf Strukturelemente und Annotationen und ggf. externe
Wissensbasen könnte Trails auch in Kadmos realisierbar machen.
Wie angesprochen, lässt sich die so zu dokumentierende explorative Suche umso besser
realisieren, je mehr geeignetes Suchvokabular bekannt ist. Neben der manuellen Analyse
von Textstellen der Suchergebnisse lassen sich für diesen Zweck auch semi-automatische
statistikbasierte und visuelle Methoden außerhalb des Information Retrieval nutzen,
welche im nächsten Abschnitt zur Korpusexploration vorgestellt werden sollen.
3.8 Graphbasierte Korpusexploration
Die Erschließung von Vokabular ist ein wesentlicher Arbeitsschritt bei der Analyse von
Korpora in den e-Humanities. Externe lexikalische Ressourcen bilden für spezifische Do-
mänen und Forschungsfragen nur selten eine ausreichende Basis und auch mit Methoden
36
A library of a million volumes could be compressed into one end of a desk.
109
3.8 Graphbasierte Korpusexploration
des
Text Mining
können nicht alle relevanten Kontexte automatisch ermittelt werden.
Deshalb werden explorative Zugänge zu den komplexen semi-strukturierten Datensätzen
benötigt, für die sich eine enge Verzahnung mit Visualisierungsmöglichkeiten der
Visual
Analytics
[
KKEM10
] anbietet. In letzter Zeit sind dort Verfahren für den Umgang mit Text-
daten geschaffen worden, die meist auch unverändert in den e-Humanities anwendbar
sind. Für die Anwendungsszenarien von
Visual Text Analytics
im Bereich der digitalen
Geisteswissenschaften wird in [
EAGJ
+
16
] ein Vorgehensmodell skizziert, in welchem ein
auf Forschungsfragen basierender Wissensaggregationsprozess in einzelne Aufgaben der
Wissenserzeugung heruntergebrochen wird. Diese können durch geeignete visuelle und
interaktive Werkzeuge zielgerichtet unterstützt werden.
Konkrete Visualisierungswerkzeuge für Textdaten sind zahlreich vorhanden, sie unter-
scheiden sich jedoch oft recht stark in ihrem genauen Fokus. Für die Darstellung und
Kontrastierung von Wörtern in ihren jeweiligen Verwendungskontexten sollen hier als
erstes die Einsatzmöglichkeiten von
Tag Pies
37
, s. [
JBR
+
17
], in Kadmos vorgestellt werden.
Dabei handelt es sich um Wortwolken“, die für mehrere Begriffe parallel erzeugt werden,
wobei sie in Segmente eines „Kuchendiagramms“ eingepasst sind, welche die relativen
Anteile der Suchwörter abbilden.
Abbildung 3.11 auf der nächsten Seite zeigt die Tag-Pies-Visualisierung für die normalisier-
ten Types der Wortumgebungs-Kontexte dreier grammatikalischer Formen von
Κάδµος
“.
Dafür wurde die Layoutvariante
merged black
gewählt, in welcher gemeinsame Kookkur-
renten mehrerer angefragter Terme zusammengefasst in der Mitte dargestellt werden.
Die Kopplung an Kadmos erlaubt, die Abfrage für ein frei wählbares Wortabstandsfenster
(hier auf 5 Wörter festgelegt) vorzunehmen. Filterungen, wie sie für das Information
Retrieval bereits vorgestellt wurden, sind zudem für diese Form der Korpusexploration
analog umsetzbar.
Die Visualisierung gibt einen ersten Überblick, an den sich genauere philologische Be-
trachtungen anschließen müssen. Es sind dabei jedoch auch bereits für den Laien auf-
fällige Effekte erkennbar. So befinden sich in den Kontexten der Nennung von Kadmos
z. B. die Nominative der Namen seiner Frau (
Αρµονία
Harmonia) und seiner Tochter
(
Σεµέλη
Semele) ausschließlich bei der Genitivform
Κάδµου
. Daraus könnte gefolgert
werden, dass sie nur mit ihm im Text kookkurrieren, wenn sie als seine Verwandten vor-
gestellt werden. Zur Überprüfung solcher Ableitungen können die einzelnen Textstellen
des gemeinsamen Auftretens interaktiv durch Klicken auf den entsprechenden Kook-
37
http://www.tagpies.vizcovery.org/
110