Measuring metadata quality
Measuring metadata quality
复制标题
衡量元数据质量
DOI:
--
复制
发表时间:
2019
期刊:
影响因子:
--
通讯作者:
P. Király
中科院分区:
文献类型:
--
作者:
P. Király
In den letzten 15 Jahren wurden verschiedene Aspekte von Metadatenqualitat untersucht. In verschiedenen Metadatenkollektionen haben Wissenschaftler und Wissenschaftlerinnen Messwerte fur etablierte Kennzahlen erfasst. Gemeinsam ist diesen Forschungsprojekten, dass die fur die Messungen benotigten Werkzeuge haufig nicht darauf ausgelegt sind in anderen Projekten wiederverwendet zu werden. Die vorliegende Arbeit beschaftigt sich hauptsachlich mit der speziellen Metadatenkollektion von Europeana und untersucht dabei die praktischen Aspekte von Kriterien zur Messung von Metadatenqualitat, wie Wiederverwendung, Reproduzierbarkeit, Skalierbarkeit und Anpassungsfahigkeit.
Europeana.eu, die europaische digitale Plattform fur kulturelles Erbe, sammelt Metadaten von 58 Millionen kulturellen Objekten, die aus mehr als 3200 Bibliotheken, Museen, Archiven und audiovisuellen Archiven in Europa stammen. Diese Sammlung ist heterogen und besteht aus Objekten in verschiedenen Formaten und Sprachen, deren Beschreibungen durch unterschiedliche Indexierungspraktiken entstanden sind. Oft wurden die Objekte aus ihrem ursprunglichen Kontext genommen. Um nun Dienstleistungen zu entwickeln, mit denen die Daten zuganglich gemacht und genutzt werden konnen, muss man die Starken und Schwachen oder anders ausgedruckt die Qualitat der Daten kennen. Der Bedarf an qualitativ hochwertigen Daten ist durch deren Ein uss auf die Nutzererfahrung, das Information Retrieval und die Wiederverwendung von Daten in anderen Zusammenhangen motiviert. Im zweiten Kapitel schlagt der Autor eine Methode sowie eine Open Source Losung vor, um strukturelle Eigenschaften von Daten, wie Vollstandigkeit, Multilingualitat und Eindeutigkeit, zu messen. Eine weitere Komponente, um Probleme in Daten aufzudecken, ist die Analyse und Veranschaulichung von Dokumentstrukturen.
Ein zentrales Anliegen von Europeana ist es, Nutzern und Nutzerinnen die Moglichkeit zu bieten Kulturguter unabhangig ihrer Herkunft und Sprache, in der sie beschrieben sind, zu finden. Fur ein erfolgreiches sprachubergreifendes Retrieval sind mehrsprachige Metadatenbeschreibungen unerlasslich. Eine Voraussetzung um uberhaupt die Metadatenqualitat in verschiedenen Sprachen verbessern zu konnen, ist die quantitative Bestimmung der sprachlichen Vielfalt der Metadaten in Europeana. Um die Mehrsprachigkeit in den Daten erfassen zu konnen, mussen der komplette Prozess der Datenaggregation abgebildet und auch Prozesse zur Datenverbesserung, wie beispielsweise automatische Datenanreicherungen, berucksichtigt werden. In Kapitel 3 prasentiert der Autor eine Methode, die er zusammen mit Mitgliedern des Europeana Data Quality Committees entwickelt hat, um Mehrsprachigkeit als Aspekt verschiedener Dimensionen von Datenqualitat, wie Vollstandigkeit, Konsistenz, Konformitat und Zuganglichkeit, messen zu konnen.
Das nachste Kapitel (Kapitel 4) geht darauf ein, wie das oben beschriebene Konzept skalierbar umgesetzt werden kann und beschreibt die Methode und die Ergebnisse der Validierung von 16 Bibliothekskatalogen. Die Katalogdatensatze liegen in einem maschinenlesbaren Format (MARC21) vor, dem am weitesten verbreiteten Metadatenstandard zur Beschreibung von bibliographischen Einheiten. Die vorliegende Untersuchung ermittelt strukturelle Merkmale der Datensatze und klassifiziert die in diesen haufig auftretenden Probleme. Die haufigsten Probleme sind die Verwendung von undokumentierten Schema-Elementen, falsche Werte an Stellen, an denen ein Wert aus einem kontrollierten Vokabular hatte ubernommen werden sollen oder die Missachtung anderer strenger Vorgaben.
Die nachsten Kapitel beschreiben die technischen Aspekte der Forschung. In Kapitel 5 wird ein kurzer uberblick uber den Aufbau des erweiterbaren Framework zur Messung von Metadatenqualitat gegeben. Dieser unterstutzt verschiedene Metadatenschemata und ist exibel genug, um mit neuen Schemata umgehen zu konnen. Diese Anwendung muss skalierbar sein, um eine grose Anzahl von Metadatensatzen innerhalb einer angemessenen Zeit verarbeiten zu konnen. Grundlegende Anforderungen, die bei der Entwicklung einer solchen Software berucksichtigt werden mussen, sind i) die Abstraktion des Metadatenschemas (im Rahmen des Messprozesses), ii) der Umgang mit unterschiedlichen Teilen innerhalb von Metadatensatzen, iii) der Messprozess, iv) eine gemeinsame und leistungsfahige Schnittstelle fur die einzelnen Metriken und v) die Interoperabilitat mit Java- und REST-APIs. In Kapitel 6 wird untersucht welche optimalen Parametereinstellungen fur einen lang laufenden Prozess, basierend auf dem Apache Spark Stand-Alone-Modus, notig sind. Dafur werden die Auswirkungen von vier verschiedenen Parametern gemessen und das Verhalten der Anwendung auf zwei verschiedenen Servern verglichen. Die wichtigste Erkenntnis aus diesem Experiment ist, dass die Zuweisung von mehr Ressourcen nicht unbedingt eine bessere Leistung bedeutet. In einem Umfeld mit begrenzten und geteilten Ressourcen brauchen wir einen Zustand, der "gut genug" ist und anderen Prozessen den Vortritt lasst. Um die optimalen Einstellungen zu finden und die Performance mit verschiedenen Parametern zu messen, sollte ein kleineres Sample herangezogen werden, das in wichtigen Merkmalen dem vollstandigen Datensatz ahnelt. Die Einstellungen, die uberpruft werden sollten, sind die Anzahl der Rechenkerne, die Speicherzuweisung, die Kompression der Quelldateien und (falls vorhanden) das Auslesen verschiedener Dateisysteme. Als Grundlage der Bewertung konnen das Standard Spark-Logging sowie das Event-Logging oder Messpunkte innerhalb der Anwendung verwendet werden.
Das letzte Kapitel (Kapitel 7) erlautert Zukunftsplane, die Anwendbarkeit der Methode auf andere Bereiche wie Wikicite (die offene Datenbank fur Zitationsdaten von Wikidata) und Forschungsdaten, sowie Forschungskooperationen mit verschiedenen Kulturerbeinstitutionen.