Measuring metadata quality

Measuring metadata quality
复制标题

衡量元数据质量

DOI:
--
复制
发表时间:
2019
期刊:
影响因子:
--
通讯作者:
P. Király
P. Király
中科院分区:
--
文献类型:
--
作者:
P. Király

文献摘要

被引文献

相似文献

在15岁的雅伦·沃登·维斯切德·阿斯皮克特·冯·梅达塔特的帮助下,他获得了巨大的成功。在Verschiedenen Metadatenkollektionen haben Wisenschaftler and Wisenschaftlerinnen Messwerte Fur etablierte Kennzahlen erFasst.这是一件很重要的事情,因为它是一件很重要的事情。从欧洲到欧洲,再往前走,再往前走。 Euroana.eu,die Europaische Digitale Platform Fur kulturelles Erbe,SamMelt Metadten von 5800万en kulturellen Objekten,die Aus Mehr ALS 3200 Bibliotheken,Museen,Archiven and AudioVisellen Archiven in Europa Stamman。这是一种不同的异源物质,并不是所有的物质都是这样的。经常有这样的人出现在我们面前。他说:“我不知道你的名字是什么,我不知道你的名字是什么,我的名字是你的名字,我的名字是你的名字。”这是一种定性的信息检索和信息检索方法,是一种有效的信息检索方法。我是Zweiten Kapitel schlagt der Autor eine Methode Sowie eine Open Source Losung Vor,um strukturelle Eigenschaften von Daten,Wie Vollstandigkeit,多种语言和Eindeutigkeit,zu Messen。这是我们所面临的问题,我们将对此进行分析和研究。 他说:“我是欧洲人中的一员,他和他的儿子们在一起,找到了他们。”他说:“我不知道怎么回事,我不知道怎么做。在欧洲,这是一种定量的估计,在欧洲,它是最重要的。从今天起,所有的数据都是自动的,这是一种自动的数据处理方式,也是一种数据处理方式。在Kapitel 3 Prasentiert der Autor eine Methode中,他们是MIT Mitgliedern des European ana Data Quality Committee entwickelt Hat,um MehrSprachigkeit ALS ASpekt Verschiedener Dimensionen von DatenQualitat,Wie Vollstandigkeit,Konsistenz,Konformitat and Zuganglichkeit,Messen zu konnen。 这是一种新的方法和方法,不同于传统的方法和方法。以MARC21格式(MARC21)和DEM am weitesten verbreiteten metadaten作为标准的zur Beschreibung von书目。这是一个很难解决的问题,也是一个非常重要的问题。这是一个很难解决的问题,也不是最好的方案,也不是最好的方案,而是最好的方案。 这是一种新的技术和技术。在Kapitel 5 wird ein Kurzer Uberblick Uber den Aufbau des erweiterbaren框架中,Zur Messung von MetadatenQuality Gegeben。我不知道这是什么意思,也不知道是什么意思。我不知道你的名字是什么,我也不知道你是谁。GrundLegende Anforderungen,die beed der Entwickump einer solchen Software berucksichtigt we den Mussen,sind i)die Abstraktion des Metadatenshemas(Im Rahman Des Messprozess),ii)De Umgang MIT Unterschiedlicheen Teilen innerhalb von Metadatensatzen,III)Der Messprozess,iv)在相同的和leistungsfaghe Schnittstelle中使用,以及v)MIT-Java和Rest-API之间的互操作性。在Kapitel 6中,我们不会对参数进行优化,也不会有更大的进展,也不会有更好的结果。他说:“这是一件非常重要的事情。”这是一项重要的实验,也是一项非常重要的工作。在Einem Umfeld MIT中,我们得到了来自Brauchen Wirn的资源,并得到了他们的支持。并对其性能和性能进行了优化,得到了相应的参数和性能指标,并提供了相应的样品。这句话的意思是:“我爱你,爱你!”ALS Grundlage der Bewertung konnen das Sowie das Event-Logging Order Messpunkte innerhalb der Anwendung verwendet wenden. Das letzte Kapitel(Kapitel 7)erlatert ZukunftsPlane,die Anwendbarkeit der Methode auf and ere Bereiche Wie Wikicite(Die Offene Datenbank Ur Zitationsdaten Von Wikidata)and Forschungsdaten,Sowie Forschungskooperation en MIT verschiedenen Kulturerbe制度en。
In den letzten 15 Jahren wurden verschiedene Aspekte von Metadatenqualitat untersucht. In verschiedenen Metadatenkollektionen haben Wissenschaftler und Wissenschaftlerinnen Messwerte fur etablierte Kennzahlen erfasst. Gemeinsam ist diesen Forschungsprojekten, dass die fur die Messungen benotigten Werkzeuge haufig nicht darauf ausgelegt sind in anderen Projekten wiederverwendet zu werden. Die vorliegende Arbeit beschaftigt sich hauptsachlich mit der speziellen Metadatenkollektion von Europeana und untersucht dabei die praktischen Aspekte von Kriterien zur Messung von Metadatenqualitat, wie Wiederverwendung, Reproduzierbarkeit, Skalierbarkeit und Anpassungsfahigkeit. Europeana.eu, die europaische digitale Plattform fur kulturelles Erbe, sammelt Metadaten von 58 Millionen kulturellen Objekten, die aus mehr als 3200 Bibliotheken, Museen, Archiven und audiovisuellen Archiven in Europa stammen. Diese Sammlung ist heterogen und besteht aus Objekten in verschiedenen Formaten und Sprachen, deren Beschreibungen durch unterschiedliche Indexierungspraktiken entstanden sind. Oft wurden die Objekte aus ihrem ursprunglichen Kontext genommen. Um nun Dienstleistungen zu entwickeln, mit denen die Daten zuganglich gemacht und genutzt werden konnen, muss man die Starken und Schwachen oder anders ausgedruckt die Qualitat der Daten kennen. Der Bedarf an qualitativ hochwertigen Daten ist durch deren Ein uss auf die Nutzererfahrung, das Information Retrieval und die Wiederverwendung von Daten in anderen Zusammenhangen motiviert. Im zweiten Kapitel schlagt der Autor eine Methode sowie eine Open Source Losung vor, um strukturelle Eigenschaften von Daten, wie Vollstandigkeit, Multilingualitat und Eindeutigkeit, zu messen. Eine weitere Komponente, um Probleme in Daten aufzudecken, ist die Analyse und Veranschaulichung von Dokumentstrukturen. Ein zentrales Anliegen von Europeana ist es, Nutzern und Nutzerinnen die Moglichkeit zu bieten Kulturguter unabhangig ihrer Herkunft und Sprache, in der sie beschrieben sind, zu finden. Fur ein erfolgreiches sprachubergreifendes Retrieval sind mehrsprachige Metadatenbeschreibungen unerlasslich. Eine Voraussetzung um uberhaupt die Metadatenqualitat in verschiedenen Sprachen verbessern zu konnen, ist die quantitative Bestimmung der sprachlichen Vielfalt der Metadaten in Europeana. Um die Mehrsprachigkeit in den Daten erfassen zu konnen, mussen der komplette Prozess der Datenaggregation abgebildet und auch Prozesse zur Datenverbesserung, wie beispielsweise automatische Datenanreicherungen, berucksichtigt werden. In Kapitel 3 prasentiert der Autor eine Methode, die er zusammen mit Mitgliedern des Europeana Data Quality Committees entwickelt hat, um Mehrsprachigkeit als Aspekt verschiedener Dimensionen von Datenqualitat, wie Vollstandigkeit, Konsistenz, Konformitat und Zuganglichkeit, messen zu konnen. Das nachste Kapitel (Kapitel 4) geht darauf ein, wie das oben beschriebene Konzept skalierbar umgesetzt werden kann und beschreibt die Methode und die Ergebnisse der Validierung von 16 Bibliothekskatalogen. Die Katalogdatensatze liegen in einem maschinenlesbaren Format (MARC21) vor, dem am weitesten verbreiteten Metadatenstandard zur Beschreibung von bibliographischen Einheiten. Die vorliegende Untersuchung ermittelt strukturelle Merkmale der Datensatze und klassifiziert die in diesen haufig auftretenden Probleme. Die haufigsten Probleme sind die Verwendung von undokumentierten Schema-Elementen, falsche Werte an Stellen, an denen ein Wert aus einem kontrollierten Vokabular hatte ubernommen werden sollen oder die Missachtung anderer strenger Vorgaben. Die nachsten Kapitel beschreiben die technischen Aspekte der Forschung. In Kapitel 5 wird ein kurzer uberblick uber den Aufbau des erweiterbaren Framework zur Messung von Metadatenqualitat gegeben. Dieser unterstutzt verschiedene Metadatenschemata und ist exibel genug, um mit neuen Schemata umgehen zu konnen. Diese Anwendung muss skalierbar sein, um eine grose Anzahl von Metadatensatzen innerhalb einer angemessenen Zeit verarbeiten zu konnen. Grundlegende Anforderungen, die bei der Entwicklung einer solchen Software berucksichtigt werden mussen, sind i) die Abstraktion des Metadatenschemas (im Rahmen des Messprozesses), ii) der Umgang mit unterschiedlichen Teilen innerhalb von Metadatensatzen, iii) der Messprozess, iv) eine gemeinsame und leistungsfahige Schnittstelle fur die einzelnen Metriken und v) die Interoperabilitat mit Java- und REST-APIs. In Kapitel 6 wird untersucht welche optimalen Parametereinstellungen fur einen lang laufenden Prozess, basierend auf dem Apache Spark Stand-Alone-Modus, notig sind. Dafur werden die Auswirkungen von vier verschiedenen Parametern gemessen und das Verhalten der Anwendung auf zwei verschiedenen Servern verglichen. Die wichtigste Erkenntnis aus diesem Experiment ist, dass die Zuweisung von mehr Ressourcen nicht unbedingt eine bessere Leistung bedeutet. In einem Umfeld mit begrenzten und geteilten Ressourcen brauchen wir einen Zustand, der "gut genug" ist und anderen Prozessen den Vortritt lasst. Um die optimalen Einstellungen zu finden und die Performance mit verschiedenen Parametern zu messen, sollte ein kleineres Sample herangezogen werden, das in wichtigen Merkmalen dem vollstandigen Datensatz ahnelt. Die Einstellungen, die uberpruft werden sollten, sind die Anzahl der Rechenkerne, die Speicherzuweisung, die Kompression der Quelldateien und (falls vorhanden) das Auslesen verschiedener Dateisysteme. Als Grundlage der Bewertung konnen das Standard Spark-Logging sowie das Event-Logging oder Messpunkte innerhalb der Anwendung verwendet werden. Das letzte Kapitel (Kapitel 7) erlautert Zukunftsplane, die Anwendbarkeit der Methode auf andere Bereiche wie Wikicite (die offene Datenbank fur Zitationsdaten von Wikidata) und Forschungsdaten, sowie Forschungskooperationen mit verschiedenen Kulturerbeinstitutionen.