Sie befinden Sich nicht im Netzwerk der Universität Paderborn. Der Zugriff auf elektronische Ressourcen ist gegebenenfalls nur via VPN oder Shibboleth (DFN-AAI) möglich. mehr Informationen...
Ergebnis 1 von 3

Details

Autor(en) / Beteiligte
Titel
INSPIRE: Insight to scientific publications and references : Verteilte Berechnung von Bibliometriken auf großen Datenmengen
Ort / Verlag
Paderborn
Erscheinungsjahr
2013
Link zum Volltext
Link zu anderen Inhalten
Beschreibungen/Notizen
  • Tag der Abgabe: 30.04.2013
  • ger: Die vorliegende Arbeit behandelt die Berechnung von Literaturempfehlungen für wissenschaftliche Publikationen. Dazu wird ein Softwaresystem entwickelt, mit dem eine automatische Zitationsanalyse durchgeführt werden kann. Dies umfasst die Untersuchung eines unterliegenden Dokumentennetzwerkes durch die Kombination verschiedener Ansätze der Bibliometrie. Die Ergebnisse der Zitationsanalyse hängen von der Menge und Qualität der unterliegenden Datenbasis ab. Diese wird durch ein Dokumentennetzwerk repräsentiert und besteht im Wesentlichen aus Publikationen und Referenzierungen zwischen diesen. Um diese Datenbasis aufzubauen, werden im Vorfeld Daten verschiedener Formate verarbeitet. Zunächst findet eine Extraktion von Volltexten aus PDF-Dateien statt. Aus den Volltexten werden anschließend Metadaten zu Publikationen und Metadaten zu Referenzen der Literaturverzeichnisse extrahiert. Dieser Extraktionsvorgang verwendet externe Open Source Anwendungen. Da die Datenqualität der Extraktion gering ist, findet eine zusätzliche Nachbearbeitung der extrahierten Daten statt. Die redundant vorliegenden Metadaten werden dabei in ein integriertes Format zusammengeführt. Extrahierte Metadaten zu Publikationen und Referenzen werden anschließend genutzt, um ein Dokumentennetzwerk aufzubauen. Eine passende Lösung zur Datenhaltung wird im Vorfeld durch einen Benchmark ermittelt. Aus dem vorbereiteten Dokumentennetzwerk kann abschließend eine Publikation gewählt werden, für die Literaturempfehlungen ermittelt und präsentiert werden. Da die benötigten Berechnungen zeitintensiv sind und als Grundlage mehrere Hunderttausend Dokumente dienen, werden sie verteilt in einem Rechnercluster durchgeführt. Für die verteilten Berechnungen findet dabei das Hadoop Framework Verwendung.
Sprache
Deutsch
Identifikatoren
DOI: 10.17619/UNIPB/1-88
URN: urn:nbn:de:hbz:466:2-28348
Titel-ID: 990218352970206441
Format
1 Online-Ressource (vii, 115 Seiten); Illustrationen, Diagramme