WikiNER-fr-gold: Ein Goldstandard NER-Korpus
WikiNER-fr-gold: A Gold-Standard NER Corpus
October 29, 2024
Autoren: Danrun Cao, Nicolas Béchet, Pierre-François Marteau
cs.AI
Zusammenfassung
In diesem Artikel behandeln wir die Qualität des WikiNER-Korpus, eines mehrsprachigen Korpus zur benannten Entitätenerkennung, und stellen eine konsolidierte Version davon bereit. Die Annotation von WikiNER wurde auf halbüberwachte Weise erstellt, d.h. es wurde keine manuelle Überprüfung im Nachhinein durchgeführt. Ein solcher Korpus wird als Silberstandard bezeichnet. In diesem Paper schlagen wir WikiNER-fr-gold vor, was eine überarbeitete Version des französischen Teils des WikiNER ist. Unser Korpus besteht aus zufällig ausgewählten 20% des ursprünglichen französischen Teilkorpus (26.818 Sätze mit 700k Tokens). Wir beginnen damit, die Entitätentypen in jeder Kategorie zusammenzufassen, um eine Anleitungsrichtlinie festzulegen, und gehen dann zur Überarbeitung des Korpus über. Abschließend präsentieren wir eine Analyse von Fehlern und Inkonsistenzen, die im WikiNER-fr-Korpus beobachtet wurden, und diskutieren potenzielle zukünftige Arbeitsrichtungen.
English
We address in this article the the quality of the WikiNER corpus, a
multilingual Named Entity Recognition corpus, and provide a consolidated
version of it. The annotation of WikiNER was produced in a semi-supervised
manner i.e. no manual verification has been carried out a posteriori. Such
corpus is called silver-standard. In this paper we propose WikiNER-fr-gold
which is a revised version of the French proportion of WikiNER. Our corpus
consists of randomly sampled 20% of the original French sub-corpus (26,818
sentences with 700k tokens). We start by summarizing the entity types included
in each category in order to define an annotation guideline, and then we
proceed to revise the corpus. Finally we present an analysis of errors and
inconsistency observed in the WikiNER-fr corpus, and we discuss potential
future work directions.Summary
AI-Generated Summary