WikiNER-fr-gold: un corpus NER de référence
WikiNER-fr-gold: A Gold-Standard NER Corpus
October 29, 2024
Autori: Danrun Cao, Nicolas Béchet, Pierre-François Marteau
cs.AI
Abstract
In questo articolo affrontiamo la qualità del corpus WikiNER, un corpus multilingue per il riconoscimento delle entità nominate, e ne forniamo una versione consolidata. L'annotazione di WikiNER è stata prodotta in modo semi-supervisionato, cioè nessuna verifica manuale è stata effettuata a posteriori. Tale corpus è definito silver-standard. In questo articolo proponiamo WikiNER-fr-gold, che è una versione rivista della porzione francese di WikiNER. Il nostro corpus è composto dal 20% campionato casualmente del sotto-corpus francese originale (26.818 frasi con 700k token). Iniziamo con un riassunto dei tipi di entità inclusi in ciascuna categoria al fine di definire una linea guida per l'annotazione, e poi procediamo con la revisione del corpus. Infine presentiamo un'analisi degli errori e delle inconsistenze osservate nel corpus WikiNER-fr, e discutiamo potenziali direzioni per futuri lavori.
English
We address in this article the the quality of the WikiNER corpus, a
multilingual Named Entity Recognition corpus, and provide a consolidated
version of it. The annotation of WikiNER was produced in a semi-supervised
manner i.e. no manual verification has been carried out a posteriori. Such
corpus is called silver-standard. In this paper we propose WikiNER-fr-gold
which is a revised version of the French proportion of WikiNER. Our corpus
consists of randomly sampled 20% of the original French sub-corpus (26,818
sentences with 700k tokens). We start by summarizing the entity types included
in each category in order to define an annotation guideline, and then we
proceed to revise the corpus. Finally we present an analysis of errors and
inconsistency observed in the WikiNER-fr corpus, and we discuss potential
future work directions.Summary
AI-Generated Summary