WikiNER-fr-gold: Een NER-corpus van gouden standaard

WikiNER-fr-gold: A Gold-Standard NER Corpus

October 29, 2024
Auteurs: Danrun Cao, Nicolas Béchet, Pierre-François Marteau
cs.AI

Samenvatting

In dit artikel behandelen we de kwaliteit van de WikiNER-corpus, een meertalige corpus voor het herkennen van vernoemde entiteiten, en bieden we een geconsolideerde versie ervan aan. De annotatie van WikiNER is op een semi-supervised manier geproduceerd, d.w.z. er is geen handmatige verificatie achteraf uitgevoerd. Een dergelijke corpus wordt een zilveren standaard genoemd. In dit artikel stellen we WikiNER-fr-gold voor, wat een herziene versie is van het Franse deel van WikiNER. Onze corpus bestaat uit willekeurig gesamplede 20% van de oorspronkelijke Franse sub-corpus (26.818 zinnen met 700k tokens). We beginnen met het samenvatten van de entiteitstypen die in elke categorie zijn opgenomen om een annotatierichtlijn te definiëren, en vervolgens gaan we over tot het herzien van de corpus. Tot slot presenteren we een analyse van fouten en inconsistenties die zijn waargenomen in de WikiNER-fr-corpus, en bespreken we mogelijke toekomstige onderzoeksrichtingen.
English
We address in this article the the quality of the WikiNER corpus, a multilingual Named Entity Recognition corpus, and provide a consolidated version of it. The annotation of WikiNER was produced in a semi-supervised manner i.e. no manual verification has been carried out a posteriori. Such corpus is called silver-standard. In this paper we propose WikiNER-fr-gold which is a revised version of the French proportion of WikiNER. Our corpus consists of randomly sampled 20% of the original French sub-corpus (26,818 sentences with 700k tokens). We start by summarizing the entity types included in each category in order to define an annotation guideline, and then we proceed to revise the corpus. Finally we present an analysis of errors and inconsistency observed in the WikiNER-fr corpus, and we discuss potential future work directions.

Summary

AI-Generated Summary

PDF44November 13, 2024