BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper • 1810.04805 • Published • 33
English newswire named entity recognition (PER, ORG, LOC, MISC) for a course experiment. Not a general-domain or safety-critical extractor.
Entity-level strict IOB2 span F1 on held-out test: 0.9120; precision 0.9113; recall 0.9127; token accuracy 0.9824. Validation F1: 0.9455. Single seed; close differences may be noise.
English Reuters news from 1996; domain and time shift can hurt performance. One label per word; truncated sentences beyond 256 subtokens lose supervised words. Named entities and noisy labels may differ across datasets. Review the upstream dataset terms before reuse or redistribution.