DizgeBERT-Coref
Türkçe için eşgönderge çözümleme modeli: bir metindeki hangi ifadelerin aynı varlığı gösterdiğini bulur. Türkçenin iki özelliği için tasarlandı: düşmüş özneler (Geldi.) ve örtük iyelik sahipleri (Annesi aradı.).
Ad, DizgeBERT ailesiyle birlikte kullanıldığı için böyle; gövde DizgeBERT (ELECTRA) değil, BERTurk'tür.
- Gövde:
dbmdz/bert-base-turkish-cased(BERTurk) - Mimari: fastcoref
FCoref(119 M parametre) - Kullanım yeri: lgram kütüphanesinin Türkçe merkezleme (Centering Theory) çözümleyicisinde varlık kimliğini verir
Ne yapar, ne yapmaz
Yapar: adlar, adıllar, düşmüş özneler ve örtük iyelik sahipleri arasında "aynı varlık" bağı kurar.
Yapmaz:
- Boş yerleri kendisi bulmaz. Düşmüş özne ve örtük iyelik sahibi, girdiye önceden adıl
yer tutucusu olarak eklenmelidir (aşağıya bakın). Bunu
lgram.trkurallarla yapar. - Köprüleme yapmaz (parça–bütün, grup–üye gibi aynı varlık olmayan bağlar).
- Uzun belge için sınanmadı: 400 token'lık parçalarla eğitildi ve paragraf düzeyinde ölçüldü.
Yer tutucu biçimi
Model, boş öğelerin yerinde bir adıl görmeyi bekler; adıl, bağlı olduğu sözcüğün hemen ardına eklenir:
| Boş öğe | Eklenen biçim | Örnek (eklenenler köşeli parantezde) |
|---|---|---|
| Düşmüş özne | o, ben, sen, biz, siz, onlar (yüklemin kişi ekine göre) |
Çok yorgundu [o] . |
| Örtük iyelik sahibi | onun, benim, senin, bizim, sizin, onların |
Annesi [onun] aradı [o] . |
Öğretmen verisindeki gibi (Turkish-ITCC), özne açıkken de yükleme bir özne yer tutucusu eklenir (Annesi … karşıladı [o]).
Kullanım
import spacy
from fastcoref import FCoref
model = FCoref(model_name_or_path="iatagun/DizgeBERT-Coref", nlp=spacy.blank("tr"))
# yer tutucular eklenmiş, sözcüklere bölünmüş girdi
tokens = "Ayşe eve geldi . Annesi onun onu kapıda karşıladı o . Çok yorgundu o .".split()
result = model.predict(texts=[tokens], is_split_into_words=True)[0]
print(result.get_clusters())
# [[['Ayşe'], ['onun'], ['onu'], ['o']], [['Annesi'], ['o']]]
print(result.get_clusters(as_strings=False)) # sözcük aralıkları [başlangıç, bitiş)
# [[(0, 1), (5, 6), (6, 7), (13, 14)], [(4, 5), (9, 10)]]
Yer tutucuları elle eklemek yerine lgram.tr kullanılabilir: ayrıştırıcı
(iatagun/DizgeBERT-Joint) ile boş yerleri bulur,
bu modelle kimlikleri çözer ve cümle cümle merkezleme geçişlerini verir
(experiments/tr_coref_centering.py, feat/turkish-centering-spike dalı; henüz PyPI sürümünde yok).
Eğitim verisi: gümüş etiket
Model elle etiketlenmiş veriyle eğitilmedi. Ham metin lgram.tr ile ayrıştırıldı, boş
yerler kuralla eklendi, eşgönderge etiketlerini bir öğretmen model üretti
(ufal/corpipe25-corefud1.3-base-251101, CorPipe 25).
| Tür | Kaynak | Belge | Token |
|---|---|---|---|
| Ansiklopedi | Türkçe Vikipedi | 450 madde | ~519 bin |
| Hikâye | Vikikaynak (çoğu Ömer Seyfettin) | 69 hikâye | ~170 bin |
| Haber | Vikihaber | 660 haber | ~158 bin |
İki aşama: önce Vikipedi (5 epoch), sonra hikâye + haber (4 epoch). Öğrenme oranı 1e-5
(gövde) / 3e-4 (baş), max_span_length=8, top_lambda=1.0. Checkpoint, Turkish-ITCC eğitim
bölümünden 2 belgeyle seçildi.
Değerlendirme
Ölçüt eşgönderge F1'i değil, modelin asıl kullanım amacı: merkezleme geçişlerinin doğruluğu. Turkish-ITCC (CorefUD 1.3) altın eşgöndergesinden türetilen geçişlere karşı, 21 belge, 3.035 geçiş. "Sıkı doğruluk": geçiş etiketi doğru ve geriye dönük merkez (Cb) doğru varlık.
| Sistem | Anlatı | Deneme/makale | Haber | Hepsi |
|---|---|---|---|---|
Yalnız kurallar (lgram.tr) |
0.494 | 0.468 | 0.477 | 0.481 |
| Bu model | 0.563 | 0.550 | 0.561 | 0.558 |
| Tavan (altın kimlik, aynı aday yerleri) | 0.762 | 0.780 | 0.751 | 0.764 |
Kurallara karşı fark anlamlı (McNemar p < 0.001; 21 belgenin 20'sinde daha iyi). Doğrulama belgelerinde CoNLL F1 0.654 (altın yer tutucularla, 2 belge).
Sınırlar ve çekinceler
- Orta düzeyde bir model. Kurallarla tavan arasındaki farkın yaklaşık dörtte birini kapatıyor.
- Tek eğitim koşusu. Farklı tohumla ±0.01 oynayabilir.
- Dolaylı sızıntı. Öğretmen model ITCC eğitim bölümünü görmüştü; bu yüzden ITCC üzerindeki sayılar tamamen bağımsız bir sınama değildir. Checkpoint seçimi de ITCC ile yapıldı.
- Başka çalışmalarla karşılaştırılamaz. Buradaki sayılar CorefUD puan tablosundaki CoNLL F1 değerleriyle aynı şeyi ölçmez.
- Tür. Eğitim verisi ansiklopedi, yüz yıl önceki hikâyeler ve haberden oluşuyor; güncel edebî metinde, denemede ve konuşma dilinde başarımı ölçülmedi ya da daha düşük.
- Hedef türde insan etiketli bir sınama kümesi yok.
Lisans ve kaynaklar
CC BY-NC-SA 4.0 — ticari olmayan kullanım. Neden: etiketleri üreten CorPipe modeli ve checkpoint seçiminde kullanılan Turkish-ITCC CC BY-NC-SA 4.0 lisanslıdır.
- Öğretmen: Straka, CorPipe at CRAC 2025 (arXiv:2509.17858)
- Turkish-ITCC: Pamay Arslan & Eryiğit, Enhancing Turkish Coreference Resolution, Computer Speech & Language, 2024 (doi:10.1016/j.csl.2024.101681); CorefUD 1.3
- Metinler: Vikipedi ve Vikikaynak (CC BY-SA 4.0), Vikihaber (CC BY 2.5)
- Gövde: BERTurk (MIT), dbmdz
- Mimari: Otmazgin, Cattan & Goldberg, F-coref (2022)
- Downloads last month
- 21
Model tree for iatagun/DizgeBERT-Coref
Base model
dbmdz/bert-base-turkish-cased