DizgeBERT-Coref

Türkçe için eşgönderge çözümleme modeli: bir metindeki hangi ifadelerin aynı varlığı gösterdiğini bulur. Türkçenin iki özelliği için tasarlandı: düşmüş özneler (Geldi.) ve örtük iyelik sahipleri (Annesi aradı.).

Ad, DizgeBERT ailesiyle birlikte kullanıldığı için böyle; gövde DizgeBERT (ELECTRA) değil, BERTurk'tür.

  • Gövde: dbmdz/bert-base-turkish-cased (BERTurk)
  • Mimari: fastcoref FCoref (119 M parametre)
  • Kullanım yeri: lgram kütüphanesinin Türkçe merkezleme (Centering Theory) çözümleyicisinde varlık kimliğini verir

Ne yapar, ne yapmaz

Yapar: adlar, adıllar, düşmüş özneler ve örtük iyelik sahipleri arasında "aynı varlık" bağı kurar.

Yapmaz:

  • Boş yerleri kendisi bulmaz. Düşmüş özne ve örtük iyelik sahibi, girdiye önceden adıl yer tutucusu olarak eklenmelidir (aşağıya bakın). Bunu lgram.tr kurallarla yapar.
  • Köprüleme yapmaz (parça–bütün, grup–üye gibi aynı varlık olmayan bağlar).
  • Uzun belge için sınanmadı: 400 token'lık parçalarla eğitildi ve paragraf düzeyinde ölçüldü.

Yer tutucu biçimi

Model, boş öğelerin yerinde bir adıl görmeyi bekler; adıl, bağlı olduğu sözcüğün hemen ardına eklenir:

Boş öğe Eklenen biçim Örnek (eklenenler köşeli parantezde)
Düşmüş özne o, ben, sen, biz, siz, onlar (yüklemin kişi ekine göre) Çok yorgundu [o] .
Örtük iyelik sahibi onun, benim, senin, bizim, sizin, onların Annesi [onun] aradı [o] .

Öğretmen verisindeki gibi (Turkish-ITCC), özne açıkken de yükleme bir özne yer tutucusu eklenir (Annesi … karşıladı [o]).

Kullanım

import spacy
from fastcoref import FCoref

model = FCoref(model_name_or_path="iatagun/DizgeBERT-Coref", nlp=spacy.blank("tr"))

# yer tutucular eklenmiş, sözcüklere bölünmüş girdi
tokens = "Ayşe eve geldi . Annesi onun onu kapıda karşıladı o . Çok yorgundu o .".split()
result = model.predict(texts=[tokens], is_split_into_words=True)[0]

print(result.get_clusters())
# [[['Ayşe'], ['onun'], ['onu'], ['o']], [['Annesi'], ['o']]]
print(result.get_clusters(as_strings=False))   # sözcük aralıkları [başlangıç, bitiş)
# [[(0, 1), (5, 6), (6, 7), (13, 14)], [(4, 5), (9, 10)]]

Yer tutucuları elle eklemek yerine lgram.tr kullanılabilir: ayrıştırıcı (iatagun/DizgeBERT-Joint) ile boş yerleri bulur, bu modelle kimlikleri çözer ve cümle cümle merkezleme geçişlerini verir (experiments/tr_coref_centering.py, feat/turkish-centering-spike dalı; henüz PyPI sürümünde yok).

Eğitim verisi: gümüş etiket

Model elle etiketlenmiş veriyle eğitilmedi. Ham metin lgram.tr ile ayrıştırıldı, boş yerler kuralla eklendi, eşgönderge etiketlerini bir öğretmen model üretti (ufal/corpipe25-corefud1.3-base-251101, CorPipe 25).

Tür Kaynak Belge Token
Ansiklopedi Türkçe Vikipedi 450 madde ~519 bin
Hikâye Vikikaynak (çoğu Ömer Seyfettin) 69 hikâye ~170 bin
Haber Vikihaber 660 haber ~158 bin

İki aşama: önce Vikipedi (5 epoch), sonra hikâye + haber (4 epoch). Öğrenme oranı 1e-5 (gövde) / 3e-4 (baş), max_span_length=8, top_lambda=1.0. Checkpoint, Turkish-ITCC eğitim bölümünden 2 belgeyle seçildi.

Değerlendirme

Ölçüt eşgönderge F1'i değil, modelin asıl kullanım amacı: merkezleme geçişlerinin doğruluğu. Turkish-ITCC (CorefUD 1.3) altın eşgöndergesinden türetilen geçişlere karşı, 21 belge, 3.035 geçiş. "Sıkı doğruluk": geçiş etiketi doğru ve geriye dönük merkez (Cb) doğru varlık.

Sistem Anlatı Deneme/makale Haber Hepsi
Yalnız kurallar (lgram.tr) 0.494 0.468 0.477 0.481
Bu model 0.563 0.550 0.561 0.558
Tavan (altın kimlik, aynı aday yerleri) 0.762 0.780 0.751 0.764

Kurallara karşı fark anlamlı (McNemar p < 0.001; 21 belgenin 20'sinde daha iyi). Doğrulama belgelerinde CoNLL F1 0.654 (altın yer tutucularla, 2 belge).

Sınırlar ve çekinceler

  • Orta düzeyde bir model. Kurallarla tavan arasındaki farkın yaklaşık dörtte birini kapatıyor.
  • Tek eğitim koşusu. Farklı tohumla ±0.01 oynayabilir.
  • Dolaylı sızıntı. Öğretmen model ITCC eğitim bölümünü görmüştü; bu yüzden ITCC üzerindeki sayılar tamamen bağımsız bir sınama değildir. Checkpoint seçimi de ITCC ile yapıldı.
  • Başka çalışmalarla karşılaştırılamaz. Buradaki sayılar CorefUD puan tablosundaki CoNLL F1 değerleriyle aynı şeyi ölçmez.
  • Tür. Eğitim verisi ansiklopedi, yüz yıl önceki hikâyeler ve haberden oluşuyor; güncel edebî metinde, denemede ve konuşma dilinde başarımı ölçülmedi ya da daha düşük.
  • Hedef türde insan etiketli bir sınama kümesi yok.

Lisans ve kaynaklar

CC BY-NC-SA 4.0 — ticari olmayan kullanım. Neden: etiketleri üreten CorPipe modeli ve checkpoint seçiminde kullanılan Turkish-ITCC CC BY-NC-SA 4.0 lisanslıdır.

  • Öğretmen: Straka, CorPipe at CRAC 2025 (arXiv:2509.17858)
  • Turkish-ITCC: Pamay Arslan & Eryiğit, Enhancing Turkish Coreference Resolution, Computer Speech & Language, 2024 (doi:10.1016/j.csl.2024.101681); CorefUD 1.3
  • Metinler: Vikipedi ve Vikikaynak (CC BY-SA 4.0), Vikihaber (CC BY 2.5)
  • Gövde: BERTurk (MIT), dbmdz
  • Mimari: Otmazgin, Cattan & Goldberg, F-coref (2022)
Downloads last month
21
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for iatagun/DizgeBERT-Coref

Finetuned
(208)
this model

Space using iatagun/DizgeBERT-Coref 1

Paper for iatagun/DizgeBERT-Coref