Kppwdfgu1/Fula-pular
Viewer • Updated • 9.76k • 66
How to use SalimDiallo/mms-1b-pular-asr with Transformers:
# Use a pipeline as a high-level helper
from transformers import pipeline
pipe = pipeline("automatic-speech-recognition", model="SalimDiallo/mms-1b-pular-asr") # Load model directly
from transformers import AutoProcessor, AutoModelForCTC
processor = AutoProcessor.from_pretrained("SalimDiallo/mms-1b-pular-asr")
model = AutoModelForCTC.from_pretrained("SalimDiallo/mms-1b-pular-asr", device_map="auto")Modèle de reconnaissance vocale (ASR/STT) pour le pular (fuf), variante du fula parlée en Guinée (Fouta-Djalon). Obtenu par fine-tuning des adapter layers de facebook/mms-1b-all (~2 % des paramètres entraînés, base gelée).
WER : 10,38 % (contre 17,31 % pour MMS d'origine, soit -40 % d'erreurs).
fuf)import torch, librosa
from transformers import Wav2Vec2ForCTC, AutoProcessor
repo = "SalimDiallo/mms-1b-pular-asr"
processor = AutoProcessor.from_pretrained(repo)
model = Wav2Vec2ForCTC.from_pretrained(repo).eval()
audio, _ = librosa.load("mon_audio.wav", sr=16_000)
inputs = processor(audio, sampling_rate=16_000, return_tensors="pt")
with torch.no_grad():
logits = model(**inputs).logits
print(processor.decode(torch.argmax(logits, dim=-1)[0]))
Dataset Kppwdfgu1/Fula-pular : ~9 760 clips audio (0,3–30 s) avec transcriptions, issus de lectures du Nouveau Testament en pular. Split 90/5/5 train/validation/test. Texte normalisé : minuscules, ponctuation retirée, caractères pular (ɓ ɗ ɲ ƴ ŋ) conservés.
| Modèle | WER | CER |
|---|---|---|
| MMS-1B-all (adapter fula d'origine, sans fine-tuning) | 17,31 % | 4,57 % |
| Ce modèle (fine-tuné) | 10,38 % | 2,89 % |
Évalué sur 200 exemples du test set (jamais vus à l'entraînement).
Si tu utilises ce modèle, cite aussi MMS :
@article{pratap2023mms,
title={Scaling Speech Technology to 1,000+ Languages},
author={Pratap, Vineel and others},
journal={arXiv preprint arXiv:2305.13516},
year={2023}
}
Base model
facebook/mms-1b-all