critiscope-bertopic / comparison_notes.md
Dalfaxy's picture
Artefacts CritiScope
1094f16 verified
|
Raw History Blame Contribute Delete
2.01 kB

Comparaison BERTopic / LDA : commentaire

Sources : comparison.csv, coherence_per_topic.csv, lda_grid_20000.csv, lda_topics_20000_k29.json, lda_topics_20000_k20.json (19 112 critiques, dictionnaire commun unigrammes + bigrammes, 10 505 termes).

Résultats

Modèle Thèmes NPMI C_V Diversité (top 25) Couverture
BERTopic (e5-large-instruct) 29 -0,021 0,492 0,70 97 %
LDA, K = 29 29 -0,053 0,385 0,71 100 %
LDA, K = 20 (meilleure NPMI de la grille) 20 -0,015 0,434 0,77 100 %
  • À nombre de thèmes égal (K = 29), BERTopic a une meilleure cohérence NPMI (+0,032) et C_V (+0,107), pour une diversité équivalente.
  • Le meilleur LDA de la grille (K = 20) a une NPMI légèrement supérieure (+0,006) mais une C_V nettement inférieure (-0,058) ; les nombres de thèmes diffèrent.
  • Toutes les NPMI sont proches de 0 : les critiques sont courtes, les mots d'un thème y co-apparaissent peu.

Lecture qualitative

  • Les thèmes LDA sont majoritairement des mélanges de mots génériques (ex. « long, métrage, sou, pierre », « bout, heure, idée, comprendre », « the, of, new ») ; seuls quelques-uns sont nets (comédie, animation, documentaire, comédie romantique, chef-d'œuvre, guerre).
  • Les thèmes BERTopic correspondent à des genres, cinémas nationaux ou sujets identifiables.
  • Les thèmes BERTopic les moins cohérents en NPMI sont de petits thèmes aux mots très spécifiques (religion : -0,20 ; politique : -0,20 ; cinéma hispanophone : -0,19) ; les plus cohérents sont des thèmes larges (espionnage : +0,23 ; guerre : +0,13 ; animation : +0,13). La NPMI, calculée sur les co-occurrences dans tout le corpus, pénalise les mots précis mais rares : elle sous-estime l'avantage de lisibilité de BERTopic.

Coût

BERTopic : 21 s d'entraînement, hors calcul des embeddings (6 min sur GPU Apple MPS pour 19 112 critiques). LDA : ~13 s par modèle (CPU, mono-cœur).