# Comparaison BERTopic / LDA : commentaire Sources : `comparison.csv`, `coherence_per_topic.csv`, `lda_grid_20000.csv`, `lda_topics_20000_k29.json`, `lda_topics_20000_k20.json` (19 112 critiques, dictionnaire commun unigrammes + bigrammes, 10 505 termes). ## Résultats | Modèle | Thèmes | NPMI | C_V | Diversité (top 25) | Couverture | |---|---|---|---|---|---| | BERTopic (e5-large-instruct) | 29 | -0,021 | 0,492 | 0,70 | 97 % | | LDA, K = 29 | 29 | -0,053 | 0,385 | 0,71 | 100 % | | LDA, K = 20 (meilleure NPMI de la grille) | 20 | -0,015 | 0,434 | 0,77 | 100 % | - À nombre de thèmes égal (K = 29), BERTopic a une meilleure cohérence NPMI (+0,032) et C_V (+0,107), pour une diversité équivalente. - Le meilleur LDA de la grille (K = 20) a une NPMI légèrement supérieure (+0,006) mais une C_V nettement inférieure (-0,058) ; les nombres de thèmes diffèrent. - Toutes les NPMI sont proches de 0 : les critiques sont courtes, les mots d'un thème y co-apparaissent peu. ## Lecture qualitative - Les thèmes LDA sont majoritairement des mélanges de mots génériques (ex. « long, métrage, sou, pierre », « bout, heure, idée, comprendre », « the, of, new ») ; seuls quelques-uns sont nets (comédie, animation, documentaire, comédie romantique, chef-d'œuvre, guerre). - Les thèmes BERTopic correspondent à des genres, cinémas nationaux ou sujets identifiables. - Les thèmes BERTopic les moins cohérents en NPMI sont de petits thèmes aux mots très spécifiques (religion : -0,20 ; politique : -0,20 ; cinéma hispanophone : -0,19) ; les plus cohérents sont des thèmes larges (espionnage : +0,23 ; guerre : +0,13 ; animation : +0,13). La NPMI, calculée sur les co-occurrences dans tout le corpus, pénalise les mots précis mais rares : elle sous-estime l'avantage de lisibilité de BERTopic. ## Coût BERTopic : ~21 s d'entraînement, hors calcul des embeddings (~6 min sur GPU Apple MPS pour 19 112 critiques). LDA : ~13 s par modèle (CPU, mono-cœur).