Instructions to use Dalfaxy/critiscope-bertopic with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- BERTopic
How to use Dalfaxy/critiscope-bertopic with BERTopic:
from bertopic import BERTopic model = BERTopic.load("Dalfaxy/critiscope-bertopic") - Notebooks
- Google Colab
- Kaggle
|
Download comparison_notes.md from Dalfaxy/critiscope-bertopic: direct link, hf CLI and curl.
- Browser
- Download file 2.01 kB
-
https://huggingface.co/Dalfaxy/critiscope-bertopic/resolve/main/comparison_notes.md
- Command line
-
hf download hf://Dalfaxy/critiscope-bertopic/comparison_notes.md
-
curl -L -o comparison_notes.md https://huggingface.co/Dalfaxy/critiscope-bertopic/resolve/main/comparison_notes.md
2.01 kB
Comparaison BERTopic / LDA : commentaire
Sources : comparison.csv, coherence_per_topic.csv, lda_grid_20000.csv, lda_topics_20000_k29.json,
lda_topics_20000_k20.json (19 112 critiques, dictionnaire commun unigrammes + bigrammes, 10 505 termes).
Résultats
| Modèle | Thèmes | NPMI | C_V | Diversité (top 25) | Couverture |
|---|---|---|---|---|---|
| BERTopic (e5-large-instruct) | 29 | -0,021 | 0,492 | 0,70 | 97 % |
| LDA, K = 29 | 29 | -0,053 | 0,385 | 0,71 | 100 % |
| LDA, K = 20 (meilleure NPMI de la grille) | 20 | -0,015 | 0,434 | 0,77 | 100 % |
- À nombre de thèmes égal (K = 29), BERTopic a une meilleure cohérence NPMI (+0,032) et C_V (+0,107), pour une diversité équivalente.
- Le meilleur LDA de la grille (K = 20) a une NPMI légèrement supérieure (+0,006) mais une C_V nettement inférieure (-0,058) ; les nombres de thèmes diffèrent.
- Toutes les NPMI sont proches de 0 : les critiques sont courtes, les mots d'un thème y co-apparaissent peu.
Lecture qualitative
- Les thèmes LDA sont majoritairement des mélanges de mots génériques (ex. « long, métrage, sou, pierre », « bout, heure, idée, comprendre », « the, of, new ») ; seuls quelques-uns sont nets (comédie, animation, documentaire, comédie romantique, chef-d'œuvre, guerre).
- Les thèmes BERTopic correspondent à des genres, cinémas nationaux ou sujets identifiables.
- Les thèmes BERTopic les moins cohérents en NPMI sont de petits thèmes aux mots très spécifiques (religion : -0,20 ; politique : -0,20 ; cinéma hispanophone : -0,19) ; les plus cohérents sont des thèmes larges (espionnage : +0,23 ; guerre : +0,13 ; animation : +0,13). La NPMI, calculée sur les co-occurrences dans tout le corpus, pénalise les mots précis mais rares : elle sous-estime l'avantage de lisibilité de BERTopic.
Coût
BERTopic : 21 s d'entraînement, hors calcul des embeddings (6 min sur GPU Apple MPS pour 19 112
critiques). LDA : ~13 s par modèle (CPU, mono-cœur).