NuTag / README.md
ApyHTML19's picture
Create README.md
5229d9e verified
|
Raw
History Blame Contribute Delete
4.06 kB
# 🏷️ NuTag — Named Entity Recognition Model
> **NuTag** est un modèle de reconnaissance d'entités nommées (NER) basé sur **NuNER-BERT-v1.0**, développé par [NuMind](https://huggingface.co/numind), quantifié au format **GGUF** pour une exécution locale légère et efficace.
---
## 📋 Informations générales
| Attribut | Détail |
|---|---|
| **Nom** | NuTag |
| **Architecture** | BERT (Bidirectional Encoder Representations from Transformers) |
| **Tâche** | Token Classification / Named Entity Recognition (NER) |
| **Langue** | Anglais 🇬🇧 |
| **Format** | GGUF (llama.cpp compatible) |
| **Licence** | Voir dépôt original NuMind |
---
## 🎯 À quoi sert NuTag ?
NuTag analyse un texte brut et **identifie automatiquement les entités nommées** qu'il contient. Il ne génère pas de texte — il **étiquette** les éléments importants.
### Entités détectées
| Étiquette | Type | Exemple |
|---|---|---|
| `PER` | Personne | *Elon Musk*, *Marie Curie* |
| `ORG` | Organisation | *Tesla*, *ONU*, *Google* |
| `LOC` | Lieu géographique | *Paris*, *Maroc*, *Sahara* |
| `DATE` | Date / Période | *12 janvier 2024*, *en 2003* |
| `MONEY` | Montant financier | *6,5 millions de dollars* |
| `MISC` | Divers | *iPhone 15*, *COVID-19* |
---
## 💡 Exemple d'utilisation
**Texte en entrée :**
```
Elon Musk a fondé Tesla à Palo Alto en 2003 avec un investissement de 6,5M$.
```
**Sortie NuTag :**
```json
[
{ "entity": "PER", "word": "Elon Musk", "score": 0.998 },
{ "entity": "ORG", "word": "Tesla", "score": 0.995 },
{ "entity": "LOC", "word": "Palo Alto", "score": 0.991 },
{ "entity": "DATE", "word": "2003", "score": 0.987 },
{ "entity": "MONEY", "word": "6,5M$", "score": 0.976 }
]
```
---
## 🚀 Installation & Usage
### Option 1 — HuggingFace Transformers (Python)
```bash
pip install transformers torch
```
```python
from transformers import pipeline
ner = pipeline(
task="ner",
model="numind/NuNER-BERT-v1.0",
aggregation_strategy="simple"
)
texte = "Elon Musk a fondé Tesla à Palo Alto en 2003 avec 6,5M$ d'investissement."
resultats = ner(texte)
for entite in resultats:
print(f"[{entite['entity_group']}] {entite['word']} (score: {entite['score']:.3f})")
```
---
### Option 3 — LM Studio (interface graphique)
1. Ouvrir **LM Studio**
2. Rechercher `ApyHTML19/NuTag`
## 🛠️ Cas d'usage
| Domaine | Application |
|---|---|
| 📰 **Presse & Médias** | Extraction automatique de personnes, lieux, événements |
| ⚖️ **Juridique** | Identification de parties, dates, montants dans des contrats |
| 🏥 **Santé** | Extraction de médicaments, pathologies, patients |
| 🔐 **Cybersécurité** | Détection d'IPs, domaines, CVE dans des logs |
| 📦 **E-commerce** | Reconnaissance de produits, marques, prix |
| 🔍 **Moteur de recherche** | Indexation sémantique de contenus |
---
## ⚙️ Caractéristiques techniques
- **Architecture** : BERT encoder-only (non génératif)
- **Méthode d'entraînement** : Fine-tuning supervisé sur corpus NER multidomaine
- **Tokenisation** : WordPiece (vocabulaire BERT)
- **Format GGUF** : Quantisation statique par `mradermacher`
- **Compatible** : `llama.cpp`, `LM Studio`, `Ollama`, `Jan`
---
## ⚠️ Limitations
- Modèle entraîné principalement sur des textes **en anglais**
- Ne génère **pas** de texte — uniquement classification de tokens
- Les quantisations basses (Q2, Q3) peuvent réduire la précision sur des entités rares
- Les entités composées (ex: *New York City*) peuvent être fragmentées selon la tokenisation
---
## 🔗 Liens utiles
- 📦 [Modèle original — numind/NuNER-BERT-v1.0](https://huggingface.co/numind/NuNER-BERT-v1.0)
- 📦 [Version GGUF — mradermacher/NuNER-BERT-v1.0-GGUF](https://huggingface.co/mradermacher/NuNER-BERT-v1.0-GGUF)
- 📖 [Guide GGUF par TheBloke](https://huggingface.co/TheBloke)
- 🛠️ [llama.cpp](https://github.com/ggerganov/llama.cpp)
- 🖥️ [LM Studio](https://lmstudio.ai)
---