MonoHime/ru_sentiment_dataset
Viewer • Updated • 211k • 373 • 13
How to use Bektur756/rubert-tiny2-russian-sentiment with Transformers:
# Use a pipeline as a high-level helper
from transformers import pipeline
pipe = pipeline("text-classification", model="Bektur756/rubert-tiny2-russian-sentiment") # pip install -U transformers accelerate
# Load model directly
from transformers import AutoTokenizer, AutoModelForSequenceClassification
tokenizer = AutoTokenizer.from_pretrained("Bektur756/rubert-tiny2-russian-sentiment")
model = AutoModelForSequenceClassification.from_pretrained("Bektur756/rubert-tiny2-russian-sentiment", device_map="auto")Классификатор тональности русскоязычных пользовательских текстов.
0: Neutral1: Positive2: Negativecointegrated/rubert-tiny2
Модель была полностью дообучена для классификации текста на три класса.
MonoHime/ru_sentiment_dataset
После очистки и удаления дубликатов:
Class weights:
| Metric | Value |
|---|---|
| Accuracy | 0.7811 |
| Macro Precision | 0.7713 |
| Macro Recall | 0.7918 |
| Macro F1 | 0.7768 |
| Neutral F1 | 0.6960 |
| Positive F1 | 0.7989 |
| Negative F1 | 0.8354 |
| Negative Recall | 0.8787 |
End-to-end latency includes preprocessing, tokenization and inference. Batch size is 1.
| Device | Mean | Median | P95 | Requests/sec |
|---|---|---|---|---|
| Tesla T4 GPU | 7.33 ms | 6.57 ms | 12.92 ms | 136.41 |
| Colab CPU | 13.84 ms | 13.69 ms | 16.77 ms | 72.26 |
import torch
from transformers import (
AutoModelForSequenceClassification,
AutoTokenizer,
)
MODEL_NAME = "Bektur756/rubert-tiny2-russian-sentiment"
tokenizer = AutoTokenizer.from_pretrained(
MODEL_NAME
)
model = (
AutoModelForSequenceClassification
.from_pretrained(MODEL_NAME)
)
text = "Отличный сервис, всё понравилось."
inputs = tokenizer(
text,
return_tensors="pt",
truncation=True,
max_length=128,
)
with torch.inference_mode():
logits = model(**inputs).logits
probabilities = torch.softmax(
logits,
dim=-1,
)[0]
predicted_id = int(
probabilities.argmax()
)
print(model.config.id2label[predicted_id])
print(probabilities.tolist())
## Limitations
В исходном датасете присутствуют шумные и неоднозначные метки.
Слабее всего модель распознаёт нейтральный класс.
Base model
cointegrated/rubert-tiny2