modheel

Дообученная модель на основе sentence-transformers/all-MiniLM-L6-v2 для семантического поиска на русском языке.

Описание

Модель дообучена на датасете deepvk/ru-HNP с использованием Triplet Loss для улучшения качества эмбеддингов русскоязычных текстов. Базовая модель была обучена на английском языке, дообучение позволило адаптировать её к русскому языку.

Данные для дообучения

  • Датасет: deepvk/ru-HNP
  • Количество примеров: 20000 (первые 20000 записей из train)
  • Разделение: 90/10 (train/val)

Использование

from sentence_transformers import SentenceTransformer

model = SentenceTransformer("NikolayRainWay/modheel")
embeddings = model.encode(["Пример текста"], normalize_embeddings=True)
Лицензия
Apache 2.0

Визуализация

UMAP проекция эмбеддингов дообученной модели на датасете headline-classification:

UMAP проекция

Downloads last month
59
Safetensors
Model size
22.7M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support