Feature Extraction
sentence-transformers
PyTorch
Russian
xlm-roberta
quantization
int8
cpu-optimized
text-embeddings-inference
Instructions to use koryl/bge-m3-quantized-int8 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use koryl/bge-m3-quantized-int8 with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("koryl/bge-m3-quantized-int8") sentences = [ "The weather is lovely today.", "It's so sunny outside!", "He drove to the stadium." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [3, 3] - Notebooks
- Google Colab
- Kaggle
Quantized BGE-M3 (INT8)
Это динамически квантованная (INT8) версия модели BAAI/bge-m3, оптимизированная для быстрого инференса на CPU.
Особенности
- Размер весов уменьшен примерно в 2 раза.
- Скорость инференса на CPU увеличена.
- Качество эмбеддингов сохраняется на уровне, близком к исходной модели (незначительная деградация метрик).
Использование
import torch
from sentence_transformers import SentenceTransformer
# 1. Загружаем базовую архитектуру и веса на CPU
model = SentenceTransformer('BAAI/bge-m3', device='cpu')
# 2. Заменяем веса на квантованные (скачанные из этого репозитория)
# model.load_state_dict(torch.load('pytorch_model.bin', map_location='cpu'))
# 3. Применяем динамическую квантизацию (обязательный шаг!)
model = torch.quantization.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)
# Теперь модель готова к работе
embeddings = model.encode(["Пример текста"])
- Downloads last month
- 54