Quantized BGE-M3 (INT8)

Это динамически квантованная (INT8) версия модели BAAI/bge-m3, оптимизированная для быстрого инференса на CPU.

Особенности

  • Размер весов уменьшен примерно в 2 раза.
  • Скорость инференса на CPU увеличена.
  • Качество эмбеддингов сохраняется на уровне, близком к исходной модели (незначительная деградация метрик).

Использование

import torch
from sentence_transformers import SentenceTransformer

# 1. Загружаем базовую архитектуру и веса на CPU
model = SentenceTransformer('BAAI/bge-m3', device='cpu')

# 2. Заменяем веса на квантованные (скачанные из этого репозитория)
# model.load_state_dict(torch.load('pytorch_model.bin', map_location='cpu'))

# 3. Применяем динамическую квантизацию (обязательный шаг!)
model = torch.quantization.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)

# Теперь модель готова к работе
embeddings = model.encode(["Пример текста"])
Downloads last month
54
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support