Instructions to use alirezaaminzadeh/SecEmbed-base with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use alirezaaminzadeh/SecEmbed-base with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("alirezaaminzadeh/SecEmbed-base") sentences = [ "That is a happy person", "That is a happy dog", "That is a very happy person", "Today is a sunny day" ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
SecEmbed-base
Cybersecurity dense embedding model fine-tuned from nswerdotai/ModernBERT-base on secembed-pairs.
Trained at max_seq_length=256 for efficient retrieval latency; ModernBERT remains capable of longer contexts at inference when needed.
Evaluation (CyberSec Retrieval Benchmark sample)
json { "attack_retrieval": { "recall@5": 1.0, "recall@10": 1.0, "n": 80 }, "cve_similarity": { "recall@5": 0.9625, "recall@10": 0.9625, "n": 80 }, "cwe_retrieval": { "recall@5": 1.0, "recall@10": 1.0, "n": 80 }, "sigma_retrieval": { "recall@5": 0.8875, "recall@10": 0.9, "n": 80 }, "soc_playbook": { "recall@5": 1.0, "recall@10": 1.0, "n": 80 }, "threat_report_retrieval": { "recall@5": 0.975, "recall@10": 0.975, "n": 80 }, "macro_recall@5": 0.9708 }
Baseline macro Recall@5 (untrained ModernBERT): 0.1417 Final macro Recall@5: 0.9708
Usage
python from sentence_transformers import SentenceTransformer model = SentenceTransformer("alirezaaminzadeh/SecEmbed-base") model.max_seq_length = 512 emb = model.encode(["remote desktop credential attack"])
Related
- Dataset: secembed-pairs
- Benchmark: cybersec-retrieval-benchmark
- Reranker: SecReranker
- Demo: https://huggingface.co/spaces/alirezaaminzadeh/secembed
- Downloads last month
- -
Model tree for alirezaaminzadeh/SecEmbed-base
Base model
answerdotai/ModernBERT-base