SecEmbed-base

Cybersecurity dense embedding model fine-tuned from nswerdotai/ModernBERT-base on secembed-pairs.

Trained at max_seq_length=256 for efficient retrieval latency; ModernBERT remains capable of longer contexts at inference when needed.

Evaluation (CyberSec Retrieval Benchmark sample)

json { "attack_retrieval": { "recall@5": 1.0, "recall@10": 1.0, "n": 80 }, "cve_similarity": { "recall@5": 0.9625, "recall@10": 0.9625, "n": 80 }, "cwe_retrieval": { "recall@5": 1.0, "recall@10": 1.0, "n": 80 }, "sigma_retrieval": { "recall@5": 0.8875, "recall@10": 0.9, "n": 80 }, "soc_playbook": { "recall@5": 1.0, "recall@10": 1.0, "n": 80 }, "threat_report_retrieval": { "recall@5": 0.975, "recall@10": 0.975, "n": 80 }, "macro_recall@5": 0.9708 }

Baseline macro Recall@5 (untrained ModernBERT): 0.1417 Final macro Recall@5: 0.9708

Usage

python from sentence_transformers import SentenceTransformer model = SentenceTransformer("alirezaaminzadeh/SecEmbed-base") model.max_seq_length = 512 emb = model.encode(["remote desktop credential attack"])

Related

Downloads last month
-
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for alirezaaminzadeh/SecEmbed-base

Finetuned
(1402)
this model

Spaces using alirezaaminzadeh/SecEmbed-base 2

Collection including alirezaaminzadeh/SecEmbed-base