laya-cybersec / benchmark_results.json
cderinbogaz's picture
Update Laya cybersecurity to verified R2a weights and matching ONNX export
259cd3d verified
Raw History Blame Contribute Delete
4.93 kB
{
"type": "aggregate_r2a_regression_comparison",
"checkpoint": "R2a",
"models": [
{
"model": "laya-cybersec-r2a",
"name": "Laya R2a",
"full_en": {
"n": 510,
"attacks": 256,
"clean": 254,
"auroc": 0.9155004306102362,
"caught": 140,
"false_alarms": 2,
"recall": 0.546875,
"fpr": 0.007874015748031496
},
"full_de": {
"n": 510,
"attacks": 256,
"clean": 254,
"auroc": 0.8780065821850394,
"caught": 151,
"false_alarms": 9,
"recall": 0.58984375,
"fpr": 0.03543307086614173
},
"skills_en": {
"n": 48,
"attacks": 27,
"clean": 21,
"auroc": 0.927689594356261,
"caught": 18,
"false_alarms": 0
},
"skills_de": {
"n": 48,
"attacks": 27,
"clean": 21,
"auroc": 0.9329805996472663,
"caught": 18,
"false_alarms": 0
},
"pdf": {
"n": 730,
"attacks": 107,
"clean": 623,
"auroc": 0.8855927753859077,
"caught": 81,
"false_alarms": 0
},
"decision_rule": "score > 0.95"
},
{
"model": "jev",
"name": "Jev",
"full_en": {
"auroc": 0.9799920029527559,
"n": 510
},
"full_de": {
"auroc": 0.9564391609251969,
"n": 510
},
"skills_en": {
"n": 48,
"attacks": 27,
"clean": 21,
"auroc": 0.9841269841269841,
"caught": 25,
"false_alarms": 1
},
"skills_de": {
"n": 48,
"attacks": 27,
"clean": 21,
"auroc": 0.9603174603174603,
"caught": 25,
"false_alarms": 2
},
"pdf": {
"n": 730,
"attacks": 107,
"clean": 623,
"auroc": 0.978525674682348,
"caught": 73,
"false_alarms": 2
},
"decision_rule": "score > 0.5"
},
{
"model": "TextCortex/clef-cybersecurity",
"name": "clef-cybersecurity",
"full_en": {
"n": 510,
"attacks": 256,
"clean": 254,
"auroc": 0.9925335260826772,
"caught": 232,
"false_alarms": 0
},
"full_de": {
"n": 510,
"attacks": 256,
"clean": 254,
"auroc": 0.9743940698818898,
"caught": 241,
"false_alarms": 17
},
"skills_en": {
"n": 48,
"attacks": 27,
"clean": 21,
"auroc": 1.0,
"caught": 23,
"false_alarms": 0
},
"skills_de": {
"n": 48,
"attacks": 27,
"clean": 21,
"auroc": 0.9171075837742504,
"caught": 26,
"false_alarms": 3
},
"pdf": {
"n": 730,
"attacks": 107,
"clean": 623,
"auroc": 0.9856212778086137,
"caught": 84,
"false_alarms": 3
},
"decision_rule": "score > 0.5"
},
{
"model": "Cloudflare/clef-flash",
"name": "CLEF Flash (base)",
"full_en": {
"n": 510,
"attacks": 256,
"clean": 254,
"auroc": 0.9587613804133859,
"caught": 136,
"false_alarms": 0
},
"full_de": {
"n": 510,
"attacks": 256,
"clean": 254,
"auroc": 0.9391455462598425,
"caught": 130,
"false_alarms": 0
},
"skills_en": {
"n": 48,
"attacks": 27,
"clean": 21,
"auroc": 0.9761904761904762,
"caught": 14,
"false_alarms": 0
},
"skills_de": {
"n": 48,
"attacks": 27,
"clean": 21,
"auroc": 0.9047619047619048,
"caught": 12,
"false_alarms": 0
},
"pdf": {
"n": 730,
"attacks": 107,
"clean": 623,
"auroc": 0.8144492281843957,
"caught": 6,
"false_alarms": 0
},
"decision_rule": "score > 0.5"
}
],
"cohort": {
"full_per_language": 510,
"skills_per_language": 48,
"pdf_attacks": 107,
"clean_pdfs": 623
},
"scope": "Previously inspected internal regression sets; not a public leaderboard or fresh blind test.",
"threshold_note": "Strict >0.5 for both CLEF models and Jev; strict >0.95 for Laya R2a. Recall and false alarms are not equal-threshold comparisons.",
"backend_note": "R2a full-suite results use the saved batched GPU run; matched skill/PDF references use saved local scores. Backend precision causes small score differences; GPU English-skills AUROC was 0.9268077601410935.",
"base_clef_evaluation": {
"type": "unchanged_local_base",
"model": "Cloudflare/clef-flash",
"revision": "17f0b0ad64efb65d273590632833508766b2aae6",
"scope": "Unchanged native checkpoint, evaluated locally on the matched cohorts with token-bounded windows. Not the Cloudflare hosted API run."
}
}