umer-wasim's picture
Claude Opus 5.5
Devseis AI Act Classifier v6: weights, int8 ONNX, card and evaluation
7c594f6 verified
Raw History Blame Contribute Delete
2.52 kB
{
"target": 0.9,
"threshold": 0.5,
"validation": [
{
"t": 0.3,
"answered": 1.0,
"acc_answered": 0.846,
"errors_flagged": "0/25",
"severe_still_answered": 0
},
{
"t": 0.35,
"answered": 1.0,
"acc_answered": 0.846,
"errors_flagged": "0/25",
"severe_still_answered": 0
},
{
"t": 0.4,
"answered": 0.988,
"acc_answered": 0.844,
"errors_flagged": "0/25",
"severe_still_answered": 0
},
{
"t": 0.45,
"answered": 0.988,
"acc_answered": 0.844,
"errors_flagged": "0/25",
"severe_still_answered": 0
},
{
"t": 0.5,
"answered": 0.981,
"acc_answered": 0.849,
"errors_flagged": "1/25",
"severe_still_answered": 0
},
{
"t": 0.55,
"answered": 0.975,
"acc_answered": 0.854,
"errors_flagged": "2/25",
"severe_still_answered": 0
},
{
"t": 0.6,
"answered": 0.938,
"acc_answered": 0.855,
"errors_flagged": "3/25",
"severe_still_answered": 0
},
{
"t": 0.65,
"answered": 0.901,
"acc_answered": 0.856,
"errors_flagged": "4/25",
"severe_still_answered": 0
},
{
"t": 0.7,
"answered": 0.858,
"acc_answered": 0.871,
"errors_flagged": "7/25",
"severe_still_answered": 0
},
{
"t": 0.75,
"answered": 0.809,
"acc_answered": 0.87,
"errors_flagged": "8/25",
"severe_still_answered": 0
},
{
"t": 0.8,
"answered": 0.753,
"acc_answered": 0.869,
"errors_flagged": "9/25",
"severe_still_answered": 0
},
{
"t": 0.85,
"answered": 0.698,
"acc_answered": 0.867,
"errors_flagged": "10/25",
"severe_still_answered": 0
},
{
"t": 0.9,
"answered": 0.574,
"acc_answered": 0.86,
"errors_flagged": "12/25",
"severe_still_answered": 0
},
{
"t": 0.95,
"answered": 0.309,
"acc_answered": 0.88,
"errors_flagged": "19/25",
"severe_still_answered": 0
}
],
"note": "The pre-set rule (answered accuracy >= 0.90 on validation) found no threshold: this model's errors are mostly confident. Chosen with the product owner: flag only genuinely split predictions (top probability < 0.50).",
"test_at_threshold": {
"t": 0.5,
"answered": 0.995,
"acc_answered": 0.833,
"errors_flagged": "0/35",
"severe_still_answered": 0
}
}