OpenJev-4B / evaluation.json
shenjunhao's picture
Add five-model comparisons on MMDM and JevBench Public
2e96e89 verified
Raw History Blame Contribute Delete
18.1 kB
{
"model": "OpenJev-4B",
"comparison_models": {
"openjev": "OpenJev-4B",
"jev": "Jev",
"decider": "Decider 4B",
"jevk5": "JevK5 4B",
"intern": "Intern-Decision-4B"
},
"versions": {
"jev": "1.13.0",
"decider": "2.1",
"jevk5": "0.3"
},
"snapshot_date": "2026-09-29",
"rows": [
{
"group": "MMDM \u00b7 Hard",
"task": "Answer preference",
"n": 185,
"models": {
"openjev": {
"accuracy_percent": 90.81,
"brier": 0.1236
},
"jev": {
"accuracy_percent": 88.11,
"brier": 0.1794
},
"decider": {
"accuracy_percent": 85.95,
"brier": 0.2263
},
"jevk5": {
"accuracy_percent": 77.84,
"brier": 0.3276
},
"intern": {
"accuracy_percent": 77.84,
"brier": 0.3142
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Code / database",
"n": 122,
"models": {
"openjev": {
"accuracy_percent": 84.43,
"brier": 0.2128
},
"jev": {
"accuracy_percent": 83.61,
"brier": 0.2189
},
"decider": {
"accuracy_percent": 77.05,
"brier": 0.3293
},
"jevk5": {
"accuracy_percent": 72.95,
"brier": 0.3546
},
"intern": {
"accuracy_percent": 68.03,
"brier": 0.3364
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Commonsense context",
"n": 355,
"models": {
"openjev": {
"accuracy_percent": 93.8,
"brier": 0.0854
},
"jev": {
"accuracy_percent": 96.9,
"brier": 0.0409
},
"decider": {
"accuracy_percent": 95.21,
"brier": 0.0687
},
"jevk5": {
"accuracy_percent": 93.8,
"brier": 0.1073
},
"intern": {
"accuracy_percent": 87.04,
"brier": 0.2096
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Constraint planning",
"n": 334,
"models": {
"openjev": {
"accuracy_percent": 76.05,
"brier": 0.2944
},
"jev": {
"accuracy_percent": 75.75,
"brier": 0.2859
},
"decider": {
"accuracy_percent": 71.26,
"brier": 0.3685
},
"jevk5": {
"accuracy_percent": 64.37,
"brier": 0.4816
},
"intern": {
"accuracy_percent": 58.38,
"brier": 0.5222
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Deductive reasoning",
"n": 619,
"models": {
"openjev": {
"accuracy_percent": 90.47,
"brier": 0.1389
},
"jev": {
"accuracy_percent": 94.51,
"brier": 0.0781
},
"decider": {
"accuracy_percent": 86.27,
"brier": 0.1861
},
"jevk5": {
"accuracy_percent": 79.97,
"brier": 0.2809
},
"intern": {
"accuracy_percent": 68.66,
"brier": 0.3848
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Emotion recognition",
"n": 9,
"models": {
"openjev": {
"accuracy_percent": 100.0,
"brier": 0.0243
},
"jev": {
"accuracy_percent": 77.78,
"brier": 0.2353
},
"decider": {
"accuracy_percent": 100.0,
"brier": 0.0684
},
"jevk5": {
"accuracy_percent": 77.78,
"brier": 0.3633
},
"intern": {
"accuracy_percent": 77.78,
"brier": 0.369
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Evidence validation",
"n": 177,
"models": {
"openjev": {
"accuracy_percent": 91.53,
"brier": 0.1221
},
"jev": {
"accuracy_percent": 90.96,
"brier": 0.1211
},
"decider": {
"accuracy_percent": 85.31,
"brier": 0.2103
},
"jevk5": {
"accuracy_percent": 88.14,
"brier": 0.196
},
"intern": {
"accuracy_percent": 84.18,
"brier": 0.2301
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Intent routing",
"n": 253,
"models": {
"openjev": {
"accuracy_percent": 94.07,
"brier": 0.1045
},
"jev": {
"accuracy_percent": 93.28,
"brier": 0.1047
},
"decider": {
"accuracy_percent": 92.49,
"brier": 0.1223
},
"jevk5": {
"accuracy_percent": 87.75,
"brier": 0.1688
},
"intern": {
"accuracy_percent": 64.82,
"brier": 0.2352
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Knowledge QA",
"n": 572,
"models": {
"openjev": {
"accuracy_percent": 95.63,
"brier": 0.0693
},
"jev": {
"accuracy_percent": 98.95,
"brier": 0.0202
},
"decider": {
"accuracy_percent": 96.85,
"brier": 0.0527
},
"jevk5": {
"accuracy_percent": 94.76,
"brier": 0.0847
},
"intern": {
"accuracy_percent": 88.99,
"brier": 0.1722
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Multi-hop reasoning",
"n": 211,
"models": {
"openjev": {
"accuracy_percent": 92.42,
"brier": 0.0992
},
"jev": {
"accuracy_percent": 89.57,
"brier": 0.1274
},
"decider": {
"accuracy_percent": 73.93,
"brier": 0.3978
},
"jevk5": {
"accuracy_percent": 74.41,
"brier": 0.3046
},
"intern": {
"accuracy_percent": 64.45,
"brier": 0.4399
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Option logic",
"n": 287,
"models": {
"openjev": {
"accuracy_percent": 51.92,
"brier": 0.5694
},
"jev": {
"accuracy_percent": 41.11,
"brier": 0.6551
},
"decider": {
"accuracy_percent": 34.84,
"brier": 0.7715
},
"jevk5": {
"accuracy_percent": 35.19,
"brier": 0.7176
},
"intern": {
"accuracy_percent": 28.22,
"brier": 0.7979
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Policy exceptions",
"n": 576,
"models": {
"openjev": {
"accuracy_percent": 95.31,
"brier": 0.0688
},
"jev": {
"accuracy_percent": 90.97,
"brier": 0.1301
},
"decider": {
"accuracy_percent": 82.81,
"brier": 0.262
},
"jevk5": {
"accuracy_percent": 72.74,
"brier": 0.3858
},
"intern": {
"accuracy_percent": 63.89,
"brier": 0.463
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Quantitative reasoning",
"n": 330,
"models": {
"openjev": {
"accuracy_percent": 69.09,
"brier": 0.3752
},
"jev": {
"accuracy_percent": 77.88,
"brier": 0.2841
},
"decider": {
"accuracy_percent": 51.21,
"brier": 0.6098
},
"jevk5": {
"accuracy_percent": 46.36,
"brier": 0.6636
},
"intern": {
"accuracy_percent": 37.58,
"brier": 0.7533
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Reading comprehension",
"n": 48,
"models": {
"openjev": {
"accuracy_percent": 95.83,
"brier": 0.0523
},
"jev": {
"accuracy_percent": 100.0,
"brier": 0.0091
},
"decider": {
"accuracy_percent": 95.83,
"brier": 0.064
},
"jevk5": {
"accuracy_percent": 91.67,
"brier": 0.1074
},
"intern": {
"accuracy_percent": 89.58,
"brier": 0.1868
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Score rubrics",
"n": 135,
"models": {
"openjev": {
"accuracy_percent": 78.52,
"brier": 0.2939
},
"jev": {
"accuracy_percent": 85.93,
"brier": 0.2055
},
"decider": {
"accuracy_percent": 72.59,
"brier": 0.3487
},
"jevk5": {
"accuracy_percent": 73.33,
"brier": 0.319
},
"intern": {
"accuracy_percent": 69.63,
"brier": 0.3827
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Temporal / numeric",
"n": 138,
"models": {
"openjev": {
"accuracy_percent": 55.07,
"brier": 0.4695
},
"jev": {
"accuracy_percent": 64.49,
"brier": 0.4235
},
"decider": {
"accuracy_percent": 54.35,
"brier": 0.5197
},
"jevk5": {
"accuracy_percent": 53.62,
"brier": 0.5379
},
"intern": {
"accuracy_percent": 59.42,
"brier": 0.5422
}
}
},
{
"group": "MMDM \u00b7 Hard",
"task": "Total",
"n": 4351,
"models": {
"openjev": {
"accuracy_percent": 85.57,
"brier": 0.1864
},
"jev": {
"accuracy_percent": 86.37,
"brier": 0.1733
},
"decider": {
"accuracy_percent": 78.88,
"brier": 0.2832
},
"jevk5": {
"accuracy_percent": 74.7,
"brier": 0.333
},
"intern": {
"accuracy_percent": 66.95,
"brier": 0.4069
}
}
},
{
"group": "MMDM \u00b7 Soft",
"task": "Constraint planning",
"n": 1,
"models": {
"openjev": {
"accuracy_percent": null,
"brier": 0.007
},
"jev": {
"accuracy_percent": null,
"brier": 0.1412
},
"decider": {
"accuracy_percent": null,
"brier": 0.1338
},
"jevk5": {
"accuracy_percent": null,
"brier": 0.0251
},
"intern": {
"accuracy_percent": null,
"brier": 0.0258
}
}
},
{
"group": "MMDM \u00b7 Soft",
"task": "Evidence validation",
"n": 22,
"models": {
"openjev": {
"accuracy_percent": null,
"brier": 0.1066
},
"jev": {
"accuracy_percent": null,
"brier": 0.0493
},
"decider": {
"accuracy_percent": null,
"brier": 0.1517
},
"jevk5": {
"accuracy_percent": null,
"brier": 0.0773
},
"intern": {
"accuracy_percent": null,
"brier": 0.0914
}
}
},
{
"group": "MMDM \u00b7 Soft",
"task": "Intent routing",
"n": 22,
"models": {
"openjev": {
"accuracy_percent": null,
"brier": 0.0681
},
"jev": {
"accuracy_percent": null,
"brier": 0.157
},
"decider": {
"accuracy_percent": null,
"brier": 0.1366
},
"jevk5": {
"accuracy_percent": null,
"brier": 0.1304
},
"intern": {
"accuracy_percent": null,
"brier": 0.0838
}
}
},
{
"group": "MMDM \u00b7 Soft",
"task": "Policy exceptions",
"n": 18,
"models": {
"openjev": {
"accuracy_percent": null,
"brier": 0.0423
},
"jev": {
"accuracy_percent": null,
"brier": 0.0606
},
"decider": {
"accuracy_percent": null,
"brier": 0.1128
},
"jevk5": {
"accuracy_percent": null,
"brier": 0.0916
},
"intern": {
"accuracy_percent": null,
"brier": 0.0674
}
}
},
{
"group": "MMDM \u00b7 Soft",
"task": "Probabilistic reasoning",
"n": 505,
"models": {
"openjev": {
"accuracy_percent": null,
"brier": 0.0278
},
"jev": {
"accuracy_percent": null,
"brier": 0.1164
},
"decider": {
"accuracy_percent": null,
"brier": 0.1387
},
"jevk5": {
"accuracy_percent": null,
"brier": 0.1092
},
"intern": {
"accuracy_percent": null,
"brier": 0.1242
}
}
},
{
"group": "MMDM \u00b7 Soft",
"task": "Score rubrics",
"n": 30,
"models": {
"openjev": {
"accuracy_percent": null,
"brier": 0.0864
},
"jev": {
"accuracy_percent": null,
"brier": 0.0895
},
"decider": {
"accuracy_percent": null,
"brier": 0.1653
},
"jevk5": {
"accuracy_percent": null,
"brier": 0.1242
},
"intern": {
"accuracy_percent": null,
"brier": 0.1746
}
}
},
{
"group": "MMDM \u00b7 Soft",
"task": "Temporal / numeric",
"n": 12,
"models": {
"openjev": {
"accuracy_percent": null,
"brier": 0.2168
},
"jev": {
"accuracy_percent": null,
"brier": 0.0822
},
"decider": {
"accuracy_percent": null,
"brier": 0.11
},
"jevk5": {
"accuracy_percent": null,
"brier": 0.1283
},
"intern": {
"accuracy_percent": null,
"brier": 0.1747
}
}
},
{
"group": "MMDM \u00b7 Soft",
"task": "Total",
"n": 610,
"models": {
"openjev": {
"accuracy_percent": null,
"brier": 0.0391
},
"jev": {
"accuracy_percent": null,
"brier": 0.1119
},
"decider": {
"accuracy_percent": null,
"brier": 0.1391
},
"jevk5": {
"accuracy_percent": null,
"brier": 0.1092
},
"intern": {
"accuracy_percent": null,
"brier": 0.1232
}
}
},
{
"group": "JevBench \u00b7 Public",
"task": "Original",
"models": {
"openjev": {
"accuracy_percent": 100.0,
"brier": 0.031173049329996292
},
"jev": {
"accuracy_percent": 98.61111111111111,
"brier": 0.028252777777777776
},
"decider": {
"accuracy_percent": 98.61111111111111,
"brier": 0.057440274164038074
},
"jevk5": {
"accuracy_percent": 94.44444444444444,
"brier": 0.10753610290390724
},
"intern": {
"accuracy_percent": 98.61111111111111,
"brier": 0.034003747946694876
}
},
"n": 72
},
{
"group": "JevBench \u00b7 Public",
"task": "Easy",
"models": {
"openjev": {
"accuracy_percent": 100.0,
"brier": 1.0634828094991897e-05
},
"jev": {
"accuracy_percent": 100.0,
"brier": 0.00019583333333333356
},
"decider": {
"accuracy_percent": 100.0,
"brier": 4.472370693105332e-05
},
"jevk5": {
"accuracy_percent": 100.0,
"brier": 0.0025092999623402795
},
"intern": {
"accuracy_percent": 100.0,
"brier": 0.0011188014255948035
}
},
"n": 48
},
{
"group": "JevBench \u00b7 Public",
"task": "Hard",
"models": {
"openjev": {
"accuracy_percent": 75.67567567567568,
"brier": 0.3469152429142525
},
"jev": {
"accuracy_percent": 72.07207207207207,
"brier": 0.35944144144144147
},
"decider": {
"accuracy_percent": 64.86486486486487,
"brier": 0.4685710696134996
},
"jevk5": {
"accuracy_percent": 77.47747747747748,
"brier": 0.31178986168730566
},
"intern": {
"accuracy_percent": 73.87387387387388,
"brier": 0.34391459157831894
}
},
"n": 111
},
{
"group": "JevBench \u00b7 Public",
"task": "Total",
"models": {
"openjev": {
"accuracy_percent": 88.31168831168831,
"brier": 0.17641801725969836
},
"jev": {
"accuracy_percent": 86.14718614718615,
"brier": 0.18156536796536796
},
"decider": {
"accuracy_percent": 82.68398268398268,
"brier": 0.2430702822720428
},
"jevk5": {
"accuracy_percent": 87.44588744588745,
"brier": 0.1838602617080718
},
"intern": {
"accuracy_percent": 87.01298701298701,
"brier": 0.17608870989516875
}
},
"n": 231
}
],
"mmdm_hard_brier_n": 4294,
"mmdm_soft_brier_n": 610,
"mmdm_source_revision": "4af5dba7284e7f72f7ffeb2357c391520813d987",
"public_suite": "original72 + easy48 + hard111",
"notes": "MMDM cells retain dataset-card rounding; Public values retain stored precision. Accuracy is expressed as a percentage."
}