BestTerm-440M-Checkpts / benchmarks /teacher_decoding.json
N8Programs's picture
Expand BestTerm model card with benchmark comparisons and reproducibility
6c2b324 verified
Raw
History Blame Contribute Delete
1.14 kB
{
"model": "N8Programs/BestTerm-440M-Checkpts",
"table": {
"greedy": "38/57",
"greedy_restricted": "38/57",
"beam4_t64": "40/57",
"beam4_t160": "40/57",
"beam8_t64": "40/57",
"beam8_t160": "40/57",
"beam16_t64": "ERROR",
"beam16_t160": "ERROR",
"vote32_T0.7": "31/57",
"rerank32_T0.7_h1_total": "38/57",
"rerank32_T0.7_h1_mean": "39/57",
"rerank32_T0.7_h2_total": "39/57",
"rerank32_T0.7_h2_mean": "39/57",
"rerank32_T0.7_h4_total": "39/57",
"rerank32_T0.7_h4_mean": "39/57",
"rerank32_T0.7_h8_total": "38/57",
"rerank32_T0.7_h8_mean": "40/57",
"rerank32_T0.7_h16_total": "37/57",
"rerank32_T0.7_h16_mean": "38/57",
"vote32_T1.0": "35/57",
"rerank32_T1.0_h1_total": "38/57",
"rerank32_T1.0_h1_mean": "39/57",
"rerank32_T1.0_h2_total": "39/57",
"rerank32_T1.0_h2_mean": "39/57",
"rerank32_T1.0_h4_total": "38/57",
"rerank32_T1.0_h4_mean": "38/57",
"rerank32_T1.0_h8_total": "40/57",
"rerank32_T1.0_h8_mean": "40/57",
"rerank32_T1.0_h16_total": "39/57",
"rerank32_T1.0_h16_mean": "40/57"
},
"num_samples": 32
}