Nanbeige4.2-3B / .eval_results /terminal-bench-2.0.yaml
leran1995's picture
Add community evaluation results for CLAW-EVAL, GPQA, HLE, HMMT_FEB_2026, SWE-BENCH_PRO, SWE-BENCH_VERIFIED, TERMINAL-BENCH-2.0 (#7)
451ed48
Raw
History Blame Contribute Delete
184 Bytes
- dataset:
id: harborframework/terminal-bench-2.0
task_id: terminalbench_2
source:
name: Model Card
url: https://huggingface.co/Nanbeige/Nanbeige4.2-3B
value: 44.1