lucas-mella commited on
Commit
64609a0
·
verified ·
1 Parent(s): c6add53

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +23 -0
README.md CHANGED
@@ -45,6 +45,29 @@ Medido sobre estos GGUF exactos servidos con llama.cpp. Script:
45
  [`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
46
  resultados se generan antes de cada publicación.*
47
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
48
  ### 🧠 Con qué se entrenó (por contribución)
49
 
50
  - **Acciones de agente (in-house, sintético)** — escenarios browser/computer/code con el
 
45
  [`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
46
  resultados se generan antes de cada publicación.*
47
 
48
+ ### 🔍 Benchmarks de la comunidad (independientes de nuestro propio bench)
49
+
50
+ Además del benchmark de agent-actions de arriba (que es nuestro propio esquema),
51
+ corrimos Qwen3-4B-Instruct-2507 y este modelo contra benchmarks ESTÁNDAR de la comunidad,
52
+ en las mismas condiciones exactas (misma cuantización GGUF, mismo serving,
53
+ mismo harness) para que la comparación sea justa:
54
+
55
+ | Benchmark | Base Qwen3-4B-Instruct-2507 | **Este modelo** | |
56
+ |---|---|---|---|
57
+ | HumanEval | 74.4% | **72.6%** | ❌ pierde |
58
+ | MBPP | 82.5% | **75.0%** | ❌ pierde |
59
+ | MMLU (subset) | 68.4% | **68.4%** | ➖ empata |
60
+ | BFCL-lite (tool-calling estandar) | 76.0% | **76.5%** | ✅ gana |
61
+
62
+ *HumanEval/MBPP: pass@1 con ejecución real de tests ocultos (no similitud de
63
+ texto). MMLU: subset de 15 materias, precisión 0-shot. BFCL-lite: subset AST
64
+ del Berkeley Function-Calling Leaderboard v3 (simple/multiple/parallel/
65
+ parallel_multiple/irrelevance) — mide tool-calling en un esquema DISTINTO al
66
+ nuestro. Si el fine-tune pierde en alguna dimensión, se muestra perdiendo:
67
+ el LoRA se entrenó para el núcleo de Daimon (agent-actions), no es un
68
+ fine-tune general-purpose, y ese trade-off queda documentado acá en vez de
69
+ escondido.
70
+
71
  ### 🧠 Con qué se entrenó (por contribución)
72
 
73
  - **Acciones de agente (in-house, sintético)** — escenarios browser/computer/code con el