Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -45,6 +45,29 @@ Medido sobre estos GGUF exactos servidos con llama.cpp. Script:
|
|
| 45 |
[`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
|
| 46 |
resultados se generan antes de cada publicación.*
|
| 47 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 48 |
### 🧠 Con qué se entrenó (por contribución)
|
| 49 |
|
| 50 |
- **Acciones de agente (in-house, sintético)** — escenarios browser/computer/code con el
|
|
|
|
| 45 |
[`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
|
| 46 |
resultados se generan antes de cada publicación.*
|
| 47 |
|
| 48 |
+
### 🔍 Benchmarks de la comunidad (independientes de nuestro propio bench)
|
| 49 |
+
|
| 50 |
+
Además del benchmark de agent-actions de arriba (que es nuestro propio esquema),
|
| 51 |
+
corrimos Qwen3-4B-Instruct-2507 y este modelo contra benchmarks ESTÁNDAR de la comunidad,
|
| 52 |
+
en las mismas condiciones exactas (misma cuantización GGUF, mismo serving,
|
| 53 |
+
mismo harness) para que la comparación sea justa:
|
| 54 |
+
|
| 55 |
+
| Benchmark | Base Qwen3-4B-Instruct-2507 | **Este modelo** | |
|
| 56 |
+
|---|---|---|---|
|
| 57 |
+
| HumanEval | 74.4% | **72.6%** | ❌ pierde |
|
| 58 |
+
| MBPP | 82.5% | **75.0%** | ❌ pierde |
|
| 59 |
+
| MMLU (subset) | 68.4% | **68.4%** | ➖ empata |
|
| 60 |
+
| BFCL-lite (tool-calling estandar) | 76.0% | **76.5%** | ✅ gana |
|
| 61 |
+
|
| 62 |
+
*HumanEval/MBPP: pass@1 con ejecución real de tests ocultos (no similitud de
|
| 63 |
+
texto). MMLU: subset de 15 materias, precisión 0-shot. BFCL-lite: subset AST
|
| 64 |
+
del Berkeley Function-Calling Leaderboard v3 (simple/multiple/parallel/
|
| 65 |
+
parallel_multiple/irrelevance) — mide tool-calling en un esquema DISTINTO al
|
| 66 |
+
nuestro. Si el fine-tune pierde en alguna dimensión, se muestra perdiendo:
|
| 67 |
+
el LoRA se entrenó para el núcleo de Daimon (agent-actions), no es un
|
| 68 |
+
fine-tune general-purpose, y ese trade-off queda documentado acá en vez de
|
| 69 |
+
escondido.
|
| 70 |
+
|
| 71 |
### 🧠 Con qué se entrenó (por contribución)
|
| 72 |
|
| 73 |
- **Acciones de agente (in-house, sintético)** — escenarios browser/computer/code con el
|