lucas-mella commited on
Commit
f017b18
·
verified ·
1 Parent(s): dcdc5cf

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +27 -15
README.md CHANGED
@@ -31,25 +31,12 @@ de Daimon: **acciones de agente (tool-calling JSON), código y conversación en
31
  funciona con llama.cpp / LM Studio / cualquier stack GGUF, **sin necesidad del software
32
  de Daimon** — abajo está el contrato completo de prompts para usarlo standalone.
33
 
34
- ### 📊 Benchmark (medido, reproducible)
35
 
36
  <div align="center">
37
- <img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-r-benchmarks-light.png" width="640" alt="benchmark daimon r vs base"/>
38
  </div>
39
 
40
- | Métrica (198 casos held-out) | Base Qwen3-4B-Instruct-2507 | **daimon r** | |
41
- |---|---|---|---|
42
- | JSON válido / valid JSON | 100.0% | **100.0%** | ➖ empata |
43
- | Acción correcta / correct action | 75.3% | **100.0%** | ✅ gana |
44
- | Acción + campos correctos / correct fields | 47.5% | **100.0%** | ✅ gana |
45
-
46
- *Benchmark objetivo y reproducible: 198 escenarios sintéticos held-out (vocabulario
47
- disjunto del entrenamiento, cero solapamiento textual), calificados determinísticamente —
48
- JSON parseable, acción esperada, campos correctos (`ref`/`path`/`command`/…). Sin juez LLM.
49
- Medido sobre estos GGUF exactos servidos con llama.cpp. Script:
50
- [`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
51
- resultados se generan antes de cada publicación.*
52
-
53
  ### 🔍 Benchmarks de la comunidad (independientes de nuestro propio bench)
54
 
55
  Además del benchmark de agent-actions de arriba (que es nuestro propio esquema),
@@ -77,6 +64,31 @@ arriba: de ~47% a ~100% en acciones correctas). Para programar "a mano" usá el
77
  modelo base; para operar como agente de Daimon, este. Si una dimensión pierde,
78
  se muestra perdiendo — preferimos que la card sea creíble a que sea linda.
79
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
80
  ### 🧠 Con qué se entrenó (por contribución)
81
 
82
  - **Acciones de agente (in-house, sintético)** — escenarios browser/computer/code con el
 
31
  funciona con llama.cpp / LM Studio / cualquier stack GGUF, **sin necesidad del software
32
  de Daimon** — abajo está el contrato completo de prompts para usarlo standalone.
33
 
34
+ ### 📊 Benchmarks de la comunidad — primero, porque no son nuestros
35
 
36
  <div align="center">
37
+ <img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-r-official-light.png" width="640" alt="benchmarks comunidad daimon r vs base"/>
38
  </div>
39
 
 
 
 
 
 
 
 
 
 
 
 
 
 
40
  ### 🔍 Benchmarks de la comunidad (independientes de nuestro propio bench)
41
 
42
  Además del benchmark de agent-actions de arriba (que es nuestro propio esquema),
 
64
  modelo base; para operar como agente de Daimon, este. Si una dimensión pierde,
65
  se muestra perdiendo — preferimos que la card sea creíble a que sea linda.
66
 
67
+ ### 🎯 Benchmark de la tarea de Daimon (in-house, harness público)
68
+
69
+ Este benchmark lo construimos NOSOTROS (por eso va segundo): mide la tarea
70
+ específica para la que existe este LoRA — elegir la acción JSON correcta como
71
+ agente de navegador/computadora/código de Daimon. Es held-out (vocabulario
72
+ disjunto del entrenamiento), determinístico y el harness es código abierto,
73
+ pero es nuestra propia cancha y corresponde decirlo.
74
+
75
+ <div align="center">
76
+ <img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-r-benchmarks-light.png" width="640" alt="benchmark agente daimon r vs base"/>
77
+ </div>
78
+
79
+ | Métrica (198 casos held-out) | Base Qwen3-4B-Instruct-2507 | **daimon r** | |
80
+ |---|---|---|---|
81
+ | JSON válido / valid JSON | 100.0% | **100.0%** | ➖ empata |
82
+ | Acción correcta / correct action | 75.3% | **100.0%** | ✅ gana |
83
+ | Acción + campos correctos / correct fields | 47.5% | **100.0%** | ✅ gana |
84
+
85
+ *Benchmark objetivo y reproducible: 198 escenarios sintéticos held-out (vocabulario
86
+ disjunto del entrenamiento, cero solapamiento textual), calificados determinísticamente —
87
+ JSON parseable, acción esperada, campos correctos (`ref`/`path`/`command`/…). Sin juez LLM.
88
+ Medido sobre estos GGUF exactos servidos con llama.cpp. Script:
89
+ [`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
90
+ resultados se generan antes de cada publicación.*
91
+
92
  ### 🧠 Con qué se entrenó (por contribución)
93
 
94
  - **Acciones de agente (in-house, sintético)** — escenarios browser/computer/code con el