Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -31,25 +31,12 @@ de Daimon: **acciones de agente (tool-calling JSON), código y conversación en
|
|
| 31 |
funciona con llama.cpp / LM Studio / cualquier stack GGUF, **sin necesidad del software
|
| 32 |
de Daimon** — abajo está el contrato completo de prompts para usarlo standalone.
|
| 33 |
|
| 34 |
-
### 📊
|
| 35 |
|
| 36 |
<div align="center">
|
| 37 |
-
<img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-r-
|
| 38 |
</div>
|
| 39 |
|
| 40 |
-
| Métrica (198 casos held-out) | Base Qwen3-4B-Instruct-2507 | **daimon r** | |
|
| 41 |
-
|---|---|---|---|
|
| 42 |
-
| JSON válido / valid JSON | 100.0% | **100.0%** | ➖ empata |
|
| 43 |
-
| Acción correcta / correct action | 75.3% | **100.0%** | ✅ gana |
|
| 44 |
-
| Acción + campos correctos / correct fields | 47.5% | **100.0%** | ✅ gana |
|
| 45 |
-
|
| 46 |
-
*Benchmark objetivo y reproducible: 198 escenarios sintéticos held-out (vocabulario
|
| 47 |
-
disjunto del entrenamiento, cero solapamiento textual), calificados determinísticamente —
|
| 48 |
-
JSON parseable, acción esperada, campos correctos (`ref`/`path`/`command`/…). Sin juez LLM.
|
| 49 |
-
Medido sobre estos GGUF exactos servidos con llama.cpp. Script:
|
| 50 |
-
[`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
|
| 51 |
-
resultados se generan antes de cada publicación.*
|
| 52 |
-
|
| 53 |
### 🔍 Benchmarks de la comunidad (independientes de nuestro propio bench)
|
| 54 |
|
| 55 |
Además del benchmark de agent-actions de arriba (que es nuestro propio esquema),
|
|
@@ -77,6 +64,31 @@ arriba: de ~47% a ~100% en acciones correctas). Para programar "a mano" usá el
|
|
| 77 |
modelo base; para operar como agente de Daimon, este. Si una dimensión pierde,
|
| 78 |
se muestra perdiendo — preferimos que la card sea creíble a que sea linda.
|
| 79 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 80 |
### 🧠 Con qué se entrenó (por contribución)
|
| 81 |
|
| 82 |
- **Acciones de agente (in-house, sintético)** — escenarios browser/computer/code con el
|
|
|
|
| 31 |
funciona con llama.cpp / LM Studio / cualquier stack GGUF, **sin necesidad del software
|
| 32 |
de Daimon** — abajo está el contrato completo de prompts para usarlo standalone.
|
| 33 |
|
| 34 |
+
### 📊 Benchmarks de la comunidad — primero, porque no son nuestros
|
| 35 |
|
| 36 |
<div align="center">
|
| 37 |
+
<img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-r-official-light.png" width="640" alt="benchmarks comunidad daimon r vs base"/>
|
| 38 |
</div>
|
| 39 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 40 |
### 🔍 Benchmarks de la comunidad (independientes de nuestro propio bench)
|
| 41 |
|
| 42 |
Además del benchmark de agent-actions de arriba (que es nuestro propio esquema),
|
|
|
|
| 64 |
modelo base; para operar como agente de Daimon, este. Si una dimensión pierde,
|
| 65 |
se muestra perdiendo — preferimos que la card sea creíble a que sea linda.
|
| 66 |
|
| 67 |
+
### 🎯 Benchmark de la tarea de Daimon (in-house, harness público)
|
| 68 |
+
|
| 69 |
+
Este benchmark lo construimos NOSOTROS (por eso va segundo): mide la tarea
|
| 70 |
+
específica para la que existe este LoRA — elegir la acción JSON correcta como
|
| 71 |
+
agente de navegador/computadora/código de Daimon. Es held-out (vocabulario
|
| 72 |
+
disjunto del entrenamiento), determinístico y el harness es código abierto,
|
| 73 |
+
pero es nuestra propia cancha y corresponde decirlo.
|
| 74 |
+
|
| 75 |
+
<div align="center">
|
| 76 |
+
<img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-r-benchmarks-light.png" width="640" alt="benchmark agente daimon r vs base"/>
|
| 77 |
+
</div>
|
| 78 |
+
|
| 79 |
+
| Métrica (198 casos held-out) | Base Qwen3-4B-Instruct-2507 | **daimon r** | |
|
| 80 |
+
|---|---|---|---|
|
| 81 |
+
| JSON válido / valid JSON | 100.0% | **100.0%** | ➖ empata |
|
| 82 |
+
| Acción correcta / correct action | 75.3% | **100.0%** | ✅ gana |
|
| 83 |
+
| Acción + campos correctos / correct fields | 47.5% | **100.0%** | ✅ gana |
|
| 84 |
+
|
| 85 |
+
*Benchmark objetivo y reproducible: 198 escenarios sintéticos held-out (vocabulario
|
| 86 |
+
disjunto del entrenamiento, cero solapamiento textual), calificados determinísticamente —
|
| 87 |
+
JSON parseable, acción esperada, campos correctos (`ref`/`path`/`command`/…). Sin juez LLM.
|
| 88 |
+
Medido sobre estos GGUF exactos servidos con llama.cpp. Script:
|
| 89 |
+
[`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
|
| 90 |
+
resultados se generan antes de cada publicación.*
|
| 91 |
+
|
| 92 |
### 🧠 Con qué se entrenó (por contribución)
|
| 93 |
|
| 94 |
- **Acciones de agente (in-house, sintético)** — escenarios browser/computer/code con el
|