docs: card = arquitectura de 3 piezas (base intacta + LoRA + spores); tabla de perdidas y encuadre fine-tune AFUERA
Browse files
README.md
CHANGED
|
@@ -23,7 +23,7 @@ library_name: gguf
|
|
| 23 |
## 🇪🇸 Español
|
| 24 |
|
| 25 |
**daimon r** es el cerebro razonador (4B) de **Daimon**, un asistente personal local-first:
|
| 26 |
-
corre en tu máquina, no en la nube.
|
| 27 |
de Daimon: **acciones de agente (tool-calling JSON), código y conversación en español nativo**.
|
| 28 |
|
| 29 |
**Qué es exactamente**: el modelo base `Qwen/Qwen3-4B-Instruct-2507` (GGUF cuantizado, intacto) + un
|
|
@@ -42,42 +42,9 @@ Medido con 3 brazos (base / RAG / spore): uv pasa de 8% → **96%** (supera al R
|
|
| 42 |
⚠️ Importante: los spores NO se aplican sobre este adapter. Se atan a `Qwen/Qwen2.5-Coder-1.5B` (base, no Instruct) — otro modelo del mismo ecosistema; daimon-r sigue siendo el cerebro agéntico.
|
| 43 |
El dataset incluye un loader autocontenido y los benchmarks congelados para reproducir la tabla.
|
| 44 |
|
| 45 |
-
### 📊 Benchmarks de la comunidad — primero, porque no son nuestros
|
| 46 |
-
|
| 47 |
-
<div align="center">
|
| 48 |
-
<img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-r-official-light.png" width="640" alt="benchmarks comunidad daimon r vs base"/>
|
| 49 |
-
</div>
|
| 50 |
-
|
| 51 |
-
### 🔍 Benchmarks de la comunidad (independientes de nuestro propio bench)
|
| 52 |
-
|
| 53 |
-
Además del benchmark de agent-actions de arriba (que es nuestro propio esquema),
|
| 54 |
-
corrimos Qwen3-4B-Instruct-2507 y este modelo contra benchmarks ESTÁNDAR de la comunidad,
|
| 55 |
-
en las mismas condiciones exactas (misma cuantización GGUF, mismo serving,
|
| 56 |
-
mismo harness) para que la comparación sea justa:
|
| 57 |
-
|
| 58 |
-
| Benchmark | Base Qwen3-4B-Instruct-2507 | **Este modelo** | |
|
| 59 |
-
|---|---|---|---|
|
| 60 |
-
| HumanEval | 74.4% | **72.0%** | ❌ pierde |
|
| 61 |
-
| MBPP | 82.5% | **75.8%** | ❌ pierde |
|
| 62 |
-
| MMLU (subset) | 68.4% | **68.4%** | ➖ empata |
|
| 63 |
-
| BFCL-lite (tool-calling estandar) | 76.0% | **77.0%** | ✅ gana |
|
| 64 |
-
|
| 65 |
-
*HumanEval/MBPP: pass@1 con ejecución real de tests ocultos (no similitud de
|
| 66 |
-
texto). MMLU: subset de 15 materias, precisión 0-shot. BFCL-lite: subset AST
|
| 67 |
-
del Berkeley Function-Calling Leaderboard v3 (simple/multiple/parallel/
|
| 68 |
-
parallel_multiple/irrelevance) — mide tool-calling en un esquema DISTINTO al
|
| 69 |
-
nuestro.*
|
| 70 |
-
|
| 71 |
-
**El trade-off, explícito**: este LoRA es un **especialista de agente**, no un
|
| 72 |
-
fine-tune general-purpose. Los puntos que cede en código/conocimiento general
|
| 73 |
-
son el costo deliberado de la ganancia enorme en su tarea núcleo (la tabla de
|
| 74 |
-
arriba: de ~47% a ~100% en acciones correctas). Para programar "a mano" usá el
|
| 75 |
-
modelo base; para operar como agente de Daimon, este. Si una dimensión pierde,
|
| 76 |
-
se muestra perdiendo — preferimos que la card sea creíble a que sea linda.
|
| 77 |
-
|
| 78 |
### 🎯 Benchmark de la tarea de Daimon (in-house, harness público)
|
| 79 |
|
| 80 |
-
Este benchmark lo construimos NOSOTROS (
|
| 81 |
específica para la que existe este LoRA — elegir la acción JSON correcta como
|
| 82 |
agente de navegador/computadora/código de Daimon. Es held-out (vocabulario
|
| 83 |
disjunto del entrenamiento), determinístico y el harness es código abierto,
|
|
@@ -115,7 +82,7 @@ huggingface-cli download lucas-mella/Daimon-R --local-dir ./daimon
|
|
| 115 |
llama-server -m ./daimon/Qwen3-4B-Instruct-2507-Q4_K_M.gguf --lora ./daimon/daimon-r-lora-f16.gguf -c 4096
|
| 116 |
```
|
| 117 |
|
| 118 |
-
Después probá una acción de agente (el
|
| 119 |
real del set de evaluación, verificado contra estos pesos exactos antes de publicar):
|
| 120 |
|
| 121 |
```bash
|
|
@@ -197,7 +164,7 @@ lo implementás vos — el modelo es el cerebro que decide la próxima acción.
|
|
| 197 |
## 🇬🇧 English
|
| 198 |
|
| 199 |
**daimon r** is the 4B reasoning brain of **Daimon**, a local-first personal AI assistant.
|
| 200 |
-
|
| 201 |
code, and native-Spanish conversation**. Benchmark table above — measured on these exact
|
| 202 |
GGUFs, deterministic grading, no LLM judge; losing dimensions are shown losing.
|
| 203 |
|
|
|
|
| 23 |
## 🇪🇸 Español
|
| 24 |
|
| 25 |
**daimon r** es el cerebro razonador (4B) de **Daimon**, un asistente personal local-first:
|
| 26 |
+
corre en tu máquina, no en la nube. Arquitectura de tres piezas: base `Qwen/Qwen3-4B-Instruct-2507` **congelada e intacta** + un LoRA angosto + spores de conocimiento, para el núcleo
|
| 27 |
de Daimon: **acciones de agente (tool-calling JSON), código y conversación en español nativo**.
|
| 28 |
|
| 29 |
**Qué es exactamente**: el modelo base `Qwen/Qwen3-4B-Instruct-2507` (GGUF cuantizado, intacto) + un
|
|
|
|
| 42 |
⚠️ Importante: los spores NO se aplican sobre este adapter. Se atan a `Qwen/Qwen2.5-Coder-1.5B` (base, no Instruct) — otro modelo del mismo ecosistema; daimon-r sigue siendo el cerebro agéntico.
|
| 43 |
El dataset incluye un loader autocontenido y los benchmarks congelados para reproducir la tabla.
|
| 44 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 45 |
### 🎯 Benchmark de la tarea de Daimon (in-house, harness público)
|
| 46 |
|
| 47 |
+
Este benchmark lo construimos NOSOTROS (nuestro, harness abierto): mide la tarea
|
| 48 |
específica para la que existe este LoRA — elegir la acción JSON correcta como
|
| 49 |
agente de navegador/computadora/código de Daimon. Es held-out (vocabulario
|
| 50 |
disjunto del entrenamiento), determinístico y el harness es código abierto,
|
|
|
|
| 82 |
llama-server -m ./daimon/Qwen3-4B-Instruct-2507-Q4_K_M.gguf --lora ./daimon/daimon-r-lora-f16.gguf -c 4096
|
| 83 |
```
|
| 84 |
|
| 85 |
+
Después probá una acción de agente (el trabajo del LoRA — este es un caso
|
| 86 |
real del set de evaluación, verificado contra estos pesos exactos antes de publicar):
|
| 87 |
|
| 88 |
```bash
|
|
|
|
| 164 |
## 🇬🇧 English
|
| 165 |
|
| 166 |
**daimon r** is the 4B reasoning brain of **Daimon**, a local-first personal AI assistant.
|
| 167 |
+
Three-piece architecture — frozen `Qwen/Qwen3-4B-Instruct-2507` base + a narrow LoRA + knowledge spores — for Daimon's core: **agent actions (JSON tool-calling),
|
| 168 |
code, and native-Spanish conversation**. Benchmark table above — measured on these exact
|
| 169 |
GGUFs, deterministic grading, no LLM judge; losing dimensions are shown losing.
|
| 170 |
|