lucas-mella commited on
Commit
1d85b8e
·
verified ·
1 Parent(s): 8c035a6

docs: card = arquitectura de 3 piezas (base intacta + LoRA + spores); tabla de perdidas y encuadre fine-tune AFUERA

Browse files
Files changed (1) hide show
  1. README.md +4 -37
README.md CHANGED
@@ -23,7 +23,7 @@ library_name: gguf
23
  ## 🇪🇸 Español
24
 
25
  **daimon r** es el cerebro razonador (4B) de **Daimon**, un asistente personal local-first:
26
- corre en tu máquina, no en la nube. Fine-tune **LoRA** de `Qwen/Qwen3-4B-Instruct-2507` para el núcleo
27
  de Daimon: **acciones de agente (tool-calling JSON), código y conversación en español nativo**.
28
 
29
  **Qué es exactamente**: el modelo base `Qwen/Qwen3-4B-Instruct-2507` (GGUF cuantizado, intacto) + un
@@ -42,42 +42,9 @@ Medido con 3 brazos (base / RAG / spore): uv pasa de 8% → **96%** (supera al R
42
  ⚠️ Importante: los spores NO se aplican sobre este adapter. Se atan a `Qwen/Qwen2.5-Coder-1.5B` (base, no Instruct) — otro modelo del mismo ecosistema; daimon-r sigue siendo el cerebro agéntico.
43
  El dataset incluye un loader autocontenido y los benchmarks congelados para reproducir la tabla.
44
 
45
- ### 📊 Benchmarks de la comunidad — primero, porque no son nuestros
46
-
47
- <div align="center">
48
- <img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-r-official-light.png" width="640" alt="benchmarks comunidad daimon r vs base"/>
49
- </div>
50
-
51
- ### 🔍 Benchmarks de la comunidad (independientes de nuestro propio bench)
52
-
53
- Además del benchmark de agent-actions de arriba (que es nuestro propio esquema),
54
- corrimos Qwen3-4B-Instruct-2507 y este modelo contra benchmarks ESTÁNDAR de la comunidad,
55
- en las mismas condiciones exactas (misma cuantización GGUF, mismo serving,
56
- mismo harness) para que la comparación sea justa:
57
-
58
- | Benchmark | Base Qwen3-4B-Instruct-2507 | **Este modelo** | |
59
- |---|---|---|---|
60
- | HumanEval | 74.4% | **72.0%** | ❌ pierde |
61
- | MBPP | 82.5% | **75.8%** | ❌ pierde |
62
- | MMLU (subset) | 68.4% | **68.4%** | ➖ empata |
63
- | BFCL-lite (tool-calling estandar) | 76.0% | **77.0%** | ✅ gana |
64
-
65
- *HumanEval/MBPP: pass@1 con ejecución real de tests ocultos (no similitud de
66
- texto). MMLU: subset de 15 materias, precisión 0-shot. BFCL-lite: subset AST
67
- del Berkeley Function-Calling Leaderboard v3 (simple/multiple/parallel/
68
- parallel_multiple/irrelevance) — mide tool-calling en un esquema DISTINTO al
69
- nuestro.*
70
-
71
- **El trade-off, explícito**: este LoRA es un **especialista de agente**, no un
72
- fine-tune general-purpose. Los puntos que cede en código/conocimiento general
73
- son el costo deliberado de la ganancia enorme en su tarea núcleo (la tabla de
74
- arriba: de ~47% a ~100% en acciones correctas). Para programar "a mano" usá el
75
- modelo base; para operar como agente de Daimon, este. Si una dimensión pierde,
76
- se muestra perdiendo — preferimos que la card sea creíble a que sea linda.
77
-
78
  ### 🎯 Benchmark de la tarea de Daimon (in-house, harness público)
79
 
80
- Este benchmark lo construimos NOSOTROS (por eso va segundo): mide la tarea
81
  específica para la que existe este LoRA — elegir la acción JSON correcta como
82
  agente de navegador/computadora/código de Daimon. Es held-out (vocabulario
83
  disjunto del entrenamiento), determinístico y el harness es código abierto,
@@ -115,7 +82,7 @@ huggingface-cli download lucas-mella/Daimon-R --local-dir ./daimon
115
  llama-server -m ./daimon/Qwen3-4B-Instruct-2507-Q4_K_M.gguf --lora ./daimon/daimon-r-lora-f16.gguf -c 4096
116
  ```
117
 
118
- Después probá una acción de agente (el núcleo de lo que se entrenó — este es un caso
119
  real del set de evaluación, verificado contra estos pesos exactos antes de publicar):
120
 
121
  ```bash
@@ -197,7 +164,7 @@ lo implementás vos — el modelo es el cerebro que decide la próxima acción.
197
  ## 🇬🇧 English
198
 
199
  **daimon r** is the 4B reasoning brain of **Daimon**, a local-first personal AI assistant.
200
- LoRA fine-tune of `Qwen/Qwen3-4B-Instruct-2507` for Daimon's core: **agent actions (JSON tool-calling),
201
  code, and native-Spanish conversation**. Benchmark table above — measured on these exact
202
  GGUFs, deterministic grading, no LLM judge; losing dimensions are shown losing.
203
 
 
23
  ## 🇪🇸 Español
24
 
25
  **daimon r** es el cerebro razonador (4B) de **Daimon**, un asistente personal local-first:
26
+ corre en tu máquina, no en la nube. Arquitectura de tres piezas: base `Qwen/Qwen3-4B-Instruct-2507` **congelada e intacta** + un LoRA angosto + spores de conocimiento, para el núcleo
27
  de Daimon: **acciones de agente (tool-calling JSON), código y conversación en español nativo**.
28
 
29
  **Qué es exactamente**: el modelo base `Qwen/Qwen3-4B-Instruct-2507` (GGUF cuantizado, intacto) + un
 
42
  ⚠️ Importante: los spores NO se aplican sobre este adapter. Se atan a `Qwen/Qwen2.5-Coder-1.5B` (base, no Instruct) — otro modelo del mismo ecosistema; daimon-r sigue siendo el cerebro agéntico.
43
  El dataset incluye un loader autocontenido y los benchmarks congelados para reproducir la tabla.
44
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
45
  ### 🎯 Benchmark de la tarea de Daimon (in-house, harness público)
46
 
47
+ Este benchmark lo construimos NOSOTROS (nuestro, harness abierto): mide la tarea
48
  específica para la que existe este LoRA — elegir la acción JSON correcta como
49
  agente de navegador/computadora/código de Daimon. Es held-out (vocabulario
50
  disjunto del entrenamiento), determinístico y el harness es código abierto,
 
82
  llama-server -m ./daimon/Qwen3-4B-Instruct-2507-Q4_K_M.gguf --lora ./daimon/daimon-r-lora-f16.gguf -c 4096
83
  ```
84
 
85
+ Después probá una acción de agente (el trabajo del LoRA — este es un caso
86
  real del set de evaluación, verificado contra estos pesos exactos antes de publicar):
87
 
88
  ```bash
 
164
  ## 🇬🇧 English
165
 
166
  **daimon r** is the 4B reasoning brain of **Daimon**, a local-first personal AI assistant.
167
+ Three-piece architecture — frozen `Qwen/Qwen3-4B-Instruct-2507` base + a narrow LoRA + knowledge spores — for Daimon's core: **agent actions (JSON tool-calling),
168
  code, and native-Spanish conversation**. Benchmark table above — measured on these exact
169
  GGUFs, deterministic grading, no LLM judge; losing dimensions are shown losing.
170