lucas-mella commited on
Commit
d5103c9
·
verified ·
1 Parent(s): 64609a0

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +7 -7
README.md CHANGED
@@ -35,8 +35,8 @@ de Daimon: **acciones de agente (tool-calling JSON), código y conversación en
35
  | Métrica (198 casos held-out) | Base Qwen3-4B-Instruct-2507 | **daimon r** | |
36
  |---|---|---|---|
37
  | JSON válido / valid JSON | 100.0% | **100.0%** | ➖ empata |
38
- | Acción correcta / correct action | 75.3% | **94.9%** | ✅ gana |
39
- | Acción + campos correctos / correct fields | 47.5% | **94.9%** | ✅ gana |
40
 
41
  *Benchmark objetivo y reproducible: 198 escenarios sintéticos held-out (vocabulario
42
  disjunto del entrenamiento, cero solapamiento textual), calificados determinísticamente —
@@ -54,10 +54,10 @@ mismo harness) para que la comparación sea justa:
54
 
55
  | Benchmark | Base Qwen3-4B-Instruct-2507 | **Este modelo** | |
56
  |---|---|---|---|
57
- | HumanEval | 74.4% | **72.6%** | ❌ pierde |
58
- | MBPP | 82.5% | **75.0%** | ❌ pierde |
59
- | MMLU (subset) | 68.4% | **68.4%** | empata |
60
- | BFCL-lite (tool-calling estandar) | 76.0% | **76.5%** | ✅ gana |
61
 
62
  *HumanEval/MBPP: pass@1 con ejecución real de tests ocultos (no similitud de
63
  texto). MMLU: subset de 15 materias, precisión 0-shot. BFCL-lite: subset AST
@@ -113,7 +113,7 @@ curl -s http://127.0.0.1:8080/v1/chat/completions -H "Content-Type: application/
113
  Respuesta esperada (un único objeto JSON, sin prosa alrededor):
114
  `{"thought": "…", "action": "fill", "ref": 1, "text": "gatos"}`
115
 
116
- SHA-256 del LoRA publicado: `77fd6ad400b691ea391d70a7f9c0ddfb50ace1f882b9dac7f4b01b11e5fb7ae6`.
117
 
118
  ---
119
 
 
35
  | Métrica (198 casos held-out) | Base Qwen3-4B-Instruct-2507 | **daimon r** | |
36
  |---|---|---|---|
37
  | JSON válido / valid JSON | 100.0% | **100.0%** | ➖ empata |
38
+ | Acción correcta / correct action | 75.3% | **100.0%** | ✅ gana |
39
+ | Acción + campos correctos / correct fields | 47.5% | **100.0%** | ✅ gana |
40
 
41
  *Benchmark objetivo y reproducible: 198 escenarios sintéticos held-out (vocabulario
42
  disjunto del entrenamiento, cero solapamiento textual), calificados determinísticamente —
 
54
 
55
  | Benchmark | Base Qwen3-4B-Instruct-2507 | **Este modelo** | |
56
  |---|---|---|---|
57
+ | HumanEval | 74.4% | **72.0%** | ❌ pierde |
58
+ | MBPP | 82.5% | **75.8%** | ❌ pierde |
59
+ | MMLU (subset) | 68.4% | **67.2%** | pierde |
60
+ | BFCL-lite (tool-calling estandar) | 76.0% | **77.0%** | ✅ gana |
61
 
62
  *HumanEval/MBPP: pass@1 con ejecución real de tests ocultos (no similitud de
63
  texto). MMLU: subset de 15 materias, precisión 0-shot. BFCL-lite: subset AST
 
113
  Respuesta esperada (un único objeto JSON, sin prosa alrededor):
114
  `{"thought": "…", "action": "fill", "ref": 1, "text": "gatos"}`
115
 
116
+ SHA-256 del LoRA publicado: `ee6ad40ac3e2c6019a4526b0f0ce6c423b16a32a875315b24008e6c789149f06`.
117
 
118
  ---
119