Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -35,8 +35,8 @@ de Daimon: **acciones de agente (tool-calling JSON), código y conversación en
|
|
| 35 |
| Métrica (198 casos held-out) | Base Qwen3-4B-Instruct-2507 | **daimon r** | |
|
| 36 |
|---|---|---|---|
|
| 37 |
| JSON válido / valid JSON | 100.0% | **100.0%** | ➖ empata |
|
| 38 |
-
| Acción correcta / correct action | 75.3% | **
|
| 39 |
-
| Acción + campos correctos / correct fields | 47.5% | **
|
| 40 |
|
| 41 |
*Benchmark objetivo y reproducible: 198 escenarios sintéticos held-out (vocabulario
|
| 42 |
disjunto del entrenamiento, cero solapamiento textual), calificados determinísticamente —
|
|
@@ -54,10 +54,10 @@ mismo harness) para que la comparación sea justa:
|
|
| 54 |
|
| 55 |
| Benchmark | Base Qwen3-4B-Instruct-2507 | **Este modelo** | |
|
| 56 |
|---|---|---|---|
|
| 57 |
-
| HumanEval | 74.4% | **72.
|
| 58 |
-
| MBPP | 82.5% | **75.
|
| 59 |
-
| MMLU (subset) | 68.4% | **
|
| 60 |
-
| BFCL-lite (tool-calling estandar) | 76.0% | **
|
| 61 |
|
| 62 |
*HumanEval/MBPP: pass@1 con ejecución real de tests ocultos (no similitud de
|
| 63 |
texto). MMLU: subset de 15 materias, precisión 0-shot. BFCL-lite: subset AST
|
|
@@ -113,7 +113,7 @@ curl -s http://127.0.0.1:8080/v1/chat/completions -H "Content-Type: application/
|
|
| 113 |
Respuesta esperada (un único objeto JSON, sin prosa alrededor):
|
| 114 |
`{"thought": "…", "action": "fill", "ref": 1, "text": "gatos"}`
|
| 115 |
|
| 116 |
-
SHA-256 del LoRA publicado: `
|
| 117 |
|
| 118 |
---
|
| 119 |
|
|
|
|
| 35 |
| Métrica (198 casos held-out) | Base Qwen3-4B-Instruct-2507 | **daimon r** | |
|
| 36 |
|---|---|---|---|
|
| 37 |
| JSON válido / valid JSON | 100.0% | **100.0%** | ➖ empata |
|
| 38 |
+
| Acción correcta / correct action | 75.3% | **100.0%** | ✅ gana |
|
| 39 |
+
| Acción + campos correctos / correct fields | 47.5% | **100.0%** | ✅ gana |
|
| 40 |
|
| 41 |
*Benchmark objetivo y reproducible: 198 escenarios sintéticos held-out (vocabulario
|
| 42 |
disjunto del entrenamiento, cero solapamiento textual), calificados determinísticamente —
|
|
|
|
| 54 |
|
| 55 |
| Benchmark | Base Qwen3-4B-Instruct-2507 | **Este modelo** | |
|
| 56 |
|---|---|---|---|
|
| 57 |
+
| HumanEval | 74.4% | **72.0%** | ❌ pierde |
|
| 58 |
+
| MBPP | 82.5% | **75.8%** | ❌ pierde |
|
| 59 |
+
| MMLU (subset) | 68.4% | **67.2%** | ❌ pierde |
|
| 60 |
+
| BFCL-lite (tool-calling estandar) | 76.0% | **77.0%** | ✅ gana |
|
| 61 |
|
| 62 |
*HumanEval/MBPP: pass@1 con ejecución real de tests ocultos (no similitud de
|
| 63 |
texto). MMLU: subset de 15 materias, precisión 0-shot. BFCL-lite: subset AST
|
|
|
|
| 113 |
Respuesta esperada (un único objeto JSON, sin prosa alrededor):
|
| 114 |
`{"thought": "…", "action": "fill", "ref": 1, "text": "gatos"}`
|
| 115 |
|
| 116 |
+
SHA-256 del LoRA publicado: `ee6ad40ac3e2c6019a4526b0f0ce6c423b16a32a875315b24008e6c789149f06`.
|
| 117 |
|
| 118 |
---
|
| 119 |
|