Fase 5: puertas 2-3 sobre el checkpoint NVFP4 con calibracion mezclada
Checkpoint cuantizado con calibracion mezclada (256 propias + 256 ultrachat_200k, fix de dos fases), contenedor de eval propio CON --speculative-config real (levanto healthy, MTP compartiendo embeddings/ lm_head con el modelo target, confirmado en logs). Puerta 2: 95.0% validos (190/200) vs 94.5% (189/200) solo-propia vs 98.5% (197/200) Fase 4 -- mejora marginal de +0.5pt sobre solo-propia, sigue ~3.5pts debajo de Fase 4. Persiste el mismo caso de nombre de tool alucinado (getJiraProjectIssueTypes, no existe) visto en el intento solo-propia. Puerta 3: 90.0% (9/10), IDENTICO a solo-propia -- mismo caso exacto falla (aleleba-pr/adherencia). La diversidad de ultrachat NO corrigio esta regresion especifica. Conclusion: la hipotesis de diversidad tematica en la calibracion no resuelve la regresion observada. El checkpoint mezclado queda como una alternativa equivalente (no mejor, no peor de forma significativa) al de solo-datos-propios.
This commit is contained in:
File diff suppressed because it is too large
Load Diff
@@ -0,0 +1,85 @@
|
||||
{
|
||||
"eval": [
|
||||
{
|
||||
"skill": "aleleba-pr",
|
||||
"kind": "adherencia",
|
||||
"prompt": "Termine de arreglar el bug del login, aplica aleleba-pr para subir esto.",
|
||||
"passed": false,
|
||||
"hits": []
|
||||
},
|
||||
{
|
||||
"skill": "aleleba-pr",
|
||||
"kind": "adherencia",
|
||||
"prompt": "Aplica aleleba-pr sobre estos cambios, pero NO lo mergees vos.",
|
||||
"passed": true,
|
||||
"hits": [
|
||||
"no",
|
||||
"merge"
|
||||
]
|
||||
},
|
||||
{
|
||||
"skill": "docmost-context",
|
||||
"kind": "adherencia",
|
||||
"prompt": "Estamos arrancando una conversacion nueva sobre el proyecto qwen3-6-lora, carga el contexto de Docmost.",
|
||||
"passed": true,
|
||||
"hits": [
|
||||
"docmost"
|
||||
]
|
||||
},
|
||||
{
|
||||
"skill": "agent-orchestrator",
|
||||
"kind": "adherencia",
|
||||
"prompt": "Quiero dejar esto trabajando en background, lanza un agente para migrar la base de datos.",
|
||||
"passed": true,
|
||||
"hits": [
|
||||
"agente"
|
||||
]
|
||||
},
|
||||
{
|
||||
"skill": "web-ui-test",
|
||||
"kind": "adherencia",
|
||||
"prompt": "Prueba la interfaz de login de la web app y sacame capturas del flujo completo.",
|
||||
"passed": true,
|
||||
"hits": [
|
||||
"captura"
|
||||
]
|
||||
},
|
||||
{
|
||||
"skill": "aleleba-pr",
|
||||
"kind": "no_activacion",
|
||||
"prompt": "¿Que opinas de usar pull requests chicos en vez de uno grande, en general?",
|
||||
"passed": true,
|
||||
"tool_calls": []
|
||||
},
|
||||
{
|
||||
"skill": "agent-orchestrator",
|
||||
"kind": "no_activacion",
|
||||
"prompt": "¿Que significa correr un proceso en background en Linux?",
|
||||
"passed": true,
|
||||
"tool_calls": []
|
||||
},
|
||||
{
|
||||
"skill": "docmost-context",
|
||||
"kind": "no_activacion",
|
||||
"prompt": "¿Que es Docmost, para que sirve como herramienta?",
|
||||
"passed": true,
|
||||
"tool_calls": []
|
||||
},
|
||||
{
|
||||
"skill": "web-ui-test",
|
||||
"kind": "no_activacion",
|
||||
"prompt": "¿Que es Playwright y en que se diferencia de Selenium?",
|
||||
"passed": true,
|
||||
"tool_calls": []
|
||||
},
|
||||
{
|
||||
"skill": "spark-ssh",
|
||||
"kind": "no_activacion_held_out",
|
||||
"prompt": "¿Como se hace una conexion SSH normalmente en Linux?",
|
||||
"passed": true,
|
||||
"tool_calls": []
|
||||
}
|
||||
],
|
||||
"baseline": null,
|
||||
"baseline_disponible": false
|
||||
}
|
||||
Reference in New Issue
Block a user