Diagnostico pedido por el usuario antes de invertir tiempo en recalibrar: mismo checkpoint NVFP4 (256 muestras), mismo contenedor de eval, unica diferencia es remover --speculative-config (servicio vllm-eval-nvfp4-nospec, puerto 8003). Resultado: la regresion persiste casi identica sin speculative-config. Puerta 2: 95.5% (191/200) sin spec vs 94.5% (189/200) con spec vs 98.5% (197/200) de Fase 4 -- diferencia de 1pt entre con/sin spec, dentro de ruido esperado; ambas configuraciones quedan ~3-4pts debajo de Fase 4. Puerta 3: 90% (9/10) sin spec, identico a 90% (9/10) con spec -- mismo caso puntual falla en ambas corridas (aleleba-pr/adherencia), aunque el texto alucinado especifico difiere entre corridas (no determinismo esperable de vLLM con batching dinamico incluso a temperature=0). Conclusion: el speculative decoding (MTP) NO es el causante de la regresion -- persiste identica sin el. El causante es la cuantizacion NVFP4 en si (probablemente calibracion insuficiente de los 256 expertos MoE con solo 256 muestras). Recalibrar con mas muestras, como estaba previsto condicionalmente, es ahora el paso indicado.
86 lines
2.2 KiB
JSON
86 lines
2.2 KiB
JSON
{
|
|
"eval": [
|
|
{
|
|
"skill": "aleleba-pr",
|
|
"kind": "adherencia",
|
|
"prompt": "Termine de arreglar el bug del login, aplica aleleba-pr para subir esto.",
|
|
"passed": false,
|
|
"hits": []
|
|
},
|
|
{
|
|
"skill": "aleleba-pr",
|
|
"kind": "adherencia",
|
|
"prompt": "Aplica aleleba-pr sobre estos cambios, pero NO lo mergees vos.",
|
|
"passed": true,
|
|
"hits": [
|
|
"no",
|
|
"merge"
|
|
]
|
|
},
|
|
{
|
|
"skill": "docmost-context",
|
|
"kind": "adherencia",
|
|
"prompt": "Estamos arrancando una conversacion nueva sobre el proyecto qwen3-6-lora, carga el contexto de Docmost.",
|
|
"passed": true,
|
|
"hits": [
|
|
"docmost"
|
|
]
|
|
},
|
|
{
|
|
"skill": "agent-orchestrator",
|
|
"kind": "adherencia",
|
|
"prompt": "Quiero dejar esto trabajando en background, lanza un agente para migrar la base de datos.",
|
|
"passed": true,
|
|
"hits": [
|
|
"agente"
|
|
]
|
|
},
|
|
{
|
|
"skill": "web-ui-test",
|
|
"kind": "adherencia",
|
|
"prompt": "Prueba la interfaz de login de la web app y sacame capturas del flujo completo.",
|
|
"passed": true,
|
|
"hits": [
|
|
"screenshot",
|
|
"captura"
|
|
]
|
|
},
|
|
{
|
|
"skill": "aleleba-pr",
|
|
"kind": "no_activacion",
|
|
"prompt": "¿Que opinas de usar pull requests chicos en vez de uno grande, en general?",
|
|
"passed": true,
|
|
"tool_calls": []
|
|
},
|
|
{
|
|
"skill": "agent-orchestrator",
|
|
"kind": "no_activacion",
|
|
"prompt": "¿Que significa correr un proceso en background en Linux?",
|
|
"passed": true,
|
|
"tool_calls": []
|
|
},
|
|
{
|
|
"skill": "docmost-context",
|
|
"kind": "no_activacion",
|
|
"prompt": "¿Que es Docmost, para que sirve como herramienta?",
|
|
"passed": true,
|
|
"tool_calls": []
|
|
},
|
|
{
|
|
"skill": "web-ui-test",
|
|
"kind": "no_activacion",
|
|
"prompt": "¿Que es Playwright y en que se diferencia de Selenium?",
|
|
"passed": true,
|
|
"tool_calls": []
|
|
},
|
|
{
|
|
"skill": "spark-ssh",
|
|
"kind": "no_activacion_held_out",
|
|
"prompt": "¿Como se hace una conexion SSH normalmente en Linux?",
|
|
"passed": true,
|
|
"tool_calls": []
|
|
}
|
|
],
|
|
"baseline": null,
|
|
"baseline_disponible": false
|
|
} |