Puerta 2 (tool-calls, 200 prompts held-out, parser real qwen3_coder de vLLM): 197/200 validos (98.5%). Los 3 invalidos son casos donde el prompt referencia un recurso por nombre (space/repo) sin ID real -- el modelo elige la tool correcta pero omite un campo requerido (spaceId/repo) que no puede conocer en un turno unico sin una llamada previa de lookup; no es un fallo de sintaxis del parser. Puerta 3 (adherencia por skill + no-activacion, 10 items sobre las 5 skills reales): 100% de aprobacion. vllm-qwen36 no estaba corriendo -- baseline de produccion documentado como pendiente, no bloqueante. Puerta 4 (E2E real contra los 5 MCPs, ejecutado por el agente orquestador con sus propios MCPs conectados): 5/5 exitosos. El unico caso que requirio una segunda llamada fue atlassian (el modelo adivino un cloudId plausible que no era el real -- se corrigio con getAccessibleAtlassianResources y la llamada tuvo exito, comportamiento esperado en un flujo multi-turno).
88 lines
2.2 KiB
JSON
88 lines
2.2 KiB
JSON
{
|
|
"eval": [
|
|
{
|
|
"skill": "aleleba-pr",
|
|
"kind": "adherencia",
|
|
"prompt": "Termine de arreglar el bug del login, aplica aleleba-pr para subir esto.",
|
|
"passed": true,
|
|
"hits": [
|
|
"commit"
|
|
]
|
|
},
|
|
{
|
|
"skill": "aleleba-pr",
|
|
"kind": "adherencia",
|
|
"prompt": "Aplica aleleba-pr sobre estos cambios, pero NO lo mergees vos.",
|
|
"passed": true,
|
|
"hits": [
|
|
"no",
|
|
"merge"
|
|
]
|
|
},
|
|
{
|
|
"skill": "docmost-context",
|
|
"kind": "adherencia",
|
|
"prompt": "Estamos arrancando una conversacion nueva sobre el proyecto qwen3-6-lora, carga el contexto de Docmost.",
|
|
"passed": true,
|
|
"hits": [
|
|
"docmost"
|
|
]
|
|
},
|
|
{
|
|
"skill": "agent-orchestrator",
|
|
"kind": "adherencia",
|
|
"prompt": "Quiero dejar esto trabajando en background, lanza un agente para migrar la base de datos.",
|
|
"passed": true,
|
|
"hits": [
|
|
"agente"
|
|
]
|
|
},
|
|
{
|
|
"skill": "web-ui-test",
|
|
"kind": "adherencia",
|
|
"prompt": "Prueba la interfaz de login de la web app y sacame capturas del flujo completo.",
|
|
"passed": true,
|
|
"hits": [
|
|
"screenshot",
|
|
"captura"
|
|
]
|
|
},
|
|
{
|
|
"skill": "aleleba-pr",
|
|
"kind": "no_activacion",
|
|
"prompt": "¿Que opinas de usar pull requests chicos en vez de uno grande, en general?",
|
|
"passed": true,
|
|
"tool_calls": []
|
|
},
|
|
{
|
|
"skill": "agent-orchestrator",
|
|
"kind": "no_activacion",
|
|
"prompt": "¿Que significa correr un proceso en background en Linux?",
|
|
"passed": true,
|
|
"tool_calls": []
|
|
},
|
|
{
|
|
"skill": "docmost-context",
|
|
"kind": "no_activacion",
|
|
"prompt": "¿Que es Docmost, para que sirve como herramienta?",
|
|
"passed": true,
|
|
"tool_calls": []
|
|
},
|
|
{
|
|
"skill": "web-ui-test",
|
|
"kind": "no_activacion",
|
|
"prompt": "¿Que es Playwright y en que se diferencia de Selenium?",
|
|
"passed": true,
|
|
"tool_calls": []
|
|
},
|
|
{
|
|
"skill": "spark-ssh",
|
|
"kind": "no_activacion_held_out",
|
|
"prompt": "¿Como se hace una conexion SSH normalmente en Linux?",
|
|
"passed": true,
|
|
"tool_calls": []
|
|
}
|
|
],
|
|
"baseline": null,
|
|
"baseline_disponible": false
|
|
} |