77e6804a4f02e019c455e720661f22ee97cb713b
Mejoras permanentes al test, no solo para esta corrida: 1. max_tokens: 512 -> 2048 (configurable via GATE3_MAX_TOKENS). Con --reasoning-parser activo, un modelo de razonamiento puede agotar 512 tokens pensando antes de emitir el contenido final -- la respuesta queda cortada a mitad de razonamiento y check_adherencia() no encuentra ninguna substring esperada, un FAIL por presupuesto de tokens agotado, no por adherencia real. El caso que fallaba en las corridas NVFP4 de Fase 5 (aleleba-pr/adherencia, el prompt mas abierto de los tres) es sospechoso de este defecto -- el JSON de resultados no guardaba el texto de la respuesta, asi que no se podia auditar. 2. Guardar content+reasoning completos en cada fila del JSON de resultados (antes solo se guardaba passed/hits/tool_calls). Permite auditar con criterio humano cualquier fallo futuro sin tener que re-correr el test.
Description
No description provided
465 MiB
Languages
Python
92.8%
Jinja
7.2%