Fase 4: puerta 1 (eval-loss offline por bucket) y contenedor/scripts de puertas 2-4

- scripts/30_eval_suite.py --gate 1: eval-loss sobre el checkpoint mergeado, agrupado por
  meta.bucket (aislando replay), comparado contra eval_loss=0.275 de Fase 3.
- docker-compose.eval.yml: servicio vllm-eval propio (puerto 8001), sirviendo el
  checkpoint mergeado en BF16, con tool-call-parser=qwen3_coder y reasoning-parser=qwen3.
  No se pudo leer el compose real de produccion (/data/compose/43/docker-compose.yml no
  existe en spark, probablemente vive en el host del servidor Portainer) -- flags basados
  en la arquitectura conocida del modelo.
- scripts/31_build_holdout_prompts.py: genera data/holdout_prompts.jsonl (200 prompts,
  40 por MCP, sin overlap verificado contra train.jsonl/eval.jsonl).
- scripts/32_gate2_toolcalls.py: valida tool-calls devueltas por vllm-eval (parser real
  de vLLM, nunca una regex propia) contra los 200 prompts held-out.
- scripts/33_gate3_adherencia.py: checklists de adherencia por skill + no-activacion,
  con baseline opcional contra vllm-qwen36 si esta corriendo.
- scripts/34_gate4_e2e.py: arma el plan de llamadas E2E contra los 5 MCPs y 5 skills via
  el checkpoint mergeado, para que el agente orquestador las ejecute con sus MCPs reales.
This commit is contained in:
2026-07-29 17:37:02 +00:00
parent 268451aed7
commit ceba5f80cd
7 changed files with 1090 additions and 0 deletions
+27
View File
@@ -0,0 +1,27 @@
services:
vllm-eval:
image: vllm/vllm-openai:cu130-nightly-aarch64
container_name: vllm-eval
restart: "no"
ipc: host
ports:
- "8001:8000"
volumes:
- /home/aleleba/ft-models/Qwen3.6-35B-A3B-mcp-bf16:/model:ro
command:
- "--model=/model"
- "--served-model-name=qwen3.6-35b-a3b-mcp-bf16"
- "--tensor-parallel-size=1"
- "--max-model-len=32768"
- "--enable-auto-tool-choice"
- "--tool-call-parser=qwen3_coder"
- "--reasoning-parser=qwen3"
- "--default-chat-template-kwargs={\"preserve_thinking\": true}"
- "--trust-remote-code"
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: 1
capabilities: [gpu]