877d86bc977b69bbc99ecdc92b4ea326c7e85cc0
Clona 1:1 el docker-compose.yml real de produccion de vllm-qwen36 (citado integro en PLAN.md): mismos flags de vLLM incluido --speculative-config (mtp, num_speculative_tokens=1) -- la primera vez que se prueba en este proyecto -- --quantization compressed-tensors, --moe-backend flashinfer_cutlass, --kv-cache-dtype fp8_e4m3, --hf-overrides de rope scaling, parsers de reasoning/tool-call, y el resto de flags identicos. Solo cambia container_name, puerto (8002 vs 8000 de produccion y 8001 del vllm-eval de Fase 4), volumen (checkpoint NVFP4 de Fase 5), --model/--served-model-name, y restart: "no". Nunca toca vllm-qwen36 ni su compose real de Portainer.
Description
No description provided
465 MiB
Languages
Python
92.8%
Jinja
7.2%