services: vllm-eval: image: vllm/vllm-openai:cu130-nightly-aarch64 container_name: vllm-eval restart: "no" ipc: host ports: - "8001:8000" volumes: - /home/aleleba/ft-models/Qwen3.6-35B-A3B-mcp-bf16:/model:ro command: - "--model=/model" - "--served-model-name=qwen3.6-35b-a3b-mcp-bf16" - "--tensor-parallel-size=1" - "--max-model-len=32768" - "--enable-auto-tool-choice" - "--tool-call-parser=qwen3_coder" - "--reasoning-parser=qwen3" - "--default-chat-template-kwargs={\"preserve_thinking\": true}" - "--trust-remote-code" deploy: resources: reservations: devices: - driver: nvidia count: 1 capabilities: [gpu]