Scaffolding inicial del repo: carpetas scripts/, data/schemas/, data/raw/, out/, .gitignore para binarios/checkpoints, y el docker-compose.yml del contenedor de training (imagen NGC pytorch 25.12-py3, GPU reservada, bind mounts a ai-projects vía NFS y a ~/ft-models en disco local rápido de spark) sin tocar jupyter-pyt ni el vllm de producción.
19 lines
536 B
YAML
19 lines
536 B
YAML
services:
|
|
qwen-lora-train:
|
|
image: nvcr.io/nvidia/pytorch:25.12-py3
|
|
container_name: qwen-lora-train
|
|
restart: unless-stopped
|
|
command: ["sleep", "infinity"]
|
|
working_dir: /workspace/ai-projects/qwen3-6-lora
|
|
shm_size: "16gb"
|
|
volumes:
|
|
- /mnt/docker-nas/projects/ai-projects:/workspace/ai-projects
|
|
- /home/aleleba/ft-models:/workspace/ft-models
|
|
deploy:
|
|
resources:
|
|
reservations:
|
|
devices:
|
|
- driver: nvidia
|
|
count: 1
|
|
capabilities: [gpu]
|