services: vllm-rocm: image: vllm/vllm-openai-rocm:latest container_name: vllm-rocm restart: unless-stopped # init:true gibt dem Container ein Init-System, das haengende Kindprozesse # ordentlich einsammelt -> kein unkillbarer Zombie mehr beim naechsten Freeze, # der Container bleibt per 'docker stop' beendbar. init: true environment: - ROCM_VIS_DEVICES=0 # Falls vLLM ueber die Architektur meckert, einkommentieren: # - HSA_OVERRIDE_GFX_VERSION=11.0.0 devices: - /dev/kfd:/dev/kfd - /dev/dri:/dev/dri volumes: - ~/.cache/huggingface:/root/.cache/huggingface ports: - "8000:8000" ipc: host # --- Stabilitaets-Parameter gegen den Gemma-4-Prefill-Deadlock (vLLM #39914) --- command: - --model - google/gemma-4-12b-it - --kv-cache-dtype - fp8 - --max-model-len - "16384" - --gpu-memory-utilization - "0.90" - --limit-mm-per-prompt - '{"image": 2, "audio": 0}' - --max-num-seqs - "4" - --max-num-batched-tokens - "2048" - --enable-chunked-prefill