39 lines
1.1 KiB
YAML
39 lines
1.1 KiB
YAML
services:
|
|
vllm-rocm:
|
|
image: vllm/vllm-openai-rocm:latest
|
|
container_name: vllm-rocm
|
|
restart: unless-stopped
|
|
# init:true gibt dem Container ein Init-System, das haengende Kindprozesse
|
|
# ordentlich einsammelt -> kein unkillbarer Zombie mehr beim naechsten Freeze,
|
|
# der Container bleibt per 'docker stop' beendbar.
|
|
init: true
|
|
environment:
|
|
- ROCM_VIS_DEVICES=0
|
|
# Falls vLLM ueber die Architektur meckert, einkommentieren:
|
|
# - HSA_OVERRIDE_GFX_VERSION=11.0.0
|
|
devices:
|
|
- /dev/kfd:/dev/kfd
|
|
- /dev/dri:/dev/dri
|
|
volumes:
|
|
- ~/.cache/huggingface:/root/.cache/huggingface
|
|
ports:
|
|
- "8000:8000"
|
|
ipc: host
|
|
# --- Stabilitaets-Parameter gegen den Gemma-4-Prefill-Deadlock (vLLM #39914) ---
|
|
command:
|
|
- --model
|
|
- google/gemma-4-12b-it
|
|
- --kv-cache-dtype
|
|
- fp8
|
|
- --max-model-len
|
|
- "16384"
|
|
- --gpu-memory-utilization
|
|
- "0.90"
|
|
- --limit-mm-per-prompt
|
|
- '{"image": 2, "audio": 0}'
|
|
- --max-num-seqs
|
|
- "4"
|
|
- --max-num-batched-tokens
|
|
- "2048"
|
|
- --enable-chunked-prefill
|