This commit is contained in:
2026-07-10 12:46:25 -05:00
parent 5650b7b3fa
commit 6881d932b8

View File

@@ -1,38 +1,47 @@
# llama.cpp + Gemma-4-12B (Vision) auf CUDA (AWS G7e / RTX PRO 6000).
#
# Bewusst SCHLANK gehalten: keine ROCm/Vulkan-Workarounds. Wir testen, ob
# CUDA die Instabilitaeten von vornherein vermeidet. Nur die inhaltlich noetigen
# Flags (--reasoning off gegen leeres content) bleiben.
#
# Voraussetzung: DLAMI mit NVIDIA Container Toolkit (docker --gpus all funktioniert).
#
# Start: docker compose -f docker-compose-cuda.yml up -d
# Logs: docker compose -f docker-compose-cuda.yml logs -f
services: services:
vllm-rocm: llamacpp-gemma12b:
image: vllm/vllm-openai-rocm:latest image: ghcr.io/ggml-org/llama.cpp:server-cuda
container_name: vllm-rocm container_name: llamacpp-gemma12b
restart: unless-stopped restart: unless-stopped
# init:true gibt dem Container ein Init-System, das haengende Kindprozesse
# ordentlich einsammelt -> kein unkillbarer Zombie mehr beim naechsten Freeze,
# der Container bleibt per 'docker stop' beendbar.
init: true init: true
environment: # GPU-Zugriff ueber das NVIDIA Container Toolkit
- ROCM_VIS_DEVICES=0 deploy:
# Falls vLLM ueber die Architektur meckert, einkommentieren: resources:
# - HSA_OVERRIDE_GFX_VERSION=11.0.0 reservations:
devices: devices:
- /dev/kfd:/dev/kfd - driver: nvidia
- /dev/dri:/dev/dri count: 1
volumes: capabilities: [gpu]
- ~/.cache/huggingface:/root/.cache/huggingface
ports: ports:
- "8000:8000" - "8000:8080"
ipc: host volumes:
# --- Stabilitaets-Parameter gegen den Gemma-4-Prefill-Deadlock (vLLM #39914) --- - ~/.cache/llama.cpp:/root/.cache/llama.cpp
command: command:
- --model - -hf
- google/gemma-4-12b-it - unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL
- --kv-cache-dtype - --host
- fp8 - 0.0.0.0
- --max-model-len - --port
- "8080"
- -ngl
- "99"
- --ctx-size
- "16384" - "16384"
- --gpu-memory-utilization - --parallel
- "0.90" - "1"
- --limit-mm-per-prompt - --jinja
- '{"image": 2, "audio": 0}' - --reasoning
- --max-num-seqs - "off"
- "4" - --alias
- --max-num-batched-tokens - gemma-4-12b
- "2048"
- --enable-chunked-prefill