cuda
This commit is contained in:
@@ -1,38 +1,47 @@
|
||||
# llama.cpp + Gemma-4-12B (Vision) auf CUDA (AWS G7e / RTX PRO 6000).
|
||||
#
|
||||
# Bewusst SCHLANK gehalten: keine ROCm/Vulkan-Workarounds. Wir testen, ob
|
||||
# CUDA die Instabilitaeten von vornherein vermeidet. Nur die inhaltlich noetigen
|
||||
# Flags (--reasoning off gegen leeres content) bleiben.
|
||||
#
|
||||
# Voraussetzung: DLAMI mit NVIDIA Container Toolkit (docker --gpus all funktioniert).
|
||||
#
|
||||
# Start: docker compose -f docker-compose-cuda.yml up -d
|
||||
# Logs: docker compose -f docker-compose-cuda.yml logs -f
|
||||
|
||||
services:
|
||||
vllm-rocm:
|
||||
image: vllm/vllm-openai-rocm:latest
|
||||
container_name: vllm-rocm
|
||||
llamacpp-gemma12b:
|
||||
image: ghcr.io/ggml-org/llama.cpp:server-cuda
|
||||
container_name: llamacpp-gemma12b
|
||||
restart: unless-stopped
|
||||
# init:true gibt dem Container ein Init-System, das haengende Kindprozesse
|
||||
# ordentlich einsammelt -> kein unkillbarer Zombie mehr beim naechsten Freeze,
|
||||
# der Container bleibt per 'docker stop' beendbar.
|
||||
init: true
|
||||
environment:
|
||||
- ROCM_VIS_DEVICES=0
|
||||
# Falls vLLM ueber die Architektur meckert, einkommentieren:
|
||||
# - HSA_OVERRIDE_GFX_VERSION=11.0.0
|
||||
devices:
|
||||
- /dev/kfd:/dev/kfd
|
||||
- /dev/dri:/dev/dri
|
||||
volumes:
|
||||
- ~/.cache/huggingface:/root/.cache/huggingface
|
||||
# GPU-Zugriff ueber das NVIDIA Container Toolkit
|
||||
deploy:
|
||||
resources:
|
||||
reservations:
|
||||
devices:
|
||||
- driver: nvidia
|
||||
count: 1
|
||||
capabilities: [gpu]
|
||||
ports:
|
||||
- "8000:8000"
|
||||
ipc: host
|
||||
# --- Stabilitaets-Parameter gegen den Gemma-4-Prefill-Deadlock (vLLM #39914) ---
|
||||
- "8000:8080"
|
||||
volumes:
|
||||
- ~/.cache/llama.cpp:/root/.cache/llama.cpp
|
||||
command:
|
||||
- --model
|
||||
- google/gemma-4-12b-it
|
||||
- --kv-cache-dtype
|
||||
- fp8
|
||||
- --max-model-len
|
||||
- -hf
|
||||
- unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL
|
||||
- --host
|
||||
- 0.0.0.0
|
||||
- --port
|
||||
- "8080"
|
||||
- -ngl
|
||||
- "99"
|
||||
- --ctx-size
|
||||
- "16384"
|
||||
- --gpu-memory-utilization
|
||||
- "0.90"
|
||||
- --limit-mm-per-prompt
|
||||
- '{"image": 2, "audio": 0}'
|
||||
- --max-num-seqs
|
||||
- "4"
|
||||
- --max-num-batched-tokens
|
||||
- "2048"
|
||||
- --enable-chunked-prefill
|
||||
- --parallel
|
||||
- "1"
|
||||
- --jinja
|
||||
- --reasoning
|
||||
- "off"
|
||||
- --alias
|
||||
- gemma-4-12b
|
||||
Reference in New Issue
Block a user