This commit is contained in:
2026-07-09 18:07:52 -05:00
parent 8434c09a55
commit 158d2a16e5
2 changed files with 85 additions and 0 deletions

View File

@@ -0,0 +1,47 @@
# llama.cpp + Gemma-4-12B (Vision) fuer die Buyer-Sheet-Extraktion.
# Basiert auf dem bewaehrten Qwen-Run (gleiche ROCm-Flags), erweitert um
# Vision (mmproj laedt -hf automatisch) und --reasoning off (sonst leeres content).
#
# Start: docker compose -f docker-compose-llama-gemma12b.yml up -d
# Logs: docker compose -f docker-compose-llama-gemma12b.yml logs -f
# Stop: docker compose -f docker-compose-llama-gemma12b.yml down
services:
llamacpp-gemma12b:
image: ghcr.io/ggml-org/llama.cpp:server-rocm
container_name: llamacpp-gemma12b
restart: unless-stopped
# init:true -> haengende Prozesse werden ordentlich eingesammelt (kein Zombie)
init: true
devices:
- /dev/kfd:/dev/kfd
- /dev/dri:/dev/dri
group_add:
- video
security_opt:
- seccomp=unconfined
ipc: host
ports:
# Achtung: Qwen laeuft schon auf 8080. Gemma bekommt 8000, damit beide
# parallel laufen koennen. Client entsprechend auf :8000 zeigen.
- "8000:8080"
volumes:
- ~/.cache/llama.cpp:/root/.cache/llama.cpp
command:
- -hf
- unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL
- --host
- 0.0.0.0
- --port
- "8080"
- -ngl
- "99"
- --ctx-size
- "16384"
- --parallel
- "1"
- --jinja
- --reasoning
- "off"
- --alias
- gemma-4-12b

View File

@@ -0,0 +1,38 @@
services:
vllm-rocm:
image: vllm/vllm-openai-rocm:latest
container_name: vllm-rocm
restart: unless-stopped
# init:true gibt dem Container ein Init-System, das haengende Kindprozesse
# ordentlich einsammelt -> kein unkillbarer Zombie mehr beim naechsten Freeze,
# der Container bleibt per 'docker stop' beendbar.
init: true
environment:
- ROCM_VIS_DEVICES=0
# Falls vLLM ueber die Architektur meckert, einkommentieren:
# - HSA_OVERRIDE_GFX_VERSION=11.0.0
devices:
- /dev/kfd:/dev/kfd
- /dev/dri:/dev/dri
volumes:
- ~/.cache/huggingface:/root/.cache/huggingface
ports:
- "8000:8000"
ipc: host
# --- Stabilitaets-Parameter gegen den Gemma-4-Prefill-Deadlock (vLLM #39914) ---
command:
- --model
- google/gemma-4-12b-it
- --kv-cache-dtype
- fp8
- --max-model-len
- "16384"
- --gpu-memory-utilization
- "0.90"
- --limit-mm-per-prompt
- '{"image": 2, "audio": 0}'
- --max-num-seqs
- "4"
- --max-num-batched-tokens
- "2048"
- --enable-chunked-prefill