docker
This commit is contained in:
47
bayarea-ai-server/docker-compose-llama-gemma12b.yml
Normal file
47
bayarea-ai-server/docker-compose-llama-gemma12b.yml
Normal file
@@ -0,0 +1,47 @@
|
|||||||
|
# llama.cpp + Gemma-4-12B (Vision) fuer die Buyer-Sheet-Extraktion.
|
||||||
|
# Basiert auf dem bewaehrten Qwen-Run (gleiche ROCm-Flags), erweitert um
|
||||||
|
# Vision (mmproj laedt -hf automatisch) und --reasoning off (sonst leeres content).
|
||||||
|
#
|
||||||
|
# Start: docker compose -f docker-compose-llama-gemma12b.yml up -d
|
||||||
|
# Logs: docker compose -f docker-compose-llama-gemma12b.yml logs -f
|
||||||
|
# Stop: docker compose -f docker-compose-llama-gemma12b.yml down
|
||||||
|
|
||||||
|
services:
|
||||||
|
llamacpp-gemma12b:
|
||||||
|
image: ghcr.io/ggml-org/llama.cpp:server-rocm
|
||||||
|
container_name: llamacpp-gemma12b
|
||||||
|
restart: unless-stopped
|
||||||
|
# init:true -> haengende Prozesse werden ordentlich eingesammelt (kein Zombie)
|
||||||
|
init: true
|
||||||
|
devices:
|
||||||
|
- /dev/kfd:/dev/kfd
|
||||||
|
- /dev/dri:/dev/dri
|
||||||
|
group_add:
|
||||||
|
- video
|
||||||
|
security_opt:
|
||||||
|
- seccomp=unconfined
|
||||||
|
ipc: host
|
||||||
|
ports:
|
||||||
|
# Achtung: Qwen laeuft schon auf 8080. Gemma bekommt 8000, damit beide
|
||||||
|
# parallel laufen koennen. Client entsprechend auf :8000 zeigen.
|
||||||
|
- "8000:8080"
|
||||||
|
volumes:
|
||||||
|
- ~/.cache/llama.cpp:/root/.cache/llama.cpp
|
||||||
|
command:
|
||||||
|
- -hf
|
||||||
|
- unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL
|
||||||
|
- --host
|
||||||
|
- 0.0.0.0
|
||||||
|
- --port
|
||||||
|
- "8080"
|
||||||
|
- -ngl
|
||||||
|
- "99"
|
||||||
|
- --ctx-size
|
||||||
|
- "16384"
|
||||||
|
- --parallel
|
||||||
|
- "1"
|
||||||
|
- --jinja
|
||||||
|
- --reasoning
|
||||||
|
- "off"
|
||||||
|
- --alias
|
||||||
|
- gemma-4-12b
|
||||||
38
bayarea-ai-server/docker-compose.yml
Normal file
38
bayarea-ai-server/docker-compose.yml
Normal file
@@ -0,0 +1,38 @@
|
|||||||
|
services:
|
||||||
|
vllm-rocm:
|
||||||
|
image: vllm/vllm-openai-rocm:latest
|
||||||
|
container_name: vllm-rocm
|
||||||
|
restart: unless-stopped
|
||||||
|
# init:true gibt dem Container ein Init-System, das haengende Kindprozesse
|
||||||
|
# ordentlich einsammelt -> kein unkillbarer Zombie mehr beim naechsten Freeze,
|
||||||
|
# der Container bleibt per 'docker stop' beendbar.
|
||||||
|
init: true
|
||||||
|
environment:
|
||||||
|
- ROCM_VIS_DEVICES=0
|
||||||
|
# Falls vLLM ueber die Architektur meckert, einkommentieren:
|
||||||
|
# - HSA_OVERRIDE_GFX_VERSION=11.0.0
|
||||||
|
devices:
|
||||||
|
- /dev/kfd:/dev/kfd
|
||||||
|
- /dev/dri:/dev/dri
|
||||||
|
volumes:
|
||||||
|
- ~/.cache/huggingface:/root/.cache/huggingface
|
||||||
|
ports:
|
||||||
|
- "8000:8000"
|
||||||
|
ipc: host
|
||||||
|
# --- Stabilitaets-Parameter gegen den Gemma-4-Prefill-Deadlock (vLLM #39914) ---
|
||||||
|
command:
|
||||||
|
- --model
|
||||||
|
- google/gemma-4-12b-it
|
||||||
|
- --kv-cache-dtype
|
||||||
|
- fp8
|
||||||
|
- --max-model-len
|
||||||
|
- "16384"
|
||||||
|
- --gpu-memory-utilization
|
||||||
|
- "0.90"
|
||||||
|
- --limit-mm-per-prompt
|
||||||
|
- '{"image": 2, "audio": 0}'
|
||||||
|
- --max-num-seqs
|
||||||
|
- "4"
|
||||||
|
- --max-num-batched-tokens
|
||||||
|
- "2048"
|
||||||
|
- --enable-chunked-prefill
|
||||||
Reference in New Issue
Block a user