diff --git a/bayarea-ai-server/docker-compose-llama-gemma12b.yml b/bayarea-ai-server/docker-compose-llama-gemma12b.yml new file mode 100644 index 0000000..7d74972 --- /dev/null +++ b/bayarea-ai-server/docker-compose-llama-gemma12b.yml @@ -0,0 +1,47 @@ +# llama.cpp + Gemma-4-12B (Vision) fuer die Buyer-Sheet-Extraktion. +# Basiert auf dem bewaehrten Qwen-Run (gleiche ROCm-Flags), erweitert um +# Vision (mmproj laedt -hf automatisch) und --reasoning off (sonst leeres content). +# +# Start: docker compose -f docker-compose-llama-gemma12b.yml up -d +# Logs: docker compose -f docker-compose-llama-gemma12b.yml logs -f +# Stop: docker compose -f docker-compose-llama-gemma12b.yml down + +services: + llamacpp-gemma12b: + image: ghcr.io/ggml-org/llama.cpp:server-rocm + container_name: llamacpp-gemma12b + restart: unless-stopped + # init:true -> haengende Prozesse werden ordentlich eingesammelt (kein Zombie) + init: true + devices: + - /dev/kfd:/dev/kfd + - /dev/dri:/dev/dri + group_add: + - video + security_opt: + - seccomp=unconfined + ipc: host + ports: + # Achtung: Qwen laeuft schon auf 8080. Gemma bekommt 8000, damit beide + # parallel laufen koennen. Client entsprechend auf :8000 zeigen. + - "8000:8080" + volumes: + - ~/.cache/llama.cpp:/root/.cache/llama.cpp + command: + - -hf + - unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL + - --host + - 0.0.0.0 + - --port + - "8080" + - -ngl + - "99" + - --ctx-size + - "16384" + - --parallel + - "1" + - --jinja + - --reasoning + - "off" + - --alias + - gemma-4-12b diff --git a/bayarea-ai-server/docker-compose.yml b/bayarea-ai-server/docker-compose.yml new file mode 100644 index 0000000..aa42c94 --- /dev/null +++ b/bayarea-ai-server/docker-compose.yml @@ -0,0 +1,38 @@ +services: + vllm-rocm: + image: vllm/vllm-openai-rocm:latest + container_name: vllm-rocm + restart: unless-stopped + # init:true gibt dem Container ein Init-System, das haengende Kindprozesse + # ordentlich einsammelt -> kein unkillbarer Zombie mehr beim naechsten Freeze, + # der Container bleibt per 'docker stop' beendbar. + init: true + environment: + - ROCM_VIS_DEVICES=0 + # Falls vLLM ueber die Architektur meckert, einkommentieren: + # - HSA_OVERRIDE_GFX_VERSION=11.0.0 + devices: + - /dev/kfd:/dev/kfd + - /dev/dri:/dev/dri + volumes: + - ~/.cache/huggingface:/root/.cache/huggingface + ports: + - "8000:8000" + ipc: host + # --- Stabilitaets-Parameter gegen den Gemma-4-Prefill-Deadlock (vLLM #39914) --- + command: + - --model + - google/gemma-4-12b-it + - --kv-cache-dtype + - fp8 + - --max-model-len + - "16384" + - --gpu-memory-utilization + - "0.90" + - --limit-mm-per-prompt + - '{"image": 2, "audio": 0}' + - --max-num-seqs + - "4" + - --max-num-batched-tokens + - "2048" + - --enable-chunked-prefill