diff --git a/bayarea-ai-server/docker-compose.yml b/bayarea-ai-server/docker-compose.yml index aa42c94..4c53f5a 100644 --- a/bayarea-ai-server/docker-compose.yml +++ b/bayarea-ai-server/docker-compose.yml @@ -1,38 +1,47 @@ +# llama.cpp + Gemma-4-12B (Vision) auf CUDA (AWS G7e / RTX PRO 6000). +# +# Bewusst SCHLANK gehalten: keine ROCm/Vulkan-Workarounds. Wir testen, ob +# CUDA die Instabilitaeten von vornherein vermeidet. Nur die inhaltlich noetigen +# Flags (--reasoning off gegen leeres content) bleiben. +# +# Voraussetzung: DLAMI mit NVIDIA Container Toolkit (docker --gpus all funktioniert). +# +# Start: docker compose -f docker-compose-cuda.yml up -d +# Logs: docker compose -f docker-compose-cuda.yml logs -f + services: - vllm-rocm: - image: vllm/vllm-openai-rocm:latest - container_name: vllm-rocm + llamacpp-gemma12b: + image: ghcr.io/ggml-org/llama.cpp:server-cuda + container_name: llamacpp-gemma12b restart: unless-stopped - # init:true gibt dem Container ein Init-System, das haengende Kindprozesse - # ordentlich einsammelt -> kein unkillbarer Zombie mehr beim naechsten Freeze, - # der Container bleibt per 'docker stop' beendbar. init: true - environment: - - ROCM_VIS_DEVICES=0 - # Falls vLLM ueber die Architektur meckert, einkommentieren: - # - HSA_OVERRIDE_GFX_VERSION=11.0.0 - devices: - - /dev/kfd:/dev/kfd - - /dev/dri:/dev/dri - volumes: - - ~/.cache/huggingface:/root/.cache/huggingface + # GPU-Zugriff ueber das NVIDIA Container Toolkit + deploy: + resources: + reservations: + devices: + - driver: nvidia + count: 1 + capabilities: [gpu] ports: - - "8000:8000" - ipc: host - # --- Stabilitaets-Parameter gegen den Gemma-4-Prefill-Deadlock (vLLM #39914) --- + - "8000:8080" + volumes: + - ~/.cache/llama.cpp:/root/.cache/llama.cpp command: - - --model - - google/gemma-4-12b-it - - --kv-cache-dtype - - fp8 - - --max-model-len + - -hf + - unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL + - --host + - 0.0.0.0 + - --port + - "8080" + - -ngl + - "99" + - --ctx-size - "16384" - - --gpu-memory-utilization - - "0.90" - - --limit-mm-per-prompt - - '{"image": 2, "audio": 0}' - - --max-num-seqs - - "4" - - --max-num-batched-tokens - - "2048" - - --enable-chunked-prefill + - --parallel + - "1" + - --jinja + - --reasoning + - "off" + - --alias + - gemma-4-12b \ No newline at end of file