# llama.cpp + Gemma-4-12B (Vision) fuer die Buyer-Sheet-Extraktion. # Basiert auf dem bewaehrten Qwen-Run (gleiche ROCm-Flags), erweitert um # Vision (mmproj laedt -hf automatisch) und --reasoning off (sonst leeres content). # # Start: docker compose -f docker-compose-llama-gemma12b.yml up -d # Logs: docker compose -f docker-compose-llama-gemma12b.yml logs -f # Stop: docker compose -f docker-compose-llama-gemma12b.yml down services: llamacpp-gemma12b: image: ghcr.io/ggml-org/llama.cpp:server-rocm container_name: llamacpp-gemma12b restart: unless-stopped # init:true -> haengende Prozesse werden ordentlich eingesammelt (kein Zombie) init: true devices: - /dev/kfd:/dev/kfd - /dev/dri:/dev/dri group_add: - video security_opt: - seccomp=unconfined ipc: host ports: # Achtung: Qwen laeuft schon auf 8080. Gemma bekommt 8000, damit beide # parallel laufen koennen. Client entsprechend auf :8000 zeigen. - "8000:8080" volumes: - ~/.cache/llama.cpp:/root/.cache/llama.cpp command: - -hf - unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL - --host - 0.0.0.0 - --port - "8080" - -ngl - "99" - --ctx-size - "16384" - --parallel - "1" - --jinja - --reasoning - "off" - --alias - gemma-4-12b