From 73d161185d0c766e59e3713e9641e0cfd5bbd3bc Mon Sep 17 00:00:00 2001 From: jenkins Date: Mon, 29 Jun 2026 15:06:44 -0300 Subject: [PATCH] fix(ai): warm fast chat model --- services/ai-llm/deployment.yaml | 8 ++++++-- 1 file changed, 6 insertions(+), 2 deletions(-) diff --git a/services/ai-llm/deployment.yaml b/services/ai-llm/deployment.yaml index e3567d70f..5fa6ab629 100644 --- a/services/ai-llm/deployment.yaml +++ b/services/ai-llm/deployment.yaml @@ -20,7 +20,7 @@ spec: labels: app: ollama annotations: - ai.bstein.dev/model: qwen2.5:14b-instruct-q4_0 + ai.bstein.dev/model: qwen2.5-coder:7b-instruct-q4_0,qwen2.5:14b-instruct-q4_0 ai.bstein.dev/gpu: GPU pool (titan-20/21) ai.bstein.dev/restartedAt: "2026-01-26T12:00:00Z" spec: @@ -53,6 +53,8 @@ spec: value: /root/.ollama - name: OLLAMA_MODEL value: qwen2.5:14b-instruct-q4_0 + - name: OLLAMA_FAST_MODEL + value: qwen2.5-coder:7b-instruct-q4_0 command: - /bin/sh - -c @@ -60,7 +62,9 @@ spec: set -e ollama serve >/tmp/ollama.log 2>&1 & sleep 6 - ollama pull "${OLLAMA_MODEL}" + for model in "${OLLAMA_FAST_MODEL}" "${OLLAMA_MODEL}"; do + ollama pull "${model}" + done pkill ollama || true volumeMounts: - name: models