Pentru a folosi modele locale în Open WebUI, ai nevoie de Ollama — serverul care rulează modelele open-source. Iată cum îl instalezi și îl conectezi.
1. Instalează Ollama
Pe VPS (Linux):
curl -fsSL https://ollama.com/install.sh | sh
Ollama pornește un server local pe portul 11434.
2. Descarcă un model
ollama pull llama3.1
ollama pull nous-hermes2
3. Verifică serverul Ollama
curl http://127.0.0.1:11434/api/tags
Ar trebui să vezi lista modelelor descărcate.
4. Conectează Open WebUI la Ollama
Dacă Open WebUI rulează în Docker, setează adresa serverului Ollama prin variabila OLLAMA_BASE_URL (de exemplu http://host.docker.internal:11434) sau din interfața de administrare, la Settings → Connections. Asigură-te că, în Docker, containerul poate accesa gazda.
5. Testează
În Open WebUI, în partea de sus a chat-ului, ar trebui să apară acum modelele Ollama. Selectează unul și trimite un mesaj.
Notă: Modelele rulează pe CPU sau GPU. Fără GPU, alege modele mici/cuantizate pentru viteză rezonabilă. Un VPS cu mai mult RAM (sau cu GPU) oferă răspunsuri mult mai rapide.