După ce ai instalat Ollama, poți descărca și rula modele cu comenzi simple.
1. Descarcă un model
ollama pull llama3.1
Comanda descarcă modelul în varianta implicită. Multe modele au variante după dimensiune și cuantizare, pe care le specifici cu „tag”:
ollama pull llama3.1:8b
ollama pull mistral:latest
ollama pull nous-hermes2
2. Rulează modelul (chat în terminal)
ollama run llama3.1
Scrie un mesaj și modelul îți răspunde. Ieși din sesiune cu /bye sau Ctrl+D.
3. Trimite un prompt direct
ollama run llama3.1 "Explică pe scurt ce este un VPS"
4. Vezi ce modele ai instalate
ollama list
Cum alegi varianta potrivită
- Dimensiunea (de exemplu 8B, 70B) — mai mare = mai capabil, dar necesită mai multe resurse.
- Cuantizarea (Q4, Q5, Q8) — mai puternic cuantizat = mai puțină memorie, cu un mic compromis de calitate.
Pentru început, o variantă de ~8B cuantizată (Q4) este cel mai accesibil punct de plecare.
Sfat: Primul răspuns poate fi mai lent pentru că modelul se încarcă în memorie. Rulările ulterioare sunt mai rapide cât timp modelul rămâne „cald”.