Ollama nis me një komandë, por madhësia e modelit vendos kufirin

|Autori: Ekipi editorial i QUASA|5 min lexim| 1
Ollama nis me një komandë, por madhësia e modelit vendos kufirin

Instalo Ollama në kompjuter, pastaj shkruaj ollama run qwen3:4b në terminal. Udhëzimi i nisjes së Ollama shpjegon se komanda ollama run shkarkon modelin e zgjedhur dhe hap bisedën në kompjuter. Për përdorim lokal, zgjidh një model që shkarkohet në pajisje, jo një variant cloud.

Para shkarkimit, kontrollo RAM-in e lirë dhe hapësirën në disk. Madhësia e skedarit të modelit të tregon sa vend duhet për ta ruajtur, por përdorimi i tij kërkon edhe memorie për modelin dhe bisedën. Nëse kompjuteri përdor njëkohësisht programe të tjera, nis me një variant të vogël; një variant më i madh mund ta ngadalësojë pajisjen ose të mos ngarkohet.

Instalimi në Windows, macOS, Linux dhe Docker

Në Windows dhe macOS, shkarko Ollama nga faqja zyrtare e produktit dhe përfundo instalimin. Hap aplikacionin, pastaj PowerShell në Windows ose Terminal në macOS. Komanda ollama hap udhëzimet fillestare; për të hyrë drejtpërdrejt në bisedë me një variant të zgjedhur, përdor ollama run qwen3:4b. Shkarkimi i parë kërkon internet, ndërsa biseda me modelin e shkarkuar zhvillohet lokalisht.

Në Linux, komanda e instalimit është curl -fsSL https://ollama.com/install.sh | sh. Pastaj provo ollama run qwen3:4b. Nëse shërbimi nuk është nisur, hap ollama serve në një terminal dhe ekzekuto komandën e modelit në një tjetër. Mos nis një shërbim të dytë nëse Ollama po punon tashmë në sfond.

Për Docker, nise kontejnerin me docker run -d -v ollama:/root/.ollama -p 127.0.0.1:11434:11434 --name ollama ollama/ollama. Vëllimi ollama ruan modelet e shkarkuara, ndërsa adresa në fillim të lidhjes së portës e kufizon publikimin te ndërfaqja lokale e kompjuterit pritës. Pastaj përdor docker exec -it ollama ollama run qwen3:4b për bisedën brenda kontejnerit. Nëse Docker punon në një kompjuter tjetër, adresa lokale i përket atij kompjuteri.

Zgjidh modelin sipas memories dhe vendit në disk

Katalogu Qwen3 në Ollama rendit variante shumëgjuhëshe me madhësi të ndryshme shkarkimi: qwen3:0.6b zë rreth 523 MB, qwen3:4b rreth 2,5 GB, qwen3:8b rreth 5,2 GB dhe qwen3:14b rreth 9,3 GB. Këto shifra përshkruajnë skedarët e shkarkuar, jo RAM-in e garantuar gjatë përdorimit. Zgjidhja më poshtë është një pikënisje e kujdesshme për një kompjuter që përdoret edhe për punë të tjera, jo kërkesë zyrtare për çdo konfigurim:

  • 4 GB RAM: provo qwen3:0.6b për pyetje të shkurtra; prit kufizime më të mëdha në detyra të ndërlikuara.
  • 8 GB RAM: nis me qwen3:4b dhe lër memorie të lirë për sistemin operativ.
  • 16 GB RAM: provo qwen3:8b nëse varianti më i vogël nuk i përballon mirë detyrat e tua.
  • 32 GB RAM: qwen3:14b është një hap i arsyeshëm, duke ruajtur hapësirë për bisedën dhe programet e tjera.

RAM-i i instaluar nuk është gjithmonë RAM i lirë. Nëse ke procesor grafik, rëndësi ka edhe memoria e tij; një pjesë e modelit mund të përfundojë në memorien e sistemit dhe përgjigjet mund të vijnë më ngadalë. Edhe gjatësia e kontekstit ndikon në përdorimin e memories. Për këtë arsye, madhësia e shkarkimit shërben për të planifikuar diskun, ndërsa tabela e RAM-it shërben vetëm për të zgjedhur variantin fillestar.

Qwen3 përshkruhet si familje shumëgjuhëshe, por kjo nuk përcakton cilësinë e përgjigjeve në shqip për çdo detyrë. Nëse të duhet për kod, përmbledhje ose shkrim, provo të njëjtat kërkesa në dy variante që kompjuteri mund t’i përballojë. Mbaje variantin më të vogël kur rezultati të mjafton: një shkarkim më i madh zë më shumë disk dhe mund të kërkojë më shumë memorie gjatë punës.

Nis bisedën dhe shiko modelin e ngarkuar

Shkruaj ollama run qwen3:4b dhe prit të përfundojë shkarkimi. Pastaj jep pyetjen në terminal, për shembull një kërkesë për të përmbledhur në shqip një tekst që e shkruan vetë. Me /bye del nga biseda. Kur e nis sërish të njëjtin model, Ollama përdor kopjen që është ruajtur në pajisje.

Komanda ollama ls tregon modelet e shkarkuara, ndërsa ollama ps tregon cilat janë të ngarkuara në atë çast. Kjo të ndihmon të dallosh vendin e zënë në disk nga memoria e përdorur gjatë punës. Nëse kompjuteri ngadalësohet shumë me qwen3:8b, provo qwen3:4b. Shkruaje madhësinë në emrin e modelit: emri pa variant mund të zgjedhë një madhësi të parazgjedhur që nuk e kishe planifikuar.

Mbaje API-në brenda pajisjes

FAQ-ja e Ollama përcakton se serveri lidhet si parazgjedhje me 127.0.0.1:11434 dhe se OLLAMA_HOST mund ta ndryshojë këtë adresë. Për aplikacione që punojnë në të njëjtin kompjuter, mbaje lidhjen te 127.0.0.1. Një vlerë si 0.0.0.0:11434 e bën serverin të dëgjojë edhe në ndërfaqet e tjera të pajisjes, ndaj nuk i shërben synimit për një API vetëm lokale.

Në instalimin vendas, kontrollo nëse e ke ndryshuar më parë OLLAMA_HOST; nëse po, ktheje te adresa lokale dhe rinis Ollama. Në Docker, përdor lidhjen e portës 127.0.0.1:11434:11434, jo vetëm 11434:11434. Kjo e fundit e publikon portën në ndërfaqet e kompjuterit pritës sipas konfigurimit të Docker. Nëse të duhet vetëm biseda përmes docker exec, mund të mos e publikosh fare portën e kontejnerit.

Një aplikacion në të njëjtën pajisje mund të dërgojë kërkesa te http://127.0.0.1:11434/api/chat. Kërkesa përfshin emrin e modelit dhe një listë mesazhesh me rolin e përdoruesit e përmbajtjen e pyetjes; vendosja e stream në false e kthen përgjigjen si një objekt të vetëm JSON. Përdor të njëjtin emër modeli që ke shkarkuar. Adresa 127.0.0.1 i përket gjithmonë pajisjes nga e cila dërgohet kërkesa, ndaj klienti duhet të punojë në kompjuterin ku është i arritshëm shërbimi lokal.

Lexoni gjithashtu:

Ndaj:

Abonohuni në buletinin tonë

Merrni lajmet më të fundit për Web3, AI dhe kripto direkt në kutinë tuaj postare.

0