Sådan kører du AI lokalt på din PC eller Mac – trin for trin
Installer Ollama, hent en lille Qwen-model, og få dit første svar fra din egen computer. Det kræver ikke programmering. Open WebUI kommer bagefter, hvis du vil have en chatflade i browseren.
Du installerer Ollama, henter Qwen og sender din første prompt. Svaret bliver lavet af modellen på din PC eller Mac. Grundopsætningen kræver hverken terminal eller programmering.
Det skal du bruge
- Ollama-appen eller PowerShell/Terminal
- Qwen 3.5 4B som første model
- Internet til installation og download
- Valgfrit: Docker Desktop og Open WebUI
Hvad gør de enkelte dele?
- 01Open WebUI
Chatfladen i browseren. Den er valgfri.
- 02Ollama
Henter modellen og kører den på computeren.
- 03Qwen
Sprogmodellen, der læser prompten og skriver svaret.
- 04Din hardware
CPU, GPU og RAM eller samlet hukommelse udfører arbejdet.
Start med Ollama og Qwen. Tilføj kun Open WebUI, når det første svar virker.
Windows
1. Installér Ollama
Installér med appen
Download installationsfilen, åbn den, og følg den almindelige installation.
Download Ollama til Windows ↗Installér fra PowerShell
Officielt installationsscript til Windows.
irm https://ollama.com/install.ps1 | iex2. Hent Qwen 3.5 4B
Brug Ollama-appen
Brug Ollamas modelvælger eller bibliotek. Søg efter Qwen 3.5 4B, og hent den lokale model.
Qwen 3.5 på Ollama ↗ollama pull qwen3.5:4b
Hent modellen uden at starte en chat.
ollama pull qwen3.5:4b3. Start Qwen
Brug Ollama-appen
Vælg Qwen 3.5 4B i Ollama-appen for at åbne chatten.
ollama run qwen3.5:4b
Start modellen i en interaktiv chat i terminalen.
ollama run qwen3.5:4b4. Send din første prompt
Forklar forskellen på RAM og VRAM til en person, der aldrig har bygget en computer. Brug højst fem korte punkter.
Du er klar, når: Ollama viser et svar under prompten, og den valgte model hedder qwen3.5:4b. Hvis downloadknappen stadig vises, er modellen ikke hentet færdig.
Mac
1. Installér Ollama
Installér med appen
Download appen, og installér eller åbn den som normalt. Vælg udgaven til din Mac-chip, hvis siden spørger.
Download Ollama til macOS ↗Terminal
Officielt installationsscript til macOS.
curl -fsSL https://ollama.com/install.sh | sh2. Hent Qwen 3.5 4B
Brug Ollama-appen
Brug Ollamas modelvælger eller bibliotek. Søg efter Qwen 3.5 4B, og hent den lokale model.
Qwen 3.5 på Ollama ↗ollama pull qwen3.5:4b
Hent modellen uden at starte en chat.
ollama pull qwen3.5:4b3. Start Qwen
Brug Ollama-appen
Vælg Qwen 3.5 4B i Ollama-appen for at åbne chatten.
ollama run qwen3.5:4b
Start modellen i en interaktiv chat i terminalen.
ollama run qwen3.5:4b4. Send din første prompt
Forklar forskellen på RAM og VRAM til en person, der aldrig har bygget en computer. Brug højst fem korte punkter.
Du er klar, når: Ollama viser et svar under prompten, og den valgte model hedder qwen3.5:4b. Hvis downloadknappen stadig vises, er modellen ikke hentet færdig.
Når Ollama allerede virker: fire nyttige kommandoer
Terminalen er ikke nødvendig for at chatte i appen. Kommandoerne er nyttige, når du vil starte en bestemt model eller kontrollere, hvad der kører.
Start Qwen i terminalen
ollama run qwen3.5:4bVis hentede modeller
ollama lsSe modeller, der kører nu
ollama psStop den indlæste model
ollama stop qwen3.5:4bKontrollér, at modellen kører lokalt
Kør ollama ps, mens modellen svarer. Tabellen viser aktive modeller, hvor længe de er indlæst, og hvor beregningen ligger, når den oplysning er tilgængelig. En CPU/GPU-fordeling beskriver aflastningen i den aktuelle kørsel; den siger ikke noget om svarkvalitet.
På Windows kan du åbne Jobliste og se GPU- eller hukommelsesaktivitet under et svar. På Mac kan Aktivitetsovervågning vise processer og hukommelsestryk. Tallene beviser ikke alene, at alt arbejde lå på GPU'en, men sammen med ollama ps giver de et nyttigt øjebliksbillede.
Prøv et enkelt offline-tjek
- Hent modellen færdig, mens du er online.
- Slå Wi-Fi fra, og afbryd eventuelt Ethernet.
- Spørg qwen3.5:4b: “Skriv en kort historie om en hund, der lærer at bruge en computer.”
Hvis svaret kommer uden net, viser det, at netop denne tekstgenerering ikke krævede en cloud-model. Det beviser ikke, at andre apps eller senere integrationer er offline. Ollama tilbyder også cloud-modeller; vælg den lokale model uden cloud-mærkat.
Tilføj Open WebUI, hvis du vil chatte i browseren
Open WebUI giver en browserbaseret chatflade med samtalehistorik og modelvælger. Projektet anbefaler Docker til de fleste. Ollama fungerer allerede uden Open WebUI; denne del er valgfri.
Docker Desktop til Windows ↗Docker Desktop til Mac ↗Open WebUI: officiel Docker-vejledning ↗
Installer Docker Desktop
Hent den officielle app til Windows eller Mac, installér den, og åbn den. Vent, til Docker viser, at motoren kører.
Lav en nøgle til Open WebUI
Generér en tilfældig WEBUI_SECRET_KEY. Opbevar den privat, og brug samme nøgle, hvis containeren senere genskabes.
Start containeren
Kør Docker-kommandoen med den genererede nøgle. Den gemmer data i en Docker-volume og forbinder containeren til Ollama på computeren.
Åbn den lokale side
Opret en konto i din lokale Open WebUI-installation, vælg qwen3.5:4b, og send en kort prompt.
Lav en tilfældig nøgle med OpenSSL
OpenSSL
openssl rand -hex 32macOS har normalt OpenSSL. På Windows kan du bruge Git Bash eller en anden OpenSSL-installation. Del aldrig nøglen.
Start Open WebUI i Docker
Docker run
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data -e WEBUI_SECRET_KEY=your-secret-key --name open-webui --restart always ghcr.io/open-webui/open-webui:mainErstat your-secret-key med værdien, som den foregående kommando genererer.
Port 3000 på computeren peger på port 8080 i containeren. Docker-volumenen open-webui gemmer data mellem genstarter. Kommandoen følger Open WebUIs officielle Quick Start.
Hvis noget ikke virker
- Ingen model vises
- Kontrollér, at download er færdig, og at du valgte qwen3.5:4b uden cloud-mærkat. Første download kræver internet.
- Ollama er meget langsom
- Luk tunge apps, prøv igen med den lille model, og vent på første indlæsning. Hastigheden afhænger blandt andet af modelvariant, kontekst, hukommelse, runtime og GPU-aflastning.
- Open WebUI finder ikke Ollama
- Kontrollér, at Ollama stadig kører. Forbindelsen skal bruge http://host.docker.internal:11434, når Ollama kører på værtsmaskinen og Open WebUI i Docker.
- Port 3000 er optaget
- Stop den anden lokale tjeneste, eller skift venstre port i Docker-kommandoen til fx 3001, og åbn derefter localhost:3001.
Når 4B-modellen virker
Ollamas aktuelle Qwen 3.5-bibliotek indeholder også 9B- og 27B-tags. En større model kan give andre muligheder, men bruger typisk mere lagerplads og arbejdshukommelse og kan svare langsommere. Prøv 9B først, hvis 4B føles uproblematisk; gå videre til 27B, når du har plads til at eksperimentere.
Filstørrelse er ikke det samme som nødvendig RAM eller VRAM. Praktisk brug afhænger også af kvantisering, kontekst, runtime, GPU-aflastning, operativsystem og andre åbne programmer. Derfor angiver vi ikke én minimumsgrænse for, hvad der “virker perfekt”.
Fem korte begreber
- 4B, 9B og 27B
- B står for milliarder af modelparametre. Tallet siger noget om modellens størrelse, men forudsiger ikke alene svarenes kvalitet eller hastighed.
- Kvantisering
- En måde at lagre modelvægte med færre bits, så filen fylder mindre. Det kan sænke hukommelsesbehovet; resultatet afhænger af model og opgave.
- VRAM og RAM
- VRAM sidder på grafikkortet. System-RAM er computerens almindelige hukommelse. Apple Silicon bruger samlet hukommelse til CPU og GPU, som også deles med system og apps.
- Kontekst
- Den tekst og samtale, modellen kan arbejde med på én gang. Længere kontekst bruger mere hukommelse og kan gøre behandlingen langsommere.
- Tokens pr. sekund
- Et groft mål for hvor hurtigt modellen skriver efter svarstart. Det er ikke ventetiden før første token eller et mål for svarkvalitet.
At kunne køre er ikke det samme som at kunne bruge
Modellen starter og giver output.
Hastighed, hukommelsesforbrug og stabilitet passer til opgaven.
Kvalitet, hastighed, kontekst, hardwarekrav, pris og brugbarhed giver mening samlet.
RigRoute Labs måler lokale AI-opsætninger, fordi modelnavne og nominelle systemkrav ikke fortæller hele historien. Vores eksisterende Mac-test undersøger blandt andet ventetid før første token, generering og opgaveresultater. Den bruger en anden model og er ikke en direkte Qwen-anbefaling.
Typiske spørgsmål
Kan jeg køre lokal AI uden programmering?
Ja. Ollamas Windows- og macOS-apps har en grafisk model- og chatoplevelse. Terminal og Open WebUI er valgfrie.
Skal jeg være online for at bruge modellen?
Du skal være online for at hente Ollama og modellen. Når den lokale model er hentet, kan tekstgenerering fungere uden internet. Cloud-modeller og eksterne integrationer kræver forbindelse.
Er mine prompts private?
Ollama sender ikke denne lokale inferens til en modelserver i opsætningen her, men kontrollér værktøjer og forbindelser, du selv tilføjer. Vi lover ikke, at hele computeren eller Open WebUI altid er offline.
Hvilken computer kan køre Qwen 3.5 4B?
Ollama findes til Windows og Mac, men om modellen bliver hurtig eller passer komfortabelt i hukommelsen, afhænger af hardwaren og indstillingerne. Start med den lille model og vurder den på din egen maskine.
Officielle vejledninger og modelside
Næste skridt
Du har nu en lokal model, der kan svare. Næste skridt er at finde ud af, hvilken model der passer til din hardware og dine opgaver.