Kjøre LLM lokalt: VRAM- og maskinvarekrav

Oppdatert: juli 2026 · 9 min lesetid

Kort oppsummert

Tommelfingerregelen for å kjøre en språkmodell lokalt: en 4-bit kvantisert modell trenger ca. 0,6 GB VRAM per milliard parametre, pluss 1–4 GB til kontekst. En 7B-modell kjører på 8 GB, 13B på 12–16 GB, 30B på 24 GB (RTX 3090/4090), og 70B trenger 48 GB+ (to 24 GB-kort eller én A100 80 GB). Resten av maskinen er enkel: moderat CPU, RAM minst lik VRAM, og NVMe-disk til modellfilene.

Å kjøre Llama, Mistral eller andre åpne språkmodeller på egen maskinvare er blitt overraskende enkelt: installer Ollama, last ned en modell, ferdig. Det eneste harde kravet er nok VRAM på GPU-en. Denne guiden gir deg tabellen som oversetter modellstørrelse til VRAM-behov – og videre til konkret maskinvare med priser. Merk at alt her gjelder inferens (å bruke en ferdig modell); skal du trene egne modeller, gjelder helt andre tall – se Hvor mye GPU trenger du for å trene en AI-modell?

VRAM-tabellen: modell → GPU → pris

Tabellen viser typisk VRAM-behov ved 4-bit kvantisering (standarden i Ollama) og hvilken GPU fra egen katalog som er det billigste fungerende valget. Prisene hentes fra katalogen og oppdateres løpende.

Modell (eksempler) VRAM, 4-bit VRAM, FP16 Billigste GPU fra lager Pris
7–8B (Mistral 7B, Llama 8B) 5–8 GB ~16 GB RTX 3090 24 GB 12 000 kr
13–14B 9–12 GB ~28 GB RTX 3090 24 GB 12 000 kr
30–34B 18–24 GB ~65 GB RTX 4090 24 GB (eller 3090) 23 000 kr
Mixtral 8x7B (MoE) ~26–30 GB ~90 GB A100 40 GB eller 2× RTX 3090 fra 24 000 kr
70B (Llama 70B) 40–48 GB ~140 GB 2× RTX 3090 m/NVLink eller A100 80 GB fra 24 000 kr / 250 000 kr
100B+ / frontier åpen 80 GB+ 300 GB+ H100 80 GB, evt. flere i AI-server fra 500 000 kr
Husk kontekstvinduet:

VRAM-tallene over gjelder moderat kontekst (noen tusen tokens). Store kontekstvinduer koster ekstra VRAM til KV-cache – kjører du 32k+ tokens kontekst, legg på flere GB. Det er derfor 24 GB er et mye tryggere valg enn 16 GB for 13B-klassen.

Kvantisering forklart: derfor holder 24 GB langt

En modells vekter lagres opprinnelig med 16 bit per parameter (FP16). En 70B-modell blir da ~140 GB – umulig på ett kort. Kvantisering reduserer presisjonen per vekt:

FP16 (16-bit): Full kvalitet, 2 GB per milliard parametre. Brukes i produksjon der maksimal kvalitet trumfer kostnad.

INT8/Q8 (8-bit): ~1 GB per milliard parametre. Nesten umålbar kvalitetsforskjell fra FP16.

Q4 (4-bit): ~0,5–0,6 GB per milliard parametre. Liten, men målbar kvalitetsreduksjon – standarden for lokal kjøring. Det er dette som gjør at en 30B-modell får plass på et 24 GB-kort.

I praksis: last ned Q4-varianten først. Merker du kvalitetsproblemer på din oppgave, prøv Q5/Q6 eller Q8 – og oppgrader GPU om det ikke får plass.

Hvor rask blir den? Tokens per sekund

Inferenshastighet begrenses i hovedsak av minnebåndbredde, ikke regnekraft. Grove, erfaringsbaserte intervaller for én bruker:

Oppsett Modell (Q4) Typisk hastighet
RTX 3090 / 4090 7–8B 60–130 tokens/s
RTX 3090 / 4090 13B 35–80 tokens/s
RTX 3090 / 4090 30B 15–40 tokens/s
2× RTX 3090 70B 10–20 tokens/s
A100 80 GB 70B 20–35 tokens/s

Til sammenligning leser folk flest 5–10 tokens i sekundet. Alt over ~20 tokens/s oppleves flytende i chat. Skal modellen serve mange brukere samtidig, endres regnestykket – da handler det om batching og total gjennomstrømming, og datacenter-kort med HBM drar fra (se GPU for lokal AI).

Resten av maskinen: CPU, RAM, disk, strøm

Når hele modellen bor i VRAM, er kravene til resten beskjedne:

CPU: Moderat. Inferensen skjer på GPU-en; CPU-en håndterer tokenisering og I/O. En brukt server med Xeon Silver/Gold eller tilsvarende har mer enn nok.

RAM: Minst like mye som VRAM, gjerne det dobbelte – modellen lastes via RAM, og noen rammeverk kan avlaste lag til RAM ved behov (tregt, men det redder deg når modellen er hakket for stor).

Disk: NVMe anbefales. Modellfiler er 4–45 GB store, og med flere modeller på disk blir lastetid merkbart. 1–2 TB NVMe holder lenge.

Strøm og kjøling: GPU-en dominerer: regn 350–450 W for consumer-kort under last, pluss 150–300 W for serveren. Sjekk at strømforsyningen har riktig effekt og kontakter, og at rommet tåler varmen – se strømforbruk og kjøling.

Programvaren: Ollama, llama.cpp, vLLM

Ollama er den enkleste starten: én kommando for å laste ned og kjøre en modell, med innebygd API. Perfekt for pilot og internt bruk.

llama.cpp er motoren under panseret på mye av økosystemet – kjør den direkte for full kontroll over kvantisering og ytelse.

vLLM er produksjonsvalget når mange brukere skal dele én modell: kontinuerlig batching og langt høyere total gjennomstrømming. Krever mer oppsett, og det er her datacenter-GPU-ene virkelig betaler seg.

Open WebUI (eller lignende) foran Ollama/vLLM gir de ansatte et kjent chat-grensesnitt mot bedriftens egen modell.

Alt kjører fint i VM eller container – skal GPU-en deles i et virtualisert miljø, se guiden om GPU-passthrough.

Når én GPU ikke er nok

Modeller større enn VRAM-en kan deles over flere kort (tensor/pipeline-parallelisme). To RTX 3090 med NVLink-bro er den rimeligste veien til 48 GB og kjører 70B-klassen for 24 000 kr i GPU-kostnad. Merk at RTX 4090 mangler NVLink – to 4090 fungerer, men kommunikasjonen går over PCIe.

For produksjon med multi-GPU er A100/H100 bygget for jobben, med høy båndbredde mellom kortene og ECC hele veien – les Hva er NVLink? Serveren må ha PCIe-plass og strøm til flere kort: HPE ML350 G10 tar opptil fire doble kort og koster fra 22 500 kr.

Hvorfor kjøre lokalt i det hele tatt?

Datakontroll: Dokumenter, kundedata og kildekode forlater aldri huset. For alt som er underlagt GDPR, taushetsplikt eller konkurransesensitivitet er dette ofte hele begrunnelsen.

Forutsigbar kostnad: Ingen forbruksfakturering per token. Maskinen koster det samme uansett hvor mye de ansatte bruker den – og brukt maskinvare gjør inngangsbilletten lav. Se Hva koster en GPU-/AI-server? for hele regnestykket, inkludert kjøpe-vs-leie.

Ingen avhengighet: Modellen endrer seg ikke under føttene dine, fungerer uten internett, og du velger selv når du oppgraderer.

Ofte stilte spørsmål

Hvor mye VRAM trenger jeg for å kjøre Llama 70B lokalt?

40–48 GB ved 4-bit kvantisering. I praksis: to 24 GB-kort (f.eks. 2× RTX 3090 med NVLink) eller ett A100 80 GB. Med 80 GB får du i tillegg plass til stort kontekstvindu og høyere kvantisering (Q6/Q8).

Kan jeg kjøre en 70B-modell på ett RTX 4090?

Bare med kraftig kompromiss: deler av modellen må avlastes til CPU/RAM, og hastigheten faller gjerne til få tokens per sekund. Det fungerer til testing, men ikke til daglig bruk. Riktig verktøy er 48 GB+ samlet VRAM.

Hva er forskjellen på å kjøre inferens og å trene en modell?

Inferens bruker en ferdig modell og krever bare plass til vektene + kontekst. Trening krever i tillegg gradienter og optimizer-tilstand – gjerne 3–4 ganger mer minne – pluss mye lengre kjøretid. Denne guiden dekker inferens; for trening, se egen guide.

Trenger jeg NVLink for å kjøre modeller over flere GPU-er?

Nei, tensor-parallelisme fungerer over PCIe også – men NVLink gir vesentlig høyere båndbredde mellom kortene og bedre ytelse på store modeller. RTX 3090 støtter NVLink (to kort), RTX 4090 gjør det ikke, A100/H100 er bygget for det.

Holder det ikke med en Mac med mye enhetlig minne?

En Mac med 64–128 GB enhetlig minne kjører store modeller, og er et reelt alternativ for én bruker. Men den skalerer ikke: ingen mulighet for flere GPU-er, begrenset batching for flere samtidige brukere, og den passer ikke i racket. En brukt server med dedikert GPU gir mer ytelse per krone og en vei videre.

Hvilken modell bør en norsk SMB starte med?

Start med en modell i 7–14B-klassen via Ollama og test den på deres faktiske oppgaver – oppsummering, e-postutkast, søk i egne dokumenter. Fungerer den nesten, prøv 30B-klassen. Først når du vet hvilken modellstørrelse som løser oppgaven, vet du hvilken maskinvare du skal dimensjonere for.

Kan jeg oppgradere GPU-en senere?

Ja – det er et av de beste argumentene for å starte med en brukt server. Begynn med et 24 GB consumer-kort, og bytt til A100 eller sett inn kort nummer to når behovet vokser. Sjekk at serveren har PCIe-plass, strømkabler og kjøling til oppgraderingen – vi hjelper deg å velge riktig chassis fra start.

Neste steg

Bestem modellstørrelsen først, deretter GPU-en, til slutt serveren. En komplett startpakke – HPE ML350 G10 med RTX 3090 – koster fra ca. 35 000 kr og kjører alt opp til 30B-klassen. Derfra er veien kort til flere kort eller A100 når behovet vokser.

Usikker på dimensjoneringen? Få tilbud på ønsket konfigurasjon – vi setter opp server, GPU og lagring samlet, med 2 års garanti.

Usikker på hva du trenger?

Få en konkret pris på en konfigurasjon som passer ditt behov – vi svarer samme dag på hverdager.

Få tilbud