GPU for lokal AI: RTX 3090/4090 vs A100/H100
Oppdatert: juli 2026 · 8 min lesetid
Den billigste veien til lokal AI er et brukt consumer-kort med 24 GB VRAM: RTX 3090 fra ca. 12 000 kr eller RTX 4090 fra ca. 23 000 kr. De kjører kvantiserte språkmodeller opp til ~30 mrd parametre. Datacenter-kortene A100 og H100 er verdt prishoppet først når du trenger mer enn 24 GB VRAM på ett kort, passiv kjøling i rackserver, ECC-minne for 24/7-drift eller skalering til flere kort.
Skal du kjøre språkmodeller (LLM) lokalt, er spørsmålet sjelden «hvilken GPU er best» – det er «hvilken GPU er billigst som løser min oppgave». Svaret for de fleste SMB-er er et brukt GeForce-kort med 24 GB VRAM. Et RTX 3090 til rundt 12 000 kr kjører en kvantisert 30B-modell like fint som kort til ti ganger prisen. A100 og H100 løser andre problemer: større modeller på ett kort, servertilpasset kjøling, ECC og skalering.
Denne guiden sammenligner kortene vi faktisk har på lager – RTX 3090, RTX 4090, A100 (40 og 80 GB) og H100 – og gir deg en konkret anbefaling per bruksområde. Gjelder det trening av modeller i stor skala, les heller A100 vs H100 for AI-trening.
Consumer vs datacenter: hva er egentlig forskjellen?
GeForce-kort (RTX 3090/4090) og datacenter-kort (A100/H100) bygger på samme CUDA-økosystem, og den samme koden kjører på begge. Forskjellene er fysiske og driftsmessige:
Minne: Consumer-kort bruker GDDR6X uten ECC. Datacenter-kort bruker HBM med ECC – høyere båndbredde og automatisk feilkorrigering. For inferens hjemme betyr ECC lite; for uker lange treningsjobber og 24/7 produksjon betyr det mye.
Kjøling: RTX-kort har vifter og trenger fri luft rundt seg – de er laget for PC-kabinett. A100/H100 er passive: de har ingen egne vifter og krever en server med kraftig gjennomstrømming (f.eks. Dell R740 eller HPE DL380 med GPU-kit). Det gjør at datacenter-kort passer i 2U-rackservere der et 3-slots RTX 4090 aldri får plass.
NVLink og skalering: RTX 3090 støtter NVLink mellom to kort; RTX 4090 har ikke NVLink i det hele tatt. A100/H100 er bygget for å kobles sammen med høy båndbredde – avgjørende når én modell må deles over flere kort. Les mer i Hva er NVLink?
MIG (Multi-Instance GPU): A100 og H100 kan partisjoneres i opptil sju isolerte GPU-instanser – nyttig når flere team eller VM-er skal dele ett kort.
Lisens: NVIDIAs driveravtale for GeForce tillater ikke bruk i datasenter-sammenheng (unntatt blokkjede). For intern bruk på egen server i egen bedrift er dette i praksis et lite hinder, men i regulerte miljøer og hos hostingleverandører er datacenter-kort det ryddige valget.
Sammenligningstabell med priser
Prisene hentes fra egen katalog og oppdateres løpende – se produktsidene for lagerstatus.
| Kort | VRAM | Minnebåndbredde | ECC / NVLink | Kjøling | Pris (brukt) | Kr per GB VRAM |
|---|---|---|---|---|---|---|
| Quadro P4000 | 8 GB | ~243 GB/s | Nei / Nei | Aktiv, 1 slot | 2 900 kr | ~360 kr |
| RTX 3090 | 24 GB | ~936 GB/s | Nei / Ja (2 kort) | Aktiv, 3 slots | 12 000 kr | ~500 kr |
| RTX 4090 | 24 GB | ~1 008 GB/s | Nei / Nei | Aktiv, 3–4 slots | 23 000 kr | ~960 kr |
| A100 40 GB | 40 GB | ~1 555 GB/s | Ja / Ja | Passiv (server) | 95 000 kr | ~2 400 kr |
| A100 80 GB | 80 GB | ~1 935 GB/s | Ja / Ja | Passiv (server) | 250 000 kr | ~3 150 kr |
| H100 80 GB | 80 GB | ~2 000 GB/s | Ja / Ja | Passiv (server) | 500 000 kr | ~6 250 kr |
Legg merke til kolonnen lengst til høyre: per gigabyte VRAM er RTX 3090 det klart billigste kortet. Det er derfor det er standardvalget i homelab- og eksperimentmiljøer verden over.
VRAM er tallet som betyr mest
For LLM-inferens avgjør VRAM hvilke modeller du i det hele tatt kan kjøre – før hastighet betyr noe. En 4-bit kvantisert modell trenger grovt regnet 0,6 GB VRAM per milliard parametre, pluss plass til kontekst:
| Modellstørrelse (4-bit) | VRAM-behov | Billigste kort fra lager |
|---|---|---|
| 7–8B (Mistral 7B, Llama 8B) | 5–8 GB | Quadro P4000 (tregt) / RTX 3090 |
| 13–14B | 9–12 GB | RTX 3090 |
| 30–34B | 18–24 GB | RTX 3090 / RTX 4090 |
| 70B | 40–48 GB | 2× RTX 3090 (NVLink) eller A100 80 GB |
| 100B+ | 80 GB+ | A100/H100 80 GB, evt. flere |
Hele regnestykket – kvantisering, kontekstvindu og hva slags hastighet du kan forvente – er dekket i detalj i guiden Kjøre LLM lokalt: VRAM- og maskinvarekrav.
Når holder et consumer-kort?
Utprøving og pilotprosjekter: Skal bedriften teste om en lokal chatbot, RAG-løsning eller kodeassistent gir verdi, er en RTX 3090 til 12 000 kr den suverent billigste billetten. Feiler piloten, har du tapt lite; lykkes den, vet du nøyaktig hva du skal skalere til.
Inferens på modeller opp til ~30B: 24 GB VRAM dekker kvantiserte modeller i 30B-klassen med rom for kontekst. For mange interne bruksområder – oppsummering, søk i egne dokumenter, koding – er dagens 7–30B-modeller gode nok.
Én bruker eller lite team: Uten krav til samtidighet trenger du ikke datacenter-ytelse. En 4090 leverer titalls tokens per sekund på en 13B-modell – raskere enn de fleste leser.
Bildegenerering og mindre finjusteringer: Stable Diffusion-arbeidsflyter og LoRA-finjustering av små modeller kjører fint på 24 GB.
Når trenger du A100 eller H100?
Modeller over 30B på ett kort: Vil du kjøre 70B-klassen uten å dele modellen over flere kort, trenger du 48–80 GB VRAM. A100 80 GB kjører en kvantisert 70B-modell alene – med plass til stort kontekstvindu.
Rackmontert 24/7-drift: Passive datacenter-kort er designet for serverens luftstrøm og kan stå i et 2U-chassis i årevis. Consumer-kort i rackserver er alltid en improvisasjon: fysisk trangt, og viftene deres er ikke laget for servermiljø.
Flere brukere samtidig: Skal en modell serve mange ansatte samtidig (batching med vLLM e.l.), gir HBM-båndbredden og den større VRAM-en langt høyere total gjennomstrømming. MIG lar deg i tillegg dele ett kort trygt mellom miljøer.
Trening og finjustering av større modeller: Trening krever langt mer minne enn inferens, og her er ECC, NVLink og HBM ikke nice-to-have. Se Hvor mye GPU trenger du for å trene en AI-modell?
A100 40 GB til 95 000 kr er ofte det smarteste steget opp fra consumer: nesten dobbelt så mye VRAM som et 4090, passiv serverkjøling, ECC og NVLink – til under halvparten av prisen for 80 GB-varianten.
Hvilken server skal GPU-en stå i?
GPU-en er bare halve regnestykket – den må stå i en maskin med nok strøm, kjøling og PCIe-baner:
For consumer-kort (3090/4090): Velg tower eller romslig chassis. HPE ML350 G10 (fra 22 500 kr) tar opptil 4 doble GPU-er og er bygget som stillegående tower – vår standardanbefaling for lokal AI. Dell R7920 (fra 25 000 kr) er alternativet med dual Xeon og god plass til fulle kort.
For A100/H100: Rackservere med GPU-kjølekit – typisk Dell R740-familien eller HPE DL380 G10. Kortene er passive og trenger serverens luftstrøm. Vi konfigurerer server + GPU samlet, så kjøling og strømbudsjett stemmer.
For klyngeskala: Ferdigbygde AI-servere med 8× A100 (fra 1,6 mill. kr) eller 8× H100 (fra 3,75 mill. kr) – NVLink-koblet og klar for trening og tung produksjon.
Skal GPU-en deles mellom VM-er i Proxmox eller VMware, les guiden om GPU-passthrough.
Ofte stilte spørsmål
Hva er den billigste GPU-en for å kjøre en LLM lokalt?
Brukt RTX 3090 med 24 GB VRAM – fra ca. 12 000 kr. Den kjører kvantiserte modeller opp til ~30 mrd parametre og har best pris per GB VRAM av alle kort i katalogen. Skal du bare eksperimentere med 7B-modeller, fungerer også en Quadro P4000 til 2 900 kr, men ytelsen er begrenset.
Kan jeg sette et RTX 4090 i en rackserver?
Sjelden i praksis. Et 4090 er 3–4 slots bredt, opptil 34 cm langt og trenger egne vifter med fri luft – det passer ikke i 1U/2U-chassis. Velg en tower som HPE ML350 eller Dell R7920, eller gå til passive datacenter-kort (A100/H100) for rackmontering.
Hvorfor koster A100 så mye mer enn RTX 4090 når 4090 er «raskere»?
Du betaler for VRAM-mengde (40/80 GB vs 24 GB), HBM-båndbredde, ECC-minne, NVLink-skalering, MIG-partisjonering og passiv serverkjøling – egenskaper som avgjør om kortet kan stå i produksjon 24/7 og kjøre modeller som ikke får plass på et consumer-kort. På ren spillytelse er 4090 raskere; på stor-modell-inferens og trening er det ikke samme liga.
Har RTX 3090 og 4090 NVLink?
RTX 3090: ja, to kort kan kobles med NVLink-bro. RTX 4090: nei, NVIDIA fjernet NVLink fra 40-serien. To 4090 kan fortsatt brukes sammen over PCIe, men med lavere båndbredde mellom kortene. For ekte multi-GPU-skalering er A100/H100 bygget for jobben.
Er det trygt å kjøpe brukt GPU?
Ja, når kortet er testet. Datacenter-GPU-er har gått i temperaturstyrte servermiljøer og er ofte i bedre forfatning enn spillkort. Alle GPU-er fra Axentra er testet før salg og leveres med 2 års garanti.
Hvor mye strøm trekker kortene?
RTX 3090: ~350 W, RTX 4090: ~450 W, A100: 250–300 W, H100 PCIe: ~350 W. Serveren rundt kommer i tillegg. Sørg for at strømforsyningene er dimensjonert med margin – se guiden om strømforbruk og kjøling.
Hva med AMD-kort til lokal AI?
ROCm-støtten blir stadig bedre, men CUDA er fortsatt standarden i AI-verktøykjeden – de fleste rammeverk, modeller og guider antar NVIDIA. For en bedrift som vil ha ting til å virke uten friksjon, anbefaler vi NVIDIA.
Neste steg
Start med oppgaven, ikke kortet: hvilken modellstørrelse trenger du, og hvor mange skal bruke den samtidig? For de fleste er svaret en RTX 3090 eller 4090 i en ML350 – en komplett lokal AI-maskin fra rundt 35 000 kr. Trenger du 70B-klassen eller 24/7-produksjon i rack, er A100 riktig steg opp.
Usikker på konfigurasjonen? Få tilbud på ønsket konfigurasjon – vi setter opp server og GPU samlet, med 2 års garanti.
Usikker på hva du trenger?
Få en konkret pris på en konfigurasjon som passer ditt behov – vi svarer samme dag på hverdager.
Få tilbudRelaterte guider
Kjøpshjelp
Brukt server vs ny: når lønner det seg?
Brukte enterprise-servere koster typisk 60–85 % mindre enn nye og har ofte mye levetid igjen.
Les guideKjøpshjelp
Sjekkliste: kvalitetstest av brukt server
En seriøs forhandler tester alt – firmware, RAM, disker og nettverk. Se hva prosessen innebærer.
Les guideKjøpshjelp
Dimensjonering for virtualisering
Hvor mange kjerner, hvor mye RAM og hvilken lagring trenger VM-ene dine? Slik regner du.
Les guide