GPU for lokal AI: RTX 3090/4090 vs A100/H100
Oppdatert: september 2026 · 8 min lesetid
RTX 3090 og RTX 4090 omtales her som modelleksempler med 24 GB VRAM. De tidligere produktannonsene er ikke aktive pristilbud. Se aktuelt GPU-utvalg for priser og tilgjengelighet, eller be om et tilbud på ønsket modell og oppsett.
Skal du kjøre språkmodeller (LLM) lokalt, bør GPU-valget ta utgangspunkt i modell, minnebehov og bruksområde. Sammenlign aktuelle produkter og totalprisen for et kompatibelt oppsett. Prisene fra de tidligere RTX 3090- og RTX 4090-annonsene brukes ikke som gjeldende tilbud.
Denne guiden sammenligner RTX 3090, RTX 4090, A100 (40 og 80 GB) og H100 for ulike bruksområder. Se de aktuelle produktsidene for pris og tilgjengelighet. Gjelder det trening av modeller i stor skala, les heller A100 vs H100 for AI-trening.
Consumer vs datacenter: hva er egentlig forskjellen?
GeForce-kort (RTX 3090/4090) og datacenter-kort (A100/H100) bygger på samme CUDA-økosystem, og den samme koden kjører på begge. Forskjellene er fysiske og driftsmessige:
Minne: Consumer-kort bruker GDDR6X uten ECC. Datacenter-kort bruker HBM med ECC – høyere båndbredde og automatisk feilkorrigering. For inferens hjemme betyr ECC lite; for uker lange treningsjobber og 24/7 produksjon betyr det mye.
Kjøling: RTX-kort har vifter og trenger fri luft rundt seg – de er laget for PC-kabinett. A100/H100 er passive: de har ingen egne vifter og krever en server med kraftig gjennomstrømming (f.eks. Dell R740 eller HPE DL380 med GPU-kit). Det gjør at datacenter-kort passer i 2U-rackservere der et 3-slots RTX 4090 aldri får plass.
NVLink og skalering: RTX 3090 støtter NVLink mellom to kort; RTX 4090 har ikke NVLink i det hele tatt. A100/H100 er bygget for å kobles sammen med høy båndbredde – avgjørende når én modell må deles over flere kort. Les mer i Hva er NVLink?
MIG (Multi-Instance GPU): A100 og H100 kan partisjoneres i opptil sju isolerte GPU-instanser – nyttig når flere team eller VM-er skal dele ett kort.
Lisens: NVIDIAs driveravtale for GeForce tillater ikke bruk i datasenter-sammenheng (unntatt blokkjede). For intern bruk på egen server i egen bedrift er dette i praksis et lite hinder, men i regulerte miljøer og hos hostingleverandører er datacenter-kort det ryddige valget.
Sammenligningstabell med priser
Prisene hentes fra egen katalog og oppdateres løpende – se produktsidene for lagerstatus.
| Kort | VRAM | Minnebåndbredde | ECC / NVLink | Kjøling | Pris (brukt) | Kr per GB VRAM |
|---|---|---|---|---|---|---|
| Quadro P4000 | 8 GB | ~243 GB/s | Nei / Nei | Aktiv, 1 slot | 2 900 kr | ~360 kr |
| RTX 3090 (se GPU-utvalget) | 24 GB | ~936 GB/s | Nei / Ja (2 kort) | Aktiv, 3 slots | Ikke aktivt pristilbud | Ikke aktivt pristilbud |
| RTX 4090 (se GPU-utvalget) | 24 GB | ~1 008 GB/s | Nei / Nei | Aktiv, 3–4 slots | Ikke aktivt pristilbud | Ikke aktivt pristilbud |
| A100 40 GB | 40 GB | ~1 555 GB/s | Ja / Ja | Passiv (server) | 95 000 kr | ~2 400 kr |
| A100 80 GB | 80 GB | ~1 935 GB/s | Ja / Ja | Passiv (server) | 250 000 kr | ~3 150 kr |
| H100 80 GB | 80 GB | ~2 000 GB/s | Ja / Ja | Passiv (server) | 500 000 kr | ~6 250 kr |
Legg merke til kolonnen lengst til høyre: per gigabyte VRAM er RTX 3090 det klart billigste kortet. Det er derfor det er standardvalget i homelab- og eksperimentmiljøer verden over.
VRAM er tallet som betyr mest
For LLM-inferens avgjør VRAM hvilke modeller du i det hele tatt kan kjøre – før hastighet betyr noe. En 4-bit kvantisert modell trenger grovt regnet 0,6 GB VRAM per milliard parametre, pluss plass til kontekst:
| Modellstørrelse (4-bit) | VRAM-behov | Billigste kort fra lager |
|---|---|---|
| 7–8B (Mistral 7B, Llama 8B) | 5–8 GB | Quadro P4000 (tregt) / RTX 3090 |
| 13–14B | 9–12 GB | RTX 3090 |
| 30–34B | 18–24 GB | RTX 3090 / RTX 4090 |
| 70B | 40–48 GB | 2× RTX 3090 (NVLink) eller A100 80 GB |
| 100B+ | 80 GB+ | A100/H100 80 GB, evt. flere |
Hele regnestykket – kvantisering, kontekstvindu og hva slags hastighet du kan forvente – er dekket i detalj i guiden Kjøre LLM lokalt: VRAM- og maskinvarekrav.
Når holder et consumer-kort?
Utprøving og pilotprosjekter: Skal bedriften teste om en lokal chatbot, RAG-løsning eller kodeassistent gir verdi, kan et avgrenset pilotoppsett være et utgangspunkt. Be om et oppdatert tilbud med GPU, server og nødvendige tilpasninger før du budsjetterer.
Inferens på modeller opp til ~30B: 24 GB VRAM dekker kvantiserte modeller i 30B-klassen med rom for kontekst. For mange interne bruksområder – oppsummering, søk i egne dokumenter, koding – er dagens 7–30B-modeller gode nok.
Én bruker eller lite team: Uten krav til samtidighet trenger du ikke datacenter-ytelse. En 4090 leverer titalls tokens per sekund på en 13B-modell – raskere enn de fleste leser.
Bildegenerering og mindre finjusteringer: Stable Diffusion-arbeidsflyter og LoRA-finjustering av små modeller kjører fint på 24 GB.
Når trenger du A100 eller H100?
Modeller over 30B på ett kort: Vil du kjøre 70B-klassen uten å dele modellen over flere kort, trenger du 48–80 GB VRAM. A100 80 GB kjører en kvantisert 70B-modell alene – med plass til stort kontekstvindu.
Rackmontert 24/7-drift: Passive datacenter-kort er designet for serverens luftstrøm og kan stå i et 2U-chassis i årevis. Consumer-kort i rackserver er alltid en improvisasjon: fysisk trangt, og viftene deres er ikke laget for servermiljø.
Flere brukere samtidig: Skal en modell serve mange ansatte samtidig (batching med vLLM e.l.), gir HBM-båndbredden og den større VRAM-en langt høyere total gjennomstrømming. MIG lar deg i tillegg dele ett kort trygt mellom miljøer.
Trening og finjustering av større modeller: Trening krever langt mer minne enn inferens, og her er ECC, NVLink og HBM ikke nice-to-have. Se Hvor mye GPU trenger du for å trene en AI-modell?
A100 40 GB til 95 000 kr er ofte det smarteste steget opp fra consumer: 40 GB VRAM mot 24 GB på et 4090, passiv serverkjøling, ECC og NVLink – til under halvparten av prisen for 80 GB-varianten.
Hvilken server skal GPU-en stå i?
GPU-en er bare halve regnestykket – den må stå i en maskin med nok strøm, kjøling og PCIe-baner:
For consumer-kort (3090/4090): Velg tower eller romslig chassis. HPE ML350 Gen10 (fra 28 500 kr) tar opptil 4 doble GPU-er og er bygget som stillegående tower – vår standardanbefaling for lokal AI. Dell-motstykket er Dell PowerEdge T640 (fra 28 000 kr) med samme plass til fire doble kort. Dell R7920 (fra 21 000 kr) er alternativet med dual Xeon og god plass til fulle kort.
For A100/H100: Rackservere med GPU-kjølekit – typisk Dell R740-familien eller HPE DL380 G10. Kortene er passive og trenger serverens luftstrøm. Vi konfigurerer server + GPU samlet, så kjøling og strømbudsjett stemmer.
For klyngeskala: Ferdigbygde AI-servere med 8× A100 (fra 1,6 mill. kr) eller 8× H100 (fra 3,75 mill. kr) – NVLink-koblet og klar for trening og tung produksjon.
Skal GPU-en deles mellom VM-er i Proxmox eller VMware, les guiden om GPU-passthrough.
Ofte stilte spørsmål
Hva er den billigste GPU-en for å kjøre en LLM lokalt?
Det rimeligste aktuelle valget avhenger av kravene og hvilke kort som er tilgjengelige. RTX 3090 omtales som et modelleksempel, ikke som et aktivt pristilbud. Se GPU-utvalget, eller kontakt oss med modell, minnebehov og budsjett.
Kan jeg sette et RTX 4090 i en rackserver?
Sjelden i praksis. Et 4090 er 3–4 slots bredt, opptil 34 cm langt og trenger egne vifter med fri luft – det passer ikke i 1U/2U-chassis. Velg en tower som HPE ML350 eller Dell R7920, eller gå til passive datacenter-kort (A100/H100) for rackmontering.
Hvorfor koster A100 så mye mer enn RTX 4090 når 4090 er «raskere»?
Du betaler for VRAM-mengde (40/80 GB vs 24 GB), HBM-båndbredde, ECC-minne, NVLink-skalering, MIG-partisjonering og passiv serverkjøling – egenskaper som avgjør om kortet kan stå i produksjon 24/7 og kjøre modeller som ikke får plass på et consumer-kort. På ren spillytelse er 4090 raskere; på stor-modell-inferens og trening er det ikke samme liga.
Har RTX 3090 og 4090 NVLink?
RTX 3090: ja, to kort kan kobles med NVLink-bro. RTX 4090: nei, NVIDIA fjernet NVLink fra 40-serien. To 4090 kan fortsatt brukes sammen over PCIe, men med lavere båndbredde mellom kortene. For ekte multi-GPU-skalering er A100/H100 bygget for jobben.
Er det trygt å kjøpe brukt GPU?
Ja, når kortet er testet. Datacenter-GPU-er har gått i temperaturstyrte servermiljøer og er ofte i bedre forfatning enn spillkort. Alle GPU-er fra Axentra er testet før salg og leveres med 2 års garanti.
Hvor mye strøm trekker kortene?
RTX 3090: ~350 W, RTX 4090: ~450 W, A100: 250–300 W, H100 PCIe: ~350 W. Serveren rundt kommer i tillegg. Sørg for at strømforsyningene er dimensjonert med margin – se guiden om strømforbruk og kjøling.
Hva med AMD-kort til lokal AI?
ROCm-støtten blir stadig bedre, men CUDA er fortsatt standarden i AI-verktøykjeden – de fleste rammeverk, modeller og guider antar NVIDIA. For en bedrift som vil ha ting til å virke uten friksjon, anbefaler vi NVIDIA.
Neste steg
Start med oppgaven: hvilken modellstørrelse trenger du, og hvor mange skal bruke den samtidig? HPE ML350 kan være utgangspunkt for et tilpasset oppsett, men GPU-er kjøpes separat. Be om en bekreftet komplett konfigurasjon og totalpris; den tidligere startpakken med RTX 3090 er ikke et aktivt pristilbud.
Usikker på konfigurasjonen? Få tilbud på ønsket konfigurasjon – vi setter opp server og GPU samlet, med 2 års garanti.
Usikker på hva du trenger?
Få en konkret pris på en konfigurasjon som passer ditt behov – vi svarer samme dag på hverdager.
Bestill eller spørRelaterte guider
Kjøpshjelp
Brukt server vs ny: når lønner det seg?
Brukte enterprise-servere koster typisk 60–85 % mindre enn nye og har ofte mye levetid igjen.
Les guideKjøpshjelp
Sjekkliste: kvalitetstest av brukt server
En seriøs forhandler tester alt – firmware, RAM, disker og nettverk. Se hva prosessen innebærer.
Les guideKjøpshjelp
Dimensjonering for virtualisering
Hvor mange kjerner, hvor mye RAM og hvilken lagring trenger VM-ene dine? Slik regner du.
Les guide