GPU for lokal AI: RTX 3090/4090 vs A100/H100

Oppdatert: juli 2026 · 8 min lesetid

Kort oppsummert

Den billigste veien til lokal AI er et brukt consumer-kort med 24 GB VRAM: RTX 3090 fra ca. 12 000 kr eller RTX 4090 fra ca. 23 000 kr. De kjører kvantiserte språkmodeller opp til ~30 mrd parametre. Datacenter-kortene A100 og H100 er verdt prishoppet først når du trenger mer enn 24 GB VRAM på ett kort, passiv kjøling i rackserver, ECC-minne for 24/7-drift eller skalering til flere kort.

Skal du kjøre språkmodeller (LLM) lokalt, er spørsmålet sjelden «hvilken GPU er best» – det er «hvilken GPU er billigst som løser min oppgave». Svaret for de fleste SMB-er er et brukt GeForce-kort med 24 GB VRAM. Et RTX 3090 til rundt 12 000 kr kjører en kvantisert 30B-modell like fint som kort til ti ganger prisen. A100 og H100 løser andre problemer: større modeller på ett kort, servertilpasset kjøling, ECC og skalering.

Denne guiden sammenligner kortene vi faktisk har på lager – RTX 3090, RTX 4090, A100 (40 og 80 GB) og H100 – og gir deg en konkret anbefaling per bruksområde. Gjelder det trening av modeller i stor skala, les heller A100 vs H100 for AI-trening.

Consumer vs datacenter: hva er egentlig forskjellen?

GeForce-kort (RTX 3090/4090) og datacenter-kort (A100/H100) bygger på samme CUDA-økosystem, og den samme koden kjører på begge. Forskjellene er fysiske og driftsmessige:

Minne: Consumer-kort bruker GDDR6X uten ECC. Datacenter-kort bruker HBM med ECC – høyere båndbredde og automatisk feilkorrigering. For inferens hjemme betyr ECC lite; for uker lange treningsjobber og 24/7 produksjon betyr det mye.

Kjøling: RTX-kort har vifter og trenger fri luft rundt seg – de er laget for PC-kabinett. A100/H100 er passive: de har ingen egne vifter og krever en server med kraftig gjennomstrømming (f.eks. Dell R740 eller HPE DL380 med GPU-kit). Det gjør at datacenter-kort passer i 2U-rackservere der et 3-slots RTX 4090 aldri får plass.

NVLink og skalering: RTX 3090 støtter NVLink mellom to kort; RTX 4090 har ikke NVLink i det hele tatt. A100/H100 er bygget for å kobles sammen med høy båndbredde – avgjørende når én modell må deles over flere kort. Les mer i Hva er NVLink?

MIG (Multi-Instance GPU): A100 og H100 kan partisjoneres i opptil sju isolerte GPU-instanser – nyttig når flere team eller VM-er skal dele ett kort.

Lisens: NVIDIAs driveravtale for GeForce tillater ikke bruk i datasenter-sammenheng (unntatt blokkjede). For intern bruk på egen server i egen bedrift er dette i praksis et lite hinder, men i regulerte miljøer og hos hostingleverandører er datacenter-kort det ryddige valget.

Sammenligningstabell med priser

Prisene hentes fra egen katalog og oppdateres løpende – se produktsidene for lagerstatus.

Kort VRAM Minnebåndbredde ECC / NVLink Kjøling Pris (brukt) Kr per GB VRAM
Quadro P4000 8 GB ~243 GB/s Nei / Nei Aktiv, 1 slot 2 900 kr ~360 kr
RTX 3090 24 GB ~936 GB/s Nei / Ja (2 kort) Aktiv, 3 slots 12 000 kr ~500 kr
RTX 4090 24 GB ~1 008 GB/s Nei / Nei Aktiv, 3–4 slots 23 000 kr ~960 kr
A100 40 GB 40 GB ~1 555 GB/s Ja / Ja Passiv (server) 95 000 kr ~2 400 kr
A100 80 GB 80 GB ~1 935 GB/s Ja / Ja Passiv (server) 250 000 kr ~3 150 kr
H100 80 GB 80 GB ~2 000 GB/s Ja / Ja Passiv (server) 500 000 kr ~6 250 kr

Legg merke til kolonnen lengst til høyre: per gigabyte VRAM er RTX 3090 det klart billigste kortet. Det er derfor det er standardvalget i homelab- og eksperimentmiljøer verden over.

VRAM er tallet som betyr mest

For LLM-inferens avgjør VRAM hvilke modeller du i det hele tatt kan kjøre – før hastighet betyr noe. En 4-bit kvantisert modell trenger grovt regnet 0,6 GB VRAM per milliard parametre, pluss plass til kontekst:

Modellstørrelse (4-bit) VRAM-behov Billigste kort fra lager
7–8B (Mistral 7B, Llama 8B) 5–8 GB Quadro P4000 (tregt) / RTX 3090
13–14B 9–12 GB RTX 3090
30–34B 18–24 GB RTX 3090 / RTX 4090
70B 40–48 GB 2× RTX 3090 (NVLink) eller A100 80 GB
100B+ 80 GB+ A100/H100 80 GB, evt. flere

Hele regnestykket – kvantisering, kontekstvindu og hva slags hastighet du kan forvente – er dekket i detalj i guiden Kjøre LLM lokalt: VRAM- og maskinvarekrav.

Når holder et consumer-kort?

Utprøving og pilotprosjekter: Skal bedriften teste om en lokal chatbot, RAG-løsning eller kodeassistent gir verdi, er en RTX 3090 til 12 000 kr den suverent billigste billetten. Feiler piloten, har du tapt lite; lykkes den, vet du nøyaktig hva du skal skalere til.

Inferens på modeller opp til ~30B: 24 GB VRAM dekker kvantiserte modeller i 30B-klassen med rom for kontekst. For mange interne bruksområder – oppsummering, søk i egne dokumenter, koding – er dagens 7–30B-modeller gode nok.

Én bruker eller lite team: Uten krav til samtidighet trenger du ikke datacenter-ytelse. En 4090 leverer titalls tokens per sekund på en 13B-modell – raskere enn de fleste leser.

Bildegenerering og mindre finjusteringer: Stable Diffusion-arbeidsflyter og LoRA-finjustering av små modeller kjører fint på 24 GB.

Når trenger du A100 eller H100?

Modeller over 30B på ett kort: Vil du kjøre 70B-klassen uten å dele modellen over flere kort, trenger du 48–80 GB VRAM. A100 80 GB kjører en kvantisert 70B-modell alene – med plass til stort kontekstvindu.

Rackmontert 24/7-drift: Passive datacenter-kort er designet for serverens luftstrøm og kan stå i et 2U-chassis i årevis. Consumer-kort i rackserver er alltid en improvisasjon: fysisk trangt, og viftene deres er ikke laget for servermiljø.

Flere brukere samtidig: Skal en modell serve mange ansatte samtidig (batching med vLLM e.l.), gir HBM-båndbredden og den større VRAM-en langt høyere total gjennomstrømming. MIG lar deg i tillegg dele ett kort trygt mellom miljøer.

Trening og finjustering av større modeller: Trening krever langt mer minne enn inferens, og her er ECC, NVLink og HBM ikke nice-to-have. Se Hvor mye GPU trenger du for å trene en AI-modell?

Mellomtrinnet mange overser:

A100 40 GB til 95 000 kr er ofte det smarteste steget opp fra consumer: nesten dobbelt så mye VRAM som et 4090, passiv serverkjøling, ECC og NVLink – til under halvparten av prisen for 80 GB-varianten.

Hvilken server skal GPU-en stå i?

GPU-en er bare halve regnestykket – den må stå i en maskin med nok strøm, kjøling og PCIe-baner:

For consumer-kort (3090/4090): Velg tower eller romslig chassis. HPE ML350 G10 (fra 22 500 kr) tar opptil 4 doble GPU-er og er bygget som stillegående tower – vår standardanbefaling for lokal AI. Dell R7920 (fra 25 000 kr) er alternativet med dual Xeon og god plass til fulle kort.

For A100/H100: Rackservere med GPU-kjølekit – typisk Dell R740-familien eller HPE DL380 G10. Kortene er passive og trenger serverens luftstrøm. Vi konfigurerer server + GPU samlet, så kjøling og strømbudsjett stemmer.

For klyngeskala: Ferdigbygde AI-servere med 8× A100 (fra 1,6 mill. kr) eller 8× H100 (fra 3,75 mill. kr) – NVLink-koblet og klar for trening og tung produksjon.

Skal GPU-en deles mellom VM-er i Proxmox eller VMware, les guiden om GPU-passthrough.

Ofte stilte spørsmål

Hva er den billigste GPU-en for å kjøre en LLM lokalt?

Brukt RTX 3090 med 24 GB VRAM – fra ca. 12 000 kr. Den kjører kvantiserte modeller opp til ~30 mrd parametre og har best pris per GB VRAM av alle kort i katalogen. Skal du bare eksperimentere med 7B-modeller, fungerer også en Quadro P4000 til 2 900 kr, men ytelsen er begrenset.

Kan jeg sette et RTX 4090 i en rackserver?

Sjelden i praksis. Et 4090 er 3–4 slots bredt, opptil 34 cm langt og trenger egne vifter med fri luft – det passer ikke i 1U/2U-chassis. Velg en tower som HPE ML350 eller Dell R7920, eller gå til passive datacenter-kort (A100/H100) for rackmontering.

Hvorfor koster A100 så mye mer enn RTX 4090 når 4090 er «raskere»?

Du betaler for VRAM-mengde (40/80 GB vs 24 GB), HBM-båndbredde, ECC-minne, NVLink-skalering, MIG-partisjonering og passiv serverkjøling – egenskaper som avgjør om kortet kan stå i produksjon 24/7 og kjøre modeller som ikke får plass på et consumer-kort. På ren spillytelse er 4090 raskere; på stor-modell-inferens og trening er det ikke samme liga.

Har RTX 3090 og 4090 NVLink?

RTX 3090: ja, to kort kan kobles med NVLink-bro. RTX 4090: nei, NVIDIA fjernet NVLink fra 40-serien. To 4090 kan fortsatt brukes sammen over PCIe, men med lavere båndbredde mellom kortene. For ekte multi-GPU-skalering er A100/H100 bygget for jobben.

Er det trygt å kjøpe brukt GPU?

Ja, når kortet er testet. Datacenter-GPU-er har gått i temperaturstyrte servermiljøer og er ofte i bedre forfatning enn spillkort. Alle GPU-er fra Axentra er testet før salg og leveres med 2 års garanti.

Hvor mye strøm trekker kortene?

RTX 3090: ~350 W, RTX 4090: ~450 W, A100: 250–300 W, H100 PCIe: ~350 W. Serveren rundt kommer i tillegg. Sørg for at strømforsyningene er dimensjonert med margin – se guiden om strømforbruk og kjøling.

Hva med AMD-kort til lokal AI?

ROCm-støtten blir stadig bedre, men CUDA er fortsatt standarden i AI-verktøykjeden – de fleste rammeverk, modeller og guider antar NVIDIA. For en bedrift som vil ha ting til å virke uten friksjon, anbefaler vi NVIDIA.

Neste steg

Start med oppgaven, ikke kortet: hvilken modellstørrelse trenger du, og hvor mange skal bruke den samtidig? For de fleste er svaret en RTX 3090 eller 4090 i en ML350 – en komplett lokal AI-maskin fra rundt 35 000 kr. Trenger du 70B-klassen eller 24/7-produksjon i rack, er A100 riktig steg opp.

Usikker på konfigurasjonen? Få tilbud på ønsket konfigurasjon – vi setter opp server og GPU samlet, med 2 års garanti.

Usikker på hva du trenger?

Få en konkret pris på en konfigurasjon som passer ditt behov – vi svarer samme dag på hverdager.

Få tilbud