Den 11. august lanserte Nvidia Nemotron 3.5 Lightning, en åpen AI-modell bygget for å kjøre raskt på vanlig kontor-maskinvare. Samme dag kom følgesvennen NeMo Switchyard, et åpent routing-bibliotek som fordeler oppgaver mellom modeller. For en norsk SMB som vurderer lokal AI er dette nyheten vi har ventet på.
Hva er egentlig nytt?
Nemotron 3.5 Lightning er en hybrid Mamba-Transformer-modell med 31,6 milliarder totale parametere, men bare 3,6 milliarder aktive per steg (Nvidia, The Decoder). MoE-arkitekturen gjør at modellen "velger" hvilke parametere den vil bruke for hver oppgave, slik at den holder seg rask uten å ofre kvalitet.
De viktigste tallene, ifølge The Decoders testrapport:
- ~670 tokens per sekund på NVFP4-vekter, dobbelt så raskt som Gemini 3.5 Flash-Lite.
- Intelligence Index 24, lik OpenAIs gpt-oss-120b, men med en fjerdedel av aktive parametere.
- GDPval-AA v2 Elo 824, som slår gpt-oss-120b (800) på agent-arbeid.
- Terminal-Bench v2.1: 24,3 %, nær gpt-oss-120b sine 26,2 %.
Hacker News-diskusjonen (258 poeng, 135 kommentarer) tyder på at utviklere tar dette alvorlig, blant annet fordi SGLang la til Day-0-støtte og Ollama leverer modellen ferdig pakket for lokal kjøring.
Hvorfor kjører den på kontoret ditt?
Den praktiske grensen for lokal AI har lenge vært GPU-minne. Nemotron 3.5 Lightning kommer i to vekt-formater:
- BF16 krever om lag 60 GB VRAM (typisk to RTX 4090 eller én A6000).
- NVFP4 komprimerer vektene til rundt 24 GB VRAM, som betyr at den kjører på én RTX 4090 eller en RTX PRO-arbeidsstasjon.
Nvidia selv viser at den kjører på RTX-PC-er, DGX Spark, DGX Station og Jetson, alt fra kontorutstyr til industrimaskiner. For en norsk SMB som vil holde data internt av GDPR- eller kundeårsaker, betyr dette at du slipper å sende kundedata til en amerikansk API.
Hva betyr dette for norske bedrifter?
Den største endringen er at små modeller endelig er gode nok til agent-arbeid. Nvidia-forskning viser at modeller under 10 milliarder aktive parametere kan håndtere de fleste agent-oppgaver like bra som 70- til 175-milliarder-modeller, til en tiendedel eller trettiendedel av kostnaden. Nemotron 3.5 Lightning treffer dette perfekt.
Tre konkrete brukstilfeller vi ser for norske kunder:
1. Intern kundeservice-agent. Mange av oss bruker i dag en stor skybasert modell til å svare på enkle spørsmål fra kunder. Med Nemotron 3.5 Lightning på en lokal arbeidsstasjon kan samme agent kjøre på kundens egne data uten å forlate kontoret. Responstiden går fra 2-4 sekunder til under ett sekund, og personvernhensyn er løst.
2. Logganalyse og varsling. CrowdStrike bruker lignende modeller til sikkerhetsovervåking. For en norsk SMB med SOC2- eller ISO27001-krav kan lokal kjøring gjøre det enklere å holde loggene på egne servere.
3. Dokumentarbeid og møtereferater. Med en kontekstvindu på 1 million tokens kan modellen lese inn hele årsregnskap, lange kontrakter eller et helt kvartals møtenotater på én kjøring. Det er et nivå som tidligere krevde enten sky-API eller svært dyr lokal maskinvare.
Hva er NeMo Switchyard?
Sammen med modellen lanserte Nvidia NeMo Switchyard, et åpent bibliotek som ruter hver forespørsel til den modellen som passer best. Tenk på det som en "AI-trafikk-kontroller":
- Enkle klassifiseringsoppgaver går til en liten modell som Nemotron 3.5 Lightning.
- Komplekse resonnementoppgaver sendes til en større modell som Nemotron 3 Ultra eller en av de kommersielle alternativene.
- Du setter opp reglene én gang, så optimaliserer Switchyard kvalitet, latens og kostnad automatisk.
Nvidia melder at LangChain brukte Switchyard til å kutte kostnadene med 74 % i et 145-trinns agent-oppsett, ved å rute bare 7 % av kallene til en stor modell med 6 % nøyaktighetstap. For en norsk SMB kan dette bety at du betaler API-regning kun for de vanskelige spørsmålene, og kjører resten lokalt.
Er dette bare enda en åpen modell?
Vi har sett flere åpne modeller de siste månedene. Det som skiller Nemotron 3.5 Lightning er kombinasjonen av tre ting:
- Åpen lisens (OpenMDW-1.1) som tillater kommersiell bruk uten restriksjoner.
- Bred maskinvare-støtte fra RTX-kontorutstyr til data-senter.
- Modent økosystem med Ollama, SGLang, DeepInfra og OpenRouter fra dag én.
Modeller som DeepSeek V4 Pro og Qwen3.6 er sterkere på ren intelligens, men de krever typisk 4-8 GPU-er for full kjøring. For norske SMB-er med begrenset maskinvare er Lightning et mer realistisk sted å starte.
Hva bør du gjøre nå?
Hvis du vurderer lokal AI i 2026:
- Kartlegg maskinvaren du har. Har du en arbeidsstasjon med NVIDIA-GPU? Hvor mye VRAM? (Se vår AI-revisjon for en konkret vurdering.)
- Test modellen selv. Last ned NVFP4-versjonen fra Hugging Face og prøv den på dine egne data. Bruk Ollama for enklest mulig oppsett.
- Vurder en pilot. En konkret arbeidsflyt (kundesvar, dokumentoppsummering, kvalitetskontroll) over 4-6 uker gir deg et reelt tall å evaluere. (AI Kickstart er bygget for akkurat dette.)
For de fleste norske SMB-ene vi snakker med er ikke spørsmålet lenger "kan vi bruke AI", men "hvilken modell, på hvilken maskinvare, og med hvilken datakontroll". Nemotron 3.5 Lightning er et godt svar på alle tre.
Kilder: Nvidia-blogg (Kari Briski), The Decoder, SGLang Day-0-støtte, Ollama, DeepInfra.



