Thinking Machines Inkling: åpen-vekt-modellen for norske SMB, med forbehold
Mira Muratis selskap Thinking Machines Lab slapp 15. juli 2026 sin første åpne modell, kalt Inkling. 975 milliarder parametere totalt, 41 milliarder aktive per token, opp til 1 million tokens kontekstvindu, og fullt åpen under Apache 2.0 (Thinking Machines). For en norsk SMB-leder som vurderer AI-leverandører betyr det tre konkrete ting: du kan laste ned modellvektene, du kan kjøre dem i EU uten å sende data til USA, og du slipper den dyre avhengigheten til én API-leverandør som kan endre prisen i morgen.
Samtidig må vi være ærlige. Inkling er ikke den sterkeste modellen på markedet. Thinking Machines skriver det selv: "It is not the most performant model available today, closed or open." På HLE text only scorer Inkling 30 prosent, mens Claude Fable 5 scorer 53,3 prosent (Thinking Machines benchmarks). Den er bygget for soliditet og åpenhet, ikke for å slå frontier-modellene på enhver test. Det er et bevisst valg, og for mange norske SMB er det akkurat det de trenger.
Hva er egentlig nytt med Inkling?
Inkling er en MoE-transformer (mixture-of-experts) med 66 lag, der hver token aktiverer 6 av 256 eksperter, pluss 2 delte eksperter. Det betyr at du får kapasiteten til en 975 milliarders modell, men beregningskostnaden til en 41 milliarders modell per spørring (Thinking Machines modellkort).
Tre ting skiller den fra de fleste andre åpne modellene i 2026:
- Multimodal fra bunnen av. Inkling er trent på 45 billioner tokens tekst, bilde, lyd og video i samme pre-training-run. Den bruker en encoder-fri arkitektur for lyd (diskrete dMel-spektrogrammer) og 40x40 bildepatches via en fire-lags hMLP. For norske SMB som vil behandle kundeopptak, produktbilder og dokumenter i samme arbeidsflyt er dette relevant.
- Variabel tenkedybde. Du kan justere hvor mye modellen "tenker" per oppgave, fra 0.2 til 0.99. På Terminal Bench 2.1 bruker Inkling en tredjedel så mange tokens som Nemotron 3 Ultra for samme resultat (Thinking Machines). Det påvirker pris og responstid direkte.
- Styrket epistemikk. Inkling er trent for å være kalibrert på prognoser, ikke overtro mot seg selv. På ForecastBench uten søk scorer den 61.1 prosent, bedre enn GPT-5.5 sine 59.1 og Claude Opus 4.8 sine 54.6. For saksbehandling og beslutningsstøtte er dette viktigere enn rå resonneringsscore.
Hvorfor er dette interessant for norske SMB?
Den viktigste grunnen er kontroll. Med en lukket modell via API er du alltid gjest i noen andres hus. De kan endre prisen, de kan endre vilkårene, de kan endre hvilken modell som faktisk svarer bak kulissene. Vi har sett dette flere ganger de siste månedene, blant annet i saken om ChatGPT Work og datasletting og i Anthropic sin agent-SDK-pause i juni.
Apache 2.0 + åpne vekter snur dette. Du eier distribusjonen. Du kan kjøre den hos en EU-host, du kan finetune den på dine egne data, og du slipper å sende bedriftskritisk informasjon gjennom et API der du ikke vet hvordan dataene brukes.
For norske SMB er det spesielt relevant å se dette som et vestlig åpen-vekt-alternativ til kinesiske modeller. DeepSeek V4 Pro og Qwen er teknisk sterke og populære i åpen-vekt-miljøet, men for en norsk bedrift med kundedata, offentlige anskaffelser eller forsvarsrelaterte kunder er leverandørlandet til vektene en helt sentral del av vurderingen. Inkling er trent i San Francisco, på NVIDIA GB300 NVL72, og vektene ligger på Hugging Face.
Hva krever det å kjøre Inkling?
Her kommer den mindre hyggelige nyheten. Full presisjon (BF16) krever rundt 2 TB VRAM aggregert. Med NVFP4-kvantisering er kravet rundt 600 GB. Det er maskinvare som koster millioner av kroner å skaffe og drifte, og det er utenfor rekkevidde for de aller fleste norske SMB.
Varsellampe for SMB: Full self-host av Inkling er i 2026 et prosjekt for en stor teknologiavdeling eller en spesialisert hosting-leverandør, ikke for en regnskapsfører med åtte ansatte.
Den realistiske veien inn for en SMB er en av tre:
- Tinker-API for finetuning. Tinker er Thinking Machines sin plattform for trening, sluppet oktober 2025. Du sender data, de trener en tilpasset versjon av Inkling for deg, og du får en modell du kan bruke. Prisen er ikke offentlig annonsert ennå, men den er atskilt fra inferens-prisingen (Thinking Machines).
- Hostet inference. Flere leverandører vil tilby Inkling som en API-tjeneste de neste ukene, inkludert gjennom SGLang, vLLM, TokenSpeed og Unsloth. For en SMB som vil bruke modellen uten å drifte den selv er dette inngangspunktet.
- EU-hostet on-prem via partner. For SMB i regulerte bransjer (helse, finans, offentlig) kan en norsk eller nordisk GPU-hosting-partner være riktig vei. Da får du kontroll på dataene uten å kjøpe GPU-klyngen selv.
Hva kan Inkling brukes til i praksis?
Vi ser fire konkrete bruksområder der Inkling passer godt for norske SMB, og der den åpne lisensen faktisk gir mening:
- Finetuning på norske fagdata. Et regnskapsbyrå kan trene en Inkling-variant på norsk regnskapsstandard (NGAAP), et advokatfirma på norsk juridisk praksis, et helseforetak på norske pasientjournallinjer. Det er dette vi i AIKI hjelper kunder med å gjøre gjennom AI Kickstart, der vi bygger en produksjonsklar arbeidsflyt på 1-4 uker til fast pris.
- Agent-systemer med kontrollert datatilgang. Inkling er trent for å være god på agent-arbeid, og trent med varierte verktøy som fungerer i praksis. For SMB som bygger autonome agenter er Inkling et alternativ til de dyre lukkede modellene.
- Multimodal dokumentflyt. Inkling håndterer tekst, bilde, lyd og video i samme modell. For SMB som vil bygge en kundeservice som leser PDF, lytter til opptak og svarer i chat er dette en forenkling sammenliknet med å holde fire spesialiserte modeller i luften.
- Prognoser og beslutningsstøtte. Inkling scorer høyt på kalibrerte prognoser, bedre enn GPT-5.5 og Claude Opus 4.8. For SMB som jobber med etterspørselsprognoser, prisanalyser eller risikoevaluering er dette et konkret bruksområde.
Tre grep AIKI anbefaler denne uken
1. Kartlegg én arbeidsflyt der du sender sensitiv data til et API i dag. Ikke bytt alt på én gang. Velg ett konkret tilfelle, for eksempel kontraktsanalyse eller kundelogg-analyse, og vurder om Inkling via en EU-host kan erstatte API-kallet. Vi i AIKI gjør dette på 1-2 uker gjennom en AI-Revisjon, der vi også ser på totalkostnad per løste oppgave.
2. Test Inkling mot modellen du bruker i dag på din egen data. Når hostet inference er tilgjengelig i Norge (de neste ukene), kjør en A/B-test. Mål både kvalitet og kostnad per oppgave. En modell som scorer 10 prosent lavere, men koster halvparten, kan være et bedre valg for høyvolum-jobber. Vi har tidligere skrevet om hvorfor AI-regningen eksploderer for mange SMB, og dette er en konkret motgift.
3. Sett en policy for når åpen-vekt er riktig valg. Ikke bruk Inkling til alt, og ikke bruk den til ingen ting. Lag en intern regel: oppgaver med sensitive data, norsk fagspråk eller behov for tilpasning går via en åpen modell. Standard oppgaver som ikke krever spesiell tilpasning kan fortsatt bruke de beste lukkede modellene. Dette er den samme logikken vi anbefaler for AI-priser og modellvalg for norske SMB.
Hva Inkling ikke er
For å være tydelige, slik Thinking Machines selv er det:
- Ikke SOTA på resonnering. 30 prosent på HLE text only mot Fable 5 sine 53,3 er et stort gap. For krevende kodebase-migrasjon eller lang, kompleks dokumentanalyse er lukkede frontier-modeller fortsatt et bedre valg.
- Ikke gratis å kjøre selv. Infrastrukturkostnaden er høy. Det som er gratis er vektene og lisensen, ikke driften.
- Ikke en erstatning for compliance-arbeid. En åpen modell løser ikke GDPR, personvern eller databehandleravtale. Du må fortsatt ha kontroll på dataflyten.
Oppsummert
Inkling er ikke den modellen som vinner benchmark-tabellen. Den er modellen som gir norske SMB et reelt alternativ til å bygge hele AI-strategien på API-et til én amerikansk leverandør. For en SMB-leder som har brukt 2025 på å lure på om AI er verdt pengene, og som nå vil ha mer kontroll på både kostnad og datasuverenitet, er dette et modent verktøy å begynne å teste.
Den viktigste endringen Inkling bringer er ikke teknisk. Det er at åpne modeller i 2026 er gode nok for produksjon i mange SMB-scenarier, og at Apache 2.0 + tilgjengelige vekter gir en forhandlingsposisjon du ikke har når du er hundre prosent låst til ett API.
Vi følger med på når hostet inference i EU-region blir tilgjengelig for norske kunder, og oppdaterer artikkelen så fort vi har konkrete tall fra et norsk produksjonsmiljø.
Vil du vite hvordan en konkret arbeidsflyt i din bedrift kan flyttes til en åpen modell uten å miste kvalitet? Book en uforpliktende samtale med oss, eller start med en AI-Revisjon for å kartlegge hvor åpne modeller faktisk lønner seg i din drift.
Ofte stilte spørsmål om Thinking Machines Inkling
Hva er Thinking Machines Inkling?
Inkling er en åpen-vekt multimodal LLM fra Thinking Machines Lab, grunnlagt av Mira Murati. Modellen ble sluppet 15. juli 2026 med 975 milliarder totale parametere og 41 milliarder aktive per token, 1 million tokens kontekstvindu og Apache 2.0-lisens. Vektene er tilgjengelig på Hugging Face.
Er Inkling like bra som GPT-5.6 eller Claude Fable 5?
Nei. Thinking Machines er selv tydelige på at Inkling ikke er den sterkeste modellen på markedet. På de fleste benchmarks scorer den under Claude Fable 5 og GPT-5.6 Sol. Poenget med Inkling er at du får en solid åpen modell du kan eie og tilpasse, ikke at den skal slå de beste lukkede modellene.
Kan en norsk SMB kjøre Inkling selv på kontoret?
Ikke i full skala. Full presisjon krever rundt 2 TB VRAM aggregert. NVFP4-kvantisert er kravet rundt 600 GB. Det er infrastruktur som koster millioner. Den realistiske veien for SMB er Tinker-API for finetuning eller hostet inference hos en EU-leverandør.
Hva betyr Apache 2.0 i praksis?
Apache 2.0 gir deg kommersiell bruksrett, rett til å modifisere, rett til å redistribuere, og en patentklausul som beskytter deg mot patentkrav fra bidragsyterne. For en norsk SMB som bygger et produkt med AI i kjernen betyr det at du kan bruke Inkling som grunnlag uten å betale lisens eller dele omsetning.
Hvorfor er Inkling interessant for norske SMB hvis den ikke er best?
Tre grunner. Du slipper å være låst til én API-leverandør som kan endre pris eller vilkår. Du kan finetune på norske fagdata uten å sende dem til en amerikansk sky. Og du får et vestlig åpen-vekt-alternativ til kinesiske modeller som DeepSeek V4 Pro og Qwen, som mange norske virksomheter er skeptiske til av datasuverenitetshensyn.
Hva er Tinker og hvorfor er det relevant?
Tinker er Thinking Machines sin plattform for finetuning, sluppet oktober 2025. Den lar deg trene tilpassede versjoner av Inkling på dine egne data uten å drifte GPU-klyngen selv. For SMB som vil bygge en norsk spesialmodell for kontraktanalyse, saksbehandling eller kundedialog er dette det mest konkrete inngangspunktet. /usr/bin/bash: line 5: /tmp/hermes-snap-1e4063f7f7cb.sh: No such file or directory /usr/bin/bash: line 6: /tmp/hermes-cwd-1e4063f7f7cb.txt: No such file or directory /usr/bin/bash: line 5: /tmp/hermes-snap-1e4063f7f7cb.sh: No such file or directory /usr/bin/bash: line 6: /tmp/hermes-cwd-1e4063f7f7cb.txt: No such file or directory /usr/bin/bash: line 5: /tmp/hermes-snap-25f3ad572298.sh: No such file or directory /usr/bin/bash: line 6: /tmp/hermes-cwd-25f3ad572298.txt: No such file or directory /usr/bin/bash: line 5: /tmp/hermes-snap-25f3ad572298.sh: No such file or directory /usr/bin/bash: line 6: /tmp/hermes-cwd-25f3ad572298.txt: No such file or directory



