
Kimi K3 er den første åpne AI-modellen som for alvor utfordrer de beste lukkede modellene på kvalitet. Det gjør lanseringen interessant av en grunn som er større enn selve modellen: Når flere kan tilby den samme AI-en, kan konkurransen øke, prisene presses ned og makten flyttes bort fra én leverandør.

16. juli 2026 slapp kinesiske Moonshot AI sin nyeste modell: Kimi K3. På Arena sitt frontend-leaderboard toppet modellen listen da den kom, foran anerkjente modeller som Claude Fable 5 og GPT-5.6 Sol. Dette er imponerende i seg selv, men ekstra imponerende når modellen i tillegg er åpen. Nå etter vektene ble sluppet til allmenheten 27. juli, er modellen fortsatt på andreplass, kun bak Claude Opus 5, Anthropic sin nye toppmodell. For en åpen modell synes jeg virkelig det er noe verdt å legge merke til.

Åpne modeller har ligget noe bak frontier, de beste i klassen, ganske lenge nå. De har vært gode nok til å imponere, men de fleste har likevel gått tilbake til mer anerkjente modeller som Claude, GPT eller lignende når de faktisk skal få gjort noe. Selv har jeg kjørt agentene mine på lukkede tredjeparts-modeller som disse hele veien. De har så langt vist til best resultater, med ganske god margin.
Derfor syns jeg det er ganske stort at en åpen modell presterer i toppen på flere benchmarks. Kan det være starten på et noe friere marked for oss sluttbrukere? Kanskje det, men før vi tar helt av, er det greit å definere hva «åpen» egentlig betyr i denne konteksten. Ja, modellens vekter er åpne for nedlasting, slik at alle i teorien bruke den. Modellen er likevel såpass stor at så og si ingen sluttbrukere vil kunne kjøre den lokalt på «vanlige» maskiner. Så hva er de åpne vektene egentlig verdt for oss som uansett ender opp med å måtte kjøpe tokens?
Kimi K3 har hele 2,8 billioner parametere, og er en mixture of experts-modell. Dette betyr at den internt splittes til mindre ekspert-modeller. Moonshot omtaler den selv som den første åpne modellen i 3T-klassen (modeller med omtrent 3 billioner parametre). Kontekstvinduet er på 1 million tokens, og den har native vision, så bilde-forståelse fungerer rett i modellen i stedet for å måtte gå gjennom et annet lag.
.png)
Uten å grave oss for mye ned i det tekniske, er den største nyvinningen i Kimi K3 to nye komponenter. Den første er Kimi Delta Attention, en mer effektiv form for attention som gjør det billigere å skalere modellen når konteksten blir lang. Den andre er Attention Residuals, som lar modellen plukke ut nyttig informasjon fra tidligere lag der det trengs, i stedet for å dra alt med seg gjennom hele modellen. Dette er i følge Moonshot grunnen til at Kimi K3 kan ha et kontekstvindu på 1M uten at prisen løper helt løpsk.
På Arena settes to modeller opp mot hverandre på ekte oppgaver, og lar folk stemme på hvilket av resultatene de foretrekker. Man vet ikke hvilken modell man vurderer, og oppgavene er laget for å være så nærme som mulig det som faktisk bygges i dag. Jeg mener dette gir et godt bilde på hvor god en modell er i praksis, i motsetning til å kun lene seg på vanlige benchmarks.
På Arena sin Frontend Code Arena tok kimi-k3 førsteplassen da den kom, med en score på 1679. Nå ligger kimi-k3-max på andreplass med 1682, nylig passert av Claude Opus 5, men fortsatt foran både claude-fable-5 på 1629 og gpt-5.6-sol-xhigh på 1623. Dette kan dog endre seg over tid, da både Kimi K3 og Claude Opus 5 er merket som «Preliminary» på grunn av hvor nye de er.
Men, selv med det forbeholdet er det en drastisk forbedring fra forrige modell. Da K3 kom, lå Kimi K2.6 på 18. plass på samme leaderboard, så modellen flyttet seg 17 plasser på én generasjon, i et felt der både Anthropic og OpenAI slapp noe nytt i samme periode.
Å bygge pen frontend og å være en god modell generelt er likevel to ganske forskjellige ting. Selv om Arena sin frontend-benchmark er den mest imponerende, viser K3 seg å være generelt ganske nærme frontier. Artificial Analysis har K3 like bak toppen på intelligens-indeksen sin, med 57,1, kun bak Claude Fable 5, GPT-5.6 Sol og Opus 5. Den ligger også nær toppen på flere av de andre indeksene, blant annet på tredjeplass på AA-Briefcase (agentisk kunnskapsarbeid). Selv om K3 ikke når helt opp, er det å være såpass nærme toppen imponerende for en åpen modell.
Blant andre åpne modeller har den ingen reell konkurranse. De 1682 poengene som holder til andreplass totalt, gjør den samtidig til den beste åpne modellen på frontend, foran GLM-5.2 på 1587. K3 topper også Agent-arenaen deres, som måler modellene på ekte agent-oppgaver som går over mange steg, med søk, filsystem og terminal. Der får kimi-k3-max en netto forbedring på 9,75% (hvor mye den løfter resultatet sammenlignet med en gjennomsnittsmodell) mot GLM-5.2 sine 7,12%, altså en god margin ned til nest beste åpne modell.
.png)
Dersom du vil bruke Kimi K3 i dag, er det enkleste fortsatt å gå gjennom Moonshot sitt eget API på https://api.moonshot.ai/v1. Prisen der er $3 per million tokens inn og $15 ut, med cache-treff på $0.30. Opus 4.8 ligger på $5 og $25, og Opus 5 til samme pris, så K3 er rundt 40 % billigere per token enn Anthropic sin toppmodell uansett hvilken du sammenligner med. På fart er det derimot omvendt: Artificial Analysis måler nå K3 til rundt 32 tokens i sekundet, mot Opus sine 57, altså tregere, og under medianen i prisklassen.
40% er en reell forskjell, men den er i praksis noe mindre enn den ser ut som ved første øyekast. Tenkingen er per i dag alltid tvunget til å være påskrudd, som bruker mange ord og tokens, på veien til et svar. reasoning_effort støtter low, high og max, med max som standard, så du kan skru innsatsen ned for enklere oppgaver. Billigere per token er dermed ikke helt det samme som billigere per ferdigstilte oppgave.
Så, selv om du ikke sparer så mye på Kimi K3 i dag, er det likevel interessant å se på hvem som setter prisen, og hvor lenge de får lov til å sette den alene.
Med vektene ute kan i prinsippet hvem som helst med nok maskinvare kjøre Kimi K3. Det høres ut som en teknikalitet, men det er en markant forskjell for deg som kunde.
Det som skiller en åpen modell fra en lukket, er hvem som kan kjøre den. Opus kan du kjøpe flere steder: direkte fra Anthropic, gjennom AWS Bedrock, eller gjennom Google Vertex. Prisene varierer, men ingen av dem kan kjøre modellen uten Anthropic. Vektene er Anthropics, så det er Anthropic som bestemmer hva forhandlerne har å selge, hvilke rate limits som gjelder, og om modellen finnes til neste år. Dette fungerer greit, for verdien man får ut er stor, men den har én markant nedside: Anthropic setter prisen. Med åpne modeller som K3 blir det flere som selger den samme modellen, og da blir det vanskeligere for én aktør å skru opp prisen alene.
Akkurat hvem som får selge den videre, avhenger likevel av lisensen. K3 ligger ute under en egen Kimi K3-lisens. Den lar deg i utgangspunktet både laste ned, kjøre og selge inferens på modellen, men med et forbehold: driver du et Model as a Service-tilbud, altså at du gir andre tilgang til modellen, og omsetter for mer enn 20 millioner dollar over tolv måneder, må du inngå en egen avtale med Moonshot før du kan bruke den kommersielt. Intern bruk, og bruk gjennom Moonshot sine egne eller sertifiserte inferens-partnere, er unntatt dette. Det ligner altså en del på hvordan Llama sin lisens fungerer, i motsetning til en modell der du fritt kan videreselge. For mindre aktører spiller det ikke en så stor rolle, men for store MaaS-selskapene, de som i teorien kan presse prisen mest, må sannsynligvis innom Moonshot først.
Størrelsen på K3 smalner leverandør-markedet ytterligere inn, for med 2,8 billioner parametere, 1,5 TB med vekter og en anbefaling på 64 akseleratorer, er terskelen betraktelig høyere enn eksempelvis DeepSeek R1 sine 671 milliarder parametere var. Dette blir en konkurranse mellom en håndfull hyperscalere og serving-selskaper. Men den håndfullen har alt meldt seg. Bare et døgn etter at vektene kom, ligger K3 ute hos blant andre Together, Fireworks, Baseten, Nebius og DigitalOcean, i tillegg til Moonshot selv. Foreløpig tar de omtrent det samme som Moonshot, altså rundt $3 inn og $15 ut per million tokens, så noen priskrig er det ikke ennå. Men likevel: fem-seks steder å kjøpe den samme modellen fra første uka er fortsatt mer enn den ene motparten du har med en lukket modell.
.png)
Åpne vekter betyr også noe hvis Moonshot selv forsvinner. Når en lukket modell som Claude eller GPT blir avviklet, er alt som er bygget mot den borte. Vekter som ligger ute kan kjøres videre, forutsatt at lisensen tillater det og at noen med et datasenter mener det er verdt bryet (og pengene).
En modell på 7 milliarder parametere kan du laste ned og kjøre selv, dersom du har noenlunde sterk maskin. 2,8 billioner parametere krever i motsetning et datasenter, uansett hvem som eier vektene. Det er her «åpen» kanskje blir litt overdrevet.
Selv med åpne vekter får vi likevel ikke se noe av treningsdataen. Språkforskerne Andreas Liesenfeld og Mark Dingemanse gikk i 2024 gjennom førti av tekstmodellene som kaller seg åpne, og konklusjonen deres var at mange egentlig bør kalles «open weight», og at mange leverandører holder tilbake informasjon om dataen for trening og fine-tuning for å slippe unna vitenskapelig, juridisk og regulatorisk ettersyn. Kimi K3 er så vidt jeg kan se ikke noe unntak.
Vi er i tillegg langt unna å kunne kjøre K3 selv. Moonshot anbefaler selv et supernode-oppsett med hele 64 akseleratorer eller mer. Det er ikke et absolutt minimum, for vektene ligger i MXFP4 (et dataformat som reduserer minne og compute) og krever rundt 1,5 TB med minne. Alt dette må ligge på kortene mens modellen kjører, men det får altså plass på atskillig færre kort enn det som anbefales. Forskerne bak «Why "open" AI systems are actually closed» i Nature peker på det underliggende: regnekraften som skal til for å bruke slike modeller i stor skala er dyr, knapp og konsentrert hos en håndfull selskaper. Åpne vekter på denne skalaen høres i prinsippet spennende ut, men bør altså i dag kun brukes på datasentre.
Åpenhet på slike modeller kommer altså med en viss forhandlingskraft for oss konsumenter, men vi kommer nok ikke til å være fri fra å kjøre modellene hos tredjeparter på en stund. Du må fortsatt kjøpe tokens, men vi har alt fått flere leverandører å velge i.
Personlig håper jeg likevel at høykvalitetsmodeller som kjører lokalt er et viktig steg i framtiden for agenter, og jeg tror at åpne frontier-vekter kan være et steg på veien dit. De små, åpne modellene (som er lettere å kjøre på lokale maskiner) har blitt en god del bedre på kort tid. Artificial Analysis ga Gemma 3 en score på 10 på indeksen sin i mars 2025, og tretten måneder senere lå Gemma 431B på 39 og Qwen3.5 27B på 42, altså omtrent der GPT-5 ligger på lave og middels innstillinger. Epoch AI anslo i fjor sommer at et gaming-kort til under $2500 holder til å kjøre det som var frontier seks til tolv måneder tidligere.
.png)
Men, skal vi være helt ærlige er det nok fortsatt en liten stund til vi kan kjøre lokale modeller som er gode nok til å erstatte de som hostes. Vicki Boykis, som har kjørt lokale modeller «siden de kom», mener selv at hun får agentiske løkker til å fungere med rundt 75% av frontier-modellenes treffsikkerhet og fart. Dette er på en Mac med 64 GB minne, og hun er likevel usikker på om det er klart for produksjonskode. De fleste i dag vil jeg anta har ganske mye mindre enn 64 GB minne på sin datamaskin i tillegg til en sterk nok GPU, så vi ser altså at modellene må bli drastisk mer effektive før dette er noe folk flest kan gjøre.
Likevel er Gemma 4 og Qwen3.5 skapt spesifikt for å være små modeller, og de dermed hadde eksistert uansett om store åpne modeller som Kimi K3 hadde blitt sluppet. Men, kan et mer åpent marked føre til tekniske nyvinninger som også hjelper de små modellene?
Jeg syns personlig at det er spennende å teste ulike modeller, og benchmark-resultatene til Kimi virker å være gode nok til at det er verdt å kjøre noen eksperimenter på. Spesielt har jeg sett imponerende resultater på frontend og 3D-grafikk da jeg har saumfart LinkedIn og X. Om jeg skal ta det i bruk blir det dessverre uansett via et API, så inntil videre kommer jeg som de fleste andre sluttbrukere til å måtte leie inferensen av noen, enten via Moonshot eller en av de nye tilbyderne.
Det jeg uansett kommer til å følge med på, er om prisen faktisk begynner å bevege seg nå som det finnes flere å kjøpe modellen fra, eller om de nye tilbyderne bare legger seg på Moonshot sitt nivå og blir der.
Håpet mitt står likevel: Blir det flere som selger den samme modellen, presses prisen ned, og da er det ikke stort å hente på å ta mer betalt. Det som står igjen er å gjøre modellene billigere å kjøre. Effektivisering virker allerede å være der mye av framgangen for de små modellene kommer fra, så jo hardere hele bransjen må jobbe med å få kostnaden ned, jo mer sitter det forhåpentligvis igjen til modellene som faktisk får plass på maskinen din. De åpne modellene tar nok ikke igjen de lukkede med det første, men arbeidet med å få kostnaden ned drar alle nytte av, også de små modellene. Kanskje sitter vi alle og kjører agenter lokalt om noen år?
Amazon Web Services. (2026). Anthropic Claude Opus 4.8. Model card, Amazon Bedrock User Guide. https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-anthropic-claude-opus-4-8.html
Anthropic. (2026). Pricing. Claude Docs. https://platform.claude.com/docs/en/about-claude/pricing
Arena. (2026a). WebDev leaderboard. Hentet 28. juli 2026 fra https://arena.ai/leaderboard/code/webdev
Arena. (2026b). Agent Arena leaderboard. Hentet 28. juli 2026 fra https://arena.ai/leaderboard/agent
Artificial Analysis. (2026a). Kimi K3. Hentet 28. juli 2026 fra https://artificialanalysis.ai/models/kimi-k3
Artificial Analysis. (2026b, 13. april). Sub-32B open weights. https://artificialanalysis.ai/articles/sub-32b-open-weights
Boykis, V. (2026, 15. juni). Running local models is good now. https://vickiboykis.com/2026/06/15/running-local-models-is-good-now/
DeepSeek. (2025). DeepSeek-R1. Model card, Hugging Face. https://huggingface.co/deepseek-ai/DeepSeek-R1
Liesenfeld, A., & Dingemanse, M. (2024). Rethinking open source generative AI: Open-washing and the EU AI Act. I Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency (FAccT '24). Association for Computing Machinery. https://doi.org/10.1145/3630106.3659005
Meta. (2024). Llama 3.3 community license agreement. https://github.com/meta-llama/llama-models/blob/main/models/llama3_3/LICENSE
Moonshot AI. (2026a). Kimi K3 quickstart. Kimi API Platform. https://platform.kimi.ai/docs/guide/kimi-k3-quickstart
Moonshot AI. (2026b). Kimi K3 tech blog: Open frontier intelligence. https://www.kimi.com/blog/kimi-k3
Moonshot AI. (2026c). Kimi K3 License. Hugging Face. Hentet 28. juli 2026 fra https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
OpenRouter. (2026). Kimi K3. Hentet 28. juli 2026 fra https://openrouter.ai/moonshotai/kimi-k3
Somala, V., & Emberson, L. (2025, 15. august). Frontier AI performance becomes accessible on consumer hardware within a year. Epoch AI. https://epoch.ai/data-insights/consumer-gpu-model-gap
Widder, D. G., Whittaker, M., & Myers West, S. (2024). Why 'open' AI systems are actually closed, and why this matters. Nature, 635, 827–833. https://doi.org/10.1038/s41586-024-08141-1

Lars Tønder er fullstackutvikler og jobber for tiden for TaskCtrl. Han er opptatt av å skape løsninger med verdi for sluttbrukeren, og liker å holde seg oppdatert på hva som beveger seg i krysningen mellom AI, fullstack-utvikling og dataanalyse
