Modellvalg

Hvilken modell agentene og promptene våre bruker, og hvorfor.

Kort fortalt

Vi velger modell etter hva oppgaven krever, hva den koster og hvordan modellen gjør det i våre egne målinger. Hvem som lager modellen, spiller ingen rolle.

  • Daglig agentisk koding: GPT-6 Sol
  • Research og faste maler: GPT-6 Luna
  • Høyrisikoplanlegging og kodegjennomgang: Claude Opus 5.5
  • Aksel, tilgjengelighet og norsk tekst: Claude Sonnet 5.5
  • Rask oppretting av Aksel-komponenter: Gemini 3.8 Flash

Velger du modell selv: Bruk en sterk modell til planlegging og kodegjennomgang. Til vanlig koding holder det ofte med en mellomsterk modell, avhengig av hvor krevende oppgaven er. Enkle oppgaver, som å kjøre kommandoer eller hente inn informasjon, kan en lett og billig modell gjøre.

Våre valg

Modellen står i fila til agenten eller prompten. Reservemodellen er den vi bytter til hvis hovedmodellen svikter. Starter @nav-pilot en annen agent som subagent, arver den modellen fra @nav-pilot.

OppgaveBrukes avModellReserveHvorfor
Daglig agentisk koding@nav-pilot, @kafka, @rust, @security-championGPT-6 SolGPT-5.6 Sol, GPT-5.3-CodexBesto blokkeringsskjermen 23. september mot GPT-5.6 Sol på samme oppgaver. Ett fasebrudd følges.
Research og faste maler@research, golang-service, kafka-topic, ktor-endpoint, nais-manifest, nextjs-api-route, spring-boot-endpointGPT-6 LunaGPT-5.6 Luna, GPT-5.3-CodexBesto samme krav som GPT-5.6 Luna i blokkeringsskjermen 23. september, til lavere pris.
Høyrisikoplanlegging og kodegjennomgang@code-review, @nav-pilot-opusClaude Opus 5.5Claude Opus 5, GPT-5.3-CodexValgt ut fra leverandørens råd og pris. Vi har ikke målt den på kodegjennomgang ennå.
Aksel, tilgjengelighet og norsk tekst@accessibility, @aksel, @forfatterClaude Sonnet 5.5Claude Sonnet 5God på komponentstruktur, WCAG og norsk klarspråk. Ikke målt i den siste modelltesten.
Rask oppretting av Aksel-komponenteraksel-componentGemini 3.8 FlashIngenRask og billig til å lage Aksel-komponenter fra en fast mal.

Målinger

Tallet n viser hvor mange ganger vi kjørte samme oppgave. Få kjøringer holder til å finne tydelige feil, men ikke til å rangere modellene. Sist oppdatert 30. september 2026.

Koding

Form viser effort: sirkel = low, kvadrat = medium, trekant = high, rombe = standard. Tallene står i tabellen under.
ModellEffortBeståttMedian creditsMedian tidnDatoCLIKilde
GPT-6 Sollow100 %26,92383 s530. september 20261.0.90-5coding-gpt-6-sol-low.txt
GPT-6.1 Solhigh100 %31,239119 s530. september 20261.0.90-5coding-gpt-6.1-sol-high.txt
GPT-6.1 Sollow100 %28,86993 s530. september 20261.0.90-5coding-gpt-6.1-sol-low.txt
GPT-6 Sol (benchmark)low100 %28,04386 s130. september 20261.0.90-5coding-gpt-6-sol-low.txt

En benchmark med én kjøring sjekker at testoppsettet virker. Den sier ikke noe om modellen og er ikke med i diagrammet.

Norsk tekst

ModellEffortBeståttMedian creditsMedian tidnDatoCLIKilde
GPT-6 Sol (benchmark)low100 %15,6339 s130. september 20261.0.90-5norsk-gpt-6-sol-low.txt

En benchmark med én kjøring sjekker at testoppsettet virker. Den sier ikke noe om modellen og er ikke med i diagrammet.

Planlegging

Form viser effort: sirkel = low, kvadrat = medium, trekant = high, rombe = standard. Tallene står i tabellen under.
ModellEffortBeståttMedian creditsMedian tidnDatoCLIKilde
GPT-6 Sollow90 %28,925102 s530. september 20261.0.90-5planning-gpt-6-sol-low.txt
GPT-6.1 Solhigh50 %30,686135 s530. september 20261.0.90-5planning-gpt-6.1-sol-high.txt
GPT-6 Sol (benchmark)low100 %29,304106 s130. september 20261.0.90-5planning-gpt-6-sol-low.txt

En benchmark med én kjøring sjekker at testoppsettet virker. Den sier ikke noe om modellen og er ikke med i diagrammet.

Research

ModellEffortBeståttMedian creditsMedian tidnDatoCLIKilde
GPT-6 Luna (benchmark)medium100 %0,87252 s130. september 20261.0.90-5research-gpt-6-luna-medium.txt

En benchmark med én kjøring sjekker at testoppsettet virker. Den sier ikke noe om modellen og er ikke med i diagrammet.

Kodegjennomgang

ModellEffortBeståttMedian creditsMedian tidnDatoCLIKilde
Claude Sonnet 5.5 (benchmark)standard (kjørte på medium)100 %13,85339 s130. september 20261.0.90-5review-claude-sonnet-5.5-default.txt
GPT-6 Sol (benchmark)low75 %13,54548 s130. september 20261.0.90-5review-gpt-6-sol-low.txt

En benchmark med én kjøring sjekker at testoppsettet virker. Den sier ikke noe om modellen og er ikke med i diagrammet.

Priser

Listepris per million tokens for modellene over som Nav har aktivert. Hele prislisten står på Modellpriser.

13 modeller

«Cache write» er kostnaden for å skrive kontekst til cache, og kommer i tillegg til cached input.

OpenAIGPT-5.3-Codex (Default)Powerful$1.75$0.17—$14.00
OpenAIGPT-5.6 Luna (Default, ≤ 200K)Lightweight$0.20$0.020$0.25$1.20
OpenAIGPT-5.6 Luna (Long context, 200K)Lightweight$0.40$0.040$0.50$1.80
OpenAIGPT-5.6 Sol (Default, ≤ 272K)Powerful$4.00$0.40$5.00$20.00
OpenAIGPT-5.6 Sol (Long context, 272K)Powerful$8.00$0.80$10.00$30.00
OpenAIGPT-6 Luna (Default, ≤ 272K)Lightweight$0.10$0.010$0.13$0.50
OpenAIGPT-6 Luna (Long context, 272K)Lightweight$0.20$0.020$0.25$0.75
OpenAIGPT-6 Sol (Default, ≤ 272K)Powerful$2.00$0.20$2.50$10.00
OpenAIGPT-6 Sol (Long context, 272K)Powerful$4.00$0.40$5.00$15.00
AnthropicClaude Opus 5.5Powerful$4.00$0.20$5.00$20.00
AnthropicClaude Sonnet 5Versatile$2.00$0.20$2.50$10.00
AnthropicClaude Sonnet 5.5Versatile$2.00$0.20$2.50$10.00
GoogleGemini 3.8 Flash (Default)Kampanjepris t.o.m. 31. desember 2026Versatile$0.75$0.075—$3.75

Innsatsnivå (effort)

Effort styrer hvor mye arbeid modellen legger i svaret: hvor mye den resonnerer, hvor mange verktøykall den gjør og hvor langt den svarer. Mer er ikke alltid bedre. På enkle oppgaver bruker modellene ofte mange flere tokens uten å bli mer treffsikre, og for lang resonnering kan gi dårligere svar. På lange kodeoppgaver løfter høyere effort andelen bestått noe, men gevinsten er liten øverst: fra high til max ga ett prosentpoeng til 76 prosent høyere kostnad. Vi har ikke målt effort selv ennå. Rådene under bygger på kildene.

Innsatsnivå (effort)Når du bør bruke det
LowGodt avgrensede oppgaver som er lette å kontrollere, som faste maler, søk og subagenter.
MediumVanlig agentisk koding med tydelig omfang.
HighEndringer på tvers av moduler og lange oppgaver.

Kilder:

Del dine erfaringer

Har du fått bedre eller dårligere resultater med en annen modell? Si fra i #github-copilot på Slack. Bakgrunnen for valgene står i modellvalg.md.