Modellvalg
Hvilken modell agentene og promptene våre bruker, og hvorfor.
Kort fortalt
Vi velger modell etter hva oppgaven krever, hva den koster og hvordan modellen gjør det i våre egne målinger. Hvem som lager modellen, spiller ingen rolle.
- Daglig agentisk koding: GPT-6 Sol
- Research og faste maler: GPT-6 Luna
- Høyrisikoplanlegging og kodegjennomgang: Claude Opus 5.5
- Aksel, tilgjengelighet og norsk tekst: Claude Sonnet 5.5
- Rask oppretting av Aksel-komponenter: Gemini 3.8 Flash
Velger du modell selv: Bruk en sterk modell til planlegging og kodegjennomgang. Til vanlig koding holder det ofte med en mellomsterk modell, avhengig av hvor krevende oppgaven er. Enkle oppgaver, som å kjøre kommandoer eller hente inn informasjon, kan en lett og billig modell gjøre.
Våre valg
Modellen står i fila til agenten eller prompten. Reservemodellen er den vi bytter til hvis hovedmodellen svikter. Starter @nav-pilot en annen agent som subagent, arver den modellen fra @nav-pilot.
| Oppgave | Brukes av | Modell | Reserve | Hvorfor |
|---|---|---|---|---|
| Daglig agentisk koding | @nav-pilot, @kafka, @rust, @security-champion | GPT-6 Sol | GPT-5.6 Sol, GPT-5.3-Codex | Besto blokkeringsskjermen 23. september mot GPT-5.6 Sol på samme oppgaver. Ett fasebrudd følges. |
| Research og faste maler | @research, golang-service, kafka-topic, ktor-endpoint, nais-manifest, nextjs-api-route, spring-boot-endpoint | GPT-6 Luna | GPT-5.6 Luna, GPT-5.3-Codex | Besto samme krav som GPT-5.6 Luna i blokkeringsskjermen 23. september, til lavere pris. |
| Høyrisikoplanlegging og kodegjennomgang | @code-review, @nav-pilot-opus | Claude Opus 5.5 | Claude Opus 5, GPT-5.3-Codex | Valgt ut fra leverandørens råd og pris. Vi har ikke målt den på kodegjennomgang ennå. |
| Aksel, tilgjengelighet og norsk tekst | @accessibility, @aksel, @forfatter | Claude Sonnet 5.5 | Claude Sonnet 5 | God på komponentstruktur, WCAG og norsk klarspråk. Ikke målt i den siste modelltesten. |
| Rask oppretting av Aksel-komponenter | aksel-component | Gemini 3.8 Flash | Ingen | Rask og billig til å lage Aksel-komponenter fra en fast mal. |
Målinger
Tallet n viser hvor mange ganger vi kjørte samme oppgave. Få kjøringer holder til å finne tydelige feil, men ikke til å rangere modellene. Sist oppdatert 30. september 2026.
Koding
| Modell | Effort | Bestått | Median credits | Median tid | n | Dato | CLI | Kilde |
|---|---|---|---|---|---|---|---|---|
| GPT-6 Sol | low | 100 % | 26,923 | 83 s | 5 | 30. september 2026 | 1.0.90-5 | coding-gpt-6-sol-low.txt |
| GPT-6.1 Sol | high | 100 % | 31,239 | 119 s | 5 | 30. september 2026 | 1.0.90-5 | coding-gpt-6.1-sol-high.txt |
| GPT-6.1 Sol | low | 100 % | 28,869 | 93 s | 5 | 30. september 2026 | 1.0.90-5 | coding-gpt-6.1-sol-low.txt |
| GPT-6 Sol (benchmark) | low | 100 % | 28,043 | 86 s | 1 | 30. september 2026 | 1.0.90-5 | coding-gpt-6-sol-low.txt |
En benchmark med én kjøring sjekker at testoppsettet virker. Den sier ikke noe om modellen og er ikke med i diagrammet.
Norsk tekst
| Modell | Effort | Bestått | Median credits | Median tid | n | Dato | CLI | Kilde |
|---|---|---|---|---|---|---|---|---|
| GPT-6 Sol (benchmark) | low | 100 % | 15,63 | 39 s | 1 | 30. september 2026 | 1.0.90-5 | norsk-gpt-6-sol-low.txt |
En benchmark med én kjøring sjekker at testoppsettet virker. Den sier ikke noe om modellen og er ikke med i diagrammet.
Planlegging
| Modell | Effort | Bestått | Median credits | Median tid | n | Dato | CLI | Kilde |
|---|---|---|---|---|---|---|---|---|
| GPT-6 Sol | low | 90 % | 28,925 | 102 s | 5 | 30. september 2026 | 1.0.90-5 | planning-gpt-6-sol-low.txt |
| GPT-6.1 Sol | high | 50 % | 30,686 | 135 s | 5 | 30. september 2026 | 1.0.90-5 | planning-gpt-6.1-sol-high.txt |
| GPT-6 Sol (benchmark) | low | 100 % | 29,304 | 106 s | 1 | 30. september 2026 | 1.0.90-5 | planning-gpt-6-sol-low.txt |
En benchmark med én kjøring sjekker at testoppsettet virker. Den sier ikke noe om modellen og er ikke med i diagrammet.
Research
| Modell | Effort | Bestått | Median credits | Median tid | n | Dato | CLI | Kilde |
|---|---|---|---|---|---|---|---|---|
| GPT-6 Luna (benchmark) | medium | 100 % | 0,872 | 52 s | 1 | 30. september 2026 | 1.0.90-5 | research-gpt-6-luna-medium.txt |
En benchmark med én kjøring sjekker at testoppsettet virker. Den sier ikke noe om modellen og er ikke med i diagrammet.
Kodegjennomgang
| Modell | Effort | Bestått | Median credits | Median tid | n | Dato | CLI | Kilde |
|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 (benchmark) | standard (kjørte på medium) | 100 % | 13,853 | 39 s | 1 | 30. september 2026 | 1.0.90-5 | review-claude-sonnet-5.5-default.txt |
| GPT-6 Sol (benchmark) | low | 75 % | 13,545 | 48 s | 1 | 30. september 2026 | 1.0.90-5 | review-gpt-6-sol-low.txt |
En benchmark med én kjøring sjekker at testoppsettet virker. Den sier ikke noe om modellen og er ikke med i diagrammet.
Priser
Listepris per million tokens for modellene over som Nav har aktivert. Hele prislisten står på Modellpriser.
13 modeller
«Cache write» er kostnaden for å skrive kontekst til cache, og kommer i tillegg til cached input.
Innsatsnivå (effort)
Effort styrer hvor mye arbeid modellen legger i svaret: hvor mye den resonnerer, hvor mange verktøykall den gjør og hvor langt den svarer. Mer er ikke alltid bedre. På enkle oppgaver bruker modellene ofte mange flere tokens uten å bli mer treffsikre, og for lang resonnering kan gi dårligere svar. På lange kodeoppgaver løfter høyere effort andelen bestått noe, men gevinsten er liten øverst: fra high til max ga ett prosentpoeng til 76 prosent høyere kostnad. Vi har ikke målt effort selv ennå. Rådene under bygger på kildene.
| Innsatsnivå (effort) | Når du bør bruke det |
|---|---|
| Low | Godt avgrensede oppgaver som er lette å kontrollere, som faste maler, søk og subagenter. |
| Medium | Vanlig agentisk koding med tydelig omfang. |
| High | Endringer på tvers av moduler og lange oppgaver. |
Kilder:
Del dine erfaringer
Har du fått bedre eller dårligere resultater med en annen modell? Si fra i #github-copilot på Slack. Bakgrunnen for valgene står i modellvalg.md.