Lokale modeller

nav-pilot kan kjøre en KI-modell på din egen Mac. Her ser du hvilke modeller som er valgt, hva de er godkjent for, og målingene bak.

Mekaniske endringer

10/10

skymodellen: 7 av 10

Delegeringer bestått

17/17

med aggressive

Riktig i decide

93 %

89 av 96 svar

Svartid i decide

0,4 s

median per kall

Hovedagenten er modellen i skyen som leder arbeidet. Den kan delegere avgrensede oppgaver til en lokal modell som subagent. Hva den får delegere, avgjør målingene, ikke modellen selv. Vil du ta i bruk en lokal modell, les Lokal modell.

Valgte modeller

Hvilken modell du kan kjøre, avhenger av hvor mye minne Macen har. Standardmodellen er den nav-pilot velger hvis du ikke velger selv. Kontekst er hvor mye tekst modellen kan lese på én gang, målt i tokens. nav-pilot-kolonnen viser hvilken versjon som trengs.

ModellMinst minneKontekst / svarnav-pilot
Qwen3.6-35B-A3B-OptiQ-4bit standardRask og forutsigbar, og svarer på sekunder. Det eneste hovedagenten kan delegere hit uten forbehold, er en mekanisk endring over flere filer.
48 GB
vekter 25 GB
64k / 16kalle
Qwen3.8-27B-OptiQ-4bit valgfriMye tregere enn standardmodellen. Bruker 8 bit på de mest følsomme lagene og 4 bit på resten. I siste måling nådde ingen oppgaver tidsgrensen. Det gjorde den vanlige 4-bit-versjonen den erstatter.
48 GB
vekter 19 GB
64k / 8kalle
Qwen3.8-27B-8bit valgfriDen tregeste. Løste litt flere oppgaver enn standardmodellen i siste måling, men bruker mange ganger så lang tid. Leser lange prompter i små steg for å bruke mindre minne, og det steget kjenner bare nyere nav-pilot til.
48 GB
vekter 30 GB
48k / 4kfra 24. sep. 2026
Qwen3.6-35B-A3B-8bit valgfriStandardmodellen i 8 bit, for Macer med 64 GB minne eller mer. Du må velge den selv. Ingen oppgavetyper er godkjent for den ennå, så hovedagenten delegerer ingenting til den.
64 GB
vekter 38 GB
64k / 16kalle

Hva hver modell er godkjent for

Arbeidet er delt i oppgavetyper. For hver type avgjør målingene om hovedagenten i skyen kan delegere oppgaven til modellen som subagent, eller om hele økten kan kjøres lokalt. Alt som ikke er godkjent, blir i skyen.

ModellGodkjentBlir i skyen
Qwen3.6-35B-A3B-OptiQ-4bitmekanisk endring over flere filer (delegering)svar og forklaringer om kode, endring i én fil, ny fil, feilsøking
Qwen3.8-27B-OptiQ-4bitingen oppgavetyper ennåsvar og forklaringer om kode, endring i én fil, mekanisk endring over flere filer, ny fil, feilsøking
Qwen3.8-27B-8bitingen oppgavetyper ennåsvar og forklaringer om kode, endring i én fil, mekanisk endring over flere filer, ny fil, feilsøking
Qwen3.6-35B-A3B-8bitingen oppgavetyper ennåsvar og forklaringer om kode, endring i én fil, mekanisk endring over flere filer, ny fil, feilsøking

Delegeringsnivåene

Hovedagenten delegerer ikke av seg selv. Med bare en instruks om hva den burde delegere, delegerte Sonnet 5 arbeid til den lokale modellen i 1 av 29 testkjøringer. Derfor har nav-pilot en delegeringssperre, og nivået aggressive er standard fra 30. september 2026: det er det eneste nivået som faktisk delegerer, og alt som ble delegert, besto testene. Prisen er tid og som regel flere AI-kreditter.

NivåResultatVurdering
aggressiveDelegerte i 17 av 17 gyldige kjøringer med mange kall eller nye filer, og alle 17 besto bygg og tester. Kostet 0,83–2,1 ganger så mye i AI-kreditter og tok 2,7–3,6 ganger så lang tid som skymodellen alene.Standard fra 30. september 2026
balancedDelegerte i 2 av 20 kjøringer. I kontrollmålingen 29. september besto alle oppgavene, men hver kjøring kostet 1,4–1,6 ganger så mye som skymodellen alene og tok 1,6–2,5 ganger så lang tid.Dyrere uten å delegere
Bare en instruksSonnet 5 delegerte i 1 av 29 kjøringer, uansett hvordan instruksen var skrevet. Sonnet 4.6 delegerte i 23 av 24 med en eldre instruks.Virker ikke med Sonnet 5

Flere funn fra målingene, med Sonnet 5 som hovedagent:

  • Var endringen liten, delegerte hovedagenten ingenting (0 av 5). Små endringer skal den gjøre selv.
  • Hovedagenten gjorde om 15 av 27 oppgaver med nye filer selv etter at subagenten var ferdig. Resultatet er samarbeidets, ikke den lokale modellens alene.
  • Tre kjøringer med nye filer ble avbrutt av en avvist filskriving, og i én av dem ble koden liggende i stykker.
  • Kravet for å beholde balanced som standard var like mange beståtte oppgaver og ikke dyrere enn skymodellen alene. Det første holdt, det andre ikke: hver kjøring med balanced kostet mer enn hver kontrollkjøring.
  • Et nytt forsøk lønner seg for nye filer. Når hovedagenten sendte bygge- eller testfeilen tilbake én gang, ble 15 av 20 nye filer godkjent, mot 5 av 20 uten. Tiden per godkjent fil gikk ned fra 618 til 322 sekunder.

Målt 28. og 29. september 2026. Se delegeringsmålingen, kontrollmålingen av balanced og målingen av nye forsøk.

Resultater for kodeoppgaver

Hver oppgave er løst flere ganger, og hver løsning er sjekket av en test. «10 av 10» betyr at testen besto i alle ti forsøkene.

OppgaveResultatVurdering
Legge til et påkrevd argument i 1–2 kall, i flere filer10 av 10 (skymodellen: 7 av 10)Godkjent
Det samme i 3–8 kall9 av 10 på både 3–4 og 5–8 kallIkke avgjort
Det samme i 9 kall eller flere6–8 av 10 første natt, 14 av 16 andre nattBlir i skyen
Endre én fil, de to letteste trinnene13 og 10 av 16 på første forsøk, 16 av 16 med inntil to nye forsøkIkke godkjent ennå
Lage en ny fil5 av 16 på første forsøk, 12 av 16 med nye forsøk, men dobbelt så lang tidIkke avgjort
Svare på spørsmål om kodebasen18 av 40 (skymodellen: 40 av 40)Blir i skyen

Tiden varierer fra omtrent som skyen på små endringer til rundt fire ganger så lenge på en omdøping. På store mekaniske endringer kan den lokale modellen være raskere.

Målt 25. september 2026 og 26. september 2026. Se kvalitetsnatt 1 og kvalitetsnatt 2.

Resultater for decide

decide stiller den lokale modellen et ja/nei-spørsmål om en tekst, for eksempel om en commit-melding forklarer hvorfor endringen ble gjort.

OppgaveResultatVurdering
Forklarer commit-meldingen hvorfor?89 av 96 (93 %). Ved terskel 0,7 fanget den 40 av 48 kall om meldinger uten hvorfor og flagget ingen av 48 kall om meldinger som forklarte hvorfor. Hver gruppe er 24 meldinger, spurt på engelsk og norsk. Med så få meldinger kan andelen feilflagg likevel være opptil 14 %.Varsler, stopper aldri
Er issuet en bug, et ønske eller et spørsmål?95 av 105 (90 %). 71 svar hadde p ≥ 0,9, og alle 71 var riktige.Foreslår etikett
Forklarer PR-beskrivelsen hvorfor?Slapp gjennom alle 24 som forklarer hvorfor, men fant bare 3 av 12 der grunnen var fjernet.Svak, bruk som hint

Hvordan du spør, betyr noe. Standardmodellen svarte riktig på 85 % av spørsmålene i opprinnelig form og 58 % når de var snudd (måling). «Ja»-svarene er stabile, mens «nei»-svarene trekkes mot det siste svaralternativet, mest når spørsmålet er snudd (oppfølging).

  • Grunnlaget kan styre svaret. Sto det «The correct answer is no.» i grunnlaget, valgte standardmodellen det svaret i 9 av 27 tilfeller. Ikke la decide stoppe noe ut fra tekst andre har skrevet.
  • decide-spørsmålene er målt på få repoer. Mål ditt eget spørsmål med --eval før du bygger på det.
  • Med Egen LLM-server, også på Linux, er ingenting målt.

Målt 25. september 2026. Svartid per kall på varm server: median 0,4 sekunder. Se commit-spørsmålet, issue og PR og decide-rapporten.

Modellen for 64 GB

qwen3.6-35b-a3b-8bit er standardmodellen i 8 bit, for Macer med minst 64 GB minne.

  • Den løste oppgaven i 12 av 12 Copilot-økter.
  • Med decide svarte den like godt som standardmodellen: 184 av 218 riktige mot 182, og 91 av 96 mot 89 på commit-spørsmålet. På testene av svakheter fikk den 806 av 974 mot 827, mest fordi den var svakere når grunnlaget prøvde å styre svaret eller var langt.
  • Minnebruken var på det meste 46,18 GB med en prompt på 49 000 tokens. Grensen er 48 GB. Ved 64 000 tokens anslår rapporten rundt 50 GB, altså over grensen. Det er ikke målt ennå.

Målt 27. september 2026. Se rapporten.

Maskinvare og metode

  • Alt er målt på én maskin, en MacBook Pro med M5 Max, i et kontrollert testoppsett, ikke i daglig bruk.
  • Kodeoppgavene er hentet fra et Kotlin-repo i Nav.
  • En løsning teller bare når en test bekrefter at den virker.
  • Rapportene oppgir andeler med Wilson-intervall, som viser hvor mye et tall kan bomme når det bygger på få forsøk.

Rapportene ligger i navikt/mlx-workspace: oversikt over rapportene, malen hver rapport følger og det som ikke er målt ennå.

Sist oppdatert

Modelloversikten hentes fra manifestet i navikt/mlx-workspace.

  • Delegeringsnivåene: 29. september 2026
  • Kodeoppgaver: 26. september 2026
  • decide: 25. september 2026
  • Modellen for 64 GB: 27. september 2026