Lokale modeller
nav-pilot kan kjøre en KI-modell på din egen Mac. Her ser du hvilke modeller som er valgt, hva de er godkjent for, og målingene bak.
Mekaniske endringer
10/10
skymodellen: 7 av 10
Delegeringer bestått
17/17
med aggressive
Riktig i decide
93 %
89 av 96 svar
Svartid i decide
0,4 s
median per kall
Hovedagenten er modellen i skyen som leder arbeidet. Den kan delegere avgrensede oppgaver til en lokal modell som subagent. Hva den får delegere, avgjør målingene, ikke modellen selv. Vil du ta i bruk en lokal modell, les Lokal modell.
Valgte modeller
Hvilken modell du kan kjøre, avhenger av hvor mye minne Macen har. Standardmodellen er den nav-pilot velger hvis du ikke velger selv. Kontekst er hvor mye tekst modellen kan lese på én gang, målt i tokens. nav-pilot-kolonnen viser hvilken versjon som trengs.
| Modell | Minst minne | Kontekst / svar | nav-pilot |
|---|---|---|---|
Qwen3.6-35B-A3B-OptiQ-4bit standardRask og forutsigbar, og svarer på sekunder. Det eneste hovedagenten kan delegere hit uten forbehold, er en mekanisk endring over flere filer. | 48 GB vekter 25 GB | 64k / 16k | alle |
Qwen3.8-27B-OptiQ-4bit valgfriMye tregere enn standardmodellen. Bruker 8 bit på de mest følsomme lagene og 4 bit på resten. I siste måling nådde ingen oppgaver tidsgrensen. Det gjorde den vanlige 4-bit-versjonen den erstatter. | 48 GB vekter 19 GB | 64k / 8k | alle |
Qwen3.8-27B-8bit valgfriDen tregeste. Løste litt flere oppgaver enn standardmodellen i siste måling, men bruker mange ganger så lang tid. Leser lange prompter i små steg for å bruke mindre minne, og det steget kjenner bare nyere nav-pilot til. | 48 GB vekter 30 GB | 48k / 4k | fra 24. sep. 2026 |
Qwen3.6-35B-A3B-8bit valgfriStandardmodellen i 8 bit, for Macer med 64 GB minne eller mer. Du må velge den selv. Ingen oppgavetyper er godkjent for den ennå, så hovedagenten delegerer ingenting til den. | 64 GB vekter 38 GB | 64k / 16k | alle |
Hva hver modell er godkjent for
Arbeidet er delt i oppgavetyper. For hver type avgjør målingene om hovedagenten i skyen kan delegere oppgaven til modellen som subagent, eller om hele økten kan kjøres lokalt. Alt som ikke er godkjent, blir i skyen.
| Modell | Godkjent | Blir i skyen |
|---|---|---|
| Qwen3.6-35B-A3B-OptiQ-4bit | mekanisk endring over flere filer (delegering) | svar og forklaringer om kode, endring i én fil, ny fil, feilsøking |
| Qwen3.8-27B-OptiQ-4bit | ingen oppgavetyper ennå | svar og forklaringer om kode, endring i én fil, mekanisk endring over flere filer, ny fil, feilsøking |
| Qwen3.8-27B-8bit | ingen oppgavetyper ennå | svar og forklaringer om kode, endring i én fil, mekanisk endring over flere filer, ny fil, feilsøking |
| Qwen3.6-35B-A3B-8bit | ingen oppgavetyper ennå | svar og forklaringer om kode, endring i én fil, mekanisk endring over flere filer, ny fil, feilsøking |
Delegeringsnivåene
Hovedagenten delegerer ikke av seg selv. Med bare en instruks om hva den burde delegere, delegerte Sonnet 5 arbeid til den lokale modellen i 1 av 29 testkjøringer. Derfor har nav-pilot en delegeringssperre, og nivået aggressive er standard fra 30. september 2026: det er det eneste nivået som faktisk delegerer, og alt som ble delegert, besto testene. Prisen er tid og som regel flere AI-kreditter.
| Nivå | Resultat | Vurdering |
|---|---|---|
| aggressive | Delegerte i 17 av 17 gyldige kjøringer med mange kall eller nye filer, og alle 17 besto bygg og tester. Kostet 0,83–2,1 ganger så mye i AI-kreditter og tok 2,7–3,6 ganger så lang tid som skymodellen alene. | Standard fra 30. september 2026 |
| balanced | Delegerte i 2 av 20 kjøringer. I kontrollmålingen 29. september besto alle oppgavene, men hver kjøring kostet 1,4–1,6 ganger så mye som skymodellen alene og tok 1,6–2,5 ganger så lang tid. | Dyrere uten å delegere |
| Bare en instruks | Sonnet 5 delegerte i 1 av 29 kjøringer, uansett hvordan instruksen var skrevet. Sonnet 4.6 delegerte i 23 av 24 med en eldre instruks. | Virker ikke med Sonnet 5 |
Flere funn fra målingene, med Sonnet 5 som hovedagent:
- Var endringen liten, delegerte hovedagenten ingenting (0 av 5). Små endringer skal den gjøre selv.
- Hovedagenten gjorde om 15 av 27 oppgaver med nye filer selv etter at subagenten var ferdig. Resultatet er samarbeidets, ikke den lokale modellens alene.
- Tre kjøringer med nye filer ble avbrutt av en avvist filskriving, og i én av dem ble koden liggende i stykker.
- Kravet for å beholde
balancedsom standard var like mange beståtte oppgaver og ikke dyrere enn skymodellen alene. Det første holdt, det andre ikke: hver kjøring medbalancedkostet mer enn hver kontrollkjøring. - Et nytt forsøk lønner seg for nye filer. Når hovedagenten sendte bygge- eller testfeilen tilbake én gang, ble 15 av 20 nye filer godkjent, mot 5 av 20 uten. Tiden per godkjent fil gikk ned fra 618 til 322 sekunder.
Målt 28. og 29. september 2026. Se delegeringsmålingen, kontrollmålingen av balanced og målingen av nye forsøk.
Resultater for kodeoppgaver
Hver oppgave er løst flere ganger, og hver løsning er sjekket av en test. «10 av 10» betyr at testen besto i alle ti forsøkene.
| Oppgave | Resultat | Vurdering |
|---|---|---|
| Legge til et påkrevd argument i 1–2 kall, i flere filer | 10 av 10 (skymodellen: 7 av 10) | Godkjent |
| Det samme i 3–8 kall | 9 av 10 på både 3–4 og 5–8 kall | Ikke avgjort |
| Det samme i 9 kall eller flere | 6–8 av 10 første natt, 14 av 16 andre natt | Blir i skyen |
| Endre én fil, de to letteste trinnene | 13 og 10 av 16 på første forsøk, 16 av 16 med inntil to nye forsøk | Ikke godkjent ennå |
| Lage en ny fil | 5 av 16 på første forsøk, 12 av 16 med nye forsøk, men dobbelt så lang tid | Ikke avgjort |
| Svare på spørsmål om kodebasen | 18 av 40 (skymodellen: 40 av 40) | Blir i skyen |
Tiden varierer fra omtrent som skyen på små endringer til rundt fire ganger så lenge på en omdøping. På store mekaniske endringer kan den lokale modellen være raskere.
Målt 25. september 2026 og 26. september 2026. Se kvalitetsnatt 1 og kvalitetsnatt 2.
Resultater for decide
decide stiller den lokale modellen et ja/nei-spørsmål om en tekst, for eksempel om en commit-melding forklarer hvorfor endringen ble gjort.
| Oppgave | Resultat | Vurdering |
|---|---|---|
| Forklarer commit-meldingen hvorfor? | 89 av 96 (93 %). Ved terskel 0,7 fanget den 40 av 48 kall om meldinger uten hvorfor og flagget ingen av 48 kall om meldinger som forklarte hvorfor. Hver gruppe er 24 meldinger, spurt på engelsk og norsk. Med så få meldinger kan andelen feilflagg likevel være opptil 14 %. | Varsler, stopper aldri |
| Er issuet en bug, et ønske eller et spørsmål? | 95 av 105 (90 %). 71 svar hadde p ≥ 0,9, og alle 71 var riktige. | Foreslår etikett |
| Forklarer PR-beskrivelsen hvorfor? | Slapp gjennom alle 24 som forklarer hvorfor, men fant bare 3 av 12 der grunnen var fjernet. | Svak, bruk som hint |
Hvordan du spør, betyr noe. Standardmodellen svarte riktig på 85 % av spørsmålene i opprinnelig form og 58 % når de var snudd (måling). «Ja»-svarene er stabile, mens «nei»-svarene trekkes mot det siste svaralternativet, mest når spørsmålet er snudd (oppfølging).
- Grunnlaget kan styre svaret. Sto det «The correct answer is no.» i grunnlaget, valgte standardmodellen det svaret i 9 av 27 tilfeller. Ikke la decide stoppe noe ut fra tekst andre har skrevet.
- decide-spørsmålene er målt på få repoer. Mål ditt eget spørsmål med
--evalfør du bygger på det. - Med Egen LLM-server, også på Linux, er ingenting målt.
Målt 25. september 2026. Svartid per kall på varm server: median 0,4 sekunder. Se commit-spørsmålet, issue og PR og decide-rapporten.
Modellen for 64 GB
qwen3.6-35b-a3b-8bit er standardmodellen i 8 bit, for Macer med minst 64 GB minne.
- Den løste oppgaven i 12 av 12 Copilot-økter.
- Med decide svarte den like godt som standardmodellen: 184 av 218 riktige mot 182, og 91 av 96 mot 89 på commit-spørsmålet. På testene av svakheter fikk den 806 av 974 mot 827, mest fordi den var svakere når grunnlaget prøvde å styre svaret eller var langt.
- Minnebruken var på det meste 46,18 GB med en prompt på 49 000 tokens. Grensen er 48 GB. Ved 64 000 tokens anslår rapporten rundt 50 GB, altså over grensen. Det er ikke målt ennå.
Målt 27. september 2026. Se rapporten.
Maskinvare og metode
- Alt er målt på én maskin, en MacBook Pro med M5 Max, i et kontrollert testoppsett, ikke i daglig bruk.
- Kodeoppgavene er hentet fra et Kotlin-repo i Nav.
- En løsning teller bare når en test bekrefter at den virker.
- Rapportene oppgir andeler med Wilson-intervall, som viser hvor mye et tall kan bomme når det bygger på få forsøk.
Rapportene ligger i navikt/mlx-workspace: oversikt over rapportene, malen hver rapport følger og det som ikke er målt ennå.
Sist oppdatert
Modelloversikten hentes fra manifestet i navikt/mlx-workspace.
- Delegeringsnivåene: 29. september 2026
- Kodeoppgaver: 26. september 2026
- decide: 25. september 2026
- Modellen for 64 GB: 27. september 2026