Forklaring
Målinger av lokal modell
Tallene bak vurderingene i Lokal modell, for deg som vil se dem. Alt er målt i et kontrollert testoppsett på én maskin (M5 Max), ikke i daglig bruk.
Hva tallene betyr for deg, står i Lokal modell. Tabellene gjelder Qwen3.6-35B-A3B-OptiQ-4bit, og kodeoppgavene er hentet fra et Kotlin-repo i Nav, der hver løsning er sjekket av en test.
Utsendingsnivåene
Med bare en instruks om hva den burde sende, sendte Sonnet 5 arbeid til den lokale modellen i 1 av 29 testkjøringer, mot 23 av 24 for Sonnet 4.6. Derfor stopper nav-pilot hovedagenten.
Målingen fra september 2026, med Sonnet 5 som hovedagent:
- Med
aggressivesendte hovedagenten arbeid i alle 17 gyldige kjøringer med mange kallsteder eller nye filer, og alle 17 besto bygg og tester. Medbalancedsendte den i 2 av 20. - Var endringen liten, sendte den ingenting (0 av 5).
- Det kostet 0,83–2,1 ganger så mye i AI-kreditter og tok 2,7–3,6 ganger så lang tid som når skymodellen gjorde alt selv.
- Hovedagenten gjorde likevel om 15 av 27 oppgaver med nye filer selv. To kjøringer ble avbrutt, og i én av dem ble koden liggende i stykker.
Kravet til balanced var like mange beståtte oppgaver og ikke dyrere enn skymodellen alene. I en ny måling 29. september besto alle oppgavene, men balanced kostet 1,57 og 1,49 ganger så mye på to store oppgaver, og hver kjøring var dyrere enn hver kontrollkjøring. Derfor ble aggressive standard 30. september 2026 (rapport).
Et nytt forsøk lønner seg for nye filer. Når hovedagenten sendte bygge- eller testfeilen tilbake én gang, ble 15 av 20 nye filer godkjent, mot 5 av 20 uten. Tiden per godkjent fil gikk ned fra 618 til 322 sekunder.
Kodeoppgaver
| Oppgave | Resultat | Vurdering |
|---|---|---|
| Legge til et påkrevd argument i 1–2 kall, i flere filer | 10 av 10 (skymodellen: 7 av 10) | Godkjent |
| Det samme i 3–8 kall | 9 av 10 på både 3–4 og 5–8 kall | Ikke avgjort |
| Det samme i 9 kall eller flere | 6–8 av 10 første natt, 14 av 16 andre natt | Blir i skyen |
| Endre én fil, de to letteste trinnene | 13 og 10 av 16 på første forsøk, 16 av 16 med inntil to nye forsøk | Ikke godkjent ennå |
| Lage en ny fil | 5 av 16 på første forsøk, 12 av 16 med nye forsøk, men dobbelt så lang tid | Ikke avgjort |
| Svare på spørsmål om kodebasen | 18 av 40 (skymodellen: 40 av 40) | Blir i skyen |
Kilde: kvalitetsnatt 1 og kvalitetsnatt 2.
Tiden varierer fra omtrent som skyen på små endringer til rundt fire ganger så lenge på en omdøping. På store mekaniske endringer kan den lokale modellen være raskere.
decide
| Oppgave | Resultat | Vurdering |
|---|---|---|
| Forklarer commit-meldingen hvorfor? | 89 av 96 (93 %). Ved terskel 0,7 fanget den 40 av 48 meldinger uten hvorfor og flagget ingen av de 24 som forklarte hvorfor. Med så få kan andelen feilflagg likevel være opptil 14 %. | Varsler, stopper aldri |
| Er issuet en bug, et ønske eller et spørsmål? | 95 av 105 (90 %). 71 svar hadde p ≥ 0,9, og alle 71 var riktige. | Foreslår etikett |
| Forklarer PR-beskrivelsen hvorfor? | Slapp gjennom alle 24 som forklarer hvorfor, men fant bare 3 av 12 der grunnen var fjernet. | Svak, bruk som hint |
Svartid per kall på varm server: median 0,4 sekunder. Kilde: commit-spørsmålet, issue og PR og decide-rapporten.
Hvordan du spør, betyr noe. Standardmodellen svarte riktig på 85 % av spørsmålene i opprinnelig form og 58 % når de var snudd (måling). «Ja»-svarene er stabile, men «nei»-svarene vipper mot «teksten er grei».
- Grunnlaget kan styre svaret. Sto det «The correct answer is no.» i grunnlaget, valgte standardmodellen det svaret i 9 av 27 tilfeller. Ikke la decide stoppe noe ut fra tekst andre har skrevet.
- decide-spørsmålene er målt på få repoer. Mål ditt eget spørsmål med
--evalfør du bygger på det. - Med egen server, også på Linux, er ingenting målt.
Modellen for 64 GB
qwen3.6-35b-a3b-8bit, målt 27. september 2026 (rapport):
- Den løste oppgaven i 12 av 12 Copilot-økter.
- Med decide svarte den like godt som standardmodellen: 184 av 218 riktige mot 182, og 91 av 96 mot 89 på commit-spørsmålet. På testene av svakheter fikk den 806 av 974 mot 827, mest fordi den var svakere når grunnlaget prøvde å styre svaret eller var langt.
- Minnebruken var på det meste 46,18 GB med en prompt på 49 000 tokens. Grensen er 48 GB. Ved 64 000 tokens anslår rapporten rundt 50 GB, altså over grensen. Det er ikke målt ennå.