
Embeddingmodell for norsk RAG: globale topplister kan villede

Den beste embeddingmodellen for norsk RAG er den som finner relevante utdrag i dine dokumenter innenfor kravene til drift, lagring og svartid. Begynn med resultater for skandinavisk gjenfinning, og sammenlign deretter aktuelle modeller på spørsmål som løsningen faktisk skal besvare. En høy plassering på en global toppliste er ikke nok til å avgjøre dette valget.
MTEBs skandinaviske samling dekker bokmål og nynorsk og skiller mellom gjenfinning, klassifisering, klynging og kobling av parallelle tekster. De oppførte norske gjenfinningsoppgavene NorQuadRetrieval og SNLRetrieval er på bokmål. Dersom arkivet også inneholder nynorsk, må søk i slike dokumenter derfor inngå i løsningenes egen evaluering.
Hva målingen sier om norske søk
Gjenfinning er den viktigste deltesten når en RAG-løsning skal hente tekst før den lager et svar. Den må vise om en forespørsel får relevante tekstutdrag høyt nok i resultatlisten til at svarmodellen mottar dem. I den publiserte SEB-studien fikk text-embedding-3-large 77,9 i skandinavisk gjenfinning, mot 69,1 for multilingual-e5-large, 63,5 for multilingual-e5-base og 60,3 for multilingual-e5-small. Tallene er gjennomsnitt fra skandinaviske oppgaver, ikke resultater fra norske bedriftsarkiver.
Forskjellen mellom globale og skandinaviske rangeringer er konkret. Blant modellene som ble sammenlignet i begge benchmarkene, gikk e5-mistral-7b-instruct fra førsteplass i MTEB til femteplass i SEB, mens multilingual-e5-large gikk fra sjuendeplass til fjerdeplass. Plasseringene gjelder forskernes utvalg av sammenlignbare modeller og er ikke posisjoner på en løpende toppliste. De viser hvorfor en modell som ser sterk ut samlet, kan være et svakere utgangspunkt for skandinaviske dokumenter.
Også en skandinavisk totalscore dekker flere jobber enn norsk dokumentsøk. Klassifisering måler om tekst kan plasseres i riktige kategorier, og klynging måler om beslektede tekster samles. Kobling av parallelle tekster kan være nyttig når formuleringer på bokmål og nynorsk skal matches. Ingen av disse resultatene forteller alene hvor høyt et bestemt svarutdrag havner når brukeren stiller et spørsmål.
Beslutningsmatrise: oppgave før totalscore
Den relevante deltesten avhenger av hva embeddingene skal brukes til. For en løsning som både søker, merker og grupperer dokumenter, kan samme modell være et rimelig kompromiss, men hver funksjon bør vurderes mot sin egen oppgave.
- Spørsmål og svar over dokumenter: Gi norsk gjenfinning størst vekt. NorQuad bygger på spørsmål til norske Wikipedia-utdrag, mens SNL Retrieval bruker innhold fra Store norske leksikon. Begge gir nærmere holdepunkter for bokmålssøk enn en global gjennomsnittsscore. Sjekk likevel om modellen finner riktig avsnitt i arkivets egen fagtekst, ikke bare et dokument om samme emne.
- Automatisk merking: Vektlegg klassifisering hvis oppgaven er å tilordne emner, kategorier eller andre etiketter. Her er det treff på riktige klasser som teller. En modell kan skille kategorier godt uten å være den beste til å rangere svarutdrag, så klassifiseringsresultatet bør ikke overføres direkte til RAG-valget.
- Gruppering av dokumenter: Se på klynging når tekster skal samles etter innhold uten faste etiketter. SNL Clustering er et bokmålsnært eksempel i studien. Nyttig gruppering kan gjøre et arkiv lettere å utforske, men måler en annen egenskap enn om et konkret spørsmål får riktig utdrag øverst.
- Selvdrift og store indekser: Vurder gjenfinningskvalitet sammen med modellstørrelse, vektordimensjoner og gjennomstrømning. Flere dimensjoner krever mer plass per lagret utdrag, og innkodingstiden får betydning når mange dokumenter legges til eller hele indeksen bygges på nytt. Hvor dokumentene kan behandles, kan også avgjøre om en API-modell er aktuell.
Størrelse og hastighet endrer regnestykket
multilingual-e5-serien er et konkret utgangspunkt for selvdrift. Microsofts tekniske rapport beskriver åpne small-, base- og large-varianter med ulik avveining mellom effektiv innkoding og embeddingkvalitet. I den skandinaviske målingen fremstår serien som en god balanse mellom ytelse, gjennomstrømning og størrelsen på representasjonene. Det er en grunn til å ta flere størrelser med i vurderingen, ikke en garanti for at én av dem passer alle arkiver.
Hastighetstallene i SEB gjelder forskernes maskinvare og oppsett; kommersielle API-er er ikke med i studiens hastighetsfigur. I drift påvirkes kapasiteten også av tekstlengde, batching og hvor ofte innholdet må indekseres på nytt. Sammenlign derfor innkodingstid for ditt dokumentvolum og forsinkelse for søk med den kvalitetsforskjellen modellene faktisk gir. En liten gevinst i gjennomsnittsscore kan ha begrenset verdi dersom den krever vesentlig mer lagring eller gjør hyppige oppdateringer trege.
La egne dokumenter avgjøre mellom kandidatene
Et avgrenset evalueringssett bør inneholde virkelige spørsmål og merkede utdrag som besvarer dem. Ta med faguttrykk, forkortelser og spørsmål der flere dokumenter ligner hverandre, men bare ett inneholder svaret. Inneholder arkivet nynorsk, bør settet også omfatte nynorske spørsmål og utdrag. Mål hvor ofte et relevant utdrag kommer blant resultatene som faktisk sendes videre til svarmodellen; registrer samtidig innkodingstid og indeksstørrelse.
Hold dokumentutvalg, tekstoppdeling, filtre og antallet utdrag til svarmodellen likt når embeddingmodellen byttes. Ellers blir det uklart om en forskjell skyldes modellen eller resten av søkekjeden. Et spørsmål som krever ett bestemt avsnitt, er særlig opplysende: en modell som finner riktig tema, men feil avsnitt, har ennå ikke løst gjenfinningsoppgaven RAG-systemet er avhengig av.
Følg også modellens inndataformat. Modellkortet for multilingual-e5-base angir prefikset «query:» for søk og «passage:» for dokumentutdrag, også når teksten ikke er engelsk. Det oppgir 768 dimensjoner og at lange tekster kuttes ved 512 token. Uten riktige prefikser eller med utdrag som kuttes før svaret, måler forsøket delvis oppsettet fremfor modellens evne til å finne innholdet.
Velg modellen som gir tilstrekkelig gjenfinning på egne norske spørsmål innenfor grensene for drift, lagring og svartid. De publiserte skandinaviske deltestene gjør kandidatlisten mer relevant; evalueringen på eget arkiv viser hvilket kompromiss som fungerer for den konkrete søkejobben.
Relaterte artikler


Norge faller til femteplass i KI-bruk – veksten fortsetter likevel

Syntetiske treningsdata: mer volum kan også forsterke feilene

Zapier eller Make: enkel oppstart kan bli den dyreste løsningen

Google lar flere KI-agenter holde en ti minutter lang video sammenhengende

Lokal eller skybasert språkmodell: personvern har en driftspris
Abonner på nyhetsbrevet vårt
Få de siste nyhetene om Web3, KI og krypto rett i innboksen.