
Cohere Embed 5 deler indeks mellem Pro og Fast – migreringen kræver egen test

Ifølge TAO Medias lanceringsoverblik lancerede Cohere den 30. september 2026 Embed 5 Pro og Fast i et fælles embeddingsrum; begge håndterer tekst og billeder, har et kontekstvindue på 128.000 tokens og understøtter mere end 100 sprog. Modellerne er tilgængelige gennem blandt andet Cohere API, Model Vault, Microsoft Foundry og Amazon SageMaker. De offentliggjorte API-priser for tekst er 0,12 dollar pr. million tokens med Pro og 0,08 dollar med Fast.
Det fælles rum lader en virksomhed indeksere dokumenter med Pro og danne forespørgselsvektorer med Fast til det samme indeks. Dermed kræver et skift mellem de to forespørgselsmodeller inden for Embed 5 ikke en ny indeksering. Det siger derimod intet om, hvorvidt Fast finder de nødvendige passager i virksomhedens egne dokumenter, eller om et indeks fra en ældre model kan genbruges.
Tre måder at fordele indeksering og søgning på
Pro er den kvalitetsorienterede variant, mens Fast er udviklet til lavere svartid og større forespørgselsmængder. For en søgeløsning med rapporter, aftaler og andet virksomhedsmateriale er den afgørende forskel, hvilken model der danner de lagrede dokumentvektorer, og hvilken der behandler de gentagne spørgsmål. Det giver tre relevante sammenligninger på den samme dokumentsamling.
Pro til både dokumenter og spørgsmål giver et referencepunkt for retrievalkvalitet. Hvis søgningen ofte skal ramme en præcis passage i en tæt rapport, er det denne konfiguration, de andre bør måles imod. Til gengæld behandles hver forespørgsel med den dyrere variant. Et godt resultat her viser heller ikke i sig selv, at hele dokumenter bør lagres som én vektor: en lang rapport kan rumme mange emner, som et enkelt søgeresultat ikke udpeger præcist.
Fast til både dokumenter og spørgsmål bruger den billigere tekstmodel ved indlæsning og ved efterfølgende opslag. Det kan være attraktivt, når samlingen ændrer sig ofte, og forespørgslerne er mange. Prisen pr. token afgør dog ikke, om designet er billigst i praksis: ekstra søgninger, større resultatmængder eller manuel gennemgang af manglende fund kan ændre regnestykket. Derfor skal relevante passager findes ved den resultatgrænse, som løsningen faktisk sender videre til brugeren eller en RAG-kæde.
Pro til dokumenter og Fast til spørgsmål beholder Pro-vektorerne, men flytter de gentagne forespørgsler til Fast. Sammenlignet med Pro på begge trin er lagerbehovet for dokumentvektorerne det samme, mens tekstprisen for forespørgsler falder med 0,04 dollar pr. million tokens efter de offentliggjorte API-satser. Sammenlignet med Fast på begge trin er forespørgselsprisen den samme; merudgiften ligger i at indlæse eller opdatere dokumenter med Pro. Den kombination er derfor kun bedre end en ren Fast-løsning, hvis Pro-indekset giver en værdifuld forbedring i de fundne resultater.
Coheres måling viser et lille gennemsnitligt tab
I Coheres lanceringstest fik Fast-forespørgsler mod et Pro-indeks scoren 98,4 mod 100 for Pro på begge trin, målt som normaliseret gennemsnitlig nDCG@10 på tværs af 40 udviklingsdatasæt. Fast til både dokumenter og spørgsmål fik 96,6 i samme opgørelse. Tallene beskriver rangeringen af fund i Coheres test, ikke andelen af korrekte svar fra en efterfølgende sprogmodel. Cohere anbefaler selv Pro til indeksering og Fast til forespørgsler.
Datasættene dækker tekst, billeder og dokumenter, hvor tekst og billeder indgår sammen. Gennemsnittet fortæller ikke, hvordan kombinationen klarer danske aftaler, sammensatte fagord eller spørgsmål, hvor en undtagelse i en tabel er afgørende. Et beskedent gennemsnitligt tab kan være acceptabelt i én samling og uacceptabelt i en anden, hvis det rammer de dokumenter, som brugerne faktisk skal finde. Der er ikke fremlagt en særskilt, uafhængig måling på danske virksomhedsdata.
Et ældre indeks skal behandles som en særskilt migration
Kompatibiliteten gælder de to Embed 5-varianter. Digital Applieds migrationsanalyse skelner mellem at skifte forespørgselsmodel i det fælles rum og at flytte et indeks fra en ældre model; samme vektorlængde gør ikke automatisk gamle og nye vektorer sammenlignelige. Et eksisterende Embed 4-indeks bør derfor bevares, mens en ny samling bygges og vurderes parallelt. Dokumentidentifikatorer og adgangsfiltre skal følge med, så et fund stadig peger på den rigtige kilde og kun vises til berettigede brugere.
Formatvalget er en del af migrationen. Embed 5 tilbyder flere vektorlængder samt float-, int8- og binære outputformater. Kortere eller mere kompakte vektorer kan mindske rå lagerplads, men ændrer også det grundlag, som søgningen skal vurderes på. Den faktiske lagerregning omfatter desuden søgeindeks, metadata og antallet af dokumentdele. En beslutning om at opdele en rapport i sider eller passager kan derfor påvirke både fund og lagerforbrug mere end valget mellem Pro og Fast til forespørgsler.
For dokumenter med figurer og tabeller er inputvejen lige så vigtig. En udtrukket tekstversion kan miste forholdet mellem tabelrækker og kolonner; et sidebillede eller kombineret tekst og billede bevarer andre oplysninger, men skal stadig passe til den søgbare enhed. Et langt kontekstvindue gør større input mulige, men sikrer ikke, at én vektor for hele rapporten finder den korte passage, der besvarer et bestemt spørgsmål. Det bør afprøves med de dokumenttyper, som indgår i den planlagte migration.
Den lokale prøve skal måle fund, tid og plads
En sammenlignelig prøve bruger samme version af dokumenterne, samme adgangsfiltre og samme spørgsmål for Pro/Pro, Fast/Fast og Pro/Fast. Fagpersoner kan på forhånd markere de passager, som et brugbart resultat skal indeholde. Spørgsmålene bør omfatte almindelige opslag og krævende tilfælde som en tabelcelle, en kontraktundtagelse eller et svar sent i en rapport. Uden sådanne relevansvurderinger kan en høj lighedsscore dække over, at systemet fandt det forkerte afsnit.
- Mål recall ved det antal resultater, som løsningen faktisk viser eller sender videre. Notér især de relevante passager, hver konfiguration overser.
- Mål typisk svartid og langsomme forespørgsler under forventet belastning. Medtag både dannelsen af forespørgselsvektoren og søgningen i indekset.
- Registrér rå vektorstørrelse og faktisk indeksforbrug med metadata. Hold dokumentopdeling, dimension og format konstant, når modellen alene skal sammenlignes.
- Opgør danske spørgsmål og danske dokumenter særskilt, og fordel fejl efter dokumenttype. Et samlet gennemsnit kan skjule svage fund i den del af samlingen, der er vigtigst.
Resultatet afgør, om den lavere pris på Fast-forespørgsler opvejer eventuelle mistede fund, og om Pro-indeksering giver nok værdi i forhold til Fast på begge trin. Indtil den vurdering er foretaget på egne data, giver det parallelle gamle indeks en konkret vej tilbage, hvis den nye søgning ikke opfylder kravene.
Læs også:
Relaterede artikler


PostgreSQL eller MySQL: Belastningen afgør, hvilken der er hurtigst

GPT-6.1 Sol koster 2 dollar ind – cacheprisen er halveret

RAG eller finjustering? Fejlvalget gør virksomhedens viden forældet

Nordnet lancerer egne ETF’er i 2027 – pris og indeks er stadig ukendt

Store PDF-samlinger i NotebookLM: Kilderne kan stadig falde ud
Tilmeld dig vores nyhedsbrev
Få de seneste nyheder om Web3, AI og krypto direkte i din indbakke.