RAG of fine-tuning: actuele kennis kost meer per antwoord

|Auteur: Redactie van QUASA|6 min. leestijd
RAG of fine-tuning: actuele kennis kost meer per antwoord

Kies RAG wanneer een toepassing antwoorden moet baseren op veranderende documenten en de gebruikte passages moet kunnen aanwijzen. Kies fine-tuning wanneer vooral de uitvoering van een terugkerende taak moet verbeteren. AWS adviseert RAG als startpunt voor vraagbeantwoording op eigen documenten en noemt fine-tuning voor aanvullende taken zoals samenvatten.

Bij RAG komen opgehaalde passages met elk verzoek mee; dat kan het antwoord duurder maken door extra invoertokens. Fine-tuning vraagt vooraf om geschikte voorbeelden en training, maar kan lange instructies per verzoek verkorten. Als een toepassing zowel actuele kennis als consequent gedrag nodig heeft, kunnen de technieken samen werken. Welke opzet het goedkoopst is, hangt uiteindelijk ook af van de nauwkeurigheid en de tijd die mensen besteden aan controle en herstel.

Wanneer kennis moet veranderen of herleidbaar zijn

RAG, voluit retrieval-augmented generation, zoekt bij een vraag naar relevante passages en voegt die toe aan de invoer van het taalmodel. De documenten blijven buiten de modelgewichten. Na verwerking in de zoekindex kan een gewijzigde handleiding voor volgende antwoorden beschikbaar zijn zonder een nieuwe trainingsronde.

Die werkwijze past bij productinformatie, technische documentatie en interne regels waarvan de geldige versie ertoe doet. Een opgehaalde passage geeft de toepassing bovendien een concrete basis voor een bronverwijzing. Die verwijzing garandeert nog geen juist antwoord: het zoeksysteem kan een ongeschikte passage kiezen en het model kan een juiste passage verkeerd uitleggen.

Voor citeerbare antwoorden telt daarom meer dan de kwaliteit van het taalmodel. De index moet de actuele versie bevatten, relevante stukken kunnen terugvinden en de toegangsrechten van de gebruiker respecteren. Als een oude passage blijft opduiken, helpt een overtuigender formulering van het antwoord niet; de fout zit dan eerder in de documentselectie.

Wanneer het model een taak consequent moet uitvoeren

Fine-tuning past een model aan met voorbeelden van gewenste invoer en uitvoer. Dat kan helpen bij een vaste antwoordstructuur, classificatie of manier van samenvatten. Het doel is hier dat het model de bewerking betrouwbaar uitvoert, ook wanneer de formulering van gebruikersvragen verschilt.

De kwaliteit van die voorbeelden bepaalt veel. Trainingsgevallen moeten lijken op de verzoeken die de toepassing werkelijk krijgt; daarnaast is een afzonderlijke evaluatieset nodig om te zien of het gedrag ook bij ongeziene gevallen standhoudt. De voorbereiding, training en latere aanpassingen vormen een initiële investering die bij de prijs per antwoord moet worden meegeteld.

Fine-tuning werkt anders dan het vervangen van een document in een zoekindex. Een bijgewerkte handleiding wordt niet vanzelf onderdeel van een al aangepast model. Moet een antwoord verwijzen naar de geldige versie, dan blijft toegang tot die versie nodig, ook als fine-tuning de vorm of verwerking van het antwoord verbetert.

Keuzematrix: welke eis geeft de doorslag?

De keuze wordt duidelijker wanneer kennis, gedrag en kosten afzonderlijk worden beoordeeld. De volgende criteria zijn uitgangspunten voor een toepassing met eigen gegevens; de uitkomst hangt af van de documenten, het model en het aantal verzoeken.

  • Actualiteit: veranderen de feiten geregeld, dan ligt RAG voor de hand. Bij fine-tuning vraagt een wijziging die het model moet leren om nieuwe voorbeelden en een volgende trainingsronde.
  • Bronverwijzingen: moet een gebruiker kunnen zien welke documentpassage een antwoord draagt, dan is een ophaalstap nodig die die passage bewaart. Gedrag dat in modelgewichten is aangeleerd, levert op zichzelf geen verwijzing naar de oorspronkelijke tekst.
  • Gewenst gedrag: gaat het vooral mis bij indeling, classificatie of de uitvoering van dezelfde taak, dan kunnen representatieve voorbeelden voor fine-tuning nuttiger zijn dan extra documenttekst.
  • Responstijd: RAG voegt zoeken en verwerking van context toe. Fine-tuning kan instructies verkorten, maar ook modelkeuze, lengte van het antwoord en inrichting van de zoekstap bepalen de wachttijd.
  • Initiële investering: RAG vraagt documentverwerking, een zoekindex en beheer van rechten. Fine-tuning vraagt beoordeelde voorbeelden, training en evaluatie; een hybride opzet heeft beide onderhoudslasten.
  • Kosten per verzoek: tel bij RAG de zoekstap en extra invoertokens mee. Verdeel bij fine-tuning de trainingskosten over het verwachte gebruik en neem eventuele kosten voor het beschikbaar houden van het aangepaste model op.
  • Menselijke controle: vergelijk ook hoeveel antwoorden iemand moet beoordelen of herstellen. Een duurdere modelaanroep kan voordeliger uitvallen als zij voldoende correctiewerk voorkomt.

Een duurder verzoek kan een goedkoper correct antwoord opleveren

In onderzoek met twee afgeschermde datasets uit de autosector kostten de onderzochte RAG-configuraties meer per verzoek dan het basismodel door extra invoertokens, terwijl hun hogere nauwkeurigheid de berekende totale kosten inclusief menselijke controle verlaagde. De datasets kwamen uit autohandleidingen en kwaliteitsmeldingen; de vraag-antwoordparen waren synthetisch opgesteld.

Dat verschil ontstaat doordat een fout antwoord meer kan kosten dan de modelaanroep zelf. De kostenberekening omvatte ook het beoordelen van antwoorden, het opnieuw proberen en het handmatig vinden van een antwoord wanneer de toepassing faalt. De uitkomst is afhankelijk van aannames over die menselijke arbeid en van de onderzochte configuraties; zij levert geen algemeen prijsverschil tussen RAG en fine-tuning op.

Ook wachttijd moet over de volledige keten worden gemeten. Volgens OpenAI’s richtlijnen voor latency weegt het genereren van uitvoertokens doorgaans zwaarder voor de modelwachttijd dan een bescheiden verkorting van de invoer. Bij RAG komt daar de zoekstap bij. Minder opgehaalde tekst kan dus invoerkosten besparen, terwijl een korter antwoord of een snellere zoekstap meer effect op de ervaren wachttijd kan hebben.

Wanneer de combinatie zinvol is

Een hybride opzet heeft een duidelijk doel wanneer de toepassing veranderende passages nodig heeft én met goede instructies nog steeds een terugkerende gedragsfout maakt. RAG levert dan de actuele context; fine-tuning leert het model die context op de gewenste manier te verwerken. Een denkbaar geval is een assistent die een bijgewerkte technische handleiding raadpleegt en het antwoord steeds volgens dezelfde vereiste structuur formuleert.

Meer context kan een goed aangeleerde taak ook verstoren. In een proef met IJslandse tekstcorrectie van OpenAI daalde de BLEU-score van een aangepast model van 87 naar 83 nadat opgehaalde voorbeelden waren toegevoegd. Dat resultaat betreft tekstcorrectie, geen vraagbeantwoording op actuele documenten, maar laat zien waarom combineren een eigen evaluatie vraagt. Voor een hybride model moeten de trainingsvoorbeelden bovendien lijken op de verzoeken mét opgehaalde passages die het later ontvangt.

De doorslaggevende vraag is dus welke fout de toepassing nu maakt. Ontbrekende of verouderde kennis wijst naar ophalen; een hardnekkige fout in de uitvoering van een taak wijst naar betere instructies of fine-tuning. Zijn beide problemen aanwezig, vergelijk dan de combinatie met de afzonderlijke opzetten op correcte antwoorden, kosten per verzoek, wachttijd en benodigde menselijke aandacht.

Lees ook:

Delen:

Abonneer je op onze nieuwsbrief

Ontvang het laatste nieuws over Web3, AI en crypto rechtstreeks in je inbox.

0