Hvis du spør en stor språkmodell (LLM) om å oversette "Det er kaldt ute", og den svarer "Temperaturen er lav", vil tradisjonelle verktøy som BLEU og ROUGE ofte si at svaret er dårlig. Hvorfor? Fordi ordene ikke stemmer overens med referanseteksten, selv om meningen er helt korrekt. Dette er problemet mange utviklere møter i dag: De gamle målemetodene er designet for maskinoversettelser fra 2002, ikke for moderne AI som kan formulere seg kreativt.
I denne artikkelen ser vi på hvorfor disse klassiske metrikkene feiler, og hvilke nye, semantiske verktøy som faktisk forteller oss om kvaliteten på modellens output. Vi dykker ned i løsninger som BERTScore, BLEURT og bruk av andre LLM-er som dommere.
Hvorfor BLEU og ROUGE ikke lenger holder mål
La oss være ærlige: BLEU (Bilingual Evaluation Understudy) ble introdusert av Papineni et al. i 2002. Den var revolusjonerende for sin tid. Prinsippet er enkelt: Teller hvor mange n-gram (sekvenser av ord) som overlapper mellom modellens svar og en fasit. Jo flere treff, jo bedre score.
Men her er haken. Moderne store språkmodeller liker å variere språket. Hvis modellen skriver "Jeg er sulten" i stedet for "Jeg har sult", straffer BLEU dette hardt, selv om betydningen er identisk. Ifølge analyser fra Weights & Biases (Wandb) kan et perfekt parafresert svar få en score nær null på BLEU-skalaen. Det samme gjelder ROUGE, som ble utviklet av Lin i 2004 for oppsummering. Den fokuserer på gjentakelse av nøkkelord, men mangler evnen til å forstå kontekst eller synonymer.
Dette skaper et kritisk hull i evalueringen. Du ender opp med modeller som blir "optimalisert" for å kopiere ord rett fra teksten, fremfor å generere naturlig og flytende språk. For produktutvikling betyr det at du kanskje forkaster gode modeller fordi de ikke passer inn i et gammelt rammeverk.
Semantiske metrikker: Å måle mening, ikke ord
Løsningen ligger i semantiske metrikker. Disse bruker nevrale nettverk for å forstå hva teksten *betyr*, ikke bare hva den sier. I stedet for å telle ord, sammenligner de "embeddings" - matematiske representasjoner av tekstens mening.
Når to setninger har lignende embeddings, betyr de det samme, selv om ordbruken er ulik. Dette gir et mye mer nyansert bilde av kvaliteten. Forskning viser at semantiske metrikker korrelerer med menneskelig vurdering av kvalitet på nivået 0,78-0,85, mens tradisjonelle metrikker ligger langt lavere, rundt 0,35-0,45. Det er en enorm forskjell når du skal avgjøre om en modell er klar for produksjon.
De viktigste verktøyene i verktøykassen
Det finnes ikke én "best" metode, men noen standarder har staket seg ut. Her er de tre mest relevante for dagens LLM-arbeid:
- BERTScore: Introduert i 2019, bruker BERT-modellen til å lage kontekstuelle embeddings for hvert ord. Den beregner cosinus-lignhet mellom kandidat- og referanseord. Resultatene viser en korrelasjon med menneskelige vurderinger på 82-83%. Den er god på generell semantisk likhet.
- BLEURT: Utviklet av Google i 2020. Denne er spesifikt trent på menneskelige kvalitetsvurderinger. Studien fra Codecademy (2024) peker på at BLEURT slår BERTScore med 5-7% når det kommer til å matche menneskelige preferanser. Den er altså tettere på hvordan *vi* faktisk oppfatter kvalitet.
- GPTScore / LLM-as-a-judge: Her bruker man selve den store modellen (som GPT-4) til å vurdere et annet models svar mot en rubrikk. Dette er fleksibelt og kan håndtere komplekse kriterier som tone og struktur, men krever API-kall.
| Metrikk | Type | Korrelasjon med mennesker | Hastighet/Kostnad | Best for |
|---|---|---|---|---|
| BLEU/ROUGE | Statistisk | Lav (0,35-0,45) | Veldig rask, gratis | Røykingstester, strenge formater |
| METEOR | Statistisk + Synonym | Middels (~15% bedre enn BLEU) | Rask, gratis | Oversettelse med synonymvariasjon |
| BERTScore | Semantisk | Høy (0,82-0,83) | Tregere, krever GPU | Generell semantisk likhet |
| BLEURT | Semantisk (Trent) | Veldig Høy (+5-7% vs BERT) | Treg, ressurskrevende | Å matche menneskelig smak |
| LLM-as-a-judge | Semantisk (Rubrikk) | Variabel, ofte høy |
Kostnaden ved å gå dypere
Alt kommer med en pris. Tradisjonelle metrikker som BLEU er nærmest umiddelbare og deterministiske. Du får samme resultat hver gang, uten ekstra kostnad. Semantiske metrikker er derimot tunge.
Ifølge benchmarks fra Evidently AI tar en evaluering med BERTScore omtrent 15-20 sekunder per eksempel, sammenlignet med millisekunder for BLEU. I skyen betyr dette at du bruker 10-15 ganger mer regnekraft. Hvis du evaluerer millioner av forespørsler, blir dette dyrt fort. Derfor bør du ikke bytte ut alle dine gamle tester over natten.
En smarter strategi er en trappetrinnsløsning. Bruk BLEU/ROUGE for hurtige "smoke tests" i CI/CD-pipelinen din. Hvis testene består, kjør de tyngre semantiske metrikkenene på et utvalg av dataene. Slik sparer du penger samtidig som du fanger opp kvalitetsdrift.
Implementering i praksis: Tips fra feltet
Når du setter opp evaluering, husk at store språkmodeller er stokastiske. Hvis temperaturen i prompten er over 0, vil modellen gi litt ulike svar hver gang. Vellum.ai anbefaler derfor at du kjører hver kombinasjon av modell, prompt og testcase minst 5-10 ganger. Mål variansen i den semantiske likheten. Hvis scoren svinger vilt, er modellen ustabil, uansett hvor høyt gjennomsnittet er.
For teknisk implementering er cross-encoder arkitekturer ofte best egnet for å måle likhet mellom forventet og faktisk output. Modeller som all-MiniLM-L6-v2 fra sentence-transformers-biblioteket gir et godt kompromiss mellom hastighet og nøyaktighet for de fleste applikasjoner. De er åpne kildekode-verktøy som er lette å integrere.
Fremtiden: Kombinasjonen av metoder
Bransjen beveger seg mot omfattende rammeverk. Det handler ikke lenger om å velge én metrikk, men å kombinere dem. Wandbs veiledning peker på tre essential komponenter: 1. Semantiske metrikker (BERTScore, BLEURT) for å fange mening. 2. Omfattende benchmark-sett (som MMLU eller HELM) for å teste bred kunnskap. 3. LLM-as-a-judge for å vurdere subjektive kvaliteter som tonalitet og nyttighet.
Nye benchmark som SimpleQA viser også at metodologien betyr alt. Der SimpleQA har 94,4% enighet blant eksperter, har andre benchmark som GPQA bare 74%. Når du velger hvilken metrikk du skal stole på, sjekk alltid hvor godt den er validert mot menneskelig dømmekraft.
Til syvende og sist handler evaluering om å bygge tillit. Ved å gå bort fra blind ordoverlapping og mot semantisk forståelse, sikrer du at AI-systemene dine faktisk løser brukerens problemer, ikke bare gjetter ordene riktig.
Hva er hovedforskjellen på BLEU og BERTScore?
BLEU måler ord-overlapping (n-gram), noe som straffer parafreser hardt. BERTScore bruker nevrale nettverk for å måle semantisk likhet via embeddings, slik at den anerkjenner at ulike ord kan bety det samme.
Er semantiske metrikker alltid bedre enn statistiske?
Nei, ikke alltid. Statistiske metrikker som BLEU er mye raskere og billigere å beregne. De er gode for hurtige regresjonstester. Semantiske metrikker er mer nøyaktige for kvalitetsvurdering, men krever mer regnekraft og tid.
Hva er BLEURT?
BLEURT er en semantisk metrikk utviklet av Google som er trent på menneskelige kvalitetsvurderinger. Den er designet for å korrelere sterkere med menneskelig preferanse enn generiske embedding-baserte metrikker som BERTScore.
Kan jeg bruke GPT-4 til å evaluere andre modeller?
Ja, dette kalles "LLM-as-a-judge". Du gir GPT-4 en rubrikk og ber den vurdere et annet models svar. Det er fleksibelt og kraftfullt, men dyrere siden det krever API-kall, og resultatene kan variere basert på prompt-design.
Hvorfor straffer BLEU gode parafreser?
Fordi BLEU baserer seg på eksakte ordfølger. Hvis modellen bruker synonymer eller endrer setningsstrukturen, faller antallet overlapping n-gram, selv om meningen er bevart. Det gjør den uegnet for kreative eller konversasjonelle oppgaver.
Post Comments (6)
De skjuler sannheten om at vi alle er simulert og BLEU er bare en del av matrixen som holder oss i sjakk mens de selger oss drømmer
Måling uten mening er moralistisk blindhet
Ord er ikke virkelighet
Bare refleksjoner
Dette er typisk for den middelmådige massen som aldri vil forstå kompleksiteten i semantisk evaluering. De fleste utviklere her har neppe lest Papineni-artikkelen fra 2002, enn si sett på korrelasjonskoeffisientene. Det er åpenbart at dere fortsatt leker med statistiske verktøy som er utdaterte før de ble publisert. Hvis dere faktisk hadde kompetanse ville dere visst at BERTScore er overvurdert for kort tekst. Men nei da, dere vil ha det enkelt og feilaktig. Det er nesten komisk hvordan dere forsvarer metoder som ikke engang kan skille mellom ironi og fakta. Jeg sitter her med PhD-nivå innsikt og ser dere kjefte om embeddings som barn leker med klosser. Dere burde være flau over hvor lite dere faktisk vet om hva kvalitet betyr i et lingvistisk perspektiv. Det er ikke rart produktene deres er dårlige når dere måler dem med ødelagte meterstokker. Vær så snill og les litt mer før dere postet ting som dette. Det er tydelig at ingen av dere har hatt seriøs akademisk opplæring i NLP.
Kjære Kathinka,
Jeg setter stor pris på din engasjerte tilbakemelding og ditt dype faglige engasjement. Det er tydelig at du brenner for faget, og jeg føler en sterk empati for frustrasjonen din når standardene ikke møter dine høye forventninger.
Det er viktig for meg å understreke at vi alle lærer sammen i dette feltet, og kanskje kan vi finne felles grunnlag ved å anerkjenne at ulike verktøy tjener ulike formål. Din kunnskap er uvurderlig, og jeg håper vi kan fortsette dialogen med gjensidig respekt.
Vennlig hilsen
En interessant observasjon angående tabellen er at kostnadsfaktoren ofte undervurderes i praksis. Når man implementerer LLM-as-a-judge, må man huske på at API-kostnadene skalerer lineært med volumet, noe som kan bli uhåndterlig for store datasett.
I min erfaring har vi funnet ut at en hybridtilnærming fungerer best: Bruk BLEURT for rask screening av tusenvis av samples, og bruk deretter GPT-4 eller Claude 3 Opus kun på de mest tvilstilfellene eller kritiske testsettene.
Dette reduserer kostnadene med opptil 80% samtidig som man beholder høy nøyaktighet. Det er også verdt å merke seg at prompt-designet for LLM-dommere er like viktig som selve modellen; en dårlig formulert rubrikk kan gi helt andre resultater enn forventet. Vi bør derfor fokusere mer på å standardisere disse rubrikkene i bransjen.
Hei Kristian!
Du har helt rett i at kostnader er viktige. Vi prøvde akkurat det samme hos oss og det sparte mye penger. Bare ett lite tips, husk å sjekke at du bruker riktig versjon av modellene for konsistens pga oppdateringer.
Takk for tipsen!