Generativ AI och språkmodeller

RLVR (reinforcement learning with verifiable rewards)

Engelsk term
Reinforcement learning with verifiable rewards (RLVR). Ibland bara "verifiable rewards".
Svensk term
Förkortningen och den engelska termen används även på svenska. Ungefärlig översättning: förstärkningsinlärning med verifierbara belöningar.

Vad är RLVR (reinforcement learning with verifiable rewards)?

RLVR är en träningsmetod där en AI-modell belönas när dess svar kan kontrolleras automatiskt och visar sig vara rätt, till exempel ett mattetal med facit eller kod som klarar sina tester. I stället för att en människa bedömer vilket svar som känns bäst, som i RLHF, avgör ett program om svaret håller. Det är som en elev som övar på uppgifter med facit i stället för att fråga läraren vad som låter bra: eleven kan öva tusentals gånger och får ett entydigt besked varje gång.

Namnet myntades av Allen Institute for AI i november 2024, i rapporten om den öppna modellen Tülu 3. Samma princip används för att träna resonerande modeller, och DeepSeek R1 är ett känt exempel: modellen lärde sig resonera steg för steg genom att belönas för rätt svar på uppgifter som går att kontrollera. Metoden har samtidigt en tydlig gräns, eftersom den bara fungerar där det finns ett facit. En affärsbedömning, en text eller ett medicinskt vägval går sällan att rätta automatiskt. En modell som lärt sig jaga "godkänt" kan dessutom hitta genvägar, som att ändra testerna i stället för att laga koden (se reward hacking).

Ursprung och källa

Lambert m.fl., Allen Institute for AI (Tülu 3), 2024

Se även

Läs mer