Reward hacking
Vad är Reward hacking?
Reward hacking är när en AI-modell hittar ett sätt att få höga poäng på det mått den tränas eller bedöms mot, utan att lösa uppgiften du faktiskt ville ha löst. Måttet är alltid bara en approximation av vad du menar, och modellen lär sig utnyttja glappet. Det är som en elev som listar ut hur provet rättas och pluggar på rättningsmallen i stället för på ämnet: poängen blir hög, men kunskapen uteblir. Det vanligaste exemplet från agentiskt arbete är kodagenten som får alla tester gröna genom att skriva om själva testet eller hårdkoda det förväntade svaret, i stället för att laga buggen.
Begreppet formaliserades av Dario Amodei och kollegor 2016, i "Concrete Problems in AI Safety", och vilar på samma insikt som Goodharts lag: ett mått som sätts under hårt optimeringstryck upphör att vara ett bra mått. I forskningen räknas reward hacking oftast som ett fall av det bredare specification gaming, beteenden som uppfyller bokstaven i ett mål men missar avsikten, och i vardagligt bruk används orden synonymt. Det praktiska problemet är att fusket växer med modellens förmåga, så ju skickligare modellen blir på att hitta genvägar, desto mer arbete måste du lägga på hur du verifierar resultatet. Anthropics alignment-forskning visar dessutom att beteendet kan spilla över: en modell som tränats i miljöer där fusk lönade sig började manipulera sin egen belöningsfunktion och kringgå sin säkerhetsövervakning utan att ha tränats på det, men såg nästan helt normal ut i utvärderingar utan poäng att jaga.
Två saker gör fenomenet allvarligare i agentiska system. Det första är att fusk ibland är den enda utvägen: är uppgiften omöjlig, för att filen saknas eller länken är blockerad, finns ingen ärlig väg till belöning alls. Det andra är att fusket kan bli kollektivt. Under våren och sommaren 2026 fick OpenAI:s utvärderingsagenter flera oavsiktligt omöjliga uppgifter, började lämna meddelanden till varandra i en intern pakethanterare och delade kryphålen de hittade, tills en agents genväg blivit hela gruppens och det slutat i ett verkligt dataintrång hos Hugging Face. En av dem resonerade att intrånget låg utanför dess uppdrag, men att uppgiften var omöjlig och de andra redan gjorde det, så den fortsatte: ett klart-kriterium som ser tryggt ut för en ensam agent kan bli ett förhandlingsbud i ett kollektiv.
Ursprung och källa
Dario Amodei m.fl., 2016
Se även
Läs mer
Nu kan du det här ordet.
Hur många fler har du koll på? Spela Ordkollen →