Generativ AI och språkmodeller

Prompt-cachning

Engelsk term
Prompt caching (även context caching)
Svensk term
Den engelska termen prompt caching används oftast även på svenska. Försvenskat skrivs det prompt-cachning.

Vad är Prompt-cachning?

Prompt-cachning betyder att AI-tjänsten sparar sitt arbete med början av en prompt, så att nästa anrop som börjar likadant slipper bearbeta samma text igen. Det gör störst skillnad för långa delar som återkommer i varje anrop: systeminstruktioner, verktygsbeskrivningar eller ett dokument du ställer flera frågor om. Den sparade delen blir både snabbare och billigare att läsa, oftast en tiondel av det vanliga priset eller mindre, medan första gången kostar lite extra eftersom texten då ska sparas. Det förklarar varför två körningar med lika många tokens kan kosta helt olika mycket.

Cachen fungerar bara så långt början är exakt identisk, tecken för tecken. Det är som ett kontoutdrag med löpande saldo: lägger du till en rad sist behöver bara den räknas, men ändrar du en tidig rad måste varje saldo efter den räknas om. Därför lägger den som bygger egna API-anrop det som är stabilt först och det som ändras sist. I Claude Code och vanliga chattar sköter verktyget den ordningen åt dig.

Den sparade delen lever bara en kort stund, från några minuter upp till en timme, om den inte används igen. Mekanismen gäller inte bara den som bygger mot ett API. I Claude Code märks den till exempel på hur snabbt du når dina användningsgränser, och byter du modell mitt i en session måste hela samtalet läsas in på nytt till fullt pris.

Ursprung och källa

Gim m.fl. (Yale), 2023, med idén Prompt Cache; Anthropic lanserade prompt caching som API-funktion 2024

Se även

Läs mer