Ett kontextfönster är den maximala mängd text, mätt i tokens, som en modell kan läsa och resonera över i ett enda anrop. Allt modellen känner till under det anropet - promptar, historik, hämtade dokument och verktygsutdata - måste rymmas inom det.
Tokens, inte ord
Modeller bearbetar inte tecken eller ord direkt. De bearbetar tokens, som är textbitar producerade av en tokeniserare. En grov tumregel är att en token motsvarar ungefär tre till fyra tecken på engelska, eller ungefär 0,75 ord. Ett kontextfönster på 128 000 tokens rymmer någonstans i storleksordningen 90 000 till 100 000 ord, även om exakta siffror beror på modellen och den tokeniserare den använder.
Kod tokeniseras på ett annat sätt än prosa. Variabelnamn, syntaktisk interpunktion och icke-latinska tecken kan förbruka tokens snabbare än vanlig engelsk text.
Vad som finns i fönstret
Varje token i ett enskilt modellanrop konkurrerar om samma utrymme:
- Systemprompt
- Konversationshistorik
- Hämtade dokument eller fragment (se vad är RAG)
- Verktygsdefinitioner och resultat från verktygssanrop
- Användarens aktuella meddelande
- Utrymme reserverat för modellens svar
I en agentisk loop returneras verktygssvar till kontexten vid varje iteration. En flerstegsuppgift kan fylla ett stort fönster snabbare än utvecklare förväntar sig.
Varför storlek inte är hela historien
Längre kontextfönster löser inte allt, av några skäl.
För det första, kostnad. De flesta leverantörer tar betalt per token, för både indata och utdata. Att skicka 100 000 tokens vid varje anrop är dyrt i större skala.
För det andra, latens. Större nyttolaster tar längre tid att bearbeta, vilket spelar roll i interaktiva eller realtidsapplikationer.
För det tredje, hämtningskvalitet. Forskning och praktisk erfarenhet tyder på att modeller kan tappa bort information som är begravd i mitten av en mycket lång kontext. Att placera det mest relevanta materialet nära början eller slutet av prompten ger ofta bättre resultat.
För det fjärde är kontextfönstret flyktigt. Ingenting i det bevaras mellan anrop om inte applikationen uttryckligen hanterar det. Minne mellan sessioner måste hanteras på applikationslagret, och kan inte förutsättas från modellen.
Praktiska konsekvenser för utvecklare
Utvecklare som arbetar på applikationslagret behöver regelbundet fatta beslut om kontexthantering:
- Vilka delar av en konversation som ska behållas och vilka som ska sammanfattas eller kastas bort
- Hur många hämtade fragment som ska skickas in, och hur de ska rangordnas
- Om ett stort dokument ska delas upp eller om frågor ska dirigeras till mindre, fokuserade anrop
- Hur verktygstäta agentiska uppgifter ska hanteras utan att nå tokengränser mitt i körningen
Det här är inte konfigurationsval. De kräver förståelse för vad modellen faktiskt gör med den information den tar emot. En utvecklare som behandlar kontextfönstret som en större hink tenderar att producera system som är långsamma, dyra eller opålitliga under realistiska arbetsbelastningar.
Kontextteknik är disciplinen att fatta medvetna, välgrundade beslut om vad som ska placeras i ett kontextfönster, hur det ska struktureras och vad som ska utelämnas.
Relation till andra komponenter
En vektordatabas finns delvis för att kontextfönster är ändliga. I stället för att läsa in en hel kunskapsbas i en prompt hittar hämtningssystem de mest relevanta fragmenten och skickar bara dessa. Kvaliteten på den hämtningen påverkar direkt vad modellen kan resonera kring.
I agentisk kodning avgör kontextfönstret också hur mycket av en kodbas en modell kan hålla i blickfånget samtidigt. Utvecklare som arbetar med stora kodförråd behöver ofta vara noggranna med vilka filer, funktioner eller diff:ar de inkluderar.
Vad vi testar
Att hantera ett kontextfönster väl är något vi specifikt observerar när vi bedömer utvecklare. I hur vi granskar AI-native-bedömningen poängsätter vi prompt- och kontextteknik på exakt detta: om en utvecklare sätter upp uppgiftskontexten så att verktyget producerar användbara resultat, snarare än att skicka in allt tillgängligt och skicka om prompten när det misslyckas. Vi tittar också på specifikationsdriven utveckling, eftersom en utvecklare som bryter ned en vag uppgift i väldefinierade delar fattar samma typ av beslut: att välja vad modellen behöver och utesluta det den inte behöver.
Korta svar
Innebär ett större kontextfönster bättre resultat?
Inte automatiskt. Större fönster ökar kostnad och latens, och modeller kan tappa bort information som är begravd djupt i långa promptar. Att noggrant välja vad som hamnar i kontexten spelar ofta större roll än den rena fönsterstoreken.
Vad händer när du överskrider kontextfönstret?
API:et returnerar ett fel, eller så trunkerar leverantören indata utan att meddela, beroende på implementation. I båda fallen går innehåll förlorat. Utvecklare måste hantera detta fall explicit i produktionssystem och inte behandla det som ett kantfall.
Är kontextfönstrets storlek densamma för alla modeller?
Nej. Det varierar avsevärt beroende på modell och version, från några tusen tokens till över en miljon i vissa fall. Den relevanta gränsen för ditt system är den modell du faktiskt anropar, inte det största talet du har sett citerat.