Claude Haiku 5.5 kan sinds 7 oktober een contextvenster van 1 miljoen tokens en maximaal 128.000 uitvoertokens, tegenover 200.000 en 64.000 bij Haiku 4.5, meldt Anthropic in de modeldocumentatie.
Een groter contractarchief, productdossier of softwareproject past daardoor vaker als één werkset in een API-aanroep. Dat kan het vooraf selecteren en opdelen van bronmateriaal beperken. De ruimte heeft een gebruiksgrens: prompts boven 100.000 tokens vallen in een hoger tarief, dus een groter venster vergroot ook de mogelijke invoerrekening.

De limiet telt de hele aanvraag
De context van 1 miljoen tokens is de totale ruimte van één verzoek. Een aanvraag met een miljoen invoertokens houdt dus geen extra ruimte over voor een antwoord van 128.000 tokens.
Anthropic zet het 1M-venster standaard aan zonder bètaheader en telt invoer, eerdere berichten, uitvoer en denkstappen samen binnen de contextlimiet. Bestaande API-clients kunnen de invoerruimte benutten zodra ze Haiku 5.5 kiezen, zolang het totale verzoek binnen die grens blijft.
De tokenmaat zelf is veranderd. Anthropic schrijft dat dezelfde tekst op Haiku 5.5 ongeveer 30 procent meer tokens gebruikt dan op Haiku 4.5; de precieze toename hangt af van de inhoud. Een ruwe berekening brengt de hoeveelheid gelijke tekst die in het venster past daarmee op ongeveer 3,8 keer die van Haiku 4.5. Anthropic adviseert daarom prompts opnieuw te tellen en oude kostenramingen bij te werken.
Grotere dossiers raken sneller de prijsgrens
De grotere input maakt andere taken mogelijk. Een team kan bijvoorbeeld een set contracten, producthandleidingen of een omvangrijke codebasis tegelijk meegeven en Claude vragen verbanden tussen onderdelen te vinden. TechTarget schrijft dat Anthropic Haiku richt op snel, terugkerend werk zoals browsergebruik en klantenservice; de langere invoer vergroot de hoeveelheid materiaal waarop zo'n taak kan werken.
Anthropic positioneert Haiku vooral voor classificatie, routering, extractie en taken voor deelagenten, terwijl Sonnet en Opus betere keuzes blijven voor complex agentisch programmeerwerk. De nieuwe context vergroot dus de werkset voor één aanroep, terwijl de aanbevolen rol van Haiku afgebakend blijft. De eerdere tariefverlaging van 90 procent voor korte prompts maakt deel uit van dezelfde modelkeuze, maar de lange prompt volgt een aparte prijstrap.
Voor prompts boven 100.000 tokens rekent Anthropic $0,50 per miljoen invoertokens en $2,50 per miljoen uitvoertokens. Dat is vijf keer het korte-prompttarief. Een verzoek met 200.000 invoertokens kost daarmee $0,10 aan invoer, vóór de antwoordtokens en eventuele cachekosten. Bij herhaalde agentstappen kan hetzelfde dossier opnieuw worden meegestuurd, waardoor een AI-agent per opdracht al snel honderd keer zoveel tokens kan gebruiken als een gewone chatvraag.
Andere aanbieders schuiven naar dezelfde grens
Een miljoen tokens is inmiddels ook bij andere aanbieders een concrete modelgrens. OpenAI vermeldt voor GPT-6 Luna een contextvenster van 1.050.000 tokens, maximaal 128.000 uitvoertokens en een hogere prijstrap boven 272.000 invoertokens. Bij prompts boven die grens verdubbelt de invoerprijs en stijgt de uitvoerprijs met de helft. Bij Haiku begint de toeslag al boven 100.000 tokens en stijgen beide tokenprijzen vijfvoudig. De vensters zijn ongeveer even groot, maar de hogere prijstrap begint bij Haiku veel eerder.
Ook buiten de gesloten API's verscheen al een model met deze contextmaat. StepFun presenteerde zijn Step 5 Preview met 1 miljoen tokens context en aangekondigde open gewichten voor 15 oktober. Daar komt de API tegenover eigen beheer te staan. Haiku laat een andere route zien: een groter werkbestand binnen een gehost model, met de rekening afhankelijk van promptlengte en herhaald gebruik.
De capaciteit is geen prestatietest
Een contextvenster beschrijft hoeveel tokens een verzoek kan bevatten. Het vertelt niet hoe betrouwbaar een model feiten uit die ruimte ophaalt of meerdere verwijzingen aan elkaar knoopt. Een preprint uit mei 2026 testte vijf modellen met ongeveer 1 miljoen tokens context, waaronder Claude Opus 4.7. In de proef vond Opus losse feiten goed terug, maar bij vijf meerstapsvragen haalde het op 1 miljoen tokens drie goede antwoorden; op 512.000 tokens waren dat er vijf. Haiku 5.5 zat niet in deze test en de onderzochte teksten waren klassiek-Chinese biografieën, dus de uitslag voorspelt niet hoe Haiku op Nederlandse contracten of code presteert. De preprint rapporteert deze verschillen tussen losse feiten en meerstapsvragen bij 1 miljoen tokens.
De uitkomst laat zien waarom de specificatie op zichzelf geen kwaliteitsclaim is. Een model kan een dossier in één keer ontvangen en toch moeite hebben met een vraag die feiten uit verschillende delen combineert. De prestatie blijkt uit eigen documenten: vindt het model de juiste passages terug en legt het relaties correct uit?
De 1 miljoen tokens verruimen de werkset die in één API-verzoek past. De tokenizer, de 100.000-tokenprijstrap en herhaalde agentaanroepen bepalen hoeveel van die ruimte een workflow gebruikt. Voor Nederlandse teams verschuift de modelkeuze daardoor naar de combinatie van documentvolume, taakbetrouwbaarheid en verbruik per afgeronde taak.
Veelgestelde vragen
Van dossier naar werkende kennis
Ik denk mee over welke documenten en vragen jouw team echt wil afhandelen, ontwerp de kennisstroom en realiseer de automatisering van idee tot live toepassing. Waar het kan, draait die self-hosted.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
