Model Vault krijgt van Cohere een versleutelde inferentielaag die prompts en antwoorden ook tijdens verwerking afschermt, zodat zelfs Cohere ze volgens de eigen documentatie niet in plaintext ziet.
Voor een Nederlandse organisatie met klantdossiers, medische gegevens, broncode of bedrijfsgeheimen verschuift daarmee de technische grens van privacy. Gevoelige data hoeft in deze opzet niet leesbaar bij Cohere, de cloudprovider of de beheertools rond de servingomgeving te staan. Je houdt een beheerde AI-dienst, maar de bescherming moet aantoonbaar in de architectuur zitten.
Wat er technisch verandert
Model Vault was al een beheerde, single-tenant omgeving voor Cohere-modellen. De nieuwe Encrypted Vault voegt confidential computing toe aan het moment waarop een model de prompt verwerkt. De CPU draait in een hardware-beveiligde virtuele machine, bijvoorbeeld met Intel TDX of AMD SEV-SNP. De NVIDIA-GPU draait tegelijk in confidential-computingmodus.
De aanvraag loopt via Cohere’s OHTTP-proxy in de eigen omgeving van de klant. Die proxy versleutelt de aanvraag voordat die het netwerk verlaat. De load balancer en het netwerk zien daardoor alleen versleutelde data. Een directe aanroep van het vault-endpoint is niet toegestaan.

Het verschil met gewone encryptie zit in het gebruik tijdens de berekening. De data blijft ook in de TEE versleuteld en geïsoleerd tijdens inferentie, zo legt Cohere uit. De vertrouwensgrens omvat volgens de documentatie de inference server, prompts en antwoorden, terwijl onder meer het hostbesturingssysteem, de hypervisor, Kubernetes en de load balancer erbuiten vallen.
Attestatie zit in het requestpad
De belangrijkste controle gebeurt aan de klantkant. De OHTTP-proxy haalt een attestatietoken en een publieke OHTTP-sleutel op, controleert de handtekening via Intel Trust Authority, vergelijkt de gemeten hardware en software met de goedgekeurde policy en controleert of de sleutel aan de echte TEE is gekoppeld. Alleen als die controles slagen, gaat de aanvraag weg.
Dat proces draait bij iedere sessie voordat de client de aanvraag versleutelt, volgens Cohere. Ook iedere inferentierespons bevat een attestatiecertificaat dat de klant kan controleren. Het dashboard met een groen schild is daarbij slechts een informatief overzicht. De clientcontrole is de beveiligingsgrens.
Voor een bedrijf wordt de vraag aan een AI-leverancier concreter. Welke code draaide er, welke policy gold, wie hield de sleutels en kan de klant dat bewijs aan een auditor laten zien?
De leverancier krijgt de sleutels niet
Cohere documenteert dat sleutels voor geheugenversleuteling en de OHTTP-verbinding binnen de TEE worden gegenereerd. De private sleutel verlaat die omgeving niet. Bij ingeschakelde Zero Data Retention worden prompts en antwoorden niet bewaard, volgens Cohere’s documentatie. Daardoor bestaat plaintext volgens die documentatie alleen tijdens de request in de TEE.
De claim heeft wel grenzen. Cohere noemt side-channelaanvallen, observatie van metadata en verkeerspatronen en beschikbaarheid als resterende risico’s. Een beheerder kan de omgeving nog steeds stoppen of herstarten, ook als die beheerder de promptinhoud niet kan lezen.
Ook de open-sourcebelofte vraagt precisie. De documentatie noemt de reproduceerbare buildketen, containerpolicy, initdata en containerimages open en controleerbaar, maar zegt ook dat sommige firmware- en virtual-device-lagen van hardware- en cloudleveranciers gesloten blijven. VentureBeat meldt dat Cohere de volledige serving-stack wil open sourcen, zodat onafhankelijke auditors kunnen controleren of de software logt, exporteert of data lekt. Dat is een plan, geen al opgeleverde onafhankelijke audit.
Beperkte bèta, beperkte modelkeuze
Cohere kondigde de functie op 16 september aan en opent early access voor een beperkte groep bètaklanten. Tijdens de bèta is de dienst gratis voor designpartners en zijn de algemene prijzen nog niet gepubliceerd, aldus de officiële prijspagina. De commerciële voorwaarden zijn dus nog bèta-voorwaarden, geen vaste prijslijst.
De bètadocumentatie noemt zeven modelcategorieën: Embed, Rerank, Parse, Compass, North Mini Code, Cohere Transcribe en aangepaste Cohere-modellen. Volgens Cohere kan de beschikbaarheid per model, regio en capaciteit verschillen.
De richting sluit aan bij Enigmata’s beschrijving van AI die op versleutelde data kan trainen, zoeken en analyseren zonder plaintext aan model of verwerkingsomgeving te geven. De technieken verschillen, maar de ontwerpkeuze is vergelijkbaar: privacy wordt afgedwongen in de datastroom zelf, niet alleen beloofd in een beleidstekst.
Voor organisaties die AI met gevoelige gegevens willen inzetten, verschuift daarmee de relevante inkoopvraag. Het gaat minder om de zin dat een leverancier niet kijkt en meer om het bewijs welke code, sleutel en beveiligingspolicy de data tijdens die ene inferentie werkelijk beschermden.
Veelgestelde vragen
Vertrouwelijke AI ontwerpen
Ik help je gevoelige bedrijfskennis bruikbaar maken in AI, van meedenken en ontwerp tot realiseren en automatiseren, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
