Blauwe en grijze netwerkkabels in een serverpatchpaneel
Nieuws17 september · 02:314 min leestijd

Cohere versleutelt AI-inferentie in Model Vault

Cohere voegt confidential computing toe aan Model Vault. Prompts en antwoorden blijven tijdens inferentie versleuteld in hardware-TEE’s, terwijl klanten de draaiende code en beveiligingspolicy vóór verzending kunnen laten attesteren.

Model Vault krijgt van Cohere een versleutelde inferentielaag die prompts en antwoorden ook tijdens verwerking afschermt, zodat zelfs Cohere ze volgens de eigen documentatie niet in plaintext ziet.

Voor een Nederlandse organisatie met klantdossiers, medische gegevens, broncode of bedrijfsgeheimen verschuift daarmee de technische grens van privacy. Gevoelige data hoeft in deze opzet niet leesbaar bij Cohere, de cloudprovider of de beheertools rond de servingomgeving te staan. Je houdt een beheerde AI-dienst, maar de bescherming moet aantoonbaar in de architectuur zitten.

Wat er technisch verandert

Model Vault was al een beheerde, single-tenant omgeving voor Cohere-modellen. De nieuwe Encrypted Vault voegt confidential computing toe aan het moment waarop een model de prompt verwerkt. De CPU draait in een hardware-beveiligde virtuele machine, bijvoorbeeld met Intel TDX of AMD SEV-SNP. De NVIDIA-GPU draait tegelijk in confidential-computingmodus.

De aanvraag loopt via Cohere’s OHTTP-proxy in de eigen omgeving van de klant. Die proxy versleutelt de aanvraag voordat die het netwerk verlaat. De load balancer en het netwerk zien daardoor alleen versleutelde data. Een directe aanroep van het vault-endpoint is niet toegestaan.

Serverrack met bekabeling in een datacenter, als illustratie van AI-infrastructuur: Bron: Federal Bureau of Investigation / Wikimedia Commons (Public domain)
Serverrack met bekabeling in een datacenter, als illustratie van AI-infrastructuur: Bron: Federal Bureau of Investigation / Wikimedia Commons (Public domain)

Het verschil met gewone encryptie zit in het gebruik tijdens de berekening. De data blijft ook in de TEE versleuteld en geïsoleerd tijdens inferentie, zo legt Cohere uit. De vertrouwensgrens omvat volgens de documentatie de inference server, prompts en antwoorden, terwijl onder meer het hostbesturingssysteem, de hypervisor, Kubernetes en de load balancer erbuiten vallen.

Attestatie zit in het requestpad

De belangrijkste controle gebeurt aan de klantkant. De OHTTP-proxy haalt een attestatietoken en een publieke OHTTP-sleutel op, controleert de handtekening via Intel Trust Authority, vergelijkt de gemeten hardware en software met de goedgekeurde policy en controleert of de sleutel aan de echte TEE is gekoppeld. Alleen als die controles slagen, gaat de aanvraag weg.

Dat proces draait bij iedere sessie voordat de client de aanvraag versleutelt, volgens Cohere. Ook iedere inferentierespons bevat een attestatiecertificaat dat de klant kan controleren. Het dashboard met een groen schild is daarbij slechts een informatief overzicht. De clientcontrole is de beveiligingsgrens.

Voor een bedrijf wordt de vraag aan een AI-leverancier concreter. Welke code draaide er, welke policy gold, wie hield de sleutels en kan de klant dat bewijs aan een auditor laten zien?

De leverancier krijgt de sleutels niet

Cohere documenteert dat sleutels voor geheugenversleuteling en de OHTTP-verbinding binnen de TEE worden gegenereerd. De private sleutel verlaat die omgeving niet. Bij ingeschakelde Zero Data Retention worden prompts en antwoorden niet bewaard, volgens Cohere’s documentatie. Daardoor bestaat plaintext volgens die documentatie alleen tijdens de request in de TEE.

De claim heeft wel grenzen. Cohere noemt side-channelaanvallen, observatie van metadata en verkeerspatronen en beschikbaarheid als resterende risico’s. Een beheerder kan de omgeving nog steeds stoppen of herstarten, ook als die beheerder de promptinhoud niet kan lezen.

Ook de open-sourcebelofte vraagt precisie. De documentatie noemt de reproduceerbare buildketen, containerpolicy, initdata en containerimages open en controleerbaar, maar zegt ook dat sommige firmware- en virtual-device-lagen van hardware- en cloudleveranciers gesloten blijven. VentureBeat meldt dat Cohere de volledige serving-stack wil open sourcen, zodat onafhankelijke auditors kunnen controleren of de software logt, exporteert of data lekt. Dat is een plan, geen al opgeleverde onafhankelijke audit.

Beperkte bèta, beperkte modelkeuze

Cohere kondigde de functie op 16 september aan en opent early access voor een beperkte groep bètaklanten. Tijdens de bèta is de dienst gratis voor designpartners en zijn de algemene prijzen nog niet gepubliceerd, aldus de officiële prijspagina. De commerciële voorwaarden zijn dus nog bèta-voorwaarden, geen vaste prijslijst.

De bètadocumentatie noemt zeven modelcategorieën: Embed, Rerank, Parse, Compass, North Mini Code, Cohere Transcribe en aangepaste Cohere-modellen. Volgens Cohere kan de beschikbaarheid per model, regio en capaciteit verschillen.

De richting sluit aan bij Enigmata’s beschrijving van AI die op versleutelde data kan trainen, zoeken en analyseren zonder plaintext aan model of verwerkingsomgeving te geven. De technieken verschillen, maar de ontwerpkeuze is vergelijkbaar: privacy wordt afgedwongen in de datastroom zelf, niet alleen beloofd in een beleidstekst.

Voor organisaties die AI met gevoelige gegevens willen inzetten, verschuift daarmee de relevante inkoopvraag. Het gaat minder om de zin dat een leverancier niet kijkt en meer om het bewijs welke code, sleutel en beveiligingspolicy de data tijdens die ene inferentie werkelijk beschermden.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Vertrouwelijke AI ontwerpen

Ik help je gevoelige bedrijfskennis bruikbaar maken in AI, van meedenken en ontwerp tot realiseren en automatiseren, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Cornelis introduceert Active Compute Fabric voor AI-clusters
Nieuws
4 min

15 sep 00:37

Cornelis introduceert Active Compute Fabric voor AI-clusters

Cornelis introduceert een open netwerkfabric die rekenwerk in de verbinding tussen AI-accelerators wil uitvoeren. De stap raakt Nvidia’s gesloten scale-up-laag, terwijl 205 miljoen dollar de productie en klantuitrol moet versnellen.

Palantir stelt retentie-eis, Nvidia en Booz Allen beperken Anthropic
Nieuws
5 min

14 sep 18:22

Palantir stelt retentie-eis, Nvidia en Booz Allen beperken Anthropic

Palantir eist onherroepelijke nulretentie, Nvidia beperkt Anthropic tot minder gevoelige taken en Booz Allen blokkeert het commerciële model voor vertrouwelijk cyberwerk. Retentie wordt zo een directe modelkeuze.

NVIDIA maakt OSMO open source voor fysieke AI
Nieuws
4 min

14 sep 12:28

NVIDIA maakt OSMO open source voor fysieke AI

NVIDIA maakt OSMO open source: één YAML-workflow stuurt datageneratie, training, simulatie en hardwaretests aan over cloud, on-premises en edge. Voor robotica- en maakbedrijven verlaagt dat vooral de infrastructuurdrempel.

Red Hat maakt AI 3.5 klaar voor beheerde productie
Nieuws
3 min

10 sep 10:57

Red Hat maakt AI 3.5 klaar voor beheerde productie

Red Hat AI 3.5 maakt EvalHub, multi-tenancy, agentbeveiliging en observability algemeen beschikbaar. Voor Nederlandse organisaties verschuift de beheeropgave daarmee van een model kiezen naar vooraf testen, bevoegdheden afbakenen en verbruik aantonen.

Vention opent Physical AI-lab voor productie
Nieuws
3 min

9 sep 18:47

Vention opent Physical AI-lab voor productie

Vention opent in Montréal een Physical AI-lab om robotic manipulation uit onderzoek naar betrouwbare inzet in productie te brengen. De stap draait om data, variatie, kosten en robotcellen die echt moeten blijven werken.

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata
Nieuws
5 min

3 sep 18:36

IFM geeft zes AI-modellen vrij met trainingscode en pre-trainingsdata

Het Abu Dhabi-instituut IFM geeft zes AI-modellen van 0,9 tot 375 miljard parameters vrij met trainingscode en pre-trainingscorpus. Op de modelkaarten wijkt de licentie op een punt af van het persbericht.