Oossa

Onderzoek: documentpagina’s zijn te reconstrueren uit vectoren

Onderzoekers ontdekten dat visuele documentindexen met meerdere vectoren genoeg informatie prijsgeven om pagina’s te reconstrueren, inclusief gevoelige tekst.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Een team onder leiding van Zhuchenyang Liu publiceerde op 8 oktober 2026 een paper waaruit blijkt dat de vector databases van visuele documentzoeksystemen kunnen worden omgezet in leesbare pagina’s. De aanval haalt ongeveer 47% van de woorden terug en zet de oorspronkelijke pagina bij 98,4% van de zoekopdrachten in de ViDoRe v3-benchmark op de eerste plaats. Eenvoudige beveiligingsmaatregelen, zoals token pooling of het door elkaar husselen van tokens, verlagen het percentage teruggevonden woorden tot ongeveer 8%. Maar een model dat de gehusselde vectoren opnieuw ordent, kan de juiste pagina nog steeds in 93,5% van de gevallen bovenaan zetten. De bevindingen gelden ook voor een andere retriever: daarbij komt de oorspronkelijke pagina in 70,2% van de gevallen op de eerste plaats.

Waarom het ertoe doet

Organisaties die documentindexen opslaan in vector databases van derden hebben mogelijk sterkere beveiliging nodig om vertrouwelijke tekst te beschermen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.