Het benutten van de universele geometrie van embeddings
Samenvatting
Wij introduceren de eerste methode voor het vertalen van tekst-embeddings van de ene vectorruimte naar de andere, zonder gebruik te maken van gepaarde data, encoders of vooraf gedefinieerde sets van matches.
Onze ongesuperviseerde benadering vertaalt elke embedding naar en van een universele latente representatie (een universele semantische structuur die wordt verondersteld door de Platonic Representation Hypothesis). Onze vertalingen behalen een hoge cosinus-overeenkomst tussen modelparen met verschillende architecturen, parameteraantallen en trainingsdatasets.
Het vermogen om onbekende embeddings naar een andere ruimte te vertalen terwijl hun geometrie behouden blijft, heeft ernstige implicaties voor de beveiliging van vectordatabases. Een aanvaller met toegang tot enkel embedding-vectoren kan gevoelige informatie over de onderliggende documenten extraheren, wat voldoende is voor classificatie en attribuutinferentie.
Groetjes,