Shadow Queries for Private Retrieval in Vector Databases
Quick summary
arXiv:2609.04767v1 Announce Type: new Abstract: Large language models (LLMs) increasingly rely on information retrieval (IR) systems, such as Retrieval-Augmented Generation (RAG), to incorporate domain-specific knowledge without costly re-training. These systems often store pre-computed document embeddings in cloud-based vector databases. However, such embeddings are vulnerable to embedding inversion attacks (EIAs), which can reconstruct their underlying text. Existing defenses, such as adding noise or scaling embeddings, often provide limited privacy or significantly reduce retrieval utility.
Key takeaways
- arXiv:2609.04767v1 Announce Type: new Abstract: Large language models (LLMs) increasingly rely on information retrieval (IR) systems, such as Retrieval-Augmented Generation (RAG), to incorporate domain-specific knowledge without costly re-training.
- These systems often store pre-computed document embeddings in cloud-based vector databases.
- However, such embeddings are vulnerable to embedding inversion attacks (EIAs), which can reconstruct their underlying text.
Why it matters
The significance is not only the legal text but how it changes product design. Decisions around “Shadow Queries for Private Retrieval in Vector Databases” may reshape data collection, model training, output accountability and market access.

Member comments