arXiv Artificial Intelligence

Shadow Queries for Private Retrieval in Vector Databases

Shadow Queries for Private Retrieval in Vector Databases

Quick summary

arXiv:2609.04767v1 Announce Type: new Abstract: Large language models (LLMs) increasingly rely on information retrieval (IR) systems, such as Retrieval-Augmented Generation (RAG), to incorporate domain-specific knowledge without costly re-training. These systems often store pre-computed document embeddings in cloud-based vector databases. However, such embeddings are vulnerable to embedding inversion attacks (EIAs), which can reconstruct their underlying text. Existing defenses, such as adding noise or scaling embeddings, often provide limited privacy or significantly reduce retrieval utility.

Key takeaways

  • arXiv:2609.04767v1 Announce Type: new Abstract: Large language models (LLMs) increasingly rely on information retrieval (IR) systems, such as Retrieval-Augmented Generation (RAG), to incorporate domain-specific knowledge without costly re-training.
  • These systems often store pre-computed document embeddings in cloud-based vector databases.
  • However, such embeddings are vulnerable to embedding inversion attacks (EIAs), which can reconstruct their underlying text.

Why it matters

The significance is not only the legal text but how it changes product design. Decisions around “Shadow Queries for Private Retrieval in Vector Databases” may reshape data collection, model training, output accountability and market access.

Kaynak sitede devamını oku: arXiv Artificial Intelligence ↗