Multi-query retrieval generates query variations to achieve broader document coverage. Mechanism: Original query → LLM generates N alternative phrasings → retrieve with each → merge results (union or RRF). Why it works: Single query may miss relevant documents phrased differently. Multiple angles catch variations. Different queries surface different relevant results. Generation prompts: "Generate 3 different ways to ask this question", "What related questions might help answer this?", "Rephrase for technical/casual audiences". Fusion strategies: Union (all unique results), RRF (ranked fusion), weighted by query similarity to original. Trade-offs: N× retrieval cost, increased latency, potential for irrelevant results from poor variations. Optimization: Generate queries in parallel, batch embed, efficient deduplication. Comparison: Similar to RAG-Fusion which also generates sub-questions and fuses results. When to use: Ambiguous queries, exploratory research, broad topics with multiple facets. Best practices: Limit to 3-5 variations, validate query quality, monitor result diversity improvement.
Related Topics
Explore 500+ Semiconductor & AI Topics
From EUV lithography to CUDA optimization — search the full knowledge base or chat with our AI assistant.