self-rag
Self-RAG enables models to decide when retrieval is needed versus generating from internal knowledge. **Motivation**: Not every query needs retrieval - simple questions answered from memory, complex/factual ones need grounding. Unconditional retrieval adds latency and may introduce noise. **Mechanism**: Model first predicts "retrieve" or "generate" token, if retrieve: execute RAG pipeline, if generate: answer directly from parameters, model self-evaluates answer quality. **Training**: Train model (or classifier) on examples of when retrieval helps vs hurts. Reward model for correct retrieve/no-retrieve decisions. **Self-critique**: Model generates answer, evaluates factuality, decides if retrieval needed to verify or improve. **Implementation**: Either fine-tune model with retrieval decisions, or use prompted self-evaluation. **Benefits**: Lower latency (skip retrieval when unnecessary), reduced cost, potentially higher quality (no irrelevant context). **Challenges**: Model must calibrate uncertainty, may skip retrieval when needed. **Related**: FLARE (Forward-Looking Active REtrieval), Adaptive RAG. Represents move toward smarter, more efficient retrieval decisions.