arXiv Artificial Intelligence

EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

Quick summary

arXiv:2607.23955v2 Announce Type: replace Abstract: Reinforcement learning enables Agentic RAG systems to learn multi-turn search from verifiable outcome rewards, but all- zero rollout groups provide no comparative signal and may hide useful search behavior. We present EviBack, an evidence- constrained Teacher backoff that supplies auxiliary super- vision to such groups while preserving verifiable Actor re- wards. It separates evidence assessment from answer refine- ment, preventing reference answers from overriding evidence- insufficiency judgments. A fully automated, end-to-end GPT- 5.5-assi

Key takeaways

  • arXiv:2607.23955v2 Announce Type: replace Abstract: Reinforcement learning enables Agentic RAG systems to learn multi-turn search from verifiable outcome rewards, but all- zero rollout groups provide no comparative signal and may hide useful search behavior.
  • We present EviBack, an evidence- constrained Teacher backoff that supplies auxiliary super- vision to such groups while preserving verifiable Actor re- wards.
  • It separates evidence assessment from answer refine- ment, preventing reference answers from overriding evidence- insufficiency judgments.

Why it matters

“EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff” should be evaluated beyond branding and benchmark scores. Its practical importance will emerge in task accuracy, latency, unit cost, safety and integration with real workflows.

Kaynak sitede devamını oku: arXiv Artificial Intelligence ↗