arXiv Artificial IntelligenceClean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints
arXiv:2609.04198v1 Announce Type: new Abstract: Language-model judges now gate training data, score…
