arXiv Artificial IntelligenceCommit-first LLM judging inherits the judge's own errors
arXiv:2609.00088v1 Announce Type: cross Abstract: LLM judges, models that score another system's output, can…
Curated from international AI laboratories, specialist publications and technology outlets. Last update: 3 hours ago.
arXiv Artificial IntelligencearXiv:2609.00088v1 Announce Type: cross Abstract: LLM judges, models that score another system's output, can…
arXiv Artificial IntelligencearXiv:2609.00086v1 Announce Type: cross Abstract: Large language models (LLMs) are increasingly used as…
arXiv Artificial IntelligencearXiv:2609.00082v1 Announce Type: cross Abstract: LLMs acquire vast amounts of knowledge during pre-training…
arXiv Artificial IntelligencearXiv:2609.00078v1 Announce Type: cross Abstract: Parameter-efficient fine-tuning methods such as LoRA have…
arXiv Artificial IntelligencearXiv:2609.00070v1 Announce Type: cross Abstract: Powder X-ray diffraction (XRD) is central to materials…
arXiv Artificial IntelligencearXiv:2609.00069v1 Announce Type: cross Abstract: Self-improving agents iteratively modify their own harness…
arXiv Artificial IntelligencearXiv:2609.00068v1 Announce Type: cross Abstract: Medical AI is moving beyond recognition towards clinical…
arXiv Artificial IntelligencearXiv:2609.00067v1 Announce Type: cross Abstract: External text can override conflicting image evidence in…
arXiv Artificial IntelligencearXiv:2609.00066v1 Announce Type: cross Abstract: NVFP4 is an efficient microscaling format for low-bit…
arXiv Artificial IntelligencearXiv:2609.00064v1 Announce Type: cross Abstract: In-context learning (ICL) lets large language models adapt…
arXiv Artificial IntelligencearXiv:2609.00063v1 Announce Type: cross Abstract: The growing use of large language models (LLMs) for search…
arXiv Artificial IntelligencearXiv:2609.00062v1 Announce Type: cross Abstract: Data contamination undermines the reliable evaluation of…