arXiv Artificial IntelligenceWhen LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation
arXiv:2509.26600v3 Announce Type: replace-cross Abstract: As LLMs rapidly saturate existing benchmarks…
Curated from international AI laboratories, specialist publications and technology outlets. Last update: 3 hours ago.
arXiv Artificial IntelligencearXiv:2509.26600v3 Announce Type: replace-cross Abstract: As LLMs rapidly saturate existing benchmarks…
arXiv Artificial IntelligencearXiv:2509.25256v4 Announce Type: replace-cross Abstract: The systematic assessment of AI systems is…
arXiv Artificial IntelligencearXiv:2509.24192v3 Announce Type: replace-cross Abstract: Vision-language models (VLMs) have advanced…
arXiv Artificial IntelligencearXiv:2509.17930v3 Announce Type: replace-cross Abstract: Multilingual translation suffers from computational…
arXiv Artificial IntelligencearXiv:2509.04183v3 Announce Type: replace-cross Abstract: The growing demand for scalable psychological…
arXiv Artificial IntelligencearXiv:2508.20766v2 Announce Type: replace-cross Abstract: Safety alignment in Large Language Models (LLMs)…
arXiv Artificial IntelligencearXiv:2508.20705v4 Announce Type: replace-cross Abstract: Recent advances in self-supervised learning for EEG…
arXiv Artificial IntelligencearXiv:2508.13186v2 Announce Type: replace-cross Abstract: AI agents with advanced reasoning and tool-use…
arXiv Artificial IntelligencearXiv:2508.03448v4 Announce Type: replace-cross Abstract: Music recordings often suffer from audio quality…
arXiv Artificial IntelligencearXiv:2508.02601v2 Announce Type: replace-cross Abstract: Tabular data derives its value from inter-feature…
arXiv Artificial IntelligencearXiv:2508.02208v3 Announce Type: replace-cross Abstract: Evaluating the mathematical capability of Large…
arXiv Artificial IntelligencearXiv:2507.05512v2 Announce Type: replace-cross Abstract: Large language models (LLMs) are increasingly used…