arXiv Artificial IntelligenceSUP-MIMIC: A Multi-Task Clinical Diagnosis Benchmark for Evaluating LLMs' Robustness to Contradictory Evidence
arXiv:2608.29582v1 Announce Type: cross Abstract: Current evaluations of large language models (LLMs)…
Curated from international AI laboratories, specialist publications and technology outlets. Last update: 3 hours ago.
arXiv Artificial IntelligencearXiv:2608.29582v1 Announce Type: cross Abstract: Current evaluations of large language models (LLMs)…
arXiv Artificial IntelligencearXiv:2608.29563v1 Announce Type: cross Abstract: School coaches prepare for opponents with game film and…
arXiv Artificial IntelligencearXiv:2608.29549v1 Announce Type: cross Abstract: Text-to-spatial audio generation, such as…
arXiv Artificial IntelligencearXiv:2608.29543v1 Announce Type: cross Abstract: Recent advances in large language models (LLMs) have…
arXiv Artificial IntelligencearXiv:2608.29537v1 Announce Type: cross Abstract: Frozen vision-language-action (VLA) policies offer broad…
arXiv Artificial IntelligencearXiv:2608.29535v1 Announce Type: cross Abstract: Infectious disease transmission is shaped by patterns of…
arXiv Artificial IntelligencearXiv:2608.29530v1 Announce Type: cross Abstract: Modern systems in artificial intelligence (AI) somehow…
arXiv Artificial IntelligencearXiv:2608.29529v1 Announce Type: cross Abstract: Semantic alignment between specialized normative texts is…
arXiv Artificial IntelligencearXiv:2608.29513v1 Announce Type: cross Abstract: Machine unlearning enables deep neural networks to…
arXiv Artificial IntelligencearXiv:2608.29507v1 Announce Type: cross Abstract: Diffusion models are increasingly used not only for…
arXiv Artificial IntelligencearXiv:2608.29490v1 Announce Type: cross Abstract: Multi-agent systems in the real-world (e.g., drone swarms…
arXiv Artificial IntelligencearXiv:2608.29478v1 Announce Type: cross Abstract: Scholarly work which aims to describe potential societal…