arXiv Artificial IntelligenceConfidently Wrong, Silently So: Auditing Undetectable Failures of a Deployed On-Device Language Model
arXiv:2608.23663v2 Announce Type: cross Abstract: Aligning deployed language models requires knowing when…
Curated from international AI laboratories, specialist publications and technology outlets. Last update: 3 hours ago.
arXiv Artificial IntelligencearXiv:2608.23663v2 Announce Type: cross Abstract: Aligning deployed language models requires knowing when…
arXiv Artificial IntelligencearXiv:2608.23660v1 Announce Type: cross Abstract: Large language models (LLMs) are increasingly used to…
arXiv Artificial IntelligencearXiv:2608.23658v1 Announce Type: cross Abstract: An LLM serving engine sizes its key-value (KV) cache once…
arXiv Artificial IntelligencearXiv:2608.23653v1 Announce Type: cross Abstract: AI agents are increasingly used for simulation-driven…
arXiv Artificial IntelligencearXiv:2608.23651v1 Announce Type: cross Abstract: Agent harnesses record a failed tool call and its error…
arXiv Artificial IntelligencearXiv:2608.23635v1 Announce Type: cross Abstract: Large language models (LLMs) rely on tool calling as a…
arXiv Artificial IntelligencearXiv:2608.23629v1 Announce Type: cross Abstract: Creating symbolic operators by hand is one of the main…
arXiv Artificial IntelligencearXiv:2608.23623v1 Announce Type: cross Abstract: Tool-using agents must decide when to stop. Existing…
arXiv Artificial IntelligencearXiv:2608.23619v1 Announce Type: cross Abstract: Legacy software repositories embed decades of domain…
arXiv Artificial IntelligencearXiv:2608.23616v2 Announce Type: cross Abstract: An AI agent's rebuild is only as good as the process that…
arXiv Artificial IntelligencearXiv:2608.23611v1 Announce Type: cross Abstract: Large Language Models (LLMs) offer new opportunities for…
arXiv Artificial IntelligencearXiv:2608.23593v1 Announce Type: cross Abstract: Text-to-image systems use learned aesthetic scorers to…