arXiv Artificial IntelligenceMMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents
arXiv:2607.29002v1 Announce Type: new Abstract: Online shoppers increasingly turn to AI shopping assistants…
Curated from international AI laboratories, specialist publications and technology outlets. Last update: 3 hours ago.
arXiv Artificial IntelligencearXiv:2607.29002v1 Announce Type: new Abstract: Online shoppers increasingly turn to AI shopping assistants…
arXiv Artificial IntelligencearXiv:2607.28990v1 Announce Type: new Abstract: Large language model agents have shown promising capabilities…
arXiv Artificial IntelligencearXiv:2607.28894v2 Announce Type: new Abstract: Computational cognitive modeling seeks to infer latent…
arXiv Artificial IntelligencearXiv:2607.28818v1 Announce Type: new Abstract: As AI companions increasingly mediate repeated social…
arXiv Artificial IntelligencearXiv:2607.28802v1 Announce Type: new Abstract: Existing evaluations often reduce agent failures to…
arXiv Artificial IntelligencearXiv:2607.28788v1 Announce Type: new Abstract: Clinical diagnosis at hospital admission must be made rapidly…
arXiv Artificial IntelligencearXiv:2607.28692v1 Announce Type: new Abstract: Large language model (LLM) agents have been increasingly…
arXiv Artificial IntelligencearXiv:2607.28685v1 Announce Type: new Abstract: Agent-safety benchmarks measure different behaviors, and…
arXiv Artificial IntelligencearXiv:2607.28684v1 Announce Type: new Abstract: Existing benchmarks for scientific equation discovery are…
arXiv Artificial IntelligencearXiv:2607.28679v1 Announce Type: new Abstract: Multi-agent planning problems arise in a variety of…
arXiv Artificial IntelligencearXiv:2607.28678v1 Announce Type: new Abstract: Multimodal agents operating in long-horizon environments must…
arXiv Artificial IntelligencearXiv:2607.28677v1 Announce Type: new Abstract: LLM now pass medical licensing examinations and, in curated…