arXiv Artificial IntelligenceRevisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
arXiv:2605.12969v4 Announce Type: replace-cross Abstract: Group Relative Policy Optimization (GRPO) is one of…
Curated from international AI laboratories, specialist publications and technology outlets. Last update: 3 hours ago.
arXiv Artificial IntelligencearXiv:2605.12969v4 Announce Type: replace-cross Abstract: Group Relative Policy Optimization (GRPO) is one of…
arXiv Artificial IntelligencearXiv:2605.10488v2 Announce Type: replace-cross Abstract: External knowledge enables large language model…
arXiv Artificial IntelligencearXiv:2604.24357v3 Announce Type: replace-cross Abstract: Discrete diffusion models admit many token orders…
arXiv Artificial IntelligencearXiv:2604.20719v2 Announce Type: replace-cross Abstract: Omnimodal notation processing, centered on sheet…
arXiv Artificial IntelligencearXiv:2604.20443v3 Announce Type: replace-cross Abstract: We introduce DialToM, an annotated Theory of Mind…
arXiv Artificial IntelligencearXiv:2604.13076v4 Announce Type: replace-cross Abstract: We investigate the robustness of value alignment…
arXiv Artificial IntelligencearXiv:2604.09746v2 Announce Type: replace-cross Abstract: As large language models (LLMs) are increasingly…
arXiv Artificial IntelligencearXiv:2604.09544v3 Announce Type: replace-cross Abstract: Large language models remain vulnerable to…
arXiv Artificial IntelligencearXiv:2604.08884v2 Announce Type: replace-cross Abstract: Multimodal Large Language Models (MLLMs) have…
arXiv Artificial IntelligencearXiv:2604.06770v2 Announce Type: replace-cross Abstract: Maintenance procedures in manufacturing facilities…
arXiv Artificial IntelligencearXiv:2604.05779v2 Announce Type: replace-cross Abstract: While large language models (LLMs) demonstrate…
arXiv Artificial IntelligencearXiv:2604.03058v3 Announce Type: replace-cross Abstract: LLMs can be socially sycophantic, affirming users…