arXiv Artificial Intelligence

SceneJail: Exploiting Video Scenario Context to Jailbreak Multimodal LLMs

SceneJail: Exploiting Video Scenario Context to Jailbreak Multimodal LLMs

Quick summary

arXiv:2609.38899v1 Announce Type: cross Abstract: Video Multimodal Large Language Models (Video-MLLMs) support reasoning over video inputs, yet remain vulnerable to jailbreak attacks that elicit policy-violating responses. Existing video jailbreaks primarily manipulate how harmful queries are visually presented, thereby treating video merely as a carrier. Consequently, the surrounding video scenario remains unexplored as a contextual attack surface. In this paper, we show that the same harmful query can elicit different safety responses when placed in different video scenarios. To systematical

Key takeaways

  • arXiv:2609.38899v1 Announce Type: cross Abstract: Video Multimodal Large Language Models (Video-MLLMs) support reasoning over video inputs, yet remain vulnerable to jailbreak attacks that elicit policy-violating responses.
  • Existing video jailbreaks primarily manipulate how harmful queries are visually presented, thereby treating video merely as a carrier.
  • Consequently, the surrounding video scenario remains unexplored as a contextual attack surface.

Why it matters

This model development creates a new option for users and a new testing obligation for developers. A fixed evaluation set comparing quality, cost and failure behavior is more useful than launch claims.

Kaynak sitede devamını oku: arXiv Artificial Intelligence ↗