arXiv Artificial Intelligence

AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models

AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models

Quick summary

arXiv:2609.19991v1 Announce Type: cross Abstract: Omni models can describe video content, but can they locate events in time, preserve event order, and judge audio-visual synchronization? We introduce AVTrace (Audio-Visual Temporal Reasoning Assessment and Capability Evaluation), a silver-standard diagnostic suite spanning onset and span grounding, synchronization, next-step prediction, cross-modal localization, chain parsing, and event-conditioned comprehension. It contains 34,114 training examples and category-balanced development and test splits of 3,500 and 7,000 examples. We evaluate five

Key takeaways

  • arXiv:2609.19991v1 Announce Type: cross Abstract: Omni models can describe video content, but can they locate events in time, preserve event order, and judge audio-visual synchronization?
  • We introduce AVTrace (Audio-Visual Temporal Reasoning Assessment and Capability Evaluation), a silver-standard diagnostic suite spanning onset and span grounding, synchronization, next-step prediction, cross-modal localization, chain parsing, and event-conditioned comprehension.
  • It contains 34,114 training examples and category-balanced development and test splits of 3,500 and 7,000 examples.

Why it matters

“AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models” should be evaluated beyond branding and benchmark scores. Its practical importance will emerge in task accuracy, latency, unit cost, safety and integration with real workflows.

Kaynak sitede devamını oku: arXiv Artificial Intelligence ↗