TEMA: Evidence-Grounded Temporal Question Answering in Multi-Turn Multi-Audio Dialogs

📅 2026-09-24
📈 Citations: 0
✨ Influential: 0
📄 PDF
🤖 AI Summary
This study addresses the challenge of temporal question answering involving cross-recording references and event tracking in multi-turn, multi-audio dialogues. To this end, it proposes an evidence-anchored temporal QA paradigm that employs a Route module to delineate relevant audio segments and a Span module to generate conditioned captions for precise evidence localization. Built upon Qwen2.5-Omni, the framework integrates temporal initialization with full-dialogue supervised fine-tuning, alongside a completeness-prioritized Span-only GRPO strategy that applies reinforcement learning exclusively to evidence generation. Furthermore, this work constructs a large-scale dataset with turn-level evidence annotations, substantially enhancing cross-audio event localization and comparative reasoning capabilities. Empirical results demonstrate that optimizing solely for evidence generation effectively improves both interval recovery rates and overall answer accuracy.
📝 Abstract
Multi-turn, multi-audio temporal question answering requires models to track target events across follow-up questions, recording switches, and historical references, recovering complete instances and their boundaries for temporal calculation and comparison. We propose TEMA, which connects event perception with evidence-based answering through Route, specifying the audio scope, and Span, describing all relevant intervals as conditional audio captions. We construct TEMA-Dialog with 40,704 dialogs and per-turn evidence and answer supervision, and TEMA-Bench for joint evaluation of evidence and final answers. Training combines temporal grounding initialization, full-dialog supervised fine-tuning, and completeness-first Span-only GRPO. Experiments on Qwen2.5-Omni and AF-Next show improved temporal question answering, particularly event localization and cross-audio comparison. Reinforcement learning applied solely to evidence further improves interval recovery and answer accuracy.
Problem

Research questions and friction points this paper is trying to address.

Temporal Question Answering
Multi-turn Dialogs
Multi-audio
Event Localization
Cross-audio Comparison
Innovation

Methods, ideas, or system contributions that make the work stand out.

Temporal Question Answering
Multi-turn Multi-Audio Dialogs
Evidence-Grounded Reasoning
GRPO Reinforcement Learning
Audio Event Localization
🔎 Similar Papers
No similar papers found.
💼 Related Jobs
No related jobs found.
Kaidi Yang
Kaidi Yang
Assistant Professor, Dept. of Civil & Environmental Engineering, National University of Singapore
Traffic controlconnected and automated vehicleslearning-based control
H
Hualei Wang
Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China.
Z
Zhaohui Wang
Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China.
C
Chenxuan Wang
Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China.
H
Hong Liu
Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China.
Xiangdong Wang
Xiangdong Wang
Department of Maternal, Child and Adolescent Health
Machine learningNutritional Epidemiology