Wavelet-based Intra-video Counterfactual Reasoning for Video Question Grounding
Abstract
Video Question Grounding (VideoQG) requires models toanswer questions and localize supporting temporal evidence. Despiteprogress in video-language models, they remain susceptible to variousbiases. Prior debiasing methods primarily focus on dataset-level correla-tions, while easily overlooking intra-video temporal bias, where visuallysimilar segments differ substantially in their causal relevance to answer-ing the question. To address this challenge, we present Wavelet-basedIntra-video Causal Intervention (WICI), a framework designed to dis-entangle causal temporal evidence from redundant visual contexts. OurWICI comprises two key components: (1) an Intra-video Causal Interven-tion module, which utilizes counterfactual reasoning to suppress irrele-vant intra-video biases, and (2) Wavelet-based Dynamic Modeling, whichdecomposes contextual variations between visually similar frames to cap-ture fine-grained temporal cues. Extensive experiments on two VideoQGbenchmarks demonstrate that the proposed WICI significantly improvesquestion grounding accuracy and yields more robust, faithful questionreasoning.