皇冠体育

师资博士后单良在A2类期刊发表学术论文

师资博士后单良作为第一作者撰写的论文“Text-Parsing Adaptive Gated Fusion for Audio-Visual Question Answering”在 《Journal of Computer Science and Technology》在线发表。该期刊属我校A2类期刊。

文章面向音视频问答(AVQA)任务中多模态信息有效融合的复杂需求,深入分析了无关音视频内容容易掩盖关键信号的挑战,并创新性地提出了一种基于文本解析的自适应门控融合网络(TP-Net)。与现有将所有问题类型同等对待的传统方法不同,该框架能够根据问题语义动态调整各模态的贡献度,例如在处理听觉主导的问题时针对性地提升音频特征权重,从而实现更精准的感知与推理。此外,该模型设计了时空感知模块(SPM)以精准筛选关键时间片段并优化音视频的时空关联,同时构建了模态门控融合模块(MFM)基于问题类型对多模态特征进行重新加权。在标准AVQA基准测试上的广泛实验结果表明,该方法取得了当前最优(State-of-the-art)的性能,尤其在需要精细多模态推理的复杂场景中展现出了卓越的优势。