• Home
  • Search
  • Multi-Modality Latent Interaction Network for Visual Question Answering
  • Open Access IconOpen Access
  • Cite Icon90
  • https://doi.org/10.1109/iccv.2019.00592Copy DOI Icon

Multi-Modality Latent Interaction Network for Visual Question Answering

  • Oct 1, 2019
  • Gao Peng +4 more
Show More
  • Abstract
  • Literature Map
  • References
  • Citations
  • Similar Papers
Abstract

Exploiting relationships between visual regions and question words have achieved great success in learning multi-modality features for Visual Question Answering (VQA). However, we argue that existing methods mostly model relations between individual visual regions and words, which are not enough to correctly answer the question. From humans' perspective, answering a visual question requires understanding the summarizations of visual and language information. In this paper, we proposed the Multi-modality Latent Interaction module (MLI) to tackle this problem. The proposed module learns the cross-modality relationships between latent visual and language summarizations, which summarize visual regions and question into a small number of latent representations to avoid modeling uninformative individual region-word relations. The cross-modality information between the latent summarizations are propagated to fuse valuable information from both modalities and are used to update the visual and word features. Such MLI modules can be stacked for several stages to model complex and latent relations between the two modalities and achieves highly competitive performance on public VQA benchmarks, VQA v2.0 and TDIUC . In addition, we show that the performance of our methods could be significantly improved by combining with pre-trained language model BERT.

Similar Papers
  • PDF
  • Research Article
  • Citations2

An Entropy Clustering Approach for Assessing Visual Question Difficulty

  • Jan 01, 2020
  • IEEE Access
  • Kento Terao +4
  • Research Article
  • Citations7

Attacking VQA Systems via Adversarial Background Noise

  • Aug 01, 2020
  • IEEE Transactions on Emerging Topics in Computational Intelligence
  • Akshay Chaturvedi +1
  • Conference Article
  • Citations2

Estimating Viewed Images with Natural Language Question Answering from fMRI Data

  • Mar 01, 2020
  • Saya Takada +3
  • Research Article

Visual Question Answering Model Using Transformer-Based Multi-Head Cross Attention Network with Optimized Gold Rush Octave Convolution Network

  • Oct 28, 2025
  • International Journal of Image and Graphics
  • J Jinu Sophia +2
  • Research Article
  • Citations41

Multitask Learning for Visual Question Answering.

  • Mar 01, 2023
  • IEEE Transactions on Neural Networks and Learning Systems
  • Jie Ma +5
  • Conference Article

Square peg, round hole: A case study on using Visual Question & Answering in Games

  • Oct 15, 2021
  • Paulo Bala +4
  • Conference Article

Dual-Stream Semantic-Aware Fusion for Robust Visual Question Answering

  • Dec 19, 2025
  • Shivshanker Singh +1
  • PDF
  • Research Article
  • Citations5

Collaborative Modality Fusion for Mitigating Language Bias in Visual Question Answering.

  • Feb 23, 2024
  • Journal of Imaging
  • Qiwen Lu +2
  • Research Article
  • Citations15

Image Captioning by Asking Questions

  • Apr 30, 2019
  • ACM Transactions on Multimedia Computing, Communications, and Applications
  • Xiaoshan Yang +1
  • Research Article

Qualitative content analysis in visual question answering-based datasets and algorithms

  • Jan 01, 2020
  • International Journal of High Performance Computing and Networking
  • Prateek Ralhan +2
  • Research Article
  • Citations29

Multi-source Multi-level Attention Networks for Visual Question Answering

  • Apr 30, 2019
  • ACM Transactions on Multimedia Computing, Communications, and Applications
  • Dongfei Yu +3
  • Research Article
  • Citations16

VISCOUNTH: A Large-scale Multilingual Visual Question Answering Dataset for Cultural Heritage

  • Jul 12, 2023
  • ACM Transactions on Multimedia Computing, Communications, and Applications
  • Federico Becattini +6
  • Conference Article
  • Citations1

Selectively Answering Visual Questions

  • Jan 01, 2024
  • Julian Eisenschlos +3
  • Research Article
  • Citations10

Robust visual question answering via semantic cross modal augmentation

  • Oct 16, 2023
  • Computer Vision and Image Understanding
  • Akib Mashrur +3
  • Conference Article
  • Citations409

Improved Fusion of Visual and Language Representations by Dense Symmetric Co-attention for Visual Question Answering

  • Jun 01, 2018
  • Duy-Kien Nguyen +1
Cactus Communications logo

Copyright 2026 Cactus Communications. All rights reserved.