DualVD

DualVD encodes images into dual visual and semantic representations and adaptively selects question-relevant information to support multi-round Visual Dialogue.


Key Features:

  • Dual-View Image Representation: Represents images from a visual view that captures appearance-level information (objects and visual relationships) and a semantic view that captures high-level visual semantics across the entire image and local regions.
  • Adaptive Information Selection: Hierarchically and adaptively selects question-relevant information from the dual views to focus on pertinent aspects across dialogue rounds.
  • Integration with Frameworks: Integrated into models based on Late Fusion and Memory Network frameworks and reported state-of-the-art performance across three benchmark datasets.
  • Interpretability via Gate Visualization: Provides explicit visualization of gate values to determine the relative contributions of visual and semantic modalities for specific questions.
  • Multi-round Visual Dialogue Handling: Designed for multi-round interactions that explore objects, relationships, and high-level semantics, distinguishing it from single-question Visual Question Answering tasks.

Scientific Applications:

  • Visual Dialogue Research: Enables research on multi-round image understanding and context-dependent question answering in Visual Dialogue tasks.
  • Representation Learning: Supports development of semantic-rich image representations that combine appearance and high-level semantics.
  • Machine Learning for Visual Interaction: Improves machine learning models for complex visual interactions by providing modality-aware information selection mechanisms.
  • Human–Computer Interaction: Advances context-aware response generation in interactive AI systems by clarifying modality contributions through gate visualization.

Methodology:

Computational steps explicitly include dual visual and semantic image representation, hierarchical adaptive selection of question-relevant information, integration into Late Fusion and Memory Network frameworks, and explicit gate-value visualization.

Topics

Details

Tool Type:
command-line tool
Programming Languages:
Python
Added:
1/18/2021
Last Updated:
3/3/2021

Operations

Publications

Yu J, Jiang X, Qin Z, Zhang W, Hu Y, Wu Q. Learning Dual Encoding Model for Adaptive Visual Understanding in Visual Dialogue. IEEE Transactions on Image Processing. 2021;30:220-233. doi:10.1109/tip.2020.3034494. PMID:33141670.

PMID: 33141670
Funding: - National Natural Science Foundation of China: 62006222