two-glimpse BAN의 bilinear 어텐션 맵(논문 Figure 3). 각 그룹은 이미지와 log-scale 어텐션 맵을 함께 보여줍니다. 첫 번째 어텐션 맵에서 주목도가 높은 6개 박스를 양쪽 이미지에 표시해 비교하며, 모델의 답변은 brown입니다.
개요
Bilinear Attention Networks(BAN)는 멀티모달 어텐션의 핵심 제약을 해결한 연구입니다. 이미지 영역과 질문 단어는 직접 상호작용해야 하지만, 모든 쌍을 그대로 모델링하면 계산량이 지나치게 커집니다. BAN은 이 상호작용을 하나의 bilinear 어텐션 분포로 표현하고, low-rank bilinear pooling을 적용해 실제로 학습 가능한 구조로 만들었습니다.
이 연구는 NeurIPS 2018에 발표됐으며 Visual Question Answering과 visual grounding 과제에서 성능을 검증했습니다.
기여 내용
시각 및 언어 채널의 쌍에 bilinear 어텐션을 적용하는 연구의 공동 저자로 참여했습니다.
low-rank bilinear pooling과 여러 어텐션 glimpse의 residual learning을 결합한 아키텍처 개발에 참여했습니다.
VQA 2.0, Flickr30k Entities, VQA Challenge 2018을 통한 실험과 성능 검증에 기여했습니다.
기술적 접근
쌍 단위 멀티모달 어텐션 — 모달리티별로 어텐션을 분리하지 않고 이미지 영역과 질문 단어 사이의 상호작용을 직접 모델링합니다.
Low-rank bilinear pooling — 계산량이 큰 bilinear 상호작용을 학습 가능한 크기의 표현으로 압축합니다.
Residual multi-glimpse reasoning — 독립된 모듈을 단순히 쌓을 때 발생하는 파라미터 증가를 줄이면서 여러 어텐션 맵을 결합합니다.
성과
발표 당시 VQA 2.0과 Flickr30k Entities에서 최고 성능을 달성했습니다.
VQA Challenge 2018에서 단일 모델 부문 1위, 앙상블 부문 2위를 기록했습니다.
하나의 범용 아키텍처로 Visual Question Answering과 visual grounding 성능을 함께 개선했습니다.
의의
BAN은 시각과 언어 사이의 세밀한 상호작용을 대규모로 학습할 수 있게 만들었습니다. 모달리티를 독립적으로 처리하는 대신 두 모달리티의 관계를 명시적으로 모델링하는 방식이 멀티모달 추론에 더 강한 공동 표현을 제공할 수 있음을 보여줬습니다.