관리 메뉴

AI바라기의 인공지능

VLM : 논문 리뷰 : Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion 본문

논문리뷰

VLM : 논문 리뷰 : Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion

AI바라기 2026. 9. 25. 19:27


용어 설명

  • Modality Coupling (양태 결합도): 서로 다른 modality(비디오와 텍스트) 간 또는 단일 modality 내부 토큰 간의 상호의존성 및 상호작용 강도를 의미합니다.
  • QUAG (QUadrant AveraGe): Transformer fusion layer의 self-attention 행렬을 4개 사분면(VV, VT, TV, TT)으로 분할한 뒤, 특정 사분면을 row-wise 평균값으로 대체(short-circuiting)하여 특정 modality 간 상호작용을 비활성화하는 lightweight non-parametric probe 기법입니다.
  • Short-circuiting (단락/우회 연산): Attention weight를 특정 사분면 단위로 균일한 평균값으로 치환하여 token-mixing을 무력화하고, 모델이 해당 상호작용 경로 없이도 정답을 맞힐 수 있는지(즉, shortcut을 쓰는지) 진단하는 연산입니다.
    • Unimodal Short-circuiting ([VV, TT]): 비디오-비디오, 텍스트-텍스트 내의 단일 modality token-mixing을 단순 평균 스케일링으로 축퇴시킵니다.
    • Crossmodal Short-circuiting ([VT, TV]): 비디오-텍스트 간 교차 modality 어텐션을 균일화하여 다중 모달 정보 융합을 차단합니다.
    • Video / Text Short-circuiting: 특정 modality의 key 어텐션을 무력화하여 어텐션 행렬의 rank 상한(rank bound)을 수학적으로 제한합니다.
  • QUAG-attention: 별도의 fine-tuning 없이 self-attention의 key 및 value 토큰을 사전에 평균화하여 시퀀스 길이를 대폭 축소하는 연산 효율화 메커니즘입니다.
  • CLAVI (Complements in LAnguage and VIdeo): Charades-STA 기반 비디오의 액션 구간 순서를 물리적으로 맞바꾼 비디오 보완쌍(video complement)과 템플릿 질문의 시간 표현(before/after, beginning/end)을 맞바꾼 텍스트 보완쌍(question complement)으로 구성된 고결합도(high modality coupling) stress-test benchmark입니다.
  • Consistent Accuracy (CAcc): 원본 인스턴스와 해당 complement(보완쌍) 인스턴스를 둘 다 맞혀야만 정답으로 인정하는 엄격한 평가 metric입니다 (비디오 기준 CAcc_V, 텍스트 기준 CAcc_T).

Purpose of the Paper

  • 기존 연구의 한계 극복:
    • 기존 VideoQA Transformer 모델들이 벤치마크에서 높은 정확도를 기록하고 있으나, 이것이 비디오와 텍스트의 시공간적 역학을 실제로 joint하게 이해한 결과인지, 아니면 데이터셋의 unimodal 편향이나 shortcut을 악용한 것인지 불분명했습니다.
    • 기존의 편향 분석 연구들은 데이터셋 혹은 모델 중 하나만을 분리하여 분석(isolated analysis)하는 한계가 있었습니다.
  • 새로운 문제 정의 및 접근 방식:
    • 모델과 데이터셋을 결합하여 분석(combined dataset-model analysis)하기 위해, 추가 학습 없이 inference time에 modality fusion을 단계별로 손상(impair)시키는 진단 probe인 QUAG를 제안했습니다.
    • 기존 벤치마크의 낮은 결합도 문제를 입증하고, 모델이 진정한 multimodal representation을 학습하도록 강제하는 고결합도 stress-test 데이터셋인 CLAVI를 새롭게 설계했습니다.

Key Contributions & Novelty

  • QUAG (QUadrant AveraGe) Probe 제안:
    • 방법론: Multimodal Transformer fusion block의 self-attention 행렬을 4개 quadrant(VV, VT, TV, TT)로 나누고, row-wise average-and-replace 연산자 R을 적용하여 특정 상호작용을 제어합니다.
    • Novelty: 파라미터가 전혀 필요 없고(non-parametric), fine-tuning 없이 frozen model의 inference 단계에서 어텐션 맵을 조작하여 unimodal 및 crossmodal representation 의존도를 정확하게 측정합니다. 수학적으로 어텐션 행렬의 rank 축소 상한(Lemma 2.2: rho <= l_T + 2) 및 unimodal average conformability(Theorem 2.1)를 증명했습니다.
  • 연산 효율적인 QUAG-attention 메커니즘 개발:
    • 방법론: Post-attention block-averaging 방식인 QUAG의 원리를 attention 계산 전 단계로 확장하여, key와 value 토큰을 사전에 modality별로 압축(token-average)한 후 어텐션을 수행합니다.
    • Novelty: 추가 training 없이 기존 self-attention을 대체하여, 모델의 성능 손실(< 1%) 없이 attention 연산량(multiplication operations)을 대폭 절감했습니다.
  • 고결합도 Stress-test 데이터셋 CLAVI 구축:
    • 방법론: Charades-STA 비디오 내 비중첩 액션 구간의 순서를 직접 swap한 비디오 보완쌍과 시간 지시어를 swap한 텍스트 보완쌍을 114K개 규모로 생성했습니다.
    • Novelty: 단순한 비디오 역재생(video reversal)과 달리 중간 구간을 보존하며 액션의 발생 순서만 교환하여 인위적 아티팩트를 줄였고, 원본과 보완쌍을 동시에 맞혀야 정답으로 처리하는 CAcc metric을 통해 shortcut 학습을 원천 차단했습니다.

Experimental Highlights

  • Simulation Study를 통한 QUAG 검증:
    • 제어된 교차 모달 결합 계수 alpha(0.0 ~ 0.5)를 가진 합성 데이터를 학습시킨 결과, alpha가 커질수록(결합도가 높을수록) crossmodal short-circuiting 적용 시 test MSE loss의 증가율이 지수적으로 급증(alpha=0.45 부근에서 3,000% 이상 폭증)하여 probe의 유효성을 검증했습니다.
  • 기존 벤치마크(ActivityNet-QA, MSRVTT-QA, NeXT-QA, ATP-Hard) 분석 결과:
    • JustAsk의 심각한 모달리티 융합 부재: Unimodal, crossmodal, video, text 등 어떤 short-circuiting 연산을 적용해도 전 데이터셋에서 baseline 대비 성능 하락이 1% 미만이었습니다. 이는 JustAsk가 벤치마크를 풀 때 modality fusion을 거의 활용하지 않음을 입증합니다.
    • FrozenBiLM의 불균형한 편향 의존: ActivityNet-QA와 MSRVTT-QA에서는 crossmodal 차단 시 10% 이상, unimodal/text 차단 시 40% 이상 성능이 폭락했으나, 시간 추론 벤치마크인 NeXT-QA와 ATP-Hard에서는 video short-circuiting 시 성능 하락이 전혀 없었고, text/unimodal 차단 시에만 chance level(20%)로 떨어져 순수 text shortcut에 의존하고 있음이 드러났습니다.
    • QUAG-attention의 극단적 연산 감소: 성능 하락 1% 미만 조건에서 JustAsk는 곱셈 연산량을 68.0%, FrozenBiLM은 13.6% 감소시켰습니다.
  • CLAVI 벤치마크 상의 모델 성능 붕괴:
    • 4개 대표 모델(JustAsk, FrozenBiLM, Singularity-Temporal, All-In-One+)은 단순 Balanced Accuracy 기준으로는 모두 70% 이상의 겉보기 성능을 기록했습니다.
    • 그러나 시간적 추론이 필요 없는 Control subset(E, E-NC, BA-NC)에서는 90% 이상의 높은 CAcc를 보인 반면, 고결합도 Complement subset(BE, BA)에서는 JustAsk(CAcc_T: 2.4%), Singularity-T(0.5%), All-In-One+(0.8%) 로 처참하게 붕괴(near-trivial)했습니다.
    • 오직 FrozenBiLM만 Complement subset에서 CAcc_V 54.1%, CAcc_T 57.2%를 유지했으나, video-average QUAG-attention으로 modality fusion을 제한하자 CAcc_V가 3.6%, CAcc_T가 23% 로 급락하여 실제 multimodal temporal representation에 의존하고 있음이 교차 검증되었습니다.

Limitations and Future Work

  • 한계점 (Limitations):
    • 단순화된 시간 관계 설계: CLAVI는 시간적 순서 추론에 집중하기 위해 완전히 겹치지 않는(non-overlapping) 액션 쌍의 선후 관계(before/after) 및 절대 위치(beginning/end)만을 다룹니다.
    • 복합적 관계 배제: 액션의 포함 관계(containment), 부분 중첩(partial overlap)과 같이 'during', 'while' 등의 전치사가 요구되는 복잡한 시공간적 참조(spatio-temporal referential reasoning) 능력 평가는 제한됩니다.
  • 향후 연구 방향 (Future Work):
    • 'during', 'while' 등의 조건이 포함된 비디오 이벤트 간의 복합적 시간 구조 및 부분 중첩 관계를 모델링하는 확장 데이터셋 구축이 필요합니다.
    • 정형화된 템플릿 질문을 넘어 자연어 형태의 복합 시간 참조 표현(temporal referring expressions)을 포함하고, 이중 부정(doubly-negative) 전략을 적용한 고도화된 VideoQA 벤치마크로의 확장이 요구됩니다.

Overall Summary

이 논문은 기존 VideoQA Transformer 모델들이 벤치마크에서 기록한 고성능이 실제 비디오-텍스트 간 융합 추론이 아닌 unimodal 편향과 shortcut에 기인한다는 점을 밝혀냈습니다. 저자들은 파라미터가 필요 없는 어텐션 사분면 평균화 기법인 QUAG와 이를 활용한 경량화 모듈 QUAG-attention을 통해 기존 모델들의 modality fusion 결핍을 규명하고, 연산량을 최대 68%까지 줄이면서도 동등한 성능이 유지됨을 보였습니다. 나아가 비디오와 텍스트의 시간적 보완쌍을 조합한 고결합도 스트레스 테스트셋 CLAVI를 구축하여, 기존 SOTA 모델들이 시간 순서가 얽힌 환경에서는 성능이 무작위 추측 수준으로 붕괴함을 실증함으로써 향후 진정한 다중 모달 융합 모델 평가를 위한 새로운 패러다임을 확립했습니다.


쉬운 설명

이 연구는 학생들이 치르는 시험에 비유할 수 있습니다.

어떤 학생이 국어 지문과 도표를 함께 보고 푸는 복합 시험(VideoQA)에서 90점을 받았습니다. 그런데 연구진이 시험지에서 도표를 가리거나(Video 차단), 도표와 글을 대조하지 못하게 시선 이동을 막아버렸는데도(Crossmodal 차단), 학생의 점수가 여전히 90점이 나오는 기이한 현상(JustAsk 모델)을 발견했습니다. 즉, 학생은 도표를 보고 이해한 게 아니라 국어 지문의 말장난이나 보기의 패턴(Shortcut)만 보고 정답을 찍어 맞추고 있었던 것입니다.

그래서 연구진은 도표의 순서를 뒤바꾼 쌍둥이 문제와 질문의 앞뒤 순서를 뒤바꾼 쌍둥이 문제를 세트로 출제하여, 두 문제를 모두 논리적으로 완벽히 풀어야만 정답으로 인정하는 진짜 실력 검증 시험(CLAVI 데이터셋과 Consistent Accuracy)을 만들었습니다. 그 결과, 겉보기에 우등생이었던 대부분의 AI 모델들이 이 시험에서는 1~3점 수준으로 점수가 폭락하며 밑천을 드러냈습니다.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

더보기

QUAG 만들어서 제대로 푸는지 확인
특별한게 아니라 그냥 어텐션 가중치를 평균 값으로 해서 특정한 위치 집중하지 못하게

modality coupling이 강한 데이터일수록 crossmodal short-circuiting 했을 때 성능이 더 떨어진다는걸 보여줌.
그래서 QUAG를 실제 VideoQA 모델에 적용해도 되겠다고 봄


ActivityNet-QA, MSRVTT-QA, NeXT-QA, ATP-Hard

여기에 

unimodal short-circuiting
crossmodal short-circuiting
video short-circuiting
text short-circuiting

어텐션을 망가뜨려봄
JustAsk FrozenBiLM 두개 모델 사용

VideoQA benchmark 점수가 높다고 해서 반드시 multimodal interaction을 제대로 쓰는 건 아니다. 어떤 모델은 거의 안 쓰고도 점수를 낸다.


Key/Value token을 평균내서 크게 줄인 attention.....

복잡한 multimodal attention을 훨씬 단순하게 만들어도 성능이 거의 그대로다.



액션의 순서를 뒤집은 modality coupling이 강한 VideoQA 데이터셋을 직접 만든 게 CLAVI
를 만들어서 둘다 맞춰야 맞은걸로 해서 테스트


원본과 바꾼 데이터를 둘 다 학습시켰는데, 테스트에서는 “순서 관계를 제대로 따라가야 하는 문제”를 원본/변형 둘 다 맞히는 걸 대부분 실패했다.



--------------------------------------------

제일 큰 문제: “왜 못 배웠는지”를 분해하지 않았음
걍 학습 실패일 수도 있음.



크게 재밌는건 없는듯 마지막 아이디어는 좋지만 파인튜닝 해놓고 바꿧더니 점수 떨어진다는 좀 짜침

2.5 점 / 5점