관리 메뉴

AI바라기의 인공지능

Bench : 빠른 논문 리뷰 : Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models 본문

논문리뷰

Bench : 빠른 논문 리뷰 : Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models

AI바라기 2026. 10. 6. 13:54

 


용어 설명

  • VidLM (Video-Language Model): 비디오 프레임 시퀀스와 텍스트를 동시에 입력받아 비디오에 대한 질의응답, 요약, 추론을 수행하는 멀티모달 대형 언어 모델입니다.
  • Grounding (시각적 접지): 모델이 생성하는 텍스트 응답이 실제 비디오의 시각적·시간적 증거에 직접적으로 기반하고 일치하도록 연결하는 능력입니다.
  • Prior Override: 비디오 인코더에서 시각적 신호가 정상적으로 인코딩되었음에도 불구하고, 이후 LLM 레이어나 디코딩 단계에서 언어적 사전 지식(language priors)이나 사용자 주장에 의해 시각 신호가 덮어씌워져 무시되는 현상입니다.
  • Encoding Failure: 비디오 인코더의 구조적 한계(패치 분할, 윈도우 어텐션 등)로 인해 시계열 정보나 전역적 모션 신호 자체가 초기 표현(representation) 단계에서 전혀 형성되지 못하는 실패입니다.
  • PoV (Persistence of Vision, 잔상 효과 기반 마스킹): 각 프레임마다 화면의 일부분(예: 19% 면적의 슬릿)만 부분 노출시키되 여러 프레임의 합집합을 통해서만 전체 장면을 복원할 수 있도록 설계한 spatiotemporal 마스킹 기법입니다.
  • TBSR (Temporal Binding Success Rate): 원본 비디오에서 맞힌 문제 중 시간적·공간적 마스킹(occlusion)이 가해진 후에도 여전히 정답을 유지하는 비율을 나타내는 지표입니다.
  • CLP (Cumulative Language Prior): 모델의 전체 오답 중 비디오 내용과 무관하게 상식적인 절차 순서(canonical procedural script)를 정답으로 선택한 비율을 측정하는 지표입니다.
  • Video Sycophancy (비디오 아첨 현상): 모델이 자신이 관찰한 시각적 증거보다 사용자가 입력 프롬프트에서 단정한 거짓 주장(expert-framed false claim)에 동조하여 거짓을 참이라고 답변하는 취약점입니다.
  • Linear Probing: 사전 훈련된 모델의 특정 레이어 hidden state를 동결(freeze)한 상태에서 단일 선형 분류기(linear classifier)를 학습시켜 해당 레이어에 특정 정보가 선형적으로 추출 가능한 형태로 존재하는지 검증하는 해석 기법입니다.
  • Linear CKA (Centered Kernel Alignment): 신경망의 서로 다른 레이어 또는 서로 다른 입력 그룹 간의 내부 표현(representation) 유사도를 측정하는 지표입니다.

Purpose of the Paper

  • 기존 벤치마크의 한계 극복: 기존 VidLM 벤치마크는 단일 총점(aggregate score) 위주로 평가되어 모델이 실제로 비디오를 보고 답하는지, 아니면 단일 프레임 힌트나 언어적 상식(language prior)에 의존하여 맞히는지 구별하지 못했습니다. 또한 기존 오류 분석은 모델의 블랙박스 출력만 관찰하는 행동적(behavioral) 평가에 머물러 실패 원인의 내부 메커니즘을 밝히지 못했습니다.
  • 실패 원인의 이원화(Two Pathways) 정립: 모델의 비디오 접지 실패를 Pathway A (인코딩 실패: 신호가 인코더에서 아예 생성되지 않음) 와 Pathway B (사전 지식에 의한 덮어쓰기: 신호는 인코딩되었으나 LLM 후반부에서 억제됨) 로 엄밀하게 분리하고 정의했습니다.
  • 원인 규명 중심의 진단형 스트레스 테스트 제안: 정답과 편향적 지름길(shortcut)이 정면으로 충돌하도록 설계된 스트레스 테스트 벤치마크 REVEAL을 구축하고, 모델 내부의 어느 단계(encoder, projector, early LLM, late LLM)에서 시각 신호가 소실되는지 기전론적(mechanistic)으로 추적하고자 했습니다.

Key Contributions & Novelty

  • 진단형 스트레스 테스트 벤치마크 REVEAL 제안:
    • 5개의 엄밀히 통제된 프로브로 구성:
      1. Camera-Motion Sensitivity (카메라 움직임 민감도 - Pathway A)
      2. Cross-Frame Integration (프레임 간 정보 통합 - Pathway A)
      3. Video Sycophancy (비디오 아첨도 - Pathway B)
      4. Language-Only Shortcuts (텍스트 지름길 의존도 - Pathway B)
      5. Temporal Expectation Bias (시간적 기대 편향 - Pathway B)
    • 모든 프로브는 visual truth와 shortcut answer가 서로 모순되도록 알고리즘 기반으로 자동 생성되어 대규모 확장이 가능합니다.
  • 두 가지 실패 메커니즘의 실증적 증명 (Two Pathways, Two Signatures):
    • Qwen2.5-VL-7B-Instruct의 내부 레이어별 Linear Probing을 통해 Pathway A(카메라 모션)는 인코더부터 최종 레이어까지 정확도가 바닥(32~39%)에 머무는 반면, Pathway B(시간 역행 판별)는 인코더(73.1%)와 초기 레이어(67.9%)에서 명확히 감지되다가 후반부 레이어(L18: 51.4%, L26: 53.0%)에서 언어 모델에 의해 무력화됨을 규명했습니다.
  • 비디오 인코더의 구조적 병목 규명:
    • Qwen2.5-VL의 비전 타워가 FlashAttention-2의 packed sequence 구조(cu_seqlens)로 인해 토큰들이 32개의 고립된 8x8 윈도우로 쪼개져 프레임 간 교차 어텐션(cross-frame attention)이 32개 모든 ViT 레이어에서 0.0% 로 동작함을 밝혔습니다.
    • Conv3D 패치 임베딩 역시 인접 프레임 간 필터 코사인 유사도가 0.996에 달해 시간적 차분(differentiation)이 아닌 단순 평균화(averaging)만 수행함을 발견했습니다.
  • Instruction Tuning의 부작용 규명:
    • 베이스(Base) 모델과 인스트럭션 튜닝(Instruct) 모델의 비교를 통해, Instruction Tuning이 사용자 프롬프트에 대한 순응도를 높이는 과정에서 후반부 레이어(L15~L27)의 비디오 어텐션을 3배 이상 급격히 붕괴시키고 시각적 접지력을 약화시킨다는 점을 입증했습니다.

Experimental Highlights

  • 평가 대상 및 프로브 세팅:
    • closed-source 모델(Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5-nano) 및 open-source 모델(Qwen3-VL-235B, Qwen2.5-VL 7B/32B/72B, Qwen2-VL Base/Instruct 쌍, LLaVA-NeXT-Video-7B) 등 총 12개 모델을 평가했습니다.
  • 주요 실험 수치 및 결과:
    • Video Sycophancy (찬반 이지선다, Chance Level 50%):
      • 인간은 권위적 거짓 유도에도 89.6%의 거부율을 보였으나, Gemini 2.5 Pro(78.9%)를 제외한 11개 모델 중 10개 모델이 25.5%~48.1%로 무작위 찍기(50%)보다 못한 성능을 기록했습니다. (Qwen2-VL-7B Base 37.8% vs Instruct 29.1%로 튜닝 후 아첨 경향 대폭 증가)
    • Camera Motion Sensitivity (6지선다, Chance Level 16.7%):
      • 인간은 98% 정확도를 보인 반면, 평가된 8개 모델 중 4개(GPT-5-nano 13.7%, Qwen2.5-VL-7B 15.3%, LLaVA-NeXT-Video-7B 14.3% 등)가 찍기 확률(16.7%) 이하로 떨어졌으며 최고 모델(Gemini 2.5 Pro)조차 24.3%에 불과했습니다.
    • Cross-Frame Integration (PoV 마스킹):
      • 인간은 프레임이 파편화되어도 9297%의 높은 TBSR을 유지했으나, Gemini 2.5 Pro는 원본 정확도 74%에서 마스킹 후 8%(TBSR 11%)로 붕괴했고 오픈소스 모델들은 012%대로 추락했습니다.
      • 동일한 정보를 4개 프레임에 순차 제공할 때와 단일 프레임 2x2 격자로 제공할 때를 비교한 Sequential Mosaic 실험에서, Gemini 2.5 Pro는 순차(Temporal) 40점에서 격자(Spatial) 76점으로, Qwen2.5-VL-7B는 4점에서 48점으로 급등하여 실패가 단순 OOD가 아닌 시간적 통합 실패임을 증명했습니다.
    • Causal Invariance (비디오 신호의 인과적 소멸):
      • 편향된 프롬프트가 주어지면 실제 비디오와 노이즈 정적 화면 간의 출력 확률 분포 차이를 나타내는 KL Divergence가 1.98(중립 프롬프트)에서 0.10으로 19배 이상 급감했습니다. 모델이 비디오를 보지 않고 프롬프트만으로 답변을 생성함을 확인했습니다.
    • Temporal Expectation Bias:
      • 공간적 이상치 감지는 모델 규모 증가에 따라 대폭 향상되었으나(Qwen2.5-VL 7B 19.3% -> 72B 56.2%), 시간적 위반(역재생, 프레임 셔플 등) 감지는 2.9%에서 2.8%로 전혀 개선되지 않았습니다.

Limitations and Future Work

  • Mechanistic Analysis의 아키텍처 범위 한계:
    • 심층 내부 프로빙이 Qwen2/2.5-VL 계열에 집중되어 있습니다. 독점 API 모델(Gemini, GPT-5-nano)은 내부 상태를 추출할 수 없어 동일한 행동 붕괴의 메커니즘적 일치 여부를 직접 검증하지 못했습니다. 향후 LLaVA-NeXT-Video 등 이종 아키텍처에 대한 추가 프로빙 확장이 필요합니다.
  • 인과적 개입(Causal Intervention)의 부재:
    • 어텐션 분포 및 hidden state 분산 분석은 상관관계(correlational) 기반 관찰입니다. 후반부 레이어의 시각 신호 억제가 실제 오답을 유발하는 직접적 원인임을 증명하기 위해 activation patching이나 late-layer attention knockout 같은 인과적 개입 연구가 요구됩니다.
  • 대조군 결여:
    • 5개 프로브 중 4개에서 시각 정보를 아예 배제한 순수 텍스트 전용(blind text-only) 베이스라인이 누락되었으며, Sycophancy 평가 시 사실에 부합하는 참(TRUE) 진술에 대한 통제군이 없어 단순 긍정 편향(acquiescence bias)과 사용자 권위 복종 간의 엄밀한 분리가 과제로 남아있습니다.
  • 도메인 및 모달리티 범위:
    • 데이터셋이 주로 Ego4D, YouCook2, Charades 등 일상·조리 비디오에 한정되어 의료, 스포츠, 로보틱스 등의 도메인 일반화가 입증되지 않았으며, 오디오-비주얼 동기화 실패는 다루지 않았습니다.

Overall Summary

본 논문은 기존 비디오-언어 모델(VidLM)이 벤치마크에서 달성한 고득점이 실제 시각적 접지(visual grounding)가 아닌 언어적 사전 지식과 단일 프레임 지름길에 의존한 착시일 수 있음을 고발합니다. 저자들은 시각 증거와 사전 지식이 정면 충돌하도록 설계된 스트레스 테스트 벤치마크 REVEAL과 내부 레이어 프로빙 기법을 통해, VidLM의 실패가 '인코더 레벨의 시각·시간 정보 형성 실패(Pathway A)'와 '언어 모델 후반부에서의 시각 신호 억제(Pathway B)'라는 상이한 두 경로로 발생함을 입증했습니다. 이 연구는 단순히 파라미터 스케일을 키우는 것만으로는 시간적 접지 문제를 해결할 수 없음을 밝히고, 인코더의 크로스 프레임 어텐션 구조 개선 및 디코딩 단계의 어텐션 재조정이라는 구체적이고 차별화된 해결 방향을 제시했다는 점에서 멀티모달 신뢰성 연구에 매우 중요한 이정표를 제공합니다.


쉬운 설명

이 논문의 핵심 아이디어는 "학생이 시험 문제를 풀 때 진짜 지문을 읽고 푸는 것인지, 아니면 시험 요령과 상식만으로 찍어서 맞히는 것인지를 가려내는 암행어사 시험" 에 비유할 수 있습니다.

요즘 비디오 AI 모델들은 시험(벤치마크) 점수가 매우 높지만, 연구진이 촛불이 거꾸로 타오르며 재생되는 비디오를 보여주거나 화면 일부를 가려놓고 문제를 내자 완전히 낙제했습니다. 원인을 뜯어보니 두 가지였습니다. 첫째는 "애초에 눈(비전 인코더)이 프레임 간의 움직임을 전혀 감지하지 못하는 근시 상태" 였고(Pathway A), 둘째는 "눈으로는 분명 거꾸로 재생되는 것을 보았음에도, 뇌(LLM) 속의 고정관념('촛불은 원래 녹아내리는 법이지')이나 질문자의 유도신문에 휘둘려 눈으로 본 사실을 묵살해버리는 현상" (Pathway B)이었습니다. 즉, 모델을 고치려면 맹목적으로 책만 더 읽힐(스케일업) 것이 아니라, 눈의 해상도를 틔워주거나(인코더 개선) 눈으로 본 증거를 무시하지 않도록 생각하는 습관(디코딩 튜닝)을 고쳐야 한다는 것을 명확히 밝혀낸 것입니다.

 

 

 

 

 

 

 

 

 

더보기

VidLM (Video-Language Model)
비디오와 언어를 함께 이해하는 멀티모달 모델

Grounding (시각적 접지
모델의 판단/답변이 실제 video의 visual evidence에 제대로 근거하고 있는가

Prior Override
영상에서 필요한 visual signal은 이미 제대로 들어왔는데, 이후 단계에서 모델의 기존 prior가 그 신호보다 더 강하게 작용해 답을 덮어버리는 현상


Encoding Failure
필요한 영상 정보가 video representation 단계에서부터 제대로 constructed / encoded되지 않은 경우



PoV (Persistence of Vision)
한 프레임의 전체 정보를 한 번에 보여주지 않고, 여러 순간에 나눠 보여줘도 사람이 그 조각들을 시간적으로 합쳐서 하나의 장면처럼 인식하는 능력


세로로 졸라 자름. 일부 검은색으로 마스킹

검은 부분에는 원래 영상 정보가 전혀 없고, 밝게 남겨진 세로 띠에서만 원본 frame이 보임.

그래서 한 순간만 보면 화면 대부분이 검은색이라 뭔지 모르지만, 여러 순간을 연속으로 기억해서 합치면:  뭐 알 아볼 수 있는 그런 느낌

모델은 마니 떨어진다고 함


Vision encoder에서는 temporal group 사이 직접 interaction이 없지만, LLM은 양쪽 token을 모두 볼 수 있다. 그런데도 실험상 LLM이 그 조각들을 제대로 relational binding하지 못했다.



TBSR (Temporal Binding Success Rate):
기본적인 문제풀이 능력 자체가 아니라, visual evidence를 시간에 걸쳐 분산시켰을 때 기존에 갖고 있던 정답 능력을 얼마나 유지하는가


CLP (Cumulative Language Prior)
모델이 틀렸을 때, 그 오답이 “영상이 아니라 언어적으로 가장 그럴듯한 정답”을 고른 경우가 얼마나 되는지 보는 비율


Video Sycophancy (비디오 아첨 현상)
영상에 보이는 사실보다 사용자가 강하게 주장한 내용을 따라가는 현상



논문 흐름 정리

그런데 모델이 정답을 맞혔다고 해서 진짜 영상을 이해했다고 볼 수는 없습니다. 예를 들어 영상을 제대로 안 보고도:
- language prior
- 흔한 event 순서
- single-frame cue

찍을 수  있음.



4. Behavioral Result — 실제로 얼마나 깨지는가
① Camera Motion: 거의 못함
카메라가
pan left/right, tilt up/down, zoom in/out

중 무엇을 하는지 맞히게 합니다.


사람은 **98%**인데 모델들은 6-way classification에서 13.7~24.3% 정도입니다.
Chance가 16.7%니까 일부 모델은 사실상 random 이하입니다.
Lane-change도 사람은 100%인데 모델 F1은 14~31% 정도입니다.     2602.11244v2
→ camera motion 자체를 잘 못 잡는다.




② Cross-Frame Integration: 심하게 무너짐
원본 영상에서는 잘 맞히던 모델도 PoV masking을 하면 크게 떨어집니다.
예:
- Gemini 2.5 Pro: 74% → 8%
- GPT-5-nano: 57% → 19%
- open-weight 모델: masked accuracy 대부분 한 자릿수


③ Video Sycophancy: 사용자 말에 잘 넘어감
False user claim을 제대로 거부하는 비율:
- Human: 89.6%
- Gemini 2.5 Pro: 78.9%
- 나머지는 대부분 50% chance 이하


④ Language-Only Shortcut: 영상 없어도 답을 만들어냄
Blank video를 줬으면 정상적으로는
“영상에서 판단할 수 없음”

을 골라야 합니다.




⑤ Temporal Expectation Bias: 공간 이상은 보는데 시간 이상은 거의 못 봄
여기가 결과가 꽤 극단적입니다.
Gemini 2.5 Pro:
- Spatial anomaly: 91.3%
- Temporal anomaly: 30.6%
Qwen2.5-VL은 7B→72B로 키우면 spatial은 크게 좋아지는데 temporal은 2.9% → 2.8%, 사실상 변화가 없습니다.




그래서 다음 네 가지 정도를 이용해서 visual signal이 어느 단계에서 존재하고 어디서 사라지는지 분석합니다.
- linear probing
- layer-wise attention
- output distribution / KL shift
- vision encoder 내부 구조 분석



Vision encoder에서 cross-frame relational representation이 충분히 만들어지지 않고, LLM이 나중에 양쪽 token을 볼 수 있어도 그 관계를 잘 복구하지 못한다.


7. Pathway B 분석 — 정보는 있었는데 뒤에서 사라지는 경우
Temporal direction
Forward vs reverse를 representation에서 linear probe합니다.
- Vision encoder: 73.1%
- Projector: 71.3%
- LLM L3: 66.2%
- L9: 67.9%
- L18: 51.4%
- L26: 53.0%
즉 vision 단계에서는 reverse인지 forward인지 어느 정도 알고 있습니다.
그런데 LLM 후반부로 갈수록 chance 근처까지 내려갑니다.



8. 그래서 논문의 최종 그림
결국 두 패턴이 나옵니다.
Encoding Failure
Video
 ↓
Vision Encoder ← 여기부터 signal 약함/없음
 ↓
LLM
 ↓
오답

대표:
Camera Motion / Cross-Frame Integration

Prior Override
Video
 ↓
Vision Encoder ← signal 있음
 ↓
LLM 초반 ← 아직 있음
 ↓
LLM 후반 ← prior가 이기면서 signal 약화
 ↓
오답

대표:
Temporal Expectation / Sycophancy / Language Shortcut

저자는 이 두 failure가 해결법 자체가 다르다고 주장합니다.




Stress test가 너무 synthetic / adversarial함

  • PoV masking, blank video, random noise, frame shuffle처럼 실제 사용 환경에서는 거의 나오지 않는 입력이 많음.

 

Cross-Frame Integration의 원인 해석이 다소 강함

  • Qwen2.5-VL의 ViT에서는 temporal group 간 attention이 없지만, LLM decoder에서는 양쪽 temporal group을 모두 볼 수 있음.

 

CLP가 실제 language prior를 직접 측정하는 지표는 아님

  • \(y^{LP}\)를 별도의 text-only model probability나 likelihood로 측정한 것이 아니라 원본 video의 canonical action order로 정의.

 

Video Sycophancy도 prompt 설정의 영향이 큼

  • “I’m a video expert...” 같은 강한 false assertion을 일부러 넣는 방식이라 일반적인 QA 상황보다 상당히 공격적인 조건.

 

Temporal Expectation Bias가 temporal reasoning과 OOD robustness를 완전히 분리하지 못함

  • reverse, shuffle, temporal cut 등은 모델의 학습 distribution에서 드문 입력일 가능성이 높음.




  • 여러 stress test가 synthetic / adversarial setting이라 실제 video understanding failure로 일반화하기엔 다소 과함.
  • CLP는 실제 language prior probability가 아니라 canonical procedural answer로 정의해서 지표 해석이 제한적임.
  • Cross-frame failure도 Qwen2.5-VL의 ViT 구조와 연결했지만, LLM은 전체 visual token을 볼 수 있어 원인을 완전히 확정하긴 어려움.
  • Mechanistic analysis가 주로 Qwen2/2.5-VL 계열에 한정되어 전체 VidLM의 공통 mechanism으로 보기엔 부족함.
더보기

 3점 / 5점

 

PoV/잔상은 참신함. 나머진 구멍이 많음