관리 메뉴

AI바라기의 인공지능

VLM : 빠른 논문 리뷰 : MAP THE FLOW: REVEALING HIDDEN PATHWAYS OF INFORMATION IN VIDEOLLMS 본문

논문리뷰

VLM : 빠른 논문 리뷰 : MAP THE FLOW: REVEALING HIDDEN PATHWAYS OF INFORMATION IN VIDEOLLMS

AI바라기 2026. 9. 26. 13:48

 

용어 설명 (Terminology)

  • Mechanistic Interpretability: 신경망의 내부 가중치, activation, attention 등을 세부적으로 분석하여 모델이 특정 작업을 수행할 때 내부에서 작동하는 알고리즘적 계산 메커니즘을 역공학(reverse-engineering)하는 기법.
  • Attention Knockout: inference 도중 특정 source token과 target token 사이의 causal attention mask 값을 마이너스 무한대(-inf)로 강제 설정하여 해당 attention edge를 차단한 뒤, 예측 확률 변화를 측정해 인과적 기여도를 평가하는 분석 방법.
  • Logit Lens: Transformer의 중간 layer hidden states를 언어 모델의 final projection head(LM head)에 직접 투영하여, 각 layer 단계에서 어떤 semantic concept(vocabulary logit)이 형성되고 있는지 추적하는 기법.
  • Temporal Checkpoints: video의 시공간 정보가 text 전반으로 무작위 전파되는 것이 아니라, 특정 temporal keywords(예: question 내의 시간 부사, action verb, true option 토큰)로 집중 수렴된 후 다음 단계로 전파되는 핵심 중간 거점 토큰.
  • Effective Information Flow Pathways: temporal reasoning을 수행하기 위해 필수적인 attention 연결(초중반 layer의 cross-frame 상호작용, 중반 layer의 video-to-question 전파, 중후반 layer의 question-to-last 전파)만을 유지한 sparse한 정보 흐름 경로.

Purpose of the Paper

  • 기존 연구의 한계 극복: 기존 VideoLLM 연구는 주로 instruction tuning dataset 확장, key frame 선택, video token 압축 등 외부적인 architecture 설계에 집중되어 있었으며, 1차원 token sequence로 평탄화(flattened)된 비디오에서 모델 내부가 시공간 정보를 '어디서', '어떻게' 추출하고 text로 전파하는지에 대한 mechanistic understanding이 전무했음.
  • 새로운 문제 정의: ImageLLM 기반 연구에서 규명된 단일 스트림 정보 흐름이 시간 축을 포함하는 VideoLLM에서도 동일하게 작동하는지, video instruction tuning을 통해 새롭게 획득되는 고유한 내부 computational circuit이 무엇인지 규명하고자 함.
  • 차별화된 접근 방식: Attention Knockout과 Logit Lens를 체계적으로 결합하여 temporal interaction, video-language integration, answer generation으로 이어지는 layer별 정보 흐름의 인과적 blueprint를 도출함.

Key Contributions & Novelty

  • 비디오 시공간 정보 처리의 3단계 내부 메커니즘 규명 (Novelty: VideoLLM 고유의 단계별 회로 최초 분석)
    • Phase 1 (Early-to-middle layers): video token 간의 활발한 cross-frame attention을 통해 spatiotemporal representation을 선행 구축함.
    • Phase 2 (Middle layers): 비디오 표현이 question 내의 temporal reasoning keywords(시간 단어, 동사, 정답 보기 등)와 선택적으로 결합하는 video-language integration이 발생함.
    • Phase 3 (Middle-to-late layers): 통합된 시공간 단서가 sequence의 last token으로 집중 수렴되며, 약 20번째 layer 이후부터 정답 예측 확률이 급상승하며 최종 answer generation이 완료됨.
  • Spatial vs. Temporal Concept의 계층적 형성 순서 발견 (Novelty: 개념 출현의 시간차 및 토큰 할당 메커니즘 규명)
    • Logit Lens 분석을 통해 spatial concepts(객체, 배경 등)는 극초반 layer에서 먼저 foreground token에 안정화되는 반면, temporal concepts(동작, 상태 변화 등)는 중반 layer 이후 잔여 video token 위치에서 발현됨을 밝혀냄.
  • Temporal Keywords의 Checkpoint 역할 규명 (Novelty: 프롬프트 구조에 따른 동적 라우팅 경로 증명)
    • 비디오 정보는 last token으로 직접 가지 않고 temporal keywords(특히 Multiple-choice QA의 True Option)를 거점으로 경유함. 작업 유형(Action 인식 vs. Object 속성/카운팅)에 따라 direct route(video -> true option)와 indirect route(video -> non-option question -> true option)가 동적으로 전환됨을 causal tracing으로 규명함.
  • Effective Information Flow 경로의 기능적 충분성 검증 (Novelty: 50% 이상의 Attention Edge Pruning 검증)
    • 규명된 핵심 경로만 남기고 나머지 attention edge(video -> last 직접 연결, late layer의 video/question 대상 edge 등)를 제거해도 성능이 거의 유지됨을 실증하여, 식별된 circuit이 실제 reasoning에 지배적임을 증명함.

Experimental Highlights

  • 실험 설정:
    • Models: LLaVA-NeXT-7B-Video-FT (기본 분석), LLaVA-NeXT-13B-Video-FT, Mini-InternVL-4B-Video-FT, VideoLLaMA3-7B
    • Datasets: TVBench (Action Antonym, Action Sequence, Scene Transition, Moving Direction, Object Count), TOMATO, VCGBench (Open-ended QA), LongVideoBench, Video-MME
    • Knockout Window: k = 9 layer window 적용
  • Cross-frame Attention 차단의 치명성:
    • 초반 1-16 layer의 cross-frame attention을 차단했을 때 정답 샘플의 accuracy가 최소 18.0%에서 최대 60.8%(Object Count: -60.8%, Moving Direction: -44.8%) 급락함. ImageLLM baseline은 동일 개입에 둔감하여, 이 메커니즘이 video fine-tuning으로 유도된 고유 특성임을 입증함.
  • Attention Edge 대규모 Pruning 및 성능 보존 (TVBench / TOMATO):
    • LLaVA-NeXT-7B-Video-FT: 전체 attention edge를 42%(10.8M)만 유지(58% 제거)하고도 TVBench 51.2(Full 51.5 대비 -0.3), TOMATO 29.2(Full 30.2 대비 -1.0)를 유지함. 반면 동일 비율 random blocking 시 TVBench 40.1, TOMATO 23.1로 대폭 하락함.
    • VideoLLaMA3-7B: 58%(11.4M) edge만 유지했을 때 TVBench 57.2(Full 55.2 대비 오히려 향상), TOMATO 28.7(Full 28.0 대비 향상)을 기록함. Random blocking 시 22.2 / 13.9로 붕괴함.
    • Long-form Video 확장 (LongVideoBench): LLaVA-NeXT-7B-Video-FT에서 edge의 42%만 유지해도 전체 평균 accuracy 45.5를 기록하며 full attention(46.1) 대비 단 0.6%p 하락에 그침.
  • Failure Case 분석 결과:
    • 오답이 발생하는 주요 원인은 중후반 layer의 cross-modal routing 붕괴가 아니라, 초반 layer에서 잘못된 cross-frame attention이 맺어지거나 static bias에 의존하여 spatiotemporal representation 구축 자체가 왜곡되었기 때문임을 확인.

Limitations and Future Work

  • 경로 집중으로 인한 표현력 낭비 및 취약성:
    • VideoLLM이 극소수의 dominant information pathway에 과도하게 의존함. 이 경로가 조금만 오염되어도 전체 추론이 왜곡되므로, training 과정에서 attention dropout 계열의 pathway regularization을 적용해 다양한 대체 경로를 학습시킬 필요가 있음.
  • 초기 Layer의 Static-scene Bias 의존성:
    • 초기 layer에서 spatial concept이 과도하게 선점되면 이후 temporal reasoning이 방해받거나 정적 단서로 타협하는 failure mode가 발생함. 시공간 개념이 더 이른 layer부터 균형 있게 형성되도록 유도하는 auxiliary loss나 architecture 제약 설계가 요구됨.
  • 효율적 추론 기법으로의 구체적 구현 미흡:
    • 분석을 통해 effective layer range(예: 중후반부에서 video token으로 향하는 attention 불필요)를 규명했으나, 이를 dynamic token pruning이나 early-exit decoding framework로 완전히 구현하여 실제 inference latency 단축까지 이어지는 end-to-end 최적화는 향후 과제로 남겨둠.

Overall Summary

이 논문은 mechanistic interpretability 기법(Attention Knockout, Logit Lens)을 활용하여 VideoLLM이 다중 프레임 비디오로부터 시간적 추론을 수행하는 내부 메커니즘을 최초로 체계적 규명한 연구입니다. 모델은 "초중반 layer의 cross-frame 상호작용 -> 중반 layer의 temporal keyword 기반 video-language 결합 -> 중후반 layer의 last token 집중 및 answer generation"이라는 3단계 희소 경로를 통해 작동함을 보였습니다. 특히 전체 attention edge의 50% 이상을 억제하고 이 핵심 경로만 유지해도 성능 손실이 거의 없음을 입증함으로써, 향후 VideoLLM의 interpretability 개선은 물론 효율적인 inference 가속화(early-exit, attention pruning)를 위한 중요한 이론적 토대를 제공합니다.


쉬운 설명

이 연구는 VideoLLM이 동영상을 보고 질문에 답할 때 머릿속에서 일어나는 생각의 흐름을 **"릴레이 경주"**로 풀어낸 것과 같습니다.

  1. 1번 주자 (초반 레이어): 모델은 먼저 비디오 프레임들끼리 시선을 주고받으며(cross-frame interaction) 무슨 일이 일어났는지 시간 순서대로 상황을 파악합니다. (단, 정적 배경이나 사물을 먼저 파악한 뒤, 남는 여력으로 움직임을 파악합니다.)
  2. 2번 주자 (중간 레이어): 비디오에서 파악한 시간 흐름을 질문 전체에 두서없이 뿌리는 대신, 질문이나 보기 속의 '시작', '끝', '일어서다' 같은 **핵심 시간 단어(체크포인트)**에 정확하게 배달합니다.
  3. 마지막 주자 (후반 레이어): 핵심 단어에 모인 비디오 정보를 마지막 토큰으로 한 번에 넘겨받아 20번째 레이어 부근부터 최종 정답을 확신하고 출력합니다.

기존에는 모델의 모든 레이어와 토큰이 서로 복잡하게 신호를 주고받아야만 비디오를 이해할 수 있다고 생각했지만, 실제로는 이 세 가지 핵심 릴레이 고속도로만 열어두고 나머지 불필요한 연결을 60% 가까이 끊어버려도 모델이 똑같이 정답을 맞힌다는 사실을 밝혀낸 것입니다.

 

 

 

더보기

Cross-frame: 뒤/현재 frame의 video token들이 이전 frame의 video token들을 못 보게 막음
Video → Question: question token들이 video token들을 못 보게 막음
Question → Last: 마지막 token이 question token들을 못 보게 막음
Video → Last: 마지막 token이 video token들을 직접 못 보게 막음

그리고 question을 더 쪼갬

True option → Last: 마지막 token이 정답 option token들을 못 보게
False option → Last: 마지막 token이 오답 option token들을 못 보게
Non-option question → Last: 마지막 token이 질문 본문 token들을 못 보게
Video → True option: 정답 option token들이 video를 못 보게
Non-option question → True option: 정답 option token들이 질문 본문을 못 보게


그래서 목표가 뭐임?
VideoLLM이 VideoQA를 풀 때, 영상 정보가 모델 내부에서 어디를 거쳐 어떻게 최종 답까지 전달되는지 밝히는 것




핵심 레이어를 알기 위해 모든 레이어를 돌면서 어텐션을 차단했음. 앞뒤 4레이어씩 더해서. 근데 초기~중반 레이어가 핵심이라 함.


또     
Video → Question 차단: early~middle layer에서 정답 확률 크게 하락
Question → Last 차단: middle~late layer에서 크게 하락
Video → Last 차단: 상대적으로 영향 작음


초중반에는 video 정보가 question token 쪽에 영향을 주고, 중후반에는 question 쪽 정보가 last token 예측에 중요

Logit Lens로 video token을 layer별로 읽어봄 근데


중간 layer쯤에서 video token 안에 temporal concept가 생기고, 그 정보가 question의 temporal keyword와 연결


Temporal Checkpoint라는 아이디어를 꺼냄
“이런 temporal 의미를 가진 text 쪽 지점이 video 정보를 받아서 최종 답변에 쓰이는 중간 거점 아닐까?”라고 봄.

그런데 temporal keyword를 직접 일관되게 추적하기 어렵다면서, 여기서 객관식 option을 분석 대상으로 바꿈. 이유는 모름

source 종류로 보면 true option이 제일 중요했고, layer 위치로 보면 그 영향이 middle~late에서 컸다.


"모델이 이미 정답을 구별해서 그 option을 최종 출력에 많이 활용했으니, 그 option을 못 보게 하면 당연히 성능이 떨어진 것 아닌가?" 라는 질문 할 수 도 있지만 그냥 넘어가겠음.


그다음: Answer Generation 시점 확인

마지막 token의 hidden state를 layer별로 LM head에 넣어서
정답 option / 오답 option의 probability가 언제부터 갈리는지 봄.

결과:

초반에는 정답/오답 probability 차이가 크지 않음
중간 layer 이후, 대략 L20 부근부터 정답 option probability가 급격히 상승

Effective Information Flow Pathways 검증
앞에서 knockout으로 찾은 경로들이 실제로 VideoQA에 중요한 핵심 경로라는 걸 역으로 확인






Temporal Checkpoint 논리가 제일 약함 갑자기 옵션 되는게 웃김

True option이 중요하다는 결과가 너무 당연할 수 있음, 점수가 1/n 을 넘는다면...

전체적으로 어텐션으로 장난친건 너무 짜침.


2점 / 5점

별로 참신한게 없었음