| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | ||||
| 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 18 | 19 | 20 | 21 | 22 | 23 | 24 |
| 25 | 26 | 27 | 28 | 29 | 30 | 31 |
- 딥시크
- 자리
- 김원스쿨
- From
- put
- 5형식
- AS
- #뱅크시 #뱅크시전시 #뱅크시전시회 #뱅크시서울전시 #뱅크시스틸히어 #BANKSY #BANKSYSTILLHERE #더현대뱅크시 #더현대서울뱅크시 #더현대서울전시 #더현대전시 #더현대전시회 #더현대서울ALT1 #ALT1 #현대백화점전시 #서울전시 #서울전시회 #서울전시추천 #서울전시회추천 #서울미술전시 #서울미술관 #서울가볼만한곳 #서울실내데이트 #서울데이트 #서울데이트코스 #서울데이트추천 #여의도전시 #여의도데이트 #여의도가볼만한곳 #여의도데이트코스 #
- IS
- TO
- 0528
- ing
- deekseek
- #삼립수박샌드 #수박샌드 #삼립신상 #삼립빵 #신상빵 #편의점신상 #편의점빵 #편의점디저트 #세븐일레븐신상 #세븐일레븐빵 #편의점간식 #신상과자리뷰 #신상리뷰 #수박맛 #수박맛빵 #수박바맛 #수박디저트 #여름간식 #여름디저트 #크림샌드 #크림카스테라 #카스테라 #빵리뷰 #간식추천 #편의점추천
- be to 부정사
- TO 부정사
- Into
- 영어학습법
- 중국AI
- GPT
- 자리의힘
- \
- Today
- Total
AI바라기의 인공지능
VLM : 빠른 논문 리뷰 : Attention Gathers, MLPs Compose: A Causal Analysis of an Action-Outcome Circuit in VideoViT 본문
VLM : 빠른 논문 리뷰 : Attention Gathers, MLPs Compose: A Causal Analysis of an Action-Outcome Circuit in VideoViT
AI바라기 2026. 9. 26. 16:40용어 설명 (Terminology)
- Mechanistic Interpretability (MechInterp): 딥러닝 모델을 단순한 black box로 보지 않고, 내부의 가중치, 활성화 값(activation), 연결 구조를 역공학(reverse-engineering)하여 모델이 수행하는 세부 알고리즘과 계산 회로(circuit)를 규명하는 해석 방법론.
- Activation Patching: 한 입력(예: strike)에 대한 특정 레이어나 컴포넌트의 activation을 다른 입력(예: gutter)의 forward pass 중간에 강제로 덮어씌워(patching), 해당 컴포넌트가 특정 내부 signal이나 최종 output 변화에 미치는 인과적(causal) 기여도를 측정하는 기법.
- Direct Logit Attribution (DLA): 모델의 특정 중간 레이어나 컴포넌트의 출력이 residual stream을 통해 최종 target class의 logit에 직접적으로 얼만큼 기여하는지 선형적으로 분해하여 측정하는 기법.
- Delta Analysis: 상반된 두 입력 상태(strike vs. gutter) 간의 내부 activation 차이 벡터(delta)를 구하고, 이의 L2 norm을 레이어별로 추적하여 특정 semantic signal이 네트워크 어디서 발생하고 증폭되는지 추적하는 분석법.
- Automated Top-K Ablation: 모델의 DLA 값이 가장 높은 상위 k%의 spatio-temporal token들을 0으로 마스킹(zero-out)하여, 해당 visual hotspot들이 실제 최종 classification에 필수적인 causal necessity를 가지는지 검증하는 기법.
- Hidden Knowledge / Latent Knowledge: 모델의 최종 output layer(예: 단순 행동 분류 라벨)에는 명시적으로 드러나지 않지만, 모델 내부의 hidden state에는 체계적으로 표현·계산되고 있는 잠재적 의미 정보(예: 성공 vs 실패).
- Tubelet Embedding: Video Transformer에서 비디오를 처리할 때, 공간적 패치(16x16)와 시간적 프레임(2x)을 결합하여 3차원 시공간 볼륨 단위로 토큰화하는 방식.
Purpose of the Paper
- 기존 연구의 한계 극복:
- 기존 Mechanistic Interpretability 연구는 대부분 Large Language Model이나 정적 Image Vision Transformer에 국한되어 있었으며, 시공간(spatio-temporal) 차원이 복잡하게 얽힌 Video Transformer 내부의 회로를 인과적으로 분석한 연구는 거의 전무했음.
- 기존의 Saliency Map, Integrated Gradients 등 attribution 기반 설명 기법은 "어떤 입력 패치가 중요한가"만 보여줄 뿐, 내부 컴포넌트(Attention vs. MLP)가 그 정보를 "어떻게 변환하고 합성하는지" 인과적 메커니즘을 밝혀내지 못함.
- 새로운 문제 정의 및 접근 방식:
- 단순한 human-action classification(예: "Bowling")으로만 학습된 사전학습 비디오 모델 내부에서, 최종 라벨에 반영되지 않는 세부적인 결과 정보(성공 "Strike" vs. 실패 "Gutter")가 실제로 어떻게 표현되는지 파헤침.
- contrastive video pair, Delta Analysis, Activation Patching을 결합하여 비디오 모델 내부의 잠재된 "action-outcome circuit"을 분리 및 인과적으로 역공학하는 새로운 분석 프레임워크를 제시함.
Key Contributions & Novelty
- Video Vision Transformer에 대한 최초 수준의 Granular MechInterp 규명:
- Contribution: Kinetics-400으로 pre-trained된 12-layer ViViT 베이스 모델을 대상으로 비디오 도메인에서 컴포넌트 단위(Attention Heads vs. MLP Blocks)의 세부 causal circuit을 밝힘.
- Novelty: 언어 모델에 편중되어 있던 Activation Patching 프레임워크를 3D 시공간 tubelet 구조를 갖는 video vision model로 성공적으로 확장함.
- "Attention Gathers, MLPs Compose" 역할 분담(Division of Labor) 발견:
- Contribution: outcome signal 형성에서 Attention Block은 시공간 residual stream에 증거를 모으는 "Evidence Gatherers"(신호 복원율 37-54%)로 작동하고, MLP Block은 모인 증거를 바탕으로 상위 추상 개념을 적극적으로 구축하는 "Concept Composers"(신호 복원율 42-60%)로 기능함을 causal patching을 통해 실증함.
- Novelty: 단순히 어텐션 맵만 확인하던 기존 observational 분석을 넘어, Attention과 MLP의 기능적 분업을 정량적 복원율로 입증함.
- Outcome Circuit과 Classification Circuit의 기능적 분리(Circuit Separation) 규명:
- Contribution: Top-10% token ablation을 통해 가장 중요한 시각적 hotspot(공-핀 충돌 영역)을 제거해도 모델의 "Bowling" 분류 logit은 거의 변하지 않음(-0.34, -0.02)을 확인.
- Novelty: 모델이 수행하는 명시적 행동 분류(explicit classification task)와 내부에서 계산되는 결과 인지(hidden outcome computation)가 서로 독립적인 메커니즘으로 분리되어 존재함을 causal evidence로 증명함.
- Linear Probe의 한계 실증 및 Delta Analysis를 통한 "Signal Amplification Cascade" 발견:
- Contribution: Linear Probe가 Layer 0부터 100% 분류 정확도를 보이며 저수준 배경 텍스처(superficial fingerprint)에 과적합되는 실패를 겪은 반면, Delta Analysis(L2 norm)를 통해 Layer 5부터 Layer 11까지 신호 강도가 300% 이상(75에서 250 이상으로) 급격히 증폭되는 진정한 semantic outcome cascade를 찾아냄.
- Novelty: 비디오 모델의 표면적 차이와 진정한 고수준 의미 표현을 명확히 필터링하고 분리해내는 방법론적 표준을 제시함.
Experimental Highlights
- Core Experimental Setup:
- Model: google/vivit-b-16x2-kinetics400 (12 Transformer Layers, tubelet patch 16x16x2).
- Dataset: Kinetics-400의 "bowling" 클래스(Label: 31)에서 추출한 10초 길이의 minimal contrastive pair 비디오 (Strike run vs. Gutter run). 모델은 두 비디오 모두 정상적으로 1순위 "Bowling"으로 분류함.
- Intervention & Metrics: Automated Top-K Token Ablation (k=10%), Activation Patching (Layer 4~10), Signal Recovery (Layer 11 outcome delta 복원 백분율).
- Key Findings & Quantitative Results:
- DLA (Direct Logit Attribution): 모델의 행동 분류 확신도는 Layer 9 이후 급격히 상승(logit 16 이상)하여 출력 직전에 대부분의 분류 logit이 결정됨.
- Outcome Detectors (Attention Head): Layer 10, Head 8의 attention을 시각화한 결과, Strike 비디오에서는 공의 궤적을 쫓다가 Frame 15에서 핀의 충돌 지점에 정확히 집중하지만, Gutter 비디오에서는 Frame 5에서 거터(도랑)에 머문 뒤 Frame 15에서는 공이 닿지 않은 핀에 머무르며 결과의 성패를 포착함.
- Top-K Visual Feature Ablation:
- Strike run: Bowling logit 16.9954 -> 16.6583 (변화량 -0.3371, Rank 1 유지).
- Gutter run: Bowling logit 16.5200 -> 16.5044 (변화량 -0.0156, Rank 1 유지).
- 핵심 패치 313개를 날려도 분류가 변하지 않아 분류 회로의 높은 분산성 및 은닉 회로와의 분리를 입증함.
- Activation Patching Recovery:
- Layer 4: Attention 54.41% vs. MLP 60.17%
- Layer 5: Attention 50.22% vs. MLP 57.49%
- Layer 6: Attention 43.62% vs. MLP 49.11%
- Layer 7: Attention 40.38% vs. MLP 42.55%
- Layer 8: Attention 37.72% vs. MLP 42.10%
- Layer 9: Attention 44.43% vs. MLP 58.66%
- Layer 10: Attention 47.61% vs. MLP 43.39%
- 중간 레이어 전반(Layer 4~9)에서 MLP의 signal 복원 기여도가 Attention보다 일관되게 우세하며, 단일 컴포넌트가 100%를 독점하지 않고 네트워크 전반에 걸쳐 누적적으로 구성됨.
Limitations and Future Work
- 한계점 (Limitations):
- Single Contrastive Pair에 의존한 Scope: 비디오의 높은 spatio-temporal 차원으로 인한 수동 activation patching의 연산 비용 한계 때문에 단일 비디오 쌍(Strike vs. Gutter) 및 단일 ViViT 구조에 국한됨. 특정 배경 텍스처나 비디오 특유의 요소가 완전히 배제되었는지 대규모 통계적 일반화가 부족함.
- 단일 도메인 편향 가능성: 볼링과 같은 trajectory-based(궤적 중심) 행동에 특화된 현상일 수 있으며, 다른 일반적인 비디오 태스크 전체로 일반화하기엔 추가 검증이 필요함.
- 향후 연구 방향 (Future Work):
- ACDC(Automated Circuit Discovery) 도입: 수동 패칭의 한계를 넘어 대규모 데이터셋(Kinetics-400 샘플 전반)에서 outcome circuit을 자동으로 추출하여 일반성을 검증.
- Integrated Gradients 등 기존 Baseline과의 정량적 벤치마킹: mechanistic 방식이 gradient 기반 attribution 기법 대비 회로 분리 정밀도에서 얼마나 우수한지 실증적 비교 수행.
- 다양한 Video Architecture로의 확장: TimeSformer 등 다른 시공간 분리 아키텍처나 패치 크기 변화에 따라 Attention과 MLP 간의 분업 비율이 어떻게 달라지는지 비교 분석 계획.
Overall Summary
이 논문은 비디오 비전 트랜스포머(ViViT)가 단순히 "볼링"이라는 명시적 행동 분류만 학습했음에도 불구하고, 모델 내부 심층에서는 "성공(Strike)"과 "실패(Gutter)"라는 상위 인과적 결과를 정교하게 구분하는 은닉 지식(hidden cognition) 회로를 구축하고 있음을 밝혀냈습니다. 저자들은 관찰 분석(Attention visualization, Linear probe)의 한계를 Delta Analysis와 Activation Patching으로 돌파하여, Attention Heads는 시공간 증거를 수집(Gather)하고 MLP Blocks는 이를 바탕으로 결과를 합성(Compose)한다는 구조적 분업 메커니즘을 최초로 규명했습니다. 이 연구는 비디오 모델의 최종 출력을 모니터링하는 것만으로는 내부의 잠재적 판단을 신뢰할 수 없음을 보여주며, 향후 배포 단계의 안전하고 신뢰할 수 있는 AI(Trustworthy AI)를 위해 세밀한 mechanistic oversight가 필수적임을 시사합니다.
쉬운 설명
시험을 볼 때 학생에게 "이 영상에 나오는 스포츠가 무엇인가?"라는 문제만 냈는데, 학생은 답안지에 단순히 "볼링"이라고만 적어 정답을 맞혔습니다.
하지만 뇌 스캔(Activation Patching 및 델타 분석)을 해보니, 겉으로는 똑같이 "볼링"이라고 답하면서도 학생의 뇌 속에서는 "공이 핀을 정확히 쓰러뜨렸으니 스트라이크다!"와 "공이 옆 도랑으로 빠졌으니 실패다!"라는 세부적인 성공 여부를 이미 완벽하게 인지하고 있었습니다.
이때 뇌 속의 **시각 신경(Attention Head)**은 공의 이동 경로와 핀의 충돌 같은 단서들을 이곳저곳에서 모아오고, **사고 중추(MLP Block)**는 그 단서들을 차례대로 조립해서 "성공/실패"라는 고차원 개념을 완성해 냅니다. 즉, AI는 겉으로 드러나는 얕은 라벨보다 훨씬 더 깊고 정교한 '숨겨진 지식'을 내부에서 스스로 계산하고 있다는 사실을 증명한 연구입니다.
겉으로는 둘 다 Bowling이라고 똑같이 분류하지만, 모델 내부에서는 Strike와 Gutter를 어떻게 다르게 처리하는지 뜯어보자.
Strike 영상 → Bowling
Gutter 영상 → Bowling
저자들은 내부에 “성공 vs 실패”를 구분하는 표현이 따로 생기는지, 생긴다면 어느 레이어에서 생기고 Attention/MLP 중 누가 만드는지 보려는 것
DLA
각 layer의 [CLS]가 Bowling logit에 얼마나 기여하는지 봄 (head 가져와서 로짓 찍어보기)
Token / CLS Attention visualization
모델이 영상 어디를 보는지 확인.
→ Strike에서는 공과 핀 충돌, Gutter에서는 gutter와 그대로 남은 핀 쪽을 봄 (사람이 봣음)
Linear Probe
각 layer의 [CLS] activation만 보고 Strike/Gutter를 구분시켜봄.
→ 근데 Layer 0부터 100% 구분돼버림. 저자도 이건 배경 같은 단순 차이를 잡은 것 같아서 실패한 분석이라고 봄
근데 학습햇는데 못하는게 이상하긴함
Delta Analysis
Layer 5쯤부터 Strike/Gutter activation 차이가 확 커지기 시작하고, 뒤로 갈수록 계속 증폭
본인 들도 이상한걸 알거임... layer 0에서 100% 랬는데 갑자기 차이보는건 5부터 커진다? ㅋㅋ 어쩌라는거임
Component Ablation
DLA로 Bowling logit에 기여가 큰 video token 상위 10%를 골라서 0으로 지워봄. 결과는 별 차이없음.
중요한걸 지워도 유지되는걸 보니 꽤 퍼져 있다고 결론 내림.
Activation Patching
“L5 이후 커지는 Strike/Gutter 차이를 실제로 만드는 건 Attention인가, MLP인가?”
하나씩 바꿔봄...
Attention도 그 차이를 전달하지만, MLP를 Strike 값으로 바꿨을 때 더 많이 Strike 쪽 내부 상태로 이동했다.
그래서 Attention = evidence gathering, MLP = concept composition이라고 주장.
“누굴 바꿨을 때 뒤쪽 내부 표현이 더 많이 따라가냐?”
“우리는 Attention gathers, MLPs compose라는 패턴을 찾았다.”
2점 / 5점
초등학생 같음 연구가. 결론을 내기에 충분하지 않은 실험.
이 논문은 걍 실험보다 해석이 너무 앞서감. Strike랑 Gutter 영상 딱 한 쌍 놓고 activation 차이 구해놓고 그걸 거의 Success vs Failure signal이라고 부르는데, 영상 자체가 다르니 activation 다른 건 너무 당연함.
공 위치나 핀 상태, 배경 차이일 수도 있음. Linear Probe는 심지어 Layer 0부터 100% 구분돼서 저자들도 “이건 superficial fingerprint임” 하고 버렸는데, 갑자기 Layer 5부터 delta 커진다고 “여기서 semantic Success/Failure가 생기나봄” 하는 것도 근거 약함.
Activation Patching도 결국 Strike activation 넣었더니 뒤쪽 상태가 Strike 쪽으로 좀 움직였다는 거지, 그게 진짜 일반적인 Success 개념이라는 증거는 아님.
결국 확실히 말할 수 있는 건 “이 한 pair에서 중후반 layer로 갈수록 representation 차이가 커지고, MLP patch가 대체로 더 큰 영향을 줬음” 정도인데, 여기서 hidden knowledge, hidden cognition까지 가는 건 스토리텔링 많이 들어간 느낌.
