| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | ||||
| 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 18 | 19 | 20 | 21 | 22 | 23 | 24 |
| 25 | 26 | 27 | 28 | 29 | 30 | 31 |
- TO
- TO 부정사
- deekseek
- 중국AI
- ing
- be to 부정사
- GPT
- 자리의힘
- From
- 딥시크
- 자리
- AS
- 김원스쿨
- IS
- 영어학습법
- #뱅크시 #뱅크시전시 #뱅크시전시회 #뱅크시서울전시 #뱅크시스틸히어 #BANKSY #BANKSYSTILLHERE #더현대뱅크시 #더현대서울뱅크시 #더현대서울전시 #더현대전시 #더현대전시회 #더현대서울ALT1 #ALT1 #현대백화점전시 #서울전시 #서울전시회 #서울전시추천 #서울전시회추천 #서울미술전시 #서울미술관 #서울가볼만한곳 #서울실내데이트 #서울데이트 #서울데이트코스 #서울데이트추천 #여의도전시 #여의도데이트 #여의도가볼만한곳 #여의도데이트코스 #
- #삼립수박샌드 #수박샌드 #삼립신상 #삼립빵 #신상빵 #편의점신상 #편의점빵 #편의점디저트 #세븐일레븐신상 #세븐일레븐빵 #편의점간식 #신상과자리뷰 #신상리뷰 #수박맛 #수박맛빵 #수박바맛 #수박디저트 #여름간식 #여름디저트 #크림샌드 #크림카스테라 #카스테라 #빵리뷰 #간식추천 #편의점추천
- 0528
- \
- 5형식
- Into
- put
- Today
- Total
AI바라기의 인공지능
VLM : 빠른 논문 리뷰 : Circuit Tracing in Vision–Language Models: Understanding the Internal Mechanisms of Multimodal Thinking 본문
VLM : 빠른 논문 리뷰 : Circuit Tracing in Vision–Language Models: Understanding the Internal Mechanisms of Multimodal Thinking
AI바라기 2026. 9. 27. 19:15용어 설명 (Terminology)
- Circuit Tracing (회로 추적): 모델 내부의 방대한 신경망 연결 중 특정 작업이나 추론(reasoning)을 직접적으로 수행하는 최소 단위의 인과적 서브그래프(subgraph)를 찾아내고 분석하는 mechanistic interpretability 기법입니다.
- Transcoder (트랜스코더): transformer의 MLP sublayer를 대체하도록 학습된 희소 오토인코더(SAE) 변형체입니다. 단순히 입력을 복원하는 일반 SAE와 달리, MLP의 입력을 받아 MLP의 출력을 근사 복원(input-to-output mapping)하여 선형적이고 해석 가능한 단일 의미(monosemantic) feature들로 분해합니다.
- Attribution Graph (어트리뷰션 그래프): 특정 입력 프롬프트에 대해 비선형 활성화 값들을 고정하여 모델을 국소적으로 선형화한 뒤, 하위 레이어의 feature가 상위 레이어 및 최종 output logit에 미치는 기여도(attribution)를 유향 그래프(directed graph)로 표현한 계산 그래프입니다.
- TopK Sparsity: 기존 transcoders에서 쓰이던 L1 패널티 기반 희소성 정규화 대신, 활성화 크기가 가장 큰 상위 k개의 latent feature만을 강제로 통과시키는 방식입니다. 하이퍼파라미터 튜닝을 줄이고 안정적인 feature 학습을 보장합니다.
- Attention-Rollout Map: vision encoder(SigLIP)의 여러 self-attention 레이어에 걸친 attention 행렬을 누적 곱하여, language model로 전달되는 특정 256개 visual token이 원본 이미지의 어느 공간 좌표(image patches)를 바라보는지 추적·시각화하는 기법입니다.
- Circuit Patching / Feature Steering: circuit 내부의 특정 feature 활성화 값을 강제로 수정(steering)하거나 다른 입력(예: Mars 회로에 Earth feature 이식)의 값으로 치환(patching)하여 모델의 출력 변화를 확인하는 인과적 검증 기법입니다.
- Dead Latents (데드 레이턴트): 학습 과정 중 최소 활성화 임계값을 넘지 못하고 계속해서 0으로 남아 모델 용량을 효율적으로 활용하지 못하는 transcoder feature들을 의미합니다.
- Cross-Layer Superposition (레이어 간 중첩): 단일 레이어 내에 머물지 않고 여러 연속된 레이어에 걸쳐 동일하거나 유사한 개념이 분산되어 표현되는 현상입니다.
Purpose of the Paper
- 기존 연구의 한계 극복:
- 기존 mechanistic interpretability(회로 분석, SAE, Transcoder)는 순수 text-only LLM에만 국한되어 있었습니다.
- 기존 vision-language model(VLM) 해석 연구는 attention 시각화, probing, representation alignment 등 고수준의 상관관계(correlation) 분석에 머물렀으며, 모델 내부에서 시각 정보와 언어 정보가 어떻게 결합되어 추론되는지 인과적(causal) 계산 메커니즘을 규명하지 못했습니다.
- 새로운 문제 정의 및 접근 방식:
- VLM 내부의 다중 모달 추론 과정을 투명하게 규명하기 위해 최초로 VLM 전용 circuit tracing 프레임워크를 제안했습니다.
- MLP를 monosemantic feature 단위로 분해하는 per-layer transcoder, 양방향 image token attention을 반영한 multimodal attribution graph, visual embedding의 물리적 의미를 해석하는 attention-rollout 분석을 통합하여 시각 입력부터 최종 텍스트 생성까지의 전 과정을 인과적 서브그래프로 추적합니다.
Key Contributions & Novelty
- 최초의 VLM 대상 Circuit Tracing 프레임워크 구축 (Novelty):
- text-only 모델에 쓰이던 transcoder 및 attribution graph 기법을 VLM(Gemma-3-4B-it) 구조에 맞춰 최초로 확장했습니다.
- image-embedding residual과 vision token의 bidirectional attention 구조를 그래프 계산에 반영하여 시각-언어 상호작용의 인과적 경로를 모델링했습니다.
- TopK 기반 Multimodal Transcoder 학습:
- L1 penalty 대신 TopK(k=48) 활성화 메커니즘을 적용하고, reconstruction residual 오차 노드를 명시적으로 추적하여 forward pass 손상 없이 MLP 블록을 고차원 monosemantic feature로 분해했습니다.
- 효율적인 Visual Feature 해석 파이프라인 (Attention-Rollout + Ad-hoc Caching):
- 텍스트와 달리 의미 파악이 어려운 visual token에 대해 SigLIP의 focused head 기반 attention-rollout을 계산하여 이미지 상의 관심 영역을 매핑했습니다.
- 전체 feature를 사전 계산하는 대신 attribution graph에 포함된 활성 feature(약 1,000~2,000개)만 선택적으로 추출하는 ad-hoc 계산 방식을 도입해 다중 모달 해석의 막대한 연산 비용을 대폭 절감했습니다.
- 인과적 조작 검증 (Steering & Circuit Patching):
- 발견된 multimodal 회로가 단순 사후 상관관계가 아님을 보이기 위해 feature steering과 activation patching을 수행했습니다.
- 화성(Mars) 회로 내 visual feature를 지구(Earth) 회로의 visual feature로 교체했을 때 모델 출력이 즉각 Earth로 전환됨을 확인하여 회로의 인과성을 입증했습니다.
- 멀티모달 내부 추론 메커니즘 규명 (새로운 발견):
- 시각과 언어가 완전히 융합되는 multimodal joint feature는 네트워크 상위 레이어(Layer 20 전후)에 이르러서야 늦게 형성된다는 사실(Late Convergence)을 밝혔습니다.
- 손가락 6개 이미지를 보고 5개라고 답하는 고질적 hallucination이 '객체 카운팅 실패'가 아니라, 손(hand)의 시각 특징이 숫자 5(five) 회로를 강하게 편향 활성화하고 6에 대한 feature를 억제하는 내부 메커니즘 때문임을 규명했습니다.
Experimental Highlights
- 실험 설정 및 모델:
- Base VLM: Google Gemma-3-4B-it (SigLIP vision encoder 896x896 -> 256 soft image tokens + 34-layer transformer decoder, d_model = 2560, d_ff = 10240).
- Transcoder 학습: SmolLM2-135M-10B(순수 텍스트 144k), ImageNet(시각 캡션 144k), Cauldron(멀티모달 QA 72k) 데이터셋 활용. d_feat = 64 * 2560 * 34, TopK k=48, AdamW, 8x H100 GPU에서 약 60시간(30,000 steps) 학습.
- Attribution Graph 계산: 누적 기여도 임계값 0.8 및 0.98, 최대 feature 수 m=7500, bfloat16 연산 기준 단일 H100에서 질의당 약 20분 소요.
- 주요 실험 결과:
- FVU (Fraction of Variance Unexplained) 비교:
- 순수 텍스트 데이터셋으로만 학습한 transcoder보다 멀티모달(텍스트+이미지) 데이터를 함께 학습한 transcoder가 모든 레이어에서 일관되게 더 낮은 FVU를 기록했습니다.
- 특히 시각 정보가 통합되는 중간 레이어(Layer 15)에서 텍스트 전용 대비 FVU 감소 폭이 가장 크게 나타났으며, 상위 레이어로 갈수록 표현이 통일되며 격차가 감소했습니다.
- Dead Latents 분포:
- 초기 레이어(Layer 0
3)는 dead latent 비율이 6080% 수준으로 매우 높게 나타난 반면, 중간 레이어(Layer 15)에서는 거의 0%에 수렴하며 feature 활성화가 조밀하게 이루어졌습니다.
- 초기 레이어(Layer 0
- Case 1: Six-Finger Hallucination 메커니즘:
- 손가락 6개 이미지를 입력했을 때, 토큰 '6'에 대한 logit은 다른 무관한 숫자(1, 7) 수준으로 억제되었습니다.
- 모델 내부에는 counting 회로(3개 그룹 감지 등)가 존재함에도 불구하고, '손'을 감지한 visual feature가 카운팅 경로를 거치지 않고 직접 숫자 5 feature 및 'say a number' 회로와 강하게 연결되어 오류가 발생함을 확인했습니다.
- Case 2: Mars -> Earth Circuit Patching:
- 화성 이미지 회로의 중간 레이어 visual feature를 억제하고, 지구 회로의 visual feature를 주입(patching)한 결과, 상위 레이어의 multimodal joint feature와 최종 생성이 완벽하게 지구 관련 개념으로 전환되었습니다.
- Case 3: Visual Arithmetic (시각적 덧셈 1+2=3):
- 초기-중간 레이어에서 숫자 0-5 범위 feature, 차트 축의 3 범위 feature, 3개 객체 그룹 feature 등 시각적 형태의 숫자 feature가 먼저 활성화된 후, 중상위 레이어의 의미론적 연산 subgraph로 정보가 전달되는 계산 경로를 확인했습니다.
- Case 4: 잠재 시각 연상 (Latent Visual Associations):
- 화성 이미지를 입력했을 때 텍스트 프롬프트에 아무런 단서가 없음에도 중간 레이어에서 'rocket', 'space shuttle' 등의 visual feature가 자발적으로 co-activation되는 현상을 발견하여, 언어 모델 내부가 순수 시각 기반의 연상 네트워크를 유지하고 있음을 입증했습니다.
- FVU (Fraction of Variance Unexplained) 비교:
Limitations and Future Work
- 명확하게 언급된 한계점 (Limitations):
- Vision Encoder Attention Map의 불완전성: SigLIP attention rollout 맵이 저수준 시각 feature의 경우 특정 영역을 정밀하게 국소화하지 못하거나 노이즈가 많아 사람 전문가의 해석을 방해합니다.
- Per-layer Transcoder의 구조적 한계 (Cross-layer Superposition 미반영): 레이어별 독립 transcoder를 사용하여 연속된 레이어에 걸쳐 중복되는 visual feature(near-duplicate features)가 다수 발생합니다.
- 다중 모달 Feature 해석의 막대한 연산 비용: 텍스트 토큰과 달리 256개의 이미지 토큰은 feature 커버리지가 낮고 encoder 연산이 추가되어, 사전 전체 분석(precomputing)이 불가능하고 ad-hoc 분석에 의존해야 합니다.
- 단일 모델 아키텍처 의존성: SigLIP 및 양방향 attention 구조를 가진 Gemma-3-4B-it 모델 하나에 대해서만 분석이 진행되어 다른 VLM 계열로의 일반화 검증이 필요합니다.
- 회로 발견 과정의 높은 인적 자원 의존성: attribution graph에서 의미 있는 노드를 묶고 서브그래프를 도출하는 과정이 자동화되지 못하고 전문가의 수작업 분석(human-in-the-loop)에 의존하여 정량 평가 확장이 어렵습니다.
- 향후 연구 방향 (Future Work):
- 자동화된 Feature 해석 (Automated Interpretation): LLM/VLM을 활용하여 다중 모달 feature의 의미를 자동으로 라벨링하는 경량화 파이프라인 개발.
- Cross-Layer Transcoder 및 최신 SAE 기법 도입: 레이어 간 중첩 문제를 해결하기 위한 cross-layer 구조와 JumpReLU, BatchTopK 등 최신 SAE 기법 적용.
- 다양한 VLM으로의 확장: 서로 다른 vision encoder(CLIP, EVA 등)와 결합 구조를 가진 다양한 오픈소스 VLM으로 circuit tracing 검증 확대.
Overall Summary
이 논문은 vision-language model(VLM)의 블랙박스 구조를 규명하기 위해 최초로 multimodal circuit tracing 프레임워크를 제안한 연구입니다. Gemma-3-4B-it 모델에 TopK transcoder와 linearized attribution graph, vision attention rollout을 적용하여, 시각 입력이 언어적 개념과 결합되는 인과적 연산 경로를 완벽히 추적했습니다. 연구진은 시각-언어 융합이 상위 레이어(Layer 20 부근)에서 늦게 일어난다는 점, 손가락 개수 왜곡(hallucination)이 카운팅 실패가 아닌 강한 시각적 선입견(hand -> 5) 때문이라는 점을 밝혀냈으며, circuit patching을 통해 모델 출력을 조작할 수 있음을 증명했습니다. 본 연구는 해석 가능성(interpretability) 연구를 텍스트에서 멀티모달 영역으로 확장하여, 향후 VLM의 디버깅, 편향 완화, 신뢰성 향상에 중요한 기초를 마련했습니다.
쉬운 설명
이 논문은 복잡한 AI의 뇌 속에서 **"시각적 자극이 어떻게 단어라는 생각으로 바뀌는지 보여주는 정밀 뇌신경 회로도(X-ray)"**를 만든 것과 같습니다.
우리가 붉은 행성 사진을 보고 즉각 "화성"이라고 말할 때, 뇌 속에서는 '붉은 둥근 물체' -> '우주선/로켓 연상' -> '화성'이라는 일련의 회로가 차례로 켜집니다. 이 연구는 AI의 신경망 속에 특수 감지기(Transcoder)를 달아 그 생각의 전선(Attribution Graph)을 하나하나 찾아냈습니다. 심지어 연구진은 AI가 화성을 떠올리는 전선 중간을 싹둑 자르고 '지구' 전선을 이어 붙였더니, AI가 곧바로 "지구"라고 대답을 바꾸는 인과적 제어까지 성공했습니다.
Transcoder (트랜스코더)
피쳐를 내부에 많이 만들어 놓고 y를 근사하게 하면서 나중에 어떤게 켜졌을지 보고싶어함.
Attribution Graph
토큰 피쳐 아웃풋 이런것들을 그래프로 엮는데 이때 얼마나 영향력을 주는지가 엣지
TopK Sparsity
상위 K개만 켜두게함
Attention-Rollout Map:
특정 토큰이 원본 이미지에서 어디를 보고 있는지 히트맵을 그림
Circuit Patching / Feature Steering
“우리가 찾은 이 feature/circuit이 정말 output을 만드는 데 인과적으로 작동하나?”를 직접 건드려 확인하는 것.
트랜스 코더에서
목적
주어진 image + prompt에 대해 VLM이 특정 output token을 내는 내부 circuit을 추적하는 것
각 MLP를 흉내 내는 Transcoder를 학습
원래 MLP 계산을 해석 가능한 latent feature들로 펼쳐놓기 위해서
각 Transcoder feature가 뭘 의미하는지 해석
feature마다 가장 강하게 켜지는 image-text example들을 모음
공통점을 보고 사람이 planet, hand, number 3 같은 의미를 붙임
실제 입력 하나를 넣고 Attribution Graph 생성
어떤 feature가 어떤 다음 feature에 얼마나 기여했는지 연결 , 최종 로짓까지
Attribution Graph에서 중요한 부분만 묶어서 Circuit 생성
비슷한 역할의 feature들을 사람이 묶고
핵심 계산 경로만 남겨서 이해 가능한 circuit으로 만듬
찾은 circuit을 실제로 건드려 검증
피쳐 값을 바꾸거나 교체해보기
그걸 가지고 실제 사례 분석
VLM의 multimodal reasoning도 feature-level circuit으로 뜯어볼 수 있고, 실제로는 visual/semantic 정보가 계층적으로 합쳐지며, 잘못된 prior circuit이 강하면 hallucination도 생긴다.
2.5점/5점
LM circuit tracing의 VLM 이식판
가장 중요한 circuit discovery가 결국 사람이 봐서 묶는 방식
더구나 causal validation도 원래 Gemma-3가 아니라 Transcoder로 MLP를 대체한 근사 모델에서 qualitative하게 확인하는 수준이라, “원 모델의 실제 causal circuit을 정확히 찾았다”는 주장에는 여지가 있음
결국 결과도 “초기엔 visual, 뒤에서 semantic과 결합”, “hand prior가 five를 밀어준다” 정도라서, 보기 좋은 해석 사례와 debugging tool로서는 흥미롭지만, 새로운 internal algorithm을 발견했다기보다는 기존 해석 도구로 몇 개의 사례를 그럴듯하게 설명한 데 가까움
