관리 메뉴

AI바라기의 인공지능

VLM : 빠른 논문 리뷰 : Causal Tracing of Object Representations in Large Vision Language Models: Mechanistic Interpretability and Hallucination Mitigation 본문

논문리뷰

VLM : 빠른 논문 리뷰 : Causal Tracing of Object Representations in Large Vision Language Models: Mechanistic Interpretability and Hallucination Mitigation

AI바라기 2026. 10. 1. 19:09

용어 설명

  • Causal Tracing (인과 추적): 딥러닝 모델의 특정 내부 activation(활성화 값)을 의도적으로 교체(activation patching)하여, 해당 component가 최종 output 확률에 미치는 직접적인 인과적 기여도를 정량화하는 mechanistic interpretability 기법입니다.
  • FCCT (Fine-grained Cross-modal Causal Tracing): 입력 이미지에 Gaussian noise를 주입하여 손상시킨 뒤, clean 상태의 activation을 토큰 종류(7종) 및 component(MHSA, MLP, hidden state)별로 복원하며 causal effect를 측정하는 프레임워크입니다.
  • Recovery Rate (RR, 복원율): corrupt된 입력 상태에서 특정 레이어의 component를 clean activation으로 교체했을 때, clean 상태의 정답 확률을 얼마나 회복하는지 나타내는 지표입니다. 수식 표현: RR = (P_patched - P_corrupted) / (P_clean - P_corrupted).
  • Intermediate Representation Injection (IRI): FCCT 분석을 통해 식별된 강한 causal effect를 지닌 중간 레이어(intermediate layers)의 cross-modal representation을 후속 레이어로 주입하여 fine-grained 시각 정보의 소실을 방지하는 training-free 추론 기법입니다.
  • Object Hallucination (객체 환각): LVLM이 입력 이미지에 실제로 존재하지 않는 물체를 마치 존재하는 것처럼 텍스트로 생성하거나 질문에 긍정으로 답하는 현상입니다.
  • TTFT / TPOT: Time To First Token(첫 번째 토큰 생성까지 걸리는 지연 시간) 및 Time Per Output Token(이후 토큰당 생성 지연 시간)을 의미하는 추론 latency 측정 지표입니다.

Purpose of the Paper

  • 기존 연구의 한계 극복:
    • 기존 LVLM mechanistic interpretability 연구는 visual 토큰과 textual 토큰 간의 상호작용을 분리하지 못했거나(coarse-grained), attention knockout·logit lens처럼 특정 component(MHSA 위주)나 특정 레이어 구간만 부분적으로 분석하여 전체 레이어에 걸친 체계적인 정보 흐름을 설명하지 못했습니다.
    • 기존 hallucination mitigation 기법 중 contrastive decoding(VCD, OPERA)은 심각한 추론 latency를 유발하고, activation steering 방식(PAI, VTI)은 어떤 레이어와 component를 왜 개입해야 하는지에 대한 정밀한 해석 가능성(interpretability)과 근거가 부족했습니다.
  • 새로운 접근 방식:
    • 이미지 전체에 controlled Gaussian noise를 가한 뒤 토큰 위치/의미(7개 범주)와 모델 component(MHSA, MLP, hidden states) 전 구간을 포괄하는 세분화된 인과 분석 프레임워크(FCCT)를 새롭게 정의했습니다.
    • 심층 레이어로 갈수록 초기의 fine-grained 시각 정보가 점진적으로 퇴화(degradation)한다는 메커니즘을 밝혀내고, 이를 보정하기 위해 인과적 기여도(RR)에 기반해 중간 표현을 후속 레이어로 직접 주입하는 경량 추론 기법(IRI)을 제안했습니다.

Key Contributions

  • FCCT(Fine-grained Cross-modal Causal Tracing) 프레임워크 제안:
    • visual 및 textual 토큰을 위치와 역할에 따라 7가지 세부 카테고리로 분류하고, 32개 전 레이어의 MHSA, MLP, hidden state에 대해 causal effect를 독립적으로 측정하는 포괄적 분석 파이프라인을 구축했습니다.
  • LVLM 내부 정보 처리 메커니즘의 세 가지 핵심 발견:
    • Finding 1 (Cross-modal Aggregation via MHSA): 중간 레이어(약 14-15번째 레이어)에서 The Last Token의 MHSA가 선행 visual 및 textual object 토큰들의 정보를 한곳으로 통합 바인딩하는 핵심 역할을 수행함을 확인했습니다.
    • Finding 2 (Three-stage Hierarchical Representation in MLPs): MLP는 초반부(국소적 visual 임베딩) -> 중반부(visual-textual 상호작용) -> 후반부(The Last Token 중심의 생성 및 task 지향 표현 축적)의 3단계 계층적 전이를 보입니다.
    • Finding 3 (Semantic Shift in Hidden States): hidden state는 얕은 레이어의 visual-centric 패턴에서 중간 레이어의 cross-modal 정제를 거쳐 깊은 레이어의 task-predictive 표현으로 급격한 의미적 전이를 겪습니다.
  • 학습 없는 추론 기법 IRI(Intermediate Representation Injection) 개발:
    • 추가 fine-tuning이나 decoding 반복 없이, Recovery Rate(RR)를 가중치로 활용하여 중요 중간 레이어(source)의 MHSA 및 MLP 출력을 선별된 상위 레이어(target)에 주입하는 가벼운 개입 방식을 설계했습니다.

Novelty

  • Gaussian Noise 기반의 Multi-Component Cross-Modal Causal Tracing 최초 적용:
    • LLM 텍스트 도메인(ROME 등)의 causal tracing을 멀티모달 LVLM 영역으로 확장하여, 이미지 섭동과 7종 토큰-3종 모듈의 세밀한 교차 분석을 최초로 구현했습니다.
  • 인과성(Causal Effect)에 기반한 적응형 표현 주입(Adaptive Injection):
    • 휴리스틱하게 레이어를 선택하거나 hidden state 전체를 왜곡하는 기존 steering 방식과 달리, RR 지표로 선별된 상위 source/target 레이어에만 선택적으로 개입하며 L2-norm 정규화를 결합해 downstream 표현 왜곡 없이 신호의 크기를 안정적으로 유지했습니다.

Experimental Highlights

  • 실험 설정:
    • Models: LLaVA-1.5-7B, Qwen-VL-Chat, LLaVA-NeXT, Qwen2-VL-7B, InternVL2-8B (총 5개 모델 검증)
    • Benchmarks: POPE (Random, Popular, Adversarial), MME (Hallucination subset 및 Cognition subset), CHAIR (CS, CI), MMHal-Bench, MHumanEval (인간 평가단 라벨링)
    • Baselines: Regular(기본 추론), VCD, OPERA, PAI, VTI
    • IRI 기본 파라미터: source 레이어 수 k1 = 3, target 레이어 수 k2 = 10, LLaVA-1.5-7B 기준 lambda_a = 0.26, lambda_m = 0.16
  • 주요 성능 결과:
    • POPE: LLaVA-1.5-7B Adversarial 세팅에서 Regular(78.96% Acc / 77.57% F1) 대비 IRI 적용 시 85.17% Acc / 84.18% F1 달성 (전체 벤치마크 평균 Acc +4.89%p, F1 +5.20%p 향상).
    • MME Hallucination: LLaVA-1.5-7B 기준 Total 점수 565.4점에서 648.3점으로 대폭 상승 (+82.9점).
    • CHAIR: LLaVA-1.5-7B에서 object hallucination 빈도 지표인 CS가 52.8에서 34.6으로, CI가 15.9에서 11.5로 크게 감소.
    • MMHal-Bench & MHumanEval: LLaVA-1.5-7B에서 점수 향상(1.86 -> 2.53), Hallucination 비율 감소(VH.% 63.5 -> 50.2, 인간 평가 Hu.% 67.1 -> 62.0).
    • 최신 대형 모델 일반화: Qwen2-VL-7B (CHAIR CS: 24.8 -> 14.2), InternVL2-8B (CHAIR CS: 37.2 -> 30.7) 등 고성능 모델에서도 일관된 성능 향상 검증.
  • Inference Latency 보존:
    • 기존 contrastive decoding 방식인 VCD(TPOT 2.7배 증가), OPERA(1.9배 증가)와 달리, IRI는 LLaVA-1.5-7B 기준 TTFT 102.2ms(1.0배), TPOT 36.5ms(1.0배)로 baseline(99.8ms / 36.0ms)과 사실상 동일한 추론 속도를 유지했습니다.
  • Ablation Study 핵심 결과:
    • Hidden States 개입의 역효과: MHSA와 MLP에 개입하지 않고 hidden state에 직접 IRI를 적용하면 84.50% Acc로 성능이 하락했습니다. 이는 이미 고도로 통합된 누적 표현을 직접 건드리면 계층적 정보 흐름이 깨지기 때문입니다.
    • 중간 레이어의 중요성 입증: 개입 대상을 처음 10개 레이어로 제한하면 Acc 78.46%, 마지막 10개 레이어로 제한하면 Acc 80.42%로 급락하여, 중간 레이어가 cross-modal 통합의 핵심이라는 FCCT 분석 결과가 증명되었습니다.

Limitations and Future Work

  • 한계점 (Limitations):
    • 모델별 Scaling 계수 튜닝 필요: 모델 아키텍처(LLaVA 계열, Qwen 계열 등)마다 최적의 lambda_a, lambda_m 및 k1, k2 값이 조금씩 상이하여 초기 실험적 세팅 탐색이 요구됩니다.
    • 고정된 Source-Target 레이어 설정: 쿼리되는 객체의 복잡도나 이미지 내용과 무관하게 사전에 RR 순위로 선택된 레이어 세트(k1=3, k2=10)를 정적으로 적용합니다.
  • 향후 연구 방향 (Future Work):
    • 동적/적응형 주입 메커니즘: 입력 프롬프트나 이미지의 복잡도에 따라 주입 강도와 레이어를 실시간으로 동적 조절하는 instance-adaptive injection 연구로 발전할 수 있습니다.
    • Fine-tuning 및 Architecture 설계 피드백: FCCT를 통해 밝혀진 MHSA의 mid-layer aggregation 및 MLP의 3단계 전이 패턴을 사전학습/미세조정 loss 설계나 decoder layer 간 shortcut 연결 설계에 구조적으로 반영할 수 있습니다.

Overall Summary

이 논문은 이미지에 Gaussian noise를 주입하는 인과 추적 프레임워크인 FCCT를 제안하여, LVLM이 중간 레이어(약 14-15층)의 The Last Token MHSA와 계층적 MLP를 통해 visual과 textual 객체 정보를 통합한다는 핵심 작동 원리를 규명했습니다. 연구진은 심층 레이어로 갈수록 이러한 세부 시각 정보가 퇴화한다는 점에 착안하여, 인과적 복원율(RR)로 스케일링된 중간 표현을 상위 레이어에 주입하는 학습 불필요 추론 기법인 IRI를 설계했습니다. IRI는 LLaVA, Qwen-VL, InternVL 등 5개 첨단 LVLM 모델과 다수의 벤치마크(POPE, MME, CHAIR 등)에서 추론 latency 저하 없이 hallucination을 획기적으로 억제함으로써, mechanistic interpretability 연구가 실제 모델 신뢰성 개선으로 직결될 수 있음을 증명했습니다.


쉬운 설명

우리가 복잡한 그림책을 읽고 질문에 답할 때, **중간 페이지쯤에서 그림 속 물체와 글의 단어를 머릿속에서 완벽히 매칭(크로스모달 통합)**해 두었더라도 결론을 내는 마지막 페이지에 다다르면 그 디테일한 시각 기억이 흐려져 엉뚱한 거짓말(환각)을 지어내기 쉽습니다.

이 논문의 핵심 아이디어는 중간 정리 노트(중간 레이어의 핵심 표현)를 복사해 두었다가 결론을 작성하는 후반부 단계에 적절한 비율로 다시 끼워 넣어(Injection) 주는 것입니다. 이렇게 하면 모델 전체를 새로 공부(재학습)시키지 않고도 디테일한 시각적 사실을 잊지 않게 환기시켜 주어, 답변 속도는 그대로 유지하면서 거짓말만 깔끔하게 방지할 수 있습니다.

 

 

 

 

더보기

Causal Tracing
모델 내부의 특정 activation을 직접 바꿔보고, 그 변화가 최종 답변에 실제로 영향을 주는지 확인하는 방법

원본 이미지 → Gaussian noise 이미지 → 특정 MHSA/MLP/hidden state만 clean activation으로 복원하는 방식
최종 output probability가 기준


FCCT (Fine-grained Cross-modal Causal Tracing)
VLM에서 Causal Tracing을 훨씬 세분화해서, 시각 정보와 텍스트 정보가 어떤 token·layer·component를 거쳐 최종 답에 영향을 주는지 추적하는 방법

Token 종류- Early Visual Token
- Object Visual Token
- Late Visual Token
- Early Textual Token
- Textual Object Token
- Late Textual Token
- Last Token

Component 종류- MHSA
- MLP/FFN
- Hidden State

토큰자리까지 다 나눠서 특정 토큰 자리를 대체 해볼때 성능이 오르면 그게 핵심 토큰이엇다 뭐 그런 얘기 같은데
특정 token 위치에서의 activation이, 특정 layer/component에서 최종 출력에 큰 causal effect를 보였다는 뜻

나머지 토큰이나 나머지 레이어에서는 모든게 오염된 이미지의 토큰이고 딱 그 15번째의 a_i만 정상으로 바꿔줘도 성능이 회복됏다 이 얘기

근데 이제 그룹 단위로 바꾸긴함. 위에서 말한대로


여기서 질문> task 마다 일관된 패턴이 보이는건지

Recovery Rate
특정 activation을 정상값으로 바꿔줬을 때, 망가졌던 최종 출력이 원래 정상 상태의 몇 %만큼 회복됐는가


Intermediate Representation Injection (IRI)
“어느 중간 표현이 중요한지” 찾은 뒤, 그 중요한 중간 표현을 뒤쪽 layer에 다시 주입해서 강화하는 방법




논문 흐름
LVLM이 visual object 정보를 내부에서 어떻게 처리해서 최종 답까지 가져가는지 충분히 모른다

어떤 연구는 visual token이 어느 layer에서 중요해지는지는 봄
어떤 연구는 MHSA / MLP 역할은 봄
어떤 연구는 text 쪽 activation은 봄

근데 애넨 촘촘하게 보지 못했다고 함

그래서 다 합쳐서 보기로 했는데 그게 노벨티는 아니고
controlled Gaussian noise를 image에 넣은 뒤 특정 activation을 복원하는 causal tracing을 LVLM에 적용
한게 노벨티 라고 하긴함...

방법은
Clean run
정상 이미지로 돌리고 activation 저장

Corrupted run
이미지 전체에 Gaussian noise를 넣어서 성능을 떨어뜨림

Patched run
corrupted 상태에서 특정 지점만 clean activation으로 복원



그래서 발견한 패턴은
Middle layer의 Last Token MHSA가 중요
특히 중간 레이어에서 마지막 token의 MHSA activation을 복원했을 때 RR이 크게 나옴.
논문은 이걸 앞에 있는 visual + textual 정보를 마지막 token이 모으는 cross-modal aggregation 지점으로 해석합니다.


이 결과만으로는 Middle-layer Last Token MHSA가 이 object task에서 특별히 중요한 건지, 원래 대부분의 task에서 중요한 건지 분리할 수 없습니다.


FCCT로 내부 메커니즘을 찾는 핵심 실험은 사실상 객체 존재 판단(object existence / object perception) 위주

객체 인식에서 중요한 것 처럼 다른 task에서는 다른 패턴으로 중요한게 나와야하는데
그런실험이 없어서 어떤게 중요한지 알기 어려움


FCCT에서 RR 높은 중간-layer MHSA/MLP representation을 찾아서, 그걸 뒤쪽 layer들에 RR 비례로 더해주는 게 IRI입니다.

특이한 짓 많이 하긴함.






FCCT는 LVLM 내부를 체계적으로 훑는다는 장점은 있지만, mechanistic finding이 사실상 object-existence task에 한정되어 있어 이를 일반적인 cross-modal information flow로 해석하기에는 근거가 부족하다. 특히 Last Token의 높은 causal effect나 MLP의 depth-wise progression이 task-specific 현상인지 Transformer의 일반적인 구조적 특성인지 분리하는 control이 없다. 또한 Gaussian noise 기반 복원 실험이 실제 hallucination의 원인을 직접 반영한다고 보기 어렵다. IRI 역시 RR이나 일부 component를 제거해도 성능 대부분이 유지되어, FCCT의 causal insight보다 단순한 중간표현 재주입 자체가 주효했을 가능성이 남는다.



2점 / 5점