| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | ||||
| 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 18 | 19 | 20 | 21 | 22 | 23 | 24 |
| 25 | 26 | 27 | 28 | 29 | 30 | 31 |
- 딥시크
- Into
- ing
- GPT
- 영어학습법
- TO
- 0528
- 김원스쿨
- 중국AI
- put
- \
- #뱅크시 #뱅크시전시 #뱅크시전시회 #뱅크시서울전시 #뱅크시스틸히어 #BANKSY #BANKSYSTILLHERE #더현대뱅크시 #더현대서울뱅크시 #더현대서울전시 #더현대전시 #더현대전시회 #더현대서울ALT1 #ALT1 #현대백화점전시 #서울전시 #서울전시회 #서울전시추천 #서울전시회추천 #서울미술전시 #서울미술관 #서울가볼만한곳 #서울실내데이트 #서울데이트 #서울데이트코스 #서울데이트추천 #여의도전시 #여의도데이트 #여의도가볼만한곳 #여의도데이트코스 #
- be to 부정사
- AS
- #삼립수박샌드 #수박샌드 #삼립신상 #삼립빵 #신상빵 #편의점신상 #편의점빵 #편의점디저트 #세븐일레븐신상 #세븐일레븐빵 #편의점간식 #신상과자리뷰 #신상리뷰 #수박맛 #수박맛빵 #수박바맛 #수박디저트 #여름간식 #여름디저트 #크림샌드 #크림카스테라 #카스테라 #빵리뷰 #간식추천 #편의점추천
- TO 부정사
- IS
- 자리
- From
- 자리의힘
- deekseek
- 5형식
- Today
- Total
AI바라기의 인공지능
VLM : 빠른 논문 리뷰 : Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information 본문
VLM : 빠른 논문 리뷰 : Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information
AI바라기 2026. 9. 27. 16:05용어 설명 (Terminology)
- Retrieval Heads: Large Language Models(LLMs)의 긴 문맥 속에서 정답과 직결된 특정 입력 토큰(needle token)을 탐색하여 출력으로 전달하는 데 인과적(causal)으로 기여하는 소수의 specialized attention heads.
- Visual Retrieval Heads (VRHs): Vision-Language Models(VLMs) 내부에서 텍스트 프롬프트가 지칭하는 이미지 내 특정 시각적 영역(ground-truth referent region)을 찾아내어 모델의 생성 출력단으로 라우팅하는 데 필수적인 핵심 attention heads. 전체 헤드의 약 1.7% ~ 2.6%에 불과한 희소(sparse) 집합입니다.
- Causal Validation: 단순히 특정 토큰에 높은 attention weight가 할당된 현상(attention-correlated artifact)을 넘어, 해당 head의 출력을 실제로 마스킹(zero ablation)했을 때 타깃 태스크 성능이 붕괴하는지를 측정하여 인과적 필수성을 검증하는 절차.
- Unified Formulation of Head-Scoring: 기존의 다양한 retrieval head 탐색 기법들을 Query token set(Q), Key aggregation function(Phi), Cross-sample aggregation function(Omega)의 세 가지 축으로 일반화한 통합 수식 프레임워크.
- Delocalized Box / Fluent-but-not-factual: VRH를 ablation했을 때 모델의 출력 포맷이나 문법(syntax, JSON/box 형식)은 온전하게 유지(parse failure는 극히 낮음)되지만, 예측된 좌표가 엉뚱한 위치를 가리키거나 시각적 근거가 결여된 유창한 오답을 내놓는 현상.
- Architecturally Shared: 비전 인코더(vision encoder), 프로젝터(projector), 인스트럭션 튜닝(instruction tuning) 레시피가 전혀 다르더라도, 동일한 언어 모델 백본(LLM backbone)을 공유하는 VLM들 간에 동일한 레이어-헤드 인덱스의 VRH가 공유 및 전이(cross-model transfer)되는 특성.
Purpose of the Paper
- 기존 연구의 한계 극복:
- LLM 분야에서는 긴 문맥 내 정보 검색을 전담하는 retrieval head의 존재(causal, sparse, universal)가 입증되었으나, VLM 분야에서는 문서나 텍스트 이미지(OCR Heads, VERA)에 국한된 연구만 존재했습니다.
- 일반 자연 이미지 대상의 이전 연구(Localization Heads)는 단순히 시각적 영역에 attention이 집중되는 형상(spatial concentration)만 관찰했을 뿐, 모델의 실제 예측에 대한 인과적 필수성(causal necessity)을 증명하지 못했습니다.
- 새로운 문제 정의 및 접근 방식:
- "일반 이미지를 다루는 VLM 내부에도 텍스트 참조를 시각 영역으로 매핑하는 인과적이고, 희소하며, 보편적인 Visual Retrieval Heads가 존재하는가?"라는 핵심 질문을 던집니다.
- 지칭 영역이 좌표로 명확히 정의되는 visual grounding을 probing task로 삼고, 기존 head-scoring 방식을 단일 설계 공간으로 통일하여 가장 causal한 VRH를 정확하게 포착하는 탐색법을 제시합니다.
Key Contributions
- Unified Head-Scoring Design Space 정립 및 최적 탐색법 규명:
- 기존 LLM/VLM head-scoring 기법을 Query 토큰 선정(입력 vs. 출력), Key 집계(argmax vs. region-sum), 샘플 집계(평균 vs. 빈도)의 2의 3제곱(8가지) 설계 공간으로 정식화했습니다.
- Causal validation을 통해 **출력 예측 토큰(Q_out)**에서 **정답 바운딩 박스 영역으로의 attention 합(Phi_sum)**을 **평균(Omega_mean)**내는 조합이 가장 인과적으로 중요한 헤드를 정확히 찾아냄을 입증했습니다.
- VRH의 Causal, Sparse, Universal 특성 입증:
- 11개 VLM과 5개 visual grounding 벤치마크 전반에서 상위 20개 VRH(전체 헤드의 1.7% ~ 2.6%)만을 마스킹했을 때 그라운딩 정확도가 최대 80%p 급감함을 확인했습니다(동일 수의 random head 마스킹 시 성능 저하 미미).
- VRH의 독창적 4대 특성(Four Properties) 발견:
- Cross-task Generalization: Bounding-box 기반 grounding으로 검출했음에도, 속성(attribute), 공간 추론(spatial reasoning), 개수 세기(counting), 시각 수학(visual math) 등 7개 VQA 벤치마크에서도 동일하게 인과적 역할을 수행함을 증명했습니다.
- Functional Specificity: VRH 제거 시 텍스트/좌표 출력 형식은 유지하면서도 지칭 대상을 잘못 찾는 mislocation만 선택적으로 급증함을 밝혔습니다.
- Architectural Transferability: 언어 백본이 같다면 비전 인코더나 프로젝터가 완전히 달라도 한 VLM에서 발견한 VRH가 다른 VLM에서도 인과적 헤드로 그대로 작동함을 규명했습니다.
- Stable Detectability: 출력 토큰 중 단 1개의 토큰만 샘플링하거나, 단 5~10개의 데이터 샘플만으로도 전체 데이터셋을 사용한 것과 거의 동일한 상위 VRH를 찾아낼 수 있는 극도의 샘플 효율성을 입증했습니다.
- 다운스트림 응용 가능성 제시 (DPO 활용):
- VRH를 ablation한 모델의 출력을 negative response로 활용한 Direct Preference Optimization(DPO) 학습을 통해 VLM의 visual grounding 성능을 평균 0.78%p 향상시키는 mechanistic 최적화 방안을 제안했습니다.
Novelty
- 일반 이미지 대상 최초의 Causal Visual Retrieval Heads 발굴: 텍스트 OCR에 의존하지 않는 일반 이미지 환경에서 시각적 참조 해결(visual reference resolution)을 전담하는 attention head의 인과적 필수성을 최초로 입증했습니다.
- 언어 백본 내 재사용 가능한 회로(Reusable Circuit) 규명: VRH의 메커니즘이 멀티모달 학습 과정에서 모델마다 개별적으로 파편화되어 생기는 것이 아니라, 기본 LLM 백본 내에 이미 내재된 참조 라우팅 회로에 기반하고 있음을 교차 마스킹(cross-model masking)으로 증명했습니다.
Experimental Highlights
- Evaluation Setup:
- Models: Qwen2.5-VL-7B, Qwen3-VL-8B, InternVL3-8B, InternVL3.5-8B (상세 분석 4종) 및 Magma-8B, LLaVA-NeXT-Llama3-8B, PaliGemma2-10B, DeepSeek-VL2-Small, InternVL2.5-8B, GLM-4.6V-Flash, Phi-4-Reasoning-Vision 등 총 11종.
- Benchmarks: RefCOCO, RefCOCO+, RefCOCOg, Toloka, RefSpatialBench (Grounding 5종) 및 VAW, Spatial457, SpatialRGPT, CV-Bench, MMStar, CountBenchQA, MathVista (VQA 7종).
- 주요 정량적 결과:
- Visual Grounding 급락 (RefCOCO, k=20 기준):
- Qwen2.5-VL-7B: Baseline 86.2% -> VRH 마스킹 시 7.5% (Random 마스킹 시 86.1%)
- Qwen3-VL-8B: Baseline 91.3% -> VRH 마스킹 시 20.4% (Random 마스킹 시 91.1%)
- InternVL3-8B: Baseline 93.6% -> VRH 마스킹 시 8.8% (Random 마스킹 시 92.5%)
- InternVL3.5-8B: Baseline 90.5% -> VRH 마스킹 시 32.1% (Random 마스킹 시 88.9%)
- Cross-task Generalization (RefCOCO 헤드로 7개 VQA 평가):
- Spatial457에서 Qwen3-VL-8B는 78.2%에서 36.9%로, MathVista에서는 66.5%에서 43.0%로 대폭 하락.
- Cross-model Transferability (동일 백본 간 헤드 전이):
- Magma-8B의 상위 20개 VRH를 LLaVA-NeXT-Llama3-8B에 적용해 마스킹했을 때 정확도가 85.8%에서 5.8%로 급감(모델 자체 VRH 마스킹 시 5.0%).
- LLaVA-NeXT-8B의 VRH를 Magma-8B에 교차 적용 시 68.8%에서 0.0%로 완벽하게 붕괴.
- Head Detection Sample Efficiency:
- n=5~10개의 grounding 샘플만으로 n=200개 샘플 기준 상위 20개 헤드와 동일한 인과적 성능 저하(accuracy 7%대 도달)를 유도하는 헤드 세트를 완벽히 검출.
- Visual Grounding 급락 (RefCOCO, k=20 기준):
Limitations and Future Work
- Attention Weight 기반 분석의 해상도 한계:
- 본 연구의 attention weight scoring은 시각적 증거가 "어디에서(where)" 전달되는지를 정확히 짚어내지만, 해당 헤드가 구체적으로 "어떤 정보(what)"를 읽고 변환하는지는 온전히 설명하지 못합니다.
- Future Work: Activation patching이나 causal mediation analysis 기법을 결합하여 보다 미세한 mechanistic interpretability 분석이 필요합니다.
- 단일 이미지(Single-image) 환경에 국한:
- 제어된 실험 환경을 위해 단일 이미지 입력으로만 평가가 진행되었습니다.
- Future Work: Multi-image, Video, 그리고 텍스트와 이미지가 교차하는 Interleaved context로 VRH 분석을 확장하고, 이를 활용한 효율적인 Visual context selection이나 Multimodal KV-cache compression 기술 개발로 연결할 수 있습니다.
Overall Summary
본 논문은 Vision-Language Model(VLM)에서 텍스트가 지시하는 시각적 영역을 찾아 출력으로 전달하는 역할을 전담하는 극소수의 인과적 attention heads인 **Visual Retrieval Heads (VRHs)**를 최초로 규명했습니다. 체계적인 설계 공간 분석을 통해 출력 토큰 기반의 region-sum scoring이 VRH를 가장 정확히 찾아냄을 보였으며, 상위 20개 헤드(약 2%)를 마스킹하는 것만으로 grounding 성능이 최대 80%p 급락함을 검증했습니다. 나아가 VRH가 단순 바운딩 박스 생성을 넘어 다양한 VQA 태스크로 일반화되고, 출력 형식은 유지한 채 위치만 틀리는 기능적 특이성을 가지며, 동일 언어 백본을 공유하는 모델 간에 그대로 전이되는 보편적 언어 회로임을 밝혀내 VLM의 내부 작동 메커니즘 이해와 최적화에 중요한 이정표를 세웠습니다.
쉬운 설명
이 논문은 복잡한 멀티모달 AI 모델 내부에서 **"글로 설명된 대상을 그림 속에서 콕 집어내는 일"을 전담하는 소수의 '시각 탐색 전문 안테나(Visual Retrieval Heads)'**를 찾아낸 연구입니다.
수많은 안테나(헤드) 중 단 2%에 해당하는 이 핵심 안테나들만 전원을 꺼버리면(masking), AI는 문장 구조나 좌표 서식(예: JSON 형식)은 완벽하게 유지하면서도 엉뚱한 허공의 좌표를 말하거나(mislocation), 그림 속에 뻔히 있는 보라색 자전거를 두고 "자전거는 보이지 않는다"며 유창하게 거짓말(hallucination)을 하게 됩니다. 흥미롭게도 이 탐색 안테나는 모델의 눈(비전 인코더)이 달라도 두뇌의 기본 뼈대(LLM 백본)가 같다면 거의 동일한 위치에 존재하며, 단 5~10장의 사진만 관찰해도 모델 내에서 어느 안테나가 이 역할을 하는지 즉시 찾아낼 수 있습니다.
Retrieval Head
어텐션에서 Wo 전에 QK 로 어디를 얼마나 볼지를 정하는 스코어를 가져와서 점수가 높은 헤드들을 비주얼 리트리벌 헤드로 선정
점수가 높은 상위 헤드들이 그 토큰이 어디를 보고 있는지를 대변할 수 있으니까 그런거 같음
Visual Retrieval Heads
논문에서는 각 head가 GT bounding box 안의 visual token들에 준 attention weight의 평균 점수를 계산하고, 그 점수가 높은 head들을 VRH로
Causal Validation
체크 해보는거, 앞서 고른 상위 어텐션 꺼보고
Unified Formulation of Head-Scoring
기존에 retrieval head 탐색 기법들을 통합하는거 같은데 안중요해보임
초등학생 마냥 이런게 있었고 다 해봣더니 중요한거 알아냈다 이거
Delocalized Box / Fluent-but-not-factual
VRH 어빌레이션 했을때 실패 형태
이상한 box 찍는다거나, visual evidence 와 맞지 않는 답을 함
Architecturally Shared는 같은 LLM backbone을 쓰는 서로 다른 VLM들에서 VRH가 비슷한 위치에 나타나고, 기능도 공유된다는 뜻
VLM에도 visual information을 찾아오는 특정 attention head가 있는지 확인함
Visual grounding task를 이용해 VRH를 찾음
VRH가 실제로 중요한지 Causal Validation함
특정 모델이나 dataset에만 존재하는지 확인함
Visual grounding 외의 task에도 같은 VRH가 중요한지 확인함
RefCOCO에서 찾은 VRH를 attribute, spatial reasoning, counting, visual math 등의 VQA task에서 masking함. 여러 task에서 성능이 떨어져 VRH가 단순 bounding-box prediction용이 아니라 general visual reference resolution에 관여함을 보임.
VRH를 끄면 모델 전체가 망가지는지 확인함
VRH를 masking해도 문장이나 bounding-box 형식 자체는 유지됨. 대신 엉뚱한 위치를 고르거나 image evidence와 맞지 않는 답을 생성함. 즉 generation 능력 자체보다 visual reference 기능이 선택적으로 망가짐을 보임.
같은 LLM backbone을 쓰는 서로 다른 VLM에서도 VRH가 공유되는지 확인함
vision encoder나 projector가 달라도 같은 LLM backbone을 쓰면 비슷한 layer/head 위치에 VRH가 나타남.
좀 초등학생 같은 논문, 어텐션 장난 ...
2.5점/5점
핵심 비판은 VRH를 “GT 영역에 attention을 많이 주는 head”로 정의했지만, 실제로 어떤 visual information을 읽고 전달하는지는 보지 않았다는 점임. 따라서 masking 시 성능이 떨어져도 그 head가 곧바로 “visual retrieval mechanism”이라고 단정하긴 어려움.
또 random head와만 비교한 control이 약하고, 여러 VQA task에서 성능이 떨어진 것도 visual reference에 특화된 것인지 일반적인 multimodal routing에 중요한 것인지 분리되지 않음. 같은 backbone 모델 간 공유 결과도 “architecturally shared”보다는 same-backbone에서 보존됨 정도가 더 정확해 보임.
즉 강하게 말할 수 있는 건 GT 영역을 강하게 보고, 제거하면 성능이 크게 떨어지는 소수의 head가 존재한다는 것까지고, 이를 visual retrieval의 sparse causal mechanism이라고 부르는 건 해석이 한 단계 더 나감.
