| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | ||||
| 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 18 | 19 | 20 | 21 | 22 | 23 | 24 |
| 25 | 26 | 27 | 28 | 29 | 30 | 31 |
- \
- #삼립수박샌드 #수박샌드 #삼립신상 #삼립빵 #신상빵 #편의점신상 #편의점빵 #편의점디저트 #세븐일레븐신상 #세븐일레븐빵 #편의점간식 #신상과자리뷰 #신상리뷰 #수박맛 #수박맛빵 #수박바맛 #수박디저트 #여름간식 #여름디저트 #크림샌드 #크림카스테라 #카스테라 #빵리뷰 #간식추천 #편의점추천
- 자리의힘
- 영어학습법
- From
- deekseek
- put
- 자리
- 5형식
- TO 부정사
- #뱅크시 #뱅크시전시 #뱅크시전시회 #뱅크시서울전시 #뱅크시스틸히어 #BANKSY #BANKSYSTILLHERE #더현대뱅크시 #더현대서울뱅크시 #더현대서울전시 #더현대전시 #더현대전시회 #더현대서울ALT1 #ALT1 #현대백화점전시 #서울전시 #서울전시회 #서울전시추천 #서울전시회추천 #서울미술전시 #서울미술관 #서울가볼만한곳 #서울실내데이트 #서울데이트 #서울데이트코스 #서울데이트추천 #여의도전시 #여의도데이트 #여의도가볼만한곳 #여의도데이트코스 #
- IS
- 김원스쿨
- 딥시크
- TO
- be to 부정사
- 중국AI
- ing
- GPT
- AS
- 0528
- Into
- Today
- Total
AI바라기의 인공지능
VLM : 빠른 논문 리뷰 : Using OCR Heads to Verbalize Image Semantics 본문
용어 설명 (Terminology)
- Verbalization Heads (언어화 헤드): 원래 OCR(광학 문자 인식) 과제를 수행할 때 활성화되는 것으로 식별되었으나, 텍스트가 없는 일반 이미지 패치/토큰에 대해서도 해당 시각 영역의 고차원 semantic features를 텍스트 토큰으로 직접 변환·출력할 수 있는 특성을 가진 VLM 내부의 generic attention heads.
- Verbalization Lens (언어화 렌즈): 식별된 상위 verbalization heads의 Output-Value(OV) projection 행렬들을 선형 결합(summation)하여 만든 단일 변환 행렬 Lp. 이를 임의의 layer의 hidden state에 곱한 뒤 vocabulary space로 바로 unembedding하여 시각 표현을 언어로 디코딩하는 mechanistic interpretability 기법.
- Logit Lens: Transformer의 중간 layer hidden state를 최종 norm 및 unembedding matrix(W_U)에 직접 통과시켜 중간 단계에서 모델이 예측하는 vocabulary distribution을 확인하는 분석 기법.
- Modality Gap (모달리티 갭): 멀티모달 모델에서 비전 임베딩과 언어 임베딩이 초기 layer에서는 정렬되지 않고 서로 다른 기하학적 공간에 분리되어 존재하다가 중간/후반 layer에 도달해서야 정렬된다는 기존의 가설/현상.
- OV Matrix (Output-Value Matrix): Attention head 내부에서 value projection(W_V)과 output projection(W_O)의 곱(W_O * W_V)으로 정의되는 행렬. Head가 특정 토큰에 attention할 때 residual stream에 어떤 내용(information)을 직접 써넣는지 결정함.
- Filter Heads: LLM에서 프롬프트의 query 조건에 맞춰 이전 context 내의 특정 조건에 맞는 항목을 검색/선택하는 역할을 수행하는 attention heads. 본 논문에서는 filter head가 visual fine-tuning을 거쳐 verbalization head로 진화했을 가능성을 제시함.
- Gaze Heads: VLM이 이미지 캡셔닝 등의 텍스트를 생성할 때 현재 자신이 서술하고 있는 이미지의 공간적 위치를 추적하며 바라보는 attention heads.
Purpose of the Paper
- 기존 연구의 한계 극복:
- 기존 연구들은 VLM 내부에서 이미지 표현이 언어 공간과 정렬되는 시점이 중간 layer 이후라고 주장하며 초기 layer에서의 심각한 'modality gap'을 지적함.
- 표준 logit lens는 VLM의 초기·중간 layer 시각 hidden state에 적용했을 때 극심한 노이즈와 의미 없는 토큰만을 출력하여 초기 표현의 해석이 불가능했음.
- 자연 이미지는 한 패치에 대해서도 'bird', 'wing', 'feather' 등 다의적 레이블이 가능해 visual-to-language 매핑 메커니즘을 엄밀한 causal level에서 추적하기 어려웠음.
- 새로운 문제 정의 및 접근 방식:
- 입력 텍스트와 출력 토큰이 1:1로 명확히 대응되는 'OCR'이라는 좁고 통제된 과제를 교두보로 삼아 visual token을 language token으로 변환하는 핵심 attention heads를 분리.
- 이 헤드들이 실제로는 텍스트뿐만 아니라 일반 자연물 시각 토큰까지 언어화하는 범용 'verbalization heads'임을 규명하고, 이를 단일 행렬 변환(verbalization lens)으로 압축하여 layer 0부터 시각 표상이 언어 공간과 완벽히 정렬되어 있음을 입증.
Key Contributions & Novelty
- OCR 전담 헤드가 아닌 범용 'Verbalization Heads'의 발견 (Novelty: High)
- OCR 과제에서 정답 단어를 residual stream으로 끌어오는 데 인과적으로 필수적인 attention heads(전체 헤드의 상위 약 10%)를 식별함.
- 이 헤드들의 attention map을 강제로 텍스트가 없는 영역(예: 새의 날개)으로 redirection하면 'feathers' 같은 해당 시각 영역의 semantic token이 직접 출력됨을 최초로 발견.
- 단일 선형 행렬 기반 'Verbalization Lens' 구축 (Novelty: Methodological)
- 식별된 상위 verbalization heads의 OV 행렬을 합산하여 단일 projection 행렬 Lp를 정의(Lp = sum(W_O * W_V)).
- 각 패치마다 forward pass를 다시 수행할 필요 없이, 단 두 번의 행렬 곱(Lp 곱셈 후 W_U unembedding)만으로 모든 layer(특히 layer 0)의 시각 토큰을 vocabulary probability로 실시간 디코딩하는 분석 툴을 제안.
- 초기 Layer의 Modality Alignment 규명 (Novelty: Conceptual Discovery)
- 기존 학설과 달리, 이미지 인코더에서 언어 디코더로 넘어오는 최초 시점(layer 0)부터 시각 표현 내부에 이미 언어적 의미 정보가 완전히 정렬되어 있음을 정량적·정성적으로 증명.
- Low-Rank Pseudo-Inverse를 이용한 인과적 잠재 이미지 편집 (Novelty: High)
- 단순 관찰에 그치지 않고, Lp의 low-rank pseudo-inverse(L_p,k^+)를 활용해 특정 개념 벡터(v_c = L_p,k^+ * u_c)를 계산.
- 모델 activation 내에서 특정 시각 개념(예: ant, tractor)을 제거하고 새로운 개념(예: iPod, revolver)을 주입하여 캡션 서술을 정밀하게 변형시키는 causal editing 기법 제시.
Experimental Highlights
- 실험 대상 모델 및 데이터셋:
- Models: Qwen3-VL-2B, Qwen3-VL-8B, Molmo2-O-7B, Llava-Next-34B (다양한 크기 및 아키텍처 포괄).
- Datasets: 합성 OCR Dataset(ImageNet 배경 위 단어 합성), MS-COCO 2014 Validation split, ImageNet 1k.
- OCR Attention Heads의 인과적 중요성 검증 (Ablation):
- OCR score 상위 10%의 attention heads를 mean-ablation했을 때, 4개 모델 전반에서 OCR task accuracy가 0으로 완전 붕괴(random late-layer heads ablation 대비 현저한 급락 확인).
- 초기 Layer Object Confidence 판별 성능:
- MS-COCO 단일 토큰 클래스 분류에서, Layer 0 기준 Raw Logit Lens는 객체 존재 여부에 따른 확률 차이(P(o)_with - P(o)_without)가 거의 0에 수렴한 반면, Verbalization Lens는 Layer 0부터 압도적으로 높은 확률 차이를 기록하며 전 layer에 걸쳐 완벽에 가까운 ROC-AUC를 달성.
- Token-Level Object Localization (COCO 2014 Val 512장, 1216 pairs):
- Qwen3-VL-8B: Raw Logit Lens (mIoU 0.161 / mAP 0.374) -> Verbalization Lens (mIoU 0.190 / mAP 0.407).
- Qwen3-VL-2B: Raw Logit Lens (mIoU 0.223 / mAP 0.462) -> Verbalization Lens (mIoU 0.249 / mAP 0.463).
- '핸드폰'과 '유선 전화기'가 공존하는 이미지에서 중국어 단어 '手机(휴대폰)'는 휴대폰 패치만, '电话(전화기)'는 유선 전화 패치만 정밀하게 localize하는 언어적 민감도를 입증.
- LatentLens 대비 해석 가능성 우위:
- GPT-5 기반 LLM-judge 평가에서 모든 모델에 걸쳐 동등 이상의 해석 가능성을 보였으며, 특히 기존 LatentLens가 초기·중간 layer에서 급격한 성능 저하를 보였던 Llava-Next-34B의 경우 평균 40.5 point 대폭 상승.
- Activation Editing 결과:
- Lp 에너지의 60%를 설명하는 rank k와 scaling factor alpha = 4~5 수준에서 ImageNet 256장 편집 평가 시 Coherence(문법/자연스러움) 9점 이상을 유지하면서 기존 객체는 완벽히 제거(Prevalence drop)되고 목표 객체가 주입됨.
- 트랙터 이미지에서 트랙터를 리볼버로 치환 시, 바퀴·번호판·운전자 등 배경 맥락과 결합하여 "실물 크기 클래식 카 형태로 개조된 초현실적 리볼버"라는 정교한 캡션을 생성함.
Limitations and Future Work
- Spatial Localization 수치의 전반적 한계:
- mIoU 수치(0.19~0.24)가 절대적으로 높지 않음. 이는 VLM이 register tokens와 같이 임의의 위치 토큰에 이미지 전체의 global semantic 정보를 분산 저장하는 아키텍처적 특성에서 기인함. 향후 global feature와 spatial feature를 분리하여 디코딩하는 기법 연구가 필요함.
- Single-Token Concepts 의존성:
- 개념 치환 및 단어 디코딩이 단일 vocabulary token으로 매핑되는 단어에 집중되어 있음. 실세계의 복잡한 다중 토큰(multi-token) 어휘나 구문 수준의 semantic editing으로 확장하는 연구가 요구됨.
- Lp 행렬 역행렬 계산 시의 노이즈 민감도:
- Lp 행렬의 고유값 꼬리(singular values tail)가 매우 작아 완전 역행렬(full inverse) 사용 시 수치적 폭발이 발생하여 휴리스틱한 low-rank pseudo-inverse(에너지 60% threshold)에 의존해야 함. 보다 안정적인 역투영 최적화 기법이 탐색되어야 함.
- Multi-head 메커니즘의 근원적 형성 과정 미규명:
- 사전 학습된 filter heads나 gaze heads가 비전 튜닝 과정에서 구체적으로 어떤 기전으로 verbalization heads로 전이되는지에 대한 훈련 역학(training dynamics) 분석이 추후 과제로 남아 있음.
Overall Summary
본 논문은 VLM이 텍스트를 읽는 OCR 메커니즘을 탐구하는 과정에서, OCR을 담당하는 attention heads가 실제로는 이미지 내 모든 패치의 시각적 특징을 언어로 변환하는 범용 Verbalization Heads임을 규명했습니다. 연구진은 이 헤드들의 가중치를 결합한 Verbalization Lens를 개발하여, 기존 logit lens로는 볼 수 없었던 layer 0(최초 레이어) 단계부터 시각 표현이 이미 언어 공간에 완벽히 정렬되어 있음을 입증했습니다. 나아가 이 변환의 pseudo-inverse를 이용해 이미지의 latent space 상에서 특정 개념을 다른 사물로 정밀하게 치환하는 causal editing까지 성공시킴으로써, 좁은 특정 기능(OCR) 분석이 거대 멀티모달 모델의 보편적 내부 메커니즘을 규명하는 핵심 열쇠가 될 수 있음을 증명했습니다.
쉬운 설명
이 논문의 핵심 아이디어는 **"외국어 간판만 전문적으로 번역하는 줄 알았던 특수 번역기(OCR 헤드)를 가져와 사물에 비춰봤더니, 사실 세상 모든 사물을 텍스트로 읽어낼 수 있는 만능 번역기였다"**는 발견입니다.
원래 VLM이 그림 속 글자('bike')를 읽을 때 사용하는 특정 두뇌 부위(헤드)를 찾아낸 뒤, 그 부위의 시선을 글자가 아닌 새의 날개나 나무로 억지로 돌려보았더니 모델이 'feathers(깃털)', 'branch(나뭇가지)'라는 단어를 술술 뱉어냈습니다. 연구진은 이 '만능 번역 회로'를 하나의 렌즈 안경(Verbalization Lens)으로 압축하여 모델의 가장 첫 단계(Layer 0) 뇌세포에 씌워주었습니다. 그 결과, 기존에는 뒤죽박죽 외계어로 보이던 초기 시각 데이터가 모델 내부로 들어오자마자 이미 언어로 완벽히 정리되어 있었다는 사실을 밝혀냈습니다. 심지어 이 번역 과정을 거꾸로 되돌려 개미 사진 속의 '개미' 생각만 쏙 빼내고 '아이팟' 생각을 밀어 넣었더니, 모델이 사진 속 개미의 색깔과 형태를 그대로 유지한 채 "나뭇가지에 놓인 아이팟"으로 인식하고 설명하게 만드는 마법 같은 편집까지 가능해졌습니다.
목적
프롬프트와 이미지 한장 주고 ocr 하는게 태스크임.
프롬프트랑 이미지가 토큰화 될거고 각 토큰 별로 헤드가 있을거임. 그래서 ocr 스코어 까지 뽑앗다고 치자.
그럼 A 세트에서 스코어가 죽 나옴
B 세트 입력해보고 스코어를 쭉 뽑음.
근데 프롬프트는 고정이고 이미지 사이즈도 같다면 토큰별로 헤드 자리는 동일
Verbalization Heads
Z뽑고 Zwo 뽑고 로짓 렌즈로 보캡 로짓 뽑음. 그걸 소프트 맥스 통과 후 확률 값들이 나오는데 거기서 정답단어확률만 봄
근데 이미지 한장만 보는게 아니라 여러장 쭉 뽑아서 평균 냄
Verbalization Lens
헤드마다 WoWv 뽑아서 곱해서 다 더해줌. 그리고 약간 공통 OV를 만든 셈인데 그걸로 토큰을 읽으면 어떤 의미인지 대충 파악
Modality Gap
기존엔 초반엔 텍스트랑 이미지 리프레젠테이션이 다르다고 햇는데 해당 연구에서 보니 크지 않을 수 있다 고 함
Filter Heads
질문에 따라 어딜 볼지가 달라짐 QK 를 봄
Gaze Heads
얘도 QK 봄 생성중인거 기준
목적
VLM이 이미지의 visual representation을 어떻게 language/semantic representation으로 연결하는지 내부 메커니즘을 밝히는 것
그걸 ocr 에서 어텐션으로 밝혀보고자 함
방법
OCR에 관여하는 attention head 찾기, 모델이 그 단어를 출력하기 직전 final token position에서 모든 attention head를 하나씩봄
여러 이미지에 대해서 평균내서 head별 OCR score를 만들고
모델의 모든 attention head 중에서, OCR 정답 단어를 특히 강하게 지지하는 head들을 찾아 ranking함.
그리고 제거해보고 성능 떨어지나 확인 상위 10% 제거 하면 많이 떨어진다고함.
prompt를 바꿔서
What is the animal in this image? 같이 물으면 프롬프트에 따라 관련 토큰으로 어텐션을 옮기는 것을 확인함.
그래서 찾은 head들의 WoWv를 전부 합쳐서 공용 OV를 만듬. 그걸로 이미지를 보면 어떤 정보를 가져올지 알 수 있지않을까 함.
구름 있는 token → cloud
PATHWAY 글자가 있는 token → pathway
하늘 쪽 token → sky
헤드를 쓰긴써야함
2점/5점
너무뻔한 방법론. 뭐가 참신한지 잘 모르겠음.
더 컴팩트 하게 일침 느낌으로
신기한 현상은 찾았는데, 방법론은 거의 기존 MI 툴체인 재조합
. OCR로 head 찾고 → ablation하고 → OV 합쳐 lens 만들고 → decode/steering하는데, 정작
QK는 버린 채 만든 lens로 layer 0이 읽힌다고 초기부터 language-aligned까지 가는 건 해석이 한 발 과함
