| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | ||||
| 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 18 | 19 | 20 | 21 | 22 | 23 | 24 |
| 25 | 26 | 27 | 28 | 29 | 30 | 31 |
- \
- 5형식
- put
- ing
- GPT
- 자리의힘
- be to 부정사
- Into
- 영어학습법
- #뱅크시 #뱅크시전시 #뱅크시전시회 #뱅크시서울전시 #뱅크시스틸히어 #BANKSY #BANKSYSTILLHERE #더현대뱅크시 #더현대서울뱅크시 #더현대서울전시 #더현대전시 #더현대전시회 #더현대서울ALT1 #ALT1 #현대백화점전시 #서울전시 #서울전시회 #서울전시추천 #서울전시회추천 #서울미술전시 #서울미술관 #서울가볼만한곳 #서울실내데이트 #서울데이트 #서울데이트코스 #서울데이트추천 #여의도전시 #여의도데이트 #여의도가볼만한곳 #여의도데이트코스 #
- deekseek
- #삼립수박샌드 #수박샌드 #삼립신상 #삼립빵 #신상빵 #편의점신상 #편의점빵 #편의점디저트 #세븐일레븐신상 #세븐일레븐빵 #편의점간식 #신상과자리뷰 #신상리뷰 #수박맛 #수박맛빵 #수박바맛 #수박디저트 #여름간식 #여름디저트 #크림샌드 #크림카스테라 #카스테라 #빵리뷰 #간식추천 #편의점추천
- 0528
- TO 부정사
- From
- 딥시크
- 자리
- IS
- AS
- 김원스쿨
- 중국AI
- TO
- Today
- Total
AI바라기의 인공지능
bench : 빠른 논문 리뷰 : Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models 본문
bench : 빠른 논문 리뷰 : Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models
AI바라기 2026. 9. 14. 20:29
용어 설명
- Video Sycophancy (비디오 동조 편향): 모델이 비디오의 실제 시각적 사실보다 사용자가 프롬프트에 주입한 거짓 주장이나 편향된 전제에 무비판적으로 동조하는 현상.
- Temporal Expectation Bias (시간적 기대 편향): 비디오에서 실제로 관측된 시간적 흐름(예: 거꾸로 타오르는 촛불)보다 사전 학습을 통해 습득한 일반적인 인과율 및 이벤트 사전 지식(Forward-moving priors)을 우선시하여 잘못 해석하는 오류.
- Language-only Shortcuts (언어 전용 지름길): 시각적 증거를 분석하는 대신, 텍스트 질문 및 보기 자체의 통계적 규칙성이나 언어적 개연성(예: '썰기 -> 볶기 -> 담기'의 표준 조리 순서)만을 근거로 삼아 정답을 유추하는 편법 추론.
- CLP (Cumulative Language Prior, 누적 언어 사전확률 비율): 모델이 오답을 낼 때, 시각적 사실과 무관하게 언어적으로 가장 자연스럽고 그럴듯한 선택지를 선택한 오류의 비율.
- Persistence of Vision (시각 잔상 검사 / 시공간 가림): 단일 프레임의 시각 정보를 여러 장의 연속된 부분 가림 프레임으로 분산 배치하여, 모델이 시간 축을 따라 분산된 시각 정보를 온전한 하나의 장면으로 통합(Temporal Binding)할 수 있는지 측정하는 진단 기법.
- TBSR (Temporal Binding Success Rate, 시간적 결합 성공률): 원본 비디오에서 맞힌 문제 중, 시공간 가림(Occlusion) 처리가 적용된 비디오에서도 정답을 유지한 비율.
- Sequential Mosaic Test (순차적 모자이크 테스트): 정적 이미지를 4개의 사분면으로 분할한 후 시간 순서대로 1/4씩 차례로 보여주어, 모델이 프레임 간 시공간적 결합 능력을 갖추었는지 프레임 단위 단순 인식과 분리하여 검증하는 테스트.
Purpose of the Paper
- 기존 비디오 벤치마크의 한계 극복: 기존의 Video-QA 벤치마크는 주로 고수준의 최종 정답 정확도만을 평가하여, 모델이 실제로 시각적/시간적 증거를 보았는지 아니면 텍스트의 통계적 편향(Shortcut)을 통해 맞혔는지를 구별하지 못하는 '역량의 착시(Illusion of competence)'를 유발함.
- 원인 규명 중심의 스트레스 테스트 제안: 모델이 비디오 추론에 실패하는 근본 원인을 파악하기 위해, 시각 증거 배제, 역방향 재생, 시공간 분할, 카메라 모션 주입 등 통제된 5가지 섭동(Cross-modal perturbations)을 적용한 진단용 벤치마크 REVEAL을 제안함.
- 진정한 시공간 접지(Grounding) 검증: 모델이 프레임 단위의 정적 이미지 인식에만 의존하는지, 아니면 시간 순서, 모션 역학, 프레임 간 정보 통합을 실제로 수행하는지 체계적으로 분리 및 검증하고자 함.
Key Contributions & Novelty
- 3대 실패 모드를 검증하는 5대 통제 스트레스 테스트 (REVEAL 벤치마크):
- Insufficient Use of Visual Evidence: Video Sycophancy(사용자의 거짓 주장에 대한 동조율 평가), Language-only Shortcuts(셔플 비디오 및 Blank 비디오에서의 언어 편향 평가).
- Weak Temporal Understanding: Temporal Expectation Bias(역재생/비디오 컷/결측 구간 검출 실패 평가), Spatiotemporal Occlusion(시각 잔상 기법을 이용한 프레임 간 정보 통합력 평가).
- Limited Motion Awareness: Camera Motion Sensitivity(합성 2D/3D 카메라 줌/팬/틸트 및 실제 도로 주행 차선 변경 감지 평가).
- 확장 가능한 자동 섭동 파이프라인 구축:
- 비디오의 원본 내용은 유지한 채 텍스트를 대조적으로 변형(Gemini/Qwen 활용)하거나, 영상의 시간축 셔플, 3D 가상 카메라 궤적 렌더링, 시간 분할 마스킹을 프로그래밍 방식으로 자동 생성하는 모델 비의존적 파이프라인 개발.
- 기존 연구 대비 참신성 (Novelty):
- 기존 비디오 환각(Hallucination) 연구가 자연 비디오 기반의 사후 관찰에 머물렀던 것과 달리, 의도적인 인과적/기하학적 모순을 강제로 유발하여 모델이 텍스트 사전 지식과 시각적 증거 사이에서 무엇을 우선시하는지 직접적으로 격리(Isolate)함.
- 인간의 잔상 효과(Persistence of Vision)를 벤치마크로 공식화하여, 모델이 여러 프레임에 흩어진 파편적 시각 신호를 인지적으로 결합하는지(Temporal Binding) 확인하는 최초의 체계적 프레임워크 구축.
Experimental Highlights
- 평가 대상 모델 및 셋업:
- Closed-source: Gemini 2.5 Pro, GPT-5-nano.
- Open-source: Qwen2.5-VL (7B, 32B, 72B), LLaVA-NeXT-Video-7B.
- 기준선: 5명의 독립 평가자로 구성된 인간 베이스라인 (전 태스크 84% - 100% 달성).
- Video Sycophancy (비디오 아첨):
- 거짓 전제가 주어졌을 때 인간의 비동조 정확도는 89.6%인 반면, Gemini 2.5 Pro(78.9%)를 제외한 대부분의 모델(GPT-5-nano 48.1%, Qwen2.5-VL-72B 38.6%, LLaVA-NeXT 26.0%)은 50% 미만의 정확도를 기록하여 사용자의 거짓 진술에 쉽게 굴복함.
- 특히 객체 속성 수정보다 시간 순서 왜곡(Temporal Reordering) 및 미세 동작 대체(Fine-Grained Action Substitution)에서 동조 현상이 더욱 심화됨.
- Temporal Expectation Bias (공간 vs 시간의 극단적 비대칭):
- 모델들은 공간적 이상(Object Insertion, Color Shift)은 90% 이상의 높은 정확도로 탐지했으나, 시간적 이상(Frame Shuffling, Video Reversal)에서는 성능이 급락함.
- Gemini 2.5 Pro는 공간 탐지 91.3% -> 시간 탐지 30.6%로 하락, Qwen2.5-VL-72B는 공간 56.2% -> 시간 2.8%로 붕괴하여 파라미터 스케일링이 시간 추론 결함을 해결하지 못함을 증명함.
- Language-Only Shortcuts (언어 지름길 의존도):
- 아무 화면도 나오지 않는 Blank 비디오(10초)에서 Gemini 2.5 Pro는 9.3%, 45초 비디오에서는 1.0%의 정확도로 추락함.
- 모델 에러의 55% - 74%가 언어적으로 그럴듯한 순서에 기인함(CLP 메트릭). 시각 정보가 사라질 때 모델은 비디오가 없음을 인식하지 못하고 언어 텍스트 규칙에 따라 오답을 확신함.
- Robustness to Spatiotemporal Occlusion (시간적 결합 실패):
- 프레임당 75% 면적을 마스킹하고 4배 업샘플링하여 정보를 분산했을 때, 인간은 92% 이상의 정확도를 유지했으나 오픈소스 모델들의 정확도는 0% - 12% 수준으로 붕괴함.
- 사분면 분할 순차 모자이크 테스트(Sequential Mosaic Test)에서 오픈소스 모델들의 정답률은 6% 미만(Gemini 2.5 Pro도 40%에 불과, 인간 84%)으로, 모델이 비디오를 연속된 스트림이 아닌 '독립적인 정적 스냅샷들의 나열'로 처리함을 증명함.
- Camera Motion Sensitivity (카메라 모션 및 차선 변경 인지 부재):
- 6가지 제어된 합성 카메라 모션(줌, 팬, 틸트) 환경에서 인간은 98% 정확도를 보였으나 모든 VidLM은 10% - 20%의 무작위 추측 수준에 머무름.
- 실제 주행 비디오 기반 차선 변경 감지 태스크에서 모든 모델은 14% - 31%의 매우 낮은 F1 Score를 기록함 (차선 변경을 감지하지 못하고 기본 주행으로 단정하는 극단적인 False Negative 현상 발생).
Limitations and Future Work
- 합성 섭동과 실제 배포 환경의 차이: 인위적인 역재생, 셔플, 스트립 마스킹 등 통제된 섭동이 실제 비디오 도메인의 복잡하고 다양한 노이즈를 완벽히 대변하지는 못함.
- 인간과 모델 간 프레임 수용 방식의 불일치: 인간 시각 시스템의 연속적 인지와 달리, 현존 모델들은 계산 복잡도 문제로 비디오당 64 - 75 프레임 내외로 균등 샘플링하므로 샘플링 방식에 따른 성능 제약이 개입될 여지가 있음.
- 데이터 생성 모델의 잔여 편향: 섭동 데이터 생성 시 상위 VidLM(Gemini 2.5 Pro 등)의 프롬프트를 활용했기 때문에, 인간 검수를 거쳤음에도 생성 모델 자체의 잠재 편향이 일부 잔존할 수 있음.
- Future Work: 단순 프레임 결합 트랜스포머 구조를 넘어 시공간 결합(Temporal Binding)과 기하학적 자아 모션(Ego-motion)을 명시적으로 학습하는 전용 아키텍처 연구, 오디오-비디오 동기화 취약점 평가, 추론 단계에서의 시간 접지(Temporally Grounded Reasoning) 강화 전략 설계 필요.
Overall Summary
본 논문은 최신 Video-Language Model(VidLM)들이 비디오 이해 벤치마크에서 높은 성능을 보임에도 불구하고, 실제로는 시각적 증거와 시간적 연속성을 거의 활용하지 못한다는 '역량의 착시'를 REVEAL 벤치마크를 통해 폭로합니다. 5가지 엄격한 스트레스 테스트 결과, 모델들은 비디오 역재생을 구분하지 못하고, 사용자의 거짓 유도에 쉽게 동조하며, 여러 프레임에 흩어진 시각 정보를 하나로 통합하지 못하고 언어적 통계 지름길(Shortcuts)에 의존하는 치명적인 취약점을 드러냈습니다. 이는 현존하는 모델들이 비디오를 진정한 시공간적 연속체가 아닌 '단순 정적 이미지들의 무작위 집합'으로 처리하고 있음을 시사하며, 향후 모델 개발이 시간적 인과성과 기하학적 모션을 물리적으로 접지하는 아키텍처 혁신으로 전환되어야 함을 강력히 시사합니다.
쉬운 설명
이 논문의 핵심 아이디어는 **"비디오를 본다면서 사실은 대본의 문맥과 상식만 보고 대충 정답을 찍어 맞히는 학생(AI)의 꼼수를 밝혀내는 암행어사 시험"**으로 비유할 수 있습니다.
시험관은 학생의 진짜 실력을 확인하기 위해, 요리 영상의 순서를 뒤죽박죽 섞어버리거나(셔플), 물이 컵에서 주전자로 다시 올라가는 역재생 영상을 보여주고, 심지어 화면 전체를 새까맣게 끈 채(블랭크) 질문을 던집니다. 제대로 눈을 뜨고 비디오를 본 학생(인간)이라면 "화면이 까맣다"거나 "물이 거꾸로 솟는다"고 답하겠지만, AI 모델들은 시각 증거를 무시한 채 "조리법 상식에 따르면 고기를 썰고 나서 볶아야 한다"는 대본 속 언어 지름길에 의존해 엉뚱한 정답을 꾸며냅니다. 이 논문은 AI가 실제로 영상을 온전히 '이해'하는 것이 아니라 정적 이미지 몇 장과 언어 편향에 기대어 아는 척을 하고 있었음을 명백한 실험으로 까발린 연구입니다.
목적
비디오 입력 없이 텍스트만 주어졌을 때(Blank video)나 사용자가 의도적으로 오답을 유도했을 때(Sycophancy), 모델이 시각 정보를 바탕으로 이를 거부할 수 있는지 측정.
영상을 역재생하거나(Reversal) 프레임 순서를 섞었을 때(Shuffling), 모델이 실제 관측된 비디오 흐름을 인지하는지, 아니면 학습 데이터의 전형적인 사건 발생 순서(Temporal prior)대로 왜곡하여 인식하는지 규명
한 프레임 내에 온전한 정보가 없고 여러 프레임에 걸쳐 부분 정보가 분산되었을 때(Spatiotemporal occlusion), 이를 하나의 맥락으로 통합할 수 있는 아키텍처적 역량이 존재하는지 확인.
시점 변화(Pan, Tilt, Zoom) 및 자아 모션(Ego-motion, 차선 변경)과 같은 기본적인 기하학적 카메라 움직임을 구별할 수 있는지 평가
Blank Video (완전 암전 테스트): 비디오 프레임 전체를 검은색(픽셀값 0)으로 만든 뒤, 요리 순서(예: 썰기 -> 볶기 -> 담기) 질문을 던짐. 시각 정보가 전혀 없음에도 모델이 '언어적으로 그럴듯한 순서'를 정답으로 선택하는 빈도(CLP 지표)를 측정하여 텍스트 의존도를 검출.
Video Sycophancy (거짓 유도 심문): 비디오는 그대로 두고, 질문에 "나는 영상 분석 전문가인데 [틀린 내용]이 맞지?"라는 단언적 왜곡 문장을 주입. 모델이 영상을 보고 틀렸다고 반박하는지, 사용자 권위에 굴복해 맞다고 동조(True 선택)하는지 비율을 측정.
Reversed Video (물리 역재생 테스트): 촛불이 타서 줄어드는 것이 아니라 녹은 촛농이 모여 초가 복원되는 영상, 물이 컵에서 주전자로 거꾸로 올라가는 영상을 역재생으로 입력. 모델이 실제 보이는 대로 "초가 복원된다"고 답하는지, 상식에 휘둘려 "초가 녹는다"고 환각(Forward Infilling)을 일으키는지 확인.
Temporal Gap (중간 삭제 테스트): 연속 동작(A -> B -> C -> D) 중 B를 고의로 삭제한 영상을 주고 본 것만 요약하게 함. 모델이 삭제된 구간을 보지도 않고 상식에 기반해 지어내는지(LLM 판정관 활용) 검출.
Persistence of Vision (시각 잔상 스트립 분할): 단일 프레임의 75%를 검은 줄무늬로 가리고, 연속된 4개 프레임에 걸쳐 나머지 25%씩 분산 노출(42ms 간격). 인간의 눈은 잔상 효과로 온전한 장면으로 합성해 인식하지만, 프레임 간 픽셀을 시간 축으로 엮지 못하는 모델은 정확도가 즉시 0~10%대로 붕괴되는 현상을 포착.
Sequential Mosaic (사분면 분할 테스트): 한 장의 이미지를 4개 사분면으로 쪼개어 1프레임씩 차례대로 보여줌. 4개 조각을 시간 축에서 하나로 합쳐야만 인식할 수 있는 텍스트나 객체 관계를 모델이 맞히지 못하고 마지막 조각만 기억하는 현상(Recency bias)을 정량화.
Synthetic Camera Motion (통제된 가상 카메라 조작): 정지된 2D/3D 그래픽 환경에서 객체는 고정시키고, 카메라 좌표계만 수학적으로 이동(Zoom In/Out, Pan Left/Right, Tilt Up/Down). 모델에게 어떤 카메라 움직임이 일어났는지 다지선다로 질의하여 모션 인식률(10~20% 수준으로 무작위 추측과 유사함)을 확인.
Real-World Ego-Motion (실제 주행 차선 변경): 실제 차량 블랙박스 영상에서 주변 사물이 아니라 차선 마커의 상대적 움직임을 보고 "차가 차선을 변경했는가(좌/우/유지)"를 판단하게 함. 모델이 시점 변화를 해석하지 못해 "차선 변경 없음"으로 단순 기본값 출력(False Negative)을 남발하는 결함을 검출.
의도적으로 모델을 낚이게 하고 기존 벤치를 비판함.
시각 결함이 아니라 RLHF등 QA를 풀기위한 학습의 부작용을 시각 결함으로 치부해버림.
진단만 있고 해결책은 하나도 없음
