Notice
Recent Posts
Recent Comments
Link
| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
Tags
- From
- TO
- 중국AI
- 자리의힘
- be to 부정사
- 5형식
- \
- put
- TO 부정사
- deekseek
- ing
- #뱅크시 #뱅크시전시 #뱅크시전시회 #뱅크시서울전시 #뱅크시스틸히어 #BANKSY #BANKSYSTILLHERE #더현대뱅크시 #더현대서울뱅크시 #더현대서울전시 #더현대전시 #더현대전시회 #더현대서울ALT1 #ALT1 #현대백화점전시 #서울전시 #서울전시회 #서울전시추천 #서울전시회추천 #서울미술전시 #서울미술관 #서울가볼만한곳 #서울실내데이트 #서울데이트 #서울데이트코스 #서울데이트추천 #여의도전시 #여의도데이트 #여의도가볼만한곳 #여의도데이트코스 #
- 김원스쿨
- 딥시크
- 자리
- 0528
- IS
- #삼립수박샌드 #수박샌드 #삼립신상 #삼립빵 #신상빵 #편의점신상 #편의점빵 #편의점디저트 #세븐일레븐신상 #세븐일레븐빵 #편의점간식 #신상과자리뷰 #신상리뷰 #수박맛 #수박맛빵 #수박바맛 #수박디저트 #여름간식 #여름디저트 #크림샌드 #크림카스테라 #카스테라 #빵리뷰 #간식추천 #편의점추천
- Into
- GPT
- AS
- 영어학습법
Archives
- Today
- Total
AI바라기의 인공지능
bench : 빠른 논문 리뷰 : LVBench: An Extreme Long Video Understanding Benchmark 본문
논문리뷰
bench : 빠른 논문 리뷰 : LVBench: An Extreme Long Video Understanding Benchmark
AI바라기 2026. 9. 2. 16:19
용어 설명 (Terminology)
- LVBench (Long Video Benchmark): 평균 약 68분(4,101초) 길이의 초장구간 비디오 이해 능력을 종합적으로 평가하기 위해 설계된 멀티모달 벤치마크 데이터셋입니다.
- Clue Duration: 질문에 정확히 답하기 위해 반드시 확인해야 하는 비디오 내 최소한의 핵심 시간 구간(Start & End timestamps)을 의미합니다.
- Modality Independence: 오디오 정보 없이도 오직 시각적 프레임(Visual channel) 정보만으로 정답을 유추할 수 있도록 데이터셋을 설계한 원칙입니다.
- Text-only Bias Filter (Visuals-agnostic Filter): 텍스트 전용 LLM(GLM-4, GPT-4)에 비디오 없이 질문과 선택지만 입력했을 때 정답을 맞히는 문항을 사전에 제거하여, 시각 정보 없이 언어적 편향만으로 문제를 푸는 현상을 방지하는 필터링 기법입니다.
- Native Long Video Support Models: 별도의 고정 프레임 샘플링(예: 32/96 프레임) 압축 없이, 긴 시퀀스/메모리 구조나 초장구간 Context window를 통해 1 FPS 등의 고밀도 비디오 입력을 직접 처리할 수 있도록 설계된 모델군입니다.
Purpose of the Paper
- 기존 연구의 한계 극복: 기존 비디오 벤치마크(Video-MME, MovieChat, MoVQA 등)는 평균 비디오 길이가 10분 내외에 불과하여, 수 시간 단위의 장기 기억(Long-term memory)과 복합적인 시간적 인과 추론(Temporal reasoning)을 평가하기에 턱없이 부족했습니다.
- 초장구간 비디오 벤치마크 구축: 평균 4,101초(약 68분, 기존 대비 약 4배 길이)의 고화질 비디오 103개와 1,549개의 고품질 QA 세트를 구축하여, 실제 환경(영화 분석, 스포츠 중계, 장기 의사결정 등)에서 요구되는 극단적인 장기 비디오 이해 성능을 체계적으로 검증하고자 했습니다.
- 순수 시각 추론 평가 체계 제시: 텍스트 편향 및 시간 프롬프트 편향을 엄격히 제거하여 오직 비디오 프레임 내 시각적 단서 탐색과 추론 능력만으로 승부하는 평가 환경을 제공합니다.
Key Contributions & Novelty
- 초장구간 고품질 데이터셋 구축:
- 6개 도메인(Sports, Documentary, Event Record, Lifestyle, TV Show, Cartoon)에서 30분 이상, 720p 이상의 비디오 117시간 분량을 엄선했습니다.
- 5분당 최소 1개 이상의 주요 이벤트가 발생하는 Event Density 및 일관된 서사 구조를 기준으로 필터링했습니다.
- 6가지 핵심 역량의 조합적 체계 (26개 복합 질문 유형):
- 6개 Core Capabilities: Entity Recognition (ER), Event Understanding (EU), Key Information Retrieval (KIR), Temporal Grounding (TG), Reasoning (Rea), Summarization (Sum).
- 단일 능력 평가에 그치지 않고, 능력들을 다층 결합하여 총 26가지 세부 복합 질문 유형을 생성함으로써 정밀한 다차원 평가를 가능하게 했습니다.
- 엄격한 데이터 정제 파이프라인 (Text Bias 제거 & Clue Duration 주석):
- LLM(GLM-4, GPT-4)이 텍스트만으로 정답을 맞히는 문제를 전수 제거하여 시각 정보 의존도를 보증했습니다.
- 모든 질문마다 정답 도출에 필요한 최소 영상 구간인 Clue Duration을 수동 라벨링하여 세부 분석 지표를 제공합니다.
- 26종 MLLM 대상의 대규모 벤치마킹 및 실패 원인 규명:
- Non-native 모델 13종과 Native long-video 모델 13종을 비교 분석하여 오픈소스와 상용 모델 간의 격차 및 긴 컨텍스트에서의 Instruction Following 실패 원인을 실증했습니다.
Experimental Highlights
- Human 대비 MLLM의 극심한 성능 격차:
- Human: 평균 94.4% 의 높은 정확도를 기록했습니다.
- Gemini-2.5-Pro: 전체 모델 중 67.4% 로 State-of-the-art(SOTA)를 달성했으며, 6개 핵심 능력 중 5개 영역(EU, KIR, TG, Rea, Sum)에서 1위를 차지했습니다.
- 인간과 최상위 모델 간에 여전히 약 27%p의 현격한 성능 격차가 존재함을 확인했습니다.
- Proprietary vs. Open-source 격차:
- 최상위 오픈소스 모델인 VideoLLaMA3-7B(45.3%), Qwen2.5-VL-72B(44.0%)는 Gemini-2.5-Pro(67.4%) 대비 20%p 이상 뒤처지는 결과를 보였습니다.
- Native Long Video 모델의 치명적 Failure Mode 발견:
- Long video 처리가 가능하다고 알려진 모델들이 장기 시퀀스에서 프롬프트 지시(Instruction)를 제대로 따르지 못하는 현상이 발견되었습니다.
- Gemini-1.5-Pro의 경우 4개 선택지 중 하나를 고르라는 지시에도 불구하고 20.9%의 비율로 선택지 외 답변("None of the above", "I cannot answer")을 출력했습니다.
- MovieChat과 LWM은 특정 선택지(Option A)로 극단적인 편향을 보였습니다.
- Frame Density 절제 연구 (Ablation on Frame Density):
- 0, 1, 4, 8, 50 프레임 및 1 FPS 조건으로 실험한 결과, 50 프레임에서 1 FPS로 고밀도 샘플링 시 성능이 비약적으로 급상승했습니다.
- 0 프레임(Control group) 실험에서는 모든 모델이 무작위 추측 수준(약 25%)에 머물러 언어 편향이 완전히 배제되었음을 입증했습니다.
Limitations and Future Work
- Audio Modality 배제 (중요성 및 극복 방향):
- 한계: 비디오의 주요 구성 요소인 오디오(음성, 효과음, 배경음악)를 평가에서 제외하고 순수 시각 채널 정보만 사용했습니다.
- Future Work: 다중 모달리티를 온전히 통합 평가하기 위해 향후 Audio-Visual을 동시에 처리하고 이해하는 평가 체계로 확장할 계획입니다.
- YouTube 외부 소스 의존성:
- 한계: 원본 YouTube 영상이 삭제되거나 수정될 경우 데이터 영속성에 문제가 발생할 수 있습니다.
- 대응: 연구진 차원에서 별도의 영상 사본을 아카이빙하여 원작자 동의 절차를 통해 제공하는 방식으로 보완하고 있습니다.
Overall Summary
본 논문은 기존 벤치마크의 길이적 한계를 넘어 평균 68분 길이의 초장구간 비디오를 다루는 종합 평가 벤치마크인 LVBench를 제안합니다. 엄격한 텍스트 편향 제거와 Clue Duration 주석을 통해 6개 핵심 역량 및 26개 세부 조합 유형으로 구성된 1,549개의 고품질 QA를 구축했습니다. 최신 26종 MLLM 평가 결과, SOTA 모델(Gemini-2.5-Pro, 67.4%)조차 인간(94.4%)에 크게 미치지 못하며 장기 컨텍스트에서의 지시 불이행 문제가 심각함을 밝혀내어, 향후 진정한 장기 비디오 파운데이션 모델 개발을 위한 중요한 기준점을 제시했습니다.
쉬운 설명
기존의 비디오 AI 시험이 "1분짜리 숏폼이나 짤방"을 보고 내용을 맞히는 시험이었다면, LVBench는 "1시간이 넘는 풀버전 영화나 축구 경기 전체"를 처음부터 끝까지 다 본 뒤에 세부적인 사건의 전후 관계, 특정 인물의 행동 이유, 중간에 잠깐 지나간 자막 정보까지 찾아내도록 요구하는 고난도 종합 수능 시험입니다.
특히 지문(텍스트)만 읽고 찍어서 맞히는 꼼수를 완벽히 차단했기 때문에, 실제로 1초당 1프레임씩 꼼꼼하게 영상을 다 기억하고 추론하는 능력이 없으면 높은 점수를 받을 수 없도록 설계되었습니다.
