AI바라기의 인공지능
VLM : 빠른 논문 리뷰 : Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models 본문
VLM : 빠른 논문 리뷰 : Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models
AI바라기 2026. 1. 2. 17:23용어 설명 (Terminology)
- QTSplus (Query-aware Token Selector Plus): 이 논문에서 제안하는 핵심 모듈로, Vision Encoder와 LLM 사이에 위치합니다. 사용자의 텍스트 질문(Query)에 따라 비디오의 시각적 토큰 중 가장 중요한 정보만을 동적으로 선별하는 역할을 수행합니다.
- Token Bottleneck: 긴 비디오를 처리할 때 Vision Encoder가 생성하는 토큰 수가 너무 많아져 LLM의 연산량과 메모리 사용량이 급증하는 현상입니다.
- Adaptive Budget Estimation: 고정된 수의 토큰만 남기는 것이 아니라, 질문의 난이도나 정보의 분산 정도에 따라 남길 토큰의 비율(retention fraction rho)을 모델이 스스로 결정하는 메커니즘입니다.
- Visual Token: 비디오의 각 프레임을 패치(patch) 단위로 쪼개어 Vision Transformer 등을 통해 벡터화한 데이터입니다. 긴 비디오일수록 이 개수가 선형적으로 증가합니다.
- Gumbel-Softmax: 학습 과정에서 미분 불가능한 discrete한 선택(토큰을 버릴지 말지 결정) 과정을 미분 가능하게 만들어주기 위해 사용하는 확률적 테크닉입니다.
- Teacher Distillation: 이미 학습된 큰 모델(Teacher, 여기서는 원본 Qwen2.5-VL)의 지식을 작은 모델이나 효율적인 구조(Student, 여기서는 QTSplus가 적용된 모델)에 전달하여 학습시키는 방법론입니다.
Purpose of the Paper
- Linear Growth Problem 해결: 기존 MLLMs는 비디오 길이가 길어질수록 Vision Token 수가 선형적으로 증가하여 Attention cost와 메모리가 폭발하는 문제가 있었습니다. 이를 해결하기 위해 입력 프레임을 단순히 줄이거나(pre-truncate) 과도하게 다운샘플링하면, "세 번째 나사가 조여진 순간"과 같은 미세한 시간적 단서(fine-grained temporal cues)를 잃게 되는 한계를 극복하고자 했습니다.
- Static Compression의 한계 극복: Q-Former나 Perceiver Resampler와 같은 기존 방식은 고정된 개수의 쿼리나 정적인 압축률을 사용하여, 질문에 따라 정보량이 달라져야 하는 상황(좁은 구간 탐색 vs 전체 요약)에 유연하게 대처하지 못했습니다. 이 논문은 Query에 따라 필요한 정보량과 위치가 다르다는 점에 착안하여 동적 토큰 선택 방식을 제안했습니다.
Key Contributions & Novelty
Key Contributions
- QTSplus Module: 기존 MLLM(Qwen2.5-VL)에 플러그인 형태로 삽입 가능한 경량화 모듈을 제안했습니다. 이는 Cross-attention을 통해 토큰의 중요도를 채점(scoring)하고, 쿼리의 복잡도에 따라 예산(budget)을 예측하여 토큰을 선별합니다.
- Adaptive Budgeting: 단순히 Top-k개를 뽑는 것이 아니라, 쿼리 임베딩, 전체 토큰 수, 중요도 점수의 엔트로피(entropy), 최대 중요도(peak relevance) 등 4가지 요소를 고려하여 인스턴스별로 최적의 토큰 유지 비율을 예측합니다.
- Absolute Time Re-encoding: 선별된 토큰들이 시간적 순서를 잃지 않도록 절대 시간 정보를 포함한 작은 Re-encoder를 통과시켜, LLM이 비디오의 시간적 흐름(temporal consistency)을 이해할 수 있도록 했습니다.
- Efficient Distillation Pipeline: Qwen3-235B(Text)와 Qwen2.5-VL(Vision)을 활용해 자동화된 QTS-VSCQ(객관식), QTS-VQA(주관식) 데이터셋을 구축하고, 이를 통해 원본 모델의 성능을 효율적인 모델로 증류(Distillation)했습니다.
Novelty
- 기존의 Token Merging이나 Token Pruning이 비디오 내용이나 텍스트 쿼리와 무관하게 혹은 단순히 시각적 유사도만으로 압축했던 것과 달리, Text Query와의 Cross-attention을 기반으로 '지금 질문에 필요한 시각 정보'만을 남기는 점이 독창적입니다.
- 고정된 개수(Fixed budget)가 아닌, 정보의 밀도와 질문의 성격에 따라 토큰 개수를 동적으로 조절하는 Budget Head를 도입한 점이 차별화됩니다. (예: 특정 시점을 묻는 질문은 적은 토큰, 전체 요약은 많은 토큰 할당)
Experimental Highlights
- Experimental Setup:
- Base Model: Qwen2.5-VL (3B, 7B)
- Benchmarks: Video-MME, LVBench, MLVU (Long video tasks), TempCompass (Temporal aspect tasks)
- Metric: Accuracy, End-to-End Latency, Vision Embedding Count
- Key Results:
- Efficiency: 긴 비디오에서 Vision Stream을 최대 89% 압축하고, End-to-End Latency를 28% 감소시켰습니다. (NVIDIA A100 기준)
- Performance: 원본 모델(Teacher)과 비교했을 때 대부분의 벤치마크에서 대등하거나 소폭 향상된 성능을 보였습니다.
- Temporal Reasoning: 특히 시간적 순서 파악이 중요한 TempCompass 벤치마크에서 Direction 정확도 +20.5점, Order 정확도 +5.6점이라는 압도적인 성능 향상을 달성했습니다. 이는 불필요한 노이즈 토큰을 제거하여 모델이 핵심 사건에 집중하게 만든 결과입니다.
- Scaling: 비디오 프레임 수가 증가해도 실제 LLM에 입력되는 토큰 수는 매우 완만하게 증가하여, 긴 비디오 처리에 특화됨을 입증했습니다.
Limitations and Future Work
- Limitations:
- Dense-evidence Tasks: Video-MME나 MLVU와 같이 비디오 전체에 걸쳐 정보가 흩어져 있는(dense-evidence) 작업에서는 약간의 성능 저하(3점 이내)가 관찰되었습니다. 이는 과도한 압축이 전역적인 맥락을 일부 놓칠 수 있음을 시사합니다.
- Future Work:
- Curriculum & Budget Scheduling: 더 넓은 범위의 커버리지가 필요한 작업을 위해, 학습 과정에서 budget을 스케줄링하거나 커리큘럼 학습을 도입하는 방향을 제시했습니다.
- Streaming & Continual Inference: 시간이 지남에 따라 예산(budget)이 진화하는 스트리밍 방식이나 연속적인 추론 환경으로의 확장을 계획하고 있습니다.
- Multi-query Interaction: 현재는 단일 쿼리에 최적화되어 있으나, 다중 쿼리 상호작용 및 멀티 카메라 입력으로 QTSplus를 확장할 예정입니다.
Overall Summary
이 논문은 긴 비디오 이해를 위해 QTSplus라는 쿼리 인식형 토큰 선택 모듈을 제안하여, MLLM의 고질적인 문제인 Vision Token 폭증 문제를 해결했습니다. 텍스트 질문에 따라 필요한 시각 정보만을 동적으로 선별하고 압축함으로써 연산 효율성을 획기적으로 높이면서도, 원본 모델의 성능을 유지하거나 시간적 추론 능력(TempCompass)을 대폭 향상시켰습니다. 이 연구는 제한된 컴퓨팅 자원으로도 시간 단위의 긴 비디오를 정밀하게 분석할 수 있는 현실적인 길을 열어주었으며, 향후 Real-world Long-video Understanding 분야에 큰 영향을 미칠 것으로 기대됩니다.
쉬운 설명 (Easy Explanation)
이 논문의 핵심 아이디어는 **"오픈북 시험을 칠 때 책의 모든 페이지를 다 읽는 것이 아니라, 질문과 관련된 페이지만 골라서 읽는 것"**과 비슷합니다.
- 기존 방식 (Standard MLLMs): 1시간짜리 비디오가 있으면, 처음부터 끝까지 모든 장면을 다 비전 토큰으로 바꿔서 LLM에게 던져줍니다. 이건 마치 시험 문제와 상관없이 교과서 전체를 달달 외우고 들어가는 것과 같아서 머리(메모리)가 아프고 시간(연산량)도 오래 걸립니다.
- 제안 방식 (QTSplus): 사용자가 "주인공이 빨간 차를 타는 순간이 언제야?"라고 물으면(Query), 이 모듈이 비디오 전체에서 '빨간 차'와 관련된 장면만 쏙쏙 뽑아냅니다(Scoring & Selection). 그리고 질문이 얼마나 어려운지에 따라 몇 장의 장면을 뽑을지도 스스로 결정합니다(Adaptive Budget). 결과적으로 LLM은 압축된 핵심 장면만 보고도 빠르고 정확하게 정답을 맞힐 수 있게 됩니다.
Abstract
multimodal large language models (MLLMs)의 video understanding ability에서의 최근 발전에도 불구하고, long video understanding은 여전히 과제로 남아있습니다. 주요 문제 중 하나는 vision tokens의 수가 비디오 길이에 따라 선형적으로 증가하여, attention cost, memory, 그리고 latency의 폭발적인 증가를 야기한다는 점입니다. 이 과제를 해결하기 위해, 우리는 vision encoder와 LLMs 사이에서 information gate 역할을 하는 lightweight하면서도 강력한 visual token selection module인 **Query-aware Token Selector (QTSplus)**를 제안합니다.
text query와 video tokens가 주어지면, QTSplus는 (i) cross-attention을 통한 visual tokens scoring, (ii) query의 복잡도에 기반한 instance-specific retention budget 예측, 그리고 (iii) training 중에는 differentiable straight-through estimator를, inference 시에는 hard gate를 사용하여 Top-n tokens를 선택함으로써 입력된 text query에 대해 가장 중요한 visual evidence를 동적으로 선택합니다.
더 나아가, 작은 re-encoder가 absolute time information을 사용하여 temporal order를 보존함으로써, global coverage를 유지하면서 second-level localization을 가능하게 합니다.
Qwen2.5-VL에 통합된 QTSplus는 long videos에서 vision stream을 최대 89%까지 압축하고 end-to-end latency를 28% 줄입니다. 8개의 long video understanding benchmarks에 대한 evaluation은 원래의 Qwen models와 비교했을 때 전반적으로 거의 대등한 accuracy를 보여주며, TempCompass direction 및 order accuracies에서 원래 model보다 각각 +20.5점 및 +5.6점 더 우수한 성능을 보입니다. 이러한 결과들은 QTSplus가 task-relevant evidence를 보존하면서 MLLMs를 실제 long-video scenarios로 scaling하기 위한 효과적이고 일반적인 mechanism임을 보여줍니다.
1. Introduction
최근 **multimodal large language models (MLLMs)**는 image 및 video understanding tasks를 해결하는 능력을 확장하는 강력한 vision–language pretraining을 기반으로 구축됩니다. MLLMs의 능력이 성장함에 따라, 확장된 temporal horizons에 대한 reasoning을 요구하는 tasks를 강조하는 Video-MME, Video-MMMU, LVBench, MLVU와 같은 benchmarks와 함께 long video understanding은 multimodal AI의 새로운 개척지 중 하나가 되었습니다. 이러한 long videos를 이해하는 것은 assistive robotics 및 surgical coaching에서부터 저작권 준수 및 안전 모니터링에 이르는 applications에 매우 중요합니다. 그러나 기존의 대부분의 video–language models는 short-clip recognition의 설계 가정을 상속받아 입력을 pre-truncate하거나 frames를 공격적으로 down-sample하며, "세 번째 조여진 나사"나 "케이크가 처음 부풀어 오르는 순간"과 같은 질문에서 중요한 fine-grained temporal cues를 버립니다.
이를 해결하는 한 가지 native 방식은 down-sampling 없이 원본 비디오를 입력하는 것입니다. 하지만 computational 및 memory costs가 비디오 길이에 따라 선형적으로 증가하며, YouTube나 Bilibili 같은 플랫폼의 user–generated content에서 점점 흔해지는 multi-hour inputs를 처리할 때 비현실적이 됩니다. 이러한 costs는 주로 비디오를 인코딩하는 visual tokens에 의해 발생합니다. Long videos는 이러한 tokens의 수를 증가시키며, 이는 downstream LLM에서 사용되어 결과적으로 높은 computational 및 memory resources를 요구하게 됩니다. 결과적으로 token bottlenecks는 다양한 queries에 적응할 수 있다면 원칙적인 솔루션으로 사용될 수 있습니다. Discrete 또는 learned visual tokenizers와 token-pruning modules는 vision stream을 줄일 수 있는 일반적인 방법이지만, 대부분의 방법은 prompt나 evidence의 temporal dispersion과 관계없이 정적인 압축률을 적용합니다. 이는 long videos에 문제가 됩니다. Downstream queries는 몇몇 국소적인 순간들("빨간 불이 언제 초록색으로 바뀌나요?" 등)에 달려 있을 수 있는 반면, 다른 queries는 광범위한 coverage("주요 사건을 요약해 주세요" 등)를 요구하기 때문입니다. 고정된 budget은 관련 없는 frames에 tokens를 낭비하거나 model의 context를 부족하게 만듭니다.
이 문제를 해결하기 위해, 우리는 vision encoder와 language model 사이에 배치되어 주어진 text query에 따라 가장 관련성 높은 visual tokens를 동적으로 선택하는 중간 모듈인 **Query-aware Token Selector (QTSplus)**를 소개합니다. QTSplus는 text와 visual tokens 간의 cross-attention을 사용하여 per-token relevance를 결정합니다. 그런 다음 소형 controller가 query statistics와 video-level signals (예: sequence length, relevance의 entropy/peakedness, maximum relevance)를 기반으로 retention fraction $\rho \in [0, 1]$을 결정합니다. Relevance에 따라 상위 fraction 내의 visual tokens만이 선택되어 language model로 입력됩니다. Training 동안, 우리는 미리 정의된 target budget을 강제하기 위해 Gumbel straight-through가 포함된 differentiable gate를 추가로 사용합니다. 또한, 유지된 tokens는 LLM이 temporal consistency를 유지할 수 있도록 absolute time information으로 re-encoded됩니다. 이 설계는 task-relevant evidence를 희생하지 않으면서 **vision embeddings (KV-cache)**와 attention cost를 최대 89%까지 줄입니다. 종합하면, 이러한 구성 요소들은 단일 MLLM이 commodity GPUs에서 multi-hour footage에 대해 reasoning할 수 있게 합니다.
Long-video question answering (QA) 및 summarization benchmarks에 대한 실험은 QTSplus가 증강된 Qwen2.5-VL이 경쟁력 있거나 state-of-the-art 결과를 달성함을 보여주며, real-world deployments를 위한 adaptive, relevance-aware tokenisation의 이점을 확인시켜 줍니다.
요약하자면, 우리의 주요 contributions는 다음과 같습니다:
- 우리는 효율적인 long-video understanding을 지원하기 위해 기존 video-language MLLMs에 플러그인할 수 있는 query-aware multimodal token selector인 QTSplus를 제안합니다.
- 이 module은 textual query와 absolute time encoding을 조건으로 visual tokens를 동적으로 필터링하여, task-critical evidence를 보존하면서 KV-cache 크기를 상당히 줄입니다.
- 우리는 제어된 generation pipeline을 통해 long-video QA 및 single-choice question datasets를 구축하고, 수정된 lmms-eval framework를 사용하여 QTSplus가 증강된 Qwen2.5-VL을 evaluate하여, 비슷하거나 향상된 task performance와 함께 상당한 inference efficiency 이득을 입증합니다.
다음은 1. Introduction 섹션에 대한 AI 연구자를 위한 정리노트와 쉬운 설명입니다.
Summary Note: Introduction
1. Problem Statement: Scalability Bottleneck in Long-Video Understanding
- Linear Growth of Tokens: 기존 MLLMs에서 vision tokens의 수는 비디오 길이에 비례하여 선형적으로 증가함.
- Resource Explosion: 이는 attention cost, memory, latency의 폭발적인 증가를 야기하여, YouTube/Bilibili 등의 multi-hour inputs 처리를 비현실적으로 만듦.
- Dilemma of Existing Solutions:
- Down-sampling/Truncation: "세 번째 나사가 조여진 순간"과 같은 fine-grained temporal cues를 소실시킴.
- Static Token Pruning: Query의 성격(국소적 정보 vs 전역적 요약)을 무시하고 고정된 비율을 적용하여, context 손실이나 비효율을 초래함.
2. Core Contribution: Query-aware Token Selector (QTSplus)
- Concept: Vision encoder와 LLM 사이에 위치하여 text query에 기반해 동적으로 visual tokens를 필터링하는 Information Gate 모듈.
- Key Mechanisms:
- (i) Cross-Attention Scoring: Text query와 visual tokens 간의 cross-attention을 통해 per-token relevance를 계산.
- (ii) Adaptive Budget Prediction: Query statistics와 video-level signals(sequence length, entropy of relevance 등)를 기반으로 retention fraction $\rho \in [0, 1]$을 동적으로 예측.
- (iii) Differentiable Selection: Training 시에는 Gumbel straight-through estimator를, Inference 시에는 hard gate를 사용하여 Top-n tokens를 선별.
- (iv) Temporal Re-encoding: 선별된 tokens에 absolute time information을 포함한 re-encoder를 적용하여 temporal consistency와 global coverage를 유지.
3. Experimental Impact (with Qwen2.5-VL)
- Efficiency: Vision stream을 최대 $89\%$ 압축하고 end-to-end latency를 $28\%$ 감소시킴.
- Performance:
- 기존 Qwen models와 전반적으로 대등한 accuracy 유지.
- Fine-grained temporal tasks에서 성능 대폭 향상 (TempCompass direction $+20.5$, order $+5.6$ points).
- Commodity GPUs에서 multi-hour footage에 대한 reasoning 가능.
쉬운 설명 : Introduction
이 섹션은 긴 비디오를 AI가 이해할 때 생기는 문제와 해결책을 다룹니다.
- 문제점: 비디오가 길어지면 AI가 봐야 할 이미지 조각(vision tokens)이 너무 많아집니다. 이걸 다 보려면 컴퓨터 성능이 부족하고, 그렇다고 띄엄띄엄 보면("나사가 언제 조여졌어?" 같은) 아주 짧은 순간의 중요한 장면을 놓치게 됩니다. 기존 방법들은 질문과 상관없이 무조건 듬성듬성 보거나 앞부분만 잘라버리는 식이라 한계가 있었습니다.
- 해결책 (QTSplus): 연구진은 **"질문(Query)을 먼저 보고, 그 질문에 필요한 장면만 골라내는 문지기(Token Selector)"**를 만들었습니다.
- 사용자의 질문이 비디오의 어떤 장면과 관련이 깊은지 점수를 매깁니다.
- 질문이 "전체 요약해줘"라면 좀 더 많은 장면을, "빨간 불 언제 켜져?"라면 딱 그 장면만 남기도록 AI가 스스로 조절(Adaptive Budget)합니다.
- 골라낸 장면들에 "이건 몇 분 몇 초 장면이야"라는 시간표(absolute time information)를 다시 붙여서 순서가 섞이지 않게 합니다.
- 결과: 이렇게 하니 AI가 처리해야 할 데이터 양을 거의 90% 가까이 줄이면서도, 정작 중요한 장면은 놓치지 않아 정답률은 그대로 유지하거나 오히려 더 좋아졌습니다.
2. Related Works
최근 MLLMs는 강력한 vision–language pre-training을 활용하여 long-video benchmarks에서의 진전을 이끌어왔습니다. 이와 독립적으로, 효율성 연구는 token pruning 및 routing, visual token grouping/merging, 그리고 dynamic inference를 탐구하고 있습니다. 흔히 **Vision Transformer (ViT)**인 vision encoder는 일반적으로 거대한 patch tokens 집합을 생성하며, 이는 LLM의 self-attention mechanisms에 감당하기 힘든 computational bottleneck을 유발합니다. 이를 해결하기 위해 visual feature selection 및 압축을 위한 여러 전략이 제안되었습니다.
지배적인 패러다임 중 하나는 Query-Based Resampling으로, 이는 information bottleneck 역할을 합니다. 이 방법은 cross attention을 통해 밀집된 visual token set에서 정보를 추출하는 작고 고정된 크기의 learnable queries 집합을 사용합니다. 이는 가장 두드러진 features를 요약하는 압축된 고정 길이의 visual embeddings sequence를 생성합니다. 이 접근 방식의 대표적인 예로는 BLIP-2에서 사용된 Q-Former architecture와 Flamingo에서 볼 수 있는 Perceiver Resampler가 있습니다.
대안적인 전략들은 visual token sequence에 직접 작동합니다. Token Pruning 방법들은 saliency, redundancy, 또는 task-relevance metrics(예: SAINT)에 기반하여 tokens를 식별하고 버림으로써 sequence length를 줄이는 것을 목표로 합니다. 대조적으로, Token Merging 기술들은 유사하거나 공간적으로 인접한 tokens를 통합된 representations으로 동적으로 융합하여, information content를 보존하려고 시도하면서 sequence를 점진적으로 단축시킵니다. 이러한 merging mechanisms는 근본적으로 LLM을 위한 input sequence length를 줄이도록 설계되었으며, 이를 통해 multimodal reasoning에 필요한 가장 중요한 visual information을 유지하면서 2차적인 computational cost를 완화합니다.
우리의 접근 방식은 visual tokens의 수를 줄이려는 동일한 목표에서 동기를 얻었지만, 추가적으로 input query를 고려하여 해당 query와 매우 관련이 높은 visual tokens만을 유지합니다. 결과적으로, 우리의 방법은 ToMe나 Qwen2.5-VL에서 사용된 것과 같은 전형적인 token-merging 방법들보다 visual tokens의 수를 훨씬 더 크게 줄일 수 있습니다. 최신 Qwen2.5-VL model을 예로 들어보겠습니다. 이 모델은 공간적으로 인접한 tokens(예: $n=4$)를 하나의 representation으로 병합하는 간단한 MLP-based merging strategy를 사용합니다. 그 결과, LLM에 입력되는 실제 tokens 수는 $n$배만큼 줄어듭니다. 이러한 접근 방식은 모델의 능력을 short videos에서 medium-length videos로 확장합니다. 그러나 입력 비디오의 프레임 레이트가 지나치게 높으면, vision embedding은 여전히 극도로 커집니다. 예를 들어, 480p 비디오 입력이 450 프레임에 도달하면(Qwen2.5-VL 사용 시), language model에 입력되는 embedding sequence length는 136,035에 달합니다. 이는 모델의 maximum processing length(131,072)를 초과합니다. 대조적으로, 우리의 접근 방식은 vanilla Qwen2.5-VL model과 비교했을 때 visual tokens의 수를 최대 89%까지 줄일 수 있습니다.
다음은 2. Related Works 섹션에 대한 AI 연구자를 위한 핵심 요약 노트와 쉬운 설명입니다.
Summary Note: Related Works
1. The Bottleneck: Vision Token Explosion
- Vision Transformer (ViT) 기반의 vision encoder는 대량의 patch tokens를 생성하여 LLM의 self-attention mechanisms에 막대한 computational bottleneck을 유발함.
2. Existing Strategies for Visual Feature Selection
- Query-Based Resampling (Information Bottleneck):
- 소수의 고정된 learnable queries와 cross attention을 사용하여 정보를 압축된 고정 길이 sequence로 요약.
- 예시: Q-Former (BLIP-2), Perceiver Resampler (Flamingo).
- Token Pruning:
- Saliency, redundancy, task-relevance metrics에 기반하여 덜 중요한 tokens를 제거. (예: SAINT).
- Token Merging:
- 유사하거나 공간적으로 인접한 tokens를 통합된 representations으로 융합하여 sequence length를 단축. (예: ToMe).
3. Limitations of Current SOTA (Case Study: Qwen2.5-VL)
- Qwen2.5-VL은 MLP-based merging strategy를 사용하여 공간적으로 인접한 tokens를 병합(factor of $n$).
- Critical Issue: Input video frame rate가 높거나 길이가 길어지면 여전히 embedding sequence가 모델의 한계를 초과함.
- 수치 예시: 480p 해상도, 450 frames 입력 시 $\rightarrow$ embedding sequence length가 136,035에 달해 모델의 maximum processing length (131,072)를 초과하여 처리 불가.
4. Differentiation of QTSplus (Proposed Approach)
- Query-Awareness: 기존의 Token Merging이나 Pruning이 정적인 압축률이나 이미지 자체의 중요도만 보는 것과 달리, Input query와의 relevance를 직접 계산하여 tokens를 선별함.
- Extreme Efficiency: 단순한 Token Merging을 넘어, Task와 무관한 정보를 과감히 버림으로써 vanilla Qwen2.5-VL 대비 visual tokens 수를 최대 $89%$까지 감소시킴.
쉬운 설명 : Related Works
이 섹션은 **"비디오가 너무 길어질 때, 기존 AI 모델들은 어떻게 대처했고 무엇이 문제였나?"**를 다룹니다.
- 기존 방법 1 (요약하기): 비디오 전체를 아주 짧은 요약본(고정된 개수의 토큰)으로 압축해서 보는 방법입니다. (Q-Former 등)
- 기존 방법 2 (합치기/버리기): 비슷한 이미지 조각들을 뭉치거나(Merge), 덜 중요해 보이는 걸 버리는(Prune) 방법입니다.
- 최신 모델의 한계 (Qwen2.5-VL): 가장 최신 모델인 Qwen2.5-VL은 주변 조각들을 뭉쳐서(Merge) 양을 줄이는 방식을 씁니다. 하지만 이 방식은 비디오가 조금만 길어지거나 화질이 좋아지면, 뭉쳐놔도 데이터 양이 AI가 처리할 수 있는 한계(약 13만 개 토큰)를 금방 넘어버린다는 치명적인 단점이 있습니다.
- 이 논문의 차별점: 기존 방법들이 "그냥 중요해 보이는 걸 남기거나 뭉치는" 방식이었다면, 이 연구는 "사용자의 질문(Query)에 필요한 것만 남기는" 방식입니다. 질문과 상관없는 부분은 과감히 버리기 때문에, 최신 모델(Qwen2.5-VL)이 감당 못하는 긴 비디오도 데이터 양을 약 90% 가까이 줄여서 가볍게 처리할 수 있다는 것입니다.
3. Method
3.1. Problem Set-up
Inputs. 우리는 long video를 다음과 같이 RGB frames의 sequence로 공식화합니다.
여기서 비디오 길이 $T$는 $\mathcal{O}(10^5)$ 범위(수 시간 분량의 샘플링된 프레임)에 이를 수 있습니다. Inference time에 시스템은 text vocabulary $\mathcal{V}_{\text{text}}$에서 추출된 길이 $L$의 sub-word tokens로 구성된 natural-language prompt $\mathcal{Q} = (q_1, \dots, q_L)$도 받습니다. 우리는 두 가지 tasks를 연구합니다:
- Long-Video QA: 전체 비디오와 질문을 조건으로 answer sequence $y = (y_1, \dots, y_{|y|}) \in \mathcal{V}_{\text{text}}^{|y|}$를 예측합니다.
- Long-Video Summarisation: $V$의 salient events $\delta$를 다루는 temporally coherent summary $\Delta = (\delta_1, \dots, \delta_\alpha)$를 생성합니다.
Vision Tokenization Pipeline. 각 프레임은 먼저 동결된 ViT encoder에 의해 패치화되고 투영됩니다. 이 과정은 latent features (visual tokens) $\mathcal{X} = [x_1, \dots, x_M]^\top \in \mathbb{R}^{M \times d}$를 산출하며, 여기서 visual tokens의 수는 다음과 같이 정의됩니다.
비디오 길이($T$)가 길거나 비디오 해상도($W, H$)가 높을 때 이 숫자는 쉽게 백만 개의 토큰을 초과할 수 있습니다. $P$는 ViT patch size이고, $\Delta t$는 video sampling interval입니다.
Query-Aware Token Budget. 선택된 토큰의 수를 더욱 줄이고 downstream decoder의 self-attention에 드는 2차 비용을 완화하기 위해, 우리는 Query-Aware Token Selector with Adaptive Budget을 도입합니다. 고정된 예산을 사용하는 대신, 우리의 방법은 token budget $n \ll M$ (예: $n=256$)을 동적으로 결정합니다. $\mathcal{X}$와 embedded query $q$가 주어지면, 선택기(selector)는 $\mathcal{Q}$와 가장 관련성 높은 상위 $n$개의 visual tokens에 점수를 매기고 유지합니다. 이 과정은 $\mathcal{X}' = [z_1, \dots, z_n]^\top \in \mathbb{R}^{n \times d}$를 출력합니다.
3.2. Query-Aware Token Selector with Adaptive Budget (QTSplus)
Tokenization을 통해 video stream을 $M$개의 토큰 $\mathcal{X} \in \mathbb{R}^{M \times d}$로 압축한 후, **Query-Aware Token Selector (QTSplus)**는 causal decoder를 위해 최대 $n \leq n_{\text{max}}$개의 query-relevant tokens를 선택하여, task evidence를 보존하면서 attention compute와 KV-cache를 줄입니다. QTSplus는 query와 video statistics로부터 token budget을 추정한다는 점에서 기존의 gating mechanisms와 다릅니다. Training 중에는 이 예산이 미분 가능한 thresholded sigmoid gate를 통해 강제되며, inference time에는 모델이 hard gate Top-n으로 전환됩니다. (Alg. 1 참조.)
3.2.1. Cross-Attention Scoring
Vision head가 video features를 처리한 후, 우리는 매우 긴 visual features sequence를 갖게 됩니다. 한편, natural-language question은 훨씬 짧은 text tokens sequence로 임베딩됩니다. 특정 질문에 어떤 visual tokens가 중요한지 결정하기 위해, 우리는 두 스트림 사이에 multi-head cross-attention layer를 배치합니다. $\mathcal{Q}=[q_1, \dots, q_L]^\top \in \mathbb{R}^{L \times d}$를 text tokens라고 합시다. 우리는 Qwen2.5-VL을 기본 모델로 사용하므로 Qwen2.5-compatible attention을 사용하여 cross-attention map $\alpha \in \mathbb{R}^{h \times L \times M}$을 계산합니다. Per-token relevance는 $r_i = \max_{h, \ell} \alpha_{h,\ell,i} \in [0, 1]$ (단, $r \in [0, 1]^M$)로 정의됩니다. 직관적으로, 질문의 어떤 단어에 의해서든 집중적으로 주목받는 visual token은 높은 $r$을 얻을 것이며, 모델이 전혀 보지 않는 토큰들은 0에 가까운 값을 유지할 것입니다.
3.2.2. Adaptive Budget Estimation
가벼운 "budget head" $\mathcal{B}_\psi$는 쿼리와 간단한 video statistics로부터 retention fraction $\rho \in [\rho_{\text{min}}, \rho_{\text{max}}]$를 예측합니다:
여기서 $\phi(\cdot)$는 multi-layer MLP이고 $\sigma$는 logistic function입니다. 입력값 $s_q, \log M, \max_i r_i, H(p)$는 예산을 추정하는 데 사용되는 요소들이며, 아래에서 자세히 논의할 것입니다. 추정된 예산은 $n_{\text{esti}} = \lceil \rho M \rceil$으로 설정됩니다. 이 비율 기반 접근 방식은 가변 길이 입력에 적합하며 후속 단계에서 깨끗한 그래디언트를 보장합니다.
$\mathcal{B}_\psi$를 위한 입력값들은 다음과 같이 선택됩니다. 첫째, mean query embedding, $s_q = \frac{1}{L} \sum_{\ell} q_\ell$는 semantic difficulty를 측정하여, 어려운 의도에는 더 많은 토큰을 요청하고 쉬운 조회에는 더 적은 토큰이 필요하도록 합니다. 둘째, $\log M$은 사용 가능한 visual tokens의 수가 증가함에 따라 거의 단조로운(near-monotonic) 예산을 강제하는 안정적인 길이 신호 역할을 합니다. 셋째, peak cross-attention relevance, $\max_i r_i$는 confidence spike 역할을 합니다; 이는 중요도가 날카로울 때 더 적은 예산이 필요함을 의미합니다. 넷째, normalized relevance의 entropy, $H(p) = -\sum_i p_i \log p_i$ (여기서 $p_i = \frac{r_i}{\sum_j r_j + \varepsilon}$)는 evidence가 퍼져 있을 때 예산을 늘리는 분산 신호입니다. 종합하면, 이 요소들은 고정된 $n$을 context-aware selection으로 대체하여 accuracy를 보존하면서 KV/attention cost와 memory를 줄입니다.
Rationale for Input Factors 이러한 요소들을 선택한 우리의 직관에 대한 자세한 논의는 다음과 같습니다:
- $s_q$: mean query embedding. 이것은 의도의 의미론에 대한 압축된 기술자입니다—예를 들어, prompt가 좁은 조회("문이 언제 열리나요?")인지 아니면 개방형 지시("비디오를 요약해 주세요")인지 여부입니다. 모델은 특정 의미론적 "모드"에서 전형적인 evidence breadth로의 매핑을 학습할 수 있습니다. 계산이나 위치 지정 질문은 종종 소수의 집중된 프레임이 필요하고; 서사나 요약 prompts는 넓은 coverage가 필요합니다. $s_q$를 사용함으로써 $\mathcal{B}_\psi$는 본질적으로 넓은 범위의 prompts에 대해 $\rho$를 높이고 포인트 쿼리에 대해서는 낮출 수 있습니다.
- $\log M$: quantization 후 사용 가능한 visual tokens의 로그 값. 이는 풀(pool)이 커짐에 따라 거의 단조로운 예산을 장려합니다: 매우 긴 비디오는 $\rho$ 비율이 천천히 변하더라도 일반적으로 더 많은 절대적인 토큰을 유지해야 합니다. $M$ 대신 $\log M$을 사용하는 것은 scale stability를 제공하여 multi-hour inputs에서도 그래디언트가 폭발하지 않도록 합니다. 이는 본 논문이 목표로 하는 long-video regimes에 있어 중요한 고려 사항입니다.
- $\max_i r_i$: peak query-vision relevance. 날카롭고 높은 피크는 정답이 작은 영역이나 시간에 달려 있을 가능성이 높으므로 일반적으로 더 적은 예산으로 충분함을 의미합니다. 반대로 어떤 토큰도 두드러지지 않으면(낮은 $\max_i r_i$), evidence가 퍼져 있으므로 $\rho$가 증가해야 합니다. 따라서 이 "confidence spike" 휴리스틱은 중요도가 날카로울 때 더 작은 예산을 유도합니다.
- $H(p)$: entropy of normalized relevance. 이 요소는 evidence의 분산을 측정합니다. Entropy가 높으면 관련 정보가 퍼져 있으므로 예산이 증가해야 합니다. 반대로 낮은 entropy는 집중된 정보를 시사하므로 더 작은 예산이 바람직합니다.
3.2.3. Top-n Gate
Training time 동안, 우리는 그래디언트 흐름을 자유롭게 하기 위해 게이트를 미분 가능하게 만듭니다. 우리는 유지되는 토큰의 기대 개수가 목표 예산과 일치하도록 임계값 $t$를 선택하며, 이는 $\sum_i \sigma((r_i - t)/\tau_s) = \rho M$을 중앙값에서 초기화된 몇 번의 Newton iterations으로 풀어 해결합니다(Alg. 2). $t$가 주어지면, 우리는 Gumbel-Softmax straight-through one-hot 샘플 $\text{logits}_i = [r_i - t, 0]$, $y_i = \text{GumbelSoftmax}(\text{logits}_i; \tau=\tau_s, \text{hard}=\text{true})$, $s_{\text{keep}, i} = y_{i, 0} \in {0, 1}$을 통해 토큰별 이진 유지/제거 결정을 형성하며, 모두 0이 발생할 경우 $\max_i s_{\text{keep}, i} = 1$로 강제하는 안전장치를 둡니다. 유지된 시퀀스 $Z$는 원래의 temporal order를 보존합니다.
Inference 시에는 $r$에 대해 hard Top-n을 사용하고 선택된 인덱스를 오름차순으로 정렬하여 temporal order를 유지합니다: $Z = \mathcal{X}[\text{TopK}(r, n)]$.
3.2.4. Lightweight Re-encoding.
마지막으로 단일 self-attention re-encoding block ($\text{RMSNorm} \to \text{MHA} \to \text{RMSNorm} \to \text{FFN}$)이 $Z$에 적용됩니다; 실제로 우리는 모양이 일치할 때 text model에서 초기화된 Qwen2.5-style self-attention wrapper를 사용합니다. QTSplus는 가지치기된 visual tokens $Z$를 분석을 위해 기록하는 진단 정보 $(r, \rho, n)$와 함께 반환합니다. (Alg. 1은 단계들을 요약합니다.)
3.2.5. Teacher Distillation
$T$를 전체 visual embeddings에서 작동하는 teacher (Qwen2.5-VL-3B-Instruct)라 하고, $S$를 QTSplus layer에 의해 생성된 압축된 embeddings를 소비하는 우리의 student (QTSplus-3B 또는 QTSplus-3B-FT)라고 합시다.
Distillation data. 우리는 두 개의 보완적인 teacher-derived corpora로부터 증류합니다: (i) 정답 옵션이 $T$에 의해 검증된 QTS-VSCQ2 classification set; 그리고 (ii) $T$가 비디오와 질문을 조건으로 free-form answers를 제공하는 QTS-VQA generative set.
Objectives. VSCQ에 대해, $S$는 옵션들에 대한 분포를 예측합니다; 우리는 teacher-validated correct label과의 표준 cross-entropy를 최소화합니다:
여기서 $q$는 질문, $v$는 비디오, $a^\star$는 정답 옵션, $g(\cdot)$는 vision features를 language model을 위한 압축된 embedding stream으로 변환하는 QTSplus tokenizer입니다.
VQA에 대해서는, sequence-level distillation을 사용합니다: teacher의 디코딩된 정답 $y_T$가 teacher forcing 하에 token-level cross-entropy를 위한 감독 목표 역할을 합니다:
전체 목표는 간단한 multi-task sum이며,
QTS-VSCQ2와 QTS-VQA의 혼합 배치에 적용됩니다. 이 공식은 $S$가 더 적은 vision tokens에 의존하면서 teacher의 결정(분류)과 표면 형태(생성)를 일치시키도록 장려합니다.
3.3. Loss function
우리는 지도 학습 항들을 learned-budget penalty로 보강한 compute-aware objective를 최소화합니다. 배치 $\mathcal{B}$에 대해,
두 개의 계산 항은 실질적인 상한 $n_{\text{max}}$로 정규화된 2차적인 attention time과 선형적인 KV memory를 반영합니다. 평균 $\bar{\rho}$를 가진 선택적인 2차 사전 확률(quadratic prior)은 초기 training을 안정화합니다. Hyperparameters $\lambda_t, \lambda_m, \lambda_s$는 accuracy와 efficiency 사이를 절충합니다.
주목할 점은 (i) 계산 페널티는 $\rho \to 0$일 때 사라지고 $n$에 따라 부드럽게 증가하여 안정적인 그래디언트를 제공한다는 것입니다: $\frac{\partial}{\partial \rho} [(\rho M)^2/n_{\text{max}}^2] = 2\rho M^2/n_{\text{max}}^2$, $\frac{\partial}{\partial \rho} [\rho M/n_{\text{max}}] = M/n_{\text{max}}$. (ii) Dataset-level budget target $\bar{n}$이 필요한 경우, 듀얼 변수 $\alpha \ge 0$를 기대값에 $\alpha(\rho M - \bar{n})$으로 추가하고 $\alpha$에 대해 표준 상승(standard ascent)을 수행할 수 있습니다.
다음은 3. Method 섹션에 대한 AI 연구자를 위한 핵심 요약 노트와 쉬운 설명입니다.
Summary Note: Method (QTSplus)
1. Problem Formulation
- Input: Long video $V$ ($T$ frames, potentially $>10^5$) 및 Text Prompt $\mathcal{Q}$.
- Vision Tokenization: ViT encoder를 통해 $M$개의 visual tokens 생성. ($M$은 수백만 개에 달할 수 있음).
- Goal: 전체 $M$개 중 Query와 관련된 $n$개만 선택 ($n \ll M$)하여 LLM에 전달.
2. QTSplus Architecture (Query-Aware Token Selector)
Step 1: Cross-Attention Scoring (Relevance 측정)
- Method: Text tokens($Q$)와 Visual tokens($K, V$) 간의 Multi-head cross-attention 수행.
- Metric: 각 visual token $i$의 중요도 $r_i$는 모든 head와 layer 중 최대 attention weight로 정의.
- $r_i = \max_{h, \ell} \alpha_{h,\ell,i} \in [0, 1]$
- Intuition: 질문의 어떤 단어라도 해당 이미지를 강하게 주목하면 높은 점수 부여.
Step 2: Adaptive Budget Estimation (핵심 Novelty)
- Mechanism: "Budget Head"($\mathcal{B}_\psi$, MLP)가 Query 및 Video Statistics를 입력받아 Retention Fraction $\rho$를 예측.
- Input Factors & Rationale:
- $s_q$ (Mean query embedding): Semantic difficulty 측정. (단순 검색 vs 복잡한 요약 구분).
- $\log M$ (Log of total tokens): 비디오 길이에 따른 Scale stability 확보 및 단조 증가(monotonic) 예산 유도.
- $\max_i r_i$ (Peak relevance): Confidence spike. 특정 구간이 매우 중요하면(High peak) 예산을 줄여도 됨.
- $H(p)$ (Entropy of relevance): Dispersion signal. 정보가 흩어져 있으면(High entropy) 예산을 늘림.
Step 3: Top-n Gate (Training vs Inference)
- Training: 미분 가능성을 위해 Gumbel-Softmax와 Newton iterations 사용.
- 기대값 $\rho M$을 만족하는 Threshold $t$를 찾고, Soft mask 생성.
- Inference: $r$ 점수 기반 Hard Top-n 선택.
- Ordering: 선택된 토큰들은 원래의 temporal order를 유지하며 정렬됨.
Step 4: Lightweight Re-encoding
- Process: 선택된 토큰들($Z$)에 Absolute time info를 더하고 Self-attention block 통과.
- Purpose: 듬성듬성 선택된 토큰들 사이의 Temporal consistency를 복원하고 Global coverage를 유지.
3. Teacher Distillation & Objective
- Teacher-Student Setup:
- Teacher: Full visual tokens를 보는 Qwen2.5-VL.
- Student: Compressed tokens를 보는 QTSplus.
- Loss Functions:
- $\mathcal{L}_{mcq}$: Teacher가 검증한 정답에 대한 Cross-Entropy.
- $\mathcal{L}_{vqa}$: Teacher의 생성 답변에 대한 Sequence-level distillation.
- $\mathcal{L}_{total}$ (Compute-aware Loss):
- Standard SFT Loss + Efficiency Penalties.
- Penalty terms: $\lambda_t \frac{(\rho M)^2}{n_{max}^2}$ (Attention cost, Quadratic) + $\lambda_m \frac{\rho M}{n_{max}}$ (KV memory, Linear).
쉬운 설명 : Method
이 섹션은 **"QTSplus가 어떻게 똑똑하게 중요한 장면만 골라내는가?"**에 대한 구체적인 방법을 설명합니다.
- 1단계: 점수 매기기 (Scoring)
- AI가 사용자의 질문(Query)을 보고, 비디오의 각 장면(Token)이 질문과 얼마나 관련이 있는지 채점합니다. 질문의 단어 하나라도 "이 장면 중요해!"라고 신호를 보내면 높은 점수를 받습니다.
- 2단계: 예산 짜기 (Budgeting) - 여기가 핵심!
- 무조건 상위 100개를 뽑는 게 아닙니다. 상황에 따라 몇 개를 뽑을지 AI가 스스로 결정합니다.
- 질문이 어려운가? (단순 검색이면 조금만, 요약이면 많이)
- 비디오가 긴가? (길면 전체적인 양을 늘림)
- 결정적 힌트가 있는가? (확실한 정답 장면이 있으면 그것만 뽑음)
- 정보가 흩어져 있는가? (힌트가 여기저기 있으면 많이 뽑음)
- 이 4가지를 고려해서 "이번엔 전체의 5%만 보자" 혹은 "20%를 보자"라고 결정합니다.
- 3단계: 선별하고 다듬기 (Selection & Re-encoding)
- 점수가 높은 순서대로 장면을 뽑습니다.
- 중요한 건, 뽑힌 장면들이 뚝뚝 끊겨 있어도 문맥을 이해할 수 있도록 "이건 10분 3초 장면, 저건 50분 1초 장면"이라는 시간 정보를 다시 입혀서 정리해 줍니다.
- 4단계: 선생님 따라하기 (Training)
- 모든 비디오를 다 본 **Teacher 모델(Qwen2.5-VL)**에게 배웁니다.
- "내가 다 보고 푼 정답이랑, 네가 요약해서 푼 정답이랑 같아야 해"라고 가르치면서, 동시에 "하지만 토큰은 최대한 적게 써야 해"라는 벌칙(Penalty)을 주어 효율성을 학습시킵니다.
주인장 이해
1. 입력 (Input)
수만 장의 프레임으로 이루어진 긴 비디오와 사용자의 텍스트 질문이 들어옵니다.
2. 비전 인코더 (Vision Encoder)
비디오 프레임을 ViT(Vision Transformer)에 통과시켜 수십만 개의 **비전 토큰(의미를 가진 벡터들)**으로 변환합니다.
3. 텍스트 임베딩 (Text Embedding)
사용자의 질문 텍스트를 토크나이징하고 임베딩하여 텍스트 쿼리 벡터로 만듭니다.
4. 크로스 어텐션 채점 (Scoring)
**텍스트(질문)**와 **비전 토큰(영상)**을 교차 어텐션하여, 각 비디오 토큰이 질문과 얼마나 관련 있는지 중요도 점수를 매깁니다.
5. 예산 예측 (Adaptive Budgeting)
별도의 작은 신경망이 질문의 난이도를 보고 몇 개의 토큰(n개)을 남길지 결정합니다. (학습때는 미분을 위해 스코어에 약간의 노이즈를 더한후 소프트 맥스 값을 역전파 시킴. 0과 1이 아니라 .)
6. 토큰 선별 (Token Selection)
계산된 점수를 바탕으로 상위 n개의 핵심 토큰만 남기고 나머지는 버립니다.
7. 재인코딩 (Re-encoding)
살아남은 토큰들이 시간 순서를 잊지 않도록 절대 시간 정보를 더해주고, 가벼운 레이어로 한 번 더 다듬습니다.
8. 결합 (Concatenation)
압축된 비전 토큰들과 아까 만들어둔 텍스트 쿼리 벡터를 하나의 긴 줄로 이어 붙입니다.
9. LLM 처리 (LLM Processing)
LLM이 이 이어진 데이터를 읽고, 압축된 시각 정보와 텍스트 질문을 통합해 추론을 시작합니다.
10. 최종 출력 (Final Output)
LLM이 답변을 생성하여 최종 텍스트 답변을 내놓습니다.
