관리 메뉴

AI바라기의 인공지능

VLM : 빠른 논문 리뷰 : ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding 본문

논문리뷰

VLM : 빠른 논문 리뷰 : ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding

AI바라기 2026. 10. 2. 22:04


용어 설명

  • GOP (Group of Pictures): 비디오 압축 코덱(예: H.264, HEVC)에서 비디오 스트림을 구성하는 프레임들의 기본 묶음 단위. 하나의 기준 키프레임(I-frame)과 이전/이후 프레임을 참조하여 압축된 프레임들(P/B-frame)로 구성됩니다.
  • I-frame (Intra-coded frame): 다른 프레임의 참조 없이 독자적으로 완전한 이미지 정보를 담고 있는 압축 도메인의 키프레임(anchor point).
  • P-frame / B-frame (Predictive / Bi-predictive frame): 전체 픽셀 데이터를 저장하지 않고, 이전(P) 또는 이전/이후(B) 참조 프레임 대비 변화된 움직임(Motion Vector)과 잔차(Residual)만을 기록하여 용량을 대폭 줄인 프레임.
  • Motion Vector (MV): 코덱 내부에서 블록 매칭을 통해 이전 프레임의 블록이 현재 어디로 이동했는지를 나타내는 2차원 변위 벡터. 계산 비용이 매우 저렴하나, 매크로블록 단위(예: 4 x 4)로 이산화되어 있어 노이즈가 많고 해상도가 거칩니다.
  • RMR (Refined Motion Representation) Module: 코덱에서 추출한 거칠고 노이즈가 심한 블록 단위 Motion Vector를 dense optical flow 수준의 정밀하고 매끄러운 연속 모션 표현으로 복원 및 변환하는 모듈.
  • HMSS (Hierarchical Motion State Space) Module: 압축 비디오의 GOP 계층 구조를 반영하여 선형 계산 복잡도(linear time)로 시계열 정보를 압축하고 장기 의존성을 모델링하는 양방향 Mamba 기반 모듈.
  • Scene-adaptive GOP Construction: 고정된 시간 간격으로 프레임을 자르지 않고, 화면 전환(scene transition)이 발생하는 시점을 코덱 감지를 통해 감지하여 동적으로 I-frame을 삽입하고 GOP 길이를 조절하는 전처리 기법.

Purpose of the Paper

  • 기존 연구의 한계 극복:
    • 기존 비디오 MLLM(Multimodal Large Language Models)은 수 분에서 수 시간에 달하는 긴 비디오를 처리할 때 모든 RGB 프레임을 완전 디코딩(decoding)한 후 균일 샘플링(uniform sampling)을 수행합니다.
    • 이는 배경과 같은 중복 시각 정보를 반복 인코딩하게 만들어 극심한 연산 낭비를 초래하며, Transformer의 self-attention 복잡도(quadratic complexity) 때문에 입력 프레임 수에 치명적인 제약이 발생합니다. 그 결과, 짧지만 중요한 순간적인 행동이나 미세한 시간적 이벤트를 놓치게 됩니다.
  • 새로운 접근 방식:
    • 비디오를 픽셀 단위로 전부 풀어서 다루는 대신, 이미 비디오 스트림 내에 존재하는 **압축 도메인 표현(compressed video representation)**을 직접 활용합니다.
    • 시각적 외형(appearance)은 극소수의 I-frame(RGB)으로만 파악하고, 프레임 간의 연속적인 시간적 동역학(temporal dynamics)은 P/B-frame의 Motion Vector를 정제하여 효율적인 모션 프록시(proxy)로 사용함으로써, 전체 디코딩 없이도 극도로 조밀한 시간 범위를 커버하는 아키텍처를 제안합니다.

Key Contributions & Novelty

  • ReMoRa 프레임워크 제안 (Novelty: 압축 도메인 네이티브 MLLM):
    • 비디오 디코딩 오버헤드를 우회하고, I-frame과 저비용 Motion Vector만을 직접 결합하여 긴 비디오를 처리하는 엔드투엔드 비디오 MLLM 아키텍처를 확립했습니다.
  • RMR (Refined Motion Representation) Module (Novelty: Motion Vector의 Optical Flow화):
    • 코덱에서 나오는 이산적이고 거친 4 x 4 블록 기반 Motion Vector의 한계를 극복하기 위해, 사전 학습 단계에서 고성능 point tracker(Co-Tracker3)가 생성한 dense optical flow를 타깃으로 삼아 L2 loss 기반 정밀화 학습을 수행했습니다.
    • 추론 단계에서는 무거운 optical flow 모델을 직접 구동하지 않고도 가벼운 Motion Vector를 dense motion embedding으로 정제해 냅니다.
  • HMSS (Hierarchical Motion State Space) Module (Novelty: GOP 계층을 모사하는 2단계 SSM):
    • 비디오의 코덱 구조(GOP 내부 및 GOP 간 관계)를 정확히 반영하는 2단계 Mamba 아키텍처를 도입했습니다.
    • 1단계 (Codec-aware Selective Scan): GOP 내부에서 I-frame 외형 토큰과 정제된 P/B-frame 모션 토큰을 양방향 Mamba로 상호작용시킨 뒤, 모션 정보가 응축된 첫 Np개의 I-frame 토큰만 추출하여 시퀀스 길이를 대폭 압축합니다.
    • 2단계 (Bidirectional Token Mixer): 전체 GOP들의 요약 토큰들을 모아 비디오 전체의 장기 의존성(long-range context)을 선형 시간 복잡도로 통합합니다.
  • Scene-adaptive Video Preprocessing:
    • 기계적인 등간격 샘플링 대신 ffmpeg의 장면 감지 알고리즘을 이용해 시각적 단절(scene change)이 일어나는 순간에만 I-frame을 동적으로 삽입하여 정보 손실을 최소화했습니다.

Experimental Highlights

  • 주요 벤치마크 SOTA 달성 (Table 1):
    • LongVideoBench: 60.8점을 기록하며 기존 최고 모델(BIMBA 59.5, Qwen2.5-VL 59.5) 대비 +1.3점 우위 달성.
    • NExT-QA: 84.2점을 기록하며 LLaVA-Video(83.2) 및 BIMBA(83.2) 대비 +1.0점 갱신.
    • MLVU: 72.1점을 기록하며 기존 최고(LLaVA-Video 70.8) 대비 +1.3점 향상.
    • 6개 대표 벤치마크 전체 평균 점수에서 69.8점을 기록하여 비교 대상 베이스라인 중 1위 달성.
  • Open-ended VideoQA 성능 (Table 2):
    • ActivityNet-QA: Accuracy 60.5점, Score 3.7점을 달성하여 기존 최고 모델(EMA: Acc 52.1, Score 3.5)을 Accuracy 기준 +8.4점이라는 큰 격차로 압도.
    • MSVD-QA: Accuracy 73.1점, Score 4.0점으로 최상위권 성능 입증.
  • 자원 및 메모리 효율성 (Table 6):
    • 단일 NVIDIA H200 SXM GPU 환경에서 LLaVA-Video 대비 peak memory 사용량을 23.21 GB에서 10.59 GB로 54% 이상 절감.
    • 디코딩 프레임 수를 대폭 줄이면서도 BIMBA(10.60 GB, 0.39 samples/s)와 유사한 처리 속도(0.40 samples/s, 24.45 tokens/s)를 유지.
  • 주요 Ablation 결과 (Table 3, 4, 5):
    • RMR 효과: Optical flow 정렬 사전 학습을 제거(w/o Align)하면 VideoMME 기준 -0.9점, NExT-QA 기준 -2.0점 하락하며, RMR 모듈 자체를 제거(w/o RMR)하면 VideoMME 및 NExT-QA에서 각각 -2.2점 하락.
    • HMSS 효과: HMSS 대신 단순 cross-attention으로 GOP를 통합할 경우 -1.8점 / -2.3점 하락, 단순 덧셈(Add) 융합의 경우 -3.0점 / -2.7점 하락하여 SSM 기반 2단계 구조의 유효성을 증명.
    • 샘플링 전략: CVR 기반 64프레임(64.3점) 대비 고정 균일 샘플링(Uniform 64프레임: 62.4점) 시 1.9점의 뚜렷한 성능 하락 확인.

Limitations and Future Work

  • Spatial Comprehension 한계 (오류 분석 1위, 22/67건):
    • I-frame이 강력한 외형 앵커 역할을 하지만, 중간 프레임들이 희소한 모션 벡터로만 주어지기 때문에 물체의 정확한 좌우 위치 파악, 인접 물체 간의 혼동, 비디오에 없는 물체를 언급하는 환각(hallucination) 문제가 가장 빈번하게 발생했습니다.
  • Long-range Temporal Comprehension 혼선 (오류 분석 2위, 21/67건):
    • 장면 전환이 많거나 매우 긴 비디오에서 사건의 전후 순서를 혼동하거나 이전 장면의 정보를 나중 장면에 잘못 투영하는 시간적 순서 오류가 나타났습니다. 키프레임과 모션 큐 간의 장기적 temporal alignment를 더 정교하게 유지하는 집계 기법이 필요합니다.
  • 미세 모션(Micro-motion) 캡처의 한계 (14/67건):
    • RMR 모듈로 정제하더라도 원본 신호가 4 x 4 블록 단위 변위이므로, 손가락의 미세한 움직임, 작은 물체 조작, 매우 빠르고 복잡한 제스처를 완벽하게 재구성하지 못하고 놓치는 현상이 존재합니다.
  • Future Work 방향:
    • 공간적 접지(spatial grounding) 능력을 보강하기 위해 I-frame 특징과 정제된 모션 간의 공간-시간 교차 주의집중 메커니즘 고도화 필요.
    • 더 정교한 압축 포맷(예: HEVC, AV1의 다양한 파티션 크기)을 지원하여 미세 모션 표현력을 극대화하는 연구로 확장 가능.

Overall Summary

ReMoRa는 긴 비디오 이해에서 발생하는 막대한 연산 비용과 프레임 중복 문제를 해결하기 위해, 디코딩된 RGB 시퀀스 대신 **압축 비디오 스트림(I-frame 및 Motion Vector)**을 직접 활용하는 비디오 MLLM입니다. 코덱 특유의 거칠고 노이즈가 많은 모션 벡터를 고품질 optical flow 수준으로 복원하는 RMR 모듈과, GOP 구조를 모사하여 선형 시간 복잡도로 시간 의존성을 모델링하는 HMSS(Mamba 기반) 모듈을 설계했습니다. 그 결과 LongVideoBench, NExT-QA, MLVU 등 주요 벤치마크에서 SOTA를 달성함과 동시에 GPU 메모리 사용량을 기존 대비 절반 이하로 줄임으로써, 압축 도메인 기반의 효율적이고 확장성 높은 장기 비디오 분석의 새로운 패러다임을 제시했습니다.


쉬운 설명

비유하자면, 1시간짜리 애니메이션을 이해하기 위해 수만 장의 종이 그림을 1장씩 전부 고화질 컬러로 인쇄해서 검토하는 것은 시간과 책상 공간(메모리)이 감당되지 않습니다.

ReMoRa는 장면이 바뀔 때의 결정적인 대표 장면 몇 장만 고화질 컬러 그림(I-frame)으로 남겨두고, 그 사이사이에 일어나는 수많은 변화는 투명 필름에 연필로 대충 끄적인 **'이동 궤적 화살표'(Motion Vector)**만 가져옵니다. 그런 다음 이 거친 화살표 스케치를 전문 복원가(RMR 모듈)가 정교하고 매끄러운 움직임 선으로 다듬고, 이를 2단계 요약 정리 기술(HMSS 모듈)을 통해 책을 넘기듯 순식간에 훑어보아 비디오의 핵심 줄거리와 디테일한 동작을 최소한의 노력으로 완벽하게 파악해 내는 방식입니다.

 

 

 

 

더보기

block
Block은 그냥 frame을 잘게 나눈 작은 직사각형 pixel 영역
[4×4][4×4][4×4]...
[4×4][4×4][4×4]...
[4×4][4×4][4×4]...
...

Reference frame
현재 frame을 압축할 때 비교 대상으로 사용하는 이미 복원 가능한 frame이 뭔지 이해.


Motion Estimation / Block Matching ← 다음에 이걸 이해해야 함
reference frame에서 가장 similar한 block을 찾고 displacement를 저장한다
라고만 되어 있음 ... ㅈㄴ 불친절

현재 frame의 어떤 block이 있을 때, reference frame의 어느 block이 이것과 가장 비슷한가? 를 알아야하는데...
유사도 계산하는 것 같음. 그렇게 아무튼 찾고

두 좌표 차이를 계산한다고 함.... 

그게 Motion Vector 인셈인데

그 Motion Vector를 이용해서 reference frame의 매칭된 block을 현재 block 위치로 가져옴

블록 단위로 과거 reference frame을 이용해 현재 P-frame을 재구성한다는 것 같음.

Motion vector는 block 단위로 구하고 → 그걸 이용해 predicted frame 전체를 만든 뒤 → 실제 current frame과 predicted frame의 pixel-wise 차이가 residual.

현재 프레임 = Motion Vector + Residual (당연한건데 뭐 압축 쪽 지식으론 분해하는게 낫나봄 압축 도 잘 되고)




GOP (Group of Pictures):
여러 frame을 하나의 묶음으로 관리하는 단위

I-frame: 다른 frame 없이도 독립적으로 복원 가능한 완전한 이미지
P-frame: 이전 reference frame과의 차이 + motion만 저장 
위에 설명 있음.

B-frame: 앞/뒤 reference frame을 이용해서 차이 + motion을 저장
P랑 똑같은데 앞에서 가져올지 뒤에서 가져올지, 혹은 합칠지 아무튼 블록당 무언가 대체할 게 있긴함. 같은 양으로
그리고 P랑 똑같음

나눈 기준은
씬이 크게 바뀌는 지점으로, 최대 32길이


화면 전체 변화는 작지만, QA에 중요한 객체만 바뀌는 경우.를 잡아주진 않는 것 같음


RMR (Refined Motion Representation) Module
입력 만드는 단계
I frame 은 RGB 이미지를 image encoder에 넣어서 appearance embedding 생성
P/B는 motion vector field m만 사용  -> RMR이라는 모듈을 정의 하고 그걸 로 임베딩 생성한다고 함
concat
↓
Z^(k)


fps는 대략 16 이라고함.16 fps × 3600초 = 57,600 frames ㄷㄷ

bidirectional Mamba(SSM)에 통과 시켜서 Z(k)  를 업데이트 해서 일단 정보 교환시키고, [I-frame patch tokens Np개]만 가져옴

그래서 영상 전체가 기준프레임마다로 줄었음. 

그걸 다시 글로벌 바이디렉셔널 맘바에 태워버림 그 출력이 바로 LLM 입력이 되는건 아니고 projector 도 달아서 학습시켜야댐

그렇게 최종 VLM 입력 으로 들어감.


ReMoRa는 P/B-frame의 appearance 정보를 버리기 때문에 scene change는 작지만 의미적으로 중요한 객체 변화가 손실될 수 있다. 또한 scene-change 기반 keyframe이 semantic importance를 보장하지 않고, 실제 long-video를 64 GOP 수준으로 어떻게 커버하는지 설명도 충분히 명확하지 않다. 핵심 입력인 codec motion vector의 생성·처리를 지나치게 black box로 넘겼다는 점도 재현성과 해석 측면에서 한계가 있다. 더불어 BIMBA 대비 실제 throughput 이득이 거의 없고, compressed-domain 활용 자체도 기존 연구가 있어 novelty는 새로운 원리라기보다 여러 기존 요소의 조합에 가깝다.




3점인데...

이미 있는 아이디어 재조합이라면

 

2.5점 / 5점