관리 메뉴

AI바라기의 인공지능

VLM : 빠른 논문 리뷰 : HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling 본문

논문리뷰

VLM : 빠른 논문 리뷰 : HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling

AI바라기 2026. 8. 18. 20:38

용어 설명 (Terminology)

  • Video Temporal Grounding (VTG): 자연어 Query가 주어졌을 때, 편집되지 않은 긴 Video(untrimmed video) 내에서 해당 내용이 발생하는 정확한 시작 시간과 종료 시간(ts, te)을 찾아내는 Vision-Language Task.
  • Anchor-MambaPooling (AMP) Block: 이 논문에서 제안한 핵심 모듈로, Video Clip Feature 사이에 압축용 Anchor Token을 끼워 넣고 Mamba의 Selective Scan을 통해 선형 시간 복잡도(Linear Time Complexity)로 Multi-Scale Temporal Feature Pyramid를 생성하는 블록.
  • State Space Model (SSM) & Mamba / Hydra: Transformer의 Quadratic Self-Attention 비용을 대체하여 선형 시간(O(N))으로 Long-Range Dependency를 모델링하는 아키텍처. 본 논문에서는 양방향 스캔(Bidirectional State-Space Scan)이 가능한 Hydra를 Global Context 모델링에 사용.
  • Anchor-Conditioned Contrastive (ACC) Loss: 각 계층(Layer)의 Anchor Token이 자신이 대표하는 Local Temporal Window 내의 Frame Token들을 가깝게 끌어당기고(Compactness), 시간적으로 먼 Distant Anchor들과는 밀어내도록(Distinctiveness) 학습하는 Self-Supervised Objective.
  • Segment-Pooled Contrastive (SPC) Loss: Ground-Truth(GT) 구간 내 Frame Token들을 하나의 Segment Prototype Vector로 Pooling한 후, 이를 Positive Anchor로 삼아 GT 내부 Token과는 정렬하고 외부 Non-GT Token과는 반발하도록 만드는 Supervised Semantic Alignment Objective.

Purpose of the Paper

  • 기존 연구의 한계 극복:
    • 기존 Long-Video Temporal Grounding(LVTG) 모델들은 Transformer의 Quadratic Self-Attention 계산 복잡도를 회피하기 위해 Naive Downsampling, Fixed-Length Pooling, 또는 Sliding Window 휴리스틱을 채택함.
    • 이로 인해 수 분에서 수 시간에 이르는 장시간 비디오에서 미세한 세부 동작(Fine-Grained Temporal Detail)이 손실되거나 Window 경계면에서 시계열 연속성이 끊어지는 문제(Fragmentation) 발생.
  • 새로운 접근 방식:
    • 시간적 해상도를 무차별적으로 깎아내리지 않고 Video Full Sequence 전체를 선형 시간으로 처리할 수 있는 Hierarchical State-Space Architecture (HieraMamba) 제안.
    • 단순 Strided Pooling이 아닌 Token 단위 압축(Token-Level Content-Aware Abstraction) 기반의 Multi-Scale Temporal Hierarchy를 구축하여 짧은 순간의 세부 동작과 장시간의 포괄적 Context를 동시에 보존.

Key Contributions & Novelty

  • HieraMamba Architecture:
    • 1시간 이상의 Long-form Video에서도 연산량 폭증 없이 동작하는 최초의 Hierarchical State-Space 기반 Temporal Grounding 모델.
  • Anchor-MambaPooling (AMP) Block (Novelty):
    • Anchor Interleaving: s개 프레임마다 생성된 Anchor Token을 해당 입력 프레임 직전에 배치하여 단일 시퀀스로 구성, Bidirectional Mamba Scan을 통해 Anchor와 Frame 간 상호 정보 교환 지원.
    • Global-Local Decoupled Encoding: 전역 구조(Global Context)는 Linear Complexity를 지닌 Hydra(Forward-Backward SSM Scan)로 모델링하고, 미세한 단기 패턴은 Window Size 5의 초경량 Local Transformer로 분리 처리.
    • Content-Adaptive Gating: 무조건적 Residual 덧셈 대신 Learnable Sigmoid Gate를 통해 Salient Information만 선택적으로 상위 Hierarchy 계층으로 전파.
  • Duo Contrastive Learning Objectives (Novelty):
    • ACC Loss: Unsupervised 방식으로 Anchor가 자신의 Temporal Window를 충실히 요약(Compact)하면서 다른 시점의 Event와 분리(Distinct)되도록 계층별 제약 부여.
    • SPC Loss: GT Segment의 다양한 하위 동작(예: Reaching, Grasping, Retracting) 다양성을 훼손하지 않도록 단일 Prototype으로 Pooling하여 정렬시킴으로써 Segment Representation의 판별력을 극대화.

Experimental Highlights

  • Evaluation Benchmarks & Setup:
    • Ego4D-NLQ (EgoVLP Feature, 평균 8.3분 비디오, 74K Queries, Target Moment가 전체 비디오의 2%에 불과한 고난도 Needle-in-a-Haystack 데이터셋)
    • MAD-v1 / MAD-v2 (CLIP Feature, 평균 110분의 장편 영화 비디오)
    • TACoS (C3D Feature, 127개 Cooking Video, 복합적 Action 중심)
    • Evaluation Metrics: R@1, R@5 (IoU 임계값 0.3, 0.5 기준) 및 Average Recall.
  • State-of-the-Art 성능 달성:
    • Ego4D-NLQ: Average Recall 25.66% 달성 (기존 최강 모델 SnAG 23.08%, DeCafNet 24.44% 대비 대폭 향상).
    • MAD-v2: Average Recall 18.05% 기록 (SnAG 15.25%, RGNet 14.87% 대비 +2.80%p 향상).
    • TACoS: Average Recall 66.65% 로 모든 지표에서 이전 SOTA(OSGNet 64.96%) 갱신.
  • Accuracy-Compute Trade-off (Efficiency):
    • MAD-v2 평가 기준, 전체 Video Context를 다루는 Transformer 기반 SnAG (Global) 대비 약 2.5배 적은 FLOPs를 사용하면서도 Average Recall은 +2.52%p 더 높은 압도적 Pareto Frontier 달성.
  • 주요 Ablation 결과:
    • Naive Mamba 모델(VideoMamba+SnAG 12.44%, SnAG-Mamba 22.88%)은 성능 개선이 없거나 하락하여, 단순 SSM 적용이 아닌 AMP 기반 Hierarchical 구조가 성능 향상의 본질임을 증명.
    • SPC Loss에서 Unpooled 방식(모든 토큰을 개별 Positive로 강제) 적용 시 24.05%로 하락하여, Pooled Prototype을 사용하는 것이 Intra-Segment Diversity 보존에 필수적임을 확인.

Limitations and Future Work

  • Frozen Video Backbone 의존성:
    • Backbone(EgoVLP, CLIP 등)을 고정한 채 Temporal Grounding Module만 학습하므로 모듈성은 높으나, Feature Learning과 Grounding Objective 간의 최적화가 분리됨.
    • Future Work: 거대 Backbone과의 End-to-End Joint Fine-tuning을 통한 표현력 극대화 연구 필요.
  • Fixed Temporal Stride Anchor Generation:
    • 고정된 Stride(s)로 Anchor를 생성하기 때문에 영상 내 정보량의 밀도 변화를 동적으로 반영하지 못함.
    • Future Work: 비디오 콘텐츠 밀도에 따라 정보가 많은 구간에는 촘촘하게, 적은 구간에는 성기게 Anchor를 할당하는 Adaptive Anchor Generation 메커니즘 도입 필요.
  • 물리적 / 기하학적 인지 한계 (Failure Modes):
    • 도구의 '가시성(Visibility)'과 실제 '사용(Usage)'을 혼동하거나, 카메라 움직임으로 인한 일시적 차폐(Occlusion) 시 인물이 사라진 것으로 인식하는 3D 공간/기하학적 추론의 한계 노출.

Overall Summary

HieraMamba는 장시간 비디오에서 Quadratic Attention 비용으로 인해 시간적 해상도를 희생하던 기존 VTG 모델의 병목을 Mamba 기반 선형 시간 Multi-Scale Pyramid 구조로 해결한 프레임워크입니다. 제안된 Anchor-MambaPooling(AMP) 블록과 상호 보완적인 두 가지 Contrastive Loss(ACC, SPC)를 통해 짧은 순간의 세밀한 동작과 긴 맥락의 전역 정보를 동시에 정확하게 보존합니다. Ego4D-NLQ, MAD, TACoS 등 대표적인 벤치마크에서 기존 최고 모델들을 모두 능가하며 연산 효율성과 정밀한 Grounding 성능을 동시에 입증했습니다.


쉬운 설명

책에서 특정 장면을 찾을 때, 일반적인 모델은 책이 너무 두꺼워 페이지를 10장씩 뭉텅이로 찢어 버리거나(Downsampling) 돋보기로 몇 줄씩만 좁게 훑어보다가(Sliding Window) 중요한 단서를 놓치는 문제가 있었습니다.

HieraMamba는 책 전체를 처음부터 끝까지 눈으로 매우 빠르게 훑으면서(Linear Mamba Scan), 챕터별·문단별·문장별로 핵심 요약 플래그(Anchor)를 층층이 꽂아두는 도서관 사서와 같습니다. 요약 플래그를 보고 거대한 전체 흐름을 파악하는 동시에, 필요한 순간에는 플래그 바로 아래의 원본 문장들을 정밀하게 검토할 수 있어 책의 두께와 상관없이 원하는 장면의 시작과 끝을 오차 없이 빠르게 찾아냅니다.