관리 메뉴

AI바라기의 인공지능

bench : 빠른 논문 리뷰 : Parse, Align and Aggregate: Graph-Driven Compositional Reasoning for Video Question Answering 본문

논문리뷰

bench : 빠른 논문 리뷰 : Parse, Align and Aggregate: Graph-Driven Compositional Reasoning for Video Question Answering

AI바라기 2026. 9. 14. 15:23

용어 설명

  • QPVA3 (Question Parsing, Video Alignment, and Answer Aggregation): 복잡한 VideoQA 문제를 질문 파싱(Planner), 비디오 정렬(Executor), 답변 취합(Reasoner)의 세 단계 그래프 기반 인과/논리적 추론으로 분해해 해결하는 프레임워크.
  • Compositional Graph (합성 그래프): 복잡한 high-level 질문을 leaf node(직접 관찰 가능한 atomic perceptual question)부터 상위 추론 질문까지 DAG(Directed Acyclic Graph) 형태로 구조화한 논리적 질문 분해 그래프.
  • Video Aligner (비디오 정렬기): 질문과 관련된 핵심 비디오 구간(relevant clips)을 찾기 위해 object, appearance, motion feature를 계층적으로 융합하고, Weakly-supervised Contrastive Learning 및 Next-token prediction loss로 학습되는 경량 모듈.
  • Compositional Consistency (합성 일관성): 모델이 본 질문(main question)을 맞혔을 때, 그 근거가 되는 하위 질문(sub-questions)들도 올바른 논리적 이유로 맞혔는지를 평가하는 척도.
  • cP, cR, c-F1 (Consistency Precision, Recall, F1): 기존 메트릭(CA, RWR, Delta)의 비대칭성(asymmetry)과 표본 불균형 시 발산하는 불안정성(instability)을 수학적으로 극복하기 위해 제안된 대칭적이고 안정적인 일관성 평가 지표.
  • QPVA3 Bench: 비디오 scene graph 변환에 의존하지 않고, LLM 보조 및 human expert 검증 파이프라인을 통해 7개 질문 유형과 2개 복잡도 레벨로 밸런싱하여 구축한 3,492개의 VideoQA 벤치마크.

Purpose of the Paper

  • 기존 MLLM의 불투명성 및 비검증성 극복: 최신 Video-MLLM(VideoLLaMA, Video-LLaVA 등)은 복잡한 질문에 대해 단답형 정답이나 모호한 단서만을 제공하며, 어떤 비디오 구간을 근거로 어떤 논리적 단계를 거쳐 답을 도출했는지 추적/검증하기 어려움.
  • 기존 Scene Graph 기반 데이터셋 구축 한계 극복: AGQA 등 기존 compositional reasoning 데이터셋은 인력 소모가 극심한 비디오 spatiotemporal scene graph 주석에 의존하여 도메인 확장 및 다양한 추론(commonsense, causal) 반영에 한계가 존재함.
  • 불안정한 평가 메트릭 교체: 기존 AGQA-Decomp에서 사용되던 CA(Compositional Accuracy), RWR(Right for Wrong Reason), Delta 메트릭의 수학적 비대칭성과 극단적 민감도(섭동 시 미분 불가능 수준의 불안정성) 문제를 해결하고자 함.
  • 해결 접근법: 비디오가 아닌 질문 자체를 인과적/논리적 구조를 가진 DAG 형태의 Compositional Graph로 파싱하고, 비디오 정렬 및 단계별 텍스트-비주얼 충돌 중재(arbitration)를 수행하는 투명한 화이트박스형 VideoQA 파이프라인 제안.

Key Contributions & Novelty

  • Unified QPVA3 Reasoning Framework:
    • Planner: Vision-agnostic 외부 파서를 대체하여 비디오 컨텍스트를 인식하는 MLLM 기반 파서(LoRA fine-tuning)로 복잡한 질문을 JSON 형태의 Compositional Graph로 분해.
    • Executor: Object, frame, clip feature를 상향식으로 결합하는 경량 3계층 Transformer 기반 Video Aligner를 통해 잡음 배경 구간을 필터링하고 MLLM으로 서브 질문 답변 생성.
    • Reasoner: GNN 기반 학습 방식 대신 Training-free 2단계 추론기 도입. 1단계로 LLM이 텍스트 논리 기반 derivation 및 conflict 감지를 수행하고, 충돌 발생 시 2단계 MLLM이 비디오 증거를 직접 대조하여 최종 중재(adjudication).
  • 수학적으로 증명된 신규 메트릭 (cP, cR, c-F1):
    • 하위 질문 정답과 본 질문 정답 간의 불일치 케이스(N-+ 와 N+-)의 위치를 교환해도 값이 불변함을 입증(Symmetry).
    • 분모가 0에 수렴하여 점수가 0에서 1로 튀는 기존 RWR/Delta의 문제를 해결하고, 표본 섭동(delta)에 대해 bounded 변화율을 가짐을 수학적으로 증명(Stability).
  • QPVA3 Bench 벤치마크 구축:
    • MSVD, MSRVTT, TGIF-QA, NExT-QA, Causal-VidQA 등 5개 데이터셋에서 2단계 샘플링(대표성 추출 및 다양성 계층화 추출)을 통해 3,492개 고품질 VQ 쌍 선별.
    • Scene graph 없이 LLM 생성 및 전문가 검수(Human-in-the-loop)를 거쳐 9,509개 중간 질문, 20,231개 leaf 질문, 9.03개 평균 노드 깊이의 세분화된 주석 제공.

Experimental Highlights

  • 주요 벤치마크 실험 설정:
    • Datasets: QPVA3 Bench, AGQA-Decomp, Causal-VidQA, STAR, MVBench, ActivityNet-QA (총 6개).
    • Backbone Models: LLaMA3.2-8B (LLM), VideoLLaMA3, LLaVA-OneVision, Qwen2-VL (MLLM alternatives).
  • Compositional Graph 제약 벤치마크 성능 (Table III, IV):
    • QPVA3 Bench: VideoLLaMA3 기준 Main Acc 41.2% -> 47.0% (+5.8%), Sub Acc 68.0% -> 77.3% (+9.3%), c-F1 46.2% -> 55.7% (+9.5%) 달성.
    • AGQA-Decomp: VideoLLaMA3 기준 Main Acc 69.2% -> 74.6%, Sub Acc 76.7% -> 84.1%, c-F1 70.9% -> 81.8% 달성. Sub-question에서 더 큰 폭의 개선을 보여 서브 쿼리의 잡음 제거 효과를 입증.
  • Zero-shot/Open-ended 및 Multi-Choice 벤치마크 (Table V, VI):
    • Causal-VidQA: 인과 추론 관련 세부 영역(Explanatory, Predictive, Counterfactual)에서 큰 폭 향상 (예: VideoLLaMA3 Acc@All 64.8% -> 67.5%, Qwen2-VL 68.0% -> 71.2%).
    • MVBench: 복잡한 인과/시간 추론을 요구하는 태스크(CI, Counterfactual Inference 등)에서 단순 인식(FP, Fine-grained Pose) 대비 유의미하게 높은 성능 향상 기록 (MLLM 평균 2.2%~3.1% 향상).
  • Ablation & Frame Sensitivity (Table VIII, IX, Fig. 7):
    • Planner의 비디오 인식 MLLM 도입으로 External Parser 대비 video-irrelevant graph 오류를 13.5%에서 0.8%로 급감시킴.
    • 사전학습된 비디오 그라운딩 모델(CG-STVG)로 Video Aligner를 대체할 경우 문맥 정보 손실로 인해 Aligner를 아예 제거한 것보다 더 큰 성능 하락 발생.
    • Executor는 8~16 프레임 수준에서 모션 큐 포화로 성능이 수렴하는 반면, Reasoner는 프레임 수가 증가할수록(최대 32) 시각적 중재 정확도가 지속 상승.

Limitations and Future Work

  • Sub-Question 오류 전파에 대한 취약성 (Cascade Errors):
    • 정성적 실패 사례(Fig. 9b)에서 드러나듯, 다수의 하위 leaf sub-question에서 오답(잘못된 감정 추정 등)이 발생할 경우, 텍스트 기반 LLM Reasoner가 논리적으로는 그럴듯하지만 사실과 다른 서사를 형성하게 됨.
    • 2단계 MLLM 중재 과정에서도 형성된 잘못된 논리 체인에 편향되어 명백한 비주얼 증거(슬로프에서 미끄러지는 시각 결과)를 무시하고 오답을 선택하는 문제 발생.
  • 향후 연구 방향 (Future Work):
    • 하위 답변의 신뢰도(Confidence Score)를 함께 전파하여 불확실한 서브 답변에 가중치를 낮추는 메커니즘 필요.
    • 더 복잡하고 긴 비디오 내러티브에 대해 그래프 구조를 동적으로 재구성하거나 역방향 피드백(Top-down visual verification)을 주는 양방향 추론 아키텍처로의 확장 계획 명시.

Overall Summary

본 논문은 기존 Video-MLLM의 블랙박스형 추론과 불투명한 답변 과정을 해결하기 위해, 질문을 의미적/인과적 서브 그래프로 분해하고 관련 비디오 구간을 정렬하여 상향식으로 검증·통합하는 QPVA3 프레임워크를 제안합니다. 또한 기존 합성 일관성 지표의 수학적 불안정성을 극복하는 c-F1 메트릭 체계를 정립하고, scene graph 없이 LLM과 인간 검수를 통해 구축한 고품질 QPVA3 Bench를 공개했습니다. 실험을 통해 복잡한 시공간 및 인과 추론 벤치마크 전반에서 정확도와 일관성을 동시에 대폭 개선함을 입증함으로써, 설명 가능하고 검증 가능한 VideoQA 연구의 새로운 표준을 제시했습니다.


쉬운 설명

복잡한 추리 소설의 범인을 한 번에 찍어 맞히라고 하면 아무리 똑똑한 탐정(MLLM)이라도 대충 둘러대며 찍을 확률이 높고, 왜 그렇게 생각했는지 알 수 없습니다.
이 논문의 핵심 아이디어는 **"탐정에게 질문을 받자마자 논리적인 수사 계획표(Compositional Graph)부터 그리게 한 뒤, 각 단서(하위 질문)마다 사건 현장의 특정 CCTV 구간(Video Aligner)만 집중 확인하게 하고, 수집된 단서들 사이에 모순이 생기면 직접 CCTV를 다시 대조(Reasoner)하여 최종 결론을 내리게 만드는 수사 프로토콜"**입니다. 이를 통해 엉뚱한 이유로 우연히 정답을 맞히는 '찍기'를 방지하고, 모든 추론 과정을 인간이 한 단계씩 투명하게 검증할 수 있게 만듭니다.

 

 

 

 

더보기

목적

VideoQA의 고질병인 '과정 없는 정답(블랙박스 추론)'을 없애고, 추론 과정을 투명하고 검증 가능(Transparent & Verifiable)하게 만드는 것

모델이 "맞는 논리적 이유로 정답을 맞혔는지(Compositional Consistency)"를 수학적으로 안정적이고 공정하게 측정하는 것


흐름
일단 16 프레임 보고 대충 답ㄱ내게끔 함. 

그리고 이어지는 흐름

MLLM을 파인튜닝시켜서 질문을 분해하게함.
영상에서 눈으로 바로 확인할 수 있는 가장 단순한 단위의 세부 질문들(Atomic questions)까지 트리/그래프 구조(JSON 형태)로 쪼갠다.

그래프인 이유는 딱히 없는 것 같음. 미사여구뿐

노드는 개별질문 그 자체, 엣지도 모델이 연결(인과 종속성 관계)


디텍션 모델로 객체 특징뽑고
비디오 전체를 16프레임으로 해서 특징 뽑고
스윈 트랜스포머로 1개짜리 벡터 뽑음

이걸로 질문이랑 어텐션 때려서 검벨 소프트 맥스 취해서 가져올 구간을 정하게 됨. 일종의 유사도 느낌

그럼 하위 질문당 구간이 잡히게 됨

답을 다 달고 순수 텍스트 모델에게 쭉 넘기고 답을 내게시킴. 

앞서 구한 답과 충돌이면 판사 mllm을 불러와서 다른 두개의 답을 주고 최종 판결 내리라고 함. 영상도 같이 보면서

그게 최종 정답

 

 

질문 자체를 분해함. 풀이 플래닝을 분해한게 아님