관리 메뉴

AI바라기의 인공지능

VLM : 빠른 논문 리뷰 : Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory 본문

논문리뷰

VLM : 빠른 논문 리뷰 : Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory

AI바라기 2026. 8. 20. 21:21


용어 설명

  • Episodic Memory (일화 기억): 비디오 내에서 관찰된 구체적인 시공간적 사건, 행동, 발화 내용을 기록하는 기억.
  • Semantic Memory (의미 기억): 관찰된 사건들로부터 추상화하고 일반화한 지식(인물의 성격, 역할, 선호도, 객체의 기능 및 규칙 등).
  • Entity-Centric Multimodal Graph: 인물이나 사물(Entity)을 중심으로 얼굴(image), 음성(audio), 텍스트(text) 지식 노드들을 엣지(edge)로 연결하여 다중 모달리티 간 일관성을 유지하는 그래프 형태의 장기 기억 구조.
  • Meta-Clip: 긴 비디오 내에서 정확히 한 명의 얼굴과 한 명의 음성만 등장하는 5초 미만의 짧은 단일 화자 영상 클립. 다중 인물 환경에서 얼굴-음성 간 매핑(Identity Equivalence)을 정밀하게 추출하기 위한 최소 단위로 활용됨.
  • Identity Equivalence Detection: 동일 인물의 시각적 특징(face ID)과 청각적 특징(voice ID)을 크로스모달로 연결하여 단일 character ID로 통합하는 과정.
  • DAPO (Direct Advantage Policy Optimization): LLM 에이전트의 Multi-turn 메모리 탐색 및 추론 정책(Control Policy)을 최적화하기 위해 적용된 강화학습(Reinforcement Learning) 알고리즘.
  • M3-Bench: 로봇 관점(Robot-perspective) 실생활 영상과 웹 영상에서 장기 기억 기반 추론 능력을 평가하기 위해 구축된 Long Video QA 벤치마크.

Purpose of the Paper

  • 기존 연구의 한계 극복:
    • 무한 스트림 처리 한계: 기존 Long Video Understanding 모델들은 고정된 길이의 오프라인 비디오 콘텍스트를 확장하거나 프레임을 압축하는 데 머물러, 무한히 지속되는 실시간 스트리밍 데이터를 처리하지 못함.
    • 단순 시각 특징 저장 및 텍스트 캡셔닝의 일관성 부재: 기존 메모리 모듈은 저수준 시각 임베딩만 저장하여 인물 식별 추적에 실패하거나, 단순 텍스트 묘사에 의존하여 장기 문맥에서 인물 및 지식의 모순과 모호성이 발생함.
    • 단일 턴 RAG의 추론 한계: 단순히 검색된 텍스트를 프롬프트에 넣고 답하는 Single-turn RAG 방식은 복잡한 다단계 계획(Planning) 및 다면적 정보 결합을 수행하지 못함.
  • 새로운 접근 방식 제시:
    • 실시간 스트림에서 일화 기억(Episodic)과 의미 기억(Semantic)을 동시에 생성하고, 인물 중심의 멀티모달 그래프로 세계 지식을 지속 축적하는 M3-Agent 제안.
    • 다단계 추론(Multi-turn Reasoning)과 반복적 메모리 검색(Iterative Retrieval)을 수행하는 제어 정책을 RL로 최적화.

Key Contributions & Novelty

  • M3-Agent 프레임워크 설계 (Novel Architecture):
    • 병렬 구조 (Memorization & Control): 실시간 입력을 받아 메모리를 구축·업데이트하는 Memorization 프로세스와, 사용자 지시를 해석해 메모리 그래프를 탐색·추론하는 Control 프로세스를 분리 구축.
    • Entity-Centric Multimodal Graph: 얼굴, 음성, 텍스트 노드를 통합 관리하며, 빈도 기반 가중치 투표(Voting Mechanism)를 통해 기억 충돌을 자체 해소하고 장기적인 개체 일관성을 보장.
  • Meta-Clip 기반 Identity Equivalence 자동 마이닝 (Novel Training Scheme):
    • 1-face 1-voice를 가진 Meta-clip을 자동으로 추출하고 이분 그래프(Bipartite Graph) 매칭을 통해 대규모 영상에서 얼굴-음성 일치 관계를 정밀하게 자동 레이블링(95.83% 정확도 달성).
    • 멀티모달 파운데이션 모델(Qwen2.5-Omni-7b 기반)에 모방 학습(Imitation Learning)을 적용하여 고품질 메모리 생성기(memory-7b-sft) 학습.
  • RL 기반 Multi-turn Control Policy 최적화:
    • 제어 모델(Qwen3-32B 기반)에 DAPO 알고리즘을 적용하여, 질문에 따라 적절한 검색 함수(search_node, search_clip)를 자율적으로 호출하고 다단계 추론을 수행하도록 훈련.
  • M3-Bench 벤치마크 구축:
    • M3-Bench-robot: 67명의 액터가 51개 장소에서 1인칭 로봇 시점 카메라로 촬영한 100개 실생활 장시간 영상(1,276 QA).
    • M3-Bench-web: 46개 카테고리의 920개 유튜브 영상(3,214 QA).
    • Multi-evidence, Multi-hop, Cross-modal, Person Understanding, General Knowledge의 5가지 기억 기반 고차원 인지 태스크 정의.

Experimental Highlights

  • 주요 벤치마크 State-of-the-Art 달성 (Accuracy 기준):
    • M3-Bench-robot: 30.7% 기록 (기존 최고 상용 모델 조합 Gemini-GPT4o-Hybrid 24.0% 대비 +6.7%p, MA-LMM 24.4% 대비 +6.3%p).
    • M3-Bench-web: 48.9% 기록 (Gemini-GPT4o-Hybrid 41.2% 대비 +7.7%p).
    • VideoMME-long: 61.8% 기록 (Gemini-GPT4o-Hybrid 56.5% 대비 +5.3%p).
  • Question Type별 분석:
    • 인물 이해(Person Understanding)와 크로스모달 추론(Cross-modal Reasoning)에서 상용 프롬프팅 에이전트 및 기존 온라인 비디오 모델 대비 압도적 성능 우위(M3-Bench-web PU 기준 59.3% 달성, 하이브리드 베이스라인 대비 +15.5%p).
  • Ablation Study 주요 발견:
    • Semantic Memory의 필수성: 의미 기억을 제거했을 때 M3-Bench-robot에서 30.7%에서 13.6%로 급락(-17.1%p), Web에서 -19.2%p, VideoMME에서 -13.1%p 하락.
    • RL 훈련의 영향: DAPO 훈련을 통해 프롬프트 기반 모델(control-32b-prompt) 대비 로봇 벤치마크에서 +10.0%p, Web에서 +8.0%p 성능 상승.
    • 추론 모드(Reasoning Mode): 컨트롤러에서 추론 단계를 비활성화하면 전체 성능이 최대 11.7%p 하락.

Limitations and Future Work

  • 미세 디테일 기억과 인지 과부하(Cognitive Overload):
    • 특정 사물의 미세한 위치나 단발성 세부 정보를 모두 장기 기억에 담으려 할 경우 메모리 포화 및 탐색 혼선 발생.
    • Future Work: 태스크와 상황에 맞추어 선택적으로 기억을 저장하는 어텐션 기반 메커니즘(Selective Memorization) 연구 필요.
  • 공간 추론(Spatial Reasoning) 한계:
    • 현재 언어 중심의 텍스트 노드는 공간 배치, 3D 구조 변화, 물체의 정확한 위치 추적 등 공간 지각 능력을 표현하는 데 한계가 존재.
    • Future Work: 텍스트 서술 외에 키프레임 스냅샷(Visual Snapshot) 등 시각적 정보를 효율적인 형태로 보관·활용하는 고밀도 비주얼 메모리 아키텍처 개발 필요.

Overall Summary

이 논문은 실시간 멀티모달 스트림을 처리하여 일화 기억과 의미 기억을 축적하고, 인물 중심의 멀티모달 그래프를 구축하여 자율적인 다단계 추론을 수행하는 M3-Agent 프레임워크를 제안합니다. 실제 로봇 1인칭 시점 및 웹 비디오로 구성된 새로운 장기 기억 벤치마크 M3-Bench를 구축하고, 강화학습(DAPO)을 통해 에이전트의 메모리 탐색 및 제어 정책을 훈련했습니다. 실험 결과 M3-Agent는 상용 대형 모델(Gemini-1.5-Pro, GPT-4o)을 활용한 프롬프팅 베이스라인을 전 영역에서 큰 폭으로 능가하며 장기 상호작용이 필요한 차세대 체화(Embodied) AI 에이전트 설계의 핵심 방향성을 제시했습니다.


쉬운 설명

사람이 새로운 직장에 출근했을 때, "어제 철수가 파란 옷을 입고 커피를 쏟았다"는 사건(Episodic Memory)을 보고 듣는 것에서 그치지 않고, "철수는 아침마다 커피를 마시는 습관이 있다", "철수의 얼굴과 목소리는 이렇다"는 일반적 지식(Semantic Memory)을 머릿속 인물 파일에 정리해 두는 것과 같습니다. 나중에 "철수가 좋아할 만한 아침 음료는?"이라는 질문을 받았을 때, 머릿속 인물 파일을 뒤져 철수의 특징과 이전 행동들을 단계적으로 떠올려 정답을 찾아내는 똑똑한 두뇌 비서 시스템입니다.

 

 

 

더보기

람처럼 실시간 시청각 스트림을 지속적으로 지각하여 **구체적 사건(Episodic Memory)**과 **일반화된 지식(Semantic Memory)**을 스스로 축적하는 **장기 기억 기반 멀티모달 에이전트(M3-Agent)**를 구축하는 것입니다.

 

 

실시간으로 들어오는 클립을 30초 단위로 순차 분할클립내 음성과 얼굴 추출

 

그래프 사용해서 동일인물이면 묶음

 

구체적인 사건은 텍스트 형태로 저장

 

구조화 해서 그래프로 축적

 

새로운 기억이 추가될때마다 기존 노드의 가중치를 수정 하며 메모리를 구축

 

...

 

 

그걸 통해서 답변 하면 되는데 

 

음... 클립 기반 메모리 구축?