관리 메뉴

AI바라기의 인공지능

VLM : 빠른 논문 리뷰 : MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences 본문

논문리뷰

VLM : 빠른 논문 리뷰 : MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences

AI바라기 2026. 9. 28. 11:24


용어 설명

  • Stateful Experience (상태 기반 경험): 전체 trajectory(궤적) 단위가 아니라, 특정 의사결정 시점의 상태(state)와 수행된 행동(action), 그리고 이에 대한 전략적 가이드(guidance)를 결합한 최소 단위(s_t, a_t, g_t)의 경험.
  • Trajectory-level Experience Retrieval (궤적 수준 경험 검색): 과거 에이전트가 문제를 해결하면서 밟아온 전체 실행 경로(모든 턴의 대화, 이미지, 도구 호출 기록 전체)를 한꺼번에 검색하여 프롬프트 컨텍스트에 주입하는 기존 방식.
  • Hindsight Reasoning (사후 평가 추론): 이전 실행 trajectory를 atomic transition(s_t, a_t, s_{t+1}) 단위로 분해한 뒤, 고성능 multimodal reasoning model(예: GPT-4o)을 통해 각 행동의 결정 품질(quality score, q_t)과 미래 의사결정에 필요한 교훈(guidance summary, g_t)을 사후에 평가·추출하는 과정.
  • Compositional State Representation (조합형 상태 표현): 질의(user instruction), 시각 정보(visual observation), 작업 설명(task descriptor), 실행 이력(execution history) 등 이종(heterogeneous) 정보를 여러 조합의 semantic viewpoints(예: [Query, Image], [Query, Task], [Query, Image, Task])로 나누어 각각 별도의 embedding vector로 인덱싱하는 방식.
  • Deep-and-Wide Search:
    • Wide Search (가로 확장): 단일 semantic viewpoint에서 Top-K개의 유사 경험을 넓게 검색하여 범용적·전략적 reasoning pattern을 확보하는 과정.
    • Deep Search (세로 심화): 여러 refinement round(L) 동안 서로 다른 semantic viewpoint를 순차적으로 질의하여 작업 의도, 시각적 단서, 도구 매개변수 문법 등을 단계적으로 정밀하게 맞추어가는 과정.
  • Experience Bank (경험 은행, B): Hindsight reasoning 평가 점수(q_t)가 기준 임계값(quality threshold, delta) 이상인 고품질 atomic decision experience들만 필터링하여 구축된 벡터 데이터베이스.

Purpose of the Paper

  • 기존 연구의 한계 극복:
    • 기존 LLM/VLM memory-augmented agent(Reflexion, Expel 등)는 과거 경험을 통째로 재사용하는 trajectory-level retrieval에 의존함.
    • Multimodal 환경에서는 visual input의 정보 밀도가 텍스트보다 낮고 컨텍스트 길이가 급증하기 때문에, 전체 trajectory를 검색·주입하면 극심한 context redundancy(문맥 중복)와 reasoning noise가 발생하여 컨텍스트 윈도우를 낭비하고 모델의 추론을 붕괴시킴.
    • 에이전트가 복잡한 다단계 추론 중 중간 의사결정 병목(intermediate reasoning bottleneck)에 직면했을 때, 거친 작업 단위 비유(coarse task-level analogies)는 세부적인 tactical guidance를 전혀 제공하지 못함.
  • 새로운 접근 방식 제시:
    • Multimodal agent reasoning을 discrete state unit 기반의 **Stateful Experience-Based Markov Decision Process (MDP)**로 재정의함.
    • 긴 실행 궤적을 hindsight reasoning을 통해 원자적(atomic) 상태-행동 단위로 분해 및 정제하고, 현재 에이전트의 결정 상태에 맞추어 dynamic query가 가능한 고품질 Stateful Experience Bank 기반의 접근법을 제안함.

Key Contributions & Novelty

Key Contributions

  • Hindsight Reasoning 기반 Stateful Experience Abstraction:
    • 성공 및 실패 trajectory를 원자적 전이 단위(s_t, a_t, s_{t+1})로 분해하고, 사후 평가 모델을 통해 결정 품질 점수(q_t in [0, 10])와 가이드라인(g_t)을 추출함.
    • 점수가 특정 기준(default delta = 5.0) 이상인 고가치 경험만을 필터링하여 컴팩트하고 노이즈에 강한 Experience Bank를 구축함.
  • Compositional State Representation 기반 다중 뷰포인트 인덱싱:
    • 텍스트 질문, 시각적 이미지, 도구 실행 이력 등 서로 다른 특성을 가진 multimodal state 요소를 분해하여 복수의 semantic viewpoints P = {p_1, ..., p_M}로 조합 및 임베딩함.
    • 단일 경험을 다양한 맥락적 단서(visual intent, tool syntax, task context)로 인덱싱하여 검색 유연성과 커버리지를 극대화함.
  • Deep-and-Wide Search 메커니즘을 통한 동적 경험 활용:
    • 추론 시 단일 뷰포인트의 너비 탐색(Wide Search, Top-K)과 뷰포인트를 바꿔가며 점진적으로 세부 단서를 정렬하는 깊이 탐색(Deep Search, L rounds)을 융합하여 정밀한 행동 결정을 생성함.
  • 13종의 종합 Multimodal Tool Bank 구축 및 통합 검증:
    • Zoom-in, Crop, Region Visualization, Localize Objects, Depth Estimation, CLIP 기반 유사도 계산, Calculator, WolframAlpha, Serper Web Search 등 다채로운 도구를 결합하여 미세 시각 인식 및 추론을 보조함.

Novelty (기존 연구 대비 차별점)

  • 단위의 혁신 (Trajectory -> Atomic State):
    • 에피소드 전체를 통째로 가져오는 대신, 의사결정 분기점 단위로 분리된 state-level experience를 제공하여 context noise를 원천 차단함.
  • 검색 방식의 혁신 (Static 1-Shot Retrieval -> Iterative Multi-view Deep Search):
    • 초기에 주어진 고정 질문 텍스트만으로 검색하는 것이 아니라, 에이전트의 실시간 변화 상태(현재 crop된 visual token, 직전 도구 오류 내역 등)에 맞춰 semantic viewpoint를 능동적으로 변경하며 필요한 지식을 단계별로 추출함.

Experimental Highlights

실험 설정

  • Datasets (1:1 exploration 및 evaluation split 분할):
    • V* Bench (Direct Attribute, Relative Position; 총 191개)
    • MME-RealWorld-Lite (실제 고해상도 환경 인지/추론; 총 1,919개 중 평가)
    • Zoom-Bench (초미세 시각 단서 인식; 621개 객관식 셋)
    • HR-Bench (8K 고해상도 이미지 인스턴스 인식; 200개 셋)
  • Base Models: Qwen3-VL-32B-Instruct, Qwen3-VL-235B-A22B-Instruct, Qwen3.5-397B-A17B
  • Evaluator & Embedding: Hindsight Model로 GPT-4o, Embedding 모델로 Qwen3-VL-8B-Embedding 사용
  • Baselines: Vanilla CoT (도구 미사용), ReAct (Zero-experience 도구 사용), Reflexion (실패 trajectory 기반), Expel (성공/실패 trajectory 기반)

주요 실험 결과

  • Trajectory-level baseline 대비 압도적 SOTA 달성:
    • Qwen3-VL-32B-Instruct 기준, MuSEAgent의 전체 평균 정확도는 **65.30%**로 최고 베이스라인인 Reflexion(57.33%) 및 Expel(56.96%) 대비 약 8%p 높은 성능 향상을 기록함.
    • 세밀한 공간 추론이 요구되는 V* Bench Relative Position에서 Qwen3-VL-235B-A22B 모델 기준 **92.11%**를 기록, Expel(73.68%) 대비 +18.43%p의 극적인 성능 개선을 달성함.
  • 모델 규모에 따른 효율성 차이:
    • 절대적 점수는 모델 크기가 커질수록 향상(Qwen3.5-397B에서 69.76% 달성)되었으나, 베이스라인 대비 상대적 개선 폭은 컴팩트 모델(32B에서 +7.97%p, 235B에서 +3.25%p, 397B에서 +3.81%p)에서 가장 두드러짐. 즉, 내재적 추론 능력이 제한된 중소형 모델일수록 state-level guidance의 의존 효용이 극대화됨.
  • Deep-and-Wide Search의 스케일링 특성:
    • Deep Search 반복 횟수 L=3, Wide Search 검색 개수 K=3에서 최적의 피크 성능을 형성함.
    • 검색 스케일을 4나 5로 과도하게 늘릴 경우 컨텍스트 윈도우 내 중복 정보 증가로 인해 성능이 완만하게 하락하는 현상이 발생하여, 적절한 context scope 제어가 중요함을 증명함.
  • OOD (Out-of-Distribution) 일반화 검증:
    • 타깃 도메인 데이터를 전혀 보지 않고 나머지 3개 벤치마크 데이터로만 구축한 OOD Experience Bank를 사용했음에도, 32B 모델 기준 **59.64%**의 평균 정확도를 기록함.
    • 이는 타깃 도메인 데이터를 직접 학습한 인-도메인 Reflexion(57.33%) 및 Expel(56.96%)보다 높은 수치로, 상태 단위로 분해된 경험이 단순 경로 암기가 아닌 전이 가능한 일반적 multimodal 도구 조작 원리를 습득함을 입증함.
  • Ablation Studies 핵심 수치:
    • Experience Source: 성공+실패 trajectory 결합(85.42% V*, 78.00% HR) > 실패 trajectory만 사용(76.04%, 76.00%) > 성공 trajectory만 사용(71.88%, 72.00%). 실패로부터 얻는 경고(cautionary guidance)가 성공 강화보다 더 결정적인 역할을 함.
    • Quality Threshold (delta): 5.0(85.42%, 78.00%) > 7.0(78.12%, 74.00%) > 9.0(75.00%, 73.00%). 완벽한 경험(9.0)만 남기면 부분적 성공이나 전략적 뉘앙스가 누락되어 오히려 성능이 하락함.

Limitations and Future Work

명확하게 드러난 Limitations

  • 오프라인/정적 Experience Bank 구축 파이프라인:
    • 경험 추출이 환경 상호작용 전에 미리 수집된 offline trajectory를 대상으로 별도의 hindsight reasoning 단계를 거쳐 이루어지므로, 새로운 환경과 실시간으로 상호작용하면서 즉각적으로 자가 진화(self-evolving)하는 데에는 구조적 제약이 있음.
  • 고성능 Hindsight Reasoning Model 의존도:
    • 경험의 질이 사후 평가 모델의 역량에 크게 좌우됨. GPT-4o를 사용했을 때(85.42%)와 자체 모델(Qwen3-VL-32B)로 self-reflection을 수행했을 때(78.12%) 성능 격차가 유의미하게 발생함.
  • 특정 전문 도메인의 OOD 한계:
    • 대부분의 일반 시각 작업에서는 OOD 경험이 효과적으로 작동했으나, MME-RealWorld-Lite와 같이 독특한 현실 환경 특성이 지배적인 과제에서는 OOD 점수(40.00%)가 인-도메인 ReAct(41.46%)보다 소폭 낮아 타깃 도메인 고유의 시각적 경험이 여전히 필수적임을 시사함.

Future Work 및 극복 방향

  • Online Experience Construction 메커니즘 개발:
    • 사전에 정의된 정적 탐색 단계 없이도 에이전트가 개방형 환경(open-ended environments)에서 태스크를 해결하는 도중 실시간으로 자신의 결정을 반추하고, stateful memory를 지속적으로 update/prune하는 online autonomous learning 체계로 발전시킬 계획임.

Overall Summary

이 논문은 multimodal reasoning agent가 겪는 긴 궤적 기반 메모리의 noise와 context redundancy 문제를 해결하기 위해, 경험을 원자적 상태-행동 단위로 분해하는 MuSEAgent를 제안합니다. 제안된 프레임워크는 hindsight reasoning을 통해 고품질의 stateful experience를 추출하고, 이를 다중 semantic viewpoint로 분해하여 Deep-and-Wide Search 방식으로 추론 시점에 동적 주입합니다. 실험 결과 기존 trajectory-level 베이스라인 대비 평균 약 8%p 높은 SOTA 성능을 기록했을 뿐만 아니라 완벽한 out-of-distribution 환경에서도 뛰어난 전이 능력을 입증함으로써, multimodal agent의 장기 추론 및 메모리 모델링 연구에 새로운 패러다임을 제시했습니다.


쉬운 설명

기존의 경험 기반 에이전트가 문제를 풀 때 **"예전에 이 문제를 처음부터 끝까지 어떻게 풀었는지 적힌 전체 풀이 시험지"**를 그대로 꺼내보는 방식이었다면, MuSEAgent는 **"오답노트와 핵심 공식을 단계별 카드(Flashcard)로 잘게 쪼개어 놓은 시스템"**입니다.

문제를 풀다가 특정 단계에서 막히면(예: '우산 색상을 알아내야 하는데 이미지가 너무 작다'), 예전 시험지를 처음부터 다 읽으며 헤매는 대신 **"작은 물체의 색을 물어볼 때는 OCR 글자 읽기를 쓰지 말고, 물체 영역을 먼저 네모 박스로 crop한 뒤 확대해야 한다"**는 정확한 한 줄짜리 조언 카드만 쏙 뽑아서 다음 행동을 결정하는 똑똑한 시험 전략과 같습니다.

 

 

 

 

더보기

u : 질문
v_t : 현재 시점 비주얼 관측 정보
d : 문제의 task
H_t : 지금 까지의 실행 히스토리

4개가 전부 St 인셈

Stateful Experience 
s1 a1 s2 a2 .. 순으로 모든 트레젝토리를 저장하려하는데 다 하면 힘드니 각 스텝은 st at st+1 인데 이 쌍으로 점수를 hindsight model이 평가해서 저장하려함

qt : 행동이 얼마나 좋았는지
gt : 얻을 수 있는 일반적인 교훈

점수 낮으면 저장안함.

st at gt 순으로 저장함.
State: 특정 물체의 색깔을 물어보고 있는데 아직 위치를 못 찾음
Action: localize_objects
Guidance: “물체 속성을 판단하기 전에 먼저 해당 물체의 위치를 찾아라.”

이런식으로 그 한덩어리가 Stateful Experience 


Trajectory-level Experience Retrieval
근데 트레젝토리 전체 저장하는 방식, 트레젝토리 전체를 하나의 case 로 보는것



Hindsight Reasoning
점수랑 가이던스 주는 모델, 별도 튜닝 없이 gpt 4o 사용.



Compositional State Representation
하나의 state를 여러 경우의 수로 나눠서 임베딩을 여러개 보관한다고 함
잘은 모르겠지만 state 에서 중요한 정보가 다르다고 함

물체 위치가 헷갈림 → Query + Image 관점으로 retrieval
어떤 종류의 문제인지가 중요함 → Query + Task
이전 tool 사용이 중요함 → History 중심

이런식으로 한다고 , agent 스스로 어떤 뷰 포인트를 쓸지 체크한다고 함.



Deep-and-Wide Search:
검색 방식
wide는 뷰포인트 검색해서 topk 가져오는거

deep은 viewpoint를 바꿔가면서 여러라운드 탐색

L X K 번 검색... 근데 너무 효율 구린것 같음






목적
기존 experience-based agent가 과거 문제의 전체 trajectory를 통째로 가져오는 방식은 너무 거칠고 noise가 많으니, 이를 state 단위의 작은 경험으로 쪼개서 현재 상황에 맞는 경험만 꺼내 쓰게 하자.




Exploration split에서 agent가 문제를 풀고 전체 trajectory를 모음.

trajectory를 step 단위로 잘게 나눔.

Hindsight model이 각 step을 보고 행동이 좋았는지 점수와 guidance를 만듦.

점수가 낮은 step은 버림.

점수가 높은 step만 Stateful Experience로 저장함.

각 experience의 state를 여러 viewpoint로 나눠 embedding해서 Experience Bank를 만듦.

새 문제가 들어오면 현재 state를 구성함.

agent가 지금 어떤 viewpoint로 경험을 찾을지 선택함.

Wide Search로 그 viewpoint에서 비슷한 experience 여러 개를 가져옴.

Deep Search로 viewpoint를 바꿔가며 여러 번 더 검색함.

가져온 guidance들을 현재 context에 넣음.

agent가 그 guidance를 참고해서 다음 action이나 tool을 선택함.

새 observation이 생기면 state를 갱신하고 다시 experience를 검색함.

이 과정을 반복해서 최종 답을 냄.







3점 / 5점

벤치마크 절반 나누는거부터 너무 찐다 같은 방식