| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- 딥시크
- ing
- GPT
- 김원스쿨
- 5형식
- 0528
- From
- #삼립수박샌드 #수박샌드 #삼립신상 #삼립빵 #신상빵 #편의점신상 #편의점빵 #편의점디저트 #세븐일레븐신상 #세븐일레븐빵 #편의점간식 #신상과자리뷰 #신상리뷰 #수박맛 #수박맛빵 #수박바맛 #수박디저트 #여름간식 #여름디저트 #크림샌드 #크림카스테라 #카스테라 #빵리뷰 #간식추천 #편의점추천
- 자리의힘
- deekseek
- TO
- TO 부정사
- 자리
- put
- 중국AI
- \
- be to 부정사
- #뱅크시 #뱅크시전시 #뱅크시전시회 #뱅크시서울전시 #뱅크시스틸히어 #BANKSY #BANKSYSTILLHERE #더현대뱅크시 #더현대서울뱅크시 #더현대서울전시 #더현대전시 #더현대전시회 #더현대서울ALT1 #ALT1 #현대백화점전시 #서울전시 #서울전시회 #서울전시추천 #서울전시회추천 #서울미술전시 #서울미술관 #서울가볼만한곳 #서울실내데이트 #서울데이트 #서울데이트코스 #서울데이트추천 #여의도전시 #여의도데이트 #여의도가볼만한곳 #여의도데이트코스 #
- Into
- AS
- IS
- 영어학습법
- Today
- Total
AI바라기의 인공지능
VLM : 빠른 논문 리뷰 : LE-NeuS: Latency-Efficient Neuro-Symbolic Video Understanding via Adaptive Temporal Verification 본문
VLM : 빠른 논문 리뷰 : LE-NeuS: Latency-Efficient Neuro-Symbolic Video Understanding via Adaptive Temporal Verification
AI바라기 2026. 8. 22. 15:09용어 설명 (Terminology)
- LVQA (Long-form Video Question Answering): 수 분에서 수 시간에 이르는 장시간 비디오를 입력받아 복잡한 시공간적 사건 관계를 파악하고 질의에 답변하는 작업.
- Temporal Logic (TL) Specification (시간 논리 명세): 시간적 순서, 사건의 지속성, 인과 관계 등을 기호화된 정형 논리 규칙(Eventually, Always, Until, Next 등의 연산자)으로 표현한 식.
- Atomic Proposition (원자 명제): 쿼리에서 분해한 최소 단위의 시각적 사건 단위 (예: "남자가 숲으로 들어감", "가지의 껍질을 벗김").
- Video Automaton (비디오 오토마톤): 비디오를 시간 윈도우 단위의 상태(state)와 전이(transition)로 모델링한 discrete-time Markov chain 구조.
- Probabilistic Model Checking: 구축된 비디오 오토마톤이 주어진 Temporal Logic 명세를 만족할 확률(satisfaction probability)을 계산하여 논리적으로 정합한 비디오 구간을 찾아내는 정형 검증 기법.
- Hierarchical Adaptive Sampling: 비디오 전체를 dense하게 처리하지 않고, CLIP 임베딩을 이용해 의미적 관련 구간 선별(Semantic Relevance Filtering) 및 시각적 중복 제거(Visual Redundancy Elimination)를 거치는 2단계 적응형 샘플링.
- Batched Proposition Detection: 동일 비디오 윈도우에 대해 여러 proposition을 평가할 때, vision encoder 연산을 1회만 수행하고 텍스트 명제들을 GPU 배치 차원에 쌓아 병렬 추론하는 최적화 기법.
- Multi-Segment Frames-of-Interest (FoI) Retrieval: 연속된 하나의 긴 윈도우를 통째로 가져오는 대신, 논리 조건을 만족하는 여러 개의 불연속(disjoint) 핵심 구간만을 추출하여 VLM의 고정 frame budget 내 evidence 밀도를 극대화하는 전략.
Purpose of the Paper
- 기존 연구의 한계 극복: NeuS-QA와 같은 기존 neuro-symbolic LVQA 프레임워크는 formal temporal verification을 통해 높은 추론 정확도를 달성했으나, 비디오의 모든 윈도우마다 순차적(sequential)이고 조밀한(dense) proposition detection을 수행하여 표준 VLM prompting 대비 최대 90배에 달하는 심각한 latency overhead를 유발함.
- 새로운 접근 방식 제시: 오토마톤 생성(automaton construction) 단계가 전체 지연시간의 지배적인 병목(bottleneck)임을 수식적으로 증명하고, Temporal Logic의 정형 검증 보장성을 유지하면서도 GPU 하드웨어 활용도와 프레임 샘플링 효율을 극대화하여 추론 속도를 획기적으로 단축시키는 LE-NeuS 프레임워크를 제안.
Key Contributions & Novelty
- Hierarchical Adaptive Sampling 제안 (Novelty: 2단계 CLIP 기반 프레임 압축)
- Stage 1 (Semantic Relevance Filtering): 경량 CLIP ViT-B/32 인코더를 통해 쿼리 proposition과의 텍스트-비디오 유사도(cosine similarity)가 임계값(tau_s = 0.21)을 넘는 candidate 윈도우만 선별하고 배경 무관 구간을 사전 제거.
- Stage 2 (Visual Redundancy Elimination): 연속 프레임 간 visual similarity가 높은(tau_r >= 0.9) 시각적 중복 프레임을 제거하여 keyframe을 구성하고, VLM 추론을 keyframe 및 국소 이웃(delta = 2)으로만 제한한 뒤 나머지 프레임은 label propagation으로 대체.
- Batched Proposition Detection 구조 도입 (Novelty: 하드웨어 병렬성 극대화)
- 단일 윈도우 내 복수 proposition 평가 시 반복되던 VLM vision encoder 연산을 1회로 브로드캐스팅하고, proposition 텍스트를 배치(batch size B)로 묶어 GPU VRAM 대역폭을 최대로 활용함으로써 VLM 호출 횟수를 획기적으로 축소.
- Multi-Segment Frames-of-Interest (FoI) Retrieval 전략 (Novelty: Evidence 밀도 극대화)
- 단일 연속 윈도우 추출 방식에서 벗어나, Temporal Logic 조건을 만족하는 불연속 구간(disjoint segments)들만을 모아 VLM에 전달함으로써 고정된 샘플링 예산(N) 내 true evidence frame의 포함 확률 P(Hit)을 대폭 향상.
- Theoretical Latency Analysis 제공 (Novelty: Neuro-Symbolic 파이프라인의 이론적 지연시간 상한 및 가속 조건 유도)
- 프레임 잔존율(alpha)과 keyframe 비율(rho)의 곱(alpha * rho)을 기반으로 파이프라인의 latency bound를 정형화하고, baseline 대비 이론적 speedup이 |P| / (alpha * rho)에 수렴함을 수학적으로 규명.
Experimental Highlights
- 평가 설정 (Experimental Settings)
- Hardware: NVIDIA H100 GPU (단일 GPU 환경에서 end-to-end 측정).
- Datasets: LongVideoBench (추론 집중 서브셋 T3E, E3E, T3O, O3O), Video-MME (Temporal Reasoning), MLVU (Ego-Reasoning, Needle QA).
- Backbones: InternVL2.5-8B, Qwen2.5-VL-7B-Instruct, VideoLLaMA3-7B, LLaVA-Video-7B-Qwen2.
- Baselines: Base VLMs (Uniform Sampling), NeuS-QA, Structured Reasoning 계열 (VideoTree, VideoAgent, LVNet, T*).
- 주요 결과 (Quantitative Results)
- LongVideoBench SOTA 달성: InternVL2.5-8B 기준 67.10% 정확도를 기록하여 NeuS-QA baseline (61.89%) 대비 +5.21%p 향상, 최고 성능의 구조적 추론 모델인 VideoTree (50.47%) 대비 +16.63%p 압도.
- Video-MME 및 MLVU 성능 향상: Video-MME Temporal Reasoning에서 **67.24%**를 달성해 NeuS-QA 대비 +12.07%p 개선, MLVU에서도 전체 백본에 걸쳐 일관된 우위를 입증.
- 압도적인 Latency 감축 및 Speedup:
- 전체 평균 지연시간을 553.68초에서 44.20초로 단축하여 12.53배의 글로벌 speedup 달성.
- 60분(3600초) 롱폼 비디오 기준: 지연시간을 957.80초(~16분)에서 70.01초로 단축 (13.66배 speedup), 처리 프레임 수를 1,427개에서 281개로 축소.
- Ablation Study 검증:
- Batched Proposition 적용 시: 지연시간 553.68초 -> 171.05초 (3.2배 단축).
- Adaptive Sampling 추가 시: 윈도우 수 268개 -> 56개, 지연시간 171.05초 -> 45.28초 (추가 3.8배 단축).
- Multi-Segment FoI 추가 시: 정확도 60.18% -> 67.10% (+6.92%p 대폭 향상).
Limitations and Future Work
- 명시된 한계점 (Limitations)
- VLM Grounding 의존성: 초기 proposition grounding 정확도 및 Temporal Logic 변환의 품질이 백본 VLM/LLM 성능에 종속됨.
- Pruning-Accuracy Trade-off: Adaptive sampling 과정에서 임계값을 너무 공격적으로 설정할 경우 미세하거나 지속시간이 매우 짧은 핵심 프레임이 누락되어 정확도가 소폭 저하될 수 있음.
- 향후 연구 방향 (Future Work)
- Task-Specific Lightweight Detectors: 거대한 VLM 대신 경량의 특화 proposition detector를 도입하여 perception 단계의 지연시간을 추가 압축.
- Neural Model Checking Approximation: Storm과 같은 symbolic probabilistic model checker의 연산을 neural network로 근사화하여 정형 검증 단계 가속화.
- Speculative Automaton Construction: 쿼리 조건에 따라 오토마톤 구축 중 조기 종료(early termination)가 가능한 추측 실행 기법 연구.
- 엣지/실시간 시스템 확장: Embodied agent, 자율주행, 웨어러블 보조 비전 등 엄격한 실시간성이 요구되는 edge 환경으로의 프레임워크 확장.
Overall Summary
LE-NeuS는 장시간 비디오 질의응답(LVQA)에서 Neuro-Symbolic 기반 정형 시간 검증이 유발하던 극심한 지연시간 병목을 해결한 고효율 temporal reasoning 프레임워크입니다. 2단계 CLIP 기반 계층적 적응형 샘플링과 배치 단위 proposition 검출, 불연속 evidence를 모으는 Multi-Segment FoI 검색을 통해 NVIDIA H100 환경에서 기존 대비 **12.53배 이상의 속도 향상(평균 553초 -> 44초)**을 달성했습니다. 본 논문은 시간 논리 기반 정형 검증의 엄밀성과 정확도 향상 이점을 온전히 보존하면서도 추론 비용을 획기적으로 낮추어, 복잡한 비디오 추론 시스템을 실시간 edge 및 agentic 환경에 배포할 수 있는 실질적인 토대를 마련했다는 점에서 큰 의의를 가집니다.
쉬운 설명
이 논문의 핵심 아이디어는 **"1시간짜리 CCTV 영상을 보면서 돋보기로 모든 1초 장면마다 질문지를 순서대로 하나씩 묻던 비효율적인 조사관(기존 NeuS-QA)"**을 **"스마트한 요약 및 속독 전문가(LE-NeuS)"**로 바꾼 것과 같습니다.
- 지루한 부분 넘기기 (Adaptive Sampling): 사람이 아예 안 나오거나 이전 장면과 똑같은 화면은 가벼운 스캐너(CLIP)로 1차 스킵합니다.
- 동시에 질문하기 (Batched Detection): 남겨진 핵심 장면에 대해 "가지 꺾었니?", "껍질 벗겼니?" 같은 여러 질문을 따로따로 묻지 않고 한 번에 종이로 건네서(Batching) 동시에 답을 받습니다.
- 핵심 하이라이트 토막만 모으기 (Multi-Segment FoI): 전체 영상을 길게 늘여서 보지 않고, 질문의 조건이 참이 되는 결정적 토막 구간들만 딱딱 모아서 최종 답변 모델에게 보여줌으로써 시간은 1/12 이하로 줄이고 정답률은 오히려 더 높였습니다.
질문을 TL로 변경
경량 클립 모델 사용해서 비디오 프레임과 유사도를 측정하고 질문과 관련없는 배경 구간을 1차로 걸러냄
그럼 연속된 w내의 프레임을 f can으로 두고
프레임간 시각 유사도를 비교해서 중복 프레임을 제거하고 핵심 키프레임을 추출
각 추출된 키프레임의 앞 뒤 2프레임을 보갛마여 vlm 검사 대상
그 뒤는 neus qa 와 같다고 보면되는데
마지막 구간 수집할때 하나로 안합치고 그냥 따로 줌
그리고 조기 종료 하지 않음. 멀티 구간을 모두 찾아야 하기에
그리고 배치 정도으이 최적화를 햇다고 하는데 별로 중요하진 않음
결국은 다 봐야한다는 점이 인상 적이지만 그렇게 괜찮진 않은듯
3점 / 5점
