| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- 딥시크
- 0528
- 중국AI
- ing
- Into
- 자리의힘
- From
- 자리
- #삼립수박샌드 #수박샌드 #삼립신상 #삼립빵 #신상빵 #편의점신상 #편의점빵 #편의점디저트 #세븐일레븐신상 #세븐일레븐빵 #편의점간식 #신상과자리뷰 #신상리뷰 #수박맛 #수박맛빵 #수박바맛 #수박디저트 #여름간식 #여름디저트 #크림샌드 #크림카스테라 #카스테라 #빵리뷰 #간식추천 #편의점추천
- TO
- be to 부정사
- #뱅크시 #뱅크시전시 #뱅크시전시회 #뱅크시서울전시 #뱅크시스틸히어 #BANKSY #BANKSYSTILLHERE #더현대뱅크시 #더현대서울뱅크시 #더현대서울전시 #더현대전시 #더현대전시회 #더현대서울ALT1 #ALT1 #현대백화점전시 #서울전시 #서울전시회 #서울전시추천 #서울전시회추천 #서울미술전시 #서울미술관 #서울가볼만한곳 #서울실내데이트 #서울데이트 #서울데이트코스 #서울데이트추천 #여의도전시 #여의도데이트 #여의도가볼만한곳 #여의도데이트코스 #
- IS
- TO 부정사
- AS
- 김원스쿨
- 영어학습법
- \
- GPT
- deekseek
- 5형식
- put
- Today
- Total
목록전체 글 (574)
AI바라기의 인공지능
용어 설명 (Terminology)LVBench (Long Video Benchmark): 평균 약 68분(4,101초) 길이의 초장구간 비디오 이해 능력을 종합적으로 평가하기 위해 설계된 멀티모달 벤치마크 데이터셋입니다.Clue Duration: 질문에 정확히 답하기 위해 반드시 확인해야 하는 비디오 내 최소한의 핵심 시간 구간(Start & End timestamps)을 의미합니다.Modality Independence: 오디오 정보 없이도 오직 시각적 프레임(Visual channel) 정보만으로 정답을 유추할 수 있도록 데이터셋을 설계한 원칙입니다.Text-only Bias Filter (Visuals-agnostic Filter): 텍스트 전용 LLM(GLM-4, GPT-4)에 비디오 없이 질문..
Terminology (용어 설명)Temporal Certificate Set (시간적 증명 집합): 비디오 이해 문제에서 정답 라벨이나 답변이 옳다는 것을 사람이 확신하는 데 필요한 최소한의 비디오 서브클립 집합.Temporal Certificate Length (시간적 증명 길이): Temporal Certificate Set에 속한 영상 조각들의 실제 재생 시간 총합. 비디오 파일 전체 길이가 길더라도 문제를 풀기 위해 '실제로 반드시 봐야 하는 최소 시간'을 측정하는 지표.QAW Triplet: Question (질문), Correct Answer (정답), Wrong Answers / Distractors (오답/방해 선택지)로 이루어진 3중 질문-정답 세트.Q(AW)-shot Prompting..
용어 설명NExT-QA (Next Phase of Question-Answering to Explaining Temporal Actions): 비디오 내 시간적 행동 및 인과관계를 설명하고 추론하는 능력을 평가하기 위해 제안된 비디오 질의응답 벤치마크 dataset.Causal Action Reasoning: 비디오 속에서 특정 행동이 일어난 원인(Cause)이나 목적/의도(Intention)를 'Why' 및 'How' 질문을 통해 시각적으로 인과관계를 밝혀내는 추론.Temporal Action Reasoning: 사건 간의 발생 순서(이전 Before, 동시 While/When, 이후 After)를 기반으로 객체 간 상호작용과 행동의 시간적 전후 관계를 규명하는 추론.Open-ended Generati..
지인이 하나 먹어보라며 줬어요이름은 리얼 블랙 트러플 하몽 소다 크래커트러플에 하몽까지.크래커 하나에 꽤 많은 걸 넣었네요 약간 김피탕 스타일 총 내용량은 294g, 21g짜리 14봉 구성.한 봉에 103.8kcal 정도예요.하몽분말은 0.075%, 검은서양송로분말은 0.0006%. 참고로 로또 3등 당첨 확률은 0.0028% ... 검은색 포장에 트러플과 하몽 사진까지 들어가 있어서 분위기는 제법 진지해요.뭔가 그냥 과자라기보다는 와인 옆에 슬쩍 놓여 있어야 할 것 같은 느낌일단 물이랑 때려 볼게요! 안에는 길쭉한 크래커가 3장 들어 있어요.봉지를 열자마자 트러플 특유의 향이 제법 올라옵니다.참크래커 스타일 - 촘 인가요? 트러플 감튀에서 흔히 나는 향 ..
용어 설명 (Terminology)LVQA (Long-form Video Question Answering): 수 분에서 수 시간에 이르는 장시간 비디오를 입력받아 복잡한 시공간적 사건 관계를 파악하고 질의에 답변하는 작업.Temporal Logic (TL) Specification (시간 논리 명세): 시간적 순서, 사건의 지속성, 인과 관계 등을 기호화된 정형 논리 규칙(Eventually, Always, Until, Next 등의 연산자)으로 표현한 식.Atomic Proposition (원자 명제): 쿼리에서 분해한 최소 단위의 시각적 사건 단위 (예: "남자가 숲으로 들어감", "가지의 껍질을 벗김").Video Automaton (비디오 오토마톤): 비디오를 시간 윈도우 단위의 상태(state..
용어 설명Episodic Memory (일화 기억): 비디오 내에서 관찰된 구체적인 시공간적 사건, 행동, 발화 내용을 기록하는 기억.Semantic Memory (의미 기억): 관찰된 사건들로부터 추상화하고 일반화한 지식(인물의 성격, 역할, 선호도, 객체의 기능 및 규칙 등).Entity-Centric Multimodal Graph: 인물이나 사물(Entity)을 중심으로 얼굴(image), 음성(audio), 텍스트(text) 지식 노드들을 엣지(edge)로 연결하여 다중 모달리티 간 일관성을 유지하는 그래프 형태의 장기 기억 구조.Meta-Clip: 긴 비디오 내에서 정확히 한 명의 얼굴과 한 명의 음성만 등장하는 5초 미만의 짧은 단일 화자 영상 클립. 다중 인물 환경에서 얼굴-음성 간 매핑(I..
용어 설명 (Terminology)Temporal Grounding (시간적 접지): 비디오 전체에서 텍스트 쿼리(질문 또는 설명)와 관련된 특정 사건의 시작 시점과 종료 시점(timestamp)을 정확히 찾아내는 작업.Chain-of-LoRA: 여러 개의 독립된 전체 모델을 띄우는 대신, 하나의 고정된 Base Large Multi-modal Model(LMM) 백본에 각 역할별로 경량화된 LoRA 어댑터를 메모리에 상주시켜 추론 시점에 동적으로 역할을 전환하는 메커니즘.Timestamp Decoder: 이산적인 텍스트 토큰(숫자 토큰)으로 시간을 생성하는 대신, 연속적인 시간 예측을 위해 별도의 회귀/분류 헤드 및 Temporal Feature Pyramid로 구성된 경량 디코더 모듈.REG Toke..
용어 설명Mamba / Mamba-2: State Space Model(SSM) 기반의 시퀀스 모델링 아키텍처로, 입력 길이에 따라 연산 복잡도가 선형(Linear)으로 증가하여 매우 긴 시퀀스를 처리할 때 Transformer 대비 메모리와 속도 면에서 효율적입니다.Pre-filling Stage: 대형 언어/멀티모달 모델에서 텍스트 생성을 시작하기 전, 주어진 입력 시퀀스(비디오 및 텍스트 프롬프트 전체)를 한 번에 인코딩하여 Key-Value 캐시 및 초기 표현을 계산하는 단계입니다.Causal Self-Attention: 이전의 모든 토큰을 참조하여 표현을 갱신하는 어텐션 메커니즘으로, 시퀀스 길이가 증가할 때 연산량이 제곱(Quadratic)으로 폭증하는 한계가 있습니다.Cross-Attenti..
용어 설명 (Key Terminology)Long Video Haystack Problem: 수만 장의 프레임으로 구성된 긴 비디오(Haystack)에서 특정 질문에 답하기 위해 반드시 필요한 극소수의 핵심 프레임(Needles, 통상 1~5장)을 찾아내는 문제 정의입니다.T* (T-star): 비전 트랜스포머의 공간 탐색 기법(V*)과 A* 알고리즘의 아이디어에서 착안하여, 연산 비용이 큰 비디오의 시간 축 탐색(Temporal Search)을 단일 이미지 내의 공간 탐색(Spatial Search) 및 반복적 줌인(Zooming-in) 메커니즘으로 전환한 경량 프레임워크입니다.Question Grounding: 입력된 자연어 질문(Question)을 분석하여, VLM을 통해 탐색의 직접적 목표가 되는..
용어 설명Memory Card: 긴 비디오를 의미 단위(semantic session)로 분할한 뒤, 대표 시각 프레임(representative keyframes), 이벤트 요약(topic), 타임스탬프 기반 음성 대본(speech transcript), 시간 메타데이터(temporal span)를 단일 2D 이미지 형태로 렌더링한 고밀도 멀티모달 증거 단위.Self-Reading Process: 특정 질문(query)과 무관하게(question-agnostic) 사전 단계에서 VLM이 비디오 전체를 읽고, 시각적 내용과 시간적 이벤트 구조를 기반으로 의미론적 세션 분할 및 이벤트 요약을 스스로 수행하는 과정.Event-Level Video Gist: 특정 세션 내에서 발생한 사건의 핵심을 요약한 텍스..
