| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | ||||
| 4 | 5 | 6 | 7 | 8 | 9 | 10 |
| 11 | 12 | 13 | 14 | 15 | 16 | 17 |
| 18 | 19 | 20 | 21 | 22 | 23 | 24 |
| 25 | 26 | 27 | 28 | 29 | 30 | 31 |
- AS
- #삼립수박샌드 #수박샌드 #삼립신상 #삼립빵 #신상빵 #편의점신상 #편의점빵 #편의점디저트 #세븐일레븐신상 #세븐일레븐빵 #편의점간식 #신상과자리뷰 #신상리뷰 #수박맛 #수박맛빵 #수박바맛 #수박디저트 #여름간식 #여름디저트 #크림샌드 #크림카스테라 #카스테라 #빵리뷰 #간식추천 #편의점추천
- 중국AI
- deekseek
- From
- 자리의힘
- 김원스쿨
- IS
- #뱅크시 #뱅크시전시 #뱅크시전시회 #뱅크시서울전시 #뱅크시스틸히어 #BANKSY #BANKSYSTILLHERE #더현대뱅크시 #더현대서울뱅크시 #더현대서울전시 #더현대전시 #더현대전시회 #더현대서울ALT1 #ALT1 #현대백화점전시 #서울전시 #서울전시회 #서울전시추천 #서울전시회추천 #서울미술전시 #서울미술관 #서울가볼만한곳 #서울실내데이트 #서울데이트 #서울데이트코스 #서울데이트추천 #여의도전시 #여의도데이트 #여의도가볼만한곳 #여의도데이트코스 #
- Into
- be to 부정사
- put
- GPT
- 0528
- TO
- TO 부정사
- 자리
- 딥시크
- \
- 5형식
- ing
- 영어학습법
- Today
- Total
AI바라기의 인공지능
LLM : 칼럼 리뷰 : A Mathematical Framework for Transformer Circuits 본문
A Mathematical Framework for Transformer Circuits
이 글의 목적은 Transformer 내부에서 실제로 어떤 계산이 일어나는지를 회로(circuit) 단위로 분해해서 이해하는 것이다.
거대한 LLM을 처음부터 해석하기보다는, MLP를 제거한 0~2 layer attention-only Transformer부터 분석한다. 구조를 단순화한 뒤 weight와 activation을 뜯어보면서, Transformer의 동작을 사람이 이해할 수 있는 작은 계산들의 조합으로 표현하려고 한다.
1. Residual Stream
Transformer를 볼 때 가장 중심이 되는 것은 residual stream이다.
각 Attention Head나 MLP는 서로 직접 연결되어 있는 것이 아니라,
Residual Stream에서 정보를 읽고 → 계산하고 → 다시 Residual Stream에 결과를 더한다.
즉 residual stream을 Transformer 내부의 공용 통신 채널처럼 볼 수 있다.
각 component가 자신의 결과를 residual stream에 더하는 구조이기 때문에, 서로 다른 head의 contribution을 따로 떼어서 분석할 수도 있다.
2. Attention Head = QK Circuit + OV Circuit
Attention Head 하나의 역할은 크게 두 부분으로 나눌 수 있다.
QK Circuit
[
W_Q^T W_K
]
→ 어디를 볼 것인가
현재 token이 어떤 다른 token에 attention을 줄지를 결정한다.
OV Circuit
[
W_O W_V
]
→ 거기서 무엇을 가져올 것인가
선택한 token의 정보를 어떻게 변환해서 residual stream에 써줄지를 결정한다.
따라서 Attention Head를 단순히 Q, K, V vector들의 계산으로 보는 대신,
QK = 어디에서 정보를 가져올지 결정
OV = 가져온 정보를 어떻게 사용할지 결정
하는 하나의 작은 회로로 볼 수 있다.
3. Path Expansion
Residual connection은 계속 더하기 구조이기 때문에 Transformer 전체 계산을 전개하면
여러 개의 end-to-end 계산 경로(path)의 합
으로 표현할 수 있다.
예를 들어
[
Embedding \rightarrow Head_1 \rightarrow Head_2 \rightarrow Unembedding
]
처럼 특정 정보가 모델 안에서 어떤 component들을 거쳐 최종 logit까지 전달되는지를 하나의 path로 볼 수 있다.
이렇게 Transformer 전체를 하나의 거대한 계산으로 보는 대신 여러 개의 작은 circuit/path의 합으로 분해해서 분석하자는 것이 이 framework의 중요한 아이디어다. Attention pattern을 고정하면 이 경로들은 대부분 linear operation으로 다룰 수 있다.
4. Attention Head Composition
깊이가 2 layer 이상이 되면 뒤의 Attention Head가 앞 Attention Head가 residual stream에 써놓은 정보를 읽을 수 있다.
즉 Head들이 서로 composition되기 시작한다.
크게
- Q-composition: 이전 Head의 output을 Query 계산에 사용
- K-composition: 이전 Head의 output을 Key 계산에 사용
- V-composition: 이전 Head의 output을 Value 계산에 사용
으로 나눌 수 있다.
이 composition 때문에 단일 Attention Head보다 훨씬 복잡한 알고리즘을 만들 수 있다.
5. 모델 깊이에 따라 무엇을 할 수 있는가
저자들은 실제 작은 Attention-only Transformer를 뜯어보면서 모델의 깊이가 증가할수록 어떤 계산이 가능해지는지 분석한다.
0 Layer Transformer
Attention 자체가 없기 때문에 현재 token만 보고 다음 token을 예측한다.
결국 사실상
[
A \rightarrow B
]
형태의 bigram model처럼 동작한다.
1 Layer Transformer
Attention으로 이전 token을 볼 수 있기 때문에
[
A ; ... ; B \rightarrow C
]
형태의 skip-trigram 같은 패턴까지 사용할 수 있다.
즉 현재 token뿐만 아니라 앞쪽 token의 정보를 가져와 다음 token 예측에 사용할 수 있다.
2 Layer Transformer
여기부터 Attention Head끼리 composition이 가능해진다.
그리고 이 과정에서 저자들이 중요하게 발견한 것이 Induction Head다.
Induction Head는 대략
[
[A][B]; ...; [A] \rightarrow [B]
]
패턴을 수행한다.
현재 token과 동일한 token이 과거에 등장한 위치를 찾고, 그 token 다음에 무엇이 나왔는지를 가져와 현재 다음 token으로 예측한다.
예를 들어 context에
... A B ... A
가 있다면 과거의 A를 찾아 그 뒤에 있던 B를 현재 위치로 복사하는 식이다.
이것은 단순한 언어 통계가 아니라 현재 context 내부에서 발견한 패턴을 이용하는 알고리즘이기 때문에, 저자들은 이를 작은 Transformer에서 나타나는 in-context learning의 핵심 mechanism으로 본다.
핵심
이 글의 핵심은 Transformer를 단순히
Embedding → Attention → MLP → Attention → ...
처럼 layer 단위로 보는 것이 아니라,
Residual Stream을 통해 서로 정보를 주고받는 작은 circuit들의 집합
으로 보자는 것이다.
특히
Residual Stream → QK / OV Circuit → Head Composition → Path → Induction Head
라는 관점을 만들면서 이후 Transformer Mechanistic Interpretability 연구에서 사용하는 기본적인 분석 틀을 제시했다.
다만 이 글은 작은 Attention-only Transformer를 중심으로 분석하기 때문에 실제 대규모 Transformer 전체를 설명한 것은 아니다. 특히 MLP를 제대로 해석하는 문제는 이 글에서는 거의 해결하지 못했으며, 저자들도 이를 주요 한계로 인정한다.
- 2-layer attention-only model에서 중요한 건 head composition
- 특히 저자들이 본 모델에서는 K-composition이 핵심
- 1층의 previous-token head가 “바로 전 token이 뭐였는지” 정보를 residual stream에 써놓고
- 2층의 induction head의 K가 그 정보를 읽음
- 그래서 현재 token과 같은 token이 예전에 나온 위치를 찾고, 그 다음 token을 복사하는 induction mechanism이 만들어짐
- 반대로 그 모델에서는 Q-composition과 V-composition은 상대적으로 중요하지 않았음
3점 / 5점 : 층마다 교환하는 정보의 흐름을 어렵지만 직관적으로 잘 써둠
