Oh My Algorithm
Concept GuidePre-norm · Residual · MLP

Transformer 블록 안에서는 무엇이 바뀔까

GPT-2식 pre-norm 블록을 확대해 정규화, 어텐션, 잔차 연결, MLP의 역할을 나눠 봅니다. 어텐션은 토큰 사이 정보를 섞고 MLP는 각 위치의 벡터를 별도로 변환합니다.

01Transformer 블록 안에서는 무엇이 바뀔까

GPT-2식 구조 · 모델별 구성은 다름

GPT-2식 블록에는 어텐션과 MLP가 있으며, 각 변환 앞에 정규화와 입력을 더하는 잔차 연결이 있습니다.

각 토큰의 특징 축을 정규화합니다. 이 단계는 서로 다른 토큰의 정보를 섞지 않습니다.

어텐션이 자기 위치와 이전 위치의 정보를 섞습니다. 이 블록에서 토큰 사이 정보가 오가는 구간입니다.

어텐션 출력에 처음 들어온 벡터를 더합니다. 입력에서 덧셈까지 직접 이어지는 경로가 잔차 연결입니다.

갱신된 각 토큰 벡터를 다시 정규화해 MLP에 넘깁니다. 블록마다 별도의 매개변수를 사용합니다.

MLP는 각 토큰을 따로 처리합니다. 특징 차원을 넓히고 GELU를 적용한 뒤 원래 차원으로 되돌립니다.

MLP 출력에 MLP 앞의 벡터를 더합니다. 토큰 수와 특징 차원을 유지한 채 다음 블록으로 넘깁니다.

GPT-2 STYLE · DECODER-ONLYx · tokens × featuresLayerNormCausal attentioncausal token mixing+ residualLayerNormMLPexpand → GELU → project+ residual입력 보존직접 연결해 더함causal token mixingcontext mixingtoken → tokenposition-wise MLP입출력 형태 유지단순화한 교육용 예제
1 / 7

정리

어텐션은 토큰 사이를, MLP는 각 토큰 안을 변환합니다. 다른 모델은 정규화와 활성화 구성이 다릅니다.

02 쉽게 이해하기

For Everyone
🔑핵심 동작

어텐션은 토큰 사이 정보를 섞고, MLP는 각 토큰의 벡터를 변환합니다. 잔차 연결은 각 변환의 입력을 출력에 더합니다.

💡쉽게 말하면

GPT-2식 블록은 x + Attention(LayerNorm(x))를 계산한 뒤, 그 결과에 MLP(LayerNorm(·))를 더합니다.

정규화는 각 토큰의 특징 축에 적용합니다.

MLP는 차원을 넓히고 GELU를 적용한 뒤 원래 차원으로 되돌립니다.

이 페이지는 구조를 설명하며 실제 활성값을 계산하지 않습니다.

Llama 등 다른 모델은 RMSNorm·SwiGLU·RoPE 등 구성 요소가 다릅니다.

📍어디에 쓰나
  • –블록 구조도를 읽거나 모델별 정규화·활성화 차이를 비교할 때 사용합니다

03 자주 묻는 질문

FAQ
Transformer 블록 안에서는 무엇이 바뀔까란 무엇인가요?+

GPT-2식 pre-norm 블록을 확대해 정규화, 어텐션, 잔차 연결, MLP의 역할을 나눠 봅니다. 어텐션은 토큰 사이 정보를 섞고 MLP는 각 위치의 벡터를 별도로 변환합니다.

Transformer 블록 안에서는 무엇이 바뀔까은(는) 어디에 사용하나요?+

블록 구조도를 읽거나 모델별 정규화·활성화 차이를 비교할 때 사용합니다.

Transformer 블록 안에서는 무엇이 바뀔까를 쉽게 비유하면?+

어텐션은 토큰 사이 정보를 섞고, MLP는 각 토큰의 벡터를 변환합니다. 잔차 연결은 각 변환의 입력을 출력에 더합니다.