Transformer 블록 안에서는 무엇이 바뀔까
GPT-2식 pre-norm 블록을 확대해 정규화, 어텐션, 잔차 연결, MLP의 역할을 나눠 봅니다. 어텐션은 토큰 사이 정보를 섞고 MLP는 각 위치의 벡터를 별도로 변환합니다.
01Transformer 블록 안에서는 무엇이 바뀔까
개념 한눈에 보기GPT-2식 구조 · 모델별 구성은 다름
GPT-2식 블록에는 어텐션과 MLP가 있으며, 각 변환 앞에 정규화와 입력을 더하는 잔차 연결이 있습니다.
각 토큰의 특징 축을 정규화합니다. 이 단계는 서로 다른 토큰의 정보를 섞지 않습니다.
어텐션이 자기 위치와 이전 위치의 정보를 섞습니다. 이 블록에서 토큰 사이 정보가 오가는 구간입니다.
어텐션 출력에 처음 들어온 벡터를 더합니다. 입력에서 덧셈까지 직접 이어지는 경로가 잔차 연결입니다.
갱신된 각 토큰 벡터를 다시 정규화해 MLP에 넘깁니다. 블록마다 별도의 매개변수를 사용합니다.
MLP는 각 토큰을 따로 처리합니다. 특징 차원을 넓히고 GELU를 적용한 뒤 원래 차원으로 되돌립니다.
MLP 출력에 MLP 앞의 벡터를 더합니다. 토큰 수와 특징 차원을 유지한 채 다음 블록으로 넘깁니다.
02 쉽게 이해하기
For Everyone어텐션은 토큰 사이 정보를 섞고, MLP는 각 토큰의 벡터를 변환합니다. 잔차 연결은 각 변환의 입력을 출력에 더합니다.
GPT-2식 블록은 x + Attention(LayerNorm(x))를 계산한 뒤, 그 결과에 MLP(LayerNorm(·))를 더합니다.
정규화는 각 토큰의 특징 축에 적용합니다.
MLP는 차원을 넓히고 GELU를 적용한 뒤 원래 차원으로 되돌립니다.
이 페이지는 구조를 설명하며 실제 활성값을 계산하지 않습니다.
Llama 등 다른 모델은 RMSNorm·SwiGLU·RoPE 등 구성 요소가 다릅니다.
- –블록 구조도를 읽거나 모델별 정규화·활성화 차이를 비교할 때 사용합니다
03 자주 묻는 질문
FAQTransformer 블록 안에서는 무엇이 바뀔까란 무엇인가요?+
GPT-2식 pre-norm 블록을 확대해 정규화, 어텐션, 잔차 연결, MLP의 역할을 나눠 봅니다. 어텐션은 토큰 사이 정보를 섞고 MLP는 각 위치의 벡터를 별도로 변환합니다.
Transformer 블록 안에서는 무엇이 바뀔까은(는) 어디에 사용하나요?+
블록 구조도를 읽거나 모델별 정규화·활성화 차이를 비교할 때 사용합니다.
Transformer 블록 안에서는 무엇이 바뀔까를 쉽게 비유하면?+
어텐션은 토큰 사이 정보를 섞고, MLP는 각 토큰의 벡터를 변환합니다. 잔차 연결은 각 변환의 입력을 출력에 더합니다.
