🧬AI·머신러닝
LLM 알고리즘
토큰에서 어텐션·생성·캐시까지 이어지는 계산. 아래 5개 항목을 인터랙티브 시각화로 단계별로 학습해 보세요.
🧬LLM은 어떻게 다음 토큰을 고를까
GPT-2식 decoder-only Transformer를 따라 입력이 토큰과 벡터로 바뀌고, 반복되는 블록을 거쳐 다음 토큰의 확률이 되는 과정을 봅니다. 학습과 추론을 구분하고, 문장 전체를 한 번에 완성하지 않는 이유를 확인합니다.
Decoder-only · Inference🧬어텐션은 어떤 토큰을 참고할까
작은 수치 예제로 Q와 K의 점수를 구하고, 미래 위치를 가린 뒤 확률로 바꾸어 V를 섞습니다. 어텐션 가중치는 이 층·헤드의 혼합 비율이며, 모델의 판단 이유 전체를 설명하는 값은 아닙니다.
Q · K · V🧬Transformer 블록 안에서는 무엇이 바뀔까
GPT-2식 pre-norm 블록을 확대해 정규화, 어텐션, 잔차 연결, MLP의 역할을 나눠 봅니다. 어텐션은 토큰 사이 정보를 섞고 MLP는 각 위치의 벡터를 별도로 변환합니다.
Pre-norm · Residual · MLP🧬확률이 문장으로 바뀌는 과정
출력 점수를 확률로 바꾸고 다음 토큰을 선택하는 과정을 봅니다. temperature가 분포를 바꾸는 모습과 토큰을 하나씩 붙이는 생성 반복을 구분합니다.
Softmax · Sampling🧬KV 캐시는 어떤 계산을 줄일까
프롬프트를 처리하는 prefill과 새 토큰을 처리하는 decode를 나눠 봅니다. 이전 위치의 K·V를 재사용해 계산을 줄이지만, 새 Q는 과거 K·V를 계속 읽고 저장 공간도 늘어납니다.
Prefill · Decode · Memory