문장이 토큰과 벡터로 바뀌는 과정
문장을 직접 입력해 GPT-2 토큰 분할과 ID를 확인합니다. 토큰을 선택하면 임베딩과 위치 벡터의 합을 볼 수 있습니다. 토큰 ID는 실제 인코딩을 사용하고 벡터는 4차원 교육용 예제로 구분합니다.
01문장이 토큰과 벡터로 바뀌는 과정
개념 한눈에 보기문장은 토큰 ID로 바뀐 뒤, 토큰 벡터와 위치 벡터를 더해 모델에 들어갑니다.
GPT-2 토크나이저로 문장을 나눕니다. 토큰은 단어와 같지 않으며 앞의 공백도 포함할 수 있습니다.
각 토큰에 어휘표의 ID가 붙습니다. ID의 크기는 뜻의 크기나 비슷한 정도를 나타내지 않습니다.
토큰 ID에 해당하는 임베딩 행을 가져옵니다. 같은 ID는 같은 벡터를 쓰며, 화면의 값은 교육용입니다.
같은 토큰도 놓인 자리가 다를 수 있습니다. GPT-2는 위치에 해당하는 벡터를 별도로 가져옵니다.
토큰 벡터와 위치 벡터를 차원별로 더합니다. 아래 체험에서 토큰을 선택해 값이 바뀌는 모습을 확인합니다.
문장을 직접 바꿔 보세요
GPT-2 토큰 분할과 ID는 실제 값입니다. 아래 4차원 임베딩·위치 벡터는 계산을 보여주는 교육용 값입니다.
토큰 수: 3
공백은 ␠, 줄바꿈은 ↵로 표시합니다. 글자가 완성되지 않는 토큰은 바이트 조각으로 표시합니다.
선택한 토큰: #0 · ID 464
UTF-8: 54 68 65
E[464] · 토큰 임베딩
P[0] · 위치 임베딩
E + P · 모델에 넣을 벡터
같은 ID는 같은 토큰 벡터를 가져오고, 같은 위치는 같은 위치 벡터를 가져옵니다. 두 벡터를 차원별로 더합니다.
전체 토큰으로 복원한 문장
The cat sat
02 쉽게 이해하기
For Everyone토큰화와 임베딩은 서로 다른 단계입니다. 토큰화는 문장을 ID로 바꾸고, 임베딩은 학습된 표에서 ID에 해당하는 벡터를 가져옵니다.
GPT-2의 byte-level BPE 인코딩 r50k_base를 사용합니다.
공백이 토큰에 포함되고 한국어·이모지는 한 글자의 바이트가 여러 토큰에 나뉠 수 있습니다.
글자로 완성되지 않는 토큰은 바이트로 표시하고 전체 ID를 합쳐 원문을 복원합니다.
GPT-2는 토큰 임베딩에 학습된 위치 임베딩을 더합니다.
이 체험의 4차원 벡터는 계산을 보여주는 합성 값이며 의미·유사도나 실제 GPT-2 가중치를 나타내지 않습니다.
다른 모델은 다른 토크나이저와 위치 표현을 사용합니다.
- –단어 수와 토큰 수의 차이
- –공백·언어별 분할 차이
- –토큰 ID와 벡터의 관계를 확인할 때 사용합니다
03 자주 묻는 질문
FAQ문장이 토큰과 벡터로 바뀌는 과정란 무엇인가요?+
문장을 직접 입력해 GPT-2 토큰 분할과 ID를 확인합니다. 토큰을 선택하면 임베딩과 위치 벡터의 합을 볼 수 있습니다. 토큰 ID는 실제 인코딩을 사용하고 벡터는 4차원 교육용 예제로 구분합니다.
문장이 토큰과 벡터로 바뀌는 과정은(는) 어디에 사용하나요?+
단어 수와 토큰 수의 차이, 공백·언어별 분할 차이, 토큰 ID와 벡터의 관계를 확인할 때 사용합니다.
문장이 토큰과 벡터로 바뀌는 과정를 쉽게 비유하면?+
토큰화와 임베딩은 서로 다른 단계입니다. 토큰화는 문장을 ID로 바꾸고, 임베딩은 학습된 표에서 ID에 해당하는 벡터를 가져옵니다.
