토크나이저 — BPE, WordPiece, SentencePiece
모델은 텍스트를 직접 읽지 못한다. 숫자 시퀀스로 변환해야 한다. 토크나이저(tokenizer)는 텍스트를 토큰으로 쪼개고, 각 토큰에 정수 ID를 부여한다.어떻게 쪼개느냐가 모델 성능에 직접 영향을 준다.단어 단위 토크나이징의 문제공백 기준으로 단어를 나누는 가장 단순한 방법이다."나는 사과를 먹었다" → ["나는", "사과를", "먹었다"]두 가지 문제가 있다.어휘 크기 폭발: 영어만 해도 단어 변형이 수십만 가지다. "run", "runs", "running", "ran"이 모두 다른 토큰이 된다. 어휘 크기가 커질수록 임베딩 테이블이 커지고 메모리가 늘어난다.미등록 단어(OOV): 학습 데이터에 없는 단어가 추론 시 등장하면 [UNK] 토큰으로 처리한다. 고유명사, 신조어, 오타가 모두 같은 토큰..