Category

LLM

Transformer, inference, serving, agent workload, token-level memory traffic.

LLM은 어떻게 다음 토큰을 예측하는가

문장을 token으로 바꾸고, Transformer가 마지막 위치의 확률분포를 만든 뒤, 다음 token을 선택하는 과정을 memory traffic 관점까지 연결한다.