Category
LLM
Transformer, inference, serving, agent workload, token-level memory traffic.

LLM은 어떻게 다음 토큰을 예측하는가
문장을 token으로 바꾸고, Transformer가 마지막 위치의 확률분포를 만든 뒤, 다음 token을 선택하는 과정을 memory traffic 관점까지 연결한다.
Category
Transformer, inference, serving, agent workload, token-level memory traffic.

문장을 token으로 바꾸고, Transformer가 마지막 위치의 확률분포를 만든 뒤, 다음 token을 선택하는 과정을 memory traffic 관점까지 연결한다.