관련 글 1건
LLM을 직접 서빙해보면 학습보다 추론 inference 이 더 골치 아프다는 걸 금방 알게 됩니다. GPU 메모리는 순식간에 꽉 차고, 토큰은 느리게 나오고, 비용은 요청량에 비례해 불어납니다. 다행히 추론을 가볍게 만드는 두 가지 핵심 기술이 있습니다. 바로 양자화 Quantizat