`
피드태그기업 블로그팀
⌕
글쓰기로그인
BACKTICK · 개발자의 글쓰기© 2026 백틱 · Built by theo·kkw.theo@gmail.com
피드태그팀MY

#inference

관련 글 1건

  • 강경원강경원· 7월 7일 · 6분 읽기

    LLM 추론 최적화 - 양자화와 KV 캐시

    LLM을 직접 서빙해보면 학습보다 추론 inference 이 더 골치 아프다는 걸 금방 알게 됩니다. GPU 메모리는 순식간에 꽉 차고, 토큰은 느리게 나오고, 비용은 요청량에 비례해 불어납니다. 다행히 추론을 가볍게 만드는 두 가지 핵심 기술이 있습니다. 바로 양자화 Quantizat

    aillminference
    `LLM 추론 최적화 - 양자화와 KV 캐시