vLLM 배치 사이즈부터 모델 스왑까지 직접 운영

vLLM_배치사이즈_모델스왑

공식 문서는 설치까지는 친절하다. 그 다음부터가 문제다. vLLM 깃허브 star 수는 이미 수만을 넘었고, 한국어로 된 설치 가이드도 제법 나온다. 그런데 막상 추론 서버를 실제 운영 환경에 올려보면 공식 문서가 다루지 않는 영역이 금방 나타난다. GPU 메모리 설정을 어떻게 잡아야 안정적으로 돌아가는지, 배치 사이즈가 응답 시간에 어떻게 영향을 주는지, 모델을 스왑해야 할 때 서비스를 얼마나 … Read more

범용 AI에서 실행형 AI로, 토큰 비용 폭증이 만든 2026년 엔터프라이즈 AI 새 지형도

엔터프라이즈 AI 새 지형도

며칠 전 한 고객사에서 토큰 청구서를 받아 든 부서장이 “이거 진짜 맞느냐”라고 두 번 물어왔다. 원래 챗봇 PoC 한 달 비용으로 300만 원 정도 잡아두었던 항목이, 정식 운영에 들어간 다음 달 청구서에서 1,800만 원으로 찍혀 나왔다고 한다. 무엇이 잘못된 게 아니었다. 챗봇이 단순 질의응답에서 다단계 추론과 도구 호출이 들어간 ‘에이전트’로 진화하면서 토큰 사용량이 6배 가까이 … Read more