2026.09.09 접속자 208
로그인 회원가입
HOT
[프롬프트] 업무 자동화 프롬프트 짜다가 깨달은 것들 [프롬프트] 일일 업무 정리할 때 쓰는 프롬프트 공유합니다 [AI뉴스] 올해 AI 판도 정리됐네... 구글 vs 오픈AI 경쟁 되짚어봅니다 [AI뉴스] 요즘 LLM 모델들 진짜 미친 속도로 나오네요... Llama 4, Gemma 3까지 [프롬프트] ChatGPT한테 "역할 지정"으로 물어보니까 답이 훨씬 달라지네요 [프롬프트] 코드 리뷰 프롬프트 어떻게 쓰세요? [프롬프트] 클라이언트한테 설명하기 좋은 프롬프트 짜는 법 있을까요? [AI뉴스] 올해 LLM 모델 출시 진짜 미쳤네요 [AI뉴스] 요즘 AI 3강 업데이트 정리... 어디가 제일 나은지 모르겠어요 [기술 Q&A] 최근 LLM 파인튜닝 시 토큰 효율성 어떻게 관리하세요? [프롬프트] 업무 자동화 프롬프트 짜다가 깨달은 것들 [프롬프트] 일일 업무 정리할 때 쓰는 프롬프트 공유합니다 [AI뉴스] 올해 AI 판도 정리됐네... 구글 vs 오픈AI 경쟁 되짚어봅니다 [AI뉴스] 요즘 LLM 모델들 진짜 미친 속도로 나오네요... Llama 4, Gemma 3까지 [프롬프트] ChatGPT한테 "역할 지정"으로 물어보니까 답이 훨씬 달라지네요 [프롬프트] 코드 리뷰 프롬프트 어떻게 쓰세요? [프롬프트] 클라이언트한테 설명하기 좋은 프롬프트 짜는 법 있을까요? [AI뉴스] 올해 LLM 모델 출시 진짜 미쳤네요 [AI뉴스] 요즘 AI 3강 업데이트 정리... 어디가 제일 나은지 모르겠어요 [기술 Q&A] 최근 LLM 파인튜닝 시 토큰 효율성 어떻게 관리하세요?
프롬프트

LLM 로컬 배포 해본 사람 있나요? 생각보다 까다로운데

코드리뷰어 2026.08.26 19:52 조회 71 추천 5 댓글 2건
회사 프로젝트에서 데이터 보안 때문에 클라우드 API 못 쓰고 온프레미스에 LLM을 직접 배포해야 했거든요. Ollama랑 LM Studio 써봤는데 둘 다 생각보다 번거로운 거 있더라고요. 특히 토큰 처리 부분에서 예상 안 했던 메모리 이슈가 자주 터졌어요.

결국 vLLM으로 갈아탔는데 inference 속도가 정말 달라요. 같은 모델이어도 처리 속도가 1.5배 이상 빨라졌습니다. 근데 세팅이 좀 복잡하긴 해서 초반에 시간이 꽤 걸렸어요.

혹시 비슷한 환경에서 작업하시는 분들은 어떤 솔루션 쓰고 계세요? 더 나은 방법이 있으면 참고하고 싶네요.
추천 5 비추천 0
댓글 2

댓글목록

profile_image
딥러닝장인
vLLM 정말 체감되는 차이 있더라고요. 저도 비슷한 상황인데 메모리 최적화가 핵심인 것 같아요.
profile_image
딥러너
vLLM 선택 잘하셨네요. 저도 비슷한 상황에서 Ollama 쓰다가 batch 처리할 때 메모리 폭증하는 거 경험했거든요. vLLM의 paged attention이 진짜 차이를 만드는 것 같아요.
한 가지 팁인데 vLLM 세팅할 때 tensor-parallelism 설정이 까다로울 수 있으니 GPU 메모리 구성에 맞게 --gpu-memory-utilization 파라미터를 조정하시면 도움이 됩니다. 저는 0.8~0.9 사이에서 가장 안정적이었어요.
혹시 serving 레이어로는 뭘 쓰고 계세요? FastAPI로 래핑해서 쓰는지, 아니면 vLLM의 기본 API 서버를 그대로 쓰는지 궁금하네요.