요즘 오픈소스 LLM 다들 로컬에 돌려본다고 해서 저도 궁금해서 시도해봤습니다. Ollama 설치하고 Llama 2, Mistral 같은 모델들 여러 개 돌려봤거든요.
결론부터 말하면 실무에서 쓰기엔 아직 멀었다는 생각이 들어요. 제일 처음 느낀 게 속도 문제인데, 응답 시간이 정말 길더라고요. GPU 괜찮은 3060ti 써도 토큰 생성 속도가 초당 10개 정도? 클라우드 기반 API 비교하면 느껴지는 차이가 확실합니다. 그리고 한국어 능력도 생각보다 많이 떨어져요. 특히 뉘앙스 파악이나 복잡한 지시사항 이해도에서요.
당연히 장점도 있죠. 데이터가 서버로 안 나간다는 건 보안 관점에서 강점이고, API 비용 걱정 안 해도 되는 게 좋습니다. 근데 그게 구축하는데 들어가는 시간 비용을 상쇄할 수 있을 정도는 아닌 것 같아요. 특히 개인이나 소규모 팀이라면 더욱 그렇고요.
혹시 로컬 LLM으로 뭔가 잘 굴려서 쓰고 계신 분 계신가요? 제가 뭔가 잘못 설정한 걸 수도 있으니까 팁 있으시면 좋겠습니다. 특히 한국어 처리나 응답 속도 개선 관련해서요.