2026.09.12 접속자 101
로그인 회원가입
HOT
[프롬프트] 클라이언트한테 설명하기 좋은 프롬프트 짜는 법 있을까요? [기술 Q&A] LLM 파인튜닝 할 때 토큰 수 계산 이게 맞나요? [프롬프트] 긴 문서 요약할 때 프롬프트 어떻게 하세요? [AI뉴스] 국내 AI 기본법이 EU보다 먼저 규제 시작...7월 시행령 본격화되는데 회사들 준비됐나 [프롬프트] 데이터 분석 프롬프트 몇 달 써본 후기 - 실무에서 통하는 버전 [프롬프트] 업무 자동화 프롬프트 찾는데 실제로 쓸 만한 거 있나요? [AI뉴스] 2025년 AI도 본격적인 변화 시작... 실험에서 실전으로 넘어간다더라 [프롬프트] AI한테 물어볼 땐 구체적으로 물어봐야 한다는 거 아시나요? [기술 Q&A] 요즘 LLM 파인튜닝 해보신 분들 경험담 듣고 싶어요 [AI뉴스] 엔비디아 허깅페이스 인수, 17조원에 개방형 AI 생태계 판판이 깨졌네요 [프롬프트] 클라이언트한테 설명하기 좋은 프롬프트 짜는 법 있을까요? [기술 Q&A] LLM 파인튜닝 할 때 토큰 수 계산 이게 맞나요? [프롬프트] 긴 문서 요약할 때 프롬프트 어떻게 하세요? [AI뉴스] 국내 AI 기본법이 EU보다 먼저 규제 시작...7월 시행령 본격화되는데 회사들 준비됐나 [프롬프트] 데이터 분석 프롬프트 몇 달 써본 후기 - 실무에서 통하는 버전 [프롬프트] 업무 자동화 프롬프트 찾는데 실제로 쓸 만한 거 있나요? [AI뉴스] 2025년 AI도 본격적인 변화 시작... 실험에서 실전으로 넘어간다더라 [프롬프트] AI한테 물어볼 땐 구체적으로 물어봐야 한다는 거 아시나요? [기술 Q&A] 요즘 LLM 파인튜닝 해보신 분들 경험담 듣고 싶어요 [AI뉴스] 엔비디아 허깅페이스 인수, 17조원에 개방형 AI 생태계 판판이 깨졌네요
파인튜닝

요즘 LLM 평가할 때 뭘 기준으로 보세요?

현실주의자 2026.06.24 15:49 조회 222 추천 12 댓글 2건
회사에서 프로젝트마다 다른 모델 써야 하는데 자꾸 "이 모델이 최고다"라고 주장하는 사람들 때문에 헷갈리네요. 벤치마크 수치만 보면 GPT-4가 최고인데, 실제로 회사 업무에 쓰면 claude가 더 나을 때도 있고, 응답 시간이 중요한 경우엔 또 다르고요.

결국 context window, 비용, 응답 속도, 정확도를 다 고려해야 하는데 이걸 어떻게 체계적으로 평가하시는지 궁금해요. 혹시 자체적으로 테스트 셋 만들어서 비교하는 분 있으신가요? 아니면 그냥 필요할 때마다 써보고 판단하시는 건가요?
추천 12 비추천 0
댓글 2

댓글목록

profile_image
코드리뷰어
저도 매번 이 문제로 고민하거든요 ㅠㅠ
예전에 이런 삽질을 했는데, 처음엔 벤치마크 스코어만 믿고 GPT-4 쓰다가 실제로 우리 고객 데이터로 테스트해보니 Claude가 더 나은 거예요. 특히 긴 문서 분석할 때 context window 활용이 훨씬 나았어요.
결국 저도 자체 테스트 셋 만드는 게 최고라는 결론에 도달했습니다. 우리 실제 작업 케이스 20~30개 정도 모아서 각 모델 돌려보고 정성평가 + 정량평가 섞어서 비교하는데, 이게 가장 현실적이더라고요.
특히 추천하는 건 가중치 매트릭스 같은 거 만드는 거예요. 각 프로젝
profile_image
인공지능개그맨
저도 같은 고민하다가 결국 회사 데이터로 직접 테스트 셋 만들었어요. 벤치마크는 참고만 하고 실제 업무 케이스 20~30개 정도 돌려보니까 훨씬 명확하더라고요. Claude가 긴 문서 분석할 땐 확실히 낫고, 속도 중요한 곳은 Llama 3 같은 오픈소스가 나을 때도 있고요. 결국 use case별로 달라서 한 모델에 올인할 수 없는 게 현실이네요.