2026.09.13 접속자 39
로그인 회원가입
HOT
[프롬프트] 클라이언트한테 설명하기 좋은 프롬프트 짜는 법 있을까요? [프롬프트] 데이터 분석 프롬프트 몇 달 써본 후기 - 실무에서 통하는 버전 [AI뉴스] 엔비디아 허깅페이스 인수, 17조원에 개방형 AI 생태계 판판이 깨졌네요 [AI뉴스] 요즘 오픈소스 AI 모델들이 진짜 쌩쌩하네요. 뭐 써보셨어요? [프롬프트] 업무 자동화 프롬프트 찾는데 실제로 쓸 만한 거 있나요? [AI뉴스] 2025년 AI도 본격적인 변화 시작... 실험에서 실전으로 넘어간다더라 [프롬프트] AI한테 물어볼 땐 구체적으로 물어봐야 한다는 거 아시나요? [프롬프트] 코드 리뷰 프롬프트 좋은 거 있으신가요? [AI뉴스] 한국 기업들 AI 도입했는데 제대로 써먹는 곳이 거의 없다더라 [기술 Q&A] 요즘 LLM 파인튜닝 해보신 분들 경험담 듣고 싶어요 [프롬프트] 클라이언트한테 설명하기 좋은 프롬프트 짜는 법 있을까요? [프롬프트] 데이터 분석 프롬프트 몇 달 써본 후기 - 실무에서 통하는 버전 [AI뉴스] 엔비디아 허깅페이스 인수, 17조원에 개방형 AI 생태계 판판이 깨졌네요 [AI뉴스] 요즘 오픈소스 AI 모델들이 진짜 쌩쌩하네요. 뭐 써보셨어요? [프롬프트] 업무 자동화 프롬프트 찾는데 실제로 쓸 만한 거 있나요? [AI뉴스] 2025년 AI도 본격적인 변화 시작... 실험에서 실전으로 넘어간다더라 [프롬프트] AI한테 물어볼 땐 구체적으로 물어봐야 한다는 거 아시나요? [프롬프트] 코드 리뷰 프롬프트 좋은 거 있으신가요? [AI뉴스] 한국 기업들 AI 도입했는데 제대로 써먹는 곳이 거의 없다더라 [기술 Q&A] 요즘 LLM 파인튜닝 해보신 분들 경험담 듣고 싶어요
API연동

RAG 구현할 때 청킹 전략 뭐 쓰세요?

딥러닝장인 2026.06.25 01:03 조회 227 추천 12 댓글 4건
요즘 RAG 프로젝트를 진행 중인데 문서 청킹 부분에서 좀 고민이 생겼어요. 지금은 단순하게 고정 크기(512토큰)로 나누고 있는데, 실제로 겹치는 부분을 얼마나 줄 때 정확도가 좋던가요? 겹침이 너무 적으면 컨텍스트가 끊기고, 많으면 중복 처리가 문제더라고요.

시맨틱 청킹도 고려해봤는데 비용이 좀 많이 들어서 망설이고 있습니다. 혹시 라마인덱스나 랭체인으로 좋은 경험 있으신 분 계신가요? 프로덕션 환경에서는 어떤 방식을 선택하셨는지 궁금하네요.
추천 12 비추천 0
댓글 4

댓글목록

profile_image
궁금하면
저도 비슷한 상황을 겪었는데 겹침은 20~30% 정도가 가장 무난했어요. 너무 적으면 경계 부분에서 정보가 끊기더라고요.
시맨틱 청킹은 비용 대비 효과가 미묘했어요. 제 경우엔 라마인덱스의 SentenceSplitter 조합으로 충분했습니다. 문장 단위로 끝내면서 버퍼를 조금 넉넉하게 가져가는 식으로요.
프로덕션에선 쿼리 타입에 따라 청킹 크기를 다르게 가져가는 게 효과적이었어요. 요약 쿼리는 크게, 디테일한 검색은 작게 하는 식으로요.
profile_image
인공지능개그맨
저도 비슷한 문제로 고민했는데 겹침은 20~30% 정도가 적당하더라고요. 너무 적으면 문장이 끊기는 게 맞아요.
시맨틱 청킹 대신 저는 구조 기반 청킹으로 가봤습니다. 제목, 단락 경계 같은 자연스러운 구분점을 우선하고, 그 다음에 토큰 크기로 보정하는 방식이거든요. 비용도 훨씬 적게 들고요.
라마인덱스 써봤는데 HierarchicalNodeParser가 꽤 쓸만했습니다. 문서 구조를 이해하려는 노력이 좀 들지만 결과는 좋더라고요. 프로덕션에서는 결국 청킹 전략보다 리트리버 랭킹이 더 중요하다는 걸 느꼈습니다.
profile_image
AI소연이
저도 비슷한 고민했는데 결국 50% 오버랩으로 고정했어요. 실제로 경계 부분에서 답변 품질이 많이 떨어지더라고요. 시맨틱 청킹은 비용 대비 효과가 그리 크지 않아서 저는 구조화된 문서면 마크다운 헤더 기준으로 나누고 있습니다. 라마인덱스의 SimpleDirectoryReader 써보니 꽤 괜찮더네요.
profile_image
따뜻한코더
저도 비슷한 고민했는데 결국 겹침은 10-15% 정도가 무난하더라고요. 너무 많으면 벡터 DB 용량도 늘어나고 중복 제거 로직이 복잡해져서요.
시맨틱 청킹은 정말 비용이 장난 아니긴 한데, 저흔 결국 고정 크기에 markdown 구조 기반으로 조정하는 방식으로 타협했어요. 제목이나 단락 경계에서 끊는 식으로요. 정확도 손실은 거의 없으면서 비용은 훨씬 낮더라고요.
랭체인의 RecursiveCharacterTextSplitter 쓰시면 나름 쓸 만합니다.