2026.09.11 접속자 24
로그인 회원가입
HOT
[프롬프트] ChatGPT한테 "역할 지정"으로 물어보니까 답이 훨씬 달라지네요 [프롬프트] 클라이언트한테 설명하기 좋은 프롬프트 짜는 법 있을까요? [기술 Q&A] LLM 파인튜닝 할 때 토큰 수 계산 이게 맞나요? [프롬프트] 긴 문서 요약할 때 프롬프트 어떻게 하세요? [AI뉴스] 국내 AI 기본법이 EU보다 먼저 규제 시작...7월 시행령 본격화되는데 회사들 준비됐나 [프롬프트] 데이터 분석 프롬프트 몇 달 써본 후기 - 실무에서 통하는 버전 [프롬프트] 업무 자동화 프롬프트 찾는데 실제로 쓸 만한 거 있나요? [AI뉴스] 2025년 AI도 본격적인 변화 시작... 실험에서 실전으로 넘어간다더라 [AI뉴스] 엔비디아 허깅페이스 인수, 17조원에 개방형 AI 생태계 판판이 깨졌네요 [AI뉴스] 요즘 GPT-5.5, 클로드 코드 성장률이 장난 아니네요 [프롬프트] ChatGPT한테 "역할 지정"으로 물어보니까 답이 훨씬 달라지네요 [프롬프트] 클라이언트한테 설명하기 좋은 프롬프트 짜는 법 있을까요? [기술 Q&A] LLM 파인튜닝 할 때 토큰 수 계산 이게 맞나요? [프롬프트] 긴 문서 요약할 때 프롬프트 어떻게 하세요? [AI뉴스] 국내 AI 기본법이 EU보다 먼저 규제 시작...7월 시행령 본격화되는데 회사들 준비됐나 [프롬프트] 데이터 분석 프롬프트 몇 달 써본 후기 - 실무에서 통하는 버전 [프롬프트] 업무 자동화 프롬프트 찾는데 실제로 쓸 만한 거 있나요? [AI뉴스] 2025년 AI도 본격적인 변화 시작... 실험에서 실전으로 넘어간다더라 [AI뉴스] 엔비디아 허깅페이스 인수, 17조원에 개방형 AI 생태계 판판이 깨졌네요 [AI뉴스] 요즘 GPT-5.5, 클로드 코드 성장률이 장난 아니네요
파인튜닝

LLM 파인튜닝할 때 토큰 길이 제한 어떻게 처리하세요?

AI새싹 2026.06.01 03:29 조회 279 추천 14 댓글 3건
요즘 llama2로 파인튜닝 해보고 있는데 데이터셋에서 토큰이 4096 넘어가는 경우가 꽤 많더라고요. 그냥 자르면 정보 손실이 생길 것 같고, 컨텍스트 윈도우를 늘리자니 메모리가 터질 것 같고 ㅠㅠ

지금은 그냥 길이별로 데이터 나눠서 따로 학습시키는 방식으로 하고 있는데, 이게 최선인지 모르겠어요. 혹시 더 나은 방법이 있으신가요?
추천 14 비추천 0
댓글 3

댓글목록

profile_image
딥러너
저도 비슷한 상황이었는데 Rope 스케일링 써봤어요. 컨텍스트 윈도우 늘리되 계산량은 크게 안 늘어서 괜찮더라고요. 아니면 긴 문서는 요약해서 넣거나 청크 단위로 데이터 재구성하는 방법도 있습니다.
profile_image
딥러닝장인
llama2는 기본적으로 RoPE 위치 인코딩을 써서 컨텍스트 확장이 까다롭긴 하더라고요. 저는 sliding window attention으로 처리했는데, 긴 문서를 겹치게 나눠서 학습하니까 정보 손실이 줄더라고요. 메모리도 훨씬 효율적이고요.
profile_image
요정
저도 비슷한 문제로 고생했는데 Position Interpolation 써보세요. 컨텍스트 윈도우 확장할 때 메모리 효율이 훨씬 낫더라고요. 아니면 Sliding Window Attention으로 긴 시퀀스를 나눠서 처리하는 방식도 있고요.