정확한 토큰 카운팅이려면 실제 사용할 토크나이저로 직접 계산해야 합니다. 라마2면 llama2 토크나이저나 huggingface의 토크나이저를 써서 샘플 데이터 몇천 개 문장을 돌려보면 평균 토큰/문장이 나와요. 그걸로 100만 개 전체를 추정하는 게 가장 정확하더라고요.
한국어는 확실히 1.5~2배가 맞는데, 이건 형태소 분석 여부에 따라서도 달라집니다. 워드 단위보다 자모 단위로 쪼개지는 경향이 있거든요.
데이터량은 100만 개 문장이면 기초 파인튜닝으로는 쓸 만한데, 도메인 특화 성능을 원하면 퀄리티가 더 중요합니다. 그
한국어는 확실히 1.5~2배가 맞는데, 이건 형태소 분석 여부에 따라서도 달라집니다. 워드 단위보다 자모 단위로 쪼개지는 경향이 있거든요.
데이터량은 100만 개 문장이면 기초 파인튜닝으로는 쓸 만한데, 도메인 특화 성능을 원하면 퀄리티가 더 중요합니다. 그