텍스트데이터전처리 (1) 썸네일형 리스트형 텍스트 데이터 전처리 | 1. 토큰화(tokenization) 텍스트 데이터 전처리 (Text Data Preprocessing) 크롤링 등으로 얻어낸 코퍼스 데이터가 전처리되지 않은 상태일 경우, 용도에 맞게 토큰화, 정제, 정규화 등을 수행하는 전처리 과정을 지난다. 이 중 토큰화 내용 정리 토큰화(tokenization) 주어진 corpus에서 token이라는 단위로 나누는 작업 보통 의미있는 단위로 token을 정의한다 크게 단어 토큰화, 문장 토큰화가 있다. 단어 토큰화(word tokenization) 토큰의 기준을 단어(word)로 하는 경우 여기서 단어는 단어 단위 외에도 단어구, 의미를 갖는 문자열로도 설정할 수 있다. 띄어쓰기, 구두점만으로 토큰화하는 것은 불가능하다. 특히 한국어의 경우 띄어쓰기만으로는 단어 토큰을 구분하기 어렵다. 예를 들어, .. 이전 1 다음