본문 바로가기

반응형

토큰화

(2)
[GoingDeeper] 04. 단어 빈도, 텍스트 분포로 벡터화하기 [GoingDeeper] 04. 단어 빈도, 텍스트 분포로 벡터화하기 목차 단어 빈도를 이용한 벡터화 1. Bag of words 2. DTM 3. TF-IDF 4. LSA(Latent Semetic analysis 5. LDA(Latent Dirichlet Allocation 텍스트 분포를 이용한 벡터화: soynlp 자연어 처리에서 텍스트를 숫자 벡터로 변환하는 과정을 벡터화(Vectorization) 이라고 한다. 벡터화 방법은 크게 1.통계와 머신러닝을 활용한 방법 과 2. 인공신경망을 활용한 방법 으로 나뉜다. 단어 빈도를 이용한 벡터화와 텍스트 분포를 이용한 벡터화의 경우 통계와 머신러닝을 활용한 벡터화에 속한다. 단어 빈도를 이용한 벡터화 1. Bag of words(BoW) 자연어처리, 정..
텍스트 데이터 전처리 | 1. 토큰화(tokenization) 텍스트 데이터 전처리 (Text Data Preprocessing) 크롤링 등으로 얻어낸 코퍼스 데이터가 전처리되지 않은 상태일 경우, 용도에 맞게 토큰화, 정제, 정규화 등을 수행하는 전처리 과정을 지난다. 이 중 토큰화 내용 정리 토큰화(tokenization) 주어진 corpus에서 token이라는 단위로 나누는 작업 보통 의미있는 단위로 token을 정의한다 크게 단어 토큰화, 문장 토큰화가 있다. 단어 토큰화(word tokenization) 토큰의 기준을 단어(word)로 하는 경우 여기서 단어는 단어 단위 외에도 단어구, 의미를 갖는 문자열로도 설정할 수 있다. 띄어쓰기, 구두점만으로 토큰화하는 것은 불가능하다. 특히 한국어의 경우 띄어쓰기만으로는 단어 토큰을 구분하기 어렵다. 예를 들어, ..

반응형