-
[파이썬] 특성 추출 - TF-IDF ( 자연어 처리 / 벡터화 )
◎ TF - IDF ( Term Frequency - Inverse Document Frequency ) : 단어의 빈도(Term Frequency)와 역 문서 빈도(Inverse Document Frequency)를 토대로, 특정 문서 내에 어떤 단어가 얼마나 중요한 지를 나타내는 통계적 수치. >> 다른 문서에는 잘 등장하지 않지만, 이 문서에는 유독 많이 쓰인 단어가 이 문서의 키워드 ▷ TF (Term Frequency) 는 단어 빈도를 나타내며 문서 내에서 특정 단어가 몇 번 발견되었는지를 계산. 문서-단어 행렬이 곧 단어들의 TF 값을 구한 것임. ▷ IDF (Inverse Document Frequency) 는 DF 의 역수이며, 특정 단어가 발견되는 문서의 수를 뜻한다. 다시 말해, 특정 ..
-
[파이썬] PDF 문서 병합 / PDF 파일들을 하나로 합치기 - PyPDF2
※ PDF 문서를 병합하는 것은 PyPDF2 모듈을 이용한다. PyPDF2는 PDF 파일의 페이지를 분할, 병합, 자르기 및 변형 할 수있는 순수 Python PDF 라이브러리로, PDF 파일에 사용자 정의 데이터, 보기 옵션 및 암호를 추가 할 수 있다. PDF에서 텍스트와 메타 데이터를 검색하고 전체 파일을 함께 병합 할 수 있다. PyPDF2.PdfFileMerger (strict=True) : PdfFileMerger는 여러 PDF를 단일 PDF로 병합하며, 연결, 슬라이스, 삽입 또는 위의 조합이 가능하다. append (fileobj, bookmark = None, pages = None, import_bookmarks = True ) : 지정된 페이지 번호의 출력 파일로 병합 PyPDF2.P..
-
[파이썬] 형태소 분석 - konlpy 설치 ( 자연어 처리 / 토큰화 )
형태소 란 문장을 구성하는 의미 요소 중 가장 작은 단위를 말한다. 품사의 종류는 다양하지만, 보통 명사, 동사, 형용사 정도만을 분석에 사용한다. 부사나 조사, 감탄사 등은 독립적으로 의미를 만들지 못하므로 잘 사용하지 않는다. KoNLPy 에는 다양한 형태소 분석기가 내장되어 있어서, 텍스트의 특성이나 분석 목적에 맞는 것을 선택해 사용하면 된다. ( Korean Natural Language processing - https://konlpy.org/ko/latest/ ) ◎ 꼬꼬마 Kkma 분석기 서울대학교에서 개발한 형태소 분석기다. 자바 기반으로 개발되었으며, 품질 대비 속도가 느린 편이다. 문장 분리기를 제공하며 GPL 라이선스를 따른다.from konlpy.tag import Kkma Kkm..
-
[파이썬] 방정식 / 행렬 - 그래프 ( sympy / numpy 모듈 ) - 수학
◎ 다항식 from sympy import * import numpy as np init_printing() # 복잡한 수식표현 x, y = symbols('x y') #------------------------------------------------ eqn = Eq(2*x**2 + 3*x - 5, 0) # 방정식 (sympy) display(eqn) solve(eqn, x) #------------------------------------------------ np.roots([2, 3, -5]) # 방정식 (numpy) #--------------------------------------------------------------- plot(2*x**2 + 3*x - 5, (x, -5, 5)..
-
[파이썬] 리스트에서 특정 문자열 제거 / 문자 삭제
◎ 리스트에서 특정 문자열 제거 word_list = ['abc-123', 'def-456', 'ghi-789', 'abc-456'] search = "abc" for word in word_list: if search in word: print('>> remove: ' + word) word_list.remove(word) print(word_list) ◎ 리스트에서 문자 부분 삭제 word_list = ['abc-123', 'def-456', 'ghi-789', 'abc-456'] search = 'abc' for i, word in enumerate(word_list): if search in word: print('>> modify: ' + word) word_list[i] = word.strip..
-
[파이썬] 구글 번역 - googletrans
Googletrans 는구글 번역 API(Google Translate API)를 구현한 파이썬 라이브러리입니다. (Googletrans 공식 문서) from googletrans import Translator translator = Translator() tran = translator.translate("안녕하세요", src='auto', dest='zh-cn') print(tran.text, tran.pronunciation) 무료이지만, 하루에 사용할 수 있는 횟수가 제한되어 있습니다. The maximum character limit on a single text is 15k ▶ 사용할 수 있는 언어 import googletrans googletrans.LANGUAGES
-
[파이썬] heroku 웹호스팅 - Flask
Heroku는 간단하게 무료로 호스팅 할 수 있도록 해주는 서비스로, 해당 도메인으로 몇 시간 동안 요청이 없을 경우, 수면상태로 전환하여 초기접속이 약간 늦어지는 편이다. ▶ heroku 가입 및 설치 * PC에 git 설치 * heroku 전용 CLI 설치 devcenter.heroku.com/articles/getting-started-with-python#set-up Getting Started on Heroku with Python | Heroku Dev Center This tutorial will have you deploying a Python app (a simple Django app) in minutes. Hang on for a few more minutes to learn how ..
-
[파이썬] 문자열 정리 함수 - strip / split
strip() 함수 : 문자열 앞뒤의 공백 또는 특별한 문자 삭제. lstrip() 함수 - 문자열 앞에 있는 데이터만 처리 (문자열 왼쪽)rstrip() 함수 - 문자열 뒤에 있는 데이터만 처리 (문자열 오른쪽)text = ' 안녕 ' text = data1.strip()text = '####안녕####' text = text.strip('#') ▶ 결과 : '안녕' split() 함수 : 문자열 내부에 있는 공백 또는 특별한 문자를 구분해서, 리스트 아이템으로 만듦. text = '사과 배 포도 오렌지' text = text.split() ▶ 결과 : ['사과', '배', '포도', '오렌지'] text[1] ▶ 결과 : '배'