-
[파이썬] PDF 문서 병합 / PDF 파일들을 하나로 합치기 - PyPDF2
※ PDF 문서를 병합하는 것은 PyPDF2 모듈을 이용한다. PyPDF2는 PDF 파일의 페이지를 분할, 병합, 자르기 및 변형 할 수있는 순수 Python PDF 라이브러리로, PDF 파일에 사용자 정의 데이터, 보기 옵션 및 암호를 추가 할 수 있다. PDF에서 텍스트와 메타 데이터를 검색하고 전체 파일을 함께 병합 할 수 있다. PyPDF2.PdfFileMerger (strict=True) : PdfFileMerger는 여러 PDF를 단일 PDF로 병합하며, 연결, 슬라이스, 삽입 또는 위의 조합이 가능하다. append (fileobj, bookmark = None, pages = None, import_bookmarks = True ) : 지정된 페이지 번호의 출력 파일로 병합 PyPDF2.P..
-
[파이썬] 문자열 정리 함수 - strip / split
strip() 함수 : 문자열 앞뒤의 공백 또는 특별한 문자 삭제. lstrip() 함수 - 문자열 앞에 있는 데이터만 처리 (문자열 왼쪽)rstrip() 함수 - 문자열 뒤에 있는 데이터만 처리 (문자열 오른쪽)text = ' 안녕 ' text = data1.strip()text = '####안녕####' text = text.strip('#') ▶ 결과 : '안녕' split() 함수 : 문자열 내부에 있는 공백 또는 특별한 문자를 구분해서, 리스트 아이템으로 만듦. text = '사과 배 포도 오렌지' text = text.split() ▶ 결과 : ['사과', '배', '포도', '오렌지'] text[1] ▶ 결과 : '배'
-
[파이썬] 데이터프레임을 파일로 저장 - 텍스트 / 표 / 엑셀 - pandas
▶DataFrame을 텍스트(text) 파일로 변환 import pandas df.to_csv('sample_file.txt', index=False, header=None, sep="\t") index = False : 왼쪽 컬럼 (인덱스) 삭제 header = None : 헤더 삭제 ▶ DataFrame을 표(html) 로 변환 import pandas df.to_html("sample_file.html") ▶ DataFrame을 엑셀 (excel) 로 변환 import pandas df.to_excel("sample_file.xlsx")
-
[파이썬] 아나콘다 가상환경에서 spyder 설치 (32bit)
▶ 64bit 환경에서 32비트로 사용시, set CONDA_FORCE_32BIT=1 ※ 가상환경 생성 conda create -n 가상환경이름 -n 옵션은 가상환경의 이름을 설정해주는 부분으로 나중에 가상환경을 이용하거나 삭제할 때 쓸 수 있도록 알아보기 쉽게 입력하면 됩니다. ▶ python 3.8 버전의 아나콘다 가상환경 생성 conda create -n test python=3.8 ▶ 가상환경 실행 activate test ※ 가상환경 확인 conda info --envs 만들어진 가상환경들을 확인하는 방법은 conda info --envs 또는 conda env list 명령어를 통해 가능 conda info --envs ▶ 가상환경에 spyder 설치 : 가상환경내에서 실행 conda inst..
-
챗GPT (Chat GPT)의 동작원리와 발전단계
챗GPT(Chat Generative Pre-trained Transformer)는 자연어 처리 기술을 사용하여 대화를 이어나가는 모델로, 입력된 문장의 다음 단어를 예측하는 언어 모델이다. 이것은 대규모 데이터셋을 학습하여 생성되었으며, 이를 통해 자연스러운 대화를 이어나갈 수 있다. 챗GPT가 학습한 데이터의 크기는 570GB 정도이며, 단어로 치면 3,000억 개가 넘는다. 여기에는 책 위키백과, 보고서, 웹사이트 등에서 긁어모은 다양한 유형의 데이터가 포함되며, 언어 또한 특정언어에 국한되지 않는다. 챗GPT의 동작 원리는 그림과 같이프롬프트 (Prompt)라는 질의를 입력하면 챗GPT가 그에 대한 대답으로 컴플리션 (Completion)을 보여 준다. 구글은 2017년에 트랜스포머라는 것을 발표..
-
[파이썬] 토픽 모델링 - 잠재 디리클레 할당 LDA ( 자연어 처리 / 주제 분류)
※ 토픽 모델링 ( Topic modeling ) 토픽 모델 (Topic model) 이란, 문서 집합의 추상적인 주제를 발견하기 위한 통계적 모델. 문헌 내에 어떤 주제가 들어있고, 주제 간의 비중이 어떤지는 문헌 집합 내의 단어 통계를 수학적으로 분석함으로써 알아낼 수 있다. 토픽 모델링의 중요한 특징은 레이블이 된 데이터가 필요 없다는 점이며, 스스로 패턴을 식별하는 비지도학습 방식이다. ◎ 토픽 모델링에 대한 사용 사례 • 문서 토픽 요약 : 문서의 토픽을 요약할 수 있어서, 신속하게 분류할 수 있도록 도와줌. 준다. • 검색엔진 최적화 : 토픽과 관련 키워드를 식별하여, 온라인 기사, 블로그 및 문서를 쉽게 태그 할 수 있으므로 검색 결과 최적화가 향상됨. • 고객 지원 개선 : 제품 및 서비스..
-
[파이썬] 특성추출 - 단어임베딩 ( 자연어처리 / 벡터화 ) - word2vec
※ 단어 임베딩 ( Word Embedding ) 원-핫 인코딩( one-hot encoding ) 방식에서는 텍스트의 단어를 벡터로 표현하며, 단어에 해당하는 항목만이 1이고, 다른 모든 항목은 0으로 표기한다. 이 방식에서는 단어가 같은 단어인지 아닌지를 비교하는 작업만 할 수 있다. ( 희소벡터 / 희소행렬 ) 또한, 새로운 단어를 추가하려고 하면 벡터의 차원이 증가된다. 연구자들은 이러한 단점을 극복하기 위해 단어를 다차원 공간에서 벡터화하는 방식을 고안하게 되었으며, 다차원에서 벡터화하는 것뿐만 아니라 연산처리까지 할 수 있게 하는 단어의 분산표현인 단어 임베딩 ( Word Embedding )이라는 방식을 제안하게 된다. 이것을 학습하기 위해서 만들어진 효율적인 예측 모델이 구글의 word2v..
-
[파이썬] 특성 추출 - TF-IDF ( 자연어 처리 / 벡터화 )
◎ TF - IDF ( Term Frequency - Inverse Document Frequency ) : 단어의 빈도(Term Frequency)와 역 문서 빈도(Inverse Document Frequency)를 토대로, 특정 문서 내에 어떤 단어가 얼마나 중요한 지를 나타내는 통계적 수치. >> 다른 문서에는 잘 등장하지 않지만, 이 문서에는 유독 많이 쓰인 단어가 이 문서의 키워드 ▷ TF (Term Frequency) 는 단어 빈도를 나타내며 문서 내에서 특정 단어가 몇 번 발견되었는지를 계산. 문서-단어 행렬이 곧 단어들의 TF 값을 구한 것임. ▷ IDF (Inverse Document Frequency) 는 DF 의 역수이며, 특정 단어가 발견되는 문서의 수를 뜻한다. 다시 말해, 특정 ..