-
[파이썬] PDF 문서 병합 / PDF 파일들을 하나로 합치기 - PyPDF2
※ PDF 문서를 병합하는 것은 PyPDF2 모듈을 이용한다. PyPDF2는 PDF 파일의 페이지를 분할, 병합, 자르기 및 변형 할 수있는 순수 Python PDF 라이브러리로, PDF 파일에 사용자 정의 데이터, 보기 옵션 및 암호를 추가 할 수 있다. PDF에서 텍스트와 메타 데이터를 검색하고 전체 파일을 함께 병합 할 수 있다. PyPDF2.PdfFileMerger (strict=True) : PdfFileMerger는 여러 PDF를 단일 PDF로 병합하며, 연결, 슬라이스, 삽입 또는 위의 조합이 가능하다. append (fileobj, bookmark = None, pages = None, import_bookmarks = True ) : 지정된 페이지 번호의 출력 파일로 병합 PyPDF2.P..
-
[파이썬] 파워포인트 / 워드 문서를 PDF 파일로 변환하는 방법 ( ppt to pdf / doc to pdf ) - 자동화
comtypes를사용하면 순수 Python에서 사용자 지정 및 디스패치 기반 COM 인터페이스를 정의, 호출 및 구현할 수 있습니다. Windows, 64 비트 Windows 및 Windows CE에서 작동합니다. ▶ 파워포인트 문서를 PDF 파일로 변환 ( ppt → pdf ) import sys import os import comtypes.client input_folder_path = "문서 읽어들일 폴더" output_folder_path = "PDF 출력 폴더" input_file_paths = os.listdir(input_folder_path) for input_file_name in input_file_paths: if not input_file_name.lower().endswith((..
-
[파이썬] 특성 추출 - TF-IDF ( 자연어 처리 / 벡터화 )
◎ TF - IDF ( Term Frequency - Inverse Document Frequency ) : 단어의 빈도(Term Frequency)와 역 문서 빈도(Inverse Document Frequency)를 토대로, 특정 문서 내에 어떤 단어가 얼마나 중요한 지를 나타내는 통계적 수치. >> 다른 문서에는 잘 등장하지 않지만, 이 문서에는 유독 많이 쓰인 단어가 이 문서의 키워드 ▷ TF (Term Frequency) 는 단어 빈도를 나타내며 문서 내에서 특정 단어가 몇 번 발견되었는지를 계산. 문서-단어 행렬이 곧 단어들의 TF 값을 구한 것임. ▷ IDF (Inverse Document Frequency) 는 DF 의 역수이며, 특정 단어가 발견되는 문서의 수를 뜻한다. 다시 말해, 특정 ..
-
[파이썬 ] 데이터프레임 엑셀 시트 / 차트 만들기 - pandas / xlsxwriter 모듈
import pandas as pd data = {'name' : [ 'Jerry', 'Riah', 'Paul'], 'java' : [ 91, 98, 85], 'basic' : [ 81, 63, 83], 'c++' : [ 65, 83, 98], } df = pd.DataFrame(data) df.set_index('name', inplace=True) # name 열을 인덱스로 지정 print(df) #--------------------------------------------------------------------------------- # 데이터 작업 writer = pd.ExcelWriter('test_chart.xlsx', engine='xlsxwriter') df.to_excel(writ..
-
[파이썬] 난수 발생 (random) 모듈
import random random.random() # 0.0 ~ 1.0 사이의 실수(부동소수점) 한 개 random.randint(3, 10) # 3 ~ 10 사이의 정수 한 개 random.uniform(3, 10) # 3 ~ 10 사이의 실수 한 개 random.randrange(2, 20, 3) # 2, 5, 8, 11, 14, 17 중 한 개 random.normalvariate(10, 2) # 평균 10, 표준편차 2의 정규분포에서 실수 한 개 random.gammavariate(10, 2) # 감마분포에서 실수 한 개 . # random 리스트 ranlist = [] for i in range(10): ranlist.append(random.randint(1, 100)) random.cho..
-
[파이썬] 리스트에서 특정 문자열 제거 / 문자 삭제
◎ 리스트에서 특정 문자열 제거 word_list = ['abc-123', 'def-456', 'ghi-789', 'abc-456'] search = "abc" for word in word_list: if search in word: print('>> remove: ' + word) word_list.remove(word) print(word_list) ◎ 리스트에서 문자 부분 삭제 word_list = ['abc-123', 'def-456', 'ghi-789', 'abc-456'] search = 'abc' for i, word in enumerate(word_list): if search in word: print('>> modify: ' + word) word_list[i] = word.strip..
-
[파이썬] 문자열 정리 함수 - strip / split
strip() 함수 : 문자열 앞뒤의 공백 또는 특별한 문자 삭제. lstrip() 함수 - 문자열 앞에 있는 데이터만 처리 (문자열 왼쪽)rstrip() 함수 - 문자열 뒤에 있는 데이터만 처리 (문자열 오른쪽)text = ' 안녕 ' text = data1.strip()text = '####안녕####' text = text.strip('#') ▶ 결과 : '안녕' split() 함수 : 문자열 내부에 있는 공백 또는 특별한 문자를 구분해서, 리스트 아이템으로 만듦. text = '사과 배 포도 오렌지' text = text.split() ▶ 결과 : ['사과', '배', '포도', '오렌지'] text[1] ▶ 결과 : '배'
-
[파이썬] 웹페이지를 PDF화일로 변환하는 방법 ( web to pdf / HTML to pdf ) - pdfkit
pdfkit 모듈은 wkhtmltopdf 유틸리티를 이용하여 , 웹페이지 또는 저장된 HTML문서를 PDF문서로 변환하는 래퍼 모듈이다. 따라서, wkhtmltopdf가 설치되어 있어야 하고 경로가 configuration에 지정되어야 한다. https://wkhtmltopdf.org/downloads.html wkhtmltopdfAll downloads are currently hosted via GitHub releases, so you can browse for a specific download or use the links below. Do not use wkhtmltopdf with any untrusted HTML – be sure to sanitize any user-supplied HTM..