Read in English

이력서 PDF는 파서에 어떤 텍스트를 전달할까요?

가상의 이력서 6개를 만들고 모든 파일에 같은 네이티브 텍스트 레이어 파서를 실행했습니다. PDF 원본, 생성 코드, 추출 결과도 함께 공개합니다. 이 실험은 텍스트 추출만 확인하며 이력서의 품질은 평가하지 않습니다.

통제된 파일 6개의 결과

앵커는 실험용 PDF에 넣은 고유한 표시입니다. 발견된 앵커 수는 모든 텍스트 누락이 아니라 앵커 누락만 감지합니다. 앵커 위치를 비교해 이력서 내용을 평가하지 않고도 순서를 확인합니다.

측정 시각(UTC):

실험 파일발견한 앵커추출한 텍스트예상 순서원본 파일
1단 텍스트 PDF10/10378 자일치PDF 다운로드
2단 텍스트 PDF10/10287 자일치PDF 다운로드
한글 텍스트 PDF7/7140 자일치PDF 다운로드
한영 혼합 PDF7/7193 자일치PDF 다운로드
표와 링크 PDF9/9218 자일치PDF 다운로드
이미지 전용 스캔 PDF0/60 자측정 불가PDF 다운로드

이번 실행에서 확인한 내용

  • 1단, 2단, 한글, 한영 혼합, 표와 링크 파일에서는 모든 앵커가 예상 순서대로 추출됐습니다.
  • 표와 링크 파일에서는 표의 셀, 화면에 보이는 URL, 링크 문구가 추출됐습니다. 사용한 파서는 문구에 연결된 PDF 링크의 목적지를 제공하지 않아 목적지 보존 여부는 평가하지 않았습니다.
  • 이미지 전용 대조군에서는 네이티브 텍스트가 추출되지 않았습니다. OCR은 실행하지 않았으므로 OCR 정확도에 관한 결과가 아닙니다.

방법과 한계

한 페이지로 된 파일 6개에는 가상의 이름과 조직만 사용했습니다. ReportLab 4.4.9와 Pillow 12.3.0으로 생성하고 pdf-parse 1.1.1의 기본 텍스트 추출을 실행했습니다. 결과 JSON에는 전체 추출 텍스트, 앵커 수와 순서, 페이지 수, 파일 크기, SHA-256 해시가 들어 있습니다.

기준 JSON은 9월 11일 실행을 보존한 기록입니다. 당시의 2단 PDF와 이미지 전용 PDF 원본은 포함되어 있지 않아 두 파일의 과거 해시와 바이트 수는 현재 생성 코드로 재현할 수 없습니다.

이 실험은 ATS 통과 테스트, OCR 실험, 이력서 항목 정확도 테스트, refresh.cv 실제 불러오기 기능 테스트가 아닙니다. 통제된 파일의 추출 성공이 서류 통과나 채용 결과를 예측하지도 않습니다. 불러온 이름, 날짜, 링크, 섹션, 글머리표를 원본 PDF와 비교해 확인하세요.

내 PDF를 편집 가능한 이력서로 확인하세요

PDF를 불러온 뒤 수정하거나 내보내기 전에 원본과 편집 가능한 각 항목을 비교하세요.

PDF 이력서 불러오기