Read in English
이력서 PDF는 파서에 어떤 텍스트를 전달할까요?
가상의 이력서 6개를 만들고 모든 파일에 같은 네이티브 텍스트 레이어 파서를 실행했습니다. PDF 원본, 생성 코드, 추출 결과도 함께 공개합니다. 이 실험은 텍스트 추출만 확인하며 이력서의 품질은 평가하지 않습니다.
통제된 파일 6개의 결과
앵커는 실험용 PDF에 넣은 고유한 표시입니다. 발견된 앵커 수는 모든 텍스트 누락이 아니라 앵커 누락만 감지합니다. 앵커 위치를 비교해 이력서 내용을 평가하지 않고도 순서를 확인합니다.
측정 시각(UTC):
이번 실행에서 확인한 내용
- 1단, 2단, 한글, 한영 혼합, 표와 링크 파일에서는 모든 앵커가 예상 순서대로 추출됐습니다.
- 표와 링크 파일에서는 표의 셀, 화면에 보이는 URL, 링크 문구가 추출됐습니다. 사용한 파서는 문구에 연결된 PDF 링크의 목적지를 제공하지 않아 목적지 보존 여부는 평가하지 않았습니다.
- 이미지 전용 대조군에서는 네이티브 텍스트가 추출되지 않았습니다. OCR은 실행하지 않았으므로 OCR 정확도에 관한 결과가 아닙니다.
방법과 한계
한 페이지로 된 파일 6개에는 가상의 이름과 조직만 사용했습니다. ReportLab 4.4.9와 Pillow 12.3.0으로 생성하고 pdf-parse 1.1.1의 기본 텍스트 추출을 실행했습니다. 결과 JSON에는 전체 추출 텍스트, 앵커 수와 순서, 페이지 수, 파일 크기, SHA-256 해시가 들어 있습니다.
기준 JSON은 9월 11일 실행을 보존한 기록입니다. 당시의 2단 PDF와 이미지 전용 PDF 원본은 포함되어 있지 않아 두 파일의 과거 해시와 바이트 수는 현재 생성 코드로 재현할 수 없습니다.
이 실험은 ATS 통과 테스트, OCR 실험, 이력서 항목 정확도 테스트, refresh.cv 실제 불러오기 기능 테스트가 아닙니다. 통제된 파일의 추출 성공이 서류 통과나 채용 결과를 예측하지도 않습니다. 불러온 이름, 날짜, 링크, 섹션, 글머리표를 원본 PDF와 비교해 확인하세요.