PDF를 CSV로 변환하는 변환기 도구는 PDF 파일에서 표를 추출하여 Excel에서 대화 상자 없이 열 수 있는 CSV로 작성합니다. 실행당 하나의 폴더가 자체 Windows PC에 생성됩니다.
PDF를 CSV로 변환하는 변환기를 다운로드하고 설치 프로그램을 실행합니다. 다른 설정은 필요하지 않습니다. PDF를 여는 엔진과 스캔된 페이지용 인식기가 모두 프로그램 내에 포함되어 있습니다.
단일 PDF 파일을 드래그하거나, 문들이 이미 있는 전체 디렉터리를 추가합니다. 목록에는 추가한 순서대로 유지되며, 필요 없는 항목은 한 번의 클릭으로 제거할 수 있습니다.
미리 보기는 문서의 페이지 수, 발견된 표의 수, 각 표를 읽은 경로, 각 표의 첫 행을 표시합니다. 첫 행이 머리글인데도 제대로 인식되지 않았다면, Excel에서 나중에 복구하는 대신 변환 탭의 확인란을 사용하면 됩니다.
문서당 하나의 CSV를 작성하거나, 모든 표를 하나의 결합된 파일로 보냅니다. 금액이 공식에 사용될 경우 숫자 및 날짜 정규화를 켭니다. 그런 다음 변환을 누릅니다.
회계사에게 PDF 더미를 여전히 다시 입력하는 이유를 물으면 대부분 같은 대답을 듣습니다. 고객의 은행 명세서는 무료로 변환해주는 웹사이트에 올라가지 않습니다. 이것은 일반적인 Windows 프로그램입니다. 가운데 브라우저 탭도 없고, 전송하는 엔드포인트도 없고, 다른 사람들의 업로드 뒤에서 명세서가 차례를 기다리는 서버상의 큐도 없습니다. 이미지 전용 페이지 인식조차도 자체 컴퓨터의 도우미 프로세스에서 이루어지므로 PDF to CSV 변환기 소프트웨어는 작업의 어떤 지점에서도 네트워크를 건드릴 이유가 없습니다.
이 시장의 모든 제품은 정확도 백분율을 첫 페이지에 인쇄하며, 여섯 번째 제품이 되면 숫자는 더 이상 정보를 전달하지 않습니다. 따라서 여기에는 백분율이 없습니다. 이 시험판은 자체 문서를 변환하고 데이터의 첫 10행을 작성하며, 거기서 중지했다는 것을 명확하게 표시합니다. 은행 명세서 한 페이지에는 약 40개의 거래 행이 포함되므로, 10행은 샘플이며 문서 자체는 아닙니다. 테이블이 정렬되는지 확인할 수는 있지만, 구매를 무의미하게 만들 만큼 충분하지는 않습니다. 헤더 행은 제한에서 제외됩니다.
몇 개의 거래를 놓치고도 깔끔해 보이는 내보내기를 제공하는 변환기는 몇 주 후에 은행 대사 과정에서 문제가 발생합니다. 그때는 어느 명세서에서 누락되었는지 아무도 기억하지 못합니다. 따라서 해결할 수 없었던 것은 즉시, 그것이 나온 파일과 함께 이름이 지정되며, 조용히 빈 행이 되지 않습니다. 두 가지 동작 중 더 보기 좋지 않은 것입니다. 또한 고객이 선택할 동작이기도 합니다.
Word, Excel 또는 Google Docs에서 나온 태그가 지정된 PDF는 테이블을 구조로 가지고 있으므로 셀이 추측되는 대신 추출됩니다. 선으로 된 테이블은 페이지의 벡터 선 세그먼트에서 가져오며, 그림에서 가져오는 것이 아닙니다. 선이 전혀 없는 곳에서는 텍스트를 페이지 전체에 투영하고 모든 행을 통과하는 수직 복도를 찾아 기하학적 모양을 계산합니다. 실제 작업에서 62개의 문서를 대상으로 한 실시간 분석에서 분할은 선을 통해 65페이지, 공백을 통해 48페이지, 태그된 구조를 통해 9페이지로 나타났습니다. 정확한 출력으로 알려진 당사의 코퍼스는 150개의 자동화된 검사를 통과했으며, 단일 평균은 어려움을 겪는 단일 경로를 숨기기 때문에 각 경로별로 통과 기준이 설정됩니다. 존재하지 않는 테이블은 생성되지도 않습니다. 해당 코퍼스에서 0건의 잘못된 긍정 결과가 나왔습니다.
텍스트 레이어가 없는 페이지도 처리 가능. 이미지 해상도로 렌더링(150~300 DPI), 인식기로 전달. 페이지별 결정, 텍스트 없는 페이지 스캔 비용 미부과. 라틴, 키릴 문자 지원. CJK, 아랍어, 태국어, 그리스어, 히브리어 미지원. 원시 PDF 대비 오류 발생 가능성 높음, 사전 테스트 권장.
명세서에서 열 머리글은 매 페이지 반복, 대부분의 도구도 마찬가지. 본 기능은 프래그먼트를 하나의 표로 재구성, 반복되는 머리글 제거. 40페이지 명세서를 40개의 작은 블록 대신 단일 머리글로 된 하나의 시트로 제공. Excel에서 수동으로 이어 붙일 필요 없음.
일괄 처리 개념, 기능 목록의 부가 기능 아님. 디렉터리 추가 시 해당 폴더 내 모든 PDF 일괄 처리. 62개 파일, 362페이지 테스트, 충돌 없이 155개 표 발견. 출력 형식 선택 가능. 파일별 개별 CSV 또는 단일 CSV로 병합.
은행 템플릿, 수천 단위 구분자 최소 5가지 사용 (공백, 스위스 아포스트로피 포함). 다양한 소수점 기호 사용. 정규화 시 PDF to CSV Converter Software가 단일 형식으로 재작성. 통화 기호 및 코드 별도 열로 이동. 날짜 ISO 형식으로 변환. 회계 마이너스 형식(1 234,56)을 -1234.56으로 변환. 정규화 미사용 시 금액 열 텍스트로 인식, SUM 함수 0 반환.
RFC 4180 준수, UTF-8 형식 및 BOM(바이트 순서 표시)으로 저장. Excel에서 이중 클릭 시 파일 열림, 가져오기 마법사 없이 올바른 문자 표시. 추가 기능: 타사 PDF의 셀이 =, +, - 또는 @로 시작하고 숫자가 아닌 경우 선행 아포스트로피 추가. 예: `=cmd|'/c calc'!A0` 와 같은 인보이스 내 수식 실행 방지. 숫자 및 괄호 안 음수는 변경 없음, 수식 오류 방지.
10~30명의 고객이 있으며, 각 고객은 더 이상 기계가 인식할 수 있는 형식으로 내보낼 수 없는 내역서를 보냅니다. 각 내역서마다 동일한 테이블 형식이 필요하며, 입력 작업 속도보다 내역서가 쌓이는 속도가 훨씬 빠릅니다. 고객별 폴더 하나씩, 한 번씩 실행합니다.
한동안 방치된 장부에는 여러 계좌에 걸쳐 12~36개월 분량의 내역서가 있으며, 보통 명확한 명명 규칙 없이 하나의 아카이브에 보관됩니다. 업무는 일괄적으로 가격이 책정되므로, PDF와 원장 사이에 발생하는 모든 문제는 해당 마진에서 직접 차감됩니다.
PDF 내역서에서 수동으로 입력하는 것은 많은 회사에서 일반적인 과정이며, 일부 회사는 외부에서 시간제로 이 서비스를 구매합니다. 입력 비용이 부담스러운 부분은 아닙니다. 부담스러운 부분은 잘못 입력된 거래가 조정 시에만 발견된다는 점이며, 매번 같은 방식으로 같은 열을 읽는 프로그램은 이러한 종류의 오류를 완전히 제거합니다.
PDF to CSV Converter
9 Mb
1.0
18/07/26