AI 문서 추출
모든 문서에 맞는 파싱 엔진을 갖춘 AI 문서 추출
Parseur는 PDF, 스캔, 이메일, 첨부파일에서 구조화된 데이터를 추출합니다. Vision AI는 시각적 레이아웃, Text AI는 일반 텍스트, 템플릿은 고정 양식을 처리합니다. 세 엔진이 하나의 메일함에서 함께 작동합니다.
문서에서 데이터를 추출하는 데 필요한 모든 기능
Vision AI 추출
비전 모델은 페이지를 텍스트가 아닌 이미지로 읽습니다. AI는 전체 레이아웃과 시각적 맥락을 포함하여 사람이 읽는 방식 그대로 문서를 인식합니다.
- 복잡한 구조의 PDF, 스캔, 양식에 최적
- 필기, 체크박스, 도장 및 레이아웃 신호 캡처
- 영어 지시문만으로 설정, 템플릿 불필요
Text AI 추출
문서가 먼저 일반 텍스트로 변환되며, 원본에 기본 텍스트 레이어가 없으면 OCR이 사용됩니다. 이후 AI는 레이아웃과 이미지를 무시하고 추출된 텍스트만 파싱합니다.
- 이메일, 일반 PDF, 기타 텍스트 중심 문서에 최적
- 시각적 레이아웃이 추가적인 정보를 제공하지 않을 때 유용
- 영어 지시문만으로 설정, 템플릿 불필요
템플릿 기반 추출
메일함마다 필요한 만큼 템플릿을 추가하세요. Parseur가 문서에 가장 잘 맞는 템플릿을 자동 선택해 매번 동일한 결과를 생성하며, AI는 관여하지 않습니다.
- 규격화된 양식 및 시스템 발송 이메일에 최적
- 레이아웃이 변하지 않을 때 가장 신뢰할 수 있는 추출 방법
- 시각적 템플릿 에디터로 설정, 문서 레이아웃당 하나씩 적용
표 및 라인 아이템 추출
표의 각 행이 단일 병합 필드가 아닌 개별 데이터 레코드가 됩니다. 세 가지 파싱 엔진 모두에서 작동합니다. 기본 스프레드시트의 경우 표 파싱이 자동으로 이루어집니다.
- 문서마다 행 수가 달라도 자동 대응
- 여러 페이지에 걸친 표 지원
- AI 엔진은 복잡한 다중 행을 개별 필드로 파싱하는 것을 지원합니다
스캔과 이미지를 위한 OCR
광학 문자 인식(OCR)이 스캔본, 휴대폰 사진, 이미지 전용 PDF에서 텍스트를 읽습니다. 기본 텍스트 레이어가 없을 때 Text AI와 템플릿 엔진에 데이터를 제공합니다.
- 스캔본, 휴대폰 사진, 이미지 전용 PDF 지원
- 필기를 포함한 200개 이상 언어의 다국어 OCR
- 템플릿 엔진은 고정 또는 변동 레이아웃에 영역 OCR과 동적 OCR 사용
문서 전처리
정확한 추출은 들어오는 문서를 정리하고 복구하는 것에서 시작됩니다. Parseur의 전처리는 1억 개 이상의 문서와 10년에 걸친 실제 엣지 케이스를 통해 개선되었습니다.
- 기울어진 스캔을 교정하고 깨진 텍스트에 OCR 재실행
- 손상된 PDF, 깨진 이메일 인코딩, 잘못된 HTML 복구
- 국가별 날짜 및 숫자 형식을 자동으로 감지
AI 문서 추출 작동 방식
방금 일어난 일
자동화된 문서 수집
문서가 이메일, API, 업로드 또는 연결된 저장소를 통해 자동으로 수집되었습니다.
전처리
모든 문서는 먼저 정리 과정을 거칩니다. Parseur가 필요에 따라 페이지 방향을 수정하고, 기울어진 스캔을 교정하며, 깨지거나 순서가 잘못된 콘텐츠를 복구합니다.
OCR
스캔본, 휴대폰 사진, 이미지 전용 PDF의 경우 Parseur가 OCR을 실행하여 텍스트를 추출합니다. 이미 기본 텍스트 레이어가 있는 문서는 이 단계를 건너뜁니다.
엔진 선택
Parseur는 각 문서에 맞는 엔진을 자동으로 선택합니다. 일치하는 템플릿이 있으면 템플릿 기반 파싱이 우선 적용되며, 그렇지 않은 경우 Vision AI가 이미지 중심 페이지를 처리하고 Text AI가 일반 텍스트 콘텐츠를 처리합니다.
추출
선택된 파싱 엔진은 메일함에 정의한 스키마에 매핑된 구조화된 필드를 문서에서 추출합니다. 여기서부터 모든 필드는 포맷팅 및 검증을 위해 정규화 단계로 전달됩니다.
다음 단계
데이터 정규화 및 검증
추출된 필드는 검증과 포맷팅을 거쳐 후속 워크플로우에 맞게 구조화됩니다.