데이터 정규화 및 검증
모든 문서, 동일한 구조의 정제된 데이터
메일박스 스키마부터 후처리까지, 모든 추출값이 깔끔하게 정제되고 검증되어 하위 시스템에 바로 전달될 수 있도록 준비됩니다.
포함된 기능
메일박스 수준 스키마
일관된 스키마는 하위 시스템 연동과 자동화를 실제로 안정적이게 만듭니다. 필드를 한 번 정의해 두면 메일박스가 처리하는 모든 문서를 동일한 구조로 매핑합니다.
- 단일 값은 표준 필드, 반복 데이터는 테이블 필드로 구성
- 자연어 지시로 AI에게 각 필드의 추출 대상을 정의
- UI 또는 API를 통해 언제든 필드 조정 가능
필드 수준 포맷팅
내장 포맷으로 날짜, 숫자, 주소 등 다양한 필드를 정규화합니다. 문서 맥락에 맞는 올바른 포맷을 자동으로 유추하며, 메일박스 기본값이 대체제로 적용됩니다.
- 날짜는 언어와 상관없이 모든 순서, 구분자, 월 이름을 파싱
- 숫자는 지역별 소수점 및 천 단위 구분자를 인식해 파싱
- 주소 필드는 위치를 식별하고 주소를 구조화된 구성 요소로 분리
데이터 검증
자동화된 데이터 검증은 추출된 모든 결과를 메일박스 스키마와 대조해 확인합니다. 실패 항목은 UI에 표시되고, 이메일 알림과 웹훅을 트리거하여 운영 팀과 시스템 모두 즉시 알 수 있습니다.
- 스키마 검증으로 AI 결과가 필드 구조와 일치하는지 확인
- 필수 필드 검증으로 소스에서 누락된 값을 실시간 감지
- 선택 필드 검증으로 허용된 목록 외의 값을 자동 표시
후처리 규칙
기본 포맷팅과 검증만으로 부족한 경우, 짧은 Python 스크립트를 추가할 수 있습니다. 규칙은 추출 후에 실행되어 값을 재구성하거나 비즈니스 로직에 맞춘 맞춤 검증을 수행합니다.
- 추출값으로 새 필드를 결합, 분리, 계산
- 비즈니스 로직 적용, 참조값 조회 또는 조건부 변환
- Pro 요금제 이상에서 이용 가능
데이터 정규화 동작 방식
방금 일어난 일
AI 문서 추출 및 파싱
Vision AI, Text AI, 템플릿, OCR 엔진을 활용해 각 문서에서 구조화된 필드를 추출했습니다.
스키마에 매핑
추출값은 각 메일박스에 정의된 고정 필드 집합으로 매핑됩니다. 원본 레이아웃과 무관하게 모든 문서가 출력 시 동일한 컬럼 구조를 갖습니다.
포맷
각 필드는 설정된 포맷팅 과정을 거칩니다. 날짜와 숫자는 문서 맥락을 활용해 지역별 차이를 통일하고, 이름은 성·이름·중간이름으로 분리하며, 주소는 구조화된 요소별로 파싱됩니다.
검증
모든 결과는 다음 단계로 넘어가기 전 검증 과정을 거칩니다. 통과한 문서는 후처리 단계로 진행되며, 나머지는 표시되어 Parseur에서 알림 없이 누락되는 일이 없도록 합니다.
후처리
마지막으로 선택적 Python 규칙이 실행되어, 필드 수준의 포맷팅만으로는 표현할 수 없는 비즈니스 로직을 적용합니다. 필드를 결합하거나 참조 데이터를 조회하고, 하위 시스템의 계약 요건에 정확히 맞게 출력을 조정할 수 있습니다.
다음 단계
실시간 내보내기 및 통합
정규화된 데이터가 CRM, 회계 시스템, 데이터베이스로 실시간 전달됩니다.