팀에 정보가 부족한 것이 아닙니다. 그것을 읽을 시간이 부족할 뿐입니다.
계약서, 청구서, 분기별 보고서, 누군가 결정을 내리기 전까지 40개의 답장이 오간 공급업체 이메일 스레드 등. 이러한 문서들은 누군가 열어볼 수 있는 속도보다 더 빠르게 도착하며, 각각 수천 단어 속에 파묻힌 4~5개의 유용한 사실을 숨기고 있습니다. 누군가는 여전히 들어가서 그것들을 찾아내야만 합니다.
텍스트 요약은 이에 대한 명확한 해답이며, 여러분의 수고를 반으로 줄여줍니다. 짧아진 문서라도 여전히 문서일 뿐이며, 누군가는 여전히 그것을 읽어야 하기 때문입니다. 문서 더미를 진정으로 해결하는 것은 요약 이후에 일어나는 일에 달려 있습니다.
핵심 요약:
- 텍스트 요약은 원본의 문장을 재사용(추출적)하거나 새로운 문장을 작성(추상적)하여 긴 문서를 자동으로 요약합니다.
- 요약은 문서를 읽는 과정을 단축시킵니다. 사람의 개입 없이 스프레드시트나 CRM이 문서에 대한 후속 작업을 수행할 수 있도록 읽는 과정 자체를 없애주는 것은 오직 지정된 필드로의 추출뿐입니다.
- Parseur는 한 번에 요약과 추출을 수행하고 그 결과를 다운스트림 시스템으로 전달하므로, 누구도 다시 타이핑할 필요가 없습니다.
네, 저희가 방금 무엇을 했는지 잘 알고 있습니다. 요약에 대한 글을, 요약했습니다.
텍스트 요약이란 무엇인가요?
텍스트 요약은 긴 텍스트를 핵심 의미는 보존하면서 더 짧은 버전으로 압축하는 자동화된 프로세스입니다. 이는 자연어 처리에서 가장 오래된 작업 중 하나로, 40년 전의 초기 모델들은 고전했던 반면 오늘날의 모델들은 이를 매우 쉽게 처리하는 것처럼 보이게 합니다. 입력 문서가 일반 기사가 아닌 비즈니스 파일일 경우, 같은 작업을 대개 문서 요약이라고 부릅니다.
좋은 요약은 중요한 정보는 유지하고 불필요한 부분은 버리며, 단순히 훑어본 것이 아니라 문서의 내용을 온전히 이해한 사람이 쓴 것처럼 읽혀야 합니다. 이 셋 중 두 가지를 충족시키는 것은 쉽습니다. 하지만 세 가지를 한꺼번에 모두 충족시키는 것이야말로 가장 어려운 과제입니다.
자동 요약이 상업적으로 활용되는 지능형 문서 처리 시장의 가치는 2026년에 약 43억 1천만 달러로 추정되며, 2034년에는 439억 2천만 달러에 이를 것으로 예상됩니다.
텍스트 요약의 종류
텍스트 요약에는 두 가지 접근 방식이 있으며, 어떤 것을 선택하느냐에 따라 결과가 크게 달라집니다. 잘못된 방식을 선택하면 시범 프로젝트가 몇 달 만에 종료될 수도 있습니다.
추출적 요약
추출적 요약(Extractive summarization)은 문서 내의 모든 문장에 점수를 매기고 그중에서 중요한 문장들을 골라 이어 붙입니다. 새롭게 재작성되는 부분이 없으므로, 요약본의 모든 단어는 원본 문서 어딘가에 존재하는 것을 검증할 수 있습니다.
이것은 추출적 요약의 장점이자 한계이기도 합니다. 없는 사실을 지어낼 수 없으므로, 규제 기관이나 판사가 나중에 읽어볼 문서에는 안전한 선택이 됩니다. 반면, 6페이지 떨어진 곳에 있는 두 아이디어를 하나로 연결할 수는 없기 때문에, 요약 결과가 마치 형광펜으로 칠한 부분만 읽는 것처럼 부자연스러울 수 있습니다.
추상적 요약
추상적 요약(Abstractive summarization)은 원본의 의미를 담은 새로운 문장을 작성합니다. 동료에게 문서 내용이 무엇인지 물어보았을 때 대답해 주는 방식과 같습니다. 대규모 언어 모델(LLM) 덕분에 이 방식이 업계의 기본 표준이 되었으며, 그 결과물은 추출적 요약보다 훨씬 읽기 좋습니다.
단점은 새로운 문장을 쓸 수 있는 모델이라면 틀린 문장도 쓸 수 있다는 점입니다. 이런 오류는 절대 엉터리 문장으로 나타나지 않습니다. 9개의 올바른 문장들 사이에 섞인 유창하고 자신감 넘치며 전혀 이상해 보이지 않는 1개의 거짓 문장으로 나타납니다.
이런 이유로 미세 조정(Tuning)이 오랫동안 중요하게 다뤄져 왔습니다. 초기 맞춤형 GPT-3 배포 과정에서 OpenAI는 해당 모델을 작업에 맞게 조정하자 고객 피드백 요약의 정확도가 66%에서 90%로 높아졌다고 보고했습니다. 이후로 여러 세대의 모델이 등장하고 사라졌지만, 그 교훈은 여전히 유효합니다. 특정 문서 유형에 맞춰진 요약기가 범용 모델을 능가한다는 것입니다.
| 추출적 요약 (Extractive) | 추상적 요약 (Abstractive) | |
|---|---|---|
| 작동 방식 | 기존 문장을 선택하고 재정렬 | 새로운 문장을 생성 |
| 사실적 위험 | 내용을 발명할 수 없음 | 근거 없는 주장을 할 수 있음 |
| 가독성 | 다소 끊기는 느낌을 줄 수 있음 | 자연스럽게 읽힘 |
| 적합한 분야 | 계약서, 서류 제출 등 감사가 필요한 문서 | 보고서, 스레드, 긴 형식의 내러티브 |
| 인적 검토 | 거의 필요하지 않음 | 중요한 결과에 필수적임 |
대부분의 실제 시스템은 이 두 가지를 모두 실행합니다. 사람이 읽을 개요에는 추상적 요약을 사용하고, 정확해야만 하는 숫자와 날짜에는 추출적 요약이나 직접 필드 추출 방식을 사용합니다.
텍스트 요약은 어떻게 작동하나요?
데모 환경에서는 단 한 번의 모델 호출로 요약이 끝나지만, 실제 프로덕션 환경에서는 파이프라인으로 구성됩니다. 대부분의 오류가 모델 외부에서 발생하기 때문에 이 차이를 이해하는 것이 중요합니다.
- 접수(Intake). 문서는 이메일, 업로드, 공유 드라이브, 스캐너 또는 API를 통해 도착합니다. 각 문서는 원본 파일을 유지한 채로 하나의 작업(job)이 됩니다.
- 분류(Classification). 청구서, 송장, 상가 임대차 계약서는 각각 다른 방식의 처리가 필요하므로, 시스템은 현재 다루고 있는 문서가 무엇인지 파악합니다.
- 텍스트 및 레이아웃 읽기(Text and layout reading). 원본 PDF는 내장 텍스트를 제공합니다. 스캔본과 휴대폰 사진의 경우 비전(vision) 모델이 필요합니다. 표, 단, 세부 항목 등은 이 단계에서 온전하게 유지되어야 하며, 그렇지 않으면 이후의 모든 단계는 불확실한 추측에 의존하게 됩니다.
- 이해(Understanding). 모델은 문서의 주제가 무엇이고 어떤 단락에 그 내용이 담겨 있는지 결정합니다.
- 요약(Summarization). 모든 문서를 똑같이 단락 하나로 뭉뚱그리는 대신, 이상적인 형태라면 해당 문서 유형에 맞는 형태로 요약본이 작성됩니다.
- 필드 추출(Field extraction). 당사자, 날짜, 총액, 갱신 조건, 청구 번호 등 이름이 지정된 값들을 뽑아냅니다.
- 유효성 검사(Validation). 신뢰도 점수를 통해 불확실한 결과를 표시하고, 해당 결과는 회계 시스템에 바로 입력되는 대신 사람이 직접 검토하게 합니다.
- 전달(Delivery). 데이터가 작업이 이루어질 스프레드시트, CRM 또는 데이터베이스에 도달합니다.
6단계부터 8단계까지가 읽기 보조 도구와 진정한 자동화를 가르는 기준입니다. 편의상 많은 요약기 판매자들이 생략하는 단계이기도 합니다.
텍스트 요약 vs 데이터 추출
요약과 데이터 추출은 서비스 제공업체의 소개서에서 종종 동의어처럼 쓰이곤 합니다. 하지만 두 작업은 명백히 다르며, 한 가지가 필요한 상황에서 다른 한 가지를 구매하는 것이 바로 많은 요약 프로젝트가 시범 단계에서 실패하는 이유입니다.
요약은 단순히 더 짧은 문서를 제공합니다. 사람은 여전히 그 문서를 열어보고, 읽고, 결정을 내리고, 그 결과를 다른 시스템에 입력해야 합니다. 읽는 시간만 줄였을 뿐, 그 일 자체를 없애지는 못한 것입니다.
추출은 송장 총액, 계약 갱신일, 청구인 이름, 보험 증권 번호와 같이 이름이 지정된 필드를 제공합니다. 스프레드시트는 중간에 사람이 개입하지 않아도 그 정보들을 받아들일 수 있습니다. 즉, 업무가 단순히 줄어드는 것이 아니라 아예 사라지는 것입니다.
정말 구축할 가치가 있는 버전은 두 가지를 동시에 수행하는 것입니다. 사람이 맥락을 파악해야 할 때를 대비한 요약과 동시에, 아무도 읽지 않는 동안 시스템이 직접 처리할 수 있는 추출 필드를 제공하는 기능입니다. 이 조합이야말로 방대한 문서 더미를 잘 정리된 테이블 데이터로 바꿔줍니다.
텍스트 요약의 활용 분야: 진가가 발휘되는 곳
대량으로 도착하고, 대략적인 패턴을 따르며, 몇 가지 핵심 정보를 얻기 위해 한 번만 읽히는 문서 유형이라면 어디든 유용합니다.
법률
계약서, 서류 제출, 판례 등은 수많은 정형화된 문구 속에 실제 작동하는 조항을 숨겨둡니다. 요약은 의무 사항, 주요 날짜 및 지배 조건을 위로 끌어올리며, 동일한 값을 필드로 추출하는 것은 갱신일을 잊어버리는 대신 캘린더 일정으로 바꿔줍니다.
의료
의사들은 환자 기록, 진료 의뢰서, 보험 청구서가 쌓여 있어도 살펴볼 시간이 턱없이 부족합니다. 치료 이력에 대한 요약은 진료 시점에 실제로 큰 도움이 되며, 추출된 필드는 누구도 입력하지 않아도 기록 시스템을 최신 상태로 유지해 줍니다. 이는 의료 분야의 다른 모든 AI의 양상과 동일합니다. 진정한 가치는 모델 그 자체가 아니라 아무도 입력 업무를 하지 않아도 된다는 데에 있습니다.
보험 및 금융
보험 청구 서류는 가장 명확한 사례입니다. 손해 사정인은 손실 발생일, 증권 번호, 청구인, 청구 금액, 사건 발생 경위를 설명하는 한 단락을 필요로 합니다. 이 5가지 정보는 맨 뒤에 첨부된 경찰 보고서가 포함된 40페이지 분량의 서류 봉투 곳곳에 흩어져 있습니다. 사람을 위해 내러티브를 요약하고, 청구 시스템을 위해 5가지 값을 추출하면 이 문서 뭉치는 더 이상 억지로 읽어야 할 과제물이 아닙니다.
분기별 보고서, 송금 명세서 및 공급업체 송장도 동일한 형태를 가집니다. 숫자는 매번 반복되며, 바로 이 점이 자동화할 가치가 있는 이유입니다. 경험 많은 직원이 이런 숫자들을 직접 읽고 찾아내게 하는 것은 아주 비효율적인 일입니다.
연구 및 학계
어떤 논문을 끝까지 읽을지 결정하기 위해 선별하는 작업은 요약의 본래 목적이기도 합니다. 추출적 요약이 세상에 존재하는 유일한 요약 방식이던 시절부터 말이죠.
운영
긴 공급업체 스레드, 주문 확인서 및 작업 지시서도 PDF 형식으로 된 문서 못지않게 중요합니다. 스레드를 요약하고 그 안에서 주문 세부 정보를 추출하는 것은 맨 아래로 스크롤을 내려 마지막 메시지에 답이 있기를 기대하는 것보다 낫습니다. 보통 그 마지막 메시지는 "좋습니다" 정도에 불과할 테니까요.
수동 요약을 피해야 하는 이유
수동으로 요약하는 것은 아주 단순한 두 가지 이유로 실패하며 아무리 노력해도 나아지지 않습니다.
첫 번째는 수학적인 이유입니다. 읽는 것은 순차적입니다. 10개의 계약서를 읽으려면 오후가 다 지나가고, 100개면 다음 주가 되며, 1000개면 아예 채용 공고를 올려야 할 수준입니다.
두 번째는 일관성의 부족입니다. 동일한 계약을 요약하더라도 두 사람이 요약하는 내용이 다르고, 같은 사람이라도 월요일과 금요일에 요약하는 내용이 다릅니다. 일관성이 없는 요약은 없는 것보다 못합니다. 겉보기에는 신뢰할 수 있을 것 같지만 서로 비교할 수조차 없기 때문입니다.
Parseur의 텍스트 요약 처리 방법
이곳은 저희 블로그이니 짧게 제품을 소개하겠습니다.
Parseur는 AI 문서 파서입니다. 요약은 사용자가 지시하는 하나의 명령일 뿐이며, 추출하는 다른 모든 필드와 동일한 목록에 배치됩니다. 이 때문에 요약 결과가 절대 폴더에 버려지지 않는 것입니다.
두 개의 엔진이 읽기를 담당합니다. Vision AI 엔진은 PDF, 스캔, 이미지를 처리하고, Text AI 엔진은 이메일과 텍스트 문서를 처리합니다. 어느 쪽도 템플릿이 필요하지 않으므로 운송업체나 공급업체가 양식을 변경할 때마다 처음부터 다시 구축할 필요가 없습니다.
워크플로우는 다음의 4단계로 구성됩니다:
- 메일박스를 만들고 이메일, 업로드 또는 API를 통해 문서를 전송합니다.
- "이 계약의 핵심 조건을 요약하세요"와 같이 요약할 항목을 포함하여, 추출하려는 필드를 쉬운 말로 설명합니다.
- AI 엔진은 입력되는 모든 문서에서 요약을 포함한 모든 필드를 자동으로 추출합니다.
- 플래그가 지정된 항목을 검토한 후 데이터가 필요한 곳으로 전달되도록 합니다.

요약 작업은 필드 지시 단계에서 이루어지며, 동료에게 업무를 지시하는 것처럼 작성할 수 있습니다. 예를 들어, "이 섹션을 요약하세요", "이 값을 고정된 목록으로 제한하세요", "문서에 대한 이 특정 질문에 답하세요", "이 필드를 번역하세요"와 같이 작성합니다. 복잡한 프롬프트 엔지니어링이나 사전 교육 과정이 필요 없으며, 문서를 제대로 읽는지 확인하기 전에 구성해야 할 것이 아무것도 없습니다.

그리고 투자 비용을 회수하는 가장 중요한 단계입니다. 추출된 값은 다운스트림 시스템이 기대하는 형태로 정규화 및 유효성 검사를 거치며, 그 결과는 수백 개의 통합, 웹훅 및 API를 통해 Google 스프레드시트, CRM, 회계 소프트웨어 또는 자체 스택으로 흐릅니다. 요금제는 문서 양에 따라 책정되므로 직원의 수가 아닌 서류 작업의 양에 비례합니다.
2025년 기준, Parseur 고객들은 수작업 데이터 입력 시간을 월평균 약 152시간 절약했으며 이는 노동력 기준으로 월 7,000달러에 달하는 금액입니다.
보안에 대해 짧게 설명하자면, Parseur는 GDPR을 준수하며 SOC 2 Type II 감사는 아직 인증이 완료되지 않고 진행 중입니다. 저희는 여러분이 자체 보안 검토에서 뒤늦게 이를 알게 되는 것보다 여기서 직접 말씀드리는 것을 선호합니다.
특히 PDF에 대해서는 AI PDF 요약기 활용 사례에서 해당 문서 유형과 함께 동일한 내용을 자세히 설명합니다. 이 기능이 포함된 전체 파이프라인에 대해서는 지능형 문서 처리 및 AI 문서 처리를 참조하세요. 도입 후보 목록을 작성 중이라면 IDP 소프트웨어 종합 가이드부터 시작해 보세요.
시작하는 방법
가장 읽는 시간을 많이 잡아먹는 문서 유형을 선택하세요. 대개 계약서나 청구서일 테고, 여러분은 이미 어떤 것인지 알고 계실 겁니다.
그런 문서 뭉치를 준비하세요. 팀에서 실제로 사용하는 5개의 필드와 1개의 요약 필드를 설명해 보세요. 사전에 템플릿을 만들 필요가 없으므로 설정은 큰 프로젝트가 아니라 단순한 묘사에 가깝습니다. 이번 주 내에 시스템이 여러분의 문서를 제대로 읽을 수 있는지 알게 될 것입니다. 수동 프로세스와 병행하여 2주 동안 실행한 후 결과를 비교해 보세요. 그런 다음 손으로 직접 읽는 것을 중단하고 다음 문서 유형으로 넘어가면 됩니다.
텍스트 요약 그 자체로도 읽기 시간을 훌륭하게 단축해 줍니다. 데이터 추출 기능과 데이터가 저장될 장소를 결합하면 단순히 짧아진 문서와 아예 처리할 문서가 사라지는 것의 차이를 만들어냅니다. 이것이 바로 여러분의 팀이 요약 시스템에 대해 처음 문의했을 때 그렸던 그림일 것입니다.
마지막 업데이트



