“不在您的数据上进行训练”说起来容易——用这12个问题来验证

不在您的数据上进行训练意味着供应商处理您的内容以提供您所要求的结果,并且绝不会将其反馈到机器学习模型的训练、微调、评估或基准测试中。您的文档是服务的输入,而不是产品的原材料。

这句话对于供应商来说没有任何成本,这就是为什么您的安全审查员不再接受它的原因。以下是测试该说法的12个问题,以及Parseur对这些问题的回答,包括那些最诚实的回答是“问我们并在书面形式中要求我们做到”。

要点总结

  • 不在您的数据上进行训练意味着您的内容仅用于处理,绝不会回收进入模型。
  • 任何供应商都可以这么说,因此安全审查已经转移到您可以检查的部分:列出子处理者名单、保留期以天数报价,并杜绝匿名数据的例外情况。
  • Parseur 从不重复使用客户数据来训练其 AI 模型,从不出售数据,托管在欧盟,原生支持 GDPR,并允许您将文档保留窗口设置为一天到无限期。
  • SOC 2 Type II 和 HIPAA 正在进行中,预计在 2026 年完成,这意味着目前尚未通过认证。Parseur 也不是零数据保留供应商,本页将解释为什么您真正想要使用的文档解析器都不可能是零保留。

为什么“我们从不在您的数据上进行训练”已经失去了意义

现在每个供应商都这么说。这正是问题所在。

审查员在营销页面上看到“我们从不在您的数据上进行训练”,并不能了解任何可以放入风险登记册的信息。这句话没有范围,没有说出子处理者的名字,没有引用保留数字,也没有任何人的签名。

事实证明,这句话与合同之间的差距很大。DataGrail 2026年的Privacy and AI Trends Report分析了 2,400 家流行的商业软件提供商,发现63.6%宣传其 AI 功能的供应商没有在其任何法律文档中披露第三方 AI 子处理者

其中一些供应商确实没有子处理者需要披露。其余的则要求您基于信任接受一个未具名的供应链,而从外部您无法区分这两组。这正是下面这些问题的全部目的。

因此,有用的问题不再是供应商是否有不训练政策。而是当您要求他们将其写下来时,还剩下什么。

处理与训练,以及为什么只有其中一个是可逆的

您上传的文档可能会发生两件事,区别在于任务完成后是否留下任何东西。

  • **处理(Processing):**您的数据被实时用于完成任务,例如从供应商发票中提取行项目。任务完成后,数据不会重新进入系统供未来学习。
  • **训练(Training):**您的数据被输入模型中以进行改进,因此您的输入成为模型已知知识的一部分。这无法撤销。要取出您的内容意味着重新训练模型,而没有人为此做过预算。

模糊这条界线造成了三个比模糊本身更持久的问题。机密文档可以从记住它们的模型中重建出来。所有权变得模糊,因为在您的合同上训练的模型吸收了您的知识产权。受监管的行业失去了回答最基本审计问题的能力,即客户数据到底去了哪里。

不训练政策消除了歧义。您的数据被用于该任务的处理,然后到此为止。

零数据保留,以及为什么 Parseur 不声明它

**零数据保留 (ZDR) 意味着提供商在内存中处理您的请求,并且不向磁盘写入任何内容。**没有存储的输入,没有存储的输出,没有内容日志。这是最严格的姿态,采购团队越来越多地明确要求它,而不是询问有关训练的问题。

它也不断被过度推销,因此了解 ZDR 往往遗漏什么是有好处的。

  • 计费元数据依然存在。时间戳、令牌数量和延迟必须记录在某个地方,否则没有人可以向您开具发票。
  • 滥用和安全监控可以完全置于协议之外,这是一个您从未被告知的人工审查路径。
  • 并非每个端点都符合 ZDR 资格。调用一个不符合资格的端点意味着默认放弃了自己的协议,这通常是由从未阅读过协议的工程师做出的决定。

这是大多数供应商页面跳过的部分。**Parseur 不是一款零数据保留产品,任何允许您重新运行提取或审查上个月结果的文档解析器都不可能诚实地做到这一点。**重新处理文档需要文档依然存在。相反,Parseur 为您提供的是一个由您控制的保留窗口,根据您的计划,从一天到无限期不等,一旦窗口关闭,就会自动删除。

如果供应商同时为您提供完整的文档历史记录和零数据保留,请问他们准备取消哪一个。

向文档提取供应商询问关于 AI 训练和保留的 12 个问题

Checklist infographic of the questions to ask a document extraction vendor about AI training, subprocessors and data retention
发送给供应商的问题

将此复制到您的供应商调查问卷中。如果供应商做足了功课,那么每个问题都有简短的答案;如果没有,他们会长时间沉默。

  1. 贵方是否使用我们上传的文档、提取的字段、元数据、更正或输出来训练、微调、评估或对任何模型进行基准测试?
  2. 该答案是否也涵盖我们数据的匿名化、去标识化、聚合或派生版本?
  3. 哪些第三方 AI、OCR 或云子处理者会接收我们的文档?列出它们的名字并说明它们在哪里运行。
  4. 那些子处理者是否在合同中被禁止使用我们的数据进行训练或服务改进?
  5. 每种类型的数据保存多长时间:源文档、提取字段、处理日志、错误日志、缓存和备份?
  6. 我们可以自己配置保留窗口吗?你们提供的最短窗口是多少?
  7. 我们可以按需删除数据吗?书面上的删除 SLA(服务级别协议)是什么?
  8. 删除是否涉及备份?多久会被覆盖?
  9. 贵方的员工或承包商能否查看我们的文档,在什么情况下?这种访问是否有日志记录?
  10. 客户数据是否会被复制到开发、测试、QA 或演示环境中?
  11. 我们的数据在哪里存储和处理?它有可能离开那个区域吗?
  12. 这些承诺会写在签署的 DPA 或 MSA 中吗?如果两者存在分歧,这些承诺是否优先于贵方的在线条款?

能用一段顺畅的话回答所有这十二个问题的供应商多半在猜测。用名称、数字和条款参考作答的供应商才是真的被问过。

Parseur 的回答,包括令人尴尬的那一部分

Infographic showing how Parseur processes customer documents without using them to train AI models
Parseur如何落实此政策

Parseur 是一款文档解析器。您向它发送供应商发票,它返回结构化字段,并且它不在客户数据上进行训练。以下是映射到上述问题的那些发票的情况。

问题 Parseur 的回答
1. 模型训练 客户数据绝不会被重复用于训练 Parseur 的 AI 模型,也绝不出售。每次提取运行仅生成您的输出,别无其他用途。
5 和 6. 保留期 根据您的计划,文档保留期可从一天配置至无限期。文档在窗口关闭时自动删除,也可以随时按您的要求删除。
11. 位置 托管在欧盟,原生支持 GDPR,并且数据保留在欧盟境内。托管数据中心通过了 ISO 27001 认证,这是数据中心的证书,而不是 Parseur 的认证。
12. 角色和文件 您是数据控制者,Parseur 是数据处理者,数据处理协议对允许的事项进行了规定。
法规 符合欧盟 GDPR、英国 GDPR、加利福尼亚州 CCPA 和 CPRA,以及新加坡 PDPA。Privacy and GDPR at Parseur 中有详细说明。
认证 **SOC 2 Type II 和 HIPAA 计划正在进行中,预计 2026 年完成。**Parseur 目前尚未通过这两项认证。
安全控制 传输和静止过程中的加密,基于角色的权限和审计跟踪,加上定期的第三方安全测试。
2, 3, 4, 7, 8, 9 和 10 未在此页作答。请询问我们,并将答案写入签署的协议中,而不是放在我们可能下个季度悄然修改的网页上。

把如果放一个Logo看起来会更好的地方写上“正在进行中”,虽然少了几分炫耀,却换来了极大的可信度。如果审查员发现有一项认证被夸大,就会停止相信其余十一个答案,他们这样做是正确的。

在与任何人交谈之前,您可以验证其中两行。《数据处理协议》是您可以在签约前完整阅读的文件,而保留窗口是您可以在自己的账户中看到的设置,而不仅仅是一个口头承诺。

注册您的免费账户
使用 Parseur 节省时间和精力。自动处理您的文档。

OpenAI、Microsoft、Anthropic、AWS 和 Google 实际承诺了什么

企业买家将整个市场推向了明确的保证,现在好答案的形式已确定。

  • OpenAI 按产品划分。消费者版本的 ChatGPT 数据可能用于改进模型,而企业层和 API 层默认排除在外,并附有已记录的选择退出(opt-out)控制。
  • Microsoft 依赖隔离。Copilot for Microsoft 365 和 Azure OpenAI 将客户内容排除在基础模型训练之外,并发布了瞬态处理数据的默认保留窗口。
  • Anthropic 公开承诺不在企业数据上进行训练。
  • Google Cloud 和 AWS 都在其数据治理条款中发布了 Document AI 和 Textract 的训练排除条款,尽管 AWS 要求您应用明确的组织级选择退出策略,而不是默认执行。默认排除与有人记得点击后才排除,不是同一种承诺。

注意它们的共同点。答案存在于治理文档中,而不是博客文章中,并且它具有明确的默认设置。这是标准,也是本页面试图超越的标准。

为什么这个问题现在会阻碍采购

买家不仅仅是出于好奇才问这个问题。The Futurum Group 在 2025 年的一项调查发现,52% 的组织优先考虑 AI 供应商的技术专长,而紧随其后的是数据处理和隐私控制,占 51%。在同一时期,2025 年投资管理合规测试调查发现,57% 的合规官将 AI 使用视为他们的首要合规问题,而 PwC 的 2025 年 AI 代理调查发现,28% 的业务领导者将对 AI 代理缺乏信任列为更广泛部署的首要障碍

这些数字背后的公众情绪甚至更冷淡。根据 Protecto 的数据,大约 70% 的成年人不信任公司会负责任地使用 AI,超过 80% 的人预期他们的数据会在某种程度上被滥用。您的客户已经做好了最坏的打算,这就是为什么处理不当的事件在面临罚款之前,很早就已付出了声誉的代价。

这就是写下这一切的真正原因。不训练政策不是添加到比较表中的功能。这是决定安全审查员是否签字的因素,而审查员不签段落,他们签条款。

因此,请将这十二个问题发送给 Parseur,然后将相同的十二个问题发送给候选名单上的其他人。从您计划的数据处理协议保留设置开始。比较才是全部意义所在,我们宁愿被放在一起比较,也不愿被排除在外。

最后更新于

深入了解

你可能还喜欢

立即开始

告别手动录入,
就从今天起。

几分钟免费上手,亲自体验Parseur如何融入您的工作流。

无需训练模型
为真实业务场景打造
操作足够简单,API足够强大

常见问题解答

以下问题是安全审查员和采购团队实际发送给文档提取供应商的。这里提供简短答复,合同答复在数据处理协议中。

不在您的数据上进行训练意味着供应商处理您的内容以提供您所要求的结果,并且绝不会将其反馈到模型训练、微调、评估或基准测试中。您的文档是服务的输入,而不是产品的原材料。

零数据保留 (ZDR) 意味着提供商在内存中处理请求,且不向磁盘写入任何内容。Parseur 不是零数据保留,任何允许您重新运行提取或审查过去结果的文档解析器都无法诚实地声称这一点。Parseur 为您提供可配置的保留窗口,根据您的计划,从一天起步。

Parseur 托管在欧盟,原生支持 GDPR,并且数据保留在欧盟境内。托管数据中心通过了 ISO 27001 认证,这是数据中心的证书,而不是 Parseur 的认证。

您是数据控制者,Parseur 是数据处理者。Parseur 根据您的《数据处理协议》条款,代表您并按照您的指示处理数据。

不自动涵盖,这正是大多数政策悄然存在的漏洞。许多供应商承诺不在您的数据上进行训练,同时保留在您的数据的匿名化、去标识化、聚合或派生版本上进行训练的权利。请要求明确列出该例外情况,然后将其杜绝。

它们直接支持两个核心原则。目的限制意味着数据仅用于您请求的任务,数据最小化意味着不存在可能在日后暴露的辅助副本。两者都不能取代数据处理协议,但如果没有不训练承诺,这两个原则都很难证明。

不。客户数据绝不会被重复用于训练 Parseur 的 AI 模型,也绝不会被出售。每次提取都只为了生成您的输出,别无其他用途。

由您决定。文档保留期可配置,从一天到无限期(取决于您的计划),一旦窗口关闭,文档将被自动删除。您也可以按需删除它们。

欧盟 GDPR、英国 GDPR、加利福尼亚州 CCPA 和 CPRA,以及新加坡 PDPA。SOC 2 Type II 和 HIPAA 合规计划正在进行中,预计在 2026 年完成,这意味着 Parseur 目前尚未通过这两项认证。

要求提供具体名称列表、它们在哪里处理数据、保留数据多长时间,以及是否在合同中被禁止使用您的内容进行训练。DataGrail 2026年对 2,400 家商业软件提供商的分析发现,63.6% 宣传其 AI 功能的供应商没有在其任何法律文档中披露第三方 AI 子处理者。

将它们写入《数据处理协议》或《主服务协议》,而不是隐私政策,并添加优先权条款,以便签署的文档优先于可能在不通知的情况下更改的在线条款。

在签约前向每个供应商询问这个问题,包括删除是否涉及备份、日志和缓存,以及需要多长时间。使用 Parseur,您可以控制保留窗口,并可以按需删除文档。