从认知元到文档对象网络,每一次有序处理持续维护文档与数据集合的关联——认知在文档间汇集、积累、反向传播,让分类分级越来越准确,最终形成精准治理与产品能力闭环。
认知元不是一条文档操作日志。它让系统理解文档流动所体现的关系与认知属性,并与文档关联的寻址数据或文档原有属性协同,使相关文档能够持续定位到对应的数据集合。
认知元不是一条文档操作日志。它让系统理解文档流动所体现的关系与认知属性,并与文档关联的寻址数据或文档原有属性协同,使相关文档能够持续定位到对应的数据集合;当文档流动代表新的实体时,系统建立目标数据集合,并维持其与来源数据集合之间的关系。
普通文档操作事件记录的是"本机文件发生了什么"——时间、进程、路径、操作。一旦文件被复制、另存或跨设备传输,这些离散记录就容易割裂,通常需要重新匹配才能找到关联。认知元解决的不是"记录文档流动",而是让系统持续判断:相关文档应归并至既有数据集合,还是建立并关联新的目标集合。
当文档流动代表新的实体时,系统不会强行把所有流动文档归并为同一实体,而是建立目标数据集合,并维持其与来源数据集合之间的关系。这种"关系判断 + 持续寻址"的机制,使链接不随文档流动而断裂——认知元解决的不是"记录文档流动",而是"让流动中的相关文档持续找到正确的归属或关联"。
图 1 和图 2 说明了认知元解决的问题:它不是记录一次文件动作,而是让一个文档及其流动中的相关文档持续找到正确的归属或关联。接下来需要进一步回答:这种持续链接依靠哪些信息建立?服务器如何处理?最终又沉淀出什么可治理的结果?
认知元并不是孤立的一段日志信息。一次认知处理需要两类信息协同:一类负责理解文档之间发生了什么关系、这次处理带来了什么属性;另一类负责让系统持续找到相关文档应归属或关联的数据集合。
在本页面的技术表达中,认知元由两部分认知信息组成:认知关系信息和认知属性信息。前者回答“谁与谁有关、关系如何变化”,例如本次处理是延续既有关系,还是形成新的衍生关系;后者记录与处理相关的应用、设备、用户、路径、时间等上下文,为系统理解文档提供判断依据。
与此同时,与文档关联的寻址数据或文档原有属性提供定位依据。它们不等同于认知元的内部字段,而是与认知元协同:认知元负责理解关系与属性,定位依据负责让系统持续找到文档应归属或关联的数据集合。
因此,系统并非在文档第一次进入时做一次性匹配后就结束,而是在后续复制、另存、传输和继续处理时,仍能沿用关系判断和定位依据,持续建立或维持链接。
文档操作是整个过程的触发点,但它本身不是认知元,也不能单独完成持续归并。真正的关键在于:操作发生后,系统如何把一次处理转化为可被服务器持续计算和定位的数据。
当复制、另存、上传下载、编辑、移动等文档操作发生时,计算设备先获得与该操作相关的基础事件或事件组合,并据此形成认知关系信息和认知属性信息。操作所涉及的处理后文档,会关联寻址数据;在适用场景中,文档原有属性也可以作为辅助定位依据。
服务器获得处理信息和定位依据后,执行两类核心处理:对于需要新建承载对象的场景,服务器使用处理信息建立对应的数据集合;对于已经建立关联的场景,服务器使用寻址数据或文档原有属性确定对应的既有数据集合。随后,服务器建立、维持或更新文档与数据集合之间的寻址关联。
这意味着,文档不再只是一份停留在某台设备、某个路径中的文件,而是能够被持续定位到相应的数据集合中。后续处理后的文档还可以继续作为新的源文档,进入下一轮相同的处理链路。
“持续建立链接”并不等于把所有流动文档都塞入同一个实体。服务器会先基于认知关系信息和预定义决策判断关系类型,再选择正确的处理路径。
第一类是维持型关系。此时,处理后文档继续归并至既有数据集合,服务器建立、维持或更新该既有集合的寻址关联,并根据新的处理信息更新相关认知属性。编辑、只读访问、重命名、移动等操作可作为这类场景的常见示意;实际关系类型仍由认知关系信息和预定义决策确定。
第二类是改变型关系。此时,服务器为处理后文档建立或确定目标数据集合,并在来源数据集合与目标数据集合之间建立或更新集合间关联。复制、另存、上传下载、压缩等操作可作为这类场景的常见示意。这样,系统既不会丢失来源关系,也不会把本应区分的衍生对象强行归并为同一个实体。
两类关系共同构成系统对文档流动的准确表达:该延续的关系被持续归并,该分化的关系被保留为可计算的集合间关联。
持续链接的价值不止是“知道文档在哪里”。更重要的是,服务器能够把文档关系和处理上下文转化为与数据集合关联、可持续更新的认知属性。
服务器基于认知关系信息、认知属性信息和预定义决策,确定一个或多个属性值,并形成或更新与数据集合关联的认知属性项。这里的预定义决策可以理解为组织已经明确的分类、分级和业务判断规则;系统并不是孤立地读取一次文件内容后给出固定结论,而是结合文档关系、处理上下文和后续新增信息持续计算。
最终,数据集合可以形成或更新类别属性、级别属性和业务属性。类别属性帮助识别数据属于什么类型,级别属性表达数据的重要性或敏感程度,业务属性则关联其业务语义和使用场景。由于这些属性与数据集合及其文档关系相连,后续新出现的处理信息可以推动属性值持续形成或更新。
这使数据安全标签系统输出的不只是一个静态标签,而是一组可查询、可治理、可持续演进的数据认知结果,并为后续的策略应用、审计追溯和数据治理提供依据。
前述内容已经说明:系统能够基于处理信息和定位依据,建立或确定对应数据集合,维护文档与数据集合之间的关联,并形成类别、级别和业务属性。真正进入治理阶段后,还要解决两个更具体的问题:如何在多个相似文档中准确锁定目标,以及如何确保任何影响只发生在应当发生的范围内。
当同一业务文档在不同终端流动时,用户最关心的不是“是否能看到一次操作”,而是:系统能否在准确确定对象和关系后,只对需要治理的指定关联文档形成结果。
跨设备管控并不是 PC A 直接修改 PC B 上的文件。PC A 发生相关处理后,服务器取得与文档关联的定位依据,并确定第一管控数据集合;再依据已维护的集合间关系,确定本次可能需要参与计算的相关数据集合。
服务器随后结合类别、级别、关系和预定义决策计算管控结果。只有通过定位和范围计算确认的指定关联文档,才会接收相应结果;与本次关系无关、或不满足规则的文档不会被纳入。这样,跨设备治理建立在统一计算和明确边界上,而不是在终端之间进行无差别传播。
文件名相同、路径相似,甚至内容近似,都不应成为系统猜测治理对象的唯一依据。精准治理的第一前提,是持续找到本次真正需要处理的指定文档。
服务器使用与文档关联的寻址数据,或者文档原有属性作为定位依据,并结合已经建立的寻址关联和属性对应关系,确定指定文档及其对应的第一数据集合。文件名、路径等信息可以是上下文的一部分,但不应单独承担跨设备、多副本场景下的持续定位任务。
这一步的价值在于把“可能相关的相似文件”与“本次需要处理的指定文档”区分开来。只有先准确确定对象和起点,后续的关系计算、属性形成和策略结果才有可靠边界。
找到起点并不等于所有相关对象都应被处理。关系网络的作用是提供可计算的候选范围,而不是触发无边界、无差别的影响。
服务器从已定位的指定文档和第一管控数据集合出发,查看已维护的集合间关系,并根据关系类型、方向、程度、路径、类别、级别等关系约束与属性规则,筛选本次可参与计算的数据集合。
关系存在,只是进入计算的前提,不等于一定被作用。只有满足预定义决策的集合和指定关联文档才进入本次管控范围;方向不符、路径不符、超出范围或无关的对象被明确排除。
文档的关系不应只停留在某一次操作或某一台设备上。复制、传输、另存和后续处理会不断带来新的处理信息,系统需要把这些信息纳入同一条持续维护的关系链。
不同设备上的连续处理会持续向服务器提供新的关系与属性判断,并与定位依据协同使用。服务器不把关系保存在单个终端上,而是基于每次处理信息持续建立、确定、维持或更新相关数据集合及集合间关系。
后续文档是否继续归并至既有数据集合,还是建立或确定目标数据集合并维护集合间关联,取决于本次处理所反映的关系类型和预定义决策。因此,跨设备、多次处理并不等于所有文档被强行视为同一对象,而是让应当延续的归并被维持、应当分化的关系被保留。
类别、级别和业务属性的价值在于可治理,而可治理的前提是边界清楚。一次属性变化只能作为处理输入,不能被理解为向所有关系对象自动传播的指令。

服务器从已定位的第一数据集合出发,将属性变化与集合间关系、关系约束、属性规则及预定义决策共同计算。关系网络提供候选对象,但只有符合条件的集合才会进入本次属性形成或更新范围。
对于已经进入范围的指定关联文档,系统可以形成或更新类别、级别和业务属性;对于未被选中的相关文档或无关文档,则不形成本次更新结果,保持其当前状态。这样,属性更新既能利用文档关系,又不会沿关系无边界扩散。
前面的图 7 至图 11 说明了精准治理的运行方式:先确定对象,再限定范围;关系可持续维护,属性更新也受到明确边界约束。对用户而言,这些底层机制最终应被理解为可部署、可配置、可验证的产品能力。
底层的关系、属性、定位和决策机制不是孤立出售的技术概念。它们共同支撑数据安全标签系统中用户可见、可采购、可治理的功能结果。
统一的服务器处理机制将认知关系信息、认知属性信息、寻址数据或文档原有属性转化为对数据集合、集合间关系、可治理属性和受控范围的持续计算。它不是五套彼此割裂的功能,而是同一套基础能力在不同产品界面和治理任务中的呈现。
在产品层面,用户可以直接获得五项能力:以 FileID 等身份或定位实现载体建立文档身份与档案;通过跟着文档走的安全标签呈现可治理信息;持续形成或更新分类分级与业务属性;在准确定位与严格范围限定后实施精准策略;以及通过关系视图与审计追溯查看文档关联、流动和处理依据。
文档网络不是预先定义的拓扑,而是由真实操作"长"出来的。每一次复制、另存、上传下载,都产生认知元,汇入 FileFlowNode,把跨设备的文档连成一张持续生长的网。
张三在 PC-A 上创建了年度财报,李四复制了一份到 PC-B,又另存出一个修改版,王五从服务器下载了副本到 PC-C——四次操作产生四个认知元,带着源/目的 FileID 和操作类型汇入 FileFlowNode(认知元汇集点)。原本散落在三台设备上的四份文件,由此连成一张跨设备的文档网络。
FileFlowNode 实时计算家族属性(类型/级别/业务属性),并通过回写标签把认知传回各 PC 端文件上。这就是"一网"(文档对象网络)的核心:不是静态的文件清单,而是由认知元持续注入、持续生长的动态认知网络。
一处标记,全网继承——这是正向传播。更深刻的是"动态认知":未来的操作可以反向更新历史文档,让已经"静止"的文件也能持续修正。
安全管理员在 PC-A 上把年度财报标记为"机密"。这个级别通过 FileFlowNode 传播给 PC-B 和 PC-C 上的副本——它们从未被单独分类,却自动继承了"机密"。副本出生即继承,这就是"一标记"(数据安全标签)随文传播的力量。
三个月后,王五在 PC-C 上编辑了下载的副本,系统内容分析发现实际应为"绝密"。这次更新通过 FileFlowNode 反向传播,让 PC-A 上的原始文档和 PC-B 上的副本都升格为"绝密"。
对 PC-A 上的原始文档来说——它的认知来自"未来"。张三三个月前创建的文件,因为三个月后另一台设备上的一次操作,被重新认知、更新级别。这就是专利中的"动态认知"与"正反馈"机制。
单个认知元只能确定一次操作,大量认知元叠加后,系统重新计算整个文档家族的级别、类别、业务属性。这就是专利中的"积累效应——量变引起质变"。
看四个时间节点上同一个文档家族的变化——认知元从 1 个积累到 30+,分类结论从模糊的"Word 文档"收敛到精确的"年度财务报表 · 机密 · 不可外发"。
文档家族从 1 份长到 12 份,认知元从 1 个积到 30+,分类结论从模糊的"Word 文档"收敛到精确的"年度财务报表 · 机密 · 不可外发"。认知不是一次性的快照,而是持续积累、持续修正的动态过程——每一次操作都在为整个文档家族的认知添砖加瓦。
技术就叫"数场"。以下术语对照帮助理解专利文档中的概念在数场体系中的角色。
文档之间的逻辑连接路径,认知元沿着道路传递
每次操作产生的信息包,沿着道路飞向汇集点
可信度、关系紧密程度、传播跳数——防止认知无边界扩散