模型自噬失调的风险:为何企业需要数据“B计划”
随着人工智能模型基于内容进行训练,企业记录的重要性日益凸显。
本文由 AI 翻译,关键事实请以原文为准。
尽管企业正将人工智能更深入地融入日常运营,但互联网上的公开内容对于这项技术所需的背景信息而言,已变得越来越不可靠。
网络上大部分现成的信息已被大量挖掘并用于训练大型语言模型 (LLM),而剩余信息中由人工智能而非人类生成的部分正日益增多。
每当互联网信息的质量下降,建立在此基础上的人工智能输出结果的可靠性也会随之降低。
正是在这样的背景下,企业内部文件——包括各种记录和多年积累的知识——的重要性日益凸显。
为何互联网正走向“MAD”
美国莱斯大学 (Rice University) 的研究人员将此现象称为“模型自噬失调” (Model Autophagy Disorder,简称MAD),而牛津大学和剑桥大学的研究人员则在2024年发表于《自然》(Nature) 杂志的一篇论文中,详细阐述了一个相关问题——“模型崩溃” (model collapse)。
这两种现象都描述了当人工智能模型反复使用其他人工智能系统生成的内容进行训练时会发生什么。模型识别罕见场景的能力通常会最先消失,而这些场景往往正是最需要人工智能介入的情况,例如标记可疑交易或违规行为。
这就是为什么各机构开始转向它们已拥有的资产——数十年的交易记录、客户互动、合规文件和运营数据。在过去,这些数据大多被视为存储负担,只是为了满足监管要求而保留,除了审计之外很少被查阅。
如今,这种态度正在改变。将这些源自真实客户、交易和员工的内部记录数据提供给人工智能工具,而不是让它们仅依赖日益被人工智能内容饱和的公共网络,能为这些工具提供更可靠的基础,并为企业带来竞争对手难以复制的宝贵资产。
几乎所有机构都能使用相同的基础模型,因此真正的差异化优势在于其背后数据的质量和独特性。
然而,很少有公司能充分利用这一点。多年来零散的技术投资导致数据分散在互不相连的系统中,许多机构至今仍无法确切说明它们拥有哪些数据,以及这些数据存储在何处。
确保企业数据的可靠性
保存记录与能够信赖这些记录并非一回事。只有当企业记录能够被证明是真实且未经篡改的,它们才能有效制衡公共网络上的信息。
这一假设正受到挑战。随着内部档案在人工智能战略中变得愈发核心,它们对网络犯罪分子的吸引力也随之增加。攻击者不再仅仅是锁定系统以勒索赎金,而是越来越倾向于悄悄篡改竞争对手的记录,或以不易察觉的方式破坏备份数据。
这改变了人工智能就绪度的关键要素。问题不再仅仅是模型是否训练得当,更在于其所使用的数据是否仍可被验证为真实,以及一旦出现问题,公司能以多快的速度恢复干净的数据版本。
即使基础数据已被篡改,输出结果也可能看似很有说服力且条理清晰。然而,无论底层的LLM多么复杂,基于这些数据做出的决策都将带有偏见。
自动化进一步加大了风险,因为以往需要多层人工审核的流程现在由人工智能加速处理,这可能导致错误在被发现前就已层层叠加。
一家区域性银行不能使用其无法担保真实性的交易历史来训练欺诈检测模型。一家物流运营商如果无法证明库存数据未经篡改,就不能信任这些数据。
监管机构也已注意到这一点,并期望各机构能够证明其由人工智能驱动的决策所依据的信息是可追溯和可验证的,而不仅仅是可检索的。
将记录视为动态基础设施
随着可靠的公共信息日益稀缺,企业记忆可能成为一个机构最宝贵的资产之一,但前提是它必须得到保护。这意味着需要将档案视为一个动态的基础设施,进行主动监控和防御,而不是仅仅作为事后合规的考虑。
为人工智能做好准备和保护内部记录并非两件不相干的事。一个无法保证自身数据完整性的机构,并未真正为模型崩溃的那一天建立起B计划,它只是将同样的问题转移到了内部而已。
作者是Cohesity公司亚细安区域副总裁