工作

企业AI开始挑着记忆:Workday称新方法更准且快31%

|作者: QUASA 编辑团队|2 分钟阅读| 2
企业AI开始挑着记忆:Workday称新方法更准且快31%

UC Today对新团队的报道 确认,Workday于2026年8月19日成立Workday AI Research,研究范围包括代理记忆、可解释性、多代理协作和自适应资源控制。其选择性记忆方法在一项公开基准测试中提高了记忆筛选精确率和综合质量,处理速度比研究采用的AI对照方法快约31%。

这不是已经进入Workday产品的功能发布,而是研究团队公布的受控实验。标题中的“更准”特指代理判断候选信息是否应进入长期记忆的精确率,并不表示招聘、财务或IT代理执行任务的整体准确率已经提高;速度差异也仅适用于这次测试的系统配置。

A-MAC先决定什么值得写入

A-MAC在公开长对话基准中筛选候选记忆,将可信且有长期用途的信息写入代理记忆

这套方法名为Adaptive Memory Admission Control(A-MAC)。它不让代理无差别积累对话内容,而是从未来用途、事实可信度、语义新颖性、时间新鲜度和信息类型五个维度判断候选记忆;只有用途判断调用较慢的AI模型,其余部分主要由可检查的规则完成。

Workday的A-MAC实验说明 显示,测试采用公开的LoCoMo基准,约30段长对话产生约1500条带人工标签的候选记忆;该方法保留了97%的有用记忆,准入精确率提高12%,综合质量约提高8%,每条候选信息处理约需2.6秒,而指定对照方法约需3.8秒,对应约31%的速度差异。该页面同时注明,测试没有使用Workday产品、客户数据或真实工作记录,企业场景只是说明性类比。

速度差异主要来自模型调用次数:A-MAC每次判断只进行一次AI调用,其他检查由规则完成。新信息与已有记忆冲突时,方法会比较两者的价值并合并更新,目标是避免互相矛盾的版本持续并存。

测试优势不能外推为产品性能

实验中的几个指标衡量不同问题:有用信息保留率反映系统是否漏掉重要内容,准入精确率反映被保留的信息中有多少值得保存,综合质量则同时考虑保留有用信息与过滤无关信息。它们不是同一个“准确率”,更不是对招聘质量、关账效率或IT故障处理结果的测量。

公开长对话基准也无法完整模拟企业环境中的并发负载、跨应用检索、部署成本和权限继承。因此,测试中的速度优势不能直接换算成生产系统响应时间以相同比例缩短,也不能证明方法在不同语言、行业数据或复杂组织权限下仍会维持相同表现。

工作对话还有一个额外难点:关键背景可能被默认、分散在不同系统中,或者从未在对话里直接说出。即使准入机制能够识别过期、重复或缺乏依据的信息,其判断质量仍取决于代理是否取得了完整且有权限使用的上下文。

企业需要审查整段记忆生命周期

企业审计追踪代理记忆的来源、更新时间、准入理由与受权限控制的读取过程

选择性准入只回答“是否写入”这一关。对于HR、财务和IT代理,治理范围还包括记忆来自哪里、允许保存多久、谁能纠正、哪些应用可以读取,以及删除后能否证明派生副本也已消失。

写入时,每条记忆需要能够关联原始对话或业务对象、生成时间、准入理由和适用权限,否则审计只能看到代理保留了什么,无法判断依据是否可靠。更新时还要区分长期事实与短期状态:语言偏好可能持续有效,候选人的招聘阶段、预算余额或工单状态则会变化。

读取权限也不能因为信息已经进入代理记忆而自动扩大。来自HR系统的个人资料、财务预测和IT安全记录即使由同一代理调用,每次检索仍应服从原始数据的用途和权限边界;员工和采购者需要确认控制是否分别覆盖写入、存储与检索阶段。

删除原始记录不等于真正忘记

删除验证覆盖代理记忆的原始记录、派生摘要、检索索引与缓存,并确认目标信息无法恢复

代理可能把原始信息加工成摘要等派生记忆,因此删除操作必须覆盖的不止一条记录。Workday的正式公告 披露,在另一项受控实验中,原始记忆被删除后,目标信息仍有约五分之一的情况可从旧摘要中恢复;同时删除所有提及该信息的摘要后,测试才不再检出残留。

这个结果不能解释为所有企业代理都有固定的信息泄漏率,也不能证明某个实际部署已经实现完整删除。不同系统还可能存在向量索引、缓存、备份和下游应用副本;界面显示“已删除”只能说明操作被触发,不能单独证明这些派生层已经同步失效。

可验证删除需要回答哪些存储层被覆盖、何时完成、索引或摘要是否重新生成,以及删除后的检索测试能否再次找到目标信息。A-MAC处理长期记忆的入口,前述删除实验则表明,记忆退出机制需要单独设计并验证。

仍待真实企业系统验证

目前可以确认的是,Workday已设立专门研究团队,并公开了选择性准入与派生记忆删除的实验结果。现有页面没有说明A-MAC何时或是否会进入具体Workday产品,也没有提供客户环境中的延迟、成本、误删率或跨应用权限测试。

接下来仍需观察更大规模工作对话、不同语言和业务系统中的结果,以及摘要、索引、缓存和备份能否实现可验证删除。在这些证据出现前,这项研究支持的结论仅是:一种可解释的记忆准入方案在特定公开基准上优于指定对照方法,而不是企业代理已经普遍解决长期记忆、错误信息和隐私治理问题。

分享:

订阅我们的新闻通讯

将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。

0