工作

Thomson Reuters自建大模型:4000万美元改写专业AI成本账

|作者: QUASA 编辑团队|2 分钟阅读| 14
Thomson Reuters自建大模型:4000万美元改写专业AI成本账

Thomson Reuters于2026年8月24日在多伦多发布Thomson,这是该公司首个内部开发的专有大语言模型。官方发布信息 显示,Thomson以开放基础模型为起点,人才与算力投入为4000万美元,并结合Westlaw、Practical Law、Checkpoint和Reuters等专业内容进行中期训练和后训练。

Thomson不是从零预训练的通用聊天模型,而是由Thomson Reuters拥有和控制、面向法律、税务及其他专业工作深度训练的模型。首个计划部署场景是CoCounsel Legal的Tabular Analysis,用于高容量、结构化文档审查;模型已经发布,但该客户功能要到后续版本才会提供。

4000万美元买到的是模型控制权

Thomson从开源基础模型经过专业内容训练和领域专家评测,形成面向法律任务的专用模型

“自建”不等于从空白开始训练。Thomson Reuters采用开放基础模型,再以自有内容、训练方法、专业人员和研究工具进行改造,把巨额通用预训练支出换成更聚焦的专业化投入。

LawSites对媒体简报的报道 显示,4000万美元覆盖约两年的人才和算力投入,而最终版本的一次训练运行约花费45万美元。两组数字口径不同:前者是项目投入,后者只是一次训练运行,不能把45万美元理解为完整模型的开发成本。

这笔投资也没有覆盖全部成本。公开信息没有完整列出内容积累、编辑体系、产品集成、安全验证、托管和持续维护投入,也未披露客户使用Thomson时的单次推理价格。因此,现有证据支持“专业化路线改变成本构成”,却不足以证明其全生命周期成本低于所有外部模型方案。

首个落地场景仍在后续版本中

CoCounsel Legal批量审查合同并把字段化结果对应回原始文档,展示Thomson的首个计划落地场景

Tabular Analysis允许用户针对一批文件定义需要提取或比较的字段,再把结果整理为结构化表格。与开放式法律问答相比,这类任务的输入、问题和输出边界更清晰,审查人员也更容易回到原始文件逐项核验。

Thomson将在即将发布的CoCounsel Legal版本中成为该功能的默认模型,但管理员仍可改选其他模型。CoCounsel Legal继续采用多模型架构:Thomson承担公司认为专业化优势较明显的任务,第三方前沿模型则用于其他工作。

这一区别关系到产品的实际状态。8月24日已经发布的是模型本身;Tabular Analysis中的客户部署仍属后续版本计划,法律和税务产品组合中的进一步扩展也尚无完整时间表。把模型发布写成所有客户已经可以使用,会夸大当前进度。

成本账从调用费变成资产与运营费

Thomson所代表的变化,不是专业机构都应立即训练自己的模型,而是模型、内容和推理支出可以被拆开决策。对于拥有大量高频任务和合法专业语料的机构,专用模型可能把部分长期调用费转化为前期训练、部署和维护投入,同时增加对版本、运行地点和模型行为的控制。

  • 自建或深度专业化:机构需要承担模型工程、领域专家、算力、托管和持续评测成本,优势是能够控制训练流程、部署方式以及高频任务使用的推理资源。
  • 接入通用前沿模型:无需建立完整的模型训练团队,但费用会随调用量、上下文长度、模型升级和供应商定价变化;采购方还需依据合同核对数据处理、留存及访问条件。
  • 通用模型加专业检索增强:专业内容可以单独更新,回答也较容易附带原文依据;但费用同时来自模型调用、检索基础设施和内容授权,而且检索到正确资料不代表模型必然能够正确推理。

Thomson Reuters实际采用的是组合路线:在开放基础模型上进行专业训练,让模型连接自有内容和工具,同时保留第三方模型。它减少了对单一外部模型的依赖,却增加了模型路由、版本管理、跨模型评测和安全运营的复杂度。

采购者需要核对六个成本与治理变量

4000万美元不能直接成为律所、税务机构或审计公司的预算参照。专业内容储备、任务调用量、部署地区和内部技术能力不同,都会改变自建、外购与检索增强三条路线的经济性。

  • 训练材料是否拥有明确授权,客户材料会不会进入后续训练;
  • 输出能否追溯到具体法律、税务或合规依据;
  • 客户数据在哪里处理、保存多久,由谁可以访问;
  • 能否切换模型,并复现特定版本产生的历史结果;
  • 训练、托管、检索和单次推理成本分别如何计算;
  • 是否有覆盖目标司法辖区、语言和真实任务的独立评测。

这些变量划定了“改写成本账”的准确边界:Thomson Reuters把模型所有权纳入专业内容业务,但这不等于所有机构自建模型都会更便宜。若调用规模不足,或缺少可训练内容和维护团队,外接通用模型仍可能具有更低的总体成本。

性能优势仍主要是公司自测结论

外部法律研究人员依据专业资料核验Thomson回答与引用,记录仍需独立验证的能力边界

目前公开的性能优势主要来自Thomson Reuters内部早期评估,尚不能等同于独立、可复现的行业验证。TNW对发布材料的核查 指出,公司没有随“可与最新前沿模型竞争”的说法公布具体分数;内部结果还包括复杂指令遵循和密集专业内容处理相对基础模型的提升。

外部学者的初步反馈提供了有限的第三方观察,但样本仍然很窄:一项测试使用公司税课程中的难题比较Thomson、ChatGPT和Claude,另一项测试认为其引用质量总体可与领先模型竞争。这些反馈尚未覆盖大规模真实业务、不同司法辖区、错误分布、稳定性和运行成本,因此不能替代系统性独立评测。

Thomson Reuters计划让更多外部研究者接触模型,并为学术和非商业用途提供较小的开放权重版本。接下来需要关注Tabular Analysis的实际上线时间和推理价格、跨司法辖区表现、失败类型,以及第三方能否在可复现条件下验证公司的能力主张;在这些数据出现前,4000万美元证明的是一条可行的专业模型路线,而不是已经结清的成本优势。

分享:

订阅我们的新闻通讯

将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。

0