路透花 4000 万美元训练大模型,企业 AI 进入自建时代

CN
3小时前
AI 竞争的下一阶段,赢的可能不是训练成本最高的公司,而是数据最独特、最不可替代的公司。

撰文:小饼

8 月 24 日,Thomson Reuters 宣布推出自研大语言模型"Thomson"。这家年收入超过 70 亿美元的信息巨头称,模型基于开源底座训练,累计投入约 4,000 万美元(涵盖人才和算力),训练数据来自 Westlaw 法律数据库、Practical Law 实务指南、Checkpoint 税务研究平台和 Reuters 新闻资产。早期评估显示,Thomson 在多个任务上的表现"与最新的前沿模型相当"。

4000 万美元,对比一下:OpenAI 最新一轮融资 400 亿美元,Anthropic 累计融资超过 130 亿,xAI 单轮就拿了 60 亿。前沿实验室用数十亿美元堆算力训练通用模型,而 Thomson Reuters 用不到一个零头,在一个垂直领域做出了自称可以对标前沿的能力。

CTO Joel Hron 的原话是:AI 行业多年来把规模当答案,更大的模型、更多的算力、更多的钱。Thomson 证明存在另一条路径,从一个强大的基础出发,针对真正重要的工作做深度特化,就能构建高效且完全自主可控的智能。

垂直行业的 AI 自建时代正在开始。

Thomson 做了什么?

Thomson 从开源底座出发(公告未指明具体是哪个模型),通过中期训练(mid-training)和后期训练(post-training)注入 Thomson Reuters 的专有数据。

公告透露,目前只使用了不到 10%的自有内容进行训练,后续将继续探索新的专业化方向。数百名学科专家从训练目标设计到最终评估全程参与。

模型的首个部署场景是 CoCounsel Legal 中的表格分析(Tabular Analysis)功能,面向律所和企业法务部门。CoCounsel 保持多模型架构,在 Thomson 具有明显优势的场景使用 Thomson,在其他场景继续使用外部前沿模型。

Thomson Reuters 还在 Hugging Face 上发布了一个"小型"开源版本,供学术和非商业用途使用,并邀请法学和 AI 学者进行独立评估。

华盛顿大学法学院教授 Jonathan Choi 用公司税课程中的高难度问题测试了 Thomson、ChatGPT和 Claude,评价是三个模型都回答正确,但他更偏好 Thomson 的回答,特别是引用法律论著的链接让回答更透明、更实用。

4000 万美元的经济学

这个数字是理解整件事的钥匙。

训练一个通用前沿模型的成本正在指数级攀升。Meta 训练 Llama 3 用了超过 1.6 万块 H100 GPU,算力开支估计在数亿美元。OpenAI和 Google DeepMind 的训练预算更高。这些模型的目标是"什么都能做",从写诗到解微分方程,从编程到角色扮演。

Thomson Reuters 做的事情在逻辑上完全不同。它不需要一个什么都能做的模型,它需要一个在法律研究、税务合规、监管解读和专业文档分析这几个极度垂直的领域里,做到和通用前沿模型一样好甚至更好的模型。这个目标的范围窄得多,所以训练成本低得多。

但真正让 4000 万美元成为可能的,不是范围缩窄,而是数据资产。

Thomson Reuters 拥有的 Westlaw 法律数据库覆盖了超过 40,000 个案例数据库和超过 100 年的判例积累。Practical Law 包含 650 多名律师编辑持续维护的操作指南和模板。Checkpoint 是美国税务专业人士的标准工具。Reuters 新闻语料库覆盖全球,时间跨度超过 175 年。

这些数据不是从互联网上爬取的。

它们是经过专业编辑、标注、结构化和持续更新的专有资产。在这种数据上训练出来的垂直模型,在其专业领域内的准确性和引用质量,通用模型很难通过简单的 RAG(检索增强生成)或微调来匹配。通用模型可以"接入"这些数据,但接入和"在其中生长"是两回事。

Thomson Reuters 自己也点出了这个区别:领域特化的训练产生的增益,是单纯的内容接入无法替代的。

谁会走这条路?

Thomson Reuters 不会是唯一一家。沿着"专有数据→垂直模型→更低推理成本→更强数据控制→更高企业毛利"这条链条看,至少有几类公司具备复制这个模式的条件。

金融数据公司。Bloomberg 已经在 2023 年训练了 BloombergGPT,基于自有的金融终端数据和新闻语料。虽然后续动作不多,但 Bloomberg Terminal 的数据壁垒和 Thomson Reuters的 Westlaw 属于同一个量级——这些是任何通用模型都无法合法获取的专有数据集。

专业服务机构。四大会计师事务所(PwC、Deloitte、EY、KPMG)、大型律所联盟(如 Baker McKenzie、Kirkland & Ellis),以及医疗信息公司(如 Epic Systems 的电子病历数据),都坐拥大量高度结构化、高度保密的专业数据。这些机构不愿意把客户数据交给通用模型处理,同时又需要 AI 提升效率。自建垂直模型对它们来说,从合规角度可能不是选择,而是必须。

行业数据垄断者。MSCI 拥有全球 ESG 评级和指数数据,Verisk 拥有保险定价和风险模型数据,Wolters Kluwer 拥有欧洲法律和合规数据,RELX 拥有 Elsevier 学术期刊和 LexisNexis 法律数据。这些公司的共同特征是:数据是核心资产,数据的独占性就是护城河,把数据喂给别人的模型会稀释自身价值。

对 OpenAI和 Anthropic 意味着什么?

Thomson Reuters 的公告里有一个细节容易被忽略:CoCounsel 保持多模型架构。在 Thomson 具有优势的地方用 Thomson,在其他场景继续用外部模型。

这说明即便是自建了模型的企业,也不会完全抛弃通用模型。

通用模型仍然在通用推理、代码生成、多语言处理等方面具有优势。垂直模型替代的是通用模型在特定领域中"够用但不够好"的那一层。

但长期来看,如果越来越多的高价值企业客户开始自建垂直模型,通用模型公司面临的风险是被压缩到基础设施层:提供底座模型供企业二次训练,提供推理 API 处理通用任务,但在最赚钱的垂直应用场景中失去定价权。

这类似于云计算行业的演变。

AWS、Azure和 GCP 提供基础设施,但最赚钱的 SaaS 应用层被 Salesforce、ServiceNow、Workday 这些垂直公司占据。如果 AI 行业走上同样的路径,OpenAI和 Anthropic 的角色可能更接近"AI的 AWS",而非"AI的 Salesforce"。

Thomson Reuters 花4000 万美元证明的事情是:当你拥有足够独特的数据,你可以用一个零头的成本,在你的领域里追平数十亿美元训练出来的通用模型。

这个逻辑一旦被验证,每一家坐在专有数据矿山上的公司,都会重新算一笔账:继续每年给 OpenAI或 Anthropic付 API 费用,还是花一笔相对小得多的钱,训练一个自己完全控制的垂直模型?

对于习惯了"AI 军备竞赛"叙事的市场来说,Thomson Reuters 的4000 万美元是一个反方向的信号。AI 竞争的下一阶段,赢的可能不是训练成本最高的公司,而是数据最独特、最不可替代的公司。模型是工具,数据才是壁垒。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接