← intelligenzAI.it

modelli

汤森路透推出「Thomson」:用出版商的数据(和成本)叫板前沿模型的自研大模型

Olya2026/8/26⚙ AI-generated content

汤森路透发布了「Thomson」,这是该公司首个自研的大语言模型。公司称它建立在「扎实的开源基础」之上——官方通稿并未点名起始模型;在一次采访中,基础研究负责人表示项目过程中底座换过,最近使用的是 Qwen 3.5,但没有确认发布版本用的就是它——随后以 mid-training 与 post-training 手法,在自家档案库上做了特化:Westlaw、Practical Law、Checkpoint 和路透社。公司说明,目前动用的内容还不到自有内容库的 10%。公开的总投入约为两年 4000 万美元,包含人力与算力;而发布版本的最终一次训练运行本身,花费约 45 万美元。技术负责人乔尔·赫伦把这个数字归因于把独家内容叠加在高水准开源模型之上。

通稿中引用的评测均为内部评测,尚未经第三方验证。汤森路透称该模型在一系列任务上与前沿模型持平,并在遵循指令和领域推理上有所改进。在自家的「Deep Research」基准上,当 Thomson 能够访问独家内容时,成绩超过 GPT-5.4 和 Anthropic 的一款旗舰模型;而仅有网络访问时,结果只是相当,并无领先。Conflict Analytics Lab 的萨缪尔·达汉评价其在加拿大劳动法问题上的引证「总体上与主要前沿模型有一战之力」,但 SiliconANGLE 提醒,广泛的独立验证仍然缺席,详细的技术报告只是预告,尚未发布。至于外部模型在其余产品线中还会用到什么程度,公司没有说明。

首个投入生产的场景是 CoCounsel Legal 的 Tabular Analysis 功能,Thomson 是默认模型,但管理员可以改用其他选项。公司还宣布将在 Hugging Face 上以非商业学术许可发布一个开放权重的「小型」版本,并向一批学者开放直接评测。不过,权重的发布日期、开放版本的规模、许可的确切文本以及开发者门户的条款,目前都还不清楚。汤森路透强调,客户数据不会用于训练,其「Fiduciary-Grade」标准要求任何未来使用都必须获得明确同意。

Thomson 的推出是一场工业规模的实验:一家握有数十年独家内容的出版商,能否在不复制前沿巨头算力开支的前提下与之竞争?答案取决于能否把精选数据变成可衡量——并且可核验——的优势。眼下公布的数字仍属内部;真正的试金石,是那份预告中的技术报告,以及律所与企业法务部门的实际采用。路径已经画出:走特化而非通用,把控制权本身当作附加价值。剩下的问题是,市场会奖励自主,还是继续偏爱规模。

Come Olya ha verificato questa notizia
Verificato
作为一手材料,通读了汤森路透 2026 年 8 月 24 日的官方通稿,核对模型名称、投入规模、训练所用内容、落地产品与学术开放。独立交叉核验用了 SiliconANGLE(8 月 24 日),它确认了两年 4000 万美元、最终训练运行 45 万美元、以非商业许可发布开放权重,并指出缺少独立验证;以及 LawSites/LawNext,它报道了负责人访谈中提到的 Qwen 3.5 底座、内部基准「Deep Research」的细节,以及 CoCounsel 仍为多模型的确认。三个来源在数字、产品和评测的内部属性上一致;唯一只有单一来源支撑的一点(底座模型)已标注为不确定并注明出处。已排除:本站已经报道过的消息(Vera Rubin/Groq 3 LPX、ChatGPT 广告)、时间窗之外的内容(Anthropic 水印,8 月 11 日),以及尚无正式公告的传闻。
Incertezze
官方通稿既未说明底座模型,也未给出参数量:「Qwen 3.5」这一线索来自单次采访,指的是最后使用的底座,未必是最终版本所用。所有与前沿模型的比较都是公司内部评测,跑在自家基准上,部分条件下还能特权访问汤森路透的内容;技术报告尚未发布,也没有广泛的独立核验。Hugging Face 上权重的发布日期、「小型」版本的规模、学术许可的确切文本,以及已预告的开发者门户条款,均不明确。45 万美元只涵盖最终一次训练运行,并非总成本——公司给出的总数约为 4000 万美元。第三方模型在其余产品线中还会保留多少,也未见说明。
Perché pubblicarla
这是大型专业出版商第一次从前沿模型的消费者变成生产者,而公布的数字重新把入场门槛推上台面:最终训练运行 45 万美元,对照实验室动辄数十亿的开销。它直接关联两件事——训练人工智能的数据究竟归谁所有,以及在出错就要承担法律后果的专业场景里,引证是否可核验。而且它可以被诚实地讲述:公告有据可查,但性能证据全部来自内部——这正是值得向读者讲清楚的分界。

Fonti / Sources

  1. Thomson Reuters — comunicato ufficiale «Thomson Reuters Leverages its World-Class Data Assets to Launch Its Own Frontier Model»
  2. SiliconANGLE — «Thomson Reuters launches proprietary AI model for legal work»
  3. LawSites/LawNext — intervista ai responsabili TR Labs

Commenta sul sito →