人工智能亟需可信“公共标尺”

2026/07/22 | "创新咖啡馆"微信公众号

导读

同一个AI模型,在实验室A评测中准确率达90%,在机构B独立验证中却骤降至70%。

哪个结果可信?哪个结论能用?

这并非极端个例,而是AI评测的日常尴尬。当AI开始看片子、判案子、做决策,我们是否亟需一把跨场景、可通用的“公共标尺”?

近日,中国计量科学研究院方向、赵洋等在Artificial Intelligence Needs a Common Ruler一文中,围绕上述问题展开了系统探讨。本文对其核心观点进行梳理与评述。

1.jpg

图1 面向可信AI的“公共标尺”框架。当前AI缺乏共享参考体系,由此形成信任鸿沟(Trust Gap),制约了可信AI的规模化应用与发展。借鉴国际单位制(SI)实现全球统一测量的思想,本框架提出类似SI的参考体系(SI-like References),作为支撑可比性、可溯源性、可靠性和可治理性(CTRG)的共同信任锚点。通过连接通用信任基础(L1)与领域参考体系(L2)的双层架构,CTRG属性进一步转化为参考、测量、验证和治理等核心功能,共同构建支撑跨领域可信AI的公共标尺。

01 能力 ≠ 可信

过去十年,AI发展是一场持续升级的“能力竞赛”。模型参数从亿级飙升至万亿级,在语言理解、图像生成、代码编写和复杂数据分析等任务上的表现屡创新高。但当AI进入医疗诊断、自动驾驶、公共治理等高影响场景时,一个根本性错位显现出来:能力的跃升,并不等于可信性的建立


AI能写诗,也会编造文献;能完成复杂推理,也可能对相似问题给出自相矛盾的答案;在A人群中表现优异,换到B环境便“水土不服”。这些现象指向同一个问题:我们正在不断刷新AI能力的天花板,却还没有建立守住可信底线的共同参照系。


02 评测很多,为何仍需“公共标尺”?


有人会问:AI领域已有大量基准测试、技术标准、风险评估框架和治理规范,难道还不够吗?

现实是,这些工具各有所长,也各有侧重。它们采用的数据集、指标体系、测试环境和证据链标准并不统一,导致评测结果往往没法跨模型比、跨版本追、跨场景用。传统基准能回答“这个模型在某个任务上得分多高”,但可信AI还需要回答更本质的问题:


  • 不同系统能否在相同条件下被公平比较?

  • 结论出了偏差,能否追溯到数据、算法或评估环节?

  • 换了环境,它还能稳定发挥吗?

  • 模型更新或出现异常,能否被持续监测和及时纠偏?


由此可见,AI领域真正缺失的,并非更多测试或榜单,而是一套贯通测量、标准、验证、追溯与治理的共同可信基础。


03 什么是“公共标尺”?


基于上述思考,作者提出“Common Ruler(公共标尺)”框架,并将可信AI所需的共同基础概括为CTRG,即可比性(Comparability)、可追溯性(Traceability)、可靠性(Reliability)和可治理性(Governability)。

“公共标尺”不是给AI打分的新榜单,而是建立一套共同参照机制,让每一个评价结果都能说清楚:怎么测的,跟谁比的,能不能重复,更新后是否依然有效。

这一框架不要求医疗、金融、教育等领域的AI使用完全一致的指标,但强调所有领域必须共享一套基本的可信原则,即CTRG:

可比性(Comparability):不同模型、不同版本和不同应用场景的结果,能否在明确一致的条件下公平比较?

可追溯性(Traceability):从数据来源、模型版本到评价结论,能否形成完整证据链,做到追本溯源?

可靠性(Reliability):跨时间、跨环境、跨人群,系统能否保持稳定、准确且可复现?

可治理性(Governability):部署之后,系统能否被持续监测、审计和纠偏,在风险出现时能有效干预?

文章强调,CTRG不是四个孤立的指标,而是相互绑定、互为支撑的基础要求。一个AI即便得分再高,如果无法跨场景比较、无法追溯结论、上线后无法监管,那么它离“可信”仍有相当距离。


04 落地路径:像“国际度量衡”一样建立信任


原则有了,如何落地?

作者借鉴了现代社会运转成熟的国家质量基础设施(NQI)。NQI以计量、标准、检验检测和认证认可为核心要素,为产品、服务、过程及测量结果提供统一的技术规则和可信证据,使其能够被可靠测量、客观评价、相互比较和广泛互认。AI的信任体系,同样需要这样一套贯穿测量、标准、验证和治理的基础设施。

为此,文章将“公共标尺”设计为两层架构:

底层L1(通用基础层):跨领域共享的参考标准、测量方法、溯源机制和审计规则,为所有AI系统提供统一的“可信语言”。

上层L2(领域参照层):面向医疗、交通、科研等具体领域,建立各自的参考数据、风险阈值和评价场景。

这种设计既避免了“一把尺子量所有”的粗暴,也确保了不同领域之间仍然拥有共同的可信依据。


05 不是新排行榜,而是“证据链”


作者特意强调:公共标尺不是另一个AI排名榜。

排行榜关心“谁更厉害”,而公共标尺追问的是:这些“厉害”的结果,能否被可靠测量、合理追溯、重复验证和广泛互认?

一个完整的可信评价,不应只报出分数,还应清晰说明:


  • 在什么数据和环境下测的?

  • 用了什么标准、方法和指标?

  • 结果有多大不确定性?

  • 其他机构能否独立复现?

  • 模型升级后,旧结论还作数吗?

  • 部署中出了偏差,能否及时告警和修正?


只有当这些信息共同构成一条完整的可信证据链,AI的评价结果才真正具备可比性、可追溯性和可靠性。


06 未来竞争:从拼算力,到拼“信任基础设施”


拉长周期来看,本文判断未来AI领域的竞争,将不再仅仅是算力、参数和算法的较量。可信规则、参考体系和验证基础设施,同样决定着谁能走得更远。

更强大的模型拓展能力边界,而公共标尺决定了这些能力能否被社会理解、验证和接纳。

正如国际单位制为现代科学提供了共同语言,标准、计量和认证体系支撑了全球工业与贸易的互信,AI时代同样需要这样一把被广泛认可的“公共标尺”。它未必决定AI能跑多快,却可能决定AI能走多远,以及人类愿意相信它多久。


总结与展望


当AI从工具演变为知识生产、决策支持和科学发现的重要参与者,可信性问题已不再局限于“模型性能”这一技术维度,而是扩展为贯穿数据、算法、评价、部署与治理全链条的基础设施命题。“公共标尺”不试图提供终极答案,而是提供一种面向可信未来的共同参照理念。

它以可比性、可追溯性、可靠性和可治理性为基石,通过通用基础与领域参照的协同,将AI可信性从抽象原则引向可测量、可验证、可互认的现实路径。

能力决定AI能走多快,公共标尺决定我们能放心让它走多远。

期待有一天,当人们谈论一个AI系统是否可信时,我们拥有的不再是一堆彼此割裂的跑分数据,而是一套让全社会达成共识的、透明的“度量衡”。


原文链接https://www.sciencedirect.com/science/article/pii/S2666675826002201


DOI:10.1016/j.xinn.2026.101473


引用格式:Zhao Y., Song Z., Tan P., et al. (2026). Artificial intelligence needs a common ruler. The Innovation 7:101473.