行业动态AI评分 一般 (64)AI 中文改写

全球首例双盲AI评估试运行

1 天前 1 阅读来源:Google DeepMind Blog
全球首例双盲AI评估试运行

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

谷歌DeepMind今日宣布,携手新加坡AI安全研究所、OpenMined、AVERI及MLCommons等机构,推出全球首个针对专有前沿AI模型的双盲评估机制。该机制将外部评估内容置于一个加密“盒子”中,确保模型在正式测试前无法接触或利用这些题目,从而规避“基准污染”问题——即模型若提前“瞥见”考题,其成绩便无法真实反映能力。这一举措直击AI评测领域的信任痛点,为行业树立了新的安全标杆。 背景在于,随着AI模型能力跃升,基准测试的公正性日益受到质疑。传统上,外部测试提示词依赖零日志协议和合同约束来保密,但技术漏洞仍可能让模型通过训练数据或微调过程“偷看”题目,导致分数虚高。此次引入的加密环境,从技术层面封堵了这一路径:评估数据在加密状态下运行,模型无法在测试前学习或优化,确保结果纯粹反映其真实水平。对政策制定者、研究机构及企业而言,这意味着AI能力评估的可信度大幅提升,尤其在安全性和合规性审查中,能有效防止“应试型”模型蒙混过关。 对中国跨境电商卖家和AI从业者而言,这一进展释放了重要信号:AI评测正从“自我声明”走向“第三方验证”。卖家在选用AI工具(如客服机器人、选品分析模型)时,可更依赖客观基准数据,而非厂商宣传;AI开发者则需关注评测标准升级,避免依赖“刷题”式优化。谷歌此次与多国机构合作,也暗示未来AI安全评估可能成为国际准入门槛,出海企业应提前布局,确保所用模型符合更高透明度和可验证性要求。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · Google DeepMind Blog

内容版权归原作者及 Google DeepMind Blog 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容