⚡ 猫叔的AI资讯雷达
安全研究政策

谷歌试行前沿模型“双盲”安全评测

谷歌以机密计算隔离模型权重和测试题,使评测方与模型提供者都无法查看对方的敏感资产。

把模型与试题同时锁进“黑箱”

Google DeepMind开始试行其所称首个面向闭源前沿模型的双盲外部评测。该方案借助机密计算环境运行测试:评测机构看不到Gemini模型权重,谷歌也无法读取保密测试题。

首轮试点由新加坡人工智能安全研究所、隐私技术组织OpenMined、评测机构AVERI和MLCommons参与。他们将在Google Cloud Confidential Space构建的受保护GPU环境中,用保密基准测试一款Gemini Flash Lite模型。密码学验证用于证明指定评测代码按约定执行,同时双方的敏感资料没有暴露给对方。

传统外部评测通常要求一方交出核心资产。评测机构若向模型公司提供秘密试题,题目可能进入研发或训练环节;模型公司若交出权重或内部系统,又会承担知识产权与安全风险。合同和零日志承诺可以降低风险,却无法从技术上独立证明信息从未被访问。

双盲方案仍不能消除所有基准偏差。题目设计、样本选择、评分方法及模型配置都会影响结果。首轮试点使用的也是Flash Lite,而非谷歌能力最强的模型。DeepMind尚未公布最终测试成绩,也没有承诺今后所有前沿模型都采用这一流程。

为什么重要

网络攻击、生物安全及国家安全相关测试往往不能公开,但闭源实验室也不会轻易向每家外部机构交付模型权重。若这种技术隔离方式被证明可靠,政府和独立评测方就能以真正未泄露的题目检查专有模型。未来若不同云平台和模型公司采用可互操作的实现,双盲执行环境有望成为监管与采购的公共基础设施,而不只是又一种评测方法。

信源