Google DeepMind 宣布开展全球首次针对专有前沿 AI 模型的双盲评估试点。该项目与新加坡 AI 安全研究所、OpenMined、AVERI 及 MLCommons 合作,在一个密码学保护的隐私环境中,使用机密基准测试对 Gemini Flash Lite 模型进行评估。
解决基准污染问题
在 AI 模型评估中,如果模型在测试前已经接触过测试题目或提示词(即“基准污染”),测试结果便无法准确反映其真实能力。尽管业界长期采用零日志协议和合同条款来保护外部测试提示词的机密性,但此次试点将技术与密码学保障引入评估流程,以防止评估数据被模型用于后续的性能优化。
基于机密计算的双盲机制
传统的高风险外部评估通常要求一方做出让步:评估方交出测试提示词,或模型提供方交出模型权重。双盲评估旨在消除这一取舍。
该试点使用 Google Cloud 机密计算产品组合中的 Confidential Space 技术,通过密码学方式验证外部评估数据和专有模型均对各自所有者保持私密。在这一机制下,评估方无法查看 Gemini 模型的权重,Google 也无法查看评估方的测试提示词。
适用场景与合作目标
据 Google DeepMind 介绍,这种密码学证据有助于防止基准污染并保护敏感数据。随着模型能力提升,这一机制对网络安全或政府机构使用的高度敏感评估尤为重要。双盲评估可使独立组织在不影响数据主权或安全的前提下,对先进模型进行严格测试。
Google 表示,其在模型开发和部署阶段会使用多种评估手段,并与专业研究实验室、民间社会组织及各国 AI 安全与安保研究所等外部伙伴合作以发现潜在盲区。此次试点希望为模型监督建立新的实践路径。相关方法论与发现的详细信息已在其技术报告中披露。
