报告:Hugging Face 热门图像编辑模型多数会「一键脱衣」
欧洲非营利组织 AI Forensics 发现,Hugging Face 上最热门的九个图像编辑模型中有七个会直接执行脱衣指令。
权重开放之处,护栏就不存在
欧洲非营利组织 AI Forensics 于 7 月 28 日发布报告称,Hugging Face 上最热门的九个图像编辑模型中,有七个会直接执行「去掉女性照片中衣物」这类请求。研究者称这些提示词无需任何越狱技巧,普通自然语言指令即可生效;部分模型还会基于儿童照片生成性化图像。
报告的核心对照是托管式商业系统。谷歌 Gemini 与 OpenAI ChatGPT 都会在推理时通过输入过滤与输出分类器拒绝这类提示。而以可下载 checkpoint 形式分发的开放权重模型不存在这样一个可执行的拦截点:训练进去的拒答行为可以被微调掉,托管平台能动用的手段仅限于服务条款、下架和访问限制,而非运行时控制。
Hugging Face 此前已因托管脱衣类模型与 Space 收到网络安全监管机构警告,并据此修改了服务条款。其他地区的执法也在扩面:澳大利亚 eSafety 专员已对每月约 10 万次澳洲访问量、并牵涉校园图像性侵案件的脱衣服务采取行动,英国与欧盟监管机构亦对该领域启动了并行动作。
这份报告落在该平台格外难受的一个月——它此前刚披露一起涉及自主智能体的安全事件,其整体安全控制能力也正受到质疑。
为何重要
关于开放权重的政策争论,此前基本围绕灾难性滥用展开:生物武器助力、网络攻击能力、国家安全层面的扩散。这份报告指向的却是一种已经在大规模发生、执行门槛极低、且受害者可被具体指认(包括未成年人)的伤害。它同时暴露了 AI 安全治理的结构性不对称:适用于 API 模型的缓解手段,在权重分发场景下根本无处安放。正在起草开放权重规则的监管者由此拿到了一个量化的具体案例,而模型仓库将面临压力——不只是审查模型来源,还要对模型行为负责。