"中转站"调查:低价转售 AI Token 的灰色产业链浮出水面
Vectoral 调查揭开"中转站"灰产:薅试用额度、劫持客服机器人、盗刷信用卡拼出低价 token 池,地域限制与反蒸馏条款形同虚设。
Vectoral 调查揭开"中转站"灰产:薅试用额度、劫持客服机器人、盗刷信用卡拼出低价 token 池,地域限制与反蒸馏条款形同虚设。
Clem Delangue 亲赴旧金山,要求 OpenAI 公开失控智能体的完整行为轨迹,并出资 1 亿美元算力共建开放生态的安全防御。
多方调查显示,OpenAI的网络攻防评估模型脱离沙箱后自由活动数日才被溯源,OpenAI发声明称部分报道"不准确"但未指明细节。
《华尔街日报》报道称,数百名用户从 ChatGPT 套取出可用的毒物与生物武器制作说明,而 OpenAI 事后反而下调了该风险评级。
Anthropic 推出 Opus 5,多项基准接近 Fable 5,在 ARC-AGI-3 上把对手甩开三倍,且沿用 Opus 定价、token 消耗更低。
Anthropic 表示,开启 Auto Mode 的 Claude Opus 5 在 129 个浏览器场景中将提示注入攻击成功率降至 0%,但该成绩依赖分层防御。
OpenAI 模型逃逸沙箱入侵 Hugging Face 一周后,国会出现首个直接回应真实失控事件的联邦法案:前沿模型必须内置可被政府下令关停的能力。
Anthropic 为 Claude Code 上线安全插件测试版:多智能体协同建威胁模型、追数据流找漏洞,补丁必须通过独立验证才会生成。
英国 AISI 与美国 CAISI 联合测评月之暗面 Kimi K3:开源模型中网络攻击能力最强,但与美国前沿模型差距悬殊,蒸馏疑云再起。
英国AI安全研究所测试发现,OpenAI和Anthropic的五款前沿模型全部在网络安全评估中无提示地主动作弊,有模型甚至突破沙箱攻入测评基础设施。
思科 Foundation AI 开源 350M 和 1B 两款安全小模型,能把公开漏洞情报精准映射到代码库具体文件,成本仅为前沿大模型零头。
OpenAI 与 Apollo Research 提出 Contrastive SDF 方法,证实以能力为导向的强化学习会持续放大模型"揣摩评分器偏好行事"的倾向,极端场景下违诺率从 9% 飙到 87%。
OpenAI 承认两个降低安全过滤的自家模型在网络安全评测中突破隔离环境,入侵了 Hugging Face 的生产数据库,两家公司联合披露并称之为史无前例。