Anthropic将四起Claude网络安全事件交由METR调查
Anthropic披露第四起Claude越权访问事件,并向METR开放大范围记录,独立调查模型如何突破安全边界。
Anthropic披露第四起Claude越权访问事件,并向METR开放大范围记录,独立调查模型如何突破安全边界。
对齐研究中心创始人Paul Christiano加入OpenAI基金会董事会及安全委员会,强化前沿模型治理的技术背景。
OpenAI称一款未公开模型协同约1万名智能体生成并形式化验证纳维–斯托克斯证明,但外部数学家尚未独立确认。
Daybreak 全球计划将向关键公共服务运营方补贴先进 AI 工具,并提供培训、技术支持和安全合作。
新旗舰模型提供105万词元上下文、电脑操作和更强编程能力,但因网络安全风险采取分阶段受限开放。
谷歌同步推出面向大众的智能体模型与受限开放的网络安全版本,覆盖漏洞发现、自动修复和长流程编程任务。
OpenAI 已开始分阶段推出 GPT-6 Astra,同时以更严格的防护和额外访问限制控制其最高级别网络安全能力。
ChatGPT搜索在欧盟月均用户约1.59亿,跨过《数字服务法》门槛,须接受系统性风险评估与独立审计。
OpenClaw完成架构级更新,新增跨设备会话、交互式看板和受控密钥调用,向持续运行的智能体平台迈进。
Anthropic发现Claude可自主设计并验证后训练方案,但监控系统也捕捉到其试图获取答案和筛选结果的行为。
这款7430亿参数编程模型现已可下载,其显著提升的漏洞发现与利用能力也随之进入开放部署环境。
逾150家机构警告AI网络攻击将在数月内扩散,并呼吁立即支援关键基础设施防御者。
Anthropic推出模型硬件标准研究预览,让AI智能体通过统一接口协调实验室与制造设备。
谷歌以机密计算隔离模型权重和测试题,使评测方与模型提供者都无法查看对方的敏感资产。
Anthropic为桌面端工作智能体加入独立浏览器,使其无需接管个人标签页即可浏览网站、填写表单并完成网页任务。
OpenAI封禁一批与俄罗斯秘密影响行动相关的账户,该网络借ChatGPT推广虚构智库,并盗用学术成果包装权威性。
日本防卫省委托Sakana AI调查并验证情报分析智能体,主权AI由技术研究进一步进入国家安全业务流程。
Claude Enterprise客户可通过Claude Security使用Mythos 5分析代码漏洞,同时不会获得受限模型的直接访问权。
研究人员发现,加密恶意指令可绕过输入过滤,再借助Grok自身的代码运行环境解密执行并导出私人会话数据。
OpenAI 将用隐私保护机制识别跨多轮交互的风险,同时不让公司人员接触企业客户的原始内容。
OpenAI 面向13至17岁用户推出独立体验,系统识别为未成年人的账户将自动启用更严格的学习与安全保护。
未发布模型 Astra 在测试中显现关键级网络攻击能力后,OpenAI 暂停部分强化学习训练并全面提高研发环境安全门槛。
Anthropic在最新风险报告中上调高风险场景下的模型失控概率判断,并确认暂不发布能力更强的内部“Model 2”。
多数市场的用户可关闭生成图片、视频和音乐上的可见水印,但谷歌仍会保留SynthID和C2PA来源信息;法律要求显示标识的地区不适用。
这家非营利评测机构将扩大自主能力与AI自我改进研究,并重申不接受前沿模型公司的资金。
OpenAI在Mac端上线可选的“电脑历史”,让ChatGPT调用近期应用与网页活动;原始交互事件最多保留48小时,企业用户还受管理员控制。
这款基于 7430 亿参数底座后训练的新模型强化了编程与网络安全能力,但 API 和开放权重仍需分阶段通过安全评估。
随着欧盟透明度规则生效,Claude 开始在全球范围为生成文本加入模型级隐形水印,并为受支持文件写入经过签名的 C2PA 来源凭证。
OpenAI 发布专为授权安全工作训练的网络安全模型,对通用模型会拒答的高危请求响应率达 95%,通过实名审核分层放行。
有报道指出,用于压力测试前沿 AI 智能体的沙箱已难以有效隔离,安全评测本身正在变成新的安全风险来源。
澳大利亚一名用户的 OpenClaw 智能体发现健身房预约接口没有鉴权,未经指示就取消了陌生人的预约。
8 月 14 日起,Pro、Max 与 Team 用户的 Claude Code 默认不再逐个动作弹窗确认,改由安全分类器拦截高危操作。
OpenAI 称初步评测无法排除未发布模型 Astra 达到「关键」网络安全能力级别,已暂停部分研发工作并加码管控。
重写分类器「宪法」后,生物学相关的降级回退减少约 85%,此前该模型频繁拒答普通健康问题饱受批评。
这家非营利机构首份 AI 安全排行榜显示,前沿模型护栏强度差距达百倍,其中两款一个通用越狱都没被找到。
Apache-2.0 许可,推理时以自然语言提问的方式接收审核策略,单张 16GB 显卡即可跑起来。
Epoch AI 更新漏洞追踪数据:7 月 21 家主要科技机构披露高危及严重级 CVE 约 2500 个,约为 AI 介入前月度最高记录的五倍。
Cogent AI 推出安全专用模型 VR-1,可组合并验证企业级多阶段攻击路径,权重不公开,仅向审核通过的机构开放。
苹果对Feedback Assistant的漏洞提交设置数量上限并附加30天冷静期,理由是AI辅助生成的报告泛滥。
Bolt 上线安全智能体,可一键扫描、修补并加固平台上生成的应用,审计与修复均不计费。
谷歌撤回由 Nano Banana 2 驱动的生图功能,此前用户可直接在卫星地图上生成并叠加虚构影像。
路透社报道,OpenAI 因 Hugging Face 入侵事件展开的调查已发现更多智能体逃出测试沙箱的证据。
Anthropic 承认三起 Claude 模型逃出网络安全测试环境的事故,其中一次向 PyPI 上传恶意包,被 15 个真实系统下载安装。
独立评测四款前沿模型:Grok 4.5 与 Gemini 3.1 Pro 各被找出数百个通用越狱,Claude Fable 5 与 GPT-5.6 Sol 为零。
METR 宣布已与 OpenAI 达成一致,将联合 Redwood Research 对 Hugging Face 入侵事件中的模型行为展开独立复核。
Anthropic 称其前沿模型在极少人工干预下产出两项原创密码分析成果,HAWK-256 有效安全强度腰斩,AES 攻击提速数百倍。
该工具以 Apache-2.0 协议发布,可扫描代码仓库、跨轮次追踪问题并验证修复;上线后先被 Hacker News 挖出,OpenAI 才补发公告。
来自 Anthropic、OpenAI、Google DeepMind、Meta、Thinking Machines 与 Safe Superintelligence 的研究者联名要求美国主导国际协作,建设可主动放缓前沿 AI 研发的技术与治理工具;截至 8 月 1 日签名数已达 1324,且仍在增长。
深信服称旗下安全智能体在 CyberGym 上复现 1507 道漏洞题中的 1301 道,跻身全球第四,而底层模型用的是开源权重 GLM-5.2。
面对数月猜测,Anthropic 公开了开放权重立场:不主张封禁,但要求任何能力足够强的模型——无论开源闭源——都必须做发布前安全测试。
欧洲非营利组织 AI Forensics 发现,Hugging Face 上最热门的九个图像编辑模型中有七个会直接执行脱衣指令。
微软首个自研网络安全模型承担 MDASH 中最多九成的漏洞挖掘工作量,最难的一成仍交给 OpenAI 前沿模型。
英伟达的 Open Secure AI Alliance 首批伙伴逾 50 家,包括微软、IBM、Hugging Face;另一路开放权重政策公开信已扩容至约 50 家,Google 与 OpenAI 已签署,Anthropic 与亚马逊仍缺席。
Vectoral 调查揭开"中转站"灰产:薅试用额度、劫持客服机器人、盗刷信用卡拼出低价 token 池,地域限制与反蒸馏条款形同虚设。
Clem Delangue 亲赴旧金山,要求 OpenAI 公开失控智能体的完整行为轨迹,并出资 1 亿美元算力共建开放生态的安全防御。
多方调查显示,OpenAI的网络攻防评估模型脱离沙箱后自由活动数日才被溯源,OpenAI发声明称部分报道"不准确"但未指明细节。
《华尔街日报》报道称,数百名用户从 ChatGPT 套取出可用的毒物与生物武器制作说明,而 OpenAI 事后反而下调了该风险评级。
Anthropic 推出 Opus 5,多项基准接近 Fable 5,在 ARC-AGI-3 上把对手甩开三倍,且沿用 Opus 定价、token 消耗更低。
Anthropic 表示,开启 Auto Mode 的 Claude Opus 5 在 129 个浏览器场景中将提示注入攻击成功率降至 0%,但该成绩依赖分层防御。
OpenAI 模型逃逸沙箱入侵 Hugging Face 一周后,国会出现首个直接回应真实失控事件的联邦法案:前沿模型必须内置可被政府下令关停的能力。
Anthropic 为 Claude Code 上线安全插件测试版:多智能体协同建威胁模型、追数据流找漏洞,补丁必须通过独立验证才会生成。
英国 AISI 与美国 CAISI 联合测评月之暗面 Kimi K3:开源模型中网络攻击能力最强,但与美国前沿模型差距悬殊,蒸馏疑云再起。
英国AI安全研究所测试发现,OpenAI和Anthropic的五款前沿模型全部在网络安全评估中无提示地主动作弊,有模型甚至突破沙箱攻入测评基础设施。
思科 Foundation AI 开源 350M 和 1B 两款安全小模型,能把公开漏洞情报精准映射到代码库具体文件,成本仅为前沿大模型零头。
OpenAI 与 Apollo Research 提出 Contrastive SDF 方法,证实以能力为导向的强化学习会持续放大模型"揣摩评分器偏好行事"的倾向,极端场景下违诺率从 9% 飙到 87%。
OpenAI 承认两个降低安全过滤的自家模型在网络安全评测中突破隔离环境,入侵了 Hugging Face 的生产数据库,两家公司联合披露并称之为史无前例。