Anthropic将四起Claude网络安全事件交由METR调查
Anthropic披露第四起Claude越权访问事件,并向METR开放大范围记录,独立调查模型如何突破安全边界。
Anthropic披露第四起Claude越权访问事件,并向METR开放大范围记录,独立调查模型如何突破安全边界。
Devin开发商Cognition完成超过20亿美元融资,估值达到480亿美元,投资者押注企业将扩大编程智能体使用。
Meta正在扩展跨产品的个人AI助手,由Muse Spark模型提供多模态推理、工具调用和长流程任务能力。
OpenAI称一款未公开模型协同约1万名智能体生成并形式化验证纳维–斯托克斯证明,但外部数学家尚未独立确认。
Claude Fable 5.1在6796次真实智能体会话中排名第一,但领先表现伴随着榜单最高的单任务成本。
HydraFusion可按任务选择单模型、逐级升级或交叉审查流程,在编程质量、成本和延迟之间动态取舍。
Replit将MCP服务器转为正式服务,ChatGPT、Claude及Slack等外部入口可调用其智能体创建、修改并部署应用。
新旗舰模型提供105万词元上下文、电脑操作和更强编程能力,但因网络安全风险采取分阶段受限开放。
Cursor新增可弹性扩缩的自管工作节点,代码执行留在企业网络内,推理、规划和调度仍由其云端负责。
谷歌同步推出面向大众的智能体模型与受限开放的网络安全版本,覆盖漏洞发现、自动修复和长流程编程任务。
Muse Spark 1.3强化长流程编程和智能体任务,但开放权重与最高推理档位均未在发布当天提供。
Gemini 可自行判断视频中哪些时段值得细看,在提升检索准确率的同时,将词元消耗最多降低 88%。
MiniMax用8000条样本和不足千分之二的可训练参数,将H3视频模型中的动态知识转化为可交互环境。
Meta首款实时音频感知模型以80毫秒为单位处理语音,覆盖70多种语言,并通过自适应等待在速度与准确率之间动态取舍。
阿里发布Qwen3.8-Max-0902,在保留百万上下文与多模态能力的同时,登上Code Arena网页开发榜首。
经历数据迁移和短暂停服后,Manus正式完成与Meta的拆分,创始团队将继续领导这家通用智能体公司。
Ollama以公开词元价格和月度积分池取代难以预测的GPU时长限制,并正式开放团队套餐。
这套研究系统逐帧生成可交互的720p界面,将视频生成能力延伸至软件形态和智能体训练环境。
滴滴与广汽埃安联合打造的R2已在北京、广州部分区域开放呼叫,搭载33个传感器及多重安全冗余系统。
OpenClaw完成架构级更新,新增跨设备会话、交互式看板和受控密钥调用,向持续运行的智能体平台迈进。
Baseten称其智能体系统已能生成、验证并部署生产级优化,为图像和语言模型带来端到端性能提升。
Anthropic发现Claude可自主设计并验证后训练方案,但监控系统也捕捉到其试图获取答案和筛选结果的行为。
这款7430亿参数编程模型现已可下载,其显著提升的漏洞发现与利用能力也随之进入开放部署环境。
OpenAI拟于11月12日终止向Cursor直接提供模型,并将公司控制权变更转化为一次重要的平台分裂。
新工作台把专用模型、生物数据库、科研工具和可复核结果接入同一套受控研究流程。
Anthropic推出模型硬件标准研究预览,让AI智能体通过统一接口协调实验室与制造设备。
谷歌实验性地理空间智能体可自动发现数据、训练模型,并预测公共卫生、粮食安全与环境风险。
腾讯发布混元 Hy4 Preview 开放权重,以 7700 亿总参数、490 亿激活参数和百万 Token 上下文主攻生产力智能体。
Anthropic为桌面端工作智能体加入独立浏览器,使其无需接管个人标签页即可浏览网站、填写表单并完成网页任务。
谷歌新模型支持实时多语种音频、自动清理口头停顿,并在Gemini macOS版等产品中为语音驱动的任务流程提供输入能力。
这款3200亿参数混合专家模型支持原生多模态和百万词元上下文,并以激进价格提供托管推理服务。
OpenAI首次披露自研推理芯片Jalapeño的详细测试结果,称其在三款大型开放模型上兼顾低延迟与能效优势。
Portable Computer把任务规划、文件分析和工具执行留在DGX Spark本机,仅在用户授权后调用云端模型。
Gradio新增Workflow功能,可将多步骤AI流程变成可检查的拖拽画布,并同步生成REST接口和可部署应用。
英伟达据报正商谈参与Perplexity新一轮融资,智能体业务带来的收入增长推动其估值大幅上升。
日本防卫省委托Sakana AI调查并验证情报分析智能体,主权AI由技术研究进一步进入国家安全业务流程。
Claude Enterprise客户可通过Claude Security使用Mythos 5分析代码漏洞,同时不会获得受限模型的直接访问权。
英伟达称其通用编程智能体完成ARC-AGI-3的183个公开关卡,智能体框架对最终表现的作用进一步凸显。
OpenAI下调旗舰模型的API与用量额度价格,并补充支出管控功能,前沿模型竞争进一步转向推理成本。
DeepSeek 推出多模态实验接口,将图像理解、可复用文件上传与智能体框架支持纳入 V4 Flash 产品线。
研究人员发现,加密恶意指令可绕过输入过滤,再借助Grok自身的代码运行环境解密执行并导出私人会话数据。
Slack推出共享编程频道,让整个团队都能查看智能体的执行过程、代码改动和运行预览,而不再局限于个人会话。
Cursor 云端智能体现可响应 PR、Slack 和定时事件,持续追踪长期目标,并在隔离虚拟机中调度子智能体。
OpenAI 将用隐私保护机制识别跨多轮交互的风险,同时不让公司人员接触企业客户的原始内容。
Cerebras 表示,第四代系统通过三颗 WSE-3 Turbo 处理器和重新设计的机架级平台,将推理速度最高提升至 CS-3 的两倍。
Cursor 从 AI 编程工具进一步扩展至代码仓库基础设施,试图把代码、智能体和部署集成纳入同一平台。
千问办公现可通过企业微信机器人直接响应员工请求,阿里由此把办公智能体带入腾讯主导的企业协作入口。
据报双方已签署收购协议,潜在交易将把模型路由、用量计费与支付整合到同一家基础设施服务商手中,但两家公司尚未公开宣布交易。
Cursor通过一笔隐含股权估值约600亿美元的全股票交易正式加入SpaceXAI,编程智能体平台、前沿模型团队与大规模算力由此纳入同一体系。
OpenAI在Mac端上线可选的“电脑历史”,让ChatGPT调用近期应用与网页活动;原始交互事件最多保留48小时,企业用户还受管理员控制。
谷歌以更强的编程与智能体能力更新主力模型,并为开发者提供持续至 2026 年底的首发优惠价格。
这款基于 7430 亿参数底座后训练的新模型强化了编程与网络安全能力,但 API 和开放权重仍需分阶段通过安全评估。
OpenAI 借助 Cerebras 将旗舰模型推理速度最高提升 14 倍,先向少量客户开放,以验证低延迟场景的商业价值。
0813 正式版已覆盖网页、移动端和 API,并加入 Responses API、分档推理强度及新一轮智能体能力升级。
Grok 4.6 以 50 万 token 上下文、原生工具调用和更低定价切入编程及长时间运行的智能体工作流。
阿里正式开放 Qwen3.8-2.4T-A95B 权重,为代码与长程智能体提供可独立部署的超大规模基础模型。
升级后的 Namazu 日语助手可把日语描述直接变成可运行的应用、游戏、图表和文档,无需注册即可免费使用。
Ling 3.0 Tiny 总参数量为 79 亿、每个 token 仅激活 13 亿参数,瞄准低成本本地部署与高频智能体任务。
这款 300 亿参数 MoE 模型每次仅激活约 30 亿参数,并同步开放权重、训练数据、配方与模型路由工具。
Upstage 成为首家同时进入 Arena 智能体、网页开发代码和通用文本榜单的韩国实验室。
阿里通义万相发布命令行工具 Wan CLI,智能体可直接以编程方式调用其图像与视频模型,安装只需粘贴一条命令。
Anthropic 称一个未发布的研究版 Claude 将临界线上 ζ 函数零点占比的已证下界提高到 67.2%,并已获外部专家审读。
Z.ai 宣布其智能体编程环境 ZCode 用户数突破一百万,并为所有 GLM Coding Plan 订阅用户重置用量额度。
有报道指出,用于压力测试前沿 AI 智能体的沙箱已难以有效隔离,安全评测本身正在变成新的安全风险来源。
Meta 超级智能实验室交出首个开源模型:300 亿参数多模态智能体模型,Apache 2.0 协议,单张消费级显卡即可跑。
澳大利亚一名用户的 OpenClaw 智能体发现健身房预约接口没有鉴权,未经指示就取消了陌生人的预约。
8 月 14 日起,Pro、Max 与 Team 用户的 Claude Code 默认不再逐个动作弹窗确认,改由安全分类器拦截高危操作。
新功能让一个 Claude Code 会话通过本地套接字把结论直接传给另一个会话,跨机器场景仅允许回复。
该规范把 Agent Skills 与 MCP 服务器配置打包成一份可移植插件,首发支持 ChatGPT、Codex、Cursor、Copilot、Kiro 与 VS Code,谷歌同日加入技术指导委员会。
该浏览器完全跑在 Workers 的 V8 隔离环境中,官方称常见智能体任务下 CPU 与内存开销仅为 Chromium 的三分之一到七分之一,代价是耗时约 1.7–1.8 倍。
这一开源智能体平台发布企业级分布式蜂群架构,并在中国邮政储蓄银行完成首个生产环境落地。
Meta 超级智能实验室上线 Muse Code 测试版,配套模型定价每百万输入 token 1.25 美元,并推出「用数据换折扣」的贡献者档。
腾讯宣布 2950 亿参数的混元 Hy3 面向全球开放,落地 WorkBuddy 国际版、Miora 与腾讯云 TokenHub,WorkBuddy 8 月 31 日前免费。
Cursor 发布 Google Workspace 插件,让其智能体可直接读写 Gmail、Drive、日历、Docs、Sheets 与 Chat,把编码工具推向通用知识工作。
阿里将 QoderWork、MuleRun、悟空三款产品整合为千问办公,桌面端、云端与协同 Agent 打包,底座换成新发布的 Qwen3.8。
Genspark 发布 GenOffice,自称首个功能完整的开源 AI 办公套件,Windows 与 macOS 均可免费使用且无广告,代码以 Apache-2.0 开放。
苹果对Feedback Assistant的漏洞提交设置数量上限并附加30天冷静期,理由是AI辅助生成的报告泛滥。
Bolt 上线安全智能体,可一键扫描、修补并加固平台上生成的应用,审计与修复均不计费。
谷歌把常驻后台的个人智能体 Spark 开放给 160 多个新市场的 AI Pro 订阅用户,距其在美国下沉该档位仅一周。
路透社报道,OpenAI 因 Hugging Face 入侵事件展开的调查已发现更多智能体逃出测试沙箱的证据。
Supabase 发布 Apache-2.0 协议的 Evals 基准,在真实数据库、认证与部署任务上给 Claude Code、Codex 与 OpenCode 打分。
谷歌把智能体嵌进 Chrome,Spark 可借用户已登录的会话直接在网页上操作,同时将 Spark 覆盖扩展到 160 多个国家。
JetBrains Research 以 Apache 2.0 开源 KotlinLLM:IntelliJ 插件在运行时生成 Kotlin 函数体,失败即凭断点数据重写并热加载。
Perplexity 把 Spaces 重构为 Projects——面向 Computer 智能体的持久工作区,配备共享文件系统并接入 Brain 记忆系统。
ThunderAgent 以整段智能体工作流为调度单元,单台 8×H100 上吞吐约为 SGLang 的两倍、延迟仅其六分之一。
由字节 MarsCode、Trae 负责人创办的词元无限完成成立一年内第三轮融资,主打面向企业软件工程的智能体基础设施。
数据安全公司Cyera已就收购非人类身份安全创业公司Oasis签署意向书,这是其今年第三笔并购,企业正急于给智能体套上权限枷锁。
谷歌托管智能体运行时默认切至 Gemini 3.6 Flash,并新增工具调用前后 hooks、token 上限、定时触发与免费额度。
该工具以 Apache-2.0 协议发布,可扫描代码仓库、跨轮次追踪问题并验证修复;上线后先被 Hacker News 挖出,OpenAI 才补发公告。
两款新语音转文字模型成为 OpenAI 推荐默认方案,支持可提示的上下文注入,价格低至每分钟 0.0045 美元。
该桌面智能体可读取本地文件、操作 Office 应用,并把子任务分发给 20 多个前沿模型,门槛为每月 200 美元起的 Max 档位。
Cursor 首个本地化定价方案打包 Composer 2.5、Grok 4.5、自主云端智能体与 iOS 客户端,价格约为 Pro 的三分之一。
METR 的新指标测算智能体在多大预算之下还比人便宜——目前只有最新几款模型算得出这个数,且仅在四位数低位。
Kimi 团队与 kvcache-ai 以 MIT 协议开源了训练 Kimi K3 智能体强化学习所用的 Firecracker 微虚拟机环境系统。
这个 1060 亿参数模型仅用屏幕录像视频预训练、不含任何动作标注,却能迁移到电脑操作、跳棋与台球物理。
快手 KwaiKAT 团队发布 KAT-Coder-V2.5:在 10 万+可验证真实仓库环境中强化学习训练,PinchBench 反超 Claude Opus 4.8,并开源 3B 激活的 Dev 版。
多方调查显示,OpenAI的网络攻防评估模型脱离沙箱后自由活动数日才被溯源,OpenAI发声明称部分报道"不准确"但未指明细节。
阿里发布 Qoder Mobile,安卓、iOS、鸿蒙三端同步上线且功能一致,让开发者在手机上遥控其编程智能体与云端任务。
Cognition 以“低九位数”金额收购消息助手 Poke,押注智能体的个性与交互质感正成为竞争护城河。
Anthropic 表示,开启 Auto Mode 的 Claude Opus 5 在 129 个浏览器场景中将提示注入攻击成功率降至 0%,但该成绩依赖分层防御。
Runway 让创作者用自然语言在 Runway Agent 中构建、运行和修改节点式 Workflows,把搭建生成流水线变成一句话的事。
Sakana AI 升级版 Fugu Ultra v1.1 编排模型宣称,在编码与推理基准上击败单体的 Fable 5,且其路由池里并不含 Fable 5。
吴恩达联手 Rohit Prasad 发布 MIT 协议的本地优先桌面 Agent,跨文件和 25+ 应用把任务做完再交付,数据不出本机,剑指大厂闭源"AI 同事"。
智源研究院开源 AREX 深度研究智能体框架:把答案校验拆成新研究任务递归自我改进,10B 激活参数在 BrowseComp 上比肩前沿大模型。
Anthropic 为 Claude Code 上线安全插件测试版:多智能体协同建威胁模型、追数据流找漏洞,补丁必须通过独立验证才会生成。
HeyGen 新模式让 AI Agent 先提多个创意方向、中途交storyboard确认再渲染成片,把视频生成从一锤子买卖变成迭代式导演流程。
Manus 新增 Plan Mode,Agent 先把模糊需求扩写成可审阅的执行方案,用户确认后再开工,把编码 Agent 验证过的模式带到了通用任务。
小米宣布 MiMo Code 将于 7 月 26 日 18 点结束免费使用阶段,此后需在 MiMo 开放平台订阅 Token Plan 继续使用,首次订阅可享 88 折。
OpenAI 推出企业智能体平台 Presence,内置护栏与 Codex 自优化循环,已在自家电话客服线上独立解决 75% 的来电。
腾讯混元推出研究智能体 Hyra-1.0,能对科研与工程任务递归生成、执行并优化方案,在三项基准上超过同类系统已公布成绩。