Cognition发布SWE-2,主打更低成本编码智能体
Cognition发布SWE-2编码模型,称其接近前沿模型表现,同时显著减少任务步骤并降低软件开发成本。
Cognition发布SWE-2编码模型,称其接近前沿模型表现,同时显著减少任务步骤并降低软件开发成本。
DeepSeek推出V4.1 Flash,支持原生多模态和百万Token上下文,并通过缓存优化大幅降低长上下文推理成本。
腾讯混元联合上海交大等机构发布开源基础模型AuK,尝试用自然语言统一生成和编辑语音与其他音频。
Google DeepMind推出AlphaGenome Atlas,为人类基因组约90亿种单字母变异提供分子影响预测,并向学术研究人员开放。
OpenAI将Images 2.5推向ChatGPT和API,重点提升参考图一致性、多轮编辑稳定性与生成速度。
OpenAI称一款未公开模型协同约1万名智能体生成并形式化验证纳维–斯托克斯证明,但外部数学家尚未独立确认。
HiDream-O1-Embodied统一表征图像、视频、三维与动作信息,瞄准复杂环境下更稳定的机器人感知和执行。
Claude Fable 5.1在6796次真实智能体会话中排名第一,但领先表现伴随着榜单最高的单任务成本。
DeepSeek据报计划在内蒙古部署至少16万颗华为昇腾芯片,检验国产算力能否支撑前沿模型的大规模推理。
谷歌把Lyria 3.5从早期Flow Music入口扩展至全球Gemini用户、AI Studio和API,显著扩大音乐生成覆盖面。
微软以完整版争夺图像编辑质量榜首,并用Flash版本降低生成成本,强化Foundry的企业图像生产能力。
Threadripper Halo Station原型机采用96核Threadripper PRO处理器、四块Instinct加速卡和最高约2.6TB综合内存,计划于2027年推出。
新旗舰模型提供105万词元上下文、电脑操作和更强编程能力,但因网络安全风险采取分阶段受限开放。
谷歌同步推出面向大众的智能体模型与受限开放的网络安全版本,覆盖漏洞发现、自动修复和长流程编程任务。
Muse Spark 1.3强化长流程编程和智能体任务,但开放权重与最高推理档位均未在发布当天提供。
Perplexity 已公开这款 Rust 与 Metal 专用引擎的源代码、测试和复现材料,并称其在 M5 Max 上运行 Qwen3.6-35B-A3B 的速度最高为 MLX-LM 的1.35倍。
Gemini 可自行判断视频中哪些时段值得细看,在提升检索准确率的同时,将词元消耗最多降低 88%。
Meta首款实时音频感知模型以80毫秒为单位处理语音,覆盖70多种语言,并通过自适应等待在速度与准确率之间动态取舍。
OpenAI 已开始分阶段推出 GPT-6 Astra,同时以更严格的防护和额外访问限制控制其最高级别网络安全能力。
阿里发布Qwen3.8-Max-0902,在保留百万上下文与多模态能力的同时,登上Code Arena网页开发榜首。
Atlas 用统一架构完成生成、三维重建与模拟,目标覆盖影视制作、机器人训练和虚拟世界开发。
这款3.3亿参数模型无需针对任务微调,即可联合预测关联序列并利用促销、天气等外部变量。
开放权重的GigaPath-Flash与GigaTIME-Flash大幅降低算力和显存需求,同时保持研究基准表现。
这款7430亿参数编程模型现已可下载,其显著提升的漏洞发现与利用能力也随之进入开放部署环境。
OpenAI拟于11月12日终止向Cursor直接提供模型,并将公司控制权变更转化为一次重要的平台分裂。
谷歌新一代视频模型支持最长40秒场景延展、首尾帧控制、低成本草稿及4K输出。
Midjourney 首款 V8.2 图像编辑模型开始扩大测试,支持文字指令修改、四图参考、局部重绘与画布扩展。
腾讯发布混元 Hy4 Preview 开放权重,以 7700 亿总参数、490 亿激活参数和百万 Token 上下文主攻生产力智能体。
谷歌新模型支持实时多语种音频、自动清理口头停顿,并在Gemini macOS版等产品中为语音驱动的任务流程提供输入能力。
这款3200亿参数混合专家模型支持原生多模态和百万词元上下文,并以激进价格提供托管推理服务。
阿里巴巴开源1250亿参数多模态模型,每个词元仅激活60亿参数,并首次展示Qwen4的核心架构方向。
新功能无需单独训练,即可从一至十张参考图提取可复用视觉风格,并生成位图或可编辑SVG素材。
面壁智能称MiniCPM开源模型全球累计下载量突破5000万,并将高效端侧智能确定为下一阶段的核心方向。
这家信息服务集团开始直接掌控面向法律、税务和监管工作的专业模型,减少对外部大模型供应商的依赖。
橡鹿机器人推出烹饪多模态基础模型及两款机器人,可观察锅内食材变化并实时调整火力、时间和调料投放。
OpenAI下调旗舰模型的API与用量额度价格,并补充支出管控功能,前沿模型竞争进一步转向推理成本。
DeepSeek 推出多模态实验接口,将图像理解、可复用文件上传与智能体框架支持纳入 V4 Flash 产品线。
Anthropic 将 Mythos Preview 和 Claude Opus 4.8 设计的蛋白结合物送入实验室验证,并公开技术报告、提示词与实验数据。
未发布模型 Astra 在测试中显现关键级网络攻击能力后,OpenAI 暂停部分强化学习训练并全面提高研发环境安全门槛。
Tripo 推出可生成原生四边面拓扑的 P2.0 预览版,最高支持2.5万四边面,重点服务角色与实时游戏资产。
千问下载量跨过30亿次,显示全球开放权重模型的开发者生态正加速向中国模型倾斜。
Anthropic在最新风险报告中上调高风险场景下的模型失控概率判断,并确认暂不发布能力更强的内部“Model 2”。
苹果据报已不再满足于直接接入通义千问,而是训练面向中国市场的专用模型,以争取更完整的平台控制权。
谷歌以更强的编程与智能体能力更新主力模型,并为开发者提供持续至 2026 年底的首发优惠价格。
这款基于 7430 亿参数底座后训练的新模型强化了编程与网络安全能力,但 API 和开放权重仍需分阶段通过安全评估。
OpenAI 借助 Cerebras 将旗舰模型推理速度最高提升 14 倍,先向少量客户开放,以验证低延迟场景的商业价值。
North Micro Vision 以 24 亿参数承载文档和视觉理解能力,开放权重并采用 Apache 2.0 许可证。
0813 正式版已覆盖网页、移动端和 API,并加入 Responses API、分档推理强度及新一轮智能体能力升级。
Dyna Robotics 发布世界—动作模型 Dyna-2,以百万小时人类视频预训练,尝试缓解机器人真实轨迹稀缺问题。
DeepMind 的 SL2T 模型进入 Gboard 与实时转写,让 Pixel 11 用户可直接用美式手语输入英文。
Grok 4.6 以 50 万 token 上下文、原生工具调用和更低定价切入编程及长时间运行的智能体工作流。
阿里正式开放 Qwen3.8-2.4T-A95B 权重,为代码与长程智能体提供可独立部署的超大规模基础模型。
Ling 3.0 Tiny 总参数量为 79 亿、每个 token 仅激活 13 亿参数,瞄准低成本本地部署与高频智能体任务。
新一代开放权重视频世界模型引入动态渲染机制,并支持原生 4K HDR、音画同步和更强的多镜头控制。
Mistral 将从智谱 GLM-5.2 开始托管第三方开放模型,同时推出欧美区域推理节点和欧洲优先算力。
这款 300 亿参数 MoE 模型每次仅激活约 30 亿参数,并同步开放权重、训练数据、配方与模型路由工具。
Upstage 成为首家同时进入 Arena 智能体、网页开发代码和通用文本榜单的韩国实验室。
Anthropic 取消 Claude Sonnet 5 优惠价的截止日期,每百万输入 2 美元、输出 10 美元的定价在 8 月 31 日后继续沿用。
微软 AI 新版图像模型以 1336 分空降 Arena 文生图榜第二,上一代 2.5 仅排第十,与榜首 GPT Image 2 相差 45 分。
Arena 首次给出人类偏好评分:Meta 新开源模型 Muse Glimmer 在 Code Arena WebDev 位列第 77、文本竞技场第 97,开源模型中分别排第 26 和第 24。
OpenAI 发布专为授权安全工作训练的网络安全模型,对通用模型会拒答的高危请求响应率达 95%,通过实名审核分层放行。
Meta 超级智能实验室交出首个开源模型:300 亿参数多模态智能体模型,Apache 2.0 协议,单张消费级显卡即可跑。
新功能让一个 Claude Code 会话通过本地套接字把结论直接传给另一个会话,跨机器场景仅允许回复。
SpaceXAI 最新图像模型首次上榜即在文生图与图像编辑两个榜单位列第二;至 8 月 11 日,它在文生图榜已被微软 MAI-Image-2.6 挤到第三,图像编辑榜仍保持第二。
第三方评测 Artificial Analysis 给蚂蚁 124B 开源模型打出 38 分,其约 5B 的激活参数量领先所有同档 flash 级模型。
OpenAI 称初步评测无法排除未发布模型 Astra 达到「关键」网络安全能力级别,已暂停部分研发工作并加码管控。
基于自研 Qwen-Audio 模型,把录音成稿、语音智能体与有声内容创作合为一体,四端上线并限时免费。
这家多伦多初创公司在权重冻结后定制芯片金属层,宣称推理系统可完全不用 HBM、先进封装、3D 堆叠与液冷。
重写分类器「宪法」后,生物学相关的降级回退减少约 85%,此前该模型频繁拒答普通健康问题饱受批评。
付费用户全面切换到升级版 GPT-5.6 Sol 并获得五档推理滑杆,免费与 Go 用户则默认改用更小的 Luna,换来文字对话不限量。
字节跳动正式开放这款 30 秒视频模型的公开 API:Luma 提前一天上线、Runway 当日跟上,Krea、Lovart、Pika 等平台宣布接入但仍在陆续推进。
Anthropic 放出「定制芯片团队」招聘岗位,称计划让硬件与模型协同设计,使 Claude 跑得更快、更省。
这家把全球推理价格拉到地板的中国实验室通知开发者,将整体上调 API 定价,但未给出具体幅度与生效时间。
谷歌已向用户发送邮件通知:Assistant 将于 9 月 4 日在手机、平板、Wear OS 手表、耳机与 Android Auto 上停止工作。
Meta 超级智能实验室上线 Muse Code 测试版,配套模型定价每百万输入 token 1.25 美元,并推出「用数据换折扣」的贡献者档。
Artificial Analysis 放出阿里 2.4 万亿参数旗舰的完整测评:综合排名前五、智能体能力第一,但 token 消耗与单任务成本同步飙升。
Black Forest Labs 的 20 秒原生带音轨视频模型 8 月 4 日在 Runway、Krea、Replicate 同步开放,结束限量灰度期。
京东开源 JoyAI-Video-Edit,160 亿参数、Apache 2.0 协议,单张 NVIDIA B200 上以约 30 FPS 完成 720P 视频实时编辑。
Apache-2.0 许可,推理时以自然语言提问的方式接收审核策略,单张 16GB 显卡即可跑起来。
国内视频大模型公司 Sand.ai 放出 MAGI-2-preview 权重与推理代码,1140 亿参数稀疏架构、Apache 2.0 协议,可生成带同步音轨的 1080P 视频。
腾讯宣布 2950 亿参数的混元 Hy3 面向全球开放,落地 WorkBuddy 国际版、Miora 与腾讯云 TokenHub,WorkBuddy 8 月 31 日前免费。
Video Arena 榜单显示,MiniMax-H3 在文生视频与图生视频两个分区均位列开源模型第一,领先次名开源模型约 280 分。权重现已公开,但许可协议目前限制美、欧、英、韩地区的开源权重使用。
腾讯混元新一代语音识别模型上线,普通话、英语、粤语词错率均约 3%,已在腾讯云开放 API,元宝端免费可用。
万相发布 Real-time 实时功能套件,首个能力 Camera-to-Image 可把手机摄像头实时画面即时转成风格化图像,首发主打二次元。
Cogent AI 推出安全专用模型 VR-1,可组合并验证企业级多阶段攻击路径,权重不公开,仅向审核通过的机构开放。
MiniMax 正式开放全模态视频模型 H3 的权重下载,让一款榜单前列的视频生成模型首次可以在本地部署运行。
阿里新旗舰 Qwen3.8-Max 为 2.4 万亿参数 MoE 模型,主打长周期智能体任务,官方称下周开放权重。
东京实验室 Sakana AI 基于月之暗面开源的 Kimi K2.6 微调出日语特化模型 Namazu,正式开放商用 API。
Epoch AI 将 FrontierMath 开放问题集扩充到 50 道真实未解研究题,并新记录两项由 AI 取得的解答,均属中间的「中等有趣」档位;同一次更新中另有三道题被移除。
谷歌把常驻后台的个人智能体 Spark 开放给 160 多个新市场的 AI Pro 订阅用户,距其在美国下沉该档位仅一周。
OpenAI 公布下一代主力模型家族 Astra,同时放出十项长期未解的数学与理论计算机科学难题解法,全部附带 Lean 形式化证明。
DeepSeek 于 7 月 31 日开放重新后训练的 V4-Flash 正式 API 公测,第三方测评智能指数升至 50 分,价格维持 0.14/0.28 美元不变。
谷歌 DeepMind 发布三款具身智能模型,用单一策略统一控制腿、躯干、双臂与手指,并支持多台机器人协同完成同一任务。
P-Image-Ideogram 提供四档质量模式、原生 1K 与 2K 输出、3 至 8 秒出图,直接瞄准规模化生产的图像流水线。
OpenAI 大幅下调 GPT-5.6 系列 API 价格,Luna 输入价降至每百万 token 0.2 美元,并为 Sol 新增付费高速模式。
字节跳动 Seedance 2.5 于 7 月 31 日结束企业内测,在国内即梦与海外 Dreamina 同步开放,单次可生成 30 秒视频。
旗舰 975B 模型发布仅两周,Thinking Machines 又开源 Apache 2.0 授权的 276B 小版本,激活参数 12B,支持文本、图像与音频推理。
阿里万相团队在 wan.video 上线 Realtime 模式,用户持续输入描述时画面即时随之变化,进一步押注实时交互式生成。
OpenAI 表示,上线后它让 GPT-5.6 Sol 反过来优化自家推理栈,模型自主重写生产 kernel,端到端服务成本下降 20%。
Ideogram 发布专用对象擦除模型,连阴影与反射一并清除,官方称在 RemovalBench 上优于 Nano Banana 2、FLUX Erase 与 GPT Image-2。
谷歌在 Flow Music 推出 Lyria 3.5,新增选段重绘功能,可只重做曲目中的一段,或把一小段构思扩写成完整歌曲。
OpenAI 称 GPT-5.6 Sol 改用自家 Responses API、开启保留推理与上下文压缩后,ARC-AGI-3 公开题集成绩从 7.8% 升至 38.3%;该数字与官方榜单成绩并不可直接比较。
据 Business Insider,亚马逊已停止 Nova Premier、Omni、Reel 与 Canvas 的研发,资源转向 Pieter Abbeel 领衔的研究组。
Anthropic 称其前沿模型在极少人工干预下产出两项原创密码分析成果,HAWK-256 有效安全强度腰斩,AES 攻击提速数百倍。
谷歌托管智能体运行时默认切至 Gemini 3.6 Flash,并新增工具调用前后 hooks、token 上限、定时触发与免费额度。
LFM2.5-Encoder-230M 与 350M 把 BERT 级模型的上下文推到 8192 token,满长度下 CPU 推理速度约为 ModernBERT-base 的 3.7 倍。
两款新语音转文字模型成为 OpenAI 推荐默认方案,支持可提示的上下文注入,价格低至每分钟 0.0045 美元。
阿里云称真武 M890 超节点是国内首个成功运行月之暗面 2.8 万亿参数模型的超节点,华为昇腾同日宣布零日适配。
月之暗面在 7 月 27 日 0 点(UTC)如约放出 Kimi K3 全部 2.8 万亿参数权重,采用 Kimi K3 License 许可证,成为迄今最大的开源权重模型。
微软首个自研网络安全模型承担 MDASH 中最多九成的漏洞挖掘工作量,最难的一成仍交给 OpenAI 前沿模型。
Kimi 团队发布新基准,把推理从多模态评测中剥离,只考一件事:模型到底有没有把图看对。
快手 KwaiKAT 团队发布 KAT-Coder-V2.5:在 10 万+可验证真实仓库环境中强化学习训练,PinchBench 反超 Claude Opus 4.8,并开源 3B 激活的 Dev 版。
ARC Prize 公布 Claude Opus 5 在 ARC-AGI-3 上拿下 30.2%,约为 GPT-5.6 Sol 的四倍,第三方评测再次改写前沿模型座次。
Anthropic 推出 Opus 5,多项基准接近 Fable 5,在 ARC-AGI-3 上把对手甩开三倍,且沿用 Opus 定价、token 消耗更低。
Midjourney 让 V8.2 结束预览、升为默认模型,这次以美学与个性化为重心,强化画质与风格参考表现。
Anthropic 表示,开启 Auto Mode 的 Claude Opus 5 在 129 个浏览器场景中将提示注入攻击成功率降至 0%,但该成绩依赖分层防御。
Sakana AI 升级版 Fugu Ultra v1.1 编排模型宣称,在编码与推理基准上击败单体的 Fable 5,且其路由池里并不含 Fable 5。
DeepSeek V4 系列今日转正:deepseek-chat 与 reasoner 旧接口停止服务强制迁移,国内大模型首个 API 峰谷计费同步落地。
FLUX 图像模型背后的德国实验室发布多模态旗舰 FLUX 3,单次生成 20 秒带原生音频的视频,并预告年内开源多模态底座。
阿里云宣布基于平头哥自研芯片的真武 M890 超节点在百炼平台承接旗舰模型 Qwen3.8 的生产推理,称推理成本直降四成——国产超节点首次伺服 2 万亿参数级模型。
Cursor推出请求级模型路由Router,为每个编码任务自动匹配最合适的模型,早期企业客户实测成本降低30%-50%且质量不打折。
英国 AISI 与美国 CAISI 联合测评月之暗面 Kimi K3:开源模型中网络攻击能力最强,但与美国前沿模型差距悬殊,蒸馏疑云再起。
阿里通义本周连发 Qwen-Image-3.0 与 Qwen-Audio-3.0-TTS:前者单次生成整版信息图、连 10 像素小字都清晰可读,后者登顶 Artificial Analysis 语音榜。
思科 Foundation AI 开源 350M 和 1B 两款安全小模型,能把公开漏洞情报精准映射到代码库具体文件,成本仅为前沿大模型零头。
Poolside 发布 118B 参数、8B 激活的开源编码模型 Laguna S 2.1,SWE-Bench Multilingual 达 78.5%,OpenRouter 定价仅每百万 token 一两毛美元。
65 位作者的 SLAI T-Rex 论文登顶 Hugging Face 日榜,详解在华为昇腾 SuperPOD 上对万亿参数 DeepSeek-V4 系列完成全参数后训练,全程未用英伟达硬件。
谷歌发布 Gemini 3.6 Flash、3.5 Flash-Lite 和网络安全特化版 Flash Cyber,以更少输出 token 和更低价格押注智能体生产负载,3.5 Pro 仍在测试中。
英伟达开源 40 亿参数世界模型 Cosmos 3 Edge,推理与动作生成全部在端侧完成,Jetson Thor 上实现 15 Hz 实时控制。
K3 上线 48 小时需求暴涨约六倍逼近 GPU 极限,月之暗面暂停新用户订阅;第三方评测显示这款 2.8 万亿参数开源路线模型已与 Claude Fable 5 几乎打平。