环球音乐与ElevenLabs达成生成式音乐合作
环球音乐与ElevenLabs宣布多年战略合作,计划与艺人、唱片公司和出版商共同开发授权AI音乐产品。
环球音乐与ElevenLabs宣布多年战略合作,计划与艺人、唱片公司和出版商共同开发授权AI音乐产品。
腾讯混元联合上海交大等机构发布开源基础模型AuK,尝试用自然语言统一生成和编辑语音与其他音频。
OpenAI将Images 2.5推向ChatGPT和API,重点提升参考图一致性、多轮编辑稳定性与生成速度。
谷歌把Lyria 3.5从早期Flow Music入口扩展至全球Gemini用户、AI Studio和API,显著扩大音乐生成覆盖面。
微软以完整版争夺图像编辑质量榜首,并用Flash版本降低生成成本,强化Foundry的企业图像生产能力。
这项研究预览可持续生成720p、24帧的视听模拟,并根据文字、镜头和玩家操作实时改变场景。
MiniMax用8000条样本和不足千分之二的可训练参数,将H3视频模型中的动态知识转化为可交互环境。
Atlas 用统一架构完成生成、三维重建与模拟,目标覆盖影视制作、机器人训练和虚拟世界开发。
这套研究系统逐帧生成可交互的720p界面,将视频生成能力延伸至软件形态和智能体训练环境。
Baseten称其智能体系统已能生成、验证并部署生产级优化,为图像和语言模型带来端到端性能提升。
谷歌新一代视频模型支持最长40秒场景延展、首尾帧控制、低成本草稿及4K输出。
Midjourney 首款 V8.2 图像编辑模型开始扩大测试,支持文字指令修改、四图参考、局部重绘与画布扩展。
新功能无需单独训练,即可从一至十张参考图提取可复用视觉风格,并生成位图或可编辑SVG素材。
Stability AI完成7600万美元B轮融资,EA及三大国际音乐集团参与,其发展路线进一步转向授权内容与专业制作。
Gradio新增Workflow功能,可将多步骤AI流程变成可检查的拖拽画布,并同步生成REST接口和可部署应用。
Runway新模型可把上传或生成的SDR视频转换为高位深HDR文件,进一步进入专业调色与后期制作流程。
Tripo 推出可生成原生四边面拓扑的 P2.0 预览版,最高支持2.5万四边面,重点服务角色与实时游戏资产。
这家生成式媒体公司获得大额融资,将扩张视频与图像平台,迎战持续升温的全球 AIGC 竞争。
Meshy 发布新技术报告,解释最新系统如何把参考图中的比例、结构与关键部件更准确地还原为可用三维几何体。
多数市场的用户可关闭生成图片、视频和音乐上的可见水印,但谷歌仍会保留SynthID和C2PA来源信息;法律要求显示标识的地区不适用。
Suno 正从“一句话生成歌曲”转向可持续编辑的音乐制作环境,让创作者能够细调 AI 生成曲目的组成与声音。
新一代开放权重视频世界模型引入动态渲染机制,并支持原生 4K HDR、音画同步和更强的多镜头控制。
阿里通义万相发布命令行工具 Wan CLI,智能体可直接以编程方式调用其图像与视频模型,安装只需粘贴一条命令。
微软 AI 新版图像模型以 1336 分空降 Arena 文生图榜第二,上一代 2.5 仅排第十,与榜首 GPT Image 2 相差 45 分。
SpaceXAI 最新图像模型首次上榜即在文生图与图像编辑两个榜单位列第二;至 8 月 11 日,它在文生图榜已被微软 MAI-Image-2.6 挤到第三,图像编辑榜仍保持第二。
基于自研 Qwen-Audio 模型,把录音成稿、语音智能体与有声内容创作合为一体,四端上线并限时免费。
字节跳动正式开放这款 30 秒视频模型的公开 API:Luma 提前一天上线、Runway 当日跟上,Krea、Lovart、Pika 等平台宣布接入但仍在陆续推进。
该音乐生成平台将嵌入抗篡改音频水印、引入指纹识别、收紧批量下载,并接入 Musixmatch 的 Sentinel 歌词版权检测系统。
Black Forest Labs 的 20 秒原生带音轨视频模型 8 月 4 日在 Runway、Krea、Replicate 同步开放,结束限量灰度期。
京东开源 JoyAI-Video-Edit,160 亿参数、Apache 2.0 协议,单张 NVIDIA B200 上以约 30 FPS 完成 720P 视频实时编辑。
国内视频大模型公司 Sand.ai 放出 MAGI-2-preview 权重与推理代码,1140 亿参数稀疏架构、Apache 2.0 协议,可生成带同步音轨的 1080P 视频。
Video Arena 榜单显示,MiniMax-H3 在文生视频与图生视频两个分区均位列开源模型第一,领先次名开源模型约 280 分。权重现已公开,但许可协议目前限制美、欧、英、韩地区的开源权重使用。
腾讯混元新一代语音识别模型上线,普通话、英语、粤语词错率均约 3%,已在腾讯云开放 API,元宝端免费可用。
万相发布 Real-time 实时功能套件,首个能力 Camera-to-Image 可把手机摄像头实时画面即时转成风格化图像,首发主打二次元。
MiniMax 正式开放全模态视频模型 H3 的权重下载,让一款榜单前列的视频生成模型首次可以在本地部署运行。
SB 942于8月2日正式施行,要求大型生成式AI提供方在内容中嵌入来源信息,并免费提供公开的检测工具。
8月2日起,《AI法案》第50条透明度义务在欧盟全域直接适用:机器可读标记、聊天机器人身份披露与深度伪造标注同步落地。
谷歌撤回由 Nano Banana 2 驱动的生图功能,此前用户可直接在卫星地图上生成并叠加虚构影像。
德国慕尼黑第一地方法院认定 AI 音乐生成工具 Suno 在训练与生成两端均构成侵权,并驳回其美式「合理使用」抗辩;Suno 称不认同判决,正评估包括上诉在内的选项。
Snap 调整 Spotlight 推荐规则,将完全由 AI 生成的视频排除在分发之外,但仍允许创作者用 AI 做剪辑与增强。
P-Image-Ideogram 提供四档质量模式、原生 1K 与 2K 输出、3 至 8 秒出图,直接瞄准规模化生产的图像流水线。
字节跳动 Seedance 2.5 于 7 月 31 日结束企业内测,在国内即梦与海外 Dreamina 同步开放,单次可生成 30 秒视频。
阿里万相团队在 wan.video 上线 Realtime 模式,用户持续输入描述时画面即时随之变化,进一步押注实时交互式生成。
Ideogram 发布专用对象擦除模型,连阴影与反射一并清除,官方称在 RemovalBench 上优于 Nano Banana 2、FLUX Erase 与 GPT Image-2。
谷歌在 Flow Music 推出 Lyria 3.5,新增选段重绘功能,可只重做曲目中的一段,或把一小段构思扩写成完整歌曲。
两款新语音转文字模型成为 OpenAI 推荐默认方案,支持可提示的上下文注入,价格低至每分钟 0.0045 美元。
欧洲非营利组织 AI Forensics 发现,Hugging Face 上最热门的九个图像编辑模型中有七个会直接执行脱衣指令。
Midjourney 让 V8.2 结束预览、升为默认模型,这次以美学与个性化为重心,强化画质与风格参考表现。
Runway 让创作者用自然语言在 Runway Agent 中构建、运行和修改节点式 Workflows,把搭建生成流水线变成一句话的事。
FLUX 图像模型背后的德国实验室发布多模态旗舰 FLUX 3,单次生成 20 秒带原生音频的视频,并预告年内开源多模态底座。
爱诗科技 PixVerse 发布 VibeMV,上传歌曲即可一键生成节奏卡点、可带歌词字幕的完整 MV,网页、安卓与 API 同步上线。
ElevenLabs 推出 Vocals 和 Styles 功能,音乐人上传自己的作品即可微调 Music v2,生成带本人嗓音和风格的歌曲,上传素材需过版权筛查。
HeyGen 推出 Audio to Video 功能:不用写脚本,直接口述,一段语音加一张图片经一次 API 调用即可生成视频,还支持批量生产。
HeyGen 新模式让 AI Agent 先提多个创意方向、中途交storyboard确认再渲染成片,把视频生成从一锤子买卖变成迭代式导演流程。