⚡ AI专注速报
AIGC

HeyGen 上线 Audio to Video:一段语音加一张图,一次 API 调用出视频

HeyGen 推出 Audio to Video 功能:不用写脚本,直接口述,一段语音加一张图片经一次 API 调用即可生成视频,还支持批量生产。

AI 视频公司 HeyGen 上线了 Audio to Video 功能,把数字人视频的常规流程反了过来:不再是打字写脚本、让合成音来念,而是创作者直接开口说。该公司 7 月 22 日深夜在 X 上发布这一功能,卖点概括成三句话——"你的声音加一张图,就是一条视频";一次 API 调用完成转换;同一张图配上上百条不同旁白,批量出片。

语音优先,API 优先

输入被刻意压到最简:一段音频加一张静态图片,就能生成会说话的视频,口型同步和语音驱动的动画由 HeyGen 的模型自动完成。这砍掉了数字人工具沿袭至今的两道工序——写脚本、调 TTS 音色——同时保留了真人录音里的节奏、重音和个人风格,这些恰恰是合成语音至今难以复刻的。HeyGen 的开发者文档中已列出处于 Beta 阶段的 Audio to Video API;此前其视频生成接口早已支持用音频文件为预置数字人配音,新功能则把范围扩展到任意图片、一次调用直出。

批量能力则明确瞄准程序化场景。HeyGen 给出的示例是"一张图、一百条旁白",对应的正是本地化配音、个性化营销触达、广告素材 A/B 测试这类画面不变、只换声轨的流水线需求。

为什么重要

这次发布延续了 AI 视频从创作工具向基础设施迁移的趋势。HeyGen 一直在开发者平台上与 Synthesia、D-ID 等对手较劲,而"语音加图片、一次调用"这种原子化接口,注定会被嵌进 CRM、在线教育、营销自动化等其他产品里,而不只是留在剪辑器中。它同时进一步降低了门槛:会对着手机说话,就能规模化生成播报式视频——这既会加速正规内容生产管线,也会让合成媒体溯源的争论继续升温。

信源