首页 > AI > 火山引擎怎么用 AI生成视频和数字人教程

火山引擎怎么用 AI生成视频和数字人教程

更新时间:2026-10-06 06:03:34 发布时间:2小时前 阅读:4次

打开火山引擎官网注册账号并完成实名认证

浏览器输入火山引擎官网,右上角点“立即注册”,手机号收验证码,填完基本信息。注册完点右上角头像进「账号管理」→「实名认证」,个人认证传身份证正反面,一般几分钟就过;企业认证要传营业执照,审核慢一点。没实名的话后面所有AI服务都开通不了,控制台里搜出来的产品全是灰的。认证通过后头像旁边会出现蓝色盾牌标志,看到这个再往下走。

进控制台搜索OmniHuman并开通数字人服务

登录后在顶部搜索框里输入“OmniHuman”或“即梦AI”,找到产品页点「立即开通」。开通后会跳转到「访问控制」页面,这里要创建一组AK/SK密钥,点“新建密钥”,把Access Key ID和Secret Access Key复制下来存到记事本。Secret Key关掉弹窗就再也看不到了,丢了只能重新生成。密钥权限范围勾选“AI服务调用”和“视觉智能服务”两项,少勾了后面调用会返回403。

准备一张正面人像照和一段15秒以内的音频

OmniHuman1.5走的是“单图加音频驱动”路线。图片格式用JPG,大小别超过5MB,分辨率控制在4096×4096以内。选图的时候优先挑单人、正脸、五官占比大的照片,侧脸或者戴墨镜的基本出不来好效果。音频时长建议15秒以内,最长不超过35秒,格式用MP3或WAV都行,但别带背景音乐和杂音。把这两个文件上传到能公网访问的图床或云存储,拿到URL备用。

调用提交任务接口发起视频生成请求

接口地址是火山引擎视觉智能服务的CVSubmitTask。Body里必填三个字段:req_key填realman_avatar_picture_omni_v2、image_url填你的人像图片公网链接、audio_url填音频公网链接。另外可选填prompt提示词来控制画面动作,比如“镜头缓缓推进,人物微笑点头”。提交后会返回一个task_id,把它记下来,后面查结果要用。这一步如果报50400错误码,说明OmniHuman服务没开通,回控制台补开通就行。

轮询查询任务状态直到视频生成完成

提交完任务后调CVGetResult接口查结果。参数里req_key同样填realman_avatar_picture_omni_v2,task_id填刚才返回的那个。返回的status字段有四种状态:in_queue、generating、done、failed。前两个说明还在排队或处理中,等十几秒再查一次。OmniHuman生成一条15秒视频大约需要60到120秒。状态变成done之后,data里的video_url就是成片下载链接,但这个链接有效期只有1小时,拿到之后立刻下载到本地。

想用克隆数字人做直播的话先录一段模板视频

如果你要做的是能反复使用的克隆数字人而不是单次图驱动,路线不一样。先在「创建克隆数字人形象」接口上传一段20秒左右的真人出镜模板视频,要求正脸清晰、光线均匀、口型动作自然。系统会返回一个resource_id,这就是你的专属数字人形象ID。后面每次生成视频时,req_key换成realman_avatar_creation_task,传resource_id和新的音频URL就行,不用再传图片。

文本转视频走Seedance路线更适合批量出片

如果你手头没有现成的人像照片,想做的是纯文本生成视频内容,那就用Seedance。先在控制台搜“Seedance”点开通,然后在「创建视频生成任务」接口里填prompt提示词、分辨率、比例、时长四个核心参数。提示词写法参考“夕阳下的湖面,金色光芒铺满水面,镜头缓缓后拉”,分辨率选720p或1080p,比例竖屏填9:16。免费额度每月100次调用,单批次最多提交20条任务,超过会触发限流。

用声音复刻让自己的声音出现在数字人视频里

如果不想用默认的合成音色,进控制台搜“声音复刻”。上传一段10到30秒的清晰人声录音,格式用WAV,文件小于3MB,环境要安静不能有混响和多人对话。上传后系统秒级完成克隆,生成一个speaker ID。回到数字人视频生成接口,把音频参数换成这个speaker ID加上你要说的文本,出来的视频就是你自己声音配的。声音复刻2.0版本支持在合成时调情感和语速,比1.0自然不少。

实时互动数字人走WebSocket流式路线延迟最低

如果你要做的是能实时对话的数字人客

微信        
微信号runmie