首页 > AI > 音述AI怎么用 语音转文字和字幕教程

音述AI怎么用 语音转文字和字幕教程

更新时间:2026-10-06 21:03:39 发布时间:22小时前 阅读:6次

注册账号后先确认麦克风和音频权限是否开启

浏览器输入音述AI官网,手机号注册登录。进去后先别急着传文件,点右上角头像进「设置→隐私与权限」,确认麦克风开关是蓝色启用状态。安卓用户还要去手机系统设置里,找到音述AI,把“访问所有音频文件”勾上,不然上传的录音文件系统读不到。这一步不做,后面拖文件进去会一直卡在0%不动的。

语音转文字必须用拖拽上传别用浏览按钮

回首页点左上角「新建任务」,选「语音转文字」模式。把MP3或WAV文件直接拖进虚线框里,单文件别超过100MB。千万别点“浏览”按钮选文件,Chrome 127以上版本会触发安全策略拦截,而且不给任何报错提示,你等半天以为在处理其实文件根本没进去。拖进去后看页面顶部,出现音频时长和采样率两个数字才算上传成功。

上传前先检查音频采样率是不是44.1或48kHz

文件拖进去之前,右键点音频文件看属性,核对采样率必须是44.1kHz或48kHz,其他数值系统会直接拒绝处理。Mac用户右键「显示简介」看采样率,Windows用户右键「属性→详细信息」里找。如果采样率不对,用Audacity导入后重新导出,导出时选44.1kHz。另外立体声文件要转成单声道,音述AI对左右声道相位差很敏感,哪怕0.3秒的偏差都会判定为无效输入。

静音段占比超过65%的音频要先剪掉再传

用Audacity打开音频,Ctrl+A全选,顶部菜单选「分析→统计」,看静音百分比。如果静音占比超过65%,系统会直接拒掉,因为它只信任有效语音密度大于35%的音频。所以录音环境很安静、但中间停顿特别多的素材,先把大段空白剪掉再传。剪的时候别手软,半秒以上的纯静音全删,保留正常换气停顿就行。

转写完成后导出SRT字幕文件不要导出纯文本

文件解析完,系统自动生成带时间轴的转写稿。在导出选项里选“导出SRT字幕文件”,别选“导出纯文本”。纯文本没有时间信息,后面导入剪映或者PR做字幕时对不上画面。SRT格式带完整时间码,拖进任何剪辑软件都能直接识别。导出后先用记事本打开看一眼,确认每条字幕的时间块格式正常,别出现空行或者乱码。

用VS Code检查SRT时间块有没有半句话被切断

用VS Code打开导出的SRT文件,查找所有时间块。重点看每个时间块里是不是只包含一句完整的话。如果出现前一个块结尾是“这个角色穿”,后一个块开头是“着红裙子”这种被切断的情况,必须手动把这两个块合并,时间改成“00:00:01,000 –> 00:00:04,200”。不合并的话,导入剪辑软件后字幕会断成两截显示,观众看着很别扭。

删掉持续时间不到0.8秒的碎片时间块

继续在SRT文件里排查,把所有持续时间小于0.8秒的时间块整条删掉。这些碎片大多是语气词或者系统误识别的噪声,音述AI在后续处理时会直接丢弃,但留在字幕文件里会影响剪辑软件的时间轴匹配。删完保存,重新导入剪辑软件,字幕对齐准确率会高很多。我一般导完SRT先做这一步,比在剪辑软件里逐条改快多了。

把SRT重新上传生成硬字幕但别选按静音间隔分割

修好的SRT文件重新上传到音述AI,在解析选项里选“按字幕段落分割”,别选“按静音间隔分割”。前者依据你校准过的时间轴切分,准确率高;后者靠音频波形自动判断,误差率能到47%。选完之后点生成,等十几秒出带字幕的视频文件。如果生成的字幕颜色或者位置不对,在导出设置里手动调,别重新跑一遍浪费额度。

免费用户每小时只能处理3分钟音频别连续传大文件

免费账户有个硬限制:每小时只能处理3分钟音频,超了要等整点重置,不能跳过。所以别一次性传一个20分钟的访谈录音,传上去系统会提示超额,前面处理到一半的也会中断。我的做法是把长音频切成3分钟以内的小段,分时段传。如果确实要处理长内容,看看充值档位,按量付费比干等整点重置划算。

字幕生成后导出前先在预览页对一遍时间轴

字幕视频生成后别直接下载,在预览页从头到尾拖一遍进度条。重点看三个地方:字幕出现时间跟声音对不对得上、有没有漏掉整句没显示字幕、末尾字幕是不是提前消失。有问题的话回SRT文件改时间码再重新生成,别在成品视频上硬改。确认没问题再点下载,免费导出的视频带轻微水印,做短视频够用,正式商用得开会员去水印。

语音转文字和字幕这套流程跑下来,免费额度处理几分钟的短视频素材没问题,长内容就得切段或者付费了。润灭网后面会整理一批免费音频转文字工具的横向对比,能帮你找到每小时额度更宽松的替代品。

微信        
微信号runmie