科技狐 14小时前
听、说、演、唱全包,StepAudio 3 有点东西!
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

不知道大家现在打字是不是和我一样,现在打字软件的语音输入法准确率直线上升,基本日常打字,特别是手机上的打字,更多都是 " 用嘴打字 "。

当然,这个准确率的直线上升,绝大部分的功劳都要归功于 AI 的出现,大模型能理解说话的意图以及识别同音字,识别率自然就大大提升。

而就在前段时间,我就刷到了阶跃星辰发了个 StepAudio 3,说把跟声音有关的活儿拆成了五个模型—— ASR、TTS、Realtime、Gen、Music 分别对应听、说、聊、演、唱五个语音领域,各管一摊。

而且还在 Artificial Analysis 榜单中位列全球第一。

这个就提起了我的兴趣了,要知道,我之前也给大家测试过其他的语音模型,那么这款第一的模型和之前的有什么进步呢?我就试了一下。

一、主管听的 ASR

对于 ASR,其实我本来没抱希望。

真如我开头说的,微信输入法、豆包我都玩过,现在语音转文字再叠点 AI,正确率 90% 往上都跟白给一样。

你说它比那俩强多少?我没觉得拉开代差。所以我特意上了点难度,下载了一个菜市场的白噪音,再融合说话的声音,想看看它能分辨出来多少。

结果呢?在嘈杂的环境下,它的辨识能力确实很不错。

例如说原声里面的一些数字 135、8021,还有下午三点半,这些关键的数字,它全部都在杂音中听清楚了,而且语音中该做的事,也大部分都正确了。

还有一些词汇,虽然不影响理解,但也并没有完全正确,例如说 " 老是飘 ",它自动改成 " 很飘 ";" 看下 " 变成 " 看一下 ",它自己按理解给我换同义词。

这些东西确实还能理解,毕竟其他很多输入法也会有同样的错。

但却还是有一些问题,特别是一些关键的细节,它完全听错了。

例如说名字上,原本是 " 陈志明 ",它给我写成 " 周志明 "。一个字,整段主语换人了。结尾的 " 回公司 " 变成 " 回去修 ",在行动上也完全做了改变。

当然,整体效果我还是挺满意的,毕竟这个测试本来我就给他增加了难度,能在高难度下依然识别出 95% 以上的内容,算是很不错的结果了。

二、主管说的 TTS

这个模型主要管的是说话,就是能直接生成人说的话,甚至还能附带情绪的那种。

说真的,之前我测试的很多 AI 语音大模型,基本都是不会有语气、情绪这一栏的,这个让我觉得特别意外。

所以我做了个测试,试着同一句话,同一个声线,让 AI 试着用不同的语气说出来,看是不是真的有效:

" 呃,就是……那个,我跟你讲啊,今天这事,唉,怎么说呢,我本来是想好好说的,结果你倒好,一句话就把我噎回来了。我当时就,哎——算了算了,我也懒得说了,反正,说了你也不听,对吧。"

这句话我特意给了很多语气词在里面,看看 AI 能不能根据我给的语气揣摩出来。没想到出来的结果却是很有意思,它竟然真的说出了不一样的感受出来。

当阴阳怪气的时候,确实能隐隐约约听出话语中背后的嘲讽和挖苦,特别是 " 你倒好 " 这些词汇,语调上非常能感受到情绪。

当疲惫疲劳的时候,语速确实慢下来了,像 " 哎 " 之类的叹气中,也能感受到是那种无能为力,非常疲惫的感觉。

当要她升高情绪时,确实能感受到话语从最初的平静,慢慢到情绪的抬升,特别是 " 结果你倒好 " 声调一下子提升,能感受到语气的明显变化。

有了人味之后,AI 配音能比之前干更多的事,例如说视频、游戏、有声书的配音,也会有更多的选择。

三、主管演的 Gen

如果说上面的 TTS 主要是扮演人的话语,那这里的 Gen 我觉得就更有意思了,它是 TTS 的升级版。

它不仅能生成人的话语,还能生成背景音、音效等等,简单来说,它能直接生成一个故事,只要把人物说话的顺序、音效、背景全部搭好,它就能直接给你生成一个语音故事出来。

我尝试生成了一个深夜一家三口对话的场景。

出来的音频我是觉得挺有意思的。

首先,继承了前面 TTS 的优势,三个人——父亲、母亲、孩子的声音都是能分开的,而且也各有情绪。

例如说孩子只剩下最后一关,想再玩一会游戏的求饶声,母亲的情绪升降,以及父亲对于孩子讨价还价时的打趣。

所有话语既没有叠在一起的鬼畜,你能明显听出来这是一家子人,而不是三个 ai 在读稿。

但是这个模型我自己感觉仍有缺点,例如说我是给音频设置了效果音的,但是一直抽不出来,可以看到,在这方面它并非长处。

但整体完成度确实很可以,能生成出有效果音和背景音,而且人声也非常有情绪,这样故事感就已经很足了。关键门槛还很低,全部用文字描述就能完全使用,非常简单。

四、主管唱的 Music

对于音乐生成的话,我尝试生成了一个有意思的歌曲——死亡金属版《生日快乐》。

出来的歌曲也挺有意思的,失真的吉他,人声是撕裂的那种死腔,地狱感拉满。非常魔幻的是,即使这么死亡金属,但 " 生日快乐 " 四个字清清楚楚,你一听就知道是祝寿的。

当时 AI 还给这首歌取名《地狱贺寿》,确实魔化又离谱。

当然,歌曲生成的话,现在很多 AI 软件都能生成出很不错的整曲音乐,所以对此我也没有很意外。但阶跃星辰却多了两个新的功能,叫做 " 歌曲改编 " 和 " 清唱配乐 "。

这两个功能倒是新鲜,难道这个可以根据原曲生成改编的歌曲吗?

但事实这两个功能却翻车得挺狠的。

首先是歌曲改编,我给了它一首《小兔子乖乖》,想着用儿歌来生成一首恐怖歌曲,没想到直接翻车了。

不知道是 AI 辨认不出原曲的歌词,还是它原本就不懂改编,生成出来的歌曲,整首只认出一个 " 开 " 字,弄出个恐怖风但一句词没有。

严重怀疑是不是在 " 鬼打门 " 一直喊 " 开!"

其次是 " 清唱配乐 ",同样的问题。我试着自己哼唱,让它给我配乐,想着我这五音不全,是不是可以让 AI 帮我修修音,再配个好一点的配乐。

谁知道出来的还是没有歌词的音乐,八竿子打不着,跟原曲毫无关系。

所以 Music 这里的功能,虽然有 3 个,但这么看的话,其实主要还是围绕 " 音乐生成 " 这一个关键的功能。

五、主管聊的 Realtime

现在实时聊天这个功能,绝大部分 AI 工具都有,例如说豆包,基本都在线。

所以我的计划是,不断地打断它,反复折腾它,看它会不会崩。

上来就丢一句:「帮我在网上查查公司附近那家川菜馆,评分咋样、人均多少。」

然后我开始发疯—— " 算了查火锅店 "," 不对我要看招牌菜 "," 哎营业时间也查下 "," 就查个不咋起眼的那种馆子啊 "。

开始了我的夺命四连问,而且我不是等它说完再改,是它刚冒出半个音我就把话堵回去,专挑它最想接话的节骨眼截胡。

有意思的来了。

第一,它收声特别快。我一张嘴,它那边立马噤声,没有那种「我这句话念完你再讲」的臭毛病。

第二,它没把整段对话推倒重来。就顺着我说「换火锅、加招牌菜、加营业时间、要低调」,前面查川菜那句它自己消化了,不啰嗦。

最关键的第三点:从头到尾,它都老老实实待在「查资料」的框里。没忽悠我说「已经帮你订好了」,也没脑补一个它根本打不了的电话。

知道自己几斤几两,这点比豆包要更聪明,不会为了讨好而骗人。

一方面是它会接话,另一方面我们把需求改了四遍,它也能接话干活,这方面,我倒觉得这个实时聊天工具非常实用。

所以说整体测下来,这五个语音模型确实是各有特色,但也并没有说非常惊艳,依然逃不出 AI 特有的需要抽卡的特性,而且偏科非常厉害。

本来的话,听、说、聊、演、唱五个功能齐全,但现在来看,听、说、演、聊天都算不错,特别是语音生成,自带情绪语气确实很难得。

但确实有点偏科,在音乐歌唱方面,只能说和市面上的 ai 并无突出优势,不过要是想一个工具解决所有声音上的内容,那这确实是个非常不错的选择。而且现在每天还有非常多的使用额度,目前来看还是很经济实惠的。

作者:ZJ

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

music ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论