语音 AI 评测这件事,大家都在假装做得很认真
乌鸦小编 发表于:2026-8-7 07:52 复制链接 发表新帖
阅读数:149
Hacker News 的 Show HN 频道这两天上了一个新工具 VoiceDuel,定位是"实时语音到语音模型的盲测竞技场"。网页打开就一句话——让两个语音 AI 同时扮演你写的角色(招聘经理、愤怒的顾客、中世纪骑士都行),你直接开口跟它俩对话,对话完闭着眼睛投票谁演得更好,直到投完才告诉你背后到底是哪家模型。它把当前的"实时语音到语音"API 拉了进来做对比——OpenAI 的 gpt-realtime、xAI 的 Grok Voice、阿里旗下的 Qwen Omni Realtime 这些都进了名单。这里说的"实时语音到语音"是指模型本身一端吃音频一端吐音频,不像传统那样把语音识别 + 大模型 + 语音合成三段拼起来。

这件事真正值得玩味的不是哪个模型分高,而是它把评测的目标从"模型厂商"换成了"配置"。同一款模型换个 turn-detection 设置、换个声音、换个角色指令,得出来的体感可能完全两样。AI 多快判断你已经说完了话、被打断时怎么接、能不能稳得住人设——这些细节对"语音助手听起来是不是像个真人"影响最大,几乎比"是哪个团队训练的"还要关键。但大多数公开排行榜偏偏都在比厂商、刷基准分,没人认真把这些配置层面的差异拿出来排。VoiceDuel 这一刀切得却有点意思。

它的排名方法也比一般的竞技场讲究。投票不是直接 Elo 拟合(一种在线近似的评分算法),而是全套投票历史用 Bradley-Terry 模型(注:一种基于两两比较的最大似然统计模型)来拟合——Elo 必须边投票边算更新,它允许事后回头重排。每个模型得分都给一个 95% 置信区间,来源是 parametric bootstrap(注:通过参数化重采样估计误差范围的方法),这样你能一眼看出这个排名到底稳不稳还是纯属噪声。配对机制也动了手脚:优先把彼此还没怎么碰过面的对手撮到一组、出场顺序左右平衡抵消"最后说话的人容易赢"的偏差。这套方法论如果跑起来扎实,对中文语音助手开发者来说是个少见的横向参考——之前大家各自刷各自的演示视频,没有一个能让用户闭着眼睛投票的公共场地。

隐私这一层它做得也算克制。麦克风只在对话时段打开,音频流实时推给被对比的 AI 提供商,不写盘、不落库。VoiceDuel 自己只保留三样东西:投票结果、配对是哪两个配置、每场对话持续了多久。从产品页能看到首页放了一张 Teatro Grande, Pompeii(注:意大利庞贝古城古罗马剧场的名字)的剧照做 banner,整体气质偏冷、没什么花哨营销。这个项目本身标着"独立项目",没有抱哪一家大厂的腿,模型都是盲测到投票结束才亮名——这跟厂商自己做基准、自己发布排名的做法直接对着来。

对国内做语音 AI 产品的人来说,这种工具意味着什么。第一,闭着眼睛投票的方法在国内很少见,本质上它绕开了厂商投放预算对评分的影响——你可以拿同一个产品 prompt 分别让 Qwen Omni Realtime 和 gpt-realtime 跑一遍,把决定权交给真实用户。第二,"配置 > 厂商"的视角特别值得抄——上线一款语音助手,体感往往不取决于底层模型,而取决于 turn-detection、prompt、声音这几个旋钮怎么调。最后,国内做语音评测的团队如果想接这套方法,最快路径是 fork VoiceDuel 的前端,把候选模型池换成国内的几家——Qwen Omni Realtime 已经进了原名单,豆包语音、深度求索的实时模型这些都可以拉进来。这种公共盲测的生态一旦搭起来,整个语音 AI 行业的产品力比基准分能更早反映出真实水位。

创业找资源,上乌鸦部落
本页内容由网友自行在乌鸦部落发布,本站仅提供帖文、图片存储空间服务,帖文(图片)发布者应自行负责所上传帖文(图片)涉及的法律责任,本站对帖文真实性、版权等概不负责,亦不承担任何法律责任。
条评论
您需要登录后才可以回帖 登录 | 立即注册
高级
相关推荐

关闭

乌鸦部落