https://x.com/i/article/2108926756191395840
八款 AI 语音输入法大横测!我找到了 Vibe Coding 的最佳搭配
上上上周我说网易出了一个新的 AI 输入法叭哥说之后评论区就炸了,
一堆人反手给我推别的输入法,微信的,千问的,秘塔的,还有几个我连名字都没听过的。
行,干脆把大家点名最多的几个全凑齐,一次比完八款输入法。
上次对比了豆包,typeless,闪电说,和网易叭哥说【https://x.com/aiwarts/status/2100185930116268401?s=20】
先来说说现在语音输入这个赛道的老毛病。
有的是一周限额两千字,周三基本就见了底,有的带 AI 调整但得自己配 API。有的整理口语主要还是原句识别,等于没怎么用 AI 整理。还有的只能在特定窗口里唤醒,通用性不够。
更普遍的问题是慢,说完一句话要干等好几秒,对习惯了敲键盘的人来说,等慢悠悠转完我早打完了。Mac 自带那个听写就更是搞笑,讲两句话能错一堆字,特别是中英文夹杂的时候。我说个 Claude 给我来个「可落的」,是真没招了。
测试方法跟上期一模一样,做到极致公平。上期测了 Typeless,闪电说、网易叭哥说和豆包输入法,这次直接实测 4 个上次没有覆盖的输入法,微信输入法,秘塔输入法,千问输入法,还有一个是新发现的开源项目OpenLess。
上期的汇总图我也带来了,
还有一点要说说,今天测的这几个,用的都是它们的免费功能,没开会员也没充值。
题目也统一,就用下面这一整段。
> GPT Image 2.5刚刚发布,我想跟大家介绍一下它有哪些新特性。
第一,精确编辑,多轮编辑,一致性智能和风格改进。
第二,支持手绘草图,把想法变成现实。
第三,支持结构化提示词。
第四,生成图片之后可以分享提示词,分享出来的提示词按照OpenAI的规范做好了更清晰的结构。
第五,API里还新增了两个模型。总的来说,我觉得这一波新模型在一致性上的表现相当不错。
里面有中英文混合、编号列表、OpenAI 和结构化提示词这种专有名词、还有比较绕的长句。基本能把识别准确率、断句能力和专有名词处理这几个最关键的维度都摸出来。
OK 开测。
先来微信输入法。大家应该都挺熟了,腾讯出的 iOS,安卓,Mac 啥平台全部都覆盖了,主打一个输入免费不限字数,方言也覆盖了一部分。
整体还是很正常的路子,没啥太不一样的,AI 功能不明显,语音输入嘛,你说啥它记啥。
像我这么给他说了一段,他就是原封不动地给我记下来了,中间有些润色但偏克制。
标点和断句它替我们整理了,口语里那些重复和口头禅,基本都还在。
好处是你说的话被完整保留了,
坏处也是你本来就说得零碎的话,识别出来也是一堆巴拉巴拉的话,还是要自己手动改一遍。
不过它有个很爽的点,跨设备复制。
平时在电脑上打了些字,或者传张图,想弄到手机上用,每次隔空投送都嫌麻烦,特别是苹果现在给其他设备 airdrop 还要配对码就是离谱中的离谱。
装了微信输入法之后,电脑上复制一下,手机上直接就能秒粘的,搭配 UU 远程用的时候甚至会考虑到手机横屏把输入法拆开左右两个区域来输入,总体来说是一个非常成熟的输入法,带上了一点点 AI,体感不明显。
继续继续,来千问输入法。阿里通义千问那条线的,AI 接得就比较深了。
同一段话,它也是成功识别出来了,然后编辑得更规范
给我的感觉,它识别得很稳定,准确率比微信还高了一档,错字和断句都更少。
换来的代价是慢一点点。
因为走的是 AI 润色这条路,除了把话转出来还会顺手帮你改写一下。如果想改它润色的方式或方向,也可以在设定里面自己调。这三档基本也是所有 AI 语音输入法的标配了,还有一些会有英文和数字前后要不要加空格。
千问还有几个我觉得特别实用的功能,就是词典和常用语。
词典可以把一些你可能会讲错或 AI 识别错的词,直接给它看答案。比如我每次说 Claude 它都给我出 Cloud,把正确的拼写加进词典里,后面识别就很稳定了。
跟微信一样,千问输入法在手机上也能语音转文字,电脑和手机还能关联起来互传消息。
不过微信那边基本是单向的,电脑上复制的东西能传到手机。
千问这个是双向同步,电脑上传的内容能同步到手机,手机上打的也能同步回电脑。这点上大分。
下一个就轮到开源项目,OpenLess 了。
它就是一款开源的语音输入,本地优先,代码全开,MIT 协议。
交互的方式也是跟现在主流 AI 语音输入法一致。按下说话,松开就在光标处给你一段整理好的文字,任何有输入框的地方都能用,ChatGPT,Claude,Cursor,Notion,邮件,聊天框都行。
这类单独占快捷键语音输入的输入法比起千问微信的好处就是不会影响你本身打字的习惯,像我因为已经适应了苹果输入法输入的过程中不带任何拼音的话,体验会更友好。
那 OpenLess 相当于把 AI 语音输入这套框架开源出来了,模型可以自由配置。可以选火山引擎的流式 ASR,加上 Ark,或者任何一个兼容 OpenAI 的 chat 接口都可以。
我们这次就测了 Luna 加上 Whisper,效果真的相当相当可以了
同一段话给它,结果是
能看出来它想做一些不同层级结构化的输出,但是有点用力过度了,有的排版成了有的没成。
感觉 OpenLess 的优势完完全全是在配置多样性,特别是它换风格的部分。
你的语气内容全部都能自定义。
想要一份能直接发给客户的内容,可以切到偏正式的表达,把零碎的口语收成完整句子,主语补齐,语气词去掉。或者只是日常沟通,也都可以直接看到效果。
要是想整活,还有很多可以整活的风格包。
有几个补充包专门就是针对着 typeless 同款体验来了,属于是一个非常不错的平替。
我自己又试了两个,
这喵我是真没绷住。。
一试一个不吱声。。。
然后也是有调专有名词的地方,这也是我用其他语音输入翻车最多的地方。
最典型的一个,说 Claude,出来 Cloud。
跟千问的一样,Openless 里专门开了一页词典,把一些常用但容易出错的词添加进去。
这个词条会当成热词先发给 ASR,润色的时候也会带上。剩下的交给上下文判断。你正在聊 AI 产品,Cloud 就会被改回 Claude。你真在说云计算的时候,它一个字都不动。
隔壁闪电说也有类似的设定我上次没说的,它可以通过截取当前屏幕的内容来判断怎么去处理我的语音输入。
那 OpenLess的词典还专门增加了一个按场景搭配的功能。
程序员来来去去就那么几个词,常用的框架名和函数名一次性列进去,后面一直受用。
还可以挂上其他预设,在不同场景每个都是独立的词典。
写代码用一套,写文章用另一套,回邮件又可以切一套。
我加完之后又念了几遍,识别得确实会更加准确。
偶尔还是有一两个漏掉了,但属实少了很多。所以用 OpenLess 是需要一段时间来慢慢配置的,属于是用的越多效果越好的类型。
最后的最后,来到我们的秘塔,试了一圈,连成都没成功。。。
真的是把设置调烂了,在 Mac 上把 f5 麦克风,能找的按键全都测了一遍,它就没有一次启动过。。。
它看着跟千问,还有 OpenLess 的方向都挺像,有兴趣的可以自己找来试试。
要是有成功跑起来的朋友,也欢迎说说这东西到底该怎么装,这就先不给它下结论了。
OK 四款测完,加上上期的四款,八款全部到齐。
该排排坐了。
先说速度,微信最快,OpenLess 和千问基本打平。
然后很离谱的事来了。
千问的准确率,是这几个里面最高的。
比微信还高。
我可以重复五百次,不是广不是广不是广,完全不是。阿里要是看到了,麻烦给千问输入法加上 Typeless 和 OpenLess 上所有的其他 AI 功能好吗。
虽然 OpenLess 的配置很多样化,但综合表现我可以排到比闪电说订阅版低一点点,比 Typeless 订阅版再低一点。
跟订阅版对比是因为 API 本身也要烧额度,都要花钱了我还是愿意多花点的。
那把上期的数据也拉过来一起看。
Typeless 有 AI 润色的情况下输出速度还是第一档的,虽然额度缩水了,一周下来大概能撑两三天。2000 字额度用完其实还能识别,就是速度会慢 12345 点。
叭哥我也把一周的额度上限测出来了,一周 5 万字就是封顶。
说真的非常够用,够用到不需要别的来做备份。
千问就是我拿来给手机和电脑一起用的,用的就是双向剪贴板,不管哪台设备都可以保留下当前的输入。
我的最终方案就是三件套。
千问 + 叭哥说 + Typeless。
千问负责手机端和跨设备同步,准确率还是八款里最高的。
叭哥说一周 5 万字额度管够,日常写东西回消息做笔记基本来用它覆盖。
Typeless 虽然免费额度缩水了,但有 AI 润色的时候速度确实是第一档,写长内容集中用,两三天的额度留给最需要速度的场景。
三个搭在一起,基本全覆盖了。
如果你是重度码字的人,OpenLess 值得花时间配一下。大概二十分钟到半小时搞定,配好之后你会觉得那些收费的都没什么必要了。
其实测完这一圈,有个感受挺深的。
这些语音输入法已经分化出两条完全不同的路。
一条是忠实记录,你说什么它记什么。
另一条是理解重写。AI 按照你的设定或者平时输出后修改的语言习惯来订正你的输入。
你想想看,语音输入这件事的终极形态是什么。是你脑子里有一团模糊的想法,用最随意的方式说出来,然后屏幕上出现的是一段逻辑清晰、表达精准的文字。
从记录你说了什么到理解你想说什么,中间的距离就是 AI 介入的深度。
我选了三个搭配着用,也是因为不同场景需要不同深度的 AI 介入。
还有啥好用的 AI 语音输入法等着我测的嘛?
