我是真没想到网易除了UU远程,
又在AI赛道整了一个新活,这次是语音输入,把我电脑里的typless干出幸福者退让原则了。
我用过的语音输入有typeless(一周8k字周三基本用完),闪电说(有AI调整功能,但要自己配API),豆包输入法(整理口语主要还是原句识别),还有的只能在特定窗口下唤醒。有些转换速度太慢,说完话得干等好几秒,对于习惯了快速敲键盘的我来说,等它慢吞吞转完文字早就打完了。
mac自带的语音听写试都不用试,讲两句话能错一堆字,遇到英文或者专业术语直接对不上号,网易有道昨天刚上线的网易叭哥说基本把上面的缺点改完了。

那这些语音识别输入法的基础能力都有哪些呢?我直接做一个表格吧。

首先是AI整理,基本上是AI输入法必备功能了。
最简单就是原汤化原食,同一段文本我们都用输入法识别一下,按照我的使用习惯,排列句和中英文混合基本上是重灾区。为了测试的准确度,我后面都会自己先录一段音,然后打开这些AI输入法,全部重新听一遍。所以不会存在因为环境或者是重录的问题,导致它们收录到的声音不一样。
Typeless,
昨天 GPT Image2.5 刚刚发布,我想跟大家介绍一下它有哪些新特性:
• 精确编辑、多轮编辑、一致性智能和风格改进
• 支持手绘草图,将想法变成现实
• 支持结构化提示词
• 生成图片后可以分享提示词,分享出来的提示词按照 OpenAI 的规范做好了更清晰的结构
• API 中还提供了两个新模型
总的来说,我觉得这一波新模型在一致性上的表现相当不错
从 Typeless 做出来的这个格式就知道了,对于你说的一大段长句,它其实会省略掉一些语气词,或者中途说错的地方。比方说我说到一半发现「不是提示语,是结构化提示语」这种,它都是能修改好的。
但这样也出现了一个问题,AI主观性太强了,哪怕typeless有个性化可以学习我们的表达方式,很多时候我还是希望它能多保留一些我的语言习惯,也就是少点AI味,更口语化一些
叭哥说,
昨天 GPT Image2.5 刚发布,所以我想跟大家介绍一下它都有什么样的新特性。
首先,它这次新增了精确编辑,还有多人一致性、智能和风格改进,还能够使用草图,比方说我们可以把绘画想法变成现实的图片。接着还会有结构化的提示语,以及它能够帮我们在分享的时候,把提示语结构分享出去,在 API 里面还新增了两个模型。
总的来说,这一波新模型的一致性表现程度上来说是相当不错的。
叭哥说这个其实跟Typeless的风格还挺不一样的,他其实更多的是用了中文语境下面的转折词语来去做这个排比。同样也会把中途不停说到的重复语。
比方说,我很喜欢用「那」或者「然后」或者“「呃」这样的语气词都会给去掉。
豆包,
昨天Gemini gPT Image2.5刚发布,所以我想给大家介绍一下它有一些什么样的新特性。首先它会有多轮编辑的一致性,然后能够做智能跟风格改进。然后中间的过程中呢,你能够使用一些草图来把你的想法变成一张图片。最后就是你可以做结构化,然后把你的提示语分享出去,然后API里面多了两个新的模型。这样的程度来来说,总的来说,这一次是新模型的一致性表现程度来说是,嗯,相当不错。
豆包其实更像一个传统的输入法,增加了AI功能。
因为它其实能够设置一些很细微的选词方式,包括用分号、引号、左右command来选互选词。

但是,豆包输入法有一个可能是第三方输入法安装到苹果电脑的问题,也就是前期它需要的权限挺多的,并且我试了一下,如果你的全局按钮跟豆包输入法冲突的前提下,你很大概率会第一次设置不成功。我就是靠 Codex 的 Computer Use 给我修好的。

那好处就是它可以离线使用,下载一个模型就能做语音识别。但它并没有用模型来做一些AI排版,从识别出来的语句来说,里面语气词,以及我中间说到的一些可能说了一半,但又觉得这句话又不太对就没继续说的内容,类似这些没什么意义的句子,都没有去掉。
闪电说,
因为闪电说的质量主要是依赖API的,它可以配很多的模型。所以为了测试的公平,我们就默认选它,闪电说自己的模型,然后把这个风格调到中档,轻度整理。

昨天 GPT Image2.5 刚发布,所以我想跟大家介绍一下它有什么新的特性。
首先它这次增加了精确编辑,还有多轮编辑、一致性智能和风格改进,还能够使用草图来去生成图片。
比方说我们就可以拿一些绘画的想法变成现实,接着还会有结构化的一个提示语,我们可以把提示语的结构分享出去。
再就是 API 里面还新增了两个模型,总的来说这一批新模型的一致性的表现程度来说是相当不错的
而且,闪电说还会有更多的修改方案,因为它在里面可以加入一些技能。比方说,这里就可以在我选中文字的时候再去修改语音。这样就能够有更多的配置方案。

整体的识别速度来说,是豆包> 叭哥说 = 闪电说 > Typeless,毕竟豆包的形态是输入法+AI,偏向转写而不是整理。
我还是蛮好奇同样是模型,叭哥说是怎么做分配来加速识别速度的,
他们有一套是ASR语音识别模型,专门盯平时的口语习惯,停顿和小声说话。它结合前后文推测用户的真实意图,中间遇到重复或者临时改口,最后只把修正后的意思整理交出来。
另一个模型负责纠错,断句和润色,可以剔除口头禅,还把专有名词抓得更准。
最后能做到E2E平均1683ms,P95是2134ms,就这样说吧基本上一松开录制按钮结果就出来了。纸面实力基本看完,接下来就是来一轮针对叭哥说的专项测试看看。
第一个就是上班上的小声嘀嘀咕咕。
每次人一多在工作室就不敢大声对着电脑说话,就怕吵到人,也怕被他们听见。。。
叭哥说还支持工位级别的小声拾音,就不需要整一个dji的麦克风,主要是我有那个电量焦虑也没有那么想说去到那都可以需要拾音。所以我在工位上戴着耳机,把音量压到几乎只有自己能听见的气声,把平时的随便给agent发的内容对,直接对着麦克风念了一段。
「确保我们所有的bug都有解决掉,然后不要有任何的残留,完之后再开PR」

这一段就算你把自己的手机调到最大声也没问题的,因为几乎听不到,真的比现在说悄悄话还小。
然后第二个是给AI写长Prompt和专业术语。
平时让AI写代码或梳理方案,经常要输入很长的前置条件,夹杂各种专有名词和英文缩写。如果用系统自带语音,吐出来的多半是一堆同音错别字。
这次我用正常语速念了一长段需求,混着专有名词和逻辑补充。
帮我写一个基于 FastMCP 的 GitHub 监控脚本。
主要是要定调 GitHub REST API,抓取那个我要的 Repo 的 Release 更新。
如果有新版本,就解析;不然的话就是,就给我一个 Daily Report。

这个测试是在我把自己存的词库导入到叭哥说之前测的,在我没有把自己的个人习惯导入,它能结合上下文抓准了专有名词,还把背景,约束条件和输出要求分段排好。
所以下一步我们顺手把个人词典也做了,这个也是基本功能了,把一些自己常用的词加入词库,不用重新训练模型直接更稳的识别生效。像我每次最烦的就是说Claude了,用过Mac自带的,开源的,结果识别几乎每次都是Cloud,再来成了claw,我要的字没一次对

如果你用codex的话,可以像我一样直接开computer use来直接提取typeless里的就行,它可以自动导入但是没有导出╮(﹀_﹀”)╭。

个人词典导入之后是即刻生效的。所以,你加入之后后面的识别,就已经能够识别出你说的名词了。

第三个我非常常用的功能,多语言翻译。
每次跟海外发邮件或交流,通常要先想中文,扔进翻译软件,再复制出来贴过去,要不然就直接gpt6 chrome use把邮件一条条恢复了。

基本上这几个AI输入法都可以在原有的快捷键上录入第二个快捷键,如果你跟我一样整个了77块的超级便宜的外置键盘的话,就可以设置成触发这个快捷键来个有仪式感的语音输入了。速度还是还是很快的,没有因为开了翻译就损失太多时间

而且支持的不止英文,扫了一眼感觉能支持的语言感觉有五六十个。。

如果叭哥说还能结合一下typless的特点,能够给同一种语言不同地区的口音切换一下,那我觉得肯定会更好的。

顺带一提,我一个普通话说得很普通的粤语人,也顺手试了试粤语识别,直接上顺口溜了朋友们。
直接上噩梦级的,各个国家有各个国家的国歌,听不懂的话就跟听公鸡叫一样的类型。

而且我还想到了一个新玩法,
把它单纯作为一个翻译软件用来练口语我感觉这也比绝大多数的软件好了。

仔细想想,
我们适应键盘这块塑料板子太多年了。
脑子里有千头万绪,一秒钟能闪过好几个念头。可只要想把想法变成文字,就得先把这些立体,快速的思维压平,拆成一个个拼音字母,再靠手指在几十个按键上反复敲打。
打字的速度赶不上脑子转动的速度。
很多时候,灵感就是在这个从大脑流向指尖的过程中,被一点点卡住,甚至忘掉的。
以前大家觉得语音输入鸡肋,问题出在过去的工具是逼着人去迁就。
说话要字正腔圆,收起所有口头禅,像念播音稿一样发音。
像我这种普通话说的很普通的粤语人,能练出一手26键盲打就是因为语音识别太拉了。
但人在琢磨事情的时候,表达本来就是松弛跳跃的,会停顿,也会随时改口的,不然我也不会用一大堆录音卡了。
语音软件学会理解意图以后,人机交互的姿态就倒过来了。
我不用再训练自己像机器一样精准说话,
它可以主动适应我们最自然随性的口语表达。
我们总在讨论AI时代怎么提高生产力。
我们自己的嘴,本来就是人类身上效率最高的输出设备