同一句话,不该只有一种“正确结果”

Xtype 的语音输入其实一直有两步。

第一步,语音识别把声音变成原始文字。第二步,再让 AI 把这段文字处理一下。

问题是,“处理一下”到底是什么意思?

有人要原汁原味,识别出来什么就要什么。有人只想去掉「嗯」「那个」「哈哈」这些口头语,顺便把英文名字拼对。有人说了一大段,希望它收成条理清晰的问题。还有人其实不是要输入问题,而是想直接得到答案。

以前这些需求被混在一个叫“整理”的动作里。系统替用户猜:这句话应该改到什么程度。

这个猜法从根上就不对。

越用越准,不是去训练一个更大的模型

从第一性原理看,Xtype 不负责提高基础 AI 模型的听力。模型能听到什么程度,不由我们控制。

我们真正能做的是:记录你亲自确认过的词、你的口音经常被听成什么、哪些英文名字属于你自己的工作,然后在下一次识别和处理时,把这些私有偏好重新提供给 AI。

这才是“越用越准”的来源。

它不是所有人共享的一份大词库,而是一套只属于你的纠正循环。你用得越久,Xtype 越知道哪些词不能自作主张,哪些错误值得提醒模型多斟酌一次。

但词听准了以后,最后要得到哪一种文字,仍然应该由你决定。

四种结果,四份契约

现在 Xtype 把输出拆成四级。

1. 原文

识别结果是什么,就插入什么。没有第二次 AI 处理,也不在识别结束后替换文字。

这适合访谈原话、证词、逐字稿,以及任何“不准帮我改”的场景。

2. 清理

这是默认方式。

它会纠正已经确认过的个人常错词和英文拼写,去掉口头语、改口与无意义重复,再补上标点。但它不能改变句子顺序,不能替你总结,更不能回答你说的问题。

说的仍然是你的话,只是干净一点。

3. 整理

这一档才允许压缩啰嗦内容、调整顺序、自然分段,必要时列成条目。

它可以把一段边想边说的话整理成清楚的问题或正文,但不能新增事实,也不能替你回答。

4. 回答

这一档把口述当成真正的问题或指令,直接给答案。

我以前把这条路禁掉过,因为 AI 很容易啰嗦,也曾经把“让同事写一份指南”误解成“你现在替我写指南”。后来我意识到,问题不是回答能力不该存在,而是它不该偷偷混进默认听写里。

现在回答是一项明确选择:默认短答,不复述问题;结果仍然只插进当前光标,不会自动发送。

全局偏好,不等于每句话都一样

设置里可以选一个全局默认。录音时,底部胶囊也会显示当前方式;点一下,只改变这一句。下一次听写仍回到你的全局偏好。

这样,“清理”可以是日常默认;遇到要保留原话、整理长问题或直接求答案时,再临时切换。

这不是一个更聪明的开关

四级不是把同一个“智能润色”旋钮从小拧到大,而是四份不同的承诺:

AI 产品最危险的地方,往往不是它不会做,而是它在没有得到允许时做得太多。

Xtype 要越用越准,也要让你始终知道:这一句,究竟是谁的话。