越用越准,不是换一个更强的模型

2026-08-29 更新:这篇里「词库会随麦作为提示带给识别引擎」的说法,从 0.1.111 起不再成立。真机事故:Grok 识别在列举语境里把几十个词库提示当成了用户说过的话,直接抄进原始转写。现在第一遍识别只听音频、不接收词库;个人常错词改在识别之后按当前句实际命中来匹配,再交给整理 AI。

词典没有被删,「越用越准」也没有变——变的是它参与的时机:从「事前提示」挪到「事后纠正」。经过见 词典自己开口说话了。

刚才我说了一句话,里面有一个词:Kiosk。

语音识别把它写成了 Kels。我打开 Xtype 的纠正窗口,把 Kels 改回 Kiosk。界面已经能把 Kiosk 加进我的英文词库,但这件事让我继续往下问了一层:

如果明天它又听错,我为什么还要再教一次?

模型变强,不等于产品越用越准

Xtype 使用 Grok 做语音识别。Grok 明天可能升级,可能更准;也可能在我的口音、公司名、产品型号和 中英混说上继续犯同样的错。

那是模型供应商的能力,不是 Xtype 的能力。我们不能把“换了一个更强的模型”说成“Xtype 越用越懂你”。

从第一性原理看,Xtype 真正能够控制的只有一件事:用户纠正之后,系统有没有记住;下一次工作时, 这份记忆有没有真正参与判断。

模型能力是租来的。一个人的词汇、口音、项目名和纠正习惯,才是使用过程中积累下来的资产。

真正可控的位置,在两次 AI 之间

一次 Xtype 口述,本来就有两个阶段:

  1. 语音识别把声音变成原始文字。
  2. 整理 AI 去掉口头禅、处理改口、补标点,输出可以直接使用的正文。

语音识别听成什么,可以先保留什么。Xtype 不应该在本地武断地把 Kels 永久替换成 Kiosk—— 换一个语境,Kels 也可能真的是人名;机械替换只会制造一种更隐蔽的错误。

更合理的位置,是原始识别完成之后、送给整理 AI 之前。

系统先从这个人的私有词语偏好里,找出与当前原始稿有关的少量候选,再告诉整理 AI:

这段话可能涉及用户偏好词 Kiosk。过去相近的声音曾被识别成 Kels。请结合整句话判断;不确定就保留原文。

这不是命令 AI 替换,而是给它一份只属于这个人的判断线索。AI 仍然要看上下文,数字、否定词、代码、 URL 和命令仍然要原样保护。

一次纠正,应该留下什么

用户把 Kels 改成 Kiosk,系统不该只保存最后那五个字母。一次完整的学习至少包含:

这些不是训练全世界的公共语料。它们描述的是一个人的口音、工作和习惯,所以应该优先留在本机。 另一个人可能真的在说 Kels,不能因为我说不好 Kiosk,就让他的文字也被改掉。

“越用越准”必须能证明

这个词很容易被当成营销话术。今天用模型 A,明天换模型 B,也可以说“更准了”;但那不叫越用越准, 因为同一个新用户也能得到相同结果。

真正的检验方法应该是:

如果这些数字没有随使用改善,就说明我们只是把词丢给了 AI,没有建成学习闭环。

这才是 Xtype 应该拥有的能力

今天 Xtype 已经有纠正、本机词库和识别前提示。你改过的正确词可以留在这台 Mac 上,下一次参与识别。

更完整的“私有语言偏好引擎”还在建设:从当前原始稿检索相关偏好,把少量候选放进第二次整理,再用 后续纠正判断它有没有真正帮上忙。它在通过代码复核、真机测试和版本发布之前,不算已经交付。

但方向已经很清楚:Xtype 不需要假装自己能训练 Grok。Xtype 要做的是一套工具,让每个用户教过一次以后, 那次纠正不再白费。

不是模型越来越认识所有人,而是这台电脑越来越认识你。

这条流程全部开放,请你来挑毛病

我们就是做工具的。这条学习流程没有黑匣子,每一步都摆在 App 里让你看:

这套设计一定有想得不周的地方。用着别扭、逻辑不对、或者你觉得学习闭环里缺了哪一环—— 在 App 里点「AI 提需求」直接说,或写信 [email protected]。 你提的意见会进入每天的整理流程,被真人读到。