2026-08-29 更新:这篇里「词库会随麦作为提示带给识别引擎」的说法,从 0.1.111 起不再成立。真机事故:Grok 识别在列举语境里把几十个词库提示当成了用户说过的话,直接抄进原始转写。现在第一遍识别只听音频、不接收词库;个人常错词改在识别之后按当前句实际命中来匹配,再交给整理 AI。
词典没有被删,「越用越准」也没有变——变的是它参与的时机:从「事前提示」挪到「事后纠正」。经过见 词典自己开口说话了。
刚才我说了一句话,里面有一个词:Kiosk。
语音识别把它写成了 Kels。我打开 Xtype 的纠正窗口,把 Kels 改回 Kiosk。界面已经能把
Kiosk 加进我的英文词库,但这件事让我继续往下问了一层:
如果明天它又听错,我为什么还要再教一次?
模型变强,不等于产品越用越准
Xtype 使用 Grok 做语音识别。Grok 明天可能升级,可能更准;也可能在我的口音、公司名、产品型号和 中英混说上继续犯同样的错。
那是模型供应商的能力,不是 Xtype 的能力。我们不能把“换了一个更强的模型”说成“Xtype 越用越懂你”。
从第一性原理看,Xtype 真正能够控制的只有一件事:用户纠正之后,系统有没有记住;下一次工作时, 这份记忆有没有真正参与判断。
模型能力是租来的。一个人的词汇、口音、项目名和纠正习惯,才是使用过程中积累下来的资产。
真正可控的位置,在两次 AI 之间
一次 Xtype 口述,本来就有两个阶段:
- 语音识别把声音变成原始文字。
- 整理 AI 去掉口头禅、处理改口、补标点,输出可以直接使用的正文。
语音识别听成什么,可以先保留什么。Xtype 不应该在本地武断地把 Kels 永久替换成 Kiosk——
换一个语境,Kels 也可能真的是人名;机械替换只会制造一种更隐蔽的错误。
更合理的位置,是原始识别完成之后、送给整理 AI 之前。
系统先从这个人的私有词语偏好里,找出与当前原始稿有关的少量候选,再告诉整理 AI:
这段话可能涉及用户偏好词 Kiosk。过去相近的声音曾被识别成 Kels。请结合整句话判断;不确定就保留原文。
这不是命令 AI 替换,而是给它一份只属于这个人的判断线索。AI 仍然要看上下文,数字、否定词、代码、 URL 和命令仍然要原样保护。
一次纠正,应该留下什么
用户把 Kels 改成 Kiosk,系统不该只保存最后那五个字母。一次完整的学习至少包含:
- 正确偏好词是
Kiosk; - 这一次原始识别曾经是
Kels; - 这条偏好是用户亲手确认的,不是软件猜的;
- 它以后被提示过多少次,是否真的减少了重复纠正;
- 如果它导致误改,用户可以停用和删除。
这些不是训练全世界的公共语料。它们描述的是一个人的口音、工作和习惯,所以应该优先留在本机。
另一个人可能真的在说 Kels,不能因为我说不好 Kiosk,就让他的文字也被改掉。
“越用越准”必须能证明
这个词很容易被当成营销话术。今天用模型 A,明天换模型 B,也可以说“更准了”;但那不叫越用越准, 因为同一个新用户也能得到相同结果。
真正的检验方法应该是:
- 同一个人反复纠正同一个词的次数有没有下降;
- 使用一段时间后,零修改就能直接使用的口述有没有增加;
- 某个偏好被 AI 采用后,用户有没有再次把它改回去;
- 错误提示能不能被看见、撤销,并让系统以后更谨慎。
如果这些数字没有随使用改善,就说明我们只是把词丢给了 AI,没有建成学习闭环。
这才是 Xtype 应该拥有的能力
今天 Xtype 已经有纠正、本机词库和识别前提示。你改过的正确词可以留在这台 Mac 上,下一次参与识别。
更完整的“私有语言偏好引擎”还在建设:从当前原始稿检索相关偏好,把少量候选放进第二次整理,再用 后续纠正判断它有没有真正帮上忙。它在通过代码复核、真机测试和版本发布之前,不算已经交付。
但方向已经很清楚:Xtype 不需要假装自己能训练 Grok。Xtype 要做的是一套工具,让每个用户教过一次以后, 那次纠正不再白费。
不是模型越来越认识所有人,而是这台电脑越来越认识你。
这条流程全部开放,请你来挑毛病
我们就是做工具的。这条学习流程没有黑匣子,每一步都摆在 App 里让你看:
- 你在「纠正」里改了什么,候选词从哪来;
- 词典里每个词后面括号标着当初听错的写法(
Kiosk(Kels)),一眼知道它为什么在这; - 哪些词已入选、正在随麦带给识别,哪些还在等你批准;
- 别名替换发生时,状态栏写明「替换了几处」,可停用、可删除。
这套设计一定有想得不周的地方。用着别扭、逻辑不对、或者你觉得学习闭环里缺了哪一环—— 在 App 里点「AI 提需求」直接说,或写信 [email protected]。 你提的意见会进入每天的整理流程,被真人读到。