2026-08-29 更新:这篇里「词库会随麦作为提示带给识别引擎」的说法,从 0.1.111 起不再成立。真机事故:Grok 识别在列举语境里把几十个词库提示当成了用户说过的话,直接抄进原始转写。现在第一遍识别只听音频、不接收词库;个人常错词改在识别之后按当前句实际命中来匹配,再交给整理 AI。
词典没有被删,「越用越准」也没有变——变的是它参与的时机:从「事前提示」挪到「事后纠正」。经过见 词典自己开口说话了。
真实案例:对着 Xtype 说「真机验收」,出来的是「增肌验收」。说「Tsys」,出来的是「TCS」。说六遍「真机」,五遍对,第六遍还是飘。
这不是某家引擎的锅,是行业通病:中文夹英文术语 + 小众专有名词,训练数据里就少,模型只能靠猜。而恰恰是天天说「把这个 PR merge 到 master」的人,最需要语音输入。
通用引擎解决不了的,个人化能解决。Xtype 的做法:
本机个人词库。 你的专有名词——公司名、项目名、行业黑话——存在这台 Mac 上;每次开麦,最相关的词会作为提示带给识别引擎。说过「Tsys」教过一次,下次就不再是「TCS」。
纠正闭环。 历史里任何一条都能「纠正」:改对文字,Xtype 自动找出你改动的中英文词,勾选进词库。英文候选默认全选(术语拼错最多、喂词收效最快),中文默认不选、要哪个点哪个。
词典透明可管。 一行一词,看得见每个词什么时候、从哪来(口述抽出/纠正学到/手加),随时改、随时删。
这些数据全部只在本机——它们既是你的隐私,也是别人拿不走的准确率。你的 Mac 越用越懂你说话的方式,这正是我们相信的护城河方向。