2026-08-29 更新:这篇里「词库会随麦作为提示带给识别引擎」的说法,从 0.1.111 起不再成立。真机事故:Grok 识别在列举语境里把几十个词库提示当成了用户说过的话,直接抄进原始转写。现在第一遍识别只听音频、不接收词库;个人常错词改在识别之后按当前句实际命中来匹配,再交给整理 AI。
词典没有被删,「越用越准」也没有变——变的是它参与的时机:从「事前提示」挪到「事后纠正」。经过见 词典自己开口说话了。
上一篇《越用越准,不是换一个更强的模型》讲了流程。流程讲完总有一句反问:空口无凭,数据呢?
行。这是 James 自己这台 Mac 上,今天(2026-08-24)的全部学习数据。不是挑好看的展示, 是原样摊开——连我们自己的毛病一起。
全部家底
| 数据 | 数量 | 说明 |
|---|---|---|
| 口述会话 | 374 句(368 句成功) | 正文只在本机,不公开——那是工作内容,不是流程数据 |
| 词典词条 | 1493 个 | 从口述和纠正里自动抽取 + 手加 |
| 人工纠正 | 22 次 | 每次纠正都是一份学习原料 |
| 别名 | 1 条 | Kels → Kiosk,待批准,命中 0 次 |
Kiosk 那条别名,数据库里长这样
CREATE TABLE aliases (
wrong TEXT PRIMARY KEY,
right_term TEXT NOT NULL,
approved INTEGER NOT NULL DEFAULT 0,
created_at REAL NOT NULL,
hits INTEGER NOT NULL DEFAULT 0
);
-- 实际数据(一条不多一条不少):
-- Kels | Kiosk | approved=0 | hits=0
approved=0:James 还没批准它,所以它现在不生效——候选默认不动手,这是设计。
hits=0:它还没帮上过忙。等它开始工作,这个数字会记下它每一次替换;
如果它误伤,停用和删除的按钮就在词典页。「越用越准」是否成立,看这些数字,不看形容词。
词典里都是什么词
真实样本(这些名字 James 在公开博客里本来就提过):
Kuvex · Hante · Sunmi · Elavon · Fiserv · Tsys · Kozen
CR100 · D3Pro · P3Mix · P3H · CPadPay · ISV · Agent
这就是一个做支付的人的日常词汇。通用模型不认识 Kuvex,也分不清 P3Mix 和 P3H—— 这些词进了词典、随麦带给识别,才是「这台电脑认识你」的物质基础。
数据里我们自己的毛病,也摊开
原样贴两条真实词条:
Keyus是类似的 ← 这不是词,是纠正时被切碎的句子片段
汉特支付公司 在做 ← 同上,抽取规则过宽的产物
1493 个词里混着这样的碎片。抽取规则还不够聪明,这是已知问题—— 写在这里,不是等被人发现才承认。开放数据的头一天,数据里就有毛病,这才是真实的产品。
让大家参与进来
我们就是做工具的,没有魔法。你可以:
- 在自己的 Xtype 里打开词典,对照这篇看你自己的数据长什么样;
- 觉得学习闭环缺了哪一环、哪个数字该公开没公开——App 里点「AI 提需求」直接说, 或写信 [email protected];
- 以后每当我们说「越用越准」,都会像这篇一样带上原始数字。说到做不到,你拿这篇对质。
你的数据永远只在你的机器上——这篇公开的是 James 自己的,他愿意。