打开天窗:374 句口述、1493 个词、1 条别名

2026-08-29 更新:这篇里「词库会随麦作为提示带给识别引擎」的说法,从 0.1.111 起不再成立。真机事故:Grok 识别在列举语境里把几十个词库提示当成了用户说过的话,直接抄进原始转写。现在第一遍识别只听音频、不接收词库;个人常错词改在识别之后按当前句实际命中来匹配,再交给整理 AI。

词典没有被删,「越用越准」也没有变——变的是它参与的时机:从「事前提示」挪到「事后纠正」。经过见 词典自己开口说话了。

上一篇《越用越准,不是换一个更强的模型》讲了流程。流程讲完总有一句反问:空口无凭,数据呢?

行。这是 James 自己这台 Mac 上,今天(2026-08-24)的全部学习数据。不是挑好看的展示, 是原样摊开——连我们自己的毛病一起。

全部家底

数据数量说明
口述会话374 句(368 句成功)正文只在本机,不公开——那是工作内容,不是流程数据
词典词条1493 个从口述和纠正里自动抽取 + 手加
人工纠正22 次每次纠正都是一份学习原料
别名1 条Kels → Kiosk,待批准,命中 0 次

Kiosk 那条别名,数据库里长这样

CREATE TABLE aliases (
    wrong TEXT PRIMARY KEY,
    right_term TEXT NOT NULL,
    approved INTEGER NOT NULL DEFAULT 0,
    created_at REAL NOT NULL,
    hits INTEGER NOT NULL DEFAULT 0
);
-- 实际数据(一条不多一条不少):
-- Kels | Kiosk | approved=0 | hits=0

approved=0:James 还没批准它,所以它现在不生效——候选默认不动手,这是设计。 hits=0:它还没帮上过忙。等它开始工作,这个数字会记下它每一次替换; 如果它误伤,停用和删除的按钮就在词典页。「越用越准」是否成立,看这些数字,不看形容词。

词典里都是什么词

真实样本(这些名字 James 在公开博客里本来就提过):

Kuvex · Hante · Sunmi · Elavon · Fiserv · Tsys · Kozen
CR100 · D3Pro · P3Mix · P3H · CPadPay · ISV · Agent

这就是一个做支付的人的日常词汇。通用模型不认识 Kuvex,也分不清 P3Mix 和 P3H—— 这些词进了词典、随麦带给识别,才是「这台电脑认识你」的物质基础。

数据里我们自己的毛病,也摊开

原样贴两条真实词条:

Keyus是类似的      ← 这不是词,是纠正时被切碎的句子片段
汉特支付公司 在做   ← 同上,抽取规则过宽的产物

1493 个词里混着这样的碎片。抽取规则还不够聪明,这是已知问题—— 写在这里,不是等被人发现才承认。开放数据的头一天,数据里就有毛病,这才是真实的产品。

让大家参与进来

我们就是做工具的,没有魔法。你可以:

你的数据永远只在你的机器上——这篇公开的是 James 自己的,他愿意。