N-gram Gap Regime Bridge
多段式路线图:A 是 original GPT gap 到 current/GPT minimal gap 的 top-down 消融历史;B 是 vanilla nanoGPT 到本地 current-shell 正例的 bottom-up bridge;C 跟踪当前 bottom-up gap 组的已完成单组件消融;D 展示 actual reduced positive、order controls 和 ob-th 探索实验。可获得原始日志的曲线使用全部原生采样:train 为逐 step,validation 与 fixed probe 按各自真实采样频率。缩进虚线节点表示分叉实验,主线表示继续推进的路径。
A. Original GPT Gap → current/GPT Minimal Gap
主线展示如何得到当前最小正例;分叉展示被排除或转为延后现象的路径。
B. Vanilla nanoGPT → Bottom-up Current-shell Gap
从干净负例逐步加入新增机制;旧 bridge 到 current core 仍无目标 gap,切到完整 current shell 后得到本地正例。
C. Bottom-up Gap Group → Single-component Ablations
以本地 current-shell baseline 正例为中心;展示已完成的单组件消融结果。
D. Reduced Positive and Order Controls
段首为当前 bigram+trigram actual reduced positive,随后展示 order controls。Formal OB-TH history10 保留在文件索引中,避免把与 baseline 同配置的机制测量重复显示为另一条路线节点。
E. Epoch-boundary Interventions, Forks, and Optimizer Audits
所有 epoch-1 intervention 默认显示 online train-batch loss 与 sampled validation loss;存在 paired fixed probe 的节点可切换查看。竖线标出实际 epoch boundary;fork suffix 的 epoch 1 来自共同 bootstrap,epoch 2 来自相应 suffix。
F. Frequency-mask Collection: Selectable Online Curves
所有完整遮罩实验在一个交互图内显示;曲线、汇总表与可见 run 都由复选框即时重绘。
所有完成的遮罩 run 现在同图显示。v4/v5/v6 与 20260803 current 分别从各自同一个 step-337 checkpoint 恢复,且每组内共享 optimizer、RNG 和 loader;因此每组内 no-mask 与任一遮罩的差异可以解释为 step 338 后的干预效应。count=0 v3 与 20260729 allgram 均是独立的早期共同 source:它们可以和主组一起观察曲线形状、遮罩剂量和量级,但不应将不同 source 的绝对 gap 当作严格配对差异。
在严格同源组,no-mask 的最后 100 step online gap 为 3.779。只遮罩 B 1–5、T 1–5、B+T 1–5 后分别为 3.409、3.366、2.802(相对降低 9.8%、10.9%、25.9%);B 6–200 为 3.481(降低 7.9%)。联合 1–5 的降低超过两个单支降低之和,说明这次单 fold 中存在非加性,但尚不足以判断普适机制。
count=0 本身有效但较小:B+T count 0 的最后 100 step gap 为 3.654;再加入 B 1–5 或 T 1–5 才出现更大降低。所有这些实验都只是从 epoch 2 开始把所选精确 context 的 n-gram value readout置零;table 行、gate、reader/backbone 及其优化器状态仍继续存在和更新。因此图支持“这些 readout 对 gap 有贡献”,不等价于“已消除这些 context 的 table history”,也不构成低频 bucket 是唯一来源的证明。
20260803 的 0 起点联合遮罩补上了边界与剂量检验。按本图的 native online 曲线口径(同 step 的 val_loss − raw_train_loss),该组 no-mask、B+T 0–200、B+T 0–1000 的 epoch-2 平均 gap 分别为 0.925、0.078、0.031;最后 100 step 分别为 3.727、0.514、0.232。两种遮罩在 step 338 都造成额外的 train-side 边界损害:相对 no-mask,raw train loss 分别高 0.292 与 0.862;对应 validation-side B/T 遮罩率为 42.1%/89.0% 与 72.5%/97.0%。因此 0–200 已大幅压低该组 epoch-2 gap,而扩至 0–1000 主要进一步损害两侧绝对 loss,gap 的边际下降较小。它是 0–200 的联合效应,不能从中分离 count=0 的边际贡献。
20260805 current v3 的窄窗口剂量曲线。三组都从同一个当前代码生成的 step-337 checkpoint 分叉;B+T 0–20、0–50、0–100 的 epoch-2 平均 gap 分别为 0.286、0.180、0.122,epoch-3 平均 gap 分别为 1.351、0.856、0.572,最后 100 step 分别为 1.793、1.161、0.786。对应 validation-side 遮罩率从 17.5%/65.8% 增至 32.6%/83.2%,说明窗口扩大在这次 run 中持续压低 online gap;但三组没有各自同源 no-mask suffix,所以该趋势不能替代严格基线差分。
曲线比较得出的两类效应。
- 低频 readout 对 gap 有直接贡献。
在 v4/v5/v6 的共同 step-337 source 中,no mask与B+T 1–5的比较使最后 100 step gap 从 3.779 降至 2.802。将 count=0 也固定后,B+T count 0与count 0 + B+T 1–5的比较仍显示额外缩小,说明这不是只由未见 context(count=0)驱动的表象;低频的精确 context value readout 本身参与了 gap。 - 遮罩高频 readout 的主效应是 epoch-1 到 epoch-2 的绝对 loss 跃升。
比较count 0 + B+T 1–5与只额外加入高频≥1001的count 0 + B+T (1–5, ≥1001):step 338 的 train loss 明显上移,随后采样到的 validation loss 也更高。这个边界损害表示高频 readout 对两侧预测质量都很重要;它不是“高频单独制造 gap”的证据,而是遮罩高频时叠加在 gap 曲线上的性能代价。 - 两个效应近似可叠加。
count 0 + B+T (1–5, ≥1001)的曲线同时保留count 0 + B+T 1–5已缩小的 gap,并叠加了加入≥1001后的 epoch-boundary loss 跃升。因而低频遮罩的 gap 缩小与高频遮罩的绝对 loss 损害在该单 fold 中呈现为可分辨、近似相加的两个方向,而不是同一种曲线变化。
图中未放入只运行到 step 337 的 epoch-1 selection setup,因为它们没有 suffix,无法形成可比较的 epoch-2/3 gap;所有完成到 step 1000 的遮罩 suffix 均可勾选,默认全部显示,且完整保留 epoch 1。
G. Experiment File Index
--