@@ -53,6 +53,34 @@ AI 以协作工具的身份参与了部分计算推演;而所有结论的灵
5353| 层级聚合 | 沿球树层级混合 value,保留超度量球嵌套结构 |
5454| VAPO / GIST | 离散 $\ell$ 上无梯度的扰动式学习(v-PuNNs 路径) |
5555
56+ ## 定位:与其他相关项目的关系
57+
58+ 本仓库从** 验证** 角度处理 p-adic/超度量 attention:唯一交付物是「树 softmax + 层级聚合」这一
59+ ** 完整超度量 attention 结构** 的数学自洽性验证(显式性质 + 定理证明 + 双库数值核验)。它与两个
60+ 同样涉及「p-adic/超度量 + 深度学习」但目标不同的公开项目** 互补而不交叉** ,对比如下:
61+
62+ | 维度 | 本仓库(ultrametric-verification) | [ model_guided_research] ( https://github.com/Dicklesworthstone/model_guided_research ) | [ v-PuNNs-HiPaN] ( https://github.com/ReFractals/v-PuNNs-HiPaN ) |
63+ | ------| ------------------------------------| ----------------------------------------------| ---------------------------------------------------|
64+ | 目的 | 验证超度量 attention 的数学是否自洽 | 在完整 GPT 中尝试 11 种 exotic attention 机制 | 在层级分类任务上跑 v-PuNNs,做 SOTA |
65+ | 是否做 Attention | ✅ 是(树 softmax) | ✅ 是(其中的一种可切换机制) | ❌ 否(逐深度分类,非 attention) |
66+ | 数学结构 | 树 softmax:层级竞争归一化,** 标准 softmax 的严格推广** | LCP-kernel:直接 ` α^lcp(q,k) ` ,无层级归一化 | p-adic 特征球神经元 |
67+ | 采用方式 | ** 整条 attention 用超度量结构** (非众多替代之一) | 作为 11 种可选机制之一(` --attention-type ` 切换) | 分类器主体为 p-adic 球 |
68+ | 交付形态 | 纯验证脚本 + 定理/证明,** 无模型** | 生产级 GPT(nanochat)+ 训练基础设施 | Jupyter 分类实验 + 论文定理 |
69+ | 数据 | 纯合成(随机树/得分);无真实任务 | 文本语料(训练 nanochat) | WordNet / Gene Ontology 等真实层级数据 |
70+ | 与标准 attention 关系 | 严格推广(单层可精确退化) | 替代机制(drop-in) | 不适用 |
71+
72+ 三点说明,保持与本仓库定位一致:
73+
74+ - ** 不做模型、不跑 SOTA、不是替代实现** 。本仓库不提供可插入生产 Transformer 的 attention 内核,
75+ 也不在真实数据上比准确率;这些是上面两仓各自的目标。这里只回答一个问题:** 在一个完全采用
76+ 超度量结构的 attention 里,树 softmax 这一层级归一化在数学上是否良定义、是否按预期退化、数值与
77+ 梯度结构是否如定理所述** 。
78+ - ** 全量而非部分采用** 。与本仓库相关的是「树 softmax / 层级聚合」这条完整结构,而非把某种
79+ p-adic kernel 作为备选机制接入既有模型。因此验证对象是整条结构的性质(归一化、退化、剪枝、
80+ 可微性、稀疏梯度),而非某一种 kernel 的可行性。
81+ - ** VAPO/GIST 的边界** 。本仓库的 VAPO 是一份** 最小化合成实验** ,用于检查"离散 ℓ 上无梯度学习
82+ 是否至少可行、以及是否依赖指数得分放大",不是真实任务 benchmark(后者见 v-PuNNs-HiPaN)。
83+
5684## 双库互证
5785
5886| 库 | 角色 | 说明 |
@@ -100,13 +128,14 @@ python verification/validate_math_vapo_discrete_learning.py
100128| A1-A6 | pruning 等权保持(乘法平衡)、球权恒等式、深度数值精度、剪枝树梯度零块 | ✅ |
101129| W1/B1-B3/L1-L2 | W_B=max 结构、B 模式层级加解析式、线性 Φ 语义界限 | ✅ |
102130
103- 26+ 验证项、21 单库 / 20 双库全部 PASS。** 核心结论** :树 softmax 是良定义的概率映射,且是
104- 标准 softmax 的严格推广;剪枝树保持可微性与稀疏梯度结构。
131+ 26+ 验证项、21 单库 / 20 双库全部 PASS( ** 20 个固定种子 ** ) 。** 核心结论** :树 softmax 是良定义的概率映射,且是
132+ 标准 softmax 的严格推广;剪枝树保持可微性与稀疏梯度结构。VAPO 采用两级统计协议(详见下节)。
105133
106134### VAPO 离散学习(` verification/validate_math_vapo_discrete_learning.py ` )
107135
108- 离散 $\ell$ 上学习 target key 的实验中,** p^ℓ 指数得分下 VAPO/GIST 可收敛(2-key 40–60%、4-key 80–100%),
109- linear 得分下收敛率≈0** ——结论:无梯度扰动学习可行 ⟺ 得分函数提供指数放大。
136+ 离散 $\ell$ 上学习 target key 的实验中,在** 两级统计协议** (R=10 次独立运行 × 每次 5 试次,步数 4000-8000)下,
137+ ** p^ℓ 指数得分下 VAPO/GIST 可收敛(VAPO 2-key 82% / GIST 2-key 84% / VAPO 4-key 96% / GIST 4-key 90%,平均 88%),
138+ linear 得分下收敛率≈0-22%** ——结论:无梯度扰动学习可行 ⟺ 得分函数提供指数放大。
110139
111140## 参考与灵感来源(References)
112141
0 commit comments