Skip to content

Commit 6d9c47b

Browse files
authored
Expand README with project positioning and comparisons
Add section on project positioning and relationships with related works, including detailed comparisons and clarifications on the project's focus and goals.
1 parent 13a7ba8 commit 6d9c47b

1 file changed

Lines changed: 33 additions & 4 deletions

File tree

README.md

Lines changed: 33 additions & 4 deletions
Original file line numberDiff line numberDiff line change
@@ -53,6 +53,34 @@ AI 以协作工具的身份参与了部分计算推演;而所有结论的灵
5353
| 层级聚合 | 沿球树层级混合 value,保留超度量球嵌套结构 |
5454
| VAPO / GIST | 离散 $\ell$ 上无梯度的扰动式学习(v-PuNNs 路径) |
5555

56+
## 定位:与其他相关项目的关系
57+
58+
本仓库从**验证**角度处理 p-adic/超度量 attention:唯一交付物是「树 softmax + 层级聚合」这一
59+
**完整超度量 attention 结构**的数学自洽性验证(显式性质 + 定理证明 + 双库数值核验)。它与两个
60+
同样涉及「p-adic/超度量 + 深度学习」但目标不同的公开项目**互补而不交叉**,对比如下:
61+
62+
| 维度 | 本仓库(ultrametric-verification) | [model_guided_research](https://github.com/Dicklesworthstone/model_guided_research) | [v-PuNNs-HiPaN](https://github.com/ReFractals/v-PuNNs-HiPaN) |
63+
|------|------------------------------------|----------------------------------------------|---------------------------------------------------|
64+
| 目的 | 验证超度量 attention 的数学是否自洽 | 在完整 GPT 中尝试 11 种 exotic attention 机制 | 在层级分类任务上跑 v-PuNNs,做 SOTA |
65+
| 是否做 Attention | ✅ 是(树 softmax) | ✅ 是(其中的一种可切换机制) | ❌ 否(逐深度分类,非 attention) |
66+
| 数学结构 | 树 softmax:层级竞争归一化,**标准 softmax 的严格推广** | LCP-kernel:直接 `α^lcp(q,k)`,无层级归一化 | p-adic 特征球神经元 |
67+
| 采用方式 | **整条 attention 用超度量结构**(非众多替代之一) | 作为 11 种可选机制之一(`--attention-type` 切换) | 分类器主体为 p-adic 球 |
68+
| 交付形态 | 纯验证脚本 + 定理/证明,**无模型** | 生产级 GPT(nanochat)+ 训练基础设施 | Jupyter 分类实验 + 论文定理 |
69+
| 数据 | 纯合成(随机树/得分);无真实任务 | 文本语料(训练 nanochat) | WordNet / Gene Ontology 等真实层级数据 |
70+
| 与标准 attention 关系 | 严格推广(单层可精确退化) | 替代机制(drop-in) | 不适用 |
71+
72+
三点说明,保持与本仓库定位一致:
73+
74+
- **不做模型、不跑 SOTA、不是替代实现**。本仓库不提供可插入生产 Transformer 的 attention 内核,
75+
也不在真实数据上比准确率;这些是上面两仓各自的目标。这里只回答一个问题:**在一个完全采用
76+
超度量结构的 attention 里,树 softmax 这一层级归一化在数学上是否良定义、是否按预期退化、数值与
77+
梯度结构是否如定理所述**
78+
- **全量而非部分采用**。与本仓库相关的是「树 softmax / 层级聚合」这条完整结构,而非把某种
79+
p-adic kernel 作为备选机制接入既有模型。因此验证对象是整条结构的性质(归一化、退化、剪枝、
80+
可微性、稀疏梯度),而非某一种 kernel 的可行性。
81+
- **VAPO/GIST 的边界**。本仓库的 VAPO 是一份**最小化合成实验**,用于检查"离散 ℓ 上无梯度学习
82+
是否至少可行、以及是否依赖指数得分放大",不是真实任务 benchmark(后者见 v-PuNNs-HiPaN)。
83+
5684
## 双库互证
5785

5886
|| 角色 | 说明 |
@@ -100,13 +128,14 @@ python verification/validate_math_vapo_discrete_learning.py
100128
| A1-A6 | pruning 等权保持(乘法平衡)、球权恒等式、深度数值精度、剪枝树梯度零块 ||
101129
| W1/B1-B3/L1-L2 | W_B=max 结构、B 模式层级加解析式、线性 Φ 语义界限 ||
102130

103-
26+ 验证项、21 单库 / 20 双库全部 PASS。**核心结论**:树 softmax 是良定义的概率映射,且是
104-
标准 softmax 的严格推广;剪枝树保持可微性与稀疏梯度结构。
131+
26+ 验证项、21 单库 / 20 双库全部 PASS**20 个固定种子****核心结论**:树 softmax 是良定义的概率映射,且是
132+
标准 softmax 的严格推广;剪枝树保持可微性与稀疏梯度结构。VAPO 采用两级统计协议(详见下节)。
105133

106134
### VAPO 离散学习(`verification/validate_math_vapo_discrete_learning.py`
107135

108-
离散 $\ell$ 上学习 target key 的实验中,**p^ℓ 指数得分下 VAPO/GIST 可收敛(2-key 40–60%、4-key 80–100%),
109-
linear 得分下收敛率≈0**——结论:无梯度扰动学习可行 ⟺ 得分函数提供指数放大。
136+
离散 $\ell$ 上学习 target key 的实验中,在**两级统计协议**(R=10 次独立运行 × 每次 5 试次,步数 4000-8000)下,
137+
**p^ℓ 指数得分下 VAPO/GIST 可收敛(VAPO 2-key 82% / GIST 2-key 84% / VAPO 4-key 96% / GIST 4-key 90%,平均 88%),
138+
linear 得分下收敛率≈0-22%**——结论:无梯度扰动学习可行 ⟺ 得分函数提供指数放大。
110139

111140
## 参考与灵感来源(References)
112141

0 commit comments

Comments
 (0)