Skip to content

Commit f33a902

Browse files
committed
Update blog
1 parent ed27531 commit f33a902

1 file changed

Lines changed: 1 addition & 1 deletion

File tree

source/_posts/2025/07/大语言模型训练原理与实践(七):grpo算法.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -211,7 +211,7 @@ def __getitem__(self, idx):
211211

212212
训练曲线:
213213

214-
<img src="https://blogfiles.oss.fyz666.xyz/png/cd33ab82-0cc9-4a4b-ad91-9f80638526d9.png" style="zoom:50%;" />
214+
<img src="https://blogfiles.oss.fyz666.xyz/png/cd33ab82-0cc9-4a4b-ad91-9f80638526d9.png" style="zoom:30%;" />
215215

216216
注意到总体 Reward 还是在上升的,并且我们还分别记录观察了三个独立的Reward函数的变化趋势,发现模型在准确率、格式方面都有所提升,唯独这个Soft Format在上升到一定程度后有所下降,观察到模型有时会重复输出answer的闭合tag:`</answer>`,目前还不知道是什么原因(明明给了一定的惩罚?)。
217217

0 commit comments

Comments
 (0)