File tree Expand file tree Collapse file tree
Expand file tree Collapse file tree Original file line number Diff line number Diff line change 11# 数据清洗、证据切分与编码流程
22
3- 本文说明 PsyLens 如何将多平台公开讨论整理成可分析的数据。展示页采用去工程化表达;本文件保留字段、规则和质量检查细节 。
3+ 本页说明 PsyLens 如何将多平台公开讨论整理成可分析的数据。
44
55## 1. 数据处理目标
66
2929
3030## 3. 候选发现与采集登记
3131
32- 采集阶段先形成候选帖子登记表,记录平台、检索主题、时间窗和讨论入口。真实抓取结果保存在本地缓存中,缓存与登录信息不进入公开仓库 。分析样本保留平台和时间窗等研究字段,公开副本移除可直接定位原帖或账号的字段。
32+ 采集阶段先形成候选帖子登记表,记录平台、检索主题、时间窗和讨论入口。真实抓取结果保存在本地缓存中,缓存与登录信息等不录入公开仓库 。分析样本保留平台和时间窗等研究字段,公开副本移除可直接定位原帖或账号的字段。
3333
34- 当前案例使用三个平台,每个平台选取 120 条样本。等额抽样用于保证跨平台观察时各平台都有足够材料,因此平台样本数相同属于研究设计,不能据此推断平台的真实讨论规模相同 。
34+ 当前案例使用三个平台,每个平台选取 120 条样本。等额抽样用于保证跨平台观察时各平台都有足够材料,因此平台样本数相同属于研究设计,更具体的分析还需考虑平台的真实讨论规模等因素 。
3535
3636## 4. 规则预清洗
3737
7272- 只保留分析、复现与字段解释需要的文本和结构字段;
7373- 公开样本只保存 ` public_text ` ,不再重复保存内容相同的 ` raw_text ` 。
7474
75- 当前公开样本有 240 条日期为空。日期不是证据回溯和编码的必需字段, 因此保留为空;涉及时间趋势分析时,这部分记录不能进入日期比较 。
75+ 当前公开样本有 240 条日期为空(受平台规则影响),不过日期不是证据回溯和编码的必需字段, 因此保留为空;只是涉及时间趋势分析时,这部分样本不能进入日期比较 。
7676
7777## 7. 证据单元切分
7878
8484- 每段去除首尾空白;
8585- 默认长度少于 6 个字符的片段不单独进入候选证据;
8686- 证据文本必须能够在父样本 ` public_text ` 中逐字定位;
87- - 不跨样本拼接,不补写省略信息,不修改原文立场 。
87+ - 严禁跨样本拼接、补写省略信息、修改原文立场 。
8888
8989候选片段随后记录纳入状态:
9090
102102- ` label_source ` :标签来源;
103103- ` review_status ` :标签流程状态。
104104
105- 表层话题和机制使用固定词表。信息不足时,分别使用 ` other_uncertain ` 和 ` uncertain ` 。公开数据中曾有 47 条表层话题为空,规范化过程已统一改为 ` other_uncertain ` ,避免同一含义同时使用空值和暂时保留为不确定值。
105+ 表层话题和机制使用固定词表。信息不足时,分别使用 ` other_uncertain ` 和 ` uncertain ` 。公开数据中有 47 条表层话题为空,规范化过程已统一为 ` other_uncertain ` ,避免同一含义同时使用空值和暂时保留为不确定值。
106106
107107## 9. 质量检查
108108
@@ -163,5 +163,3 @@ python tools/summarize_public_analysis.py \
163163# 运行离线示例流程
164164python tools/run_demo.py --provider mock --output artifacts/demo/run
165165```
166-
167- 生成器只读取公开数据,默认不联网,也不读取 Cookie、Token 或 API Key。
You can’t perform that action at this time.
0 commit comments