|
4 | 4 | "cell_type": "markdown", |
5 | 5 | "metadata": {}, |
6 | 6 | "source": [ |
7 | | - "# 02 - 随机实验\n", |
8 | | - "\n", |
| 7 | + "---\n", |
| 8 | + "title: \"第二章: 随机试验\"\n", |
| 9 | + "date: \"2026-03-02\"\n", |
| 10 | + "jupyter: python3\n", |
| 11 | + "author: \"CausalInferenceIntro\"\n", |
| 12 | + "lang: zh-CN\n", |
| 13 | + "execute:\n", |
| 14 | + " echo: true\n", |
| 15 | + " warning: false\n", |
| 16 | + "format:\n", |
| 17 | + " html:\n", |
| 18 | + " toc: true\n", |
| 19 | + " toc-depth: 3\n", |
| 20 | + " code-fold: false\n", |
| 21 | + "---\n" |
| 22 | + ] |
| 23 | + }, |
| 24 | + { |
| 25 | + "cell_type": "markdown", |
| 26 | + "metadata": {}, |
| 27 | + "source": [ |
9 | 28 | "## 黄金标准\n", |
10 | 29 | "\n", |
11 | 30 | "在上一节中,我们看到了关联关系与因果关系为什么不同。我们还看到了使关联成为因果关系所需的条件。\n", |
12 | 31 | "\n", |
13 | | - "$\n", |
| 32 | + "$$\n", |
14 | 33 | "E[Y|T=1] - E[Y|T=0] = \\underbrace{E[Y_1 - Y_0|T=1]}_{ATT} + \\underbrace{\\{ E[Y_0|T=1] - E[Y_0|T=0] \\}}_{BIAS}\n", |
15 | | - "$\n", |
| 34 | + "$$\n", |
16 | 35 | "\n", |
17 | 36 | "\n", |
18 | | - "回顾一下,如果没有偏差,关联就会变成因果关系。如果 \\\\(E[Y_0|T=0]=E[Y_0|T=1]\\\\),就不会有偏差。换句话说,如果干预组和对照组相同或具有可比性,除了他们接受的干预外,关联将是因果关系。或者,用更专业的话说,当未处理的结果等于处理的反事实结果时。请记住,如果他们没有接受干预,这个反事实结果将是干预组的结果。\n", |
| 37 | + "回顾一下,如果没有偏差,关联就会变成因果关系。如果 $E[Y_0|T=0]=E[Y_0|T=1]$,就不会有偏差。换句话说,如果干预组和对照组相同或具有可比性,除了他们接受的干预外,关联将是因果关系。或者,用更专业的话说,当未处理的结果等于处理的反事实结果时。请记住,如果他们没有接受干预,这个反事实结果将是干预组的结果。\n", |
19 | 38 | "\n", |
20 | 39 | "我认为我们在使用数学解释如何使关联等于因果关系方面做得还不错。但这只是个理论。现在,我们来看看我们必须使偏差消失的第一个工具:**随机实验**。随机实验包括将群体中的个体随机分配到干预组或对照组。接受干预的比例不必是 50%。您可以进行一个实验,其中只有 10% 的样本得到处理。\n", |
21 | 40 | "\n", |
22 | 41 | "随机化通过使潜在结果独立于干预来消除偏见。\n", |
23 | 42 | "\n", |
24 | | - "$\n", |
| 43 | + "$$\n", |
25 | 44 | "(Y_0, Y_1) \\perp\\!\\!\\!\\perp T\n", |
26 | | - "$\n", |
| 45 | + "$$\n", |
27 | 46 | "\n", |
28 | | - "起初这可能会令人困惑(至少对我来说)。不过别担心,勇敢而真诚的伙伴,我会进一步解释的。如果结果与干预无关,这是否也意味着干预没有效果?嗯,是!但请注意,我不是在谈论结果。相反,我在谈论**潜在**结果。潜在的结果是在干预 (\\\\(Y_1\\\\)) 或控制 (\\\\(Y_0\\\\)) 下结果 **本来**会是怎样的。在随机试验中,我们**不**希望结果**独立**于干预,因为我们认为**干预会导致**结果。但我们希望**潜在**结果独立于干预。\n", |
| 47 | + "起初这可能会令人困惑(至少对我来说)。不过别担心,勇敢而真诚的伙伴,我会进一步解释的。如果结果与干预无关,这是否也意味着干预没有效果?嗯,是!但请注意,我不是在谈论结果。相反,我在谈论**潜在**结果。潜在的结果是在干预 ($Y_1$) 或控制 ($Y_0$) 下结果 **本来**会是怎样的。在随机试验中,我们**不**希望结果**独立**于干预,因为我们认为**干预会导致**结果。但我们希望**潜在**结果独立于干预。\n", |
29 | 48 | "\n", |
30 | 49 | "\n", |
31 | 50 | "\n", |
32 | | - "说潜在的结果独立于干预是说它们在预期中在干预组或对照组中是相同的。简单来说,这意味着干预组和对照组具有可比性。或者知道干预分配并没有给我任何关于干预前结果如何的信息。因此,\\\\((Y_0, Y_1)\\perp T\\\\) 意味着干预是唯一在干预和对照中产生结果差异的因素。要看到这一点,请注意独立性恰好意味着\n", |
| 51 | + "说潜在的结果独立于干预是说它们在预期中在干预组或对照组中是相同的。简单来说,这意味着干预组和对照组具有可比性。或者知道干预分配并没有给我任何关于干预前结果如何的信息。因此,$(Y_0, Y_1)\\perp T$ 意味着干预是唯一在干预和对照中产生结果差异的因素。要看到这一点,请注意独立性恰好意味着\n", |
33 | 52 | "\n", |
34 | | - "$\n", |
| 53 | + "$$\n", |
35 | 54 | "E[Y_0|T=0]=E[Y_0|T=1]=E[Y_0]\n", |
36 | | - "$\n", |
| 55 | + "$$\n", |
37 | 56 | "\n", |
38 | 57 | "正如我们所见,这使得\n", |
39 | 58 | "\n", |
40 | | - "$\n", |
| 59 | + "$$\n", |
41 | 60 | "E[Y|T=1] - E[Y|T=0] = E[Y_1 - Y_0]=ATE\n", |
42 | | - "$\n", |
| 61 | + "$$\n", |
43 | 62 | "\n", |
44 | 63 | "因此,随机化为我们提供了一种在干预和控制之间使用简单差异的方法,并将其称为干预效果。\n", |
45 | 64 | "\n", |
|
50 | 69 | "\n", |
51 | 70 | "危机发生四个月后,许多人想知道引入的更改是否可以维持。毫无疑问,在线学习有其好处。这一次,它更便宜,因为它可以节省房地产和交通费用。它也可以更加数字化,利用来自世界各地的世界一流内容,而不仅仅是来自固定教师。尽管如此,我们仍然需要回答在线学习对学生的学习成绩是否有负面或正面影响。\n", |
52 | 71 | "\n", |
53 | | - "回答这个问题的一种方法是将主要提供在线课程的学校的学生与在传统课堂上授课的学校的学生进行比较。正如我们现在所知,这不是最好的方法。可能是在线学校只吸引纪律严明、成绩高于平均水平的学生,即使课堂表现出色。在这种情况下,我们将有一个正偏差,其中接受干预的学生在学业上比未接受干预的要好:\\\\(E[Y_0|T=1] > E[Y_0|T=0]\\\\)。\n", |
| 72 | + "回答这个问题的一种方法是将主要提供在线课程的学校的学生与在传统课堂上授课的学校的学生进行比较。正如我们现在所知,这不是最好的方法。可能是在线学校只吸引纪律严明、成绩高于平均水平的学生,即使课堂表现出色。在这种情况下,我们将有一个正偏差,其中接受干预的学生在学业上比未接受干预的要好:$E[Y_0|T=1] > E[Y_0|T=0]$。\n", |
54 | 73 | "\n", |
55 | | - "或者,另一方面,可能是在线课程更便宜,并且主要由不太富裕的学生组成,他们可能除了学习之外还需要工作。在这种情况下,这些学生即使参加了预科班,也会比预科学校的学生表现更差。如果是这种情况,我们就会偏向另一个方向,即接受干预的学生在学业上比未接受干预的学生更差:\\\\(E[Y_0|T=1] < E[Y_0|T=0]\\\\)。\n", |
| 74 | + "或者,另一方面,可能是在线课程更便宜,并且主要由不太富裕的学生组成,他们可能除了学习之外还需要工作。在这种情况下,这些学生即使参加了预科班,也会比预科学校的学生表现更差。如果是这种情况,我们就会偏向另一个方向,即接受干预的学生在学业上比未接受干预的学生更差:$E[Y_0|T=1] < E[Y_0|T=0]$。\n", |
56 | 75 | "\n", |
57 | 76 | "所以,虽然我们可以做简单的比较,但不会很有说服力。无论如何,我们永远无法确定是否有任何偏见潜伏并掩盖了我们的因果关系。\n", |
58 | 77 | "\n", |
59 | 78 | "\n", |
60 | 79 | "\n", |
61 | | - "为了解决这个问题,我们需要使处理过和未处理过的具有可比性 \\\\(E[Y_0|T=1] = E[Y_0|T=0]\\\\)。 强制执行此操作的一种方法是将在线课程和演示课程随机分配给学生。 如果我们设法做到这一点,除了他们接受的干预外,是否干预不同场景下的平均情况相同。\n", |
| 80 | + "为了解决这个问题,我们需要使处理过和未处理过的具有可比性 $E[Y_0|T=1] = E[Y_0|T=0]$。 强制执行此操作的一种方法是将在线课程和演示课程随机分配给学生。 如果我们设法做到这一点,除了他们接受的干预外,是否干预不同场景下的平均情况相同。\n", |
62 | 81 | "\n", |
63 | 82 | "幸运的是,一些经济学家已经为我们做到了这一点。 他们将班级随机化,这样一些学生被分配到面对面的讲座,其他人只进行在线讲座,而第三组则进行在线和面对面讲座的混合形式。 在学期末,他们收集了标准考试的数据。\n", |
64 | 83 | "\n", |
|
346 | 365 | "cell_type": "markdown", |
347 | 366 | "metadata": {}, |
348 | 367 | "source": [ |
349 | | - "是的。就这么简单。我们可以看到面对面课程的平均得分为 78.54,而在线课程的平均得分为 73.63。对于在线学习的支持者来说,这不是个好消息。因此,在线课程的 \\\\(ATE\\\\) 为 -4.91。这意味着**在线课程会导致学生的平均成绩降低约 5 分**。就是这样。您不必担心在线课程可能有负担不起面对面课程的贫困学生,或者就此而言,您不必担心来自不同干预方法的学生在任何方面都有所不同他们接受的干预。根据设计,随机实验旨在消除这些差异。\n", |
| 368 | + "是的。就这么简单。我们可以看到面对面课程的平均得分为 78.54,而在线课程的平均得分为 73.63。对于在线学习的支持者来说,这不是个好消息。因此,在线课程的 $ATE$ 为 -4.91。这意味着**在线课程会导致学生的平均成绩降低约 5 分**。就是这样。您不必担心在线课程可能有负担不起面对面课程的贫困学生,或者就此而言,您不必担心来自不同干预方法的学生在任何方面都有所不同他们接受的干预。根据设计,随机实验旨在消除这些差异。\n", |
350 | 369 | "\n", |
351 | 370 | "出于这个原因,一个很好的健全性检查以查看随机化是否正确(或者您是否正在查看正确的数据)是检查干预前变量中的干预变量是否等于未干预变量。在我们的数据中,我们有关于性别和种族的信息,因此我们可以查看它们在不同群体中是否平等。对于 `gender`、`asian`、`hispanic` 和 `white` 变量,我们可以说它们看起来非常相似。然而,`black` 变量看起来有点不同。这引起了人们对小数据集会发生什么的关注。即使在随机化的情况下,也可能是偶然地,一组与另一组不同。在大样本中,这种差异趋于消失。\n", |
352 | 371 | "\n", |
|
0 commit comments