首页 / 资讯中心 / 文章详情

Stata 新命令 sreg:随机实验的回归系数未必是你关心的平均效应

Stata 新命令 sreg:随机实验的回归系数未必是你关心的平均效应 ★ FEATURED ARTICLE
温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。作者丁闪闪 (连享会)邮箱lianxhcn163.comTitle: Stata 新命令 sreg随机实验的回归系数未必是你关心的平均效应Keywords: sreg, 分层随机实验, 平均处理效应, 协变量调整, Stata提要分层随机实验中固定效应回归给各层分配多少权重既取决于该层人数也取决于该层获得处理的比例。当各层处理比例和处理效应都有差异时回归系数就未必等于按人数汇总的平均效应。本文以课外辅导实验为例介绍如何用sreg汇总各层效应、利用实验前特征提高估计精度并计算适合分层实验的标准误。1. 随机实验中的估计问题分析随机实验时一个常见的想法是既然处理已经随机分配直接比较处理组和对照组的平均结果就可以了没有必要再控制其他变量。按这个思路做一个 t 检验或将结果变量对处理状态做简单回归就能判断干预是否有效。但在分层实验中处理只在各层内部随机分配。例如先按学期初成绩将学生分层再随机分配辅导机会。如果成绩较好的一层获得辅导的比例更高合并各层以后辅导组中原本成绩较好的学生就会更多。直接比较两组期末均分就难以分清有多少差异来自辅导有多少来自原有成绩。加入分层固定效应可以处理这种学生构成差异但还要看回归给各层分配了多少权重以及标准误怎样计算。Bugni、Canay 和 Shaikh (2019) 对这些问题作了系统分析。同样一份随机实验数据回归给各层的权重不同算出的平均效应就可能不同。本文通过课外辅导实验解释这种差异并介绍sreg的用法。这个命令可以汇总各层处理效应利用实验前变量提高估计精度并按实验设计计算标准误。使用这些方法的前提是处理确实经过随机分配不能仅靠加入分组变量就把观察性数据当作随机实验分析。1.1 课外辅导实验假设研究者想知道一个学期的数学课外辅导能否提高同年级学生的期末数学成绩。学期开始时先让参加实验的 200 名学生参加统一测试将学期初成绩记为 XiXi​。测试在辅导开始前完成成绩不会受到本次辅导的影响。研究者按学期初成绩将学生分成两层不低于 70 分的 100 人属于第一层低于 70 分的另外 100 人属于第二层。随后从第一层随机选出 50 人从第二层随机选出 10 人向他们提供课外辅导。其余学生照常学习不参加这项额外辅导。两层的辅导比例故意设为不同便于说明它对效应估计的影响这只是教学设定不是实际分配辅导名额的建议。辅导从学期初测试后开始持续至学期末。全部学生在学期末参加同一套数学考试成绩记为 YiYi​。用 DiDi​ 记录随机分配结果获得辅导机会时取 1否则取 0用 SiSi​ 记录分层取值为 1 或 2。为简化讨论假定获得机会的学生都参加辅导其他学生不参加所有学生都完成期末考试辅导内容也没有在两组之间传播。分析时期末成绩 YiYi​ 是结果变量随机分配状态 DiDi​ 是处理变量学期初成绩 XiXi​ 可以作为控制变量。我们关心获得辅导机会相对于未获得辅导机会对期末成绩有多大影响。仅看学生的成绩比学期初增加多少不能将这些变化都归因于辅导。1.2 两种比例这里要区分两种比例。每层学生占全体实验学生的比例决定汇总效应时该层占多大权重两层各有 100 人因此各占 50%。每层内部获得辅导机会的比例描述名额怎样分配第一层为 50%第二层为 10%。记全部实验学生人数为 nn第 ss 层有 nsns​ 人其中 n1sn1s​ 人获得辅导机会。这两种比例分别为q^snsn,π^sn1sns.q​s​nns​​,πs​ns​n1s​​.下标 1s1s 中的 1 表示辅导组ss 表示所在层。本例中q^1q^20.5q​1​q​2​0.5而 π^10.5π1​0.5、π^20.1π2​0.1。汇总各层效应时按学生人数加权用的是 q^sq​s​不能将它与层内辅导比例 π^sπs​ 混淆。实验分层学期初成绩本层人数占全部学生的比例辅导人数对照人数层内辅导比例第一层 Si1Si​1不低于 70 分10050%505050%第二层 Si2Si​2低于 70 分10050%109010%图中每个色块代表 10 名学生蓝色为辅导组橙色为对照组。两层都占全体学生的一半所以按人数汇总效应时各用 50% 的权重图中 50% 和 10% 的辅导比例描述的是另一件事即各层怎样分配名额。这张图从已参加实验的 200 名学生开始没有展示抽取学生的过程。分层抽样与分层随机分配也要区分。前者决定从总体中抽取哪些学生参加实验后者决定入选学生中谁获得辅导机会。本文主要讨论后者。strata()应填写随机分配辅导机会时使用的分层变量调查抽样所用的分组只有同时用于随机分配时才有这个含义。具体条件可参阅sreg帮助文件和 Bugni 等 (2019)。1.3 简单均值比较的问题假设这 200 名学生的期末均分如下。表中数字是为解释计算方法而设定的不是真实实验结果也不用于显著性检验。分层辅导组期末均分对照组期末均分层内均值差第一层82802第二层706010在第一层辅导组的期末均分比对照组高 2 分在第二层高 10 分。把所有辅导学生合在一起平均分为 (50×8210×70)/6080(50×8210×70)/6080 分所有对照学生的平均分为 (50×8090×60)/140≈67.14(50×8090×60)/140≈67.14 分。两者相减得到约 12.86 分比任何一层的均值差都大。差别来自两组学生的构成。辅导组中50/60≈83.3%50/60≈83.3% 的学生来自学期初成绩较高的第一层对照组中这一比例只有 50/140≈35.7%50/140≈35.7%。因此12.86 分既包含辅导带来的差异也包含两组原有成绩不同带来的差异。围绕这个数做 t 检验只是在检验两组均值是否不同无法剔除学生构成的影响。要估计全体学生的平均辅导效果需要先计算各层的均值差再确定怎样加权。标准误也应针对这个加权后的估计量计算。2. 分层效应与权重2.1 按学生占比汇总两层学生各占一半。要估计全体学生的平均辅导效果就给两个层内均值差各 50% 的权重τ^0.5×20.5×106.τ0.5×20.5×106.这个估计的含义是与未获得辅导机会相比获得辅导机会使期末数学成绩平均提高约 6 分。它按两层学生各占一半计算不表示每名学生都提高 6 分也不是期末成绩相对学期初成绩增加了 6 分。上述计算可以推广到更多分层。用 Yi(1)Yi​(1) 和 Yi(0)Yi​(0) 分别表示学生获得和未获得辅导机会时的潜在期末成绩。设第 ss 层在总体中的占比为 qsqs​该层平均效应为 τsE[Yi(1)−Yi(0)∣Sis]τs​E[Yi​(1)−Yi​(0)∣Si​s]则总体平均效应为τE[Yi(1)−Yi(0)]∑s1Hqsτs,τE[Yi​(1)−Yi​(0)]s1∑H​qs​τs​,其中HH 是分层数量。后文假定实验对象从目标总体中随机抽取用样本中的学生占比 q^sns/nq​s​ns​/n 估计总体占比。前面的例子恰好每层各有 100 人如果重新抽取一批学生各层人数未必仍然相同。第 ss 层辅导组与对照组的期末均分分别为 Yˉ1sYˉ1s​ 和 Yˉ0sYˉ0s​两者之差为 τ^sYˉ1s−Yˉ0sτs​Yˉ1s​−Yˉ0s​。按各层学生占比加权得到总体平均效应的估计量τ^∑s1Hq^sτ^s∑s1Hnsn(Yˉ1s−Yˉ0s).τs1∑H​q​s​τs​s1∑H​nns​​(Yˉ1s​−Yˉ0s​).这个公式仍然是先作层内比较再按学生占比汇总。在个体层面随机分配、每层人数较多且不加入控制变量时sreg就按这个公式计算点估计。理论条件见 Bugni 等 (2019)程序计算方法见 估计量说明。如果刻意多抽取某类学生就不能直接用样本占比代表总体占比。例如两类学生在总体中各占一半样本中却分别占 80% 和 20%仍按样本比例加权就会偏离两类学生等权的目标。这时还需要根据抽样方式确定总体权重sreg无法仅凭分层变量知道两类学生在外部总体中的真实比例。温馨提示若页面不能正常显示数学公式和代码请阅读原文获得更好的阅读体验。
阅读完成 · 觉得有帮助?
咨询建站