G*Power 安装与样本量估算:以两独立样本比较为例

从官方下载 G*Power,认识事前功效分析的输入项,并理解效应量和脱落率对样本量的影响。

两组样本、功效曲线和参数卡片组成的原创样本量估算示意图

研究开始前估算样本量,是为了检查计划中的研究能否合理回答问题。G*Power 可做多种统计检验的功效分析,但它不会替研究者决定主要结局、预期效应量或研究设计。下面用“两组独立样本的连续结局”演示软件操作;数值只是练习,不对应真实临床试验。

从项目官网取得软件

进入杜塞尔多夫海因里希·海涅大学的 G*Power 页面,按系统选择 Windows 或 macOS 下载。Windows 版先解压 ZIP,再运行 GPowerNT.exe;若程序提示缺少运行库,可按官网说明处理压缩包中的 Visual C++ 运行库安装文件。不要从不明下载站获取重新封装的安装包。

第一次打开后,先认识四个核心输入:统计检验、分析类型、效应量、显著性水平与目标功效。选择不同检验,样本量的含义可能是每组人数、总人数或配对数,不能只抄最终的一个数字。G*Power 官方手册解释了各分析类型和参数。

事前分析回答的是“如果预期效应和模型假设成立,达到目标功效需要多少观察单位”。它不能证明将来一定会得到显著结果,也不能替代实际研究的招募可行性评估。尤其要区分主要分析单位:若一个人测了多个部位、多个时间点,这些读数通常不能直接当成互相独立的多个人。

做一次事前估算练习

假定主要结局是一个连续变量,两组由不同对象组成,计划比较两组均值。界面中依次选择:

  1. Test familyt tests
  2. Statistical testMeans: Difference between two independent means (two groups);另将 Tail(s) 设为双侧。
  3. Type of power analysisA priori,即在研究开始前由效应量、α 和功效求所需样本量。
  4. Input parameters:练习输入 Cohen’s d = 0.5α = 0.05power = 0.80、两组分配比 1,再点击 Calculate

效应量、显著性水平、目标功效和分配比进入样本量计算的示意图

图 1:示意独立样本 t 检验的输入与输出;实际人数以软件计算和方案复核为准。

输出中的总样本量应连同实际达到的功效和所选检验一起记录。d = 0.5 在这里仅是演示软件的假设,不能因为它“常见”就当作某个疾病或结局的真实效应。正式研究应优先根据既往研究、最小重要差异及其不确定性确定效应量,并解释依据。G*Power 项目论文说明了事前功效分析的用途。

在两组均值比较的常见设定下,标准化效应量可理解为“预期均值差 / 组内标准差”。例如纯数学练习中,预期差 5 个单位、组内标准差约 10 个单位,会得到 d = 0.5。两个数字都应有来源:差值最好与临床或研究上的重要程度相关,标准差可参考设计相近的研究或预实验。若既往研究的样本很少,标准差本身也不稳定,最好用合理范围做敏感性分析。

改变一个假设,看结果怎样变化

固定双侧检验、α 与目标功效,分别尝试较小、基准和较大的效应量。把每次输出整理成表,不应只挑出最省人的一次:

情景 效应量输入 要解释的问题
较小效应 d = 0.3 若真实差异比预想的小,项目还能否实施?
基准效应 d = 0.5 这个差值和标准差是否有可信依据?
较大效应 d = 0.7 是否过于乐观,导致样本量不足?

同等 α 和功效下,较小效应一般需要更多样本。再单独改变目标功效或两组分配比,比较结果;不要在多项参数同时变化时,误以为人数差异完全由一个参数造成。G*Power 的图形功能可以辅助观察趋势,但写方案仍应列明具体输入值、输出值和依据。官方手册介绍了参数与功效图的关系。

别把软件输出直接当招募目标

若预计随访脱落,先得到统计分析所需的完成例数,再根据可论证的脱落比例推算招募数,并把比例来源写进方案。若采用配对测量、聚类随机、重复测量或时间事件结局,上述独立样本 t 检验设置就不适用。对于复杂设计,应使用相应方法并请统计人员复核。

例如预计脱落比例为 r,粗略的招募目标可按 完成例数 ÷ (1-r) 向上取整;这一步应在 G*Power 计算完成后另行做,并分别考虑每组人数。真实研究还要检查筛查失败、方案违背、失访是否被混为同一种“脱落”,以及所选分析方法如何处理不完整数据。公式不能自动解决这些设计问题。

可做一张敏感性表:固定 α 和目标功效,分别输入几个有依据的效应量,观察样本量如何变化。效应量越小,通常需要越多观察对象。报告时写清检验方向、效应量定义、分配比、α、功效、软件版本与额外调整,而不只报告“G*Power 算得 N 人”。

最后请另一位成员按报告中的参数重新输入一次。若复算人数不同,先检查尾数方向、d 的定义、分配比以及抄写时是否把“总样本量”误当“每组样本量”。比起截图中的一个大数字,能让他人复算的参数表更有价值。

写进方案的参数段可以怎样组织

不要直接复制软件窗口截图作为唯一说明。可以按下面的顺序写成一段可复算的方法:主要结局及测量尺度是什么;计划比较哪两组、用双侧还是单侧检验;目标功效与 α 分别是多少;预期差值和标准差来自哪里;由此得到的标准化效应量是多少;软件输出的每组与总人数是多少;最后如何处理不等分配或预期失访。若其中某项没有可靠来源,就应标明它是设计假设,并展示该假设变化时的样本量范围。

常见错误包括把事后功效当成结果可靠性的证明、在看到试验数据后倒推效应量,再宣称研究“本来就足够有力”;或者把某项研究报告的显著 p 值直接当成效应量。效应量是差异大小的量化,显著性水平是分析前设定的错误概率阈值,两者不能互换。G*Power 手册区分了事前与其他功效分析类型。对于多主要结局或序贯设计,还要按完整研究方案考虑多重性与停止规则,单次 t 检验的样本量计算不足以覆盖全部问题。

完成练习后,保存一份包含参数和输出的计算记录。隔几天不看旧截图,从文字参数重新运行一次,若得到同样的结果,说明报告至少具备基本的可复查性。

如果招募能力明显达不到估算人数,不应默默降低目标功效或换成更大的假定效应量来“凑”方案。应回到研究问题,评估延长招募期、增加中心、优化测量精度或改变设计是否可行;改动设计后重新估算,并说明伦理与资源影响。样本量计算是研究规划的一部分,不能用一个软件按钮弥补现实资源与研究目标之间的矛盾。

若主要结局或统计方法在方案定稿后改变,也需要说明原样本量依据是否仍适用;不能沿用旧截图却把正文方法换成另一种检验。

参考资料

— 文章结束 —返回文章列表