JASP 医学统计入门:安装、导入数据与完成 t 检验

用虚构数据认识 JASP 的变量类型、描述性统计、独立样本 t 检验与项目保存。

JASP 风格的数据表、两组点图和统计结果卡片组成的原创示意图

JASP 是可通过图形界面完成常见统计分析的软件。第一次使用时,先确认“每行是什么、变量是什么类型”,再选择检验,比直接点击 t 检验更重要。下面的数据完全虚构,只用来练习操作,不用于医学推断。

安装并打开练习数据

JASP 官方下载页选择对应的系统版本安装。不同系统的安装方式见官网说明;不建议从第三方打包站下载。打开软件后,可先从 File → Open → Data Library 查看自带练习文件,熟悉左侧设置和右侧输出的布局。JASP 入门页说明了数据文件和分析界面的基本结构。

也可以把以下内容保存为 UTF-8 编码的 jasp-practice.csv,再从 Open 导入:

id,group,score
1,A,12
2,A,11
3,A,14
4,A,13
5,A,10
6,A,12
7,B,15
8,B,14
9,B,13
10,B,16
11,B,14
12,B,15

这里每行代表一个独立的虚构对象。id 是编号,group 是类别变量,score 是连续测量值;导入后检查列名、行数和类型图标。若数值列被识别为文本,先检查原 CSV 是否夹杂字母、单位或不一致的缺失编码,再在 JASP 中调整变量类型。类型错误会影响可选分析。JASP 变量类型说明对此有专门提示。

导入后的第一步是对照原文件抽查前后各两行,再检查 id 是否唯一。若同一对象出现两行,可能是重复录入,也可能是真实的两次随访;这两种情况对应完全不同的分析结构。不要只因为软件成功读入 12 行,就认定有 12 个独立样本。

JASP 示例数据中两组原始观察值、均值和变量类型的示意图

图 1:原始点比单独两根均值柱更容易暴露范围与异常值;图中数值与本文 CSV 一致。

先看数据,再做两组比较

先在 Descriptives(描述性统计) 中查看两组样本数、均值、标准差和分布图。确认每组都是 6 行、没有意外的第三组,也没有离谱的录入值。练习数据的 A 组均值为 12,B 组均值为 14.5;如果软件输出不同,优先检查导入和筛选设置。

两组均值差为 2.5 个虚构单位,但这只是样本的描述。图中若存在一个极端值,均值可能明显移动;中位数、最小最大值和逐点图可以帮助检查。真实医学研究还需说明测量仪器、单位、数据清理规则与预设的主要结局。若一个人的多次技术读数被当成几个独立样本,显著性检验会误估不确定性。

然后在 T-Tests → Independent Samples T-Test 中,把 score 放入因变量,把 group 放入分组变量。查看软件提供的假设检查与效应量选项,记录所选的检验形式、均值差、置信区间和各组 N。若是同一对象干预前后各测一次,应使用配对分析,不能把数据排成两列就误当独立样本。JASP 功能表列出了独立样本与配对样本 t 检验;官方教学材料索引提供操作范例。

Student 与 Welch:先看设计和假设

独立样本 t 检验的常见形式包括假定两组总体方差相同的 Student 检验,以及不要求两组方差相同的 Welch 检验。JASP 可在分析面板中选择相应选项;名称或勾选方式会随版本变化。不要只因为方差齐性检验的 p 值略高于某阈值,就宣称两组方差“被证明相同”。应结合组内分布、标准差、样本量不平衡程度及事先写好的分析方案来选。JASP 教学材料提供了相关示例。

核对项目 为什么要看
分组和每组有效 N 排除导入错误、意外筛选与缺失值影响
原始点和离群值 判断均值是否被少数值主导
均值差与 95% 置信区间 了解差异大小及其不确定性
检验类型与效应量 让他人知道使用了哪一组假设

若主要研究问题是“给定年龄和基线严重度后,分组与结果是否相关”,简单 t 检验通常不是完整分析方案;可能需要回归模型或其他设计相适应的方法。软件提供多个按钮,不意味着所有按钮都适合同一份研究数据。

样本很小或分布有明显异常时,单靠一个正态性检验的 p 值不足以证明前提满足。应结合研究设计、原始点图、离群值和分析方案判断;必要时考虑其他方法。这里的 6 对 6 数值只是为了看清按钮和输出,不应据此声称两组在真实世界有差异。

若输出中的 p 值很小,准确表述是“在所用模型及其假设下,这样或更极端的数据与零假设不相容的程度”,它不是“处理有效的概率”。论文结果段应同时给出两组描述性统计、差异及区间,而不是仅写“有统计学意义”。图注要写明每个点代表什么以及误差线的定义。

保存可重新检查的结果

将项目保存为 .jasp 文件,保留数据、分析设置和输出;另存一份原始 CSV。写入论文时记录 JASP 版本、分析类型、缺失值处理及结果解释。图形或表格可以导出用于展示,但不要只存图片而丢掉可复核的项目文件。

交给他人复核时,附上一个短数据字典:id 是否允许重复、A/B 的含义、score 的单位和缺失编码、各行是否为独立对象。复核者应能从原始 CSV 打开项目、重新得到同样的有效 N 与均值;如果做不到,先解决数据问题,再讨论统计结论。

把输出转成能读懂的一段结果

练习时可以先只写描述,再填分析:两组各有 6 个虚构观察值,A 组均值 12、B 组均值 14.5,样本均值差为 2.5 个任意单位。下一句才报告所用检验、检验统计量、自由度、p 值、均值差和置信区间;这些数必须从实际 JASP 输出逐项抄录,本文不预填,以免读者在选择了不同检验选项时仍照搬同一结果。

写图注时,说明散点代表单个独立对象,横线代表组均值。若添加误差线,必须写明是标准差、标准误还是置信区间;三者回答的问题不同。图上的点若发生重叠,可轻微水平错开以便看清,但不能改变纵轴数值。若数据经过对数转换或排除离群值,也应在方法段交代规则及分析前后各组有效 N。

JASP 的右侧输出会随左侧选项变化。正式提交前,重新打开 .jasp 文件,确认右侧最终显示的是准备报告的那组分析,而不是早先试过的检验。保存一份简短的分析决定记录:为什么用独立样本、为什么选 Student 或 Welch、是否排除任何行、有没有做额外比较。这样共同作者才能判断结果是否与研究方案一致。

参考资料

— 文章结束 —返回文章列表