SPSS 基础使用

以 IBM SPSS Statistics 为例,从变量视图、CSV 导入和缺失值设置走到描述性统计、图表及结果保存。

数据视图、变量定义和统计图并排展示的原创 SPSS 入门示意图

这里的“SPSS”指 IBM SPSS Statistics。它把数据录入、变量定义、统计过程和输出结果放在图形界面中。对初学者来说,最值得先学的不是记住多少菜单,而是建立一个可追溯的顺序:理解每行代表谁 → 定义变量 → 核对缺失值 → 查看分布 → 运行分析 → 保存数据和输出。下文以 IBM SPSS Statistics 31 的官方资料为参考;不同版本、许可和界面模式可能略有差异。

本文数据全部虚构,仅用于软件操作练习;不含患者信息,也不能用于临床判断。

认识 Data View 和 Variable View

Data View(数据视图) 中,通常一行是一条观察记录,一列是一个变量,单元格放该记录在该变量上的值。Variable View(变量视图) 用来给每列数据定义名称、类型、小数位、标签、缺失值和测量水平。IBM 文档分别说明了 数据视图的录入方式变量视图能设置的属性

下面用“两个虚构小组的测量值”练习。三列分别是 id(记录编号)、group(组别,1=对照,2=处理)和 score(模拟测量值,任意单位)。这是假设不同记录彼此独立的数据结构;真实项目必须先确认一个 id 是否确实对应一个独立观察对象。

id,group,score
1,1,12
2,1,11
3,1,13
4,1,12
5,1,14
6,1,10
7,2,14
8,2,15
9,2,13
10,2,16
11,2,14
12,2,15

这份数据共有 12 行;对照组均值为 12,处理组均值为 14.5。先手工算一个容易核对的值,有助于发现后续的导入或分组错误。

导入 CSV,并检查有没有读错列

将上面的内容保存为 UTF-8 编码的 practice.csv。在 SPSS 中选择 File → Import Data → Text Data,打开文件后按文本导入向导检查:第一行是否作为变量名、分隔符是否为逗号、预览里是否正好有 idgroupscore 三列,以及每列是否被识别为合适的类型。IBM 的 文本文件导入教程特别强调用预览核对分隔符和字段类型;类型自动推断有可能把不合法值转成系统缺失。

导入后不要马上运行检验。先看数据视图的行数和首尾几行,再在变量视图中检查三个变量:

变量 建议的类型与测量水平 需要核对的内容
id 数值型;测量水平设为名义 是否唯一;不要把它当成连续测量值求均值
group 数值型;名义 设置值标签“1=对照、2=处理”;检查有无其他编码
score 数值型;标度 检查单位、小数位和不合理范围

Label(变量标签) 可以写更易懂的说明;Values(值标签) 可把数字编码显示为文字;Measure(测量水平) 用来区分类别、顺序和标度变量。导入外部文件后,这些属性未必齐全,IBM 建议在变量视图补充。来源:IBM 变量属性指南

缺失值要先定义,再谈有效样本量

空白的数值型单元格会成为系统缺失。如果原始数据用 99999 之类的编码表示“未测”或“不适用”,SPSS 不会自动猜出其含义;需要在变量视图的 Missing(缺失值) 中明确指定为用户缺失,并保存编码含义。否则这些数会进入均值或图形,造成明显错误。IBM 区分了 系统缺失与用户缺失

真实项目里,缺失往往有不同原因,例如未采集、设备故障、受试者退出。保留原始编码和数据字典,记录每一步如何处理;不要统一替换为 0,也不要先删除整行再想分析方法。运行任何统计过程时,都应核对输出中的有效 N 是否与预期一致。

先看频数、分布和离群值

group 这样的类别变量,进入 Analyze → Descriptive Statistics → Frequencies,检查两组各有多少行、是否出现 3 或 99 等意外编码。IBM 的 入门教程就是从频数表开始演示分析。

score 这样的连续变量,可用 Descriptives 查看均值、标准差、最小值和最大值;也可用 Explore 配合 group 分组,观察每组的分布和箱线图。即使均值正确,极端值、偏斜或录入错误仍可能被一个汇总数字掩盖。把“这组数是什么样”弄清楚,再谈组间比较。来源:IBM SPSS Statistics Base 31 手册

需要自己制作散点图等图形时,可从 Graphs → Chart Builder 选择图形类型,再把变量拖到相应坐标轴或分组区域。图形编辑器支持修改轴、标题及元素属性。作图前先确认 group 被设为类别变量、score 被设为标度变量;图注写清楚样本量、单位和误差线含义。来源:IBM Chart Builder 布局说明

比较两组之前,先写出设计

如果只是想练习菜单,可打开 Analyze → Compare Means → Independent-Samples T Test,将 score 作为检验变量、group 作为分组变量,再在 Define Groups 中指定 1 和 2。IBM 说明这一过程适用于由分组变量区分的两组独立观察;输出可包含组别统计、均值差、置信区间以及不同方差假设下的结果。来源:IBM 独立样本 t 检验说明

操作上能点出结果,不表示数据满足检验前提。先判断两组是否真正独立、变量是否为合适的连续测量、分布和离群值是否需要进一步处理;如果同一个人在前后各测一次,应考虑配对分析与相应的数据排列。阅读输出时要看每组 N、均值差、置信区间与假设条件,不能只摘一个 p 值或把它解释为“处理有效的概率”。这份六加六的虚构数据只用来认识流程,不据此下研究结论。

把分析步骤和结果分别保存

至少保留三类文件:数据集 .sav、输出文件 .spv,以及可重复运行的语法文件 .sps.sav 包含数据和变量字典;输出文件保存表格与图;语法文件记录了运行过的命令。IBM 分别说明了 数据保存格式输出文件保存从对话框生成语法

初学者不必一开始手写全部命令:在分析对话框设置好选项后用 Paste 将命令送进语法窗口,保存为 .sps;检查无误再运行。这样下次可以复查当时选了哪些变量、组别和缺失处理,而不必依赖记忆。不同界面模式下输出窗口和菜单可能不同,保存时确认实际生成的文件可以重新打开。

一份可复查的小型分析应写清什么

  1. 数据来源、观察单位、纳入范围和变量含义。
  2. 组别编码、单位、缺失值定义及排除规则。
  3. 每组有效 N、描述性统计和原始分布图。
  4. 使用的分析方法、关键设置、软件版本与限制。
  5. 原始数据、清理后的 .sav、语法 .sps 和输出 .spv 的对应关系。

SPSS 负责执行指定的步骤,研究者仍需对数据质量、方法选择和解释负责。医学相关资料还应按所在机构的隐私、伦理和数据管理要求保存,不要把可识别个人的信息放进公开练习文件。

参考资料

— 文章结束 —返回文章列表