Chapter 10 按统计学分类模块

10.1 两组独立样本 T 检验/秩和检验

本节说明如何在 本软件 中完成两组独立样本均值差异检验(Student/Welch t 检验)与秩和检验(Mann–Whitney U),并导出 Word/TXT 报告。本文仅涵盖建模与出表,不再复述数据准备流程。
适用于“两组互不重叠的受试者”(独立样本),例如:男性 vs 女性、新方案组 vs 对照组等。不适用于:同一人治疗前后(配对/重复测量)、三组及以上(ANOVA/非参扩展),或二分类结局(卡方/费舍尔)。

10.1.1 背景与方法小百科(必读)

  • Student’s t 检验:比较两组均值是否不同;前提是各组近似正态方差相等。样本量稍大时对偏离正态较稳健。
    医学例子:新药 vs 标准治疗的降压幅度(mmHg)是否不同。
  • Welch’s t 检验:t 检验的改良版,不要求方差相等(对方差不齐更稳健)。现实研究里优先推荐
    医学例子:两种术式后住院天数均值比较(两组方差差异往往明显)。
  • Mann–Whitney U(秩和检验):不依赖正态性,比较两组总体分布是否有系统性差异(常被简化理解为“中位数差异”,但严格说是分布的差异)。
    医学例子疼痛评分(0–10)常偏态/有极端值,用秩和检验更稳妥。
  • 均值差(MD):两组均值之差(组1−组2),配合95% 置信区间一起报告更完整。
  • 效应量 Cohen’s d:把“均值差”除以“组内标准差的综合”,无量纲,便于不同量纲比较(约 0.2/0.5/0.8 分别常被称为小/中/大效应)。
  • Shapiro–Wilk 正态性检验:p 值小提示偏离正态;大样本下对微小偏离也很敏感,需结合 Q–Q 图。
  • Q–Q 图:判断正态性最直观的图;点大致落在直线附近→近似正态。
  • Levene 方差齐性检验:检测两组方差是否相等;方差不齐时用 Welch’s t。
  • 贝叶斯因子(BF10):>3 支持“有差异”、<1/3 支持“无差异”,介于中间为不确定;与 p 值互补。

小贴士
- Welch’s t 在实际研究里很常用,因为“方差齐性”常不满足。
- 秩和检验更稳健,但它检验的是分布差异;若两组分布形状/离散程度不同,不能简单等同“中位数差异”。


10.1.2 数据准备

整洁数据格式(每行一名受试者):至少包含 1 列连续型结局(Y)和 1 列二分类分组变量(Group)。两列都应在 “定义字段” 中设定为正确类型:Y 为 numeric/integer,Group 为 factor恰好两类)。

10.1.2.1 必要字段

  • id(可选):受试者编号,便于核查;
  • group:二分类分组(如 Treatment / Control,或 Male / Female);
  • y:连续结局(如 血压下降值 mmHg、CRP、住院天数 等)。

不要把两组的 Y 放在两列(如 y_treaty_ctrl),那是“配对/重复测量”的宽表结构,不适用于独立样本检验。本模块需要“一列 Y + 一列 Group”。

10.1.2.2 示例数据表(每行一人)

id group y (SBP reduction, mmHg)
1 Treatment 12.5
2 Treatment 8.0
3 Treatment 15.2
4 Control 6.1
5 Control 9.3
6 Control 2.7

准备要点与小贴士
- 类型:Y 需是 numeric;Group 设为 factor 且只有两类。若 Group 目前有 3 类及以上,请在 “定义字段/调整因子顺序” 合并为两类。
- 取值丰富度:去除缺失后,Y 在每组建议至少有 ≥ 3 个不同取值
- 缺失:允许缺失。分析时可选按变量剔除整行剔除(见“缺失值处理”)。
- 极端值:如存在明显异常或右偏,建议同时报告 Mann–Whitney U 结果作稳健性参考。
- 单位一致:确保同一指标量纲一致(如都为 mmHg)。


10.1.3 进入模块

接下来我们进入模块,点击软件顶部菜单的“按统计学分类模块”,然后点击“两组独立样本 T 检验/秩和检验”进入模块。


10.1.4 选择变量

  1. 因变量 Y(连续型)
    “选择因变量或结局变量 Y” 下拉框中选择。

    • 必须是 numeric/integer,且去缺失后≥3 个不同取值
    • 若未出现,请回到 “定义字段” 将其设置为 numeric

    名词解释:连续型变量 是可以细分到任意精度的数,如血压、肌酐、住院天数等。

  2. 分组变量(两组)
    “选择分组变量(二分类变量)” 选择恰好两类的变量。

    • 如果当前是 3 类及以上,请在 “定义字段/调整因子顺序” 合并为两类。

    名词解释:二分类变量 是仅有两类的类别变量,如“治疗/对照”“男/女”。

提示:若要改变“组1/组2”的先后顺序,请到 “调整因子顺序” 拖拽分组变量的水平顺序


10.1.5 检查前提假设(可选但推荐)

“适用条件判断” 勾选需要的检验:

  • Shapiro–Wilk 正态性检验(默认开):判断两组数据是否近似正态
  • Q–Q 图:可视化正态性(默认开,与上项联动)。
  • Levene 方差齐性检验:判断两组方差是否近似相等。

怎么用这些结论?
- 正态 + 方差齐:可用 Student’s t(或直接用更稳健的 Welch’s t)。
- 正态 + 方差不齐:优先用 Welch’s t
- 明显偏态/极端值:可用 Mann–Whitney U 做主分析/敏感性分析。


10.1.6 选择统计方法(可多选并行出结果)

  • Student’s t test方差齐时的 t 检验。
  • Welch’s t test不要求方差齐;现实里更稳健,优先推荐
  • Mann–Whitney U(秩和检验):正态性不佳或有极端值时使用。
  • 贝叶斯因子:提供与 p 值互补的“证据强度”。

医学里的直观例子
- t/Welch:比较两治疗组的舒张压下降值(mmHg)
- 秩和:比较两术式的住院天数(常偏态)。
- 贝叶斯因子:当 p≈0.06 时,用 BF 判断“无差异”的证据是否也很强。


###(可选)对因变量做正态性变换 {#normality-transformation}

Y 全为正数 时,会出现下列选项:

  • 不转换(默认)
  • 对数转换(log):适合“倍数变化”的指标(如 CRP、乳酸)。
  • 平方根转换(√):适合轻度右偏的数据。
  • 倒数转换(1/x):适合极端右偏,但解释较不直观。

解读提醒:
- log 变换后的“均值差”近似表示几何均值之比的对数;必要时在结果里加一句解释。
- 变换仅为满足模型近似前提;若变换前后结论一致,可在文中说明“敏感性分析一致”。


10.1.7 假设检验方向

“假设检验类型” 选择:
- 组1 ≠ 组2(双侧,默认)
- 组1 > 组2组1 < 组2(单侧)

名词解释:
- 双侧检验:只要两组不一样就算显著。
- 单侧检验:仅在“有明确且事先约定的方向性假设”时使用(如新药只可能更强)。
“组1/组2”由分组水平顺序决定;方向弄反可在“调整因子顺序”或此处重选方向。


10.1.8 显示统计量与区间

  • 均值差(MD)95% 置信区间(可改置信水平)。
    > 置信区间:若多次重复同样研究,95% 的此类区间会覆盖真实均值差。区间不跨 0 → 与双侧检验显著一致。

  • 效应量(Cohen’s d) 与区间(可选):
    > Cohen’s d = 均值差 ÷ 组内标准差的综合;0.2/0.5/0.8 常对应小/中/大效应,仅供粗略参考。


10.1.9 缺失值处理

  • 每个因变量单独剔除缺失(默认):保证尽可能多的有效样本,但不同结果的样本量可能不同。
  • 整行有缺失就剔除:所有分析样本量一致,但丢失信息更快。

医学建议:优先默认策略;若担心偏倚,可在数据准备模块做缺失填补后再分析。


10.1.10 描述性统计与图

  • 描述性统计表:输出两组的均值/SD 或中位数/IQR(由底层自动选择/展示)。
  • 描述性统计图:默认开启,可调 图像宽度/高度;图下方提供下载按钮(PNG/PPT/PDF)。


10.1.11 一键运行

点击 “开始进行两组独立样本检验分析”。页面将依次显示:

  1. 正态性检验表(Shapiro–Wilk)
  2. 方差齐性检验表(Levene)
  3. Q–Q 图(若开启)
  4. 主检验结果(t/秩和/贝叶斯):t 值/自由度、p 值、均值差(及 CI)、可选的效应量
  5. 分组描述结果(文本表)
  6. 描述性统计图

解读建议
- Welch’s t 对方差不齐更稳健;常作为主要结果。
- 若正态性/方差齐性明显违背,Mann–Whitney U 可作为主结果或敏感性分析。
- 始终伴随报告效应量与置信区间,避免只报 p 值。


10.1.12 导出结果

切换到 “下载Word报告” 页签:

  • 下载 Word 文档:包含

    1. 正态性检验表、2) 方差齐性检验表、3) Q–Q 图、4) 描述性统计图。
    • 请用 Microsoft Word 打开不要用 WPS,可能样式不兼容)。
  • 下载 TXT 文本:包含

    • 两组检验主结果表分组描述结果(纯文本,便于粘贴至邮件/文稿)。

高分辨率图片:在图下方用图片下载按钮(PNG/PPT/PDF)。


10.1.13 常见问题与排查

  • 因变量未出现在下拉框:回到 “定义字段” 将其设为 numeric,并确保去缺失后有 ≥3 个不同取值。
  • 分组变量不是两类:请在 “定义字段/调整因子顺序” 合并水平,使其恰为两类。
  • p 值或区间异常巨大/为 NA:多因极端值或样本极小;检查离群值,或改用秩和检验。
  • Q–Q 图未显示:确认已勾选 Shapiro–Wilk(取消该项也不会生成 Q–Q 图)。
  • 单侧检验方向弄反:检查“组1/组2”的水平顺序或更换单侧方向,再次运行。
  • Word 排版错乱:使用 Microsoft Word 打开;如仍异常,减少一次性插入的图片尺寸后重试。

10.1.14 适用范围与不适用情形(容易混淆)

  • 适用:两组互不重叠的独立样本、连续型结局(如血压、肌酐、炎症指标)。
  • 不适用
    • 同一受试者的前后对比 → 配对 t/秩和(另见配对模块)
    • 结局是率/构成比卡方/费舍尔
    • 三组及以上 → 单因素 ANOVA/非参 Kruskal–Wallis
    • 明显的极端偏态且解释在原量纲更重要 → 可直接用秩和并报告中位数/IQR

10.1.15 报告撰写要点(可直接改写)

  • “我们使用 Welch’s t 检验 比较两组在 Y 上的差异(诊断后两组方差不齐,采用 Welch)。组间均值差(MD)为 …(95% CI …),t(df)= …,p= …;效应量 Cohen’s d = …(95% CI …)。”
  • “作为稳健性分析,我们采用 Mann–Whitney U,U= …,p= …,结论一致/不同。”
  • “由于 Y 呈明显右偏,我们对 Ylog 变换,变换后结论保持一致(敏感性分析一致)。”

10.2 两组配对样本 T 检验/秩和检验

本节说明如何在 本软件 中完成两组配对样本的均值差异检验(配对 t 检验)与配对的非参数检验(Wilcoxon 符号秩和检验),并导出 Word/TXT 报告。仅涵盖建模与出表,不再复述数据准备流程。文中对统计名词都做了入门解释,适合统计小白快速上手。

10.2.1 背景与原理(先懂再做)

  • 什么是“配对样本”?
    同一受试者在两个时间点/两侧器官/两种处理下的两次测量,一人两值,两值彼此成对。例如术前/术后血压、治疗前后某生物标志物、左/右眼眼压。同一人的两次测量高度相关,不能当作独立样本处理。

  • 配对 t 检验(Student’s paired t
    把每个受试者的“差值” \(d = \text{测量1} - \text{测量2}\) 当作一列新数据,检验差值的平均数是否为 0
    适用条件:差值 \(d\) 近似正态分布。优势:对小样本也常见,结果易解释(给出均值差 MD及其置信区间)。

  • Wilcoxon 符号秩和检验(配对的非参数法)
    不要求正态。对差值的绝对值做秩次排序,再根据正负号加总,检验“中位差是否为 0”。
    适用场景:差值偏态/有极端值时更稳妥。解释为中位数层面的差异

  • 贝叶斯因子(Bayes factor, BF)
    量化数据支持“有差异”还是“无差异”。常用阈值:
    BF10 > 3 倾向支持存在差异;BF10 < 1/3 倾向支持无差异;中间区域为不确定。需要给定一个先验宽度(默认 0.707)。

  • 医学研究中的常见例子

    1. 抗高血压药物前后收缩压(同一人两次)。
    2. 手术前后炎症指标 CRP。
    3. 左/右肾皮质厚度(同一人左右侧比较)。
      这些都应使用配对方法,而不是独立样本方法。

10.2.2 数据准备

数据必须是“宽表”(wide format):每位受试者占一行,有两列分别存放两次测量值。两列都应为数值型numeric/integer),去除缺失后至少各有 3 个不同取值

10.2.2.1 必要字段

  • id(可选):受试者编号或样本 ID(便于自查)。
  • measure_1:第一次测量(如“基线”/“用药前”)。
  • measure_2:第二次测量(如“末次随访”/“用药后”)。

若你的原始数据是“长表”(如列有 id/time/value ),请先在外部软件或 R 中转换为宽表,使两个测量各占一列,再导入 本软件。

10.2.2.2 示例数据表(宽表)

id measure_1 (Pre) measure_2 (Post)
1 142.0 134.0
2 150.5 141.0
3 138.0 139.5
4 160.0 148.0
5 147.5 143.0

准备要点与小贴士 - 变量类型:两列测量都应在 “定义字段” 中设为 numeric;若显示为 factor/character,请更改为 numeric
- 缺失:允许有缺失。分析时可选择按变量剔除整行剔除(见后文“缺失值处理”)。
- 极端值:若差值分布偏态/有极端值,建议同时报告 Wilcoxon 结果作稳健性参考。
- 同一单位:两次测量必须同量纲、同单位(如都为 mmHg)。


10.2.3 进入模块

点击顶部菜单 “按统计学分类模块”“两组配对样本 T 检验/秩和检验” 进入。


10.2.4 选择变量(两列测量值一一对应)

  1. 第一个测量值(测量1)
    “选择第一个测量值(需在前页面设置成 numeric)” 选择。要求:数值型,去缺失后至少 3 个不同取值。
  2. 第二个测量值(测量2)
    “选择第二个测量值(需在前页面设置成 numeric)” 选择。
    > 重要两列必须来自同一批受试者且顺序一致(第 i 行的两值属于同一人)。如存在配对错位,结果将失真。

小贴士:如果变量未出现在下拉框,请回到 “定义字段” 把该列设为 numeric应用更改


10.2.5 检查前提假设(推荐)

  • Shapiro–Wilk 正态性检验(默认开)
    检验的是差值 \(d\) 是否近似正态(界面中自动完成差值并检验)。
  • Q–Q 图(默认开)
    可视化差值 \(d\) 的正态性:点越贴近对角线越接近正态。

说明:若取消 Shapiro–Wilk,系统也不会生成 Q–Q 图(与界面勾选保持一致)。


10.2.6 选择统计方法(可多选并行出结果)

  • Student’s t test(配对 t 检验):差值近似正态时的首选。
  • Wilcoxon signed rank tests(符号秩和检验):差值不正态/有极端值时更稳健。
  • 贝叶斯因子法:可选。默认先验 0.707(可在 0.01–2 之间调整)。

10.2.7 假设检验方向(一定要对齐“谁减谁”)

“假设检验类型” 选择:
- 测量值1 ≠ 测量值2(双侧,默认)
- 测量值1 > 测量值2测量值1 < 测量值2(单侧)

方向如何理解?系统以“测量1 − 测量2”构造差值:
- 选择“测量1 > 测量2”即假设 差值均值 > 0
- 选择“测量1 < 测量2”即假设 差值均值 < 0
若结果方向和期望相反,可对调两列或改选相反方向。


10.2.8 显示哪些统计量

  • 均值差(MD)置信区间(默认 95%)
    MD = 平均(测量1 − 测量2)。区间不跨 0 常提示差异显著。
  • 效应量(Effect size) 与置信区间(可选)
    对配对 t,系统给出类似 Cohen’s d 的标准化差值(等于差值均值 ÷ 差值标准差)。
    粗略阈值:0.2(小)、0.5(中)、0.8(大)。

10.2.9 缺失值处理

  • 每个因变量单独剔除缺失(默认):两列中缺失的那一对会被剔除,其他对照常保留。
  • 整行有缺失就剔除:更严格,统一样本数,但可能更保守。

10.2.10 描述性统计与图(便于展示)

  • 描述性统计表:两次测量各自的均值/SD 或中位数/IQR(由底层函数自动选择/展示)。
  • 描述性统计图:默认开启,可调 图像宽度/高度
    图下方提供图片下载(PNG/PPT/PDF),便于插入幻灯或稿件。

10.2.11 一键运行

点击 “开始进行两组独立样本检验分析”(按钮名称沿用界面文案)。完成后将依次看到:

  1. 正态性检验表(Shapiro–Wilk):针对差值 \(d\)
  2. Q–Q 图(若开启):目测差值是否近似正态。
  3. 主检验结果(根据你勾选的方法并行展示):
    • t 值/自由度(df)、p 值、均值差(MD)及其 CI
    • 效应量(Cohen’s d及其 CI(如勾选);
    • 贝叶斯因子(BF)(如勾选),并可据阈值解读;
  4. 分组描述结果(文本表)
  5. 描述性统计图(可下载为 PNG/PPT/PDF)

解读建议
- 若差值近似正态,优先报告配对 t;如偏离明显,报告 Wilcoxon 作为敏感性或主结果。
- 同时报告 MD 与其 CI效应量,比只报 p 值更完整。
- 若临床上更关注“术后是否下降”,请采用单侧方向并在方法中说明依据。


10.2.12 导出结果

切换 “下载Word报告” 页签可导出:

  • Word 文档(推荐用 Microsoft Word 打开,勿用 WPS 以免格式错乱),包含:
    1. 正态性检验表 2) Q–Q 图 3) 描述性统计图。
  • TXT 文本:包含主检验结果描述性统计(文本),便于复制粘贴到论文草稿。

高分辨率图片:建议用图下方的图片下载按钮(PNG/PPT/PDF)。


10.2.13 医学写作示例(可直接改词套用)

  • “我们采用配对 t 检验比较治疗前后 Y 值。差值(前−后)的均值差为 MD=…(95% CI …),t(df)=…,p=…;效应量 d=…(95% CI …)。结果提示治疗后Y显著下降/无显著变化。”
  • “作为稳健性分析,我们使用Wilcoxon 符号秩和检验,得到 V=…,p=…,结论与配对 t 一致/不同。”
  • “若采用单侧假设(前 > 后),结论仍然成立/不成立(p=…),与研究假设一致/不一致。”

10.2.14 常见问题与排查

  • 两列样本数不同或顺序不一致
    必须一人一行、两列一一对应;如有错位,请按受试者 ID 对齐或重建数据表。
  • 变量没出现在下拉框
    回到 “定义字段” 将两列设置为 numeric,并点击应用更改
  • Q–Q 图不显示
    请确认已勾选 Shapiro–Wilk 正态性检验;否则系统不会生成 Q–Q 图。
  • 效应量或区间异常
    多见于样本过小或差值极端;可查看箱线图/原始点图,必要时使用 Wilcoxon 并在文中说明理由。
  • 方向与期望相反
    记住系统计算的是“测量1 − 测量2”。可在“假设检验类型”选择相反方向,或交换两列后重跑。
  • Word 格式错乱
    使用 Microsoft Word 打开;若仍异常,降低图尺寸或数量后重导。

10.2.15 术语速查(超简版)

  • 均值差(MD):平均(测量1 − 测量2),>0 表示测量1更大。
  • 置信区间(CI):在重复抽样下,覆盖真值的区间比例(如 95%)。区间不跨 0 通常支持存在差异。
  • 效应量(Cohen’s d:把差异单位化(除以差值的标准差),便于不同量纲间比较;0.2/0.5/0.8 代表小/中/大效应。
  • 贝叶斯因子(BF):数据支持“有差异”相对“无差异”的比值;>3 支持有差异,<1/3 支持无差异。

10.3 单样本 T 检验/秩和检验

本节说明如何在 本软件 中完成单一样本与某个理论检验值(基准值)的比较:包括 单样本 t 检验单样本 Wilcoxon 符号秩和检验,并导出 Word/TXT 报告。适用于“一组受试者”的某项连续指标是否高于/低于/不同于既定标准(如指南阈值、历史对照均值)。

10.3.1 背景与方法小百科(必读)

  • 单样本 t 检验(Student’s one-sample t)
    用于判断样本均值是否与检验值(μ₀)不同;要求该指标在总体上近似正态
    医学例子:某降压药试验组的舒张压下降幅度是否与“临床目标 5 mmHg”不同。

  • 单样本 Wilcoxon 符号秩和检验(Wilcoxon signed-rank, one-sample)
    非参数方法,不要求正态,检验总体分布的中位数是否等于检验值(严格地说是对称分布下的“位置差异”)。
    医学例子疼痛评分(0–10)是否显著低于“可耐受阈值 4 分”(偏态常见)。

  • 检验值(Test value, μ₀)
    你要对照的基准:指南阈值、历史均值、理论值(如 0)。单样本 t 的均值差 = 样本均值 − μ₀

  • Shapiro–Wilk 正态性检验 & Q–Q 图
    用于评估“近似正态”前提:p 值小提示偏离正态;大样本对轻微偏离也很敏感,需结合 Q–Q 图。

  • 效应量(Cohen’s d)
    = (样本均值 − μ₀) / 样本标准差,无量纲,≈0.2/0.5/0.8 常对应小/中/大效应(仅作粗略参考)。

  • 贝叶斯因子(BF₁₀)
    表示“有差异”相对“无差异”的证据强度:>3 支持有差异,<1/3 支持无差异,中间为不确定。


10.3.2 数据准备

数据应为“宽表”(wide format):每位受试者占一行,目标变量仅一列,为数值型numeric/integer),去除缺失后至少 3 个不同取值

10.3.2.1 必要字段

  • id(可选):受试者编号,便于自查。
  • measure:待检验的连续型指标(如 SBP、CRP、住院天数等)。

若变量被识别成 factor/character,请在 “定义字段” 中改为 numeric;单位必须统一(例如都为 mmHg)。

10.3.2.2 示例数据表(宽表)

id measure (SBP, mmHg)
1 134.0
2 141.0
3 139.5
4 148.0
5 143.0

准备要点与小贴士
- 允许缺失;分析时可选择每次分析单独剔除缺失整行剔除(见后文“缺失值处理”)。
- 若分布明显右偏/存在极端值,建议同时报告 Wilcoxon 结果作稳健性参考。
- 如研究关注“变化量是否不同于 0”,可先在数据准备阶段计算 delta = 后 − 前,再对 delta单样本检验。


10.3.3 进入模块

从顶部菜单进入 “按统计学分类模块 → 单样本 T 检验/秩和检验”


10.3.4 选择变量与检验值

  1. 选择因变量(连续型)
    “选择因变量(需在前页面设置成 numeric)” 下拉框中选择目标变量。
    • 必须是 numeric/integer,且去缺失后 ≥ 3 个不同取值。
    • 未出现时,请回到 “定义字段” 更改类型。
  2. 输入检验值(μ₀)
    “输入检验值” 中填入你要对照的基准值(默认 0)。
    • 例:检验“平均 SBP 是否不同于 140 mmHg”,则输入 140
    • 例:检验“平均变化量是否不同于 0”,则输入 0

名词解释:均值差(MD) = 样本均值 − 检验值。置信区间不跨 0 → 与双侧检验“显著”一致。


10.3.5 检查前提假设(可选但推荐)

“适用条件判断” 勾选需要的检验:
- Shapiro–Wilk 正态性检验(默认开):评估“近似正态”。
- Q–Q 图:可视化正态性(默认开,与上项联动)。

怎么用?
- 近似正态:可用 t 检验(常规报告)。
- 明显偏态/极端值:同时报告 Wilcoxon(稳健)。


10.3.6 选择统计方法(可多选并行出结果)

  • Student’s t test(单样本 t):基于均值,需“近似正态”。
  • Wilcoxon signed-rank(单样本):基于秩与符号,更稳健。
  • 贝叶斯因子:提供与 p 值互补的证据强度(默认先验 r = 0.707,可调 0.01–2)。

医学里的直观例子
- t 检验:平均 CRP 是否不同于 10 mg/L(CRP 近似正态或样本量中等偏大)。
- Wilcoxon:平均疼痛评分是否低于 4 分(评分常偏态)。
- BF:当 p≈0.06 时,用 BF 判断“无差异”的证据是否同样强。


10.3.7 假设检验方向

“假设检验类型” 选择:
- ≠ 检验值(双侧,默认)
- > 检验值< 检验值(单侧)

名词解释:
- 双侧检验:只要“不同于”就算显著(更常用、也更稳妥)。
- 单侧检验:仅在事先有明确方向与伦理/机制一致时使用(如“只关心是否高于阈值”)。


10.3.8 显示统计量与区间

  • 均值差(MD)95% 置信区间(可改置信水平)。
    > 置信区间:若重复同样研究,95% 的此类区间会覆盖真实“均值差”。区间不跨 0 → 与双侧显著一致。

  • 效应量(Cohen’s d) 与区间(可选):
    > d = (样本均值 − 检验值) / 样本 SD;0.2/0.5/0.8 ≈ 小/中/大效应,仅供粗略参考。


10.3.9 缺失值处理

  • 每个因变量单独剔除缺失(默认):尽量保留样本,但不同结果的样本量可能不同。
  • 整行有缺失就剔除:各输出的样本量一致,但信息损失更快。

建议:通常保留默认;如担心偏倚,可在数据准备模块先做缺失填补,再回来分析。


10.3.10 描述性统计与图

  • 描述性统计表:显示均值/SD 或中位数/IQR(由底层自动选择/展示)。
  • 描述性统计图:默认开启,可在界面调整图像宽度/高度
    • 图下方提供下载按钮(PNG/PPT/PDF),便于制图入稿。

10.3.11 一键运行

点击 “开始进行两组独立样本检验分析”(按钮文字通用,此处为单样本)。页面将依次显示:

  1. 正态性检验表(Shapiro–Wilk)
  2. Q–Q 图(若开启)
  3. 主检验结果(t / Wilcoxon / 贝叶斯):t 值/自由度、p 值、均值差(及 CI)、可选的效应量
  4. 描述性统计表(文本)
  5. 描述性统计图(可下载)

解读建议
- 近似正态下可主要报告 t 检验;若偏态明显,补充 Wilcoxon 作为稳健性分析。
- 始终配合置信区间与效应量,避免只报 p 值。
- 样本量很大时,微小差异也可能显著;此时更应关注效应量与临床意义


10.3.12 导出结果

切换到 “下载Word报告” 页签:

  • 下载 Word 文档:包含

    1. 正态性检验表、2) Q–Q 图、3) 描述性统计图。
    • 请用 Microsoft Word 打开不要用 WPS,可能样式不兼容)。
  • 下载 TXT 文本:包含

    • 单样本检验主结果表描述性统计(纯文本,便于粘贴至邮件/文稿)。

高分辨率图片:在图下方使用图片下载按钮(PNG/PPT/PDF)。


10.3.13 常见问题与排查

  • 变量未出现在下拉框:回到 “定义字段” 将其设为 numeric,且去缺失后 ≥ 3 个不同取值。
  • p 值或区间异常/为 NA:多因极端值或样本极小;请检查离群值,或同时报告 Wilcoxon
  • Q–Q 图未显示:确认已勾选 Shapiro–Wilk(取消该项也不会生成 Q–Q 图)。
  • 单侧/双侧选择不当:仅在有事先方向假设时用单侧;否则使用双侧更稳妥。
  • Word 排版错乱:使用 Microsoft Word 打开;若仍异常,减少一次性插入的图片尺寸后重试。

10.3.14 适用范围与不适用情形(容易混淆)

  • 适用:单一样本的连续型指标与既定检验值的比较(均值/中位数 vs 目标/阈值/历史均值)。
  • 不适用
    • 二分类/计数 → 比例/率用二项检验/泊松检验
    • 两组比较 → 见“独立样本 / 配对样本”模块
    • 三组及以上 → ANOVA / Kruskal–Wallis
    • 重复测量多时间点 → 线性混合效应模型 / 重复测量方差分析等

10.3.15 报告撰写要点(可直接改写)

  • “我们采用单样本 t 检验评估 Y 是否不同于检验值 μ₀。结果显示:均值差(MD)为 …(95% CI …),t(df)= …,p= …;效应量 Cohen’s d = …(95% CI …)。”
  • “作为稳健性分析,应用单样本 Wilcoxon 符号秩和检验,V= …,p= …,结论一致/不同。”
  • “若研究关注变化量是否不同于 0,我们先计算 delta = 后 − 前,对 delta 进行单样本检验;与原指标的敏感性分析一致/不一致。”

10.4 独立样本列联表分析(卡方检验、趋势检验等)

列联表(Contingency Table),又称交叉表、列联表分析,是用于表示两个或多个分类变量之间关系的表格。在医学研究中,列联表广泛应用于疾病与风险因素、治疗方法与疗效等方面的关联性分析。

例如,通过卡方检验(Chi-square test)评估吸烟是否与肺癌的发病率相关,或者通过趋势检验(Trend test)研究不同剂量药物治疗对疾病恢复的影响。

本软件为列联表分析提供了全面且强大的功能支持,以下是其主要功能介绍:

  1. 多种假设检验方法:本软件支持χ²检验、连续性校正χ²检验、似然比(Likelihood ratio)检验、Fisher’s 精确检验和Z检验等方法,以满足不同场景和数据类型的需求。

  2. 自定义假设检验类型:用户可以根据研究目的,自主选择双侧检验(two-tailed test)或单侧检验(one-tailed test)。

  3. 效应量估计:本软件可以计算比值比(Odds Ratio, OR)、对数比值比(Log OR)、相对危险度(Relative Risk, RR)、两组发生率差值(Risk Difference, RD)等效应量,并给出相应的置信区间。

  4. 设置置信水平:用户可以根据需要自行设定置信水平(Confidence Level),如95%或99%等。

  5. 计算列联系数:对于无序分类变量,本软件能计算φ系数(Phi coefficient)、Cramer’s V系数等列联系数;对于有序分类变量,本软件支持计算Gamma系数、Kendall’s Tau-b系数等趋势检验指标。

  6. Mantel-Haenszel趋势检验:本软件支持Mantel-Haenszel趋势检验,用于评估具有有序分类变量的列联表中的趋势关系。

  7. 选择分层因素,自动分层分析。

  8. 可视化分析:本软件能绘制列联表的统计条图,直观地展示分类变量之间的关系。

10.4.1 准备数据

到”导入数据”页面下载示例数据看一下:

Treatment, Age, Sex 都是分类变量,代表分组因素

Effect是疗效,也是分类变量

Stage 是数字,但是不是连续性变量,我们认为是一个分类,但是每个分类之间有数量关系,所以这里是一个有序分类变量,导入本软件后,需要设置为factor,后续在趋势检验中有用。

如果没有原始的个体数据,只有四格表或者列联表的频数:

则按照这样的格式准备数据,多出一个变量Frequency表示频次,导入软件后将其设置为频次或权重即可。

10.4.2 进入模块

点击顶部菜单 “按统计学分类模块”“独立样本列联表分析(卡方检验、趋势检验等)” 进入。

10.4.3 开始列联表分析

选择变量:

用原始数据做分析,选择行变量,和列变量,例如:

也可以选择分层变量进行分层分析。

如果没有原始数据,只有频数表,则选择频数变量,例如:

10.4.4 列联表统计的参数

请勾选需要计算的参数,说明如下:

χ²(卡方检验,Chi-square test)

定义:卡方检验是一种非参数检验方法,用于评估两个分类变量之间的关联性或独立性。

使用条件:适用于n×m列联表,无序分类变量。

场景和临床应用:在医学研究中,卡方检验常用于评估疾病与风险因素、疗效与治疗方法等之间的关系。

连续性校正χ²(Continuity-corrected Chi-square)

定义:连续性校正卡方检验是卡方检验的一种修正方法,用于修正列联表中离散数据的近似误差。

使用条件:适当列联表大于2×2时,当总N值(在列联表中评估的总样本量)小于40时,需要使用Yates连续性校正来补偿理论概率分布(平滑)与实际观察值之间的偏差。

似然比(Likelihood ratio)

定义:似然比是一种比较两个模型拟合数据优度的方法,通常用于参数估计和假设检验。

使用条件:适用于n×m列联表。

场景和临床应用:在医学研究中,似然比检验用于评估诊断试验、疗效与治疗方法等之间的关系。

Fisher’s 精确检验(Fisher’s Exact Test)

定义:Fisher’s 精确检验是一种非参数检验方法,用于评估两个分类变量之间的关联性或独立性。

使用条件:适用于n×m列联表,特别是当超过20%的单元格期望频数小于5时,使用近似方法可能不准确,此时需要使用Fisher’s 精确检验。Fisher’s 精确检验通过应用列联表中各单元格数值的超几何分布来评估独立性的原假设。

场景和临床应用:在医学研究中,Fisher’s 精确检验常用于评估稀有疾病与风险因素、疗效与治疗方法等之间的关系,尤其在样本量较小或期望频数不满足卡方检验条件的情况下。

Z检验(Z-test)

定义:Z检验是一种基于正态分布的参数检验方法,用于比较两个比例或比较一个比例与一个已知的参考值。

使用条件:适用于n×m列联表,适用于大样本数据,且样本分布近似正态分布。通常,当样本量较大且单元格中的期望频数足够大(大于5)时,Z检验的结果与卡方检验的结果相似。

场景和临床应用:在医学研究中,Z检验常用于评估疗效与治疗方法、疾病与风险因素等之间的关系,尤其在样本量较大且数据分布近似正态的情况下。

结果如下:

假设检验类型:

  1. 双侧检验(Two-tailed test)

定义:双侧检验是一种假设检验方法,用于评估观察差异的显著性,不论差异的方向。在双侧检验中,我们同时考虑了两个方向的极端值。

使用场景:当研究者对差异的方向没有预期或假设,或者对差异的方向不感兴趣时,使用双侧检验。例如,研究者希望检验两种药物的疗效是否有显著差异,但并不关心哪一种药物疗效更好。

功能:双侧检验主要用于评估两组之间的差异是否显著。例如:组1 ≠ 组2。

  1. 单侧检验(One-tailed test)

定义:单侧检验是一种假设检验方法,用于评估观察差异的显著性,只关注差异的一个方向。在单侧检验中,我们仅考虑一个方向的极端值。

使用场景:当研究者对差异的方向有明确预期或假设时,使用单侧检验。例如,研究者希望检验某种药物是否比对照组更有效。

功能:单侧检验主要用于评估两组之间的差异是否显著且符合预期的方向。例如:组1 > 组2 或 组1 < 组2。

总之,选择单侧检验还是双侧检验取决于研究者的预期和假设。在实际研究中,如果对差异方向有明确预期,可以使用单侧检验;否则,使用双侧检验更为保守且可靠

10.4.5 测量值

可以勾选需要计算的测量值:

测量指标的介绍:

  1. 比值比(Odds Ratio, OR)

定义:比值比是一种用于量化两个事件A和B之间关联强度的统计量。比值比定义为在B存在时A的几率与在B不存在时A的几率之比,或等效地(由于对称性),在A存在时B的几率与在A不存在时B的几率之比。两个事件相互独立当且仅当比值比等于1,即一个事件在另一个事件存在或不存在时的几率相同。如果比值比大于1,则表示A和B之间存在关联(相关),相较于B不存在的情况下,B存在时A的几率增加,同样地,A存在时B的几率增加。相反,如果比值比小于1,则A和B之间呈负相关,一个事件的存在降低了另一个事件的几率。

功能:评估两组之间事件发生概率的相对差异。

使用案例:在研究吸烟与肺癌发病率的关系时,可以计算吸烟者与非吸烟者发生肺癌的比值比,以评估吸烟对肺癌发病率的影响。

  1. 对数比值比(Log Odds Ratio, Log OR)

定义:对数比值比是比值比的自然对数。将比值比取对数可以使其更接近正态分布,便于进行参数估计和检验。

功能:用于比较两组之间事件发生概率的相对差异,便于进行参数估计和检验。

使用案例:在分析药物疗效的临床试验中,可以计算实验组和对照组的对数比值比,以评估药物对治疗效果的影响。

  1. 相对危险度(Relative Risk, RR)

定义:相对危险度是一种用于比较两组之间事件发生的相对风险的指标。它表示一组中事件发生的概率与另一组中事件发生的概率之间的比值。

功能:评估两组之间事件发生风险的相对差异。

使用案例:在研究高血压患者与非高血压患者心脏病发病率的关系时,可以计算高血压患者与非高血压患者发生心脏病的相对危险度,以评估高血压对心脏病发病风险的影响。

  1. 两组发生率的差值(Risk Difference, RD)

定义:两组发生率的差值是一种用于比较两组之间事件发生的绝对差异的指标。它表示一组中事件发生的概率与另一组中事件发生的概率之间的差值。

功能:评估两组之间事件发生风险的绝对差异。

使用案例:在评估某种疫苗的有效性时,可以计算接种疫苗组和未接种疫苗组发生某种疾病的发生率差值,以评估疫苗的预防效果。

结果如下:

无序分类变量和有序分类变量的统计指标:

  1. 无序分类变量的统计

a. 列联系数(Contingency coefficient)

定义描述:列联系数是一种用于度量列联表中两个无序分类变量间关联强度的指标,其取值范围为0到1,值越接近1表示关联程度越高。

功能描述:评估两个无序分类变量间的关联程度。

使用场景案例描述:在研究患者的性别与某种疾病(如高血压)的关系时,可以使用列联系数来衡量性别与疾病之间的关联程度。

b. φ系数(Phi coefficient)和 Cramer’s V系数

定义描述:φ系数和 Cramer’s V系数都是衡量列联表中两个无序分类变量间关联强度的指标。φ系数适用于2×2列联表,而Cramer’s V系数适用于n×m列联表。它们的取值范围为0到1,值越接近1表示关联程度越高。

功能描述:评估两个无序分类变量间的关联程度。

使用场景案例描述:在研究某种疾病(如糖尿病)与患者的生活习惯(如饮食、运动)之间的关系时,可以使用Cramer’s V系数来衡量这两个无序分类变量之间的关联程度。

  1. 有序分类变量的统计

a. Gamma系数

定义描述:Gamma系数是一种用于度量两个有序分类变量间关联强度的指标,其取值范围为-1到1。正值表示正相关,负值表示负相关,绝对值越接近1表示关联程度越高。

功能描述:评估两个有序分类变量间的关联程度。

使用场景案例描述:在研究患者癌症分期与预后生存状态的关系时,可以使用Gamma系数来衡量这两个有序分类变量之间的关联程度。

b. Kendall’s Tau-b系数

定义描述:Kendall’s Tau-b系数是一种用于度量两个有序分类变量间关联强度的指标,其取值范围为-1到1。正值表示正相关,负值表示负相关,绝对值越接近1表示关联程度越高。

功能描述:评估两个有序分类变量间的关联程度。

使用场景案例描述:在研究疼痛评分与镇痛药物剂量之间的关系时,可以使用Kendall’s Tau-b系数来衡量这两个有序分类变量之间的关联程度。

c. Mantel-Haenszel趋势检验

定义描述:Mantel-Haenszel趋势检验是一种用于分析有序分类变量在分层数据中的关联趋势的统计方法。它可以帮助研究者评估有序分类变量之间的关联是否具有一致性。

功能描述:评估有序分类变量在分层数据中的关联趋势,以确定其关联一致性。

使用场景案例描述:在研究多个年龄层次的患者中,药物治疗有效性与疾病严重程度之间的关系时,可以使用Mantel-Haenszel趋势检验来评估在不同年龄层中,药物治疗有效性与疾病严重程度之间的关联趋势是否一致。

结果如下:

列联表的外观选项:

可以自定义需要展示的内容,结果如下:

10.4.6 分层分析:

如果需要分层,请选定分层变量:

例如,选择以Age分层。

结果如下:

10.4.7 统计作图

完成卡方检验之后,可以到下一个页面作图:


结果如下:

10.5 配对样本 McNemar 检验

本节讲解如何在 本软件 中完成配对二分类数据的 McNemar 检验,并正确读取输出。应用场景:同一对象两次判定(如治疗前/后是否阳性)、成对匹配的病例–对照(1:1)等。不适用:两组互不重叠的独立个体(应做卡方/费舍尔),或类别数 > 2 的结局(需更换方法)。

10.5.1 背景与方法小百科

  • McNemar 检验是什么?
    用于同一对象两次二分类判定(或匹配对)的一致性变化检验。只关注不一致的成对结果
    记 2×2 配对表为

    第二次=1 第二次=0
    第一次=1 a b
    第一次=0 c d

    核心只看 b(1→0)与 c(0→1)。若 b 与 c 差距很大,说明“前后发生了系统性改变”。

  • 统计量怎么来的?
    经典近似:\(\chi^2 = \frac{(b-c)^2}{b+c}\)(自由度=1)。
    连续性校正版更保守:\(\chi^2 = \frac{(|b-c|-1)^2}{b+c}\)

  • 何时用“精确法(exact)”?
    \(b+c\) 较小(经验上 < 25)时,建议使用精确二项(代码里显示为 exact log odds ratio 与精确 p 值),更稳妥。

  • 配对比值比(Paired OR)
    McNemar 的“配对 OR”≈ \(b/c\)。若 1 在其区间外,则提示有方向性改变(例如“由阴变阳更多”)。

名词解释
二分类变量:仅两类,如“阳性/阴性”“是/否”。
配对/匹配:同一对象前后两次测量,或成对的两个对象(如病例与按性别/年龄匹配的对照)。
行/列变量:在 2×2 表中的“第一次判定”和“第二次判定”。


10.5.2 数据准备

支持两种数据形态,任选其一:

10.5.2.1 方式 A:个体级“宽表”(推荐,最直观)

  • 每一行是一名受试者(或一对匹配个体),两列分别存第一次第二次的判定结果(都必须是两个水平)。
  • 类型在“定义字段”页设置为 factor,并确保恰好两类(如 0/1 或 阴/阳)。

示例(治疗前后是否阳性)

id pre (第一次) post (第二次)
1
2
3
4

准备要点 - 若显示为 numeric/character,请在 “定义字段” 改成 factor 并核对水平标签(建议先后顺序为“0/1”或“阴/阳”)。 - 只有两类;若出现第三种值(如“未测”),请先清洗或合并为缺失(NA)。

10.5.2.2 方式 B:汇总 2×2 列联表(带“频数列”)

  • 每一行是一种行×列组合,并用一列 counts 表示该格子的频数(权重)。
  • 仍需将行、列两列设置为二分类因子countsnumeric

示例(四行即四格)

pre post counts
58
22
10
40

准备要点 - counts 必须是非负数;若缺失或文本,请先修正。 - 行/列变量仍需只有两个水平


10.5.3 进入模块

顶部菜单选择 “按统计学分类模块”“配对样本 McNemar 检验” 进入。


10.5.4 选择变量与参数

  1. 指定 2×2 变量
    • “选择行变量(二分类变量)”:第一次判定(如 pre)。
    • “选择列变量(二分类变量)”:第二次判定(如 post,不可与行变量相同)。
    • “选择频数变量(可选)”:仅当采用“方式 B:汇总表”时勾选你的频数列(如 counts)。个体级宽表无需选择。
  2. 勾选检验与显示内容
    • χ²:经典 McNemar \(\chi^2\) 近似检验。
    • 连续性校正 χ²:更保守,样本不大时推荐一并查看。
    • exact log odds ratio:给出精确法的配对 OR 与区间及 p 值(小样本更可信)。
    • 显示行/列百分比:便于快速查看“由阴变阳/由阳变阴”的占比。
  3. 运行
    点击 “开始/刷新 McNemar 配对检验”

10.5.5 结果界面与读数指南

运行后依次显示两块文本输出:

  1. 列联表结果
    • 展示 2×2 频数与(可选的)行/列百分比。
    • 重点观察 b 与 c(不一致对),并记录 b+c 的大小(用于判断是否需偏重“精确法”)。
  2. McNemar 结果
    • 包含:χ²(是否带连续性校正)/ 精确法统计量与 p 值,以及 log OR(≈ b/c)及其置信区间
    • 结论书写:若 p < 0.05(或小于你的显著性阈值),说明两次判定比例发生了显著改变;并注明改变方向(b>c 表示“1→0 多于 0→1”,反之亦然)。

选择哪一个 p 值?
- 样本较小\(b+c<25\):优先报告精确法
- 样本较大:可报告连续性校正 χ²标准 χ²,并与精确法核对是否一致。


10.5.6 结果解读范例(可改写)

  • “对同一受试者的治疗前后阳性率进行 McNemar 检验:1→0 为 b=10,0→1 为 c=22,精确法 p=0.015,提示治疗后阳性率显著上升。配对 OR=2.20(95% CI 1.17–4.26)。”
  • “病例–对照配对样本中,暴露前后差异采用 McNemar 进行检验,连续性校正 χ²=4.31,p=0.038,提示暴露改变与结局存在关联。”

10.5.7 常见问题与排查

  • 行/列变量未出现:请在“定义字段”把它们设为 factor,且保证只有两类
  • 报错:levels 超过 2:请先在数据准备中合并为两类(如“阴/阳”),再导入或在“定义字段”中调整。
  • 频数变量无法选择:仅当你采用“汇总表 + 频数列”的方式时才需要;否则留空。
  • 精确法未输出/为 NA:检查 b+c 是否为 0(完全一致无变化时不可检验),或频数列是否为有效非负数值
  • 方向解释弄反:记得 log OR ≈ b/c;b>c 表示“从 1 变 0 更多”还是“从 0 变 1 更多”,取决于你对“1/0”的语义设定。

10.5.8 适用范围与不适用情形(容易混淆)

  • 适用
    同一对象两次二分类判定(治疗前/后、检查法 A vs B)、1:1 匹配病例–对照的二分类结局比较。
  • 不适用
    • 两个独立样本(用卡方/费舍尔);
    • >2 类结局(需多分类配对方法);
    • >2 次重复测量(考虑 Cochran’s Q 等)。

10.5.9 报告撰写要点(模板)

  • “我们使用 McNemar 检验 比较同一受试者在干预前后阳性率的变化。结果显示 b=…,c=…连续性校正 χ²=…,p=…(/ 精确法 p=…)。提示两次判定的阳性率存在/不存在显著差异。配对 OR=…(95% CI …–…)。”

10.5.10 与 本软件 界面一一对应(操作速查)

  1. 行变量 = 第一次判定;列变量 = 第二次判定
  2. 频数变量(可选)= 汇总表的计数列
  3. 勾选检验:χ² / 连续性校正 χ² / exact log OR
  4. 显示比例:行百分比 / 列百分比
  5. 开始/刷新:点击运行,阅读“列联表结果”与“McNemar 结果”

10.6 对数线性回归

对于分类变量,常用卡方检验进行数据分析,但卡方检验更多的应用于二维列联表的情形,若列联表维度更高,如要同时研究多个分类变量间的关系,卡方检验显然不够,因为它不可能为多个分类变量间的关系给出一个系统而综合的评价,也不可能在控制其他因素作用的同时,对变量的效应作出估计。此时,除了用logistic回归模型分析之外,也可以考虑采用对数线性模型这一多元统计分析方法来研究多个分类变量之间的关系。

对数线性模型将列联表资料中各个格子理论频数的自然对数表示为各个分类变量的主效应,以及各个分类变量之间交互效应的线性模型。通过迭代计算估计模型中的参数,应用方差分析的思想,检验各分类变量的主效应和交互效应的大小。此时,不区分因变量和自变量,强调的是模型的拟合优度检验和分类变量间交互效应的检验。

以下是一个医学研究中应用对数线性回归的例子:

假设我们要研究某种疾病的发病与年龄段、性别和治疗方式之间的关系。在这个例子中,我们可以运用对数线性回归模型来分析这些分类变量之间的关联,从而为进一步的研究提供依据。

本软件 统计软件中的对数线性回归模块提供了对数线性回归的全面功能,包括:

  1. 设置因子:可根据研究目的设置一个或多个分类变量。

  2. 支持交互作用项:可以分析分类变量间的交互作用对关联的影响。

  3. 设置分类自变量的参照水平:方便进行多水平分类变量的比较。

  4. 显示模型系数的置信区间、RR 值、RR 值的置信区间:方便对各分类变量的关联程度进行评估。

  5. Omnibus 似然比检验:检验模型整体的显著性。

  6. 模型拟合优度评价:包括 Deviance、AIC、BIC、McFadden’s R²、Cox & Snell’s R²、Nagelkerke’s R²、χ²、df 和 p-value。

  7. 做估计边际平均值统计图表:包括生成预测频数及其不确定性的图表。

通过 本软件 对数线性回归模块,您可以轻松地进行多分类变量关联分析,并获得全面的统计结果。这有助于为您的研究提供定量信息,以及用于评估模型拟合优度和显著性的各种指标。

10.6.1 准备数据

可按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

本样例数据的规则:

变量有两种,连续性变量(值是连续数据,它可以在变量值所属区间内任意进行取值,如年龄(岁)、血糖值、人的身高、智商等)以及分类变量(是说明事物类别的一个名称,其取值是分类数据。如”性别”就是一个分类变量,其变量值为”男”或”女”;“行业”也是一个分类变量,其变量值可以为”零售业”、“旅游业”、“汽车制造 业”等),在本例中 Age和Blood_test是连续性变量(numeric), 其他的是分类变量(factor)。

在对数线性回归中,只纳入分类变量,类似多维度的列联表概念。

10.6.2 对数线性回归分析

下一步就是对数线性回归分析啦:

使用方法和步骤如下:

  1. 在”请点击空白框选择因子,多选”框中选择多个因子,这些因子将用于对数线性回归分析。

  2. 点击”增加交互作用项(可多次点击)“按钮,可以为模型添加交互项。可以多次点击以添加多个交互项。

  3. 点击”重置清零”按钮,清除已添加的交互项。

  4. 选择要作为参照组的非数值因子。

  5. 选择表示权重(频数)的变量(可选项)。

  6. 选择模型拟合优度评价的指标,如离差(deviance)、AIC、BIC、模型整体检验和伪R²(pseudo-R²)。

  7. 选择是否显示模型系数的置信区间,RR值和RR值的置信区间。

  8. 选择Omnibus检验的方法。

  9. 选择做边际平均值统计图表的方式,可以是对每个因素逐个单独做边际平均值统计图表,也可以是把多个因素交叉组合在同一个统计图表上展示边际平均值。

  10. 根据选择的边际平均值统计图表方式,选择因子或因子组合。

  11. 选择是否显示置信区间,如果显示,可修改置信水平。

  12. 调整统计图的宽度和高度。

  13. 最后点击”开始进行对数线性回归”按钮,程序将根据选择的设置进行对数线性回归分析。

在整个过程中,用户可以通过选择不同的因子、交互项和其他设置来自定义对数线性回归模型。分析完成后,将生成相应的统计结果和图表。

10.6.3 交互作用怎么选

对数线性模型的构建一般以饱和模型开始,饱和模型包含了所有变量的主效应,低阶交互效应和高阶交互效应。在本案例中,饱和模型包括以下部分:

  • age2、sex、obstruct 个主效应项;

  • age2:sex、age2:obstruct、sex:obstruct 3个二阶交互效应项;

  • age2:sex:obstruct 1个高阶交互效应项。

对数线性模型为层次模型,如果模型中包含了某几个变量的高阶交互效应项时,这几个变量的低阶交互效应项与主效应项也一定包含在模型中。但由于饱和模型的理论频数完全拟合了实际频数,因此在实际应用过程中的意义不大,所以需要找到最简约的模型,对变量之间的关系进行解释。拟合优度检验过程中通过后退法(即最先对饱和模型中的最高阶交互效应项进行假设检验,然后依次向次高阶和低阶交互效应进行假设检验)逐渐排除没有统计学意义的项,最后得到最优简化模型

确定最优简化模型后,通常用最大似然估计法对拟合的简化模型参数进行估计。最大似然估计利用多项分布的原理构造自然函数,再求对数似然函数。由对数线性模型的结构可以发现,该模型不仅可以解决两个因素是否相关的问题。还可以用来分析各因素主效应是否起作用。如在本案例中,如果要想知道”age2”是否对”obstruct”起作用,则需要看”age2*obstruct”交互项是否有统计学意义。

10.6.4 下载报告

点击下载word文件即可

10.7 单样本检验(单组率的描述和比较,二分类结局)

本节演示如何在 本软件 中完成单样本率(单组、二分类结局)的描述与假设检验:给定一个“理论/历史/目标比例”(检验值),比较本组观测到的发生比例是否等于该值;并批量生成整洁表格与 Word 报告。

10.7.1 背景与方法小百科(必读,面向零基础)

  • 单样本率(one-sample proportion)
    只有一组受试者、结局是两类(例如“有/无”“成功/失败”)。我们关心这组里“事件”(例如“有、成功”那一类)的比例是多少。
    医学例子:某新方案客观缓解率(ORR)是否达到历史阈值 30%;术后并发症发生率是否低于院内红线 10%
  • 原假设(H0)与备择假设(H1)
    给定“检验值” p0(如 0.3),检验观测比例 是否与 p0 不同(双侧)、大于 p0、或小于 p0(单侧)。
  • p 值
    若 H0 为真,得到当前或更极端结果的概率。p 很小(如 <0.05)→“有统计学差异”。
    温馨提醒:p 值不等于“差异大小”,也不等于“临床意义”。
  • 置信区间(CI)
    例如 95% CI 表示:若重复做很多次相同研究,95% 的这类区间会覆盖真实比例。
    阅读技巧:95% CI 不跨过检验值 p0,与双侧检验显著性一致。
  • 双侧 vs 单侧
    • 双侧:只要“不等于”就算差异(默认,最稳妥)。
    • 单侧:仅在事先明确且有理论依据的方向假设时使用(如“新方案不可能更差,只可能更好”)。
  • 小样本与稀有事件
    小样本或比例靠近 0/1 时,区间会更宽;解读要结合临床意义样本量(功效)考虑。

10.7.2 数据准备

数据为“宽表”:每行一个个体,每个待检的二分类变量一列(可一次选择多列,批量出结果)。

10.7.2.1 必要字段

  • id(可选):受试者编号,便于自查。
  • var1var2 …:二分类变量(只能有两个不同取值,例如 0/1、No/Yes、阴性/阳性)。

小技巧
- 变量可用数值(0/1)或文字(No/Yes、阴性/阳性)表示;保证只有两类
- 在 “定义字段” 里设为 factor(文本)或 numeric(0/1 也可识别为二分类)。
- 批量分析时,可一次选中多列二分类变量。

10.7.2.2 示例数据表(宽表)

id ORR (Yes/No) SAE (0/1) R0_resection (Yes/No)
1 Yes 0 No
2 No 1 Yes
3 Yes 0 Yes
4 No 0 No
5 Yes 0 Yes

准备要点
- 保证每个待检变量仅两类;若出现第三类(如“未知”),请先在数据准备阶段合并或剔除。
- 缺失允许存在;本模块会按你的缺失策略进行处理(见下文“缺失值处理”)。
- 若你只关心某个“事件水平”(如 Yes=“发生”),表中会同时列出两个水平的比例与同一个 p 值;写论文时通常只呈现“事件水平”的一行即可。


10.7.3 进入模块

顶部菜单进入 “按统计学分类模块 → 单样本检验(单组率的描述和比较,二分类结局)”


10.7.4 选择变量(可批量)

  • “选择因变量(二分类,也可多选进行批量分析)” 中勾选一个或多个二分类变量。
    • 支持拖拽调整顺序。
    • 若未出现在列表:回到 “定义字段” 将其设为 factornumeric(仅两类)。

名词解释:二分类变量只有两个取值(如“是/否、阳性/阴性、0/1”)。


10.7.5 设定检验值与备择假设

  • “输入检验值”:填入历史阈值或目标比例 p0(0–1 之间;例如 0.3)。
  • “假设检验类型(备择假设)”
    • ≠ 检验值(双侧,默认):检验 是否不同于 p0
    • > 检验值(单侧):检验 是否大于 p0(如疗效率是否≥目标值)。
    • < 检验值(单侧):检验 是否小于 p0(如严重不良事件率是否≤上限线)。

小贴士
- 方向性检验仅在事先设定有充分依据时使用;否则优先选用双侧


10.7.6 置信区间与 p 值格式

  • 勾选 “显示均值差的置信区间”(这里对应比例的 CI),并设置 置信水平(默认 95%)。
  • 通过 “P 值保留几位小数” 设置报表中 p 值的展示位数(期刊常用 3 位)。

10.7.7 一键运行与结果解读

点击 “开始进行单样本二分类的检验分析”,将生成整洁表格,典型列含义:

  • Variable / Level:变量名称及其两个水平(例如 Yes / No)。
  • Count / Total / Proportion:该水平的例数、总例数、比例。
  • 95% CI Lower / Upper(名称随置信度变化):比例的置信区间。
  • p-value:单样本比例检验的 p 值。同一变量两行(两个水平)p 值相同,代表同一个检验;报告时只需引用你关心的“事件水平”一行即可。

读取示例:
“ORR=Yes 的比例为 42%(95% CI 30%–55%),与历史阈值 30% 比较,p=0.041(双侧)。”


10.7.8 导出结果

切换到 “下载Word报告” 页签:
- 下载 Word 文档:包含整洁的单样本率检验表(请使用 Microsoft Word 打开;不建议 WPS)。


10.7.9 缺失值处理与常见问题

  • 缺失值:本模块按当前分析规则对缺失进行处理。建议在导入前就完成缺失清理/填补,确保每列仅两类。
  • 变量不是两类:请回到 “定义字段/数据准备” 合并水平或改造为严格二分类。
  • p 值或区间异常:多见于样本量太小或比例极端(接近 0 或 1)。建议如实报告,并结合临床意义解读;必要时考虑扩大样本或更换研究设计。
  • 关注哪一行?:通常报告“事件”那一行(例如 Yes);两行的 p 值相同,代表同一检验。

10.7.10 适用范围与不适用情形(易混淆)

  • 适用:单组、二分类结局(如 ORR 是否达到目标值、并发症率是否低于上限)。
  • 不适用
    • 两组比较 → 请选择 两组率比较(卡方/费舍尔/两独立样本比例检验)
    • 同一受试者前后“是否发生”对比 → 请选择 配对样本 McNemar 检验
    • 连续型指标是否达到目标均值 → 请选择 单样本 t/秩和检验

10.7.11 写论文怎么表述(可直接改写)

  • “以 30% 为检验值,我们对客观缓解率(ORR)进行单样本比例检验:本组 ORR 为 42%(95% CI 30%–55%),与检验值相比存在差异(双侧 p=0.041)。”
  • “对安全性终点,我们检验 SAE 发生率是否低于 10%:本组 SAE 比例 6%(95% CI 2%–14%),p=0.12

10.8 两组或多组非参检验(Kruskal-Wallis)

本统计模块 (Kruskal-Wallis检验) 适用于比较两组或两组以上分组时(如A、B、C治疗组),连续性变量(如某种检测,AST值,或其他临床结局)在不同分组的差异。当不满足正态分布及方差齐性时适用本模块。

  1. 整体Kruskal-Wallis检验
  2. 事后检验(两两比较):Dwass-Steel-Critchlow-Fligner 法

10.8.1 准备数据

到导入数据页面下载示例数据看一下:

Treatment是代表治疗组别的变量,这里有三个组Lev, Obs, 和Lev+5FU组。需要把变量属性设置成factor

Length, Blood 和React是代表效果的变量,为连续性变量。需要把变量属性设置成numeric

Kruskal-Wallis检验,主要看 三个组中,Length, Blood 或React 是否有差异。

另外可以进行事后分析,分别看上述指标在Lev vs. Obs, Lev vs. Lev+5FU, Obs vs. Lev+5FU对比中的差异。

10.8.2 进入模块

顶部菜单进入 “按统计学分类模块 → 两组或多组非参检验(Kruskal-Wallis)”

10.8.3 开始非参数检验

选择代表组别的变量,如果菜单里没有,则返回去把你想要的组别变量设置为factor

选择因变量,这里一次可以分析多个因变量,如果菜单里没有你想要的变量,则返回去把它设置成numeric

10.8.4 事后检验(两两比较)

但组别为三个及以上时,方差分析的结果只能告诉我们,多组之间的均值是否全相等或不全相等,还不能告诉我们每个组两两比较的结果。

这时候可以用事后分析做两两比较。本模块采用Dwass-Steel-Critchlow-Fligner 法进行两两比较。

10.9 配对或重复测量非参检验(Friedman)

Friedman 检验是一种非参数统计方法,用于分析配对资料和重复测量资料。这种方法主要用于研究时间或配对变量之间的差异,尤其适用于数据不满足正态分布或方差齐性假设的情况。

使用场景:

研究某种干预或处理在不同时间点的效果。

比较配对变量之间的差异。

例子1:临床上重复测量空腹血糖值,比较不同时间点血糖值的差异 在这个例子中,我们关注患者在不同时间点的空腹血糖水平。例如,我们可以在开始治疗前、治疗后1个月、治疗后3个月和治疗后6个月测量空腹血糖值。通过使用Friedman检验,我们可以检测不同时间点空腹血糖值之间的差异,以便了解患者的血糖控制情况。

例子2:比较不同训练方法对学生数学成绩的影响 在这个例子中,我们关注使用三种不同训练方法(如教材、在线课程和辅导)的学生在数学成绩上的表现。通过使用Friedman检验,我们可以检测三种训练方法对学生数学成绩的差异。这有助于我们了解哪种训练方法对学生数学成绩的提高效果最好。

本软件 医学科研统计机器人提供了一站式的Friedman检验步骤:

  • 进行Friedman检验;

  • 对各水平亚组进行两两比较(Durbin-Conover法);

  • 描述性统计表和统计图:对数据进行描述性分析和绘制描述性统计图。

10.9.1 准备数据

示例数据如下:

可按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

Week.0, Week.6, Week.12, Week.24 是一组重复测量的数据,为基线、6周、12周、24周的血糖值。

10.9.2 进入模块

顶部菜单进入 “按统计学分类模块 → 配对或重复测量非参检验(Friedman)”

10.9.3 开始非参数检验分析

选择变量:

选择多个因变量Y,必须是数值型连续变量numeric。

如果整体分析有统计学意义,还可以进一步勾选两两比较(Durbin-Conover法);

也可以勾选生成描述性统计表和统计图。

10.9.4 下载word报告

点击下载word文件即可

10.10 Brunner-Munzel 两独立样本检验

Brunner-Munzel 检验用于比较两个独立总体的随机优势。它不要求两组方差相等,也不要求两组分布形状完全一致,因此特别适合偏态、异方差或分布形状不同的连续资料。本模块可一次选择多个连续结局,并同时运行 t 近似、随机置换和完全置换版本。

核心问题:从两组中各随机抽取一个观察,第二组取值高于第一组的概率,加上两者相等概率的一半,是否为 0.5?相对效应为 0.5 表示两组没有随机优势;偏离 0.5 表示一组更倾向于取得较高值。

10.10.1 模块能做什么

  • 对一个或多个连续结局比较两个独立组;
  • 选择双侧或有方向的单侧备择假设;
  • 使用 t 近似、随机置换或完全置换推断,并可同时输出多个版本;
  • 按每个结局分别删除缺失,或对所有所选结局执行整行删除;
  • 输出组别样本量、均值、标准差、中位数、四分位距和范围;
  • 输出检验统计量、近似自由度、P 值、相对效应及置信区间;
  • 绘制小提琴图、箱线图、原始散点和相对效应图;
  • 下载当前表格与图形的 Word 报告、汇总结果 CSV 和分析数据 CSV。

10.10.2 适用场景

本模块适合以下研究问题:

  1. 两个独立治疗组的连续结局明显偏态或存在长尾;
  2. 两组方差差异较大,不适合直接依赖方差齐性;
  3. 研究问题关注总体取值的随机优势,而不仅是均值差;
  4. 普通秩和检验的分布形状假设难以成立;
  5. 需要用置换推断检查 t 近似结果的稳定性;
  6. 希望一次批量比较多个连续结局,并保留每个结局的有效样本量。

典型医学例子包括住院天数、炎症指标、治疗反应评分、医疗费用、偏态实验室指标,以及两组离散程度明显不同的患者报告结局。

不宜直接使用的情况:同一受试者前后配对、三个及以上独立组、重复测量、中心或医生聚类、需要调整协变量、结局为二分类/计数/生存时间。此时应选择配对检验、多组非参数检验、回归或混合效应模型。

10.10.3 方法原理

设第一组观察为 \(X\),第二组观察为 \(Y\)。本模块报告的相对效应为:

\[p=P(X<Y)+0.5P(X=Y)\]

  • \(p=0.5\):两组没有随机优势;
  • \(p>0.5\):第二组更倾向于取得较高值;
  • \(p<0.5\):第一组更倾向于取得较高值。

双侧检验考察 \(p\) 是否不同于 0.5。单侧假设“第一组 > 第二组”对应 \(p<0.5\);“第一组 < 第二组”对应 \(p>0.5\)。组别顺序会直接改变方向,因此必须先核对分析概览中的第一组和第二组。

Brunner-Munzel 检验与普通秩和检验都使用排序信息,但两者的假设并不相同。本检验允许两组离散程度和分布形状不同,更适合把结果解释为随机优势。除非两组分布形状近似一致,否则不要把显著结果简单写成“中位数不同”。

10.10.4 三种检验版本

检验版本 特点 使用建议
t 近似 使用 Brunner-Munzel 统计量的有限样本 t 近似,并报告自由度 默认主要分析;计算快,适合多数常规样本
随机置换 随机抽取指定次数的组别排列,估计 P 值和相对效应区间 用于小样本或检查近似结果;固定随机种子
完全置换 枚举所有可行组别排列 仅适合很小样本;组合数过大时改用随机置换

随机置换次数越多,P 值和区间越稳定,但计算时间也越长。高置信水平需要更多尾部分位点;若界面输入的置换次数不足,模块会自动提高到最低可计算次数,并在结果上方注明实际次数。

10.10.5 数据准备

数据使用长表,每行代表一个独立观察单位。

ID Outcome Biomarker Group
001 10.4 1.12 Control
002 9.7 0.84 Control
003 12.8 1.96 Treatment
004 8.9 2.31 Treatment
  • 连续结局应设置为数值型;
  • 分组变量应设置为分类变量,并且恰好有两个有效水平;
  • 每组、每个结局至少需要两个不同的有效观察值;
  • 每行必须来自独立观察单位;同一受试者重复出现时不能直接使用;
  • 缺失值可以存在,但应预先决定逐结局删除还是所有结局整行删除;
  • 对有方向意义的指标,应先确认“数值越高”代表更好还是更差。

10.10.6 主要参数

设置 含义 使用建议
连续结局 一个或多个需要比较的数值变量 批量分析前确认量纲和临床方向
二水平分组变量 定义第一组和第二组 运行后在分析概览中核对组别顺序
备择假设 双侧、第一组较大或第一组较小 无预设方向时使用双侧;单侧必须事先指定
缺失值处理 逐结局删除或所有结局整行删除 主要分析应预先确定;批量结局建议核对每项 N
置换次数 随机置换的重复次数 正式报告增加次数并固定随机种子
计算时限 每个随机置换分析允许的秒数 大样本或高置换次数时适当增加
置信水平 相对效应区间的覆盖水平 通常使用 95%;应与方案一致

一键自动生成以下表格和图形:

  • 分析变量、组别顺序、备择假设、缺失策略和检验版本;
  • 每个结局、每个组别的有效样本量;
  • 均值、标准差、中位数、四分位距、最小值和最大值;
  • t 近似、随机置换和完全置换的统计量与 P 值;
  • 相对效应、置信区间和方向定义;
  • 分组小提琴/箱线/散点图与相对效应图;
  • Word 报告、汇总结果 CSV 和分析数据 CSV。

10.10.7 使用步骤

10.10.7.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “非参数检验” → “Brunner-Munzel 两独立样本检验”

10.10.7.2 2. 选择结局和分组

在“连续结局”中选择一个或多个数值变量,在“二水平分组变量”中选择恰好有两个有效水平的分类变量。界面默认选择前两个数值变量,正式运行前应按研究问题调整。

Brunner-Munzel 检验:完整设置与分析概览
Brunner-Munzel 检验:完整设置与分析概览

10.10.7.3 3. 设置假设与缺失值

无明确方向时保留双侧。只有研究方案在查看数据前已经规定方向时,才选择“第一组 > 第二组”或“第一组 < 第二组”。批量分析多个结局时,逐结局删除可以保留更多数据;整行删除可使各结局使用同一批观察。

10.10.7.4 4. 选择检验版本

默认使用 t 近似。随机置换适合敏感性分析,需设置置换次数、计算时限和随机种子。完全置换仅用于小样本;组合数过大时,模块会显示可读错误或保留其他可用检验结果,不会使整个应用退出。

10.10.7.5 5. 开始分析

主要表格、相对效应和两张图默认勾选。点击 “开始 Brunner-Munzel 检验”,模块会完成数据验证、计算、绘图和下载准备。

10.10.8 结果解释

10.10.8.1 分析概览和样本量

首先核对连续结局、分组变量、第一组、第二组、备择假设、检验版本和缺失处理。逐结局删除时,不同结局可能具有不同的 N;这不是错误,但报告时应分别注明。

10.10.8.2 描述统计

均值和标准差便于理解原始量纲,中位数和四分位距用于核对偏态与离散程度。若两组方差或分布形状差异明显,正是本检验相较普通秩和检验更有价值的情形,但仍应排除录入错误和不合理极端值。

10.10.8.3 检验表

检验表按“结局变量 × 检验版本”逐行展示。t 近似报告统计量、自由度和 P 值;置换版本通常不报告自由度。多个版本的效应方向和结论一致时,结果更稳定;不一致时应报告主要方法,并把其他版本作为敏感性分析,不要只选择最显著的一行。

Brunner-Munzel 检验:多版本检验结果
Brunner-Munzel 检验:多版本检验结果

10.10.8.4 相对效应表

相对效应为 0 至 1 之间的点估计。值大于 0.5 表示第二组更倾向于取得较高值,值小于 0.5 表示第一组更倾向于取得较高值。区间越宽,表示估计越不精确。随机置换的原始尺度区间在极小样本或极高置信水平下可能超出 0 至 1,报告时应结合点估计、P 值和样本量谨慎说明。

10.10.9 图形解释

10.10.9.1 分组分布图

小提琴轮廓表示分布密度,箱线部分显示中位数和四分位范围,散点保留每个观察。先查看样本量、偏态、长尾、并列值和离群点,再解释检验结果。

10.10.9.2 相对效应图

蓝点表示相对效应点估计,横线表示置信区间,红色虚线位于 0.5。点位于 0.5 右侧表示第二组倾向于取得更高值,位于左侧表示第一组倾向于取得更高值。区间是否跨越 0.5 可辅助理解,但正式判断以当前检验版本的 P 值为准。

Brunner-Munzel 检验:分布图与相对效应图
Brunner-Munzel 检验:分布图与相对效应图

10.10.10 表格描述与下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动生成文字必须人工核对组别顺序、指标方向、检验版本、相对效应定义和数值。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格与图形。汇总结果 CSV 保存各结果表;分析数据 CSV 保存本次送入分析的变量和案例。

Brunner-Munzel 检验:Word 与 CSV 下载页
Brunner-Munzel 检验:Word 与 CSV 下载页

建议:正式分析时同时保存原始数据版本、组别编码及顺序、缺失策略、主要检验版本、置换次数、随机种子、置信水平、Word 报告和 CSV,并在方法部分明确相对效应的方向定义。

10.10.11 论文报告建议

方法部分建议说明研究设计、连续结局、二水平分组、组别顺序、缺失值处理、备择假设、主要检验版本、置换次数、随机种子、置信水平和相对效应定义。结果部分依次报告每组 N、描述统计、相对效应及区间、检验统计量、自由度和 P 值。

可参考如下写法:

因两组结局分布偏态且离散程度不同,采用 Brunner-Munzel 检验比较治疗组与对照组。有效样本量分别为 42 和 40。相对效应 P(对照组 < 治疗组)+0.5P(相等) 为 0.68(95% CI 0.56 至 0.80),t 近似统计量为 2.74,自由度为 68.3,双侧 P=0.008,提示治疗组更倾向于取得较高结局值。随机置换敏感性分析所得方向一致。

示例数值仅用于展示写法,实际报告必须使用本研究输出。若结局数值越高代表更差,应把“较高值”按临床含义正确解释,不能自动写成“疗效更好”。

10.10.12 常见问题

1. 它和 Mann-Whitney/Wilcoxon 秩和检验有什么区别?

两者都使用排序信息,但 Brunner-Munzel 检验不要求两组分布形状和离散程度相同,结果更自然地解释为随机优势。

2. 显著结果是否表示两组中位数不同?

不一定。只有在两组分布形状近似一致时,中位数位移解释才较合理。本模块的正式目标是相对效应是否偏离 0.5。

3. 为什么组别顺序这么重要?

相对效应定义为第一组小于第二组的概率加相等概率的一半。交换组别会把相对效应变为 \(1-p\),单侧假设方向也会相反。

4. 什么时候使用随机置换?

小样本、近似自由度不稳定或希望做敏感性分析时可以使用。正式报告应增加置换次数并固定随机种子。

5. 为什么置换次数被自动提高?

高置信水平需要足够多的尾部置换结果来估计区间。输入次数不足时,模块按置信水平自动提高到最低可计算次数,并在结果中记录。

6. 完全置换为什么不可用?

完全置换数量随样本量组合式增长。样本稍大就可能需要数千万次排列,此时应改用随机置换或 t 近似。

7. 多个结局的有效样本量为什么不同?

选择逐结局删除时,每个结局只删除自身缺失案例。若需要各结局使用完全相同的人群,选择“所有所选结局整行删除”。

8. 单侧检验可以在看到结果后选择吗?

不可以。单侧方向应在研究方案中预先规定;查看结果后改为单侧会增加错误发现风险。

9. 可以调整年龄、性别等协变量吗?

当前模块不提供协变量调整。需要调整混杂因素时,应使用与结局分布相匹配的回归模型。

10. 分析报错会不会使整个应用退出?

不会。变量类型错误、组别不为两个水平、样本不足、完全置换过大或计算超时都会在当前模块显示错误信息,其他页面和当前会话仍可继续使用。

10.10.13 小结

本模块的最佳使用顺序是:先确认两个独立组和指标方向,核对组别顺序与缺失策略,查看原始分布和样本量,以 t 近似作为主要分析,必要时用固定种子的随机置换进行敏感性分析,最后同时报告相对效应、区间、统计量和 P 值。

10.11 稳健统计检验

稳健统计用于在数据存在离群值、厚尾、偏态或方差不齐时,降低少数极端观察对位置估计和组间比较的影响。本模块把稳健描述、独立两组检验、配对检验和稳健方差分析放在同一界面中,并同步输出可核对的原始分布、稳健估计、置信区间和 Word 报告。

核心原则:稳健方法不是自动修复数据质量问题。分析前仍需核对录入错误、研究设计、独立性、配对关系和分组编码,并同时查看原始数据分布与样本量。

10.11.1 模块能做什么

  • 对一个或多个连续变量计算均值、截尾均值、Winsor 均值、M 估计和中位数。
  • 按一个分类变量分层显示稳健描述统计。
  • 对二水平独立组进行 Yuen 截尾均值检验、Bootstrap 检验和 M 估计检验。
  • 对两个配对连续变量进行稳健位置差异检验。
  • 对 1 至 3 个固定因子进行截尾均值、中位数或 Bootstrap 稳健方差分析。
  • 在可用时生成稳健事后比较、差值、置信区间和效应量。
  • 输出小提琴/箱线/散点分布图、稳健估计与区间图,以及配对个体连线图。
  • 下载当前表格和图形的 Word 报告、汇总结果 CSV 与完整案例 CSV。

10.11.2 适用场景

本模块适合以下研究问题:

  1. 连续结局中存在少量可信但极端的观察值;
  2. 数据分布厚尾或明显偏态,普通均值对样本扰动较敏感;
  3. 两组样本量或方差不均衡,希望使用截尾均值进行比较;
  4. 配对差值受到少数极端变化值影响;
  5. 单因素或多因素设计中,经典方差分析的正态和方差齐性假设难以满足;
  6. 需要把原始分布、稳健位置估计和推断结果同时纳入报告。

典型医学例子包括:住院天数、炎症指标、费用、手术出血量、治疗前后变化值,以及存在少量极端反应者的连续疗效结局。

不宜直接使用的情况:结局为二分类、计数或生存时间;同一受试者有三个及以上重复时间点;数据存在聚类、中心或医师层级;研究目标是调整协变量或估计复杂交互。此时应选择相应的广义模型、混合效应模型或重复测量模型。

10.11.3 数据准备

每行代表一个独立观察单位。独立两组和稳健方差分析使用长表;配对检验使用宽表,每个受试者的两次测量位于同一行。

ID Outcome Outcome2 Before After Group Site
001 12.4 7.1 14.8 15.9 Control East
002 10.8 6.5 13.2 14.1 Treatment West
003 25.6 8.9 16.1 20.7 Treatment North
  • 连续结局和配对变量应设置为数值型。
  • 分组变量和固定因子应设置为分类变量。
  • 独立两组检验的分组变量必须恰好有两个有效水平。
  • 配对变量 1 和配对变量 2 必须是不同变量,并且一一对应。
  • 稳健方差分析可选择 1 至 3 个固定因子;每个模型单元都应有足够观察。
  • 当前分析按所选变量删除缺失案例,结果中的有效样本量应与预期一致。

10.11.4 主要参数

设置 含义 使用建议
截尾比例 从分布两端各去除一定比例后计算均值 默认 0.20;敏感性分析可比较 0.10、0.20 和 0.30
Winsor 水平 将两端极端值替换为相应分位点后计算均值 默认 0.20;用于描述时应报告具体水平
M 估计弯曲常数 控制极端残差被降低权重的程度 默认 1.28;无领域依据时保留默认值
Bootstrap 次数 通过重复抽样估计检验分布或区间 快速探索可较少,正式报告建议增加并固定随机种子
数据点展示 抖动或堆叠显示原始观察 抖动适合连续分布;堆叠适合并列值较多的数据
随机种子 固定 Bootstrap 与随机图形位置 保存并在方法部分或分析记录中注明

截尾均值去除两端同等比例的观察后计算中心,能降低极端值影响;Winsor 均值不删除观察,而是将极端值替换为边界分位点;M 估计依据每个观察与中心的距离给予不同权重;中位数只使用排序中心,对极端值最不敏感,但可能牺牲部分效率。

一键自动生成以下表格和图形:

  • 分析类型、变量、稳健参数、Bootstrap 次数和随机种子;
  • 完整案例数、排除案例数以及分组/组合样本量;
  • 均值、标准差、截尾均值、Winsor 均值、M 估计、中位数及其区间;
  • 稳健检验统计量、自由度、P 值、差值、置信区间和效应量;
  • 稳健方差分析主效应、交互效应及事后比较;
  • 原始分布图、稳健估计区间图和配对个体连线图;
  • Word 报告、汇总结果 CSV 和完整案例 CSV。

10.11.5 使用步骤

10.11.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “稳健统计” → “稳健统计检验”

10.11.5.2 2. 选择分析类型和变量

在“分析类型”中选择稳健描述统计、独立两组稳健检验、配对资料稳健检验或稳健方差分析。界面会自动切换为当前模式需要的变量面板。

稳健统计检验:完整设置与分析概览
稳健统计检验:完整设置与分析概览

10.11.5.3 3. 设置稳健估计

根据研究方案选择需要报告的中心位置指标。建议至少保留截尾均值、中位数和一种原始尺度指标,并明确截尾比例、Winsor 水平和 M 估计常数。

10.11.5.4 4. 设置检验方法

  • 独立两组:可同时运行 Yuen 截尾均值检验、Yuen Bootstrap 检验和 M 估计检验,并选择 M 估计方法。
  • 配对资料:选择两个按行配对的连续变量。
  • 稳健方差分析:选择截尾均值、中位数或 Bootstrap;Bootstrap 还可设置估计量和距离方法。
稳健统计检验:推断方法和输出设置
稳健统计检验:推断方法和输出设置

10.11.5.5 5. 开始分析

主要表格和图形默认勾选。点击 “开始稳健统计分析” 后,数据校验、模型计算、绘图和导出错误只会显示在当前模块中,不会使整个应用退出。

10.11.6 结果解释

10.11.6.1 分析概览和样本量

先核对分析类型、变量、完整案例数、排除案例数、分组水平和每组样本量。若独立两组变量出现三个及以上有效水平,或方差分析存在极小单元,应先修正编码或重新考虑模型。

10.11.6.2 稳健描述统计

描述表将普通均值与多种稳健位置估计并列展示。当普通均值与截尾均值、中位数差距明显时,提示分布不对称或极端值对普通均值影响较大。此时应结合分布图辨别偏态、厚尾、离群点和组间不平衡。

稳健描述统计:位置估计结果
稳健描述统计:位置估计结果

10.11.6.3 独立两组稳健检验

Yuen 检验比较两组截尾均值,并允许组间离散程度不同;Bootstrap 结果通过重复抽样估计不确定性;M 估计检验降低极端观察的权重。多个检验结果一致时,结论更稳健;不一致时应报告具体方法、效应方向和区间,不宜只挑选显著结果。

差值的正负方向取决于表中组别顺序。P 值反映当前零假设下结果的相容程度,不代表效应大小;效应量和置信区间用于判断差异的方向、大小和精度。

10.11.6.4 配对资料稳健检验

配对分析关注同一观察单位两次测量之差。应先核对配对方向,再结合个体连线图查看多数受试者是否具有一致变化,以及少数极端变化是否影响普通均值。

配对资料:稳健检验与个体变化图
配对资料:稳健检验与个体变化图

10.11.6.5 稳健方差分析与事后比较

主效应表示在模型中平均考虑其他因子后,该因子各水平是否存在整体差异;交互效应表示一个因子的差异是否随另一个因子水平而改变。存在交互时,应优先解释交互和分层模式,再讨论主效应。

只有在研究问题需要且整体结果支持进一步比较时,才解释事后比较。事后表中的差值、区间和 P 值必须与比较方向和因子水平同时报告。

稳健方差分析:主效应、交互与事后比较
稳健方差分析:主效应、交互与事后比较

10.11.7 图形解释

10.11.7.1 原始分布图

小提琴轮廓表示分布密度,箱线部分显示中位数和四分位范围,散点保留每个观察。先看样本量、偏态、长尾和极端值,再解释位置估计与检验结果。

10.11.7.2 稳健估计与区间图

点表示所选稳健中心,线段表示相应区间。组间区间重叠不能机械等同于“无差异”,正式判断应以相应检验和差值区间为准。

独立两组:分布图与稳健估计区间图
独立两组:分布图与稳健估计区间图

10.11.7.3 配对个体连线图

每条线代表同一观察单位从变量 1 到变量 2 的变化。多数线条方向一致提示整体变化较一致;交叉较多或少数线条跨度很大时,应谨慎解释平均变化。

10.11.8 表格描述与下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动生成的文字必须人工核对变量、组别顺序、截尾比例、检验方法和数值。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。汇总结果 CSV 按结果表保存统计量;完整案例 CSV 保存本次分析实际使用的数据。

稳健统计检验:Word 与 CSV 下载页
稳健统计检验:Word 与 CSV 下载页

建议:正式报告时同时保存原始数据版本、变量编码、排除案例数、截尾/Winsor 比例、M 估计设置、Bootstrap 次数、随机种子、Word 报告和 CSV,并用至少一种合理替代设置进行敏感性分析。

10.11.9 论文报告建议

方法部分建议说明选择稳健方法的原因、研究设计、分析变量、组别顺序、完整案例规则、位置估计、截尾或 Winsor 比例、Bootstrap 次数、随机种子、效应量和事后比较策略。结果部分建议先报告样本量和分布,再报告稳健中心、组间或配对差值、95% 置信区间、检验统计量和 P 值。

独立两组结果可参考如下写法:

因结局分布呈厚尾并含少量极端观察,采用 20% 截尾均值进行组间比较。治疗组与对照组的截尾均值分别为 11.42 和 10.31,Yuen 检验提示两组差值为 1.11(95% CI 0.34 至 1.88,P=0.006)。Bootstrap 和 M 估计敏感性分析所得效应方向一致。

稳健方差分析可参考如下写法:

采用 20% 截尾均值的两因素稳健方差分析评价组别、中心及其交互。组别主效应具有统计学意义(P=0.012),中心主效应和组别×中心交互未见明确证据。事后比较及原始分布图用于说明差异方向和不确定性。

示例数值仅用于展示写法,实际报告必须使用本研究输出。稳健分析降低异常值影响,但不能把观察性关联解释为因果效应。

10.11.10 常见问题

1. 截尾比例 0.20 是删除 20% 的全部数据吗?

不是。通常表示从分布低端和高端各截去 20% 后计算截尾均值,因此中心 60% 的观察直接参与均值计算。原始数据并未从文件中删除。

2. 截尾均值和 Winsor 均值有什么区别?

截尾均值不让两端观察直接参与均值;Winsor 均值保留样本量,但将两端值替换为边界分位点。两者都应报告所用比例。

3. 为什么普通均值和中位数差别很大?

常见原因是偏态、长尾或极端值。应先排除录入错误,再结合分布图和稳健估计判断哪一种中心位置更符合研究问题。

4. 独立两组检验为什么不能选择三水平分组?

该模式只比较两个独立组。三个及以上组应使用稳健方差分析,并根据研究设计决定是否进行事后比较。

5. 配对分析可以用于两个独立组吗?

不可以。配对检验要求同一受试者或匹配单位的两次测量按行一一对应。独立样本应使用独立两组模式。

6. Bootstrap 次数应该设多少?

较少次数适合界面探索;正式分析通常需要更多重复以提高数值稳定性。应在计算资源允许范围内增加次数,并固定随机种子检查结果是否稳定。

7. 多种检验结果不一致怎么办?

先检查它们比较的中心位置是否相同,再查看分布、样本量和区间。应预先指定主要方法,把其他方法作为敏感性分析,而不是事后选择最显著的结果。

8. 稳健方法是否意味着可以忽略异常值?

不能。异常值可能来自录入错误、不同人群、测量故障或真实极端反应。稳健估计只降低其数值影响,不能替代数据核查和临床判断。

9. 稳健方差分析可以调整连续协变量吗?

当前模块不提供连续协变量调整。若需要协变量、随机效应或重复测量结构,应使用相应的回归或混合效应模型。

10. 为什么图形有结果但某个表格为空?

先检查当前分析模式是否支持该结果。例如事后比较只适用于稳健方差分析,配对个体连线图只适用于配对模式。还要确认相应输出复选框已勾选。

10.11.11 小结

本模块的最佳使用方式是:先核对异常值是否真实和研究设计是否正确,再预先指定主要稳健估计与检验,先查看样本量和原始分布,随后解释差值、效应量、置信区间和 P 值,最后用替代稳健设置进行敏感性分析。

稳健统计的价值在于减少少数极端观察对结论的支配,而不是让研究者跳过数据清理、设计判断和结果透明报告。

10.12 等效性检验

等效性检验用于判断观察到的效应是否足够接近零或目标值,以至于落在研究者预先规定的可接受范围内。本模块支持单样本均值、配对样本均值、独立两组均值、相关系数和两组比例差,并可切换为最小效应检验,判断效应是否明确超过预设的实际意义阈值。

核心原则:传统差异检验未达到统计学显著,不等于已经证明等效。等效性结论必须依赖分析前预先规定的下界和上界,并由两项单侧检验共同支持。

10.12.1 模块能做什么

  • 检验一个连续变量的均值相对于参考值是否等效或超过最小效应界值;
  • 检验同一受试者两次连续测量的平均差是否等效;
  • 检验两个独立组的连续结局均值差是否等效;
  • 检验 Pearson、Spearman 或 Kendall 相关系数是否位于预设范围内;
  • 检验两个独立组的目标事件率之差是否位于预设范围内;
  • 对均值问题使用原始单位或标准化效应量界值,并报告 Cohen’s d 或 Hedges’ g;
  • 同时输出传统零效应检验、单侧检验、效应估计、置信区间、结论摘要和统计图;
  • 下载当前表格与图形的 Word 报告、汇总结果 CSV 和完整案例 CSV。

10.12.2 适用场景

本模块适合以下研究问题:

  1. 验证仿制药与参比制剂的连续疗效差异是否处于预先接受范围;
  2. 判断两种测量方法的平均差是否小到可忽略;
  3. 判断干预前后某项指标的平均变化是否可视为没有实际意义;
  4. 检验两个指标之间的相关是否小于研究者关心的最低相关强度;
  5. 比较两组不良事件率或有效率之差是否处于可接受范围;
  6. 在确证性研究中验证观察效应是否至少达到预先规定的最小重要效应。

不宜直接使用的情况:界值是在看到结果后才选择;存在三个及以上独立组;数据具有中心、医生或受试者内聚类;需要调整多个协变量;结局为计数、生存时间或有序多分类。此时应使用与研究设计相匹配的回归、混合效应或生存分析方法,并在模型尺度上定义界值。

10.12.3 方法原理

10.12.3.1 等效性检验

设可接受的效应范围为下界 \(\Delta_L\) 至上界 \(\Delta_U\)。等效性检验同时考察效应是否大于下界,以及是否小于上界。只有两项单侧检验都达到预设显著性水平,才能拒绝“效应位于等效区间之外”的零假设,并认为数据支持等效。

当显著性水平为 0.05 时,等效性判断通常等价于检查相应的 90% 置信区间是否完全落在预设界值内。界面仍应以两项单侧检验和结论摘要为正式判断依据。

10.12.3.2 最小效应检验

最小效应检验回答相反问题:效应是否有证据超过预先规定的最小重要界值。它用于排除“效应虽不为零但过小、缺乏实际意义”的情形。等效性检验和最小效应检验的目标不同,不能仅因更容易显著而事后互换。

10.12.3.3 与传统差异检验的区别

传统零效应检验考察效应是否不同于 0;等效性检验考察效应是否被限制在可接受区间;最小效应检验考察效应是否超过实际意义阈值。因此可能出现以下组合:

传统检验 等效性检验 解释
显著 显著 效应不同于 0,但仍小到处于预设等效范围内
显著 不显著 存在差异,但尚不能证明差异足够小
不显著 显著 没有明确零效应差异,同时有证据支持等效
不显著 不显著 证据不足,既不能证明差异,也不能证明等效

10.12.4 数据准备

每行代表一个观察单位。独立两组、相关和比例差使用长表;配对均值使用宽表,同一受试者的两次测量位于同一行。

ID Outcome Before After Marker1 Marker2 Event Group
001 0.21 20.4 20.6 -0.42 -0.31 Yes Control
002 -0.08 18.9 19.2 0.15 0.27 No Treatment
003 0.34 22.1 22.0 0.73 0.51 Yes Treatment
  • 单样本、配对、独立两组和相关变量应设置为数值型;
  • 独立两组和比例差模式的分组变量必须恰好有两个有效水平;
  • 比例差模式需选择分类结局中的目标事件水平;
  • 配对变量必须是一一对应的两个不同变量;
  • 当前分析按照所选变量删除缺失案例,应先核对完整案例数;
  • 差值方向由变量顺序、组别顺序或目标事件定义决定,必须在报告中写清楚。

10.12.5 界值设定

界值应在查看当前研究结果之前,根据临床最小重要差异、法规或指南、测量误差、既有高质量研究、专家共识或样本量设计预先确定。

设置 含义 使用建议
下界 / 上界 可接受效应范围或最小效应阈值 可不对称,但必须有领域依据并预先记录
原始单位 直接用结局的自然单位定义界值 最便于临床解释,通常优先
标准化效应量 以样本标准差为尺度定义界值 跨量表比较时使用,需说明标准化方式
Hedges’ g 对小样本偏倚校正的标准化均值差 小样本或组间样本量不均时优先
Cohen’s d 未作小样本偏倚校正的标准化均值差 样本较大且研究方案明确指定时使用
方差相等 独立两组均值采用合并方差假设 无充分依据时不要勾选
显著性水平 每项单侧检验使用的错误概率 默认 0.05;确证性分析应按方案设置

一键自动生成以下表格和图形:

  • 分析模式、目标假设、变量、界值尺度、显著性水平和完整案例数;
  • 总样本量、分组样本量及描述统计;
  • 传统零效应检验、下界单侧检验和上界单侧检验;
  • 预设界值、原始尺度或标准化效应估计及其区间;
  • 传统检验与目标假设的结论摘要;
  • 效应区间与预设界值图、原始数据分布图和配对差值图;
  • Word 报告、汇总结果 CSV 和完整案例 CSV。

10.12.6 使用步骤

10.12.6.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “等效性与最小效应检验” → “等效性检验”

10.12.6.2 2. 选择分析类型和变量

选择单样本均值、配对样本均值、独立两组均值、相关系数或两组比例差。界面会自动切换为当前模式所需的变量菜单。

等效性检验:完整设置与分析概览
等效性检验:完整设置与分析概览

10.12.6.3 3. 选择目标假设

  • 研究问题是“差异是否足够小”时选择 等效性检验
  • 研究问题是“效应是否至少达到重要阈值”时选择 最小效应检验

目标假设应在分析方案中预先指定,不能在查看结果后切换以追求显著。

10.12.6.4 4. 输入预设界值

均值模式可选原始单位或标准化效应量。相关和比例差界值必须位于 -1 至 1。下界必须严格小于上界;若研究只关心一个方向,也应按研究方案明确另一侧界值的含义。

10.12.6.5 5. 开始分析

主要表格和图形默认勾选。点击 “开始等效性检验” 后,模块会完成数据校验、检验、绘图和导出准备。无效界值或变量设置会在当前模块内显示错误,不会使整个应用退出。

10.12.7 结果解释

10.12.7.1 分析概览和描述统计

先核对分析模式、变量顺序、目标事件、界值尺度、完整案例数和组别顺序。均值与标准差、事件数与事件率或相关变量的离散程度用于发现编码、方向和样本量问题,但不能代替正式检验。

10.12.7.2 假设检验表

均值模式通常显示三行:传统零效应检验、下界单侧检验和上界单侧检验。等效性要求后两项单侧检验共同达到显著性水平。只看传统检验的 P 值会导致错误结论。

独立两组均值:单侧检验、界值与效应估计
独立两组均值:单侧检验、界值与效应估计

10.12.7.3 界值与效应估计表

先确认界值与效应估计采用相同尺度,再比较点估计和区间。原始单位结果便于临床解释;标准化结果适合跨量表比较,但其含义依赖样本离散程度。置信区间越宽,通常表示结论不确定性越大。

10.12.7.4 结论摘要

结论摘要把传统零效应检验与当前目标假设分开报告。若等效性未成立,应写“尚不能确认等效”,不能写成“证实不等效”;若传统差异不显著,也不能写成“没有差异”。

10.12.8 五种分析模式

10.12.8.1 单样本均值

比较连续变量均值与参考值之间的差。参考值可以是 0、目标浓度、标准值或历史基准。原始单位界值应围绕“均值减参考值”的差异解释。

10.12.8.2 配对样本均值

比较同一受试者两个变量的平均差。必须确认变量 1 和变量 2 的时间或方法顺序;区间和结论均依赖差值方向。个体连线图和差值分布图可用于识别方向不一致和极端变化。

配对样本:效应界值图与个体变化输出
配对样本:效应界值图与个体变化输出

10.12.8.3 独立两组均值

比较两个独立组的连续结局。无充分方差齐性依据时保留默认的不等方差设置。差值方向由分组水平顺序决定,报告时应写明“哪一组减哪一组”。

10.12.8.4 相关系数

Pearson 适合线性关系,Spearman 适合单调关系或偏态数据,Kendall 对小样本和并列秩更稳健。界值定义在相关系数尺度上,必须位于 -1 至 1。相关等效性仍不代表两个测量方法可以互换。

10.12.8.5 两组比例差

先选择分类结局中的目标事件,再选择二水平分组变量。效应表示两组目标事件率之差,正负方向取决于组别顺序。应同时报告两组事件数、总例数、事件率、比例差和区间。

两组比例差:事件选择与效应界值图
两组比例差:事件选择与效应界值图

10.12.9 图形解释

10.12.9.1 效应估计与预设界值图

蓝点表示效应点估计,线段表示相应区间,红色虚线表示预设下界和上界。等效性分析中,区间完全位于两条界线之间时通常支持等效;最小效应分析则关注区间是否排除界值内的最小效应区域。正式结论仍以检验表和结论摘要为准。

10.12.9.2 原始数据分布图

单样本显示直方图;独立两组显示小提琴、箱线和散点;配对样本显示个体变化;相关模式显示散点与趋势;比例差显示各组事件率。先核对异常值、偏态、组间不平衡和事件稀少,再解释推断结果。

10.12.10 表格描述与下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动文字必须人工核对变量顺序、目标事件、组别方向、界值来源和统计结论。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格与图形。汇总结果 CSV 保存各结果表;完整案例 CSV 保存本次分析实际使用的数据。

等效性检验:Word 与 CSV 下载页
等效性检验:Word 与 CSV 下载页

建议:正式分析时同时保存界值依据、分析方案、变量和组别顺序、目标事件、完整案例数、效应尺度、显著性水平、Word 报告和 CSV。界值依据比计算按钮更重要。

10.12.11 论文报告建议

方法部分建议说明研究设计、分析对象、目标假设、效应定义、差值方向、界值及其依据、原始或标准化尺度、显著性水平、完整案例规则和所用相关或方差方法。结果部分建议依次报告样本量、描述统计、效应估计、区间、两项单侧检验和明确的等效性结论。

独立两组均值结果可参考如下写法:

预先将治疗组减对照组的临床等效界值设为 -0.50 至 0.50 分。两组均值差为 -0.05 分,90% 置信区间为 -0.33 至 0.23。下界和上界单侧检验均达到预设显著性水平,因此结果支持两组在该结局上的等效性。传统双侧差异检验未见明确差异证据。

两组比例差结果可参考如下写法:

目标事件定义为治疗有效,治疗组减对照组的等效界值预设为 -10 至 10 个百分点。两组事件率差及其 90% 置信区间完全位于预设界值内,两项单侧检验共同支持等效性。

示例数值仅用于展示写法,实际报告必须使用本研究输出和预先记录的界值依据。

10.12.12 常见问题

1. P>0.05 是否表示两组等效?

不是。P>0.05 只表示传统差异检验没有足够证据拒绝零效应。证明等效需要预设界值,并由两项单侧检验共同支持。

2. 等效界值可以根据当前样本结果设定吗?

不可以。事后围绕点估计设置界值会使结论失去确证意义。界值应来自临床、方法学或外部证据,并在查看结果前确定。

3. 为什么等效性检验常显示 90% 置信区间?

当两项单侧检验各使用 0.05 显著性水平时,与之对应的区间通常为 90% 双侧区间。若改变显著性水平,相应区间水平也会改变。

4. 下界和上界必须对称吗?

不必须。只要不对称界值具有明确领域依据并预先规定即可。例如一个方向的伤害可能比另一个方向更难接受。

5. 原始单位和标准化效应量如何选择?

存在可解释的临床单位和最小重要差异时优先原始单位。只有在跨量表比较或缺乏统一自然单位时,才考虑标准化效应量,并说明标准化定义。

6. Hedges’ g 与 Cohen’s d 有什么区别?

两者都是标准化均值差。Hedges’ g 对小样本偏倚进行校正;样本较小时通常更合适。

7. 独立两组为什么只能选择二水平分组?

当前模式定义的是一个两组差值。三个及以上组需要预先指定比较或使用相应的多组模型,并处理多重比较问题。

8. 相关系数等效是否表示两个方法一致?

不是。相关反映共同变化,不反映系统偏倚和个体层面一致性。方法学替代性应使用一致性或方法比较模块。

9. 比例差模式为什么必须选择目标事件?

同一二分类变量选择不同水平会改变事件率和差值方向。报告必须明确事件定义,例如“死亡”“有效”或“发生不良事件”。

10. 等效性未成立是否证明不等效?

不是。可能是样本量不足、区间过宽或真实效应接近界值。应写“尚不能确认等效”,并结合效应区间和研究精度解释。

10.12.13 小结

本模块的最佳使用方式是:先依据外部证据预设界值和效应方向,再选择与研究设计对应的分析模式,先核对完整案例、变量和组别顺序,随后联合解释两项单侧检验、效应区间和结论摘要,最后保存 Word、CSV 与界值依据。

等效性分析的关键不是把“不显著”换一种说法,而是用预先定义的实际意义范围回答一个独立、可检验的问题。

10.13 独立两组估计统计

独立两组估计统计用于比较两个互不重叠人群的连续结局。与只给出“是否显著”的传统检验不同,本模块重点报告差异有多大、估计有多精确,以及结果是否落在研究者预先规定的可忽略区间内。既可以直接分析逐例原始数据,也可以只输入两组的均值、标准差和样本量。

核心问题:比较组与参考组相差多少?该差值的置信区间有多宽?标准化后效应有多大?若已预设一个可忽略区间,当前区间证据能否把结果判为可忽略、具有实质性,还是仍不明确?

10.13.1 模块能做什么

  • 同时分析一个或多个连续结局和一个二水平分组变量;
  • 输入两组汇总统计,在没有逐例数据时估计均值差和标准化均值差;
  • 输出两组均值、中位数、标准差、四分位数、样本量和缺失数;
  • 输出均值差、中位数差、标准化均值差及置信区间;
  • 对严格为正的真比率尺度输出均值比和中位数比;
  • 选择等方差或不等方差估计,并反转比较方向;
  • 评估点零假设以及以零为中心的区间零假设;
  • 绘制半眼图、猫眼图和不同布局的原始数据点;
  • 下载包含当前表格和图形的 Word 报告、结果 CSV 与分析数据 CSV。

10.13.2 适用场景

本模块适合平行对照试验、两个独立人群的横断面比较、两种互不重叠诊疗策略的连续结局比较,以及只有文献汇总统计时的效应估计。例如血压、量表评分、住院天数、炎症指标、检验值、费用和生理测量。

不宜直接使用的情况:同一受试者治疗前后、配对或匹配设计、三个及以上组、重复测量、中心聚类、需要调整协变量、结局为二分类/计数/生存时间。此时应选择配对分析、方差分析、回归或混合效应模型。

10.13.3 方法原理

设参考组均值为 \(\bar X_R\),比较组均值为 \(\bar X_C\),本模块按以下方向报告均值差:

\[\Delta=\bar X_C-\bar X_R\]

正值表示比较组较高,负值表示比较组较低。反转比较方向后,差值符号和组间比值的分子、分母会同时改变。

标准化均值差将原始量纲差值除以两组离散程度的标准化分母,并进行小样本偏倚校正。它适合跨量纲比较效应大小,但不能替代原始量纲差值的临床解释。

若启用区间零假设,模块把预设边界写为 \([-\delta,+\delta]\)。边界可用原始单位,也可用标准差单位输入。置信区间完全位于该区间内时,结果支持效应可忽略;完全位于区间外时,结果支持效应具有实质性;两者重叠时,当前证据仍不明确。

10.13.4 原始数据与汇总数据

数据入口 必要信息 可输出结果
原始数据 一个或多个连续结局、一个二水平分组变量 均值差、中位数差、标准化均值差、可选比值、假设评估和完整估计图
汇总数据 两组名称、均值、标准差、样本量、变量名称 均值差、标准化均值差、假设评估和不含原始点的估计图

汇总数据不能恢复中位数、四分位数、离群值或原始分布,因此不会输出中位数差、中位数比或原始数据点。

10.13.5 数据准备

原始数据应为长表,每行代表一个独立观察单位。

ID Outcome Biomarker Group
001 10.4 8.2 Control
002 9.7 9.1 Control
003 12.8 11.6 Treatment
004 11.9 10.8 Treatment
  • 连续结局必须为数值型;
  • 分组变量必须恰好包含两个有效水平;
  • 每组、每个结局至少需要两个有效观察;
  • 每行必须来自独立观察单位;
  • 计算比值时,所选结局必须严格大于零,并且零点具有实际意义;
  • 输入汇总数据时,两组标准差必须大于零,样本量不得少于 2。

10.13.6 主要参数

设置 含义 使用建议
数据入口 原始数据或汇总数据 有逐例数据时优先使用原始数据
主要效应 均值差或中位数差 按研究问题预先确定;汇总数据只能使用均值差
置信水平 90%、95% 或 99% 通常使用 95%,并与方案保持一致
方差假设 等方差或不等方差 默认不等方差;只有充分依据时勾选等方差
反转比较方向 交换参考组和比较组 用于使效应方向与研究问题一致
组间比值 均值比和中位数比 只用于严格为正的真比率尺度
区间零假设边界 预先定义的可忽略范围 应依据临床或专业意义预设,不要由结果反推
误差分布样式 半眼图、猫眼图或不显示 半眼图适合默认展示;猫眼图便于比较对称区间
原始点布局 随机抖动、蜂群或不显示 样本较少时保留原始点;重叠严重时使用蜂群
差值轴单位 原始单位或标准差单位 临床解释用原始单位,跨量纲比较可用标准差单位

一键自动生成以下表格和图形:

  • 数据入口、结局、分组、比较方向、方差假设和置信水平;
  • 两组描述统计与有效样本量;
  • 均值及均值差、标准化均值差;
  • 原始数据模式下的中位数及中位数差;
  • 可选的均值比和中位数比;
  • 点零假设和区间零假设评估;
  • 估计图以及 Word、结果 CSV 和分析数据 CSV。

10.13.7 使用步骤

10.13.7.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “效应量与估计统计” → “独立两组估计统计”

10.13.7.2 2. 选择数据入口

有逐例数据时保留“分析原始数据”,选择一个或多个连续结局和一个二水平分组变量。只有两组均值、标准差和样本量时,选择“输入汇总数据”并完整填写两组信息。

独立两组估计统计:完整设置面板
独立两组估计统计:完整设置面板
独立两组估计统计:图形与结果输出设置
独立两组估计统计:图形与结果输出设置

10.13.7.3 3. 设置估计方法

原始数据可选择均值差或中位数差作为主要效应。默认使用不等方差方法;若研究设计和数据依据支持共同方差,可勾选等方差。运行后先在“分析概览”核对比较方向,必要时反转。

10.13.7.4 4. 设置区间零假设和图形

只有在分析前已有可忽略阈值时才启用区间零假设。选择边界的单位,并设置误差分布样式、原始点布局和差值轴单位。界面不需要设置图宽和图高,每幅图在展示与下载时使用稳定尺寸。

10.13.7.5 5. 开始分析

所有结果输出默认勾选。点击 “开始独立两组估计”,模块会完成数据验证、效应估计、区间评估、绘图和下载准备。

10.13.8 结果解释

10.13.8.1 分析概览和描述统计

首先核对参考组、比较组、差值方向、主要效应、方差假设和置信水平。原始数据模式还应核对两组 N、缺失数、均值、中位数、离散程度和极值,避免把录入错误或异常分布当作真实效应。

10.13.8.2 均值差与标准化均值差

均值差保留原始量纲,最适合临床解释;标准化均值差适合跨量纲比较。置信区间越窄,估计越精确。区间是否跨 0 可用于理解点零假设,但效应大小和专业意义不能只依据 P 值判断。

独立两组估计统计:均值效应与主要结果
独立两组估计统计:均值效应与主要结果

10.13.8.3 中位数差与比值

中位数差仅在原始数据模式下生成。比值大于 1 表示比较组较高,小于 1 表示比较组较低;只有严格为正且零点具有实际意义的量表才可解释比值。

10.13.8.4 假设评估

点零假设表报告传统差值为 0 的检验。区间零假设表把置信区间与预设可忽略范围比较。结果“不明确”不是分析失败,而是当前数据不足以把效应判为可忽略或具有实质性,通常需要更精确的数据或更大样本。

10.13.9 图形解释

估计图左侧展示两组原始数据、位置估计和区间,右侧展示比较组减参考组的差值及置信区间。半眼图用密度轮廓呈现误差分布,猫眼图使用双侧对称轮廓;选择“不显示”时仍保留点估计和区间。

独立两组估计统计:半眼估计图
独立两组估计统计:半眼估计图
独立两组估计统计:猫眼估计图与区间零假设
独立两组估计统计:猫眼估计图与区间零假设

10.13.10 表格描述与下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。图形可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动文字必须人工核对比较方向、效应单位、区间边界和数值。

进入 “下载 Word 报告” 页签,可下载当前成功生成的表格与图形。结果 CSV 汇总各结果表,分析数据 CSV 保存本次使用的逐例数据或两组汇总输入。

独立两组估计统计:Word 与 CSV 下载页
独立两组估计统计:Word 与 CSV 下载页

建议:在研究方案中预先写明主要效应、比较方向、方差假设、置信水平和可忽略边界。结果部分同时报告原始量纲差值、置信区间和标准化效应,不要只报告 P 值。

10.13.11 论文报告建议

方法部分应说明独立两组设计、结局、参考组和比较组、原始或汇总数据入口、方差假设、主要效应、置信水平,以及是否预设可忽略区间。结果部分依次报告两组 N 和描述统计、差值和置信区间、标准化效应、假设评估与必要的敏感性分析。

可参考如下写法:

治疗组的结局均值为 12.1(SD 2.4),对照组为 10.0(SD 1.5)。采用不等方差估计,治疗组减对照组的均值差为 2.1(95% CI 1.2 至 3.0),偏倚校正标准化均值差为 0.98(95% CI 0.51 至 1.44)。预设可忽略区间为 -0.20 至 0.20 个标准差,当前置信区间位于该范围之外,结果支持存在具有实质性的组间差异。

示例数值仅用于展示写法,实际报告必须使用本研究输出,并按指标“越高越好”或“越高越差”的方向解释。

10.13.12 常见问题

1. 为什么默认不假定方差相等?

不等方差方法对两组离散程度不同更稳健,通常也是更保守的默认选择。只有设计和数据依据充分时才使用共同方差。

2. 什么时候用中位数差?

当研究问题本身关注中位位置,或均值容易受长尾影响时可使用。它必须基于原始数据,不能从均值、标准差和样本量恢复。

3. 标准化均值差能否代替原始差值?

不能。标准化效应便于跨量纲比较,原始差值更适合专业和临床解释,两者应互补报告。

4. 为什么某个变量不能计算比值?

变量包含零或负值,或其零点没有真实含义。此时应取消比值,使用差值和标准化效应。

5. 区间零假设边界如何确定?

应来自临床最小重要差异、测量误差、规范阈值或事先共识,不能根据当前结果反向选择。

6. 汇总数据模式为什么没有原始点和中位数结果?

均值、标准差和样本量不足以恢复每个观察、中位数、四分位数和分布形状,因此模块只输出能够可靠计算的均值类结果。

7. 反转比较方向会改变显著性吗?

双侧 P 值通常不变,但差值符号、比值方向、组别标签和文字结论会改变,因此必须按研究问题固定方向。

8. 置信区间跨 0 是否等于“没有差异”?

不等于。它表示当前精度下不能排除 0;要证明效应可忽略,需要预设区间并查看整个置信区间是否位于其中。

9. 可以调整年龄、性别等协变量吗?

当前模块不提供协变量调整。需要控制混杂因素时,应使用线性模型或适合该结局的回归模型。

10. 输入错误会不会使整个应用退出?

不会。变量类型、组别水平、样本量、标准差、比值尺度或绘图错误会显示在当前模块中,其他页面和当前会话仍可继续使用。

10.13.13 小结

本模块的最佳使用顺序是:先确定独立两组设计和比较方向,选择原始或汇总数据入口,预先规定主要效应与置信水平,查看描述统计和估计图,再同时解释原始差值、标准化效应及置信区间;只有事先有专业依据时才启用比值和区间零假设。

10.14 配对估计统计

配对估计统计用于比较同一对象的两次连续测量,或按一一对应方式形成的两组连续观察。模块把每一对测量的关联纳入估计,重点报告变化有多大、区间有多精确,以及结果与预先规定的可忽略范围有何关系。既可以分析逐例原始配对数据,也可以输入两次测量的均值、标准差、配对数和配对相关系数。

核心问题:比较测量相对参考测量改变了多少?变化方向和不确定性如何?标准化后效应有多大?若已预设可忽略区间,当前证据支持变化可忽略、具有实质性,还是仍不明确?

10.14.1 模块能做什么

  • 分析同一对象两次连续测量,并仅使用共同完整配对;
  • 输入配对汇总统计,在没有逐例数据时估计均值差和标准化均值差;
  • 输出两次测量的描述统计、均值差、标准化配对均值差和配对相关;
  • 原始数据模式下输出中位数差,并可对严格为正的真比率尺度计算均值比和中位数比;
  • 评估点零假设以及以零为中心的区间零假设;
  • 绘制半眼图、猫眼图和不同布局的原始配对数据;
  • 为主要表格和图形生成中英文描述;
  • 下载包含当前表格与图形的 Word 报告、结果 CSV 和配对数据 CSV。

10.14.2 适用场景

本模块适合治疗前后、干预前后、同一受试者两种条件、左右侧配对、病例与一一匹配对照等连续结局比较。例如血压、量表评分、生理指标、实验室指标、疼痛评分和功能测量。

不宜直接使用的情况:两组对象互不重叠、三个及以上时间点、同一对象多次重复测量、存在中心或家庭聚类、需要调整协变量,或者结局为二分类、计数或生存时间。此时应选择独立两组估计、重复测量模型、回归或混合效应模型。

10.14.3 方法原理

设第 \(i\) 个对象的参考测量为 \(R_i\),比较测量为 \(C_i\),模块按以下方向定义配对差值:

\[D_i=C_i-R_i\]

因此正值表示比较测量较高,负值表示比较测量较低。配对均值差为 \(\bar D\),其精度由差值本身的离散程度和完整配对数决定。两次测量的个体内相关越高,通常越能减少差值估计的不确定性。

标准化配对均值差把原始量纲差值除以标准化分母,并进行区间估计。它便于跨量纲比较,但不能替代原始单位下的变化量。配对相关系数描述两次测量在个体层面的线性一致趋势,不等同于均值没有变化。

若启用区间零假设,模块把预设边界写为 \([-\delta,+\delta]\)。置信区间完全位于该范围内时,结果支持变化可忽略;完全位于范围外时,结果支持存在实质性变化;与边界重叠时,当前证据仍不明确。

10.14.4 原始数据与汇总数据

数据入口 必要信息 可输出结果
原始数据 两个数值型变量,分别表示参考测量和比较测量 描述统计、均值差、中位数差、标准化效应、配对相关、可选比值、假设评估和完整估计图
汇总数据 两次测量名称、均值、标准差、共同配对数和配对相关系数 描述统计、均值差、标准化效应、配对相关、假设评估和不含原始点的估计图

汇总统计不能恢复每个对象的配对差值、中位数、四分位数或分布形状,因此不会生成中位数差、配对测量比值或原始数据点。

10.14.5 数据准备

原始数据应采用宽表,每行代表一个对象,两列分别保存同一对象的两次测量。

ID TreatmentBefore TreatmentAfter
001 10.4 11.8
002 9.7 10.5
003 12.8 13.1
004 11.9 13.4
  • 两次测量必须为数值型变量,且来自同一对象或明确的一一匹配;
  • 两列不得互换含义,运行前应先确定参考测量和比较测量;
  • 只有两列均非缺失的共同完整配对进入分析;
  • 至少需要 3 个有效配对,两次测量及配对差值都必须具有足够变异;
  • 计算比值时,两次测量必须严格大于零,并且零点具有实际意义;
  • 汇总数据的标准差必须大于零,配对数不少于 3,相关系数严格位于 -1 与 1 之间。

10.14.6 主要参数

设置 含义 使用建议
数据入口 原始数据或汇总数据 有逐例配对数据时优先使用原始数据
参考测量 / 比较测量 定义差值方向 固定为“比较测量减参考测量”,运行后在概览中复核
主要效应 均值差或中位数差 按方案预先确定;汇总数据只能使用均值差
置信水平 90%、95% 或 99% 通常使用 95%,并与研究方案保持一致
配对测量比值 均值比和中位数比 仅适用于严格为正的原始真比率尺度数据
区间零假设边界 预先定义的可忽略变化范围 应依据临床或专业意义预设,不要由结果反推
误差分布样式 半眼图、猫眼图或不显示 半眼图适合默认展示;猫眼图便于观察对称区间
原始数据点布局 随机抖动、蜂群或不显示 样本较少时保留原始点,重叠明显时使用蜂群
差值轴单位 原始单位或标准差单位 临床解释用原始单位,跨量纲比较可用标准差单位

一键自动生成以下表格和图形:

  • 数据入口、参考测量、比较测量、差值方向和完整配对数;
  • 两次测量的描述统计;
  • 均值与配对均值差、标准化配对均值差和配对相关;
  • 原始数据模式下的中位数差和可选比值;
  • 点零假设和区间零假设评估;
  • 配对估计图以及 Word、结果 CSV 和配对数据 CSV。

10.14.7 使用步骤

10.14.7.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “效应量与估计统计” → “配对估计统计”

10.14.7.2 2. 选择数据入口和测量顺序

有逐例数据时保留“分析原始数据”,分别选择参考测量和比较测量。只有汇总统计时,选择“输入汇总数据”,填写两次测量的名称、均值、标准差、共同配对数和配对相关系数。

10.14.7.3 3. 设置效应、区间与图形

选择均值差或中位数差作为主要效应,并设定置信水平。只有在分析前已有可忽略阈值时才启用区间零假设。比值只用于严格为正的原始真比率尺度数据。图形可选择误差分布、原始点布局和差值轴单位,不需要设置图宽或图高。

10.14.7.4 4. 开始分析

所有结果输出默认勾选。点击 “开始配对估计统计”,模块会完成配对核验、效应估计、区间评估、绘图和下载准备。

配对估计统计:完整设置面板与效应结果
配对估计统计:完整设置面板与效应结果

10.14.8 结果解释

10.14.8.1 分析概览和描述统计

先核对数据入口、参考测量、比较测量、差值方向、完整配对数和主要效应。描述统计用于理解两次测量各自的位置与离散程度,但真正回答配对变化的是差值及其区间。

10.14.8.2 均值差、标准化效应与配对相关

均值差保留原始量纲,最适合专业解释;标准化效应适合跨量纲比较。置信区间越窄,估计越精确。配对相关较高表示对象在两次测量中的相对排序较一致,但即使相关很高,平均水平仍可能发生明显改变。

10.14.8.3 中位数差与比值

中位数差仅在原始数据模式下生成,适合关注中位位置的研究问题。均值比或中位数比大于 1 表示比较测量较高,小于 1 表示比较测量较低;比值不能用于含零、负值或零点没有真实含义的量表。

10.14.8.4 假设评估

点零假设表检验配对差值是否等于 0。区间零假设表比较置信区间与预设可忽略范围。结果“不明确”表示当前精度尚不能把变化判为可忽略或具有实质性,不代表程序失败。

配对估计统计:点零假设与区间零假设
配对估计统计:点零假设与区间零假设

10.14.9 图形解释

估计图展示参考测量、比较测量和配对差值的分布、位置估计与置信区间。半眼图用单侧密度轮廓呈现不确定性,猫眼图使用双侧对称轮廓;选择“不显示”时仍保留点估计与区间。图中差值方向始终为“比较测量减参考测量”。

配对估计统计:配对估计图
配对估计统计:配对估计图

10.14.10 表格描述与下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。图形可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动文字必须人工核对测量顺序、差值方向、效应单位和区间边界。

进入 “下载 Word 报告” 页签,可下载当前成功生成的表格与图形。结果 CSV 汇总各结果表,配对数据 CSV 保存本次分析使用的共同完整配对或汇总输入。

配对估计统计:Word 与 CSV 下载页
配对估计统计:Word 与 CSV 下载页

建议:在研究方案中预先写明两次测量的时间点、参考方向、主要效应、置信水平和可忽略边界。结果部分同时报告完整配对数、原始量纲变化、置信区间和标准化效应,不要只报告 P 值。

10.14.11 论文报告建议

方法部分应说明配对设计、参考测量和比较测量、完整配对处理、原始或汇总数据入口、主要效应、置信水平,以及是否预设可忽略区间。结果部分依次报告完整配对数、两次测量的描述统计、差值和置信区间、标准化效应、配对相关及必要的区间评估。

可参考如下写法:

共纳入 175 个完整配对。干预后测量均值为 11.65,干预前为 10.35;按干预后减干预前计算,配对均值差为 1.30(95% CI 1.13 至 1.47),标准化配对均值差为 0.48(95% CI 0.40 至 0.56)。两次测量的配对相关系数为 0.92(95% CI 0.89 至 0.94)。

示例数值仅用于展示写法,实际报告必须使用本研究输出,并结合指标“越高越好”或“越高越差”的方向解释。

10.14.12 常见问题

1. 为什么有效样本数少于数据总行数?

模块只使用参考测量和比较测量都非缺失的共同完整配对;任一测量缺失,该行不进入本次配对分析。

2. 配对相关很高是否说明没有变化?

不是。相关描述对象相对排序的一致性,均值差描述整体水平的变化,两者回答不同问题。

3. 什么时候使用中位数差?

当研究问题关注中位位置或均值容易受长尾影响时可使用。中位数差必须来自原始配对数据。

4. 汇总数据为什么需要配对相关系数?

两次测量的相关决定配对差值的方差。缺少该相关系数,就无法正确恢复配对设计的标准误和区间。

5. 汇总数据为什么没有比值和中位数结果?

均值、标准差、配对数和相关系数不足以恢复逐例比值、中位数或分布形状,因此模块只输出能够可靠计算的均值类结果。

6. 能否把左右侧或匹配病例对照作为配对数据?

可以,但必须保证每行确实是一一对应的配对,并明确哪一列作为参考测量、哪一列作为比较测量。

7. 置信区间跨 0 是否等于“没有变化”?

不等于。它表示当前精度下不能排除 0;要判断变化可忽略,需要预设区间并查看整个置信区间是否位于其中。

8. 输入错误会不会使整个应用退出?

不会。变量类型、配对数、标准差、相关范围、比值尺度或绘图错误会显示在当前模块中,其他页面和当前会话仍可继续使用。

10.14.13 小结

本模块的最佳使用顺序是:先确认一一对应的配对结构和比较方向,选择原始或汇总数据入口,预先确定主要效应与置信水平,核对完整配对数和描述统计,再联合解释原始差值、标准化效应、配对相关及置信区间;只有事先有专业依据时才启用比值和区间零假设。

10.15 汇总数据均值比较

汇总数据均值比较用于只有样本量、均值和标准差而没有逐例原始数据时的均值检验。模块支持两个互相独立样本的比较,也支持一个样本均值与预设检验值的比较,并同时报告检验统计量、P 值、均值差、效应量、置信区间和均值图。

核心问题:两个独立样本的总体均值是否不同,或一个样本的总体均值是否偏离预先规定的检验值?差异方向和大小如何,当前估计有多精确?

10.15.1 模块能做什么

  • 根据样本量、均值和标准差完成独立两组均值比较;
  • 同时报告不要求方差相等的 Welch t 检验和等方差 Student t 检验;
  • 完成单样本均值与预设检验值的比较;
  • 选择双侧、第一项较大或第一项较小三种备择假设;
  • 分别设置效应量、均值差和样本均值的置信水平;
  • 输出 Cohen’s d、均值差、标准误和置信区间;
  • 绘制均值及其置信区间图,单样本图同时标出检验值;
  • 为主要表格和图形生成中英文描述;
  • 下载包含当前表格和图形的 Word 报告、结果 CSV 以及多种格式的统计图。

10.15.2 适用场景

本模块适合文献只报告汇总统计、历史研究资料无法获得逐例数据、报告或摘要仅提供两组均值与标准差,以及质量控制中需要把样本均值与标准值比较的情形。例如比较治疗组与对照组的平均血压、两个独立人群的平均量表得分,或检验某批次产品的平均指标是否偏离规定值。

不宜直接使用的情况:同一受试者前后测量、配对或匹配资料、三个及以上组、重复测量、需要调整年龄或性别等协变量、明显聚类的数据,以及二分类、计数或生存结局。当前模块不提供配对 t 检验;配对资料需要均值差及其标准差或逐对原始数据,应转入相应配对分析模块。

10.15.3 方法原理

10.15.3.1 独立两组

设第一组和第二组的均值分别为 \(\bar X_1\)\(\bar X_2\),标准差为 \(s_1\)\(s_2\),样本量为 \(n_1\)\(n_2\)。模块按以下方向报告均值差:

\[\Delta=\bar X_1-\bar X_2\]

Welch 检验的标准误为:

\[SE_W=\sqrt{\frac{s_1^2}{n_1}+\frac{s_2^2}{n_2}}\]

检验统计量为 \(t_W=\Delta/SE_W\),自由度使用 Welch-Satterthwaite 近似。该方法不要求两组方差相等,通常应作为主要结果。

Student 检验先计算合并方差,再以共同方差估计均值差的标准误。只有研究设计和专业依据支持两组总体方差相等时,才把它作为主要结果;否则优先解释 Welch 结果。

10.15.3.2 单样本

设样本均值为 \(\bar X\)、标准差为 \(s\)、样本量为 \(n\),预设检验值为 \(\mu_0\)

\[t=\frac{\bar X-\mu_0}{s/\sqrt n},\qquad df=n-1\]

均值差为 \(\bar X-\mu_0\)。正值表示样本均值高于检验值,负值表示样本均值低于检验值。

单样本效应量表同时给出未校正 \(d^{\dagger}=|\bar X-\mu_0|/s\) 及用于直接解释的校正 Cohen’s d,其中校正值为 \(d^{\dagger}\sqrt 2\)。效应量采用绝对值表示大小,因此方向应结合均值差判断。

10.15.4 备择假设与区间

界面选项 独立两组含义 单样本含义 区间形式
不等于 第一组均值不等于第二组 样本均值不等于检验值 双侧置信区间
第一项 > 第二项/检验值 第一组均值大于第二组 样本均值大于检验值 下限有限、上限为正无穷
第一项 < 第二项/检验值 第一组均值小于第二组 样本均值小于检验值 下限为负无穷、上限有限

单侧假设必须在查看结果前根据研究问题确定。发现双侧结果不显著后再改成单侧检验,会夸大假阳性风险。

10.15.5 数据准备

独立两组需要为每组准备以下四项信息:

变量 要求 示例
组名 两组名称不能相同 治疗组、对照组
均值 有限数值 12.4
标准差 必须大于 0 3.1
样本量 不小于 2 的整数 35

单样本需要样本名称、均值、标准差、样本量和检验值。检验值应来自规范、研究方案、历史基准或有专业意义的参照,而不是根据当前样本均值临时选择。

汇总数据的限制:均值、标准差和样本量不能恢复个体分布、离群值、偏态、缺失模式或数据录入错误。因此模块能够复现均值类统计检验,却不能代替对原始数据的质量检查、分布诊断和敏感性分析。

10.15.6 主要参数

设置 含义 使用建议
检验类型 独立两组或单样本 先依据研究设计选择,不按结果切换
备择假设 双侧、第一项较大或第一项较小 默认双侧;单侧须事先规定
效应量区间 Cohen’s d 的置信水平 默认 90%,可按方案调整
均值差区间 原始量纲差值的置信水平 通常使用 95%
均值区间 各样本均值的置信水平 通常使用 95%
分析概览 输出当前检验类型、方向和区间设置 建议保留,用于核对分析
均值差标准误 独立两组均值差的不确定性 仅独立两组模式显示
样本描述统计 输出 N、均值、标准差、标准误和区间 建议保留
均值与置信区间图 图形化展示均值、区间和检验值 默认勾选

一键自动生成以下表格和图形:

  • 分析类型、备择假设和三个置信水平的分析概览;
  • Welch、Student 或单样本 t 检验结果;
  • Cohen’s d 及效应量置信区间;
  • 均值差、标准误和均值差置信区间;
  • 各样本的 N、均值、标准差、均值标准误和均值置信区间;
  • 均值与置信区间图;
  • Word 报告、结果 CSV 和 PNG、TIFF、SVG、PDF 图形文件。

10.15.7 使用步骤

10.15.7.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “效应量与估计统计” → “汇总数据均值比较”

10.15.7.2 2. 选择检验类型并录入摘要

比较两个互不重叠样本时选择“独立两组”,依次填写两组名称、均值、标准差和样本量。比较一个样本均值与规定值时选择“单样本”,填写样本汇总数据和检验值。

汇总数据均值比较:独立两组设置与分析概览
汇总数据均值比较:独立两组设置与分析概览

10.15.7.3 3. 预先确定检验方向

没有充分的方向性依据时保留“不等于”。只有研究方案事先明确关注第一项较高或较低时,才选择相应单侧备择假设。

10.15.7.4 4. 设置置信水平和输出

分别设置效应量、均值差和样本均值的置信水平。所有可用的表格和图形默认勾选;单样本模式会自动隐藏只适用于独立两组的均值差标准误选项。界面不需要填写图宽或图高,图形展示和下载采用稳定尺寸。

10.15.7.5 5. 开始分析

点击 “开始汇总数据均值比较”。模块先检查名称、标准差、样本量、检验值和区间设置,再计算统计量、整理表格、绘图并准备下载文件。输入或计算错误会显示在当前模块中,不会使整个应用退出。

10.15.8 结果解释

10.15.8.1 分析概览

先核对检验类型、差值方向、备择假设和置信水平。对于独立两组,所有差值均按“第一组减第二组”解释;对于单样本,按“样本均值减检验值”解释。

10.15.8.2 t 检验结果

独立两组同时给出 Welch 和 Student 两行。默认优先报告 Welch 结果;只有方差齐性假设有充分依据时再报告 Student 结果。P 值用于衡量数据与当前零假设的相容程度,但不能单独说明差异大小或专业意义。

汇总数据均值比较:独立两组检验、效应量和均值差
汇总数据均值比较:独立两组检验、效应量和均值差

10.15.8.3 效应量和均值差

均值差保留原始量纲,最适合专业解释;Cohen’s d 用标准差单位表达效应大小,适合跨量纲比较。应同时查看点估计和置信区间,不要只把效应量机械分成“小、中、大”。单样本效应量采用绝对值,差异方向必须由均值差的正负判断。

10.15.8.4 描述统计

描述统计表列出各样本的 N、均值、标准差、均值标准误和均值置信区间。单样本模式会把检验值作为参照行显示,其 N、标准差和标准误为空是正常现象,因为检验值是固定常数而不是另一个样本。

汇总数据均值比较:描述统计结果
汇总数据均值比较:描述统计结果

10.15.9 单样本分析

切换到“单样本”后,界面只保留一个样本的汇总数据和检验值。结果表报告单样本 t、自由度、P 值、两种效应量表达和样本均值相对检验值的差值。

汇总数据均值比较:单样本设置与结果
汇总数据均值比较:单样本设置与结果

10.15.10 图形解释

图中的点表示样本均值,误差线表示所选均值置信区间。独立两组图用于直观看两组均值及区间的位置;单样本图还会用虚线标出检验值。图形适合展示估计和精度,但两条置信区间是否重叠并不等同于 t 检验是否显著,正式结论应依据检验表和均值差区间。

汇总数据均值比较:独立两组均值与置信区间图
汇总数据均值比较:独立两组均值与置信区间图
汇总数据均值比较:单样本均值、区间和检验值
汇总数据均值比较:单样本均值、区间和检验值

10.15.11 表格描述与下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。统计图可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动生成的文字应由研究者核对检验方向、量纲、置信水平和数值。

进入 “下载 Word 报告” 页签,可下载当前成功分析的全部表格和图形,也可下载长表格式的结果 CSV。Word 报告建议使用微软 Word 打开。

汇总数据均值比较:Word 与 CSV 下载页
汇总数据均值比较:Word 与 CSV 下载页

建议:先根据研究设计确定独立两组或单样本,再事先固定差值方向、单双侧假设和置信水平。结果部分优先报告原始量纲均值差及置信区间,并用效应量补充说明差异大小。

10.15.12 论文报告建议

方法部分应说明使用汇总数据、检验类型、两组是否独立、备择假设方向、方差处理方式、效应量定义和置信水平。结果部分应报告各组样本量、均值和标准差,再报告 t、自由度、P 值、均值差及置信区间和 Cohen’s d。

独立两组可参考如下写法:

第一组均值为 12.0(SD 3.0,n = 30),第二组均值为 10.0(SD 3.0,n = 30)。Welch t 检验显示两组均值差为 2.0(95% CI 0.45 至 3.55),t(58.0) = 2.58,P = 0.012;Cohen’s d 为 0.67(90% CI 0.23 至 1.10)。

单样本可参考如下写法:

样本均值为 12.0(SD 3.0,n = 30),高于预设检验值 10.0;均值差为 2.0(95% CI 0.88 至 3.12),t(29) = 3.65,P = 0.001。

示例数值仅用于展示写法,实际报告必须使用本研究输出,并依据指标方向和专业背景解释。

10.15.13 常见问题

1. 独立两组应报告 Welch 还是 Student?

通常优先报告 Welch,因为它不要求两组方差相等。只有研究设计和专业依据支持共同方差时,才把 Student 结果作为主要结果。

2. 为什么没有配对检验?

配对检验需要每一对的差值信息,至少需要差值的标准差或可推导该标准差的配对相关信息。两组各自的均值、标准差和样本量不足以恢复配对差异。

3. 可以把标准误当作标准差输入吗?

不能。界面要求标准差。若文献只给标准误,可在确认定义后用 \(SD=SE\sqrt n\) 换算,并在报告中说明换算过程。

4. 单侧检验什么时候可以用?

研究问题和方案在查看数据前已明确方向,且反方向结果不会被解释为支持研究假设时才使用。不能根据当前结果临时改成单侧。

5. 两组样本量不同可以分析吗?

可以。Welch 方法允许样本量和方差都不同,但仍要求两组观察彼此独立。

6. 置信区间为什么出现正无穷或负无穷?

这是单侧置信区间的正常形式。第一项较大的假设给出有限下限和正无穷上限;第一项较小的假设给出负无穷下限和有限上限。

7. 为什么图上区间重叠,检验仍可能显著?

每组均值区间与“均值差的区间”不是同一个量。显著性应查看 t 检验和均值差置信区间,不能只凭两条误差线是否重叠判断。

8. 可以检查正态性和离群值吗?

不能。只有汇总统计时无法检查原始分布。若能获得逐例数据,应优先使用原始数据模块并进行数据诊断。

9. 可以调整协变量或处理聚类吗?

不能。需要调整混杂因素、处理中心或受试者内相关时,应使用线性模型、广义估计方程或混合效应模型。

10. 输入错误会不会使整个应用退出?

不会。名称重复、标准差为零、样本量不足、置信水平越界或计算失败都会显示在当前模块中,其他页面和当前会话仍可继续使用。

10.15.14 小结

本模块的最佳使用顺序是:确认只能获得可靠的样本量、均值和标准差,依据研究设计选择独立两组或单样本,事先固定检验方向和置信水平,优先解释均值差及其区间,再结合 t 检验、效应量、描述统计和均值图形成完整结论。

10.16 常用检验功效分析

常用检验功效分析用于在效应量、样本量和检验效能之间求解一个未知量。模块覆盖 T 检验、Pearson 相关和比例检验,可用于研究设计阶段估算样本量,也可在样本量已经确定时评估可达到的功效或最小可检出效应。

核心问题:在预设显著性水平和效应大小下,需要多少样本才能达到目标功效?若样本量已经固定,研究有多大概率检出预期效应?当前设计能够可靠检出的最小效应有多大?

10.16.1 模块能做什么

  • 计算独立样本、配对样本和单样本 T 检验的样本量、功效或最小可检出效应;
  • 计算 Pearson 相关检验的样本量、功效或最小可检出相关系数;
  • 计算两独立样本、单样本和配对比例检验的样本量、功效或最小可检出效应;
  • 在比例检验中选择优势比、比例差或相对风险作为效应表示;
  • 为独立样本设计设置两组样本量比例;
  • 为 T 检验设置等效界值并进行等效性功效规划;
  • 输出主要功效结果和效应量检出区间;
  • 绘制功效等高线、效应量曲线、样本量曲线和自定义参数曲线;
  • 下载包含当前结果表和图形的 Word 报告与结果 CSV。

10.16.2 适用场景

本模块适合研究方案设计、伦理申请、基金标书、统计分析计划和研究可行性评估。例如比较两组均值、评价治疗前后变化、检验某个指标与结局的相关性、比较两组率或评估单组率是否偏离预设值。

不宜直接使用的情况:多因素方差分析、协变量调整回归、混合效应模型、生存分析、中介模型、结构方程模型、复杂抽样或多重主要结局。此时应进入与模型结构对应的专门功效模块,并考虑失访、聚类、设计效应和多重性校正。

10.16.3 方法原理

检验效能定义为在备择假设为真时拒绝原假设的概率:

\[Power=1-\beta\]

其中 \(\beta\) 为第二类错误概率。给定显著性水平 \(\alpha\)、效应量和样本量后,可计算功效;给定其中任意两项,也可反向求解所需样本量或最小可检出效应。

在其他条件相同的情况下,效应量越大、样本量越多、显著性水平越宽松,功效通常越高。双侧检验同时考虑两个方向,通常比同条件下的单侧检验需要更多样本。单侧检验只能在研究问题和分析方案事先明确方向时使用。

独立样本设计的组间样本量比例记为 \(r=N_2/N_1\)。当 \(r=1\) 时两组等量;偏离 1 时,为达到同等功效通常需要更大的总样本量。

10.16.4 支持的检验设计

检验类型 设计 主要效应输入 样本量含义
T 检验 独立样本 Cohen’s d 输入第 1 组样本量,并设置第 2 组/第 1 组比例
T 检验 配对样本 Cohen’s dz 配对数量
T 检验 单样本 Cohen’s d 单组观察数
Pearson 相关 单一相关系数 Pearson r 独立观察数
比例检验 两独立样本 两组比例 输入第 1 组样本量,并设置第 2 组/第 1 组比例
比例检验 单样本 预期比例与假设比例 单组观察数
比例检验 配对样本 两个不一致比例 配对数量

10.16.5 主要参数

设置 含义 使用建议
检验类型 T 检验、Pearson 相关或比例检验 按主要研究假设和结局类型选择
计算目标 样本量、功效或最小可检出效应 研究设计常求样本量;可行性评估常求功效或效应
目标功效 \(1-\beta\) 通常至少 0.80;重要确证研究常使用 0.90
显著性水平 第一类错误概率 \(\alpha\) 常用 0.05;应与主要假设和多重性方案一致
检验方向 双侧或单侧 默认双侧;只有事先明确单向假设时使用单侧
组间样本量比例 第 2 组样本量除以第 1 组样本量 能等量入组时通常设为 1
等效界值 可接受的标准化差异范围 必须依据专业意义事先规定,且预期效应绝对值小于界值
比例效应表示 优势比、比例差或相对风险 按研究领域和预设报告指标选择
配色与对数坐标 功效图显示设置 大范围效应量时可保留自动对数坐标
自定义功效图 指定横轴、纵轴和分层参数 用于比较多种设计情景,而不是替代主要结果表

一键自动生成以下表格和图形:

  • 分析类型、计算目标、研究设计和输入参数;
  • 目标样本量、达到的功效或最小可检出效应;
  • 不同效应量区间的检出可能性;
  • 功效等高线图;
  • 功效随效应量变化曲线;
  • 功效随样本量变化曲线;
  • 自定义功效参数图及其数据表;
  • Word 报告和结果 CSV。

10.16.6 使用步骤

10.16.6.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “统计功效与样本量” → “常用检验功效分析”

10.16.6.2 2. 选择检验和计算目标

先选择 T 检验、Pearson 相关或比例检验,再选择要计算“所需样本量”“检验效能”或“最小可检出效应”。随后选择与研究资料结构一致的设计。

常用检验功效分析:检验类型与主要参数
常用检验功效分析:检验类型与主要参数

10.16.6.3 3. 输入设计参数

输入预期效应、已有样本量、目标功效和显著性水平。求解某一参数时,该参数会由模块计算,其余参数必须来自既往研究、预实验、临床最小重要差异或研究方案,不应根据希望得到的样本量反向挑选。

10.16.6.4 4. 设置图形和输出

标准功效图和结果表默认全部勾选。自定义图要求横轴、纵轴不同,分层参数不能与坐标轴重复;选择参数后,界面会更新适合该参数的范围和分层值。界面不需要设置图宽和图高。

常用检验功效分析:图形与结果输出设置
常用检验功效分析:图形与结果输出设置

10.16.6.5 5. 开始分析

点击 “开始功效分析”。完成后先在“结果概览”核对设计和输入,再查看敏感性分区、标准功效图与自定义图。

10.16.7 结果解释

10.16.7.1 主要功效结果

当计算目标为样本量时,结果表给出总样本量及必要的分组样本量;实际研究应向上取整,并额外考虑失访、无效记录和组间分配。当目标为功效时,表中功效表示当前样本量在预期效应成立时检出该效应的概率。当目标为效应量时,结果表示在给定样本量和功效要求下可检出的最小效应。

常用检验功效分析:主要功效结果
常用检验功效分析:主要功效结果

10.16.7.2 效应量检出区间

该表把效应量划分为较可能漏检、仍有较高漏检概率、较可能检出和极可能检出的区间。它适合说明设计对不同真实效应的敏感程度,但不能用于断言真实效应落在哪个区间。

常用检验功效分析:效应量检出区间
常用检验功效分析:效应量检出区间

10.16.7.3 比例检验的样本量

部分比例检验使用连续近似,样本量可能显示小数。实际入组人数必须向上取整,再按组间比例分配;若事件罕见、样本较小或需要精确方法,应进一步使用专门的比例样本量模块验证。

10.16.8 图形解释

功效等高线图同时展示样本量、效应量与功效的关系。颜色或等高线表示功效水平,研究者可观察达到 0.80 或 0.90 功效所需的参数组合。

常用检验功效分析:功效等高线图
常用检验功效分析:功效等高线图

效应量曲线固定其他参数,展示真实效应增加时功效如何变化;样本量曲线则展示扩大样本如何提高功效。曲线较平缓时,增加少量样本对功效改善有限。

常用检验功效分析:效应量和样本量曲线
常用检验功效分析:效应量和样本量曲线

自定义功效参数图允许把样本量、功效或效应量放在横轴和纵轴,并按第三个参数分层。每条曲线代表一个预设情景,适合在方案阶段比较多种可行设计。

常用检验功效分析:自定义功效参数图
常用检验功效分析:自定义功效参数图

10.16.9 表格描述与下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。图形可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动文字必须人工核对计算目标、样本量单位、效应指标和检验方向。

进入 “下载 Word 报告” 页签,可下载当前成功生成的结果表和图形;结果 CSV 汇总当前表格。

常用检验功效分析:Word 与 CSV 下载页
常用检验功效分析:Word 与 CSV 下载页

建议:在研究方案中记录效应量来源、显著性水平、目标功效、检验方向、组间分配比例和失访膨胀比例。样本量计算不是单一数字,而是研究假设与设计选择共同形成的可追溯结论。

10.16.10 论文报告建议

方法部分应说明主要检验、单双侧、效应量定义及来源、显著性水平、目标功效、组间分配比例、计算得到的样本量,以及失访或无效样本的膨胀方式。若报告事后功效,应同时报告效应估计和置信区间,避免把事后功效作为研究结果是否可信的唯一依据。

可参考如下写法:

主要结局拟采用双侧独立样本 T 检验比较两组均值。依据既往研究,预期标准化均值差为 0.50;设双侧 α=0.05、检验效能为 0.90、两组按 1:1 分配,计算所需总样本量为 172 例。考虑 10% 失访后,计划入组 192 例,每组 96 例。

示例数值仅用于展示写法,实际报告必须使用本研究输出,并明确是否对结果向上取整和进行失访膨胀。

10.16.11 常见问题

1. 目标功效应该选 0.80 还是 0.90?

0.80 是常见最低标准,0.90 提供更低的漏检风险但需要更多样本。应结合研究重要性、伦理、成本和预先方案确定。

2. 效应量从哪里来?

优先使用高质量既往研究、系统评价、可靠预实验或临床最小重要差异。不要只为了得到可承受的样本量而任意放大效应。

3. 什么时候可以使用单侧检验?

只有研究问题、干预方向和反方向结果的处理在分析前已经明确时才使用。看到数据后再改为单侧会增加第一类错误。

4. 独立样本结果中的总样本量如何分配?

按设置的第 2 组/第 1 组比例分配,并对每组分别向上取整。等量分配通常在固定总样本量下效率最高。

5. 最小可检出效应等于临床最小重要差异吗?

不等于。前者由当前样本量和统计要求决定,后者来自专业或临床意义。两者比较可用于判断设计是否足够敏感。

6. 为什么比例检验的样本量出现小数?

这是连续近似计算结果。实际人数必须向上取整,并按组间比例形成整数分配。

7. 配对比例中的两个比例是什么?

它们表示从状态 1 变为状态 2 和从状态 2 变为状态 1 的两类不一致比例,而不是前后各自的总阳性率。

8. 自定义图为什么提示参数重复?

横轴、纵轴和分层参数必须代表不同参数。重复设置不能形成有意义的多维曲线。

9. 是否还要增加失访样本?

需要。模块给出可分析样本量,实际入组数应按预期失访率、无效记录率和分组限制进一步膨胀。

10. 输入错误会不会使整个应用退出?

不会。无效样本量、功效、显著性水平、效应量、比例或绘图参数会显示在当前模块中,其他页面和当前会话仍可继续使用。

10.16.12 小结

本模块的最佳使用顺序是:先明确主要统计检验和单双侧方向,从外部证据确定效应量,设置 α、目标功效和分配比例,读取主要样本量结果,再用敏感性表和功效曲线检查不同真实效应下的稳健性,最后加入失访膨胀并保存 Word、CSV 与参数依据。

10.17 线性模型功效分析

线性模型功效分析用于回归、ANOVA 和 ANCOVA 的研究设计。它在效应量、样本量和检验效能之间求解一个未知量,并允许用偏 \(η^2\)\(η^2\) 或标准化回归系数表示预期效应。

核心问题:在预设模型自由度、效应自由度、显著性水平和预期效应下,需要多少样本才能达到目标功效?若样本量已经固定,当前模型能够检出多大的效应?

10.17.1 模块能做什么

  • 计算一般线性模型所需样本量、给定样本量下的功效或最小可检出效应;
  • 支持偏 \(η^2\)\(η^2\) 和标准化回归系数三种效应量参数化;
  • 设置模型自由度和待检验效应的自由度;
  • \(η^2\) 和标准化回归系数模式中加入预期模型 \(R^2\)
  • 在标准化回归系数模式中选择双侧或单侧检验;
  • 可选读取预测变量相关矩阵,避免默认假定预测变量相互独立;
  • 在模型、宽松和严格三种非中心参数口径之间进行敏感性比较;
  • 输出主要功效结果、效应量换算参数、检出区间和自定义数据表;
  • 绘制功效等高线、效应量曲线、样本量曲线和自定义参数图;
  • 下载包含当前结果表和图形的 Word 报告与结果 CSV。

10.17.2 适用场景

本模块适合多因素方差分析、协方差分析、多元线性回归、嵌套模型中局部效应的 F 检验,以及在已知模型复杂度下评估某个自变量或一组自变量的检出能力。

不宜直接使用的情况:二分类、计数或生存结局;重复测量、聚类或混合效应结构;中介、调节、结构方程或复杂抽样。这些设计应进入与模型结构对应的专用功效模块。

10.17.3 方法原理

线性模型的效应通过非中心 F 分布计算功效。对偏 \(η^2_p\),对应的 Cohen’s \(f^2\) 为:

\[f^2=\frac{\eta^2_p}{1-\eta^2_p}\]

对整体 \(η^2\) 或标准化回归系数,还需要结合模型 \(R^2\) 以确定局部效应。标准化回归系数模式要求 \(R^2\geq\beta^2\);否则所设参数在数学上不相容。

残差自由度由总样本量和模型自由度决定。模型自由度必须覆盖待检验效应的自由度,并在计算前按实际模型项数确定。

10.17.4 效应量模式

模式 主要输入 适用问题
\(η^2\) 预期偏 \(η^2\)、效应自由度、模型自由度 评估控制其他模型项后的局部效应
\(η^2\) 预期 \(η^2\)\(R^2\)、效应和模型自由度 用总变异解释比例表示效应
标准化回归系数 预期 \(β\)\(R^2\)、模型自由度、检验方向 检验线性回归中某个标准化系数

10.17.5 主要参数

设置 含义 使用建议
计算目标 样本量、功效或最小可检出效应 方案设计通常求样本量;可行性评估可求功效或效应
模型自由度 完整模型中的可估计效应参数数量 应按拟合模型的实际项数预先确定
效应自由度 待检验效应占用的自由度 单一连续预测变量常为 1;多水平因子通常为水平数减 1
模型 \(R^2\) 完整模型的预期决定系数 应来自高质量既往研究或预实验
非中心参数口径 模型、宽松或严格 默认使用模型口径;其他口径用于敏感性评估
相关矩阵列 目标预测变量与其他预测变量的相关结构 仅标准化回归系数模式使用,数据必须为方形、数值型、正定相关矩阵
目标功效与 \(α\) 第二类和第一类错误控制 应在分析前按主要假设和多重性方案预先规定

一键自动生成以下表格和图形:

  • 分析设置与参数记录;
  • 样本量、效应量、Cohen’s \(f^2\)、功效和自由度;
  • 效应量换算参数;
  • 效应量检出区间;
  • 功效等高线图、效应量曲线和样本量曲线;
  • 自定义功效参数图及数据表;
  • Word 报告和结果 CSV。

10.17.6 使用步骤

10.17.6.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “统计功效与样本量” → “线性模型功效分析”

10.17.6.2 2. 选择效应量与计算目标

先按研究报告的效应指标选择偏 \(η^2\)\(η^2\) 或标准化回归系数,再选择要计算所需样本量、检验效能或最小可检出效应。

线性模型功效分析:效应量与主要参数
线性模型功效分析:效应量与主要参数

10.17.6.3 3. 输入自由度、\(R^2\) 和检验参数

模型自由度代表完整模型复杂度,效应自由度代表本次检验的局部效应。在 \(η^2\) 和标准化回归系数模式中还需输入预期 \(R^2\)。求解某一未知参数时,其余参数必须由方案或外部证据确定。

10.17.6.4 4. 设置图形与输出

标准图形和结果表默认全部勾选。自定义图的横轴、纵轴必须不同,分层参数不能与坐标轴重复。界面不需设置图宽和图高。

线性模型功效分析:检验参数与标准图形
线性模型功效分析:检验参数与标准图形
线性模型功效分析:自定义图形参数
线性模型功效分析:自定义图形参数
线性模型功效分析:完整结果输出选项
线性模型功效分析:完整结果输出选项

10.17.6.5 5. 开始分析

点击 “开始线性模型功效分析”。先在“结果概览”核对输入和自由度,再查看敏感性区间、标准功效图与自定义图。

10.17.7 结果解释

10.17.7.1 主要功效结果

当目标为样本量时,表中给出达到目标功效的最小可分析样本量。当目标为功效时,表中功效表示预期效应真实存在时拒绝零假设的概率。当目标为效应量时,结果是当前样本量与功效要求下可检出的最小效应。

线性模型功效分析:主要功效结果
线性模型功效分析:主要功效结果

10.17.7.2 效应量检出区间

敏感性表将真实效应划分为较可能漏检、仍有较高漏检概率、较可能检出和极可能检出的区间。它描述设计灵敏度,不是对真实效应的估计。

线性模型功效分析:效应量检出区间
线性模型功效分析:效应量检出区间

10.17.7.3 预测变量相关矩阵

标准化回归系数模式默认预测变量不相关。若研究存在明显共线性,可在当前数据中准备方形相关矩阵,第一列为目标预测变量,其余列为其他预测变量,然后按矩阵顺序选择列。矩阵必须对称、对角线为 1 且正定。

10.17.8 图形解释

功效等高线图同时展示样本量、效应量与功效的关系。可用于评估达到 0.80 或 0.90 功效的多种可行组合。

线性模型功效分析:功效等高线图
线性模型功效分析:功效等高线图

效应量曲线固定其他参数,展示真实效应增加时功效的变化;样本量曲线展示扩大样本对功效的改善。

线性模型功效分析:效应量和样本量曲线
线性模型功效分析:效应量和样本量曲线

自定义功效参数图允许将样本量、功效或效应量放在横轴和纵轴,并按第三个参数分层,适合比较多个设计情景。

线性模型功效分析:自定义功效参数图
线性模型功效分析:自定义功效参数图

10.17.9 表格描述与下载

每张主要表格下方提供中文和英文描述按钮。图形可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动文字必须人工核对效应量参数化、自由度、计算目标和检验方向。

进入 “下载 Word 报告” 页签,可下载当前成功生成的结果表和图形;结果 CSV 汇总当前表格。

线性模型功效分析:Word 与 CSV 下载页
线性模型功效分析:Word 与 CSV 下载页

建议:在研究方案中同时记录效应量定义及来源、模型和效应自由度、预期 \(R^2\)、非中心参数口径、\(α\)、目标功效、失访膨胀和最终向上取整方案。

10.17.10 论文报告建议

方法部分应说明计划使用的线性模型、待检验效应、效应量表示及来源、模型自由度、效应自由度、预期 \(R^2\)、显著性水平、目标功效、计算样本量和失访膨胀方式。

可参考如下写法:

计划采用一般线性模型评估主要结局。根据既往研究,待检验效应的预期偏 \(η^2\) 为 0.10,效应自由度为 1,完整模型自由度为 3。设双侧 \(α=0.05\)、检验效能为 0.90,采用模型口径计算得所需可分析样本量为 97 例。考虑 10% 失访后,计划入组 108 例。

示例数值仅用于展示写法,实际报告必须使用本研究输出。

10.17.11 常见问题

1. 应该选偏 \(η^2\) 还是 \(η^2\)

按研究问题和效应量证据的定义选择。偏 \(η^2\) 描述控制其他模型项后的局部效应,\(η^2\) 描述总变异中由该效应解释的比例,两者不能随意互换。

2. 模型自由度怎么确定?

按实际拟合模型中的可估计效应参数确定,包括多水平因子的虚拟变量和交互项。不应只按原始变量个数计数。

3. 为什么 \(R^2\) 不能小于 \(β^2\)

单个标准化回归系数的平方已经构成其对模型解释变异的下界。若输入的整体 \(R^2\) 更小,参数组合在数学上不可能。

4. 是否必须输入相关矩阵?

不必须。不输入时假定预测变量不相关。若既往研究表明预测变量明显相关,建议输入可行的相关矩阵做更符合设计的计算。

5. 三种非中心参数口径应如何选择?

默认使用模型口径。宽松和严格口径可用于评估不同定义下样本量的变化,并在方案中说明最终选择。

6. 计算样本量是最终入组人数吗?

不是。输出是可分析样本量,必须向上取整,并根据失访、无效记录、不平衡分组和多重主要假设进一步调整。

7. 单侧检验什么时候可以使用?

只有在研究前已明确方向性假设,且反方向结果不会导致拒绝零假设时才可使用。不得看到数据后再从双侧改为单侧。

8. 输入错误会不会使整个应用退出?

不会。无效的效应量、\(R^2\)、自由度、样本量、功效、\(α\)、相关矩阵或绘图参数会在当前模块内显示,修正后可在同一会话继续分析。

10.17.12 小结

本模块的最佳使用顺序是:先按实际拟合模型确定效应量定义、模型自由度和效应自由度,从外部证据设定效应量与 \(R^2\),设置 \(α\)、目标功效和非中心参数口径,读取主要样本量结果,再用敏感性表与功效曲线比较设计情景,最后加入失访膨胀并保存 Word、CSV 和参数依据。

10.18 两个变量相关分析(Correlation)(基础版)

本节演示如何在 本软件 中完成两个连续变量的相关分析,支持 Pearson / Spearman / Kendall 三种相关系数,输出检验结果、置信区间与可复制的文字报告,并可一键导出 Word。适用于探索两个数值指标之间是否同向/反向随动,以及随动强度的大小。
典型医学场景:年龄与收缩压、CRP 与住院天数、肿瘤直径与手术时间等。

10.18.1 背景与方法小百科(必读)

  • 相关系数:衡量两个变量“同涨同跌”的强弱,范围 -1 ~ +1
    • 0:几乎无线性关系;+1:完美正线性;-1:完美负线性。
    • 常用解读(仅经验阈值):约 |r| 或 |ρ| = 0.1/0.3/0.5弱/中/强
  • Pearson(皮尔逊):检验线性相关,对极端值敏感;前提近似为线性趋势 + 误差近似正态
    :肌酐与尿素(通常近似线性)。
  • Spearman(斯皮尔曼):对做相关,捕捉单调关系(不要求线性),抗极端值;偏态、等级数据、非线性单调时优先。
    :疼痛评分与镇痛用量(常单调但未必线性)。
  • Kendall(肯德尔 τ):基于一致/不一致对的秩相关,样本量较小时更稳健,对并列值处理更友好。
    :样本量较小(如 n < 20)或大量并列秩。
  • p 值与置信区间(CI):p 值检验“相关系数是否显著不为 0”;CI 提供估计不确定性(不跨 0 与双侧显著一致)。
  • 重要提醒:相关 ≠ 因果。混杂因素、分层结构、非线性关系都可能导致“貌似相关”或“被稀释的相关”。

10.18.2 数据准备

数据形态:宽表(wide format)。每位受试者一行,至少包含两列数值型变量(系统也支持“看起来是数字的因子”,但更推荐在“定义字段”里设为 numeric)。

10.18.2.1 必要字段(示例)

  • var1:第一个连续变量(如收缩压 SBP,单位 mmHg)
  • var2:第二个连续变量(如年龄 Age,单位 years)

10.18.2.2 示例数据表

id Age (years) SBP (mmHg)
1 45.0 132.0
2 53.0 145.5
3 61.0 150.0
4 37.0 118.0
5 69.0 158.0

准备要点 - 两列应在 “定义字段” 中设为 numeric;若显示为因子/字符,请改为数值。 - 同一量纲/单位(便于解读与作图)。 - 缺失值允许存在,分析时会自动忽略成对缺失(仅保留两列都不缺失的样本)。 - 若存在极端值非线性单调关系,推荐用 Spearman/Kendall 并在报告里说明理由。


10.18.3 进入模块

顶部菜单选择 “按统计学分类模块” → “两个变量相关分析(基础版)” 进入。


10.18.4 选择变量

  1. 第一个变量(X):在 “请选择第一个变量” 下拉框中选择(需为数值型)。
  2. 第二个变量(Y):在 “请选择第二个变量” 下拉框中选择(与 X 不同)。

若未在列表中出现,请回到 “定义字段” 将其属性设为 numeric 后再返回。


10.18.5 设定检验选项

  • 备择假设方式
    • 双侧检验(默认):只要相关 ≠ 0 就算显著。
    • 单侧(大于/小于):仅在事先有明确方向性假设时使用。
  • 置信水平:默认 0.95(即 95% CI),可改为 0.90/0.99 等。
  • 方法(method)
    • Pearson:线性、近似正态、无明显极端值时。
    • Spearman:偏态、单调非线性、受极端值影响时。
    • Kendall:样本较小、大量并列秩或需更稳健时。

10.18.6 运行分析

点击 “生成/更新…” 按钮后,右侧依次显示: 1) 方法和结果(文字报告):包含相关系数、p 值、置信区间与人类可读解读。
2) 相关分析详细结果(表格):便于复制到论文或补充材料。


10.18.7 结果解读(示例)

  • “采用 Spearman 相关分析,AgeSBP中等强度正相关:ρ = 0.42,95% CI [0.25, 0.56],p < 0.001。结果提示年龄越大,收缩压越高的单调趋势。”
  • “采用 Pearson,r = 0.31(95% CI [0.12, 0.48],p = 0.002)。散点图显示大致线性,残差近似对称,无明显极端值。”
  • “采用 Kendall,τ = 0.28(p = 0.004)。样本量较小并存在并列值,Kendall 结果更稳健。”

小贴士
- p 值反映“是否有统计学相关”,相关系数反映“相关有多强”。
- 置信区间跨 0 → 与双侧不显著一致。
- 若 Pearson 与 Spearman 方向一致但强度不同,优先依据更匹配前提的方法(偏态/极端值→Spearman/Kendall)。


10.18.8 导出 Word 报告

切换到 “下载Word报告” 页签,点击 “点此下载word文档”,将生成包含以下内容的文档: - 标题与Objective; - Method and Results 的可读性文字报告; - Correlation analysis results 表格(含系数、p 值与 CI)。

建议使用 Microsoft Word 打开(不要用 WPS,可能样式不兼容)。


10.18.9 常见问题与排查

  • 变量不在下拉框:回到 “定义字段” 把两个变量类型设为 numeric;若是“数字形式的因子”,也建议改为数值。
  • 结果受极端值影响:改用 Spearman/Kendall,并在报告中说明原因。
  • 线性假设不满足:Spearman/Kendall 更合适;或考虑做非线性建模(如样条、局部回归),超出本模块范围。
  • 混杂与分层:相关只是二元关系的表象;如疑似混杂(如年龄),请在后续回归模型中调整。
  • 一眼看不出趋势:可能是“U 形/非单调”关系,相关系数可能接近 0;需画散点并考虑非线性方法(本基础版不含图形)。
  • 缺失太多:系统会忽略成对缺失,若样本量骤降,请回到“数据准备”做缺失填补或核对数据质量。

10.18.10 适用与不适用情形

  • 适用:两个连续指标之间的线性或单调关系探索与检验。
  • 不适用
    • 一个或两个变量是分类变量(应考虑点双列/列联分析、回归等);
    • 时间序列自相关重复测量(需专业方法);
    • 明显非单调关系(相关系数可能低估,需非线性方法)。

10.18.11 报告写作模板(可直接改写)

  • “采用 Pearson 相关分析,XYr = 0.36(95% CI [0.18, 0.51]),p = 0.0004 的正相关。考虑到散点图显示近似线性且无明显极端值,Pearson 的前提假设基本满足。”
  • “由于 Y 分布偏态且存在极端值,使用 Spearman 相关分析:ρ = -0.29(95% CI [-0.45, -0.11]),p = 0.002。提示 X 越高,Y 越低的单调趋势。”
  • “在样本量较小且并列值较多的场景下,采用 Kendallτ = 0.22p = 0.018,结论与 Spearman 一致,结果稳健。”

10.18.12 操作小结

  1. “定义字段” 将两个变量设为 numeric
  2. 在本模块选择 两个变量备择方向置信水平方法
  3. 点击 “生成/更新…” 查看文字报告与结果表;
  4. 需要存档/投稿时,下载 Word 报告 并按模板润色。

10.19 相关分析(Correlation)(高级版,支持 13 种相关)及相关系数矩阵

本节介绍如何在 本软件 的“相关分析(高级版)”模块中,完成多变量相关分析相关系数矩阵的生成,支持 13 类常用/稳健/鲁棒相关方法,并导出 Word 报告与可下载的矩阵图。本文聚焦建模与出表,并补充一份相关方法百科(含参考文献),把用户当作统计学零基础来说明。


10.19.1 数据准备

数据形态:宽表(每列一个变量,每行一个受试者/样本)。

  • 连续变量请在“定义字段”中设为 numeric/integer
  • 分类变量若用于有序/等级相关(如 Kendall、Gamma),可保留为 factor(有序因子更佳);
  • 二分类变量(0/1、是/否、阳/阴)可用于 点二列/二列四分相关(tetrachoric) 等。

变量与方法的匹配(快速对照)

方法(在模块中的名称) 变量类型要求 场景示例 备注
Pearson 连续–连续 两项生化指标线性相关 对极端值敏感;线性关系假设
Spearman 等级/连续–等级/连续 疼痛等级与步行距离 单调关系即可,抗异常值
Kendall 等级–等级 症状分级与医生评分 对偏态更稳健,效率较高
Biweight 连续–连续 含少量离群值的实验测量 中位数为核心,抗离群
Distance 连续–连续 任意非线性关联 能抓住非线性/非单调
Percentage bend 连续–连续 噪声较多的测量数据 下调离群观测的权重
Shepherd’s Pi 等级/连续–等级/连续 先剔离群再做 Spearman 鲁棒的秩相关
Blomqvist 连续/有序–连续/有序 总体中位数相依 以中位为核心的非参相关
Hoeffding’s D 连续/有序–连续/有序 任意依赖结构探测 可检出更广泛的依赖
Gamma 有序–有序 分级量表之间 对大量并列(ties)友好
Gaussian rank 连续/有序–连续/有序 鲁棒秩相关的替代 将秩映射到高斯分位
Biserial(点二列/二列) 连续–二分类 连续指标与阳/阴 用于一连续一二分类
Tetrachoric 二分类–二分类 两个二分类潜在连续 两侧都为二分类时使用

特别提醒
- 选择“自动选择(auto)”方法时:不能含缺失值(模块限制)。
- 相关分析会基于成对可用的观测进行计算(即某对变量有值才参与该对的计算)。
- 四分相关(tetrachoric)请确保两变量均为二分类且各格频数不为 0。
- Biserial适用于一连续 + 一二分类;若二分类是自然离散(不是潜在连续),“点二列/二列”解释更贴切。


10.19.2 进入模块

顶部菜单选择 “按统计学分类模块” → “相关分析” → “相关分析及相关系数矩阵”,再打开 “普通相关与矩阵” 页签。


10.19.3 选择变量(可多选)

  • “请选择做相关分析的变量(多选,至少选两个)” 中多选需要比较的变量列。
  • 变量类型影响可选方法(见上表);若某变量未出现,请回到“定义字段”设置为合适类型。

10.19.4 设定备择假设与置信区间

  • 备择(two.sided / greater / less):默认双侧,当你有明确方向性假设(且事先约定)时再选单侧。
  • 置信水平(CI):默认 0.95(即 95% CI),可根据期刊要求调整。

10.19.5 选择相关方法(method)

  • “做相关分析的方法” 中选择(默认 Pearson)。
  • 若数据含离群值/非线性/等级测量,考虑 Spearman/Kendall/Distance/鲁棒方法
  • 自动选择(auto):由程序为变量对自动匹配最合适方法(注意:入选变量需无缺失)。

10.19.6 多重比较校正(P 值)

  • “对 P 值进行多重比较调整的方法” 中选择:
    • 常用:Holm(较 Bonferroni 稳健)、Bonferroni(保守)、BH/FDR(控制假阳性率)。
    • 若变量较多,推荐 BH(FDR) 平衡发现与严格性;确认期刊要求后选择。

10.19.7 一键运行与输出

点击 “开始普通相关分析”,主页面输出:

  1. 相关结果表(含相关系数 r/ρ/τ 或其他统计量、95% CI、P 值〔已按你的选择调整〕等);
  2. 相关系数矩阵:成对展示相关方向与大小;
  3. 相关系数热图:用颜色和数值同时展示相关强度。图形按模块预设尺寸渲染,图下可下载 PNG、TIFF、SVG 或 PDF。

导出 Word:在 “下载 Word 报告” 页签导出,内含“相关结果表 + 相关矩阵 + 矩阵图”。


10.19.8 结果解读(给非统计背景的你)

  • 系数大小(连续变量常见阈值,粗略)
    | 绝对值 | 相关强度 | |—:|:—| | 0.1–0.3 | 弱 | | 0.3–0.5 | 中等 | | >0.5 | 较强 | > 注意:阈值仅作经验参考,应结合学科语境与样本量。

  • 显著性(P 值/CI)

    • 95% CI 不跨 0 → 与双侧显著性一致。
    • 多变量成对检验较多时请看校正后的 P 值FDR
  • 方法选择的影响

    • Pearson反映线性关系;Spearman/Kendall反映单调/等级关系;Distance/Hoeffding可检出非线性依赖。
    • 离群值时,Biweight / Percentage bend / Shepherd’s Pi / Gaussian rank更稳健。
    • 二分类场景Biserial(点二列/二列)/Tetrachoric 更贴切。

10.19.9 常见问题与排查

  • 变量选不上/方法受限:检查“定义字段”的类型设置是否匹配方法要求。
  • Auto 报错:入选变量不得含缺失;请先做缺失处理或改用手选方法。
  • Tetrachoric 失败:检查两变量是否都是二分类,且四格频数均>0。
  • 很多对都显著:请查看“多重比较校正”后的 P 值或 FDR;必要时收紧阈值。
  • 图中文字较密:减少同时纳入的变量数,或下载 SVG/PDF 后以矢量格式查看。

10.19.10 报告撰写模板(可改写)

  • “我们对 XY 进行相关分析。考虑到变量的等级/非正态特征,采用 Spearman 相关,结果 ρ = 0.34(95% CI 0.12–0.52),校正后 P = 0.004。作为敏感性分析,Distance 相关同向且显著。”
  • “针对含离群值的数据,采用Biweight 作为鲁棒相关(r_bi = …);与常规 Pearson 方向一致。”
  • “多变量成对比较共 m 对,对 P 值进行 BH-FDR 校正,以控制多重比较带来的假阳性。”

10.19.11 知识补给|相关类型详解(含参考文献)

下列解释帮助你理解每种相关系数的含义、适用场景与优缺点。括号内标注为本模块中的对应选项(如适用)。

  • Pearson’s correlation(皮尔逊,pearson
    最常见的相关系数,度量两变量的线性关系;等于协方差除以两变量标准差的乘积。
    适用于连续–连续且关系近似线性、无严重离群值的情形。

  • Spearman’s rank correlation(斯皮尔曼,spearman
    基于的非参数相关,等价于“将原值换成秩后再做 Pearson”。检验单调关系(不要求线性)。
    Spearman 的 CI 可用 Fieller et al., 1957 的修正;见 Bishara & Hittner, 2017 的讨论。

  • Kendall’s rank correlation(肯德尔,kendall
    非参数秩相关,常较 Spearman 更稳健与高效(更小的总体误差敏感度与渐近方差)。
    其 τ 的解释是“一致对不一致对比例之差”。CI 同样可参考 Fieller et al., 1957

  • Biweight midcorrelation(biweight
    基于中位数的相似性度量,对离群值不敏感,是 Pearson 的鲁棒替代(Langfelder & Horvath, 2012)。

  • Distance correlation(distance
    可检测线性与非线性的更一般的依赖关系,对复杂曲线型关系尤其有用。

  • Percentage bend correlation(percentage
    Wilcox (1994) 提出,对偏离中位数的边缘观测赋予较低权重(默认 20%),以降低离群影响。

  • Shepherd’s Pi correlation(shepherd
    先用自助法马氏距离识别/下调离群,再对秩做 Spearman,得到鲁棒秩相关。

  • Blomqvist’s coefficient(blomqvist
    又称 Blomqvist’s Beta / medial correlationBlomqvist, 1950),基于中位的非参相关,
    在含并列/非正态时相比 Spearman/Kendall 具有一定优势(见 Shmid & Schimdt, 2006 述评)。

  • Hoeffding’s D(hoeffding
    非参数秩统计量,能检测更一般的独立性偏离(包括非线性依赖;Hoeffding, 1948);取值范围约 [-0.5, 1](无并列时),值越大表示关系越强。

  • Somers’ D(说明性,当前模块未实现)
    非参数有序关联度量,常用于二分类结局与连续/有序预测之间(如逻辑回归情境)。本实现多用于二分类结局的有序关联度评估。

  • Point-Biserial / Biserial(模块对应 biserial
    一连续 + 一二分类的相关系数。点二列等价于 Pearson;二列适用于“二分类来自潜在连续”的设定(如“焦虑程度”二分自连续)。模块提供 biserial 以覆盖这类情形。

  • Gamma correlation(gamma
    Goodman–Kruskal Gamma,与 Kendall’s Tau 类似,对大量并列情况表现更好,且相对稳健。

  • Winsorized correlation(说明性,当前模块未实现)
    对变量先做温莎化(阈值外的极端值被截断/替换)再计算相关,常用于减少可疑极端值的影响。

  • Gaussian Rank correlation(gaussian
    将秩映射到高斯分位后计算的相关,作为鲁棒秩相关的简单且性能良好替代(Boudt et al., 2012)。
    Bhushan et al., 2019 在心理学网络中的应用。

  • Polychoric correlation(说明性,当前模块未实现)
    两个潜在正态的连续潜变量之间的相关,从两个观察到的有序变量估计而来。

  • Tetrachoric correlation(tetrachoric
    Polychoric 的特殊情形:两侧观测变量均为二分类。常用于潜在连续阈值模型下的二分数据。

如何选?超简化指南
- 线性且无显著离群:Pearson
- 等级/单调、或对离群更稳健:Spearman / Kendall
- 非线性/复杂依赖:Distance / Hoeffding
- 离群明显:Biweight / Percentage bend / Shepherd’s Pi / Gaussian rank
- 连续 vs 二分类:Biserial(点二列/二列)
- 二分类 vs 二分类(潜在连续):Tetrachoric


10.19.12 参考文献

  • Boudt, K., Cornelissen, J., & Croux, C. (2012). The Gaussian rank correlation estimator: robustness properties. Statistics and Computing, 22(2), 471–483.
  • Bhushan, N., Mohnert, F., Sloot, D., Jans, L., Albers, C., & Steg, L. (2019). Using a Gaussian graphical model to explore relationships between items and variables in environmental psychology research. Frontiers in Psychology, 10, 1050.
  • Bishara, A. J., & Hittner, J. B. (2017). Confidence intervals for correlations when data are not normal. Behavior Research Methods, 49(1), 294–309.
  • Fieller, E. C., Hartley, H. O., & Pearson, E. S. (1957). Tests for rank correlation coefficients. I. Biometrika, 44(3/4), 470–481.
  • Langfelder, P., & Horvath, S. (2012). Fast R functions for robust correlations and hierarchical clustering. Journal of Statistical Software, 46(11).
  • Blomqvist, N. (1950). On a measure of dependence between two random variables. Annals of Mathematical Statistics, 21, 593–600.
  • Somers, R. H. (1962). A new asymmetric measure of association for ordinal variables. American Sociological Review, 27(6).

以上文献为方法背景阅读。实际发表请按你的研究领域与期刊要求引用最贴切的来源与软件版本信息。

10.20 偏相关与半偏相关

偏相关与半偏相关用于回答:在剔除一个或多个控制变量的线性效应后,两个变量之间还保留多强的条件关联。偏相关同时调整两个待分析变量,结果是对称的;半偏相关只调整其中一个变量,结果具有方向性。模块可同时计算 Pearson、Spearman 和 Kendall 相关,输出方法矩阵、成对长表、有效样本量和热图,并下载 Word 报告与 CSV。

核心问题:观察到的变量关系是否主要由年龄、基线水平等控制变量共同解释?控制这些因素后,关联方向和强度是否仍然存在?研究问题需要对两个变量都调整,还是只需要从其中一个变量中剔除控制效应?

10.20.1 模块功能

  • 同时选择多个待分析数值变量和一个或多个控制变量;
  • 计算偏相关或具有方向性的半偏相关;
  • 支持 Pearson、Spearman 和 Kendall 三种方法,并可同时输出;
  • 支持双侧、正相关单侧和负相关单侧备择假设;
  • 可显示 P 值、显著性标记和每个变量对的有效样本量 N;
  • 输出分析概览、方法矩阵、成对结果长表和相关热图;
  • 每张主要表格均可生成中文或英文 Results 风格描述;
  • 每幅热图均可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF;
  • 下载包含当前表格和图形的 Word 报告,以及完整成对结果 CSV;
  • 输入、计算、绘图或下载错误会保留在当前模块中,不会使整个应用退出。

10.20.2 适用场景

本模块适合研究连续或有序数值指标之间的调整后关联,例如:

  1. 控制年龄后,炎症指标与肾功能是否仍有关联;
  2. 控制基线评分和病程后,治疗依从性与生活质量是否相关;
  3. 控制体重指数后,某项生物标志物能否解释结局的额外变异;
  4. 对偏态或含异常值的指标,使用 Spearman 或 Kendall 进行稳健的秩相关分析;
  5. 同时查看多个结局和暴露之间的条件关联模式,并用热图辅助筛查。

不宜直接使用的情况:结局为二分类、计数、生存时间或重复测量时,通常应使用相应回归或混合效应模型;关系明显非线性时,单一相关系数可能掩盖结构;控制变量是暴露后的中介或碰撞变量时,机械调整可能产生偏倚;需要因果效应时,相关分析本身不能替代研究设计和因果模型。

10.20.3 统计原理

10.20.3.1 偏相关

设待分析变量为 \(X\)\(Y\),控制变量集合为 \(Z\)。先分别用 \(Z\) 解释 \(X\)\(Y\),得到残差 \(e_X\)\(e_Y\),再计算两个残差之间的相关:

\[r_{XY\cdot Z}=\operatorname{cor}(e_X,e_Y).\]

因为 \(X\)\(Y\) 都剔除了 \(Z\) 的线性效应,所以 \(r_{XY\cdot Z}=r_{YX\cdot Z}\),偏相关矩阵是对称矩阵。页面只显示下三角,以减少重复信息。

10.20.3.2 半偏相关

半偏相关只从其中一个变量中剔除控制变量效应。模块按“行变量与调整后的列变量”的方向计算:

\[r_{X(Y\cdot Z)}=\operatorname{cor}(X,e_Y).\]

因此交换行列后通常得到不同结果,即 \(r_{X(Y\cdot Z)}\neq r_{Y(X\cdot Z)}\)。矩阵脚注和成对长表中的“调整位置”明确指出被调整的是变量 B(列变量)。

10.20.3.3 三种相关方法

方法 主要度量 适用提示
Pearson r 调整后的线性相关 变量近似连续、关系近似线性且异常值影响可接受
Spearman rho 调整后的秩单调相关 分布偏态、存在异常值或关系单调但不严格线性
Kendall tau-b 调整后的秩一致性 样本较小、并列秩较多或希望使用更保守的秩相关

三种系数的数值尺度不完全相同,不能只按绝对值大小判断哪一种“更正确”。应根据变量尺度、关系形态、异常值和研究方案选择主要方法,其他方法可作为敏感性分析。

10.20.3.4 P 值与有效样本量

双侧假设检验相关系数是否不等于 0;正相关单侧检验系数是否大于 0;负相关单侧检验系数是否小于 0。单侧假设应在查看结果前由研究问题预先规定,不能因为双侧结果不显著而临时改用单侧。

模块按每个变量对与所有控制变量共同完整的案例计算,因此不同变量对的 N 可能不同。缺失模式不同时,矩阵中的系数可能基于不同样本子集,解释和比较时应同时查看 N。

10.20.4 数据准备

数据采用每名研究对象一行的宽表:

受试者编号 炎症指标 肾功能 生活质量 依从性 年龄 基线评分
P001 2.8 86 72 81 53 48
P002 4.1 78 65 69 61 55
P003 1.9 94 80 88 47 44
  • 至少选择 2 个待分析数值变量;
  • 至少选择 1 个控制变量;
  • 待分析变量与控制变量不能重复;
  • 所选字段必须为数值型,分类标签、ID、日期和自由文本不能直接纳入;
  • 每个变量对与全部控制变量需要至少 5 个完整案例,并应明显多于控制变量数量;
  • 完整案例中的变量必须具有变异,完全共线或常数变量无法计算有限结果;
  • 建议先用散点图、分布图和异常值诊断检查关系形态;
  • 多重比较较多时,应在研究方案中预先确定主要变量对,必要时进行校正或把结果视为探索性。

10.20.5 主要参数

设置 含义 使用建议
待分析数值变量 需要形成相关矩阵的变量 至少 2 个,避免把 ID 或类别编码当连续量
控制变量 需要剔除线性效应的变量 依据研究方案和因果结构预先选择
偏相关 同时调整两个待分析变量 适合研究两个变量在相同控制条件下的关联
半偏相关 仅调整列变量 适合研究某变量在剔除控制效应后贡献的独特关联
Pearson 线性相关 默认主要方法之一
Spearman 秩单调相关 偏态、异常值或非线性单调关系时使用
Kendall 秩一致性 小样本或并列秩较多时使用
备择假设 双侧、正相关单侧或负相关单侧 除非有预先方向假设,通常选双侧
显示 P 值 输出显著性检验 默认勾选
标记显著性 用星号标记 P 值阈值 仅在显示 P 值时生效,默认勾选
显示有效样本量 N 输出每个变量对的完整案例数 缺失数据存在时建议保留

分析概览、相关矩阵、成对结果长表和相关热图均默认勾选。左侧不提供图像宽高设置,每幅图在页面和下载中使用稳定尺寸。

一键自动生成以下表格和图形:

  • 当前相关类型、变量、控制变量、方法、假设、缺失处理和 N 范围概览;
  • 每种相关方法的偏相关或半偏相关矩阵;
  • 包含变量 A、变量 B、调整位置、方法、系数、P 值、显著性和 N 的长表;
  • 每种相关方法对应的调整后相关热图;
  • Word 报告、成对结果 CSV 和多格式统计图。

10.20.6 使用步骤

10.20.6.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “相关分析” → “偏相关与半偏相关”

10.20.6.2 2. 选择变量和控制变量

“待分析数值变量”至少选择 2 个指标;“控制变量”至少选择 1 个需要调整的数值字段。两组字段不能重复。第一次运行前应先确认控制变量的时间顺序和研究含义,避免无依据地把中介变量或碰撞变量作为控制变量。

10.20.6.3 3. 选择相关类型、方法和假设

研究两个变量在相同控制条件下的关联时选择“偏相关”;只希望从列变量中剔除控制效应时选择“半偏相关”。可同时勾选 Pearson、Spearman 和 Kendall。若没有预先规定的方向性假设,使用默认双侧检验。

10.20.6.4 4. 选择输出并运行

默认输出已全部勾选。点击 “开始偏相关与半偏相关分析”,先核对分析概览中的变量、控制变量、方法、假设和有效 N 范围,再进入矩阵、成对结果和统计图页签。

偏相关与半偏相关:完整设置面板与分析概览
偏相关与半偏相关:完整设置面板与分析概览
偏相关与半偏相关:分析概览与表格描述按钮
偏相关与半偏相关:分析概览与表格描述按钮

10.20.7 结果解释

10.20.7.1 偏相关矩阵

偏相关矩阵仅显示下三角。相关系数正负表示方向,绝对值表示调整后的关联强度;P 值小于 0.001 显示为 <0.001;显著性星号为 * P<0.05** P<0.01*** P<0.001。N 是当前变量对与全部控制变量共同完整的案例数。

偏相关与半偏相关:Pearson 偏相关矩阵
偏相关与半偏相关:Pearson 偏相关矩阵

10.20.7.2 成对结果长表

长表便于复制、筛选和下载。偏相关的“调整位置”为“双方”;半偏相关则明确显示“变量 B”,表示只从变量 B 中剔除控制变量效应。同一变量对在半偏相关中会按两个方向各出现一次,不能把它们当成重复行删除。

偏相关与半偏相关:成对结果长表
偏相关与半偏相关:成对结果长表

10.20.7.3 半偏相关方向矩阵

半偏相关矩阵显示全部非对角单元格。读取一个单元格时,先看行变量,再看列变量:该值表示行变量与“剔除控制效应后的列变量”之间的相关。交换行列后,调整对象随之改变,数值通常不同。

偏相关与半偏相关:具有方向性的半偏相关矩阵
偏相关与半偏相关:具有方向性的半偏相关矩阵

解释边界:“调整后仍显著”不等于发现独立因果效应,也不等于控制了全部混杂。相关系数仍可能受测量误差、遗漏变量、选择偏倚、非线性和多重检验影响。

10.20.8 图形解释

热图以蓝色表示负相关、红色表示正相关,颜色深浅和单元格标签共同反映相关系数。偏相关热图关于对角线对称;半偏相关热图可能不对称。热图适合识别整体模式,但正式报告应同时给出系数、P 值、N 和控制变量,不能只根据颜色判断显著性。

偏相关与半偏相关:高分辨率 Pearson 偏相关热图
偏相关与半偏相关:高分辨率 Pearson 偏相关热图

10.20.9 表格描述与下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅热图可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动描述需要人工核对变量定义、控制变量、相关类型、方向、方法和有效样本量。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格与图形。成对结果 CSV 保存全部方向和方法结果,适合审计、补充材料或后续绘图。Word 报告建议使用微软 Word 打开,以避免表头、脚注或图片排版兼容问题。

偏相关与半偏相关:Word 与成对结果 CSV 下载
偏相关与半偏相关:Word 与成对结果 CSV 下载

10.20.10 论文报告建议

方法部分应说明待分析变量、控制变量及其选择依据、偏相关或半偏相关、相关方法、双侧或单侧假设、缺失值处理、多重比较策略和软件输出的有效样本量规则。结果部分应报告相关系数、P 值、有效 N 和控制变量,并明确半偏相关的调整方向。

偏相关可参考如下写法:

采用 Pearson 偏相关分析评估炎症指标与肾功能的条件关联,并控制年龄。每个变量对使用该变量对与全部控制变量共同完整的案例。调整后炎症指标与肾功能呈负相关(偏相关系数、P 值及有效 N 见表)。

半偏相关可参考如下写法:

采用半偏相关分析评估生活质量与依从性的独特关联,仅从依从性中剔除年龄的线性效应。结果按“行变量与调整后的列变量”方向报告,并同时给出反向结果作为补充。

实际论文应替换为具体估计值,并说明是否进行了多重比较校正。不要使用“控制后 X 导致 Y”之类因果措辞。

10.20.11 常见问题

1. 偏相关和半偏相关最主要的区别是什么?

偏相关同时从两个变量中剔除控制效应,结果对称;半偏相关只从列变量中剔除控制效应,结果有方向。

2. 为什么半偏相关矩阵上下三角不同?

因为交换行列会改变被调整的变量。上三角和下三角对应两个不同方向,不是计算误差。

3. 为什么不同变量对的 N 不一样?

模块对每个变量对连同全部控制变量使用共同完整案例。各字段缺失位置不同,就会得到不同 N。

4. Pearson、Spearman 和 Kendall 应选哪一个?

近似线性连续关系通常选 Pearson;偏态、异常值或单调非线性关系可选 Spearman;小样本或并列秩较多可考虑 Kendall。建议预先规定主要方法,其他方法作为敏感性分析。

5. 可以同时勾选三种方法吗?

可以。模块会分别生成矩阵、长表和热图,但论文应明确主要方法,避免只挑选最显著的结果。

6. 单侧检验什么时候使用?

只有研究方案在看数据前已明确方向且反方向结果不具有同等解释价值时使用。否则应使用双侧检验。

7. 控制变量越多越好吗?

不是。无依据地增加控制变量会降低有效样本量和精度,也可能调整中介或碰撞变量而产生偏倚。控制变量应由研究设计和因果结构决定。

8. 显著性星号可以代替效应量吗?

不能。星号只概括 P 值阈值,必须同时报告相关系数、方向、有效 N 和控制变量。

9. 相关显著是否说明存在独立预测作用?

不一定。相关分析描述关联,不等同于回归模型中的预测性能,也不能证明因果效应。

10. 输入错误或计算失败会不会使整个应用退出?

不会。错误会显示在当前模块中,原数据和应用会话保持可用;修正变量或选项后可重新运行。

10.20.12 小结

本模块的可靠使用流程是:先根据研究问题确定控制变量和调整方向,选择偏相关或半偏相关及主要相关方法,核对每个变量对的有效 N,再联合解释系数、方向、P 值和热图;半偏相关必须明确列变量被调整,所有结果都应保持关联性而非因果性表述。

10.21 单因素方差分析(One-way ANOVA)

单因素方差分析是一种用于比较两个或多个组之间差异的统计方法。这种方法被用于确定一个或多个因素对于一个或多个连续型变量的影响,因素通常是指某一类别或者某个处理。在单因素方差分析中,一个连续型变量(称为因变量)在一个分类变量(称为自变量)的每一种水平(或组别)上被测量。

单因素方差分析,需要满足6个条件:

条件1:观察变量为连续变量。

条件2:观测值相互独立。

条件3:观测值可分为多组(≥2)。

条件4:观察变量不存在显著的异常值。

条件5:残差为正态(或近似正态)分布。

条件6:多组观测值的整体方差相等。

单因素方差分析常用于比较不同治疗方法对疾病的疗效。

本软件 医学科研统计机器人提供了一站式的单因素方差分析步骤:

  1. 数据是否适合做方差分析:提供正态性检验、QQ图、方差齐性检验;
  2. 描述性统计:各组结局的均值、SE、95% CI 进行描述统计
  3. 方差分析的方法:可选 Welch’s 法(方差不齐)和 Fisher’s 法(方差齐);
  4. 事后检验:对各组进行两两比较,包括Games-Howell (方差不齐) 法和Tukey法(方差齐)

10.21.1 准备数据

到导入数据页面下载示例数据看一下:

Treatment是代表治疗组别的变量,这里有三个组Lev, Obs, 和Lev+5FU组。需要把变量属性设置成factor

Length, Blood 和React是代表效果的变量,为连续性变量。需要把变量属性设置成numeric

单因素方差分析,主要看 三个组中,Length, Blood 或React 的均值是否相同。

另外可以进行事后分析,分别看上述指标在Lev vs. Obs, Lev vs. Lev+5FU, Obs vs. Lev+5FU对比中的差异。

10.21.2 开始方差分析

选择代表组别的变量,如果菜单里没有,则返回去把你想要的组别变量设置为factor

选择因变量,这里一次可以分析多个因变量,如果菜单里没有你想要的变量,则返回去把它设置成numeric

10.21.3 进入模块

顶部菜单选择 “按统计学分类模块” → “单因素方差分析(One-way ANOVA)” 进入。

10.21.4 使用条件判断

这里可以勾选正态性检验和方差齐性检验等。

10.21.5 描述性分析

然后可以做一下描述性分析:

然后可以根据方差齐性的结果,选择方差分析的方法。

对于不是特别严重的方差不齐,单因素方差分析提供了校正检验方法(Welch one-way ANOVA/ Welch’s F检验),考虑了方差差异之后的更为稳健的分析结果。但当组间方差差异较大时,校正结果也不一定可信,建议使用非参数检验(Kruskal-Wallis检验)。如果数据正态性和方差齐性都不满足,最好使用非参数检验(Kruskal-Wallis检验)。

10.21.6 事后检验(两两比较)

但组别为三个及以上时,方差分析的结果只能告诉我们,多组之间的均值是否全相等或不全相等,还不能告诉我们每个组两两比较的结果。

这时候可以用事后分析做两两比较。可以根据方差齐性检验的结果来决定用Games-Howell (方差不齐) 法和Tukey法(方差齐)做事后分析。

10.21.7 下载报告

点击下载word文件即可

事后分析的表格,单独放在txt文档里,点击事后检验结果按钮下载即可。

10.21.8 讨论:

  • 严格来讲,单因素方差分析时,需要分别对每一组数据的正态性进行检验。但方差分析对数据非正态性具有一定的耐受力,如果数据不是严重偏态或者只有部分组别数据不满足正态性要求,出于参数检验的统计学效能优于非参数检验的角度,还是可以使用单因素方差分析方法,而不使用非参数检验。

  • 本软件在”单因素方差分析”和”方差分析”模块下的”适用条件判断”中均提供了”正态性检验”和”绘制Q-Q图”功能可检验数据的正态性情况,但此处检验的是数据的整体正态分布(感兴趣的读者请自行操作)。正如上所述,单因素方差分析对数据非正态性具有一定的耐受力,如果数据满足整体正态分布,也是可以使用该种分析方法。但我们建议尽可能分组别检验数据的正态性。

  • 对于不是特别严重的方差不齐,单因素方差分析提供了校正检验方法(Welch one-way ANOVA/ Welch’s F检验),考虑了方差差异之后的更为稳健的分析结果。但当组间方差差异较大时,校正结果也不一定可信,建议使用非参数检验(Kruskal-Wallis检验)。如果数据正态性和方差齐性都不满足,最好使用非参数检验(Kruskal-Wallis检验)。

  • 多重比较一般分为事前检验(Prior tests)和事后检验(Post hoc tests)。事前检验是指在数据收集之前便决定了要通过多重比较来考察多个组与某个特定组之间的差别,多根据专业意义设定比较的策略。如果是事前检验,不论整体分析的结果如何,均可进行比较,并且一般不需要对检验水准进行太多修正。事后检验只有在方差分析得到有统计学意义的F值后才有必要进行,是一种探索性分析。对于事先未计划的多重比较(即事后检验),各组间的差别只是一种提示,要确认这种差别最好重新设计实验。

  • 本软件在”单因素方差分析”和”方差分析”模块下的”事后检验”中均提供了多重比较的方法。“单因素方差分析”方法下的事后检验提供了”Games-Howell (unequal variances)“法和”Tukey (equal variances)“法两种方法,前者为方差不齐时使用,后者为方差齐时使用。

    如果还不够,可以移步”方差分析”模块:

    “方差分析”模块下的事后检验提供了”Tukey”法、“Scheffe”法、“Bonferroni”法和”Holm”法四种方法,均为在方差齐时使用。其中”Bonferroni”法为对检验水准的严格校正,校正后的检验水准为原始检验水准除以比较次数,当两两比较的次数较多时,结果偏保守。“Holm”法对检验水准的校正程度不如”Bonferroni”法严格,结果更为稳健。Scheffe法的检验效能优于Bonferroni法。Tukey法使用时需要样本数目相同,并可能产生较多的假阴性结果。

10.22 方差分析(ANOVA)

当有两个或者两个以上的因素对因变量产生影响时,可以用多因素方差分析的方法来进行分析。多因素方差分析亦称”多向方差分析”,原理与单因素方差分析基本一致,也是利用方差比较的方法,通过假设检验的过程来判断多个因素是否对因变量产生显著性影响。在多因素方差分析中,由于影响因变量的因素有多个,其中某些因素除了自身对因变量产生影响之外,它们之间也有可能会共同对因变量产生影响。在多因素方差分析中,把因素单独对因变量产生的影响称之为”主效应”;把因素之间共同对因变量产生的影响,或者因素某些水平同时出现时,除了主效应之外的附加影响,称之为”交互效应”。多因素方差分析不仅要考虑每个因素的主效应,往往还要考虑因素之间的交互效应。

两因素方差分析原理如下,两个以上因素也同理:

多因素方差分析,需要满足6个条件:

条件1:观察变量唯一,且为连续变量。

条件2:有多个分组变量,且都为分类变量。

条件3:观测值相互独立。

条件4:观察变量不存在显著的异常值。

条件5:各组、各水平观察变量为正态(或近似正态)分布。

条件6:相互比较的各处理水平(组别)的总体方差相等,即通过方差齐性检验。

MSTATA 医学科研统计机器人提供了一站式的多因素方差分析步骤:

  1. 数据是否适合做方差分析:提供正态性检验、QQ图、方差齐性检验;
  2. 进行多因素方差分析,可选交互作用或不选交互作用
  3. 事后检验:对各水平亚组进行两两比较,可以调整多重比较的P值,可选Tukey法,Scheffe法,Bonferroni法和Holm法
  4. 计算效应量(effect size)
  5. 计算和比较各水平亚组的估计边际平均值(Estimated marginal means)和置信区间,生成统计表,绘制统计图

10.22.1 准备数据

到”导入数据”页面下载示例数据看一下:

treatment是代表治疗组别的变量,这里有三个组Lev, Obs, 和Lev+5FU组。需要把变量属性设置成factor

blood 是代表结局的变量,为连续性变量。需要把变量属性设置成numeric

其他的分类变量如hospital, sex, obstruct等等,都算是分组处理因素。

探讨blood在不同组别、不同分组处理因素中均值的比较,就是多因素方差分析。

例如做一个两因素方差分析:

blood ~ treatment+sex

其中treatment有三组,sex有两组。

也可以包含交互作用:

blood ~ treatment+sex+treatment:sex

交互作用一般用冒号 : 连接两个变量

其中treatment和sex表示主效应,treatment:sex表示交互效应

如果要探讨三个因素,可以有多种方法:

blood ~ treatment+sex+obstruct 只考虑主效应

blood ~ treatment+sex+obstruct+treatment:sex 考虑一个交互作用

blood ~ treatment+sex+obstruct+treatment:sex+treatment:obstruct+sex:obstruct+treatment:sex:obstruct 考虑所有交互作用

10.22.2 进入模块

顶部菜单选择 “按统计学分类模块” → “方差分析(ANOVA)” 进入。

10.22.3 开始方差分析

选择因变量,只能选择一个,如果菜单里没有你想要的变量,则返回去把它设置成numeric

选择代表组别的因子,这里我们选treatment和sex,如果菜单里没有,则返回去把你想要的组别变量设置为factor

选择交互作用,每点击一次”增加交互作用项”按钮,就可以增加一个交互作用项菜单,在菜单里选两个以上的变量,就能将其合成交互作用项。这里我们合成一个treatment:sex。如果选错了要修改,可以点击”重置清零”按钮。

10.22.4 使用条件判断

这里可以勾选正态性检验和方差齐性检验等。

检验结果如下:

正态性检验仅供参考,P<0.05提示正态性不好,但即使正态性不佳,也可以做方差分析;

方差齐性检验,P<0.05时提示可能方差不齐;

Q-Q图是针对标准化残差做的,如果不太偏离这条直线,说明残差呈正态分布,可以做方差分析。

如果都不满足,可以考虑给因变量取对数或开平方后,再进行检测和做方差分析,

如果还不行,考虑非参数检验。

10.22.5 方差分析的选项

这里可以选择平方和(ss)的类型,默认选类型3;

可以选择是否计算effect size, 这里给了常见的三个参数;

也可以选择是否显示整体模型检验的参数

分析结果:

这里根据前面的选择,对treatment、sex以及它们的交互作用进行了方差分析,显示了平方和、均方、F值和P值,这里P值小于0.05表示该因素不同水平的blood均值的差异有统计学意义。而effect size则客观描述了标化量纲之后的效应大小。

10.22.6 事后检验

如果有些因子有三个组或以上,如这里的treatment就有三个组,则可以选择做事后检验进行两两比较。

三个组以上两两比较时,需要对P值进行校正,这里提供了Tukey法,Scheffe法,Bonferroni法和Holm法;如果只有两个组,则校正和不校正的P值没有区别。

另外,可选计算cohen’s d效应量及其置信区间。

事后检验的结果如下:

事后检验比较重要的参数是两组之间的差值Mean Difference (adjusted) 和SE,以及调整后的P值。

注意:表里的95% CI是Cohen’s d的可信区间,不是Mean Difference的可信区间。

10.22.7 估计边际平均值

所谓边际均值,就是在控制了其他因素之后,只是单纯在一个因素的作用下,因变量的变化。

举个简单的例子,如果只有一个自变量时,计算出来的边际均值和普通均值是一样的;当有两个及以上自变量时,计算边际均值和普通均值的出来的结果是不同的。

点击勾选需要计算边际均值的分组变量,交互作用也可以选。

分析结果如下:

这里的统计图,上下两条误差线可以用SE,也可以用置信区间表示。

统计表的解读:

例如三个治疗组,Lev+5FU、Obs、Lev 各自的blood边际均值和95% CI都可以在第一个表中找到;

两个性别,Female 和 Male各自的blood边际均值和95% CI可以在第二个表中找到;

而第三个表,交互作用表中,则有3*2=6个亚组,如男性接受Lev+5FU治疗组,blood边际均值为58.79

统计图的解读:

中间的圆点是均值,上下两条线是误差线。

在最后一个交互作用图中,横坐标是treatment, 图例分组是sex, 如果想颠倒过来,在选择边际均值项的菜单中,可以先选sex, 再选treatment, 图像的交叉顺序是根据菜单选择顺序来排列的。treatment:sex和sex:treatment在图像排列上有所不同。

10.22.8 下载报告

点击下载word文件即可

10.22.9 讨论

  • 方差分析对数据非正态性具有一定的耐受力,如果数据不是严重偏态或者只有部分组别数据不满足正态性要求,出于参数检验的统计学效能优于非参数检验的角度,还是可以使用方差分析方法,而不使用非参数检验。

  • 多重比较一般分为事前检验(Prior tests)和事后检验(Post hoc tests)。事前检验是指在数据收集之前便决定了要通过多重比较来考察多个组与某个特定组之间的差别,多根据专业意义设定比较的策略。如果是事前检验,不论整体分析的结果如何,均可进行比较,并且一般不需要对检验水准进行太多修正。事后检验只有在方差分析得到有统计学意义的F值后才有必要进行,是一种探索性分析。对于事先未计划的多重比较(即事后检验),各组间的差别只是一种提示,要确认这种差别最好重新设计实验。

  • 事后检验提供了”Tukey”法、“Scheffe”法、“Bonferroni”法和”Holm”法四种方法,均为在方差齐时使用。其中”Bonferroni”法为对检验水准的严格校正,校正后的检验水准为原始检验水准除以比较次数,当两两比较的次数较多时,结果偏保守。“Holm”法对检验水准的校正程度不如”Bonferroni”法严格,结果更为稳健。Scheffe法的检验效能优于Bonferroni法。Tukey法使用时需要样本数目相同,并可能产生较多的假阴性结果。

10.23 协方差分析(ANCOVA)

协方差分析(ANCOVA)是一种统计方法,结合了方差分析(ANOVA)和回归分析的特点。它主要用于比较两个或多个组间的因变量均值差异,在控制一个或多个协变量的影响后。协变量是可能影响因变量的其他变量。通过引入协变量,我们可以减少误差变异,从而更准确地评估组间因变量均值的差异。

以下是一个医学研究中应用协方差分析的例子:

假设我们要研究两种不同药物(药物A和药物B)对降低血压的效果。我们把病人分为两组,一组使用药物A,另一组使用药物B。研究期间,我们还记录了病人的年龄,因为年龄可能会影响血压水平。 在这个例子中,我们的因变量是血压降低的程度,自变量是药物类型(药物A和药物B),协变量是病人的年龄。我们想要比较在控制年龄因素后,药物A和药物B在降低血压方面是否存在显著差异。

我们进行协方差分析(ANCOVA),把年龄设置为协变量,比较调整后的血压降低数值在药物A和药物B组间是否存在显著差异。如果结果显示存在显著差异,我们可以得出结论,在控制年龄因素后,药物A和药物B对降低血压的效果具有显著差异。

通过协方差分析(ANCOVA),我们可以更准确地评估药物A和药物B对降低血压的效果,排除年龄等潜在混杂因素的干扰。这对于医学研究以及其他涉及多个影响因素的领域非常有价值。协方差分析有助于提高研究的准确性和可靠性,使得研究结果更具有说服力。

在实际应用中,协方差分析还可以用于教育、心理学、生态学、经济学等多个学科。例如,在教育研究中,我们可能想要比较两种不同的教学方法对学生学术成绩的影响,同时控制学生的家庭背景等因素。在这种情况下,协方差分析可以帮助我们更准确地评估不同教学方法的效果。

总之,协方差分析是一种强大的统计工具,可以帮助研究人员在控制潜在协变量的影响下,准确评估不同组间因变量均值的差异。

MSTATA 医学科研统计机器人提供了一站式的协方差分析步骤:

  1. 数据是否适合做方差分析:提供正态性检验、QQ图、方差齐性检验;
  2. 进行协方差分析,设置因变量和感兴趣的因子,可选交互作用或不选交互作用,设置要调整的协变量;
  3. 事后检验:对各水平亚组进行两两比较,可以调整多重比较的P值,可选Tukey法,Scheffe法,Bonferroni法和Holm法
  4. 计算效应量(effect size)
  5. 计算和比较各水平亚组的估计边际平均值(Estimated marginal means)和置信区间,生成统计表,绘制统计图

10.23.1 准备数据

到”导入数据”页面下载示例数据看一下:

treatment是代表治疗组别的变量,这里有三个组Lev, Obs, 和Lev+5FU组。需要把变量属性设置成factor

sex是性别,也是我们感兴趣的组别变量

blood 是代表结局的变量,为连续性变量。需要把变量属性设置成numeric

其他的分类变量如hospital, obstruct等等,我们不感兴趣,只做调整用的协变量。

其他的连续性变量如age, 我们不感兴趣,为协变量。

探讨blood在调整其他协变量后,在不同治疗组、不同性别的均值的比较,就是协方差分析。

10.23.2 进入模块

顶部菜单选择 “按统计学分类模块” → “协方差分析(ANCOVA)” 进入。

10.23.3 开始协方差分析

选择因变量,只能选择一个,如果菜单里没有你想要的变量,则返回去把它设置成numeric

选择代表感兴趣的组别的因子,这里我们选treatment和sex,如果菜单里没有,则返回去把你想要的组别变量设置为factor

选择交互作用,每点击一次”增加交互作用项”按钮,就可以增加一个交互作用项菜单,在菜单里选两个以上的变量,就能将其合成交互作用项。这里我们合成一个treatment:sex。如果选错了要修改,可以点击”重置清零”按钮。

选择不感兴趣,用来做调整的协变量:这里hospital, age, obstruct, perfor可能对结局有影响,但不是我们研究感兴趣的研究变量,因此勾选用来做协变量调整。

10.23.4 使用条件判断

这里可以勾选正态性检验和方差齐性检验等。

检验结果如下:

正态性检验仅供参考,P<0.05提示正态性不好,但即使正态性不佳,也可以做方差分析;

方差齐性检验,P<0.05时提示可能方差不齐;

Q-Q图是针对标准化残差做的,如果不太偏离这条直线,说明残差呈正态分布,可以做方差分析。

如果都不满足,可以考虑给因变量取对数或开平方后,再进行检测和做方差分析,

如果还不行,考虑非参数检验。

10.23.5 方差分析的选项

这里可以选择平方和(ss)的类型,默认选类型3;

可以选择是否计算effect size, 这里给了常见的三个参数;

也可以选择是否显示整体模型检验的参数

分析结果:

这里根据前面的选择,所选的因子、交互作用和协变量都做了协方差分析,显示了平方和、均方、F值和P值,这里P值小于0.05表示该因素不同水平的blood均值的差异有统计学意义。而effect size则客观描述了标化量纲之后的效应大小。

10.23.6 事后检验

如果有些因子有三个组或以上,如这里的treatment就有三个组,则可以选择做事后检验进行两两比较。

三个组以上两两比较时,需要对P值进行校正,这里提供了Tukey法,Scheffe法,Bonferroni法和Holm法;如果只有两个组,则校正和不校正的P值没有区别。

另外,可选计算cohen’s d效应量及其置信区间。

事后检验的结果如下:

事后检验比较重要的参数是两组之间的差值Mean Difference (adjusted) 和SE,以及调整后的P值。

注意:表里的95% CI是Cohen’s d的可信区间,不是Mean Difference的可信区间。

10.23.7 估计边际平均值

所谓边际均值,就是在控制了其他因素之后,只是单纯在一个因素的作用下,因变量的变化。

举个简单的例子,如果只有一个自变量时,计算出来的边际均值和普通均值是一样的;当有两个及以上自变量时,计算边际均值和普通均值的出来的结果是不同的。

点击勾选需要计算边际均值的分组变量,交互作用也可以选。

分析结果如下:

这里的统计图,上下两条误差线可以用SE,也可以用置信区间表示。

统计表的解读:

例如三个治疗组,Lev+5FU、Obs、Lev 各自的blood边际均值和95% CI都可以在第一个表中找到;

两个性别,Female 和 Male各自的blood边际均值和95% CI可以在第二个表中找到;

而第三个表,交互作用表中,则有3*2=6个亚组,如男性接受Lev+5FU治疗组,blood边际均值为58.79

统计图的解读:

中间的圆点是均值,上下两条线是误差线。

在最后一个交互作用图中,横坐标是treatment, 图例分组是sex, 如果想颠倒过来,在选择边际均值项的菜单中,可以先选sex, 再选treatment, 图像的交叉顺序是根据菜单选择顺序来排列的。treatment:sex和sex:treatment在图像排列上有所不同。

10.23.8 下载报告

点击下载word文件即可

10.23.9 讨论

  • 方差分析对数据非正态性具有一定的耐受力,如果数据不是严重偏态或者只有部分组别数据不满足正态性要求,出于参数检验的统计学效能优于非参数检验的角度,还是可以使用方差分析方法,而不使用非参数检验。

  • 多重比较一般分为事前检验(Prior tests)和事后检验(Post hoc tests)。事前检验是指在数据收集之前便决定了要通过多重比较来考察多个组与某个特定组之间的差别,多根据专业意义设定比较的策略。如果是事前检验,不论整体分析的结果如何,均可进行比较,并且一般不需要对检验水准进行太多修正。事后检验只有在方差分析得到有统计学意义的F值后才有必要进行,是一种探索性分析。对于事先未计划的多重比较(即事后检验),各组间的差别只是一种提示,要确认这种差别最好重新设计实验。

  • 事后检验提供了”Tukey”法、“Scheffe”法、“Bonferroni”法和”Holm”法四种方法,均为在方差齐时使用。其中”Bonferroni”法为对检验水准的严格校正,校正后的检验水准为原始检验水准除以比较次数,当两两比较的次数较多时,结果偏保守。“Holm”法对检验水准的校正程度不如”Bonferroni”法严格,结果更为稳健。Scheffe法的检验效能优于Bonferroni法。Tukey法使用时需要样本数目相同,并可能产生较多的假阴性结果。

10.24 多元(协)方差分析(MANCOVA)

多元(协)方差分析(Multivariate Analysis of (Co)Variance,MANCOVA)是一种统计方法,用于研究多个因变量与一个或多个分类和/或连续解释变量之间的关系。与普通(协)方差分析(ANOVA/ANCOVA)相比,MANCOVA能够同时处理多个因变量,从而分析多个相关因变量之间的整体效应。在MANCOVA中,多个因变量被看作是一个整体,并结合在一起进行分析。这有助于检测解释变量对因变量组合的主效应、交互效应以及各组之间的差异。

举例:在心血管疾病患者中,我们研究两种不同药物治疗(药物A和药物B)对生活质量的影响,同时考虑年龄作为一个协变量。生活质量可以通过多个指标来衡量,如心理健康、生理健康和社会功能等。具体指标可以包括:

  1. 心理健康:

    • 抑郁程度:如使用汉密尔顿抑郁量表(HAMD)评估;

    • 焦虑程度:如使用汉密尔顿焦虑量表(HAMA)评估;

    • 精神压力水平:例如使用 perceived stress scale(PSS)评估。

  2. 生理健康:

    • 心率:静息心率、运动时心率;

    • 血压:收缩压、舒张压;

    • 胆固醇水平:总胆固醇、低密度脂蛋白胆固醇、高密度脂蛋白胆固醇;

    • 身体质量指数(BMI)。

  3. 社会功能:

    • 工作能力:例如使用工作能力指数(WAI)评估;

    • 社会支持:例如使用社会支持评定量表(SSRS)评估;

    • 生活满意度:例如使用满意度与生活质量量表(SWLS)评估。

这些指标之间可能存在一定程度的相关性,例如心理健康与生理健康之间可能存在相互影响。使用多元(协)方差分析而不是普通(协)方差分析的原因在于:

  1. 多元(协)方差分析能够同时考虑多个因变量,更全面地分析药物治疗对患者生活质量的整体影响。

  2. 由于多个指标之间可能存在相关性,多元(协)方差分析能够考虑这些相关性,更准确地评估解释变量和协变量对因变量的影响。

  3. 多元(协)方差分析能够检测解释变量对因变量组合的主效应、交互效应以及各组之间的差异,从而为科研工作提供更多信息。

MSTATA做多元(协)方差分析的功能主要有:

  1. 适用条件判断:包括Box’s M test(用于检验协方差矩阵的相等性)、Shapiro-Wilk test(用于检验多元正态性)和Q-Q plot of multivariate normality(用于可视化多元正态性)。

  2. 使用以下方法进行MANCOVA分析:Pillai’s Trace, Wilks’ Lambda, Hotelling’s Trace和Roy’s Largest Root multivariate statistics。这些方法可以帮助用户确定解释变量对多个因变量的整体影响。

  3. 自动生成Word表格,方便用户直接粘贴到论文中。这些表格包括各种统计结果和分析细节,以便用户能够清晰地了解分析过程和结论。

通过MSTATA提供的多元(协)方差分析功能,用户可以方便地对多个因变量进行综合分析,评估解释变量和协变量对因变量的影响,并生成详细的统计报告和可视化结果,从而为科研工作提供有力支持。

10.24.1 准备数据

到”导入数据”页面下载示例数据看一下:

Blood, Heart, Mental, Strong 是一组疗效指标,且有相关性。

treatment是代表治疗组别的变量,这里有三个组Treatment A,Treatment B 和Control组。需要把变量属性设置成factor

sex是性别,也是我们感兴趣的组别变量, 要设为factor

Age是需要调整的协变量,为连续性变量,要设为numeric

10.24.2 进入模块

顶部菜单选择 “按统计学分类模块” → “多元(协)方差分析(MANCOVA)” 进入。

10.24.3 开始多元(协)方差分析

选择变量:

选择多个因变量Y,必须是数值型连续变量numeric, 另外选择分组因素自变量facotr,只选感兴趣的分组因素,不要选一大堆。还有协变量numeric。

10.24.4 使用条件判断

这里可以勾选 Box’s M 检验和多元正态性检验、QQ图等。

多元(协)方差分析(MANCOVA)的适用条件主要包括协方差矩阵相等性、多元正态性和因变量间独立性。以下是相关统计检验的介绍:

  1. Box’s M 检验:

Box’s M检验用于检验各组协方差矩阵的相等性。协方差矩阵相等性是多元(协)方差分析的基本假设之一。如果各组的协方差矩阵不相等,那么多元(协)方差分析的结果可能受到影响。当Box’s M检验的p值大于显著性水平(如0.05)时,我们不能拒绝原假设(各组协方差矩阵相等),认为满足多元(协)方差分析的要求。

  1. 显示多元正态Q-Q图:

Q-Q图(Quantile-Quantile图)是一种用于判断样本数据是否符合某种分布(如正态分布)的图形方法。多元正态Q-Q图将多元数据的分位数与理论正态分布的分位数进行比较。如果数据点在Q-Q图上大致沿一条直线排列,则认为数据满足多元正态分布。多元正态性是多元(协)方差分析的另一个基本假设。

  1. Shapiro-Wilk(正态性)检验:

Shapiro-Wilk检验是一种用于检验样本数据是否符合正态分布的方法。在多元(协)方差分析中,我们需要确保各组因变量满足正态分布。当Shapiro-Wilk检验的p值大于显著性水平(如0.05)时,我们不能拒绝原假设(数据符合正态分布),认为满足多元(协)方差分析的要求。

总之,在进行多元(协)方差分析之前,我们需要满足以下条件:

  • 各组协方差矩阵相等(通过Box’s M检验判断)

  • 数据满足多元正态分布(通过多元正态Q-Q图判断)

如果这些条件得到满足,我们可以认为数据适合进行多元(协)方差分析。

10.24.5 多元(协)方差分析的选项

多元(协)方差分析(MANCOVA)的方法主要有四种,它们分别是Pillai’s Trace、Wilks’ Lambda、Hotelling’s Trace和Roy’s Largest Root。以下是它们的定义以及如何解读结果:

  1. Pillai’s Trace:

Pillai’s Trace是一种用于检验解释变量对多个因变量的整体影响的方法。其值范围在0到1之间。较大的Pillai’s Trace值表示解释变量对因变量的整体影响较大。通过比较Pillai’s Trace值的观测值与在原假设下的期望值,我们可以得到一个p值,以判断解释变量对因变量组合的影响是否显著。

  1. Wilks’ Lambda:

Wilks’ Lambda是另一种用于检验解释变量对多个因变量的整体影响的方法。其值范围在0到1之间。较小的Wilks’ Lambda值表示解释变量对因变量的整体影响较大。通过比较Wilks’ Lambda值的观测值与在原假设下的期望值,我们可以得到一个p值,以判断解释变量对因变量组合的影响是否显著。

  1. Hotelling’s Trace:

Hotelling’s Trace也是一种用于检验解释变量对多个因变量的整体影响的方法。其值大于等于0。较大的Hotelling’s Trace值表示解释变量对因变量的整体影响较大。通过比较Hotelling’s Trace值的观测值与在原假设下的期望值,我们可以得到一个p值,以判断解释变量对因变量组合的影响是否显著。

  1. Roy’s Largest Root:

Roy’s Largest Root是用于检验解释变量对因变量组合中最大单一效应的方法。其值大于等于0。较大的Roy’s Largest Root值表示解释变量对至少一个因变量的影响较大。通过比较Roy’s Largest Root值的观测值与在原假设下的期望值,我们可以得到一个p值,以判断解释变量对因变量组合中的最大单一效应是否显著。

解读结果:

对于这四种方法,我们需要关注它们对应的p值。如果p值小于预设的显著性水平(如0.05),则认为解释变量对因变量的整体影响或最大单一效应是显著的。在实际研究中,我们可以根据具体情况选择合适的方法。有时,研究者会选择多种方法进行检验以提高结果的稳定性。

Pillai’s Trace、Wilks’ Lambda、Hotelling’s Trace和Roy’s Largest Root都可以用于检验解释变量对多个因变量的整体影响。选择合适的方法取决于具体研究背景和数据特点。以下是一些建议:

  1. 数据分布和样本大小:对于小样本和数据分布偏离多元正态分布的情况,Pillai’s Trace和Wilks’ Lambda相对于Hotelling’s Trace和Roy’s Largest Root具有更好的稳健性。

  2. 统计功效:一般来说,Roy’s Largest Root在检验解释变量对因变量组合中最大单一效应时具有较高的统计功效,但可能较不稳健。相反,Pillai’s Trace和Wilks’ Lambda在检验解释变量对因变量的整体影响时具有较好的稳健性,但可能在某些情况下具有较低的统计功效。

  3. 结果一致性:在实际研究中,我们可以选择多种方法进行检验以提高结果的稳定性。如果这四种方法的结果相互一致,那么结论更具有可信度。

  4. 研究目的:根据研究目的,可以选择更关注整体效应的Pillai’s Trace和Wilks’ Lambda,或更关注最大单一效应的Hotelling’s Trace和Roy’s Largest Root。

做完多元(协)方差分析之后,系统还会给出对每个因变量Y逐个进行传统方差分析的结果供参考。

10.24.6 下载word报告

点击下载word文件即可

10.25 重复测量方差分析(Repeated Measures ANOVA)

重复测量方差分析(Repeated Measures ANOVA)是一种统计方法,用于分析在相同实验单位上进行的多次观测之间的差异。该方法主要用于研究时间、条件或处理对实验单位的影响。重复测量方差分析可以考虑实验单位内的差异,并对此进行控制,以更准确地检测因素的作用。

使用场景:

  1. 研究某种干预或处理在不同时间点的效果。

  2. 比较多个实验条件下的实验单位表现。

  3. 研究时间与处理之间的交互作用。

例子1:临床上重复测量空腹血糖值,比较不同时间点血糖值的差异 在这个例子中,我们关注单一治疗组的患者在不同时间点的空腹血糖水平。例如,我们可以在开始治疗前、治疗后1个月、治疗后3个月和治疗后6个月测量空腹血糖值。通过使用重复测量方差分析,我们可以检测不同时间点空腹血糖值之间的差异,以便了解患者的血糖控制情况。

例子2:重复测量空腹血糖值,有三个治疗组,比较三组之间疗效的差异 在这个例子中,我们关注三个不同治疗组的患者在不同时间点的空腹血糖水平。例如,治疗组A接受药物1,治疗组B接受药物2,治疗组C接受药物3。我们可以在开始治疗前、治疗后1个月、治疗后3个月和治疗后6个月的时间点测量空腹血糖值。通过使用重复测量方差分析,我们可以检测三组之间的疗效差异(治疗组效应),不同时间点的血糖值差异(时间效应)以及时间与治疗组之间的交互作用。这有助于我们了解哪种药物对血糖控制的效果最好。

MSTATA 医学科研统计机器人提供了一站式的重复测量差分析步骤:

  1. 数据是否适合做重复测量方差分析:提供球形度检验、QQ图、方差齐性检验;
  2. 进行重复测量方差分析,设置重复测量单元和感兴趣的因子,可选交互作用或不选交互作用,设置要调整的协变量;
  3. 事后检验:对各水平亚组进行两两比较,可以调整多重比较的P值,可选Tukey法,Scheffe法,Bonferroni法和Holm法
  4. 计算效应量(effect size)
  5. 计算和比较各水平亚组的估计边际平均值(Estimated marginal means)和置信区间,生成统计表,绘制统计图

10.25.1 准备数据

首先务必按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

Week.0, Week.6, Week.12, Week.24 是一组重复测量的数据,为基线、6周、12周、24周的血糖值。

treatment是代表治疗组别的变量,这里有三个组Treatment A,Treatment B 和Control组。需要把变量属性设置成factor

sex是性别,也是我们感兴趣的组别变量, 要设为factor

Age是需要调整的协变量,为连续性变量,要设为numeric

10.25.2 进入模块

顶部菜单选择 “按统计学分类模块” → “重复测量方差分析(Repeated Measures ANOVA)” 进入。

10.25.3 设置重复测量单元

本例中0~24周的血糖测量,一共四个变量,值都是血糖水平,变量名用了Week.X 这样易于理解的时间标签。

把这几个变量点选中,即可组合成一个重复测量单元,注意点选的顺序需要按照事情发生的顺序来选,不可打乱。

给重复测量单元敲入一个易于展示的名称,这里我们命名为 Times,表示时间或次数。另外给指标也起一个名字,这里我们敲入”血糖值”,这两个名称都会在后面生成的统计图表中出现:

选择代表感兴趣的组别的因子,这里我们选treatment和sex,如果菜单里没有,则返回去把你想要的组别变量设置为factor

选择交互作用,每点击一次”增加交互作用项”按钮,就可以增加一个交互作用项菜单,在菜单里选两个以上的变量,就能将其合成交互作用项。这个例子中我们不设置交互作用。如果选错了要修改,可以点击”重置清零”按钮。

选择不感兴趣,用来做调整的协变量:这里age可能对结局有影响,但不是我们研究感兴趣的研究变量,因此勾选用来做协变量调整。

10.25.4 使用条件判断

这里可以勾选球形度检验和方差齐性检验等。

球形度检验结果如下:

球形度检验(Tests of Sphericity)是在重复测量方差分析(Repeated Measures ANOVA)中用来检验数据是否满足球形假设(sphericity assumption)的方法。球形假设要求各水平之间的协方差相等,即各水平之间的方差和协方差矩阵是球形的。违反球形假设会导致重复测量方差分析的结果失真。

Mauchly’s W、Greenhouse-Geisser ε和Huynh-Feldt ε是常用的球形度检验方法:

  1. Mauchly’s W:Mauchly’s W检验是最常用的球形度检验方法。它检验了协方差矩阵是否与恒等矩阵的充分接近。如果Mauchly’s W检验的p值小于预定的显著性水平(如0.05),则拒绝球形假设,认为数据违反了球形假设。

  2. Greenhouse-Geisser ε:Greenhouse-Geisser修正是一种用于调整自由度的方法,以弥补违反球形假设所带来的影响。在使用Greenhouse-Geisser ε修正之后,可以通过比较调整后的F值与F分布的临界值来判断球形度。Greenhouse-Geisser ε的值介于0和1之间,当ε趋近于1时,说明球形假设趋于成立;反之,趋近于0则违反球形假设。

  3. Huynh-Feldt ε:Huynh-Feldt修正是另一种调整自由度的方法。与Greenhouse-Geisser修正相比,Huynh-Feldt修正在估计自由度时相对较宽松,因此在实际应用中可能存在假阳性风险。Huynh-Feldt ε的值介于0和1之间,同样地,当ε趋近于1时,说明球形假设趋于成立;反之,趋近于0则违反球形假设。

在重复测量方差分析中,如果球形度检验表明数据违反了球形假设,那么通常需要采用Greenhouse-Geisser或Huynh-Feldt修正来调整自由度,以减小估计偏差,从而得到更准确的统计推断。选择哪种修正方法取决于实际情况,通常情况下,Greenhouse-Geisser修正较为保守,而Huynh-Feldt修正较为宽松。

10.25.5 重复测量方差分析的选项

这里可以选择平方和(ss)的类型,默认选类型3;

在重复测量方差分析中,效应量(effect size)是一个反映因素对因变量的影响程度的指标。常用的效应量指标有η²G(总组间效应量,Eta-squared generalized)、η²(组间效应量,Eta-squared)、η²p(偏组间效应量,Partial Eta-squared)和ω²(总组内效应量,Omega-squared)。

  1. η²G(总组间效应量,Eta-squared generalized):η²G是一个描述整个模型中组间差异(即因素对因变量的影响)与总差异(因素效应和误差效应的总和)之间比例的指标。η²G的值介于0和1之间,值越大表示组间差异越明显,因素对因变量的影响越大。

  2. η²(组间效应量,Eta-squared):η²是一个描述某个特定因素对因变量的影响程度的指标。它反映了该因素产生的差异与总差异之间的比例。与η²G类似,η²的值介于0和1之间,值越大表示该因素对因变量的影响越大。

  3. η²p(偏组间效应量,Partial Eta-squared):η²p是一个描述某个特定因素对因变量的影响程度的指标,与η²类似,但是它考虑了其他因素的影响。它反映了该因素产生的差异与总差异(包括该因素和其他因素的影响)之间的比例。η²p的值介于0和1之间,值越大表示该因素对因变量的影响越大,同时考虑了其他因素的影响。

  4. ω²(总组内效应量,Omega-squared):ω²是一个描述整个模型中组内差异(即误差效应)与总差异(因素效应和误差效应的总和)之间比例的指标。ω²的值介于0和1之间,值越大表示组内差异越明显,误差效应对因变量的影响越大。

在重复测量方差分析中,Within Subjects Effects(组内效应)和Between Subjects Effects(组间效应)是两种不同类型的因素对因变量产生影响的方式。

  1. Within Subjects Effects(组内效应):组内效应是指在同一实验单位内,在不同条件或时间点上的因变量值之间的差异。例如,在一个实验中,对同一组受试者在不同时间点进行测量,以研究某种干预措施的长期效果。

  2. Between Subjects Effects(组间效应):组间效应是指在不同实验单位或组别之间的因变量值的差异。例如,在一个实验中,将受试者分为两个或多个组,每个组接受不同的干预措施,以研究不同干预措施之间的效果差异。

在重复测量方差分析的输出结果中,通常会看到以下统计量:

  1. Sum of Squares(平方和):Sum of Squares是指因素效应、误差效应或总效应下,因变量值与其均值之差的平方和。它用于衡量因素、误差或总体中的变异性。

  2. Mean Square(均方):Mean Square是平方和除以对应的自由度,即Sum of Squares的平均值。对于因素效应和误差效应,它们的均方分别用于计算F值。

  3. F值(F统计量):F值是因素效应的均方与误差效应的均方之比。它用于检验因素对因变量的影响是否显著。F值越大,说明因素对因变量的影响越大,拒绝原假设(即认为因素对因变量有显著影响)的可能性越高。

  4. P值(显著性水平):P值是在原假设成立的前提下,观察到当前或更极端F值的概率。通常情况下,如果P值小于预定的显著性水平(如0.05),则拒绝原假设,认为因素对因变量有显著影响。

在解释重复测量方差分析的结果时,需要分别关注Within Subjects Effects和Between Subjects Effects的F值和P值,以了解组内和组间因素对因变量的影响程度。同时,还需要关注效应量指标(如η²、η²p等),以了解因素对因变量的实际影响大小。

10.25.6 事后检验

重复测量方差分析的事后检验(post hoc tests)用于在方差分析结果显著的情况下,进一步确定哪些组别之间存在显著差异。事后检验分为重复测量变量之间的事后检验和其他分组因素的事后检验。

  1. 重复测量变量之间的事后检验:这种事后检验主要关注不同时间点或条件下因变量之间的差异。当重复测量方差分析的Within Subjects Effects显著时,可以通过这类事后检验来确定具体哪些时间点或条件之间存在显著差异。常用的事后检验方法包括Tukey法、Scheffe法、Bonferroni法和Holm法。这些方法通过调整显著性水平或P值,来控制多重比较带来的假阳性风险。

  2. 其他分组因素的事后检验:这种事后检验主要关注不同组别之间因变量的差异。当重复测量方差分析的Between Subjects Effects显著时,可以通过这类事后检验来确定具体哪些组别之间存在显著差异。同样可以采用Tukey法、Scheffe法、Bonferroni法和Holm法进行事后检验。

以下简要介绍这四种方法:

  1. Tukey法(Tukey’s Honestly Significant Difference, Tukey’s HSD):Tukey法主要用于多组比较,可以在保证整体显著性水平的前提下,确定哪些组别之间存在显著差异。适用于组间样本量相等的情况。

  2. Scheffe法(Scheffé’s method):Scheffe法适用于各种自由度的比较,包括两两比较和多重比较。它较为保守,适用于组间样本量不等的情况。

  3. Bonferroni法(Bonferroni correction):Bonferroni法通过将原显著性水平除以比较次数来调整显著性水平,从而控制整体显著性水平。它是一种保守的方法,但在多重比较较多时可能过于保守。

  4. Holm法(Holm-Bonferroni method):Holm法是对Bonferroni法的改进,它通过对P值进行排序和按顺序进行调整,以减轻Bonferroni法在多重比较较多时过于保守的问题。

在选择事后检验方法时,研究者需要权衡实际情况和对误差控制的需求,以得到准确的统计

这里我们选了不同时间点之间的比较,不同治疗组之间的比较,和不同性别之间的比较。

如果需要进一步交叉比较,例如每个治疗组中不同时间点比较,或者每个时间点中不同治疗组的比较,则应该在事后检验的菜单中选择中交互作用Times:Treatment进行事后检验。

10.25.7 估计边际平均值

重复测量方差分析中的Estimated Marginal Means(估计边际均值)是一种描述性统计量,用于表示在考虑所有其他因素的影响下,某一特定因素水平的平均因变量值。估计边际均值是通过将模型中的其他因素固定在它们的平均水平上,并计算给定因素水平的平均因变量值来获得的。

在重复测量方差分析中,可以对重复测量的时间点和其他分组因素分别单独进行估计边际均值的展示,也可以将这几个因素交互在同一个统计表中。这有助于更好地理解和展示因素水平对因变量的影响。

  1. 单独对时间点进行估计边际均值的展示:这种方法将展示不同时间点上因变量的估计边际均值,以及它们之间的差异。这有助于了解在不同时间点上因变量值的变化趋势。

  2. 单独对其他分组因素进行估计边际均值的展示:这种方法将展示不同分组因素水平上因变量的估计边际均值,以及它们之间的差异。这有助于了解不同分组因素水平对因变量的影响程度。

  3. 将重复测量时间点和其他分组因素交互在同一个统计表中:这种方法将展示不同时间点和分组因素水平组合下因变量的估计边际均值,以及它们之间的差异。这有助于了解时间点和分组因素之间的交互作用对因变量的影响。

在绘制统计图时,也可以采用类似的方式来展示估计边际均值。例如,可以绘制线图来展示不同时间点上的估计边际均值,或者绘制条形图来展示不同分组因素水平上的估计边际均值。对于交互作用的展示,可以在同一图中绘制多条曲线或多组柱状图,以展示不同时间点和分组因素水平组合下的估计边际均值。这将有助于更直观地了解因素水平对因变量的影响及其交互作用。

分别对各分组因素进行估计边际均值的展示:

把各因素交叉组合在同一张统计图表中:

10.25.8 下载报告

点击下载word文件即可

10.26 一般线性回归

线性回归是一种统计学方法,用于研究两个或多个变量之间的关系,通常用于预测一个因变量(响应变量)基于一个或多个自变量(预测变量)。线性回归的关键在于拟合出一个线性方程,最大程度地解释事件发生的概率。在医学研究领域,线性回归常被用于分析连续型数据,例如研究血压与年龄、性别、体重指数(BMI)等相关因素之间的关系。

以下是一个医学研究中应用线性回归的例子:

假设我们要研究收缩压(因变量)与年龄、性别、体重指数(BMI)等危险因素(自变量)之间的关系。在这个例子中,我们可以运用线性回归模型来预测收缩压的变化,进而分析这些危险因素与收缩压之间是否存在显著关系。

MSTATA统计软件中的线性回归模块提供了线性回归的所有相关功能,包括:

  1. 设置自变量:可根据研究目的设置一个或多个自变量。
  2. 支持交互作用项:可以分析自变量间的交互作用对因变量的影响。
  3. 设置分类自变量的参照水平:方便进行多水平分类自变量的比较。
  4. 适用条件判断:
  • 做自相关分析:检查自变量间是否存在自相关,以确保模型稳定性。

  • 做多重共线性分析:检查自变量间是否存在多重共线性,以确保模型稳定性。

  • 做正态性检验:检验因变量和残差的正态性假设。

  • 做残差Q-Q图、做残差图、Cook’s 距离:评估模型假设的满足程度和异常值的存在。

  1. 显示模型系数的置信区间、显示标准化系数、显示标准化系数的置信区间:方便对各自变量的影响力进行评估。
  2. Omnibus方差检验:检验模型整体的显著性。
  3. 模型拟合优度评价:包括复相关系数R、决定系数R²、校正R²、AIC、BIC、均方根误差(RMSE)以及整体模型F检验。
  4. 做估计边际平均值:包括生成估计边际平均值(统计图和表)。

10.26.1 准备数据

首先务必按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

本样例数据的规则:

  1. 一个患者一行(这是准备数据最重要的前提)。

  2. 代表结局的应变量:例如上图中的BLevel,是一项血液学指标。

    解释变量(自变量):例如上图中的age、sex等等一系列指标。

  3. 解释(自)变量有两种,连续性变量(值是连续数据,它可以在变量值所属区间内任意进行取值,如年龄\[岁\]、血糖值、人的身高、智商等)以及分类变量(是说明事物类别的一个名称,其取值是分类数据。如”性别”就是一个分类变量,其变量值为”男”或”女”;“行业”也是一个分类变量,其变量值可以为”零售业”、“旅游业”、“汽车制造 业”等),在本例中 Age和Gtest是连续性变量(numeric), 其他的是分类变量(factor)。

    以上概念很重要,后面有一个页面专门设置连续变量和分类变量。

10.26.2 进入模块

顶部菜单选择 “按统计学分类模块” → “一般线性回归” 进入。

10.26.3 线性回归分析

下一步就是回归分析啦:

  • 选择结局(应)变量 在”请选择结局(应)变量”下拉框中,选择一个连续性变量作为因变量。如果您需要的变量不在列表中,请返回设置将其更改为numeric类型。

  • 选择自变量/解释变量 在”请点击空白框选择自变量/解释变量”下拉框中,选择一个或多个变量作为自变量。如果您需要的字段不在列表中,可能是因为连续性变量被设置成了分类变量,请返回修改。

  • 添加交互作用项 点击”增加交互作用项(可多次点击)“按钮,然后在弹出的选择框中选择至少两个变量以创建交互作用项。您可以多次点击以添加更多交互作用项。

  • 重置清零 如需重置所有已添加的交互作用项,点击”重置清零”按钮。

  • 选择参照组 对于每个非数值因子,从下拉框中选择一个参照组。

  • 适用条件判断 在此部分,您可以选择进行以下分析:

自相关分析(Durbin-Watson 检验): 在线性回归中,自相关分析主要用于检测残差(观测值与预测值之间的差异)之间的相关性。Durbin-Watson 检验是一种常用的方法,检验统计量的值在 0 到 4 之间,接近 2 表示不存在自相关。如果存在显著的自相关,可能需要考虑更复杂的模型,如时间序列模型。

多重共线性分析: 多重共线性是指线性回归模型中,两个或多个自变量之间存在较强的相关性。多重共线性可能导致模型系数估计不稳定,降低解释性。检测方法有方差膨胀因子(VIF)等。VIF 值大于 10 通常被认为表明存在多重共线性。解决方法包括删除相关变量、使用主成分分析等。

正态性检验: 线性回归模型中,正态性检验主要用于检验残差的正态分布假设。常用方法有 Shapiro-Wilk 检验等。若残差不符合正态分布,可能需要考虑变量转换或非线性模型。

残差 Q-Q 图: Q-Q 图是一种图形化方法,用于检验残差的正态分布假设。理想情况下,Q-Q 图上的点应在一条直线上。如果点明显偏离直线,表明残差可能不符合正态分布。

残差图: 残差图用于检查线性回归模型的拟合情况。通常横坐标为预测值,纵坐标为残差。理想情况下,残差应在 0 附近随机分布,无明显模式。如果残差图呈现出特定模式,可能需要考虑非线性模型。

Cook’s 距离: Cook’s 距离是一种衡量观测值对模型参数估计影响程度的统计量。较大的 Cook’s 距离值表明某个观测值对模型拟合产生较大影响,可能是离群值或高杠杆点。通常可设定阈值,如 4/n(n 为观测数),若某观测值的 Cook’s 距离大于阈值,则需要进一步审查

  • 模型拟合优度评价 在此部分,您可以选择显示以下模型拟合优度指标:

    • 复相关系数R

    • 决定系数R²

    • 校正R²

    • AIC

    • BIC

    • 均方根误差(RMSE)

    • 整体模型F检验

  • 显示模型系数 您可以选择显示模型系数的置信区间和标准化系数。如果需要,还可以显示标准化系数的置信区间。

  • Omnibus 检验 您可以选择进行方差分析。

  • 边际估计均值统计图表 您可以选择对每个因素逐个单独做边际估计均值统计图表,或者把多个因素交叉组合在同一个统计图表上展示边际估计均值。此外,您还可以设置显示置信区间,修改置信水平,以及设定统计图的宽度和高度(像素)。

  • 开始进行线性回归 设置完成后,点击”开始进行线性回归”按钮,开始分析

10.26.4 下载报告

点击下载word文件即可

10.27 二分类 Logistic 回归(Y 为二分类变量)

Logistic回归是一种广义线性模型,适用于处理具有二分类结果的因变量。Logistic回归的特点是使用logit函数将线性预测子与因变量之间的关系建立起来,从而可以预测事件发生的概率。在医学研究中,Logistic回归常用于分析疾病发生与危险因素之间的关系。

以下是一个医学研究中应用Logistic回归的例子:

假设我们要研究糖尿病(因变量)与年龄、性别、体重指数(BMI)等危险因素(自变量)之间的关系。在这个例子中,我们可以运用Logistic回归模型来预测糖尿病发生的概率,进而分析这些危险因素与糖尿病之间是否存在显著关系。

MSTATA统计软件中的Logistic回归模块提供了Logistic回归的所有相关功能,可谓集大成者,包括:

  1. 设置自变量:可根据研究目的设置一个或多个自变量。

  2. 支持交互作用项:可以分析自变量间的交互作用对因变量的影响。

  3. 设置分类自变量的参照水平:方便进行多水平分类自变量的比较。

  4. 适用条件判断(多重共线性分析):检查自变量间是否存在多重共线性,以确保模型稳定性。

  5. 展示回归系数:输出每个自变量对应的回归系数。

  6. 展示OR值和可信区间:方便对各自变量的影响力进行评估。

  7. 模型拟合评价:包括Deviance、AIC、BIC、McFadden’s R²、Cox & Snell’s R²和Nagelkerke’s R²。

  8. 做Omnibus似然比检验:检验模型整体的显著性。

  9. Estimated Marginal Means分析:包括生成估计边际平均值(概率图)。

  10. 诊断预测和ROC曲线:评估模型的诊断能力。

  11. ROC曲线评估:计算AUC值及灵敏度特异度等,评估模型的区分能力。

  12. 生成cut-off图:根据截断点,进行分类预测。

  13. 生成分类表(混淆矩阵):用于评估模型的预测准确性。

  14. 导出Word格式的统计报告:方便进一步编辑和整理。

10.27.1 准备数据

首先务必按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

本样例数据的规则:

  1. 一个患者一行(这是准备数据最重要的前提)。

  2. 代表结局的应变量:例如上图中的Effectiveness,有疗效Good、Bad两种情况

    解释变量(自变量):例如上图中的age、sex等等一系列指标。

  3. 解释(自)变量有两种,连续性变量(值是连续数据,它可以在变量值所属区间内任意进行取值,如年龄\[岁\]、血糖值、人的身高、智商等)以及分类变量(是说明事物类别的一个名称,其取值是分类数据。如”性别”就是一个分类变量,其变量值为”男”或”女”;“行业”也是一个分类变量,其变量值可以为”零售业”、“旅游业”、“汽车制造 业”等),在本例中 Age和Blood_test是连续性变量(numeric), 其他的是分类变量(factor)。

    以上概念很重要,后面有一个页面专门设置连续变量和分类变量。

10.27.2 进入模块

顶部菜单选择 “按统计学分类模块” → “二分类 Logistic 回归(Y 为二分类变量)” 进入。

10.27.3 选择结局变量

选择二分类变量作为应变量进行logistic回归。

10.27.4 选择解释变量(自变量)

根据提示选择自变量。这里要注意的是,如果上传的数据Excel文件里把连续性变量设置成了字符型,如年龄设置成了字符型,需要在前面”选择字段”功能里改回成numeric,如果按照分类变量放进影响因素分析。同理,如果把ID号也作为分类变量放进影响因素,也会出问题。

另外,在分类变量里,有些亚组人数很少,最好把它和其他亚组合并之后再传上来分析,亚组人数太少容易让可信区间特别宽,影响排版。当然,后续我们也会增加一个合并亚组的小工具。

10.27.5 选择交互作用

点开交互作用选项,点击增加交互作用项按钮,选定两个及以上变量即可生成交互作用项,如果要增加多个交互作用项,重复点击”增加交互作用项”按钮即可;如果选错了,点击重置清零即可。

10.27.6 设置分类变量的参照组

分类变量会被自动拆成哑变量处理,可以下拉选择参照水平。通常选临床默认的参照水平,也可以将样本量最大的亚组设置为参照水平,以增加统计分析效能。

10.27.7 多重共线性分析

多重共线性是指自变量之间存在较高的相关性,可能导致回归系数估计不稳定,影响模型解释和预测能力。在Logistic回归中,多重共线性分析的目的是检查模型中自变量间是否存在较强的线性关系,以便在建模过程中采取相应措施。

多重共线性的判断通常基于方差膨胀因子(Variance Inflation Factor, VIF)和容忍度(Tolerance)两个指标。

  1. 方差膨胀因子(VIF):VIF是一个衡量多重共线性程度的指标,可以反映自变量的方差与无共线性情况下的方差之间的比值。VIF值越大,表示该自变量与其他自变量之间的共线性越强。通常,VIF值大于10被认为存在较强的多重共线性。

计算公式:VIF = 1 / (1 - R²)

其中,R²是该自变量作为因变量,其他自变量作为解释变量时,线性回归模型的解释力。

  1. 容忍度(Tolerance):容忍度是VIF的倒数,用于衡量一个自变量与其他自变量之间的独立性。容忍度值越小,表示该自变量与其他自变量之间的共线性越强。通常,容忍度值小于0.1被认为存在较强的多重共线性。

计算公式:Tolerance = 1 - R²

在实际应用中,可以通过计算每个自变量的VIF和容忍度来判断多重共线性的程度。如果发现存在较强的多重共线性,可以采取以下措施:

  1. 增加样本量:有时候多重共线性是由于样本量不足导致的,增加样本量可能有助于降低多重共线性。

  2. 删除某些自变量:如果某些自变量之间存在强相关性,可以考虑删除其中之一,以降低多重共线性。

  3. 组合自变量:对于高度相关的自变量,可以考虑将它们组合成一个新的自变量。

  4. 引入Lasso或者岭回归等方法:这些方法可以在一定程度上解决多重共线性问题。

总之,在进行Logistic回归分析时,应关注多重共线性的问题,通过VIF和容忍度等指标判断自变量间的相关性,并采取相应措施以确保模型的稳定性和解释力。

可以用本站另外一个APP”从单因素到多因素分析中自动变量筛选”功能来筛选变量,APP位于www.mstata.com , “以临床研究类型分类” - “影响因素分析” 菜单

多重共线性分析结果:

10.27.8 Logistic回归结果展示选项

选择结果展示的表格外观:

可以选择是否显示回归系数的置信区间、是否显示OR值,是否显示OR值的置信区间,以及是否做似然比检验。

回归分析结果如下:

在二分类Logistic回归分析中,对于每个自变量,我们需要估计其对应的参数。参数的估计值反映了自变量与因变量之间的关系。在结果报告中,我们通常可以找到以下信息:

Estimate(估计值):自变量对应的回归系数估计值。系数的正负表示自变量与因变量之间的正负相关关系。系数的绝对值表示了自变量变化一个单位时,对应的log-odds变化的大小。

SE(标准误差):回归系数估计值的标准误差。标准误差是估计值的不确定性度量,用于计算置信区间和进行假设检验。

Z(Z统计量):回归系数估计值除以其标准误差得到的值。Z统计量用于检验回归系数是否显著地不同于零。

p-value(p值):对应于Z统计量的p值。如果p值小于预定显著性水平(例如0.05),我们可以拒绝零假设(即回归系数为0),认为该自变量对因变量具有显著影响。

OR(Odds Ratio,比值比):回归系数的指数形式。比值比表示自变量每增加一个单位时,事件发生几率(Odds)的变化。值大于1表示自变量增加时,事件发生几率增加;值小于1表示自变量增加时,事件发生几率减少;值等于1表示自变量与事件发生几率无关。

95% CI Lower(95%置信区间下限):回归系数的95%置信区间的下限。置信区间表示我们对回归系数的不确定性范围。

95% CI Upper(95%置信区间上限):回归系数的95%置信区间的上限。置信区间表示我们对回归系数的不确定性范围。

总之,这些结果参数帮助我们了解自变量与因变量之间的关系、显著性和不确定性。通过分析这些参数,我们可以评估自变量对事件发生几率的影响以及其显著性水平。

似然比检验:

在二分类Logistic回归中,Omnibus似然比检验用于评估模型中一个或多个自变量对模型拟合优度的显著性贡献。这种检验通过比较包含某个自变量的完整模型与不包含该自变量的简化模型之间的对数似然差值来进行。差值经过计算后,得到一个χ²统计量,然后根据自由度(df)来计算对应的p值。较低的p值表示在包含该自变量的情况下,模型的拟合优度显著地得到了改善。

从结果中,我们可以看到不同自变量对模型拟合优度的贡献。例如,年龄(Age)的p值为0.0287,小于0.05,表示年龄对模型的拟合具有显著性贡献。然而,性别(Sex)的p值为0.9727,大于0.05,表明性别对模型的拟合优度没有显著影响。

通过Omnibus似然比检验,我们可以了解到哪些自变量对Logistic回归模型的拟合优度有显著性贡献,从而帮助我们确定关键因素,优化模型和提高预测准确性。

10.27.9 模型拟合评价

选择模型拟合评价的参数:

在Logistic回归分析中,模型拟合优度评价是用于衡量模型与数据之间拟合程度的指标。以下介绍几种常见的Logistic回归模型拟合优度评价指标:

离差(Deviance):离差是基于似然比的一种度量,用于衡量拟合模型与完全拟合模型(即每个观测值都有一个独立参数)之间的差异。较小的离差值表示模型拟合较好。离差值本身无明确标准,通常用于模型间的比较。

AIC(Akaike Information Criterion):AIC是由赤池质量量提出的一种模型选择准则,用于衡量模型拟合优度和模型复杂度之间的平衡。AIC值越小,表示模型拟合较好。AIC主要用于比较不同模型的拟合优度。

计算公式:AIC = -2 * ln(似然比) + 2 * k

其中,k表示模型中参数的个数。

BIC(Bayesian Information Criterion):BIC与AIC类似,也是一种衡量模型拟合优度和模型复杂度之间的平衡的指标。与AIC相比,BIC对模型复杂度的惩罚更大。BIC值越小,表示模型拟合较好。BIC也主要用于比较不同模型的拟合优度。

计算公式:BIC = -2 * ln(似然比) + k * ln(n)

其中,k表示模型中参数的个数,n表示样本量。

伪R²(pseudo-R²):伪R²是Logistic回归中类似于线性回归中R²的指标,用于衡量模型解释力。伪R²的值介于0和1之间,值越接近1,表示模型解释力越强。常见的伪R²有McFadden’s R²、Cox & Snell’s R²和Nagelkerke’s R²。

1)McFadden’s R²:McFadden提出的伪R²,基于空模型(不包含任何自变量)与拟合模型的离差之比。

计算公式:McFadden’s R² = 1 - (拟合模型离差 / 空模型离差)

2)Cox & Snell’s R²:Cox和Snell提出的伪R²,基于空模型和拟合模型的似然比。

计算公式:Cox & Snell’s R² = 1 - (拟合模型似然 / 空模型似然)^(2/n)

其中,n表示样本量。

3)Nagelkerke’s R²:Nagelkerke对Cox & Snell’s R²进行了调整,使其最大值为1,因此在实际应用中更为常用。

计算公式:Nagelkerke’s R² = (Cox & Snell’s R²) / (1 - 空模型似然^(2/n))

其中,n表示样本量。

以上各个参数的定义、意义和评价方法在Logistic回归模型拟合优度评价中都起到了重要作用。在模型评估和选择时,我们需要综合考虑这些指标,以确保选出的模型具有较好的拟合优度和较低的复杂度。需要注意的是,这些指标并非绝对标准,而是用于在多个模型之间进行相对比较。在实际应用中,除了考虑这些指标,还应结合领域知识和研究目标进行模型选择和评估。

模型拟合评价结果如下:

10.27.10 进行估计边际平均值分析:

估计边际平均值(Estimated Marginal Means,EMM)在Logistic回归中是一种描述自变量对因变量(概率)影响的方法。它考虑了其他自变量和交互作用的影响,计算在特定水平或条件下的预测概率。估计边际平均值有助于我们更直观地理解模型中各变量的效应,尤其是在模型中存在交互作用时。

在Logistic回归中,估计边际平均值通常表示某一自变量水平下事件发生的预测概率。这个概率是基于模型中所有其他自变量取其平均值或设定值时的预测值。通过计算不同自变量水平下的估计边际平均值,我们可以比较不同条件下事件发生的可能性。

统计图表在估计边际平均值分析中起到了重要作用。通常,我们使用线图或柱状图展示不同自变量水平下的估计边际平均值,其中横坐标表示自变量的水平,纵坐标表示预测的概率。这样的图表可以帮助我们直观地观察不同自变量水平下事件发生概率的变化,进而分析自变量对事件发生概率的影响。

例如,在一个研究中,我们关心某种药物剂量对患者康复概率的影响,同时需要考虑年龄的影响。在进行Logistic回归分析后,我们可以计算不同药物剂量下的估计边际平均值,并绘制统计图表。图表上的纵坐标表示患者康复的预测概率,横坐标表示药物剂量。通过观察图表,我们可以直观地了解药物剂量与康复概率之间的关系,为临床决策提供依据。

总之,估计边际平均值分析在Logistic回归中具有重要意义,可以帮助我们更好地理解自变量对事件发生概率的影响。通过绘制统计图表,我们可以直观地展示和比较不同自变量水平下的预测概率,从而为实际应用提供依据。

估计边际平均值(Estimated Marginal Means,EMM)分析结果如下:

横坐标是自变量的不同取值,纵坐标是结局事件发生的期望概率。期望,就是平均的意思,所以是自变量每个取值患者们,调整了协变量之后的平均概率。

做诊断预测和ROC曲线

Logistic回归的诊断预测主要用于评估模型在预测二分类结果方面的表现。接收者操作特征曲线(ROC曲线)是一种用于评价二分类模型预测性能的图形工具,横坐标表示1-特异度,纵坐标表示灵敏度。ROC曲线下的面积(AUC,Area Under the Curve)越接近1,表示模型的分类预测能力越强。

MSTATA软件界面提供了以下功能,用于评估Logistic回归模型的诊断预测性能:

  1. 显示模型的ROC曲线:绘制ROC曲线,直观展示模型在不同截断值下的特异度和灵敏度变化。

  2. 显示AUC值:计算ROC曲线下的面积,衡量模型的预测性能。AUC值越接近1,预测性能越好;接近0.5时,预测性能不佳,相当于随机猜测。

  3. 设定截断值(cut-off):截断值是一个阈值,用于将预测概率转换为二分类结果。通过调整截断值,可以在特异度和灵敏度之间找到一个平衡。

  4. 显示cut-off图:绘制截断值与准确度、特异度、灵敏度之间的关系图,帮助用户选择合适的截断值。

  5. 显示预测分类表(混淆矩阵):根据设定的截断值,生成预测分类表,展示真实结果与预测结果的对应关系,包括真阳性(TP)、真阴性(TN)、假阳性(FP)和假阴性(FN)。

  6. 显示准确度(Accuracy):计算模型预测结果的准确率,即正确预测的样本占总样本的比例。准确度 = (TP + TN) / (TP + TN + FP + FN)。

  7. 显示特异度(Specificity):计算模型在预测阴性样本方面的准确率,即真阴性占所有阴性样本的比例。特异度 = TN / (TN + FP)。

  8. 显示灵敏度(Sensitivity):计算模型在预测阳性样本方面的准确率,即真阳性占所有阳性样本的比例。灵敏度 = TP / (TP + FN)。

ROC分析的结果如下:

10.27.11 下载报告

点击下载word文件即可

10.28 有序分类 Logistic 回归(Y 为有序分类变量)

有序分类Logistic回归是一种统计方法,用于研究具有有序分类结果的因变量与一个或多个自变量之间的关系。与普通的Logistic回归不同,有序分类Logistic回归考虑了因变量类别之间的有序关系。这种方法在医学研究和其他领域中非常有用,特别是当因变量具有有序性质时。

以下是一个医学研究中应用有序分类Logistic回归的例子:

假设我们要研究患者的年龄、性别和吸烟状况对心血管疾病风险等级的影响。心血管疾病风险分为三个有序等级:低风险、中风险和高风险。我们的因变量是心血管疾病风险等级,自变量包括年龄、性别和吸烟状况。我们想要了解这些自变量对心血管疾病风险等级的影响。

MSTATA统计软件的有序分类Logistic回归模块提供了以下功能:

  1. 设置自变量:可以选择一个或多个自变量,例如年龄、性别和吸烟状况。

  2. 支持交互作用项:可以选择是否考虑自变量之间的交互作用。

  3. 设置分类自变量的参照水平:可以为分类自变量设置参照水平,以便进行比较。

  4. 展示回归系数:展示每个自变量的回归系数,反映其对因变量的影响程度。

  5. 展示OR值和可信区间:展示每个自变量的比值比(Odds Ratio,OR)和对应的置信区间,用于衡量自变量对因变量的相对影响。

  6. 模型拟合评价:包括Deviance、AIC、BIC、McFadden’s R²、Cox & Snell’s R²、Nagelkerke’s R²等指标,用于评估模型的拟合程度。

  7. 进行Omnibus似然比检验:检验模型中所有自变量的整体显著性。

  8. 有序分类的阈值(thresholds)分析:展示用于区分不同风险等级的阈值。

  9. 导出Word格式的统计报告:将分析结果直接导出为Word文档,便于撰写报告和分享。

10.28.1 准备数据

首先务必按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

数据集包含了237名学生关于吸烟、锻炼和其他生活方式因素的调查数据。这个数据集包括一个有序分类因变量Exer(锻炼频率),可以将其视为类似于健康状况的有序分类变量。

本样例数据的规则:

  1. 一个患者一行(这是准备数据最重要的前提)。

  2. 代表结局的应变量:Exer变量是关于锻炼频率的有序分类变量。它有3个水平,表示不同的锻炼频率:

    1. None:不进行锻炼。

    2. Some:偶尔锻炼,没有固定的锻炼计划。

    3. Freq:经常锻炼,有规律的锻炼计划。

  3. 解释变量(自变量):例如上图中的age、sex等等一系列指标。解释(自)变量有两种,连续性变量(值是连续数据,它可以在变量值所属区间内任意进行取值,如年龄\[岁\]、血糖值、人的身高、智商等)以及分类变量(是说明事物类别的一个名称,其取值是分类数据。如”性别”就是一个分类变量,其变量值为”男”或”女”;“行业”也是一个分类变量,其变量值可以为”零售业”、“旅游业”、“汽车制造 业”等)。

    以上概念很重要,后面有一个页面专门设置连续变量和分类变量。

10.28.2 进入模块

顶部菜单选择 “按统计学分类模块” → “有序分类 Logistic 回归(Y 为有序分类变量)” 进入。

10.28.3 选择结局变量

选择有序分类变量作为应变量进行logistic回归。结局变量不管是 低级-中级-高级 这样的文字,还是 1, 2, 3, 4 这样的数字,都要在前面的页面设置成 factor, 然后在因子顺序设置页面按照从低级到高级的的排列顺序进行拖拽设置。

10.28.4 选择解释变量(自变量)

根据提示选择自变量。这里要注意的是,如果上传的数据Excel文件里把连续性变量设置成了字符型,如年龄设置成了字符型,需要在前面”选择字段”功能里改回成numeric,如果按照分类变量放进影响因素分析。同理,如果把ID号也作为分类变量放进影响因素,也会出问题。

另外,在分类变量里,有些亚组人数很少,最好把它和其他亚组合并之后再传上来分析,亚组人数太少容易让可信区间特别宽,影响排版。当然,后续我们也会增加一个合并亚组的小工具。

10.28.5 选择交互作用

点开交互作用选项,点击增加交互作用项按钮,选定两个及以上变量即可生成交互作用项,如果要增加多个交互作用项,重复点击”增加交互作用项”按钮即可;如果选错了,点击重置清零即可。

10.28.6 设置分类变量的参照组

分类变量会被自动拆成哑变量处理,可以下拉选择参照水平。通常选临床默认的参照水平,也可以将样本量最大的亚组设置为参照水平,以增加统计分析效能。

10.28.7 Logistic回归结果展示选项

选择结果展示的表格外观:

可以选择是否显示回归系数的置信区间、是否显示OR值,是否显示OR值的置信区间,以及是否做似然比检验。

回归分析结果如下:

10.28.8 模型拟合评价

选择模型拟合评价的参数:

在Logistic回归分析中,模型拟合优度评价是用于衡量模型与数据之间拟合程度的指标。以下介绍几种常见的Logistic回归模型拟合优度评价指标:

离差(Deviance):离差是基于似然比的一种度量,用于衡量拟合模型与完全拟合模型(即每个观测值都有一个独立参数)之间的差异。较小的离差值表示模型拟合较好。离差值本身无明确标准,通常用于模型间的比较。

AIC(Akaike Information Criterion):AIC是由赤池质量量提出的一种模型选择准则,用于衡量模型拟合优度和模型复杂度之间的平衡。AIC值越小,表示模型拟合较好。AIC主要用于比较不同模型的拟合优度。

计算公式:AIC = -2 * ln(似然比) + 2 * k

其中,k表示模型中参数的个数。

BIC(Bayesian Information Criterion):BIC与AIC类似,也是一种衡量模型拟合优度和模型复杂度之间的平衡的指标。与AIC相比,BIC对模型复杂度的惩罚更大。BIC值越小,表示模型拟合较好。BIC也主要用于比较不同模型的拟合优度。

计算公式:BIC = -2 * ln(似然比) + k * ln(n)

其中,k表示模型中参数的个数,n表示样本量。

伪R²(pseudo-R²):伪R²是Logistic回归中类似于线性回归中R²的指标,用于衡量模型解释力。伪R²的值介于0和1之间,值越接近1,表示模型解释力越强。常见的伪R²有McFadden’s R²、Cox & Snell’s R²和Nagelkerke’s R²。

1)McFadden’s R²:McFadden提出的伪R²,基于空模型(不包含任何自变量)与拟合模型的离差之比。

计算公式:McFadden’s R² = 1 - (拟合模型离差 / 空模型离差)

2)Cox & Snell’s R²:Cox和Snell提出的伪R²,基于空模型和拟合模型的似然比。

计算公式:Cox & Snell’s R² = 1 - (拟合模型似然 / 空模型似然)^(2/n)

其中,n表示样本量。

3)Nagelkerke’s R²:Nagelkerke对Cox & Snell’s R²进行了调整,使其最大值为1,因此在实际应用中更为常用。

计算公式:Nagelkerke’s R² = (Cox & Snell’s R²) / (1 - 空模型似然^(2/n))

其中,n表示样本量。

以上各个参数的定义、意义和评价方法在Logistic回归模型拟合优度评价中都起到了重要作用。在模型评估和选择时,我们需要综合考虑这些指标,以确保选出的模型具有较好的拟合优度和较低的复杂度。需要注意的是,这些指标并非绝对标准,而是用于在多个模型之间进行相对比较。在实际应用中,除了考虑这些指标,还应结合领域知识和研究目标进行模型选择和评估。

模型拟合评价结果如下:

10.28.9 Omnibus 似然比检验

Omnibus Likelihood Ratio Tests(全模型似然比检验)是一种用于评估自变量对有序分类Logistic回归模型的整体显著性的方法。它通过比较包含所有自变量的完整模型与一个不包含任何自变量的空模型(即只包含截距项)之间的似然比来检验自变量的整体显著性。基本上,它在回答这个问题:“我们的模型是否比一个不包含任何预测变量的模型更好地拟合数据?”

Omnibus 检验结果如下:

在上面的输出中,我们看到了五个自变量(Sex、W.Hnd、Fold、Pulse和Clap)的Omnibus Likelihood Ratio Tests结果。这些结果包括以下信息:

  • χ²:似然比统计量(Likelihood Ratio Test statistic),用于比较完整模型和空模型。

  • df:自由度(degrees of freedom),等于该自变量的分类水平数减1。对于二分类自变量,自由度为1;对于多分类自变量,自由度等于水平数减1。

  • p-value:对应于似然比统计量的p值。如果p值小于预定显著性水平(例如0.05),我们可以拒绝零假设(即自变量对模型没有显著影响),认为自变量对模型具有显著性。

在这个例子中,我们可以看到:

  1. Sex:χ² = 1.6132,df = 1,p-value = 0.20404082。p值大于0.05,因此性别对模型的影响不显著。

  2. W.Hnd:χ² = 0.9068,df = 1,p-value = 0.34095942。p值大于0.05,因此惯用手对模型的影响不显著。

  3. Fold:χ² = 0.2778,df = 2,p-value = 0.87032579。p值大于0.05,因此fold对模型的影响不显著。

  4. Pulse:χ² = 5.2545,df = 1,p-value = 0.02189054。p值小于0.05,因此脉搏对模型的影响显著。

  5. Clap:χ² = 2.5596,df = 2,p-value = 0.27809340。p值大于0.05,因此clap对模型的影响不显著。

总之,Omnibus Likelihood Ratio Tests可以帮助我们评估每个自变量对有序分类Logistic回归模型的整体显著性,从而了解哪些自变量对模型具有显著影响。

10.28.10 阈值(Threshold)参数分析结果:

阈值结果显示有序分类Logistic回归模型的阈值参数估计。阈值参数是用于将模型的预测值(线性组合的结果)转换为概率,以便将观测值分类到有序类别中。在有序分类Logistic回归中,我们通常需要估计K-1个阈值参数,其中K表示因变量的类别数。这些阈值参数定义了模型中的切分点,用于将预测值转换为概率。

在这个例子中,我们有两个阈值参数:None | Some(无锻炼和少量锻炼之间的阈值)和Some | Freq(少量锻炼和频繁锻炼之间的阈值)。对于每个阈值参数,报告包括以下信息:

  1. Estimate:阈值参数的估计值。

  2. se:阈值参数估计值的标准误差。

  3. Z:Z统计量,是阈值参数估计值除以标准误差得到的值。

  4. p-value:对应于Z统计量的p值。如果p值小于预定显著性水平(例如0.05),我们可以拒绝零假设(即阈值参数为0),认为该阈值具有显著性。

  5. Odds ratio:表示阈值参数的比值。在这种情况下,它显示了跨越阈值时相对风险的变化。值大于1表示风险增加,值小于1表示风险减少。

在这个例子中,我们可以看到:

  1. None | Some 阈值:

    • Estimate:-4.38741

    • se:1.10460

    • Z:-3.972

    • p-value:<0.001,表示该阈值具有显著性。

    • Odds ratio:0.012,表示跨越这个阈值时,相对风险减少。

  2. Some | Freq 阈值:

    • Estimate:-1.94410

    • se:1.05862

    • Z:-1.836

    • p-value:0.066,表示该阈值的显著性较弱。

    • Odds ratio:0.143,表示跨越这个阈值时,相对风险减少。

总之,阈值结果报告帮助我们了解有序分类Logistic回归模型中的切分点,以便将预测值转换为概率并将观测值分类到有序类别中。同时,它们也可以帮助我们评估跨越阈值时相对风险的变化。

10.28.11 下载报告

点击下载word文件即可

10.29 无序分类 Logistic 回归(Y 为无序分类变量)

无序分类Logistic回归是一种统计方法,用于研究具有无序分类结果的因变量与一个或多个自变量之间的关系。与有序分类Logistic回归不同,无序分类Logistic回归并不考虑因变量类别之间的有序关系。这种方法在医学研究和其他领域中非常有用,特别是当因变量是分类的、并且分类之间没有明显的顺序关系时。

以下是一个医学研究中应用无序分类Logistic回归的例子:

假设我们要研究患者的年龄、性别和吸烟状况对心血管疾病类型的影响。心血管疾病类型可以分为冠状动脉疾病、心肌梗死、心脏瓣膜病等,这些类别之间没有明显的有序关系。我们的因变量是心血管疾病类型,自变量包括年龄、性别和吸烟状况。我们想要了解这些自变量对心血管疾病类型的影响。

MSTATA统计软件的无序分类Logistic回归模块提供了以下功能:

  1. 设置自变量:可以选择一个或多个自变量,例如年龄、性别和吸烟状况。

  2. 支持交互作用项:可以选择是否考虑自变量之间的交互作用。

  3. 设置分类自变量的参照水平:可以为分类自变量设置参照水平,以便进行比较。

  4. 展示回归系数:展示每个自变量的回归系数,反映其对因变量的影响程度。

  5. 展示OR值和可信区间:展示每个自变量的比值比(Odds Ratio,OR)和对应的置信区间,用于衡量自变量对因变量的相对影响。

  6. 模型拟合评价:包括Deviance、AIC、BIC、伪R²(pseudo-R²)、McFadden’s R²、Cox & Snell’s R²、Nagelkerke’s R²等指标,用于评估模型的拟合程度。

  7. 进行Omnibus似然比检验:检验模型中所有自变量的整体显著性。

  8. 无序分类的概率分析:展示每个因变量类别的概率,以及各个类别之间的相对关系。

  9. 生成估计边际平均概率统计图表:可以清晰地看到各自变量在模型中的作用效果。

  10. 导出Word格式的统计报告:将分析结果直接导出为Word文档,便于撰写报告和分享。这包括模型的系数、模型的拟合优度指标、OR值及其置信区间等关键信息。此外,报告中还会包含估计边际平均概率的统计图表,以便于直观地理解和解释模型的结果。

10.29.1 准备数据

首先务必按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

数据集遵循以下规则:

  • 每一行代表一个患者,这是准备数据的最重要前提。

  • 我们的因变量,即我们想要预测的变量是’Disease’,它是一个无序分类变量,表示患者的心血管疾病类型,有”Coronary Artery Disease”、“Myocardial Infarction”、“Valvular Heart Disease”、“Heart Failure”四种情况。

  • 自变量,也就是解释变量包括年龄(Age),性别(Sex),吸烟状态(Smoking),体重指数(BMI)和种族(Race)等。这些变量有连续性变量和分类变量两种类型:

  1. 连续性变量(值是连续数据,它可以在变量值所属区间内任意进行取值):在本数据集中,’Age’和’BMI’是连续性变量。’Age’表示患者的年龄,’BMI’表示患者的身体质量指数。

  2. 分类变量(是说明事物类别的一个名称,其取值是分类数据):在本数据集中,‘Sex’,’Smoking’和’Race’是分类变量。’Sex’表示患者的性别,其变量值为”Male”或”Female”;’Smoking’表示患者的吸烟状态,其变量值为”Non smoker”或”Smoker”;’Race’也是一个分类变量,其变量值可以为”Asian”、“Black”、“White”、“Hispanic”或”Other”。

理解这些概念非常重要,因为在后面的分析中,我们需要针对不同类型的变量进行不同的处理。

10.29.2 进入模块

顶部菜单选择 “按统计学分类模块” → “无序分类 Logistic 回归(Y 为无序分类变量)” 进入。

10.29.3 选择结局变量

选择无序分类变量作为应变量进行logistic回归。

10.29.4 选择解释变量(自变量)

根据提示选择自变量。这里要注意的是,如果上传的数据Excel文件里把连续性变量设置成了字符型,如年龄设置成了字符型,需要在前面”选择字段”功能里改回成numeric,如果按照分类变量放进影响因素分析。同理,如果把ID号也作为分类变量放进影响因素,也会出问题。

另外,在分类变量里,有些亚组人数很少,最好把它和其他亚组合并之后再传上来分析,亚组人数太少容易让可信区间特别宽,影响排版。当然,后续我们也会增加一个合并亚组的小工具。

10.29.5 选择交互作用

点开交互作用选项,点击增加交互作用项按钮,选定两个及以上变量即可生成交互作用项,如果要增加多个交互作用项,重复点击”增加交互作用项”按钮即可;如果选错了,点击重置清零即可。这个案例中我们不选交互作用。

10.29.6 设置分类变量的参照组

分类变量会被自动拆成哑变量处理,可以下拉选择参照水平。通常选临床默认的参照水平,也可以将样本量最大的亚组设置为参照水平,以增加统计分析效能。

10.29.7 Logistic回归结果展示选项

选择结果展示的表格外观:

可以选择是否显示回归系数的置信区间、是否显示OR值,是否显示OR值的置信区间,以及是否做似然比检验。

回归分析结果如下:

这个统计结果是一个多项式Logistic回归的输出结果,用于分析心血管疾病类型与年龄、性别和吸烟状态的关系。在多项式Logistic回归中,我们会选择一个参照类别,这里选择的是”Valvular Heart Disease”,然后其他的类别都会与这个参照类别进行比较。

以下是对表格中参数的解释:

  • Estimate: 这是回归系数,代表了当解释变量增加一个单位时,log odds的变化量。例如,在”Coronary Artery Disease - Valvular Heart Disease”中,年龄的Estimate值为0.01306,表示每增加一岁,患冠状动脉疾病相对于患心脏瓣膜病的log odds将增加0.01306。

  • SE: 这是标准误,衡量的是回归系数的不确定性。标准误越小,估计的准确度越高。

  • Z: 这是Z统计量,是回归系数除以其标准误的结果。在大样本中,Z统计量服从标准正态分布。

  • p-value: 这是Z统计量对应的p值。p值小于0.05通常被认为是统计显著的,这意味着我们拒绝零假设(解释变量对因变量没有影响),认为解释变量对因变量有影响。

  • OR (Odds Ratio): 这是比值比,表示当解释变量增加一个单位时,odds的倍数变化。例如,在”Coronary Artery Disease - Valvular Heart Disease”中,年龄的OR值为1.013,表示每增加一岁,患冠状动脉疾病相对于患心脏瓣膜病的odds将增加1.3%。

  • 95% CI Lower & 95% CI Upper: 这是回归系数的95%置信区间。如果置信区间包含0,那么我们通常认为这个回归系数不是统计显著的。

注意:以上解释是在所有其他变量不变的情况下进行的。另外,由于这是无序分类logistic回归,因此,不同类型疾病之间的比较(例如,冠状动脉疾病和心肌梗死之间的比较)可能没有意义。

似然比检验:

Omnibus Likelihood Ratio Tests 用于评估自变量对模型的贡献度。这个统计表中的每一行对应一个自变量。χ²值表示该自变量的似然比检验统计量,df是自由度,p-value是似然比检验的p值。

  • Age:这一行的结果显示,年龄这个自变量在模型中的影响不显著(p值=0.662,大于0.05)。这意味着,在控制其他因素的情况下,年龄对心脏病发病类型的影响不显著。

  • Sex:这一行的结果显示,性别这个自变量在模型中的影响不显著(p值=0.630,大于0.05)。这意味着,在控制其他因素的情况下,性别对心脏病发病类型的影响不显著。

  • Smoking:这一行的结果显示,吸烟状态这个自变量在模型中的影响不显著(p值=0.257,大于0.05)。这意味着,在控制其他因素的情况下,吸烟状态对心脏病发病类型的影响不显著。

    这个结果表明,在考虑其他变量的影响后,年龄、性别和吸烟状态在这个模型中对心脏病类型的预测并没有显著贡献。也就是说,我们不能确认这些变量对于预测心脏病类型具有显著的统计意义。

    需要注意的是,这并不意味着这些变量在实际中对心脏病类型没有影响。可能是由于样本数量不足、变量间的关系复杂或者存在其他未考虑到的混淆因素等原因,导致在这个模型中这些变量的影响没有达到统计显著水平。因此,在做出结论时需要综合考虑统计结果和实际情况。

10.29.8 模型拟合评价

选择模型拟合评价的参数:

在Logistic回归分析中,模型拟合优度评价是用于衡量模型与数据之间拟合程度的指标。以下介绍几种常见的Logistic回归模型拟合优度评价指标:

离差(Deviance):离差是基于似然比的一种度量,用于衡量拟合模型与完全拟合模型(即每个观测值都有一个独立参数)之间的差异。较小的离差值表示模型拟合较好。离差值本身无明确标准,通常用于模型间的比较。

AIC(Akaike Information Criterion):AIC是由赤池质量量提出的一种模型选择准则,用于衡量模型拟合优度和模型复杂度之间的平衡。AIC值越小,表示模型拟合较好。AIC主要用于比较不同模型的拟合优度。

计算公式:AIC = -2 * ln(似然比) + 2 * k

其中,k表示模型中参数的个数。

BIC(Bayesian Information Criterion):BIC与AIC类似,也是一种衡量模型拟合优度和模型复杂度之间的平衡的指标。与AIC相比,BIC对模型复杂度的惩罚更大。BIC值越小,表示模型拟合较好。BIC也主要用于比较不同模型的拟合优度。

计算公式:BIC = -2 * ln(似然比) + k * ln(n)

其中,k表示模型中参数的个数,n表示样本量。

伪R²(pseudo-R²):伪R²是Logistic回归中类似于线性回归中R²的指标,用于衡量模型解释力。伪R²的值介于0和1之间,值越接近1,表示模型解释力越强。常见的伪R²有McFadden’s R²、Cox & Snell’s R²和Nagelkerke’s R²。

1)McFadden’s R²:McFadden提出的伪R²,基于空模型(不包含任何自变量)与拟合模型的离差之比。

计算公式:McFadden’s R² = 1 - (拟合模型离差 / 空模型离差)

2)Cox & Snell’s R²:Cox和Snell提出的伪R²,基于空模型和拟合模型的似然比。

计算公式:Cox & Snell’s R² = 1 - (拟合模型似然 / 空模型似然)^(2/n)

其中,n表示样本量。

3)Nagelkerke’s R²:Nagelkerke对Cox & Snell’s R²进行了调整,使其最大值为1,因此在实际应用中更为常用。

计算公式:Nagelkerke’s R² = (Cox & Snell’s R²) / (1 - 空模型似然^(2/n))

其中,n表示样本量。

以上各个参数的定义、意义和评价方法在Logistic回归模型拟合优度评价中都起到了重要作用。在模型评估和选择时,我们需要综合考虑这些指标,以确保选出的模型具有较好的拟合优度和较低的复杂度。需要注意的是,这些指标并非绝对标准,而是用于在多个模型之间进行相对比较。在实际应用中,除了考虑这些指标,还应结合领域知识和研究目标进行模型选择和评估。

模型拟合评价结果如下:

10.29.9 进行估计边际平均值分析:

在统计学中,边际平均值(Estimated Marginal Means,EMM)有时也被称为预期平均值或调整平均值。在无序logistic回归中,EMM是当所有其他自变量被控制在其平均水平时,某一特定自变量取某一特定值的预期因变量平均值。

例如,假设我们在无序logistic回归模型中有年龄、性别和吸烟状态三个自变量,疾病类型是因变量。在计算EMM时,我们可能对男性(性别)的预期疾病类型进行估计,同时将年龄控制在所有样本的平均年龄,吸烟状态控制在样本的平均吸烟状态。这样我们就得到了在平均年龄和平均吸烟状态下,男性的预期疾病类型概率的平均值。

EMM的主要应用在于它可以帮助我们理解和解释一个复杂的统计模型。通过比较不同水平的EMM,我们可以了解不同条件下的预期结果。这在研究中非常有用,尤其是当我们关注的是多种因素同时影响结果时。

估计边际平均值(Estimated Marginal Means,EMM)分析结果如下:

以年龄为例:

这个表格提供了在三种不同年龄水平(平均年龄,平均年龄减去一个标准差,和平均年龄加上一个标准差)下,患有四种不同疾病(二尖瓣疾病,心肌梗塞,心力衰竭,和冠状动脉疾病)的估计边际概率。这个概率的含义是,在给定年龄的情况下,患者被诊断为某种疾病的概率。这里的”年龄”是一个连续变量,被设定为三个水平:平均值,平均值减去一个标准差,和平均值加上一个标准差。

对于每一种疾病和年龄组合,表格提供了以下信息:

  1. 概率(Probability):在给定年龄的情况下,被诊断为某种疾病的估计概率。例如,对于年龄为50.47129岁的人,被诊断为二尖瓣疾病的概率估计为0.269。

  2. 标准误(SE):概率估计的标准误,可以理解为概率估计的不确定性。标准误越小,估计的概率越精确。

  3. 95%置信区间(95% CI Lower,95% CI Upper):这个区间表示,真实的概率有95%的可能性落在这个区间内。例如,对于年龄为50.47129岁的人,被诊断为二尖瓣疾病的真实概率有95%的可能性在0.173到0.366之间。

这个表格可以帮助我们理解年龄如何影响患有不同疾病的概率。例如,从表格中我们可以看出,对于年龄在50.47129岁和69.35871岁之间的人,他们患有心肌梗塞的概率估计从0.299下降到0.231。这可能暗示年龄对患有心肌梗塞的风险有一定的影响。然而,要得出这个结论,我们还需要进一步的统计检验来确认年龄的效应是否显著。

10.29.10 下载报告

点击下载word文件即可

10.30 广义线性模型(非常强大,医学研究首选推荐)

广义线性模型是一类非常重要的统计模型,它广泛应用于各种科学研究领域。广义线性模型是线性模型的推广,它允许因变量服从任意指数分布族,通过引入链接函数来描述因变量与自变量之间的关系。这使得广义线性模型可以适用于更加广泛的情况,例如因变量是二项分布、泊松分布等情况。

例如,在医学研究中,我们可能关注某种疾病的发生率是否与特定的风险因素有关。此时,我们的因变量是二项分布(患病与否),自变量是风险因素(如年龄、性别、吸烟与否等),通过广义线性模型,我们可以有效地建立因变量与自变量之间的关系,从而探索特定风险因素对疾病发生的影响。

MSTATA是一款强大的统计软件,它提供了广义线性模型模块,可以用于估计具有类别和/或连续因变量和自变量的广义线性模型,还提供了各种选项来方便用户估计交互作用、简单斜率、简单效应等。

MSTATA可以估计多种线性模型,包括线性模型、泊松模型、超分散泊松模型、负二项模型、Logistic模型、Probit模型、序数模型(比例比模型)、多项式模型,以及可以自定义分布和链接函数的模型。

各个模型根据链接函数和因变量的分布来定义,从而可以模型不同类型的因变量。例如,线性模型使用身份链接函数和高斯分布,可以用于连续因变量的一般线性模型。

MSTATA支持的分布有:高斯分布、二项分布、伽马分布、逆高斯分布。支持的链接函数有:身份、对数、逆函数、逆平方函数。虽然软件不会检查分布/链接函数组合的合理性,但如果数据不符合选定的自定义模型,将会发出错误信息。

MSTATA支持的功能有:设置模型、设置分布、设置链接函数、设置交互作用、设置分类变量参照组、设置连续性变量转换和标化、设置Contrast分析编码、进行事后检验、多重比较P值调整、进行简单效应(Simple effect)分析、进行边际估计均值(LSmeans、事件发生概率等)分析、绘制统计图。

10.30.1 准备数据

首先务必按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

本样例数据的规则:

  1. 一个患者一行(这是准备数据最重要的前提)。

  2. 每个患者准备两大类数据,自变量和结局(应)变量,自变量和结局分别都可以有多个变量。

    如图所示,hospital, treatment, age, age2, sex, obstruct, prfor, adhear, differ, extent 为影响因素(自变量),而blood, effect, occurrence在本例中是结局变量。

  3. 自变量有两种,连续性变量(值是连续数据,它可以在变量值所属区间内任意进行取值,如年龄\[岁\]、血糖值、人的身高、智商等)以及分类变量(是说明事物类别的一个名称,其取值是分类数据。如”性别”就是一个分类变量,其变量值为”男”或”女”;“行业”也是一个分类变量,其变量值可以为”零售业”、“旅游业”、“汽车制造 业”等),在本例中 age是连续性变量(numeric), 其他的是分类变量(factor)。age单位为”岁”时为连续变量,而age2为年龄段分组,这时候为分类变量。

    以上概念很重要,后面有一个页面专门设置连续变量和分类变量。

  4. 结局变量在本工具中分为几类:

    • 连续型结局变量

      如本例中的blood(某血液检测指标)

    • 二分类结局变量

      如本例中的effect(疗效)为二分类变量(Good,Bad)

    • 计数型结局变量

      计数型的结局变量为一个非负的整数,如本例中occurrence,是急性发作次数,无法取负数,也不可能取小数。

10.30.2 进入模块

顶部菜单选择 “按统计学分类模块” → “广义线性模型(非常强大,医学研究首选推荐)” 进入。

10.30.3 广义线性模型分析

下一步就是分析啦:

步骤1:选择模型

您需要在”模型选择”框中选择一个统计模型。可选的模型包括线性模型、泊松模型、逻辑斯蒂模型等。如果您选择”自定义”,那么您将可以选择具体的”自定义家族”和”自定义链接函数”。

统计模型是描述变量间关系的数学方程。例如,线性模型假设因变量和自变量之间的关系是线性的;逻辑斯蒂模型常用于处理因变量为二分类的情况;泊松模型则常用于描述计数数据。

“自定义家族”和”自定义链接函数”让您可以选择更复杂的模型。例如,高斯分布(家族)和恒等链接函数(链接函数)构成的模型就是普通最小二乘回归模型。

步骤2:选择因变量

您需要在”请选择结局(应)变量”框中选择一个因变量。因变量也就是您希望通过模型来预测或解释的变量。

可供选择的因变量会根据您之前选择的模型类型自动调整。例如,对于二分类逻辑斯蒂模型,因变量应该是一个二分类变量。

步骤3:选择自变量

在”请点击空白框选择自变量/解释变量”框中,您需要选择一个或多个自变量,即您希望用来预测或解释因变量的变量。这些变量可以根据您的需要进行选择。

步骤4:选择参照类别

对于每一个分类自变量,您需要选择一个参照类别。在模型预测时,其它类别会与此参照类别进行比较。选择参照类别的界面是动态生成的,具体取决于您选择的自变量。

步骤5:选择对比(Contrast)分析的编码

您可能需要为分类自变量选择一种对比分析的编码方式,比如”简单(simple)“、”离差(deviation)“、”哑变量(dummy)“等。这决定了如何在数学模型中表示您的分类变量。

编码方式是统计分析中的重要概念。不同的编码方式会导致模型的解释方式有所不同,但并不会影响模型的预测能力。

步骤7:选择自变量的处理方式

对于连续的自变量,您需要选择一种处理方式,例如”不做处理”、“中心化处理(centered)”、“标准化处理(standardized)”或”进行Log变换”。

这些处理方式可以帮助改善模型的性能和稳定性,或者使模型的参数解释更加容易。例如,中心化可以使得自变量的平均值为0,标准化可以使得自变量的标准差为1,Log变换可以帮助处理右偏的数据。

步骤8:绘制统计图

  1. 选择横坐标变量:此处应选择您想要在图形中表示的水平轴的变量,例如性别。

  2. 选择区分线条的变量:选择此选项可以使您的折线图中的线条以不同的方式表示,例如表示不同的治疗方法。

  3. 选择分层图的变量:这是一个可选项,如果你有一个分层的变量(例如医院),你可以在这里选择它。

步骤8:简单效应(Simple effects)分析

  1. 选择 Simple Effects Variable:这是您想要检验其对因变量影响的主要自变量。这通常是您的模型中的主要关注点,您想要了解它如何影响因变量的变化。

  2. 选择 Moderator:调节变量是影响自变量和因变量关系强弱的一个变量。也就是说,它可能会改变自变量和因变量之间的关系。

  3. 选择 Breaking Variable:分割变量,也就是分层变量,用来将数据集分割成多个部分,以便于在不同的数据子集上进行独立的分析。

步骤9:事后检验(post-hoc tests)

指在收集和分析数据后进行的统计方法,用于比较多个研究组之间的差异。事后检验通常在全局性检验表明存在显著差异之后进行,以确定哪些具体组间比较存在显著差异。

步骤10:边际估计均值(Estimated Mariginal Means)分析

进行边际估计均值(Estimated Mariginal Means)分析:如果你希望进行边际估计均值分析(例如LSMeans等),你可以选中这个选项。

10.30.4 下载报告

点击下载word文件即可

10.31 单组患者生存分析(生存率、中位生存、四种生存曲线)

单组生存分析是一种统计学方法,用于研究生存数据中事件发生的时间和频率。它通常用于描述事件发生的速率、估计生存函数,主要关注单一样本中生存时间的描述性分析。在医学研究领域,单组生存分析常用于研究患者生存期和事件发生的概率,例如研究某种疾病患者的生存期。

以下是一个医学研究中应用单组生存分析的例子:

假设我们要研究某种癌症患者的生存期(时间)。我们可以收集患者的生存数据,包括每个患者的随访时间、是否发生了感兴趣的事件(如死亡)等。利用单组生存分析,我们可以估计患者的生存率及生存期。

在单组生存分析中,Kaplan-Meier(KM)法是一种广泛使用的非参数方法,用于估计生存数据的生存函数。KM法考虑了随访时间的不同长度和不同时间点的失访情况,提供了对生存率和生存期的准确估计。

软件中提供了以下功能:

  1. 设置时间变量的单位,如天、周、月、年:方便对生存时间进行度量。

  2. 选择统计图表中的时间单位,系统会自动转换:提供不同时间单位的图表展示。

  3. 计算平均生存期,中位生存期及其95% CI:提供生存期的估计和置信区间。

  4. 计算自定义的各时间点的生存率及其95% CI:可以根据研究需求,查询指定时间点的生存率。

  5. 支持生存曲线(Survival Plot):展示随时间推移的生存率变化。

  6. 累积事件曲线(Cumulative Events):展示随时间推移的累积事件发生数。

  7. 累积风险曲线(Cumulative Hazard):展示随时间推移的累积风险。

  8. KMunicate 曲线(KMunicate-Style Plot):一种直观的方式来展示生存曲线和生存时间的分布。

通过软件的单组生存分析功能,研究者可以更有效地描述和分析生存数据,为临床和公共卫生决策提供有力的依据。

10.31.1 准备数据

首先务必按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

在使用本软件进行单组生存分析之前,您需要准备包含两个关键变量的数据:时间变量(time)和生存状态变量(status)。这两个变量的详细说明如下:

  1. 生存状态变量(status):表示患者在研究结束时的生存状态。在本工具中,您可以为status设置任意标签,但为了简单明了,我们建议使用数字 0 或 1。具体而言:

    • 0 代表未观察到感兴趣事件发生(例如患者尚未死亡或失访)。

    • 1 代表已观察到感兴趣事件发生(例如患者死亡,并记录了死亡日期)。 在本软件中,您可以设定哪个标签代表发生事件,确保标签和实际含义相符。

  2. 时间变量(time):表示从研究开始日期到观察结束日期的时间差。研究开始日期的定义根据您的研究目的而定,例如随机对照研究通常以随机分组日期为开始,而观察性研究可以选择首次诊断日期或首次治疗日期等。关于time变量,请注意以下事项:

    • 当status为 1 时,观察结束日期为感兴趣事件发生(如死亡)的日期。

    • 当status为 0 时,观察结束日期为最后一次确认患者生存的日期(如研究结束日或随后一次随访日)。

总之,time是一个数值型变量,表示患者从研究开始到观察结束所经历的时间。例如,若time为56,status为1,则表示患者从研究开始到死亡共生活了56天;若time为56,status为0,则表示患者从研究开始到最后一次随访共生活了56天。time的单位可以是天、月或年,本软件可以在分析时进行转换。

在准备数据时,请确保为每个患者填写非负整数的 time 和相应的status标签。time 和 status均不能为空,否则将无法进行分析。若 time 或 status 的数值不确定或缺失,建议不要将该患者纳入数据库。

为了便于理解,我们还是建议在举例时使用 0和 1这样简单的数字标签。当然,在实际操作中,您可以根据自己的需求为status设置合适的标签,比如 “死亡”, “生存或未知(失访)”等标签,然后在软件里把死亡设置为发生事件。只要确保在本软件中正确设定标签含义即可。这将有助于用户更加灵活地应对不同的研究需求,并且更容易地理解和操作数据。

10.31.2 进入模块

顶部菜单选择 “按统计学分类模块” → “单组患者生存分析(生存率、中位生存、四种生存曲线)” 进入。

10.31.3 单组患者生存分析

下一步就是生存分析啦:

  1. 选择代表时间的变量(如从开始到死亡的时间,或从开始到末次随访时间)。

  2. 确定数据中的时间变量每个单位代表的时间长度(天、周、月或年)。

  3. 选择代表患者最终状态的变量(只能有两个取值,例如1代表发生事件,0代表删失,如1-死亡,0-存活或未知)。

  4. 选择结局变量的水平,以表示发生事件(建模时,选中的水平会设定为1,剩下的水平会设定为0)。

  5. 选择后续统计图表中的时间单位(天、周、月或年)。

  6. 设置统计表选项:输入需要在统计表中展示的生存率,用英文半角逗号隔开。

  7. 设置统计图选项:勾选需要绘制的图表类型(生存曲线、累积事件曲线、累积风险曲线、KMunicate曲线等),并设定图像的宽度和高度。

  8. 设定坐标轴的范围:设定横坐标(时间)的上限,以决定曲线完整显示还是部分显示;设定横坐标(时间)的每格单位刻度值。

  9. 设置额外图像选项:在图像上显示95%置信区间条带、风险人数表(Risk table)以及删失(censored)数据标记。

  10. 点击”开始进行单组生存分析”按钮,程序将根据设置的选项进行分析并生成结果。

请注意,正确设置图像选项(如横坐标上限和最小刻度)有助于让生存曲线显示完整且清晰。

10.31.4 下载报告

点击下载word文件即可

10.32 单组患者归因生存分析(全因死亡率和某种疾病死亡率)

全因生存分析是一种统计方法,主要用于研究从一项研究开始到感兴趣的事件(如死亡)发生的时间间隔。这种分析方法通常会考虑所有可能导致该事件的原因,因此被称为全因生存分析。

归因生存分析则是一种更细分的方法,主要关注由特定原因导致的事件发生的时间和频率。这种方法可以提供更具体的信息,例如,一个病人是由于其疾病导致死亡,还是由于其他非疾病相关的原因导致死亡。

这两种生存分析方法在医学研究中都非常重要。例如,在一个关于某种癌症的研究中,我们可能想要知道患者的整体生存期(全因生存分析),也可能对特定的死因,如由癌症直接导致的死亡(归因生存分析),更感兴趣。

考虑以下医学研究的例子:在一项研究中,研究人员关注某种癌症患者的生存时间。他们收集了患者的生存数据,包括每个患者的随访时间,以及患者是否发生了感兴趣的事件,例如死亡。通过全因生存分析,他们可以估计患者的整体生存时间和生存率。然后,他们可以使用归因生存分析,详细地查看死于癌症的患者的生存时间和生存率,以及由于其他原因导致的死亡的生存时间和生存率。

在进行全因和归因生存分析时,研究者通常需要收集大量的生存数据,包括生存时间,是否发生了感兴趣的事件,以及导致事件的具体原因等。这些数据通常会存在某些特定的模式,例如右偏分布(大多数人在短时间内发生事件,但有少数人会生存很长时间)、存在删失数据(一些参与者在研究结束前失联,导致其生存时间未知)等,这些都是生存数据的特点,需要在进行生存分析时予以考虑和处理。

例如,在全因生存分析中,由于要考虑所有可能的死因,所以往往需要更全面的数据收集和更复杂的数据处理。而在归因生存分析中,研究者需要更仔细地去查看和分析每个发生事件的具体原因,因此也需要更精细的数据处理和更高级的统计方法。

在处理生存数据时,统计软件如MSTATA可以提供大量的帮助。例如,MSTATA可以很方便地处理右偏分布的数据和删失数据,还可以自动进行生存期和生存率的估计,以及生成生存曲线等。此外,MSTATA还能够进行全因和归因生存分析,支持对多种事件结局的处理,如死于疾病(Died Of Disease, DOD)、死于其他原因(Died Of Other Causes, DOOC)、带病存活(Alive With Disease, AWD)和无病存活(Alive Without Disease, AWOD)。

利用MSTATA软件的全因和归因生存分析功能,研究者可以更有效地处理和分析生存数据,更深入地了解研究对象的生存状况,以及各种事件发生的可能性,从而为临床和公共卫生决策提供有力的依据。

以下是MSTATA在处理多事件结局时的一些主要功能:

  • 设置时间变量的单位,方便度量生存时间。

  • 在统计图表中选择时间单位,系统会自动转换。

  • 计算全因和归因的平均生存期、中位生存期以及它们的95%置信区间。

  • 计算自定义时间点的全因和归因生存率及其95%置信区间。

  • 生成全因和归因生存曲线,展示生存率随时间的变化。

  • 显示全因和归因的累积事件曲线,展示累积事件发生数随时间的变化。

  • 生成全因和归因的累积风险曲线,展示累积风险随时间的变化。

此外,MSTATA还提供了KMunicate-Style Plot,这是一种最先进的方式来展示生存曲线和生存时间的分布。

10.32.1 准备数据

首先务必按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

在使用MSTATA软件进行单组生存分析(归因死亡)之前,您需要准备包含两个关键变量的数据:时间变量(time)和生存结局变量(outcome)。这两个变量的详细说明如下:

生存结局变量(outcome):表示患者在研究结束时的生存结局。在本工具中,您可以为outcome设置任意标签,但为了清晰明了,我们建议使用如下标签:死于疾病(Died Of Disease, DOD)、死于其他原因(Died Of Other Causes, DOOC)、带病存活(Alive With Disease, AWD)和无病存活(Alive Without Disease, AWOD)。在MSTATA软件中,您可以设定哪个标签代表发生事件,确保标签和实际含义相符。

时间变量(time):表示从研究开始日期到观察结束日期的时间差。研究开始日期的定义根据您的研究目的而定,例如随机对照研究通常以随机分组日期为开始,而观察性研究可以选择首次诊断日期或首次治疗日期等。关于time变量,请注意以下事项:

当outcome为 DOD 或 DOOC 时,观察结束日期为死亡的日期。

当outcome为 AWD 或 AWOD 时,观察结束日期为最后一次确认患者生存的日期(如研究结束日或随后一次随访日)。

总之,time是一个数值型变量,表示患者从研究开始到观察结束所经历的时间。例如,若time为56,outcome为DOD,则表示患者从研究开始到死于疾病共生活了56天;若time为56,outcome为AWOD,则表示患者从研究开始到最后一次随访并确认无病存活共生活了56天。time的单位可以是天、月或年,MSTATA软件可以在分析时进行转换。

在准备数据时,请确保为每个患者填写非负数的 time 和相应的outcome标签。time 和 outcome均不能为空,否则将无法进行分析。若 time 或 outcome 的数值不确定或缺失,建议不要将该患者纳入数据库。

在实际操作中,您可以根据自己的需求为outcome设置合适的标签,然后在软件里设定对应的事件含义。只要确保在MSTATA软件中正确设定标签含义即可。这将有助于用户更加灵活地应对不同的研究需求,并且更容易地理解和操作数据。

10.32.2 进入模块

顶部菜单选择 “按统计学分类模块” → “单组患者归因生存分析(全因死亡率和某种疾病死亡率)” 进入。

10.32.3 单组患者生存分析

下一步就是生存分析啦:

  1. 选择时间变量:在菜单中找到一个下拉菜单,标签为”请选择代表时间的变量”。在这个下拉菜单中,你需要选择代表时间的变量。对于已死亡的患者,这应该是从疾病开始到死亡的时间差。对于尚未死亡或生死未知的患者,这应该是从疾病开始到最后一次随访(即最后一次确认该患者还活着)的时间差。

  2. 设定时间单位:在菜单中找到一个单选按钮,标签为”请告诉系统您数据中的时间变量每1个单位代表的时间长度”,你可以在这里选择时间变量的单位,选项包括”天”、“周”、“月”和”年”。

  3. 输入疾病名称:在菜单中找到一个文本框,标签为”请输入感兴趣的归因死亡疾病名称”,你需要在这里输入你关注的疾病的名称。

  4. 选择结局状态:在菜单中找到一个下拉菜单,标签为”请选择代表患者最终状态的变量”。在这个下拉菜单中,你需要选择代表患者最终状态的变量。这个变量可以有四个值,分别表示死于某种疾病(DOD),死于其他原因(DOOC),带病存活(AWD),无病存活(AWOD)。

  5. 选择DOD、DOOC、AWD、AWOD代表的值:在菜单中会有四个下拉菜单,标签分别为”请下拉选择结局变量的哪个水平表示死于某疾病”,“请下拉选择结局变量的哪个水平表示死于其他原因”,“请下拉选择结局变量的哪个水平表示带病生存”,“请下拉选择结局变量的哪个水平表示无病生存”。在这些下拉菜单中,你需要选择相应的值。

  6. 选择图表的时间单位:在菜单中找到一个单选按钮,标签为”请选择后续统计图表中的时间单位,系统会自动转换”,你可以在这里选择统计图表的时间单位。

  7. 设定统计表选项和统计图选项:在菜单中,你可以设定统计表的生存率、绘制生存曲线、累积事件曲线、累积风险曲线和KMunicate曲线的选项,以及设定图像的宽度和高度。你还可以设定坐标轴的范围,输入数字即可,时间单位默认为前面菜单中选定的输出单位,如年、月、日。

  8. 输入生存率:在菜单中找到一个文本框,标签为”请输入您需要在统计表中展示的生存率,用英文半角逗号隔开。“。在这里,你可以输入你想要显示在统计表中的生存率。

  9. 设定图像选项:在菜单中,你可以选择是否绘制生存曲线、累积事件曲线、累积风险曲线,以及KMunicate曲线。你还可以设定图像的宽度和高度。

  10. 设定坐标轴范围:在菜单中,你可以设定横坐标(时间)的上限(决定曲线完整显示还是部分显示)和横坐标(时间)的每格单位刻度值。

  11. 设定其他选项:在菜单中,你可以选择是否在图像上显示95%置信区间条带,是否显示风险人数表(Risk table),以及是否显示删失(censored)数据标记。

  12. 开始分析:在菜单的最下方,你可以看到一个按钮,标签为”开始进行单组生存分析”。点击这个按钮,就可以开始进行分析了。

10.32.4 下载报告

点击下载word文件即可

10.33 多组患者生存分析(Log-rank, Cox回归、事后检验、四种生存曲线)

多组生存分析是一种统计学方法,用于研究生存数据中事件发生的时间和频率,并在此基础上进行多组比较。相比于单组生存分析主要关注单一样本的生存时间描述性分析,多组生存分析能更深入地分析不同群体或不同条件下生存数据的差异。

以下是一个医学研究中应用多组生存分析的例子:

假设我们要研究某种癌症患者的生存期,同时也希望比较不同治疗方案的效果(生存时间)。我们可以收集患者的生存数据,包括每个患者的随访时间、治疗方案、是否发生了感兴趣的事件(如死亡)等。利用多组生存分析,我们可以比较不同治疗方案下患者的生存率和生存期。

在多组生存分析中,除了使用 Kaplan-Meier(KM)法估计生存函数,还可引入Log-rank和Cox回归模型来考虑影响生存时间的多个协变量,从而获取更全面的研究结果。

MSTATA统计软件中的多组生存分析模块提供了以下功能:

  • 设置时间变量的单位,如天、周、月、年:方便对生存时间进行度量。

  • 选择统计图表中的时间单位,系统会自动转换:提供不同时间单位的图表展示。

  • 选择分组因素(变量),如治疗方案、性别、年龄等:可以根据研究目的,选择不同的分组因素进行分析。

  • 进行Cox回归分析,计算风险比及其95% CI:提供对影响生存时间的协变量的估计和置信区间。

  • 进行事后检验,两两组间比较生存函数的差异:提供组间生存数据的比较结果。

  • 计算平均生存期,中位生存期及其95% CI:提供生存期的估计和置信区间。

  • 计算自定义的各时间点的生存率及其95% CI:可以根据研究需求,查询指定时间点的生存率。

  • 支持生存曲线(Survival Plot):展示随时间推移的生存率变化。

  • 累积事件曲线(Cumulative Events):展示随时间推移的累积事件发生数。

  • 累积风险曲线(Cumulative Hazard):展示随时间推移的累积风险。

  • KMunicate 曲线(KMunicate-Style Plot):一种直观的方式来展示生存曲线和生存时间的分布。

  • 提供组间生存曲线比较:在同一图表中展示各组的生存曲线,直观展示组间生存时间的差异。

    通过MSTATA软件的多组生存分析功能,研究者可以更全面地描述和分析生存数据,探索和比较不同条件下的生存率和生存期,从而为临床决策和公共卫生政策制定提供更为深入和全面的依据。

10.33.1 准备数据

首先务必按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

在使用MSTATA软件进行单组生存分析之前,您需要准备包含三个关键变量的数据:分组变量(treatment)、时间变量(time)和生存状态变量(status)。这两个变量的详细说明如下:

  1. 代表治疗分组的变量:例如上图中的treatment, 分成了Lev、Obs和Lev+5FU三个组

  2. 生存状态变量(status):表示患者在研究结束时的生存状态。在本工具中,您可以为status设置任意标签,但为了简单明了,我们建议使用数字 0 或 1。具体而言:

    • 0 代表未观察到感兴趣事件发生(例如患者尚未死亡或失访)。

    • 1 代表已观察到感兴趣事件发生(例如患者死亡,并记录了死亡日期)。 在MSTATA软件中,您可以设定哪个标签代表发生事件,确保标签和实际含义相符。

  3. 时间变量(time):表示从研究开始日期到观察结束日期的时间差。研究开始日期的定义根据您的研究目的而定,例如随机对照研究通常以随机分组日期为开始,而观察性研究可以选择首次诊断日期或首次治疗日期等。关于time变量,请注意以下事项:

    • 当status为 1 时,观察结束日期为感兴趣事件发生(如死亡)的日期。

    • 当status为 0 时,观察结束日期为最后一次确认患者生存的日期(如研究结束日或随后一次随访日)。

总之,time是一个数值型变量,表示患者从研究开始到观察结束所经历的时间。例如,若time为56,status为1,则表示患者从研究开始到死亡共生活了56天;若time为56,status为0,则表示患者从研究开始到最后一次随访共生活了56天。time的单位可以是天、月或年,MSTATA软件可以在分析时进行转换。

在准备数据时,请确保为每个患者填写非负整数的 time 和相应的status标签。time 和 status均不能为空,否则将无法进行分析。若 time 或 status 的数值不确定或缺失,建议不要将该患者纳入数据库。

为了便于理解,我们还是建议在举例时使用 0和 1这样简单的数字标签。当然,在实际操作中,您可以根据自己的需求为status设置合适的标签,比如 “死亡”, “生存或未知(失访)”等标签,然后在软件里把死亡设置为发生事件。只要确保在MSTATA软件中正确设定标签含义即可。这将有助于用户更加灵活地应对不同的研究需求,并且更容易地理解和操作数据。

10.33.2 进入模块

顶部菜单选择 “按统计学分类模块” → “多组患者生存分析(Log-rank, Cox回归、事后检验、四种生存曲线)” 进入。

10.33.3 多组患者生存分析

在MSTATA中进行多组生存分析的步骤如下:

  1. 选择代表患者分组的字段:在主界面中,选择分组字段的下拉菜单。例如,如果您正在研究不同治疗方法的效果,您可能会选择”治疗方法”这一字段。如果您希望分组的字段不在列表中,请返回并将其设置为因子类型。

  2. 选择事前比较的参照组:在参照组下拉菜单中,选择您希望作为比较基准的组别。

  3. 选择代表时间的变量:在时间变量的下拉菜单中,选择代表时间的变量。此时间变量应包括已死亡的患者从开始到死亡的时间差值,和未死亡的/生死未知的患者从开始到末次随访(最后一次活着)时间差值。如果您只有开始和结束的日期变量,没有时间变量,您需要在MSTATA的”生存数据预处理”模块计算时间差值。

  4. 设定时间变量的单位:告诉系统您的时间变量每一个单位代表的时间长度,例如天、周、月或年。

  5. 选择代表患者最终状态的变量:选择代表患者最终状态的变量,这个变量只能有两个取值,例如1代表发生事件,0代表删失。如果您需要的变量不在列表中,检查原始数据看是否只有两个取值。

  6. 选择结局变量的发生事件水平:选择结局变量的哪个水平代表发生事件,系统会在建模时将此级别设定为1,其余级别设定为0。

  7. 选择统计图表中的时间单位:系统会自动转换时间单位,例如,可以选择将所有的时间单位转换为年,即1年=365.25天。

  8. 设定统计表选项:您可以输入需要在统计表中展示的生存率,使用英文半角逗号隔开。例如,如果您需要展示1年,3年,5年的生存率,可以输入”1, 3, 5”。

  9. 设定组间两两比较的选项:可以选择进行事后检验(两两组间比较,有三组及以上时有效),并选择多重比较P值调整方法。

  10. 设定统计图选项:您可以选择是否绘制生存曲线(Survival Plot)、累积事件曲线(Cumulative Events)、累积风险曲线(Cumulative Hazard)和KMunicate曲线(KMunicate-Style Plot)。您还可以选择是否在图像中显示Log-rank P值,并设定图像的尺寸。

  11. 设定坐标轴的范围:您需要设定横坐标(时间)的上限和单位刻度值。横坐标上限决定了曲线完整显示还是部分显示。设定合适的横坐标上限,可以让生存曲线显示完整,选择合适的最小刻度,才能让图像X轴不堆叠,显示清晰。

  12. 设定图像的其他选项:您可以选择在图像上显示95%置信区间条带,显示风险人数表(Risk table),显示删失(censored)数据标记。

    以上就是在MSTATA中进行多组生存分析的步骤。这些步骤适用于多种生存分析场景,包括临床试验和观察性研究。每个步骤都可以根据研究的特定需求进行定制。

    对上述分析所用统计方法的解释:

    1. Kaplan-Meier法:Kaplan-Meier法(也称生存分析或产品限制方法)是一种用于估计在给定时间点生存概率的非参数统计方法。它在处理”删失”数据(即,一些研究对象在研究结束时仍然存活,我们不知道他们之后何时会发生事件)方面特别有用。KM生存曲线图是一种常见的可视化方法,用来表示生存数据。

    2. Log-rank法:Log-rank检验是一种用于比较两个或更多生存曲线的统计方法。它是一种非参数检验,用于测试不同组之间生存时间的差异是否显著。例如,您可能想比较不同治疗方法的患者生存时间。Log-rank检验的结果是一个P值,如果P值小于您设定的显著性水平(通常为0.05),那么您就可以拒绝零假设(即,所有组的生存时间相同),认为组间的生存时间有显著差异。

    3. Cox回归:Cox回归(也称比例风险模型)是一种用于探索生存时间与一个或多个预测变量(也称协变量)之间关系的统计方法。Cox回归的结果通常表示为风险比(HR),这是一个衡量协变量对生存时间影响程度的指标。例如,如果一个治疗方法的风险比是0.5,那么这意味着接受这种治疗的患者死亡的风险是对照组的一半。

    4. 事后两两比较:当我们比较三个或更多的组时,总体比较可能是显著的,但我们可能还想知道哪些具体的组间比较是显著的。这就需要进行事后两两比较。MSTATA软件做两两比较,后台用的是R的survminer包中的pairwise_survdiff函数,它基于Log-rank检验。注意,由于进行了多重比较,所以我们需要进行P值的调整,以控制第一类错误(错误地拒绝了真的零假设)的概率。这可以使用多种方法,如Bonferroni校正,Holm校正等。

    以上就是这些统计方法的基本介绍。在解读这些方法的结果时,一定要考虑到您的研究背景和目标。例如,Cox回归的风险比需要在疾病背景和治疗影响的环境下解读。同时,也要谨慎处理统计显著性和实际(临床)显著性之间的区别。仅仅因为结果在统计上是显著的,并不一定意味着在实际中它就有重要的意义。例如,如果两种治疗方法之间的生存时间差异只有几天,那么即使统计检验结果显著,这种差异在临床上也可能并不重要。

    以下是一些基本的解读建议:

    • Kaplan-Meier曲线:这是生存分析最常见的图形表示。每个曲线代表一个组,Y轴通常表示生存概率,X轴表示时间。曲线的下降表示事件的发生(例如,患者死亡)。如果一条曲线在另一条之上,那么在整个时间范围内,该组的生存概率较高。

    • Log-rank检验:如果P值小于0.05,那么我们通常会认为生存曲线之间存在显著差异。但是,这并不能告诉我们哪个组更好,也不能量化差异的大小。为此,我们需要查看生存曲线或进行其他类型的分析(例如,Cox回归)。

    • Cox回归:这种方法的结果通常会给出每个协变量的风险比,以及相应的95%置信区间和P值。风险比大于1表示该协变量增加了事件发生的风险,而小于1则表示降低了风险。置信区间可以告诉我们结果的不确定性,如果它包括1,那么结果就不是统计显著的。

    • 事后两两比较:这些比较的结果通常会给出每对组之间的P值,这些P值通常会经过调整,以考虑多重比较的问题。如果调整后的P值小于0.05,我们通常会认为那一对比较是显著的。但是,和Log-rank检验一样,这并不能告诉我们差异的大小或方向。对此,我们需要查看生存曲线或风险比。

    请注意,以上解释并不能涵盖所有可能的场景和结果,所以在解读您自己的结果时,可能需要进一步的专业知识和理解。

10.33.4 下载报告

点击下载word文件即可

10.34 多因素生存分析(包括调整协变量后的生存曲线)

多因素生存分析是一种统计学方法,它可以研究多个因素如何影响事件的发生时间和频率。在临床研究中,这种方法常常被用于研究多个协变量对患者生存时间的影响,例如年龄、性别、治疗方法等。

Cox回归分析是多因素生存分析的一种常用方法,它能够计算每个协变量对生存时间的影响,这种影响常常以风险比(hazard ratio)的形式呈现。在此基础上,我们可以绘制森林图,直观地展示每个协变量的风险比以及其95%置信区间。在森林图中,如果95%置信区间不包含1,那么就说明这个协变量对生存时间有显著影响。

此外,我们还可以生成调整协变量的多因素生存曲线。这种曲线考虑了所有协变量的影响,展示了在控制了其他协变量的影响后,某个特定协变量的不同取值对生存时间的影响。例如,我们可以生成不同年龄组的调整后的生存曲线,来比较不同年龄组的患者的预期生存时间。

MSTATA统计软件为多因素生存分析提供了全面的工具和函数,包括多因素Cox回归分析、生成单因素和多因素森林图,以及调整协变量的多因素生存曲线等功能。这些功能使得研究人员能够方便地进行多因素生存分析,从而更深入地理解各个因素如何影响生存时间。

10.34.1 准备数据

首先务必按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

在使用MSTATA软件进行单组生存分析之前,您需要准备包含三个关键变量的数据:分组变量(treatment)、时间变量(time)和生存状态变量(status)。这两个变量的详细说明如下:

  1. 生存状态变量(status):表示患者在研究结束时的生存状态。在本工具中,您可以为status设置任意标签,但为了简单明了,我们建议使用数字 0 或 1。具体而言:

    • 0 代表未观察到感兴趣事件发生(例如患者尚未死亡或失访)。

    • 1 代表已观察到感兴趣事件发生(例如患者死亡,并记录了死亡日期)。 在MSTATA软件中,您可以设定哪个标签代表发生事件,确保标签和实际含义相符。

  2. 时间变量(time):表示从研究开始日期到观察结束日期的时间差。研究开始日期的定义根据您的研究目的而定,例如随机对照研究通常以随机分组日期为开始,而观察性研究可以选择首次诊断日期或首次治疗日期等。关于time变量,请注意以下事项:

    • 当status为 1 时,观察结束日期为感兴趣事件发生(如死亡)的日期。

    • 当status为 0 时,观察结束日期为最后一次确认患者生存的日期(如研究结束日或随后一次随访日)。

  3. 自变量/解释变量,包括性别、年龄、代表治疗分组的变量:例如上图中的treatment, 分成了Lev、Obs和Lev+5FU三个组以及其他协变量

总之,time是一个数值型变量,表示患者从研究开始到观察结束所经历的时间。例如,若time为56,status为1,则表示患者从研究开始到死亡共生活了56天;若time为56,status为0,则表示患者从研究开始到最后一次随访共生活了56天。time的单位可以是天、月或年,MSTATA软件可以在分析时进行转换。

在准备数据时,请确保为每个患者填写非负整数的 time 和相应的status标签。time 和 status均不能为空,否则将无法进行分析。若 time 或 status 的数值不确定或缺失,建议不要将该患者纳入数据库。

为了便于理解,我们还是建议在举例时使用 0和 1这样简单的数字标签。当然,在实际操作中,您可以根据自己的需求为status设置合适的标签,比如 “死亡”, “生存或未知(失访)”等标签,然后在软件里把死亡设置为发生事件。只要确保在MSTATA软件中正确设定标签含义即可。这将有助于用户更加灵活地应对不同的研究需求,并且更容易地理解和操作数据。

10.34.2 进入模块

顶部菜单选择 “按统计学分类模块” → “多因素生存分析(包括调整协变量后的生存曲线)” 进入。

10.34.3 多因素生存分析

步骤1:选择时间变量

  • 在 “请选择代表时间的变量” 的下拉菜单中选择一个适当的变量。这个变量应该代表已死亡的患者从开始到死亡的时间差值,或者未死亡的/生死未知的患者从开始到末次随访的时间差值。如果您的数据中没有这样的时间变量,只有开始和结束的日期变量,您可以使用 MSTATA 的”生存数据预处理”模块来计算时间差值。

步骤2:选择状态变量

  • 在 “请选择代表患者最终状态的变量” 的下拉菜单中选择一个适当的变量。这个变量应该只有两个取值,例如 1 代表发生事件,0 代表删失,如1-死亡,0-存活或未知。

步骤3:选择结局变量

  • 在 “请下拉选择结局变量的哪个水平表示发生事件” 的下拉菜单中选择一个适当的水平。请注意不要选择错误的水平,因为选中的水平在建模时系统会设定为1,剩下的水平会设定为0。

步骤4:设置时间单位

  • 在 “请告诉系统您数据中的时间变量每1个单位代表的时间长度” 和 “请选择后续统计图表中的时间单位,系统会自动转换” 中,选择适当的时间单位。

步骤5:选择解释变量

  • 在 “请点击空白框选择纳入模型的解释变量/自变量” 的下拉菜单中选择一个或多个适当的解释变量。这些变量可以是连续的,也可以是分类的。

步骤6:对数值型变量进行处理

  • 在 “对数值型变量进行转换处理” 中,选择是否要将取值范围较少的数值型变量自动转换为分类变量。

步骤7:调整小数位数

  • 使用滑块调整效应量的小数位数和 P 值的小数位数。

步骤8:生成影响因素分析表

  • 点击 “生成/更新影响因素分析表” 按钮。

步骤9:生成森林图

  • 点击 “生成/更新森林图” 按钮。

步骤10:绘制生存曲线

  • 在 “如何进行生存曲线的绘制” 中,选择是按整体人群绘制曲线,还是分组绘制曲线。如果选择分组绘制曲线,还需要选择代表患者分组的字段。

  • 设置图像的宽度和高度。

下面是对调整协变量的多因素生存曲线方法学的解释:

在使用MSTATA的过程中,我们主要使用的是基于R的survminer包中的ggadjustedcurves函数来生成调整后的生存曲线。这个函数是基于Cox比例风险模型(Cox Proportional Hazards Model)来计算和绘制调整后的生存曲线。其主要的理念是为了展示基于Cox模型计算的各个亚群体的预期生存曲线。在Terry Therneau, Cynthia Crowson, Elizabeth Atkinson (2015)的论文’Adjusted Survival Curves’中有关于调整曲线的非常详细的描述和有趣的讨论。该函数目前实现了四种方法:两种非均衡方法,一种条件方法和一种边际方法。

  1. “单一”方法 (“single”):在这种方法下,计算并绘制一个单一的生存曲线,该曲线表示基于Cox模型拟合的全体人群数据计算的预期生存率。

  2. “平均”方法 (“average”):在这种方法下,根据作为变量列表的每一级别,分别计算并绘制一个生存曲线。如果未指定此参数,则会从fit参数的分层组件中提取。每条曲线表示基于Cox模型拟合的数据亚群体的预期生存率。值得注意的是,这种方法下,亚群体并未被平衡。

  3. “边际”方法 (“marginal”):此方法将根据由变量参数选择的分组变量的每个级别绘制一个生存曲线。如果未指定此参数,则会从fit对象的分层组件中提取。子群体将根据fit公式中的变量进行平衡,以使分布类似于参考群体中的分布。如果未指定参考群体,则将整个数据作为参考群体。平衡是以以下方式进行的:(1)对于每个子群体,创建一个逻辑回归模型,模型模拟了考虑fit对象中列出的其他变量后,子群体与参考群体之间的几率,(2)使用到指定子群体的反向概率作为Cox模型的权重,(3)考虑权重的影响,重新拟合Cox模型,(4)根据重新拟合的加权模型,计算每个子群体的预期生存曲线。

  4. “条件”方法 (“conditional”):此方法将对由变量参数选择的分组变量的每个级别绘制一个生存曲线。如果未指定此参数,则会从fit对象的分层组件中提取。平衡子群体的方式是:(1)数据复制的次数与考虑的子群体的数量相同(即k),(2)对于原始数据中的每一行,创建k个副本,并为每个副本分配一个不同的分组变量值,这将创建一个新的在分组变量方面平衡的数据集,(3)根据新的人工数据集,计算每个子群体的预期生存。在这里,模型拟合不会重新进行。

    这四种方法都以各自的方式解决了协变量的调整问题,从而提供了更准确的生存曲线预测。选择哪种方法取决于具体的研究目的和数据的特性。不同的方法会给出不同的预期生存曲线,这反映了协变量如何影响生存时间的不同假设。

    综上所述,MSTATA通过提供上述四种基于Cox比例风险模型的方法,使用户能够根据他们的具体需求和数据特性选择最适合的方法进行生存曲线的调整。同时,这些方法也使得生存曲线的结果更具有可解释性,可以更清晰地理解协变量如何影响生存时间。

10.34.4 下载报告

点击下载word文件即可

10.35 线性混合效应模型(连续结局)

10.35.1 模块功能

本模块用于在存在群组聚集、层级结构或重复观测的数据中,完成连续型结局的线性混合效应模型分析。它适合处理普通线性回归无法直接处理的“同一患者多次记录”“同一中心患者更相似”“同一医生或医院下观测值相关”等问题。

在临床研究中,最常见的使用场景是连续结局的重复测量疗效研究、多中心研究以及层级数据。例如一项药物随机对照试验在基线、第 4 周、第 8 周和第 12 周反复记录 Outcome,每位受试者贡献多行数据;此时不能把所有行都当作彼此独立,通常需要把 Subject 放入随机效应结构。

换句话说,当研究者已经确定:

  • 结局变量 Y 是连续型变量,例如量表评分、实验室指标、血压、肿瘤大小或肺功能指标;
  • 核心自变量、治疗分组、随访时间、交互项或调整协变量已经明确;
  • 数据中存在患者 ID、中心、医院、医生、地区、家庭等群组变量;
  • 需要同时报告固定效应、随机效应、模型拟合、事后比较、边际估计均值、统计图和诊断图;
  • 需要下载当前分析的 Word 报告;

就可以使用本模块建立线性混合效应模型,并生成适合论文初步整理的表格和图形。

本模块与普通线性回归、t 检验或重复测量方差分析不同。普通线性回归默认每一行观测相互独立;重复测量方差分析通常对数据结构和缺失值更敏感;线性混合效应模型可以把固定效应和随机效应放在同一个模型中,更灵活地处理长格式重复测量、多中心聚集和多水平结构。

10.35.2 适用场景

本模块适合以下问题:

  1. 连续型结局在同一患者内有多次测量;
  2. 多中心研究中,患者嵌套在医院、中心或地区内;
  3. 研究者需要估计治疗组、时间、治疗组 × 时间交互等固定效应;
  4. 研究者希望用随机截距处理不同患者或中心的基线水平差异;
  5. 研究者希望用随机斜率处理不同患者或中心的时间趋势差异;
  6. 需要在调整协变量后输出边际估计均值、事后比较和预测图。

典型应用包括:

  • 比较不同治疗组在多个随访时间点的连续评分变化;
  • 多中心临床试验中,调整中心或患者内相关性;
  • 同一患者在多次访视中记录血压、HbA1c、肺功能、疼痛评分或量表总分;
  • 患者嵌套在医院内,医院又嵌套在城市或地区内;
  • 允许不同患者拥有不同基线水平,或允许不同患者随时间变化的斜率不同;
  • 在模型结果中报告固定效应、随机效应方差、边际估计均值和预测趋势图。

重复测量连续结局例子:一项随机对照试验比较新药、低剂量和对照组,在第 0、4、8、12 周记录连续量表评分。TreatmentTimeTreatment × Time 是固定效应,因为研究者需要直接解释治疗组是否不同、评分是否随时间改变、治疗组随时间变化是否不同;Subject 是随机效应,因为同一受试者的多次评分更相似。

不建议用于以下情况:

  • 结局变量是二分类、计数、有序等级或无序多分类结局;
  • 数据没有任何聚集、中心、医生、家庭或重复测量结构;
  • 每个随机效应群组只有一条观测,模型无法学习组内相关性;
  • 群组水平太少,却希望精确解释随机效应方差;
  • 随机斜率、嵌套结构、交叉结构和多重交互项同时加入,但样本量不足;
  • 只是想做普通亚组分析,而不是建立含随机效应的模型。

10.35.3 支持的分析内容

本模块支持以下模型和结果内容:

  • 连续型结局的线性混合效应模型;
  • 固定效应主效应和二阶交互项;
  • 随机截距和随机斜率;
  • 随机效应相关结构:允许相关、不相关或按区块相关;
  • REML 和 ML 估计;
  • Satterthwaite 和 Kenward-Roger 自由度方法;
  • Identity、Compound Symmetry、Unstructured、AR(1) 和 ARMA(1,1) 残差相关结构;
  • 固定效应参数估计、置信区间和 Omnibus 检验;
  • 随机效应方差成分、随机效应似然比检验和模型拟合指标;
  • Contrast 对比编码、Post-hoc 事后比较和多重比较校正;
  • Estimated Marginal Means / LSMeans;
  • Simple effects 简单效应分析;
  • 连续变量中心化、标准化、按 cluster 中心化和按 cluster 标准化;
  • 模型预测图、残差 Q-Q 图、残差-预测值图等诊断图;
  • Word 报告下载。

10.35.4 主要特点

  • 左侧面板按变量、随机效应、估计方法、对比、边际均值和绘图选项分区;
  • 自动识别连续结局、分类固定效应、连续协变量和群组变量;
  • 固定效应模型项支持主效应和二阶交互项;
  • 随机效应候选项可包含随机截距和固定效应随机斜率;
  • 支持 REML/ML、自由度方法、残差相关结构和连续变量尺度转换;
  • 主要 flextable 表格通过 viptest 专用表格描述模块渲染,提供中文和英文表格描述按钮;
  • 统计图通过专用图形描述模块展示,并支持下载 PNG、TIFF、SVG 和 PDF 图像;
  • Word 报告页面独立排版,可导出当前模型的表格、图形和报告内容。

本模块用于完成线性混合效应模型分析。用户不需要手写公式,但需要正确指定连续结局、固定效应、群组变量、随机效应和必要的模型选项。

10.35.5 支持的结局类型和模型

结局类型 模型选择 常见报告内容 典型用途
连续型结局 Linear Mixed Model 均值差、回归系数、置信区间 量表评分、血压、HbA1c、肺功能、实验室指标
连续型重复测量结局 LMM + 患者随机效应 时间效应、组别效应、组别 × 时间交互 多访视疗效评价
多中心连续结局 LMM + 中心随机效应 固定效应、中心间变异、模型拟合 多中心临床研究
层级或聚集数据 LMM + 嵌套或平行随机效应 群组间变异、随机截距/斜率 患者-医院-地区结构

模型选择应由结局变量和数据结构决定。二分类、计数、有序等级或无序多分类结局不应强行放入本模块;这些结局更适合使用广义线性混合效应模型。

10.35.6 生成的表格和图形

一键自动生成以下表格和图形:

本模块结果分布在“模型整体参数”“线性混合效应模型结果”“Post-hoc 和边际均值”“Simple effect 结果”和“统计图和诊断图”几个标签页中。按照左侧选项不同,主分析标签页会生成固定效应参数、固定效应 Omnibus 检验、随机效应方差成分、随机效应似然比检验和 contrast coding 等结果。

1. 模型整体参数和拟合评价表

用于复核模型类型、模型公式、分布、估计方法、自由度方法、样本量、收敛状态和置信区间算法。

线性混合效应模型:模型整体参数表
线性混合效应模型:模型整体参数表

2. 模型解释度表

展示 Conditional R2 和 Marginal R2。前者包含固定效应和随机效应解释的变异,后者主要反映固定效应部分的解释度。

线性混合效应模型:模型解释度表
线性混合效应模型:模型解释度表

3. 固定效应参数估计表

展示固定效应的回归系数、标准误、置信区间、自由度、t 值和 P 值。连续结局中,系数通常解释为结局均值在当前模型尺度上的变化。

线性混合效应模型:固定效应参数估计表
线性混合效应模型:固定效应参数估计表

4. 固定效应 Omnibus 检验表

用于检验某个固定效应模型项整体是否有统计学证据,例如治疗组、时间或治疗组 × 时间交互是否对连续结局有贡献。

线性混合效应模型:固定效应 Omnibus 检验表
线性混合效应模型:固定效应 Omnibus 检验表

5. 随机效应方差成分表

展示随机截距、随机斜率、残差方差、标准差、ICC 和群组数量等信息,用于说明聚集或重复测量结构带来的变异。

线性混合效应模型:随机效应方差成分表
线性混合效应模型:随机效应方差成分表

6. 随机效应似然比检验表

勾选随机效应 LRT 后生成,用于比较加入随机效应后模型拟合是否改善。该结果需要结合研究设计、群组数量和模型稳定性谨慎解释。

线性混合效应模型:随机效应似然比检验表
线性混合效应模型:随机效应似然比检验表

7. Contrast coding 表

勾选 contrast coding 后生成,用于展示分类变量各水平在当前对比编码下如何进入模型。

线性混合效应模型:Contrast coding 表
线性混合效应模型:Contrast coding 表

8. Post-hoc 事后比较表

勾选 post-hoc 后生成,用于多水平分类变量的两两比较,并显示未校正和校正后的 P 值。

线性混合效应模型:Post-hoc 事后比较表
线性混合效应模型:Post-hoc 事后比较表

9. Estimated Marginal Means 表

边际估计均值用于把模型结果转换为更容易展示的组别均值、时间均值或组别 × 时间组合均值。

线性混合效应模型:边际估计均值表
线性混合效应模型:边际估计均值表

10. 统计图和诊断图

勾选绘制统计图后,模块可根据横坐标变量、区分线条变量和分层变量生成模型预测图;勾选诊断选项后,可输出残差 Q-Q 图、残差-预测值图等诊断图。

线性混合效应模型:模型预测图
线性混合效应模型:模型预测图
线性混合效应模型:残差 Q-Q 诊断图
线性混合效应模型:残差 Q-Q 诊断图

本节只展示统计表和统计图本体,不展示浏览器边框、完整左侧菜单或下载控件。不同模型和不同菜单设置会显示不同结果块;没有勾选、当前模型不适用或当前模型不可估计的内容不会强行显示。

10.35.7 背景介绍

线性混合效应模型可以理解为“线性模型 + 随机效应”。线性模型部分用于估计研究者关心的固定效应,例如治疗组、时间、组别 × 时间交互和协变量;随机效应部分用于处理观测值之间的相关性,例如同一患者多次记录、同一中心患者更相似或同一医生治疗的患者更接近。

固定效应是研究者希望在论文中直接解释的因素。临床试验中常见固定效应包括治疗组、随访时间、治疗组 × 时间交互、基线评分、年龄、性别和疾病严重程度。

随机效应用于告诉模型哪些观测天然更相似。重复测量研究中,同一患者的多次观测共享个体基础水平,因此 Subject 常作为随机截距;如果研究者认为不同患者随时间变化的趋势也可能不同,并且每位患者有足够多时间点,可考虑 Time | Subject 这样的随机斜率。

在医学研究中,最常见的两类结构是:

  • 多水平/聚集数据:患者来自不同医院、城市、医生或研究中心;
  • 重复观测数据:同一患者有多次访视记录,同一患者内部的观测不是独立样本。

如果忽略这种相关性,把所有行都当作独立观测,标准误可能偏小,P 值可能过于乐观。LMM 的作用就是在估计固定效应的同时,通过随机效应处理群组或重复观测结构。

多中心 + 重复测量例子:一项 12 个中心参加的连续评分疗效试验,每位患者在 4 个访视时间点记录评分。固定效应可以是 TreatmentVisitTreatment × Visit 和基线评分;随机效应可以包括 Intercept | Center 处理中心差异,以及 Intercept | Subject 处理同一患者多次记录的相关性。

不要把“想调整的变量”都放进随机效应。治疗组、时间、年龄、性别、基线评分通常是固定效应;患者 ID、中心、医院、医生这类代表聚集或重复观测来源的变量,才可能作为随机效应。

10.35.8 数据准备要求

进入模块前,建议先整理好以下内容:

  1. 每一行是一条观测记录。若同一患者有多次随访,则同一患者应出现多行;
  2. 结局变量必须是连续型变量,并且应设置为 numeric;
  3. 重复测量研究应有患者 ID 变量,例如 SubjectPatientID
  4. 应有访视或时间变量,例如 VisitWeekMonth 或连续时间;
  5. 固定效应变量可以是分类变量或连续变量,例如治疗组、时间、年龄、性别、基线评分;
  6. 随机效应群组变量应代表真实聚集结构,例如患者、中心、医院、医生、家庭或地区;
  7. 每个随机效应群组最好有足够重复观测;
  8. 分类变量水平不要过多且过稀疏,否则模型可能不稳定;
  9. 缺失值应在分析前确认来源和模式。

重复测量连续结局推荐整理成长格式:同一名患者在第 0、4、8、12 周各占一行,Subject 四行相同,Time 分别为 0、4、8、12,Outcome 记录每次访视的连续结局。这样模型才能同时看到“患者内重复”和“时间变化”。

10.35.9 进入模块

顶部菜单选择 “按统计学分类模块” → “混合效应模型/多水平模型” → “线性混合效应模型” 进入。

10.35.10 使用步骤

左侧面板按正式建模流程排列。建议从上到下设置,不要跳着选。下面的截图是菜单设置示例,和前面“生成的表格和图形”中的结果截图分开展示。

线性混合效应模型:结局变量、固定效应和模型项菜单
线性混合效应模型:结局变量、固定效应和模型项菜单

第一步,选择连续型结局变量。

结局变量是要解释的连续型结果,例如评分、血压、HbA1c、肺功能或实验室指标。该变量应为 numeric,不应是二分类、计数或等级变量。

第二步,选择分类固定效应和连续协变量。

分类固定效应常见包括治疗组、性别、中心类型、访视时间分组等;连续协变量常见包括年龄、基线评分、连续时间、BMI 等。重复测量临床试验中,常见固定效应包括:

  • Treatment:治疗组;
  • TimeVisit:随访时间;
  • Treatment × Time:治疗组随时间变化是否不同;
  • 基线协变量:年龄、性别、基线评分、疾病严重程度等。

第三步,设置固定效应模型项。

如果只选择主效应,模型会估计每个变量的平均作用。如果研究问题包含“治疗效果是否随时间改变”“治疗效果是否因性别或基线状态不同而不同”,应加入相应交互项。

线性混合效应模型:群组变量、随机效应和估计方法菜单
线性混合效应模型:群组变量、随机效应和估计方法菜单

第四步,选择群组变量。

群组变量用于生成随机效应候选项。常见群组变量包括 SubjectPatientIDCenterHospitalDoctorCityFamilyID

第五步,选择随机效应。

Intercept | Subject 表示不同患者可以有不同基线水平;Time | Subject 表示不同患者的时间变化斜率可以不同。随机斜率比随机截距更复杂,需要更多数据支持。

第六步,选择随机效应相关结构。

如果同时选择随机截距和随机斜率,需要决定它们是否估计相关性。all 表示估计所有相关;none 表示随机截距和随机斜率不相关;block 表示按随机效应区块相关。

第七步,设置参照水平、估计方法和自由度方法。

分类变量需要设置参照水平。估计方法中,REML 常用于最终方差成分估计;ML 常用于比较固定效应不同的嵌套模型。自由度方法默认使用 Satterthwaite;Kenward-Roger 通常更耗时,适合需要更稳健小样本修正时使用。

第八步,选择残差相关结构和置信区间。

残差相关结构用于描述重复测量误差之间的相关性。常见选择如下:

结构 含义 常见用途
Identity 残差相互独立 简单随机截距模型或默认起点
Compound Symmetry 任意两个时间点相关相同 平衡重复测量、相关结构较简单
Unstructured 不同时间点相关可不同 时间点较少且样本量较充足
AR(1) 时间越近相关越高 等间隔连续随访
ARMA(1,1) 更复杂的时间相关 需要更灵活时间相关时
线性混合效应模型:结果、对比和边际均值菜单
线性混合效应模型:结果、对比和边际均值菜单

第九步,设置模型比较和随机效应检验。

模型比较用于比较当前模型和嵌套模型。随机效应似然比检验用于评估加入随机效应后模型拟合是否改善。随机效应检验需要谨慎解释,尤其在群组数较少或模型接近边界时。

第十步,设置 Contrast、Post-hoc 和连续变量变换。

Contrast 更适合事先计划好的比较;Post-hoc 更适合多水平分类变量的两两比较,并需要配合多重比较校正。连续变量变换包括中心化、标准化、按 cluster 中心化、cluster 均值和按 cluster 标准化。

第十一步,设置 Estimated Marginal Means。

Estimated marginal means 又称边际估计均值或 LSMeans,适合把复杂模型转换为更容易展示的组别均值、时间均值或组别 × 时间组合均值。

线性混合效应模型:绘图、简单效应和诊断图菜单
线性混合效应模型:绘图、简单效应和诊断图菜单

第十二步,设置 Simple effects。

Simple effects 用于解释交互作用。例如 Treatment × Time 存在时,可以查看每个时间点内治疗组之间的差异,或每个治疗组内随时间的变化。Simple effects 是帮助解释交互作用,不应替代完整模型中的交互作用检验。

第十三步,设置统计图。

勾选“绘制模型预测图”后,需要选择横坐标变量、区分线条变量和可选分面变量。重复测量连续结局中,常用设置是 Time 做横坐标,Treatment 做区分线条,这样可以直接查看各治疗组随时间的模型预测趋势。

第十四步,设置诊断图。

可勾选 Shapiro-Wilk 残差正态性检验、残差 Q-Q 图、残差直方图、残差-预测值图、随机系数直方图、按 cluster 的残差箱线图和残差-预测值图。诊断图用于检查模型假设和异常模式,不应作为主疗效结果解释。

第十五步,点击“开始进行线性混合效应模型分析”。

如果随机效应设置不合理、模型过于复杂或变量选择不完整,模块可能无法生成相应结果。此时应先回到简单随机截距模型,确认主要固定效应能稳定估计,再逐步增加随机斜率、复杂残差结构或更多交互项。

10.35.11 随机效应如何选择

随机效应是本模块最容易选错的部分。建议先回答三个问题:

  1. 数据中哪些观测不是相互独立的?
  2. 哪个变量代表这种聚集或重复观测结构?
  3. 这个变量的每个水平是否有多条记录?

常见选择如下:

场景 随机效应选择 说明
同一患者多次记录 Intercept | Subject 处理患者内相关性
重复测量随时间变化 Time | Subject 允许不同患者有不同时间趋势
多中心研究 Intercept | Center 处理不同中心基线水平不同
患者嵌套在医院 Intercept | Hospital/Subject 先高层级后低层级
治疗效应在中心间不同 Treatment | Center 随机斜率,通常需要更多数据支持

如果某个随机效应导致结果为空、模型不收敛或方差估计为 0,应先简化随机效应结构。通常先保留随机截距,再谨慎增加随机斜率、嵌套或交叉结构。

最常见错误是把每个患者只有一行的数据也设置为 Intercept | Subject。这时模型没有任何患者内重复信息可以学习,患者 ID 不适合作为随机效应。应取消该随机效应,或确认数据是否应该整理成每名患者多行的长格式。

10.35.12 结果表如何阅读

本模块结果分为几个主题。这样设计是为了避免把模型整体信息、固定效应、随机效应、事后检验、边际均值和图形结果混在一起。

10.35.12.1 模型整体参数

模型整体参数表用于复核模型公式、样本量、估计方法、自由度方法、收敛信息和置信区间算法。正式解释结果前,先确认结局变量、固定效应和随机效应设置是否正确。

10.35.12.2 固定效应结果

固定效应表是论文中最常用的主结果表。连续结局中,固定效应系数通常解释为结局均值在当前模型尺度上的变化。例如 Treatment 的系数表示相对于参照组的均值差;Time 的系数表示时间每增加一个单位结局的平均变化;Treatment × Time 表示不同治疗组随时间变化的斜率是否不同。

10.35.12.3 随机效应结果

随机效应表展示随机截距、随机斜率和残差方差。随机效应方差不是固定效应的均值差,不应和固定效应混在同一句话中解释。ICC 可用于说明同一群组内观测相似的程度。

10.35.12.4 Post-hoc 和边际估计均值

Post-hoc tests 用于多水平分类变量的两两比较,并配合多重比较校正。边际估计均值适合展示调整协变量和随机效应结构后的组别均值或趋势。

10.35.12.5 诊断图

残差 Q-Q 图用于检查残差近似正态性;残差-预测值图用于查看异方差、非线性或异常点模式。诊断图提示模型假设是否合理,但不能替代对研究设计和变量定义的判断。

10.35.13 表格描述和统计图描述

主要结果表格下方有“对表格进行中文描述”和“对表格进行英文描述”按钮。点击后,系统会把当前表格数值、模型类型、结局变量、固定效应、随机效应、协变量和结果类型一起传给大模型,生成医学论文 Results 部分风格的描述文字。

统计图同样通过专用图形描述模块展示。图形描述会围绕横坐标变量、线条变量、分层变量、预测值和误差线展开。

建议使用方式:

  1. 先确认模型没有报错,变量和随机效应设置正确;
  2. 再点击中文或英文描述按钮;
  3. 把生成文字作为初稿,而不是最终不可修改文本;
  4. 正式投稿前,人工核对变量医学含义、效应方向和因果措辞;
  5. 不要把表格中没有呈现的信息写入 Results。

10.35.14 Word 报告

“下载Word报告”会导出当前线性混合效应模型的统计表、统计图和报告内容。报告适合用于:

  • 保存当前模型设置和结果;
  • 给导师、合作者或统计人员初步审阅;
  • 起草论文 Methods 和 Results;
  • 记录随机效应结构、自由度方法、残差结构、对比编码和事后检验设置;
  • 保存表格和统计图。
线性混合效应模型:Word 报告下载页面
线性混合效应模型:Word 报告下载页面

请用 Microsoft Word 打开导出的文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.35.15 从模块结果转入论文写作

如果计划把本模块结果写入论文,建议按以下逻辑整理:

  1. 在 Methods 中说明模型类型为线性混合效应模型,并说明使用 LMM 的原因;
  2. 说明连续结局、固定效应、协变量和随机效应包括哪些变量;
  3. 说明估计方法是 REML 还是 ML,自由度方法是 Satterthwaite 还是 Kenward-Roger;
  4. 如果使用随机斜率、嵌套结构或特殊残差相关结构,应说明研究设计依据;
  5. 对分类变量说明参照水平和对比编码;
  6. 对连续变量说明是否中心化、标准化或按 cluster 处理;
  7. 在 Results 中优先描述主要固定效应的方向、均值差、置信区间和 P 值;
  8. 随机效应方差用于说明群组间变异,不要解释成普通自变量效应;
  9. 若模型不收敛或随机效应不可估计,应简化模型,而不是强行报告。

10.35.16 常见问题

1. 每个 Subject 只有一行,能不能把 Subject 作为随机效应?

通常不能。随机效应需要同一水平下有重复观测或聚集信息。如果每个 Subject 只有一行,模型无法估计患者内相关性。

2. Time 应该放固定效应还是随机效应?

通常先把 Time 放入固定效应,因为研究者需要解释平均时间趋势。若还想允许不同患者的时间变化趋势不同,并且每位患者有足够多时间点,才考虑 Time | Subject 这样的随机斜率。

3. REML 和 ML 应该怎么选?

REML 常用于最终模型的方差成分估计;ML 更适合比较固定效应不同的嵌套模型。若做固定效应模型比较,建议用 ML;最终报告时可根据研究规范选择 REML 或 ML,并在 Methods 中说明。

4. Satterthwaite 和 Kenward-Roger 有什么区别?

两者都是混合模型中常用的自由度近似方法。Satterthwaite 速度较快,是常用默认方式;Kenward-Roger 在小样本或复杂方差结构下常被认为更保守,但计算更慢。

5. 随机截距和随机斜率有什么区别?

随机截距表示不同群组有不同基线水平。随机斜率表示某个固定效应在不同群组中的作用大小也可以不同。随机斜率需要更多数据支持,不能随意添加。

6. 为什么模型很复杂时容易报错?

模型越复杂,需要数据支持的信息越多。多个随机斜率、复杂残差结构、多水平交互项和稀疏分类变量同时出现时,模型可能不收敛或方差估计为 0。

7. LMM 可以替代 MMRM 吗?

不能简单替代。LMM 和 MMRM 都可用于连续结局重复测量数据,但模型假设、缺失值处理、协方差结构和临床试验报告规范可能不同。正式研究中应根据方案、统计分析计划和数据结构选择。

8. 连续结局不服从正态分布怎么办?

先检查残差而不是只看原始结局分布。若残差严重偏离正态、存在异方差或离群点,可考虑变换结局、使用稳健方法、改用其他模型或进行敏感性分析。

9. 能不能把中心作为固定效应而不是随机效应?

可以,取决于研究目的和中心数量。若中心数很少且需要控制每个中心的具体差异,中心固定效应可能更合适;若中心较多且主要想处理中心间随机变异,中心随机效应更常见。

10. Post-hoc 和 Estimated Marginal Means 有什么关系?

边际估计均值是模型调整后的组别或组合均值;Post-hoc 通常是在这些估计基础上进行两两比较,并可进行多重比较校正。

10.35.17 小结

本模块的最佳用法是:先明确连续结局、重复测量或聚集结构,再建立固定效应和随机效应都能解释清楚的 LMM;从简单随机截距模型开始,根据研究设计和数据量逐步增加随机斜率、残差相关结构和交互项。

在论文写作中,固定效应表适合承担主要结果解释;随机效应表用于说明群组间或个体间变异;边际估计均值、post-hoc 和预测图用于解释交互或展示调整后的趋势。模型越复杂,越需要清楚说明随机效应、估计方法、自由度方法和残差结构为什么这样设定。

10.36 广义线性混合效应模型(Logistic、Poisson等)

10.36.1 模块功能

本模块用于在存在群组聚集、层级结构或重复观测的数据中,完成广义线性混合效应模型分析。它适合处理结局不是普通连续变量、但又不能把所有观测当作彼此独立的医学研究问题。

在临床研究中,最常见的三类使用场景是:多中心临床试验中患者来自不同医院或研究中心;地区/医院/医生造成的聚集数据;以及同一患者在多个随访时间点反复记录二分类、有序等级或计数结局的重复测量数据。比如一项药物随机对照试验在基线、第 4 周、第 8 周和第 12 周记录“是否缓解”,同一个患者贡献多行数据,这些行显然不是彼此独立的,此时通常需要把 PatientID 放入随机效应结构。

换句话说,当研究者已经确定:

  • 结局变量 Y 是二分类、有序多分类、多分类、计数或过度离散计数;
  • 核心自变量、暴露因素、治疗分组或协变量已经明确;
  • 数据中存在医院、中心、城市、医生、家庭、患者 ID 等群组变量;
  • 需要用随机效应处理同一群组内观测更相似的问题;
  • 需要报告固定效应、随机效应、事后检验、简单效应、边际估计均值和预测图;

就可以使用本模块生成广义线性混合效应模型结果表、随机效应诊断表、统计图、中文/英文表格描述和 Word 报告。

本模块与普通 Logistic、Poisson 或多分类回归不同。普通模型默认每一行观测相互独立;本模块允许把同一医院、同一中心、同一患者或更高层级下的观测联系起来,避免把相关观测误当作独立样本。它不只是“地区聚集模型”,也适合结局类型符合要求的重复测量临床试验数据。

10.36.2 适用场景

本模块适合以下问题:

  1. 多中心研究中,患者嵌套在医院、中心或地区内;
  2. 同一患者、同一家庭、同一医生或同一研究中心有多条观测记录;
  3. 二分类结局需要 Logistic 或 Probit 混合模型;
  4. 计数结局需要 Poisson 或负二项混合模型;
  5. 有序多分类或无序多分类结局需要相应的混合模型;
  6. 研究者希望估计某些固定效应是否在不同群组中存在随机变异。

典型应用包括:

  • 不同医院患者的治疗有效率比较,并将医院作为随机截距;
  • 住院次数、急性发作次数等计数结局,同时考虑中心聚集;
  • 多中心二分类结局研究中,调整年龄、性别、治疗组等固定效应;
  • 患者嵌套在医院内,医院又嵌套在国家或地区内;
  • 同一患者有多条记录,需要用患者 ID 处理个体内相关性;
  • 药物临床试验在多个随访时间点记录“是否达到缓解”“是否出现不良事件”,需要同时比较治疗组、时间和治疗组 × 时间交互;
  • 哮喘或 COPD 研究中,每位受试者 6 个月内每月记录急性发作次数,需要用计数型混合模型处理重复计数;
  • 肿瘤疗效随访中,每次访视记录 CR/PR/SD/PD 等有序或多分类疗效结局,并考虑患者内重复观测。

重复测量临床试验例子:一项随机对照试验比较新药和安慰剂,在第 0、4、8、12 周记录“是否缓解”。TreatmentVisitTreatment × Visit 是固定效应,因为研究者要直接解释它们;PatientID 是随机效应,因为同一患者的多次记录更相似,主要作用是处理患者内相关性。

不建议用于以下情况:

  • 只有普通独立样本,没有任何群组、中心或重复观测结构;
  • 随机效应变量的每个水平只有一条记录,例如每个患者 ID 只出现一次;
  • 群组水平过少,却希望精确解释随机效应方差;
  • 事件数很少,却同时加入多水平交互项、多个随机斜率和大量协变量;
  • 只是想做普通亚组分析,而不是建立包含随机效应的模型;
  • 不清楚群组变量之间是平行、嵌套还是交叉关系。

10.36.3 支持的分析内容

本模块支持以下模型和结果内容:

  • 二分类 Logistic 混合模型;
  • 二分类 Probit 混合模型;
  • 多分类 Multinomial 混合模型;
  • 有序多分类 Ordinal 混合模型;
  • Poisson 计数混合模型;
  • Negative Binomial 负二项混合模型;
  • 固定效应参数估计、似然比检验和效应量 exp(B)
  • 随机效应方差成分、随机效应似然比检验和随机效应可估计性诊断;
  • Contrast 对比编码和计划比较;
  • Post-hoc 事后两两比较和多重比较 P 值校正;
  • Simple effects 简单效应分析;
  • Estimated Marginal Means / LSMeans / 预测概率;
  • 统计图和图形描述;
  • Word 报告下载。

10.36.4 主要特点

  • 左侧面板按模型、变量、随机效应和结果选项分区,适合从上到下完成设置;
  • 多选菜单支持“全选”和“清空”,便于快速选择固定效应、随机效应和边际均值模型项;
  • 随机效应候选项可包含随机截距、固定效应随机斜率、嵌套 cluster 和交叉 cluster;
  • 如果随机效应不可估计,模块会弹窗说明原因,并留白分析结果,避免展示错误结果;
  • 主要 flextable 表格通过 viptest 专用表格描述模块渲染,提供中文和英文表格描述按钮;
  • 统计图通过 viptest 专用图形描述模块渲染,可生成图形说明;
  • 结果主面板按主题拆分为模型整体参数、主要模型结果、Simple effect、边际估计均值和统计图;
  • Word 报告页面独立排版,适合下载当前分析的表格、图形和报告内容。

本模块底层使用 GAMLj3 相关函数完成广义混合模型分析。用户不需要手写公式,但需要正确指定固定效应、群组变量和随机效应结构。

10.36.5 支持的结局类型和模型

结局类型 模型选择 常见效应量 典型用途
二分类结局 Logistic OR 有效/无效、死亡/存活、感染/未感染
二分类结局 Probit Probit 尺度系数 需要 Probit 链接的二分类模型
无序多分类结局 Multinomial 相对风险或相对优势 多类别诊断、治疗反应分型
有序多分类结局 Ordinal OR 疾病严重程度、有序等级评分
计数结局 Poisson IRR 发作次数、住院次数、事件计数
过度离散计数 Negative Binomial IRR 方差明显大于均值的计数结局

模型选择应由结局变量类型决定。不要为了得到某个喜欢的效应量而随意更换模型。例如,二分类结局通常用 Logistic;计数结局如果过度离散,负二项模型通常比 Poisson 更稳妥。

10.36.6 生成的表格和图形

一键自动生成以下表格和图形:

本模块不是只生成一张表和一张图。按照左侧选项不同,结果会分布在“模型整体参数”“广义混和效应模型结果”“Simple effect 结果”“边际估计均值结果”和“统计图”几个标签页中。其中,“广义混和效应模型结果”这个主分析标签页最多包含 8 类结果表:固定效应参数、Relative Risk、边际效应、固定效应似然比检验、随机效应方差成分、随机效应似然比检验、contrast coding 和 post-hoc 事后比较。

1. 模型整体参数和拟合评价表

用于复核模型类型、模型公式、分布、链接函数、事件方向、样本量、收敛状态、置信区间算法和模型比较设置。

广义线性混合效应模型:模型整体参数和拟合评价表
广义线性混合效应模型:模型整体参数和拟合评价表

2. 固定效应参数估计表

展示固定效应的回归系数、标准误、exp(B)、置信区间、z 值和 P 值。Logistic 模型中 exp(B) 通常解释为 OR,Poisson 或负二项模型中通常解释为 IRR。

广义线性混合效应模型:固定效应参数估计表
广义线性混合效应模型:固定效应参数估计表

3. Relative Risk(RR)表

勾选 RR 后生成,用于在适合的二分类结局语境下查看相对风险及其区间。

广义线性混合效应模型:Relative Risk 表
广义线性混合效应模型:Relative Risk 表

4. Marginal Effects(边际效应)表

勾选边际效应后生成,把模型参数转换为概率或均值尺度上的变化,更便于临床解释。

广义线性混合效应模型:边际效应表
广义线性混合效应模型:边际效应表

5. 固定效应似然比检验表

用于检验固定效应模型项整体是否有统计学证据,例如治疗组、时间或协变量是否对结局有贡献。

广义线性混合效应模型:固定效应似然比检验表
广义线性混合效应模型:固定效应似然比检验表

6. 随机效应方差成分表

展示随机截距、随机斜率、方差、标准差、ICC 和群组数量等信息。它用于说明聚集或重复测量结构带来的变异,而不是普通固定效应。

广义线性混合效应模型:随机效应方差成分表
广义线性混合效应模型:随机效应方差成分表

7. 随机效应似然比检验表

勾选随机效应 LRT 后生成,用于比较加入随机效应前后模型拟合是否改善。

广义线性混合效应模型:随机效应似然比检验表
广义线性混合效应模型:随机效应似然比检验表

8. Contrast coding 表

勾选 contrast 后生成,用于展示分类变量各水平在当前对比编码下如何进入模型,帮助解释固定效应参数的实际比较含义。

广义线性混合效应模型:Contrast coding 表
广义线性混合效应模型:Contrast coding 表

9. Post-hoc 事后比较表

勾选 post-hoc 后生成,用于多水平分类变量的两两比较,并显示未校正和校正后的 P 值。

广义线性混合效应模型:Post-hoc 事后比较表
广义线性混合效应模型:Post-hoc 事后比较表

10. 统计图

勾选绘制统计图后,模块可根据横坐标变量、区分线条变量和分层变量生成预测图或边际趋势图,并提供图形描述按钮。

广义线性混合效应模型:统计图
广义线性混合效应模型:统计图

本节只展示统计表和统计图本体,不展示左侧菜单、浏览器边框、按钮、解释面板、下载控件或 Word 下载界面。不同模型和不同菜单设置会显示不同结果块;没有勾选、当前模型不适用或当前模型不可估计的内容不会强行显示。

10.36.7 背景介绍

广义线性混合效应模型可以理解为“广义线性模型 + 随机效应”。“广义线性模型”负责处理不同结局类型,例如二分类结局用 Logistic,计数结局用 Poisson 或负二项;“混合效应”负责同时放入固定效应和随机效应。

固定效应是研究者主要关心、并希望在论文中直接解释的因素。临床试验中常见的固定效应包括治疗组、随访时间、治疗组 × 时间交互、基线年龄、性别、疾病严重程度和合并症。比如在“新药 vs 安慰剂”的重复测量试验中,研究者真正想回答的是新药是否提高缓解率、不同访视时间缓解率是否变化、新药组和安慰剂组随时间变化是否不同,这些都属于固定效应问题。

随机效应不是普通自变量,也不是越多越好。随机效应主要用于告诉模型:哪些行之间天然更相似、不能当成完全独立样本。多中心试验中,同一中心的患者可能因为医生习惯、设备、入组标准或地区差异而更相似,因此 Center 可以作为随机效应;重复测量试验中,同一患者的多次记录共享个人体质、基础风险和治疗反应倾向,因此 PatientID 可以作为随机效应。

在医学研究中,最常见的两类结构是:

  • 多水平/聚集数据:患者来自不同医院、城市、医生或研究中心,同一群组内患者可能更相似;
  • 重复观测数据:同一患者有多次记录,同一患者内部的观测不是独立样本。

如果忽略这种相关性,把所有行都当作独立观测,标准误可能偏小,P 值可能过于乐观。GLMM 的作用就是在估计固定效应的同时,通过随机效应处理群组或重复观测结构。

多中心 + 重复测量例子:一项 20 个中心参加的肿瘤临床试验,每位患者在 4 个访视时间点记录“是否达到疾病控制”。固定效应可以是 TreatmentVisitTreatment × Visit 和基线 ECOG;随机效应可以包括 Intercept | Center 处理中心差异,以及 Intercept | PatientID 处理同一患者多次记录的相关性。如果患者 ID 只在各中心内部唯一,而不是全局唯一,还需要按真实层级考虑 Center/PatientID 这样的嵌套结构。

不要把“想调整的变量”都放进随机效应。年龄、性别、基线评分、治疗组通常是固定效应;医院、中心、医生、患者 ID 这类代表聚集或重复观测来源的变量,才可能作为随机效应。

10.36.8 数据准备要求

进入模块前,建议先整理好以下内容:

  1. 每一行是一条观测记录。若同一患者有多次随访,则同一患者应出现多行,这就是长格式数据;
  2. 重复测量研究应有能够识别患者的变量,例如 PatientID,还应有访视或时间变量,例如 VisitWeekMonth
  3. 结局变量类型应与模型选择一致,例如 Logistic 模型需要二分类结局,Poisson 模型需要非负整数计数结局;
  4. 固定效应变量可以是分类变量或连续变量,例如治疗组、访视时间、治疗组 × 访视时间、年龄、性别、基线评分;
  5. 随机效应群组变量应能代表真实聚集结构,例如医院、中心、医生、地区、家庭或患者 ID;
  6. 每个随机效应群组最好有足够重复观测;如果每个水平只有一行,通常不适合作为随机效应;
  7. 嵌套随机效应应按高层级到低层级理解,例如国家/城市/医院/患者 ID;
  8. 分类变量水平不要过多且过稀疏,否则模型容易不收敛或估计不稳定。

随机效应变量不是“越多越好”。例如,如果每个 PatientID 在数据中只出现一次,PatientID 并不能帮助模型估计个体内相关性,因为没有重复记录可供比较。这时应不要把它勾选为随机效应。

重复测量数据推荐整理成长格式:同一名患者在第 0、4、8、12 周各占一行,PatientID 四行相同,Visit 分别为 0、4、8、12,结局变量记录每次访视的结果。这样模型才能同时看到“患者内重复”和“时间变化”。

10.36.9 进入模块

顶部菜单选择 “按统计学分类模块” → “混合效应模型/多水平模型” → “广义线性混合效应模型(Logistic、Poisson等)” 进入。

10.36.10 使用步骤

左侧面板按正式建模流程排列。建议从上到下设置,不要跳着选。下面的截图是菜单设置示例,和前面“生成的表格和图形”中的结果截图分开展示。

模型、结局变量和固定效应菜单
模型、结局变量和固定效应菜单

第一步,选择模型种类。

模型种类由结局变量决定:

  • Logistic:二分类结局,例如是否缓解、是否感染、是否死亡。常报告 OR;
  • Probit:也是二分类结局,但使用 Probit 链接,临床论文中使用频率低于 Logistic;
  • Multinomial:无序多分类结局,例如治疗反应分型 A/B/C;
  • Ordinal:有序多分类结局,例如轻/中/重,或 0/1/2/3 级不良反应;
  • Poisson:计数结局,例如发作次数、住院次数、感染次数,常报告 IRR;
  • Negative Binomial:计数结局且方差明显大于均值时使用,例如少数患者发作次数特别多导致过度离散。

第二步,选择结局变量和事件水平。

结局变量是要解释的结果。二分类模型中还需要确认事件水平,例如 1 = 缓解 还是 1 = 未缓解。事件水平选反时,OR 的方向也会反过来。临床报告前一定要确认:表格里的 OR 或预测概率究竟对应哪个事件。

第三步,选择固定效应。

固定效应是要在论文中直接解释的变量。重复测量临床试验中,常见固定效应包括:

  • Treatment:治疗组,回答新药和对照是否不同;
  • VisitTime:访视时间,回答结局是否随时间变化;
  • Treatment × Visit:治疗组随时间变化是否不同,这是纵向疗效研究很常见的核心假设;
  • 基线协变量:年龄、性别、基线评分、疾病分期等,用于调整混杂。

第四步,设置模型项和交互作用。

如果只选择主效应,模型会估计每个变量的平均作用。如果研究问题包含“治疗效果是否随时间改变”“治疗效果是否因性别或疾病严重程度不同而不同”,就应加入交互项。例如 Treatment × Visit 用于重复测量疗效趋势,Treatment × Sex 用于治疗效果是否存在性别差异。

群组变量和随机效应菜单
群组变量和随机效应菜单

第五步,选择群组变量。

群组变量用于生成随机效应候选项。常见群组变量包括 PatientIDCenterHospitalDoctorCityFamilyID。如果有多个随机效应,可以平行,也可以嵌套。

嵌套结构需要按层级从高到低选择。例如国家下面有城市、城市下面有医院、医院下面有患者,应按 CountryCityHospitalPatientID 的顺序选择。顺序选反时,后面组装出的嵌套随机效应会把层级含义弄错。

第六步,设置随机效应候选项。

  • 固定效应随机斜率候选项:勾选后,会为固定效应生成 固定效应 | 群组变量。例如 Visit | PatientID 表示不同患者的时间变化趋势可以不同;
  • 随机截距候选项:勾选后,会生成 Intercept | 群组变量。这是最常用、最稳妥的随机效应;
  • 嵌套 cluster 候选项:适合真实层级结构,例如患者嵌套在中心内;
  • 交叉 cluster 候选项:适合两个群组不是上下级关系的情况,例如患者由多个医生管理、医生也服务多个中心。

第七步,选择随机效应。

随机效应候选项中的 Intercept | Center 表示不同中心可以有不同基线风险;Intercept | PatientID 表示同一患者多次记录相关;Visit | PatientID 表示不同患者随时间变化的斜率可以不同。随机斜率比随机截距更复杂,需要更多数据支持,不能因为菜单里有就一定要选。

如果每个 PatientID 只有一行数据,请不要选择 Intercept | PatientID。这不是软件限制,而是数据本身没有提供“同一患者内部重复”的信息,模型无法估计患者内相关性。

第八步,选择随机效应相关结构。

如果同时选择随机截距和随机斜率,需要决定它们是否估计相关性。all 表示估计所有相关,模型更灵活但更容易不稳定;none 表示不估计相关,模型更简单;block 表示按块估计。一般建议从简单结构开始,模型稳定后再考虑更复杂的相关结构。

结果、对比和边际结果菜单
结果、对比和边际结果菜单

第九步,设置参照水平和对比编码。

分类变量需要设置参照水平。参照水平决定 OR、IRR 或系数是“相对于谁”来解释。对比编码可选择 simple、deviation、dummy、difference、Helmert、repeated 或 polynomial。医学论文中最常用的是以某一参照组为基准的比较;如果不熟悉不同编码含义,建议保持默认,并在结果解释中明确参照水平。

第十步,设置截距和置信区间。

模型中包含截距 通常保持勾选。置信区间水平通常使用 95%。exp(B) 适合 Logistic、Poisson 和负二项等模型,可把系数转换成 OR 或 IRR,更便于临床解释。

第十一步,设置效应量和区间算法。

  • 显示 exp(B) 及其置信区间:Logistic 中常解释为 OR,Poisson/负二项中常解释为 IRR;
  • 同时显示风险比 RR:适合需要报告相对风险的场景,但应确认模型和结局含义是否支持;
  • 边际效应:把模型结果转换为概率或均值尺度上的差异,更直观,但解释依赖模型设定;
  • 标准/Wald 区间:速度快,是常用默认方式;
  • 参数 bootstrap:通过模拟估计区间,更耗时,适合需要更稳健区间时使用。

第十二步,选择模型比较和随机效应检验。

模型比较 用于比较不同模型拟合优度。随机效应似然比检验 用于评估加入某个随机效应后模型是否明显改善。随机效应置信区间 用于查看随机效应方差成分的不确定性。随机效应检验要谨慎解释,尤其在群组数很少或模型接近边界时。

第十三步,选择 Contrast、Post-hoc 和连续变量变换。

Contrast 更适合事先计划好的比较,例如新药 vs 安慰剂。Post-hoc 更适合多水平变量的两两比较,需要配合多重比较校正。连续变量处理包括中心化、标准化、按 cluster 中心化、cluster 均值和按 cluster 标准化。重复测量或多水平数据中,按 cluster 中心化可用于区分组内效应和组间效应,但只有在研究问题需要时才使用。

绘图、简单效应和边际均值菜单
绘图、简单效应和边际均值菜单

第十四步,设置统计图。

勾选“绘制统计图”后,需要选择:

  • 横坐标变量:通常选择时间、访视、治疗组或核心自变量;
  • 区分线条变量:常用于治疗组、性别或亚组变量;
  • 分面变量:用于把不同水平分成多个小图;
  • 是否显示误差线:通常建议显示,便于看不确定性;
  • 是否使用响应尺度:Logistic 模型中响应尺度通常是预测概率,比 logit 尺度更容易读。

重复测量临床试验中,常用设置是 Visit 做横坐标,Treatment 做区分线条,这样可以直接看治疗组随时间的预测概率变化。

第十五步,设置 Simple effects。

Simple effects 用于解释交互作用。例如 Treatment × Visit 存在时,可以查看每个访视时间点内治疗组之间的差异,或每个治疗组内随时间的变化。连续调节变量可以按均值、均值 ± 1SD、分位数或自定义值拆点展示。注意:Simple effects 是帮助解释交互作用,不应替代完整模型中的交互作用检验。

第十六步,设置 Estimated Marginal Means。

Estimated marginal means 又称边际估计均值、LSMeans 或预测均值/概率。它适合把复杂模型转成更容易展示的组别估计值。比如在调整年龄、性别和中心随机效应后,展示每个治疗组在各访视时间点的预测缓解概率。

第十七步,点击“开始进行广义混和效应模型分析”。

如果随机效应设置不合理,模块会弹窗提醒,并说明原因。例如,某个患者 ID 每个水平只有一行数据时,系统会提示该变量不适合作为随机效应。此时应取消该随机效应,或重新整理成长格式重复测量数据。弹窗出现后,分析结果会留白,不展示可能误导用户的错误结果。

10.36.11 随机效应如何选择

随机效应是本模块最容易选错的部分。建议先回答三个问题:

  1. 数据中哪些观测不是相互独立的?
  2. 哪个变量代表这种聚集或重复观测结构?
  3. 这个变量的每个水平是否有多条记录?

随机效应可以分成三种常见结构:

  • 平行随机效应:两个聚集来源不是上下级关系。例如同一数据中同时存在 CenterDoctor,但医生并不固定属于某一个中心;
  • 嵌套随机效应:低层级完全属于高层级。例如患者属于医院,医院属于城市。选择时应先选高层级,再选低层级;
  • 交叉随机效应:两个聚集来源交叉出现。例如同一医生在多个中心坐诊,同一中心也有多名医生。

常见选择如下:

场景 随机效应选择 说明
多中心研究 Intercept | Center 处理不同中心基线风险不同
同一患者多次记录 Intercept | PatientID 处理患者内相关性
重复测量疗效随时间变化 Visit | PatientID 允许不同患者有不同时间趋势,需数据量支持
患者嵌套在医院 Intercept | Hospital/PatientID 先高层级后低层级
医生和患者交叉 交叉 cluster 候选项 医生和患者不是简单嵌套关系
治疗效应在中心间不同 Treatment | Center 随机斜率,通常需要更多数据支持

如果某个随机效应导致结果表为空、模型不收敛或弹出诊断提醒,应先简化随机效应结构。通常先保留随机截距,再谨慎增加随机斜率、嵌套或交叉结构。

最常见错误是把每个患者只有一行的数据也设置为 Intercept | PatientID。这时模型没有任何患者内重复信息可以学习,患者 ID 不适合作为随机效应。应取消该随机效应,或确认数据是否应该整理成每名患者多行的长格式。

10.36.12 结果表如何阅读

本模块结果分为几个主题。这样设计是为了避免把模型整体信息、固定效应、随机效应、事后检验和图形结果混在一起。

10.36.12.1 模型整体参数

模型整体参数表用于复核模型类型、链接函数、拟合指标、收敛信息和主要设置。正式解释结果前,先确认模型选择和结局变量是否正确。

10.36.12.2 固定效应结果

固定效应表是论文中最常用的主结果表。它展示每个固定效应的参数估计、标准误、P 值,以及在勾选时显示的 exp(B)、OR 或 IRR 和置信区间。对 Logistic 模型,exp(B) 通常解释为 OR;对 Poisson 或负二项模型,通常解释为 IRR。

10.36.12.3 随机效应结果

随机效应表展示随机截距、随机斜率或方差成分。随机效应方差不是固定效应的 OR 或 IRR,不应和固定效应混在同一句话中解释。若随机效应诊断表提示某个群组变量不可估计,应按弹窗建议调整随机效应菜单。

10.36.12.4 Contrast 和 Post-hoc

Contrast 更像事前计划比较,适合研究设计中已经明确的特定比较。Post-hoc tests 更适合在全局检验后做多组两两比较,并需要选择合适的多重比较校正方法。

10.36.12.5 Simple effects 和边际估计均值

Simple effects 用于解释交互作用:例如在不同年龄水平或不同性别层内,治疗组对结局的影响是否不同。边际估计均值或预测概率适合把模型结果转成更直观的组别概率、均值或趋势展示。

10.36.13 表格描述和统计图描述

主要结果表格下方有“对表格进行中文描述”和“对表格进行英文描述”按钮。点击后,系统会把当前表格数值、模型类型、结局变量、固定效应、随机效应、协变量和结果类型一起传给大模型,生成医学论文 Results 部分风格的描述文字。

统计图同样通过专用图形描述模块展示。图形描述会围绕横坐标变量、线条变量、分层变量、预测值和误差线展开。

建议使用方式:

  1. 先确认模型没有报错,变量和随机效应设置正确;
  2. 再点击中文或英文描述按钮;
  3. 把生成文字作为初稿,而不是最终不可修改文本;
  4. 正式投稿前,人工核对变量医学含义、效应量方向和因果措辞;
  5. 不要把表格中没有呈现的信息写入 Results。

10.36.14 Word 报告

“下载Word报告”会导出当前广义线性混合效应模型的统计表、统计图和报告内容。报告适合用于:

  • 保存当前模型设置和结果;
  • 给导师、合作者或统计人员初步审阅;
  • 起草论文 Methods 和 Results;
  • 记录随机效应结构、对比编码和事后检验设置;
  • 保存表格和统计图。
Word 报告下载页面
Word 报告下载页面

请用 Microsoft Word 打开导出的文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.36.15 从模块结果转入论文写作

如果计划把本模块结果写入论文,建议按以下逻辑整理:

  1. 在 Methods 中说明模型类型、结局类型、链接函数和使用 GLMM 的原因;
  2. 说明固定效应包括哪些变量,随机效应包括哪些群组变量;
  3. 如果使用随机斜率、嵌套或交叉随机效应,应说明研究设计依据;
  4. 对分类变量说明参照水平;
  5. 对连续变量说明是否中心化、标准化或按 cluster 处理;
  6. 在 Results 中优先描述主要固定效应的方向、效应量和置信区间;
  7. 随机效应方差用于说明群组间变异,不要解释成普通自变量效应;
  8. 若模型不收敛或随机效应不可估计,应简化模型,而不是强行报告。

10.36.16 常见问题

1. 每个 PatientID 只有一行,能不能把 PatientID 作为随机效应?

通常不能。随机效应需要同一水平下有重复观测或聚集信息。如果每个 PatientID 只有一行,模型无法估计患者内相关性。请不要在随机效应菜单中勾选这个变量。

2. 多个随机效应应该怎么排序?

如果是平行结构,顺序影响较小。如果是嵌套结构,应先选层级高的变量,再选层级低的变量,例如国家、城市、医院、患者 ID。顺序选反会导致随机效应结构含义错误。

3. 随机截距和随机斜率有什么区别?

随机截距表示不同群组有不同的基线风险或基线水平。随机斜率表示某个固定效应在不同群组中的作用大小也不同。随机斜率需要更多数据支持,不能随意添加。

4. 为什么选择随机效应后结果为空或弹窗提示?

常见原因是某个随机效应群组每个水平只有一条记录,或模型太复杂导致无法估计。此时模块会弹窗说明原因,并留白结果区。应取消不合适的随机效应或简化模型。

5. 中心数很少时能不能用随机效应?

学术界对此存在不同观点。若中心数很少,随机效应方差估计通常不稳定。可以用随机效应处理聚集相关,但需要谨慎解释,并考虑中心固定效应模型作为敏感性分析。

6. Post-hoc 和 Contrast 有什么区别?

Contrast 是研究设计阶段预先计划的比较;Post-hoc 是模型拟合后对多个水平进行两两比较。Post-hoc 通常需要进行多重比较 P 值校正。

7. 统计图中的预测值是什么?

统计图展示的是模型预测值或边际估计结果,不是简单原始均值。是否显示误差线、是否加入随机效应预测、是否使用响应尺度,都由左侧绘图选项决定。

8. 这个模块能替代所有重复测量分析吗?

不能。GLMM 适合特定结局类型和随机效应结构。连续结局多时间点疗效分析常见方法还包括 MMRM、GEE 和 LMM,应根据研究目的和结局类型选择。

9. 重复测量临床试验中,Visit 应该放固定效应还是随机效应?

通常先把 Visit 放入固定效应,因为研究者需要解释不同随访时间的平均变化。若还想允许每位患者随时间变化的趋势不同,并且每位患者有足够多时间点,才考虑 Visit | PatientID 这样的随机斜率。

10. 多中心重复测量试验中,Center 和 PatientID 应该怎么放?

常见做法是把 CenterPatientID 都作为群组来源:Center 处理中心差异,PatientID 处理同一患者多次观测。如果患者 ID 在全数据中唯一,可以把它们作为平行随机效应;如果患者 ID 只在每个中心内部唯一,应按真实数据结构考虑 Center/PatientID 这类嵌套结构。

11. 固定效应和随机效应能不能是同一个变量?

多数情况下不要这样做。治疗组、时间、年龄、性别等需要解释的变量通常作为固定效应;患者 ID、中心、医院、医生这类代表相关结构的变量才作为随机效应。少数高级模型会让某个固定效应在不同群组中有随机斜率,例如 Visit | PatientID,意思不是把 Visit 变成随机变量,而是允许 Visit 的作用在不同患者之间变化。

12. 为什么模型很复杂时容易报错?

模型越复杂,需要数据支持的信息越多。多个随机斜率、嵌套结构、交叉结构、多水平交互项和稀疏结局同时出现时,模型可能不收敛或方差估计为 0。处理方法通常是先回到简单随机截距模型,确认主要固定效应能稳定估计,再逐步增加复杂结构。

10.36.17 小结

本模块的最佳用法是:先明确结局类型和群组结构,再建立固定效应和随机效应都能解释清楚的 GLMM;从简单随机截距模型开始,根据研究设计和数据量逐步增加随机斜率、嵌套或交叉结构。

在论文写作中,固定效应表适合承担主要结果解释;随机效应表用于说明群组间变异;Simple effects、边际估计均值和统计图用于解释交互或展示预测模式。模型越复杂,越需要清楚说明随机效应为什么这样设定,以及数据是否支持这种设定。

10.37 探索性因子分析

10.37.1 模块功能

本模块用于从一组彼此相关的观测变量中探索较少数量的潜在因子。它适合量表开发、问卷条目筛选、指标降维和潜在结构探索,例如判断多个症状条目是否可以归纳为身体症状、情绪症状或社会功能等较少的维度。

探索性因子分析(Exploratory Factor Analysis, EFA)不是简单地把变量压缩成几个综合指标。它假定每个观测变量的变异可以分为共同因子解释的部分和该变量特有的部分,并通过因子载荷、唯一性、因子相关和模型拟合结果帮助研究者理解潜在结构。

当研究者已经确定:

  • 有多个连续型或有序数值型条目需要共同分析;
  • 这些条目可能由少数潜在维度解释;
  • 目前尚未确定严格的测量模型,或希望先探索结构;
  • 需要比较因子提取方法、因子数量判定方法和旋转方法;
  • 需要输出因子得分供后续描述、回归或分组分析使用;

就可以使用本模块生成适用性检验、因子载荷、因子汇总、因子相关、模型拟合、初始特征值、碎石图和因子得分,并下载 Word 报告与因子得分 CSV。

本模块用于完成探索性因子分析;结果表格、图形、中文/英文表格描述和 Word 报告采用 MSTATA 的统一展示方式。

10.37.2 适用场景

本模块适合以下问题:

  1. 新量表或问卷开发阶段,探索条目可能形成几个维度;
  2. 已有量表在新的语言、地区、疾病或人群中使用前,检查潜在结构;
  3. 多个临床症状、实验室指标或行为条目之间高度相关,希望提取共同维度;
  4. 在建立验证性因子分析模型前,先用 EFA 形成候选结构;
  5. 希望计算每个研究对象的因子得分,用于后续回归、聚类或描述分析。

典型应用包括:

  • 20 个生活质量条目是否可以归纳为身体、心理和社会功能;
  • 多个焦虑或抑郁症状条目是否反映一个总体维度或多个子维度;
  • 多个实验室指标是否存在炎症、代谢或器官功能等共同模式;
  • 中文版量表在目标人群中的条目结构是否与原量表基本一致;
  • 从多个相关暴露指标中提取较少的综合潜在因子。

量表探索例子:一份问卷包含 12 个条目,研究者推测前 4 项反映身体功能,中间 4 项反映心理状态,后 4 项反映社会功能。研究者可以先选择平行分析、最小残差提取和 Oblimin 旋转,观察实际数据支持几个因子、各条目主要载荷在哪个因子,以及不同因子之间是否相关。

不建议用于以下情况:

  • 只有一个或两个变量,没有可识别的多变量共同结构;
  • 研究者已有明确且固定的理论结构,目标是严格检验模型,此时更适合验证性因子分析;
  • 样本量太小、缺失严重,或完整案例数不大于变量数;
  • 变量之间几乎没有相关性,Bartlett 检验和 KMO 均不支持因子分析;
  • 把名义分类变量、ID、日期或自由文本直接当作量表条目;
  • 只想构造解释总方差最大的线性组合,而不区分共同方差与唯一性,此时可考虑主成分分析。

10.37.3 支持的分析内容

本模块支持以下分析和结果:

  • 最小残差法(Minimum residuals)、最大似然法(Maximum likelihood)和主轴法(Principal axis)提取;
  • 不旋转、Varimax、Quartimax、Promax、Oblimin 和 Simplimax 旋转;
  • 平行分析、特征值阈值和固定因子数三种因子数量判定方式;
  • Bartlett 球形检验和 KMO 抽样适合性检验;
  • 因子载荷、唯一性、载荷显示阈值和按载荷大小排序;
  • 因子汇总、因子相关、模型拟合和初始特征值;
  • 碎石图及平行分析模拟参考线;
  • Thurstone、Bartlett、ten Berge、Anderson-Rubin 和 Harman 因子得分;
  • 因子得分摘要、前 20 行预览和完整 CSV 下载;
  • 主要表格的中文与英文 Results 风格描述;
  • 包含统计表和碎石图的 Word 报告。

10.37.4 主要特点

  • 左侧面板按变量、提取和旋转、因子数量、适用性检验、载荷、附加输出、因子得分和图形尺寸分区;
  • 多选变量菜单提供“全选”和“清空”,便于快速选择量表条目;
  • 分析前自动检查变量数量、变量有效取值和完整案例数;
  • 所有主要结果表按主题放在不同标签页,避免把载荷、适用性检验和拟合指标混在一起;
  • 主要 flextable 表格提供“对表格进行中文描述”和“对表格进行英文描述”按钮;
  • 碎石图可调整宽度和高度,并下载 PNG、TIFF、SVG 或 PDF;
  • 因子得分可在页面中预览,也可以单独下载完整 CSV;
  • Word 报告页面独立排版,保存当前勾选的统计表和碎石图。

10.37.5 探索性因子分析、主成分分析和验证性因子分析的区别

方法 主要目的 处理的变异 典型使用阶段
探索性因子分析(EFA) 探索潜在因子结构 共同方差与唯一性分开考虑 量表开发、结构探索
主成分分析(PCA) 用少数线性组合概括原变量 主要利用总方差 降维、构造综合指标
验证性因子分析(CFA) 检验预先规定的测量模型 明确指定载荷和误差结构 理论验证、模型比较

EFA 的重点是“哪些条目共同反映哪些潜在维度”;PCA 的重点是“怎样用更少的成分保留尽可能多的信息”;CFA 的重点是“预先规定的结构是否与数据相符”。三者不能仅根据软件是否都输出载荷表而互相替代。

10.37.6 生成的表格和图形

一键自动生成以下表格和图形:

结果主面板分为“模型与适用性”“因子载荷”“因子统计”“拟合与特征值”“统计图”和“因子得分”六个标签页。以下示例使用 8 个条目、平行分析、最小残差提取、Oblimin 旋转和 Thurstone 因子得分;截图中的数值仅用于说明如何阅读结果。

1. 模型信息表

用于复核分析变量、总行数、完整案例数、排除行数、提取因子数、因子数判定方法、提取方法、旋转方法、载荷阈值和因子得分方法。

探索性因子分析:模型信息表
探索性因子分析:模型信息表

2. Bartlett 球形检验和 KMO 检验

Bartlett 检验用于判断相关矩阵是否明显不同于单位矩阵;KMO 表给出总体及每个变量的抽样适合性指标。二者应结合相关矩阵、样本量和条目内容判断。

探索性因子分析:Bartlett 球形检验
探索性因子分析:Bartlett 球形检验
探索性因子分析:KMO 抽样适合性检验
探索性因子分析:KMO 抽样适合性检验

3. 因子载荷和唯一性表

因子载荷表示变量与潜在因子的关系强度;唯一性表示该变量中未被共同因子解释的方差比例。显示阈值只影响表格是否隐藏小载荷,不改变模型估计。

探索性因子分析:因子载荷表
探索性因子分析:因子载荷表

4. 因子汇总和因子相关表

因子汇总表显示平方载荷和、解释方差百分比和累计解释方差;使用斜交旋转时,因子相关表展示潜在因子之间的相关程度。

探索性因子分析:因子汇总表
探索性因子分析:因子汇总表
探索性因子分析:因子相关表
探索性因子分析:因子相关表

5. 模型拟合和初始特征值

模型拟合表包括 RMSEA、RMSEA 90% 置信区间、TLI、BIC 和模型卡方检验;初始特征值用于观察各潜在维度的相对大小。拟合指标应综合判断,不应只凭单一阈值决定模型优劣。

探索性因子分析:模型拟合指标
探索性因子分析:模型拟合指标
探索性因子分析:初始特征值
探索性因子分析:初始特征值

6. 碎石图和平行分析参考线

实线表示数据特征值,虚线表示随机模拟数据的参考值。平行分析通常保留数据特征值高于模拟参考值的因子,并结合拐点和理论解释确定最终因子数。

探索性因子分析:碎石图
探索性因子分析:碎石图

7. 因子得分摘要

显示每个因子得分的有效样本数、均值、标准差、最小值和最大值。完整个体得分可另行下载 CSV。

探索性因子分析:因子得分摘要
探索性因子分析:因子得分摘要

示例中原始数据有 280 行,8 个条目同时完整的案例为 221 行。因此模型信息表、因子得分和 CSV 的有效样本数均为 221。模块使用所选变量的完整案例,缺失较多时应先检查缺失模式和被排除比例。

10.37.7 数据准备

10.37.7.1 数据格式

数据应采用宽格式:每一行代表一个研究对象或独立观测,每一列代表一个待分析条目或指标。

ID Item01 Item02 Item03 Item04 Item05
P001 4 5 3 4 2
P002 2 3 2 3 4
P003 5 4 4 5 1

分析变量应为数值型、整数型或已经正确排序的有序数值型。患者 ID、研究中心、分组变量和日期可以保留在数据中,但不要把它们放入 EFA 的分析变量列表。

10.37.7.2 分析前检查

建议在分析前完成以下检查:

  1. 每个条目的编码方向是否一致,反向题是否已经正确反向计分;
  2. 每个条目是否至少有两个不同的非缺失值;
  3. 是否存在录入错误、超出量表范围的数值或几乎没有变异的条目;
  4. 条目间是否存在一定相关性,但又不是完全重复;
  5. 完整案例数是否明显大于条目数;
  6. 缺失比例是否会使完整案例分析损失过多样本;
  7. 样本是否来自目标人群,是否把不同版本或不同计分规则的量表混在一起。

“每个条目 5 或 10 个样本”只能作为粗略经验,不能替代对共同度、载荷强度、因子数、条目数和数据质量的判断。小样本、低共同度和多个弱因子同时出现时,因子结构可能很不稳定。

10.37.8 操作步骤

顶部菜单选择 “按统计学分类模块” → “探索性因子分析” 进入模块。

  1. 在“选择分析变量”中选择至少 3 个数值型或有序数值型条目;
  2. 选择提取方法。初次探索可从“最小残差法”开始;
  3. 选择旋转方法。多数医学和心理量表允许因子相关,可优先考虑 Oblimin;
  4. 选择因子数量判定方法。初次分析通常优先使用平行分析;
  5. 保留 Bartlett 和 KMO 检验,用于评估因子分析适用性;
  6. 设置载荷显示阈值,例如 0.30。该阈值只影响结果表显示;
  7. 根据需要勾选因子汇总、因子相关、模型拟合、初始特征值和碎石图;
  8. 如需个体得分,勾选“计算并输出因子得分”并选择估计方法;
  9. 设置碎石图宽度和高度;
  10. 点击“开始分析”。
探索性因子分析:完整设置面板
探索性因子分析:完整设置面板

10.37.9 提取方法如何选择

提取方法 主要特点 建议场景
Minimum residuals 最小化残差,分布要求相对宽松 一般探索、量表条目、默认首选
Maximum likelihood 可提供基于似然的拟合信息,对分布要求更高 数据近似连续且接近多元正态
Principal axis 基于共同方差逐步提取 不希望依赖严格正态假设时

不同提取方法得到的因子数、载荷和拟合结果可能略有差异。建议先确定研究目的和数据性质,再把其他合理提取方法作为敏感性分析,而不是反复尝试直到得到“最好看”的结果。

10.37.10 因子数量如何选择

10.37.10.1 平行分析

平行分析把实际数据的特征值与随机模拟数据的特征值比较。通常保留实际特征值高于模拟参考值的因子。它比单纯使用“特征值大于 1”更稳健,因此适合作为初次探索的主要依据。

10.37.10.2 特征值阈值

选择“基于特征值”后,可以设置最低特征值。传统 Kaiser 规则常使用大于 1,但这个规则可能保留过多或过少因子,不能脱离碎石图和理论解释单独使用。

10.37.10.3 固定因子数量

当既往研究、量表理论或研究设计已经提出明确候选维度时,可以固定因子数量。固定因子数仍应检查载荷、共同度、交叉载荷、拟合指标和因子可解释性。

因子数不是越多越好。提取过多因子可能产生只有一两个条目定义的弱因子、Heywood 情形或不稳定载荷;提取过少因子可能把含义不同的维度强行合并。应综合平行分析、碎石图、拟合、条目内容和理论依据。

10.37.11 旋转方法如何选择

旋转的目的是获得更清晰、更容易解释的载荷结构,不是改变原始数据或人为制造显著结果。

类型 方法 解释
不旋转 None 保留初始解,通常较难解释
正交旋转 Varimax、Quartimax 假定因子彼此不相关
斜交旋转 Promax、Oblimin、Simplimax 允许因子相关

医学、心理和行为研究中的潜在维度经常存在相关性,因此斜交旋转通常更符合实际。若斜交旋转得到的因子相关接近 0,可再使用正交旋转作为补充;若理论上因子明确独立,也可以直接选择正交旋转。

10.37.12 载荷阈值和条目保留

载荷绝对值越大,通常表示该变量与相应因子的关系越强。常见经验会关注 0.30、0.40 或 0.50,但阈值应结合样本量、研究阶段、条目内容和因子结构决定。

  • 某条目在一个因子上载荷较高、在其他因子上较低,通常更容易解释;
  • 同一条目在多个因子上都有较高载荷时,称为交叉载荷,需要结合内容判断;
  • 唯一性很高表示共同因子对该条目的解释较少;
  • 只根据统计阈值机械删除条目,可能损害内容效度;
  • “隐藏低于阈值的载荷”只改变显示,不会重新拟合模型。

10.37.13 适用性检验如何阅读

10.37.13.1 Bartlett 球形检验

原假设是相关矩阵为单位矩阵。P 值较小表示变量之间存在足够的总体相关性,可以继续考虑因子分析。该检验对样本量敏感,大样本中很弱的相关也可能显著,因此不能只看 P 值。

10.37.13.2 KMO 抽样适合性检验

KMO 越接近 1,通常表示变量的偏相关相对较小、共同因子结构更清晰。常见经验解释为:0.80 以上较好,0.70 左右可接受,0.60 左右需要谨慎,低于 0.50 通常不适合。但应同时检查总体 KMO 和每个变量的 MSA,不能只报告总体值。

10.37.14 模型拟合如何阅读

  • RMSEA:越小通常表示近似拟合越好,同时查看 90% 置信区间;
  • TLI:越接近 1 通常越好;
  • BIC:主要用于同一数据、同一变量下的候选模型相对比较,数值较小者通常更优;
  • 模型卡方检验:检验严格拟合,但对样本量较敏感;
  • 载荷和可解释性:即使拟合指标较好,也必须确认每个因子有足够条目且含义清晰。

不要把单一阈值当作自动判定按钮。EFA 的最终结构应同时满足统计合理性、条目内容一致性和研究领域可解释性。

10.37.15 因子得分如何使用

本模块支持 Thurstone、Bartlett、ten Berge、Anderson-Rubin 和 Harman 五种方法。不同方法对得分的偏差、相关结构和稳定性处理不同。一般探索可使用默认 Thurstone;若既往研究或分析方案指定了方法,应保持一致并在 Methods 中报告。

因子得分是根据当前样本、当前条目、当前提取和旋转结果估计出来的,不等同于原始量表总分。它适合:

  • 描述不同潜在维度的个体差异;
  • 作为后续回归或聚类分析的变量;
  • 与外部效标做相关或效度分析;
  • 在明确分析方案下构造综合维度指标。

CSV 中的 Row 保留原数据中的行号,因子得分只对应完整案例。把得分合并回原始数据时,应根据 Row 对齐,不要仅按当前排序直接拼接。

10.37.16 结果表如何阅读

建议按以下顺序阅读:

  1. 先看模型信息表,确认变量、完整案例数、因子数、提取和旋转方法;
  2. 再看 Bartlett 和 KMO,判断数据是否基本适合因子分析;
  3. 查看碎石图和平行分析,评估因子数量;
  4. 查看载荷和唯一性,判断条目归属、交叉载荷和弱条目;
  5. 查看因子汇总和因子相关,理解解释方差与潜在维度之间的关系;
  6. 查看模型拟合,比较候选因子数或候选提取方案;
  7. 最后检查因子得分摘要和范围,再用于后续分析。

本说明书示例中,Bartlett 检验 P 值小于 0.0001,总体 KMO 为 0.8216;平行分析保留 2 个因子,累计解释方差约为 58.3%,Oblimin 旋转后的因子相关约为 0.35。结果提示两个因子既可以区分,又存在一定相关。具体因子名称仍必须根据各条目的医学或量表内容确定。

10.37.17 表格描述和统计图描述

主要结果表格下方有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把当前表格数值、分析变量、因子数、提取方法、旋转方法和完整案例数作为背景,生成医学论文 Results 部分风格的描述文字。

建议使用方式:

  1. 先确认变量编码、因子数和方法设置正确;
  2. 再点击中文或英文描述按钮;
  3. 把生成文字作为初稿,人工核对载荷方向、因子含义和数值;
  4. 因子命名必须结合条目内容和领域理论,不应由模型自动臆测;
  5. 不要把探索性结果写成因果结论或已被验证的测量结构。

10.37.18 Word 报告

“下载Word报告”会导出当前勾选的探索性因子分析统计表和碎石图;因子得分可单独下载 CSV。报告适合用于:

  • 保存当前分析设置和结果;
  • 给导师、合作者或统计人员初步审阅;
  • 起草论文 Methods 和 Results;
  • 比较不同因子数量、提取方法或旋转方法;
  • 保存适用性检验、载荷、拟合和因子得分摘要。
探索性因子分析:Word 报告和因子得分下载页
探索性因子分析:Word 报告和因子得分下载页

请用 Microsoft Word 打开导出的文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.37.19 从模块结果转入论文写作

如果计划把 EFA 写入论文,建议按以下逻辑整理:

  1. 在 Methods 中说明纳入的条目和样本量;
  2. 说明缺失值处理方式,本模块采用所选变量完整案例分析;
  3. 报告 KMO 和 Bartlett 检验;
  4. 说明因子数的确定依据,例如平行分析、碎石图和理论可解释性;
  5. 报告提取方法、旋转方法和载荷显示或条目保留标准;
  6. 报告保留因子数、解释方差、主要载荷、交叉载荷和因子相关;
  7. 如报告拟合指标,应说明候选模型比较逻辑;
  8. 如使用因子得分,应说明估计方法和后续用途;
  9. 在 Discussion 中把结果表述为探索性结构,并说明需要独立样本 CFA 或重复验证。

10.37.20 常见问题

1. EFA 和 PCA 应该选哪个?

如果目的是探索潜在构念并区分共同方差与唯一性,选 EFA;如果主要目的是压缩变量并构造保留总方差的线性组合,选 PCA。

2. 已经知道量表有三个维度,还需要 EFA 吗?

如果目标是严格验证预先规定的三维结构,应优先考虑 CFA。若量表进入全新人群、语言或疾病场景,也可以先做 EFA 作为结构探索,但应在独立样本中验证。

3. 样本量至少需要多少?

没有适用于所有研究的固定数字。条目数、共同度、载荷强度、因子数和每个因子的条目数都会影响稳定性。应避免只引用“每个条目 5 或 10 人”作为唯一依据。

4. Bartlett 显著就一定能做因子分析吗?

不一定。大样本中很弱的相关也可能显著。还应检查总体 KMO、各条目 MSA、相关矩阵、样本量和载荷结构。

5. 平行分析、特征值和理论给出的因子数不一致怎么办?

把它们视为候选模型。分别检查载荷、交叉载荷、共同度、拟合、因子条目数和理论含义,必要时报告敏感性分析,不要只选择最符合预期的结果。

6. 应该选择 Varimax 还是 Oblimin?

若潜在维度可能相关,通常优先使用 Oblimin 等斜交旋转;只有在理论上明确要求因子不相关,或斜交结果显示相关接近 0 时,再考虑 Varimax 等正交旋转。

7. 为什么有些载荷是空白?

通常是因为载荷绝对值低于左侧设置的显示阈值。调低阈值可以查看这些载荷,但不会改变模型估计。

8. 一个条目在两个因子上都有较高载荷怎么办?

这是交叉载荷。应结合条目内容、两个载荷差异、共同度、量表内容覆盖和删除后的结构变化判断,不能只凭一个固定阈值自动删除。

9. 为什么因子得分行数少于原始样本数?

模块使用所选变量的完整案例。任一所选条目缺失都会使该行不进入当前分析和得分计算。可在模型信息表查看完整案例数和排除行数。

10. 因子得分可以直接当量表总分吗?

不能简单等同。因子得分依赖当前样本和估计方法;量表总分通常由预先规定的计分规则得到。若要替代或比较,需要明确研究依据并进行效度和稳定性评估。

11. 出现 Heywood 情形或迭代警告怎么办?

常见原因包括因子提取过多、样本不足、变量高度共线、共同度异常或模型过于复杂。应检查数据质量,减少因子数,比较其他合理提取或旋转方法,并避免强行解释不稳定结果。

12. 软件可以自动给因子命名吗?

因子名称必须由条目内容、量表理论和专业知识共同决定。软件能提供载荷结构,但不能替代研究者进行医学或心理学命名。

10.37.21 小结

本模块的最佳用法是:先确认数据适合因子分析,再以平行分析和碎石图形成候选因子数,结合载荷、唯一性、因子相关、模型拟合和理论含义确定最终结构。

在论文写作中,应完整报告样本与缺失处理、KMO、Bartlett、因子数依据、提取和旋转方法、主要载荷、解释方差和因子相关。EFA 产生的是探索性证据;重要量表结构应尽可能在独立样本中通过 CFA 或重复分析进一步验证。

10.38 验证性因子分析

10.38.1 模块功能

本模块用于检验研究者预先提出的测量模型是否与观测数据相符。研究者需要在分析前明确潜在因子、每个因子包含的观测指标,以及有理论依据的残差协方差;模块随后估计因子载荷、因子关系、残差参数和整体拟合程度。

验证性因子分析(Confirmatory Factor Analysis, CFA)回答的核心问题是:预先规定的因子结构能否合理解释观测指标之间的协方差关系。它不是根据当前数据自动搜索最漂亮的结构,也不能仅凭拟合指标证明量表“绝对有效”。

当研究者已经确定:

  • 量表或测量工具具有明确的理论维度;
  • 每个条目或指标应归属于哪个潜在因子;
  • 需要检验已有量表在新语言、新地区、新疾病或新人群中的结构;
  • 需要比较若干事先定义的候选测量模型;
  • 需要同时报告标准化载荷、因子关系、拟合指标和模型诊断;

就可以使用本模块建立 CFA 模型,并生成模型信息、因子载荷、因子与残差估计、精确拟合检验、CFI、TLI、SRMR、RMSEA、AIC、BIC、观测相关残差、修正指数和路径图。

本模块用于完成验证性因子分析,支持因子、缺失值、识别约束、估计、拟合和诊断设置;结果表格、图形、中文/英文表格描述和 Word 报告采用 MSTATA 的统一展示方式。

10.38.2 适用场景

本模块适合以下问题:

  1. 检验已有量表的一因子、二因子或多因子结构;
  2. 验证探索性因子分析提出的候选结构;
  3. 评估中文版、简版或修订版量表的结构效度;
  4. 比较相关因子模型、单因子模型或其他理论候选模型;
  5. 检查条目载荷、潜在因子关系及局部拟合偏差;
  6. 为后续结构方程模型建立测量部分。

典型应用包括:

  • 9 个认知测验指标是否分别反映视觉、文字和速度三个潜在维度;
  • 焦虑量表的一般焦虑与躯体症状二因子结构能否得到数据支持;
  • 生活质量量表在某疾病人群中是否仍保持原有维度;
  • 新量表经 EFA 得到的结构能否在独立样本中重复;
  • 两个内容相近条目是否存在理论上可解释的残差相关。

三因子验证例子:研究者预先提出 Visual、Textual 和 Speed 三个因子,分别由 x1-x3x4-x6x7-x9 测量。分析时把三个因子及其指标明确写入面板,使用 FIML 处理缺失值,固定因子方差为 1,并综合查看标准化载荷、因子关系、CFI、TLI、SRMR、RMSEA、残差和修正指数。

不建议用于以下情况:

  • 尚无理论结构,只希望让软件自动发现因子,此时更适合探索性因子分析;
  • 每个因子指标太少,模型无法识别或参数极不稳定;
  • 把 ID、日期、名义分类变量或自由文本直接作为指标;
  • 样本量不足、指标几乎没有变异,或相关矩阵非正定;
  • 仅根据修正指数反复增加路径,直到拟合指标达到某个阈值;
  • 把 CFA 结果直接解释为因果关系或临床干预效果。

10.38.3 支持的分析内容

本模块支持以下分析和结果:

  • 自定义一个或多个潜在因子及其观测指标;
  • 动态新增和删除因子,同一指标不能重复分配;
  • 在有理论依据时指定观测指标之间的残差协方差;
  • 完全信息最大似然(FIML)和整行删除(Listwise)两种缺失值处理;
  • 固定因子方差为 1 和首指标定标两种模型识别约束;
  • 参数 Z 检验、P 值、置信区间和标准化估计;
  • 因子协方差、因子截距、残差方差/协方差和残差截距;
  • 精确拟合卡方检验;
  • CFI、TLI、SRMR、RMSEA、RMSEA 90% 置信区间、AIC 和 BIC;
  • 观测相关残差矩阵及突出显示阈值;
  • 因子载荷和残差协方差修正指数;
  • 可调尺寸的 CFA 路径图;
  • 主要表格的中文与英文 Results 风格描述;
  • 包含当前模型结果和路径图的 Word 报告。

10.38.4 主要特点

  • 左侧面板按因子结构、残差协方差、缺失值、识别约束、估计、拟合、诊断和图形尺寸分区;
  • 新增因子时自动分配尚未使用的候选指标,减少重复选择;
  • 分析前自动检查因子名称、指标数量、重复指标、有效取值和样本量;
  • 主要结果按模型信息、因子载荷、因子估计、残差估计、模型拟合、模型诊断和路径图分标签展示;
  • 所有主要复选框默认勾选,首次分析即可获得完整结果;
  • 主要 flextable 表格提供“对表格进行中文描述”和“对表格进行英文描述”按钮;
  • 路径图可以调整宽度和高度,并与统计表一起写入 Word 报告;
  • 下载页与分析页分开,便于复核模型后保存当前结果。

10.38.5 探索性因子分析、主成分分析和验证性因子分析的区别

方法 主要目的 模型结构 典型使用阶段
探索性因子分析(EFA) 探索潜在因子结构 允许条目在多个因子上估计载荷 量表开发、结构探索
主成分分析(PCA) 用少数线性组合概括原变量 不建立共同因子测量模型 降维、构造综合指标
验证性因子分析(CFA) 检验预先规定的测量模型 明确指定因子、指标和允许的参数 理论验证、候选模型比较

EFA 的重点是“数据可能支持怎样的潜在结构”;CFA 的重点是“预先提出的结构是否得到数据支持”。如果先在同一样本中用 EFA 搜索结构,再用 CFA 验证同一结构,结果仍可能受样本驱动;条件允许时应使用独立样本或拆分样本验证。

10.38.6 生成的表格和图形

一键自动生成以下表格和图形:

结果主面板分为“模型信息”“因子载荷”“因子估计”“残差估计”“模型拟合”“模型诊断”和“路径图”七个标签页。以下示例使用 301 行数据,Visual、Textual 和 Speed 三个相关因子,FIML 缺失值处理和固定因子方差识别;截图中的数值仅用于说明如何阅读结果。

1. 模型信息表

用于复核总行数、完整案例数、缺失值处理、模型识别方式、因子与指标归属、残差协方差和所选拟合指标。

验证性因子分析:模型信息表
验证性因子分析:模型信息表

2. 因子载荷表

显示每个指标所属因子、非标准化载荷、标准误、置信区间、Z 值、P 值和标准化载荷。标准化载荷便于比较同一模型中不同指标与潜在因子的关系强度。

验证性因子分析:因子载荷表
验证性因子分析:因子载荷表

3. 因子协方差和因子截距

因子协方差表描述潜在因子之间的关系。固定因子方差为 1 时,因子协方差可按潜在因子相关的尺度理解;因子截距表则展示潜在均值结构中的截距参数。

验证性因子分析:因子协方差
验证性因子分析:因子协方差
验证性因子分析:因子截距
验证性因子分析:因子截距

4. 残差协方差和残差截距

残差估计反映各观测指标中未被潜在因子解释的部分。若未指定额外残差配对,表中主要显示各指标残差方差;只有事先允许的残差协方差才进入模型。

验证性因子分析:残差协方差
验证性因子分析:残差协方差
验证性因子分析:残差截距
验证性因子分析:残差截距

5. 精确拟合检验和拟合指标

精确拟合卡方检验评价模型隐含协方差矩阵与观测协方差矩阵是否完全一致;CFI、TLI、SRMR 和 RMSEA 从不同角度评价近似拟合;AIC 和 BIC 用于同一数据上的候选模型相对比较。

验证性因子分析:精确拟合卡方检验
验证性因子分析:精确拟合卡方检验
验证性因子分析:模型拟合指标
验证性因子分析:模型拟合指标

6. 观测相关残差矩阵

该矩阵显示模型未充分解释的观测相关。绝对值较大的残差提示局部拟合偏差,可帮助定位指标配对,但不能脱离条目内容自动增加路径。

验证性因子分析:观测相关残差矩阵
验证性因子分析:观测相关残差矩阵

7. 修正指数

修正指数提示释放当前受约束参数后,模型卡方可能下降的程度。模块分别给出候选交叉载荷和候选残差协方差,突出阈值只影响显示重点,不改变已拟合模型。

验证性因子分析:因子载荷修正指数
验证性因子分析:因子载荷修正指数
验证性因子分析:残差协方差修正指数
验证性因子分析:残差协方差修正指数

8. 路径图

矩形表示观测指标,椭圆表示潜在因子;单向箭头表示测量路径,双向箭头表示潜在因子协方差。路径图主要用于核对模型结构,正式报告仍应以参数表和拟合表为准。

验证性因子分析:路径图
验证性因子分析:路径图

示例中共有 301 行数据,9 个指标同时完整的案例为 283 行。FIML 使用所有可利用的信息估计模型,而模型信息表仍列出完整案例数,便于研究者了解缺失情况;改用 Listwise 时仅完整案例进入分析。

10.38.7 数据准备

10.38.7.1 数据格式

数据应采用宽格式:每一行代表一个研究对象或独立观测,每一列代表一个观测指标或量表条目。

ID x1 x2 x3 x4 x5 x6
P001 3.33 7.75 0.38 2.33 5.75 1.29
P002 5.33 5.25 2.13 1.67 3.00 1.11
P003 4.50 5.25 1.29 3.00 1.75 0.43

指标应为数值型、整数型或正确排序的有序数值型。当前模块会把有序变量按其数值顺序送入模型;对于类别很少、偏态明显的有序条目,宜考虑专门的有序分类 CFA 估计方法,并在研究方案中说明。

患者 ID、分组变量、日期和研究中心可以保留在数据中,但不要把它们分配为潜在因子的观测指标。

10.38.7.2 分析前检查

建议在分析前完成以下检查:

  1. 因子结构是否在查看当前结果之前由理论、量表设计或既往研究确定;
  2. 反向题是否已经正确反向计分,所有指标方向是否符合预期;
  3. 每个指标是否至少有两个不同的非缺失值;
  4. 是否存在录入错误、异常值、极端偏态或近乎常数的指标;
  5. 指标之间是否高度重复,相关矩阵是否可能非正定;
  6. 每个因子是否有足够指标,模型是否可识别;
  7. 缺失比例和缺失机制是否支持所选缺失值处理;
  8. 样本量是否与因子数、指标数、载荷强度和模型复杂度相匹配。

CFA 没有适用于所有模型的固定最小样本量。模型复杂、载荷较弱、缺失较多或数据偏离正态时,需要更充分的样本。只使用“每个参数 5 人”或“总样本 200 人”等单一经验规则,不能保证估计稳定。

10.38.8 操作步骤

顶部菜单选择 “按统计学分类模块” → “验证性因子分析” 进入模块。

  1. 在第一个因子中输入因子名称,并选择属于该因子的观测指标;
  2. 点击“新增因子”,继续定义其他潜在因子;
  3. 确认同一指标只属于一个因子,每个因子至少分配 2 个指标;
  4. 只有在明确的理论或测量依据下,才新增残差协方差配对;
  5. 选择 FIML 或 Listwise 缺失值处理;
  6. 选择固定因子方差为 1 或首指标定标;
  7. 保留参数检验、置信区间、标准化估计、因子和残差估计;
  8. 保留卡方检验以及 CFI、TLI、SRMR、RMSEA、AIC 和 BIC;
  9. 保留观测相关残差、修正指数和路径图,并按需要调整突出阈值;
  10. 设置路径图宽度和高度,点击“开始分析”。
验证性因子分析:完整设置面板
验证性因子分析:完整设置面板

10.38.9 如何定义因子结构

因子名称应来自理论构念或量表维度,而不是根据载荷大小临时命名。每个指标只能分配给一个因子;若理论模型需要交叉载荷,应先把它作为明确的候选模型,而不是看到修正指数后随意增加。

  • 一般情况下,每个因子有 3 个或更多指标更容易识别和稳定估计;
  • 只有 2 个指标的因子可能仍可识别,但更依赖整体模型结构和约束;
  • 单指标因子需要额外可靠性或误差约束,当前面板不适合直接建立;
  • 因子之间默认可以相关,更符合多数医学、心理和行为构念;
  • 因子相关过高时,应重新评估区分效度或更简约的结构。

新增因子后,模块会优先分配尚未使用的指标。请逐项核对指标归属,尤其要注意名称相近、不同时间点或反向编码的变量。

10.38.10 缺失值处理如何选择

方法 处理方式 主要考虑
FIML 利用每个研究对象已观测到的信息直接估计模型 通常比整行删除保留更多信息,但仍依赖缺失机制和模型设定
Listwise 任一模型指标缺失即排除整行 实现直观,但缺失较多时会损失样本并可能产生偏倚

FIML 不是自动修复缺失数据。应先描述每个指标的缺失比例和缺失模式,并讨论缺失机制是否合理。若改用 Listwise,应在模型信息表中核对完整案例数,避免实际分析样本远小于原始样本。

10.38.11 模型识别约束如何选择

潜在因子没有天然单位,因此需要设置尺度:

  • 固定因子方差为 1(facVar):把潜在因子的方差固定为 1,所有载荷自由估计。适合直接比较指标对标准化潜在因子的载荷;
  • 以首个指标定标(facInd):把每个因子的第一个指标载荷固定为 1,其他载荷相对于该指标解释。首指标应具有明确含义和稳定测量质量。

两种识别方式不会改变同一模型的整体拟合,但会改变非标准化参数的尺度。比较研究或重复分析时应保持识别方式一致,并优先用标准化估计解释指标关系。

10.38.12 参数估计如何阅读

10.38.12.1 因子载荷

载荷方向应与指标编码和理论一致。标准化载荷绝对值越大,通常表示该指标与潜在因子的关系越强,但不存在适用于所有量表的机械删除线。应同时查看置信区间、标准误、指标内容和残差方差。

  • 载荷很低可能提示指标不能充分反映目标因子;
  • 载荷方向相反可能来自反向题未计分、编码错误或理论不一致;
  • 标准化载荷异常接近或超过 1 可能提示 Heywood 情形、共线性或模型设定问题;
  • P 值显著不能替代对效应大小和测量意义的判断。

10.38.12.2 因子协方差

因子协方差或标准化因子关系反映潜在维度之间的联系。相关适中说明维度彼此相关但仍有区分;相关非常接近 1 时,应考虑两个因子是否缺乏区分效度,或是否存在更简约的高阶/单因子结构。

10.38.12.3 残差估计

残差方差表示指标中未被潜在因子解释的部分。负残差方差是不合常理的 Heywood 情形,需要检查数据、模型识别、共线性、样本量和结构设定,而不是继续报告为正常结果。

10.38.13 模型拟合如何阅读

指标 阅读方向 使用要点
卡方检验 P 值较大表示未拒绝精确拟合 对样本量和模型复杂度敏感,大样本中轻微偏差也可能显著
CFI、TLI 越接近 1 通常越好 与基线模型比较,应结合其他指标和理论判断
SRMR 越接近 0 通常越好 反映标准化残差的总体大小
RMSEA 越接近 0 通常越好 同时报告 90% 置信区间,避免只看点估计
AIC、BIC 同一数据上越小通常越优 只能比较使用相同观测指标和样本的候选模型

常见经验会把 CFI/TLI 接近或高于 0.90/0.95、SRMR 接近或低于 0.08、RMSEA 接近或低于 0.08/0.06 作为参考,但这些不是自动判定标准。模型复杂度、样本量、指标分布、载荷强度、理论合理性和局部残差都必须同时考虑。

本说明书示例的 CFI 为 0.9313、TLI 为 0.8970、SRMR 为 0.0590、RMSEA 为 0.0907(90% CI:0.0700-0.1124),精确拟合卡方检验 P 值小于 0.0001。结果显示不同拟合指标给出的信息并不完全一致,因此不应只凭 CFI 或 SRMR 单独宣布模型拟合良好。

10.38.14 残差协方差如何设置

残差协方差表示两个指标在潜在因子之外仍存在共同变异。合理依据可能包括:

  • 两个条目的措辞、题干或测量方法高度相似;
  • 同一指标在相近时间点重复测量;
  • 两个项目共享明确的方法效应;
  • 既往验证研究事先规定该残差相关。

仅因为修正指数较大就增加残差协方差,会使模型依赖当前样本。每增加一条路径,都应记录理论理由,并在独立样本中重新验证。

10.38.15 观测相关残差和修正指数

10.38.15.1 观测相关残差

残差矩阵用于定位模型没有充分解释的指标配对。绝对值较大的残差提示局部拟合问题,但其来源可能是遗漏交叉载荷、残差相关、异常值、指标分布或因子结构错误。

左侧“突出绝对值高于”只控制哪些残差在结果中被重点标识,不改变模型参数。应先观察残差分布是否集中在有共同内容的条目,再考虑候选模型。

10.38.15.2 修正指数

修正指数估计释放某个固定参数后卡方可能下降多少。数值较大只说明该参数可能改善当前样本拟合,不代表它在理论上正确,也不保证在新样本中稳定。

建议按以下顺序处理:

  1. 先检查数据编码、异常值、载荷和残差;
  2. 判断建议路径是否符合量表内容和预先理论;
  3. 把修改后的结构视为新的候选模型;
  4. 记录每一次修改及理由;
  5. 在独立样本或交叉验证样本中检验。

不要按修正指数从大到小逐条加路径,直到 CFI、TLI 或 RMSEA 达到期望阈值。这种做法会增加过拟合和结果不可重复的风险。

10.38.16 路径图如何阅读

  • 椭圆表示潜在因子;
  • 矩形表示观测指标;
  • 从因子指向指标的单向箭头表示测量载荷;
  • 因子之间的双向箭头表示协方差;
  • 路径图用于检查模型结构是否与研究方案一致;
  • 参数大小、统计不确定性和拟合判断仍以结果表为准。

路径图较拥挤时,可以增大左侧图宽和图高。图形尺寸只影响展示和 Word 排版,不会改变模型估计。

10.38.17 结果表如何阅读

建议按以下顺序阅读:

  1. 先看模型信息表,确认样本量、因子名称、指标归属、缺失处理和识别方式;
  2. 查看因子载荷,确认方向、大小、置信区间和标准化估计;
  3. 查看因子协方差,判断潜在维度之间的联系和区分程度;
  4. 检查残差方差是否为正,是否存在异常估计;
  5. 综合阅读卡方、CFI、TLI、SRMR、RMSEA 及其区间;
  6. 若比较候选模型,再结合 AIC 和 BIC;
  7. 查看观测相关残差和修正指数,定位局部拟合问题;
  8. 最后用路径图核对模型结构,而不是只凭图形判断拟合。

本说明书示例中,9 个指标的标准化载荷约为 0.42-0.85,三个潜在因子之间的关系约为 0.29-0.48。结果提示指标与预设因子均有正向关系,三个维度彼此相关但尚未接近完全重合;是否接受该结构还需要结合 RMSEA、TLI、局部残差、量表理论和独立样本验证。

10.38.18 表格描述和统计图描述

主要结果表格下方有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把当前表格、因子结构、样本量、缺失值处理和识别约束作为背景,生成医学论文 Results 部分风格的描述文字。

建议使用方式:

  1. 先核对因子名称、指标归属和模型设置;
  2. 再点击中文或英文描述按钮;
  3. 把生成文字作为初稿,人工核对参数方向、数值和术语;
  4. 不要把拟合结果写成因果结论或量表绝对有效的证明;
  5. 修正指数和残差只能作为诊断信息,不能由自动描述替代专业判断。

10.38.19 Word 报告

“下载Word报告”会导出当前勾选的验证性因子分析结果,包括模型信息、因子载荷、因子与残差估计、模型拟合、模型诊断和路径图。报告适合用于:

  • 保存当前因子结构与分析设置;
  • 给导师、合作者或统计人员复核;
  • 起草论文 Methods 和 Results;
  • 比较预先规定的候选测量模型;
  • 保存标准化载荷、拟合指标和诊断结果。
验证性因子分析:Word 报告下载页
验证性因子分析:Word 报告下载页

请用 Microsoft Word 打开导出的文档。WPS 可能导致表头、底注或路径图排版兼容性问题。

10.38.20 从模块结果转入论文写作

如果计划把 CFA 写入论文,建议按以下逻辑整理:

  1. 在 Methods 中说明量表、指标和预先规定的因子结构;
  2. 报告分析样本量、缺失比例和缺失值处理方法;
  3. 说明模型识别方式和置信水平;
  4. 说明报告了哪些拟合指标及候选模型比较原则;
  5. 报告主要标准化载荷及其区间或显著性;
  6. 报告潜在因子之间的关系;
  7. 综合报告卡方、df、P 值、CFI、TLI、SRMR、RMSEA 及 90% 置信区间;
  8. 若使用 AIC/BIC 比较模型,说明模型使用相同数据和指标;
  9. 若释放残差协方差或交叉载荷,给出事先依据或透明说明修改过程;
  10. 在 Discussion 中说明样本、估计方法和外部验证的局限。

10.38.21 常见问题

1. CFA 和 EFA 应该选哪个?

已有明确、可检验的理论结构时选 CFA;尚不清楚条目应属于哪些因子时选 EFA。EFA 得到的候选结构最好在独立样本中用 CFA 验证。

2. 每个因子至少需要几个指标?

通常 3 个或更多指标更稳定。2 指标因子可能依赖额外结构和约束;单指标因子需要专门设定,不能直接按普通多指标因子处理。

3. FIML 和 Listwise 应该选哪个?

缺失不多且完整案例充足时,两者可作为敏感性比较。FIML 通常能利用更多信息,但应讨论缺失机制;Listwise 简单直观,却可能明显减少样本并产生偏倚。

4. 固定因子方差与首指标定标有什么区别?

它们是潜在因子定标方式。整体模型相同,但非标准化参数尺度不同。解释和比较时应说明使用哪种方式,并优先参考标准化估计。

5. 卡方检验显著是否表示模型一定不能用?

不一定。卡方检验对样本量敏感,应结合 CFI、TLI、SRMR、RMSEA、局部残差、理论和模型复杂度综合判断。

6. CFI 大于 0.90 就说明模型拟合良好吗?

不能只看一个阈值。CFI、TLI、SRMR、RMSEA 可能给出不同信息,还要检查载荷、残差、异常估计、模型理论和样本特征。

7. AIC 和 BIC 可以判断模型绝对拟合吗?

不可以。AIC 和 BIC主要用于同一数据、相同观测指标下候选模型的相对比较,数值较小通常更优。

8. 修正指数很大,是否应该直接加路径?

不应该。先判断路径是否有理论和测量依据,再把修改后的结构作为新候选模型,并尽可能在独立样本中验证。

9. 因子相关很高怎么办?

检查两个因子的概念是否真正可区分、指标是否内容重叠,以及是否存在更简约的单因子或高阶模型。不要只为降低相关而机械删除条目。

10. 出现负残差方差或标准化载荷超过 1 怎么办?

这可能是 Heywood 情形。应检查样本量、指标共线性、异常值、模型识别和结构设定,不能把异常参数当作正常结果解释。

11. 为什么模型不收敛或提示相关矩阵非正定?

常见原因包括重复或高度相关指标、样本不足、缺失严重、模型过于复杂、指标无变异或模型不可识别。应先检查数据和结构,而不是反复更换阈值。

12. 有序分类条目可以直接分析吗?

当前模块可接收有序数值变量并按数值顺序进入模型。若条目类别很少、分布极不对称或研究方案要求有序分类估计,应使用支持相应相关矩阵和稳健估计量的专门 CFA 方法。

13. 同一样本先做 EFA 再做 CFA 可以吗?

可以作为探索过程,但不能视为严格独立验证。更理想的做法是拆分样本,或在新的独立样本中重复 CFA。

14. 路径图看起来合理就代表模型合理吗?

不是。路径图只展示设定结构,必须结合载荷、置信区间、残差、拟合指标、异常估计和理论依据判断。

10.38.22 小结

本模块的最佳用法是:先依据理论明确因子结构,再检查参数估计和异常结果,综合评价整体拟合与局部残差,并把修正指数仅作为有理论约束的诊断线索。

在论文写作中,应完整报告因子与指标、样本与缺失处理、识别方式、标准化载荷、因子关系、卡方检验、CFI、TLI、SRMR、RMSEA 及其区间;任何模型修改都应透明说明并尽可能在独立样本中验证。CFA 提供的是测量结构与数据相符程度的证据,不能单独证明因果关系或量表在所有人群中的普遍有效性。

10.39 量表信度与项目分析

量表信度与项目分析用于评价一组题项是否能够稳定、一致地反映同一个或高度相关的测量构念。模块同时提供量表层面的内部一致性系数、项目层面的删项诊断、项目相关热图,以及反向计分后的量表均分和总分。

核心原则:信度反映的是当前样本、当前条目组合和当前计分方式下的内部一致性,不等于效度,也不能单独证明量表是单维的。

10.39.1 模块能做什么

  • 计算 Cronbach’s alpha 和 McDonald’s omega。
  • 计算量表均值与标准差。
  • 计算每个项目的均值、标准差和项目-其余项目相关。
  • 查看删除某个项目后 alpha 和 omega 的变化。
  • 指定一个或多个反向计分项目。
  • 绘制项目相关热图。
  • 计算并下载每个完整案例的量表均分和总分。
  • 生成包含表格、图形和统计说明的 Word 报告。

10.39.2 适用场景

  1. 新编或翻译量表的初步条目筛查。
  2. 问卷、症状评分、生活质量、心理行为或功能指标的内部一致性评价。
  3. 在不同人群、语言版本或时间点重新评估已有量表的信度。
  4. 在探索性因子分析或验证性因子分析之前,检查各个预定维度的条目表现。

不建议:不要把明显测量不同构念的条目全部放在同一次信度分析中。多维量表应先根据理论或因子结构分维度评价。

10.39.3 数据准备

数据应为“一个受试者一行,一个量表项目一列”。项目应使用有明确顺序的数值编码,例如 1–5 或 0–4。

数据要素 正确做法 常见问题
每行为一个受试者 同一人被拆成多行
每列为一个题项 把总分和题项同时作为项目
编码 数值越大表示构念程度越高 反向题未经反向计分
缺失 使用空值或统一缺失编码 用 99、999 等未声明数值代表缺失
变异 每个项目至少有两个不同取值 某列全部为同一个数

本模块对所有入选项目使用完整案例分析。只要某个受试者在任一入选项目上缺失,该行就不进入本次信度系数和得分计算。结果页会报告总行数、完整案例数和排除行数。

10.39.4 使用步骤

10.39.4.1 1. 进入模块

在顶部菜单选择 “按统计学分类模块”,进入 “测量与心理统计” 分类,点击 “量表信度与项目分析”

10.39.4.2 2. 选择量表项目

在“选择量表项目”中选择同一量表或同一维度的条目,至少选择 2 项。按钮可以快速全选或清空。

10.39.4.3 3. 指定反向计分项目

将问卷中表述方向与总构念相反的项目放入“反向计分项目”。模块按该项目在完整案例中的最小值与最大值自动反向:

\[ X_{reverse}=X_{min}+X_{max}-X \]

例如,1–5 计分的 1、2、3、4、5 将被转换为 5、4、3、2、1。

注意:只有研究者知道哪些题是反向题。项目与总分呈负相关可以提示编码问题,但不能代替问卷计分手册。

10.39.4.4 4. 选择输出

左侧面板默认勾选全部统计表、项目相关热图、量表均分和总分。不需要的内容可取消勾选;当某类指标全部取消时,对应结果表不会输出。

10.39.4.5 5. 开始分析

点击 “开始信度分析”。如果项目数不足、项目无变异、完整案例太少或数据类型不适合,页面会保留当前会话并显示明确错误信息,不会因单次分析失败而退出整个应用。

10.39.5 结果解读

10.39.5.1 分析信息与量表信度

首先确认入选项目、反向计分项目、总行数、完整案例数和排除行数。若排除比例较高,应先评估缺失模式及其可能影响。

Cronbach’s alpha 是常用的内部一致性指标。它受项目数、项目间相关和量表结构影响。较高的 alpha 并不自动证明单维性,过高的系数还可能提示项目内容重复。

McDonald’s omega 在不要求每个项目贡献完全相同的条件下评价内部一致性。当项目载荷差异明显时,omega 往往比 alpha 更适合作为补充证据。

下列阈值只能用作粗略参考,不应机械套用:

系数范围 常见描述 解读要点
< 0.60 偏低 检查反向计分、项目质量、多维性和样本适用性
0.60–0.69 一般 探索性研究中可结合其他证据解释
0.70–0.79 可接受 仍应检查项目内容和维度结构
0.80–0.89 良好 通常表示较强内部一致性
>= 0.90 很高 同时检查是否存在过度相似或重复项目

10.39.5.2 项目分析

项目-其余项目相关是某个项目与其余项目合成得分的相关。较低或负值需要重点检查,常见原因包括反向计分错误、项目与构念不符、项目表述不清或量表存在多维结构。

删除项目后的 alpha/omega 表示移除该项目后余下量表的系数。若删项后系数上升,只说明该项目在当前样本中降低了内部一致性;是否删除仍要结合内容效度、理论覆盖和独立样本验证。

10.39.5.3 项目相关热图

热图用颜色和数值展示项目间的相关方向与强度。应关注:

  • 反向计分后仍与多数项目呈负相关的条目。
  • 几乎不与其他项目相关的孤立条目。
  • 相关过高、可能内容重复的项目对。
  • 呈现多个相关块的结构,这可能提示量表包含多个维度。

10.39.5.4 量表得分

量表均分和总分均在反向计分后计算。得分摘要表报告样本量、均值、标准差、最小值和最大值;预览表显示前 20 个完整案例,全部得分可下载为 CSV。

10.39.6 下载 Word 报告

进入 “下载Word报告” 页签,下载当前分析的 Word 文档。报告只收录本次勾选并成功生成的表格和图形。

建议:请用微软 Word 打开下载文档,以保持表头、底注和图形排版。

10.39.7 论文报告建议

方法部分建议说明:

  1. 量表名称、维度和入选项目数。
  2. 项目的评分范围及反向计分规则。
  3. 分析的样本与缺失值处理方法。
  4. 使用的信度指标和项目诊断方法。

结果部分建议报告:

  1. 总样本量、完整案例数及排除数。
  2. alpha 和 omega,必要时报告置信区间或敏感性分析。
  3. 项目-其余项目相关的范围及异常项目。
  4. 任何删项决定及其理论和统计依据。

可参考如下写法:

该维度共包含 8 个项目。在完整案例中,Cronbach’s alpha 为 0.86,McDonald’s omega 为 0.87,表明当前样本中量表具有良好的内部一致性。项目-其余项目相关介于 0.41 至 0.68,删除任一项目均未使量表信度明显提高。

10.39.8 常见问题

1. alpha 达到 0.70 就一定合格吗?

不一定。阈值与研究用途、项目数、构念宽度和测量阶段有关,还应结合 omega、项目诊断、因子结构和内容效度。

2. alpha 越高越好吗?

不是。过高的 alpha 可能来自内容重复项目,并不代表量表覆盖了构念的所有重要方面。

3. alpha 和 omega 应该报告哪个?

在条件允许时可同时报告。alpha 便于与既往研究比较;omega 对项目贡献不完全相同的情形通常更灵活。

4. 删除某项后 alpha 上升,应该直接删吗?

不应直接删除。先检查反向计分、数据录入、项目表述和因子结构,再结合内容效度和独立样本证据决定。

5. 可以把所有维度一起算一个 alpha 吗?

只有在理论和结构上支持总分时才应这样做。多维量表通常应分别评价各维度的信度。

6. 为什么样本数变少了?

本模块对入选项目使用完整案例分析。任一项目缺失都会使该行从当前分析中排除。

7. 量表得分为什么与原数据直接求和不同?

检查是否选择了反向计分项目,以及原数据是否有缺失。模块在反向计分和完整案例筛选后再计算均分和总分。

8. 信度很高是否证明量表有效?

不能。信度是效度的重要条件之一,但仍需要内容效度、结构效度、效标关联效度和跨人群验证等证据。

10.39.9 小结

本模块的最佳使用方式是:先核对项目方向和缺失情况,再联合解读 alpha、omega、项目-其余项目相关、删项系数和相关结构,最后根据量表理论与内容效度作出项目决策。

信度系数应与研究样本、量表版本和计分方法一起报告。它们提供的是内部一致性证据,不能单独代替因子结构、效度或临床解释。

10.40 概化理论分析

概化理论分析用于把观测分数中的变异分解为测量对象、项目、评定者、任务等来源,并评价结论能否概化到更广的测量条件。与只给出一个总体信度系数的方法不同,概化理论可以同时回答“误差主要来自哪里”和“增加多少项目或评定者后,测量能达到怎样的可靠程度”。

两个阶段:G 研究估计各方差来源;D 研究把这些方差分量代入计划采用的项目数、评定者数或任务数,计算概化系数和可依赖系数。先诊断误差结构,再评价具体测量方案。

10.40.1 模块能做什么

  • 进行单变量 G 研究和 D 研究;
  • 选择一个测量对象和一至两个测量分面;
  • 使用主效应、完全交叉两两项或自定义随机效应公式;
  • 输出单次观测和当前测量设计的方差分量;
  • 计算概化系数、可依赖系数、宇宙分数方差、相对误差方差和绝对误差方差;
  • 对多变量分层设计输出各层方差分量、层间观测协方差、宇宙分数协方差、各层系数和组合测量结果;
  • 在单变量、单分面设计中绘制 D 研究系数曲线;
  • 为每张主表和统计图生成中英文描述,并下载 Word 和 CSV。

所有结果输出默认勾选。数据校验、公式解析、模型拟合、绘图和下载均有错误隔离;某次设置不成立时,错误只显示在当前模块内,不会使整个应用退出。

10.40.2 适用场景

  1. 多个评定者对同一批病例进行量表、影像或病理评分。
  2. 由多个项目或任务构成的能力、知识、技能或症状测量。
  3. 同时受到项目与评定者影响的临床评分或操作考核。
  4. 计划缩短量表、减少评定者或增加测量次数,并评价可靠性变化。
  5. 多个分测验或测量领域构成的组合分数,需要评价各层及整体结果。

不适用:若每名对象只有一个观测值,无法把对象差异与分面误差分开。若研究目的只是评价两种连续测量方法的差值一致性,应使用 Bland–Altman 分析;若只需普通组内相关系数或 Kappa,应使用医学一致性分析。

10.40.3 统计原理

10.40.3.1 G 研究与方差分量

以人员 \(p\) 和项目 \(i\) 的单分面设计为例,观测分数可以写为:

\[ Y_{pi}=\mu+p+i+(pi,e), \]

其中 \(p\) 表示测量对象的稳定差异,\(i\) 表示项目难度或项目水平差异,\((pi,e)\) 表示对象与项目交互及未分离残差。G 研究估计对应的方差分量:

\[ \sigma_p^2,\quad \sigma_i^2,\quad \sigma_{pi,e}^2. \]

若同时存在项目和评定者,可进一步设置对象、项目、评定者以及有重复观测支持的两两交互。方差分量越大,表示该来源对观测分数差异的贡献越大。负方差不具有通常的方差解释;奇异拟合或接近 0 的分量应结合设计、样本量和重复观测重新评估。

10.40.3.2 相对决策和绝对决策

相对决策关注对象之间的排序。对单分面设计、计划使用 \(n_i\) 个项目时,相对误差方差可概括为:

\[ \sigma_\delta^2=\frac{\sigma_{pi,e}^2}{n_i}, \]

概化系数为:

\[ E\rho^2=\frac{\sigma_p^2}{\sigma_p^2+\sigma_\delta^2}. \]

绝对决策关注分数是否超过固定阈值,因此项目难度差异也构成误差:

\[ \sigma_\Delta^2=\frac{\sigma_i^2}{n_i}+\frac{\sigma_{pi,e}^2}{n_i}, \]

可依赖系数为:

\[ \Phi=\frac{\sigma_p^2}{\sigma_p^2+\sigma_\Delta^2}. \]

因此,可依赖系数通常不高于概化系数。前者适合通过/不通过、达到阈值与否等绝对判断;后者适合排名、比较或相对位置判断。

10.40.3.3 D 研究

D 研究不重新估计对象和分面的原始方差,而是根据计划中的分面水平数对误差方差进行平均化。增加项目数或评定者数通常会减小相应误差方差,但收益会逐渐变小。D 研究曲线用于寻找可靠性改善和测量成本之间的合理平衡,而不是机械追求系数接近 1。

10.40.3.4 多变量分层设计

多变量设计把分测验、领域或评分维度作为分层变量。模块在每一层内估计 G 研究和 D 研究,并输出层间观测方差与协方差、层间宇宙分数方差与协方差、各层系数及组合测量结果。组合系数依赖当前层间结构和默认组合方式,不能代替研究方案中预先规定的临床或测量学权重。

10.40.4 数据准备

数据必须使用长表结构,每行代表某个对象在某个测量条件下的一次观测。下例为人员、分测验、项目和评定者构成的数据:

Person Subtest Item Rater Score
P01 认知 I01 R01 10.8
P01 认知 I01 R02 10.4
P01 认知 I02 R01 11.2
P02 认知 I01 R01 9.6
P02 操作 I01 R01 10.1
  • 连续结局变量:每次评分、得分或连续测量值;
  • 测量对象变量:患者、受试者、样本或被评价对象的唯一编号;
  • 测量分面:项目、评定者、任务、时间或设备等误差来源;
  • 分层变量:仅多变量设计使用,例如分测验、领域或结局维度;
  • 每个对象、分面和分层变量至少需要两个有效水平;
  • 结局、对象、分面和分层变量不能重复;
  • 当前模块最多选择两个测量分面;
  • 分析按全部入选变量进行完整案例排除;
  • 随机效应分组水平数必须小于有效观测数;
  • 交互方差需要重复观测支持,不能为每条观测创建唯一的随机效应水平。

设计先于公式:完全交叉公式只适用于对象、项目和评定者确实交叉,且相应交互单元有重复信息的设计。若评定者嵌套在任务内,或某个交互水平与每一行一一对应,应使用符合实际抽样结构的自定义公式,不能因为菜单可选就强行加入全部交互。

10.40.5 使用步骤

10.40.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “信度与一致性分析” → “概化理论分析”

10.40.5.2 2. 选择变量

选择连续结局、测量对象和一至两个测量分面。单变量设计不需要分层变量;多变量分层设计还需选择分测验或领域变量。模块会把对象、分面和分层变量按分类变量处理。

10.40.5.3 3. 选择公式

  • 自动:主效应:适合初始分析和简单设计,公式包含对象及各分面的随机截距;
  • 自动:完全交叉两两项:在主效应外加入对象×分面以及分面×分面的两两交互;
  • 自定义公式:用于嵌套、不完全交叉或研究方案预先规定的结构。

自定义公式左侧必须是当前结局变量,只能引用已选择变量,并至少包含一个随机效应项。页面会显示本次实际使用的公式,运行前应逐项核对。

10.40.5.4 4. 设置 D 研究曲线

单变量、单分面设计可设置曲线的最大分面水平数,并选择同时显示概化系数和可依赖系数,或只显示其中一种。曲线从 1 个分面水平开始,最多支持 50 个水平。

10.40.5.5 5. 核对输出并开始分析

主表、矩阵和 D 研究曲线默认全部勾选。左侧不提供图像宽高设置;统计图使用稳定尺寸渲染,并可在图下下载 PNG、TIFF、SVG 和 PDF。点击 “开始概化理论分析” 后,先检查分析概览中的变量、有效观测数和公式,再阅读 G 研究和 D 研究。

概化理论分析:完整设置与分析概览
概化理论分析:完整设置与分析概览

10.40.6 结果解读

10.40.6.1 分析概览

概览表列出分析类型、结局、对象、分面、分层变量、有效观测数和实际公式。若公式与研究设计不一致,后续系数即使能计算也不应解释。完整案例明显少于原始数据时,应评估缺失是否集中在特定对象、项目或评定者。

10.40.6.2 G 研究方差分量

G 研究表报告每个方差来源的估计值、占总方差比例及单次观测的分面水平乘积。

概化理论分析:G 研究方差分量
概化理论分析:G 研究方差分量

解释时重点区分:

  • 对象方差:反映被测对象之间的稳定差异,是可靠区分对象的信号;
  • 分面主效应:反映项目难度、评定者宽严或任务条件的系统差异;
  • 对象×分面交互及残差:反映不同对象对分面反应不一致及未分离误差;
  • 分面间交互:反映某些项目在特定评定者或任务条件下表现不同。

方差占比高不自动说明该来源具有临床重要性;它只表示在当前设计和样本中,该来源对分数变异贡献较大。

10.40.6.3 D 研究方差分量和测量系数

D 研究表将当前数据中每个对象实际拥有的分面水平数纳入平均化,报告计划测量设计下的方差分量。与单次观测相比,分面相关误差通常会下降。

概化理论分析:D 研究方差分量
概化理论分析:D 研究方差分量

系数表同时给出概化系数、可依赖系数、宇宙分数方差、相对误差方差、绝对误差方差及测量标准误。不能只报告系数而不说明分面数量和决策类型;同一个数据集在不同项目数或评定者数下会得到不同系数。

概化理论分析:概化与可依赖系数
概化理论分析:概化与可依赖系数

常用的 0.70、0.80 或 0.90 阈值只能作为情境化参考。低风险的群体研究、个体筛查和高风险临床决策对可靠性的要求不同,应结合测量用途、误分类后果、成本和既往规范预先确定目标。

10.40.6.4 D 研究曲线

D 研究曲线展示增加分面水平数时系数的变化。示例中前几个项目带来的提升较明显,之后曲线逐渐变平,提示继续增加项目的边际收益下降。

概化理论分析:D 研究系数曲线
概化理论分析:D 研究系数曲线

选择最终项目数时,应综合目标可靠性、测量时长、患者负担、评分成本和内容覆盖。曲线只反映当前方差结构;若缩短量表会改变内容范围或被测构念,不能假定方差分量保持不变。

10.40.6.5 多变量分层结果

多变量模式按分层变量的每个水平输出 G/D 研究方差分量,并估计层间协方差。应先检查各层的样本和分面结构是否可比,再解释层间矩阵和组合结果。

概化理论分析:多变量分层 G 研究
概化理论分析:多变量分层 G 研究

层间观测协方差包含真实对象差异与误差;宇宙分数协方差更接近各层稳定对象差异之间的关系。各层系数用于评价单独分测验,组合测量结果用于评价当前多层组合。层间相关较高不代表多个分测验可以随意合并,仍需理论、内容和结构证据。

概化理论分析:多变量系数和矩阵
概化理论分析:多变量系数和矩阵

10.40.7 表格描述和下载

每张主表下方提供 “对表格进行中文描述”“对表格进行英文描述” 按钮。D 研究曲线可生成中英文图形描述,并下载 PNG、TIFF、SVG 和 PDF。自动描述需要人工核对公式、分面结构、相对/绝对决策和有效观测范围。

进入 “下载 Word 报告” 页签,可下载当前成功生成的表格和图形。结果 CSV 将各结果表合并并保留表名,便于复核或归档。

概化理论分析:Word 与 CSV 下载
概化理论分析:Word 与 CSV 下载

建议:请用微软 Word 打开报告。正式研究应同时保存原始长表数据、变量字典、抽样设计、实际公式、缺失处理、G 研究结果、D 研究方案和报告文件。

10.40.8 论文报告建议

方法部分建议说明:

  1. 测量对象、分面和分层变量的定义;
  2. 设计是交叉、嵌套还是不完全平衡;
  3. 每个对象的项目数、评定者数或测量次数;
  4. G 研究随机效应公式和方差估计结构;
  5. D 研究的相对或绝对决策目标;
  6. 缺失值、异常评分和不平衡数据的处理;
  7. 预先规定的目标可靠性和测量成本约束。

结果部分建议依次报告有效观测数、主要方差来源、对象方差、相对和绝对误差方差、当前设计下的概化系数与可依赖系数,以及候选分面水平数的 D 研究结果。

可参考如下写法:

采用概化理论评价 18 名对象在 4 个项目上的测量可靠性。G 研究将对象和项目设为随机分面,并估计对象、项目及残差方差。对象方差占总方差的主要部分;当前 4 项设计的概化系数为 0.xx,可依赖系数为 0.xx。D 研究显示,项目数由 4 增至 6 时两种系数均提高,但此后曲线趋于平缓。基于预先规定的可靠性目标和测量负担,最终保留 6 个项目。

示例中的数值占位符必须替换为实际结果。若公式包含交互或嵌套结构,应明确报告各方差来源,不能只写“进行了信度分析”。

10.40.9 常见问题

1. 概化系数和 Cronbach’s alpha 有什么区别?

alpha 主要反映一组项目的内部一致性;概化理论可以同时估计项目、评定者、任务及其交互等多个误差来源,并为不同测量方案进行 D 研究。

2. 概化系数和可依赖系数报告哪个?

相对排序或组间比较以概化系数为主;固定阈值、是否达标等绝对决策以可依赖系数为主。研究同时涉及两类用途时可同时报告。

3. 为什么可依赖系数通常更低?

绝对决策把分面主效应也视为误差,例如项目整体偏难会改变是否超过固定阈值,因此绝对误差方差通常大于相对误差方差。

4. 默认主效应公式和完全交叉公式如何选?

先按实际抽样设计选择。简单设计可从主效应开始;只有对应交互具有重复信息且研究设计确实交叉时,才加入完全交叉两两项。

5. 为什么完全交叉公式提示随机效应水平过多?

某个交互可能与每条观测一一对应,没有重复信息可用于区分交互方差和残差。应简化公式,或根据实际设计改为嵌套/部分交叉结构。

6. 数据不平衡可以分析吗?

可以处理一定程度的不平衡,D 研究会依据对象实际拥有的分面水平数更新误差分量。但严重不平衡、结构性缺失或某些对象只由特定评定者评价,会使方差来源难以分离,应报告分布并做敏感性分析。

7. 系数达到 0.80 就一定足够吗?

不一定。阈值应取决于用途、误分类后果、测量成本和领域规范。高风险个体决策通常需要更高可靠性和外部验证。

8. D 研究曲线可以直接决定项目数吗?

不能单独决定。曲线只反映可靠性与分面水平数的统计关系,还要考虑内容效度、时间、费用、患者负担及缩短后构念是否改变。

9. 为什么某个方差分量接近 0?

可能表示该来源在当前样本中变异很小,也可能来自样本不足、设计混淆或奇异拟合。应检查水平数、交叉结构、重复观测和模型稳定性。

10. 对象编号可以用连续整数吗?

可以。模块会把测量对象和分面变量转换为分类变量,但编号必须稳定且能唯一标识对象。

11. 多变量分层变量与普通分面有什么区别?

分面表示测量条件或误差来源;分层变量表示多个需要联合评价的分测验、领域或结局维度。两者在模型中的统计角色不同,不能只因变量是分类变量就随意互换。

12. 可以把不同医院当作分层变量吗?

只有当目标是把医院作为多个联合测量层,并且各院内具有可比的对象和分面设计时才考虑。若医院代表聚类、中心效应或外部验证场景,通常应使用多水平模型或分中心分析。

10.40.10 小结

本模块的可靠使用流程是:先把数据整理成长表并明确对象、分面和分层结构,按真实抽样设计核对随机效应公式,先用 G 研究识别主要误差来源,再用 D 研究评价候选测量方案,最后结合相对/绝对决策目标、测量成本和内容效度确定方案。

概化理论的优势不只是给出一个信度数字,而是把可靠性与具体测量设计联系起来。透明的设计说明、正确的公式和克制的 D 研究外推,是结果可解释和可重复的关键。

10.41 Rasch 与项目反应分析

Rasch 与项目反应分析用于把受试者的潜在水平和项目难度放在同一个 logit 尺度上。二分类项目使用 Rasch 模型;三个及以上有序类别的项目使用部分计分模型。模块同时提供项目参数、拟合、局部依赖、残差维度、测量信度、人员参数、原始分换算和差异项目功能诊断。

核心原则:Rasch 分析不是只寻找一个高信度系数。它要求数据在项目拟合、局部独立、主要维度、类别使用和跨组稳定性等方面共同支持所采用的测量模型。任何单一阈值都不应代替对项目内容、样本构成和多项诊断证据的综合判断。

10.41.1 模块能做什么

  • 自动识别二分类项目或多分类有序项目,并拟合相应测量模型。
  • 使用条件极大似然或边际极大似然估计项目位置与类别阈值。
  • 估计 WLE 或 EAP 人员参数,并输出人员参数 CSV。
  • 计算项目 Infit 和项目—剩余总分诊断。
  • 使用 Q3 残差相关检查局部依赖,并显示最大的项目对。
  • 使用残差主成分分析检查次级维度线索。
  • 输出 alpha、人员分离信度、边际信度和 RMU 等测量精度指标。
  • 生成原始总分到 logit 人员参数及标准误的换算表。
  • 按分组变量进行项目层级或阈值层级的 DIF 分析。
  • 绘制目标匹配、类别概率、项目特征曲线、Q3 热图、残差 PCA、人员参数、得分换算和 DIF 图形。
  • 生成包含当前所选表格、图形和分析提示的 Word 报告。

10.41.2 适用场景

  1. 评价患者报告结局量表、知识测验、症状清单或能力测验的项目表现。
  2. 检查不同项目的相对难度和量表对目标人群的覆盖范围。
  3. 识别与其他项目不一致、与剩余总分关系异常或可能局部依赖的项目。
  4. 建立原始总分到潜在水平的换算,并描述不同分数位置的测量误差。
  5. 比较性别、年龄组、治疗组、地区或语言版本之间是否存在 DIF。
  6. 在正式修订量表前,形成需要进一步进行内容审查或独立验证的项目清单。

方法边界:本模块适用于由二分类或有序多分类项目组成的单一主要测量结构。若目标是自由探索多个潜在因子,应使用探索性因子分析;若已有明确的多因子测量模型,应使用验证性因子分析。DIF 标记也不等于项目必然有偏倚,仍需结合题意、翻译、分组构成和外部证据复核。

10.41.3 数据准备

每行应代表一名受试者,每列代表一个项目。至少选择 5 个项目,并至少保留 30 名对全部入选项目均有完整作答的受试者。

要求 说明
项目类型 数值型、整数编码且具有明确顺序的项目
项目数量 至少 5 个项目
类别数量 每个项目至少 2 类,最多 15 类
类别间距 必须为连续整数,如 0、1、2、3 或 1、2、3、4
项目方向 所有项目应预先调整为同一方向,较高类别表示较高的同一潜在特质
有效样本 入选项目完整案例至少 30 名受试者
DIF 分组 可选;至少 2 组,每组至少 10 名具有完整项目和分组信息的受试者

若项目从 1 开始编码,模块会在分析内部平移为从 0 开始;类别顺序与类别间距不变,分析信息会列出每个项目的原始范围、转换范围和偏移量。该平移不等于反向计分。

模块对全部入选项目使用完整案例分析。任一项目缺失会使该受试者从主分析中排除;仅 DIF 分组变量缺失时,受试者仍可进入主模型,但会从 DIF 分析中排除。

10.41.4 主要统计量

10.41.4.1 项目位置和类别阈值

项目参数以 logit 表示。较大的项目位置或阈值通常表示需要较高潜在水平才能达到相应类别。多分类项目的阈值应结合类别概率曲线检查;阈值顺序异常可能提示类别含义重叠、类别使用稀少或项目反应结构不理想。

  • 条件极大似然(CML):估计项目参数时不直接假定人员分布,常作为 Rasch 分析的主要方法。
  • 边际极大似然(MML):通过假定潜在水平分布联合估计,适合需要与相应人员参数或其他模型结果比较的场景。

10.41.4.2 项目 Infit

Infit 对靠近受试者潜在水平的非预期反应更敏感。数值偏大提示反应噪声或模型未解释的变异,数值偏小可能提示项目过度可预测、内容重复或局部依赖。阈值应结合模拟区间、样本量、项目内容和其他诊断结果解释,不宜只按固定经验界值机械删项。

10.41.4.3 项目—剩余总分关系

该诊断把每个项目与删除该项目后的总分联系起来,用于检查项目是否与量表其余部分保持一致方向和足够关联。多重比较校正可选择 FWER、FDR 或不校正;若同时检查多个项目,通常应保留校正。

10.41.4.4 Q3 局部依赖

Q3 是项目残差之间的相关。较大的正残差相关表示在共同潜在水平之外,两项目仍共享额外信息,可能来自题干相似、共同情境、连续提问或局部内容簇。应优先查看最大的项目对,并结合 Q3 热图和题目内容核实。

10.41.4.5 残差主成分分析

残差 PCA 用于检查主要测量维度之外是否仍存在系统结构。较大的首个残差成分或成组的正负载荷可能提示次级维度,但残差成分不能直接当作实质因子命名;需要结合项目内容、因子分析和独立样本复核。

10.41.4.6 测量信度

模块可报告 alpha、人员分离信度(PSI)、边际信度和 RMU。不同指标的定义与估计方式不同,不应把它们当作完全等价的数值。信度反映当前样本中分数或人员参数的区分精度,不能证明单维性、内容效度或跨组稳定性。

10.41.4.7 人员参数和得分换算

WLE 或 EAP 人员参数以 logit 表示,0 附近对应当前项目参数中心。标准误随测量位置变化,极端原始分通常具有更大的不确定性。原始分—logit 表适合描述当前项目组合的换算关系;项目、计分或目标人群改变后应重新估计。

10.41.4.8 差异项目功能

DIF 检查潜在水平相近的受试者在不同分组中是否仍表现出不同项目位置或阈值。模块先给出总体似然比检验,再给出项目或阈值结果,并按预设 logit 差异阈值标记。统计显著但差异很小与差异较大但区间很宽的情形应区别解释。

一键自动生成以下表格和图形:

  • 分析信息与项目类别编码表;
  • 项目参数、项目 Infit 和项目—剩余总分诊断;
  • 最大 Q3 项目对、残差主成分和测量信度;
  • 人员参数汇总和原始分—logit 换算表;
  • DIF 总体检验和项目或阈值结果;
  • 目标匹配、类别概率、项目特征曲线、Q3 热图、残差 PCA、人员参数、得分换算和 DIF 图形。

10.41.5 使用步骤

10.41.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “信度与一致性分析” → “Rasch 与项目反应分析”

10.41.5.2 2. 选择项目和 DIF 分组

在“项目变量”中选择至少 5 个有序整数项目。项目较多时可使用“全选”和“清空”按钮快速调整。若需要跨组比较,再选择一个 DIF 分组变量;不进行 DIF 时保持“不进行 DIF 分析”。

10.41.5.3 3. 设置估计方法

  • 项目参数估计:默认 CML,也可选择 MML。
  • 项目参数表:长格式逐行显示项目和阈值,宽格式便于横向比较。
  • 人员参数估计:默认 WLE,也可选择 EAP。
  • 信度人员参数方法:可选 WLE、EAP、MAP 或 ML。
  • 置信水平:可选 90%、95% 或 99%。
  • 人员参数范围:限定人员参数、换算和有关图形的 logit 范围;下限必须小于上限。

10.41.5.4 4. 设置模型诊断

  • Q3 估计方法:可选 CML 或 MML。
  • 多重比较校正:默认 FDR(BH),也可选择 FWER、FDR(BY)或不校正。
  • Q3 项目对与残差主成分数量:控制表中重点展示的诊断数量。
  • 信度抽样次数、RMU 迭代和 Bootstrap:增加次数可提高数值稳定性,但会延长运行时间。
  • 模拟诊断阈值:可对 Infit、Q3 和残差 PCA 生成样本特异的模拟阈值;模拟 P 值要求至少 1000 次模拟。
  • 随机种子:保证抽样、Bootstrap 和模拟结果可复现。

10.41.5.5 5. 设置 DIF 和图形

选择 DIF 分组后,可在项目层级和阈值层级之间切换,并设置 logit 差异阈值。类别分布图可按频数或百分比标记组间差异。目标匹配图可选择稳健人员分布、项目排序和分箱数;项目特征曲线可按分位数、等宽区间或原始分形成能力组。

10.41.5.6 6. 选择输出并开始分析

左侧结果表和图形默认全部勾选。取消勾选后,相应内容不会显示,也不会写入 Word 报告。点击 “开始 Rasch 分析” 后,数据验证、模型估计、诊断、图形和下载错误都会在模块内显示,不会让整个应用退出。

Rasch 与项目反应分析:完整设置面板
Rasch 与项目反应分析:完整设置面板

10.41.6 结果解读

10.41.6.1 分析概览

先核对识别出的测量模型、项目数、总行数、完整受试者、排除数、项目与人员参数估计方法、置信水平、人员参数范围、DIF 分组、模拟设置和随机种子。项目类别编码表用于确认是否发生从 1 起始到 0 起始的平移。

Rasch 与项目反应分析:分析概览
Rasch 与项目反应分析:分析概览

10.41.6.2 项目参数与拟合

项目参数表用于比较位置和类别阈值;Infit 表用于识别非预期或过度可预测的反应模式;项目—剩余总分表用于检查项目与其余量表的一致方向。建议先确认类别编码,再联合三张表和项目内容判断,不要仅因某一列超过经验界值直接删项。

Rasch 与项目反应分析:项目参数
Rasch 与项目反应分析:项目参数
Rasch 与项目反应分析:项目 Infit
Rasch 与项目反应分析:项目 Infit
Rasch 与项目反应分析:项目—剩余总分诊断
Rasch 与项目反应分析:项目—剩余总分诊断

10.41.6.3 模型诊断

Q3 表优先显示残差相关最大的项目对;残差 PCA 表显示主要残差成分;信度表从不同角度描述测量精度。局部依赖、次级维度和信度应联合解释:高信度可能由重复内容或局部依赖抬高,不能抵消模型诊断中的问题。

Rasch 与项目反应分析:Q3 局部依赖
Rasch 与项目反应分析:Q3 局部依赖
Rasch 与项目反应分析:残差 PCA
Rasch 与项目反应分析:残差 PCA
Rasch 与项目反应分析:测量信度
Rasch 与项目反应分析:测量信度

10.41.6.4 人员与评分

人员参数汇总包括均值、标准差、范围、平均标准误、极端分数数目和原始分分布。得分换算表给出每个可用原始分对应的 logit、标准误和置信区间。极端分数附近的不确定性通常更大,应避免报告过多小数或过度精细地解释个体差异。

Rasch 与项目反应分析:人员参数汇总
Rasch 与项目反应分析:人员参数汇总
Rasch 与项目反应分析:原始分—logit 换算
Rasch 与项目反应分析:原始分—logit 换算

10.41.6.5 DIF

若选择分组变量,先查看总体似然比检验,再查看项目或阈值差异、置信区间和预设阈值标记。DIF 结果应报告分组定义、每组样本量、检验层级、阈值与置信水平;标记项目需回到题意和分组响应分布复核。

Rasch 与项目反应分析:DIF 总体检验
Rasch 与项目反应分析:DIF 总体检验
Rasch 与项目反应分析:DIF 项目结果
Rasch 与项目反应分析:DIF 项目结果

10.41.7 图形解读

10.41.7.1 目标匹配图

目标匹配图把人员潜在水平分布和项目位置放在同一 logit 尺度上。人员集中但缺少相应项目的位置提示测量覆盖不足;项目集中在人员分布之外则表示该区域信息有限。

Rasch 与项目反应分析:目标匹配图
Rasch 与项目反应分析:目标匹配图

10.41.7.2 类别概率与项目特征曲线

类别概率曲线显示不同潜在水平下各反应类别成为最可能类别的区域。中间类别从不占优势或曲线交叉顺序异常时,应检查类别定义和使用频数。项目特征曲线用于比较模型预期与按能力分组的观测表现。

Rasch 与项目反应分析:类别概率曲线
Rasch 与项目反应分析:类别概率曲线
Rasch 与项目反应分析:项目特征曲线
Rasch 与项目反应分析:项目特征曲线

10.41.7.3 Q3、残差和人员参数图

Q3 热图用于定位成组的正残差相关;残差 PCA 图用于查看主要残差成分;人员参数分布图显示当前项目组合对目标样本的测量位置和极端分数情况。图形用于发现模式,不能代替正式检验和内容审查。

Rasch 与项目反应分析:Q3 热图
Rasch 与项目反应分析:Q3 热图
Rasch 与项目反应分析:残差 PCA 图
Rasch 与项目反应分析:残差 PCA 图
Rasch 与项目反应分析:人员参数分布
Rasch 与项目反应分析:人员参数分布

10.41.7.4 得分换算与 DIF 图

得分换算图展示原始总分、logit 与不确定性的关系。DIF 位置图比较不同组的项目或阈值位置,类别分布图帮助识别组间响应类别使用差异。两类 DIF 图应与表格、样本量和项目内容共同解释。

Rasch 与项目反应分析:得分换算图
Rasch 与项目反应分析:得分换算图
Rasch 与项目反应分析:DIF 位置图
Rasch 与项目反应分析:DIF 位置图
Rasch 与项目反应分析:DIF 类别分布图
Rasch 与项目反应分析:DIF 类别分布图

10.41.8 表格描述和下载

主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮;图形也可生成中英文描述。生成文字后应人工核对项目编码、logit 方向、统计量定义、分组和阈值,不应把自动描述直接当作最终论文结论。

进入 “下载 Word 报告” 页签,可下载当前分析的表格、图形和提示;人员参数还可单独下载 CSV。Word 报告只收录本次勾选且成功生成的内容。

Rasch 与项目反应分析:Word 报告和人员参数下载页
Rasch 与项目反应分析:Word 报告和人员参数下载页

建议:请使用微软 Word 打开报告。正式使用前应核对项目方向、类别编码、完整案例、估计方法、诊断阈值、DIF 分组和随机种子;若启用模拟或 Bootstrap,应在方法部分报告迭代次数。

10.41.9 论文报告建议

方法部分建议说明:

  1. 量表名称、版本、语言、项目数量和各项目反应类别。
  2. 项目方向、反向计分、缺失值和完整案例处理。
  3. 二分类 Rasch 模型或部分计分模型,以及项目和人员参数估计方法。
  4. 人员参数范围、置信水平和信度估计设置。
  5. Infit、项目—剩余总分、Q3、残差 PCA 的判断方法和多重比较校正。
  6. 是否使用模拟阈值、Bootstrap、迭代次数和随机种子。
  7. DIF 分组、检验层级、每组样本量和 logit 差异阈值。

结果部分建议报告:

  1. 总样本数、完整案例数、排除数和项目类别平移情况。
  2. 项目位置和阈值的主要范围及异常类别结构。
  3. Infit 和项目—剩余总分诊断中需要关注的项目。
  4. 最大 Q3 项目对及局部依赖证据。
  5. 残差 PCA 的主要结果和单维性限制。
  6. PSI、边际信度或其他预先规定的主要信度指标。
  7. 人员参数分布、目标匹配和极端分数情况。
  8. DIF 总体检验、标记项目、差异大小和不确定性。

可参考如下写法:

在 236 名受试者中,218 名对 9 个项目具有完整作答并进入部分计分模型。项目类别统一平移为 0 起始编码。CML 项目参数和 WLE 人员参数显示,项目位置覆盖了样本潜在水平的主要范围,但高水平区域项目相对不足。项目 Infit 与项目—剩余总分诊断提示 1 个项目需要进一步内容复核;最大 Q3 残差相关出现在项目 3 与项目 4之间。人员分离信度为 0.82。按预设 0.50 logit 差异阈值进行分组 DIF 分析后,1 个项目被标记,但其内容与分组响应分布仍需进一步审查。

示例数值仅用于展示写法,实际报告必须使用本研究输出。

10.41.10 常见问题

1. 为什么项目必须是连续整数编码?

模型需要有序反应类别。1、2、3、4 可自动平移为 0、1、2、3;1、2、4 则存在缺口,应先核对是否漏掉类别、合并错误或把缺失码当成有效值。

2. 项目从 1 开始编码会影响结果吗?

不会改变类别顺序和间距。模块只在内部做常数平移,并在项目类别编码表中记录;反向项目仍需在分析前单独反向计分。

3. CML 和 MML 应选哪个?

CML 常作为 Rasch 项目参数估计的主要选择;MML 适合需要相应分布假设或与其他边际估计结果比较的情形。应在研究方案中预先规定,并进行必要的敏感性分析。

4. Infit 超过某个固定值就必须删项吗?

不能。经验界值会受样本量、类别、目标人群和估计方法影响。应联合模拟阈值、项目内容、项目—剩余总分、Q3、残差结构和独立样本结果判断。

5. Q3 较高说明什么?

表示共同潜在水平之外,两项目残差仍相关。常见原因包括题干相似、共同情境或内容重复;也可能受样本和估计影响,需要回到项目文本核实。

6. 信度很高是否说明模型拟合良好?

不是。局部依赖或重复内容也可能抬高信度。必须同时检查项目拟合、局部依赖、残差维度、目标匹配和 DIF。

7. 为什么极端原始分的人员参数标准误较大?

全选最低或最高类别时,数据对参数位置的约束较弱。人员参数范围会限制极端估计,报告个体结果时应保留其不确定性。

8. DIF 显著是否证明项目有偏倚?

不能。DIF 是统计学上的跨组不一致证据。是否构成偏倚还取决于题意、翻译、文化或临床背景、分组可比性和差异大小。

9. 为什么不选择分组变量时没有 DIF 表和 DIF 图?

DIF 必须定义比较组。不选择分组时,主模型、项目诊断、人员参数和其他图形仍可正常生成;DIF 页签会显示说明提示。

10. 是否可以把得分换算表直接用于另一个量表版本?

不可以。换算依赖当前项目集合、计分、模型和校准样本。项目增删、类别改变或版本改变后应重新估计并验证。

10.41.11 小结

本模块的最佳使用方式是:先统一项目方向并核对类别编码,再选择估计方法和诊断设置,联合项目参数、Infit、项目—剩余总分、Q3、残差 PCA、信度和目标匹配评价模型,最后在有明确分组问题时检查 DIF,并透明报告完整案例、阈值和不确定性。

Rasch 分析的价值在于把项目、人员和测量误差放到统一框架中检查。可靠的量表结论来自模型证据、项目内容、目标人群和独立验证的共同支持,而不是来自某一个漂亮的拟合或信度数字。

10.42 Rasch 混合模型

Rasch 混合模型用于识别项目难度结构不同的潜在人群类别,并比较不同类别的项目参数、拟合和能力分布。

适用数据:同一批受试者完成至少四个项目;项目使用从 0 开始的整数编码。二分类项目编码为 0/1,多分类项目编码为 0 至所设最高分。

10.42.1 分析目的

普通 Rasch 分析假定所有受试者共享同一套项目参数。Rasch 混合模型允许样本中存在若干潜在人群类别,各类别可以呈现不同的项目难度模式。它适合探索量表在不同潜在人群中的测量结构是否一致。

注意:潜在类别是模型识别出的统计分组,不等同于已知临床亚组,也不应直接解释为疾病亚型或因果机制。

10.42.2 操作步骤

  1. 选择至少四个项目变量。
  2. 设置拟合的潜在类别数,建议从 2 类开始,并与相邻类别数结果比较。
  3. 设置项目最高计分。0/1 项目填写 1;0/1/2/3 项目填写 3。
  4. 多分类项目选择等级评分模型或部分计分模型。
  5. 保留所需表格和图形,点击“开始分析”。

10.42.3 菜单说明

设置 含义
潜在类别数 拟合的最大类别数。模型比较表会同时给出从 1 类到所设类别数的候选模型。
最高计分 单个项目允许的最大整数分值;所有项目分值必须位于 0 至该数值之间。
等级评分模型 假定不同项目共享相同的类别步距结构,适合评分规则一致的项目。
部分计分模型 允许各项目拥有不同的类别步距结构,适合项目评分结构不完全相同的量表。

10.42.4 结果解读

模型比较:AIC、BIC 和 CAIC 越小,通常表示拟合与模型复杂度之间的平衡越好。类别数选择还应结合类别解释是否清晰、项目参数是否稳定以及研究目的。

项目难度:项目难度越高,表示在该潜在类别中获得较高项目得分需要更高能力。若同一项目在不同类别中的难度差异明显,提示潜在人群间的项目反应结构不同。

项目拟合:Infit 对接近受试者能力水平的反应更敏感,Outfit 对远离能力水平的异常反应更敏感。拟合值需结合样本量、项目用途和量表背景判断。

平均能力与图形:平均能力用于比较各潜在类别在测量尺度上的相对位置;项目难度图用于识别类别间模式差异;拟合比较图用于观察增加类别后的信息准则变化;能力分布图用于比较类别尺度位置和分散程度。

10.42.5 论文报告建议

报告项目数、计分范围、完整案例数、候选类别数、最终类别数的选择依据、信息准则、分潜在类别项目参数和拟合指标。避免仅凭最低信息准则选取难以解释或不稳定的类别模型。

10.43 测验分数等值分析

测验分数等值分析将测验 X 的分数转换到测验 Y 的分数尺度,用于比较不同试卷、版本或评分尺度上的分数。

适用数据:每行对应一名受试者或一个等组位置,两列分别存放待转换测验 X 和目标测验 Y 的总分。线性等值可使用连续分数;等百分位等值要求整数总分。

10.43.1 分析目的

不同试卷的难度和分数分布可能不同,原始分数不能直接比较。等值分析建立从测验 X 到测验 Y 的分数映射,使 X 分数能够在 Y 的尺度上解释。

方向很重要:“待转换测验 X → 目标测验 Y”与反向转换不是同一个结果。开始前请核对两列的角色。

10.43.2 操作步骤

  1. 选择待转换测验 X 和目标测验 Y。
  2. 选择线性等值或等百分位等值。
  3. 使用等百分位方法时,选择单组设计或等组设计。
  4. 保留所需表格和图形,点击“开始分析”。

10.43.3 方法选择

方法 适用情形 主要假设
线性等值 两份测验分布形态相近,主要差异表现为均值和标准差。 分数关系可由截距和斜率描述。
等百分位等值 两份测验分布形态可能不同,需要按相同百分位位置映射。 分数为离散整数,并有足够的分数范围和样本量。
单组设计 同一批受试者完成两份测验。 两列分数在行层面对应同一受试者。
等组设计 能力分布相当的两个独立组分别完成两份测验。 两组具有可比的能力分布;行顺序不作个体配对解释。

10.43.4 结果解读

线性方程:目标分数 = 截距 + 斜率 × 待转换分数。截距反映尺度位置差异,斜率反映尺度离散程度差异。

等百分位转换表:每个 X 分数映射到 Y 分布中相同百分位位置的分数。分布尾部样本较少时,转换可能更不稳定。

分布与图形:频数表和累积分布图用于核对分数范围、稀疏区间和分布差异;等值关系图展示转换曲线及其偏离恒等线的程度。

10.43.5 论文报告建议

报告等值方向、方法、设计、完整案例数、两份测验的描述性统计、线性方程或等百分位转换表,并说明分数范围与样本限制。

10.44 线性逻辑测验模型

线性逻辑测验模型用研究者预设的认知成分解释二分类项目的位置参数,检验项目难度结构能否由较少的成分效应重构。

适用数据:每行对应一名受试者,每列对应一个二分类项目,项目须使用 0/1 编码。设计矩阵的每一行对应一个项目,每一列对应一个预设认知成分。

10.44.1 分析目的

普通项目模型为每个项目分别估计位置参数;线性逻辑测验模型进一步假定,这些项目位置可由少量认知成分的加权组合解释。该方法适合检验题目设计、认知操作或项目特征的预设结构。

设计矩阵决定模型含义:矩阵不是由数据自动发现的结果,而是研究者在分析前提出的结构假设。每一列的含义及权重编码应有明确的理论或项目编制依据。

10.44.2 操作步骤

  1. 选择至少四个采用 0/1 编码的二分类项目。
  2. 设置认知成分数。成分数不能超过项目数,且各成分列应包含非零权重。
  3. 按列输入设计矩阵:先输入第一个成分对全部项目的权重,再依次输入后续成分。
  4. 核对矩阵数值总数应等于“项目数 × 成分数”,保留所需表格和图形,点击“开始分析”。

10.44.3 设计矩阵

要素 含义 检查重点
与左侧项目选择顺序一致的项目。 项目顺序改变后应重新核对矩阵。
理论上预设的认知成分、题目操作或项目特征。 每列应有清楚且互不重复的含义。
权重 项目位置中对应成分的贡献;常用 0/1,也可使用有理论依据的其他数值。 避免全零列、重复列和完全线性相关。
矩阵秩 可独立估计的成分维度数。 矩阵秩应等于成分数。

10.44.4 结果解读

不受约束项目参数:每个项目独立估计位置参数,作为成分约束模型的比较基准。Infit、Outfit、整体检验和项目检验共同用于评估模型拟合。

认知成分效应:成分效应表示对应认知成分对项目位置的贡献。估计值、标准误和置信区间应结合设计矩阵的编码方向解释,不能脱离权重定义单独判断“难”或“易”。

模型拟合比较:成分约束模型使用更少参数重构项目位置。似然比检验显著时,说明当前设计矩阵相对于不受约束模型产生了可检测的拟合损失;不显著不等于结构已被证明正确,仍需结合残差与理论合理性。

矩阵与残差诊断:设计矩阵诊断用于发现秩不足、严重共线或过度稀疏。项目位置残差反映不受约束估计与成分约束重构之间的差异,绝对值较大的项目应优先复核题目内容和成分编码。

10.44.5 论文报告建议

报告项目数、样本量、0/1 编码、认知成分定义、完整设计矩阵、成分效应及置信区间、模型比较、主要拟合检验和残差诊断。应将结论限定为对预设项目结构的统计检验,避免将成分效应解释为未经验证的心理机制。

10.45 自助法项目拟合

自助法项目拟合通过重复重抽样评估项目 Infit 与 Outfit 的抽样不确定性,识别可能过度拟合或需要复核的项目。

适用数据:每行对应一名受试者,每列对应一个项目。二分类项目使用 0/1 编码;多分类项目使用从 0 开始的连续整数分值。

10.45.1 分析目的

单次样本得到的项目拟合统计量会受到样本构成和样本量影响。自助法通过有放回地重复抽取受试者,形成项目拟合统计量的经验分布,从而提供区间估计或基于重抽样的显著性检验。

拟合筛查不是机械删除规则:0.5 至 1.5 是常用的初步筛查区间。项目是否删除还应结合题目内容、目标人群、局部依赖和测量目的判断。

10.45.2 操作步骤

  1. 选择至少四个项目,并设置二分类或多分类计分。
  2. 多分类项目需填写实际最高分,所有项目分值均应位于 0 到最高分之间。
  3. 选择百分位区间或校正后显著性检验,并设置自助抽样次数。
  4. 使用显著性检验时选择多重比较校正方法,保留所需表格和图形后点击“开始分析”。

10.45.3 方法选择

设置 主要输出 适用说明
百分位区间 Infit、Outfit 及其 95% 自助区间。 适合直观查看拟合值的不确定范围,以及区间是否明显偏离 1。
校正后显著性检验 拟合值、原始 P 值、校正后 P 值和显著性标记。 适合同时筛查多个项目,并控制多重比较造成的假阳性。
50 次 较快的预览结果。 适合调试变量和编码,不宜作为最终报告的唯一依据。
100 或 200 次 更稳定的经验区间或 P 值。 样本量、项目数和分值类别较多时计算时间会增加。

10.45.4 结果解读

Infit:对接近受试者能力水平的非预期反应更敏感。明显高于 1 表示反应噪声较大,明显低于 1 表示反应模式可能过于可预测。

Outfit:对远离受试者能力水平的离群反应更敏感。少量异常反应可能使 Outfit 升高,因此应结合项目内容和数据质量检查。

自助区间与校正后 P 值:区间反映重抽样下的经验不确定性;校正后 P 值用于多项目同时检验。两种方法提供不同角度的证据,不应仅凭单个阈值作出项目删除决定。

诊断汇总:汇总表将项目按常用筛查标准归类,方便确定优先复核顺序。最终判断应同时考虑 Infit、Outfit、抽样不确定性、项目内容和测量目标。

10.45.5 论文报告建议

报告项目数、计分范围、完整案例数、自助抽样次数、分析方法、多重比较校正、每个项目的 Infit 与 Outfit 结果,以及需要复核的项目清单。说明筛查阈值和自助抽样次数,并避免把拟合偏离直接解释为项目无效。

10.46 差异项目功能分析

差异项目功能分析比较两个组在控制总体潜在能力后的项目位置,识别可能对某一组更容易或更困难的项目。

适用数据:每行对应一名受试者,每列对应一个项目,并包含一个恰好具有两个非缺失组别的分组变量。二分类项目使用 0/1;部分计分项目使用从 0 开始的连续整数分值。

10.46.1 分析目的

当总体能力相近的受试者仅因所属组别不同而对某个项目表现出不同反应概率时,该项目可能存在差异项目功能。分析同时估计总体和分组项目位置,并用统计检验与 Logit 差异幅度进行筛查。

组间差异不等于偏倚:统计学标记提示项目需要复核,但不能单独证明项目不公平。应结合项目内容、语言、文化背景、临床情境和分组样本的可比性判断。

10.46.2 操作步骤

  1. 选择至少四个项目和一个恰好包含两个组别的分组变量。
  2. 根据项目计分选择二分类模型或部分计分模型。
  3. 选择多重比较校正,并预设具有实质意义的 Logit 差异阈值。
  4. 保留所需表格和图形,点击“开始分析”。

10.46.3 模型与诊断

设置或结果 含义 解读重点
二分类模型 用于 0/1 项目,比较两个组的项目位置。 每组至少 40 名完整受试者,且各项目在完整案例中均有 0 和 1。
部分计分模型 用于 0、1、2 等多分类项目。 每个项目在两个组内都应观察到全部分值类别。
校正后 P 值 控制多个项目同时检验造成的假阳性。 校正方法应在研究计划或报告中说明。
Logit 差异 组 1 项目位置减去组 2 项目位置。 正负表示方向,绝对值表示组间差异幅度。

10.46.4 结果解读

组别样本与总分概览:先核对两个组的样本量和总分分布。总体能力差异、样本选择或分值类别稀疏都可能影响项目位置比较。

项目组间差异检验:Z 值和校正后 P 值反映统计证据。多重比较校正后仍显著的项目应优先复核,但统计显著性会受到样本量影响。

总体与分组项目位置:分组项目位置展示项目在两个组中的相对难度。应同时观察差异方向、标准误、相邻项目模式及总体位置。

Logit 差异与诊断:诊断表结合校正后 P 值和预设幅度阈值。统计与幅度均达到标准的项目证据较强;仅达到一项时仍应结合内容审查和敏感性分析。

10.46.5 论文报告建议

报告项目数、计分模型、组别定义、各组完整案例数、多重比较校正、Logit 阈值、每个项目的 Z 值、校正后 P 值、分组项目位置和差异方向。将结论表述为“可能存在组间项目功能差异”,避免直接等同于测量偏倚或不公平。

10.47 医学一致性分析

医学一致性分析用于评价两名或多名评估者对同一批观察对象的判断是否一致,或评价多次连续测量能否给出接近的数值。分类评级通常使用 Kappa、Krippendorff’s alpha、Gwet’s AC 和 PABAK;连续测量通常使用组内相关系数(ICC)和 Lin’s 一致性相关系数(CCC)。

核心原则:一致性不等于相关性。两个评估者的测量值可以高度相关,却长期存在固定偏高或偏低;反过来,类别构成和患病率也会影响部分一致性系数。应联合报告观测一致率、校正偶然一致的系数、置信区间和类别或测量分布。

10.47.1 模块能做什么

  • 对两名评估者计算 Cohen’s Kappa,对三名及以上评估者计算多评估者 Kappa。
  • 提供无权重、线性权重和平方权重 Kappa。
  • 计算 Krippendorff’s alpha,并支持名义、顺序、区间和比率尺度。
  • 计算 Gwet’s AC1/AC2,降低某些高度偏斜类别分布下的 Kappa 悖论影响。
  • 在两名评估者时报告 PABAK、患病率指数和偏倚指数。
  • 以指定评估者为参照计算成对 Kappa,并给出评估者排序。
  • 输出混淆矩阵、分类别 Precision、Recall 和 F1,以及 Bootstrap 置信区间。
  • 对连续测量提供六种常用 ICC、平均 Pearson 相关和成对 Lin’s CCC。
  • 绘制分类一致性热图或连续测量的评估者分布图。
  • 生成包含当前表格、图形和分析提示的 Word 报告。

10.47.2 适用场景

  1. 两名病理医师对同一批切片作阴性、可疑或阳性判断。
  2. 多名影像科医师对病灶分级、诊断类别或影像特征进行判读。
  3. 护士、研究者或量表评分员对同一批对象进行分类评级。
  4. 多台设备或多名测量者对同一批对象给出连续测量值。
  5. 同一评估流程在不同时间或不同评估者之间进行重复性评价。

方法边界:本模块不进行 Bland–Altman 方法学比较。若研究重点是两种连续测量方法之间的系统偏倚和一致性界限,应使用独立的 Bland–Altman 模块;仅报告相关系数或 ICC 不能替代一致性界限分析。

10.47.3 数据准备

数据应为“一个观察对象一行,一名评估者一列”。同一行必须对应同一个病例、样本或测量对象,不能把不同对象的评分错位排列。

数据要素 要求 常见问题
评估者变量 至少 2 列,每列代表一名评估者 把评估者放在行中,或同一对象未对齐
分类评级 各列使用含义一致的类别水平 同一编码在不同列代表不同含义
有序评级 水平顺序应有明确专业含义 将名义类别误设为有序等级
连续测量 各列均为数值型,单位一致 混用不同单位或把缺失码当数值
缺失值 使用空值或统一缺失编码 使用 9、99、999 等未清理的缺失码
样本量 应覆盖主要类别和评估者差异 极少见类别导致区间很宽或估计不稳定

模块对所选评估者变量使用完整案例分析。任一评估者在某行缺失,该行不进入本次分析;结果会报告总行数、完整案例数和排除行数。

分类评级的类别水平会在评估者之间统一。若某个类别只在一名评估者中出现,仍会保留在共同水平中,但这通常提示需要核对编码、培训标准或样本分布。

10.47.4 主要统计量

10.47.4.1 Kappa

Kappa 将观测一致率 \(P_o\) 与偶然一致率 \(P_e\) 比较:

\[ \kappa=\frac{P_o-P_e}{1-P_e} \]

\(\kappa=1\) 表示完全一致,\(\kappa=0\) 表示与偶然一致相当,负值表示实际一致低于偶然期望。Kappa 会受到类别分布、边际比例和评估者偏倚影响,因此必须与观测一致率和类别频数一起解释。

对于有序等级,线性或平方权重允许“相差一级”比“相差多级”受到更轻的惩罚。无序类别应使用无权重 Kappa。

10.47.4.2 Krippendorff’s alpha 与 Gwet’s AC

Krippendorff’s alpha 可用于多名评估者,并能按名义、顺序、区间或比率尺度定义分歧距离。所选尺度必须与变量的测量性质一致。

Gwet’s AC1/AC2 也是校正偶然一致的指标。在某一类别极常见或极少见、Kappa 与观测一致率明显矛盾时,可把 Gwet’s AC 作为预先指定的补充结果,但不应只选择数值更有利的指标。

10.47.4.3 PABAK

PABAK 对类别患病率和评估者偏倚进行调整,仅在两名评估者时显示。它适合用于敏感性描述,不应替代原始 Kappa、观测一致率和类别分布。

10.47.4.4 ICC

ICC 评价连续测量中对象间变异相对于总变异的比例。模块提供六种常见定义:

类型 评估者模型 一致性定义 测量单位 常见用途
ICC(1,1) 单向随机 一致性 单次测量 每个对象可能由不同随机评估者测量
ICC(1,k) 单向随机 一致性 多次平均 最终结果取多次测量平均
ICC(2,1) 双向随机 绝对一致 单次测量 评估者代表更大总体,要求数值相同
ICC(2,k) 双向随机 绝对一致 多次平均 报告多名随机评估者的平均值
ICC(3,1) 双向混合 一致性 单次测量 只关心当前固定评估者的相对一致
ICC(3,k) 双向混合 一致性 多次平均 报告当前固定评估者的平均值

选择 ICC 前应先明确:评估者是随机抽取还是研究中特定的固定人员、研究要求绝对数值一致还是只要求相对排序一致、最终使用单次测量还是多次平均。

10.47.5 使用步骤

10.47.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “测量质量、信度与一致性” → “医学一致性分析”

10.47.5.2 2. 选择数据类型

选择“分类评级”或“连续测量”。切换模式后,评估者变量列表和可用统计量会同步变化。

10.47.5.3 3. 选择评估者变量

至少选择 2 名评估者。分类模式可选择因子、字符或分类编码变量;连续模式只显示数值型变量。分类模式还需选择一名参考评估者,用于成对 Kappa、混淆矩阵和热图。

10.47.5.4 4. 设置统计参数

  • 置信水平:可选 90%、95% 或 99%。
  • Kappa 权重:名义类别选无权重;有序等级可选线性或平方权重。
  • Alpha 测量尺度:按变量性质选择名义、顺序、区间或比率。
  • Gwet 权重:有序等级可使用线性或二次权重。
  • 混淆矩阵标准化:可显示原始计数、按参考类别的比例或按比较类别的比例。
  • Bootstrap 次数:100 次适合快速检查,正式分析通常建议使用 500 或 1000 次并检查稳定性。
  • ICC 类型:按评估者模型、一致性定义和最终测量单位选择。

10.47.5.5 5. 选择输出并开始分析

左侧默认勾选全部适用表格和图形。点击 “开始一致性分析” 后,变量类型、有效案例、水平数、零变异、统计计算、图形和下载错误都会在模块内显示,不会让整个应用退出。

医学一致性分析:完整设置面板
医学一致性分析:完整设置面板

10.47.6 结果解读

10.47.6.1 分析概览

先核对分析类型、评估者、总行数、完整案例数、排除数、置信水平和参考评估者。模块还会显示主结果与独立核对值是否一致;若提示需要复核,应先检查变量类型、类别编码和权重设置。

医学一致性分析:分析概览
医学一致性分析:分析概览

10.47.6.2 主要一致性

分类模式报告 Kappa、观测一致率、检验统计量和 P 值。连续模式报告所选 ICC、置信区间、F 检验和自由度。

医学一致性分析:主要一致性结果
医学一致性分析:主要一致性结果

常见的“一致性较差、中等、良好”等分级只能作为描述性参考,不能脱离研究用途机械套用。临床决策、病理诊断和安全性测量对可接受一致性的要求可能完全不同。

10.47.6.3 补充指标

分类模式可同时查看 Krippendorff’s alpha、Gwet’s AC、PABAK 和 Bootstrap 区间。若这些指标结论不一致,优先检查类别分布、边际比例、权重设定和样本稀疏性,而不是只保留数值最高的结果。

医学一致性分析:补充一致性指标
医学一致性分析:补充一致性指标

连续模式中,平均 Pearson 相关反映线性关联,Lin’s CCC 同时考虑精密度和偏离 45 度一致线的程度。相关很高但 CCC 或绝对一致 ICC 较低,常提示存在系统偏移或尺度差异。

10.47.6.4 成对诊断

成对 Kappa 表用于定位哪一名评估者与参考评估者差异更大。混淆矩阵显示具体类别之间的误分方向;分类别 Precision、Recall 和 F1 可发现总体一致率掩盖的少见类别问题。

医学一致性分析:成对 Kappa、混淆矩阵与分类别指标
医学一致性分析:成对 Kappa、混淆矩阵与分类别指标

评估者排序只反映当前样本和当前参考评估者下的相对表现,不能直接解释为评估者能力排名,也不应作为惩罚或绩效评价的唯一依据。

10.47.6.5 一致性热图与连续分布图

分类热图把参考评估者放在纵轴、比较评估者放在横轴。对角线单元格代表一致判断,非对角线单元格显示具体分歧方向。

医学一致性分析:一致性热图
医学一致性分析:一致性热图

连续模式的分布图比较各评估者的中心位置、离散程度和异常值。若不同评估者整体平移或变异程度明显不同,应进一步使用方法学比较和偏倚分析。

10.47.7 下载 Word 报告

进入 “下载Word报告” 页签,可下载当前分析的 Word 文档。报告只收录本次勾选且成功生成的表格、图形和分析提示。

医学一致性分析:下载页
医学一致性分析:下载页

建议:请使用微软 Word 打开报告。正式投稿前应核对类别含义、参考评估者、ICC 类型、置信水平、缺失处理和图形标签,并在正文中明确主要一致性指标是事先指定还是补充分析。

10.47.8 论文报告建议

方法部分建议说明:

  1. 观察对象、评估者数量、评估流程及是否独立盲法判读。
  2. 分类类别或连续测量的定义、单位和编码。
  3. 主要一致性指标及其权重、尺度或 ICC 类型。
  4. 置信水平、Bootstrap 次数和缺失值处理。
  5. 参考评估者和任何成对或分类别分析的预设依据。

结果部分建议报告:

  1. 总样本量、完整案例数和排除数。
  2. 分类评级的观测一致率、Kappa 及置信区间,或连续测量的 ICC 及置信区间。
  3. 关键补充指标及其与主结果是否一致。
  4. 主要分歧类别、成对差异或连续测量分布差异。
  5. 估计不稳定、稀疏类别或泛化范围限制。

分类评级可参考如下写法:

三名评估者对 176 个完整病例进行分类判读。总体观测一致率为 70.0%,多评估者 Kappa 为 0.68。Krippendorff’s alpha 和 Gwet’s AC 得到方向一致的结果。分歧主要发生在临界类别与阴性或阳性类别之间;各类别的成对表现和 Bootstrap 置信区间见表。

连续测量可参考如下写法:

三名评估者对 176 个完整病例进行连续测量。基于双向随机、绝对一致、单次测量模型的 ICC(2,1) 为 0.93(95% CI 0.90–0.95)。成对 Lin’s CCC 均超过 0.90,提示当前样本中具有较高一致性;不同评估者的测量分布仍见轻度位置差异。

示例数值仅用于展示写法,实际报告必须使用本研究输出。

10.47.9 常见问题

1. Kappa 很低,但观测一致率很高,哪个是对的?

两者回答的问题不同。类别极不平衡时,偶然一致率可能很高,使 Kappa 降低。应同时报告观测一致率、类别分布、Kappa 区间,并按预设方案补充 Gwet’s AC 或 PABAK。

2. 什么时候使用加权 Kappa?

仅当类别有明确顺序、不同程度的分歧可以赋予不同代价时使用。疾病类型、病理亚型等无序类别通常应使用无权重 Kappa。

3. ICC(2,1) 和 ICC(3,1) 如何选择?

若评估者视为从更大总体随机抽取,并希望结果推广到其他评估者,通常考虑 ICC(2,1);若只关心当前固定评估者之间的一致排序,可考虑 ICC(3,1)。还需明确绝对一致与一致性定义。

4. 平均测量的 ICC 为什么通常更高?

多次测量取平均可以减少随机误差,因此 ICC(·,k) 往往高于 ICC(·,1)。只有研究最终确实使用多次平均时,才能把平均测量 ICC 作为主要结果。

5. Pearson 相关很高能否证明一致性好?

不能。相关系数主要反映线性排序,不会充分惩罚固定偏移。应使用绝对一致 ICC、Lin’s CCC,并在比较两种测量方法时使用 Bland–Altman 分析。

6. 多名评估者都需要把同一批对象评完吗?

本模块当前使用完整案例,因此主要结果基于所有所选评估者均有记录的对象。若设计中不同对象由不同评估者子集判读,需要专门处理不完全评估设计。

7. 可以根据成对 Kappa 排名评估者吗?

只能作为当前参考评估者和当前样本下的诊断信息。没有独立金标准时,较高成对一致不等于更准确,也不能直接代表能力高低。

8. 一致性高是否证明测量有效?

不能。评估者可能高度一致地作出同一种错误判断。一致性评价需要与准确性、效度、校准、临床结局或外部标准共同考虑。

9. 为什么样本量比原数据少?

任一所选评估者变量缺失时,该行会从当前分析中排除。请在分析概览中核对总行数、完整案例数和排除数。

10.47.10 小结

本模块的最佳使用方式是:先依据数据尺度和研究设计指定主要一致性指标,再核对完整案例与类别分布,联合观测一致率、Kappa/ICC、置信区间、补充指标和诊断图解释结果,最后清楚报告指标定义与泛化范围。

一致性分析评价的是重复判读或测量的可重复程度,不自动证明准确性、效度或可互换性。透明报告评估流程、类别分布、ICC 类型、缺失处理和主要指标选择,是形成可靠结论的关键。

10.48 Bland–Altman 方法学比较

Bland–Altman 方法学比较用于评价两种连续测量方法对同一对象所得结果能否在预先规定的误差范围内互换。模块估计平均偏倚及其置信区间、个体差值的一致性界限及其置信区间,并通过图形检查固定偏倚、比例偏倚、异常差值和差值方差随测量水平变化的线索。

核心原则:方法学比较的重点不是两个方法是否高度相关,而是“方法 1 减方法 2”的差值是否足够小、95% 左右的个体差值范围是否落在专业上可接受的界限内。最大可接受差值应在查看结果前,根据临床、实验或质量控制要求确定。

10.48.1 模块能做什么

  • 分析普通成对测量、同一对象的重复测量和对象内均值变化的嵌套测量。
  • 计算平均偏倚、差值标准差、下限和上限一致性界限及其置信区间。
  • 使用 MOVER 或经典方法计算一致性界限的置信区间。
  • 按预设最大可接受差值进行一致性界值检验。
  • 计算 Lin’s 一致性相关系数(CCC)及置信区间,作为补充描述。
  • 检查比例偏倚,并在需要时估计随测量水平变化的一致性界限。
  • 对严格为正的测量值进行对数尺度分析,以比值或对称百分差展示结果。
  • 绘制 Bland–Altman 图、恒等线比较图和差值假设诊断图。
  • 输出分析信息、界值检验、一致性界限、CCC、描述统计和差值诊断表。
  • 生成包含当前所选表格和图形的 Word 报告。

10.48.2 适用场景

  1. 新检测方法与参考方法比较,例如血糖、血红蛋白、影像定量或生理参数测量。
  2. 两台仪器、两种试剂、两种采样方式或两种计算流程的结果比较。
  3. 同一对象在每种方法下有多次重复测量,需要考虑对象内相关性。
  4. 测量误差可能随数值水平成比例变化,需要以比值或百分差表达。
  5. 研究目标是判断两种方法是否可以在规定误差范围内互换,而不只是评价线性关联。

方法边界:Bland–Altman 分析不能证明新方法准确,也不能仅凭“多数点位于一致性界限内”宣布两种方法可互换。应事先定义可接受差值,并结合一致性界限及其置信区间、测量范围、临床后果和研究设计作出判断。

10.48.3 数据准备

数据结构 每行代表 必需变量 选择原则
普通成对测量 一个相互独立的对象 方法 1、方法 2 每个对象只有一对测量,或仅分析一对预先规定的测量
重复测量 一个对象的一次重复测量 对象标识、方法 1、方法 2 同一对象有多对测量,且对象内真实均值可视为稳定
嵌套测量 一个对象在某条件或时间的一次测量 对象标识、方法 1、方法 2 同一对象有多对测量,且对象内真实均值可能随条件或时间变化

两种测量变量必须为连续数值,且使用相同或可直接比较的单位。重复或嵌套模式还必须选择对象标识变量;每个对象至少保留 2 对完整测量,且至少有 5 个对象。

模块使用所选变量的完整测量对。方法 1、方法 2或对象标识任一缺失时,该行从当前分析中排除;分析概览会报告总行数、完整测量对和排除行数。

对数尺度要求两种方法的所有完整测量值均大于 0。0、负值、无穷值或人为缺失码应在分析前处理。若测量单位不同,应先完成有专业依据的单位换算,不要用统计模型掩盖单位不一致。

10.48.4 主要统计量

10.48.4.1 平均偏倚和一致性界限

令每个测量对的差值为

\[ d_i=x_i-y_i \]

其中 \(x_i\) 为方法 1,\(y_i\) 为方法 2。平均偏倚为 \(\bar d\)。在普通成对测量且差值近似正态时,覆盖比例为 95% 的经典一致性界限为

\[ \bar d \pm 1.96s_d \]

其中 \(s_d\) 为差值标准差。若一致性覆盖水平改为 90% 或 99%,相应分位数也会改变。重复和嵌套数据会按其层级结构估计方差,不应把同一对象的多次测量错误地当作相互独立。

平均偏倚接近 0 只表示总体上没有明显固定偏移,不代表个体差值足够小。判断可互换性时,应把一致性界限及其置信区间与预设可接受差值比较。

10.48.4.2 界限置信区间

  • MOVER:默认方法,分别组合偏倚和方差成分的不确定性,通常适合作为主要区间方法。
  • 经典 Bland–Altman:使用经典近似公式,便于与既往文献或常用软件结果比较。

置信区间越宽,说明样本对一致性界限位置的估计越不确定。样本量较小、重复结构复杂或差值变异较大时,不应只报告点估计。

10.48.4.3 比例偏倚

比例偏倚表示方法差值随两种方法的平均测量水平系统变化。模块会检查差值对平均值的回归斜率,并在勾选“考虑比例偏倚”时估计随测量水平变化的偏倚和一致性范围。

比例偏倚分析应以图形和区间为主。显著性检验受样本量和模型假设影响,不能替代对实际误差大小的判断。

10.48.4.4 对数尺度

当差值变异随测量值增大、误差更接近乘法结构时,可对严格正值进行对数转换:

  • 比值:把对数差值还原为方法 1 / 方法 2 的比值及比值一致性界限;1 表示无系统偏移。
  • 对称百分差:以百分数表达相对差异;0% 表示无系统偏移。

不要仅因原始尺度图形“不好看”而自动使用对数转换。应根据误差机制、测量单位和解释需要预先决定,并在论文中明确报告。

10.48.4.5 一致性相关系数

CCC 同时考虑线性相关和偏离 45 度恒等线的程度。它比 Pearson 相关更接近一致性概念,但仍不能代替个体差值的一致性界限。CCC 应作为补充指标,与 Bland–Altman 结果共同解释。

10.48.5 使用步骤

10.48.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “测量质量、信度与一致性” → “Bland-Altman 方法学比较”

10.48.5.2 2. 选择数据结构和变量

先选择普通成对测量、重复测量或嵌套测量,再选择方法 1 和方法 2。差值方向固定为“方法 1减方法 2”,交换两个变量会改变偏倚符号和图中纵轴方向。

重复或嵌套模式还需选择对象标识变量。若同一对象多次重复测量但对象内真实水平可视为稳定,选择重复测量;若真实水平可能随时间或条件改变,选择嵌套测量。

10.48.5.3 3. 设置一致性参数

  • 置信水平:可选 90%、95% 或 99%,决定偏倚和界限区间的不确定性范围。
  • 一致性覆盖水平:可选 90%、95% 或 99%,决定预计覆盖多少个体差值。
  • 最大可接受差值:输入专业上可以接受的绝对差值,必须为正数。
  • 界限置信区间方法:默认 MOVER;需要与经典文献比较时可选择经典方法。
  • 考虑比例偏倚:在差值随平均水平变化且有专业依据时勾选。
  • 使用对数尺度:仅对严格正值使用,并选择比值或对称百分差。

10.48.5.4 4. 设置标签和输出

横轴、纵轴标题可按变量单位和研究语境修改。左侧默认勾选全部六张结果表和三张图;取消勾选后,相应内容不会显示,也不会写入 Word 报告。

10.48.5.5 5. 开始分析

点击 “开始方法学比较”。变量类型、样本量、重复结构、对数值范围、统计计算、图形和 Word 导出错误都会在模块内显示,不会让整个应用退出。

Bland–Altman 方法学比较:完整设置面板
Bland–Altman 方法学比较:完整设置面板

10.48.6 结果解读

10.48.6.1 分析概览

先核对两种方法、数据结构、总行数、完整测量对、排除行数、对象数、置信水平、一致性覆盖水平、区间方法和结果尺度。普通成对测量在适用条件下还会显示主结果与独立直接计算是否匹配。

Bland–Altman 方法学比较:分析概览
Bland–Altman 方法学比较:分析概览

10.48.6.2 一致性界值检验

界值检验把统计结果与“最大可接受差值”比较。只有在该差值事先确定且具有专业意义时,结论才有解释价值。若未证明达到一致,不等于两种方法必然不同;可能是误差过大,也可能是样本量不足导致区间较宽。

10.48.6.3 偏倚与一致性界限

表中首先给出平均偏倚及其置信区间,再给出下限和上限一致性界限及其区间。解读顺序建议为:

  1. 确认差值方向和单位。
  2. 判断平均偏倚是否具有实际意义,而不只看 P 值。
  3. 比较上下限一致性界限与预设可接受差值。
  4. 检查一致性界限置信区间是否仍落在可接受范围。
  5. 结合图形判断异常点、趋势和异方差。
Bland–Altman 方法学比较:一致性界限
Bland–Altman 方法学比较:一致性界限

10.48.6.4 补充统计与差值诊断

CCC 表用于补充描述整体一致程度;两种方法的描述统计有助于核对量级、离散度和范围。差值诊断表报告差值均值、标准差、中位数、范围、正态性检验和比例偏倚回归斜率。

正态性检验不应机械决定分析是否有效。样本较大时微小偏离也可能显著,样本较小时检验又可能缺乏把握;应结合差值分布图、异常点和一致性界限对研究结论的敏感程度判断。

10.48.6.5 Bland–Altman 图

图中横轴为两种方法的平均值,纵轴为方法 1减方法 2。中心线表示平均偏倚,上下线表示一致性界限;预设可接受差值可作为判断背景。

Bland–Altman 方法学比较:Bland–Altman 图
Bland–Altman 方法学比较:Bland–Altman 图

重点检查:点是否围绕偏倚线随机分布、差值散布是否随测量水平增大、是否存在斜向趋势、是否有明显异常点,以及测量范围两端的数据是否足够。

10.48.6.6 恒等线图和假设诊断图

恒等线图把方法 1 与方法 2直接比较;点偏离 45 度线提示固定偏移、尺度差异或局部不一致。假设诊断图用于查看差值分布、残差模式和异常值线索。

Bland–Altman 方法学比较:恒等线图
Bland–Altman 方法学比较:恒等线图
Bland–Altman 方法学比较:假设诊断图
Bland–Altman 方法学比较:假设诊断图

10.48.7 下载 Word 报告

进入 “下载Word报告” 页签,可下载当前分析的 Word 文档。报告只收录本次勾选且成功生成的表格、图形和分析提示。

Bland–Altman 方法学比较:下载页
Bland–Altman 方法学比较:下载页

建议:请使用微软 Word 打开报告。正式使用前应核对差值方向、单位、数据结构、可接受差值、覆盖水平、区间方法、对数尺度和图形标签;Word 中的统计结果仍需结合研究方案和专业阈值解释。

10.48.8 论文报告建议

方法部分建议说明:

  1. 两种测量方法、单位、测量顺序、盲法和质量控制过程。
  2. 普通、重复或嵌套数据结构,以及每个对象的重复次数。
  3. 差值方向和最大可接受差值的预设依据。
  4. 置信水平、一致性覆盖水平和界限置信区间方法。
  5. 是否考虑比例偏倚或进行对数尺度分析。
  6. 缺失值、异常值和失败测量的处理原则。

结果部分建议报告:

  1. 总行数、完整测量对、排除数和对象数。
  2. 平均偏倚、置信区间及单位。
  3. 下限和上限一致性界限及其置信区间。
  4. 与预设可接受差值的比较和界值检验结论。
  5. 比例偏倚、异方差、异常点或测量范围限制。
  6. CCC 等补充指标,但不要用它们替代一致性界限。

原始尺度可参考如下写法:

共纳入 144 对完整测量。以新方法减参考方法计算,平均偏倚为 1.8 单位(95% CI 1.1–2.5),95% 一致性界限为 -6.4 至 10.0 单位。上限界限及其置信区间超过预设的正负 8 单位可接受范围,因此当前样本未支持两种方法在该标准下直接互换。差值随平均测量水平未见明显趋势。

对数尺度可参考如下写法:

对严格正值进行对数尺度分析后,方法 1 / 方法 2 的平均比值为 1.03,95% 比值一致性界限为 0.88–1.20。图形提示高测量水平下相对差异未明显扩大;该区间仍需与研究预设的相对误差标准比较。

示例数值仅用于展示写法,实际报告必须使用本研究输出。

10.48.9 常见问题

1. 两种方法的相关系数很高,为什么仍可能不能互换?

相关系数主要反映排序和线性关系。若一种方法始终比另一种高 10 个单位,相关仍可能接近 1,但个体差值可能超过可接受范围。

2. 为什么最大可接受差值必须在分析前确定?

查看结果后再选择阈值容易让结论迎合数据。阈值应来自临床决策、实验质量要求、既往验证研究或预设性能标准。

3. 普通、重复和嵌套测量如何选择?

每个对象只有一对测量时选普通;同一对象有多对测量且对象内真实均值稳定时选重复;对象内真实均值会随时间或条件变化时选嵌套。错误忽略对象内相关性会使区间和检验不可靠。

4. 什么时候使用对数尺度?

当误差更像固定比例而非固定绝对差值,且两种方法的完整值均大于 0 时考虑。转换决定应基于测量机制和解释目标,而不是只为获得更理想的图形。

5. 平均偏倚不显著是否说明没有系统误差?

不能。P 值受样本量影响,置信区间和实际误差大小更重要。即使平均偏倚接近 0,个体一致性界限仍可能很宽。

6. 95% 的点落在一致性界限内是否就表示一致性好?

不是。界限本来就是按覆盖比例估计的;关键是界限本身是否足够窄并落在专业上可接受范围内,以及区间不确定性是否可接受。

7. 差值不服从正态分布怎么办?

先检查录入错误、异常值、不同量级混合和异方差。可考虑有依据的转换、分层分析或稳健/非参数方法,并进行敏感性分析;不要只删除不利数据。

8. 为什么重复或嵌套模式要求对象标识?

同一对象内的多次测量相关。对象标识用于估计对象内和对象间变异,避免把重复记录误当作独立样本。

9. 为什么对数分析中结果接近 1而不是 0?

比值尺度以 1 表示无偏倚;若选择对称百分差,则以 0% 表示无偏倚。报告时必须写清尺度和方向。

10. 能否把参考方法视为没有误差的金标准?

Bland–Altman 方法比较通常允许两种方法都存在测量误差。若研究目标是校准到真正无误差的标准或建立预测方程,需要使用适合该问题的校准或误差模型。

10.48.10 小结

本模块的最佳使用方式是:先根据重复结构选择数据模式并预设可接受差值,再核对完整测量对和差值方向,联合平均偏倚、一致性界限及其置信区间、界值检验和诊断图判断两种方法能否互换,最后透明报告尺度、单位和不确定性。

方法学比较不是寻找一个漂亮的相关系数,而是把个体层面的测量误差放回实际使用场景中判断。只有当一致性界限及其不确定性满足预先规定的专业要求,并且图形未提示严重趋势、异方差或异常结构时,才有依据讨论两种方法的可替代性。

10.49 诊断试验 ROC 分析

诊断试验 ROC 分析用于评价一个或多个连续检测指标区分事件与非事件的能力。模块同时给出 AUC、置信区间、成对 AUC 比较、Youden 最优阈值、灵敏度、特异度、预测值、似然比、四格表和阈值坐标。

核心原则:先定义金标准和目标事件,再解释曲线与阈值。ROC 曲线衡量排序区分度,不等于临床效用;Youden 阈值使灵敏度与特异度之和最大,但不一定符合筛查、确诊、成本、风险或资源配置要求。

10.49.1 模块能做什么

  • 同时评价 1 至 12 个连续检测指标;
  • 自动识别指标升高或降低对应事件的方向;
  • 输出 AUC、标准误、95% 置信区间及 AUC 相对 0.5 的检验;
  • 对两个及以上指标进行成对 AUC 比较;
  • 根据 Youden 指数选择最优阈值;
  • 输出灵敏度、特异度、阳性和阴性预测值、阳性和阴性似然比、准确率及 F1 分数;
  • 输出最优阈值四格表和局部最优或全部有限阈值坐标;
  • 合并或分开绘制 ROC 曲线;
  • 下载 Word 报告、诊断汇总 CSV 和阈值坐标 CSV。

10.49.2 统计基础

10.49.2.1 ROC 曲线与 AUC

对每个阈值 \(c\),根据指标方向计算:

\[ \mathrm{Sensitivity}(c)=\frac{TP(c)}{TP(c)+FN(c)},\qquad \mathrm{Specificity}(c)=\frac{TN(c)}{TN(c)+FP(c)}. \]

ROC 曲线以 \(1-\mathrm{Specificity}\) 为横轴、\(\mathrm{Sensitivity}\) 为纵轴。AUC 可理解为随机抽取一名事件对象和一名非事件对象时,检测指标正确排序二者的概率。AUC 为 0.5 表示接近随机排序,AUC 越接近 1 表示区分度越强。

模块会自动处理反向指标。例如某指标在事件组中更低,仍可通过反向判阳得到大于 0.5 的 AUC;阈值表中的“判阳方向”必须与阈值一起报告。

10.49.2.2 成对 AUC 比较

当同一批对象接受多个检测指标时,各 ROC 曲线彼此相关。成对比较表检验两个相关 AUC 的差值,并给出差值的 95% 置信区间和 P 值。若同时比较很多指标,应预先规定主要比较并考虑多重比较问题。

10.49.2.3 Youden 指数

\[ J(c)=\mathrm{Sensitivity}(c)+\mathrm{Specificity}(c)-1. \]

模块把 \(J(c)\) 最大的有限阈值作为最优阈值。Youden 指数对灵敏度和特异度赋予相同权重,不使用疾病患病率、误诊成本或漏诊后果;因此它是统计学参考阈值,不是自动生成的临床决策标准。

10.49.2.4 诊断准确性指标

  • 灵敏度:事件对象中检测阳性的比例;
  • 特异度:非事件对象中检测阴性的比例;
  • 阳性预测值:检测阳性者中真正事件对象的比例;
  • 阴性预测值:检测阴性者中真正非事件对象的比例;
  • 阳性似然比:灵敏度除以 \(1-\) 特异度;
  • 阴性似然比:\(1-\) 灵敏度除以特异度;
  • 准确率:全部对象中分类正确的比例。

预测值会随当前样本的患病率变化。病例-对照抽样或富集样本中的阳性/阴性预测值,不能直接外推到患病率不同的真实临床人群;似然比通常比预测值更便于跨患病率环境解释,但仍需要验证。

10.49.3 数据准备

每行代表一名对象。金标准变量必须恰好有两个有效水平;检测指标必须为数值型且具有足够变异。模块使用金标准和全部所选检测指标的共同完整案例,因此增加一个缺失较多的指标会使所有曲线的分析样本减少。

事件组和非事件组均至少需要 10 个完整案例,总完整案例至少需要 30 条。多指标比较最好使用同一批对象的配对检测数据;若不同指标来自不同对象或不同抽样框,不应直接使用成对比较结果。

避免信息泄漏:若检测指标是在同一数据中通过变量筛选、模型拟合或阈值调优得到,当前 AUC 和最优阈值通常偏乐观。独立验证集或外部队列必须完整重复指标计算和阈值应用过程。

一键自动生成以下表格和图形:

  • 分析设置、事件方向和完整案例概览;
  • ROC 曲线汇总及 AUC 95% 置信区间;
  • 多指标成对 AUC 比较;
  • Youden 最优阈值和判阳方向;
  • 诊断准确性及 95% 置信区间;
  • 最优阈值四格表;
  • 局部最优或全部有限阈值坐标;
  • ROC、AUC 森林、阈值权衡和诊断指标图;
  • Word 报告和两类 CSV。

10.49.4 使用步骤

10.49.4.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “诊断试验 ROC 分析”

10.49.4.2 2. 设置变量

选择二分类金标准变量,再明确目标事件水平。连续检测指标可多选;单指标分析不会生成成对 AUC 比较表。

10.49.4.3 3. 设置显示方式

“合并显示”便于直接比较曲线,“分开显示”适合指标较多或曲线重叠严重的情况。坐标表默认只显示局部最优阈值;需要完整阈值信息时改选“全部有限阈值”。

10.49.4.4 4. 开始分析

所有主要表格和图形默认勾选。点击 “开始诊断试验 ROC 分析” 后,结果显示于右侧页签。数据校验、统计计算、绘图和下载错误只会显示在当前模块中,不会使整个应用退出。

10.49.5 ROC 与 AUC

先看 AUC 及其置信区间,再看曲线形状。置信区间宽说明样本信息有限;P 值小于 0.05 只说明 AUC 与 0.5 存在统计差异,不能说明区分度足以用于临床。

诊断试验 ROC 分析:多指标 ROC 曲线
诊断试验 ROC 分析:多指标 ROC 曲线

AUC 森林图把点估计和 95% 置信区间放在同一尺度上。比较两个指标时,应优先查看成对 AUC 差值及其区间,而不是仅凭两个 AUC 点估计大小下结论。

诊断试验 ROC 分析:AUC 与 95% 置信区间
诊断试验 ROC 分析:AUC 与 95% 置信区间

10.49.6 最优阈值

阈值表同时显示判阳方向、灵敏度、特异度和 Youden 指数。对反向指标,“指标小于或等于阈值”为阳性可能是正确方向;不能默认所有指标都采用“越高越危险”。

阈值权衡图显示阈值变化时灵敏度和特异度的此消彼长。筛查场景可能优先灵敏度,确诊场景可能优先特异度;必要时应从完整坐标表中选择符合预先规定目标的阈值,而不是机械采用 Youden 最大值。

诊断试验 ROC 分析:阈值与灵敏度、特异度
诊断试验 ROC 分析:阈值与灵敏度、特异度

10.49.7 诊断准确性

诊断指标图适合快速比较多个指标在各自 Youden 阈值下的分类表现。不同指标的最优阈值不相同,因此图中的灵敏度、特异度和预测值不是在同一阈值约束下比较;正式报告应同时给出阈值和判阳方向。

诊断试验 ROC 分析:最优阈值诊断指标
诊断试验 ROC 分析:最优阈值诊断指标

10.49.8 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。自动文字必须人工核对事件水平、指标方向、阈值符号、AUC 比较对象和患病率背景。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。诊断汇总 CSV 合并 AUC 与最优阈值结果;阈值坐标 CSV 保存当前坐标表设置对应的阈值、灵敏度、特异度及扩展诊断指标。

统计图使用模块固定的稳定尺寸,不需要在左侧设置图像宽高。每幅图下方可生成中文或英文描述,并下载 PNG、TIFF、SVG 或 PDF。

建议:保存金标准定义、事件水平、指标单位、测量时间、缺失处理、阈值选择原则和验证数据来源。若阈值将用于临床决策,应在独立人群中固定阈值后重新估计灵敏度、特异度、预测值和置信区间。

10.49.9 论文报告建议

方法部分建议说明研究设计、受试者来源、金标准、事件定义、检测指标单位和方向、缺失处理、AUC 置信区间方法、成对比较、阈值选择原则和验证策略。结果部分先报告完整案例及事件数,再报告 AUC 与区间、成对差值、阈值和判阳方向,最后报告灵敏度、特异度、预测值及似然比。

可参考如下写法:

共 209 名对象进入完整案例分析,其中目标事件 84 例。指标 A 的 AUC 为 0.86(95% CI:0.80 至 0.91),提示具有较好的区分度。其 Youden 最优阈值为 1.12,采用指标大于或等于该值判阳时,灵敏度为 0.79,特异度为 0.82。指标 A 与指标 B 的成对 AUC 差值为 0.11(95% CI:0.03 至 0.19,P=0.008)。该阈值和诊断指标来自当前样本,仍需独立验证。

示例名称和数值只用于展示写法,实际报告必须替换为本研究输出。不要把“P 值显著”写成“诊断价值良好”,也不要把 Youden 阈值写成已经验证的临床界值。

10.49.10 常见问题

1. 事件水平选错会怎样?

灵敏度、特异度、判阳方向和阈值解释都会改变。分析前必须先核对概览表中的事件与非事件水平。

2. 反向指标为什么 AUC 仍大于 0.5?

模块会自动识别指标降低对应事件的情况,并反转判阳方向。报告时必须同时写明“小于或等于阈值”为阳性。

3. AUC 0.80 是否一定可以临床使用?

不能。还要考虑置信区间、校准、阈值后果、净获益、目标人群、测量重复性、偏倚和独立验证。

4. 为什么预测值和其他研究不同?

阳性和阴性预测值受患病率影响。不同抽样设计、人群构成和疾病谱会产生不同预测值。

5. 可以比较很多 AUC 后只报告最好的一个吗?

不建议。应预先规定主要指标和主要比较,并透明报告候选指标数量及多重比较处理。

6. 应选局部最优还是全部阈值坐标?

常规报告用局部最优坐标即可;研究特定灵敏度或特异度目标时使用全部阈值,并按预设临床标准选择。

7. Youden 阈值可以直接用于新患者吗?

不能直接假定。阈值是在当前样本中优化得到,通常需要独立验证,且测量平台和人群变化可能导致阈值漂移。

10.49.11 小结

诊断试验 ROC 分析的可靠流程是:先固定金标准和事件定义,使用共同完整案例比较 AUC,再联合阈值方向、灵敏度、特异度、预测值和似然比解释结果,最后在独立人群中固定阈值验证。

ROC 分析的价值在于把不同阈值下的区分能力与分类后果清楚呈现,而不是自动替研究者决定临床阈值。

10.50 指定阈值诊断准确性

指定阈值诊断准确性分析用于评价一个预先规定的连续检验阈值,或一个已经二分类的检验结果。模块把每条判阳规则转换为四格表,并输出灵敏度、特异度、预测值、似然比、相对效应、验后概率和 Fagan 概率更新图。

核心原则:阈值和判阳方向应来自研究方案、临床目标、既往验证或独立训练数据,而不是看完当前结果后反复挑选。验前概率代表目标应用场景中事件发生的先验可能性;它与似然比共同决定验后概率,不能随意用当前样本患病率替代。

10.50.1 模块能做什么

  • 对一个连续检验同时评价 1 至 8 个预设阈值;
  • 每个阈值独立选择大于或等于、大于、小于或等于、小于作为判阳方向;
  • 直接评价二分类检验,并指定哪一水平代表检验阳性;
  • 输出每条判阳规则的真阳性、假阳性、假阴性和真阴性;
  • 计算灵敏度、特异度、阳性和阴性预测值、阳性和阴性似然比、患病率及准确率;
  • 输出相对风险、绝对风险差、相对风险变化、风险差倒数和优势比;
  • 根据设定的验前概率计算检验阳性或阴性后的验后概率;
  • 绘制诊断准确性、似然比、验后概率和 Fagan 概率更新图;
  • 下载包含当前表格与图形的 Word 报告,以及诊断结果 CSV。

10.50.2 统计基础

10.50.2.1 四格表与判阳方向

设金标准事件为“患病”。对规则“检验值大于或等于 \(c\) 判阳”,四格表为:

金标准事件 金标准非事件
检验阳性 真阳性(TP) 假阳性(FP)
检验阴性 假阴性(FN) 真阴性(TN)

灵敏度和特异度分别为:

\[ \mathrm{Sensitivity}=\frac{TP}{TP+FN},\qquad \mathrm{Specificity}=\frac{TN}{TN+FP}. \]

连续检验的阈值必须和符号一起解释。例如“\(leq 0.5\) 判阳”和“\(geq 0.5\) 判阳”代表完全不同的临床规则。二分类检验则由所选“检验阳性水平”直接形成四格表。

10.50.2.2 预测值与患病率

\[ \mathrm{PPV}=\frac{TP}{TP+FP},\qquad \mathrm{NPV}=\frac{TN}{TN+FN}. \]

阳性预测值和阴性预测值取决于研究样本中的事件比例。病例-对照抽样、富集样本或事件比例与真实应用人群不一致时,样本预测值不能直接当作目标人群预测值。

10.50.2.3 似然比

\[ \mathrm{LR+}=\frac{\mathrm{Sensitivity}}{1-\mathrm{Specificity}},\qquad \mathrm{LR-}=\frac{1-\mathrm{Sensitivity}}{\mathrm{Specificity}}. \]

阳性似然比越大,阳性结果越能提高事件可能性;阴性似然比越小,阴性结果越能降低事件可能性。似然比等于 1 表示检验结果没有改变事件可能性。零格可能产生 0 或无穷大的边界值,这类结果应同时结合样本量和置信区间解释。

10.50.2.4 验前概率与验后概率

先把验前概率 \(p_{pre}\) 转换为验前优势:

\[ O_{pre}=\frac{p_{pre}}{1-p_{pre}}. \]

检验阳性或阴性后的优势为:

\[ O_{post,+}=O_{pre}\times \mathrm{LR+},\qquad O_{post,-}=O_{pre}\times \mathrm{LR-}. \]

再把优势转换为概率:

\[ p_{post}=\frac{O_{post}}{1+O_{post}}. \]

模块允许输入 1% 至 99% 的验前概率。该数值应来自目标人群的疾病流行率、经过验证的临床评分或就诊前信息,而不是为了得到理想的验后概率而调整。

10.50.2.5 相对效应

相对风险和优势比比较的是“检验阳性组”与“检验阴性组”的事件频率,可用于描述检验结果与金标准事件的关联强度。绝对风险差、相对风险变化及风险差倒数也来自同一四格表。

解释边界:这里的检验阳性和阴性不是随机分配的治疗组。相对风险、优势比、风险差及其倒数不能解释为治疗效果、因果作用或干预获益;风险差倒数也不应直接写成临床治疗所需人数。

10.50.3 数据准备

每行代表一名相互独立的对象。至少需要:

变量 类型 要求
金标准变量 二分类 完整案例中恰好两个有效水平,并明确目标事件
连续检验变量 数值型 至少三个不同有限值,阈值能把样本分为检验阳性和阴性
二分类检验变量 因子、字符或逻辑型 恰好两个有效水平,并指定检验阳性水平

模块使用检验变量与金标准变量的共同完整案例。总完整案例至少 30 条,事件组与非事件组均至少 10 条。分析概览会报告原始样本数、完整案例、排除案例、事件数和非事件数。

连续阈值不能重复,也不能位于使全部对象都判阳或全部判阴的位置。若需要从数据中自动搜索最优阈值,应使用“诊断试验 ROC 分析”;本模块适合评价已经预先确定的规则。

一键自动生成以下表格和图形:

  • 分析设置、事件方向、判阳规则和完整案例概览;
  • 每条判阳规则的四格表;
  • 诊断准确性及 95% 置信区间;
  • 相对效应、置信区间、统计量和 P 值;
  • 验前概率与阳性、阴性验后概率;
  • 诊断准确性、似然比和验后概率比较图;
  • 每条规则的 Fagan 概率更新图;
  • Word 报告和诊断结果 CSV。

10.50.4 使用步骤

10.50.4.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “指定阈值诊断准确性”

10.50.4.2 2. 选择变量和事件

先选择检验变量,再选择二分类金标准变量和事件水平。事件水平决定 TP、FN、灵敏度和验后概率的含义;开始分析后应先在概览表中核对。

10.50.4.3 3. 设置判阳规则

若检验变量为数值型,设置阈值数量,再为每个阈值输入数值并选择 ><。若检验变量为二分类,选择哪个水平代表检验阳性;数值阈值控件会自动替换为阳性水平控件。

10.50.4.4 4. 输入验前概率

默认验前概率为 10%。请根据实际目标人群和使用场景修改。相同的似然比在不同验前概率下会得到不同验后概率,因此论文中必须说明验前概率来源。

10.50.4.5 5. 开始分析

所有主要表格和图形默认勾选。点击 “开始指定阈值诊断准确性分析” 后,结果显示在右侧六个页签中。变量校验、统计计算、绘图和下载错误只会显示在当前模块中,不会使整个应用退出。

10.50.5 结果解读

10.50.5.1 分析概览与四格表

先核对检验类型、金标准事件、非事件水平、全部判阳规则、验前概率和完整案例数。四格表是后续指标的原始依据;出现零格时,应检查是否由样本过少、阈值过于极端或真实的高区分度造成。

10.50.5.2 诊断准确性比较

比较图同时展示灵敏度、特异度、阳性预测值和阴性预测值。阈值提高通常会改变灵敏度与特异度的平衡;预测值还会受到样本患病率影响。

指定阈值诊断准确性:诊断准确性比较
指定阈值诊断准确性:诊断准确性比较

不要仅选择四项指标中最高的阈值。筛查更关注漏诊,确诊可能更关注误诊;阈值选择应按预先规定的目标性能、误判代价和后续处置综合判断。

10.50.5.3 诊断似然比

似然比图使用对数刻度,虚线 1 表示检验结果不改变事件可能性。阳性似然比应关注是否明显大于 1,阴性似然比应关注是否明显小于 1,同时查看 95% 置信区间。

指定阈值诊断准确性:阳性和阴性似然比
指定阈值诊断准确性:阳性和阴性似然比

10.50.5.4 验后概率

柱形图比较每条规则下检验阳性和阴性后的验后概率,虚线表示设定的验前概率。阳性结果的柱高于虚线表示事件概率上升;阴性结果的柱低于虚线表示事件概率下降。

指定阈值诊断准确性:验前与验后概率
指定阈值诊断准确性:验前与验后概率

10.50.5.5 Fagan 概率更新图

Fagan 图把同一条规则的验前概率、阳性和阴性似然比、两种验后概率放在一个更新路径中。它用于说明概率如何改变,不是替代置信区间或临床决策阈值。

指定阈值诊断准确性:Fagan 概率更新图
指定阈值诊断准确性:Fagan 概率更新图

10.50.6 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。自动文字必须人工核对事件水平、判阳符号、检验阳性水平、验前概率和零格边界。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。诊断结果 CSV 每行对应一条判阳规则,合并四格表、诊断准确性和两类验后概率,便于保存或进一步分析。

统计图使用模块固定的稳定尺寸,不需要在左侧设置图像宽高。每幅图下方可生成中文或英文描述,并下载 PNG、TIFF、SVG 或 PDF。

建议:保存金标准定义、事件水平、检验单位、预设阈值来源、判阳方向、目标人群、验前概率来源和缺失处理。若规则来自当前样本的探索,应在独立人群中固定规则后重新估计全部诊断指标。

10.50.7 论文报告建议

方法部分建议说明研究设计、受试者来源、金标准、事件定义、检验变量与单位、阈值及判阳方向的预设依据、完整案例处理、置信区间方法、验前概率来源和验证策略。

结果部分建议依次报告完整案例和事件数、四格表、灵敏度与特异度、预测值与似然比、验前和验后概率。若报告相对风险或优势比,应明确它们只是检验阳性与阴性组的描述性比较。

可参考如下写法:

共 234 名对象进入完整案例分析,其中目标事件 98 例。预设指标 A 大于或等于 0.30 为检验阳性,该规则的灵敏度为 0.92(95% CI:0.85 至 0.96),特异度为 0.60(95% CI:0.51 至 0.68),阳性似然比为 2.33,阴性似然比为 0.11。设目标场景验前概率为 20%,检验阳性后的验后概率为 36.8%,检验阴性后为 2.7%。该阈值为预先规定,仍需在独立人群中验证其性能和适用范围。

示例名称和数值只用于展示写法,实际报告必须替换为本研究输出。不要把“优势比较大”写成因果作用,也不要把风险差倒数解释为治疗获益人数。

10.50.8 常见问题

1. 这个模块与 ROC 模块有什么区别?

ROC 模块在全部阈值中评价曲线并可寻找 Youden 最优阈值;本模块评价已经指定的一个或多个阈值,或已经二分类的检验结果。

2. 为什么必须选择事件水平?

事件水平决定谁计入 TP 和 FN。选反后,灵敏度、特异度、预测值、似然比和相对效应的方向都会改变。

3. > 有什么区别?

当观测值恰好等于阈值时, 把它判为阳性,> 把它判为阴性。离散或四舍五入后的指标可能有很多并列值,这个差异不能忽略。

4. 验前概率应该填多少?

应使用目标场景中患者在获得当前检验结果前的事件概率,来源可为目标人群流行率、经过验证的风险评分或既往证据。病例-对照样本比例通常不适合作为真实验前概率。

5. 为什么同一检验在不同场景的验后概率不同?

似然比相同,但验前概率不同。高风险专科人群和低风险筛查人群会得到不同验后概率。

6. 出现 0 或无穷大的似然比是否代表完美检验?

不一定。零格可由样本量小或阈值极端造成。应结合四格表人数和置信区间,并在独立样本中验证。

7. 可以看完结果后选择表现最好的阈值吗?

这会产生乐观偏倚。探索性选择应明确标注,并用独立验证数据固定阈值后重新估计性能。

8. 相对风险和优势比可以解释为因果效应吗?

不能。这里比较的是检验阳性和阴性对象,分组并非随机分配;这些指标只描述检验结果与金标准事件的关联。

9. 二分类检验还需要阈值吗?

不需要。选择检验阳性水平即可,模块会直接构造四格表。

10.50.9 小结

指定阈值诊断准确性分析的可靠流程是:先固定金标准事件、阈值和判阳方向,再核对四格表与完整案例,联合灵敏度、特异度、预测值和似然比评价性能,使用有依据的验前概率计算验后概率,最后在独立人群中验证规则。

该模块回答的是“预先规定的规则在当前数据中表现如何”,而不是自动寻找最漂亮的阈值,也不能仅凭当前样本把统计关联升级为临床决策或因果结论。

10.51 调节效应分析

调节效应分析用于检验焦点自变量 \(X\) 与结局 \(Y\) 的关联是否会随调节变量 \(W\) 的水平而改变。本模块同时支持连续结局和二分类结局,并提供交互作用检验、条件效应、简单斜率、Johnson–Neyman 显著性区间和交互作用图。

核心原则:调节效应的统计学证据来自 \(X\times W\) 交互项,不能仅根据某一组显著、另一组不显著就断定存在调节效应。

10.51.1 模块能做什么

  • 对连续结局拟合包含 \(X\times W\) 的线性模型。
  • 对二分类结局拟合包含 \(X\times W\) 的 Logistic 模型。
  • 支持连续或分类的 \(X\)\(W\)
  • 纳入连续或分类协变量进行调整。
  • 输出模型拟合、总体检验、参数估计和置信区间。
  • 在指定的 \(W\) 水平下计算 \(X\) 的条件效应或简单斜率。
  • 对连续 \(X\)\(W\) 计算 Johnson–Neyman 显著性区间。
  • 绘制交互作用图,并生成 Word 报告。

10.51.2 适用场景

  1. 检验治疗效果是否因基线风险、年龄或支持水平而不同。
  2. 评估暴露与结局的关联是否受性别、疾病亚组或环境因素修饰。
  3. 分析心理、行为或社会因素之间的交互作用。
  4. 对事先提出的效应修饰假设进行验证。

不建议:不要为了寻找显著性而对大量调节变量反复试验。调节变量应尽量有理论、临床或研究设计依据。

10.51.3 数据准备

数据应为“一个观察对象一行,一个变量一列”。结局、\(X\)\(W\) 和协变量不能重复选择。

数据要素 要求 常见问题
连续结局 数值型且有变异 将类别代码当成连续数值
二分类结局 恰好两个水平 含有第三类或未清理的缺失代码
焦点自变量 \(X\) 连续或分类 与调节变量选为同一列
调节变量 \(W\) 连续或分类 分类水平过多导致模型不稳定
协变量 连续或分类 把中介变量当作普通协变量纳入
样本量 应支持交互项及所有协变量 小样本中拟合过度复杂的模型

本模块使用完整案例分析。任一入模变量缺失都会使该行从当前模型排除,结果页会报告总行数、完整案例数和排除行数。

10.51.4 统计模型

连续结局的基本模型为:

\[ Y=\beta_0+\beta_1X+\beta_2W+\beta_3XW+\sum_k\gamma_kC_k+\varepsilon \]

二分类结局则对事件概率 \(p\) 的 logit 建模:

\[ \log\left(\frac{p}{1-p}\right)=\beta_0+\beta_1X+\beta_2W+\beta_3XW+\sum_k\gamma_kC_k \]

其中 \(\beta_3\) 是调节效应的核心参数。当 \(\beta_3\) 显著时,表明 \(X\) 的效应随 \(W\) 改变。

10.51.5 使用步骤

10.51.5.1 1. 进入模块

在顶部菜单选择 “按统计学分类模块”,进入 “回归、效应修饰与复杂关系” 分类,点击 “调节效应分析”

10.51.5.2 2. 选择结局类型和变量

先选择连续结局或二分类结局,再依次选择结局、焦点自变量 \(X\)、调节变量 \(W\) 和需要调整的协变量。

10.51.5.3 3. 设置连续变量处理

  • 不中心化:保留原始零点。
  • 中心化 X 与 W:将连续 \(X\)\(W\) 减去各自均值,通常是推荐默认项。
  • 中心化所有连续预测变量:同时中心化连续协变量。

中心化不改变交互项的整体显著性或模型拟合,但会改变主效应和截距的参照点,通常有助于解释。

10.51.5.4 4. 设置条件值和推断方法

连续 \(W\) 可在均值及正负标准差、指定百分位数或观察范围的代表值下显示条件效应。分类 \(W\) 则按各水平显示。置信水平可选 90%、95% 或 99%,标准误可选常规方法或 HC3 稳健方法。

10.51.5.5 5. 开始分析

点击 “开始调节效应分析”。左侧默认勾选全部结果。如果变量重复、结局类型不符、变量无变异或完整案例过少,页面会保留当前会话并显示具体错误。

10.51.6 结果解读

10.51.6.1 模型概览

首先核对结局类型、变量角色、模型式、完整案例数、中心化和标准误方法。连续结局主要查看 \(R^2\)、调整 \(R^2\) 和总体检验;二分类结局主要查看似然类指标、AIC/BIC 和模型总体检验。

10.51.6.2 交互作用检验

先查看总体检验和参数估计中的 \(X\times W\) 项。连续结局中,交互系数表示 \(W\) 每增加一个单位时,\(X\) 斜率的改变量。二分类结局中,系数位于 log odds 尺度,OR 为其指数转换。

\(X\)\(W\) 为多水平分类变量时,不应只解读某一个虚拟变量系数,还应先查看交互作用的总体检验。

10.51.6.3 条件效应与简单斜率

条件效应表显示在特定 \(W\) 水平下 \(X\)\(Y\) 的关联。应联合估计值、置信区间和 P 值解读,不要把任意的“低”“中”“高”代表值误解为真实分组。

10.51.6.4 Johnson–Neyman 显著性区间

\(X\)\(W\) 均为连续变量时,Johnson–Neyman 方法用于寻找 \(X\) 的条件效应从不显著转为显著的 \(W\) 阈值,并将结果限定在样本实际观察的 \(W\) 范围内。阈值附近的结论对抽样波动较敏感,应避免把阈值解释为确定的临床分界点。

10.51.6.5 交互作用图

图中线条或分组表示不同 \(W\) 条件,线条不平行是交互作用的直观表现。图形用于解释方向和大小,统计结论仍应以交互项的检验和置信区间为主。

10.51.7 下载 Word 报告

进入 “下载Word报告” 页签,下载当前分析的 Word 文档。报告会按左侧勾选项收录分析信息、模型表、条件效应、Johnson–Neyman 结果和交互图。

建议:请用微软 Word 打开下载文档,以保持表头、底注和图形排版。

10.51.8 论文报告建议

方法部分建议说明:

  1. 结局、\(X\)\(W\) 和协变量的定义与编码。
  2. 使用的线性或 Logistic 调节模型。
  3. 连续变量的中心化方法和条件值设置。
  4. 标准误、置信水平和缺失值处理。
  5. 调节变量的选择依据,以及是否事先指定。

结果部分建议报告:

  1. 完整案例数和排除数。
  2. \(X\times W\) 交互项的估计值、标准误、置信区间和 P 值。
  3. 关键 \(W\) 水平下 \(X\) 的条件效应。
  4. Johnson–Neyman 阈值或显著区间(如适用)。
  5. 交互作用图及其对效应方向的辅助说明。

连续结局可参考如下写法:

在调整年龄和性别后,压力与社会支持的交互项与连续结局显著相关(\(\beta=0.42\),95% CI 0.18–0.66,\(P<0.001\))。条件效应分析表明,社会支持较低时压力与结局的关联较弱,随社会支持增加,该关联增强。

二分类结局中应明确 OR 所对应的事件水平,并避免将交互项 OR 直接当作某一组的普通效应。

10.51.9 常见问题

1. 交互项不显著,但某一组的简单效应显著,能说存在调节吗?

不能。“显著”与“不显著”之间本身不一定存在显著差异。应以交互项的直接检验为主。

2. 中心化会改变调节效应吗?

线性重新定标不会改变整体模型拟合或交互项的核心检验,但会改变截距和主效应的参照点。

3. 什么时候使用 HC3 稳健标准误?

在连续结局模型中,当担心异方差或小样本对常规标准误的影响时,HC3 可作为稳健性分析。它不会修复模型形式错误、极端离群值或缺失非随机问题。

4. Johnson–Neyman 方法为什么没有结果?

该方法仅适用于连续 \(X\) 和连续 \(W\)。如果观察范围内的条件效应始终显著或始终不显著,也可能没有内部阈值。

5. 可以把连续调节变量人为分为高低组吗?

通常不推荐。切分连续变量会丢失信息、降低效能,并使结果依赖任意切点。保留连续尺度后使用条件效应和交互图通常更好。

6. 调节效应能证明因果吗?

不能。因果解释仍取决于研究设计、时间顺序、混杂控制、测量质量和其他可识别性条件。

10.51.10 小结

本模块的最佳使用方式是:先根据理论指定 \(X\)\(W\),再检验 \(X\times W\) 交互项,随后联合条件效应、Johnson–Neyman 区间和交互图解释方向与大小。

交互作用通常需要比主效应更大的样本量。对于关键结论,应报告估计值和置信区间,进行模型诊断与稳健性分析,并尽量在独立样本中验证。

10.52 结构方程模型

结构方程模型(Structural Equation Model, SEM)把因子分析与多元回归统一在同一个模型中,可同时描述不可直接观察的潜变量、潜变量与观测变量之间的测量关系,以及变量之间的结构路径。它适合检验有明确理论依据的复杂关联结构,也可用于仅含观测变量的路径分析。

核心原则:SEM 首先是理论驱动的模型检验方法。整体拟合良好并不证明模型是唯一正确的,也不自动建立因果关系;参数方向、模型识别、局部残差、替代模型和研究设计必须共同考虑。

10.52.1 模块能做什么

  • 使用语法定义测量模型、结构回归、方差、协方差、约束和用户定义参数。
  • 同时估计直接效应、间接效应、总效应和标准化路径系数。
  • 提供最大似然、稳健最大似然、最小二乘、加权最小二乘和成对最大似然等估计方法。
  • 提供整行删除、FIML、稳健两阶段和成对删除等缺失值策略,并自动处理统计上不兼容的组合。
  • 输出整体模型检验、CFI、TLI、RMSEA、SRMR 及附加拟合指标。
  • 输出结构路径、因子载荷、方差协方差、截距、定义参数和各内生变量的 \(R^2\)
  • 输出观测协方差矩阵、模型隐含协方差矩阵、标准化残差矩阵和修正指数。
  • 绘制路径图和标准化残差热图。
  • 生成包含当前表格、图形、模型语法和分析提示的 Word 报告。

10.52.2 适用场景

  1. 检验多个观测指标是否共同测量一个或多个潜在构念,并进一步分析潜变量之间的关联。
  2. 同时估计暴露、潜在中介、结局和协变量之间的多条路径。
  3. 比较理论模型所隐含的协方差结构与实际数据是否一致。
  4. 分解直接效应、间接效应与总效应,但前提是研究设计支持相应的时间顺序和混杂控制。
  5. 对仅含观测变量的复杂回归系统进行路径分析。

不建议:不要在没有理论依据的情况下反复添加路径直到拟合指标达标;不要把横断面路径系数解释为时间顺序或因果效应;不要仅凭修正指数决定模型结构。

10.52.3 数据准备

数据通常应为“一个观察对象一行,一个变量一列”。模型语法中出现的变量名必须与数据列名完全一致。连续变量应为数值型;若研究对象是有序分类指标,应依据指标尺度选择相应估计方法,并避免把无序分类编码直接当作连续测量。

数据要素 要求 常见问题
观测指标 每个潜变量通常需要多个有理论依据的指标 指标高度重复、零方差或测量方向相反
结构变量 暴露、结局、中介和协变量应有明确角色 同一变量被不合理地同时设为原因和结果
样本量 应结合自由参数、指标分布和模型复杂度判断 参数过多、样本过少、模型不识别
缺失值 使用统一缺失编码,并说明缺失机制假设 把 99、999 等缺失码当作真实数值
变量名称 与模型语法完全一致 空格、特殊字符或拼写不一致导致找不到变量

SEM 没有适用于所有研究的固定样本量阈值。自由参数越多、指标分布越偏、缺失越多、载荷越弱,通常越需要更大样本。正式分析前应检查异常值、极端偏态、共线性、稀疏类别和协方差矩阵是否接近奇异。

10.52.4 模型语法

本模块使用简洁语法描述模型。常用运算符如下:

语法 含义 示例
=~ 定义潜变量及其观测指标 Clinical =~ Biomarker1 + Biomarker2 + Biomarker3
~ 定义回归路径 Outcome ~ Clinical + Baseline
~~ 定义方差或协方差 Biomarker1 ~~ Biomarker2
* 为路径参数命名 Outcome ~ b*Clinical
:= 定义间接效应或其他参数函数 indirect := a*b

一个包含潜变量和间接效应的模型可写为:

Clinical =~ Biomarker1 + Biomarker2 + Biomarker3
Outcome ~ b*Clinical + c*Baseline
Clinical ~ a*Age
indirect := a*b

其中 Clinical 是潜变量,Biomarker1Biomarker3 是其观测指标,ab 是被命名的路径,indirect 是用户定义的间接效应。

10.52.5 统计模型

测量模型可写为:

\[ \mathbf{x}=\boldsymbol{\nu}+\boldsymbol{\Lambda}\boldsymbol{\eta}+\boldsymbol{\epsilon} \]

结构模型可写为:

\[ \boldsymbol{\eta}=\boldsymbol{\alpha}+\mathbf{B}\boldsymbol{\eta}+\mathbf{\Gamma}\mathbf{z}+\boldsymbol{\zeta} \]

其中 \(\boldsymbol{\Lambda}\) 为因子载荷矩阵,\(\mathbf{B}\) 表示潜变量之间的结构路径,\(\mathbf{\Gamma}\) 表示外生变量到内生变量的路径,\(\boldsymbol{\epsilon}\)\(\boldsymbol{\zeta}\) 分别是测量误差与结构扰动。

模型估计寻找一组参数,使模型隐含协方差矩阵 \(\boldsymbol{\Sigma}(\boldsymbol{\theta})\) 与观测协方差矩阵 \(\mathbf{S}\) 尽可能接近。不同估计方法使用不同的目标函数与标准误校正。

10.52.6 使用步骤

10.52.6.1 1. 进入模块

在顶部菜单选择 “按统计学分类模块”,进入 “潜变量模型与结构方程” 分类,点击 “结构方程模型”

10.52.6.2 2. 编写模型语法

在“模型语法”框中输入测量模型和结构路径。建议先从最简可识别模型开始,确认变量名、路径方向和潜变量指标,再逐步加入协方差、约束或定义参数。

10.52.6.3 3. 选择估计方法

默认“自动”适合以连续变量为主的常规模型。MLR 等稳健最大似然方法可在非正态连续数据中提供稳健标准误和校正检验;DWLS/WLSMV 等方法通常更适合有序分类指标;PML 使用成对信息进行估计。

方法类别 常见选择 使用提醒
最大似然 ML 适合连续指标和常规正态理论模型
稳健最大似然 MLM、MLMV、MLMVS、MLR 用于对非正态性更稳健的检验与标准误
最小二乘 GLS、ULS 对数据分布与模型规模有不同要求
加权最小二乘 WLS、DWLS、WLSM、WLSMV、WLSMVS 常用于有序分类指标,需结合指标尺度选择
成对最大似然 PML 与成对缺失值处理配合使用

10.52.6.4 4. 设置缺失值和标准误

  • 整行删除:任一建模变量缺失时排除该行,假设较强但解释直观。
  • FIML:在模型假设下利用每个观察对象的可用信息,适用于相应最大似然方法。
  • FIML(包含固定外生变量):把固定外生变量的缺失也纳入似然处理。
  • 稳健两阶段:采用两阶段方式估计缺失数据下的矩信息。
  • 成对删除:按变量对使用可用数据,主要与 PML 配合。

若估计方法、似然、缺失策略和标准误在统计上不兼容,模块会采用可执行的有效组合,并在模型信息中说明调整,不会让单次错误终止整个页面。

选择 Bootstrap 标准误后,可设置区间方法、重复次数和并行计算。正式报告通常需要足够的重复次数;较小次数只适合调试模型。

10.52.6.5 5. 设置模型与图形

潜变量可通过“固定首个指标载荷”或“固定潜变量方差”定标。观测变量预标准化会改变非标准化参数的量纲,应在方法中说明。修正指数阈值只控制显示,不改变模型估计。

路径图可选树状、环形或弹簧布局,并显示标准化估计、非标准化估计或参数名称。布局只影响图形排版。

10.52.6.6 6. 选择输出并开始分析

左侧默认勾选全部主要表格和两类图形。点击 “开始结构方程分析” 后,模块会在当前页面内捕获语法、识别、收敛、矩阵和绘图错误,并显示具体信息。

结构方程模型:完整设置面板
结构方程模型:完整设置面板

10.52.7 结果解读

10.52.7.1 模型概览

首先核对估计方法、缺失处理、标准误、样本量、自由参数、收敛状态和迭代次数。若模型未收敛、信息矩阵异常或出现负方差,应先解决估计问题,再解释拟合和路径。

结构方程模型:模型概览
结构方程模型:模型概览

10.52.7.2 模型拟合

  • 卡方检验:检验模型隐含协方差矩阵与观测矩阵是否完全一致。对样本量和轻微失配较敏感。
  • CFI / TLI:把当前模型与基线模型比较,数值越高通常表示相对拟合更好。
  • RMSEA:反映每个自由度的近似失配,应结合置信区间解释。
  • SRMR:标准化残差的总体摘要,越小通常表示平均残差越小。
  • AIC / BIC 等:用于同一数据上候选模型的相对比较,数值越小通常更有利;不能独立证明模型正确。
结构方程模型:模型拟合
结构方程模型:模型拟合

10.52.7.3 参数估计

结构路径表给出回归路径的非标准化估计、标准误、置信区间、标准化估计、Z 值和 P 值。测量模型载荷用于判断各指标与潜变量的关系方向和强度。方差协方差表与截距表用于检查尺度、残差和潜变量关系。

结构方程模型:参数估计
结构方程模型:参数估计

标准化系数便于比较同一模型中不同路径的相对强度,但其解释仍依赖变量分布、定标方式和研究设计。统计学显著不等于临床重要,非显著也不证明效应为零。

10.52.7.4 间接效应与定义参数

若模型语法使用参数标签并通过 := 定义间接效应,结果会报告相应估计及置信区间。勾选“自动计算间接效应”时,模块还可依据连续结构路径生成可识别的间接效应。

间接效应的因果解释需要明确时间顺序、无未控制混杂、测量可靠性和正确模型设定。横断面数据通常只能支持关联性的路径分解。

10.52.7.5 协方差矩阵与残差

观测协方差矩阵来自数据;模型隐含协方差矩阵由估计参数推导;两者差异形成残差。较大的标准化残差提示模型在相应变量对上存在局部失配。

结构方程模型:协方差与残差矩阵
结构方程模型:协方差与残差矩阵

10.52.7.6 解释方差与修正指数

\(R^2\) 表示模型对各内生变量或指标变异的解释比例。修正指数估计“若释放当前固定路径,整体卡方可能下降多少”;预期参数变化反映该路径可能的方向和大小。

结构方程模型:模型诊断
结构方程模型:模型诊断

修正指数边界:同一数据上反复按修正指数加路径会提高过拟合和偶然发现风险。任何修改都应有理论理由,并尽量在独立数据中验证。

10.52.7.7 图形

路径图用椭圆表示潜变量、矩形表示观测变量,箭头表示回归或测量关系,双向线表示协方差。图形用于核对模型结构;正式解释应以参数表和置信区间为准。

结构方程模型:路径图
结构方程模型:路径图

残差热图把标准化残差的方向和大小映射为颜色。接近 0 的单元格表示局部拟合较好,绝对值较大的单元格需要结合理论和数据质量检查。

结构方程模型:标准化残差热图
结构方程模型:标准化残差热图

10.52.8 下载 Word 报告

进入 “下载Word报告” 页签,可下载当前分析的 Word 文档。报告包含已勾选且成功生成的表格、路径图、残差图、模型语法和分析提示。

结构方程模型:下载页
结构方程模型:下载页

建议:请使用微软 Word 打开报告。正式投稿前应核对变量命名、表题、置信水平、估计方法、缺失处理和图形标签,并删除仅用于模型调试的输出。

10.52.9 论文报告建议

方法部分建议说明:

  1. 理论模型、潜变量定义、观测指标和路径方向。
  2. 估计方法、标准误类型、置信水平和缺失值处理。
  3. 潜变量定标方式、观测变量预处理和异常值处理。
  4. 用于判断模型拟合的指标,以及任何事后模型修改的预设规则。
  5. 间接效应的定义与 Bootstrap 设置(如适用)。

结果部分建议报告:

  1. 分析样本量、缺失处理后的有效信息和模型是否收敛。
  2. 卡方、自由度、P 值、CFI、TLI、RMSEA 及其区间、SRMR。
  3. 关键路径的非标准化估计、标准误、置信区间、P 值和标准化估计。
  4. 主要因子载荷、内生变量 \(R^2\) 和间接效应。
  5. 有理论依据的模型修改及其验证方式。

可参考如下写法:

采用结构方程模型同时估计潜在临床负担及其与结局的结构路径。模型使用稳健最大似然方法估计,并以完全信息最大似然处理缺失值。模型整体拟合通过卡方检验、CFI、TLI、RMSEA 及其 90% 置信区间和 SRMR 联合评价。潜在临床负担与结局呈正向关联;该路径的非标准化估计、95% 置信区间和标准化估计见表。所有路径均按预设理论模型解释,未根据修正指数进行数据驱动的路径增删。

10.52.10 常见问题

1. 模型拟合良好是否证明因果关系?

不能。拟合只说明模型隐含的协方差结构与数据并不明显冲突。因果解释还需要研究设计、时间顺序、混杂控制、测量质量和可识别性假设。

2. 卡方检验显著是否一定说明模型不能用?

不一定。卡方检验对样本量和轻微失配较敏感,应结合自由度、CFI/TLI、RMSEA 区间、SRMR、残差和理论合理性综合判断。

3. 应选择固定首个载荷还是固定潜变量方差?

两者都是常见定标方式。固定首个载荷使潜变量量纲接近该指标;固定潜变量方差便于把潜变量视为标准化尺度。选择应预先确定并在方法中说明。

4. 为什么模型不收敛?

常见原因包括模型不识别、样本量不足、变量无变异、共线性、极端偏态、负方差、路径过多、指标过少或起始值困难。应先简化模型并检查数据,而不是反复更换估计器碰运气。

5. 修正指数很大就应增加该路径吗?

不应自动增加。先核对数据录入、指标内容、方法效应和理论依据;若增加路径,应明确标注为事后修改,并在独立样本验证。

6. 什么时候使用 FIML?

当估计方法支持、缺失机制假设合理且模型包含足够预测缺失的信息时可考虑 FIML。仍应报告缺失比例、缺失模式和敏感性分析。

7. 连续变量都需要标准化吗?

不需要。标准化便于比较路径,但会改变非标准化系数的量纲。若变量尺度差异极大或数值优化困难,可考虑标准化,并在报告中说明。

8. 路径图可以代替结果表吗?

不能。路径图便于展示结构,但通常省略标准误、置信区间、P 值和完整诊断信息。正式报告应以统计表为主。

9. 为什么某些菜单组合被自动调整?

部分缺失策略、似然形式和标准误只适用于特定估计方法。模块会把不适用组合调整为可执行设置,并在模型信息中记录,避免得到伪结果或让页面崩溃。

10.52.11 小结

本模块的最佳使用方式是:先依据理论写出最简可识别模型,再选择与变量尺度相符的估计方法和缺失策略,确认收敛后联合检查整体拟合、参数、残差和修正指数,最后以独立数据或敏感性分析验证关键结论。

结构方程模型能够同时表达测量误差和多条结构路径,但复杂并不等于更真实。透明报告模型设定、估计选择、数据驱动修改和解释边界,是形成可靠结论的关键。

10.53 路径分析

路径分析用于同时估计多个连续结局之间的有向回归关系。它适合表达“暴露变量与中间变量相关,中间变量再与后续结局相关”的观测变量路径系统,并可分解直接效应和间接效应。

核心原则:路径方向必须由研究设计、时间顺序和专业理论预先确定。模型拟合良好不能自动证明因果关系。

10.53.1 适用场景

  • 同时分析暴露、中间变量和连续结局之间的多条路径;
  • 估计直接效应、由路径系数乘积形成的间接效应和内生变量 \(R^2\)
  • 比较同一数据上的候选路径结构,并用多类拟合指标评价模型与数据的一致程度;
  • 按分组变量估计多组路径模型,探索各组路径结构。

不建议:不要根据修正指数反复添加路径直到拟合达标;不要把横断面数据中的路径系数直接写成因果效应。

10.53.2 数据准备

变量角色 要求
内生变量 连续数值变量,每个变量至少有两个不同的非缺失值
连续预测变量 数值型暴露、协变量或基线测量
分类预测变量 应预先设置为因子或文本类别,并明确参照水平
多组比较变量 可选分类变量,各组应有足够样本

数据应为一个观察对象一行、一个变量一列。分析前应检查缺失值、极端值、共线性和零方差变量,并确认路径方向符合实际时间顺序。

10.53.3 操作步骤

  1. 在顶部菜单选择 “按统计学分类模块” → “潜变量模型与结构方程” → “路径分析”
  2. 选择内生变量、连续预测变量、分类预测变量和可选的多组比较变量;
  3. 在每个内生变量的路径卡片中,选择进入该回归方程的预测变量;
  4. 选择估计方法、标准误、置信水平、\(R^2\) 区间、分类变量编码和连续变量处理方式;
  5. 核对结果表、修正指数和路径图选项;所有主要结果默认已勾选;
  6. 点击 “开始分析”,再依次查看模型信息、拟合、路径系数、间接效应、诊断和路径图。

内生变量之间不能形成循环路径。如果出现互相回归、缺少预测变量、样本过少、变量类型不符或模型不收敛,错误会显示在当前页面,不会使整个应用退出。

10.53.4 菜单选项

估计方法包括最大似然、广义最小二乘和对角加权最小二乘。估计方法应根据变量尺度、分布、样本量和研究方案选择,不应根据哪一种方法更容易得到显著结果而切换。

标准误可选常规、稳健或 Bootstrap。Bootstrap 需要设置重抽次数和区间方法,运行时间明显更长。

分类变量编码决定分类预测变量如何进入模型。报告时应说明编码方式和参照水平。

连续变量处理可保留原尺度、中心化或标准化。中心化改变截距的解释;标准化便于比较不同量纲路径,但不会消除混杂或证明因果。

多组比较会按一个分类变量分组拟合路径模型。各组样本过少时,参数和拟合指标可能不稳定。

10.53.5 结果解读

10.53.5.1 模型信息与拟合

先核对实际进入分析的样本量、估计方法、模型路径和是否收敛。整体卡方检验、CFI、TLI、RMSEA、SRMR、AIC 和 BIC 应联合解释,不能只依据单一阈值。AIC 和 BIC 只适合比较基于同一数据的候选模型。

10.53.5.2 路径系数与 \(R^2\)

非标准化系数保留原始量纲,标准化系数便于比较同一模型中不同路径的相对强度。\(R^2\) 表示当前模型对相应内生变量变异的解释比例。

10.53.5.3 间接效应

间接效应通常由连续路径系数的乘积得到。应同时报告估计值、置信区间和 P 值,并核对数据是否支持必要的时间顺序与混杂控制。统计上的间接效应不自动等于已证实的中介机制。

10.53.5.4 修正指数

修正指数用于定位可能的局部失配。新增路径必须有事前理论依据,并应尽量在独立数据中验证。如果根据当前数据修改模型,应在 Methods 和 Results 中明确标注为事后修改。

10.53.5.5 路径图

单向箭头表示回归方向,双向线表示协方差,路径标签可显示标准化或非标准化系数。布局、节点形状和节点大小只影响呈现,不改变模型结果。正式报告仍应以统计表为主。

10.53.6 表格描述与 Word 报告

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会将模型路径、样本量、估计方法和变量角色作为背景,生成医学论文 Results 部分风格的客观初稿。

“下载 Word 文档”会导出当前已勾选的统计表和路径图。请使用 Microsoft Word 打开文档,并在正式投稿前核对变量名称、参照水平、估计方法、置信水平和路径方向。

Methods 建议说明:研究设计、变量的时间顺序、路径设定依据、估计方法、标准误、置信区间、缺失处理、分类变量编码和是否进行事后模型修改。

Results 建议按“分析样本量 → 整体拟合 → 关键路径 → \(R^2\) → 间接效应 → 诊断与敏感性分析”的顺序报告。

10.53.7 常见问题

1. 模型拟合良好是否证明因果关系?

不能。拟合只表示模型隐含的协方差结构与数据并不明显冲突。因果解释还需要研究设计、时间顺序、混杂控制和可识别性假设。

2. 路径分析与结构方程模型有什么区别?

路径分析的主要变量都是直接观测的列;结构方程模型还可以用多个指标定义潜变量并显式建模测量误差。如果研究问题依赖潜在构念,应使用结构方程模型。

3. 修正指数很大就应增加路径吗?

不应自动增加。先核对数据、时间顺序和理论依据;事后修改应如实报告,并在独立数据中验证。

4. 为什么不能设置互相回归?

当前模块要求有向无环的递归路径结构。如果理论需要非递归互为因果的路径,通常需要额外的工具变量或识别条件,不应在本模块中直接拟合。

5. Bootstrap 运行很慢是否正常?

正常。Bootstrap 需要在每个重抽样本中重新拟合模型。建议先用常规标准误核对变量和路径,再在正式结果中运行足够的重抽次数。

10.53.8 小结

路径分析的可靠流程是:先依据理论和时间顺序定义无环路径,再核对变量类型、参照水平和样本量,确认模型收敛后联合解读整体拟合、路径系数、\(R^2\) 和间接效应,最后将修正指数限定为有理论依据的诊断工具。

10.54 复合结构方程模型

复合结构方程模型用于同时分析形成性复合构念、反映性潜在构念及其结构关系。模块把构念与指标定义、模型拟合、测量质量、路径效应、样本外预测和多组比较放在同一分析流程中。

核心原则:构念类型必须由测量理论和指标形成机制预先确定。形成性指标共同形成构念,反映性指标则是潜在特征的表现;两者不能仅根据哪种设置拟合更好而互换。

10.54.1 适用场景

  • 多个指标共同形成风险负荷、资源指数、环境暴露或综合能力等复合构念;
  • 多个题项反映同一潜在特征,并希望同时估计构念之间的结构路径;
  • 研究重点包括解释方差和样本外预测,同时需要检查信度、效度与共线性;
  • 希望比较不同人群中的构念关系和参数差异;
  • 需要对 PLS、GSCA 和 MAXVAR 三种估计结果进行预先规定的敏感性比较。

以下情况不宜直接使用本模块作为最终分析:构念含义和指标归属尚未确定;每个构念只有一个指标;样本量或组内样本过少;指标几乎无变异或高度共线;模型路径依赖当前数据反复试探;研究设计不能支持所写的时间顺序或因果语言。

10.54.2 数据准备

内容 要求 核对重点
测量指标 连续数值变量 每个构念至少两个指标,同一指标只能分配给一个构念
构念名称 以字母开头,仅含字母、数字、下划线或点 不得重复,也不得与数据列名相同
方向性路径 每个内生构念至少一个预测构念 不能自我预测或形成循环路径
多组变量 可选分类变量 每组应有足够完整案例和指标变异

数据应为一个观察对象一行、一个变量一列。模块采用当前模型涉及变量的完整案例。分析前应检查缺失比例、异常值、指标分布、零方差、共线性和组别样本量。

构念定义边界:反映性构念中的题项通常应具有可交换性并共享共同原因;形成性构念的指标可以代表不同组成部分,删除某个指标可能改变构念含义。统计结果不能替代内容效度判断。

10.54.3 操作步骤

顶部菜单选择 “按统计学分类模块” → “潜变量模型与结构方程” → “复合结构方程模型”

  1. 设置 2–6 个构念;
  2. 为每个构念选择“反映性潜在构念”或“形成性复合构念”;
  3. 填写构念名称,并为每个构念分配至少两个数值指标;
  4. 选择“方向性路径模型”或“构念相关模型”;
  5. 方向性模型中指定内生、外生构念,以及每个内生构念的预测构念;
  6. 如需多组比较,选择一个分类分组变量;
  7. 选择 PLS、GSCA 或 MAXVAR,并核对 Bootstrap、精确拟合和样本外预测设置;
  8. 核对结果表和统计图;默认已全部勾选;
  9. 点击“开始分析”,依次查看模型概览、拟合、测量模型、结构模型、预测与多组结果和统计图;
  10. 在下载页导出 Word 报告。

输入不合法、路径循环、样本过少、模型未返回结果或图表生成失败时,错误会显示在当前模块,不会使整个应用退出。修正设置后可在同一会话重新分析。

10.54.4 菜单选项

构念类型决定指标与构念之间的关系。反映性潜在构念重点评价外部载荷、信度、AVE 和区别效度;形成性复合构念重点评价外部权重、载荷、显著性和 VIF。

方向性路径模型估计预先设定的有向结构关系、内生构念 \(R^2\) 以及直接和间接效应。构念相关模型不指定路径方向,用于估计构念之间的协方差或相关结构。

PLS通常适用于强调解释方差和预测的复合模型。GSCA使用整体最小二乘准则估计构念得分和模型参数;含形成性构念的构念相关模型不提供 GSCA。MAXVAR强调构念得分之间的解释关系;与形成性复合构念同时使用时,模块会自动采用兼容的去衰减设置并在结果中说明。

Bootstrap用于评估标准误、置信区间和参数稳定性。重抽次数越多,计算时间越长。正式分析通常应使用足够的重抽次数,并报告具体次数。

精确拟合检验依赖重抽样,用于比较观测与模型隐含的差异。它应与描述性拟合指标、模型目的和样本量联合解释。

样本外预测能力使用交叉验证比较目标模型和线性基准的预测误差。该功能适用于不分组且内生构念不超过两个的方向性路径模型;其他结构会在结果中明确说明不生成预测。折数决定每轮训练与验证的划分,应在分析前设定。

10.54.5 结果解读

10.54.5.1 模型概览与拟合

先核对构念类型、指标归属、完整案例数、估计方法、迭代和收敛信息。整体拟合与精确拟合结果应联合解读,不宜依据单一阈值机械判定模型“正确”或“错误”。

10.54.5.2 反映性测量模型

外部载荷反映指标与潜在构念之间的关系。应联合查看载荷大小和不确定性、Cronbach’s alpha、rhoC、rhoA、AVE 以及 HTMT。信度较高不等于内容效度充分,HTMT 也不能替代理论上的构念区分。

10.54.5.3 形成性测量模型

外部权重表示指标对复合构念得分的相对贡献;外部载荷可作为补充。VIF 用于识别形成性指标之间的共线性。权重不显著时,应结合载荷、内容覆盖和指标不可替代性决定是否保留,不能仅按 P 值机械删项。

10.54.5.4 结构路径、\(R^2\) 与效应

路径系数表示在模型中其他前置构念保持不变时的条件关联。\(R^2\) 表示模型对内生构念变异的解释比例。间接效应依赖路径方向、时间顺序、模型正确设定和无未控制混杂等强假设,不应自动写成已证实的因果机制。

10.54.5.5 样本外预测

Q²_predict 以及目标模型与线性基准的 MAE、RMSE 比较用于评价预测表现。训练数据中的高解释度不保证新样本预测良好;预测结论应基于交叉验证结果,并说明数据拆分和折数。

10.54.5.6 多组比较

多组结果用于考察构念关系是否可能随人群而变化。正式解释前应核对各组样本量、构念测量是否可比、参数差异和多重检验问题。分组内结果显著性不同,不等于组间差异本身显著。

10.54.6 统计图

构念路径图展示构念类型、路径方向和估计值;外部载荷与权重图比较各指标对构念的关系或贡献;样本外预测误差图比较目标模型与线性基准的 RMSE。

图形使用固定、适合报告的渲染尺寸,左侧面板不提供宽高设置。布局只影响呈现,不改变统计结果。正式报告仍应以统计表中的估计值和不确定性为准。

10.54.7 表格描述与 Word 报告

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把构念、路径、估计方法、样本量和表格主题作为背景,生成医学论文 Results 部分风格的客观初稿,并限制因果断言、机制猜测、临床建议和表外信息。

“下载 Word 文档”会导出当前勾选的统计表、多组摘要和统计图。请使用 Microsoft Word 打开文档;WPS 可能导致表头、底注或图片排版兼容性问题。

Methods 建议报告:研究设计、构念理论、指标与构念类型、路径设定依据、完整案例处理、估计方法、去衰减设置、Bootstrap 次数、精确拟合检验、交叉验证折数和多组变量。

Results 建议按“样本与模型概览 → 反映性测量质量 → 形成性权重和共线性 → 整体拟合 → 结构路径与 \(R^2\) → 间接效应 → 样本外预测 → 多组结果”的顺序报告。

10.54.8 常见问题

1. 形成性和反映性构念如何选择?

依据指标与构念的理论关系选择。若潜在特征导致各题项表现,通常考虑反映性;若各指标共同定义或形成综合构念,通常考虑形成性。

2. 为什么同一指标不能分配给多个构念?

当前模块要求每个观测指标有唯一的测量归属,以避免重复使用同一信息造成模型定义和解释含糊。

3. 为什么方向性路径不能循环?

当前模块估计递归结构。互相预测会形成非递归模型,需要额外识别条件和专门方法,不能在这里直接拟合。

4. Bootstrap 为什么较慢?

每次重抽样都需要重新估计完整测量模型和结构模型;构念多、多组比较或重抽次数高时,运行时间会明显增加。

5. 模型拟合好是否说明预测能力好?

不一定。拟合描述模型与当前样本的关系,预测评价模型对未参与训练数据的表现,应单独查看交叉验证结果。

6. 路径显著是否证明因果关系?

不能。因果解释还需要研究设计、时间顺序、混杂控制、测量质量和可识别性假设。

10.54.9 小结

复合结构方程模型的可靠流程是:先依据理论区分形成性和反映性构念,明确指标归属和无环结构路径,再核对样本与收敛,依次评价测量模型、整体拟合、结构效应和样本外预测,最后在多组分析和论文写作中保持测量可比性与因果边界。

10.55 潜在类别分析

潜在类别分析用于根据多个分类指标的共同反应模式,识别样本中无法直接观察到的潜在人群类别。它不是按研究者预先给定的分组比较均值,而是用概率模型估计每个类别的反应特征、类别比例,以及每个观察对象属于各类别的后验概率。

核心原则:类别数不能只凭某一个信息准则决定。应联合比较 AIC、BIC 等拟合指标,同时检查类别规模、后验归类质量、模型稳定性、专业可解释性和研究可重复性。

10.55.1 模块能做什么

  • 使用两个或更多分类指标拟合潜在类别模型。
  • 比较 1 类至所选类别数的候选模型。
  • 输出 AIC、AIC3、BIC、SABIC、CAIC、熵、似然比统计量和 Pearson 拟合统计量。
  • 报告模型估计的类别比例、实际归类人数和平均后验概率。
  • 输出各类别对每个指标反应水平的条件概率。
  • 显示观察到的反应模式频数与模型预测频数。
  • 在纳入协变量时,估计协变量与潜在类别归属之间的关联。
  • 下载完整案例的类别归属和各类别后验概率。
  • 绘制条件概率热图、按类别的项目图、类别剖面图和模型比较图。
  • 生成包含当前表格与图形的 Word 报告。

10.55.2 适用场景

  1. 根据多项症状的有无识别临床表现亚型。
  2. 根据健康行为、危险因素或治疗依从性项目识别人群模式。
  3. 根据问卷的分类反应寻找不同反应类别。
  4. 探索多个疾病、并发症或照护需求是否形成可解释的人群组合。

不建议:连续指标不应仅为了使用潜在类别分析而随意分组。若主要指标本身是连续变量,更适合使用潜在剖面分析。类别结果也不能自动等同于真实疾病实体或稳定的个体标签。

10.55.3 数据准备

数据应为“一个观察对象一行,一个分类指标一列”。模块可接收因子、字符或低水平数值编码,并把每个指标的有效水平重新编码后进入模型。

数据要素 要求 常见问题
分类指标 每项至少两个、至多八个有效水平 把连续测量直接当作多水平分类指标
协变量 可为有变异的连续变量或分类变量 与分类指标重复选择
样本量 完整案例至少 50,且应支持所选类别数 类别数过多、参数远多于信息量
缺失值 使用空值或统一的缺失编码 把 99、999 等当作真实类别
类别含义 每个水平有明确专业含义 同一数值在不同指标中含义不清

本模块对所有入模指标和协变量使用完整案例分析。任一入模变量缺失,该行就不进入当前模型;结果会报告总行数、完整案例数和排除行数。

10.55.4 统计模型

设观察对象在第 \(j\) 个指标上的反应为 \(Y_j\),潜在类别为 \(C\)。局部独立假设下,给定类别后的联合反应概率可写为:

\[ P(Y_1=y_1,\ldots,Y_J=y_J)=\sum_{c=1}^{K}P(C=c)\prod_{j=1}^{J}P(Y_j=y_j\mid C=c) \]

其中 \(K\) 为类别数,\(P(C=c)\) 为类别比例,\(P(Y_j=y_j\mid C=c)\) 为条件反应概率。若纳入协变量,类别归属概率通过多项 Logistic 形式与协变量关联。

10.55.5 使用步骤

10.55.5.1 1. 进入模块

在顶部菜单选择 “按统计学分类模块”,进入 “潜变量模型与结构方程” 分类,点击 “潜在类别分析”

10.55.5.2 2. 选择分类指标

在“分类指标”中选择至少 2 项。指标应共同刻画同一研究主题,但又能够区分不同反应模式。指标过少时,复杂类别模型通常缺乏充分识别信息。

10.55.5.3 3. 选择协变量

协变量为可选项。纳入后用于估计其与潜在类别归属的关联;它不会替代分类指标,也不应仅因统计显著而随意加入。

10.55.5.4 4. 设置类别数

可选择 2–6 类。模块会同时拟合 1 类至所选类别数,便于比较候选模型。建议从较少类别开始,逐步增加并检查模型是否获得稳定、规模合理且有专业含义的类别。

10.55.5.5 5. 设置图形标签并选择输出

横轴标签角度只改变图形排版,不改变模型估计。左侧默认勾选全部表格、图形和成员归类结果;不需要的内容可取消勾选。

10.55.5.6 6. 开始分析

点击 “开始潜在类别分析”。如果指标不足、变量无变异、完整案例过少、类别数相对样本过多或模型无法拟合,页面会保留当前会话并显示具体错误,不会因单次分析失败而退出整个应用。

10.55.6 结果解读

10.55.6.1 模型概览

首先核对入选指标、协变量、类别数、完整案例数和排除数。最终模型拟合表汇总所选类别模型的参数数、信息准则、熵、总体拟合统计量和收敛状态;类别规模表用于识别过小或归类不清的类别。

类别标签本身是任意的。“类别 1”“类别 2”没有固定的严重程度或临床含义,必须根据条件反应概率进行命名。

10.55.6.2 模型比较

  • AIC、AIC3、BIC、SABIC、CAIC:用于候选类别数的相对比较,通常越小越好。惩罚更强的信息准则更倾向于简约模型。
  • 熵(Entropy):反映总体归类清晰程度,越接近 1 通常表示后验归类更明确,但不能单独用于选择类别数。
  • G2 与 Pearson 统计量:比较模型预测和观察反应模式。稀疏列联模式较多时,其近似 P 值应谨慎解释。
  • 类别规模:极小类别可能反映离群模式、局部最优解或过度提取,也可能代表真实但少见的人群,应结合研究背景判断。

信息准则继续下降不意味着必须选择更多类别。若新增类别很小、与原类别高度相似、难以解释或在重复拟合中不稳定,应优先考虑更简约的模型。

10.55.6.3 项目反应概率

条件反应概率是类别命名的主要依据。例如,某一类别在多个症状“有”上的概率都高,可描述为“多症状高概率类”;若只在某一组指标上高,应依据该组指标的专业内容命名。

命名应保持描述性,避免把探索出的统计类别直接命名为尚未验证的疾病、病因或治疗反应机制。

10.55.6.4 归类结果

后验归类质量表汇总每个观察对象最大后验概率的均值、中位数及低于常用参考值的人数。最大后验概率越高,个体归类越明确。

成员归类表提供最可能类别和每个类别的后验概率。下载的 CSV 包含全部完整案例,可用于描述类别特征;但后续分析若只使用“最可能类别”,会忽略分类不确定性,应在论文局限性或敏感性分析中说明。

10.55.6.5 协变量结果

纳入协变量时,系数以类别 1 为参照,表示协变量与进入其他潜在类别的相对优势之间的关联。连续协变量的系数对应每增加一个单位,分类协变量则相对其参照水平解释。

注意:协变量系数来自类别归属模型,不能自动证明协变量造成了类别差异。横断面数据尤其不能据此确定时间顺序或因果方向。

10.55.6.6 图形

条件概率热图便于纵览每个指标反应在不同类别中的概率:

按类别的项目图用于比较各反应水平在类别间的构成:

潜在类别剖面图突出类别之间的模式差异,适合辅助命名:

模型比较图展示不同类别数下信息准则的变化趋势:

图形用于识别模式和沟通结果,正式结论仍应以数值表、模型稳定性和专业判断为依据。

10.55.7 下载 Word 报告

进入 “下载Word报告” 页签,可下载当前分析的 Word 文档和全部成员归类 CSV。Word 报告只收录本次勾选并成功生成的表格和图形。

建议:请用微软 Word 打开下载文档,以保持表头、底注和图形排版。成员归类 CSV 应与原始数据的行标识核对后再用于后续分析。

10.55.8 论文报告建议

方法部分建议说明:

  1. 分类指标及其编码方式。
  2. 候选类别数范围和随机起始值策略。
  3. 类别数选择所依据的信息准则、类别规模和解释原则。
  4. 缺失值处理、协变量及其编码。
  5. 后验归类和不确定性的处理方式。

结果部分建议报告:

  1. 总样本量、完整案例数和排除数。
  2. 各候选模型的主要信息准则。
  3. 最终类别数及选择理由。
  4. 各类别比例、归类人数和平均后验概率。
  5. 用于类别命名的关键条件反应概率。
  6. 协变量与类别归属的估计值和区间(如适用)。

可参考如下写法:

比较 1–4 类模型后,综合 BIC、SABIC、类别规模、后验归类质量和专业可解释性,最终选择 3 类模型。三类分别占完整案例的 41.2%、34.6% 和 24.2%。根据条件反应概率,三类被描述为低症状概率类、特定症状类和多症状高概率类。各类平均后验概率均超过 0.80,提示总体归类较清晰。

10.55.9 常见问题

1. BIC 最小的模型一定是最终模型吗?

不一定。还要检查类别规模、后验概率、模型稳定性、参数是否异常,以及新增类别是否有清晰专业意义。

2. 熵达到多少才算合格?

没有适用于所有研究的绝对阈值。熵受类别重叠、指标数量和样本构成影响,应作为归类质量证据之一,而不是类别数选择的唯一标准。

3. 为什么不同次分析的类别顺序会变化?

类别编号没有固有顺序。只要反应模式相同,编号互换并不改变模型含义。比较模型时应根据概率剖面匹配类别,而不是只看编号。

4. 为什么出现很小的类别?

可能是样本中确有少见模式,也可能来自离群反应、类别数过多、局部最优解或数据稀疏。应检查该类规模、后验概率、概率剖面和重复拟合稳定性。

5. 可以把后验类别直接作为无误差分组做回归吗?

可以用于探索性描述,但会忽略分类误差。关键推断应考虑分类不确定性,或至少进行敏感性分析并说明局限。

6. 二分类和多分类指标可以一起分析吗?

可以,只要各水平编码清楚、样本量足够且指标具有共同研究意义。水平过多会显著增加参数数量。

7. 连续指标能否直接放入本模块?

不建议把具有大量不同取值的连续变量作为分类指标。连续指标应优先使用潜在剖面分析;若确需分组,应预先给出有专业依据的切点并评估信息损失。

8. 模型不收敛怎么办?

减少类别数或指标水平,检查极少见反应、缺失、重复变量和异常编码,并增加有效样本。不要只选择一次偶然收敛但结构不稳定的结果。

9. 潜在类别是否代表真实疾病亚型?

不能自动这样解释。潜在类别是当前样本、指标和模型假设下的统计模式,需要外部变量、独立样本、时间稳定性和专业证据进一步验证。

10.55.10 小结

本模块的最佳使用方式是:先选择有共同研究意义的分类指标,再比较由简到繁的候选模型,联合信息准则、类别规模、后验归类质量和专业解释选择类别数,最后用条件反应概率描述类别并在独立样本中验证。

潜在类别分析适合发现人群中的异质反应模式,但类别不是直接观察到的事实。透明报告模型比较、缺失处理、归类不确定性和类别命名依据,是形成可靠结论的关键。

10.56 多水平潜类分析

多水平潜类分析用于处理“个体嵌套于群组”的分类指标资料,例如患者嵌套于医院、学生嵌套于学校或居民嵌套于社区。模型在识别个体层潜在类别的同时,进一步识别群组层潜在类别,从而描述不同群组中个体类别构成的异质性。

核心问题:多个分类指标能否把个体分成若干具有不同反应模式的潜在类别?这些个体类别在不同医院、学校、中心或社区中的构成是否又形成若干群组层潜在类型?

10.56.1 模块能做什么

  • 同时估计个体层潜在类别和群组层潜在类别;
  • 使用至少 3 个二分类或有限水平分类指标;
  • 设置 2–5 个个体潜类和 2–4 个群组潜类;
  • 输出当前模型的对数似然、AIC、BIC、熵、自由度和似然比卡方;
  • 比较 2 类至所选群组潜类数的候选模型;
  • 报告个体类别比例、群组类别比例及各群组类别中的个体类别构成;
  • 输出每个观测群组的后验概率和最可能群组类别;
  • 输出各个体潜类中的项目反应概率;
  • 纳入连续或分类个体层协变量,并报告模型比较、差异检验和类别归属系数;
  • 绘制项目反应概率图、群组类别构成图和模型比较图;
  • 为每张主要表格和图形生成中英文描述,并下载多格式图形;
  • 下载包含当前结果的 Word 报告和完整群组归类 CSV;
  • 将输入、拟合、绘图或下载错误保留在模块内部,不会使整个应用退出。

10.56.2 适用场景

  1. 根据患者症状组合识别个体亚型,并比较不同医院的亚型构成;
  2. 根据学生行为或心理项目识别个体类别,并识别具有不同类别分布的学校类型;
  3. 根据居民健康行为识别人群模式,并分析社区层异质性;
  4. 根据多项护理质量或服务利用指标识别个体需求类别和中心类型;
  5. 在明确的群组结构下,考察年龄、性别等个体层协变量与潜在类别归属的关联。

不宜直接使用的情况:资料没有真实的嵌套结构;群组只是普通暴露分组;群组数过少或多数群组人数很少;主要指标为连续变量;同一个体跨越多个群组;需要估计随时间转移的类别。上述情况应分别考虑普通潜类分析、潜在剖面分析、交叉分类模型或潜在转移分析。

10.56.3 数据准备

数据采用长表结构:每名个体占一行,群组标识在同一群组内重复出现。

个体编号 中心 症状1 症状2 症状3 症状4 年龄 性别
P001 中心01 52
P002 中心01 61
P003 中心02 46
数据要素 模块要求 准备建议
分类指标 至少 3 项,每项 2–8 个有效水平 水平应有清晰专业含义,避免极少见类别
群组标识 至少 8 个有效群组,每组至少 5 个完整案例 使用医院、学校、中心或社区编号,不要使用个体 ID
个体层协变量 可为空;连续变量需有变异,分类变量 2–12 个水平 分类变量自动以第一个水平为参照进行虚拟编码
样本量 完整案例至少 100,并应支持所选类别数 个体潜类越多、群组潜类越多,对样本和群组数要求越高
缺失值 使用空值或统一缺失编码 99、999 等必须先转换为缺失,不能当作真实类别

模型对分类指标、群组标识和所选协变量使用共同完整案例。页面会报告原始样本量、模型样本量、排除样本量、有效群组数和群组规模范围。

10.56.4 统计模型

设第 \(g\) 个群组中的第 \(i\) 名个体在第 \(j\) 个分类指标上的反应为 \(Y_{gij}\),个体潜在类别为 \(C_{gi}\),群组潜在类别为 \(W_g\)。在给定个体类别后的局部独立假设下,可表示为:

\[ P(\mathbf{Y}_{gi}=\mathbf{y}\mid W_g=w) =\sum_{c=1}^{K}P(C_{gi}=c\mid W_g=w,\mathbf{x}_{gi}) \prod_{j=1}^{J}P(Y_{gij}=y_j\mid C_{gi}=c), \]

其中 \(K\) 为个体潜类数,\(W_g\) 描述群组层异质性,\(\mathbf{x}_{gi}\) 为可选个体层协变量。项目反应概率用于解释个体类别;不同 \(W_g\) 下的 \(P(C_{gi}=c\mid W_g=w)\) 用于解释群组类别。

潜在类别编号没有固有顺序。“个体类别1”或“群组类别1”只是计算标签,不能自动理解为低风险、轻症或参照人群,必须依据概率模式进行描述。

10.56.5 主要参数

设置 含义 使用建议
分类指标 用于识别个体潜类的分类反应 至少 3 项,宜共同反映同一研究主题
群组标识 个体嵌套所在的上级单位 一个群组内可有多名个体,个体不能跨组重复
个体层协变量 与个体类别归属关联的变量 应由研究问题预先确定,不能只按显著性筛选
个体潜类数 个体反应模式的类别数 支持 2–5 类,建议从少到多比较
群组潜类数 群组层类别数 支持 2–4 类,群组数不足时不要过度提取
模型比较 比较群组潜类数的信息准则和相邻模型 结合 BIC、类别规模、稳定性和解释性判断
群组后验归类 各群组属于每个群组潜类的概率 最大概率用于最可能归类,同时保留不确定性
协变量检验与系数 比较协变量模型并输出比值比 解释为关联,不作因果推断

左侧所有结果表和图形默认勾选,不提供图像宽高设置;每幅图在显示和下载时使用稳定尺寸。

一键自动生成以下表格和图形:

  • 分析信息与当前模型拟合;
  • 群组潜类数比较和相邻模型比较;
  • 个体类别比例、群组类别比例及群组内个体类别构成;
  • 观测群组的个体类别构成和群组后验归类;
  • 项目反应概率;
  • 协变量模型拟合、差异检验和类别归属系数;
  • 项目反应概率图、群组类别构成图和信息准则图;
  • Word 报告、群组归类 CSV 和多格式统计图。

10.56.6 使用步骤

10.56.6.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “潜变量模型与结构方程” → “多水平潜类分析”

10.56.6.2 2. 选择分类指标与群组标识

在“分类指标”中至少选择 3 项分类变量,在“群组标识”中选择医院、学校、中心或社区编号。群组标识不能与指标或协变量重复。

10.56.6.3 3. 选择个体层协变量

协变量可为空。连续协变量按每增加一个单位解释;分类协变量以第一个水平为参照形成虚拟变量。只有在研究问题需要时才纳入协变量。

10.56.6.4 4. 设置类别数和输出

先从较少的个体潜类和群组潜类开始。默认结果与图形均已勾选,无需设置图宽和图高。

多水平潜类分析:变量、群组与类别设置
多水平潜类分析:变量、群组与类别设置
多水平潜类分析:完整输出选项与开始分析按钮
多水平潜类分析:完整输出选项与开始分析按钮

10.56.6.5 5. 开始分析

点击 “开始多水平潜类分析”。先在“分析概览”核对样本、群组、类别数和当前模型,再依次查看模型比较、类别结构、项目概率、协变量结果和统计图。

多水平潜类分析:分析概览与表格描述按钮
多水平潜类分析:分析概览与表格描述按钮

10.56.7 结果解释

10.56.7.1 当前模型拟合与模型比较

  • 对数似然:用于构成信息准则和嵌套模型比较,不能脱离参数数直接判断优劣;
  • AIC、BIC:越小通常表示相对拟合更优,BIC 对复杂模型惩罚更强;
  • 熵:越接近 1 通常表示个体归类更清晰,但不能单独决定类别数;
  • 似然比卡方:描述模型与观察反应模式之间的偏离,稀疏反应模式较多时需谨慎解释;
  • 相邻模型比较:在群组潜类数大于 2 时提供,用于比较增加群组类别后的拟合变化。
多水平潜类分析:群组潜类数模型比较
多水平潜类分析:群组潜类数模型比较

信息准则继续下降不意味着必须选择更多类别。若新增群组类别只包含很少群组、后验概率不清晰、与原类别构成相近或缺乏专业意义,应考虑更简约模型。

10.56.7.2 类别结构与群组归类

个体类别比例描述总体中的潜在个体类型分布;群组类别比例描述群组层类别分布;群组类别条件构成表展示每个群组潜类中各个体类别所占比例,是解释群组类别的主要依据。

群组后验归类表给出每个观测群组属于各群组类别的概率。模块根据这些后验概率的最大值重新确定“最可能群组类别”,CSV 同时保留全部概率,不能只保留最终标签而丢弃不确定性。

多水平潜类分析:类别比例、条件构成和群组后验归类
多水平潜类分析:类别比例、条件构成和群组后验归类

10.56.7.3 项目反应概率

项目反应概率表示在给定个体潜类后出现某个反应水平的概率,是个体类别命名的核心依据。例如,多个症状“是”的概率均较高时,可描述为“多症状高概率类”;只在特定指标上较高时,应按该组指标的专业含义命名。

多水平潜类分析:项目反应概率表
多水平潜类分析:项目反应概率表

解释边界:统计类别不是直接观察到的疾病实体。类别命名应保持描述性,并在独立样本、外部结局或重复测量中进一步验证。

10.56.7.4 协变量与类别归属

协变量表按群组潜类和个体类别比较报告估计值、标准误、Z 值、P 值和比值比。连续协变量的比值比对应每增加一个单位;分类协变量明确显示比较水平和参照水平。截距主要用于模型参数化,通常不是论文解释重点。

多水平潜类分析:协变量模型比较与类别归属系数
多水平潜类分析:协变量模型比较与类别归属系数

协变量结果表示与类别归属的统计关联,不证明协变量造成类别差异。横断面资料尤其不能由此确定时间顺序或机制。

10.56.8 图形解释

项目反应概率图把每个指标水平在不同个体类别中的概率连接起来,适合观察类别间整体反应模式和辅助命名。

多水平潜类分析:高分辨率项目反应概率图
多水平潜类分析:高分辨率项目反应概率图

群组类别构成图以堆积比例展示每个群组潜类中的个体类别构成。若两个群组类别的构成几乎相同,增加群组类别的实际解释价值可能有限。

多水平潜类分析:各群组潜类的个体类别构成
多水平潜类分析:各群组潜类的个体类别构成

信息准则图展示群组潜类数变化时 AIC 和 BIC 的趋势。折点和最低点可辅助判断,但仍需联合类别规模、后验概率和专业解释。

多水平潜类分析:群组潜类数信息准则图
多水平潜类分析:群组潜类数信息准则图

每幅图下方可生成中文或英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动描述必须人工核对类别编号、指标水平和概率方向。

10.56.9 表格描述与下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。进入 “下载Word报告” 页签,可下载当前勾选且成功生成的表格与图形;群组归类 CSV 包含全部群组、各群组类别后验概率和最可能类别。

多水平潜类分析:Word 与群组归类 CSV 下载
多水平潜类分析:Word 与群组归类 CSV 下载

建议:Word 报告请用微软 Word 打开。群组归类 CSV 用于后续描述时,应保留全部后验概率并核对群组标签;关键推断不要把最可能类别当作无误差的已知分组。

10.56.10 论文报告建议

方法部分建议说明:嵌套结构及群组定义、分类指标及编码、候选个体和群组类别数、类别选择标准、缺失处理、协变量及参照水平,以及后验归类不确定性的处理。

结果部分建议报告:

  1. 原始样本量、模型样本量、群组数和群组规模范围;
  2. 候选模型的对数似然、AIC、BIC、熵和比较结果;
  3. 最终个体潜类数和群组潜类数及选择理由;
  4. 个体类别比例、群组类别比例和群组内类别构成;
  5. 用于类别命名的关键项目反应概率;
  6. 群组归类的后验概率质量;
  7. 协变量与类别归属的比值比和 P 值(如适用)。

可参考如下写法:

采用多水平潜类模型分析个体嵌套于研究中心的多项分类指标。综合比较信息准则、熵、类别规模、后验归类清晰度和专业可解释性后,确定最终个体层与群组层类别数。个体类别依据项目反应概率进行描述,群组类别依据各个体类别的条件构成进行命名。模型使用所选字段的共同完整案例,并报告各研究中心的群组类别后验概率。

实际论文应替换为本研究的具体类别数、估计值和命名依据,避免使用“模型发现了真实疾病亚型”或因果性措辞。

10.56.11 常见问题

1. 群组标识可以用治疗组吗?

通常不可以。群组标识应代表个体实际嵌套的上级单位,如中心、学校或社区。普通治疗分组是个体层变量。

2. 至少需要多少群组?

模块要求至少 8 个有效群组,每组至少 5 个完整案例;这只是运行下限。群组层类别越多,实际所需群组数越大。

3. 个体潜类数和群组潜类数怎么选?

从较少类别开始,比较 AIC、BIC、熵、类别规模、后验概率、稳定性和专业可解释性。不要只选择某一指标最小的模型。

4. 为什么群组类别比较表从 2 类开始?

该表用于比较具有实际群组异质性的候选模型,因此列出 2 类至当前所选群组潜类数;当前模型拟合另行报告。

5. 为什么群组类别编号与上次不同?

潜在类别编号可互换。应根据群组内个体类别构成匹配类别,而不是只按编号比较。

6. 可以把连续量表直接作为分类指标吗?

不建议。具有大量不同取值的连续指标应优先进入潜在剖面分析;只有专业上预先规定的有限类别编码才适合作为分类指标。

7. 协变量比值比如何解释?

按表中所示个体类别比较和参照水平解释。它描述类别归属优势的关联变化,不表示因果效应。

8. 后验概率最大就代表群组归类确定吗?

不一定。还应检查最大概率与第二大概率的差距。若概率接近,群组归类存在明显不确定性。

9. 模型不收敛或结果异常怎么办?

减少个体或群组类别数,检查稀少指标水平、重复指标、缺失编码和小群组,并增加有效样本与群组数。

10. 单次模型错误会使整个应用退出吗?

不会。输入、拟合、绘图和下载错误会显示在当前模块中,可直接修改设置后重新运行。

10.56.12 小结

本模块的最佳使用顺序是:确认真实嵌套结构,准备至少 3 个有共同研究意义的分类指标,从较少类别开始比较模型,联合信息准则、类别规模、后验概率和专业解释选择个体及群组类别数,再用项目反应概率和群组类别构成进行描述,最后保存 Word 与群组后验概率 CSV。

多水平潜类分析能够同时刻画个体异质性和群组异质性,但类别仍是模型下的概率结构。透明报告数据层级、模型比较、缺失处理、类别命名和归类不确定性,是形成可靠结论的关键。

10.57 潜在剖面分析

潜在剖面分析用于根据多个连续指标的联合分布,识别样本中无法直接观察到的潜在人群剖面。它与潜在类别分析的研究目的相似,但适用于连续测量:模型估计每个剖面的指标均值、方差、协方差、剖面比例,以及每个观察对象属于各剖面的后验概率。

核心原则:剖面数不能只凭某一个信息准则决定。应联合比较 AIC、BIC、SABIC 等指标,同时检查剖面规模、熵、后验归类质量、模型稳定性、专业可解释性和重复分析的一致性。

10.57.1 模块能做什么

  • 使用两个或更多连续指标拟合潜在剖面模型。
  • 比较 1 个剖面至所选剖面数的候选模型。
  • 比较四种可用的方差–协方差结构。
  • 输出 LogLik、AIC、AWE、BIC、CAIC、CLC、KIC、SABIC、ICL、熵和剖面规模指标。
  • 报告各剖面的指标均值、方差和协方差估计。
  • 报告模型估计的剖面比例、实际归类人数和平均后验概率。
  • 下载全部完整案例的最可能剖面和各剖面后验概率。
  • 对一个连续或分类辅助变量进行后验概率加权的三步近似比较。
  • 绘制类别比例图、指标密度图、模型比较图、剖面分布图、剖面线图和均值中心化剖面图。
  • 生成包含当前勾选表格与图形的 Word 报告。

10.57.2 适用场景

  1. 根据多个连续症状或量表维度识别不同严重程度和组合模式。
  2. 根据代谢、生化或体格指标识别具有不同风险特征的人群剖面。
  3. 根据生活方式、行为频率或连续心理测量探索人群异质性。
  4. 比较不同潜在剖面在结局、风险分组或其他外部变量上的分布差异。

不建议:不要把剖面结果自动等同于真实疾病亚型,也不要仅因某个统计指标略有改善就增加剖面数。若指标主要是二分类或多分类变量,应使用潜在类别分析。

10.57.3 数据准备

数据应为“一个观察对象一行,一个连续指标一列”。各指标可以量纲不同,但必须是有变异的数值型变量;正式分析前应检查录入错误、异常值、极端偏态和重复变量。

数据要素 要求 常见问题
连续指标 至少 2 项,均为数值型且有有效变异 把分类编码当作连续量使用
辅助变量 可选一个连续变量或分类变量 与剖面指标重复选择
样本量 完整案例至少 50,且应支持所选剖面数 高维指标、剖面数过多或极小剖面
缺失值 使用空值或统一缺失编码 把 99、999 等缺失码当作真实测量
异常值 先核对来源和专业合理性 少数异常值形成伪剖面

本模块对剖面指标使用完整案例分析。任一所选指标缺失,该行不进入当前模型;结果会报告总行数、完整案例数和排除行数。启用辅助变量时,辅助变量的缺失只影响相应三步比较中的有效信息。

10.57.4 统计模型

设连续指标向量为 \(\mathbf{Y}\),潜在剖面为 \(C\)。含 \(K\) 个剖面的有限混合模型可写为:

\[ f(\mathbf{Y})=\sum_{c=1}^{K}\pi_c\,\phi(\mathbf{Y};\boldsymbol{\mu}_c,\boldsymbol{\Sigma}_c) \]

其中 \(\pi_c\) 为第 \(c\) 个剖面的比例,\(\boldsymbol{\mu}_c\) 为该剖面的指标均值向量,\(\boldsymbol{\Sigma}_c\) 为方差–协方差矩阵。不同模型结构对各剖面的方差和协方差施加不同约束。

模块提供以下四种结构:

模型 方差 协方差 特点
模型 1 各剖面相等 固定为 0 最简约,指标在剖面内条件独立
模型 2 各剖面可不同 固定为 0 允许不同剖面的离散程度不同
模型 3 各剖面相等 各剖面相等 允许指标相关,但相关结构不随剖面变化
模型 6 各剖面可不同 各剖面可不同 最灵活,参数最多,对样本量要求最高

10.57.5 使用步骤

10.57.5.1 1. 进入模块

在顶部菜单选择 “按统计学分类模块”,进入 “潜变量模型与结构方程” 分类,点击 “潜在剖面分析”

10.57.5.2 2. 选择连续指标

在“连续指标”中选择至少 2 项。指标应共同刻画一个有专业意义的研究领域,同时保留足够差异来区分人群模式。高度重复的指标可能造成数值不稳定。

10.57.5.3 3. 设置剖面数与模型结构

可选择 2–6 个剖面。模块会比较 1 个剖面至所选剖面数,并同时列出四种可用结构的主要信息准则。建议从模型 1 和较少剖面开始,再逐步增加复杂度。

10.57.5.4 4. 设置三步辅助变量分析

勾选“启用三步辅助变量分析”后,可选择一个连续或分类辅助变量。模块先固定剖面模型,再依据每个观察对象的后验概率进行加权比较。

解释边界:本模块的三步结果是后验概率加权的近似比较,不能完全消除分类误差,也不表示辅助变量造成了剖面差异。关键结论应结合敏感性分析或专门的分类误差校正方法。

10.57.5.5 5. 设置图形并选择输出

横轴标签角度和连接线只改变图形排版,不改变模型估计。左侧默认勾选全部主要表格和六类图形;不需要的内容可取消勾选。

潜在剖面分析:完整设置面板
潜在剖面分析:完整设置面板

10.57.5.6 6. 开始分析

点击 “开始潜在剖面分析”。若指标不足、存在非数值变量、完整案例过少、剖面数相对样本过多或模型无法稳定优化,页面会保留当前会话并显示具体错误,不会因单次分析失败而退出整个应用。

10.57.6 结果解读

10.57.6.1 模型概览

首先核对入选指标、模型结构、剖面数、完整案例数和排除数。最终模型拟合表汇总主要信息准则、熵、最小剖面规模和收敛状态;剖面规模表用于识别极小或归类不清的剖面。

潜在剖面分析:模型概览
潜在剖面分析:模型概览

剖面标签没有固定含义。“Class 1”“Class 2”不代表自然的高低顺序,必须根据各指标均值模式进行描述性命名。

10.57.6.2 模型比较

  • AIC、AWE、BIC、CAIC、CLC、KIC、SABIC、ICL:用于候选模型的相对比较。大多数信息准则越小表示拟合与简约性的平衡越好,但不同准则可能支持不同模型。
  • 熵(Entropy):越接近 1 通常表示归类更清晰,不能作为剖面数选择的唯一依据。
  • prob_min / prob_max:各剖面平均后验归类概率的范围,用于检查最不清晰的剖面。
  • n_min / n_max:最小与最大剖面在样本中的比例。极小剖面应重点检查稳定性和专业意义。
  • 收敛状态:只有稳定收敛的模型才适合进一步解释。

若新增剖面只把一个原剖面机械拆分、规模很小、均值模式难以解释,或复杂结构频繁不收敛,应优先考虑更简约的结果。

10.57.6.3 参数估计与剖面命名

参数估计表给出每个剖面的指标均值、方差及模型允许的协方差。剖面命名应依据成组指标的相对模式,而不是只挑一个显著或极端指标。

例如,一个剖面在所有症状指标上都较低,可描述为“整体低症状剖面”;另一个剖面只在睡眠和疲劳指标上较高,可描述为“睡眠–疲劳突出剖面”。命名应保持描述性,避免未经验证的病因或诊断用语。

10.57.6.4 归类结果

后验归类质量表汇总最大后验概率的均值、中位数,以及低于 0.70 和 0.80 的人数。成员归类表显示最可能剖面,后验概率表显示归类不确定性。

下载的 CSV 包含全部完整案例及其后验概率。若后续分析只使用“最可能剖面”,会把概率归类简化成无误差分组,应在局限性或敏感性分析中说明。

10.57.6.5 三步辅助变量结果

连续辅助变量输出各剖面的加权均值、标准差、标准误和有效样本量,并给出总体与两两比较。分类辅助变量输出各剖面的加权构成比、总体检验和两两比较。两两比较同时提供原始 P 值、BH 校正和 Bonferroni 校正结果。

当辅助变量与剖面指标来自同一时间点时,结果只能描述关联,不能确认时间顺序或因果方向。

10.57.6.6 图形

类别比例图用于直观看各剖面的归类人数和比例:

潜在剖面分析:类别比例图
潜在剖面分析:类别比例图

指标密度图用于检查各连续指标在不同剖面中的分布与重叠程度:

潜在剖面分析:指标密度图
潜在剖面分析:指标密度图

模型比较图展示不同剖面数下信息准则的变化:

潜在剖面分析:模型比较图
潜在剖面分析:模型比较图

剖面分布图把观察分布与估计均值结合起来,便于发现重叠、离群值和剖面差异:

潜在剖面分析:剖面分布图
潜在剖面分析:剖面分布图

剖面线图直接比较各剖面的指标均值模式:

潜在剖面分析:剖面线图
潜在剖面分析:剖面线图

均值中心化剖面图强调每个指标上各剖面相对总体均值的偏离:

潜在剖面分析:均值中心化剖面图
潜在剖面分析:均值中心化剖面图

图形用于识别模式和沟通结果,正式结论仍应以数值表、模型稳定性和专业判断为依据。

10.57.7 下载 Word 报告

进入 “下载Word报告” 页签,可下载当前分析的 Word 文档和全部成员归类 CSV。Word 报告只收录本次勾选并成功生成的表格和图形。

潜在剖面分析:下载页
潜在剖面分析:下载页

建议:请用微软 Word 打开下载文档,以保持表头、底注和图形排版。成员归类 CSV 应先与原始数据行标识核对,再用于后续描述或敏感性分析。

10.57.8 论文报告建议

方法部分建议说明:

  1. 连续指标及其量纲、预处理和选择依据。
  2. 候选剖面数和方差–协方差结构。
  3. 剖面选择所依据的信息准则、规模、熵和解释原则。
  4. 缺失值、异常值和完整案例处理。
  5. 后验归类及辅助变量比较的处理方式。

结果部分建议报告:

  1. 总样本量、完整案例数和排除数。
  2. 主要候选模型的信息准则与收敛情况。
  3. 最终剖面数、结构及选择理由。
  4. 各剖面比例、归类人数和平均后验概率。
  5. 用于剖面命名的关键指标均值模式。
  6. 辅助变量总体与校正后两两比较(如适用)。

可参考如下写法:

比较 1–4 个剖面及四种方差–协方差结构后,综合 BIC、SABIC、熵、剖面规模、模型稳定性和专业可解释性,最终选择三剖面的等方差、零协方差模型。三个剖面分别占完整案例的 38.5%、36.2% 和 25.3%,平均后验归类概率均超过 0.80。根据各指标均值模式,将其描述为整体低水平剖面、选择性升高剖面和整体高水平剖面。

10.57.9 常见问题

1. BIC 最小的模型一定是最终模型吗?

不一定。还要检查剖面规模、熵、后验概率、收敛稳定性、参数是否异常,以及新增剖面是否有清晰专业意义。

2. 是否需要先把所有指标标准化?

若指标量纲差异很大,标准化有助于避免大尺度变量主导模型;但标准化会改变参数解释。应依据研究问题统一决定,并在方法中说明。

3. 为什么不同次分析的剖面编号会变化?

剖面编号没有固有顺序。只要均值和分布模式相同,编号互换不改变模型含义。比较结果时应按剖面模式匹配,而不是只看编号。

4. 为什么出现很小的剖面?

可能是少见但真实的模式,也可能来自异常值、过多剖面、局部最优解或模型过度灵活。应检查规模、后验概率、指标分布和重复拟合稳定性。

5. 模型 6 一定比模型 1 更好吗?

不是。模型 6 参数更多,可能改善拟合,也更容易不稳定或过拟合。样本量有限时,简约且可解释的结构通常更可靠。

6. 可以把最可能剖面直接作为普通分组做回归吗?

可以用于探索性描述,但会忽略分类误差。关键推断应考虑后验概率、三步方法或敏感性分析,并明确说明限制。

7. 分类指标能否放入本模块?

不能作为主要剖面指标。二分类或多分类指标应使用潜在类别分析;分类变量只可作为三步辅助变量。

8. 模型不收敛怎么办?

减少剖面数、使用更简约的结构、检查异常值和高度相关指标,并增加有效样本。不要只保留一次偶然收敛但无法重复的结果。

9. 潜在剖面是否代表真实疾病亚型?

不能自动这样解释。潜在剖面是当前样本、指标和模型假设下的统计模式,需要外部变量、独立样本、纵向稳定性和专业证据进一步验证。

10.57.10 小结

本模块的最佳使用方式是:先选择有共同研究意义的连续指标,再从简约结构和较少剖面开始,联合信息准则、剖面规模、归类质量、模型稳定性和专业解释选择最终模型,最后通过外部变量和独立样本验证。

潜在剖面分析适合发现连续测量中的人群异质性,但剖面不是直接观察到的事实。透明报告模型比较、缺失处理、归类不确定性和命名依据,是形成可靠结论的关键。

10.58 潜在转移分析

潜在转移分析用于研究同一批观察对象在多个时间点的潜在人群类别及其变化。它先根据每个时间点的一组分类指标识别潜在类别,再估计对象从前一时间点类别转入后一时间点类别的概率,并可进一步分析协变量与潜在类别归属之间的关联。

核心问题:潜在类别分析回答“样本中有哪些未直接观察到的人群类别”,潜在转移分析进一步回答“这些类别随时间如何保持或转换”。转移概率描述的是模型估计的类别变化模式,不应自动解释为疾病进展机制或个体确定无误的状态改变。

10.58.1 模块能做什么

  • 分析 2–4 个时间点,每个时间点选择至少 2 个分类指标;
  • 为每个时间点分别设置 2–5 个潜在类别;
  • 同时拟合测量非不变模型和测量不变模型;
  • 使用似然比检验及 AIC、BIC 比较两类测量模型;
  • 输出各时间点的潜在类别比例和项目反应概率;
  • 输出相邻时间点的类别转移概率矩阵;
  • 汇总类别保持概率、转换概率及总体稳定程度;
  • 纳入连续或分类协变量,进行朴素法、BCH 法或 ML 三步分析;
  • 绘制类别比例、转移概率热图和协变量系数图;
  • 为主要表格和图形生成中英文描述,并下载 Word 报告和 CSV 结果。

全部结果默认勾选。数据校验、模型拟合、表格、绘图和下载均有错误隔离;某一设置无法估计时,页面会显示具体错误,而不会使整个应用退出。

10.58.2 适用场景

  1. 根据多项症状有无,研究患者在低症状、特定症状和多症状类别之间的变化。
  2. 根据健康行为项目,研究健康行为模式在随访期间的保持和转换。
  3. 根据治疗依从性、生活质量条目或照护需求,识别人群状态及其动态变化。
  4. 评价性别、年龄或其他基线特征与初始类别或后续类别归属之间的关联。

不建议:若各时间点使用的是连续指标,应优先考虑适用于连续测量的纵向潜在剖面或增长混合模型。若每名对象仅有一个时间点,不能估计转移概率;若不同时间点的指标含义完全不同,也难以把类别变化解释为同一构念的纵向转移。

10.58.3 数据准备

数据必须使用宽表结构:每行代表一名观察对象,每列代表某个时间点的一个分类指标。下例展示三个时间点、每个时间点三个二分类指标的数据结构:

ID T1_症状1 T1_症状2 T1_症状3 T2_症状1 T2_症状2 T2_症状3 T3_症状1 T3_症状2 T3_症状3 性别 年龄
P001 0 0 1 0 1 1 1 1 1 46
P002 1 1 1 1 1 0 0 1 0 53
数据要素 要求 常见问题
时间点 选择 2–4 个时间点 把不同人群误当成不同时间点
分类指标 每个时间点至少 2 项,因子、字符或低水平数值编码均可 直接纳入取值很多的连续变量
指标对应 测量不变性分析时,各时间点应有相同数量且顺序对应的指标 T1 与 T2 的指标顺序不一致
潜在类别 每个时间点设置 2–5 类 类别数过多,出现极小类别或不稳定估计
协变量 可选连续或分类变量,不能与指标重复 把随访后才出现的变量解释为基线预测因素
缺失值 使用真正空值或统一缺失编码 把 99、999 当作真实类别

本模块对所有入模指标及所选协变量使用完整案例分析。任一入模变量缺失,该行就不进入当前模型;分析概览会报告原始行数、有效行数和排除行数。若缺失较多或存在系统性缺失,应在正式研究中补充缺失机制评估和敏感性分析。

10.58.4 统计原理

10.58.4.1 潜在类别和项目反应概率

设第 \(t\) 个时间点的潜在类别为 \(C_t\),该时间点第 \(j\) 个分类指标为 \(Y_{jt}\)。在给定潜在类别后的局部独立假设下,单个时间点的反应概率可写为:

\[ P(\mathbf{Y}_t=\mathbf{y}_t)=\sum_{c=1}^{K_t}P(C_t=c)\prod_{j=1}^{J_t}P(Y_{jt}=y_{jt}\mid C_t=c), \]

其中 \(P(C_t=c)\) 为第 \(t\) 个时间点的类别比例,\(P(Y_{jt}=y\mid C_t=c)\) 为类别 \(c\) 中某个指标水平的条件反应概率。类别名称没有固定含义,必须依据项目反应概率进行描述性命名。

10.58.4.2 转移概率

相邻时间点的转移概率定义为:

\[ \tau_{ab}^{(t)}=P(C_{t+1}=b\mid C_t=a). \]

每个转移矩阵的行表示前一时间点类别,列表示后一时间点类别;每一行概率之和为 1。对角线元素表示保持在对应类别的概率,非对角线元素表示转入其他类别的概率。只有在类别含义能够跨时间对应时,对角线才可直接解释为“稳定”。

10.58.4.3 测量非不变与测量不变模型

  • 测量非不变模型:允许相同指标在不同时间点具有不同的类别条件反应概率,灵活性更高。
  • 测量不变模型:对选中的指标参数施加跨时间相等约束,使同一类别在不同时间点具有可比含义。

若不变模型拟合并未明显变差,且类别概率剖面具有专业可解释性,可优先使用不变模型帮助解释真实的类别转移。若不变约束明显降低拟合,则观察到的变化可能同时包含类别结构变化和测量含义变化,不宜只用转移矩阵概括。

模块使用似然比检验比较嵌套模型,并同时提供 AIC、BIC。较小的信息准则表示在拟合和模型复杂度之间取得较好平衡,但最终判断还需结合类别规模、概率剖面、模型稳定性和研究背景。

10.58.4.4 协变量三步分析

三步分析先用指标估计潜在类别,再分析协变量与类别归属的关联。当前模块使用最可能类别完成第三步,并提供三种方法:

  • 朴素法(Naive):直接把最可能类别当作观察到的分类结局,容易忽略分类误差;
  • BCH 法:通过分类质量相关权重减轻分类误差带来的偏倚;
  • ML 法:在第三步中用最大似然方式校正分类不确定性。

协变量系数采用多项 Logistic 形式,表示相对参照类别的对数优势变化。系数不能自动证明协变量导致了类别变化,尤其不能用横断面或同期协变量推断时间顺序。

10.58.5 使用步骤

10.58.5.1 1. 进入模块

在顶部菜单选择 “按统计学分类模块” → “潜变量模型与结构方程” → “潜在转移分析”

10.58.5.2 2. 设置时间点

选择 2–4 个时间点。页面会为每个时间点显示独立的指标选择框和潜在类别数。按照真实时间顺序,从时间点 1 到时间点 4 依次选择变量。

10.58.5.3 3. 选择每个时间点的指标和类别数

每个时间点至少选择 2 个分类指标。若准备比较测量不变模型,各时间点应选择数量相同、含义相同且顺序对应的指标。类别数可设为 2–5;初次分析建议各时间点使用相同且较少的类别数,获得可解释结果后再进行敏感性比较。

10.58.5.4 4. 设置测量不变性约束

选择希望跨时间保持相同测量含义的指标位置。默认选择可比较的全部指标。若只对部分指标有充分的纵向可比依据,也可以只约束相应位置。

10.58.5.5 5. 选择协变量和三步方法

协变量为可选。选择后设置朴素法、BCH 法或 ML 法,并指定参照类别。类别编号应结合当前概率剖面核对;重新拟合后类别编号可能互换,不能仅凭编号认定类别含义。

10.58.5.6 6. 核对输出并开始分析

所有表格和图形默认勾选。左侧不提供图像宽高设置;每幅图使用稳定尺寸渲染,并可在图下下载 PNG、TIFF、SVG 和 PDF。点击 “开始潜在转移分析” 后,先核对分析概览,再依次查看模型比较、两类测量模型、转移稳定性和协变量结果。

潜在转移分析:完整设置和分析概览
潜在转移分析:完整设置和分析概览

10.58.6 结果解读

10.58.6.1 分析概览与模型比较

分析概览列出时间点数、各时间点指标、类别数、协变量、三步方法、原始行数、有效行数和排除行数。首先确认实际变量顺序、类别数和样本量与研究设计一致。

测量模型比较
测量模型比较

模型比较表同时给出非不变模型和不变模型的对数似然、参数数、AIC、BIC,以及嵌套模型的似然比检验。解读顺序建议为:

  1. 检查两个模型是否成功估计;
  2. 比较 AIC、BIC 的方向;
  3. 查看似然比检验是否提示不变约束明显降低拟合;
  4. 对照两个模型的项目反应概率,判断类别含义能否跨时间对应;
  5. 最后结合简约性和专业解释选择主要模型。

10.58.6.2 测量非不变模型

测量非不变模型结果
测量非不变模型结果

非不变模型允许各时间点的项目反应概率自由变化。结果包括每个时间点的类别比例、项目反应概率和相邻时间点转移概率。若相同类别编号的概率剖面随时间变化很大,则类别编号可能不再代表相同状态,此时不能把对角线简单解释为稳定率。

10.58.6.3 测量不变模型

测量不变模型结果
测量不变模型结果

不变模型通过所选约束提高类别的纵向可比性。若模型拟合可接受,应根据共同的项目反应概率为类别命名,再解释各时间点类别比例和转移概率。类别名称应采用“低症状概率类”“特定行为模式类”等描述性表述,避免直接赋予未经验证的诊断或病因含义。

10.58.6.4 转移与稳定性

转移概率与稳定性结果
转移概率与稳定性结果
  • 转移概率矩阵:按行阅读。例如某行第 2 列为 0.35,表示前一时间点处于该行类别的对象,在后一时间点进入类别 2 的模型估计概率为 35%。
  • 保持概率:在类别可对应时,对角线元素表示保持在同类的概率。
  • 转换概率:非对角线元素表示转入其他类别的概率。
  • 总体稳定性:综合各类别比例和保持概率得到的汇总指标,用于概括样本总体的状态稳定程度。

样本量很小或类别比例极低时,单个转移单元可能不稳定。正式报告应同时提供分母信息、置信区间或敏感性分析,而不应只展示颜色较深的热图单元。

10.58.6.5 协变量结果

协变量三步分析结果
协变量三步分析结果

协变量表报告估计值、标准误、统计量、P 值及指数化系数。指数化系数大于 1 表示协变量增加时,相对参照类别进入目标类别的优势增大;小于 1 表示优势减小。分类协变量必须按实际参照水平解释,连续协变量则对应每增加一个原始单位。

避免过度解释:协变量结果是与潜在类别归属的统计关联。除非研究设计、时间顺序和混杂控制充分支持,否则不要使用“导致”“促进转变”或“保护作用”等因果语言。

10.58.6.6 图形

类别比例图比较各时间点的潜在类别构成;转移热图显示相邻时间点各类别之间的转移概率;协变量系数图展示相对参照类别的估计方向和不确定性。

类别比例、转移热图和协变量系数图
类别比例、转移热图和协变量系数图

图形用于快速识别模式,正式结论仍应以数值表、模型比较、分类质量和专业解释为依据。图下的中英文描述按钮可生成论文结果段落草稿,但应由研究者结合研究设计复核。

10.58.7 下载 Word 报告

进入 “下载Word报告” 页签,可以下载本次分析的 Word 文档和 CSV 结果。Word 报告仅收录当前勾选且成功生成的表格和图形;CSV 以长表方式汇总主要数值结果,便于存档和复核。

下载 Word 报告和 CSV 结果
下载 Word 报告和 CSV 结果

建议:请使用微软 Word 打开下载文档,以保持表头、底注和图形排版。正式提交前应核对类别编号、参照类别、指标顺序、有效样本数和缺失处理说明。

10.58.8 论文报告建议

方法部分建议说明:

  1. 随访时间点及每个时间点的分类指标和编码;
  2. 各时间点候选或最终类别数;
  3. 局部独立假设和测量不变性约束;
  4. 模型比较依据,包括似然比检验、AIC、BIC、类别规模和可解释性;
  5. 缺失值处理及各模型实际样本量;
  6. 协变量、参照类别和三步校正方法;
  7. 软件输出中用于类别命名的项目反应概率。

结果部分建议报告:

  1. 原始样本量、完整案例数和排除数;
  2. 非不变模型与不变模型的主要拟合指标;
  3. 最终模型选择理由;
  4. 各时间点类别比例和类别命名依据;
  5. 关键保持概率和转移概率;
  6. 协变量估计值、区间和 P 值(如适用);
  7. 类别不确定性、极小类别或模型稳定性限制。

可参考如下写法:

对三个时间点的六项二分类指标进行潜在转移分析。综合似然比检验、BIC、类别概率剖面和专业可解释性,选择跨时间测量不变的三类别模型。三个类别被描述为低症状概率类、特定症状类和多症状高概率类。时间点 1 至时间点 2 的总体保持概率为 0.72,其中多症状高概率类保持率最高。年龄与时间点 1 的类别归属存在统计学关联,但该结果仅作关联性解释。

10.58.9 常见问题

1. 每个时间点的类别数必须相同吗?

不必须,但相同类别数通常更便于检验测量不变性和解释类别保持。类别数不同适合有明确理论依据、且允许某些状态出现或消失的研究。

2. 为什么同一个类别编号在不同模型里含义变了?

类别编号没有固有顺序。模型重新拟合后可能发生标签交换,应根据项目反应概率匹配类别,而不是只比较编号。

3. 测量不变模型一定优于非不变模型吗?

不一定。不变模型更简约且便于纵向解释,但前提是约束与数据相容。若拟合显著变差或概率剖面不合理,应考虑部分不变或保留非不变模型。

4. 为什么转移矩阵对角线很高?

可能表示潜在状态较稳定,也可能受类别分离度、时间间隔、样本构成或测量约束影响。应结合项目反应概率、类别规模和分类质量判断。

5. 可以把转移概率解释为某个患者一定会转变吗?

不可以。转移概率是群体层面的模型估计,不是对单个对象的确定预测。

6. 为什么选择协变量后有效样本数减少?

模块对全部入模指标和协变量使用完整案例分析。协变量中的缺失也会排除对应行。

7. 朴素法、BCH 法和 ML 法如何选择?

朴素法适合快速探索,但忽略分类误差。正式分析通常优先使用能够校正分类不确定性的 BCH 或 ML 法,并把不同方法作为敏感性比较。

8. 为什么模型不收敛或出现极端概率?

常见原因包括类别数过多、样本量不足、极少见反应模式、指标高度重复、某些类别几乎为空或时间点过多。应先减少类别数,检查编码和频数,再逐步增加模型复杂度。

9. 各时间点可以使用完全不同的指标吗?

技术上可拟合非不变模型,但类别含义通常难以跨时间对应,转移解释也会明显减弱。纵向研究应优先使用相同或具有明确锚定关系的指标。

10. 结果能证明病程进展或干预效果吗?

不能仅凭潜在转移分析证明。病程或干预效果解释还需要合适的研究设计、时间顺序、对照、混杂控制和稳健性证据。

10.58.10 小结

潜在转移分析的可靠流程是:先保证各时间点指标可比并由简到繁确定类别结构,再比较测量非不变和不变模型,依据项目反应概率匹配并命名类别,最后解释转移概率和经过分类误差校正的协变量结果。

透明报告变量顺序、类别数、测量约束、有效样本、模型比较和分类不确定性,比单纯展示一张转移热图更重要。

10.59 主成分分析

主成分分析(PCA)是一种统计学方法,用于降低高维数据的维数,同时保留数据的主要变异信息。通过将原始数据集的多个相关变量转换为一组不相关的新变量(即主成分),可以更有效地识别和解释数据中的模式。主成分分析广泛应用于多领域,如医学研究、市场分析和财务分析等。

在医学研究中,例如,我们可以用主成分分析来研究一组患者的多个生物标志物数据,以发现这些生物标志物之间的潜在关联,为疾病分类和风险评估提供依据。

MSTATA统计软件的主成分分析模块提供了全面的PCA功能,包括:

适用条件判断:

  • 进行Bartlett’s球形检验,检查数据集是否适合进行主成分分析。

  • 进行KMO抽样适合性检验,评估观测值的数量是否足够。

主成分分析方法:

  • 提供旋转(rotation)选项,以便更清晰地解释主成分。

最终提取多少个主成分的方法依据:

  • 基于平行性分析(parallel analysis)选择。

  • 基于特征值(Eigenvalue)选择。

  • 自定义主成分个数。

成分载荷(Loadings):

  • 隐藏低于设定值的成分载荷。

  • 按载荷大小排序。

输出其他统计表:

  • 主成分摘要。

  • 主成分相关性。

  • 初始特征值。

输出统计图:

  • 输出统计图。

  • 绘制碎石图,直观展示主成分的数量选择。

  • 绘制变量贡献图,显示各变量对主成分的贡献。

  • 绘制个体分布图,展示观测值在主成分空间的分布。

  • 绘制双标图,同时展示观测值和变量在主成分空间的分布。

MSTATA的主成分分析模块为您提供了一个强大、全面且易于使用的PCA工具,帮助您从复杂的高维数据中提取有意义的信息。

10.59.1 准备数据

首先务必按照下面的格式准备数据(网站上可下载,下载后在此基础上修改):

下载csv样例数据(右击另存为)

打开如下图:

本样例数据的规则:

  1. 一个患者一行(这是准备数据最重要的前提)。

  2. 分类变量,如diagnosis,不能用来做主成分分析

  3. 有相关性的连续性变量,直径,位置,密度等,用来做主成分分析

以上概念很重要,后面有一个页面专门设置连续变量和分类变量。

10.59.2 进入模块

顶部菜单选择 “按统计学分类模块” → “主成分分析” 进入。

10.59.3 主成分分析

下一步就是主成分分析啦:

  1. 在”选择用来做主成分降维的变量”下拉框中,选择连续性变量(至少选择两个以上的变量才能继续往下走)。

  2. 在”适用条件判断”部分,勾选”做Bartlett’s球形检验”和”做KMO抽样适合性检验”,以确定数据集是否适合进行主成分分析。

    Bartlett’s球形检验:Bartlett’s球形检验用于检验数据集的协方差矩阵是否为单位矩阵。如果协方差矩阵为单位矩阵,则各变量之间无相关性,不适合进行主成分分析。当检验的P值较小(通常小于0.05)时,我们拒绝原假设(协方差矩阵为单位矩阵),认为数据集适合进行主成分分析。

    KMO抽样适合性检验(Kaiser-Meyer-Olkin):KMO检验用于评估数据集的抽样适合性,即各变量之间的相关性是否足够强烈,以便对数据集进行主成分分析。KMO值范围为0到1,值越接近1,表示变量间的相关性越强,主成分分析的结果越可靠。通常,KMO值大于0.6时认为数据集适合进行主成分分析。以下是对KMO值的一般解释:

    KMO值大于0.9:非常适合进行主成分分析。

    KMO值在0.8至0.9之间:适合进行主成分分析。

    KMO值在0.7至0.8之间:较为适合进行主成分分析。

    KMO值在0.6至0.7之间:适合性一般,可以进行主成分分析,但需谨慎解释。

    KMO值小于0.6:不适合进行主成分分析。

  3. 在”主成分分析方法”部分,从下拉框中选择进行旋转(rotation)的方法,如无需旋转、最大方差法、四次方极大法、最优法、斜交法或最简法。

    无需旋转(none):在这种情况下,主成分分析不会对主成分进行旋转。这意味着原始主成分将保持不变。无需旋转的主成分分析可以直接反映数据的基本结构,但可能较难解释。

    最大方差法(varimax):这是一种正交旋转方法,旨在使主成分的平方载荷在主成分之间的方差最大化。这使得每个主成分都尽可能解释较少的原始变量,从而使结果更易于解释。

    四次方极大法(quartimax):这是另一种正交旋转方法,旨在使主成分的四次方载荷在主成分之间的方差最大化。这通常会导致每个主成分解释更多原始变量,但解释性可能较差。

    最优法(promax):这是一种斜交旋转方法,先进行正交旋转(通常是 varimax 旋转),然后应用某种幂变换。最优法允许主成分之间存在相关性,并试图使旋转后的载荷矩阵更加稀疏,从而更容易解释。

    斜交法(oblimin):这是一种斜交旋转方法,允许主成分之间存在相关性。斜交法试图使每个主成分与尽可能少的原始变量高度相关,从而使结果更易于解释。

    最简法(simplimax):这是一种正交旋转方法,类似于 varimax 和 quartimax,旨在使主成分载荷矩阵更加简单。最简法试图使每个主成分只与少量原始变量高度相关,这有助于提高结果的解释性。

    在进行主成分分析时,可以根据数据集的特点和需求选择合适的旋转方法。正交旋转方法(如最大方差法和四次方极大法)通常更容易计算和理解,但斜交旋转方法(如最优法和斜交法)可能在某些情况下提供更好的解释性。

  4. 在”最终提取多少个主成分的方法依据”部分,选择基于平行性分析(parallel analysis)、基于特征值(Eigenvalue)或自定义主成分个数。

    a. 若选择基于特征值(Eigenvalue)选择,设置特征值大于多少时的主成分。

    1. 若选择自定义主成分个数,设置要提取的主成分个数。

    平行性分析(Parallel Analysis):平行性分析是一种基于随机数据模拟的方法,用于确定保留的主成分个数。通过比较实际数据的特征值与随机数据的特征值,确定应保留的主成分数量。具体而言,如果实际数据的特征值大于相应的随机数据特征值,则认为该主成分是重要的,应该保留。平行性分析被认为是在主成分分析中选择保留主成分数量的较为稳健和准确的方法。

    特征值(Eigenvalue):特征值是主成分分析中用于衡量主成分解释方差的重要性的指标。在基于特征值的方法中,通常使用”特征值大于1”的准则来确定保留的主成分个数。这意味着,只有那些解释的方差大于原始变量平均方差的主成分才会被保留。然而,这种方法有时会保留过多或过少的主成分,因此它可能不是最稳健的选择方法。

    自定义主成分个数:在某些情况下,研究者可能希望根据特定的理论或实践需求来指定保留的主成分个数。这种方法允许研究者根据他们对数据集和研究问题的理解来选择适当的主成分数量。然而,这种方法可能受到主观因素的影响,并且在缺乏理论支持的情况下,可能导致不准确的结果。

    在进行主成分分析时,可以根据数据集的特点和需求选择合适的主成分数量选择方法。平行性分析通常被认为是一种较为稳健和准确的方法,而特征值方法和自定义主成分数量方法可能在特定情况下更适用。

  5. 在”成分载荷(Loadings)“部分,设置隐藏低于此值的成分载荷,并勾选按载荷大小排序。

    成分载荷表示每个原始变量与主成分之间的关系。隐藏低载荷值有助于更容易地识别与主成分密切相关的变量。按载荷大小排序可以帮助用户更直观地了解每个主成分中最重要的变量。

  6. 在”输出其他统计表”部分,勾选”主成分摘要”、“主成分相关性”和”初始特征值”。这些选项将在结果中生成额外的统计表,提供更多关于主成分分析的详细信息。

    主成分摘要提供了每个主成分的方差解释百分比和累积方差解释百分比等信息。主成分相关性表显示了各个主成分之间的相关性,有助于理解它们之间的关系。初始特征值表显示了每个主成分的特征值,以及与其相关的方差解释百分比和累积方差解释百分比。

  7. 在”输出统计图”部分,勾选”绘制碎石图”、“绘制变量贡献图”、“绘制个体分布图”和”绘制双标图”。这些图形可以帮助用户直观地了解主成分分析的结果。

    碎石图展示了每个主成分的特征值,有助于确定保留的主成分数量。变量贡献图显示了每个变量对各个主成分的贡献程度。个体分布图描绘了观测值在主成分空间中的位置,以便了解它们在主成分上的分布。双标图综合展示了观测值和变量在主成分空间中的关系,有助于解释主成分在实际问题中的意义。

  8. 设置统计图的宽度(像素)和高度(像素)。

  9. 点击”开始进行主成分分析”按钮,开始分析。

通过以上步骤,您可以使用MSTATA进行主成分分析,根据您的需求定制化分析过程并输出相关统计表和图形。

10.59.4 下载报告

点击下载word文件即可

10.60 综合聚类分析

综合聚类分析用于在没有预先给定结局标签的情况下,根据多个变量之间的相似性把研究对象分成若干类别。本模块整合 K-means、层次聚类和 DBSCAN,可处理连续变量聚类、连续与分类变量的混合聚类、层级结构探索以及带噪声点的非规则类别识别。

核心原则:聚类是探索性分析。算法总能在一定条件下给出分组,但分组并不自动等于真实疾病亚型或具有临床意义的人群。应联合类别规模、聚类质量、结果稳定性、专业可解释性和外部验证决定最终方案。

10.60.1 模块能做什么

  • 对连续变量执行 K-means 聚类,并比较多种迭代算法和随机起点。
  • 使用 Gower 距离对连续变量和分类变量进行混合聚类。
  • 使用多种距离度量和连接方法执行层次聚类。
  • 按预定聚类数或树高切分层次聚类树。
  • 使用 DBSCAN 识别任意形状的高密度类别和噪声点。
  • 自动或手动设置 DBSCAN 的 epsilon,并显示 kNN 距离诊断。
  • 输出分析信息、类别规模、类别中心或剖面、聚类质量和成员预览。
  • 绘制类别剖面、Gap 统计、肘部、聚类散点、变量聚类、轮廓、树状、热图和变量关系图。
  • 下载包含当前表格和图形的 Word 报告,以及全部样本的聚类成员 CSV。

10.60.2 适用场景

  1. 根据多项生物标志物识别具有不同特征组合的患者亚群。
  2. 根据症状、实验室指标或量表维度探索潜在人群分型。
  3. 在没有既定类别标签时探索样本之间的层级结构。
  4. 识别常规类别之外的稀疏样本、离群模式或噪声点。
  5. 在后续回归、生存分析或外部验证前生成候选类别变量。

方法边界:聚类分析不检验因果关系,也不能证明所识别类别是自然存在的实体。聚类数、距离度量、标准化、变量选择和异常值都会改变结果。若已有明确的结局标签并希望建立预测模型,应使用机器学习分类模块;若目标是降维或解释变量共同结构,应考虑主成分分析或因子分析。

10.60.3 数据准备

每行代表一个研究对象,每列代表一个用于描述对象的特征。建议至少保留 30 个完整案例,并根据研究问题预先选择变量。

  • 连续型 K-means 至少需要 2 个数值变量。
  • 混合变量聚类至少需要 1 个分类变量,且连续与分类变量合计不少于 2 个。
  • 层次聚类至少需要 3 个数值变量。
  • DBSCAN 至少需要 2 个变量。
  • 二元距离要求所选变量只包含 0 和 1。
  • 标签变量只用于显示对象名称,不参与距离计算。
  • 缺失值按所选聚类变量执行完整案例分析;成员 CSV 中被排除的原始行保留为空。

建议:不要把结局变量、治疗后才获得的信息或同一概念的高度重复指标随意放入聚类变量。连续变量量纲差异较大时通常应保持“标准化数值变量”勾选,并在独立样本中检查类别是否可重复。

10.60.4 三种算法怎么选

10.60.4.1 K-means

适合近似球形、类别内部较紧密、主要由连续变量描述的结构。分析者需要事先给定聚类数。连续变量模式可使用 Gap 统计图、肘部图和聚类质量辅助选择聚类数;混合变量模式使用 Gower 距离统一处理不同量尺。

10.60.4.2 层次聚类

通过逐步合并相似对象形成树状结构,适合观察类别之间的层级关系。Euclidean 距离配合 Ward D2 是连续变量的常用起点;其他距离和连接方法可用于敏感性分析。Centroid 和 Median 连接可能产生树高反转,因此模块只允许按聚类数切分。

10.60.4.3 DBSCAN

根据局部密度形成类别,不要求事先指定类别数,并可把稀疏对象标记为噪声。epsilon 控制邻域半径,minPts 控制形成稠密区域所需的最少点数。结果对这两个参数和量纲较敏感,应结合 kNN 距离图、噪声比例和专业解释调整。

10.60.5 主要统计量

  • 类别规模与比例:用于识别极小类别、类别不平衡和 DBSCAN 噪声比例。
  • 类别中心或剖面:连续变量通常显示均值或中位数,分类变量显示代表性类别,用于给类别赋予专业含义。
  • 平均轮廓系数:范围大致为 -1 至 1,越高表示对象更接近本类别而远离其他类别;负值提示可能被分错。
  • Davies–Bouldin 指数:综合类别内紧密度和类别间分离度,通常越小越好;只能在支持的距离设置下计算。
  • Gap 统计:比较观测数据和参考随机数据的聚类内离差,较大的 Gap 值支持相应聚类数。
  • 肘部准则:观察聚类内平方和随聚类数增加的下降速度,在收益明显变缓的位置形成候选聚类数。
  • 噪声点:DBSCAN 中类别 0 表示未归入任何高密度类别的对象,不应简单删除,应检查其测量质量和专业特征。

一键自动生成以下表格和图形:

  • 分析信息、类别规模、类别中心或剖面、聚类质量和成员预览表;
  • K-means 类别剖面、Gap 统计、肘部、聚类散点、变量聚类或 Gower 轮廓图;
  • 层次聚类树状图、聚类热图和变量关系图;
  • DBSCAN 聚类分布图和 kNN 距离图;
  • Word 报告和全部聚类成员 CSV。

10.60.6 使用步骤

10.60.6.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “聚类分析与多元统计” → “综合聚类分析”

10.60.6.2 2. 选择算法和变量

先选择 K-means、层次聚类或 DBSCAN,再选择参与距离计算的变量。切换算法时,左侧只显示该算法可以接受的参数。使用层次聚类时可额外选择标签变量。

10.60.6.3 3. 设置算法参数

  • K-means:选择连续变量或混合变量模式,设置聚类数;连续变量模式还可选择迭代算法、随机起点数和最大评估聚类数。
  • 层次聚类:选择距离度量、连接方法和树切分方式。若按树高切分,应根据树状图在有实质分离的位置设定树高。
  • DBSCAN:选择距离度量和 minPts;默认自动按 kNN 距离分位数选择 epsilon,也可关闭自动选择并手动输入。

10.60.6.4 4. 选择标准化和输出

连续变量默认标准化。结果表和图形默认全部勾选;取消勾选后,相应内容不会显示,也不会写入 Word 报告。点击 “开始聚类分析” 后,参数验证、模型运行、图形和下载错误都会在模块内部显示,不会使整个应用退出。

综合聚类分析:K-means 完整设置与图形
综合聚类分析:K-means 完整设置与图形

10.60.7 结果解读

10.60.7.1 分析概览

先核对算法、入选变量、总行数、完整案例数、排除数、标准化和关键参数。聚类结果只适用于实际进入分析的完整案例;改变变量集合后应重新评估,而不是沿用原聚类数。

综合聚类分析:分析概览
综合聚类分析:分析概览

10.60.7.2 类别规模与剖面

类别规模表用于检查是否出现样本过少或高度不平衡的类别。类别中心或剖面表用于比较各类别在原始变量上的特征。类别命名应依据多个具有稳定差异且有专业意义的变量,避免只根据一个偶然极值命名。

综合聚类分析:类别规模与剖面
综合聚类分析:类别规模与剖面

10.60.7.3 聚类质量

聚类质量用于比较候选方案,不应机械套用固定阈值。若统计指标较好但类别极小、结果对参数不稳定或无法形成清晰专业解释,该方案仍不宜直接作为最终分型。建议比较相邻聚类数、不同随机种子、距离度量和重抽样结果。

10.60.8 图形解读

10.60.8.1 K-means 图形

类别剖面图显示各类别变量模式;Gap 统计和肘部图用于形成候选聚类数;聚类散点图把高维结构投影到低维空间。投影图中的重叠不一定等于原始高维空间完全重叠,必须与质量指标和类别剖面共同解释。

10.60.8.2 层次聚类图形

树状图显示对象和类别逐步合并的过程,较长的垂直分支通常表示较明显的分离。热图按类别排列对象并显示变量模式,变量关系图用于查看类别在成对变量空间中的分布。不同连接方法的树结构可能不同,应进行敏感性分析。

综合聚类分析:层次聚类图形
综合聚类分析:层次聚类图形

10.60.8.3 DBSCAN 图形

聚类分布图显示高密度类别和噪声点。kNN 距离图中的明显弯折可作为 epsilon 的候选位置;自动分位数只是可复现的起点。若几乎所有对象都成为噪声或全部并入一个类别,应重新检查标准化、距离、epsilon 和 minPts。

综合聚类分析:DBSCAN 聚类与 kNN 距离图
综合聚类分析:DBSCAN 聚类与 kNN 距离图

10.60.9 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮;每幅图也可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。生成的文字应人工核对变量定义、类别编号、完整案例、标准化和算法参数。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。点击“下载聚类成员 CSV”可取得全部原始行的类别归属;DBSCAN 的类别 0 标记为噪声,缺失导致的排除行保留为空。

综合聚类分析:Word 报告与聚类成员下载
综合聚类分析:Word 报告与聚类成员下载

建议:请使用微软 Word 打开报告。正式使用前应保存变量选择、标准化、算法、距离、聚类数或密度参数、随机起点和完整案例规则,并把聚类成员文件与分析版本一起归档。

10.60.10 论文报告建议

方法部分建议说明:

  1. 聚类目的、候选变量及其选择依据。
  2. 缺失值处理、异常值处理和最终完整案例数。
  3. 连续变量是否标准化,分类变量如何编码。
  4. 聚类算法、距离度量、连接方法或密度参数。
  5. K-means 的聚类数、迭代算法、随机起点和随机种子相关设置。
  6. 聚类数或 epsilon 的选择依据及敏感性分析。
  7. 用于评价类别质量、稳定性和专业意义的方法。

结果部分建议报告:

  1. 总样本数、完整案例数和排除数。
  2. 最终类别数、各类别样本量与比例。
  3. 各类别主要变量特征及命名依据。
  4. 预先规定的聚类质量指标及候选方案比较。
  5. DBSCAN 噪声点的数量和比例。
  6. 参数或变量改变时结果是否稳定,以及是否完成外部验证。

可参考如下写法:

在 150 名研究对象中,146 名对 4 个预先选择的生物标志物具有完整数据并进入聚类分析。各变量在分析前进行标准化。Gap 统计和肘部图共同支持 3 类方案,采用 50 个随机起点的 K-means 获得 3 个类别,样本量分别为 48、51 和 47。三类在标志物组合上呈现不同剖面,平均轮廓系数为 0.57。改变聚类数和随机起点后主要模式基本稳定,但类别的临床意义仍需在独立样本中验证。

示例数值仅用于展示写法,实际报告必须使用本研究输出。

10.60.11 常见问题

1. 为什么建议标准化连续变量?

距离会受量纲影响。若一个变量的数值范围远大于其他变量,它可能主导聚类。标准化使连续变量在常见情况下具有可比尺度;若量纲本身具有明确权重,应在研究方案中说明不标准化的理由。

2. K-means 的聚类数应该怎么定?

应综合 Gap 统计、肘部、轮廓系数、类别规模、结果稳定性和专业解释。任何单一图形或固定阈值都不能自动给出唯一正确答案。

3. 为什么同一数据的 K-means 结果可能变化?

K-means 依赖初始中心。增加随机起点数可降低落入较差局部解的风险。正式报告应固定设置并检查多次运行是否得到相近结果。

4. 什么时候使用 Gower 距离?

当聚类变量同时包含连续和分类变量时,Gower 距离可把不同变量类型转换为可比较的差异。变量选择和类别频数仍会影响结果,不能把大量稀有类别无条件加入。

5. Ward D2 可以配任意距离吗?

Ward 方法通常与 Euclidean 距离配合解释最清楚。虽然界面允许比较其他组合,正式分析应根据方法假设和研究目的选择,并把非标准组合视为敏感性分析。

6. DBSCAN 的噪声点是不是应该删除?

不一定。噪声点可能是录入错误、测量异常、稀有但真实的临床模式或参数设置过严的结果。应先核对数据质量,再检查不同 epsilon 和 minPts 下是否稳定。

7. 为什么自动 epsilon 得到的类别不理想?

自动分位数提供统一起点,并不保证最符合每个数据集。应查看 kNN 距离图,并比较噪声比例、类别规模和稳定性后调整。

8. 聚类结果可以直接作为结局做显著性检验吗?

同一数据既用于形成类别又用于检验类别差异会产生循环解释。聚类变量的组间差异主要用于描述类别;验证性比较最好使用未参与聚类的外部变量或独立样本。

9. 缺失值如何处理?

模块对所有入选聚类变量执行完整案例分析。成员 CSV 保留原始行号和标签,被排除行的类别为空。变量较多时完整案例可能明显减少,应在结果中报告。

10. 聚类编号 1、2、3 有大小顺序吗?

没有。类别编号只是标签,不代表严重程度或自然顺序。应根据剖面特征命名,并在不同运行之间根据中心或剖面匹配类别。

10.60.12 小结

本模块的最佳使用方式是:先依据研究问题选择变量并处理量纲,再根据数据结构选择 K-means、层次聚类或 DBSCAN,联合质量指标、类别规模、图形和专业意义比较方案,最后保存完整成员数据并在独立样本中验证。

聚类分析的价值在于生成可检验的结构假设,而不是为数据强行贴上标签。透明记录变量、参数和稳定性检查,是使聚类结果可复现、可解释和可验证的关键。

10.61 对应分析与多重对应分析

对应分析用于把列联表中的行类别和列类别映射到低维空间,多重对应分析用于同时研究三个及以上分类变量的类别结构。两种方法都把分类关联分解为若干维度,并通过惯量、坐标、cos²、贡献率和图形显示主要关系。

核心原则:图上彼此接近的类别通常具有相似的响应模式,离原点较远且贡献率较高的类别对维度结构影响更大。但二维图只是原始关联结构的近似表示,空间接近不能解释为因果关系,也不能脱离惯量、cos² 和贡献率单独下结论。

10.61.1 模块能做什么

  • 对非负频数列联表执行普通对应分析。
  • 计算 Pearson 卡方独立性检验、特征值和解释惯量。
  • 输出行与列在各维度上的坐标、cos² 或贡献率。
  • 绘制碎石图、行点图、列点图和对应分析双标图。
  • 对三个及以上分类变量执行多重对应分析。
  • 输出变量水平频数、类别结果和个体结果。
  • 按可选分组变量绘制个体分组图,并动态支持多个组别。
  • 绘制变量与维度关系、类别坐标、个体坐标、碎石和双标图。
  • 下载包含当前表格和图形的 Word 报告,以及全部行或个体维度结果 CSV。

10.61.2 适用场景

  1. 探索疾病分期与治疗反应类别之间的对应关系。
  2. 比较不同人群在症状类别、行为类别或问卷响应上的分布模式。
  3. 同时研究多个生活方式、人口学或临床分类变量的联合结构。
  4. 发现对主要分类维度贡献较大的类别,为后续验证分析形成假设。
  5. 以低维图形展示复杂列联表或多分类数据的主要关联。

方法边界:普通对应分析要求输入的是汇总频数列联表,而多重对应分析要求每行代表一个研究对象、每列代表一个分类变量。两种数据结构不能互换。方法本身不校正混杂因素,也不提供因果效应;若需调整协变量,应使用适合结局类型的回归模型。

10.61.3 数据准备

10.61.3.1 普通对应分析

数据采用列联表宽格式:每行代表一个行类别,每个入选数值列代表一个列类别,单元格为非负频数。至少选择 3 个频数列,并至少保留 3 个总频数大于 0 的完整行。可选择一个行标签变量;不选择时使用原始行号。

行标签 轻度 中度 重度
A 组 34 18 7
B 组 22 29 14
C 组 9 21 33

频数不能为负数,不能包含无穷值,也不能存在合计为 0 的行或列。缺失频数所在行不进入本次分析。

10.61.3.2 多重对应分析

每行代表一个研究对象,每列代表一个分类变量。至少选择 3 个分类变量;每个变量在完整案例中至少需要 2 个有效水平。可另选一个不参与分析的分组变量,用于在个体图中着色和绘制组别椭圆。

建议:合并极少见且含义相近的水平时应有专业依据,并在方法部分说明。不要把连续变量任意分组后仅为制作漂亮图形而进行分析;分组会丢失信息,也可能制造人为结构。

10.61.4 主要统计量

  • 卡方独立性检验:普通对应分析中检验行变量与列变量是否独立。显著结果说明存在总体关联,但不说明哪些类别贡献最大,更不代表因果关系。
  • 特征值与惯量:描述每个维度解释的关联结构。解释惯量越高,该维度保留的信息越多;累积惯量用于判断二维或三维表示是否充分。
  • 坐标:给出行类别、列类别、变量类别或个体在各维度上的位置。符号方向可整体翻转,不影响相对关系。
  • cos²:表示某个点被所选维度表示得多好。cos² 较低时,即使图上位置显眼,也不宜过度解释其二维位置。
  • 贡献率:表示某个点对形成相应维度的贡献。贡献率较高的类别通常是解释维度含义的重点。
  • 原点距离:接近原点的类别通常接近平均分布模式;远离原点的类别更具区分性,但仍需结合频数和贡献率判断。

一键自动生成以下表格和图形:

  • 分析信息、输入列联表或变量水平概览;
  • 卡方独立性检验、特征值和解释惯量;
  • 行、列、变量类别或个体的坐标、cos² 和贡献率;
  • CA 碎石图、行点图、列点图和双标图;
  • MCA 碎石图、变量与维度关系图、类别图、个体图、分组个体图和双标图;
  • Word 报告与全部行或个体结果 CSV。

10.61.5 使用步骤

10.61.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “聚类分析与多元统计” → “对应分析与多重对应分析”

10.61.5.2 2. 选择分析类型

  • 数据是汇总列联表时,选择 “普通对应分析(CA)”
  • 数据是个体级记录并含有多个分类变量时,选择 “多重对应分析(MCA)”

10.61.5.3 3. 选择变量

CA 中选择至少 3 个频数列,并可选择行标签变量。MCA 中选择至少 3 个分类变量,并可另选个体分组变量。界面只提供当前分析类型可以接受的变量。

10.61.5.4 4. 设置维度和结果类型

提取维度数默认 2,最大值会根据有效行、列或类别水平动态限制。CA 可分别设置行结果和列结果类型;MCA 可分别设置变量类别和个体结果类型。三种类型分别为坐标、cos² 和贡献率。

10.61.5.5 5. 选择输出并开始分析

表格和图形默认全部勾选。取消勾选后,相应内容不会显示,也不会写入 Word 报告。点击 “开始对应分析” 后,数据验证、分析计算、图形和下载错误都会在模块内部显示,不会使整个应用退出。

普通对应分析:设置与分析概览
普通对应分析:设置与分析概览

10.61.6 普通对应分析结果

先核对频数列、完整行、排除行、总频数和提取维度。卡方检验用于确认总体关联,惯量表用于评估二维表示保留的信息。行表与列表应根据当前选择的坐标、cos² 或贡献率解释。

10.61.6.1 行点图和列点图

行点图比较行类别的响应分布,列点图比较列类别在各行中的分布。位于同一方向且彼此接近的同类点通常模式相似。不同类型点之间的距离不能机械当作普通 Euclidean 距离解释,应以双标图方向、贡献率和原始频数共同判断。

10.61.6.2 双标图

双标图同时显示行点与列点。某个行类别与某个列类别位于相似方向,提示该组合相对独立模型的期望频数具有较强关联。必须回到列联表核对绝对频数和相对比例。

普通对应分析:碎石图、行点图、列点图与双标图
普通对应分析:碎石图、行点图、列点图与双标图

10.61.7 多重对应分析结果

分析概览显示入选分类变量、可选分组变量、完整案例和结果类型。变量水平概览用于识别稀有类别和不平衡变量;频数过少的水平可能在图上远离原点并产生较大影响,需要谨慎解释。

多重对应分析:设置与分析概览
多重对应分析:设置与分析概览

变量类别表用于判断各类别在维度上的位置、表示质量或贡献。个体结果页只预览前 30 个完整案例,完整结果应通过 CSV 下载。类别名称相同但来自不同变量时,应始终结合变量名识别。

多重对应分析:变量类别坐标或贡献结果
多重对应分析:变量类别坐标或贡献结果

10.61.7.1 MCA 图形

变量与维度关系图显示分类变量对各维度的总体联系;类别坐标图显示具体水平;个体图显示研究对象在分类空间中的位置;分组个体图用于描述预先定义组别的空间重叠;双标图同时展示个体和类别。置信椭圆反映组内位置分布的不确定性,不是组间显著性检验。

多重对应分析:碎石、变量、类别、个体、分组与双标图
多重对应分析:碎石、变量、类别、个体、分组与双标图

10.61.8 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮;每幅图也可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动描述应人工核对维度解释、类别名称、完整案例和结果类型。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。点击“下载行或个体结果 CSV”可取得 CA 的全部行结果或 MCA 的全部个体结果。

对应分析:Word 报告与 CSV 下载
对应分析:Word 报告与 CSV 下载

建议:请使用微软 Word 打开报告。正式使用前应保存原始类别编码、完整案例规则、提取维度、结果类型和分组定义,并把 CSV 与本次分析版本一起归档。

10.61.9 论文报告建议

方法部分建议说明:

  1. 使用普通对应分析还是多重对应分析,以及选择该方法的原因。
  2. 数据结构、变量和类别定义,稀有水平是否合并。
  3. 缺失值处理和最终完整案例数。
  4. 提取维度数及其选择依据。
  5. 主要报告坐标、cos² 还是贡献率。
  6. MCA 分组变量仅用于描述图形,还是另有预先规定的验证分析。

结果部分建议报告:

  1. 总频数或总样本数、完整案例数和排除数。
  2. CA 卡方统计量、自由度和 P 值。
  3. 前两个或预定维度的解释惯量和累积惯量。
  4. 对主要维度贡献最大的类别及其 cos²。
  5. 图形中最稳定、最具专业意义的接近或分离模式。
  6. 稀有类别、低 cos² 或低累积惯量对解释的限制。

可参考如下写法:

对 5×4 列联表进行普通对应分析,Pearson 卡方检验提示行类别与列类别分布存在总体关联。前两个维度分别解释 68.4% 和 21.7% 的惯量,累积解释 90.1%。第一维度主要由重度类别和高风险列类别贡献,两者在双标图中位于相同方向;轻度类别位于相反方向。低频类别的 cos² 较低,因此未对其二维位置作进一步解释。

示例数值仅用于展示写法,实际报告必须使用本研究输出。

10.61.10 常见问题

1. CA 能直接选择两个原始分类变量吗?

不能。本模块的 CA 接收已经汇总的列联表宽格式。若原始数据是一人一行,应先生成列联表,或根据变量数量选择 MCA。

2. MCA 至少需要几个变量?

至少 3 个分类变量。只有两个分类变量时,更适合先做列联表分析或普通对应分析。

3. 为什么维度方向和其他软件相反?

维度坐标的整体正负号可以翻转,不改变点之间的相对位置、惯量、cos² 和贡献率。解释应关注相对关系,而不是正负号本身。

4. 二维图中点很接近就代表显著相关吗?

不是。图形是探索性表示。应结合总体检验、惯量、cos²、贡献率、频数和预先规定的问题解释。

5. 为什么某个低频类别离原点很远?

稀有类别可能因少量观测产生极端位置。先检查频数、cos² 和贡献率,再决定是否具有稳定意义;不要仅按距离命名维度。

6. cos² 和贡献率有什么区别?

cos² 衡量该点被某个维度表示得有多好;贡献率衡量该点对形成该维度有多重要。一个点可以表示质量高但贡献不大,也可以贡献较大但需要多个维度才能充分表示。

7. 累积惯量多少才算足够?

没有适用于所有研究的固定阈值。分类变量多、水平多时,单个维度的惯量常较低。应透明报告数值,并根据研究目的和可解释性决定是否使用更多维度。

8. 分组个体图可以代替组间检验吗?

不能。分组图用于描述空间分布和重叠。若需要正式比较组别,应根据研究设计使用适当的回归或多变量检验。

9. 缺失值如何处理?

模块对所有入选分析变量以及所选分组变量执行完整案例分析。分析概览会报告总行数、完整行和排除行。

10. 个体坐标可以直接作为新的连续变量吗?

可以用于后续探索,但应保留维度解释、建模样本和过拟合风险。若用于验证性预测或推断,应在独立数据中重新评估。

10.61.11 小结

本模块的最佳使用方式是:先判断数据是汇总列联表还是个体级多分类记录,再选择 CA 或 MCA,核对频数与完整案例,联合惯量、坐标、cos²、贡献率和图形解释结构,并对稀有类别、低表示质量和外部验证保持谨慎。

对应分析把复杂分类关系转化为可视化的维度结构,其价值在于帮助形成清晰、可检验的关联假设,而不是把图上距离直接转化为因果或临床结论。

10.62 多维尺度分析

多维尺度分析根据研究对象之间的距离,把原本位于多个变量空间中的对象映射到二维或三维坐标中。图中彼此接近的对象具有较相似的变量模式,彼此远离的对象差异较大。本模块同时提供 Stress、探索性 K-means 分群和 Shepard 图,便于评价低维表示是否保留了主要距离结构。

核心原则:多维尺度分析解释的是对象之间的相对距离,而不是每个坐标轴的固定专业含义。坐标可以整体旋转、翻转或平移而不改变对象间关系,因此应重点报告距离、聚集和分离模式,并结合 Stress 判断低维表示质量。

10.62.1 模块能做什么

  • 对至少 2 个连续变量执行经典多维尺度分析。
  • 选择二维或三维表示空间。
  • 使用欧氏距离、曼哈顿距离或最大距离。
  • 计算低维距离重现原始距离的 Stress。
  • 在二维坐标上执行 K-means 探索性分群。
  • 输出对象坐标、聚类规模、原始变量聚类特征和完整成员归属。
  • 绘制多维尺度坐标图、分群坐标图、Shepard 图和三维坐标图。
  • 下载包含当前表格和图形的 Word 报告,以及全部对象坐标与归类 CSV。

10.62.2 适用场景

  1. 根据多个生物标志物观察患者之间的整体相似性。
  2. 比较药物、医院、地区或实验条件的多指标距离结构。
  3. 把难以直接观察的高维差异压缩到二维或三维空间进行探索。
  4. 识别可能存在的对象聚集、离群对象或连续变化梯度。
  5. 检查预先定义的对象类别是否在多变量距离空间中表现出分离。

方法边界:本模块执行经典多维尺度分析,不是非度量多维尺度分析。它不检验组间因果效应,也不会自动校正混杂因素。K-means 类别是对坐标的探索性划分,不应直接命名为疾病亚型或临床诊断。

10.62.3 数据准备

每行代表一个研究对象,每个入选列为连续数值变量。建议变量具有明确含义、测量方向一致,并在分析前检查异常值和量纲差异。

对象 指标 1 指标 2 指标 3 指标 4
P001 12.4 8.1 3.7 20.2
P002 10.8 7.9 4.1 18.6
P003 18.5 4.3 8.9 12.1

标签变量可为对象编号或名称,只用于图形和结果识别,不参与距离计算。未选择标签时使用原始行号。任何入选连续变量缺失的行都会从本次模型计算中排除,但下载的 CSV 会保留全部原始行,并在被排除行的坐标和聚类列中显示缺失。

量纲建议:当前距离直接基于原始数值计算。若变量单位差异很大,应在数据治理步骤中依据研究方案先完成标准化或其他预处理,并记录处理方法。否则数值范围最大的变量可能主导距离。

10.62.4 距离和主要统计量

  • 欧氏距离:表示对象在多变量空间中的直线距离,适合量纲可比较、连续变化较平滑的数据。
  • 曼哈顿距离:为各变量绝对差的总和,对单个变量的极端差异通常不如平方距离敏感。
  • 最大距离:使用对象在所有入选变量中的最大绝对差,强调最不相似的那个维度。
  • Stress:比较原始对象距离与低维坐标距离。数值越小,低维表示越接近原始距离结构。
  • 对象坐标:描述对象在二维或三维空间中的相对位置。坐标正负号本身没有固定解释。
  • Shepard 图:横轴为原始距离,纵轴为低维拟合距离。点越接近 45°参考线,距离重现越好。
  • 聚类规模与特征:描述二维坐标 K-means 分群后的样本量、比例和原始变量均值。

Stress 可参考以下描述:小于 0.05 通常表示优秀,0.05–0.10 表示良好,0.10–0.20 表示一般,大于 0.20 表示较差。阈值只作为辅助,不应替代图形、样本量和研究目的判断。

一键自动生成以下表格和图形:

  • 分析模式、距离、变量、完整案例和聚类数;
  • Stress 与表示拟合评价;
  • 二维或三维对象坐标;
  • K-means 聚类规模和原始变量特征;
  • 坐标与归类预览;
  • 多维尺度图、分群图、Shepard 图和三维图;
  • Word 报告与完整坐标归类 CSV。

10.62.5 使用步骤

10.62.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “聚类分析与多元统计” → “多维尺度分析”

10.62.5.2 2. 选择变量和标签

选择至少 2 个连续变量。标签变量可选,建议使用不重复的对象编号;重复标签会自动附加序号,以保证每个对象能够识别。

10.62.5.3 3. 设置表示空间和距离

二维模式适合主要结果展示;三维模式可在二维不足以保留结构时作为补充。距离默认使用欧氏距离,可根据研究问题切换为曼哈顿距离或最大距离。

10.62.5.4 4. 设置探索性聚类数

K-means 聚类数可设为 2–10,且必须小于完整案例数。聚类用于帮助识别坐标空间中的可能结构,不是确定类别数的正式检验。

10.62.5.5 5. 选择输出并开始分析

表格和图形默认全部勾选。取消勾选后,相应内容不会显示,也不会写入 Word 报告。点击 “开始多维尺度分析” 后,数据验证、距离计算、低维映射、绘图和下载错误都会在模块内部显示,不会使整个应用退出。

多维尺度分析:完整设置面板和结果界面
多维尺度分析:完整设置面板和结果界面

10.62.6 结果解释

10.62.6.1 分析概览与 Stress

先核对分析变量、总行数、完整案例、排除案例、表示维度和距离度量。Stress 是判断二维或三维表示是否足以概括原始距离的首要指标。三维 Stress 通常低于二维,但增加维度会降低展示简洁性,应综合拟合改善和可解释性决定主要呈现方式。

10.62.6.2 对象坐标

坐标表用于准确定位每个对象。对象在所有展示维度上都较接近时,说明它们在所选连续变量上的整体模式相似;坐标明显远离主体的对象应回到原始数据检查是否为真实特殊病例、异常值或录入错误。

10.62.6.3 聚类规模与特征

聚类规模表用于识别过小类别,聚类特征表显示各探索性类别的原始变量均值。只有当类别规模合理、不同设置下结果稳定并具有专业解释时,才适合形成后续验证假设。

10.62.7 图形解释

10.62.7.1 多维尺度坐标图

坐标图显示所有对象在前两个维度上的位置。解释应关注对象之间的相对接近、分离、连续梯度和离群位置,不要给横轴或纵轴强行赋予固定临床含义。

多维尺度二维坐标图
多维尺度二维坐标图

10.62.7.2 分群坐标图

颜色表示在二维坐标上得到的 K-means 类别。类别明显分离说明当前聚类数能够概括部分距离结构;类别重叠或存在很小类别时,应重新评估聚类数、变量和量纲处理。

多维尺度分群坐标图
多维尺度分群坐标图

10.62.7.3 Shepard 图

Shepard 图用于检查原始距离和低维距离的一致性。点云整体贴近参考线说明拟合较好;系统性弯曲、扇形扩散或远离参考线提示二维或三维空间不能充分保留距离结构。

多维尺度 Shepard 图
多维尺度 Shepard 图

10.62.7.4 三维坐标图

三维图增加第三个表示维度,适合观察二维图中重叠对象是否在第三维分开。三维视角仍是探索性展示,正式报告应同时给出 Stress 和坐标表。

多维尺度三维坐标图
多维尺度三维坐标图

10.62.8 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮;每幅图也可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动描述应人工核对距离方法、完整案例、Stress 和聚类数。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。点击“下载坐标与归类 CSV”可取得全部原始行、标签、二维或三维坐标和聚类结果。

多维尺度分析:Word 报告与坐标下载
多维尺度分析:Word 报告与坐标下载

建议:请使用微软 Word 打开报告。正式使用前应保存变量定义、预处理方法、距离、维度、聚类数、完整案例规则和 CSV,并在独立样本或重复抽样中检查结构是否稳定。

10.62.9 论文报告建议

方法部分建议说明:

  1. 使用经典多维尺度分析的研究目的。
  2. 入选变量、测量单位和分析前预处理。
  3. 距离度量及选择依据。
  4. 缺失值处理和最终完整案例数。
  5. 使用二维还是三维表示,以及选择依据。
  6. K-means 聚类数和其探索性定位。

结果部分建议报告:

  1. 总样本数、完整案例数和排除数。
  2. 表示维度和 Stress。
  3. 主要的对象聚集、分离、梯度或离群模式。
  4. 探索性类别的规模和主要原始变量特征。
  5. 不同距离、维度或聚类数设置下结果是否一致。
  6. 低维拟合不足、异常值和缺乏外部验证等限制。

可参考如下写法:

对 5 个连续指标进行经典多维尺度分析,采用欧氏距离并保留二维表示。共 72 例纳入数据,其中 70 例具有完整观测。二维表示的 Stress 为 0.086,提示距离重现良好。坐标图显示研究对象形成三个主要聚集区域,3 类 K-means 划分的样本量分别为 23、22 和 25;第三类在指标 1 和指标 4 上的均值较高。Shepard 图中大多数点接近参考线,但较大原始距离处仍存在一定离散,因此聚类仅作为后续验证的探索性结果。

示例数值仅用于展示写法,实际报告必须使用本研究输出。

10.62.10 常见问题

1. 至少需要几个变量?

至少 2 个连续变量。变量过少时,多维尺度分析相对于直接散点图的增益有限;变量越多,越应关注量纲和异常值。

2. 选择二维还是三维?

通常先以二维作为主要展示,再比较三维 Stress 是否有实质改善。三维可用于补充观察,但更难在论文中静态呈现。

3. 为什么坐标正负方向与其他结果相反?

低维坐标可以整体翻转或旋转,只要对象间距离不变,解就是等价的。不要根据单个坐标正负号下结论。

4. Stress 多小才可以接受?

没有适合所有研究的绝对界值。可把小于 0.05、0.10 和 0.20 分别作为优秀、良好和一般的辅助参考,同时检查 Shepard 图和研究用途。

5. 三种距离如何选择?

量纲可比且关注整体直线差异时常用欧氏距离;希望降低单一大差值影响时可考虑曼哈顿距离;关注对象最突出差异时可考虑最大距离。应在分析前规定,并可做敏感性比较。

6. 聚类数可以按图形看着选吗?

不建议只按视觉选择。应结合研究问题、类别规模、稳定性、原始变量特征和其他聚类评估方法。这里的 K-means 是帮助解释坐标结构的探索性工具。

7. 为什么结果会受标准化影响?

距离直接受变量数值范围影响。量纲大的变量会对距离贡献更大,因此标准化与否必须根据研究目的决定并清楚报告。

8. 缺失值如何处理?

模块对所有入选连续变量执行完整案例分析。概览表报告排除数,CSV 保留原始行并将被排除行的坐标和聚类标记为缺失。

9. 图上的聚类可以直接称为亚型吗?

不能。未经稳定性检验和独立验证的类别只能称为探索性聚类。临床亚型还需要外部结局、重复样本和专业定义支持。

10. 多维尺度分析可以代替回归模型吗?

不能。它主要描述对象间距离结构,不估计调整后的效应,也不检验因果关系。若目标是解释结局或校正协变量,应使用相应回归模型。

10.62.11 小结

本模块的最佳使用方式是:先依据研究问题选择连续变量并处理量纲,选择合适距离,从二维开始并结合 Stress 与 Shepard 图评价表示质量,再谨慎解释对象位置和探索性聚类,最后保存坐标数据并在独立样本中验证。

多维尺度分析的价值在于把复杂距离结构转化为可观察、可核对的低维图形,而不是为坐标轴或聚类赋予超出数据证据的含义。

10.63 样本距离矩阵与相似性分析

样本距离矩阵与相似性分析计算变量之间或观测之间的距离、不相似性或相似性矩阵,并用关键配对、热图和二维关系图展示整体结构。

适用数据:连续型指标、非负频数或统一编码的二值变量。按变量比较时,每个变量是一个对象;按观测比较时,每行受试者或样本是一个对象。

10.63.1 分析目的

距离和相似性矩阵是聚类、多维尺度、异常样本识别和模式探索的基础。模块保留完整矩阵,同时汇总最接近、最远、最高相似或最低相似的对象配对,帮助快速定位主要结构。

先区分距离与相似性:距离或不相似性通常越小表示越接近;相似性通常越大表示越相似。不同度量的数值尺度不可直接比较,正式解释必须写明数据类型、标准化方式和具体度量。

10.63.2 操作步骤

  1. 选择连续型、频数型或二值型数据。
  2. 选择三至十二个变量,并决定比较变量之间还是观测之间。
  3. 连续型数据可选择标准化;频数型和二值型数据保持不标准化。
  4. 选择与数据类型匹配的距离或相似性度量。二值型数据还需确认存在值与不存在值。
  5. 点击“开始分析”,依次核对概览、矩阵、关键配对、热图和二维关系图。
  6. 在下载页保存 Word 报告或完整矩阵 CSV。

10.63.3 菜单设置

设置 含义 使用建议
数据类型 决定可用的度量方法和输入检查。 连续指标选连续型;计数表选频数型;仅含两个明确状态的变量选二值型。
计算对象 “变量之间”比较列的形状;“观测之间”比较每一行样本。 观测之间最多计算六十个完整对象,以保证矩阵、报告和图形可读。
标准化 在计算连续型距离前调整各对象的中心或尺度。 量纲差异明显时优先考虑 Z 标准化;若原尺度本身具有明确意义,可不标准化。
欧氏、平方欧氏、曼哈顿 常用连续型距离。欧氏距离强调总体直线差异,曼哈顿距离累加各维绝对差。 欧氏距离常用于聚类;存在较大单维差异时可与曼哈顿距离做敏感性比较。
Canberra、Chebyshev Canberra 强调相对差异,Chebyshev 由最大单维差异决定。 低值比例差异或最坏单项差异有研究意义时使用。
Minkowski、广义幂距离 通过幂参数和根参数调整各维差异的权重。 必须报告参数;不建议仅为得到更清晰图形而反复调参。
余弦、相关相似度 分别比较向量方向或共同变化模式。 关注形状而非绝对大小时适用;结果属于相似性,数值越大通常越相似。
卡方不相似度 用于非负频数构成,比较频数轮廓差异。 所有频数必须为非负整数,每个比较对象的总频数应大于零。
二值相似性与不相似性 依据共同存在、共同不存在或不一致状态计算。 明确存在值和不存在值;Jaccard 通常更关注共同存在,简单匹配同时计入共同不存在。

10.63.4 结果解读

分析设置与样本概览:核对数据类型、比较方向、度量性质、标准化、完整记录数和对象数。缺失记录在计算前按所选变量完整案例排除。

距离或相似性矩阵:矩阵关于对角线对称。矩阵超过二十个对象时,页面和 Word 只预览前二十行与前二十列,完整矩阵仍可下载为 CSV。

关键对象配对与摘要:距离型结果列出最近和最远配对;相似性结果列出最高和最低相似配对。对象摘要进一步显示每个对象与其余对象的平均非对角值和最佳匹配。

矩阵热图与二维关系图:热图展示全部两两关系;二维关系图把矩阵近似映射到平面,点越接近表示按当前度量越接近。二维图会损失部分高维信息,应与原矩阵共同解释。

10.63.5 论文报告建议

报告变量、对象方向、完整样本数、标准化和具体度量;列出最重要的邻近或相似配对,并说明二维图仅用于探索性展示。若矩阵用于后续聚类或多维尺度分析,还应报告后续算法和参数。

10.64 网络分析

网络分析把变量表示为节点,把变量间估计得到的统计关联表示为边。模块同时支持连续变量网络和由连续、分类、计数变量组成的混合网络,并输出边权、稀疏度、节点中心性、聚类系数和网络图。

核心原则:网络边是统计关联,不是因果箭头。在正则化偏相关网络中,边可理解为控制其他入网节点后两个变量的条件关联,但这仍不能证明时间顺序、机制或因果方向。

10.64.1 模块能做什么

  • 对至少 3 个连续变量估计 EBIC 正则化偏相关网络、相关网络或偏相关网络。
  • 在连续网络中选择自动相关、Pearson 相关或协方差矩阵。
  • 对连续、分类和非负整数计数变量估计混合网络。
  • 使用 EBIC 或交叉验证选择正则化参数,并选择 AND 或 OR 边对称化规则。
  • 按分组变量分别估计多个网络,并使用统一指标进行对照。
  • 输出网络摘要、边权表、加权邻接矩阵、中心性和聚类系数。
  • 绘制弹簧或环形布局网络图、中心性图和聚类系数图。
  • 下载包含当前表格和图形的 Word 报告,以及完整边权 CSV。

10.64.2 适用场景

  1. 描述多个症状、量表条目或生物标志物之间的关联结构。
  2. 在控制其他入网变量后,识别仍保留直接关联的节点对。
  3. 比较不同队列、治疗组或人群分层的网络密度和节点结构。
  4. 在同一网络中纳入连续指标、分类状态和计数指标。
  5. 为后续验证性研究生成节点优先级和关联假设。

方法边界:网络中心性受样本、入网变量、变量编码、正则化和缺失值处理影响。不应根据一次分析就将某个节点称为“核心病因”或制定干预优先级。

10.64.3 数据准备

每行代表一个相互独立的研究对象,每个入网变量代表一个节点。连续网络的所有节点必须为数值型;混合网络可分别放入连续、分类和计数变量。

ID 症状 1 症状 2 分期 就诊次数 队列
P001 12 8 II 3 A
P002 6 5 I 1 A
P003 15 11 III 5 B

连续网络使用成对有效观测估计关联矩阵,同时报告全部节点均完整的案例数。混合网络对所有入网变量执行完整案例分析。分组变量缺失的行不进入任何分组网络。

节点分组映射:若需要在图中按概念分组为节点着色,可准备一个字符型变量,其有效值写为“变量名=分组名”,例如“Symptom1=Symptoms”。该变量只控制节点颜色,不参与网络估计。

10.64.4 估计方法

  • EBIC 正则化偏相关网络:在估计条件关联时对小边进行收缩,使部分边精确为零,是连续节点的默认选择。
  • 相关网络:边表示两个变量的边际相关,不控制其他节点,通常更密集。
  • 偏相关网络:边表示控制其他节点后的关联,但不进行稀疏收缩,小样本或节点较多时可能不稳定。
  • 混合网络 EBIC:使用信息准则选择正则化程度。调节参数越大,通常越偏向稀疏网络。
  • 混合网络交叉验证:根据指定折数的预测表现选择正则化参数,计算时间通常更长。
  • AND / OR 规则:AND 要求两个节点的条件模型都支持该边,因此较严格;OR 只需一方支持,通常保留更多边。

10.64.5 主要结果

  • 边权:绝对值越大表示估计关联越强;正负号表示关联方向。
  • 稀疏度:可能边中被估计为零的比例。值越高,网络越稀疏。
  • 强度:节点与其他节点边权强度的综合。
  • 接近中心性:根据节点到其他节点的加权路径评价其网络位置。
  • 中介中心性:节点位于其他节点最短路径上的程度。
  • 预期影响:保留边权正负方向的节点连接总和。
  • 聚类系数:描述节点周围是否形成局部紧密结构。

中心性和聚类系数在每个网络内转换为 Z 分数,用于比较同一网络内各节点的相对位置。不应把不同变量集合或不同估计方法下的 Z 分数当作绝对量直接对照。

一键自动生成以下表格和图形:

  • 分析模式、估计方法、节点变量和分组信息;
  • 分析案例、完整案例、节点数、边数和稀疏度;
  • 边权长表和加权邻接矩阵;
  • 中心性和聚类系数表;
  • 网络图、中心性图和聚类系数图;
  • Word 报告和边权 CSV。

10.64.6 使用步骤

10.64.6.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “聚类分析与多元统计” → “网络分析”

10.64.6.2 2. 选择网络类型和节点

所有节点都是数值型时选“连续变量网络”。需要同时纳入分类或计数节点时选“混合变量网络”,并把变量放入正确类型框。

10.64.6.3 3. 设置估计方法

连续网络建议以 EBIC 正则化偏相关作为主分析,再使用相关或未正则化偏相关进行敏感性比较。混合网络可选 EBIC 或交叉验证;样本不大时应慎用较多交叉验证折数。

10.64.6.4 4. 选择分组和布局

分组变量可选。启用后每个水平独立估计网络,因此必须确保每组都有足够案例。弹簧布局便于观察节点聚集,环形布局便于在不同设置下比较同一节点位置。

10.64.6.5 5. 开始分析

所有主要表格和图形默认勾选。取消勾选后,相应内容不显示,也不写入 Word 报告。点击 “开始网络分析” 后,变量校验、估计、绘图和下载错误都会在当前模块内显示,不会使整个应用退出。

网络分析:完整设置面板
网络分析:完整设置面板

10.64.7 结果解释

10.64.7.1 分析概览

先核对节点变量、估计方法、分组、分析案例和完整案例。边数与稀疏度描述网络的总体复杂度,但其大小受节点数和正则化设置影响。

网络分析概览和主要表格
网络分析概览和主要表格

10.64.7.2 边权与邻接矩阵

边权表按绝对值从大到小排列,便于识别最强关联。邻接矩阵用于核对全部节点对、保存进一步处理所需的对称边权,对角线固定为零。

10.64.7.3 中心性与聚类系数

中心性应以同一网络内的相对排序解释。强度高的节点与其他节点的总体连接更强;预期影响则保留正负方向。聚类系数反映局部结构,不等于分类精度或因果重要性。

10.64.8 图形解释

10.64.8.1 网络图

节点之间的线表示估计边,线越粗表示边权绝对值越大,蓝色和红色分别表示正关联和负关联。弹簧布局中的物理位置主要为了显示结构,不应把二维距离当作独立统计量。

连续变量网络图
连续变量网络图

10.64.8.2 中心性图

图中每个面板显示一种标准化中心性指标。数值高的节点在当前指标和当前网络中处于相对更中心的位置。

节点中心性图
节点中心性图

10.64.8.3 聚类系数图

不同聚类系数采用不同的加权局部结构定义。解释时应观察某节点在多个指标上是否呈现一致的相对高值,并避免过度解释单一系数。

节点聚类系数图
节点聚类系数图

10.64.9 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动描述必须人工核对网络类型、样本量、边权方向和标准化指标。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。边权 CSV 包含网络名、两个节点、边权和方向,可用于审核、存档和后续处理。

建议:正式报告前应保存节点定义、变量编码、缺失值规则、估计方法、正则化参数、分组方案、Word 报告和 CSV,并在重复抽样或独立样本中检查边和中心性的稳定性。

10.64.10 论文报告建议

方法部分建议说明:

  1. 网络分析的研究目的和入网节点选择依据。
  2. 节点的数据类型、编码和预处理。
  3. 连续网络或混合网络的估计方法。
  4. 关联矩阵、EBIC 调节参数或交叉验证折数。
  5. AND/OR 规则、分组方案和缺失值处理。
  6. 边权、中心性和聚类系数的定义及标准化方法。

结果部分建议报告:

  1. 总样本、有效样本、完整案例和每个分组的人数。
  2. 节点数、估计边数和稀疏度。
  3. 绝对边权最大的若干节点对及关联方向。
  4. 主要中心性指标中相对高的节点。
  5. 分组网络之间的描述性差异及未进行正式差异检验的限制。
  6. 不同估计方法、正则化或样本设置下结果是否一致。

可参考如下写法:

对 6 个连续临床指标估计 EBIC 正则化偏相关网络。共 180 例进入关联矩阵估计,其中 178 例所有节点均完整。在 15 条可能边中保留 8 条,网络稀疏度为 0.467。症状 1 与症状 2 的正向边权最大,症状 1 的标准化强度相对较高。这些结果描述了节点间的条件关联结构,不支持因果方向推断。

示例数值仅用于展示写法,实际报告必须使用本研究输出。

10.64.11 常见问题

1. 至少需要几个变量?

至少 3 个节点变量。节点越多,可能边数按平方速度增长,需要更大样本和更谨慎的正则化。

2. 连续网络为什么默认使用正则化?

正则化可收缩不稳定的小边,生成更稀疏的条件关联网络。它能降低过度拟合,但也可能去除真实的弱关联。

3. 相关网络和偏相关网络有什么不同?

相关网络的每条边是两个变量的边际关联;偏相关网络的边控制了其他入网变量。两者回答的问题不同。

4. 什么时候使用混合网络?

当节点中包含分类变量或非负整数计数变量时使用。若所有节点均为连续型,优先使用连续网络。

5. AND 和 OR 如何选择?

AND 更严格,一般得到更稀疏的网络;OR 更宽松,可能保留更多边。建议预先指定主方案,并用另一规则做敏感性分析。

6. 中心性高是否表示该变量最值得干预?

不能直接这样解释。中心性是网络结构指标,不是干预效果、因果影响或临床重要性的估计。

7. 为什么分组后网络变得很稀疏?

分组减少了每个网络的样本量,正则化会更倾向收缩小边。应先核对每组案例数,不要仅根据图形宣称组间存在网络差异。

8. 缺失值如何处理?

连续网络的关联矩阵使用成对有效观测,混合网络使用完整案例。分组变量缺失的行会被排除。

9. 弹簧布局中节点更近是否代表显著性更高?

不是。布局是为了可视化结构的绘图算法,节点的二维距离不是显著性、效应量或置信区间。

10. 能否通过这个模块证明网络稳定?

不能仅靠单次估计证明。建议使用重复抽样、边权区间、中心性稳定性或独立样本复现进行进一步检查。

10.64.12 小结

本模块的最佳使用方式是:先根据研究问题预定义节点和变量类型,选择连续或混合网络及正则化方案,先核对案例数和稀疏度,再解释边权和节点指标,最后通过敏感性分析、重复抽样或独立样本验证网络结构。

网络分析的价值在于把多变量关联组织成可检查的结构,而不是将关联图转化为超出数据证据的因果故事。

10.65 时间序列建模与预测

时间序列分析用于处理按时间顺序连续观察的数据。本模块提供 ARIMA 和 Prophet 两类建模路径,可用于描述趋势、季节性和自相关结构,评估模型误差,并生成带预测区间的未来预测。

核心原则:预测是已选模型在当前数据和参数下的外推,不是对未来的确定保证。正式应用时应结合时间规则、数据生成过程、残差诊断和时间外验证解释结果。

10.65.1 模块能做什么

  • 对单个连续型序列自动选择 ARIMA 阶数并输出预测。
  • 设置无季节周期、季度、每月、每周或每日频率。
  • 选择 80%、90%、95% 或 99% 预测区间,并设置预测周期数。
  • 输出 ARIMA 系数、对数似然、AIC、AICc、BIC、MAE、RMSE、MAPE 和残差诊断。
  • 对一个或多个连续结局进行趋势和季节性预测。
  • 在 Prophet 路径中加入数值型外部回归量,并设置未来回归量填充规则。
  • 输出序列图、季节分解图、预测图、残差图、ACF/PACF 图和精度图。
  • 下载包含当前表格和图形的 Word 报告,以及完整预测 CSV。

10.65.2 何时选择 ARIMA 或 Prophet

  • ARIMA:适合单一等间隔序列,重点利用序列本身的滞后、差分和移动平均结构。
  • Prophet:适合具有显式日期、趋势变点、每周/每年季节性或外部回归量的序列,也可同时对多个结局建模。
  • 两种模型都要求时间顺序正确,并且不能自动消除研究设计改变、测量方式变化或突发事件带来的结构性偏差。

10.65.3 数据准备

每行代表一个时间点,日期/时间变量必须可以排序,结局变量和外部回归量必须为数值型。

Date Outcome Biomarker Regressor
2023-01-01 52.4 21.7 -0.82
2023-02-01 56.1 22.3 -0.61
2023-03-01 59.8 23.0 -0.43

ARIMA 可不选时间变量,此时按数据行顺序建模。Prophet 必须选择日期/时间变量,且不允许重复时间点。

数据频率:“每月”表示一个周期含 12 个观察点,而不是软件自动把不规则数据汇总为月度数据。分析前应先按时间聚合数据,并检查间隔是否规则。

10.65.4 主要统计量

  • ARIMA(p,d,q)(P,D,Q)[m]:p/d/q 分别是非季节自回归阶数、差分阶数和移动平均阶数;P/D/Q 是对应季节阶数;m 是频率。
  • AIC、AICc、BIC:用于在同一数据上比较候选模型,通常越小越好,不是绝对的拟合达标线。
  • MAE:预测误差绝对值的平均。
  • RMSE:对较大误差更敏感的误差指标。
  • MAPE:绝对百分比误差的平均;序列接近零时可能不稳定。
  • Ljung–Box 检验:检查残差是否仍存在整体自相关。P 值较小提示模型未充分解释时间依赖。
  • 预测区间:在模型假设成立时表示未来观察值的不确定性范围。预测越远,区间通常越宽。

一键自动生成以下表格和图形:

  • 分析模式、变量、有效时间点、频率和预测设置;
  • ARIMA 系数、拟合优度和残差诊断;
  • 训练集精度指标与未来预测表;
  • 观察序列、季节分解、预测区间、残差、ACF/PACF 和精度图;
  • Word 报告和预测 CSV。

10.65.5 使用步骤

10.65.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “时间序列分析” → “时间序列建模与预测”

10.65.5.2 2. 选择建模方法和变量

ARIMA 选择 1 个连续结局,时间排序变量可选。Prophet 必须选择日期/时间变量,可选多个连续结局和多个数值型外部回归量。

10.65.5.3 3. 设置模型

ARIMA 需要确定序列频率、预测周期数、预测区间和是否自动清理异常值。Prophet 需要确定未来预测单位和期数、季节性、趋势增长、变点灵活度和外部回归量填充方式。

10.65.5.4 4. 开始分析

所有主要表格和图形默认勾选。取消勾选后,对应内容不显示,也不写入 Word 报告。点击 “开始时间序列分析” 后,变量校验、模型拟合、绘图和导出错误都只会在当前模块显示,不会使整个应用退出。

时间序列分析:完整设置面板
时间序列分析:完整设置面板

10.65.6 结果解释

10.65.6.1 分析概览

先核对结局变量、时间变量、有效时间点、序列频率、选定模型和预测范围。若频率或时间排序错误,后续所有结果都可能失去意义。

时间序列分析概览和主要表格
时间序列分析概览和主要表格

10.65.6.2 ARIMA 系数、精度和残差

系数表给出自回归、季节自回归、移动平均、季节移动平均或漂移项。AIC、AICc 和 BIC 用于记录和比较同一序列的候选模型。MAE、RMSE 和 MAPE 是当前序列上的拟合误差,不等于真实的时间外预测误差。

10.65.7 图形解释

10.65.7.1 ARIMA 季节分解图

分解图依次显示原始序列、趋势、季节分量和随机分量。只有当频率大于 1 且至少包含两个完整周期时才生成。

ARIMA 季节分解图
ARIMA 季节分解图

10.65.7.2 ARIMA 预测图

蓝线为历史观察,红线为未来点预测,色带为预测区间。远期预测应重点报告方向和不确定性,避免把单个点预测当作确定值。

ARIMA 预测图
ARIMA 预测图

10.65.7.3 残差 ACF 图

残差各滞后阶的自相关若多数位于参考线内,说明明显时间结构较少。连续多个滞后阶超出参考线时,应重新考虑阶数、季节周期或数据转换。

ARIMA 残差 ACF 图
ARIMA 残差 ACF 图

10.65.7.4 Prophet 预测图

每个结局在独立面板中显示。蓝色部分为历史拟合,红色部分为未来预测,色带表示不确定性。若使用外部回归量,预测还依赖未来回归量填充规则。

Prophet 多结局预测图
Prophet 多结局预测图

10.65.7.5 Prophet 精度图

精度图并列显示各结局在无外部回归量和含外部回归量时的 MAE、RMSE 和 MAPE。加入回归量不一定会改善拟合,应优先依据研究问题和时间外验证决定是否保留。

Prophet 预测精度图
Prophet 预测精度图

10.65.8 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动描述必须人工核对变量、时间频率、模型和预测区间。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。预测 CSV 包含时间、点预测、下限、上限、结局变量和历史/未来阶段。

建议:正式报告前保存原始时间字段、聚合规则、频率、模型设置、缺失/异常值处理、Word 报告和预测 CSV,并使用保留的后续时间窗评估真实预测误差。

10.65.9 论文报告建议

方法部分建议说明时间序列来源、起止时间、聚合粒度、序列频率、缺失和异常值处理、模型选择依据、预测范围及验证策略。结果部分建议报告有效时间点、选定模型、拟合和诊断指标、主要预测值与区间,并说明长期外推和未来回归量假设的局限。

可参考如下写法:

对 2018 年 1 月至 2025 年 12 月的 96 个月度观察值建立季节 ARIMA 模型。自动定阶选定 ARIMA(2,0,0)(2,1,1)[12]。训练序列 RMSE 为 1.85,Ljung–Box 检验未提示显著残差自相关(P=0.29)。模型随后生成 24 个月度时间点的点预测和 95% 预测区间。这些结果反映当前模型假设下的时间趋势,不代表确定的未来值。

示例数值仅用于展示写法,实际报告必须使用本研究输出。

10.65.10 常见问题

1. ARIMA 的预测周期数是什么意思?

它会与序列频率相乘。例如频率为 12、预测周期数为 2 时,将输出 24 个未来时间点。

2. 可以不选时间变量吗?

ARIMA 可以,此时严格按当前数据行顺序。Prophet 不可以,它必须使用可解析的日期/时间字段。

3. 序列频率如何选择?

频率是一个季节周期中的观察点数。月度数据存在年周期时通常设为 12,季度数据设为 4,无明确周期设为 1。

4. 为什么没有季节分解图?

频率必须大于 1,且有效观察值至少覆盖两个完整周期。否则模块不生成该图。

5. Ljung–Box 检验显著怎么办?

说明残差中可能仍有时间依赖。应重新核对频率、考虑变换或外部解释变量,并比较备选模型。

6. Prophet 为什么不允许重复日期?

每个时间点需要对应唯一结局。若同一日期有多行,应先按研究定义汇总。

7. 外部回归量的未来值如何处理?

可选择使用最后观察值或填 0。这是一个明确的预测情景假设,必须在报告中说明。

8. 逻辑增长什么时候使用?

适合明确存在上限、且结局不低于 0 的增长过程。若结局可取负值或没有合理容量上限,优先使用线性增长。

9. 预测区间为什么越来越宽?

预测步数增加时,误差和参数不确定性逐步累积,因此远期区间变宽是常见现象。

10. 模型精度较好就能保证未来预测吗?

不能。当前表中的精度主要描述历史序列拟合。真实预测能力应使用滚动时间窗或保留的后续时间段评估。

10.65.11 小结

本模块的最佳使用方式是:先检查时间字段、观察间隔和频率,根据研究问题选择 ARIMA 或 Prophet,先检查残差与拟合误差,再解释预测值和区间,最后用时间外数据验证预测能力。

时间序列模型的价值在于结构化描述和量化不确定性,而不是用平滑曲线遮盖数据和未来环境的变化。

10.66 机器学习回归

10.66.1 模块功能

本模块用于建立连续型结局的机器学习回归模型。它把数值型和分类特征与连续型结局之间的预测关系交给算法学习,并用独立测试集评价模型在未参与训练的数据上的表现。

当研究者已经确定:

  • 结局变量是连续数值,例如血压、量表评分、住院天数或实验室指标;
  • 有至少两个候选预测特征;
  • 研究目的以预测准确性、泛化能力或复杂非线性模式识别为主;
  • 需要比较不同算法或超参数;
  • 需要输出训练集与测试集性能、诊断图、特征重要性和依赖图;

就可以使用本模块完成数据预处理、随机拆分、模型训练、训练集内交叉验证、测试集评价、特征解释、个体预测和 Word 报告导出。

本模块固定先排除所选变量存在缺失值的案例,再按随机种子将完整案例随机分为 75% 训练集和 25% 测试集。模型调优只在训练集内进行 5 折交叉验证;测试集不参与训练或调参,只用于评价泛化性能。

10.66.2 适用场景

本模块适合以下问题:

  1. 根据人口学、临床和实验室指标预测连续结局;
  2. 比较神经网络、随机森林、XGBoost 和支持向量机的预测性能;
  3. 在变量关系可能非线性或存在复杂交互时建立预测模型;
  4. 评估哪些特征对模型预测最重要;
  5. 观察某个特征变化时模型预测如何变化;
  6. 导出每个完整案例的预测值、残差和训练/测试集标记。

典型应用包括:

  • 根据年龄、基线指标和生物标志物预测治疗后的连续疗效评分;
  • 根据术前资料预测手术时间、出血量或住院时长;
  • 根据多项检查结果预测某个连续生理指标;
  • 比较传统线性关系难以刻画的非线性预测模式;
  • 在形成正式预测模型方案前进行算法和超参数探索。

连续结局预测例子:研究者希望根据年龄、基线评分和两个生物标志物预测随访结局。可先标准化四个数值特征,使用随机森林和固定超参数建立模型,再比较训练集与测试集 RMSE、MAE 和 R²。若测试集性能明显差于训练集,应警惕过拟合,并调整模型复杂度或扩大样本。

不建议用于以下情况:

  • 结局是二分类或多分类,此时应使用机器学习分类模块;
  • 主要目的为估计可解释的回归系数、置信区间或因果效应;
  • 完整案例少于 30 个,或测试集样本过少,导致评价非常不稳定;
  • 特征中包含 ID、姓名、日期文本或分析后才获得的信息;
  • 同一患者存在多次观测却被当作相互独立的行;
  • 在拆分前利用全体数据进行变量筛选、标准化或缺失值填补,造成信息泄漏;
  • 仅凭一次随机拆分就宣称模型已具备临床推广价值。

10.66.3 支持的分析内容

本模块支持以下分析和结果:

  • 神经网络、随机森林、XGBoost 和支持向量机四类回归算法;
  • 数值特征标准化和分类特征独热编码;
  • 固定超参数或指定超参数搜索范围;
  • 网格搜索交叉验证和贝叶斯优化;
  • RMSE、MAE、MPE、MAPE、SMAPE、CCC、RPIQ 和 R²;
  • 残差分布、残差-预测值和观测值-预测值诊断图;
  • 置换特征重要性、SHAP、Olden 和 Sobol-Jansen 重要性;
  • Friedman 总交互强度及两两交互强度;
  • 部分依赖图(PDP)、累积局部效应图(ALE)和 ICE 个体曲线;
  • 前 20 行个体预测预览和完整预测值 CSV;
  • 主要表格的中文与英文 Results 风格描述;
  • 包含当前统计表和图形的 Word 报告。

10.66.4 主要特点

  • 左侧面板按变量、预处理、算法、调优、评价、特征解释和依赖图分区;
  • 多选特征菜单提供“全选”和“清空”;
  • 随机种子下方直接说明 75%/25% 拆分和训练集内 5 折交叉验证;
  • 模型概览显示总行数、完整案例数、排除行数及实际训练/测试集人数;
  • 四类算法分别显示其可接受的超参数;
  • 所有主要评价和解释选项默认勾选;
  • 主要 flextable 表格提供中文和英文描述按钮;
  • 统计图可下载 PNG、TIFF、SVG 或 PDF;
  • Word 报告和完整预测值 CSV 分开下载。

10.66.5 生成的表格和图形

一键自动生成以下表格和图形:

结果主面板分为“模型概览”“性能评价”“诊断图”“特征解释”“特征依赖”和“个体预测”六个标签页。以下示例使用 180 行数据,其中 168 行为完整案例;随机种子为 42,采用随机森林、网格搜索交叉验证和 RMSE 优化。截图中的数值仅用于说明如何阅读结果。

1. 模型信息与数据拆分

模型信息表用于复核结局、特征、预处理、完整案例、训练/测试集人数、算法、调优方式、优化指标和随机种子。本例 168 个完整案例被分为 126 个训练集案例和 42 个测试集案例。

机器学习回归:模型信息与数据拆分
机器学习回归:模型信息与数据拆分

2. 训练集与测试集性能

性能表并列报告训练集和测试集指标。测试集结果是评价泛化能力的主要依据;训练集只用于了解模型对建模数据的拟合情况。两者差距过大时,应检查过拟合、数据泄漏和测试集样本量。

机器学习回归:训练集与测试集性能
机器学习回归:训练集与测试集性能

3. 预测性能诊断图

残差分布图用于观察误差中心、离散程度、偏斜和异常残差。还可输出残差-预测值图和观测值-预测值图,检查系统性偏差、异方差和预测一致性。

机器学习回归:训练集与测试集残差分布
机器学习回归:训练集与测试集残差分布

4. 特征重要性、SHAP 汇总和多种 SHAP 图形

置换重要性衡量打乱某个特征后模型性能下降的程度;SHAP 汇总反映各特征对预测的平均贡献大小和方向信息。重要性高表示模型更依赖该特征,不等于该特征具有因果效应。

机器学习回归:置换特征重要性
机器学习回归:置换特征重要性
机器学习回归:SHAP 汇总
机器学习回归:SHAP 汇总

SHAP 平均绝对值图按平均贡献幅度对特征排序。条形越长,说明该特征在全部样本中的平均预测贡献越大;误差线反映重复计算或样本间贡献的不确定性。该图只比较贡献大小,不区分预测方向。

机器学习回归:SHAP 平均绝对值图
机器学习回归:SHAP 平均绝对值图

SHAP 方向敏感性图在全局重要性基础上保留方向。高于零的条形表示特征总体上倾向于提高模型预测值,低于零的条形表示总体上倾向于降低模型预测值。正负方向可能掩盖不同样本间的异质性,因此应结合箱线图和蜂群图阅读。

机器学习回归:SHAP 方向敏感性图
机器学习回归:SHAP 方向敏感性图

SHAP 箱线图展示每个特征在全部样本中的 SHAP 值分布。中位数反映典型贡献方向,箱体和须反映贡献的离散程度,离群点提示少数样本存在不同寻常的局部贡献。

机器学习回归:SHAP 值箱线图
机器学习回归:SHAP 值箱线图

SHAP 蜂群图进一步展示每个样本的局部贡献。横轴为 SHAP 值:正值表示该特征在该样本中使模型预测值升高,负值表示使预测值降低;每个点代表一个样本,颜色由深到浅对应标准化后的特征取值由低到高。同一特征的点在横轴上分布越宽,说明其对不同样本的预测贡献差异越大。SHAP 描述的是当前模型中的预测贡献,不能据此推断因果效应。

机器学习回归:SHAP 蜂群图
机器学习回归:SHAP 蜂群图

5. PDP 和 ICE 特征依赖图

粗线表示总体部分依赖趋势,细线表示不同个体的 ICE 曲线。曲线可用于发现非线性和个体异质性,但不能脱离数据分布、特征相关性和模型假设解释为因果剂量反应。

机器学习回归:Age 的 PDP 和 ICE 曲线
机器学习回归:Age 的 PDP 和 ICE 曲线

6. 个体预测与残差

个体预测表保留原数据行号,并给出观测值、预测值、残差和训练/测试集标记。页面预览前 20 行,完整结果可下载 CSV。

机器学习回归:个体预测与残差
机器学习回归:个体预测与残差

示例中原始数据有 180 行,所选结局和特征同时完整的案例为 168 行,因此有 12 行被排除。训练集与测试集人数均以 168 个完整案例为基数,而不是以原始 180 行为基数。

10.66.6 数据准备

10.66.6.1 数据格式

数据应采用宽格式:每一行代表一个相互独立的研究对象或观测,每一列代表一个结局或候选特征。

ID Outcome Age Biomarker1 Biomarker2 Treatment
P001 28.4 57 1.82 0.43 A
P002 31.1 64 2.15 0.51 B
P003 24.9 49 1.36 0.39 A

其中 Outcome 为连续型因变量;Age 和生物标志物属于数值型特征;Treatment 属于分类特征。患者 ID 可以保留在数据中,但不要放入候选特征。

10.66.6.2 分析前检查

建议在分析前完成以下检查:

  1. 结局变量确实为连续数值型,并具有足够变异;
  2. 每个候选特征至少有两个不同取值;
  3. 分类特征的水平命名正确,没有拼写导致的伪水平;
  4. 缺失比例不会使完整案例数大幅下降;
  5. 极端值、录入错误和不合理单位已经核对;
  6. 不把结局的组成部分、随访后信息或人工生成的答案变量作为特征;
  7. 同一患者多次观测时,先明确是否需要按患者分组拆分;
  8. 样本量足以支持模型复杂度和独立测试集评价。

本模块采用完整案例分析。任一所选结局或特征缺失,该行就不会进入当前模型。缺失并非完全随机时,完整案例结果可能产生选择偏倚;正式研究应预先说明缺失处理策略。

10.66.7 操作步骤

顶部菜单选择 “按统计学分类模块” → “机器学习建模” → “机器学习回归” 进入模块。

  1. 在“连续型因变量”中选择结局;
  2. 在“数值型特征”和“分类特征”中选择至少两个候选特征;
  3. 选择需要标准化的数值特征;
  4. 对分类特征选择独热编码;
  5. 设置随机种子,用于复现训练/测试集拆分;
  6. 选择神经网络、随机森林、XGBoost 或支持向量机;
  7. 为每个超参数选择固定值或调优范围;
  8. 选择调优方法和优化指标;
  9. 保留需要的性能指标、诊断图和特征解释输出;
  10. 如需 PDP 或 ALE,选择绘图数据集和最多两个特征;
  11. 点击“开始分析”。

下图按上下两段展示同一个左侧设置面板。截图保留了面板的完整宽度,所有字段、下拉框、数值框和复选框均可见。

机器学习回归:完整设置面板上半部分
机器学习回归:完整设置面板上半部分
机器学习回归:完整设置面板下半部分
机器学习回归:完整设置面板下半部分

10.66.8 训练集、测试集和交叉验证

本模块的数据流程为:

  1. 仅保留所选结局和特征;
  2. 排除其中存在缺失值的案例;
  3. 按随机种子随机拆分 75% 训练集和 25% 测试集;
  4. 仅在训练集内进行 5 折交叉验证和超参数选择;
  5. 用最终训练模型对测试集预测;
  6. 分别报告训练集和测试集性能。

随机种子决定拆分结果。相同数据、变量和种子会得到相同拆分;改变种子可能改变测试集组成和评价指标。若样本较小,建议用多个种子或重复重采样检查稳定性,不要只保留表现最好的一次拆分。

测试集必须保持独立。不要根据测试集结果反复调整特征、超参数或预处理后仍把同一测试集称为“独立验证集”。反复查看并据此修改模型,会使测试集逐渐参与建模并高估泛化性能。

10.66.9 数据预处理

10.66.9.1 数值特征标准化

标准化把不同量纲的数值特征转换到可比较尺度。神经网络和支持向量机通常对尺度敏感,建议标准化;树模型对单调尺度变化相对不敏感,但统一标准化便于跨算法比较。

标准化参数应由训练集估计后应用到测试集,避免利用测试集分布信息。模块在建模流程中完成相应预处理。

10.66.9.2 分类特征独热编码

独热编码把分类变量的各水平转换为模型可使用的指示变量。将分类变量直接当作连续数值会人为引入距离和顺序,因此所选分类特征应进行独热编码。

类别极少、极不平衡或只在测试集中出现的水平可能导致模型不稳定。分析前应合并明显稀疏且有专业依据的水平,并检查训练集和测试集中的类别分布。

10.66.10 四类算法如何选择

算法 主要特点 重点超参数 常见使用场景
神经网络 可拟合复杂非线性,需关注尺度和正则化 隐藏层神经元数、惩罚 样本和信号较充分、关系复杂
随机森林 对非线性和交互较稳健,通常适合作为起始模型 每次分裂特征数、树数、最小节点样本数 通用表格型数据、稳健基线模型
XGBoost 逐步提升弱学习器,预测能力强但调参维度较多 特征数、树数、节点样本数、树深、学习率、损失下降阈值 需要精细控制复杂度和偏差-方差平衡
支持向量机 通过核函数拟合线性或非线性边界,对尺度敏感 核函数、代价、不敏感带宽度及核参数 中小样本、高维或平滑非线性关系

没有一种算法对所有数据都最好。算法选择应结合样本量、特征数、非线性、计算成本、可解释性和测试集性能,不应只根据训练集指标决定。

10.66.11 超参数和调优方法

每个超参数可设为固定值或搜索范围。固定值适合复现既定方案或快速分析;搜索范围适合在训练集内比较候选配置。

  • 网格搜索交叉验证:按预设组合系统搜索,直观但在调参维度多时组合数迅速增加;
  • 贝叶斯优化:根据已评价候选逐步选择更有希望的配置,适合较多连续或离散超参数;
  • 优化指标:决定调参时优先改善哪项训练集交叉验证指标,通常可从 RMSE 或 MAE 开始。

为避免无效或过大的搜索,模块会进行自动保护:仅有一个待调超参数而选择贝叶斯优化时,自动改用网格搜索;网格搜索同时包含四个及以上范围参数时,自动改用贝叶斯优化。

调参范围越宽、待调参数越多,计算时间越长,过度搜索的风险也越高。应先依据算法特点和样本量限定合理范围,再进行训练集内交叉验证。

10.66.12 性能指标如何阅读

指标 解释 方向与注意事项
RMSE 均方根误差,对大误差更敏感 越小越好,单位与结局相同
MAE 平均绝对误差 越小越好,较不受极端误差支配
MPE 平均百分比误差,反映系统性高估或低估 正负误差可能抵消,结局接近 0 时不稳定
MAPE 平均绝对百分比误差 越小越好,真实值为 0 或接近 0 时不适用
SMAPE 对称平均绝对百分比误差 便于相对误差比较,但小值附近仍需谨慎
CCC 一致性相关系数,同时考虑相关和偏离一致线 越接近 1 越好
RPIQ 四分位距相对于预测误差的比值 越大通常越好,受结局分布影响
模型解释的结局变异比例 越大通常越好,但不能替代误差指标

应把测试集 RMSE、MAE 和 R² 作为核心结果,并结合结局的临床尺度判断误差是否可接受。不同结局量纲下的 RMSE 和 MAE不能直接横向比较。

本说明书示例中,训练集 RMSE 为 1.71、R² 为 0.821;测试集 RMSE 为 3.23、R² 为 0.673。测试集性能低于训练集,提示模型在未见数据上的误差增加。是否属于不可接受的过拟合,还需结合样本量、结局尺度、重复验证和临床用途判断。

10.66.13 诊断图如何阅读

  • 残差分布图:检查残差是否以 0 附近为中心、是否偏斜、是否有长尾或异常大误差;
  • 残差-预测值图:检查不同预测水平下是否出现系统性偏差或误差扩大;
  • 观测值-预测值图:观察预测是否接近一致线,以及高值或低值区域是否存在收缩或偏差。

机器学习模型不要求残差严格服从正态分布,但诊断图仍能发现系统性误差、异方差、异常样本和预测范围不足。应优先检查测试集图形。

10.66.14 特征重要性和交互

10.66.14.1 置换特征重要性

在其他条件不变时打乱某个特征,观察模型性能下降程度。下降越明显,说明模型越依赖该特征。高度相关的特征可能彼此替代,从而使单个变量的重要性被低估。

10.66.14.2 SHAP、Olden 和 Sobol-Jansen

  • SHAP:把每个特征对个体预测的贡献分解后汇总,可查看平均绝对贡献、方向、箱线图和蜂群图;
  • Olden:用于神经网络,通过网络权重评估输入特征影响;
  • Sobol-Jansen:基于全局敏感性分析评估主效应和总效应,当前模块仅在没有分类特征时提供;
  • 支持向量机限制:SHAP 输出适用于线性核设置,非线性核下不会显示相同的 SHAP 选项。

10.66.14.3 Friedman 交互强度

Friedman 总交互强度用于评估某个特征的预测作用中有多少不能由单独主效应解释;两两交互用于评估两个特征共同出现时的非加性预测模式。交互强度高是模型结构线索,不是统计显著性检验,也不能自动证明生物学交互。

所有特征解释结果都依赖当前模型、当前样本、特征编码和特征相关结构。重要性、SHAP、敏感性和交互结果应写成“模型预测依赖”或“预测模式”,不要写成独立危险因素、保护因素或因果机制。

10.66.15 PDP、ALE 和 ICE 如何阅读

  • PDP:在平均其他特征影响后,显示某个特征变化与模型平均预测的关系;
  • ICE:为每个个体绘制一条条件预测曲线,可发现个体异质性和潜在交互;
  • ALE:在局部数据范围内累计特征效应,特征相关较强时通常比 PDP 更不容易外推到不现实的组合。

模块允许选择训练集或测试集绘图,并在每张图中选择最多两个特征。解释时应同时查看横轴数据分布;样本稀少区域的曲线通常不稳定。

PDP、ALE 和 ICE 展示的是模型学到的函数关系。它们不能控制未测量混杂,也不能证明改变特征会导致结局按曲线变化。

10.66.16 结果表如何阅读

建议按以下顺序阅读:

  1. 先看模型信息,确认结局、特征、预处理、完整案例和拆分人数;
  2. 检查超参数表,确认实际使用的是固定值还是搜索范围;
  3. 以测试集性能作为泛化评价重点,并与训练集比较;
  4. 查看残差和观测值-预测值图,检查系统性误差;
  5. 比较多种特征重要性结果是否大体一致;
  6. 查看 Friedman 交互、PDP/ALE 和 ICE,理解模型预测模式;
  7. 最后检查个体预测和异常残差,并回到原始数据核对。

10.66.17 表格描述和统计图描述

主要结果表格下方有“对表格进行中文描述”和“对表格进行英文描述”按钮;统计图下方也可生成中英文描述。系统会结合当前结局、特征、算法、数据拆分和表格或图形内容生成论文 Results 风格初稿。

建议使用方式:

  1. 先确认数据拆分、算法、指标和样本数正确;
  2. 再生成中文或英文描述;
  3. 人工核对训练集与测试集、指标方向和数值;
  4. 删除超出表格或图形证据范围的表述;
  5. 不把预测关联写成因果效应或临床建议。

10.66.18 Word 报告

“下载Word报告”会导出当前机器学习回归的模型信息、超参数、性能表、解释表和统计图;“下载预测值 CSV”保存完整案例的行号、观测值、预测值、残差和训练/测试集标记。

机器学习回归:Word 报告和预测值下载页
机器学习回归:Word 报告和预测值下载页

报告适合用于:

  • 保存当前分析设置和结果;
  • 给导师、合作者或统计人员初步审阅;
  • 比较不同算法、超参数和随机种子;
  • 起草论文 Methods 和 Results;
  • 保存诊断图、特征解释和个体预测结果。

请用 Microsoft Word 打开导出的文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.66.19 从模块结果转入论文写作

如果计划把机器学习回归写入论文,建议至少报告:

  1. 研究对象、结局定义和候选特征来源;
  2. 原始样本数、完整案例数和缺失值处理;
  3. 训练/测试集拆分比例和随机种子;
  4. 数值标准化、分类变量编码及防止数据泄漏的做法;
  5. 算法名称和关键超参数;
  6. 训练集内 5 折交叉验证、调优方法和优化指标;
  7. 训练集与测试集 RMSE、MAE、R²及其他预先指定指标;
  8. 诊断图和主要系统性误差;
  9. 特征重要性和依赖图的计算口径;
  10. 内部验证局限及是否进行了独立外部验证。

在 Results 中应明确区分训练集和测试集。特征解释可表述为“模型对某特征较为依赖”或“模型预测随该特征呈非线性变化”,不应写成因果关联。

10.66.20 常见问题

1. 为什么没有单独的拆分比例选项?

当前模块固定使用 75% 训练集和 25% 测试集。拆分发生在完整案例形成之后,实际人数显示在模型信息表中。

2. 为什么测试集人数不是原始总样本的 25%?

因为模块先排除所选变量存在缺失值的案例,再从完整案例中拆分。测试集比例以完整案例数为基数。

3. 随机种子有什么作用?

随机种子用于复现数据拆分和算法中的随机过程。相同数据、变量、设置和种子会得到相同拆分;改变种子可能改变性能指标。

4. 为什么需要至少两个特征?

本模块面向多特征机器学习建模,并以至少两个候选特征作为运行条件。只有一个预测变量时,可考虑普通线性或非线性回归。

5. 分类特征为什么要独热编码?

独热编码避免把无序类别错误解释为有大小和距离的连续数字。所选分类特征未正确编码时,模块会阻止运行。

6. 应优先选择哪个算法?

可把随机森林作为通用起始模型,再根据研究问题比较其他算法。最终选择应基于预先规定的测试集或验证策略,而不是训练集表现。

7. 为什么训练集很好,测试集明显变差?

常见原因包括过拟合、样本太小、特征太多、调参范围过宽、数据泄漏或训练/测试集分布差异。应简化模型、限制搜索、扩大样本并重复验证。

8. RMSE 和 MAE 应该报告哪个?

通常两者同时报告。RMSE 更强调大误差,MAE 更接近平均绝对偏差。还应结合结局单位判断误差是否有实际意义。

9. MAPE 为什么可能很大或无法解释?

真实结局为 0 或接近 0 时,百分比误差会非常不稳定。此时应优先使用 RMSE、MAE 和适合当前结局的其他指标。

10. 特征重要性最高是否代表最重要的危险因素?

不是。它只表示当前模型预测较依赖该特征,且会受共线性、编码、算法和样本影响,不能替代回归效应估计或因果分析。

11. PDP 曲线可以解释为剂量反应关系吗?

不能直接这样解释。PDP 是模型预测函数的平均展示,可能受特征相关、稀疏数据和模型外推影响,不代表干预该特征会改变结局。

12. 为什么 Sobol-Jansen 选项有时不能使用?

当前模块的 Sobol-Jansen 分析不支持分类特征。若模型包含分类特征,应使用置换重要性、可用的 SHAP 输出或其他解释结果。

13. 为什么某些支持向量机设置没有 SHAP 输出?

当前模块仅在线性核支持向量机下提供相应 SHAP 输出。使用 RBF 或多项式核时,应结合置换重要性、诊断图和依赖图解释。

14. 一次 75%/25% 拆分足以发表吗?

不一定。样本较小或研究目标较高时,应增加重复交叉验证、Bootstrap、多个种子稳定性分析或独立外部验证,并在论文中说明当前模块结果属于内部拆分评价。

10.66.21 小结

本模块的最佳用法是:先保证结局和特征定义正确,理解完整案例与 75%/25% 拆分,再在训练集内完成预处理和调参,以测试集误差评价泛化能力,最后结合诊断图、特征重要性和 PDP/ALE 理解模型预测模式。

机器学习回归的核心不是让训练集指标尽可能漂亮,而是获得在未参与训练数据上仍然稳定、可复现且与研究用途相符的预测性能。论文中应透明报告数据拆分、随机种子、预处理、算法、超参数、调优、训练/测试集指标和验证局限,并避免把模型解释结果写成因果结论。

10.67 机器学习二分类

10.67.1 模块功能

本模块用于建立二分类结局的机器学习预测模型。它根据数值型和分类特征学习个体属于阳性事件类别的概率,并用未参与训练的测试集评价模型的区分度、分类正确性、概率校准和泛化能力。

当研究者已经确定:

  • 结局变量恰好包含两个水平,例如发生/未发生、阳性/阴性或复发/未复发;
  • 已明确哪一个水平属于阳性事件;
  • 有至少三个候选预测特征;
  • 研究目的以个体风险预测、分类或复杂非线性模式识别为主;
  • 需要比较算法、超参数、分类指标、校准和模型解释结果;

就可以使用本模块完成完整案例筛选、分层随机拆分、模型训练、训练集内交叉验证、测试集评价、分类图、特征解释、个体概率预测和 Word 报告导出。

本模块固定先排除所选变量存在缺失值的案例,再依据二分类结局进行分层随机拆分,约 75% 作为训练集、25% 作为测试集。模型调优只在训练集内进行 5 折交叉验证;测试集不参与训练或调参,只用于评价泛化性能。由于按类别分层并涉及整数取整,实际人数和比例可能与 75%/25% 略有差异。

10.67.2 适用场景

本模块适合以下问题:

  1. 根据人口学、临床、影像或实验室特征预测某个二分类结局;
  2. 比较神经网络、随机森林、XGBoost 和支持向量机的分类性能;
  3. 在类别分布不均衡时同时考察 ROC AUC、PR AUC、平衡准确率、F1 和 MCC;
  4. 评价预测概率与实际发生率是否一致;
  5. 识别模型较依赖的特征及其局部预测贡献;
  6. 导出每个完整案例的预测类别、阳性事件概率和训练/测试集标记。

典型应用包括:

  • 根据基线资料预测治疗应答或不应答;
  • 根据术前指标预测并发症发生或未发生;
  • 根据检查结果预测疾病阳性或阴性;
  • 根据随访前资料预测复发或未复发;
  • 在正式预测模型研究前比较不同算法和超参数方案。

二分类预测例子:研究者希望根据年龄、基线评分和两个生物标志物预测随访事件。可将“Event”指定为阳性事件,使用随机森林和固定超参数建模,再重点比较训练集与测试集 ROC AUC、PR AUC、平衡准确率、Brier Score、校准图和混淆矩阵。若训练集指标远高于测试集,应警惕过拟合。

不建议用于以下情况:

  • 结局为连续数值或包含三个及以上无序类别;
  • 主要目的为估计可解释的比值比、置信区间或因果效应;
  • 完整案例少于 30 个,或任一结局水平少于 10 个完整案例;
  • 特征中包含 ID、姓名、自由文本或结局发生后才获得的信息;
  • 同一研究对象有多行记录,却被当作相互独立的样本随机拆分;
  • 在拆分前利用全体数据进行筛选、标准化或编码,造成信息泄漏;
  • 仅凭一次内部拆分就宣称模型已完成独立外部验证。

10.67.3 支持的分析内容

本模块支持以下分析和结果:

  • 神经网络、随机森林、XGBoost 和支持向量机四类二分类算法;
  • 阳性事件水平指定、数值特征标准化和分类特征独热编码;
  • 固定超参数或指定超参数搜索范围;
  • 网格搜索交叉验证和贝叶斯优化;
  • Accuracy、Balanced Accuracy、Precision、Recall、Specificity、Sensitivity、Kappa、F1、MCC 和 Youden 指数;
  • Detection Prevalence、ROC AUC、PR AUC、Gain Capture 和 Brier Score;
  • ROC、PR、增益、提升、分类概率分布、可靠性/校准和混淆矩阵图;
  • 置换特征重要性、SHAP、Olden 和 Sobol-Jansen 重要性;
  • Friedman 总交互强度及两两交互强度;
  • 部分依赖图(PDP)、累积局部效应图(ALE)和 ICE 个体曲线;
  • 前 20 行个体预测预览和完整预测值 CSV;
  • 主要表格的中文与英文 Results 风格描述;
  • 包含当前统计表和图形的 Word 报告。

10.67.4 主要特点

  • 左侧面板按变量、预处理、算法、调优、评价、特征解释和依赖图分区;
  • 明确指定阳性事件水平,所有阳性预测指标均按该水平计算;
  • 多选特征菜单提供“全选”和“清空”;
  • 随机种子下方直接说明分层 75%/25% 拆分和训练集内 5 折交叉验证;
  • 模型概览显示总行数、完整案例数、排除行数及实际训练/测试集人数;
  • 所有主要评价、分类图和解释选项默认勾选;
  • 主要 flextable 表格提供中文和英文描述按钮;
  • 统计图可下载 PNG、TIFF、SVG 或 PDF;
  • Word 报告和完整预测值 CSV 分开下载。

10.67.5 生成的表格和图形

一键自动生成以下表格和图形:

结果主面板分为“模型概览”“性能评价”“分类图”“特征解释”“特征依赖”和“个体预测”六个标签页。以下示例使用 180 行数据,其中 168 行为完整案例;随机种子为 42,采用随机森林、网格搜索交叉验证和 ROC AUC 优化。截图中的数值仅用于说明如何阅读结果。

1. 模型信息与分层数据拆分

模型信息表用于复核结局水平、阳性事件、特征、预处理、完整案例、训练/测试集人数、算法、调优方式、优化指标和随机种子。本例 168 个完整案例按结局分层后分为 125 个训练集案例和 43 个测试集案例。

机器学习二分类:模型信息与数据拆分
机器学习二分类:模型信息与数据拆分

2. 训练集与测试集分类性能

性能表并列报告训练集和测试集的正确性、区分度和概率误差。测试集结果是评价泛化能力的主要依据;训练集只用于了解模型对建模数据的拟合情况。本例训练集 ROC AUC 为 0.974、测试集 ROC AUC 为 0.816,训练集表现更好,提示需要结合重复验证判断过拟合程度。

机器学习二分类:训练集与测试集性能
机器学习二分类:训练集与测试集性能

3. ROC 曲线和 PR 曲线

ROC 曲线展示不同阈值下灵敏度与假阳性率的权衡;PR 曲线展示 Precision 与 Recall 的权衡。类别不均衡时,PR 曲线和 PR AUC通常比单独的 Accuracy 更能反映阳性事件识别能力。

机器学习二分类:ROC 曲线
机器学习二分类:ROC 曲线
机器学习二分类:PR 曲线
机器学习二分类:PR 曲线

4. 校准图与混淆矩阵

可靠性/校准图比较预测概率和实际发生比例;曲线越接近理想线,概率校准通常越好。混淆矩阵显示真阳性、假阳性、真阴性和假阴性的数量,可用于理解同一个阈值下不同错误类型的构成。

机器学习二分类:可靠性和校准图
机器学习二分类:可靠性和校准图
机器学习二分类:混淆矩阵
机器学习二分类:混淆矩阵

5. 置换重要性和多种 SHAP 图形

置换重要性衡量打乱某个特征后模型性能下降的程度;SHAP 结果把个体预测相对于基线预测的变化分配到各特征。重要性高表示当前模型较依赖该特征,不等于该特征具有独立效应或因果作用。

机器学习二分类:置换特征重要性
机器学习二分类:置换特征重要性

SHAP 平均绝对值图按平均贡献幅度排序,只比较贡献大小,不区分提高或降低阳性事件预测概率的方向。

机器学习二分类:SHAP 平均绝对值图
机器学习二分类:SHAP 平均绝对值图

SHAP 方向敏感性图保留总体方向:正值表示特征总体上倾向于提高阳性事件预测,负值表示总体上倾向于降低阳性事件预测。总体方向可能掩盖个体差异,应结合箱线图和蜂群图阅读。

机器学习二分类:SHAP 方向敏感性图
机器学习二分类:SHAP 方向敏感性图

SHAP 箱线图展示每个特征在不同样本中的贡献分布,中位数反映典型方向,箱体、须和离群点反映个体贡献的异质性。

机器学习二分类:SHAP 值箱线图
机器学习二分类:SHAP 值箱线图

SHAP 蜂群图中每个点代表一个样本,横轴为局部 SHAP 值;正值表示该特征使当前样本的阳性预测升高,负值表示使其降低。颜色反映特征取值高低。SHAP 描述当前模型中的预测贡献,不能据此推断因果效应。

机器学习二分类:SHAP 蜂群图
机器学习二分类:SHAP 蜂群图

6. PDP 和 ICE 特征依赖图

粗线表示总体部分依赖趋势,细线表示不同个体的 ICE 曲线。纵轴反映模型对阳性事件的预测变化,可用于发现非线性和个体异质性,但不能解释为因果风险曲线。

机器学习二分类:Age 的 PDP 和 ICE 曲线
机器学习二分类:Age 的 PDP 和 ICE 曲线

7. 个体预测类别与概率

个体预测表保留原数据行号,并给出真实类别、预测类别、阳性事件水平、阳性事件概率、预测是否正确以及训练/测试集标记。页面预览前 20 行,完整结果可下载 CSV。

机器学习二分类:个体预测类别与概率
机器学习二分类:个体预测类别与概率

示例原始数据有 180 行,所选结局和特征同时完整的案例为 168 行,因此有 12 行被排除。训练集与测试集人数均以 168 个完整案例为基数。二分类拆分按结局分层,实际得到 125 个训练集和 43 个测试集案例,而不是机械地把 168 乘以 75% 后强制得到整数 126。

10.67.6 数据准备

10.67.6.1 数据格式

数据应采用宽格式:每一行代表一个相互独立的研究对象或观测,每一列代表结局或候选特征。

ID Outcome Age Biomarker1 Biomarker2 Treatment
P001 Event 57 1.82 0.43 A
P002 No event 64 2.15 0.51 B
P003 Event 49 1.36 0.39 A

其中 Outcome 为二分类因变量;Event 可指定为阳性事件;Age 和生物标志物属于数值型特征;Treatment 属于分类特征。患者 ID 可以保留在数据中,但不要放入候选特征。

10.67.6.2 分析前检查

建议在分析前完成以下检查:

  1. 因变量恰好包含两个有效水平,且阳性事件定义符合研究问题;
  2. 每个结局水平至少有 10 个完整案例,并记录事件率;
  3. 每个候选特征至少有两个不同取值;
  4. 分类特征的水平命名正确,没有拼写造成的伪水平;
  5. 缺失比例不会使完整案例数或少数类别样本数大幅下降;
  6. 不把结局组成部分、结局发生后信息或人工生成的答案变量作为特征;
  7. 同一患者多次观测时,先明确是否需要按患者分组拆分;
  8. 样本量和阳性事件数足以支持模型复杂度、调参和测试集评价。

本模块采用完整案例分析。任一所选结局或特征缺失,该行就不会进入当前模型。缺失并非完全随机时,完整案例结果可能产生选择偏倚;正式研究应预先说明缺失处理策略。

10.67.7 操作步骤

顶部菜单选择 “按统计学分类模块” → “机器学习建模” → “机器学习二分类” 进入模块。

  1. 在“二分类因变量”中选择恰好包含两个水平的结局;
  2. 在“阳性事件水平”中指定研究关注的事件;
  3. 在“数值型特征”和“分类特征”中选择至少三个候选特征;
  4. 选择需要标准化的数值特征;
  5. 对分类特征选择独热编码;
  6. 设置随机种子,用于复现分层训练/测试集拆分;
  7. 选择神经网络、随机森林、XGBoost 或支持向量机;
  8. 为每个超参数选择固定值或调优范围;
  9. 选择调优方法和优化指标;
  10. 保留需要的性能指标、分类图和特征解释输出;
  11. 如需 PDP 或 ALE,选择绘图数据集和最多两个特征;
  12. 点击“开始分析”。

下图按上下两段展示同一个左侧设置面板。截图保留了面板的完整宽度,所有字段、下拉框、数值框和复选框均可见。

机器学习二分类:完整设置面板上半部分
机器学习二分类:完整设置面板上半部分
机器学习二分类:完整设置面板下半部分
机器学习二分类:完整设置面板下半部分

10.67.8 训练集、测试集和交叉验证

本模块的数据流程为:

  1. 仅保留所选结局和特征;
  2. 排除其中存在缺失值的案例;
  3. 按二分类结局进行分层随机拆分,约 75% 进入训练集、25% 进入测试集;
  4. 仅在训练集内进行 5 折交叉验证和超参数选择;
  5. 用最终训练模型对测试集预测;
  6. 分别报告训练集和测试集性能、分类图与个体预测。

分层拆分尽量保持训练集和测试集中的事件比例接近。随机种子决定具体分组;相同数据、变量和种子会得到相同拆分。由于类别内分别取整,实际训练/测试人数和比例可能略偏离 75%/25%。

测试集必须保持独立。不要根据测试集 ROC、PR、校准或混淆矩阵反复调整特征、阈值和超参数后,仍把同一测试集称为“独立验证集”。反复查看并据此修改模型,会使测试集逐渐参与建模并高估泛化性能。

10.67.9 阳性事件与分类阈值

阳性事件决定 Precision、Recall、Sensitivity、Specificity、PR AUC、增益、提升和混淆矩阵的解释方向。分析前必须按研究问题明确指定,不能仅根据编码顺序自动判断。

模块给出每个样本的阳性事件概率,并按默认分类阈值生成预测类别和混淆矩阵。阈值改变会同时改变灵敏度、特异度、Precision 和 Recall,但不会改变基于全部阈值的 ROC AUC。正式应用若需选择临床阈值,应在独立于测试集的规则或验证设计中预先确定,并结合误判代价,而不是只追求单项指标最大。

10.67.10 数据预处理

10.67.10.1 数值特征标准化

标准化把不同量纲的数值特征转换到可比较尺度。神经网络和支持向量机通常对尺度敏感,建议标准化;树模型对单调尺度变化相对不敏感,但统一标准化便于跨算法比较。

标准化参数由训练集估计后应用到测试集,测试集不会参与均值和标准差的估计,从而减少信息泄漏。

10.67.10.2 分类特征独热编码

独热编码把分类变量的各水平转换为模型可使用的指示变量。将无序类别直接当作连续数字会人为引入距离和顺序,因此所选分类特征应进行独热编码。

类别极少、严重稀疏或只在测试集中出现的水平可能导致模型不稳定。分析前应在有专业依据时合并稀疏水平,并检查各类别在结局两组中的分布。

10.67.11 四类算法如何选择

算法 主要特点 重点超参数 常见使用场景
神经网络 可拟合复杂非线性,需关注尺度、样本量和正则化 隐藏层神经元数、惩罚 样本和信号较充分、关系复杂
随机森林 对非线性和交互较稳健,通常适合作为起始模型 每次分裂特征数、树数、最小节点样本数 通用表格型数据、稳健基线模型
XGBoost 逐步提升弱学习器,分类能力强但调参维度较多 特征数、树数、节点样本数、树深、学习率、损失下降阈值 需要精细控制复杂度和偏差-方差平衡
支持向量机 通过核函数建立线性或非线性分类边界,对尺度敏感 核函数、代价及核参数 中小样本、高维或复杂分类边界

没有一种算法对所有数据都最好。算法选择应结合事件数、特征数、类别不平衡、非线性、计算成本、校准和测试集性能,不应只根据训练集 Accuracy 决定。

10.67.12 超参数和调优方法

每个超参数可设为固定值或搜索范围。固定值适合复现既定方案或快速分析;搜索范围适合在训练集内比较候选配置。

  • 网格搜索交叉验证:按预设组合系统搜索,直观但调参维度多时组合数迅速增加;
  • 贝叶斯优化:根据已评价候选逐步选择更有希望的配置,适合较多连续或离散超参数;
  • 优化指标:决定调参时优先改善哪项训练集交叉验证指标。类别大致平衡时可从 ROC AUC 开始;阳性事件较少时应同时关注 PR AUC、Recall、F1 或 MCC。

为避免无效或过大的搜索,模块会进行自动保护:仅有一个待调超参数而选择贝叶斯优化时,自动改用网格搜索;网格搜索同时包含四个及以上范围参数时,自动改用贝叶斯优化;若优化指标或调优组合无法产生稳定有效结果,模块会按提示改用可运行的指标、搜索方式或当前固定参数。

调参范围越宽、待调参数越多,计算时间越长,过度搜索的风险也越高。应先依据算法特点、样本量和事件数限定合理范围,再进行训练集内交叉验证。

10.67.13 性能指标如何阅读

指标 解释 方向与注意事项
Accuracy 全部样本中预测正确的比例 越大越好;类别不平衡时可能具有误导性
Balanced Accuracy 灵敏度和特异度的平均值 越大越好;比 Accuracy 更兼顾两类
Precision 预测为阳性的样本中真实阳性的比例 越大越好;受事件率影响
Recall / Sensitivity 真实阳性样本中被正确识别的比例 越大越好;本模块两者数值相同
Specificity 真实阴性样本中被正确识别的比例 越大越好;应与灵敏度共同解释
Kappa 扣除随机一致后的分类一致程度 越接近 1 越好,受类别分布影响
F1 Score Precision 与 Recall 的调和平均 越大越好;不直接考虑真阴性
MCC 综合四格混淆矩阵的相关性指标 范围约为 -1 至 1,越接近 1 越好
Youden 指数 Sensitivity + Specificity - 1 越大越好;常用于概括阈值分类能力
Detection Prevalence 模型预测为阳性的比例 应与实际事件率及应用场景比较
ROC AUC 随机阳性样本得分高于随机阴性样本的概率性概括 越接近 1 越好;不直接反映校准
PR AUC 全部阈值下 Precision-Recall 关系的概括 越大越好;类别不平衡时尤其重要
Gain Capture 高预测得分样本对阳性事件的捕获能力 越大通常越好,应结合增益曲线阅读
Brier Score 预测概率与真实二分类结局之间的均方误差 越小越好,同时受区分度和校准影响

应以测试集为核心,同时报告区分度、分类阈值指标和概率误差。只报告 Accuracy 或 ROC AUC不足以说明模型可靠;至少应结合 PR AUC、灵敏度/特异度、校准图和 Brier Score。

本说明书示例中,训练集 ROC AUC 为 0.974、PR AUC 为 0.972、Brier Score 为 0.089;测试集 ROC AUC 为 0.816、PR AUC 为 0.747、Brier Score 为 0.181。测试集表现低于训练集,提示模型在未见数据上的区分度下降且概率误差增加。是否构成不可接受的过拟合,还需结合事件数、重复验证和应用目的判断。

10.67.14 分类图如何阅读

  • ROC 曲线:观察不同阈值下灵敏度与 1-特异度的权衡,曲线越靠近左上角通常越好;
  • PR 曲线:观察 Precision 与 Recall 的权衡,特别适合阳性事件较少的数据;
  • 增益曲线:观察按预测风险从高到低选择一定比例样本时能捕获多少阳性事件;
  • 提升曲线:比较模型筛选阳性事件的效率与随机筛选相比提高多少;
  • 分类概率分布图:比较阳性与阴性样本的预测概率重叠程度;
  • 可靠性/校准图:比较预测概率与实际发生比例,检查系统性高估或低估;
  • 混淆矩阵图:在当前阈值下检查真阳性、假阳性、真阴性和假阴性的数量。

ROC 和 PR 主要评价排序与区分,校准图和 Brier Score评价概率是否可信,混淆矩阵评价特定阈值下的错误构成。三类结果不能互相替代。

10.67.15 特征重要性和交互

10.67.15.1 置换特征重要性

在其他条件不变时打乱某个特征,观察模型性能下降程度。下降越明显,说明模型越依赖该特征。高度相关的特征可能彼此替代,使单个变量的重要性被低估或分散。

10.67.15.2 SHAP、Olden 和 Sobol-Jansen

  • SHAP:分解各特征对个体阳性预测的贡献,可查看平均绝对贡献、总体方向、箱线图和蜂群图;
  • Olden:用于神经网络,通过网络权重评估输入特征影响;
  • Sobol-Jansen:基于全局敏感性分析评估主效应和总效应,当前模块仅在没有分类特征时提供;
  • 支持向量机限制:SHAP 输出适用于线性核设置,非线性核下不会显示相同的 SHAP 选项。

10.67.15.3 Friedman 交互强度

Friedman 总交互强度用于评估某个特征的预测作用中有多少不能由单独主效应解释;两两交互用于评估两个特征共同出现时的非加性预测模式。交互强度高是模型结构线索,不是统计显著性检验,也不能自动证明生物学交互。

所有特征解释结果都依赖当前模型、当前样本、阳性事件定义、特征编码和特征相关结构。重要性、SHAP、敏感性和交互结果应写成“模型预测依赖”或“预测模式”,不要写成独立危险因素、保护因素或因果机制。

10.67.16 PDP、ALE 和 ICE 如何阅读

  • PDP:在平均其他特征影响后,显示某个特征变化与模型平均阳性预测之间的关系;
  • ICE:为每个个体绘制一条条件预测曲线,可发现个体异质性和潜在交互;
  • ALE:在局部数据范围内累计特征效应,特征相关较强时通常比 PDP 更不容易外推到不现实的组合。

模块允许选择训练集或测试集绘图,并在每张图中选择最多两个特征。解释时应同时查看横轴数据分布;样本稀少区域的曲线通常不稳定。

PDP、ALE 和 ICE 展示的是模型学到的预测函数。它们不能控制未测量混杂,也不能证明改变特征会导致事件风险按曲线变化。

10.67.17 结果表如何阅读

建议按以下顺序阅读:

  1. 先看模型信息,确认结局水平、阳性事件、特征、完整案例和分层拆分人数;
  2. 检查超参数表,确认实际使用的是固定值还是搜索范围;
  3. 以测试集 ROC AUC、PR AUC、Brier Score和预先指定的阈值指标为重点;
  4. 查看 ROC、PR、校准和混淆矩阵,理解区分、概率和错误类型;
  5. 比较多种特征重要性结果是否大体一致;
  6. 查看 Friedman 交互、PDP/ALE 和 ICE,理解模型预测模式;
  7. 最后检查个体概率、错误分类样本和训练/测试集标记,并回到原始数据核对。

10.67.18 表格描述和统计图描述

主要结果表格下方有“对表格进行中文描述”和“对表格进行英文描述”按钮;统计图下方也可生成中英文描述。系统会结合当前结局、阳性事件、特征、算法、数据拆分和表格或图形内容生成论文 Results 风格初稿。

建议使用方式:

  1. 先确认阳性事件、拆分、算法、指标和样本数正确;
  2. 再生成中文或英文描述;
  3. 人工核对训练集与测试集、指标方向、阈值和数值;
  4. 删除超出表格或图形证据范围的表述;
  5. 不把预测贡献写成因果效应或临床建议。

10.67.19 Word 报告

“下载Word报告”会导出当前机器学习二分类的模型信息、超参数、性能表、解释表和统计图;“下载预测值 CSV”保存完整案例的行号、真实类别、预测类别、阳性事件概率、预测是否正确和训练/测试集标记。

机器学习二分类:Word 报告和预测值下载页
机器学习二分类:Word 报告和预测值下载页

报告适合用于:

  • 保存当前分析设置和结果;
  • 给导师、合作者或统计人员初步审阅;
  • 比较不同算法、超参数、阳性事件定义和随机种子;
  • 起草论文 Methods 和 Results;
  • 保存分类图、特征解释和个体预测结果。

请用 Microsoft Word 打开导出的文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.67.20 从模块结果转入论文写作

如果计划把机器学习二分类写入论文,建议至少报告:

  1. 研究对象、二分类结局、阳性事件定义和候选特征来源;
  2. 原始样本数、完整案例数、事件数和缺失值处理;
  3. 按结局分层的训练/测试集拆分比例、实际人数和随机种子;
  4. 数值标准化、分类变量编码及防止数据泄漏的做法;
  5. 算法名称和关键超参数;
  6. 训练集内 5 折交叉验证、调优方法和优化指标;
  7. 训练集与测试集 ROC AUC、PR AUC、Brier Score及预先指定的阈值指标;
  8. ROC、PR、校准图和混淆矩阵的主要结果;
  9. 分类阈值的确定方式和误判代价;
  10. 特征重要性和依赖图的计算口径;
  11. 内部验证局限及是否进行了独立外部验证。

在 Results 中应明确区分训练集和测试集,并始终说明阳性事件。特征解释可表述为“模型对某特征较为依赖”或“阳性预测随该特征呈非线性变化”,不应写成因果关联。

10.67.21 常见问题

1. 为什么必须指定阳性事件水平?

Precision、Recall、Sensitivity、PR AUC、增益、提升和混淆矩阵都依赖阳性类别定义。指定错误会使结果解释方向相反。

2. 为什么没有单独的拆分比例选项?

当前模块固定按结局分层拆分约 75% 训练集和 25% 测试集。拆分发生在完整案例形成之后,实际人数显示在模型信息表中。

3. 为什么实际训练集不是完整案例数的精确 75%?

因为二分类拆分在两个结局水平内分别进行,以尽量保持事件比例;类别内整数取整会使最终人数和比例略有偏差。

4. 随机种子有什么作用?

随机种子用于复现分层数据拆分和算法中的随机过程。相同数据、变量、设置和种子会得到相同拆分;改变种子可能改变测试集组成和性能指标。

5. 为什么需要至少三个特征?

本模块面向多特征机器学习分类,并以至少三个候选特征作为运行条件。特征很少且研究重点是效应估计时,可考虑普通 Logistic 回归。

6. 分类特征为什么要独热编码?

独热编码避免把无序类别错误解释为有大小和距离的连续数字。所选分类特征未正确编码时,模块会阻止运行。

7. 应优先选择哪个算法?

可把随机森林作为通用起始模型,再根据研究问题比较其他算法。最终选择应基于预先规定的验证策略、测试集区分度与校准,而不是训练集表现。

8. 为什么 Accuracy 很高,模型仍可能不好?

类别不平衡时,即使模型几乎都预测为多数类,Accuracy 也可能很高。应同时检查 Balanced Accuracy、Recall、Specificity、PR AUC、MCC 和混淆矩阵。

9. ROC AUC 和 PR AUC 应报告哪个?

通常同时报告。ROC AUC概括两类排序能力;PR AUC更关注阳性预测质量,在阳性事件较少时尤其重要。两者都不能替代校准评价。

10. Brier Score 很低是否代表模型可以临床使用?

不一定。Brier Score反映概率误差,但仍需结合区分度、校准图、决策阈值、样本代表性和独立验证判断应用价值。

11. 为什么训练集很好,测试集明显变差?

常见原因包括过拟合、样本或事件数太少、特征过多、调参范围过宽、数据泄漏或训练/测试集分布差异。应简化模型、限制搜索、扩大样本并重复验证。

12. 可以根据测试集选择最佳分类阈值吗?

不建议反复这样做。若利用测试集选择阈值,再用同一测试集报告性能,会产生乐观偏倚。阈值应在训练/验证流程内确定,或在独立数据中评价。

13. 特征重要性最高是否代表最重要的危险因素?

不是。它只表示当前模型预测较依赖该特征,且会受共线性、编码、算法和样本影响,不能替代回归效应估计或因果分析。

14. PDP 曲线可以解释为风险的因果剂量反应吗?

不能。PDP 是模型预测函数的平均展示,可能受特征相关、稀疏数据和模型外推影响,不代表干预该特征会改变事件风险。

15. 为什么 Sobol-Jansen 选项有时不能使用?

当前模块的 Sobol-Jansen 分析不支持分类特征。若模型包含分类特征,应使用置换重要性、可用的 SHAP 输出或其他解释结果。

16. 为什么某些支持向量机设置没有 SHAP 输出?

当前模块仅在线性核支持向量机下提供相应 SHAP 输出。使用 RBF 或多项式核时,应结合置换重要性、分类图和依赖图解释。

17. 一次分层 75%/25% 拆分足以发表吗?

不一定。样本较小、事件较少或研究目标较高时,应增加重复交叉验证、Bootstrap、多个种子稳定性分析或独立外部验证,并在论文中说明当前结果属于内部拆分评价。

10.67.22 小结

本模块的最佳用法是:先明确定义阳性事件并检查两类样本量,理解完整案例和分层 75%/25% 拆分,再在训练集内完成预处理和调参,以测试集区分度、阈值指标和概率校准评价泛化能力,最后结合 SHAP、重要性和 PDP/ALE 理解模型预测模式。

机器学习二分类的核心不是让训练集 Accuracy 或 AUC尽可能漂亮,而是获得在未参与训练数据上仍然稳定、校准良好、可复现且与研究用途相符的预测性能。论文中应透明报告阳性事件、事件数、数据拆分、随机种子、预处理、算法、超参数、调优、训练/测试集指标、分类阈值和验证局限,并避免把模型解释结果写成因果结论。

10.68 机器学习多分类

10.68.1 模块功能

本模块用于建立三个及以上无序类别结局的机器学习预测模型。模型根据数值型和分类特征学习每个类别的预测概率,并用未参与训练的测试集评价总体分类性能和每个类别的识别能力。

当研究者已经确定:

  • 结局变量包含三个及以上无天然顺序的类别;
  • 每个类别至少有 10 个完整案例;
  • 有至少两个候选预测特征;
  • 研究目的以个体类别预测、复杂非线性模式识别或算法比较为主;
  • 需要同时查看宏加权指标、逐类别 One-vs-Rest 指标和每类预测概率;

就可以使用本模块完成完整案例筛选、分层随机拆分、模型训练、训练集内交叉验证、测试集评价、分类图、特征解释、个体概率预测和 Word 报告导出。

本模块固定先排除所选变量存在缺失值的案例,再依据多分类结局进行分层随机拆分,约 75% 作为训练集、25% 作为测试集。模型调优只在训练集内进行 5 折交叉验证;测试集不参与训练或调参,只用于评价泛化性能。由于按类别分层并涉及整数取整,实际人数和比例可能与 75%/25% 略有差异。

10.68.2 适用场景

本模块适合以下问题:

  1. 根据人口学、临床、影像或实验室特征预测三种及以上诊断类别;
  2. 预测治疗反应分型、疾病亚型、风险分层或其他无序多分类结局;
  3. 比较神经网络、随机森林、XGBoost 和支持向量机的分类性能;
  4. 在类别不均衡时同时考察宏加权指标和逐类别识别能力;
  5. 识别模型对不同结局类别较依赖的特征;
  6. 导出每个完整案例的预测类别、全部类别概率和训练/测试集标记。

多分类预测例子:研究者希望根据年龄、基线评分和生物标志物预测患者属于 A、B 或 C 三种疾病亚型。可选择随机森林,使用 ROC AUC 进行训练集内调优,再重点比较训练集与测试集的宏加权 ROC AUC、PR AUC、Balanced Accuracy、Brier Score、逐类别 One-vs-Rest 指标和混淆矩阵。若训练集指标明显高于测试集,应警惕过拟合。

不建议用于以下情况:

  • 结局为连续数值、恰好两个类别或有明确等级顺序;
  • 主要目的为估计可解释的回归系数、比值比、置信区间或因果效应;
  • 完整案例少于 30 个,或任一类别少于 10 个完整案例;
  • 特征中包含 ID、姓名、自由文本或结局发生后才获得的信息;
  • 同一研究对象有多行记录,却被当作相互独立的样本随机拆分;
  • 仅凭一次内部拆分就宣称模型已完成独立外部验证。

10.68.3 支持的分析内容

  • 神经网络、随机森林、XGBoost 和支持向量机四类算法;
  • 数值特征标准化和分类特征独热编码;
  • 固定超参数或指定超参数搜索范围;
  • 网格搜索交叉验证和贝叶斯优化;
  • Accuracy、Balanced Accuracy、Precision、Recall、Specificity、Sensitivity、Kappa、F1、MCC 和 Youden 指数;
  • Detection Prevalence、ROC AUC、PR AUC、Gain Capture 和 Brier Score;
  • 宏加权训练/测试集汇总和逐类别 One-vs-Rest 结果;
  • ROC、PR、增益、提升、类别概率分布和混淆矩阵图;
  • 置换特征重要性、SHAP、Olden 和 Friedman 交互强度;
  • 部分依赖图(PDP)、累积局部效应图(ALE)和 ICE 个体曲线;
  • 前 20 行个体预测预览和完整预测值 CSV;
  • 主要表格的中文与英文 Results 风格描述;
  • 包含当前统计表和图形的 Word 报告。

10.68.4 生成的表格和图形

一键自动生成以下表格和图形:

结果主面板分为“模型概览”“性能评价”“分类图”“特征解释”“特征依赖”和“个体预测”六个标签页。以下截图使用三类别示例数据、随机种子 42、随机森林、网格搜索交叉验证和 ROC AUC 优化;数值仅用于说明如何阅读结果。

1. 完整设置面板

左侧面板按变量、预处理、算法、调优、评价、特征解释和依赖图分区。所有主要评价和图表默认勾选。

机器学习多分类:完整设置面板上半部分
机器学习多分类:完整设置面板上半部分
机器学习多分类:完整设置面板下半部分
机器学习多分类:完整设置面板下半部分

2. 模型信息与分层数据拆分

模型信息表用于复核结局类别、特征、预处理、完整案例、训练/测试集人数、算法、调优方式、优化指标和随机种子。

机器学习多分类:模型信息与数据拆分
机器学习多分类:模型信息与数据拆分

3. 宏加权和逐类别分类性能

宏加权汇总表比较训练集与测试集的总体表现;逐类别表把每个类别依次作为目标类别、其余类别作为对照,分别报告 One-vs-Rest 指标。测试集结果是评价泛化能力的主要依据。

机器学习多分类:宏加权训练集与测试集性能
机器学习多分类:宏加权训练集与测试集性能
机器学习多分类:逐类别 One-vs-Rest 性能
机器学习多分类:逐类别 One-vs-Rest 性能

4. 分类性能图

ROC 和 PR 曲线按类别展示阈值变化下的区分能力;混淆矩阵显示真实类别与预测类别的对应关系,便于定位容易混淆的类别组合。

机器学习多分类:ROC 曲线
机器学习多分类:ROC 曲线
机器学习多分类:PR 曲线
机器学习多分类:PR 曲线
机器学习多分类:混淆矩阵
机器学习多分类:混淆矩阵

5. 逐类别特征重要性和 SHAP

置换重要性和 SHAP 结果按类别输出。重要性高表示当前模型对该特征预测某个类别较为依赖,不等于该特征具有独立效应或因果作用。

机器学习多分类:逐类别置换特征重要性
机器学习多分类:逐类别置换特征重要性
机器学习多分类:SHAP 平均绝对值图
机器学习多分类:SHAP 平均绝对值图
机器学习多分类:SHAP 方向敏感性图
机器学习多分类:SHAP 方向敏感性图
机器学习多分类:SHAP 蜂群图
机器学习多分类:SHAP 蜂群图

6. PDP、ALE 和 ICE 特征依赖图

PDP 表示某个特征变化时模型对各类别平均预测概率的变化;ICE 显示个体曲线;ALE 在局部数据范围内累计特征效应。它们展示模型学到的预测函数,不能解释为因果剂量反应。

机器学习多分类:PDP 和 ICE 曲线
机器学习多分类:PDP 和 ICE 曲线

7. 个体预测类别与全部类别概率

个体预测表保留原数据行号,并给出真实类别、预测类别、预测是否正确、训练/测试集标记,以及每个结局类别的预测概率。页面预览前 20 行,完整结果可下载 CSV。

机器学习多分类:个体预测类别与概率
机器学习多分类:个体预测类别与概率

10.68.5 数据准备

数据应采用宽格式:每一行代表一个相互独立的研究对象或观测,每一列代表结局或候选特征。

ID Outcome Age Biomarker1 Biomarker2 Treatment
P001 Class A 57 1.82 0.43 A
P002 Class B 64 2.15 0.51 B
P003 Class C 49 1.36 0.39 A

其中 Outcome 为无序多分类因变量;Age 和生物标志物属于数值型特征;Treatment 属于分类特征。患者 ID 可以保留在数据中,但不要放入候选特征。

分析前应检查:

  1. 因变量包含至少三个无序类别,没有把有序等级误作无序类别;
  2. 每个类别至少有 10 个完整案例,并记录各类别频数和比例;
  3. 每个候选特征至少有两个不同取值;
  4. 分类特征没有由拼写错误产生的伪水平;
  5. 缺失不会使某个少数类别在完整案例中消失或样本量过低;
  6. 不把结局组成部分、结局发生后信息或答案变量作为特征;
  7. 同一患者多次观测时,先明确是否需要按患者分组拆分。

本模块采用完整案例分析。任一所选结局或特征缺失,该行就不会进入当前模型。缺失并非完全随机时,完整案例结果可能产生选择偏倚;正式研究应预先说明缺失处理策略。

10.68.6 操作步骤

顶部菜单选择 “按统计学分类模块” → “机器学习建模” → “机器学习多分类” 进入模块。

  1. 在“多分类因变量”中选择包含三个及以上无序类别的结局;
  2. 核对系统显示的全部分析类别;
  3. 在“数值型特征”和“分类特征”中选择至少两个候选特征;
  4. 选择需要标准化的数值特征,并对分类特征进行独热编码;
  5. 设置随机种子,用于复现分层训练/测试集拆分;
  6. 选择神经网络、随机森林、XGBoost 或支持向量机;
  7. 为每个超参数选择固定值或调优范围;
  8. 选择调优方法和优化指标;
  9. 保留需要的性能指标、分类图和逐类别结果;
  10. 如需 PDP 或 ALE,选择绘图数据集和最多两个特征;
  11. 点击“开始分析”。

10.68.7 训练集、测试集和交叉验证

本模块的数据流程为:

  1. 仅保留所选结局和特征;
  2. 排除其中存在缺失值的案例;
  3. 按多分类结局分层随机拆分,约 75% 进入训练集、25% 进入测试集;
  4. 仅在训练集内进行 5 折交叉验证和超参数选择;
  5. 用最终训练模型对测试集预测;
  6. 分别报告训练集和测试集的宏加权与逐类别结果。

分层拆分尽量保持每个类别在训练集和测试集中的比例接近。随机种子决定具体分组;相同数据、变量和种子会得到相同拆分。

测试集必须保持独立。不要根据测试集结果反复调整特征和超参数后,仍把同一测试集称为“独立验证集”。反复查看并据此修改模型,会使测试集逐渐参与建模并高估泛化性能。

10.68.8 四类算法和调优

算法 主要特点 重点超参数
神经网络 可拟合复杂非线性,需关注尺度、样本量和正则化 隐藏层神经元数、惩罚
随机森林 对非线性和交互较稳健,适合作为通用起始模型 每次分裂特征数、树数、最小节点样本数
XGBoost 分类能力强但调参维度较多 特征数、树数、节点样本数、树深、学习率、损失下降阈值
支持向量机 通过核函数建立线性或非线性分类边界,对尺度敏感 核函数、代价及核参数

每个超参数可设为固定值或搜索范围。网格搜索系统比较预设组合;贝叶斯优化逐步选择更有希望的候选。模块会自动处理只有一个待调参数、网格组合过多或某个优化指标无法稳定计算的情况,并在界面给出提示。

10.68.9 性能指标如何阅读

指标 多分类解释 方向与注意事项
Accuracy 全部样本中预测正确的比例 越大越好;类别不平衡时可能具有误导性
Balanced Accuracy 各类别识别能力的平衡概括 越大越好;比 Accuracy 更兼顾少数类别
Precision 预测为某类别的样本中真实属于该类别的比例 越大越好;逐类别阅读
Recall / Sensitivity 某真实类别被正确识别的比例 越大越好;逐类别阅读
Specificity 非目标类别被正确排除的比例 越大越好;按 One-vs-Rest 解释
Kappa 扣除随机一致后的分类一致程度 越接近 1 越好
F1 Score Precision 与 Recall 的调和平均 越大越好
MCC 兼顾整个混淆矩阵的分类相关性 越接近 1 越好
ROC AUC 目标类别与其余类别排序能力的概括 越接近 1 越好;宏加权和逐类别结合阅读
PR AUC Precision-Recall 关系的概括 越大越好;少数类别尤其重要
Brier Score 各类别预测概率与真实类别之间的概率误差 越小越好

宏加权结果使每个类别先得到指标再汇总,避免只由多数类别主导;逐类别 One-vs-Rest 表用于定位具体哪个类别识别较好或较差。正式报告应同时给出宏加权测试集结果、各类别样本量和关键逐类别指标。

10.68.10 分类图和模型解释

  • ROC/PR 曲线:按类别查看目标类别与其余类别的区分;
  • 增益和提升曲线:评价按预测概率排序后捕获某类别样本的效率;
  • 概率分布图:比较各真实类别的预测概率分布和重叠;
  • 混淆矩阵:直接查看哪些类别之间最容易误分;
  • 置换重要性:打乱特征后观察模型性能下降,按类别输出;
  • SHAP:分解各特征对每个类别预测的局部贡献;
  • Olden:用于神经网络的权重型特征解释;
  • Friedman 交互:描述模型中的非加性预测结构,不是显著性检验;
  • PDP/ALE/ICE:展示特征变化与各类别预测概率之间的模型关系。

支持向量机的 SHAP 输出仅适用于线性核;RBF 和多项式核应结合置换重要性、分类图和依赖图解释。

所有特征解释结果都依赖当前模型、样本、类别编码和特征相关结构。应写成“模型预测依赖”或“预测模式”,不要写成独立危险因素、保护因素或因果机制。

10.68.11 表格描述和 Word 报告

主要结果表格下方有“对表格进行中文描述”和“对表格进行英文描述”按钮;统计图也可生成中英文描述。生成后应人工核对训练集与测试集、宏加权与逐类别口径、指标方向和数值。

“下载Word报告”会导出当前机器学习多分类的模型信息、超参数、性能表、逐类别解释表和统计图;“下载预测值 CSV”保存原行号、真实类别、预测类别、预测是否正确、全部类别概率和训练/测试集标记。

机器学习多分类:Word 报告和预测值下载页
机器学习多分类:Word 报告和预测值下载页

请用 Microsoft Word 打开导出的文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.68.12 从模块结果转入论文写作

建议至少报告:

  1. 研究对象、多分类结局、全部类别定义和候选特征来源;
  2. 原始样本数、完整案例数、各类别样本量和缺失值处理;
  3. 按类别分层的训练/测试集拆分比例、实际人数和随机种子;
  4. 数值标准化、分类变量编码及防止数据泄漏的做法;
  5. 算法名称、关键超参数、5 折交叉验证、调优方法和优化指标;
  6. 训练集与测试集宏加权指标;
  7. 各类别的 One-vs-Rest ROC AUC、PR AUC、Recall、Precision 或 F1;
  8. 混淆矩阵中主要误分类模式;
  9. 特征重要性和依赖图的计算口径;
  10. 内部验证局限及是否进行了独立外部验证。

10.68.13 常见问题

1. 为什么二分类结局不能在这里运行?

本模块专门处理三个及以上无序类别。恰好两个类别时,应使用机器学习二分类模块;有明确等级顺序时,应使用适合有序结局的方法。

2. 为什么没有阳性事件选项?

多分类没有唯一阳性类别。模块会把每个类别依次作为目标类别,与其余类别进行 One-vs-Rest 评价。

3. 为什么实际训练集不是完整案例数的精确 75%?

因为拆分在每个类别内分别进行,以尽量保持类别比例;类别内整数取整会使最终人数和比例略有偏差。

4. 为什么至少需要两个特征?

本模块面向多特征机器学习分类。只有一个特征时,模型比较和解释价值有限,可考虑更简单的统计方法或先补充候选特征。

5. Accuracy 很高,为什么某个类别仍识别很差?

多数类别可能主导总体 Accuracy。应检查 Balanced Accuracy、宏加权指标、逐类别 Recall/Precision/PR AUC 和混淆矩阵。

6. 应优先选择哪个算法?

可把随机森林作为通用起始模型,再比较其他算法。最终选择应依据预先规定的验证策略和测试集表现,不应只看训练集。

7. 为什么某些支持向量机设置没有 SHAP?

当前相应 SHAP 输出适用于线性核。使用 RBF 或多项式核时,可使用置换重要性、分类图和依赖图。

8. 最高重要性的特征是否就是最重要的危险因素?

不是。它只表示当前模型的预测较依赖该特征,且会受共线性、编码、算法和样本影响,不能替代效应估计或因果分析。

9. 一次分层 75%/25% 拆分足以发表吗?

不一定。样本较小、类别不平衡或研究目标较高时,应增加重复交叉验证、Bootstrap、多个随机种子稳定性分析或独立外部验证。

10.68.14 小结

本模块的最佳用法是:先确认结局包含三个及以上无序类别并检查每类样本量,理解完整案例和分层 75%/25% 拆分,再在训练集内完成预处理和调参,以测试集宏加权与逐类别指标评价泛化能力,最后结合混淆矩阵、SHAP、重要性和 PDP/ALE 理解模型预测模式。

机器学习多分类的核心不是让训练集 Accuracy 或 AUC 尽可能漂亮,而是获得在未参与训练数据上仍然稳定、可复现且能兼顾各类别的预测性能。论文中应透明报告类别定义、各类样本量、数据拆分、预处理、算法、超参数、调优、训练/测试集指标和验证局限,并避免把模型解释结果写成因果结论。

10.69 贝叶斯常用统计检验

贝叶斯分析通过比较数据在不同假设或模型下的相对支持程度,并结合先验分布与当前数据形成后验分布。本模块集中提供单样本、独立样本和配对样本 t 检验、方差分析及列联表分析,适合处理常见均值、组间差异、模型比较和分类变量关联问题。

核心原则:贝叶斯因子回答“当前数据在两个假设下相对更可能出现于哪一个”,不是零假设或备择假设为真的概率。结论会受到数据、模型和先验共同影响,因此必须同时报告贝叶斯因子方向、先验设置和敏感性分析。

10.69.1 模块能做什么

  • 对单个连续变量进行单样本 t 检验,并设置检验值;
  • 比较两个独立组或两次配对测量的均值差异;
  • 设置双侧、大于或小于的方向性备择假设;
  • 比较含一个至三个固定因子的方差分析模型,可加入一个随机因子;
  • 输出方差分析的模型贝叶斯因子和效应包含证据;
  • 分析普通、加权或分层列联表,并选择与研究抽样过程相符的抽样设计;
  • 对 2×2 列联表输出对数优势比后验摘要和方向性假设结果;
  • 绘制先验与后验、先验稳健性、序贯证据、模型证据、分组均值和列联表热图;
  • 下载当前分析的 Word 报告和后验/模型 CSV。

10.69.2 如何选择分析方法

研究问题 数据结构 选择方法
一个连续变量是否偏离给定值 一列连续变量 单样本 t 检验
两个独立组的连续结局是否不同 连续结局 + 二分类分组 独立样本 t 检验
同一对象两次测量是否不同 两列成对连续变量 配对样本 t 检验
一个或多个分类因子与连续结局的模型证据 连续结局 + 1至3个因子 方差分析
两个分类变量是否有关联 行变量 + 列变量 列联表

若研究目标是估计多个协变量调整后的连续或二分类效应,应使用相应的回归模型;若数据存在重复测量、中心聚类或个体内相关,应使用混合效应模型。

10.69.3 数据准备

10.69.3.1 t 检验和方差分析

连续结局应为数值型。独立样本 t 检验的分组变量必须恰好包含两个有效水平;配对样本 t 检验的两列数值必须按同一对象逐行对应。方差分析的固定因子应为分类变量,每个拟合单元需要有足够观测值。

10.69.3.2 列联表

普通个体数据中,每行代表一个观察对象,直接选择行变量和列变量。汇总数据中,每行代表一个单元格组合,并用非负整数频数作为权重。分层变量用于对不同亚组分别建立列联表,不应与行列变量重复。

缺失值和小样本:模块按当前分析所需变量使用完整案例。极小单元格、完全分离、空水平或过少的有效配对会使后验结果不稳定;应先核对频数、样本量和数据编码。

10.69.4 主要统计量

  • BF10:备择假设相对于零假设的边际似然比。BF10=5 表示当前数据在备择假设下约为零假设下的 5 倍可能。
  • BF01:零假设相对于备择假设的证据,理论上是 BF10 的倒数。
  • 蒙特卡洛误差百分比:数值积分或抽样带来的相对计算误差。较大时应增加抽样精度或谨慎解释。
  • 后验均值和中位数:在当前模型和先验下,参数后验分布的中心位置。
  • 95% 可信区间:当前数据和先验下,参数后验概率质量的主要范围;不等同于频率学置信区间。
  • P(效应量>0):后验分布中效应量大于 0 的比例,是方向不确定性的描述,不是传统 P 值。
  • 包含贝叶斯因子:比较包含某效应的模型集合与不包含该效应的模型集合,为方差分析中的主效应或交互效应提供整体证据。

常见的经验性表达会把 1 至 3 视为较弱证据、3 至 10 视为中等证据、10 以上视为较强证据。它们只用于组织叙述,不是机械的显著性阈值;接近 1 通常表示数据对两种假设的区分能力有限。

一键自动生成以下表格和图形:

  • 分析方法、变量、假设、先验和有效样本量;
  • t 检验或列联表贝叶斯因子;
  • 方差分析模型比较和效应包含证据;
  • 描述统计、列联表频数与百分比;
  • 效应量或对数优势比后验摘要;
  • 先验与后验、先验稳健性、序贯证据、模型证据和描述图;
  • Word 报告和后验/模型 CSV。

10.69.5 使用步骤

10.69.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “贝叶斯统计” → “贝叶斯常用统计检验”

10.69.5.2 2. 选择分析方法和变量

从“分析方法”中选择单样本、独立样本、配对样本、方差分析或列联表。页面只显示当前方法能够接受的变量和设置,切换方法后应重新核对变量。

10.69.5.3 3. 设置假设、先验和模型

t 检验选择双侧或方向性备择假设,并设置 Cauchy 先验宽度。方差分析选择主效应或交互项、比较参照、固定/随机效应先验尺度和抽样方式。列联表选择抽样设计、先验集中度和后验抽样数。

10.69.5.4 4. 开始分析

所有当前方法可用的主要表格和图形默认勾选。点击 “开始贝叶斯分析” 后,结果显示于右侧各页签;变量校验、计算、绘图和导出错误只会显示在本模块内,不会使整个应用退出。

贝叶斯常用统计检验:完整设置与结果面板
贝叶斯常用统计检验:完整设置与结果面板

方差分析和列联表会自动切换为各自专用设置面板。

方差分析:模型和输出设置
方差分析:模型和输出设置
列联表:抽样设计和输出设置
列联表:抽样设计和输出设置

10.69.6 t 检验结果解释

10.69.6.1 分析概览

先核对分析类型、变量或组别顺序、备择假设、先验宽度、后验抽样数和有效观察数。独立样本结果中的效应方向由表中显示的组别顺序决定;配对结果由第一变量减第二变量的顺序决定。

独立样本 t 检验:分析概览
独立样本 t 检验:分析概览

10.69.6.2 贝叶斯因子

证据表同时列出比较对象、假设方向、BF10 或 BF01、计算误差和观察效应量。解释时先看方向,再看数值大小,并结合先验稳健性图判断结论是否依赖某个特定先验宽度。

独立样本 t 检验:贝叶斯因子
独立样本 t 检验:贝叶斯因子

10.69.6.3 后验摘要

后验表给出标准化效应量的均值、中位数、95% 可信区间和大于 0 的后验概率。若可信区间较宽,应在结论中保留不确定性,而不是只报告贝叶斯因子。

独立样本 t 检验:后验摘要
独立样本 t 检验:后验摘要

10.69.7 t 检验图形解释

10.69.7.1 先验与后验图

先验曲线表示分析前对标准化效应量的设定,后验曲线表示先验与数据结合后的分布。后验越集中,说明参数不确定性越小;其位置和宽度应与后验摘要一起解释。

t 检验:先验与后验分布
t 检验:先验与后验分布

10.69.7.2 先验稳健性图

横轴改变先验宽度,纵轴显示相应贝叶斯因子。若结论在合理先验范围内保持同一证据方向,说明结果对先验设置相对稳健;若曲线跨越 1 或波动较大,应报告敏感性。

t 检验:先验稳健性
t 检验:先验稳健性

10.69.7.3 序贯贝叶斯因子图

序贯图显示随样本逐步加入时证据如何积累。它可用于识别证据是否稳定形成,但数据顺序可能影响曲线路径,不应把事后选择的停止点写成预先设计的序贯试验。

t 检验:序贯贝叶斯因子
t 检验:序贯贝叶斯因子

10.69.7.4 描述图

描述图展示各组数据分布、中心和离散程度,用于发现偏态、离群值或组间样本不平衡。它是模型解释的必要背景,但不能替代贝叶斯证据和后验区间。

t 检验:组别描述图
t 检验:组别描述图

10.69.8 方差分析结果解释

模型比较表按当前参照给出每个候选模型的贝叶斯因子。以零模型为参照时,数值大于 1 表示该模型相对零模型获得更多支持;以最佳模型为参照时,最佳模型为基准,其他模型反映相对证据损失。

效应包含表综合所有包含或排除某效应的候选模型,适合回答“数据整体是否支持加入这个主效应或交互效应”。交互效应应优先结合分组均值图解释,且不应在交互证据不足时过度拆分简单效应。

方差分析:模型比较与效应包含证据
方差分析:模型比较与效应包含证据

模型证据图便于比较候选模型,稳健性图用于检查先验尺度改变后的证据,分组均值图用于理解主效应和交互模式。

方差分析:模型证据图
方差分析:模型证据图
方差分析:先验稳健性图
方差分析:先验稳健性图
方差分析:分组均值图
方差分析:分组均值图

10.69.9 列联表结果解释

列联表证据依赖所选抽样设计。Poisson 适用于各单元频数均可变化;联合多项式适用于总样本量固定;独立行或独立列多项式适用于相应边际总数由设计固定;超几何适用于两个边际都固定的情形。选择依据应来自研究如何抽样,而不是哪个选项产生更大的贝叶斯因子。

列联表:贝叶斯因子结果
列联表:贝叶斯因子结果

2×2 表可进一步报告对数优势比后验分布和方向性假设。对于更大的表,模块重点输出整体关联证据、频数/百分比、先验稳健性和热图;方向性大于或小于只适用于 2×2 表。

列联表:先验稳健性
列联表:先验稳健性
列联表:频数热图
列联表:频数热图

10.69.10 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动生成的文字必须人工核对假设方向、组别顺序、先验和数值。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形;“下载后验/模型 CSV”保存当前模式下可供复核的后验摘要、模型比较或列联表证据数据。

贝叶斯常用统计检验:Word 和 CSV 下载页
贝叶斯常用统计检验:Word 和 CSV 下载页

建议:正式报告时同时保存数据版本、变量编码、假设方向、先验设置、分析模式、Word 报告和 CSV。对关键结论至少进行一次合理范围内的先验敏感性分析。

10.69.11 论文报告建议

方法部分建议说明分析类型、变量与组别顺序、零假设和备择假设、先验分布与尺度、贝叶斯因子方向、后验抽样数以及方差分析或列联表的模型设置。结果部分建议同时报告贝叶斯因子、计算误差、效应量后验摘要、95% 可信区间和敏感性分析。

可参考如下写法:

采用双侧贝叶斯独立样本 t 检验比较两组连续结局,标准化效应量使用宽度为 0.707 的 Cauchy 先验。结果得到 BF10=3.54,提示当前数据对组间差异提供中等程度的相对证据。标准化效应量后验均值为 -0.43,95% 可信区间为 -0.80 至 -0.08。先验敏感性分析中证据方向总体一致。

示例数值仅用于展示写法,实际报告必须使用本研究输出。若 BF 接近 1,应表述为“当前数据不能充分区分两个假设”,不宜写成“证明无差异”。

10.69.12 常见问题

1. BF10 和 BF01 应该选哪个?

二者表达同一比较的相反方向。若研究重点是备择相对零假设的证据,可报告 BF10;若重点是零假设证据,可报告 BF01。必须在正文中说明方向。

2. 贝叶斯因子等于备择假设为真的概率吗?

不等于。它是两个假设下数据边际似然的比值。假设本身的后验概率还取决于研究者为模型设定的先验概率。

3. BF 接近 1 表示什么?

表示当前数据对两个假设的区分能力有限。此时更合理的结论是证据不确定,而不是接受某一个假设。

4. 为什么改变先验宽度后 BF 会变化?

贝叶斯因子会对备择假设允许的效应范围进行平均。先验越宽,分配给极端效应的概率越多,因此边际似然会变化。应依据领域知识设定先验并报告稳健性。

5. 后验可信区间包含 0,但 BF 支持备择,是否矛盾?

不一定。贝叶斯因子比较完整模型证据,可信区间描述参数不确定性,两者回答的问题不同。应一起报告并避免二值化判断。

6. 方差分析的模型比较和效应包含证据有什么区别?

模型比较评价具体候选模型;效应包含证据把所有包含某效应的模型与不包含该效应的模型综合比较,更适合概括主效应或交互效应。

7. 方差分析为什么要设置随机因子?

当某个分类来源代表从更大总体中抽取的水平,并且研究关注其方差而非每个水平差异时,可作为随机因子。若数据存在个体内重复测量或复杂聚类,优先使用混合效应模型。

8. 列联表抽样设计如何选择?

根据数据收集时哪些边际总数被固定来选择。若不确定,应回到研究设计,而不是比较结果后选择证据最大的设计。

9. 为什么大于或小于只适用于 2×2 表?

方向性假设依赖单一优势比方向。更大的列联表包含多个独立对比,不能用一个简单的大于或小于概括整体关联。

10. 后验抽样数越大越好吗?

更多抽样通常能降低数值误差,但会增加计算时间。应结合蒙特卡洛误差和结果稳定性决定,而不是无限增加。

11. 贝叶斯分析可以忽略样本量吗?

不可以。小样本通常导致后验更宽、证据更接近 1;大样本也不能补救错误的变量编码、研究设计或模型设定。

12. 能否只报告 BF,不报告效应量?

不建议。BF 描述相对证据,效应量后验和可信区间描述效应大小与不确定性,两者缺一会限制结果解释。

10.69.13 小结

本模块的最佳使用方式是:先根据研究问题和数据结构选择检验,明确假设方向与组别顺序,使用有依据的先验,先核对贝叶斯因子和计算误差,再结合后验效应量、可信区间、描述图和先验敏感性解释结果。

贝叶斯常用检验的价值在于同时组织相对证据和参数不确定性,而不是把 BF 换成另一套机械的显著性阈值。

10.70 贝叶斯 Logistic 模型

贝叶斯 Logistic 模型用于分析只有两个水平的结局。它不是只拟合一个预先指定的回归方程,而是在候选预测项组成的模型空间中比较多个模型,把模型不确定性纳入变量选择、效应估计和个体预测。

核心原则:后验模型概率和变量纳入概率取决于当前候选项、模型先验、系数先验和数据。它们表示相对模型证据,不能解释为变量产生结局的因果概率。预测性能来自当前建模样本,属于表观性能,不能替代独立验证。

10.70.1 模块能做什么

  • 指定二分类结局及目标事件水平;
  • 同时纳入连续预测变量和分类预测变量;
  • 比较仅主效应模型空间,或加入全部两两交互项;
  • 对连续变量进行中心化或标准化;
  • 选择多种系数先验和模型先验;
  • 使用自适应无放回搜索或 MCMC 搜索候选模型;
  • 输出候选模型后验概率、BF10 或 BF01;
  • 输出模型项后验纳入概率和纳入贝叶斯因子;
  • 输出模型平均或最高后验模型的系数、可信区间和优势比;
  • 输出 AUC、Brier 分数、对数损失、分类指标和校准信息;
  • 绘制模型概率、变量纳入、优势比、ROC、校准和预测概率图;
  • 下载 Word、个体预测 CSV 和候选模型 CSV。

10.70.2 统计模型

对第 \(i\) 名对象,设目标事件为 \(Y_i=1\),非事件为 \(Y_i=0\)。每个候选模型 \(M_k\) 使用 Logistic 链接:

\[ \log\left\{\frac{P(Y_i=1\mid M_k)}{1-P(Y_i=1\mid M_k)}\right\} =\beta_{0k}+\sum_j \beta_{jk}X_{ij}. \]

候选模型的后验概率与其边际似然和模型先验共同决定。模型平均估计把每个候选模型中的参数估计按后验模型概率加权;某个模型未包含的参数按 0 计入,因此结果同时反映参数不确定性和模型选择不确定性。

10.70.2.1 候选模型与贝叶斯因子

  • 后验模型概率:当前候选模型集合中某个模型获得的相对后验权重;
  • BF10:当前模型相对参照模型的证据;
  • BF01:参照模型相对当前模型的证据,是相反方向的表达;
  • 与仅截距模型比较:适合判断加入预测项是否提高模型证据;
  • 与最佳模型比较:适合比较其他候选模型相对当前最高证据模型的损失。

比较基准和方向必须与数值一起报告。接近 1 表示数据不能清楚区分两个模型,不应写成“证明两个模型相同”。

10.70.2.2 后验纳入概率

某模型项的后验纳入概率,是全部包含该项的候选模型后验概率之和。纳入贝叶斯因子进一步比较该项的后验纳入优势与先验纳入优势。高纳入概率说明当前候选模型空间更支持保留该项,但不等于该项具有因果作用,也不保证其在新样本中稳定入模。

10.70.3 数据准备

每行代表一名对象,每列代表一个字段。结局变量必须恰好包含两个有效水平,并在菜单中明确哪个水平是目标事件。连续预测变量必须为数值型;分类预测变量应具有两个或以上有效水平。

模块按结局、所选预测变量和可选权重使用完整案例。事件组与非事件组均至少需要 10 个完整案例,总完整案例至少需要 40 条。分类水平过多、预测项过多或加入交互后模型矩阵过大,会显著扩大候选模型空间并降低稳定性。

完全或近完全分离:若某个变量或组合几乎完美区分事件和非事件,系数、优势比和预测性能可能非常极端。先验可缓解部分数值问题,但不能把缺乏信息的数据变成可靠证据;应检查频数、交叉表、异常值和数据泄漏。

10.70.4 先验与搜索设置

10.70.4.1 系数先验

模块提供 CCH、稳健、内在、经验贝叶斯局部、AIC 型、BIC 型、固定 g、Hyper-g、Hyper-g(Laplace)、Hyper-g/n 和 JZS 型先验。它们对模型复杂度和系数幅度施加不同程度的约束。

没有充分领域依据时,建议把默认设置作为起点,并用至少一种合理替代先验进行敏感性分析。若不同先验产生完全不同的变量纳入或效应方向,应把先验敏感性作为主要结果,而不是选择最符合预期的一项。

10.70.4.2 模型先验

  • 均匀模型先验:每个候选模型具有相同先验概率;
  • Bernoulli 模型先验:每个模型项按给定概率独立纳入;
  • Beta-Binomial 模型先验:对总体模型大小的不确定性进行混合,减少固定纳入概率的刚性。

候选项较多时,模型先验会明显影响对复杂模型的支持。应结合预期模型大小设置,并在论文中报告参数。

10.70.4.3 搜索方法

自适应无放回搜索适合在候选模型空间中快速找到高证据模型。MCMC 搜索通过模型空间抽样近似后验分布,迭代数越大通常越稳定,但计算时间也越长。两种方法在主要结论不一致时,应增加搜索规模、检查随机种子稳定性,并减少缺乏依据的候选项。

一键自动生成以下表格和图形:

  • 分析设置、样本量、完整案例和事件分布;
  • 后验概率最高的候选模型与贝叶斯因子;
  • 模型项后验纳入概率和纳入贝叶斯因子;
  • 后验系数、可信区间、优势比和后验纳入概率;
  • 表观预测性能和分类混淆矩阵;
  • 模型空间与不确定性诊断;
  • 个体预测概率和预测分类;
  • 6 类统计图、Word 报告和两类 CSV。

10.70.5 使用步骤

10.70.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “贝叶斯统计” → “贝叶斯 Logistic 模型”

10.70.5.2 2. 设置变量

选择二分类结局及事件水平,再分别选择连续和分类预测变量。权重变量可不选;只有研究设计或抽样方案明确需要权重时才使用。

10.70.5.3 3. 设置模型和先验

先以仅主效应、默认先验和模型平均作为起点。若研究问题明确涉及交互,再选择主效应与两两交互。设置系数先验、模型先验、模型空间搜索、候选模型上限、贝叶斯因子方向和比较基准。

10.70.5.4 4. 开始分析

所有主要表格和图形默认勾选。点击 “开始贝叶斯 Logistic 分析” 后,结果显示于右侧页签。数据校验、模型估计、绘图和下载错误只会显示在模块内,不会使整个应用退出。

贝叶斯 Logistic 模型:完整设置与分析概览
贝叶斯 Logistic 模型:完整设置与分析概览

10.70.6 分析概览

先核对结局、事件水平、非事件水平、连续和分类预测变量、模型结构、连续变量变换、系数先验、模型先验、搜索方法、BF 方向、比较基准、完整案例数和排除案例数。事件水平一旦反转,系数和优势比方向也会反转。

贝叶斯 Logistic 模型:事件定义与样本概览
贝叶斯 Logistic 模型:事件定义与样本概览

10.70.7 模型比较与变量纳入

候选模型表优先查看后验模型概率和贝叶斯因子。若最高后验模型概率仍较低,说明模型不确定性明显,应优先解释模型平均结果,而不是只报告单一“最佳模型”。

模型项后验纳入概率用于识别跨模型稳定出现的项。对分类变量和交互项,模型矩阵可能展开为多个参数;解释时必须回到原始变量和参照水平,不能把一个虚拟变量参数误写成整个因素的总体证据。

贝叶斯 Logistic 模型:候选模型与变量纳入
贝叶斯 Logistic 模型:候选模型与变量纳入

10.70.8 后验系数与优势比

后验系数位于对数优势尺度,指数化后得到 OR。OR 大于 1 表示预测变量增加或该水平相对参照水平时,目标事件优势增加;OR 小于 1 表示目标事件优势降低。可信区间越宽,不确定性越大。

模型平均结果中,参数不在某些候选模型时按 0 计入,因此后验均值通常会向无效应方向收缩。报告时应同时给出后验纳入概率、OR 和可信区间,避免只挑选 OR 最大的变量。

贝叶斯 Logistic 模型:后验系数与优势比
贝叶斯 Logistic 模型:后验系数与优势比

10.70.9 预测性能与诊断

  • AUC:衡量事件与非事件的排序区分能力,不反映概率是否校准;
  • Brier 分数:预测概率与实际结局平方误差的平均值,越小越好;
  • 对数损失:对过度自信的错误预测惩罚更强,越小越好;
  • 灵敏度和特异度:依赖当前分类阈值;
  • 校准截距和斜率:理想值分别为 0 和 1,但当前结果仍是样本内估计;
  • 有效模型数和后验熵:描述后验权重分散程度,数值较大通常表示模型不确定性更高。

所有指标均在建模完整案例上计算,常常偏乐观。需要评估泛化性能时,应在独立测试集或外部队列中重新计算;不能根据同一数据反复调变量和阈值后仍把结果称为验证性能。

贝叶斯 Logistic 模型:预测性能与模型诊断
贝叶斯 Logistic 模型:预测性能与模型诊断

10.70.10 统计图

候选模型后验概率图显示证据是否集中在少数模型;变量纳入概率图显示跨模型支持;优势比森林图显示方向和可信区间;ROC 图描述区分度;校准图比较预测概率与实际事件比例;概率分布图观察两类对象的预测重叠。

贝叶斯 Logistic 模型:模型证据、效应和预测图
贝叶斯 Logistic 模型:模型证据、效应和预测图

统计图使用模块固定的稳定尺寸,不需要在左侧设置图像宽高。每幅图下方可生成中文或英文描述,并下载 PNG、TIFF、SVG 或 PDF。

10.70.11 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。自动文字必须人工核对事件方向、参照水平、先验、模型比较基准、OR 和预测性能性质。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。个体预测 CSV 包含完整案例的原始行号、实际结局、事件概率和预测分类;模型比较 CSV 保存当前显示的高后验候选模型。

贝叶斯 Logistic 模型:Word 和 CSV 下载页
贝叶斯 Logistic 模型:Word 和 CSV 下载页

建议:保留数据版本、事件定义、候选变量清单、模型结构、连续变量变换、先验、随机种子、搜索设置、Word 和 CSV。对关键结论至少改变一次合理先验和搜索设置,确认变量纳入和效应方向是否稳定。

10.70.12 论文报告建议

方法部分建议说明二分类结局和事件定义、候选预测变量、连续和分类编码、交互结构、缺失处理、系数先验、模型先验、搜索方法、候选模型上限、随机种子、可信区间、预测方式和分类阈值。结果部分先报告完整案例与事件数,再报告模型证据和不确定性、变量纳入、模型平均 OR 与可信区间,最后明确预测性能属于表观性能。

可参考如下写法:

采用贝叶斯 Logistic 模型空间分析研究目标事件的相关因素。连续变量中心化并标准化,候选模型包含预先指定预测项的主效应,模型先验设为均匀先验,并采用自适应无放回搜索。共 173 名对象进入完整案例分析,其中目标事件 61 例。最高后验模型概率为 0.31,提示仍存在模型不确定性,因此主要报告模型平均结果。Biomarker 的后验纳入概率为 0.91,模型平均 OR 为 2.18,95% 可信区间为 1.30 至 3.82。建模样本中的 AUC 为 0.78,该数值属于表观性能,尚需独立验证。

示例名称和数值只用于展示写法,实际报告必须替换为本研究输出。若最高模型概率较低、可信区间很宽或先验敏感性明显,应把不确定性写入结论。

10.70.13 常见问题

1. 贝叶斯 Logistic 和普通 Logistic 有什么区别?

普通 Logistic 通常拟合一个预先指定模型;本模块还比较多个候选模型,并通过模型平均传播模型选择不确定性。

2. 后验纳入概率 0.95 等于变量有 95% 的因果概率吗?

不等于。它只表示在当前候选模型、先验和数据下,该模型项被纳入的后验权重。

3. 为什么最高后验模型概率很低?

多个模型可能具有相近证据。此时不应强行选择一个唯一模型,应报告模型不确定性和模型平均结果。

4. BF10 和 BF01 应该选哪个?

二者是相反方向的同一比较。选择与研究叙述一致的一种,并明确参照模型;不要在看完结果后只选数值较大的一边。

5. 应选择仅主效应还是两两交互?

交互应由研究问题和预先假设驱动。自动加入全部交互会迅速扩大模型空间,并增加稀疏单元和不稳定估计风险。

6. 连续变量为什么默认标准化?

标准化使不同量纲的连续变量处于可比尺度,也有利于数值稳定。OR 此时表示增加 1 个标准差的变化;若需要原单位 OR,可关闭标准化。

7. 如何选择系数先验?

使用有理论或领域依据的先验;缺乏依据时从默认先验开始,并用合理替代先验做敏感性分析。不要按结果最显著来选择。

8. MCMC 迭代数越大越好吗?

更多迭代通常提高模型空间近似稳定性,但增加计算时间。应检查不同随机种子和迭代数下主要模型概率与纳入概率是否稳定。

9. 为什么模型平均 OR 比单一模型更接近 1?

模型平均把未包含该项的模型按系数 0 纳入加权,反映了“是否应纳入”这层不确定性,因此会产生合理收缩。

10. AUC 较高就说明模型可用于临床吗?

不能。还需要检查校准、临床阈值、净获益、外部验证、实施条件和偏倚风险。本模块的 AUC 是样本内表观值。

11. 为什么事件水平反转后 OR 方向也反转?

模型估计的是所选事件相对非事件的优势。反转事件定义会改变模型方向,解释前必须先核对概览表。

12. 可以把所有可用变量都放进去吗?

不建议。变量应依据研究设计、时间顺序、测量质量和领域知识预先确定。大量无依据候选项会放大模型空间并增加偶然发现。

10.70.14 小结

本模块的最佳使用方式是:先明确事件定义和候选变量,以简约主效应模型和有依据的先验作为起点,检查模型证据是否集中,再联合解释后验纳入概率、模型平均 OR、可信区间和模型不确定性,最后把所有预测指标明确标记为表观性能并进行独立验证。

贝叶斯 Logistic 模型的优势不是自动找出“唯一正确变量”,而是让模型选择、参数估计和预测中的不确定性更透明。

10.71 有调节的中介分析

有调节的中介分析用于研究一个变量通过中介变量与结局发生关联,同时检验这条间接路径是否随另一个变量的取值或类别而改变。本模块支持一个至三个并行中介、连续或分类自变量、一个连续或分类调节变量,以及连续和分类协变量。

核心原则:中介分析分解直接效应和间接效应,调节分析检验路径系数是否随 W 改变。有显著间接效应或交互项并不自动证明因果关系;因果解释仍要求合理的时间顺序、混杂控制、测量质量和研究设计。

10.71.1 模块能做什么

  • 估计 X 通过一个至三个并行中介 M 与连续结局 Y 的间接效应;
  • 输出直接效应、间接效应、总效应和组成路径;
  • 选择无调节、X→M 路径调节、M→Y 路径调节或双路径调节;
  • 在 W 的均值及均值±标准差、指定百分位或分类水平下估计条件间接效应;
  • 使用 Delta 法、百分位 Bootstrap 或偏倚校正 Bootstrap 构建区间;
  • 选择完整案例或全信息极大似然处理缺失值;
  • 对连续变量进行中心化、标准化或不处理,并设置分类变量编码;
  • 输出组成回归的拟合摘要和回归系数;
  • 绘制路径图、条件间接效应图和关键路径条件效应图;
  • 下载当前分析的 Word 报告和清洁结果 CSV。

10.71.2 统计模型和路径预设

设 X 为主要自变量,M 为中介,Y 为连续结局,W 为调节变量。基础中介模型由 X→M、M→Y 和 X→Y 三部分组成。模块提供四种预设:

路径预设 中介模型 结局模型 适用问题
无调节 M ~ X + 协变量 Y ~ M + X + 协变量 是否存在总体间接效应
X→M 路径调节 加入 X×W 加入 W 主效应 X 对 M 的关联是否随 W 改变
M→Y 路径调节 加入 W 主效应 加入 M×W M 对 Y 的关联是否随 W 改变
两条路径均调节 加入 X×W 加入 M×W 前半和后半路径是否都随 W 改变

多中介模式按并行中介拟合:每个中介分别接受 X 和协变量的预测,并同时进入结局模型。模块不会自动把中介按先后顺序连接;若研究问题是链式中介,应根据明确的理论和时间顺序另行建模。

10.71.3 数据准备

10.71.3.1 变量类型

  • 结局 Y:必须为连续数值型变量;
  • 中介 M:必须为连续数值型,可选择 1 至 3 个;
  • 自变量 X:可为连续变量或分类变量;
  • 调节变量 W:选择调节路径时必须设置,可为连续变量或分类变量;
  • 连续协变量:年龄、基线值等数值型字段;
  • 分类协变量:性别、中心、分层因素等分类字段。

Y、M、X、W 和协变量不能重复。分类变量至少需要两个有效水平,数值变量应有足够变异。若变量是用 0、1、2 等数字编码的类别,应先在数据准备步骤中明确设为分类变量。

10.71.3.2 样本量和缺失值

模型参数数量随中介数、分类水平、协变量和交互项增加。样本很小、分类水平稀疏、变量近似常数或高度共线时,系数和 Bootstrap 区间可能不稳定。

“完整案例”只使用当前模型所需变量均不缺失的观察;“全信息极大似然”利用观测到的信息估计模型,通常依赖缺失随机等假设。两种方法的有效信息不同,论文中必须说明所选方法并报告原始样本量、缺失情况和分析样本量。

时间顺序:若 X、M 和 Y 在同一时间测量,模型能够描述统计路径,但通常不能充分支持“X 先影响 M,再影响 Y”的因果叙述。横断面结果宜使用“间接关联”或“路径分解”等谨慎表述。

10.71.4 估计、编码和条件化

10.71.4.1 区间方法

  • Delta 法:基于渐近标准误,速度快,适合常规初步分析;
  • 百分位 Bootstrap:直接使用重复抽样分布的百分位数构建区间;
  • 偏倚校正 Bootstrap:进一步校正抽样分布偏倚,计算量更大。

Bootstrap 次数最低为 50,正式研究通常应使用更充分的重复次数,并检查随机重复后的稳定性。区间水平可在 50% 至 99.9% 之间设置,常规报告通常使用 95%。

10.71.4.2 连续变量处理

中心化把变量均值移动到 0,使主效应更接近 W 平均水平下的条件效应;标准化进一步除以标准差,便于比较量纲不同的连续变量。中心化或标准化不会消除混杂,也不会改变交互检验所回答的研究问题。

10.71.4.3 条件取值

连续 W 可按均值及均值±若干标准差,或按低、中、高百分位展示。百分位偏移量允许 5% 至 49%;例如设置 25 表示比较第 25、50 和 75 百分位。分类 W 直接按其有效水平展示条件效应。

分类变量编码包括简单、离差、虚拟变量、差分、Helmert、重复和多项式编码。编码会改变系数的参照和解释方式,但不应在看到结果后反复更换编码以追求显著性。

一键自动生成以下表格和图形:

  • 分析概览和有效样本量;
  • 直接效应、间接效应、总效应和路径分量;
  • W 各条件下的间接效应和区间;
  • 被调节路径的交互项;
  • 总效应、中介和结局模型的拟合摘要;
  • 各组成回归的系数、标准误、区间和 P 值;
  • 路径图、条件间接效应图和关键路径条件效应图;
  • Word 报告和结果 CSV。

10.71.5 使用步骤

10.71.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “中介与调节效应分析” → “有调节的中介分析”

10.71.5.2 2. 设置变量

依次选择连续结局 Y、1 至 3 个连续中介 M、主要自变量 X 和调节变量 W,再按研究方案加入连续或分类协变量。路径预设选择“无调节”时不需要 W。

10.71.5.3 3. 设置模型

选择调节发生在 X→M、M→Y 或两条路径;设置区间方法、缺失处理、连续变量缩放、条件取值规则和分类编码。路径图可选择概念图或统计图、系数标签、节点形状和节点大小。

10.71.5.4 4. 开始分析

所有主要表格和图形默认勾选。点击 “开始有调节的中介分析” 后,结果显示于右侧五个页签。变量校验、估计、绘图和导出异常只会显示在本模块内,不会使整个应用退出。

有调节的中介分析:完整设置与结果面板
有调节的中介分析:完整设置与结果面板

10.71.6 分析概览

概览表首先用于核对 Y、M、X、W、协变量、路径预设、区间方法、缺失处理和完整观测数。任何变量选择、路径预设或有效样本量与研究方案不一致时,应先返回设置面板修正,不能直接解释后续表格。

10.71.7 效应分解

效应表包含间接效应、路径分量、直接效应和总效应。间接效应表示 X 通过指定 M 与 Y 的关联分量;直接效应表示控制中介后 X 与 Y 的条件关联;总效应为当前模型下总体关联的概括。

对于有调节的模型,表中会按 W 的条件值重复显示效应。解释时应同时报告估计值、区间和条件,而不是只根据 P 值下结论。间接效应区间不包含 0 可表述为“在当前条件和模型下存在统计证据”,不应写成“证明存在因果中介”。

有调节的中介分析:效应分解表
有调节的中介分析:效应分解表

10.71.8 条件效应和交互作用

条件间接效应表比较 W 在较低、平均和较高取值或不同分类水平下的间接效应。若某些条件下区间不含 0、另一些条件下包含 0,只能说明各条件下证据不同;不能仅凭“一个显著、一个不显著”断言二者显著不同。

交互作用表直接检验 X×W 或 M×W 路径。判断调节效应时应优先查看交互项及其区间,再结合条件效应和图形理解方向。若交互项证据不足,不宜过度解读分组后的局部结果。

有调节的中介分析:条件间接效应与交互作用
有调节的中介分析:条件间接效应与交互作用

10.71.9 回归结果

回归结果分为总效应模型、中介模型和结局模型。拟合摘要用于核对每个组成模型的解释度和整体检验,系数表用于理解 X→M、M→Y、X→Y、协变量和交互项。

当包含分类变量时,系数含义依赖所选编码。交互模型中的主效应是调节变量处于参照或中心值时的条件效应,不是跨所有 W 水平的平均效应。标准化系数可辅助比较量纲,但不能替代原始量纲效应和区间。

有调节的中介分析:组成回归结果
有调节的中介分析:组成回归结果

10.71.10 统计图解释

10.71.10.1 路径图

路径图展示 X、M、Y、W 和协变量之间的指定结构。概念图使用 a、b 和 c′ 标记路径;统计图可显示非标准化或标准化系数。虚线调节箭头表示 W 改变某条路径,而不是 W 必然对所有变量产生直接作用。

有调节的中介分析:路径图
有调节的中介分析:路径图

10.71.10.2 条件间接效应图

点表示各条件下间接效应估计,误差线表示所选区间。零线用于判断区间是否跨越 0。应关注效应方向、大小、区间宽度和随 W 的整体趋势,避免把图形中的局部波动过度解释为生物学机制。

有调节的中介分析:条件间接效应图
有调节的中介分析:条件间接效应图

10.71.10.3 关键路径条件效应图

该图显示被调节路径在 W 的不同条件下如何变化。前半路径调节时纵轴为中介的调整后预测值;后半路径调节时纵轴为结局的调整后预测值。线条不平行提示交互模式,其统计证据仍应回到交互作用表确认。

有调节的中介分析:关键路径条件效应图
有调节的中介分析:关键路径条件效应图

统计图使用模块固定的稳定尺寸,不需要在左侧设置图像宽高。每幅图下方可生成中文或英文描述,并下载 PNG、TIFF、SVG 或 PDF。

10.71.11 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。自动生成文字必须人工核对变量角色、路径方向、条件值、参照编码和数值,不能把统计关联改写为因果结论。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。CSV 以长表形式保存分析概览、效应分解、条件间接效应、交互作用、回归拟合和回归系数,便于复核与归档。

有调节的中介分析:Word 和 CSV 下载页
有调节的中介分析:Word 和 CSV 下载页

建议:正式分析前预先写明 X、M、Y、W、调节路径、协变量、缺失处理、分类编码和 Bootstrap 设置。保存数据版本、分析设置、Word、CSV 及图形,避免只保留最终显著组合。

10.71.12 论文报告建议

方法部分建议说明研究设计、变量测量时间、Y/M/X/W 的定义、并行中介数量、调节路径、协变量、分类编码、连续变量处理、缺失值方法、区间类型、区间水平和 Bootstrap 次数。结果部分建议先报告有效样本量,再报告直接、间接和总效应,随后报告交互项和各条件下的间接效应。

可参考如下写法:

采用有调节的中介模型评估 X 与 Y 之间的间接关联,M 作为中介,W 同时调节 X→M 和 M→Y 路径,并调整预先指定的协变量。连续预测变量进行均值中心化,采用偏倚校正 Bootstrap 构建 95% 区间。X×W 交互项提示前半路径随 W 改变;条件间接效应在 W 较低、平均和较高水平分别为 0.08、0.21 和 0.39。上述结果描述的是指定模型下的路径分解,不单独建立因果关系。

示例数值只用于展示写法,实际报告必须使用本研究输出。若交互项或间接效应区间跨越 0,应如实报告不确定性,不宜写成“没有任何作用”。

10.71.13 常见问题

1. 应该选择前半路径、后半路径还是双路径调节?

根据理论、时间顺序和研究设计预先选择。若 W 被认为改变 X 对 M 的影响,选前半路径;若改变 M 对 Y 的影响,选后半路径;只有两条路径都有明确依据时才选双路径。

2. 可以放入多个中介吗?

可以选择 1 至 3 个并行中介。它们会同时进入结局模型并分别建立中介模型。模块不会自动建立 M1→M2→M3 的链式结构。

3. 为什么间接效应显著,但总效应不显著?

总效应可能由方向不同的路径抵消,或估计不够精确。间接效应与总效应回答不同问题,不应把总效应显著作为检验间接效应的机械前提,但必须结合模型设定和研究设计解释。

4. 一个条件显著、另一个条件不显著,能说明调节显著吗?

不能。两个条件的显著性状态不同不等于二者差异显著。应查看交互项和条件效应随 W 的整体变化。

5. 中心化会让交互项更显著吗?

通常不会改变交互项所检验的核心关系。中心化主要改善主效应在交互模型中的解释,并可能缓解非本质的数值问题。

6. 分类调节变量如何解释?

条件效应按其有效水平展示。系数解释依赖分类编码和参照水平,应在方法和结果中明确说明。

7. Delta 法和 Bootstrap 如何选择?

Delta 法计算快,适合常规探索;间接效应分布明显偏斜、样本量有限或正式报告时,通常更重视 Bootstrap 区间。无论选择哪种方法,都应报告区间而不是只看 P 值。

8. FIML 是否一定优于完整案例?

不一定。FIML 能利用部分观察信息,但依赖模型和缺失机制假设;完整案例简单透明,但可能损失效率并产生选择偏倚。选择应由缺失模式和研究方案决定。

9. 可以从横断面数据得出中介因果结论吗?

通常不能。横断面数据难以确认 X、M、Y 的时间顺序,也难排除未测混杂。结果宜表述为间接关联或路径分解。

10. 为什么 Bootstrap 很慢?

每次重复都要重新拟合全部中介和结局模型。中介数量、交互项、分类水平和重复次数都会增加计算量。正式报告不应仅为节省时间而使用过少重复。

11. 条件间接效应图能替代表格吗?

不能。图形便于理解趋势,正式结论仍需报告效应估计、区间、条件值和交互检验。

12. 如何避免结果导向的模型选择?

在分析前明确路径预设、协变量、编码、区间和条件值;对合理替代设置做透明的敏感性分析,并报告不支持假设的结果。

10.71.14 小结

本模块的最佳使用方式是:先依据研究设计明确 X、M、Y、W 的时间顺序和调节路径,预先确定协变量与编码,再核对有效样本量和模型概览,依次解释交互项、条件间接效应、直接效应和总效应,最后结合路径图与条件效应图组织结果。

有调节的中介分析把“通过什么路径发生关联”和“该路径在什么条件下改变”放进同一模型,但模型复杂度越高,越需要透明的先验方案、充分样本、稳健性检查和克制的因果措辞。

10.72 工具变量与两阶段回归

工具变量与两阶段回归用于分析解释变量可能与模型误差相关的线性回归问题。模块通过与内生变量相关、但不应通过其他路径直接影响结局的工具变量识别内生变量效应,并输出第一阶段强度、内生性和过度识别诊断。

核心原则:两阶段回归不能自动消除混杂。工具变量要支持因果解释,至少需要相关性、独立性和排除限制等假设;其中后两项通常不能仅靠当前数据完全检验,必须由研究设计、领域知识和敏感性分析共同论证。

10.72.1 模块能做什么

  • 设置一个连续结局和一个或多个连续内生自变量;
  • 加入连续外生自变量作为调整变量;
  • 设置恰好识别或过度识别的工具变量集合;
  • 拟合两阶段最小二乘回归并输出拟合摘要和总体检验;
  • 输出原始系数、标准误、区间、标准化系数、t 值和 P 值;
  • 使用标准方法、百分位 Bootstrap 或偏倚校正 Bootstrap 构建区间;
  • 选择常规或异方差稳健标准误;
  • 输出弱工具变量、Wu-Hausman 内生性和 Sargan 过度识别检验;
  • 显示可选系数协方差矩阵、预测值和残差;
  • 绘制第一阶段拟合、第二阶段残差、Q-Q 和杠杆值诊断图;
  • 下载当前分析的 Word 报告和结果 CSV。

10.72.2 统计模型

设 (Y) 为连续结局,(X) 为可能内生的解释变量,(C) 为外生调整变量,(Z) 为排除型工具变量。第一阶段可写为:

\[ X = \pi_0 + \pi_1 Z + \pi_2 C + v \]

第二阶段使用第一阶段中由工具变量解释的 (X) 变异估计:

\[ Y = \beta_0 + \beta_1 X + \beta_2 C + \varepsilon \]

模型允许多个内生变量和多个工具变量。工具变量数等于内生变量数时为恰好识别;工具变量数更多时为过度识别,此时可进行 Sargan 检验,但通过该检验并不证明所有工具变量有效。

10.72.3 工具变量假设

10.72.3.1 相关性

工具变量必须能够解释内生变量的变异。第一阶段关系很弱时,两阶段估计可能偏倚、区间很宽,常规推断也可能失真。弱工具变量检验应结合第一阶段系数、研究背景、样本量和工具变量数量解释。

10.72.3.2 独立性

工具变量不应与影响结局的未测混杂因素相关。随机分配、自然实验、制度规则或明确的生物学机制可能增强这一假设的可信度,但单纯观察到工具变量与已测协变量平衡并不足以证明独立性。

10.72.3.3 排除限制

工具变量只能通过内生变量影响结局,不能存在绕过内生变量的直接路径。该假设通常依赖实质性知识,不能仅凭统计检验确认。

因果解释边界:只有在研究设计和领域证据充分支持工具变量假设、模型形式合理且不存在严重弱工具变量问题时,才可谨慎讨论因果效应。否则应表述为“工具变量识别的效应估计”或“在指定假设下的两阶段回归结果”。

10.72.4 数据准备

10.72.4.1 变量类型

  • 结局变量:一个连续数值型字段;
  • 内生自变量:一个或多个连续数值型字段;
  • 外生自变量:可选的连续数值型调整变量;
  • 工具变量:一个或多个连续数值型字段,数量不能少于内生变量数。

变量角色不能重复,每个变量必须具有足够有效观测和变异。模块按当前模型变量使用完整案例;分析概览同时报告原始样本量和完整观测数。

10.72.4.2 工具变量选择

工具变量应由研究方案预先确定,不能在看到结果后反复筛选以获得显著效应。过度加入弱或可疑工具变量可能降低稳定性,并增加排除限制被违反的风险。

10.72.5 估计设置

10.72.5.1 区间方法

  • 标准方法:使用模型的渐近标准误构建区间,计算速度快;
  • 百分位 Bootstrap:使用重复抽样分布的百分位数构建区间;
  • 偏倚校正 Bootstrap:对重复抽样分布的偏倚和加速项作修正。

Bootstrap 次数允许 50 至 5000。较小次数适合功能测试,正式分析应采用更充分的重复次数并检查随机重复后的稳定性。区间水平允许 50% 至 99.9%,常规报告通常使用 95%。

10.72.5.2 标准误和附加结果

“异方差稳健”用于在误差方差不齐时改进系数标准误估计,但不会修复无效或过弱的工具变量。标准化系数有助于比较量纲不同的变量;原始系数仍是解释实际变化量的主要依据。协方差矩阵适合高级复核,预测值和残差可用于诊断与外部检查。

一键自动生成以下表格和图形:

  • 分析概览、模型公式和有效样本量;
  • 两阶段模型拟合和总体检验;
  • 参数估计、区间和标准化系数;
  • 弱工具变量、Wu-Hausman 和 Sargan 检验;
  • 系数协方差矩阵;
  • 预测值与残差预览及全量 CSV;
  • 第一阶段观测值与拟合值图;
  • 第二阶段残差图、Q-Q 图和杠杆值图;
  • 包含当前结果的 Word 报告。

10.72.6 使用步骤

10.72.6.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “工具变量分析” → “工具变量与两阶段回归”

10.72.6.2 2. 设置变量

选择连续结局、内生自变量、可选外生自变量和工具变量。工具变量数量至少等于内生变量数量;变量角色不能重复。

10.72.6.3 3. 设置推断和输出

选择区间方法、区间水平和标准误方法。使用 Bootstrap 时设置重复次数;按需要保留标准化系数、协方差矩阵、预测值和残差。所有主要表格和图形默认勾选。

10.72.6.4 4. 开始分析

点击 “开始工具变量与两阶段回归”,结果显示于右侧五个页签。变量校验、估计、绘图和导出异常只在本模块内显示,不会使整个应用退出。

工具变量与两阶段回归:完整设置与分析概览
工具变量与两阶段回归:完整设置与分析概览

10.72.7 分析概览

概览表用于核对结局、内生变量、外生变量、排除型工具变量、模型公式、区间方法、标准误方法和完整观测数。模型公式中竖线左侧是第二阶段自变量,右侧是工具变量集合;外生自变量同时出现在两侧。

10.72.8 模型结果

模型拟合表报告 R²、调整 R² 和整体 Wald 检验。总体检验表分别检验各模型项,参数估计表报告两阶段回归系数、标准误、区间、标准化系数、t 值和 P 值。

内生变量系数表示由工具变量所识别变异对应的效应估计,其含义不同于普通最小二乘回归中的总体条件关联。解释时应同时报告原始系数、区间和工具变量诊断,不能只依据 P 值下结论。

工具变量与两阶段回归:模型拟合、总体检验和参数估计
工具变量与两阶段回归:模型拟合、总体检验和参数估计

10.72.9 工具变量诊断

10.72.9.1 弱工具变量检验

该检验评估排除型工具变量是否能够解释内生变量。较小 P 值和较大的统计量提示第一阶段具有统计证据,但不存在适用于所有设计的单一安全阈值。传统的第一阶段 F 值经验规则只能作为筛查,不能替代弱工具变量稳健推断和实质性判断。

10.72.9.2 Wu-Hausman 内生性检验

该检验比较普通回归和工具变量估计。较小 P 值提示两类估计存在系统差异,与内生性相符;较大 P 值不等于证明解释变量完全外生,检验效能也会受工具变量强度和样本量影响。

10.72.9.3 Sargan 过度识别检验

仅在工具变量数量多于内生变量数量时具有自由度。较小 P 值提示至少部分过度识别限制可能不成立;较大 P 值不能证明每个工具变量均有效,并且检验本身依赖额外假设。

工具变量与两阶段回归:识别、内生性和过度识别诊断
工具变量与两阶段回归:识别、内生性和过度识别诊断

10.72.10 回归诊断图

10.72.10.1 第一阶段观测值与拟合值

横轴为内生变量观测值,纵轴为第一阶段拟合值,虚线为理想一致线。点云越集中于对角线附近,说明工具变量和外生变量对内生变量的预测越充分;仍应以第一阶段检验和研究设计为主要依据。

10.72.10.2 第二阶段残差与拟合值

残差应围绕零线随机分布。明显曲线、漏斗形或分组结构可能提示非线性、异方差或遗漏结构。平滑线用于发现总体模式,不是额外的模型拟合结果。

10.72.10.3 残差 Q-Q 图

点接近参考线时,残差分布与正态分布较一致。尾部偏离提示异常值或重尾;大样本中轻微偏离未必影响主要结论,但应结合稳健标准误和敏感性分析。

10.72.10.4 杠杆值图

杠杆值较高的观察对模型几何结构影响较大。虚线是筛查参考线,高杠杆点应核对数据质量,并通过透明的敏感性分析评估影响,不能仅因其改变显著性而删除。

工具变量与两阶段回归:四类回归诊断图
工具变量与两阶段回归:四类回归诊断图

统计图使用模块固定的稳定尺寸,不需要在左侧设置图像宽高。每幅图下方可生成中文或英文描述,并下载 PNG、TIFF、SVG 或 PDF。

10.72.11 保存数据

保存数据页预览前 20 个完整案例,包括原始行号、第二阶段预测值和残差;选择保存预测值时,还包含各内生变量的第一阶段预测值。CSV 保存所有完整案例和全部统计结果,便于外部复核。

工具变量与两阶段回归:预测值与残差预览
工具变量与两阶段回归:预测值与残差预览

10.72.12 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。自动生成文字必须人工核对变量角色、效应方向、区间和诊断检验,不能把统计结果改写为未经论证的因果结论。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。CSV 以“结果部分”区分概览、模型拟合、总体检验、参数估计、工具变量诊断、协方差矩阵和保存数据。

工具变量与两阶段回归:Word 和 CSV 下载页
工具变量与两阶段回归:Word 和 CSV 下载页

建议:正式分析前写明内生变量为何内生、每个工具变量的来源、相关性依据、独立性和排除限制论证、外生调整变量、标准误与区间方法。保存数据版本、分析设置、Word、CSV 和图形,并完整报告不支持假设的诊断结果。

10.72.13 论文报告建议

方法部分建议说明研究设计、结局和内生变量定义、工具变量构造与理论依据、外生调整变量、完整案例规则、两阶段估计、标准误方法、区间类型、区间水平和 Bootstrap 次数。结果部分先报告样本量和第一阶段强度,再报告内生性与过度识别诊断,最后报告两阶段系数和区间。

可参考如下写法:

采用工具变量两阶段最小二乘回归评估 X 与连续结局 Y 的关系,以 Z1 和 Z2 作为排除型工具变量,并调整预先指定的外生协变量。分析纳入 177 个完整案例,使用异方差稳健标准误和 95% 置信区间。第一阶段弱工具变量检验提示工具变量与 X 存在统计关联,Wu-Hausman 检验提示普通回归与工具变量估计存在差异;Sargan 检验未提示过度识别限制存在明显冲突。两阶段估计显示 X 每增加 1 个单位,Y 平均改变 1.12 个单位(95% CI 0.74 至 1.50)。该解释依赖工具变量独立性和排除限制等不可完全由当前数据验证的假设。

示例数值只用于展示写法,实际报告必须替换为本研究输出。Sargan 检验不适用于恰好识别模型;若工具变量较弱,应明确报告限制并考虑弱工具变量稳健方法。

10.72.14 常见问题

1. 什么情况下需要工具变量分析?

当主要解释变量可能因未测混杂、反向因果或测量误差而与模型误差相关,并且存在有明确设计依据的工具变量时,可考虑工具变量分析。

2. 工具变量一定要与结局无关吗?

工具变量可以通过内生变量与结局相关,但不应存在绕过内生变量的直接作用路径,也不应与结局的未测混杂因素相关。

3. 第一阶段 F 值大于 10 就一定安全吗?

不是。该规则只是特定情境下的经验筛查,多个内生变量、多个工具变量、异方差或有限样本时需要更谨慎的诊断和稳健方法。

4. Wu-Hausman 不显著就应该改用普通回归吗?

不能机械决定。检验可能因样本量或弱工具变量而效能不足,最终选择仍应依据研究设计和内生性机制。

5. Sargan 检验不显著是否证明工具变量有效?

不能。它只检查过度识别限制之间是否出现统计冲突,并依赖至少部分工具变量有效等假设;恰好识别时更无法进行该检验。

6. 可以加入多个内生变量吗?

可以,但工具变量数量必须至少等于内生变量数量,而且每个内生变量都需要充分的第一阶段识别。模型复杂度增加后更应关注弱识别。

7. 外生自变量为什么同时进入两个阶段?

外生调整变量既参与预测内生变量,也直接进入结局模型;因此在工具变量公式中同时作为已包含的工具变量和第二阶段协变量。

8. 稳健标准误能解决弱工具变量吗?

不能。稳健标准误主要处理异方差,对工具变量相关性不足、排除限制违反或未识别问题没有修复作用。

9. Bootstrap 是否总比标准区间好?

不一定。Bootstrap 可反映有限样本分布,但仍依赖样本代表性和工具变量假设,也不能自动解决弱识别。应根据样本量、计算资源和研究方案选择。

10. 为什么预测值和残差只对应部分样本?

模块按当前模型变量使用完整案例;存在任一所需变量缺失的记录不会进入拟合。保存数据保留原始行号,便于回到原数据核对。

11. 可以根据 Sargan 结果删除工具变量吗?

不应仅依据 P 值反复筛选。工具变量的保留或排除应由预先指定的设计逻辑、机制证据和透明敏感性分析决定。

12. 结果能直接解释为全人群平均处理效应吗?

未必。工具变量估计的目标参数取决于模型、处理形式、工具变量机制和异质性假设。二元处理和特定工具变量下可能更接近局部平均处理效应,报告时应明确目标人群和解释范围。

10.72.15 小结

本模块的最佳使用方式是:先从研究设计论证内生性来源和工具变量三项核心假设,再预先确定外生调整变量,核对第一阶段强度和识别状态,随后解释内生性与过度识别诊断,最后报告两阶段系数、区间及完整假设边界。

工具变量方法的价值来自设计,而不是复杂公式本身。统计诊断能够提示弱识别或假设冲突,却不能替代对工具变量来源、作用路径和未测混杂的严谨论证。

10.73 缺失数据与多重插补

缺失数据与多重插补用于系统检查变量缺失情况,并通过链式多重插补或随机森林插补生成可用于后续分析的完整数据。模块同时输出缺失模式、插补值明细、分布比较和诊断图,帮助研究者判断插补过程是否稳定、插补值是否合理。

核心原则:插补不是把空白单元格“补齐”就结束。应先说明缺失发生的可能原因,选择与缺失机制、待插补变量和后续分析有关的预测变量,再通过多份插补数据传播缺失所带来的不确定性。

10.73.1 模块能做什么

  • 选择一个或多个连续、二分类或多分类待插补变量;
  • 加入与缺失机制或后续分析有关的辅助预测变量;
  • 使用预测均值匹配、贝叶斯线性回归、二分类或多分类 Logistic 条件模型;
  • 处理具有组内相关性的两层数据和宽格式重复测量数据;
  • 使用随机森林进行单次或多次非线性插补;
  • 设置插补数据集数量、迭代次数、随机种子、树数量和供体数;
  • 输出变量缺失概览、缺失模式、插补值明细和插补前后分布比较;
  • 绘制缺失模式图、缺失指示相关热图、收敛轨迹、密度图和条带图;
  • 下载包含当前结果的 Word 报告和插补后的完整数据 CSV。

10.73.2 缺失机制

10.73.2.1 完全随机缺失

缺失发生的概率与已观测和未观测数据均无关。该条件较强,通常不能仅凭某个统计检验确认。即使总体缺失比例较低,也应比较缺失与完整记录的基线特征。

10.73.2.2 随机缺失

在控制已观测变量后,缺失概率不再依赖未观测值。多重插补通常依赖这一工作假设,因此插补模型应纳入能够解释缺失发生或待插补值的变量,包括结局、暴露、分组、时间和重要辅助变量。

10.73.2.3 非随机缺失

即使控制已观测信息,缺失概率仍与未观测值本身有关。常规插补不能自动解决此类问题,需结合选择模型、模式混合模型、偏移量敏感性分析或上下界分析。

解释边界:缺失模式图和缺失指示相关性只能描述当前数据结构,不能证明缺失机制。机制判断必须结合数据收集流程、失访原因、测量规则和敏感性分析。

10.73.3 插补方法

10.73.3.1 链式多重插补

模块依次为每个不完整变量建立条件模型,并反复迭代更新插补值。每轮使用其他变量的当前值预测目标变量,最终生成多份不同但合理的完整数据。正式推断时应在每份数据上拟合同一分析模型,再合并系数和方差;不要只选其中一份数据当作无缺失的原始数据。

  • 预测均值匹配(PMM):先预测均值,再从预测值接近的真实观测中抽取供体,适合偏态或不易满足正态性的连续变量;
  • 贝叶斯线性回归:用于连续变量,要求条件线性关系和误差结构基本合理;
  • 二分类 Logistic:用于两个水平的分类变量;
  • 多分类 Logistic:用于三个及以上无序类别变量;
  • 两层预测均值匹配:适合受试者、中心或班级等聚类结构中的连续变量;
  • 两层连续模型:以两层连续响应模型处理组内相关性。

10.73.3.2 随机森林插补

随机森林能够表示非线性和高阶交互,不要求事先指定函数形式。树数量越多通常越稳定,但计算耗时也增加。使用预测均值匹配供体时,连续插补值取自真实观测,有助于避免不合理范围;供体数为 0 时直接使用模型预测值。

10.73.4 数据准备

10.73.4.1 变量选择

  • 待插补变量:后续分析需要、且确有缺失的字段;
  • 附加预测变量:与待插补值、缺失发生或最终分析有关,但不一定需要被插补的字段;
  • 受试者 ID:纵向数据中标识同一受试者,不能作为普通连续预测变量解释;
  • 时间或波次:表示重复测量顺序;
  • 分组或聚类变量:表示受试者、中心、学校、社区等上层单位;
  • 固定协变量:在重复测量期间不随时间变化的字段;
  • 宽格式波次字段:同一指标在不同时间点分别存储于不同列时使用。

待插补变量至少应有部分已观测值。完全缺失、无变异、角色重复或类型与条件模型不匹配的字段应先处理。分类变量应在插补前定义清楚水平和参考编码。

10.73.4.2 插补次数和迭代次数

插补数据集数量允许 2 至 50。缺失信息较多或需要稳定尾部区间时,通常应增加插补份数;5 份适合快速检查,不一定足以支持正式报告。最大迭代次数控制链式更新轮数,应结合收敛轨迹判断,而不是机械使用默认值。

固定随机种子可复现当前结果。正式分析建议保存种子、变量角色、方法、插补份数和迭代次数,并在改变种子或方法后进行稳定性复核。

一键自动生成以下表格和图形:

  • 分析设置、变量角色、样本量和插补参数概览;
  • 各变量缺失数、缺失比例、有效数和条件模型;
  • 记录层面的缺失模式组合;
  • 每个插补数据集中的插补值明细;
  • 插补前后均值、标准差、分位数和类别比例比较;
  • 插补后完整数据预览及全量 CSV;
  • 缺失模式图和缺失指示相关热图;
  • 多条插补链的收敛轨迹;
  • 观测值与插补值密度图和条带图;
  • 包含当前结果和图形的 Word 报告。

10.73.5 使用步骤

10.73.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “数据诊断与预处理” → “缺失数据与多重插补”

10.73.5.2 2. 设置变量

选择待插补变量,并根据缺失机制和最终分析加入辅助预测变量。纵向或多水平分析需进一步设置受试者 ID、时间/波次、聚类变量和固定协变量。

10.73.5.3 3. 设置方法

选择链式多重插补或随机森林插补。链式方法需匹配待插补变量类型;随机森林方法可设置树数量和 PMM 供体数。随后设置插补份数、迭代次数和随机种子。

10.73.5.4 4. 开始分析

主要表格和图形默认勾选。点击 “开始缺失数据与多重插补”,结果显示于右侧五个页签。变量校验、插补、绘图和导出异常只在本模块内显示,不会使整个应用退出。

缺失数据与多重插补:左侧完整分析设置
缺失数据与多重插补:左侧完整分析设置

10.73.6 分析概览

概览表用于核对插补引擎、条件模型、待插补变量、辅助预测变量、样本量、插补份数、迭代次数和随机种子。开始解释结果前应确认变量角色与研究方案一致,尤其要避免把 ID、日期编码或纯序号误作连续预测变量。

缺失数据与多重插补:分析设置与样本概览
缺失数据与多重插补:分析设置与样本概览

10.73.7 缺失模式

变量缺失概览报告缺失数、缺失比例和有效数。缺失模式组合表中,实心圆表示该变量在相应模式中缺失,空心圆表示完整;频数和比例反映每种组合出现的记录数。

单变量缺失占主导时,可优先检查该字段的测量流程;多个变量成组缺失时,应核对是否存在共同访视、问卷跳转、设备故障或特定亚组失访。模式频率很低并不代表可以忽略,关键仍是该模式与结局和暴露的关系。

缺失数据与多重插补:变量缺失概览和缺失模式组合
缺失数据与多重插补:变量缺失概览和缺失模式组合

10.73.8 插补结果

插补值明细用于抽查不同插补数据集对同一缺失单元格给出的合理值。多份插补结果不应完全相同;若差异过大,应检查预测变量是否充分、模型是否稳定以及样本是否过小。

分布比较表应关注观测值与插补值的中心、离散程度、分位数和类别比例。插补分布不必与观测分布完全相同,但明显超出合理范围、方差接近零或类别比例剧烈改变,可能提示模型不匹配。

缺失数据与多重插补:插补值明细和分布比较
缺失数据与多重插补:插补值明细和分布比较

10.73.9 诊断图

10.73.9.1 缺失模式图

每行代表一种缺失组合,每列代表一个待插补变量。成块出现的缺失提示共同访视或流程因素;分散缺失更可能涉及字段特异性原因。图形用于发现结构,不用于单独判定缺失机制。

10.73.9.2 缺失指示相关热图

热图显示不同变量“是否缺失”之间的相关性。高正相关提示两个变量经常同时缺失;接近零表示缺失指示之间缺少明显线性关联。二元缺失指示的相关性可能受低缺失率影响,应结合频数表解释。

缺失数据与多重插补:缺失模式图和缺失指示相关热图
缺失数据与多重插补:缺失模式图和缺失指示相关热图

10.73.9.3 插补链收敛轨迹

不同颜色代表不同插补链。经过初始迭代后,各链应在相近范围内波动并相互交叠,不应持续上升、下降或分离。轨迹稳定并不证明插补模型正确,但明显不稳定时不应直接使用结果。

10.73.9.4 观测值与插补值分布图

密度图比较观测值和插补值的整体形状。插补分布应符合变量的实际范围和领域知识;适度差异可能来自缺失机制,不能为了追求图形重合而反复调整模型。

缺失数据与多重插补:收敛轨迹和分布诊断
缺失数据与多重插补:收敛轨迹和分布诊断

10.73.9.5 观测值与插补值条带图

条带图显示每个观测和插补值的位置,更容易发现边界堆积、离群插补值和缺少变异的问题。对离散取值较少的变量,可结合原始频数和类别定义判断重叠点。

缺失数据与多重插补:密度图和条带图
缺失数据与多重插补:密度图和条带图

统计图使用模块固定的稳定尺寸,不需要在左侧设置图像宽高。每幅图下方可生成中文或英文描述,并下载 PNG、TIFF、SVG 或 PDF。

10.73.10 完整数据

完整数据页预览当前选定的一份插补后数据。下载的 CSV 保留全部原始记录和字段,并替换当前待插补变量中的缺失值;未纳入待插补变量的字段继续保留原始缺失状态。

多重插补的标准推断应分别分析全部插补数据集并合并结果。若后续模块只读取单个 CSV,应在研究报告中明确这是单份完成数据,并优先使用能够直接合并多重插补估计的分析流程。

缺失数据与多重插补:插补后完整数据预览
缺失数据与多重插补:插补后完整数据预览

10.73.11 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。自动生成文字必须人工核对缺失比例、变量角色、插补方法和诊断结果,不能据此声称缺失机制已经被证实。

进入 “下载 Word 报告” 页签,可下载当前成功生成的表格、5 类诊断图和 Word 报告,也可下载插补后完整数据 CSV。正式归档时建议同时保存原始数据、插补设置、随机种子和后续分析脚本。

缺失数据与多重插补:Word 和完整数据下载页
缺失数据与多重插补:Word 和完整数据下载页

建议:在研究方案中预先列出待插补变量、辅助预测变量、变量类型、缺失机制工作假设、插补方法、插补份数、迭代次数和敏感性分析。不要根据某次插补是否产生显著结果来反复修改模型。

10.73.12 论文报告建议

方法部分建议报告各关键变量缺失比例、缺失原因调查、缺失机制工作假设、插补模型变量、分类变量编码、插补方法、插补份数、迭代次数、随机种子、诊断方式和多重插补结果合并方法。结果部分可先报告缺失模式,再说明收敛和分布诊断,最后报告插补后分析及完整案例或非随机缺失敏感性分析。

可参考如下写法:

主要分析变量的缺失比例为 12.0% 至 18.7%。在随机缺失工作假设下,采用链式多重插补生成 20 份数据,每条链迭代 20 次;插补模型纳入结局、主要暴露、预先指定协变量以及与失访相关的辅助变量。连续变量使用预测均值匹配,二分类变量使用 Logistic 条件模型。收敛轨迹未见持续趋势,观测值与插补值分布未见明显不合理范围。各插补数据集中的模型估计按标准合并规则汇总,并以完整案例分析和非随机缺失偏移分析作为敏感性分析。

示例比例和参数只用于展示写法,实际报告必须替换为本研究输出。若仅下载并分析一份完成数据,不应写成“多重插补推断”。

10.73.13 常见问题

1. 缺失比例低于 5% 就可以直接删除吗?

不能只看总体比例。即使比例较低,若缺失与结局、暴露或特定亚组相关,完整案例分析仍可能偏倚。应同时检查缺失模式和发生原因。

2. 应把结局变量放入插补模型吗?

通常应纳入。若结局能预测待插补变量或缺失发生,排除结局可能削弱变量关系并产生偏倚;最终模型与插补模型的变量关系应尽量相容。

3. ID 可以作为普通预测变量吗?

通常不可以。纯编号不具有连续含义。纵向数据应把 ID 用作受试者或聚类标识,而不是把数值大小当作效应。

4. PMM 为什么常用于连续变量?

它从预测均值接近的真实观测中抽取供体,能够保留变量范围和部分非正态特征。但供体池过小、样本稀疏或极端值较多时仍需谨慎。

5. 随机森林一定优于链式模型吗?

不一定。随机森林擅长非线性和交互,但解释透明度较低,外推和稀有类别也可能不稳定。应根据变量类型、样本量、计算资源和研究目的选择。

6. 插补次数设置为 5 就够吗?

5 次适合快速检查。正式分析所需次数取决于缺失信息比例和目标估计的稳定性,常需要更多插补份数并检查 Monte Carlo 误差。

7. 收敛轨迹稳定是否证明插补正确?

不能。它只说明数值过程没有明显漂移。变量遗漏、模型不相容、错误类型或非随机缺失仍可能导致偏倚。

8. 插补值分布必须和观测值完全相同吗?

不必。若缺失概率与已观测变量有关,插补值分布可能合理地不同。应重点检查范围、形状、变异和领域合理性。

9. 为什么下载的 CSV 仍有缺失值?

模块只替换“待插补变量”中的缺失值。未选择的原始字段保持不变,因此仍可能包含缺失;这有助于避免悄然改动不参与当前插补的变量。

10. 可以直接把第一份插补数据用于论文主分析吗?

不建议。单份数据没有传播插补不确定性,标准误可能偏小。应在全部插补数据上拟合相同模型并合并估计。

11. 两层方法什么时候使用?

受试者重复测量、患者嵌套于中心、学生嵌套于学校等数据存在组内相关性时使用。需正确指定聚类变量和时间结构。

12. 分类变量插补后出现很少的类别怎么办?

先核对类别编码和样本量。极稀有类别可能导致条件模型不稳定,可在有实质依据时预先合并类别,或采用更合适的方法并透明报告。

13. 非随机缺失可以用本模块彻底解决吗?

不能。常规插补依赖可由已观测信息解释缺失的工作假设。应进一步进行偏移量、模式混合或选择模型等敏感性分析。

14. 插补模型可以比最终分析模型更复杂吗?

可以,而且通常应包含最终模型中的全部变量、交互或非线性项以及有用辅助变量。但变量过多、样本过小或共线性严重时需要简化并检查稳定性。

10.73.14 小结

本模块的最佳使用方式是:先描述缺失比例和流程原因,提出缺失机制工作假设,再选择与待插补值、缺失发生和最终分析有关的变量,匹配变量类型与数据层级设置插补方法,最后结合模式、收敛、分布和敏感性分析判断结果是否可信。

多重插补的价值在于保留信息并传播缺失不确定性,而不是制造一份看起来完整的数据。规范报告应同时说明插补模型、诊断结果、合并方法和对非随机缺失的敏感性分析。

10.74 单样本多分类结局检验

单样本多分类结局检验用于判断一个多分类变量的观测构成比是否符合预先指定的期望比例。例如,检验患者疗效等级是否符合历史分布、不同血型构成是否符合人群参考比例,或多种不良事件类型是否按理论比例出现。

核心原则:这是单样本构成比的拟合优度检验,不是两个分类变量之间的独立性检验。期望比例必须在查看当前检验结果前由研究方案、历史资料或明确理论确定。

10.74.1 模块能做什么

  • 分析具有 2 至 30 个水平的单个分类结局;
  • 支持每行一名对象的原始记录和“类别 + 频数”的汇总数据;
  • 输入任意正数权重并自动标准化为期望比例;
  • 输出观测频数、观测比例、Wilson 区间、期望频数和期望比例;
  • 进行 Pearson 卡方拟合优度检验;
  • 计算 Cohen’s w 效应量;
  • 输出 Pearson 残差、类别卡方贡献及贡献占比;
  • 绘制观测/期望比例比较图和残差图;
  • 下载 Word 报告和类别诊断 CSV。

10.74.2 统计原理

设第 (i) 个类别的观测频数为 (O_i),预先指定的期望比例为 (p_i),总频数为 (N),则期望频数为 (E_i=Np_i)。Pearson 卡方统计量为:

\[ X^2=\sum_{i=1}^{k}\frac{(O_i-E_i)^2}{E_i} \]

在常规近似条件下,自由度为 (k-1)。原假设是全部类别的真实构成比与指定期望比例一致;较小的 P 值提示至少一个类别存在偏离,但不直接说明具体类别。

Cohen’s w 定义为:

\[ w=\sqrt{\frac{X^2}{N}} \]

常用经验分级为 0.10、0.30 和 0.50,但这些阈值不能替代领域意义和绝对比例差。类别 Pearson 残差为 ((O_i-E_i)/),绝对值较大提示该类别对总体差异贡献较大。

10.74.3 数据准备

10.74.3.1 原始记录

每行代表一个研究对象,结局列记录其所属类别。缺失结局不会进入检验。数字编码的类别也可以使用,但应先确认数字只是标签而不是连续量。

10.74.3.2 汇总频数

每行提供类别和非负整数频数。同一类别可以出现多行,模块会自动求和。频数不能为小数、负数或无穷值;结局或频数缺失的行不进入检验。

10.74.3.3 期望比例权重

每个类别输入一个正数,模块按总和自动标准化。例如,1、1、1 表示三类等比例,5、3、2 表示期望比例为 50%、30% 和 20%。权重顺序与左侧显示的类别顺序一致。

近似条件:若部分期望频数小于 5,卡方近似可能不稳定。此时应结合样本量、类别合并的实质依据或更合适的精确/模拟方法;不能只为满足条件而随意合并临床含义不同的类别。

一键自动生成以下表格和图形:

  • 分析设置、变量、数据形式、有效样本和期望比例概览;
  • 类别观测频数、比例、Wilson 区间和期望构成;
  • Pearson 卡方拟合优度检验;
  • Cohen’s w 效应量;
  • Pearson 残差、类别卡方贡献和贡献占比;
  • 观测比例与期望比例比较图;
  • Pearson 残差图;
  • 包含当前结果的 Word 报告和类别诊断 CSV。

10.74.4 使用步骤

10.74.4.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “频数统计” → “单样本多分类结局检验”

10.74.4.2 2. 设置变量

选择多分类结局。若数据已经按类别汇总,再选择频数变量;若每行代表一名对象,则保持“原始记录逐行计数”。

10.74.4.3 3. 设置期望比例

按类别顺序填写期望权重,并选择 90%、95% 或 99% 比例置信水平。所有主要表格和图形默认勾选。

10.74.4.4 4. 开始分析

点击 “开始单样本多分类结局检验”。结果显示于右侧四个页签;输入、计算、绘图和导出异常只在本模块内显示,不会使整个应用退出。

单样本多分类结局检验:完整设置与分析概览
单样本多分类结局检验:完整设置与分析概览

10.74.5 比例结果

比例表报告每个类别的观测频数和构成比,并给出 Wilson 区间。选择显示期望结果后,还会报告期望频数、期望比例和比例差。各类别区间是分别计算的单个比例区间,并非覆盖整组比例的同时置信区间。

观察绝对比例差有助于判断差异大小。例如,某类别观测比例比期望高 8 个百分点,通常比只报告 P 值更易解释。样本量很大时,很小的比例差也可能达到统计学显著。

单样本多分类结局检验:观测比例、区间和期望比例
单样本多分类结局检验:观测比例、区间和期望比例

10.74.6 检验与诊断

总体检验回答“整组构成比是否符合期望分布”。若 P 值较小,再结合 Cohen’s w、比例差、残差和贡献确定差异主要来自哪些类别。

残差为正表示观测频数高于期望,残差为负表示低于期望。类别卡方贡献之和等于总体 (X^2);贡献占比用于描述不同类别在总体统计量中的相对份额。它不表示该类别造成了其他类别变化,也不构成因果证据。

单样本多分类结局检验:总体检验、效应量与类别诊断
单样本多分类结局检验:总体检验、效应量与类别诊断

10.74.7 统计图

观测/期望比较图直接显示各类别比例差异。残差图以 0 为一致基准,并以 ±2 虚线作为直观筛查线;超过参考线的类别应结合其频数、比例差和研究背景解释。

单样本多分类结局检验:构成比和 Pearson 残差图
单样本多分类结局检验:构成比和 Pearson 残差图

统计图使用模块固定的稳定尺寸,不需要在左侧设置图像宽高。每幅图下方可生成中文或英文描述,并下载 PNG、TIFF、SVG 或 PDF。

10.74.8 表格描述和下载

每张主表提供“对表格进行中文描述”和“对表格进行英文描述”按钮。自动文字必须人工核对期望比例来源、类别方向、P 值和效应量,不能将构成比偏离解释为因果关系。

进入 “下载 Word 报告” 页签,可下载当前勾选的表格、图形和 Word 报告;类别诊断 CSV 包含全部类别的观测/期望结果、区间、残差和贡献。

单样本多分类结局检验:Word 和 CSV 下载页
单样本多分类结局检验:Word 和 CSV 下载页

建议:正式报告应同时给出期望比例来源、各类别观测频数和比例、总体检验、效应量以及主要偏离类别。若期望比例来自外部样本,还应说明其人群、年代和测量定义是否与当前研究可比。

10.74.9 论文报告建议

方法部分建议说明分类结局定义、数据形式、期望比例来源、缺失记录处理、卡方拟合优度检验、比例区间方法和效应量。结果部分先报告各类别构成,再报告总体检验和效应量,最后用残差和贡献解释差异来源。

可参考如下写法:

采用 Pearson 卡方拟合优度检验比较疗效等级的观测构成与方案预设的 50%、30% 和 20% 分布。共纳入 180 名具有有效结局的受试者。完全缓解、部分缓解和未缓解的观测比例分别为 56.1%、28.3% 和 15.6%。总体构成与预设分布存在差异((X^2=4.82),df=2,P=0.090;Cohen’s w=0.16)。类别残差提示完全缓解高于期望,而未缓解低于期望;结合区间和绝对比例差,偏离幅度较小。

示例数值只用于展示写法,实际报告必须替换为本研究结果。P 值不显著不等于证明两个分布完全相同;若研究目标是等效性或非劣效性,应使用与界值相匹配的方法。

10.74.10 常见问题

1. 这和列联表卡方检验有什么不同?

本模块只有一个分类变量,检验其构成比是否符合期望比例。列联表检验分析两个分类变量是否独立。

2. 期望比例可以用当前样本估计吗?

不能再用同一批观测数据生成期望比例并检验自身。期望比例应来自预先规定的理论、设计或独立外部资料。

3. 权重必须加起来等于 1 吗?

不必。模块自动标准化,因此 5、3、20.5、0.3、0.2 等价。

4. 可以检验二分类结局吗?

可以,但若目标是单个率与假设值比较,已有“单样本检验”模块通常提供更直接的比例区间和检验。

5. P 值显著后能否只报告贡献最大的类别?

不能。应报告全部类别构成、总体检验和预先定义的解释方式,避免只挑选支持结论的类别。

6. Pearson 残差绝对值大于 2 就一定显著吗?

它是常用筛查线,不是经过多重比较校正的独立检验。应结合总体检验、类别数和预先计划的比较解释。

7. 期望频数小于 5 怎么办?

优先核对类别定义、样本量和期望比例来源。只有在临床含义允许时才合并类别,并考虑精确或模拟方法。

8. 汇总频数可以有重复类别行吗?

可以。模块会按类别求和,但每行频数必须是非负整数。

9. 为什么每个比例区间不能直接判断总体差异?

单个比例区间没有同时控制整组类别的覆盖率,而且多分类比例相互约束。总体结论应以拟合优度检验为主。

10. Cohen’s w 很小但 P 值显著如何解释?

大样本可能使很小偏离达到显著。应同时报告绝对比例差、w 和实际意义,不能只依据 P 值。

10.74.11 小结

本模块的最佳使用方式是:先独立确定期望比例,再核对数据形式和类别顺序,报告各类别观测构成与区间,随后解释总体卡方检验和 Cohen’s w,最后借助残差和贡献定位偏离来源,并明确近似条件和期望比例的适用人群。

10.75 潜在类别增长模型

潜在类别增长模型用于分析多个时间点的重复测量数据,并识别具有不同起点、变化速度或曲线形状的潜在轨迹类别。例如,同一随访队列中可能同时存在持续改善、基本稳定、早期恶化或先升后降等不同变化模式。

核心原则:潜在类别是模型根据当前变量、时间范围和模型假设形成的数据驱动分组,不等同于已经证实的自然人群类型。类别数必须结合拟合指标、分类质量、类别规模、收敛、轨迹可解释性和外部验证共同确定。

10.75.1 模块能做什么

  • 按时间顺序选择至少 3 个连续或有序等级重复测量变量;
  • 使用等间隔或自定义时间得分;
  • 拟合线性或二次潜在类别增长轨迹;
  • 设置各波次自由或跨波次相等的残差方差;
  • 使用完整案例或全信息最大似然处理缺失重复测量;
  • 从 2 类开始拟合至指定上限,并按最低 BIC 给出推荐模型;
  • 输出 AIC、BIC、样本量校正 BIC、Entropy、平均后验概率和类别比例;
  • 输出推荐模型的截距、线性变化、二次变化和残差参数;
  • 保存每名对象的推荐类别和各类别后验概率;
  • 对连续或分类远端变量进行后验概率加权的三步比较;
  • 绘制波次分布、类别大小、类别轨迹和 BIC 比较图;
  • 下载 Word 报告、类别归属 CSV 和候选模型比较 CSV。

10.75.2 统计模型

设第 \(i\) 名对象在时间 \(t\) 的重复测量为 \(Y_{it}\)。线性增长轨迹可写为:

\[ Y_{it}=\eta_{0c}+\eta_{1c}t+\varepsilon_{it}, \]

其中 \(c\) 表示潜在类别,\(\eta_{0c}\) 为该类平均截距,\(\eta_{1c}\) 为平均线性变化速度。二次模型增加 \(\eta_{2c}t^2\)

\[ Y_{it}=\eta_{0c}+\eta_{1c}t+\eta_{2c}t^2+\varepsilon_{it}. \]

本模块采用类别内增长因子方差固定为 0 的潜在类别增长模型,因此同一类别内的对象共享类别平均轨迹,个体差异主要由测量残差表示。若研究目标需要估计类别内随机截距或随机斜率,应使用更一般的增长混合模型。

10.75.2.1 类别数与模型比较

  • AIC:在拟合与复杂度之间权衡,数值越小越优;
  • BIC:对复杂模型施加更强惩罚,常用于潜在类别数筛选,数值越小越优;
  • 样本量校正 BIC:对样本量作修正,可作为辅助依据;
  • Entropy:概括分类清晰度,越接近 1 越清晰,但不是显著性检验;
  • 平均后验概率:表示归入某类别的对象对该类别的平均支持程度;
  • 最小类别比例:用于识别可能由少量异常对象形成的不稳定小类别。

类别数选择边界:最低 BIC 不等于唯一正确答案。若新增类别只复制已有轨迹、最小类别过小、平均后验概率较低、参数不稳定或缺乏实质解释,应优先选择更简约且可重复的模型。

10.75.3 数据准备

10.75.3.1 宽格式重复测量

每行代表一名研究对象,每个时间点占一列,例如 Score_T0Score_T1Score_T2Score_T3。重复测量变量必须按时间先后顺序选择,不能按字段名称自动假定顺序。

至少需要 3 个波次;二次增长模型至少需要 4 个波次。各波次必须具有足够有效观测和变异。若使用有序等级模式,每个波次应使用一致含义的整数等级,且每列包含 2 至 10 个有效等级。

10.75.3.2 时间得分

等间隔随访可使用 0、1、2、3。若实际访视时间为基线、3 个月、12 个月和 24 个月,可使用 0、3、12、24。时间得分必须与波次数量一致、严格递增且不能重复。

时间单位会影响斜率数值。例如以“月”为单位的斜率与以“年”为单位的斜率量纲不同,但同一数据和同一模型下的轨迹形状等价。报告时必须写明时间单位和编码。

10.75.3.3 远端变量

远端变量用于在模型确定后比较不同潜在类别的外部结局。连续变量输出后验概率加权均值、标准差和类别比较;分类变量输出类别内加权比例及总体和两两比较。

远端变量应与用于形成轨迹类别的重复测量变量区分开。若变量本身参与类别形成,不应再把它作为独立的远端验证证据。

10.75.4 模型设置

10.75.4.1 线性与二次增长

  • 线性增长:适合变化速度近似恒定的轨迹,参数较少、通常更稳定;
  • 二次增长:允许加速、减速或转折,但需要更多波次和样本信息。

应优先依据研究时间结构和预期变化形状选择,而不是只根据哪个设置得到更多类别或更小 P 值。

10.75.4.2 残差方差结构

  • 各波次自由估计:允许不同时间点的测量误差或未解释变异不同;
  • 跨波次相等:假设各波次残差方差相同,模型更简约。

若自由残差模型出现极端估计或不稳定,而相等残差具有合理依据,可将后者作为主模型或敏感性分析。两种设置得到的类别结构差异较大时,应明确报告。

10.75.4.3 连续与有序测量

连续测量直接建模各波次的数值。Likert 等有序等级数据可选择有序模式,通过阈值表示等级概率。等级较少、分布严重偏斜或某些等级极稀少时,模型可能不稳定,应检查每个波次的频数分布。

10.75.4.4 缺失处理

  • 完整案例:只纳入全部所选波次均有观测的对象,结果直观但可能损失信息;
  • 全信息最大似然:使用对象已有的波次信息估计模型,依赖缺失可由模型中已观测信息解释的工作假设。

两种方法均不能自动解决非随机缺失。正式研究应说明缺失比例和原因,并比较完整案例、全信息最大似然及合理敏感性分析。

一键自动生成以下表格和图形:

  • 分析设置、波次、时间得分、样本量和推荐类别数概览;
  • 各波次描述统计;
  • 候选类别模型比较和失败原因记录;
  • 推荐模型拟合指标和参数估计;
  • 类别人数、比例和个体后验归类;
  • 可选远端变量总体、类别和两两比较;
  • 各波次测量值分布图;
  • 潜在类别大小图;
  • 潜在类别估计轨迹图及可选原始个体轨迹;
  • 候选模型 BIC 比较图;
  • Word 报告、类别归属 CSV 和模型比较 CSV。

10.75.5 使用步骤

10.75.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “潜变量模型与结构方程” → “潜在类别增长模型”

10.75.5.2 2. 选择重复测量变量

按时间顺序选择至少 3 个波次。若计划二次增长,至少选择 4 个波次。需要外部比较时,再选择一个连续或分类远端变量。

10.75.5.3 3. 设置时间与模型

选择等间隔或自定义时间得分,设置线性/二次增长、残差结构、连续/有序测量、缺失处理和候选最大类别数。建议先以较简约模型检查数据和收敛,再将合理替代设置作为敏感性分析。

10.75.5.4 4. 开始分析

所有主要表格和图形默认勾选。点击 “开始潜在类别增长模型”,每个候选类别模型会独立运行;某个候选模型失败时会记录原因并继续其他类别,错误不会使整个应用退出。

潜在类别增长模型:完整设置与分析概览
潜在类别增长模型:完整设置与分析概览

10.75.6 分析概览

概览表用于核对波次顺序、时间得分、增长形式、残差结构、测量类型、缺失处理、原始记录数、实际建模记录数、候选范围和推荐类别数。各波次描述统计用于识别分布漂移、缺失集中、量纲变化和异常范围。

完整案例模式下,描述统计基于实际进入模型的完整记录,因此表中各波次缺失数通常为 0;原始缺失情况应在数据诊断模块中另行报告。

10.75.7 类别模型比较

候选比较表每行对应一个类别数。先检查状态和参数是否成功,再比较 BIC、AIC、样本量校正 BIC、Entropy、平均后验概率和类别比例。模块在成功模型中选择最低 BIC 作为“推荐模型”,但该标记只是统一起点,不替代研究者判断。

潜在类别增长模型:候选类别模型比较
潜在类别增长模型:候选类别模型比较

建议按以下顺序判断:

  1. 排除未收敛、参数异常或不可解释的模型;
  2. 比较 BIC 和样本量校正 BIC 的改善幅度;
  3. 检查 Entropy 和平均后验概率;
  4. 检查最小类别人数与比例;
  5. 查看新增类别是否形成实质不同且可解释的轨迹;
  6. 在不同初值、残差结构、时间得分和样本子集中检查稳定性。

10.75.9 类别归属

类别大小表报告最大后验概率归类的人数和比例。个体归属表显示推荐类别以及属于每个类别的后验概率。若两类概率接近,说明该对象的归属不确定,不应把推荐类别视为无误差标签。

潜在类别增长模型:类别大小和个体后验归属
潜在类别增长模型:类别大小和个体后验归属

将推荐类别导出后用于后续普通回归,会忽略分类误差并低估不确定性。远端变量比较优先使用模块的后验概率加权三步结果;更复杂的协变量预测或因果问题需要使用能传播分类误差的专门方法。

10.75.10 远端变量三步比较

连续远端变量使用后验概率加权的类别均值和近似总体检验,并报告两两比较、BH 和 Bonferroni 校正 P 值及 Cohen’s d。分类远端变量使用加权列联结构,报告总体卡方、Cramer’s V、类别内比例和两两比较。

三步分析减少了把不确定类别当作完全已知分组的问题,但仍属于模型依赖分析。远端变量缺失、类别过小或后验概率模糊时,结果应谨慎解释。比较只表示类别间分布差异,不能证明轨迹类别导致远端结局。

10.75.11 统计图

10.75.11.1 各波次测量值分布图

用于观察总体分布随时间的移动、离散程度和多峰结构。多峰可能与潜在类别有关,也可能来自量表边界、批次或混合人群,不能单独证明存在类别。

10.75.11.2 类别大小图

直接显示推荐模型各类比例。极小类别可能代表真实少数轨迹,也可能由异常值、过度提取或局部最优形成,需要结合稳定性分析。

10.75.11.3 潜在类别估计轨迹图

粗线表示各类估计平均轨迹;选择叠加后,淡线显示每名对象的原始轨迹。原始轨迹离散很大时,平均轨迹可能掩盖类别内异质性。

10.75.11.4 BIC 比较图

显示候选类别数增加时 BIC 的变化。若 BIC 在当前上限仍持续明显下降,应在样本量和可解释性允许时扩大候选范围;若改善很小,则简约模型通常更合适。

潜在类别增长模型:分布、类别大小、轨迹和 BIC 图
潜在类别增长模型:分布、类别大小、轨迹和 BIC 图

统计图使用模块固定的稳定尺寸,不需要在左侧设置图像宽高。每幅图下方可生成中文或英文描述,并下载 PNG、TIFF、SVG 或 PDF。

10.75.12 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。自动文字必须人工核对波次顺序、时间单位、类别编号、参数方向、分类质量和远端变量定义,不能把类别标签改写成未经验证的临床亚型。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和 4 类图形。类别归属 CSV 保存全部进入推荐模型的对象、推荐类别和各类别后验概率;候选模型比较 CSV 保存每个类别数的拟合和分类指标。

潜在类别增长模型:Word、类别归属和模型比较下载页
潜在类别增长模型:Word、类别归属和模型比较下载页

建议:正式分析前预先确定波次、时间得分、增长形式、残差结构、候选类别范围和最小可接受类别规模。保留全部候选模型、失败信息、敏感性分析、Word、CSV 和图形,避免只展示最符合预期的类别方案。

10.75.13 论文报告建议

方法部分建议说明研究设计、波次和时间单位、重复测量定义、样本量、缺失比例和处理、线性或二次增长、残差结构、候选类别范围、类别选择标准、远端变量方法及敏感性分析。结果部分先报告候选比较和分类质量,再描述各类别规模与轨迹参数,最后报告远端变量比较。

可参考如下写法:

采用潜在类别增长模型识别基线至 12 个月症状评分的异质变化轨迹,时间得分设为 0、1、3 和 12。候选模型包含 2 至 5 类,采用线性增长和各波次自由残差方差,并以全信息最大似然处理重复测量缺失。综合 BIC、Entropy、平均后验概率、类别规模和轨迹可解释性,选择 3 类模型。三类分别占 42.1%、35.4% 和 22.5%,表现为“低水平稳定”“中等水平改善”和“高水平持续”轨迹;Entropy 为 0.86,各类平均后验概率均高于 0.88。远端变量比较显示三类在 12 个月功能评分上存在分布差异,但该结果不作因果解释。

示例名称和数值只用于展示写法,实际报告必须替换为本研究输出。类别命名应在查看完整轨迹后进行,并使用中性、描述性词语,避免将统计类别直接命名为疾病亚型或治疗反应机制。

10.75.14 常见问题

1. 最低 BIC 对应的模型一定是最终模型吗?

不一定。还要检查收敛、类别规模、Entropy、平均后验概率、轨迹区分度、实质意义和敏感性分析。

2. Entropy 大于 0.80 就说明分类正确吗?

不能。0.80 是常见经验参考,不是正确率保证;Entropy 也可能在过度提取类别时较高。

3. 为什么类别编号每次可能改变?

类别编号没有固有顺序。相同轨迹在不同运行中可能交换编号,应依据轨迹形状和参数匹配,而不是只比较“类别 1”。

4. 3 个波次能拟合二次增长吗?

本模块要求至少 4 个波次。3 个点虽然能定义一条二次曲线,但模型通常缺乏足够信息稳定估计残差和潜在类别。

5. 时间间隔不相等怎么办?

选择自定义时间得分,输入实际随访间隔。把不等间隔访视错误设为等间隔会改变斜率和曲率含义。

6. 可以混合不同量表版本或量纲吗?

不建议直接混合。各波次应测量相同构念并具有可比量纲;量表改变时需先完成链接、等值或明确转换。

7. 最小类别比例低于 5% 是否必须删除?

不是机械规则。应检查类别人数、参数稳定、异常对象、复现性和临床合理性;极小类别通常需要更强证据。

8. 为什么完整案例和全信息最大似然得到不同类别?

两者使用的信息和缺失假设不同。差异较大提示缺失模式可能影响类别结构,应报告两种结果并进一步分析缺失机制。

9. 后验概率可以当作分类准确率吗?

不能直接等同。它是在当前模型正确的前提下表示相对类别支持,不包含模型错设和类别数选择的不确定性。

10. 能否把导出的类别用于普通回归?

可以作为探索性变量,但普通回归会把类别当作无误差标签。正式推断应优先使用传播分类误差的方法,并进行敏感性分析。

11. 远端变量三步结果能证明类别导致结局吗?

不能。它比较不同潜在类别的远端变量分布,仍可能受混杂、时间顺序、测量误差和模型错设影响。

12. 二次模型优于线性模型时如何解释?

先检查二次参数和轨迹图是否表现出稳定、合理的弯曲,再比较信息准则和残差。少量极端对象也可能制造表面曲率。

13. BIC 在 5 类仍持续下降怎么办?

若样本量充足且没有小类别或不稳定参数,可扩大候选上限;否则应优先考虑模型过度复杂、局部最优或当前测量不能支持更多类别。

14. 类别轨迹能直接用于制定治疗方案吗?

不能。轨迹类别首先是描述性模型结果,必须经过独立样本复现、外部验证和临床效用评估后,才可能进入决策研究。

10.75.15 小结

本模块的最佳使用方式是:先依据研究设计确定波次顺序和时间得分,以简约增长结构拟合候选类别,依次检查收敛、信息准则、Entropy、后验概率和类别规模,再结合轨迹形状与敏感性分析确定类别数,最后谨慎进行远端变量比较和论文报告。

潜在类别增长模型能够揭示总体均值背后的轨迹异质性,但类别发现只是起点。可重复、可解释并经外部验证的轨迹结构,才具有更可靠的研究价值。

10.76 诊断试验样本量估算

诊断试验样本量估算用于研究开始前回答三个问题:为了把灵敏度或特异度估计到指定精度,需要多少对象;为了检验诊断准确性是否优于预设水平,需要多少对象;为了比较两个诊断试验,需要多少对象。模块直接根据设计参数计算,不需要上传数据。

适用场景:前瞻性或回顾性诊断准确性研究的方案设计、伦理申请、注册方案和统计分析计划。正式计算前应明确目标人群、金标准、目标事件、主要准确性指标、显著性水平、检验效能、允许误差、事件率,以及两个试验是配对还是非配对。

10.76.1 模块概览

模块提供三种研究设计:

设计 主要问题 关键输入 主要结果
新诊断试验精度 灵敏度或特异度的置信区间要多窄 一类错误率、预期准确性、事件率、允许误差 按灵敏度和特异度分别估算,总样本量取较大值
单项对零假设 准确性是否优于预设的无效水平 检验效能、一类错误率、预期与零假设灵敏度、预期与零假设特异度、事件率 事件数、非事件数、事件率调整总样本量及连续性校正
两个试验比较 两个诊断试验的准确性是否不同 检验效能、一类错误率、两个预期准确性 非配对每组/总样本量、配对样本量及连续性校正

所有主要表格和敏感性图默认勾选。计算错误会显示在当前模块内,不会导致整个应用退出。

10.76.2 统计原理

10.76.2.1 精度设计

若目标比例为 \(p\),允许误差为 \(d\),置信水平对应的标准正态分位数为 \(z_{1-\alpha/2}\),比例精度所需的目标组样本量近似为:

\[ n=\frac{z_{1-\alpha/2}^{2}p(1-p)}{d^2}. \]

灵敏度依赖事件组,特异度依赖非事件组。设事件率为 \(\pi\),总样本量需分别按 \(n_{Se}/\pi\)\(n_{Sp}/(1-\pi)\) 调整,并取较大者。事件率接近 0 或 1 时,其中一个目标组稀少,总样本量会迅速增加。

10.76.2.2 单项准确性对零假设

该设计比较预期准确性 \(p_1\) 与零假设准确性 \(p_0\)。效应大小由 \(|p_1-p_0|\) 决定;差异越小、检验效能越高、一类错误率越低,所需样本量越大。模块分别计算灵敏度和特异度要求,再按事件率换算为总样本量。

结果表同时给出基础估算和连续性校正。研究方案应优先使用更保守的连续性校正结果,并在此基础上增加失访、无法判定结果和无效标本的预留比例。

10.76.2.3 两个诊断试验比较

非配对设计中,两组对象分别接受不同检验,因此结果表给出每组和两组合计样本量。配对设计中,同一对象接受两个检验,样本量依赖两项检验结果的不一致率。

模块由两个预期准确性自动计算可行的不一致率范围:

\[ D_{min}=|p_1-p_2|, \]

\[ D_{max}=p_1(1-p_2)+p_2(1-p_1). \]

结果表报告最小和最大不一致率下的配对样本量及其平均值。实际研究若有先验资料,应在方案中说明预期不一致结构;仅凭边际准确性不能完全确定配对样本量。

重要边界:100% 检验效能在理论上需要无限样本量,结果显示为“∞”。这不是程序错误。实际研究应选择 80%、90%、95% 或 99% 等有限目标,并结合可行性确定最终设计。

10.76.3 参数准备

本模块不读取上传数据,但输入参数必须来自合理依据:既往研究、预实验、系统综述、相近产品、注册要求或具有临床意义的最低差异。推荐在计算前形成如下参数表:

参数 建议依据 常见错误
预期灵敏度、特异度或准确性 独立先验资料或保守预期 直接使用小样本中最理想的点估计
零假设准确性 最低可接受性能、现有标准或临床无效界值 为降低样本量而随意拉大差异
事件率 目标入组人群中的真实事件比例 使用普通人群流行率代替富集入组人群比例
允许误差 方案预先规定的置信区间半宽 把允许误差误写成相对误差
检验效能与一类错误率 方案和监管要求 把 100% 效能当作理想默认值
配对或非配对设计 实际检测流程 同一对象接受两项检验却使用非配对结果

一键自动生成以下结果:

  • 研究设计与全部输入参数表;
  • 基础样本量、连续性校正和建议样本量表;
  • 允许误差、事件率或预期差异变化下的敏感性图;
  • Word 报告和样本量结果 CSV;
  • 表格与图形的中文或英文辅助描述。

10.76.4 使用步骤

10.76.4.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “诊断试验样本量估算”

10.76.4.2 2. 选择研究设计

根据主要研究问题选择“新诊断试验精度”“单项对零假设”或“两个试验比较”。切换设计后,左侧参数面板会显示对应控件。

10.76.4.3 3. 输入设计参数

百分比均直接输入页面显示值,例如 85 表示 85%。单项对零假设时,灵敏度和特异度分别输入预期值与零假设值;两个试验比较时,只需输入两项预期准确性,不一致率范围会自动显示。

10.76.4.4 4. 核对输出选项

研究参数表、样本量表和敏感性图默认全部勾选。左侧不提供图像宽高设置;每幅图使用稳定尺寸渲染,并可在图形下方单独下载。

10.76.4.5 5. 开始估算

点击 “开始诊断试验样本量估算”。先在“设计参数”页签核对输入,再阅读“样本量结果”和“敏感性分析”。参数越严格时,应检查结果是否仍具可行性。

10.76.5 结果解读

10.76.5.1 新诊断试验精度

示例设一类错误率 5%、预期准确性 85%、事件率 30%、允许误差 5 个百分点。按灵敏度精度需要 653 例,按特异度精度需要 280 例,建议总样本量取 653 例。敏感性图显示允许误差缩小时,样本量呈非线性增加。

诊断试验样本量估算:允许误差与建议总样本量
诊断试验样本量估算:允许误差与建议总样本量

红色虚线表示当前设置。图中纵轴为对数刻度,因此相同垂直距离代表成倍变化,不应按普通线性距离解释。

10.76.5.2 单项准确性对零假设

示例设检验效能 90%、一类错误率 5%、预期与零假设灵敏度分别为 90% 和 80%、预期与零假设特异度分别为 85% 和 75%、事件率 30%。基础建议总样本量为 455 例,连续性校正后为 520 例。

诊断试验样本量估算:事件率与连续性校正后样本量
诊断试验样本量估算:事件率与连续性校正后样本量

灵敏度要求随事件率降低而快速增加,特异度要求随事件率升高而增加。最终样本量应满足两条约束中较大者,而不是取两者平均。

10.76.5.3 两个诊断试验比较

示例设检验效能 80%、一类错误率 5%,两个预期准确性分别为 90% 和 80%。非配对设计的基础总样本量为 313 例、连续性校正后为 352 例;配对设计平均基础样本量为 109 例、校正后为 128 例。

诊断试验样本量估算:预期准确性差异与样本量
诊断试验样本量估算:预期准确性差异与样本量

预期差异越小,样本量越大。配对设计可能更高效,但只有在同一对象确实接受两项检验且配对结果可获得时,才能采用配对样本量。

10.76.6 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。自动描述只解释当前输入和结果,不能替代参数来源、临床可接受界值和研究可行性的人工论证。

进入 “下载 Word 报告” 页签,可下载当前勾选的参数表、样本量表和敏感性图。CSV 保存逐项样本量结果,便于纳入方案附件或继续计算失访预留。

若预计失访或无效比例为 \(r\),可在模块建议样本量 \(N\) 基础上计算:

\[ N_{final}=\left\lceil\frac{N}{1-r}\right\rceil. \]

例如建议 520 例、预计 10% 无效,则最终计划量为 \(\lceil 520/0.90\rceil=578\) 例。分层抽样、整群设计、重复中心效应或多重主要假设还可能需要额外调整。

10.76.7 论文和方案报告建议

方法部分建议说明目标人群、金标准、主要诊断指标、研究设计、预期值来源、零假设或最低可接受值、事件率、一类错误率、检验效能、允许误差、配对关系、连续性校正和失访预留。

可参考如下写法:

本研究以灵敏度和特异度的精度为样本量依据。根据既往研究,预期诊断准确性为 85%,目标入组人群事件率为 30%。采用双侧一类错误率 5%,将 95% 置信区间允许误差设为 5 个百分点。按灵敏度精度估算需 653 例,按特异度精度估算需 280 例,取较大值 653 例;考虑 10% 无效或失访,计划至少纳入 726 例。

示例数值仅用于展示写法。实际报告必须替换为本研究参数,并给出每个关键输入的文献、预实验或临床依据。

10.76.8 常见问题

1. 为什么不需要上传数据?

这是研究设计阶段工具,计算基于预期参数。已有原始数据可用于获得先验估计,但不应在同一小样本中反复选择最有利参数。

2. 灵敏度和特异度需要分别估算吗?

需要。二者依赖事件组和非事件组,事件率不同会使总样本量要求明显不同,最终应取较大者。

3. 事件率应该填患病率吗?

应填实际计划入组人群中目标事件的预期比例。病例-对照富集、专科门诊和筛查人群的事件率可能完全不同。

4. 为什么连续性校正后的样本量更大?

二分类计数是离散的,连续近似可能偏乐观。连续性校正提高保守性,研究方案通常优先采用校正后的结果。

5. 100% 检验效能为什么显示“∞”?

有限样本无法保证绝对不发生第二类错误。请选择有限效能目标,并说明其依据。

6. 配对设计一定比非配对设计省样本吗?

不一定。效率取决于两项检验在同一对象中的相关性和不一致结构;流程成本、顺序效应和无法判定结果也应考虑。

7. 两个试验比较为什么自动显示最小和最大不一致率?

边际准确性只能限定不一致率范围,不能唯一决定配对结构。模块用可行范围展示样本量不确定性,正式方案最好使用更具体的先验配对资料。

8. 模块结果已经包含失访吗?

不包含。结果是统计模型所需有效样本量,还需按预计失访、无效标本和无法判定比例上调。

9. 可以只根据一幅敏感性图选择最小样本量吗?

不可以。敏感性图用于展示假设变化的影响,最终参数应由临床问题、先验依据和方案预设决定,不能倒推最容易完成的组合。

10. 样本量很大是否说明公式有问题?

通常意味着允许误差很小、预期差异很小、效能很高、事件率极端或目标性能接近 0%/100%。应逐项检查依据,而不是直接缩小样本量。

10.76.9 小结

本模块的最佳使用方式是:先把临床问题转换为精度估计、单项检验或双试验比较,使用可追溯的先验资料输入性能和事件率,采用保守的连续性校正结果,借助敏感性图评估参数不确定性,最后再增加失访、无效样本和设计效应。

样本量是研究假设、精度、错误概率和可行性的共同结果。透明报告参数依据与敏感性分析,比只给出一个最终数字更重要。

10.77 线性判别分析

线性判别分析用于根据多个数值型判别变量区分两个或多个已知类别,并为每个对象计算判别得分、后验类别概率和预测类别。它既能描述哪些变量推动类别分离,也能在明确的训练/测试划分下评价当前数据中的分类表现。

适用场景:结局是两个或多个互斥类别,预测信息主要为连续测量,并希望得到可解释的线性判别函数。例如根据多项实验室指标区分疾病亚型、根据量表维度识别风险层级,或比较不同表型在多变量空间中的分离程度。

10.77.1 模块概览

模块自动生成以下结果:

  • 原始样本量、完整案例、训练集、测试集、类别和判别变量概览;
  • 类别先验概率与训练集各类别判别变量均值;
  • 原始线性判别系数、标准化判别载荷和判别函数解释比例;
  • 类别判别中心、典型相关系数、结构系数和 Wilks Lambda 检验;
  • 训练集与测试集混淆矩阵、逐类别正确率和总体正确率;
  • 二维或一维判别得分图,以及 LD1 分组直方图和密度曲线;
  • 每个完整案例的实际类别、预测类别、判别得分与后验概率 CSV;
  • 当前勾选表格和图形的 Word 报告。

所有主要表格与图形默认勾选。变量校验、模型拟合、绘图和下载错误会显示在当前模块内,不会使整个应用退出。

10.77.2 统计原理

10.77.2.1 线性判别函数

设对象的判别变量向量为 \(\mathbf{x}\),第 \(k\) 个类别的均值向量为 \(\boldsymbol{\mu}_k\),各类别共享组内协方差矩阵 \(\boldsymbol{\Sigma}\),先验概率为 \(\pi_k\)。类别 \(k\) 的判别得分可写为:

\[ \delta_k(\mathbf{x})=\mathbf{x}^{T}\boldsymbol{\Sigma}^{-1}\boldsymbol{\mu}_k- \frac{1}{2}\boldsymbol{\mu}_k^{T}\boldsymbol{\Sigma}^{-1}\boldsymbol{\mu}_k+ \log(\pi_k). \]

对象通常归入判别得分最大的类别。模块使用训练集类别比例估计先验概率,并在共享组内协方差假设下建立线性边界。

10.77.2.2 判别函数数量

可估计的判别函数数量不超过“类别数减 1”和“判别变量数”中的较小者。二分类只有 LD1,因此模块绘制一维判别得分图;三个及以上类别且至少存在两个函数时,绘制 LD1 与 LD2 的二维分布图。没有 LD2 时不应强行解释二维空间。

10.77.2.3 解释比例与典型相关

各判别函数的解释比例表示该函数在全部类别分离信息中的相对贡献。典型相关系数越接近 1,表示该函数与类别区分关系越强,但不能单独证明模型具有良好的外部预测性能。

10.77.2.4 Wilks Lambda

Wilks Lambda 衡量在尚未解释的多变量变异中,有多少仍留在类别内部。数值越小通常表示类别分离越明显。模块从第一个函数开始进行顺序检验:若“1 至 3”显著,表示全部函数联合提供区分信息;随后“2 至 3”和“3”用于判断剩余函数是否仍有额外贡献。

重要假设:各类别中的判别变量应近似多元正态,并具有相近的组内协方差结构;观察单位应相互独立;判别变量之间不应存在严重线性依赖;各类别需有足够样本。明显离群值、小类别、强共线性和协方差差异都可能使结果不稳定。

10.77.3 数据准备

数据采用长表结构,每行代表一个独立观察对象。分类结局设置为因子或文本字段,判别变量设置为数值型。

受试者编号 四分类结局 指标A 指标B 指标C 指标D
LDA001 A型 -1.83 -1.40 0.12 1.25
LDA002 A型 -2.10 -1.71 0.44 1.62
LDA061 B型 -0.31 1.34 -1.48 -0.96
LDA121 C型 1.02 -0.18 1.65 -0.88
LDA181 D型 2.27 2.03 0.24 1.17
  • 分类结局至少需要两个有效水平,当前最多支持 12 个类别;
  • 至少选择两个数值型判别变量;
  • 每个类别至少需要 5 个完整案例,训练集中每个类别至少保留 2 个对象;
  • 缺失值和非有限数值按所选变量进行完整案例排除;
  • 在任一类别内为常数的变量不能用于分析;
  • 标识编号、自由文本和类别过多的字段不应作为分类结局;
  • 若变量量纲差异很大,应结合标准化载荷解释,而不要只比较原始系数。

10.77.4 训练集与测试集

训练集比例可在 0.1 至 1.0 之间调整,随机种子固定为 1234。比例小于 1.0 时,模块按实际类别分层抽样,使各类别尽量同时出现在训练集和测试集中;比例为 1.0 时,全部完整案例用于拟合,不生成测试集混淆矩阵。

训练集用于估计类别均值、共享协方差和判别函数;测试集只用于应用已经拟合的函数并计算当前划分下的分类正确率。固定随机种子使同一数据和设置能够复现相同划分。

解释边界:一次随机测试集只能提供内部保留样本表现。变量筛选、参数调整和类别定义若参考了全部数据,测试结果仍可能偏乐观。确证性预测研究应另设独立验证队列,或采用预先规定的重复交叉验证和外部验证方案。

10.77.5 使用步骤

10.77.5.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “聚类分析与多元统计” → “线性判别分析”

10.77.5.2 2. 选择分类结局和判别变量

分类结局选择研究中已经定义的类别;数值型判别变量至少选择两个。左侧面板会自动选入前四个可用数值变量,也可使用“全选”和“清空”快速调整。

线性判别分析:完整高分辨率设置面板
线性判别分析:完整高分辨率设置面板

10.77.5.3 3. 设置训练比例

探索性分析可从 70% 训练、30% 测试开始。样本较少时,降低训练比例可能导致某些类别训练样本不足;将比例设为 100% 可用于描述全部样本的判别结构,但此时没有独立测试结果。

10.77.5.4 4. 核对输出选项

主要表格与两幅图默认全部勾选。左侧不提供图像宽高设置;每幅图以稳定尺寸渲染,并在图形下方提供 PNG、TIFF、SVG 和 PDF 下载。

10.77.5.5 5. 开始分析

点击 “开始线性判别分析”。先在“模型概览”核对完整案例、类别、判别变量和训练测试划分,再依次查看“判别函数”“分类表现”和“判别图形”。

线性判别分析:分析设置与模型概览
线性判别分析:分析设置与模型概览

10.77.6 结果解读

10.77.6.1 分析概览、先验概率和组均值

示例数据原始样本量为 240,因所选变量缺失排除 2 例,完整案例为 238;其中训练集 168 例、测试集 70 例。四类训练样本均为 42,因此先验概率均为 0.25。正式分析首先应确认这些数字与研究流程一致。

组均值表用于初步识别哪些变量在类别间具有较大位置差异。它是描述性结果,不能代替联合判别函数,也不能仅凭均值差判断某变量的独立贡献。

10.77.6.2 原始系数和标准化载荷

原始线性判别系数用于计算判别得分,受变量单位影响;标准化判别载荷便于比较同一函数内变量的相对权重。系数正负表示函数方向,但判别函数整体乘以 -1 后分类信息不变,因此解释应集中在相对大小、变量组合和类别中心,而不是把正负号当作固定临床方向。

线性判别分析:判别系数、标准化载荷和函数结果
线性判别分析:判别系数、标准化载荷和函数结果

10.77.6.3 结构系数

结构系数是原始判别变量与判别得分之间的相关。绝对值较大的变量与该函数关系更强。存在变量相关时,结构系数与标准化系数可能排序不同,应联合解释,避免把单一表格当作变量重要性的唯一结论。

10.77.6.4 类别判别中心

类别判别中心是训练集中每个类别的平均判别得分。两个类别在某函数上的中心距离越大,该函数越能区分这两个类别。中心重叠则提示该函数在相应类别间的区分有限。

10.77.6.5 混淆矩阵

混淆矩阵行表示实际类别,列表示预测类别。对角线是正确分类,非对角线显示具体混淆方向。逐类别正确率可发现总体准确率掩盖的小类别问题。

线性判别分析:训练集与测试集混淆矩阵
线性判别分析:训练集与测试集混淆矩阵

示例训练集正确率为 95.2%,测试集正确率为 97.1%。这两个数值只说明当前固定划分中的表现,不能直接写成“模型准确率为 97.1%”而忽略样本来源、随机划分和外部验证。

10.77.7 图形解释

10.77.7.1 判别得分分布图

三类及以上时,横轴和纵轴通常为 LD1 与 LD2。散点代表训练对象,三角形代表类别中心,椭圆概括各类别的主要得分范围。类别中心分开且椭圆重叠较少,提示在前两个函数上分离较好;大量重叠提示相应类别仍难区分。

线性判别分析:二维判别得分、类别中心和椭圆
线性判别分析:二维判别得分、类别中心和椭圆

二分类只有 LD1,模块改用一维得分加轻微纵向抖动显示对象与类别中心。纵向位置仅用于分开展示类别,不是第二个判别维度。

10.77.7.2 LD1 直方图与密度

直方图和密度曲线显示各类别在第一判别函数上的重叠。峰值分离越明显,LD1 的区分作用越强;曲线尾部重叠常对应混淆矩阵中的误分类。密度形状还可帮助识别偏态、多峰和异常得分。

线性判别分析:LD1 分组直方图与密度
线性判别分析:LD1 分组直方图与密度

10.77.8 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述并下载多种格式。自动描述必须人工核对类别顺序、判别函数方向、训练测试划分和数值。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格与图形。判别得分 CSV 包含原始行号、实际类别、预测类别、LD 得分和各类别后验概率,便于追查误分类对象或开展预先规定的后续分析。

线性判别分析:Word 报告与判别得分 CSV 下载
线性判别分析:Word 报告与判别得分 CSV 下载

建议:正式分析时同时保存原始数据版本、变量编码、完整案例规则、训练比例、随机种子、类别先验、Word 报告和判别得分 CSV。任何变量筛选或异常值处理都应在方法中透明说明。

10.77.9 论文报告建议

方法部分建议说明分类结局及各水平、候选判别变量、缺失处理、线性判别模型、先验概率来源、训练测试划分、随机种子、协方差假设检查和验证策略。结果部分依次报告完整案例和各类别样本量、主要判别函数、结构系数或标准化载荷、Wilks Lambda、类别中心、训练与测试混淆矩阵和正确率。

可参考如下写法:

采用线性判别分析联合评价 4 项连续指标对四种表型的区分能力。按所选变量进行完整案例分析,共纳入 238 例;使用固定随机种子按类别分层分为训练集 168 例和测试集 70 例。第一判别函数解释主要类别分离信息,指标A和指标B的结构系数绝对值较大。训练集与测试集总体正确率分别为 95.2% 和 97.1%。测试结果属于当前内部保留样本表现,仍需在独立人群中验证。

示例数值仅用于展示写法,实际报告必须使用本研究输出。不要把判别系数解释为因果效应,也不要把一次随机测试结果写成已经完成外部验证。

10.77.10 常见问题

1. 二分类为什么没有 LD2?

二分类最多只有一个判别函数。模块显示一维 LD1 得分图,这是正确的维度,不是结果缺失。

2. 训练比例应该选多少?

70% 是便于开始检查的常用设置,不是统一标准。应根据总样本量、最小类别、变量数和验证目标预先规定;小样本更适合结合重复重采样评价稳定性。

3. 100% 训练是否更准确?

它能使用全部数据估计函数,但只能得到表观训练表现,不能评价未见数据。描述判别结构时可使用,预测评价时不应替代测试集或外部验证。

4. 为什么某个编号字段不能选为分类结局?

标识字段通常每行一个水平,不是可学习的类别。模块预先过滤超过 12 个有效水平的分类字段,避免把编号误当作结局。

5. 原始系数和结构系数应优先看哪个?

原始系数用于构造函数;标准化载荷和结构系数更适合比较变量贡献。变量相关时三者可能不同,应联合类别中心和研究含义解释。

6. Wilks Lambda 显著是否说明分类一定准确?

不说明。它表示判别函数提供统计区分信息;分类性能还取决于类别重叠、样本构成、阈值和验证设计。

7. 测试集正确率比训练集高正常吗?

可能发生,尤其在一次随机划分和有限样本中。应查看类别构成、混淆方向和重复划分稳定性,不能因此断言模型没有过拟合。

8. 类别样本量很不平衡怎么办?

先确认先验概率是否应反映目标人群比例,再报告逐类别正确率而不是只看总体准确率。极小类别可能导致协方差和均值估计不稳定,应考虑增加样本或采用更适合不平衡数据的方法。

9. 判别变量高度相关会怎样?

共享协方差矩阵可能接近奇异,系数会不稳定。应检查相关矩阵、条件数或方差膨胀,并根据临床问题预先减少重复信息变量。

10. 能否直接将后验概率用于临床决策?

不能。后验概率由当前样本、先验和模型假设决定,进入临床决策前还需独立验证、校准、阈值选择和临床效用评估。

10.77.11 小结

本模块的可靠使用流程是:先定义可复现的类别和候选判别变量,核对完整案例、类别样本量与模型假设,使用预先规定的分层训练测试划分,联合解释判别函数、结构系数、类别中心和混淆矩阵,再检查一维或二维得分图,最后保存 Word 与得分 CSV 并安排独立验证。

线性判别分析的价值在于把多项连续信息压缩为可解释的类别分离函数。清晰的设计、稳定的类别定义和诚实的验证边界,比追求单次最高正确率更重要。

10.78 多重因子分析

多重因子分析(Multiple Factor Analysis, MFA)用于联合分析由多个变量组描述的同一批研究对象。例如,每位受试者同时具有临床指标、实验室指标、量表维度、症状分类和事件计数。MFA 在保留各变量组内部结构的同时建立共同因子空间,使不同变量组不会仅因变量数量多或方差大而支配结果。

适用场景:同一批对象具有两个至六个预先定义的信息域,希望回答“哪些变量组共同推动总体差异”“不同信息域是否描述相似结构”“哪些对象在共同因子空间中接近”以及“某一全局维度主要由哪些变量组和变量贡献”等问题。

10.78.1 模块概览

模块自动生成以下结果:

  • 原始样本量、完整案例、排除案例、变量组数量和提取维度概览;
  • 每个变量组的名称、类型、变量数及变量清单;
  • 全局维度的特征根、解释比例和累计解释比例;
  • 变量组、个体和定量变量的坐标、表示质量(cos2)或贡献率;
  • 碎石图、变量组因子图、维度贡献图和定量变量因子图;
  • 未着色与按分类字段着色的个体因子图;
  • 每个完整案例的全局维度坐标 CSV;
  • 当前勾选表格和图形的 Word 报告。

全部主要表格和图形默认勾选。变量组校验、模型拟合、绘图和下载均有错误隔离,错误会显示在当前模块内,不会使整个应用退出。

10.78.2 统计原理

10.78.2.1 为什么需要变量组加权

若把所有变量直接放入一次普通降维,变量较多、量纲较大或内部相关较强的变量组可能主导前几个维度。MFA 先分别分析每个变量组,并用该组第一主轴的强度进行标准化,再联合建立全局空间。设第 \(g\) 个变量组的数据矩阵为 \(X_g\),该组第一特征值为 \(\lambda_{1g}\),其加权矩阵可概括为:

\[ X_g^{*}=\frac{X_g}{\sqrt{\lambda_{1g}}}. \]

随后把各组加权矩阵并列形成全局矩阵:

\[ X^{*}=\left[X_1^{*},X_2^{*},\ldots,X_G^{*}\right]. \]

这种处理使每个变量组在全局分析开始时具有可比较的最大惯量。它不是让所有变量组最终贡献完全相同,而是避免某组仅凭规模和量纲获得不合理优势。

10.78.2.2 四种变量组类型

组类型 适用数据 处理含义 常见例子
标准化定量 连续或数值型变量 各变量中心化并按标准差缩放 不同单位的实验室指标、量表分数
中心化定量 连续或数值型变量 中心化但保留原始尺度差异 单位一致且尺度差异有实质意义的测量
定性 因子或分类变量 按类别水平建立定性信息结构 症状类型、分型、用药类别
频数 非负数值型计数 将变量组作为频数信息处理 事件次数、症状计数、资源使用次数

组类型必须根据变量测量性质预先确定。把连续变量误设为定性会改变距离定义;把不同单位的连续变量都设为中心化定量,可能使大尺度变量获得过高权重。

10.78.2.3 坐标、cos2 和贡献率

坐标表示对象、变量或变量组在某个全局维度上的位置。正负号给出该维度两端的相对方向;整个维度同时乘以 -1 不改变统计结构,因此不应把符号本身解释为固定的好坏方向。

表示质量(cos2)衡量某个对象、变量或变量组被当前维度表示得有多好。可概括为该维度坐标平方占其总平方距离的比例:

\[ \cos^2_{ik}=\frac{f_{ik}^{2}}{\sum_{h} f_{ih}^{2}}. \]

cos2 较高时,可较有把握地在该维度或当前二维图上解释该元素;cos2 较低时,即使坐标看起来较远,也可能主要由未显示维度解释。

贡献率表示某元素对某个维度形成的相对贡献。同一维度中贡献率较大的变量组或变量更能解释该轴的统计含义。贡献率不是回归效应、因果效应或临床重要性,仍需结合测量内容和研究设计判断。

解释边界:MFA 是探索性多变量方法。它描述当前样本中的共同结构与相对位置,不检验因果关系,也不能自动证明变量组之间存在机制联系。维度命名、保留数量和对象分群都需要结合解释比例、贡献、cos2、稳定性和专业知识。

10.78.3 数据准备

数据采用宽表结构,每行代表同一个独立研究对象,每列为该对象的一个测量。用于着色的分类字段和对象编号不应重复进入分析变量组。

受试者编号 表型 临床1 临床2 实验室1 实验室2 症状类型 计数1
MFA001 A -1.32 -0.77 0.28 1.02 3
MFA002 A -0.94 -1.14 0.08 0.76 4
MFA051 B 0.21 1.03 -1.22 -0.41 7
MFA101 C 1.18 0.06 1.31 -0.83 9
  • 变量组数量必须为 2 至 6;
  • 全部变量组合计至少需要 3 个分析变量;
  • 同一个变量只能进入一个变量组;
  • 标准化定量、中心化定量和频数组要求数值型变量;
  • 定性组中的数值编码会按分类水平解释,正式分析宜先设置清晰标签;
  • 着色字段需要 2 至 12 个有效水平;
  • 缺失值和非有限值按全部入组变量进行完整案例排除;
  • 常数变量或没有足够变异的变量组无法形成有效维度;
  • 极端离群值可能显著改变对象距离和变量组贡献,应在分析前核查。

10.78.4 使用步骤

10.78.4.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “聚类分析与多元统计” → “多重因子分析”

10.78.4.2 2. 设置对象标签与着色字段

“对象标签字段”用于表格和个体图标识对象,建议选择受试者编号等唯一字段;不使用时按原始行号标识。“个体图着色分类字段”只影响分组个体图,不进入 MFA 计算。

10.78.4.3 3. 建立变量组

选择 2 至 6 个变量组。每组依次填写组名称、选择组类型,并在“组内变量”中放入属于该信息域的变量。组名宜使用“临床指标”“实验室指标”“量表维度”等可解释名称,而不是保留“变量组1”。

多重因子分析:完整高分辨率设置面板
多重因子分析:完整高分辨率设置面板

10.78.4.4 4. 选择结果度量

变量组、个体和定量变量可分别显示坐标、cos2 或贡献率。第一次分析可先使用坐标了解结构,再切换到 cos2 判断表示质量,最后用贡献率解释各维度由哪些元素形成。贡献图标签角度可设为 0、45 或 90 度。

10.78.4.5 5. 核对输出选项并开始分析

主要表格与 9 幅图默认全部勾选。左侧不提供图像宽高设置;每幅图使用稳定尺寸渲染,并可在图形下方下载 PNG、TIFF、SVG 和 PDF。点击 “开始多重因子分析” 后,先核对“分析概览”,再依次查看“变量组结果”“变量与个体”和“统计图”。

多重因子分析:分析概览、变量组配置与解释比例
多重因子分析:分析概览、变量组配置与解释比例

10.78.5 结果解读

10.78.5.1 分析概览与特征根

示例数据原始样本量为 150,因所选变量缺失排除 2 例,完整案例为 148;3 个变量组共包含 6 个定量变量,提取 5 个全局维度。前两个维度分别解释 37.9% 和 25.6% 的加权惯量,累计解释 63.6%。

解释比例用于判断前几个维度保留了多少共同结构,但没有适用于所有研究的固定保留阈值。应结合碎石图转折、各维度贡献、cos2、可解释性和重复分析稳定性确定重点维度。

10.78.5.2 变量组结果

变量组坐标表示各信息域在全局维度上的位置。示例中变量组2在 Dim.1 上的坐标较大,变量组1和变量组3在 Dim.2 上位置相近,提示前两个维度由不同信息域组合形成。切换到贡献率可直接比较某个维度主要由哪些变量组推动;切换到 cos2 则判断变量组是否被该维度充分表示。

多重因子分析:变量组在全局维度上的坐标
多重因子分析:变量组在全局维度上的坐标

10.78.5.3 定量变量结果

定量变量坐标用于解释全局维度方向。位于同一方向且夹角较小的变量通常具有相似变化模式,方向相反表示在该因子空间中呈相反关联,接近原点则说明前两个维度对该变量表示有限。

多重因子分析:定量变量坐标表
多重因子分析:定量变量坐标表

不要只按坐标绝对值为维度命名。应同时查看变量贡献率和 cos2,并确认高贡献变量具有足够表示质量。若某变量主要在 Dim.3 或更后维度上被解释,前两维图可能低估其作用。

10.78.6 图形解释

10.78.6.1 碎石图

碎石图按顺序显示各全局维度的特征根或解释信息。明显转折前的维度通常值得优先解释,但还应考虑累计解释比例和研究问题,不能机械地只保留特征根大于 1 的维度。

多重因子分析:碎石图
多重因子分析:碎石图

10.78.6.2 变量组因子图

变量组因子图比较不同信息域在共同空间中的方向和关系。两个变量组方向相近,表示它们在当前维度组合中描述的对象差异较一致;夹角大或方向相反表示结构不同。距离原点较远不等于临床更重要,应结合贡献与 cos2。

多重因子分析:变量组因子图
多重因子分析:变量组因子图

10.78.6.3 个体因子图

每个点代表一个完整案例。点越接近,表示这些对象在全部变量组加权后的多变量特征越相似。按分类字段着色后,可观察预先定义的表型是否在共同空间中分离;椭圆概括组内主要分布范围,重叠表示相应组在前两个维度上仍有相似区域。

多重因子分析:按表型着色的个体因子图
多重因子分析:按表型着色的个体因子图

图中的可视分离属于探索性描述,不能替代预先规定的组间检验或分类验证。若样本很少、组别不平衡或存在离群点,椭圆和视觉边界可能不稳定。

10.78.7 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述并下载多种格式。自动描述需要人工核对变量组类型、维度符号、当前结果度量和完整案例范围。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。个体坐标 CSV 包含原始行号、对象标签、着色分组和各全局维度坐标,可用于追查离群对象或开展预先规定的后续分析。

多重因子分析:Word 报告与个体坐标 CSV 下载
多重因子分析:Word 报告与个体坐标 CSV 下载

建议:正式分析时同时保存数据版本、变量组定义、组类型、完整案例规则、结果度量、Word 报告和坐标 CSV。变量组定义若在查看结果后反复调整,应明确标记为探索性分析并在独立样本中复核。

10.78.8 论文报告建议

方法部分建议说明研究对象、变量组及其理论依据、每组变量和组类型、预处理与缺失处理、MFA 加权原则、维度保留依据、用于着色的分类字段和软件输出。结果部分依次报告完整案例数、前几个维度解释比例、主要变量组贡献、关键变量坐标/cos2/贡献、对象分布及敏感性检查。

可参考如下写法:

采用多重因子分析联合评价临床、实验室和量表三个信息域。按全部入组变量进行完整案例分析,共纳入 148 例。各变量组先按组内第一主轴进行权重标准化,再建立共同因子空间。前两个全局维度分别解释 37.9% 和 25.6% 的加权惯量,累计解释 63.6%。Dim.1 主要由临床与量表相关变量推动,Dim.2 更多反映另一组实验室和临床指标的共同变化。按预设表型着色的个体图显示各组在前两个维度上存在部分分离,但仍有重叠。

示例仅用于展示写法。实际报告应根据当前贡献率和 cos2 重新确定维度含义,不能把视觉分离写成因果关系、诊断准确性或已经证实的机制。

10.78.9 常见问题

1. MFA 与普通主成分分析有什么区别?

普通主成分分析通常把全部变量同等放入一个矩阵;MFA 明确保留变量组结构,并在全局分析前对各组加权,适合多信息域或多量表块数据。

2. 变量组应该如何划分?

应依据测量来源、理论构念、时间点或数据模态预先划分,而不是为了获得更漂亮的图反复试分组。同一变量不能进入多个组。

3. 标准化定量与中心化定量如何选择?

不同单位或尺度时通常选择标准化定量;单位一致且原始方差差异本身具有实质意义时可考虑中心化定量。选择应在方法中说明。

4. 为什么定性组没有定量变量结果?

定性组由类别水平构成,不存在与连续变量相同定义的定量变量坐标表。模块会保留适用的变量组、个体和图形结果,并自动省略不适用输出。

5. 坐标正负号可以解释为风险升高或降低吗?

不能直接这样解释。因子轴方向可以整体翻转,正负号只表示同一维度两端的相对位置。需要结合高贡献变量的方向和实际编码命名。

6. cos2 和贡献率有什么区别?

cos2 回答“当前维度对这个元素表示得好不好”;贡献率回答“这个元素对当前维度形成贡献多大”。高贡献但低 cos2 或高 cos2 但低贡献都可能出现。

7. 前两个维度累计解释比例不高怎么办?

说明数据结构需要更多维度描述。应查看后续维度、贡献和碎石图,不应为了二维展示强行忽略重要信息。

8. 个体图上的组别分开是否证明组间有显著差异?

不证明。着色图是描述性可视化;正式组间推断需要独立、预先规定的统计检验,并考虑多重比较和研究设计。

9. 缺失值如何处理?

当前模块按全部入组变量进行完整案例分析。变量组越多,完整案例损失可能越明显,应报告排除数量并评估缺失机制和敏感性。

10. 可以把 MFA 坐标继续用于聚类或回归吗?

可以作为预先规定的后续分析输入,但应说明使用哪些维度、为何保留,并避免在同一数据中反复选择最有利维度后作确证性推断。需要预测评价时应在重采样或外部验证框架中重新拟合全部预处理和 MFA。

10.78.10 小结

本模块的可靠使用流程是:先按研究设计定义互不重叠的变量组和正确组类型,核对完整案例与变量变异,先看特征根和解释比例,再联合使用坐标、cos2 与贡献率解释变量组和变量,最后检查个体图、保存 Word 与坐标 CSV,并在独立数据中复核探索性结构。

多重因子分析的价值不只是把高维数据画成二维图,而是以相对公平的方式整合多个信息域。透明的变量组定义、合适的度量类型和克制的探索性解释,是结果可重复的关键。

10.79 混合数据因子分析

混合数据因子分析(Factor Analysis of Mixed Data, FAMD)用于在同一个共同因子空间中联合分析定量变量与定性变量。例如,一份临床数据同时包含年龄、生物标志物和量表分数,也包含症状等级、治疗反应和疾病分期。FAMD 兼顾两类变量的测量特点,使连续变量不会因量纲较大而支配结果,类别较多的定性变量也不会仅凭水平数量获得不合理权重。

适用场景:同一批独立研究对象同时具有连续测量和分类特征,希望回答“哪些定量变量与哪些类别水平共同定义主要差异”“对象在混合特征空间中是否形成相似区域”“预先定义的分组在前几个维度上是否出现分离或重叠”等探索性问题。

10.79.1 模块概览

模块自动生成以下结果:

  • 原始样本量、完整案例、排除案例、变量数量和提取维度概览;
  • 每个分析变量的定量/定性类型及有效水平或唯一值数量;
  • 全局维度的特征根、解释比例和累计解释比例;
  • 个体、全部变量、定量变量和定性变量水平的坐标、表示质量(cos2)或贡献率;
  • 碎石图、全部变量因子图、定量变量因子图和定性变量水平因子图;
  • 未着色与按分类字段着色的个体因子图;
  • 每个完整案例的全局维度坐标 CSV;
  • 当前勾选表格和图形的 Word 报告。

全部主要表格和图形默认勾选。输入校验、模型拟合、绘图和下载均有错误隔离,错误会显示在当前模块内,不会使整个应用退出。

10.79.2 统计原理

10.79.2.1 定量与定性信息如何进入同一空间

对定量变量,FAMD 先进行中心化和标准化。若第 \(j\) 个定量变量为 \(x_j\),均值为 \(\bar{x}_j\),标准差为 \(s_j\),标准化值为:

\[ z_{ij}=\frac{x_{ij}-\bar{x}_j}{s_j}. \]

因此,不同单位的年龄、浓度和量表分数可以在相近尺度上参与分析。

对定性变量,每个类别水平转化为指示信息,并按该水平在样本中的频率调整。较少见水平不会被当成普通的 0/1 数值直接计算欧氏距离,而是按定性数据的相对频率结构进入共同空间。最终分析可理解为同时保留主成分分析对定量变量的处理方式和多重对应分析对定性变量的处理方式。

FAMD 对混合变量矩阵进行加权分解,得到相互正交的全局维度。第 \(k\) 个维度的解释比例可写为:

\[ \text{Explained}_k=\frac{\lambda_k}{\sum_h\lambda_h}\times 100\%, \]

其中 \(\lambda_k\) 为第 \(k\) 个维度的特征根。解释比例越高,表示该维度保留的总体混合信息越多。

10.79.2.2 坐标、cos2 和贡献率

坐标表示个体、变量或类别水平在某个维度上的相对位置。对象距离较近,说明它们在全部入选定量和定性特征上较相似;变量或类别水平位于相近方向,表示它们与该维度的关联模式相似。

表示质量(cos2)衡量某个元素在当前维度或当前二维图上被表示得有多好。对个体 \(i\) 和维度 \(k\),可概括为:

\[ \cos^2_{ik}=\frac{f_{ik}^{2}}{d_i^{2}}, \]

其中 \(f_{ik}\) 为维度坐标,\(d_i^{2}\) 为该个体在完整因子空间中的平方距离。cos2 较低时,不宜仅根据前两维图解释该元素。

贡献率表示某个元素对维度形成的相对贡献。贡献率高的定量变量或类别水平更有助于解释该轴的统计含义。贡献率不是回归效应、风险比或临床重要性,仍需结合变量内容、频率分布和研究设计判断。

解释边界:FAMD 是探索性降维方法。它描述当前样本中的混合变量结构,不检验因果关系,也不直接提供分类准确率或外部预测性能。维度命名、保留数量和视觉分组都需要结合解释比例、贡献率、cos2、样本量和专业知识。

10.79.3 数据准备

数据采用宽表结构,每行代表一个独立研究对象,每列为一个测量或分类特征。对象标签和着色分组用于展示,不应重复进入分析变量。

受试者编号 表型分组 年龄 生物标志物1 基线评分 症状等级 治疗反应
FAMD001 A 43.5 -1.28 52.1
FAMD002 A 47.2 -0.96 56.4
FAMD051 B 58.7 0.24 64.2
FAMD101 C 65.8 1.13 72.5
  • 至少选择 3 个分析变量;
  • 必须同时包含至少 1 个数值变量和 1 个分类变量;
  • 数值变量应具有实际连续或有序数值含义,不能是无标签的类别编码;
  • 分类变量需要至少 2 个有效水平,单个分析变量最多支持 20 个水平;
  • 着色字段需要 2 至 12 个有效水平;
  • 对象标签与着色字段不能相同,也不能重复进入分析变量;
  • 缺失值和非有限值按全部入选变量进行完整案例排除;
  • 常数变量或几乎没有变异的数值变量无法形成有效维度;
  • 极少见类别和极端离群值可能显著改变因子空间,应在分析前核查频数与分布。

若全部变量均为数值型,应使用主成分分析;若全部变量均为分类变量,应使用适合定性数据的对应分析模块。FAMD 专门用于两类变量同时存在的情形。

10.79.4 使用步骤

10.79.4.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “聚类分析与多元统计” → “混合数据因子分析”

10.79.4.2 2. 选择分析变量

在“分析变量”中同时选择定量和定性变量。模块会自动识别支持的变量类型,并在结果中列出类型核对表。对象编号、姓名等标识字段不应作为分析变量。

10.79.4.3 3. 设置对象标签与着色字段

“对象标签字段”用于坐标表和个体图标识对象,建议选择唯一受试者编号;不使用时按原始行号标识。“个体图着色分类字段”仅用于生成分组个体图,不参与 FAMD 维度计算。

10.79.4.4 4. 选择结果度量

个体、全部变量、定量变量和定性变量水平可以分别选择坐标、cos2 或贡献率。第一次分析可先全部使用坐标观察结构,再切换到 cos2 判断表示质量,最后用贡献率解释各维度的主要构成。

混合数据因子分析:完整高分辨率设置面板
混合数据因子分析:完整高分辨率设置面板

10.79.4.5 5. 核对输出并开始分析

7 张主表和 6 幅图默认全部勾选。左侧不提供图像宽高设置;每幅图使用稳定尺寸渲染,并可在图形下方下载 PNG、TIFF、SVG 和 PDF。点击 “开始混合数据因子分析” 后,先核对“分析概览”,再依次查看“个体与变量”和“统计图”。

混合数据因子分析:分析概览、变量类型与解释比例
混合数据因子分析:分析概览、变量类型与解释比例

10.79.5 结果解读

10.79.5.1 分析概览与变量类型

示例数据原始样本量为 150,因所选变量缺失排除 2 例,完整案例为 148;实际进入分析的 6 个变量包括 4 个定量变量和 2 个定性变量,共提取 5 个全局维度。类型表应与研究方案一致,尤其要确认数值编码的类别没有被误当成连续测量。

10.79.5.2 特征根与解释比例

示例中 Dim.1 解释 28.29% 的混合信息,Dim.2 解释 15.16%,前两维累计解释 43.45%。这意味着二维图便于展示主要结构,但仍有超过一半的信息位于后续维度,解释单个元素时必须同时查看 cos2,不能把二维距离当成完整距离。

维度保留没有适用于所有研究的固定阈值。应结合碎石图转折、累计解释比例、变量贡献、cos2、可解释性和重复分析稳定性确定重点维度。

10.79.5.3 个体与变量结果

个体坐标表给出每个完整案例在各全局维度的位置;全部变量结果用于联合观察定量变量和定性变量的总体关系;定量变量结果保留连续测量的方向信息;定性变量水平结果则把每个类别水平作为独立元素展示。

混合数据因子分析:个体与变量结果表
混合数据因子分析:个体与变量结果表

解释类别水平时必须连同原变量和频数一起阅读。例如“治疗反应=是”与“症状等级=轻”位于相近方向,只说明它们在当前样本和维度上具有相似位置,不能据此推断治疗导致症状减轻。

10.79.6 图形解释

10.79.6.1 碎石图

碎石图按顺序显示各全局维度的信息量。明显转折前的维度通常值得优先解释,但应同时考虑累计解释比例和后续维度中是否存在临床上重要、且贡献率和 cos2 较高的变量。

混合数据因子分析:碎石图
混合数据因子分析:碎石图

10.79.6.2 全部变量因子图

全部变量因子图把定量变量和定性变量信息放入同一空间。距离原点较远且 cos2 较高的元素更适合在当前二维图中解释;相近方向表示相似的维度关联模式,方向相反表示相对位置相反。不能仅凭标签距离判断显著性。

混合数据因子分析:全部变量因子图
混合数据因子分析:全部变量因子图

10.79.6.3 定性变量水平因子图

定性变量水平因子图专门显示各类别水平。某一变量的不同水平通常位于因子空间的不同区域,可帮助理解维度两端分别对应哪些分类特征。低频水平可能离原点较远,解释前应先核查样本频数和稳定性。

混合数据因子分析:定性变量水平因子图
混合数据因子分析:定性变量水平因子图

10.79.6.4 个体因子图

每个点代表一个完整案例。点越接近,表示这些对象在所有入选定量和定性变量上的加权特征越相似。按预设分类字段着色后,可观察组间是否存在相对分离、重叠和离群对象;椭圆概括组内主要分布范围。

混合数据因子分析:按表型着色的个体因子图
混合数据因子分析:按表型着色的个体因子图

图中的视觉分离不等于统计显著或分类性能良好。若研究目的为预测类别,应使用独立分类模块并在训练/验证框架中报告性能;若目的为组间推断,应使用预先规定的检验模型。

10.79.7 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述,并下载 PNG、TIFF、SVG 和 PDF。自动描述需要人工核对变量类型、类别编码、维度符号、当前度量和完整案例范围。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。个体坐标 CSV 包含原始行号、对象标签、着色分组和各维度坐标,可用于追查离群对象或开展预先规定的后续分析。

混合数据因子分析:Word 报告与个体坐标 CSV 下载
混合数据因子分析:Word 报告与个体坐标 CSV 下载

建议:正式分析时同时保存数据版本、变量类型定义、类别水平频数、完整案例规则、结果度量、Word 报告和坐标 CSV。若在查看结果后反复更换变量或合并类别,应明确标记为探索性分析,并在独立样本中复核。

10.79.8 论文报告建议

方法部分建议说明研究对象、定量与定性变量清单、变量编码、标准化与类别处理原则、缺失处理、维度保留依据、着色字段及软件输出。结果部分依次报告完整案例数、变量类型构成、前几个维度解释比例、主要变量或类别水平的贡献与 cos2,以及对象分布和敏感性检查。

可参考如下写法:

采用混合数据因子分析联合评价 4 个定量指标和 2 个定性特征。按全部入组变量进行完整案例分析,共纳入 148 例。定量变量经中心化与标准化,定性变量按类别水平及其相对频率进入共同因子空间。Dim.1 和 Dim.2 分别解释 28.29% 和 15.16% 的混合信息,累计解释 43.45%。Dim.1 主要由若干生物标志物和特定症状水平推动;按预设表型着色的个体图显示各组在前两个维度上存在部分分离,但仍有明显重叠。

示例仅用于展示写法。实际报告应根据当前贡献率和 cos2 确定维度含义,不能把视觉位置写成因果关系、诊断准确性或已经证实的机制。

10.79.9 常见问题

1. FAMD 与主成分分析有什么区别?

主成分分析主要用于数值型变量;FAMD 同时处理数值型和分类变量,并分别采用适合两类变量的标准化方式后建立共同空间。

2. 全部变量都是数值型还需要 FAMD 吗?

通常不需要。全部为数值型时使用主成分分析更直接;FAMD 至少需要一个数值变量和一个分类变量。

3. 1、2、3 编码的疾病分期应当按数值还是分类处理?

若这些数字仅代表类别标签,应先设为因子并保留清晰水平名称。只有当相邻数值差具有可解释的等距含义时,才适合作为数值变量。

4. 为什么前两维累计解释比例比主成分分析低?

混合数据包含连续变化和多个类别方向,信息可能分散在更多维度。应查看后续维度、贡献率和 cos2,而不是为了二维展示强行忽略重要结构。

5. 坐标正负号可以解释为风险升高或降低吗?

不能直接这样解释。因子轴方向可以整体翻转,正负号只表示同一维度两端的相对位置。需要结合高贡献元素和原始编码命名维度。

6. cos2 和贡献率有什么区别?

cos2 回答“当前维度对这个元素表示得好不好”;贡献率回答“这个元素对当前维度形成贡献多大”。两者应与坐标联合解释。

7. 罕见类别为什么离原点很远?

定性水平按相对频率进入分析,低频水平可能获得较大几何距离。远离原点不自动意味着临床重要,应先核查频数、异常录入和重复分析稳定性。

8. 个体图上的组别分开是否证明组间显著?

不证明。着色图是描述性可视化;正式组间推断需要独立、预先规定的统计检验,分类性能则需要训练集与验证集评价。

9. 缺失值如何处理?

当前模块按全部入选变量进行完整案例分析。变量越多,完整案例损失可能越明显,应报告排除数量并评估缺失机制和敏感性。

10. 可以把 FAMD 坐标用于聚类或回归吗?

可以作为预先规定的后续分析输入,但应说明保留哪些维度及其依据。用于预测时,标准化、类别编码和 FAMD 都必须在每个训练折内重新拟合,避免信息泄漏。

10.79.10 小结

本模块的可靠使用流程是:先确认数据同时包含定量和定性变量,核对类型、类别水平与完整案例,先看特征根和解释比例,再联合使用坐标、cos2 与贡献率解释变量和类别水平,最后检查个体图、保存 Word 与坐标 CSV,并在独立数据中复核探索性结构。

混合数据因子分析的价值,在于让不同测量类型在同一空间中获得相对平衡的表达。正确的变量类型、透明的类别编码和克制的探索性解释,是结果可重复的关键。

10.80 时间序列聚类

时间序列聚类用于把具有相似纵向轨迹的对象归入同一组。例如,多名受试者在相同随访时间点重复测量某项生物标志物,可以根据整个观察期的数值水平与变化形态识别上升型、下降型或波动型轨迹。

适用场景:每个对象都在一组完全相同的时间点具有同一个数值指标,希望回答“哪些对象具有相似轨迹”“不同轨迹组的平均变化方向如何”“候选聚类数增加后簇内差异下降多少”等探索性问题。

10.80.1 模块概览

模块自动生成以下结果:

  • 记录数、对象数、时间点数、不同序列轮廓和允许聚类范围概览;
  • 每个对象的聚类归属、记录数和观察时间范围;
  • 每个聚类的对象数、总体均值、标准差、最小值和最大值;
  • 1 至允许上限的聚类数肘部图;
  • 按聚类分面的对象时间序列图;
  • 各聚类的均值时间序列图;
  • 对象聚类归属 CSV;
  • 当前勾选表格和图形的 Word 报告。

全部主要表格和图形默认勾选。数据校验、聚类、绘图和下载均有错误隔离,错误会显示在当前模块内,不会使整个应用退出。

10.80.2 统计原理

10.80.2.1 对象×时间矩阵

模块先把长表转换为对象×时间宽矩阵。设第 \(i\) 个对象在 \(T\) 个共同时间点上的序列为:

\[ \mathbf{x}_i=(x_{i1},x_{i2},\ldots,x_{iT}). \]

两个对象之间的差异按原始尺度上的平方欧氏距离衡量:

\[ d^2(i,j)=\sum_{t=1}^{T}(x_{it}-x_{jt})^2. \]

因此,聚类同时受总体水平变化形态影响。两个轨迹形状相似但整体相差很大,仍可能被分到不同簇;若研究只关注形状,应在分析前按对象进行有明确依据的中心化或标准化,并把该预处理写入方法。

10.80.2.2 K-means 目标函数

给定聚类数 \(K\),K-means 寻找使簇内平方和最小的分组:

\[ \mathrm{WCSS}=\sum_{g=1}^{K}\sum_{i\in C_g}\lVert \mathbf{x}_i-\boldsymbol{\mu}_g\rVert^2, \]

其中 \(C_g\) 为第 \(g\) 个聚类,\(\boldsymbol{\mu}_g\) 为该簇在所有时间点上的均值轨迹。模块固定随机种子为 1234,并使用 100 个随机起点选择较稳定的主解,减少单次起点落入较差局部最优的风险。

10.80.2.3 肘部图

随着 \(K\) 增加,WCSS 必然下降。肘部图寻找“继续增加聚类数后,WCSS 改善明显变缓”的转折。肘部不是正式显著性检验,也不保证只有一个正确答案;最终聚类数还应考虑每簇样本量、轨迹可解释性、稳定性和研究目的。

分析边界:当前模块要求所有对象具有完全相同且完整的时间点,使用原始尺度 K-means,不执行动态时间规整,也不对不同长度、错位峰值或不规则随访轨迹自动对齐。若各对象时间点不同,应先选择适合不规则纵向数据的方法,而不是补零后直接聚类。

10.80.3 数据准备

数据必须采用长表,每行是一条对象-时间记录:

对象编号 日期 观测值
对象01 2014-01-01 11.80
对象01 2015-01-01 13.42
对象01 2016-01-01 14.61
对象02 2014-01-01 12.35
对象02 2015-01-01 13.07
  • 时间字段支持日期、日期时间、四位年份数值/字符或可识别的日期字符;
  • 对象字段用于定义独立序列;同一对象名称必须保持完全一致;
  • 数值字段必须为有限数值,不能包含缺失或无穷值;
  • 每个对象在每个时间点只能有一条记录;
  • 所有对象必须具有完全相同的时间点集合;
  • 至少需要 3 个对象、3 个时间点和 2 个不同的序列轮廓;
  • 聚类数上限为对象数减 1、不同轮廓数和 10 三者中的最小值;
  • 不应把缺失时间点填为 0,除非 0 确实是该指标的真实观测值;
  • 极端值和单位变化会直接影响距离,应在分析前核查时间顺序、量纲和异常记录。

10.80.4 使用步骤

10.80.4.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “时间序列分析” → “时间序列聚类”

10.80.4.2 2. 指定三个字段

“时间字段”选择日期或年份,“对象字段”选择受试者编号等序列标识,“数值字段”选择需要聚类的重复测量指标。三个字段必须互不相同。

10.80.4.3 3. 选择聚类数

聚类数默认为 2。第一次分析可先运行默认值并查看肘部图,再结合转折位置、每簇对象数和轨迹可解释性调整。不要只为了得到更漂亮的分面图不断增加聚类数。

10.80.4.4 4. 设置横轴角度并运行

横轴标签角度可选 0、45 或 90 度,只影响图形显示。3 张表和 3 幅图默认全部勾选;左侧不提供图像宽高设置。点击 “开始时间序列聚类” 后,先核对分析概览,再查看聚类归属和图形。

时间序列聚类:完整高分辨率设置面板
时间序列聚类:完整高分辨率设置面板
时间序列聚类:分析概览
时间序列聚类:分析概览

10.80.5 结果解读

10.80.5.1 分析概览

示例数据包含 180 条记录、15 个对象和 12 个共同时间点,观察期为 2014 至 2025 年;15 个对象具有 15 个不同序列轮廓,允许的最大聚类数为 10。根据肘部图和预设数据结构,示例选择 3 个聚类。

“所选解簇内平方和”用于核对当前主解与肘部图中同一聚类数的参考值。模块使用 100 个随机起点,主解不应比参考曲线同一 \(K\) 的解更差。

10.80.5.2 对象聚类归属

归属表中每个对象只出现一次,并保留记录数、起始时间和结束时间。示例 15 个对象被分为 3 簇,每簇 5 个对象,每个对象均有 12 条记录。

时间序列聚类:对象归属与聚类汇总
时间序列聚类:对象归属与聚类汇总

聚类编号只是标签。聚类1不代表风险最低,聚类3也不代表最严重;每次改变数据、聚类数或预处理后,编号可能交换。正式报告应根据均值轨迹命名为“上升型”“下降型”“波动型”等,而不是直接比较编号大小。

10.80.5.3 聚类汇总

汇总表的均值、标准差和范围按该簇全部对象-时间记录计算,用于快速比较总体水平和离散程度。它不是每个对象先求均值后的组间检验,也没有调整重复测量相关性,不能把表中差异写成统计显著。

10.80.6 图形解释

10.80.6.1 聚类数肘部图

示例中 WCSS 从 1 类到 2 类明显下降,从 2 类到 3 类仍大幅下降,而 3 类以后改善趋缓,因此 3 类是合理候选。虚线标出当前选择的聚类数。

时间序列聚类:聚类数肘部图
时间序列聚类:聚类数肘部图

若肘部不明显,应比较相邻候选 \(K\) 的簇规模、轨迹含义和重复抽样稳定性,不能仅凭目测强行确定唯一聚类数。

10.80.6.2 分簇时间序列图

每条线代表一个对象,分面代表聚类。应同时观察簇内轨迹是否方向一致、是否存在离群线、各簇是否仅由总体水平区分,以及某个聚类是否样本过少。

时间序列聚类:分簇对象轨迹
时间序列聚类:分簇对象轨迹

10.80.6.3 簇均值时间序列图

簇均值图将每个聚类在各时间点的平均值连接起来,便于命名轨迹。示例可辨认出上升、下降和周期波动三类平均轨迹。均值线会掩盖簇内差异,因此必须与分簇对象轨迹图一起解释。

时间序列聚类:簇均值轨迹
时间序列聚类:簇均值轨迹

10.80.7 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述,并下载 PNG、TIFF、SVG 和 PDF。自动描述需要人工核对时间单位、数值尺度、聚类数和当前预处理。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。聚类归属 CSV 包含对象、聚类编号、记录数和观察时间范围,可用于与原始对象层资料合并,但合并后仍应核对对象标识唯一性。

时间序列聚类:Word 报告与聚类归属 CSV 下载
时间序列聚类:Word 报告与聚类归属 CSV 下载

建议:正式分析时同时保存原始长表、预处理规则、时间点集合、聚类数选择依据、随机种子、Word 报告和聚类归属 CSV。若聚类用于后续结局比较,应明确其探索性和数据驱动性质,并在独立数据中复核轨迹结构。

10.80.8 论文报告建议

方法部分建议说明对象与时间范围、数值指标和单位、长表完整性、异常值处理、是否按对象标准化、距离与 K-means 目标、候选聚类数范围、随机种子、随机起点数和聚类数选择依据。结果部分报告对象数、时间点数、各簇对象数、主要轨迹方向、WCSS 转折和敏感性分析。

可参考如下写法:

对 15 个对象在 12 个共同年度时间点的观测轨迹进行 K-means 时间序列聚类。聚类基于原始尺度的对象×时间矩阵,固定随机种子并使用 100 个随机起点。肘部图在 3 类附近出现明显转折,结合簇规模和轨迹可解释性选择 3 类。三个聚类各包含 5 个对象,平均轨迹分别表现为持续上升、持续下降和周期波动。各簇内部轨迹总体一致,但仍存在一定个体差异。

示例仅用于展示写法。实际报告不能把探索性轨迹类型写成已经证实的疾病亚型、因果机制或预测模型性能。

10.80.9 常见问题

1. 数据必须是长表吗?

是。每行是一条对象-时间-数值记录。模块会内部转换为对象×时间矩阵。

2. 各对象时间点不完全相同怎么办?

当前模块不适用。不能简单补零;应根据缺失机制和研究设计使用插值、纵向模型或适合不规则序列的聚类方法。

3. 模块是否使用动态时间规整?

不使用。当前距离比较相同时间点的原始数值,不能自动对齐提前或延后的峰值。

4. 是否需要先标准化?

只有一个数值指标时,是否标准化取决于研究问题。原始尺度同时保留水平与形状;按对象中心化或标准化更强调形状,但会丢失绝对水平差异。预处理必须在分析前确定并报告。

5. 肘部图没有明显转折怎么办?

比较多个候选聚类数的簇规模、可解释性和稳定性,并考虑不进行强制分群。肘部图不是显著性检验。

6. 为什么每次聚类编号可能不同?

编号只是无序标签。即使分组结构相同,编号也可能交换;本模块固定随机种子以提高可重复性,但改变数据或参数仍可能改变编号。

7. 为什么使用 100 个随机起点?

K-means 可能落入局部最优。多个随机起点可选取较低 WCSS 的解,并使主解与肘部图的参考计算保持一致。

8. 小聚类一定是异常组吗?

不一定。小簇可能代表真实少数轨迹,也可能由离群值、录入错误或过大的 \(K\) 造成。应回查原始曲线和数据质量。

9. 聚类后可以直接比较结局吗?

可以作为探索性后续分析,但聚类由同一数据驱动,常规 P 值可能低估不确定性。应预先规定比较、控制多重性,并在独立样本中验证。

10. 可以把聚类编号当作有序变量吗?

不能。聚类编号没有天然顺序,应作为无序分类变量,并根据轨迹内容重新命名。

10.80.10 小结

本模块的可靠使用流程是:先建立完整且无重复的对象-时间长表,确认所有对象共享同一时间点和同一数值尺度,用肘部图提出候选聚类数,再结合簇规模、稳定性和轨迹含义选择主解,最后联合查看个体轨迹与簇均值,并保存 Word 和聚类归属 CSV。

时间序列聚类的价值不在于自动发现“真实亚型”,而在于用可重复的距离和分组规则压缩复杂纵向轨迹。清晰的数据结构、充分的随机起点和克制的探索性解释,是结果可信的关键。

10.81 竞争风险分析

竞争风险分析用于研究一个关注事件可能被另一类事件提前阻止的时间结局。例如,研究肿瘤相关死亡时,患者若先死于其他原因,之后便不可能再发生肿瘤相关死亡;把其他原因死亡简单当作普通删失,会高估关注事件的发生概率。

适用场景:每名研究对象具有一个随访时间和一个最终状态,希望比较不同组的关注事件累积发生率,并进一步估计分组或协变量与关注事件亚分布风险之间的关系。常见场景包括疾病死亡与其他原因死亡、复发与非复发死亡、移植失败与死亡等。

10.81.1 模块概览

模块自动生成以下结果:

  • 原始记录、完整案例、排除记录、事件数、删失数和事件映射概览;
  • 各分组的删失、关注事件和竞争事件构成;
  • 指定时间点的两类事件累积发生率、置信区间、风险集人数和累计事件数;
  • 两类事件的 Gray 组间检验;
  • 关注事件的未调整和调整后 Fine-Gray 亚分布风险回归;
  • 关注事件和竞争事件的累积发生率曲线;
  • 累积发生率明细 CSV;
  • 当前勾选表格和图形的 Word 报告。

全部主要表格和图形默认勾选。数据校验、统计计算、绘图和下载均有错误隔离;参数不合法时会在当前模块显示可读错误,页面无需刷新,整个应用不会退出。

10.81.2 统计原理

10.81.2.1 累积发生率函数

\(T\) 为首次发生事件或删失的时间,\(J\) 为事件类型。第 \(k\) 类事件在时间 \(t\) 前的累积发生率函数为:

\[ F_k(t)=P(T\le t,J=k). \]

在存在竞争事件时,\(F_k(t)\) 不能通过把其他事件当作普通删失后使用 \(1-\widehat S(t)\) 得到。模块根据所有事件类型的风险集变化估计:

\[ \widehat F_k(t)=\sum_{u\le t}\widehat S(u-)\,d\widehat\Lambda_k(u), \]

其中 \(\widehat S(u-)\) 是所有事件均尚未发生的概率,\(d\widehat\Lambda_k(u)\) 是第 \(k\) 类事件在时点 \(u\) 的原因别风险增量。这样得到的累积发生率同时考虑了关注事件和竞争事件。

10.81.2.2 Gray 组间检验

Gray 检验比较不同组的累积发生率函数是否存在整体差异。其原假设是各组在整个观察期内的目标事件累积发生率函数相同。P 值较小提示曲线整体存在差异,但不能说明差异来自哪个时间段,也不能替代效应量和置信区间。

本模块同时报告关注事件和竞争事件的 Gray 检验。两类检验回答不同问题:关注事件不显著并不意味着竞争事件也不显著,反之亦然。

10.81.2.3 Fine-Gray 亚分布风险回归

Fine-Gray 模型直接建模关注事件的亚分布风险:

\[ \widetilde\lambda_k(t\mid\mathbf X)=\widetilde\lambda_{k0}(t)\exp(\boldsymbol\beta^\mathsf{T}\mathbf X). \]

系数指数化后得到亚分布风险比:

\[ \mathrm{SHR}=\exp(\beta). \]

在其他变量相同时,SHR 大于 1 表示该变量水平与更高的关注事件累积发生率相关,SHR 小于 1 表示与更低的累积发生率相关。SHR 描述的是亚分布风险及累积发生率排序,不等同于普通 Cox 模型的原因别瞬时风险比。

解释边界:竞争风险模型处理“哪个事件先发生”的统计结构,不会自动消除混杂、选择偏倚或信息偏倚。调整后 SHR 仍是观察性关联;若研究问题关注病因学瞬时风险,可同时预先规定原因别 Cox 模型,但不能把两种效应量混为一谈。

10.81.3 数据准备

数据采用每名对象一行的宽表结构:

受试者编号 随访时间 结局状态 治疗组 临床分期 年龄
CR001 18.4 疾病死亡 标准治疗 II期 58
CR002 36.0 无病存活 强化治疗 I期 47
CR003 11.2 其他原因死亡 联合治疗 III期 72
CR004 42.7 带病存活 标准治疗 II期 63
  • 随访时间必须是非负有限数值,并明确单位;
  • 结局状态至少需要 3 个有效水平;
  • 关注事件和竞争事件必须是两个不同水平;
  • 未指定为关注或竞争事件的其他状态水平统一作为删失;
  • 分组变量需要 2 至 6 个有效水平,每组至少 5 个完整案例;
  • 完整案例至少 30 例,关注事件至少 10 例,竞争事件至少 5 例;
  • 连续协变量必须有实际变异,分类协变量至少需要 2 个有效水平;
  • 协变量、时间、状态和分组字段不能重复;
  • 缺失值按当前模型所需字段进行完整案例排除,并在概览中报告排除数量;
  • 报告时间点应使用与随访时间相同的单位,至少一个时间点需位于观察范围内。

数据中的“带病存活”和“无病存活”均可映射为删失,但两者的临床含义仍不同。正式研究应在方案中预先说明状态定义、判定窗口和数据截止日,不能仅在分析阶段临时合并。

10.81.4 使用步骤

10.81.4.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “生存分析” → “竞争风险分析”

10.81.4.2 2. 指定时间、状态与分组

“随访时间”选择从研究起点到首次事件或末次随访的时间;“结局状态”选择包含关注事件、竞争事件和删失状态的字段;“分组变量”选择需要比较的治疗组、暴露组或分层变量。

10.81.4.3 3. 设置事件映射

“关注事件”选择研究的主要事件,“竞争事件”选择会阻止主要事件发生的另一事件。其余水平自动作为删失。第一次运行前必须逐项核对映射,尤其不要把“其他原因死亡”误设为删失。

10.81.4.4 4. 选择协变量、参考组与置信水平

调整协变量可为空,也可选择预先规定的连续或分类变量。分组参考水平决定回归表中 SHR 的比较方向;置信水平可选 90%、95% 或 99%,默认 95%。协变量选择应基于研究方案和因果结构,不应只根据单因素 P 值机械筛选。

10.81.4.5 5. 输入报告时间点并运行

报告时间点用逗号分隔,最多 8 个,并与随访时间使用同一单位。5 张表和 2 幅图默认全部勾选;左侧不提供图像宽高设置。点击 “开始竞争风险分析” 后,先核对分析概览,再查看累积发生率、回归结果和统计图。

竞争风险分析:完整高分辨率设置面板
竞争风险分析:完整高分辨率设置面板
竞争风险分析:分析概览
竞争风险分析:分析概览

10.81.5 结果解读

10.81.5.1 分析概览与事件构成

示例原始数据有 360 例,因调整协变量缺失排除 8 例,完整案例为 352 例;其中疾病死亡 175 例、其他原因死亡 110 例、删失 67 例。关注事件映射为“疾病死亡”,竞争事件映射为“其他原因死亡”,“带病存活”和“无病存活”作为删失。

事件构成表显示强化治疗组、标准治疗组和联合治疗组的关注事件比例分别约为 54.5%、43.0% 和 51.3%。这些是组内最终状态构成,并未考虑随访时间长短,因此不能替代累积发生率曲线。

10.81.5.2 指定时间累积发生率

累积发生率表在 12、24、36 和 60 个时间单位报告两类事件的估计值、95% 置信区间、风险集人数和累计事件数。解释时需要同时观察估计值和风险集:随访后期风险集人数很少,即使曲线仍延伸,估计不确定性也会增大。

竞争风险分析:事件构成、累积发生率和 Gray 检验
竞争风险分析:事件构成、累积发生率和 Gray 检验

示例中关注事件的 Gray 检验统计量为 3.441,自由度为 2,P=0.179;竞争事件统计量为 0.271,自由度为 2,P=0.873。当前数据未提供三组累积发生率函数整体不同的充分证据。不能把“未达到统计学显著”写成三组完全等效。

10.81.5.3 亚分布风险回归

未调整模型中,以强化治疗为参考,标准治疗的 SHR 为 0.703(95% CI 0.485–1.018,P=0.062),联合治疗的 SHR 为 0.888(95% CI 0.627–1.257,P=0.500)。调整临床分期和年龄后,相应 SHR 为 0.705(95% CI 0.487–1.020,P=0.064)和 0.870(95% CI 0.614–1.233,P=0.430)。

竞争风险分析:未调整与调整后 Fine-Gray 回归
竞争风险分析:未调整与调整后 Fine-Gray 回归

示例中调整前后分组估计接近,说明这两个协变量对分组效应估计的改变有限;但这不证明不存在其他混杂。分类协变量的比较方向取决于其参考水平,解读前应同时查看“参数”列和分析概览。

10.81.6 图形解释

10.81.6.1 关注事件累积发生率图

每条阶梯线表示某组截至当前时间已发生关注事件的累计概率,阴影为置信区间。曲线上升意味着新的关注事件发生,竞争事件或删失发生时不会让曲线下降。

竞争风险分析:关注事件累积发生率曲线
竞争风险分析:关注事件累积发生率曲线

示例中强化治疗组的疾病死亡累积发生率在大部分观察期较高,标准治疗组较低,联合治疗组居中;但置信区间重叠明显,Gray 检验 P=0.179,因此应把图形描述为趋势,而不是显著组间差异。

10.81.6.2 竞争事件累积发生率图

竞争事件图使用完全相同的风险集逻辑,但目标改为其他原因死亡。它有助于判断关注事件曲线差异是否同时伴随竞争事件发生模式不同。

竞争风险分析:竞争事件累积发生率曲线
竞争风险分析:竞争事件累积发生率曲线
竞争风险分析:图形描述与多格式下载控件
竞争风险分析:图形描述与多格式下载控件

不能把关注事件和竞争事件两条图简单相减,也不能分别使用普通生存曲线后再相加。两类累积发生率与无事件概率在同一时间点共同构成完整状态概率。

10.81.7 表格描述和下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述,并下载 PNG、TIFF、SVG 和 PDF。自动描述需要人工核对事件定义、时间单位、参考水平、协变量、风险集人数和效应量方向。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格和图形。累积发生率 CSV 保留事件类型、分组、时间、估计值、置信区间、风险集人数和累计事件数,便于审计或制作预先规定的补充材料。

竞争风险分析:Word 报告与累积发生率 CSV 下载
竞争风险分析:Word 报告与累积发生率 CSV 下载

建议:正式分析时同时保存数据截止日、状态编码字典、事件映射、时间单位、协变量方案、参考水平、报告时间点、Word 报告和 CSV。若改变关注事件,原竞争事件与删失定义也会改变,应作为新的分析问题重新报告。

10.81.8 论文报告建议

方法部分建议说明研究起点、时间单位、关注事件、竞争事件、删失定义、数据截止日、分组和参考水平、完整案例规则、累积发生率估计、Gray 检验、Fine-Gray 模型、协变量及置信水平。结果部分依次报告完整案例和事件数、关键时间点累积发生率、Gray 检验以及调整前后 SHR。

可参考如下写法:

采用竞争风险方法分析疾病死亡,以其他原因死亡作为竞争事件,带病存活和无病存活在末次随访时删失。按模型所需字段进行完整案例分析,共纳入 352 例,其中疾病死亡 175 例、其他原因死亡 110 例、删失 67 例。三组疾病死亡累积发生率的 Gray 检验差异未达到统计学显著(统计量=3.441,df=2,P=0.179)。以强化治疗为参考,调整临床分期和年龄后,标准治疗和联合治疗的疾病死亡亚分布风险比分别为 0.705(95% CI 0.487–1.020,P=0.064)和 0.870(95% CI 0.614–1.233,P=0.430)。

示例仅用于展示写法。实际论文还应报告预先规定的关键时间点累积发生率及风险集人数,避免只报告 P 值或只展示曲线。

10.81.9 常见问题

1. 什么情况才算竞争事件?

竞争事件必须在关注事件之前发生,并使关注事件此后不可能发生或不再具有原定义。例如研究疾病死亡时,其他原因死亡是竞争事件;普通失访不是竞争事件,而是删失。

2. 为什么不能把竞争事件当作普通删失?

普通删失假设该对象之后仍可能发生关注事件。竞争事件已经永久阻止关注事件,若仍按普通删失处理,会把其未来风险错误分配给仍在风险集者,通常高估累积发生率。

3. Gray 检验与 Fine-Gray 回归有什么区别?

Gray 检验是未调整的组间整体曲线比较;Fine-Gray 回归可估计分组和协变量的 SHR,并进行多变量调整。两者应联合报告。

4. SHR 与 Cox 回归的 HR 相同吗?

不同。SHR对应亚分布风险和累积发生率排序;原因别 Cox HR 对应当前仍无任何事件者中的瞬时原因别风险。研究目的不同,解释也不同。

5. SHR 大于 1 是否表示个体在任一时刻风险都更高?

不能这样表述。SHR 是亚分布风险比,其风险集保留了已经发生竞争事件者的加权信息。更稳妥的表述是“与更高的关注事件累积发生率相关”。

6. 可以把多个竞争事件合并吗?

可以在研究问题允许时合并为一个竞争事件类别,但应保证临床含义清楚并预先规定。若不同竞争事件机制差异很大,建议分别分析并明确多重性。

7. 报告时间点如何选择?

应根据临床随访节点和风险集人数预先确定,例如 1、3、5 年。不要在看到曲线后只挑差异最大的时间点;后期风险集过小时应谨慎或不报告。

8. 为什么加入协变量后完整案例数减少?

当前模块按时间、状态、分组和全部所选协变量执行完整案例分析。协变量缺失会排除对应对象,应报告排除数,并根据缺失机制考虑多重插补或敏感性分析。

9. 分类协变量的参考水平在哪里确认?

分组参考水平由左侧明确设置;其他分类协变量使用其当前第一个因子水平作为参考。回归表“参数”列会写出比较水平与参考水平,解释前必须核对。

10. Gray 检验不显著,还能报告回归吗?

可以,尤其当回归和协变量调整是研究方案预先规定时。不能因为总体检验不显著就删除预设模型,也不能只保留显著的协变量结果。

10.81.10 小结

本模块的可靠使用流程是:先定义研究起点和互斥终点,明确关注事件、竞争事件与删失,核对完整案例和风险集,再联合解释累积发生率、Gray 检验和调整后 SHR,最后保存 Word、CSV 和事件编码字典。

竞争风险分析的关键不是更复杂的曲线,而是正确承认“另一事件已经改变了关注事件未来是否可能发生”。透明的终点定义、预先规定的协变量和克制的 SHR 解释,是结果可信的基础。

10.82 参数生存模型

参数生存模型为生存时间指定明确的概率分布,在一个统一模型中估计生存函数、风险函数、分组或协变量效应,并可在充分依据下把预测延伸到观察期之外。与只对风险比作半参数假设的 Cox 模型不同,参数模型还要规定基线生存时间的分布形状,因此能够提供平滑曲线和长期外推,但也更依赖模型假设。

核心问题:哪一种分布能够合理描述当前随访数据?不同组在指定时间点的生存概率是多少?风险随时间如何变化?若需要观察期外预测,结论对分布选择有多敏感?

10.82.1 模块能做什么

  • 拟合指数、Weibull、对数正态、对数 Logistic、Gamma、广义 Gamma、Gompertz 和 Royston-Parmar 样条 8 类参数模型;
  • 选择分组参考水平,并加入连续或分类协变量;
  • 同时比较候选分布的对数似然、参数数、AIC 和 BIC;
  • 输出模型分布参数、协变量系数、指数化效应、置信区间和 P 值;
  • 估计各组在指定时间点的生存概率及置信区间;
  • 在观察期之外生成明确标记的生存外推结果;
  • 绘制参数生存曲线、风险函数图和 Cox-Snell 残差诊断图;
  • 在参数生存图上叠加非参数阶梯估计,辅助检查模型拟合;
  • 为主要表格和图形生成中英文描述;
  • 下载包含当前表格和图形的 Word 报告,以及生存预测明细 CSV。

10.82.2 适用场景

本模块适合需要估计完整生存曲线、比较不同风险形状、计算指定时间生存率或进行谨慎长期外推的研究。例如肿瘤总生存期、无进展生存期、器械寿命、复发时间、住院后再入院时间和卫生经济模型中的长期生存输入。

不宜直接使用的情况:存在多个互斥终点时应先考虑竞争风险;同一对象有多次事件时需复发事件模型;分组或协变量效应明显随时间变化时,普通固定效应参数模型可能不足;中心、家庭或受试者内聚类需要脆弱性或多水平生存模型;只因某个分布 AIC 最小并不能保证其临床外推合理。

10.82.3 统计原理

10.82.3.1 生存函数与风险函数

设事件时间为 \(T\)。生存函数和风险函数分别为:

\[S(t)=P(T>t),\]

\[h(t)=\lim_{\Delta t\to0}\frac{P(t\le T<t+\Delta t\mid T\ge t)}{\Delta t}.\]

参数模型假定 \(T\) 或其变换服从某个给定分布。分布参数和协变量系数共同决定 \(S(t)\)\(h(t)\) 的形状。指数模型假定风险恒定;Weibull 和 Gompertz 可表示单调变化风险;对数正态和对数 Logistic 可表示先升后降风险;广义 Gamma 更灵活;Royston-Parmar 模型用限制性三次样条描述变换后的基线函数。

10.82.3.2 协变量效应尺度

指数化系数的解释取决于分布参数化,不能一律称为风险比:

当前模型 指数化协变量效应 大于 1 的一般含义
指数、Weibull、对数正态、对数 Logistic、Gamma、广义 Gamma 时间比或加速因子 事件时间相对延长
Gompertz 风险比 瞬时事件风险相对升高
风险尺度样条 风险比 瞬时事件风险相对升高
优势尺度样条 生存优势比 生存优势相对升高
正态尺度样条 指数化正态尺度系数 按所选变换尺度解释

时间比大于 1 通常表示事件时间被拉长,而风险比大于 1 表示风险更高,两者方向可能相反。正式报告前必须查看“效应解释尺度”列。

10.82.3.3 模型比较

模块报告 Akaike 信息准则:

\[AIC=-2\ell+2k,\]

以及 Bayesian 信息准则:

\[BIC=-2\ell+k\log n,\]

其中 \(\ell\) 为最大对数似然,\(k\) 为模型参数数,\(n\) 为完整案例数。AIC 和 BIC 越小表示在拟合程度与复杂度之间的相对平衡越好。它们只能在同一数据、同一结局和相同协变量条件下比较,不是绝对拟合优度,也不能单独证明长期外推可信。

10.82.3.4 观察期外外推

最大观察时间之后没有直接观察数据,外推完全由当前分布和协变量结构决定。模块在概览、预测表和图中明确标出最大观察时间,并把区间标为“模型外推”。外推终点填 0 时,默认延伸到最大观察时间的 2 倍。

外推边界:观察期外曲线不是额外随访数据。长期预测应比较多个临床合理分布、检查外部证据,并进行分布敏感性分析。若不同分布在观察期内接近、观察期外迅速分离,应把这种不确定性作为主要结论报告。

10.82.4 数据准备

数据采用每名研究对象一行的宽表:

受试者编号 随访时间 结局状态 治疗组 年龄 临床分期
P001 8.4 发生事件 标准治疗 63 III期
P002 24.0 删失 强化治疗 51 II期
P003 17.2 发生事件 联合治疗 57 II期
P004 36.5 删失 标准治疗 69 III期
  • 随访时间必须为非负有限数值,并至少包含一个正值;
  • 结局状态至少需要 2 个有效水平;用户指定事件水平,其余水平统一视为删失;
  • 分组变量需要 2 至 6 个有效水平,每组至少 5 个完整案例;
  • 完整案例至少 30 例,事件至少 10 例,删失至少 5 例;
  • 连续协变量必须有变异且不能包含非有限值;
  • 分类协变量需要 2 至 10 个有效水平;
  • 时间、状态、分组和协变量字段不能重复;
  • 缺失记录按当前模型实际使用字段进行完整案例排除;
  • 报告时间点必须为正数、最多 8 个,并至少有一个位于实际观察范围内;
  • 外推终点必须大于最大观察时间。

事件数相对模型参数偏少时,概览会给出提示。该提示不等同于模型必然无效,但意味着估计可能不稳定,应减少不必要参数、增加事件或进行敏感性分析。

10.82.5 主要参数

设置 含义 使用建议
事件水平 哪个状态被编码为事件 第一次运行前逐项核对
分组参考水平 分组系数的比较基准 与研究方案和报告方向一致
调整协变量 纳入模型的连续或分类变量 依据研究方案和因果结构预先选择
参数分布 基线生存时间或风险的形状假设 默认 Weibull,并与其他分布比较
样条结点数 Royston-Parmar 模型灵活度 结点越多越灵活,也越容易过拟合
样条尺度 风险、优势或正态尺度 按效应解释和拟合情况选择
置信水平 90%、95% 或 99% 通常使用 95%
报告时间点 需要输出生存率的时间 按临床节点预先规定,单位与随访时间一致
比较全部参数分布 拟合并排序 8 类模型 用于相对拟合与敏感性分析
进行观察期外生存外推 把预测延伸到最大观察时间之后 仅在研究问题确有需要时使用
进行模型拟合诊断 输出残差诊断 建议保留

所有 6 张结果表和 3 幅图默认勾选。左侧不提供图像宽高设置,每幅图在页面和下载中使用稳定尺寸。

一键自动生成以下表格和图形:

  • 完整案例、事件映射、参考组、协变量、当前分布和预测范围概览;
  • 8 类参数分布的 AIC、BIC、差值和排序;
  • 分布参数与协变量效应表;
  • 指定时间点各组生存概率及置信区间;
  • 观察期内和观察期外生存预测明细;
  • 参数生存曲线与非参数阶梯估计;
  • 风险函数图和 Cox-Snell 残差诊断图;
  • Word 报告、生存预测 CSV 和多格式统计图。

10.82.6 使用步骤

10.82.6.1 1. 进入模块

顶部菜单选择 “按统计学分类模块” → “生存分析” → “参数生存模型”

10.82.6.2 2. 选择时间、状态、事件和分组

“随访时间”选择从研究起点到事件或末次随访的时间;“结局状态”选择包含事件与删失的字段;再明确事件水平、分组变量和分组参考水平。状态存在多个非事件水平时,它们会统一视为删失,必须确认这与研究定义一致。

10.82.6.3 3. 选择协变量

可选择连续和分类协变量,并用“将已选协变量纳入参数模型”控制是否调整。连续协变量的组别预测固定在样本中位数,分类协变量固定在其参考水平,因此预测表表示代表性协变量组合下的条件生存率。

参数生存模型:完整高分辨率设置面板
参数生存模型:完整高分辨率设置面板
参数生存模型:分析概览
参数生存模型:分析概览

10.82.6.4 4. 设置分布、时间点和外推

默认选择 Weibull。若选择 Royston-Parmar 样条,再设置结点数和尺度。报告时间点用逗号分隔;需要长期预测时勾选外推并设置终点,填 0 表示最大观察时间的 2 倍。

10.82.6.5 5. 运行并核对概览

点击 “开始参数生存模型分析”。先核对完整案例数、事件数、删失数、事件映射、参考组、协变量、当前分布、最大观察时间和预测终点。输入、拟合、绘图或下载错误会显示在当前模块中,不会使整个应用退出。

10.82.7 结果解释

10.82.7.1 参数分布比较

首先查看各分布是否成功拟合,再比较 AIC、BIC 和 AIC 差值。AIC 排名第一表示相对拟合最好,不表示其他模型错误。分布选择应综合 AIC/BIC、参数曲线与非参数阶梯估计的吻合、残差诊断、风险形状是否合理以及长期临床知识。

参数生存模型:候选分布比较
参数生存模型:候选分布比较

10.82.7.2 模型参数与协变量效应

“参数类型”区分分布参数和协变量效应。分布参数用于确定基线曲线形状,通常不按临床效应直接解释;协变量效应需要同时查看系数、指数化效应、置信区间、P 值和“效应解释尺度”。分类变量参数按“当前水平 vs 参考水平”显示。

参数生存模型:模型比较、参数与协变量效应
参数生存模型:模型比较、参数与协变量效应

10.82.7.3 指定时间点生存率

预测表按分组和报告时间点给出生存概率及置信区间。结果是在其他协变量固定为代表值时计算的条件预测,不是未经调整的原始 Kaplan-Meier 比例。观察期内结果仍依赖所选参数分布,但有实际数据支持;观察期外结果还依赖外推假设,二者必须分开表述。

参数生存模型:指定时间生存率与外推结果
参数生存模型:指定时间生存率与外推结果

10.82.8 图形解释

10.82.8.1 参数生存曲线

实线和阴影分别表示参数模型估计的生存概率及置信区间,虚线阶梯表示非参数估计。两者在主要观察区间内越接近,说明当前分布越能重现经验曲线;竖线表示最大观察时间,其右侧属于模型外推。

参数生存模型:参数曲线与非参数估计
参数生存模型:参数曲线与非参数估计

10.82.8.2 风险函数图

风险函数图展示事件瞬时风险随时间的变化。指数模型为恒定风险,Weibull 或 Gompertz 通常产生单调风险,其他分布可产生非单调形状。后期风险集少时,即使曲线平滑也不代表估计精确,尤其不能把外推区间的细节当作实际观察。

参数生存模型:风险函数图
参数生存模型:风险函数图

10.82.8.3 Cox-Snell 残差诊断

若模型整体拟合充分,Cox-Snell 残差的经验累计风险应接近 45 度参考线。系统性弯曲、尾部明显偏离或局部异常提示分布形状、协变量形式或效应假设可能不充分。尾部偏离也可能来自风险集过少,应结合样本和随访结构判断。

参数生存模型:Cox-Snell 残差诊断
参数生存模型:Cox-Snell 残差诊断
参数生存模型:图形描述与多格式下载控件
参数生存模型:图形描述与多格式下载控件

10.82.9 表格描述与下载

每张主要表格下方提供“对表格进行中文描述”和“对表格进行英文描述”按钮。每幅图可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF。自动描述需要人工核对事件定义、分布、参考组、协变量代表值和外推边界。

进入 “下载 Word 报告” 页签,可下载当前勾选且成功生成的表格与图形。生存预测 CSV 保存分组、时间、生存概率、置信区间和“观察期内/模型外推”标记,适合审计、补充材料和分布敏感性比较。

参数生存模型:Word 与预测 CSV 下载
参数生存模型:Word 与预测 CSV 下载

建议:先用非参数曲线理解数据,再比较多个临床合理的参数分布;把主要观察期内结果与长期外推分开报告,并至少用一个替代分布进行敏感性分析。模型越灵活,越需要防止尾部过拟合。

10.82.10 论文报告建议

方法部分应说明研究起点、事件和删失定义、时间单位、分组及参考水平、完整案例规则、候选分布、最终分布选择依据、协变量、样条设置、置信水平、报告时间点、诊断方法和外推终点。结果部分依次报告样本与事件数、模型比较、主要协变量效应尺度、关键时间生存率、诊断结论和外推敏感性。

可参考如下写法:

采用参数生存模型估计各治疗组的生存函数,以标准治疗为参考,并调整年龄和临床分期。比较候选分布的 AIC、BIC、参数曲线与非参数估计及 Cox-Snell 残差后,选择 Weibull 分布作为主要模型。报告 12、24 和 36 个月条件生存概率及 95% 置信区间。最大观察时间之后的预测作为模型外推单独呈现,并使用替代分布进行敏感性分析。

协变量效应应根据输出表中的尺度写成时间比、风险比或生存优势比,不能把所有指数化系数统一写成 HR。实际论文应补充具体估计值、置信区间和模型比较指标。

10.82.11 常见问题

1. 参数模型与 Cox 模型有什么区别?

Cox 模型不规定基线风险的具体分布,重点估计比例风险效应;参数模型规定完整时间分布,能够直接得到平滑生存与风险函数并进行外推,但对分布假设更敏感。

2. 默认为什么使用 Weibull?

Weibull 能表示恒定、递增或递减风险,结构相对简洁,适合作为起点。默认不代表最终一定选择 Weibull,仍应比较候选分布与诊断结果。

3. AIC 最小的模型一定最好吗?

不一定。AIC 只反映当前数据上的相对拟合与复杂度平衡。长期风险形状、临床合理性、残差诊断和替代分布敏感性同样重要。

4. 指数化效应为什么有时不是风险比?

不同分布采用不同参数化。加速失效时间模型中的指数化系数通常是时间比;比例风险尺度模型中才通常解释为风险比。应以“效应解释尺度”列为准。

5. 时间比大于 1 如何解释?

在加速失效时间尺度下,一般表示事件时间被延长。例如时间比 1.20 可描述为在其他变量相同条件下,典型事件时间约为参考水平的 1.20 倍,而不是风险升高 20%。

6. 样条结点越多越好吗?

不是。更多结点增加灵活度,也增加参数量和尾部不稳定风险。应结合事件数、AIC/BIC、残差和曲线形状选择,并进行敏感性分析。

7. 为什么不同分布在观察期内接近、外推期差异很大?

观察数据约束了观察期内曲线,但无法直接约束未来尾部;不同分布对尾部衰减方式的假设不同,因此外推会逐渐分离。这正是需要分布敏感性分析的原因。

8. 预测表中的协变量取什么值?

连续协变量固定在当前完整案例的中位数,分类协变量固定在其参考水平。预测因此对应代表性条件组合,而非每组原始人群的边际平均。

9. 可以使用多个事件状态吗?

模块把用户指定水平视为事件,其余状态统一视为删失。如果其他状态会阻止目标事件,应使用竞争风险分析,而不是简单当作删失。

10. 输入或某个分布拟合失败会不会使整个应用退出?

不会。输入错误或当前模型失败会显示在模块中;比较多个分布时,单个分布失败会保留失败原因,其余模型继续比较,整个应用和会话不会退出。

10.82.12 小结

本模块的可靠使用流程是:先明确事件与删失并检查非参数曲线,比较多个临床合理的参数分布,核对效应解释尺度和指定时间生存率,再结合残差诊断确定主要模型;所有观察期外结果都应标为模型外推,并用替代分布和外部知识检验其稳健性。 ## 多元正态性检验 {#multivariate-normality}

10.82.13 模块功能

本模块用于判断一组连续变量的联合分布是否明显偏离多元正态分布,并同时检查各变量的边际正态性、描述统计和多元异常值。它适合在多元方差分析、线性判别分析、因子分析、典型相关和其他依赖多元分布假设的方法之前进行数据诊断。

多元正态性不是“每个变量分别正态”的简单相加。即使每个变量单独看起来近似正态,它们的联合分布仍可能因为相关结构、尾部形态或多元异常值而偏离多元正态;反过来,轻度边际偏态也不一定使大样本多元模型完全不可用。因此,本模块同时提供数值检验和图形诊断,帮助研究者基于研究设计、样本量和后续模型的稳健性作出判断。

当研究者已经确定:

  • 有两个或以上连续变量需要共同进入多元模型;
  • 后续方法对联合正态性或组内多元正态性有要求;
  • 需要比较不同正态性检验对同一数据的结论;
  • 需要识别多元异常值,而不仅是逐变量异常值;
  • 数据存在缺失、偏态或量纲差异,需要评估插补、变换或标准化后的分布;
  • 需要保存完整统计表、诊断图和处理后数据;

就可以使用本模块完成多元与单变量正态性检验、分组诊断、异常值检测、图形检查和 Word 报告。

10.82.14 适用场景

本模块适合以下问题:

  1. 在多元(协)方差分析前,检查多个连续结局在各研究组中的联合分布;
  2. 在线性判别分析前,检查各类别中的判别变量是否近似多元正态;
  3. 在探索性或验证性因子分析前,了解条目分布和多元异常值;
  4. 在结构方程或路径分析前,评估连续观测变量的偏态、峰度和联合分布;
  5. 比较原始数据与变换后数据的分布改善程度;
  6. 检查某些观察是否只在多个变量联合考虑时表现异常。

多结局临床研究例子:研究者准备比较三种治疗方案对血压、血脂、炎症指标和生活质量评分的整体影响。可以把 4 个连续结局放入分析变量,把治疗组放入分组变量,分别查看每组的 Henze-Zirkler 检验、多元 Q-Q 图和异常值表,再决定是否继续使用多元方差分析或增加稳健性分析。

不建议用于以下情况:

  • 只有一个连续变量,此时应使用单变量正态性诊断;
  • 分析变量是名义分类、自由文本、日期或患者 ID;
  • 每组样本数小于变量数,协方差矩阵无法稳定估计;
  • 变量之间存在完全线性关系或某个变量没有变异;
  • 把“P 值大于 0.05”理解为已经证明数据严格正态;
  • 只为了得到不显著结果而反复尝试变换或删除异常值。

10.82.15 支持的分析内容

本模块支持以下分析和结果:

  • Henze-Zirkler、Mardia、Henze-Wagner、Royston、Doornik-Hansen 和 Energy 六种多元正态性检验;
  • Anderson-Darling、Shapiro-Wilk、Shapiro-Francia、Cramer-von Mises 和 Lilliefors 五种单变量检验;
  • 不分组或按一个分类变量逐组分析;
  • 完整案例、均值插补、中位数插补和多重插补四种缺失处理;
  • 对数、平方根、平方、Box-Cox、含负值 Box-Cox 和 Yeo-Johnson 变换;
  • 处理后变量标准化;
  • 分位数法和调整法多元异常值检测;
  • 可选 Bootstrap P 值与重抽样次数;
  • 分析概览、组别处理记录、多元检验、单变量检验、描述统计和异常值表;
  • 多元正态 Q-Q 图、单变量正态 Q-Q 图、变量箱线图和直方图;
  • 主要表格和图形的中文与英文描述;
  • Word 报告和处理后数据 CSV 下载。

10.82.16 主要特点

  • 左侧面板按变量、检验、数据处理、表格和图形分区;
  • 所有结果表和诊断图默认勾选,打开模块后只需选择变量即可分析;
  • 分组分析逐组运行,一个组失败不会使其他组或整个 Shiny 会话中断;
  • 输入错误和统计计算错误会显示在结果区,页面仍可修改参数后重新分析;
  • 主要 flextable 表格提供“对表格进行中文描述”和“对表格进行英文描述”按钮;
  • 每幅图提供中文和英文图形描述,并可下载 PNG、TIFF、SVG 或 PDF;
  • 左侧不提供图像宽高设置,图形下载组件使用各图自带的合理尺寸;
  • Word 报告保留当前勾选的表格和图形,处理后数据可单独下载 CSV。

10.82.17 六种多元检验如何选择

检验 主要特点 建议场景
Henze-Zirkler 对多类偏离具有较均衡的检验能力 一般用途和默认首选
Mardia 分别考察多元偏度和多元峰度 希望区分偏度与峰度来源
Henze-Wagner 基于经验特征函数距离 作为一般检验的敏感性分析
Royston 综合各变量的正态性信息 变量数不多且样本量适中
Doornik-Hansen 对偏度和峰度进行变换后联合检验 作为总体偏离的补充判断
Energy 基于能量距离并使用重抽样 怀疑复杂非正态结构时

没有一种检验在所有样本量、维度和偏离类型下都绝对最好。初次分析可从 Henze-Zirkler 开始,再使用 Mardia 或 Energy 做敏感性比较。若不同检验结论不一致,应查看 Q-Q 图、偏度、峰度、异常值和样本量,而不是只选择符合预期的结果。

10.82.18 五种单变量检验如何选择

检验 主要特点 注意事项
Anderson-Darling 对尾部分布较敏感 适合作为默认边际检验
Shapiro-Wilk 常用且对多类偏离较敏感 大样本中很小偏离也可能显著
Shapiro-Francia 与 Shapiro-Wilk 思路接近 可用于补充检查尾部和线性关系
Cramer-von Mises 比较经验分布与理论分布的整体距离 与图形结合解释
Lilliefors 均值和方差由样本估计的正态性检验 适合作为 K-S 类检验的修正版本

单变量检验不能替代多元检验。论文中若后续模型依赖联合分布,应优先报告多元检验,并把单变量检验、偏度、峰度和图形作为诊断依据。

10.82.19 生成的表格和图形

一键自动生成以下表格和图形:

结果主面板分为“分析概览”“正态性检验”“描述与异常值”和“统计图”四个标签页。

1. 分析概览与组别处理记录

用于复核原始案例数、成功分析案例数、变量、分组、检验方法、缺失处理、变换、标准化、Bootstrap 和异常值阈值。组别处理记录会明确列出每个组是否成功,以及失败组的可读原因。

多元正态性检验:分析概览
多元正态性检验:分析概览

2. 多元与单变量正态性检验

多元检验表报告检验统计量、自由度、P 值、计算方法和结论;Mardia 检验会分别报告偏度与峰度。单变量检验表按分组和变量报告边际正态性。

多元正态性检验:数值检验
多元正态性检验:数值检验

3. 描述统计与多元异常值

描述统计表包含样本量、均值、标准差、中位数、四分位数、范围、偏度和峰度。异常值表报告原始行号和马氏距离;未启用检测或未发现异常值时也会保留明确说明。

多元正态性检验:描述与异常值
多元正态性检验:描述与异常值

4. 四类诊断图

多元 Q-Q 图比较平方马氏距离与理论卡方分位数;单变量 Q-Q 图检查各变量边际分布;箱线图显示离群、偏态和组间尺度;直方图与密度曲线显示整体分布形态。

多元正态性检验:统计图
多元正态性检验:统计图

数值检验与图形可能给出不同强度的信号。大样本中轻微偏离也可能有很小的 P 值;小样本中检验能力有限。应结合后续模型对非正态的稳健性、组内样本量和异常值来源综合判断。

10.82.20 数据准备

10.82.20.1 数据格式

数据采用宽格式:每行代表一个研究对象或独立观察,每列代表一个连续指标。可选分组变量用于逐组检验。

ID Treatment Biomarker1 Biomarker2 Score
P001 Control 2.31 4.82 56
P002 Control 1.98 5.11 61
P003 Treatment 3.02 4.37 52

分析变量必须为数值型。患者 ID、文本、日期和名义分类变量不要放入连续变量列表;治疗组、疾病分期或风险组可以作为可选分组变量。

10.82.20.2 分析前检查

建议在分析前完成以下检查:

  1. 变量单位、方向和编码是否正确;
  2. 是否存在明显录入错误或不可能值;
  3. 每个变量是否有足够变异;
  4. 变量之间是否存在完全重复或精确线性组合;
  5. 每个组的有效案例数是否大于变量数;
  6. 缺失比例和缺失机制是否支持所选处理方法;
  7. 变换是否有明确的数据分布或分析计划依据。

10.82.21 操作步骤

顶部菜单选择 “按统计学分类模块” → “多元统计假设检验” → “多元正态性检验” 进入模块。

  1. 在“连续变量”中选择至少 2 个数值型变量;
  2. 如需检查各组内分布,选择一个分组变量;否则保留“不分组”;
  3. 选择多元检验。初次分析可保留 Henze-Zirkler;
  4. 选择单变量检验。默认 Anderson-Darling;
  5. 需要小样本重抽样推断时,勾选 Bootstrap 并设置次数;
  6. 根据缺失情况选择完整案例、均值、中位数或多重插补;
  7. 如有明确依据,选择一种边际变换或幂变换;两类变换不要同时启用;
  8. 量纲差异较大时可勾选标准化;
  9. 根据需要选择多元异常值方法和显著性水平;
  10. 保留所需表格和图形,点击“开始多元正态性检验”。
多元正态性检验:完整设置面板
多元正态性检验:完整设置面板

10.82.22 缺失数据处理

方法 处理方式 建议
完整案例 删除任一分析变量缺失的案例 缺失很少且近似完全随机时
均值插补 用变量均值替代缺失 仅适合作为简单敏感性检查,可能低估方差
中位数插补 用变量中位数替代缺失 偏态变量的简单敏感性检查
多重插补 根据变量间关系生成插补值 缺失较多且需要更合理保留信息时

本模块下载的是当前处理后的数据。均值和中位数插补会压缩不确定性,不宜直接作为正式论文分析的唯一缺失处理;多重插补的正式推断通常还需要对多个插补数据集分别分析并合并估计。本模块中的多重插补主要用于当前分布诊断。

10.82.23 变量变换与标准化

  • 对数变换:要求所有有效值严格大于 0,适合明显右偏且量级跨度大的变量;
  • 平方根变换:要求所有有效值不小于 0,常用于计数样或轻中度右偏数据;
  • 平方变换:会放大大值差异,只有在有明确分布依据时使用;
  • Box-Cox:要求严格正值并由数据估计幂参数;
  • 含负值 Box-Cox:允许零或负值,通过额外平移参数处理;
  • Yeo-Johnson:允许零和负值,适合有符号连续变量;
  • 标准化:把处理后的变量变为均值 0、标准差 1,改变单位但不保证正态。

边际变换和幂变换只能选择一类。变换不是为了“把 P 值调到不显著”,而是为了改善模型尺度、减少极端偏态或满足预先规定的分析策略。变换后结果应按变换尺度解释,并在 Methods 中说明。

10.82.24 多元异常值如何阅读

多元异常值是指某个观察在多个变量联合空间中距离总体中心较远。它可能在每个单变量图中都不极端,但组合起来非常少见。

  • 分位数法:用马氏距离与卡方分位数阈值比较;
  • 调整法:使用稳健位置和协方差估计,对异常值污染更不敏感;
  • 显著性水平:越小通常判定越严格,识别的观察越少。

发现异常值后应先检查原始行号对应的病历、测量和录入过程,再考虑数据更正、预设排除或敏感性分析。不能只因为某行影响正态性检验就删除。

异常值检测不是自动清洗规则。真实的罕见患者、重症个体或极端但合理的测量也可能被标记。正式分析应说明异常值处理依据,并比较保留与排除后的结果是否一致。

10.82.25 结果表和图形如何阅读

建议按以下顺序阅读:

  1. 先看分析概览,确认变量、分组、有效案例数、缺失和变换;
  2. 查看组别处理记录,确认没有组因样本不足或协方差矩阵不可逆而失败;
  3. 查看多元检验 P 值和结论;
  4. 查看单变量检验、偏度和峰度,定位偏离来源;
  5. 查看多元 Q-Q 图,关注尾部和系统性弯曲;
  6. 查看单变量 Q-Q、箱线图和直方图;
  7. 对照异常值表核查原始数据;
  8. 根据后续模型的稳健性决定是否变换、采用稳健方法或做敏感性分析。

P 值小于预设显著性水平表示数据与多元正态假设存在统计学不一致;P 值大于显著性水平只表示当前样本没有提供足够证据拒绝该假设。不要写成“数据已被证明服从正态分布”。

10.82.26 分组分析

许多多元模型要求的是“每个研究组内”近似多元正态,而不是把所有组混在一起后整体正态。因此,当后续分析包含治疗组、疾病分期或类别结局时,建议把相应分类变量放入分组菜单。

模块会逐组运行。若某个组样本太少、变量无变异或协方差矩阵不可逆,该组会在“组别处理记录”中标记失败,其他组仍继续生成结果。正式解释时应先解决失败组的数据问题,不能只报告成功组而忽略失败组。

10.82.27 Bootstrap 如何使用

Bootstrap 通过重复重抽样估计检验统计量的参考分布,适合样本量不大或渐近近似可能不足的情况。次数越多,随机误差通常越小,但计算时间越长。初步检查可使用 500 至 1000 次;正式报告可根据计算资源和分析计划增加次数,并设置随机种子保证可重复性。

Energy 检验本身依赖重抽样次数。使用 Bootstrap 时应在 Methods 中报告检验名称、重抽样次数和分组方式。

10.82.28 表格描述和统计图描述

主要结果表格下方有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把当前变量、分组、样本量和检验方法作为背景,生成医学论文 Results 部分风格的描述文字。

每幅统计图同样提供中文和英文描述按钮。建议先人工确认图形和表格一致,再把描述作为写作初稿;自动描述不能替代研究者对异常值来源、变量医学意义和后续模型稳健性的判断。

10.82.29 Word 报告

“下载Word报告”会导出当前勾选的统计表和诊断图;“下载处理后数据 CSV”会保存当前完整案例、插补、变换和标准化后的分析数据,并保留原始行号。

多元正态性检验:下载页面
多元正态性检验:下载页面

Word 报告适合用于:

  • 保存当前分析设置和完整诊断结果;
  • 给导师、合作者或统计人员审阅;
  • 比较不同检验、变换或缺失处理方案;
  • 起草论文 Methods 和 Results;
  • 记录异常值核查和敏感性分析依据。

请用 Microsoft Word 打开导出的文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.82.30 从模块结果转入论文写作

如果计划把本模块结果写入论文,建议按以下逻辑整理:

  1. 在 Methods 中说明纳入的连续变量和分组变量;
  2. 说明缺失数据处理、变量变换和标准化方法;
  3. 报告主要多元正态性检验名称和显著性水平;
  4. 使用 Bootstrap 时报告重抽样次数;
  5. 说明多元异常值检测方法和阈值;
  6. 在 Results 中报告各组有效样本数、检验统计量和 P 值;
  7. 用“未发现显著偏离”代替“证明正态”;
  8. 简要说明 Q-Q 图、偏度、峰度和异常值是否支持数值检验;
  9. 如果假设明显不满足,说明采用的变换、稳健方法或敏感性分析。

结果写作示例:在完整案例中,Henze-Zirkler 检验未发现 A 组联合分布显著偏离多元正态性(HZ = 0.71,P = 0.18),但 B 组显示偏离(HZ = 1.09,P = 0.012)。B 组多元 Q-Q 图尾部向上偏离,并识别出 2 个高马氏距离观察。核查原始记录后保留这些有效观察,并在后续多元模型中补充稳健性分析。

10.82.31 常见问题

1. 每个变量的 Shapiro-Wilk 都不显著,是否就满足多元正态?

不能。边际正态不保证联合正态,还需查看多元检验和多元 Q-Q 图。

2. P 值大于 0.05 能否写“数据服从正态分布”?

不建议。更准确的写法是“未发现显著偏离正态性”。检验不显著可能来自分布接近正态,也可能来自样本量小和检验能力不足。

3. 样本很大时为什么总是显著?

大样本能检测到很小的分布偏离。此时应查看图形、偏度、峰度、异常值和后续模型稳健性,不应只凭 P 值否定所有参数方法。

4. 应该选哪一种多元检验?

一般可从 Henze-Zirkler 开始,再用 Mardia 或 Energy 做敏感性分析。选择应在分析前确定,不能根据结果反复挑选。

5. Mardia 为什么有两行结果?

因为它分别检验多元偏度和多元峰度。任一部分显著都提示联合分布存在相应类型的偏离。

6. 是否必须把所有连续变量都放进去?

应选择后续多元模型实际共同使用的变量。加入无关变量会改变维度、协方差结构和检验结论。

7. 分组变量应该怎么选?

若后续模型比较治疗组或类别,应按该类别逐组检查;如果后续分析不分组,可保留“不分组”。

8. 发现异常值后是否直接删除?

不能。先核对原始数据和医学合理性,再根据预设规则决定是否更正、排除或做敏感性分析。

9. 对数变换和 Box-Cox 可以同时选择吗?

不可以。两类变换应二选一;同时选择时模块会给出明确提示并保持页面可用。

10. 标准化能让数据变正态吗?

不能。标准化只改变位置和尺度,不改变偏度、尾部或异常值结构。

11. 多重插补后为什么仍需谨慎?

本模块使用处理后的一个数据集进行分布诊断;正式多重插补推断通常需要在多个插补数据集上分析并合并结果,不能把单次诊断等同于完整合并推断。

12. 某个组失败但其他组有结果,应该怎么办?

先查看组别处理记录。常见原因是样本太少、变量无变异或完全线性依赖。应调整变量或数据结构后重新分析,不能忽略失败组。

13. 为什么处理后数据行数少于原始数据?

选择完整案例时,任一分析变量缺失的行会被排除;分组变量缺失的行也不能进入分组分析。分析概览会报告排除案例数。

14. 多元正态性不满足,还能做 MANOVA 或判别分析吗?

需要结合样本量、各组平衡性、异常值、协方差齐性和方法稳健性判断。可考虑变换、稳健方法、置换方法或敏感性分析,不能只根据单个检验自动决定。

10.82.32 小结

本模块的最佳用法是:先按后续模型实际使用的连续变量和分组结构进行诊断,再把多元检验、边际检验、Q-Q 图、偏度峰度和异常值结合起来解释;必要时使用有依据的缺失处理、变换或稳健性分析。

多元正态性是模型诊断的一部分,不是机械通行证。检验显著不等于模型一定无效,检验不显著也不等于假设已经被证明。透明报告数据处理、组内样本量和敏感性分析,比追求一个“不显著”的 P 值更重要。

10.83 典型相关分析

10.83.1 模块功能

本模块用于分析两组连续变量之间的整体线性关联。它不是逐对计算普通相关,而是在集合 1 中寻找线性组合 \(U=a_1X_1+\cdots+a_pX_p\),在集合 2 中寻找线性组合 \(V=b_1Y_1+\cdots+b_qY_q\),使 \(U\)\(V\) 的相关最大。第一对典型变量解释最强关联,后续函数在与前面函数不相关的条件下继续解释剩余关联。

当研究者已经确定:

  • 研究问题包含两组具有明确理论含义的连续指标;
  • 关心的是两个变量集的整体关联,而不只是某一对变量的相关;
  • 希望确定哪些原始变量主要定义显著的典型函数;
  • 需要量化一个变量集可以解释另一变量集多少平均方差;
  • 需要保存典型得分、表格、图形和 Word 报告;

就可以使用本模块完成典型相关、显著性检验、载荷解释和冗余分析。

10.83.2 适用场景

本模块适合以下问题:

  1. 评估血压、血脂和炎症指标整体与生活质量、功能和症状评分的关联;
  2. 研究认知指标组与脑影像指标组的多变量关联;
  3. 分析体格指标组与代谢指标组之间是否存在主要共变模式;
  4. 在多个暴露指标和多个结局指标之间探索低维线性结构;
  5. 为后续回归、分类或结构方程模型生成有理论含义的典型得分。

心血管与患者报告结局例子:集合 1 放入收缩压、舒张压和炎症指标,集合 2 放入生活质量、临床评分和功能指标。若第一典型函数显著,可再通过两侧载荷判断它主要代表“心血管/炎症负担”与“患者功能/症状”的哪种共变模式。

不建议用于以下情况:

  • 变量是名义分类、自由文本、日期或患者 ID;
  • 两个变量集之间没有事先明确的理论分工;
  • 样本量过小,或变量数相对样本量过多;
  • 集合内变量存在完全共线或基本没有变异;
  • 存在明显多元异常值,但尚未核查其数据质量;
  • 研究目标是推断因果效应,而不是描述多变量线性关联。

10.83.3 支持的分析内容

本模块支持:

  • 两组各 1 至 10 个不重叠连续变量;
  • 完整案例排除与样本数报告;
  • 典型相关系数、平方值、特征值、解释比例和累积解释比例;
  • 序贯 Wilks’ Lambda 卡方检验;
  • Pillai、Hotelling-Lawley、Wilks 和 Roy 四种多元总体检验;
  • 标准化典型系数、典型载荷和交叉载荷;
  • 方差提取比例和冗余度;
  • 典型相关系数图、第一典型函数得分图和载荷热图;
  • 主要表格和图形的中文与英文描述;
  • Word 报告和典型得分 CSV。

10.83.4 主要特点

  • 左侧界面仅保留变量集和输出选项,不设置冗余的图像宽高输入;
  • 8 张主表和 3 幅图默认全部勾选;
  • 重复变量、样本不足、零方差和完全共线会显示明确中文错误;
  • 分析失败时不中断 Shiny 会话,可在原页面修改后继续分析;
  • 每张主表提供“对表格进行中文描述”和“对表格进行英文描述”;
  • 每幅图可生成中英文描述,并下载 PNG、TIFF、SVG 或 PDF;
  • Word 报告与界面当前勾选的表格和图形保持一致。

10.83.5 生成的表格和图形

一键自动生成以下表格和图形:

1. 分析概览

核对原始案例、完整案例、排除案例、两组变量和典型函数数量。

典型相关分析:分析概览
典型相关分析:分析概览

2. 典型相关和显著性检验

典型相关表显示每个函数的关联强度;序贯检验用于判断从第几个函数开始剩余关联已不显著;四种多元检验评估总体关联。

典型相关分析:相关与检验
典型相关分析:相关与检验

3. 标准化系数、载荷和交叉载荷

系数用于构建典型得分,载荷用于识别原始变量如何定义本侧典型变量,交叉载荷用于描述原始变量与对侧典型变量的相关。

典型相关分析:系数与载荷
典型相关分析:系数与载荷

4. 冗余分析与得分

冗余度表示某变量集的平均方差被对侧典型变量解释的比例。典型得分通过 CSV 下载,并保留原始行号。

典型相关分析:冗余分析
典型相关分析:冗余分析

5. 三类统计图

条形图展示各典型相关系数;散点图展示第一对典型得分;热图展示每个原始变量在各函数上的载荷方向和强度。

典型相关分析:统计图
典型相关分析:统计图

10.83.6 数据准备

10.83.6.1 数据格式

数据使用宽格式:每行代表一个独立研究对象,每列代表一个连续指标。

ID SBP DBP CRP QualityOfLife SymptomScore FunctionScore
P001 132 81 2.4 58 42 69
P002 118 73 1.1 71 31 82
P003 145 89 4.7 49 55 57

患者 ID、分类变量、日期和自由文本不能放入任一变量集。

10.83.6.2 分析前检查

  • 两个变量集是否由研究问题事先界定;
  • 测量方向是否一致,高分和低分的临床含义是否明确;
  • 是否存在明显输入错误、非法值或极端异常值;
  • 每个变量是否有足够变异;
  • 集合内是否存在重复变量或精确线性组合;
  • 完整案例数是否足以支持所选变量数;
  • 缺失排除是否可能引入选择偏倚。

典型相关在样本小、变量多时容易过度估计。“能算出结果”不等于结果稳定,应结合先验研究设计、样本量和外部验证考虑。

10.83.7 操作步骤

顶部菜单选择 “按统计学分类模块” → “聚类分析与多元统计” → “典型相关分析” 进入模块。

  1. 在“集合 1 变量”中选择第一组连续指标;
  2. 在“集合 2 变量”中选择第二组连续指标;
  3. 确认两组没有重复变量;
  4. 保留需要的表格和图形,默认已全部勾选;
  5. 点击“开始典型相关分析”;
  6. 先核对分析概览,再按“相关与检验”“系数与载荷”“冗余与得分”“统计图”阅读。
典型相关分析:完整设置面板
典型相关分析:完整设置面板

10.83.8 如何确定显著的典型函数

建议按以下顺序:

  1. 先看四种多元总体检验,判断两组变量总体是否有关联;
  2. 查看序贯检验的第一行,它同时检验所有典型函数;
  3. 若第一行显著,继续看第二行,其检验排除第一函数后的剩余函数;
  4. 当某一行不显著时,通常不再对后续函数做实质解释;
  5. 同时核对典型相关系数和冗余度,因为统计显著不代表实质解释量很大。

典型相关系数的平方是两个典型得分的共享方差,不是原始变量集平均被解释的方差。后者要查看冗余度。

10.83.9 系数、载荷和交叉载荷

指标 定义 主要用途
标准化典型系数 构建典型得分的权重 重现得分,谨慎解释单个权重
典型载荷 原始变量与本侧典型得分的相关 识别函数在本变量集中代表什么
交叉载荷 原始变量与对侧典型得分的相关 表示单个原始变量与对侧函数的直接关联

当集合内变量高度相关时,标准化系数可能很不稳定,并出现系数方向与单变量相关不一致的情况。因此,为典型函数命名和进行医学解释时,通常优先查看典型载荷,并结合交叉载荷。

10.83.10 冗余分析

对某一典型函数:

  • 方差提取比例:该侧各原始变量载荷平方的平均;
  • 冗余度:方差提取比例 × 典型相关系数平方。

冗余度回答的是“对侧典型变量平均能解释本变量集多少方差”。一个函数可能具有较高典型相关,但如果本侧载荷整体不高,其冗余度仍可能较小。

10.83.11 统计图如何阅读

  • 典型相关系数图:快速判断关联是否主要集中在第一函数;
  • 第一典型函数得分图:查看两侧第一得分的线性关系、散布和潜在异常点;
  • 典型载荷热图:同时比较各变量在不同函数上的正负方向和绝对大小。

载荷整体乘以 -1 不改变典型相关或实质含义,因此不要把单纯的正负号反转误解为结果矛盾。关键是同一函数内变量之间的相对方向和强度。

10.83.12 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合两个变量集、完整案例数和当前表格生成医学论文 Results 风格的描述初稿。

每幅图也提供中文和英文描述。自动描述不会把图形直接解读为显著性、因果关系或临床建议;使用前仍应由研究者核对变量方向和专业含义。

10.83.13 Word 报告与得分下载

“下载 Word 文档”会导出当前勾选的统计表和图形;“下载典型得分 CSV”会保存完整案例的两侧典型得分并保留原始行号。

典型相关分析:下载页面
典型相关分析:下载页面

请用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.83.14 从模块结果转入论文写作

建议按以下逻辑整理:

  1. 在 Methods 中说明两个变量集及其理论依据;
  2. 说明完整案例处理、最终样本量和两侧变量数;
  3. 报告多元总体检验和序贯 Wilks’ Lambda 检验;
  4. 对每个需要解释的函数报告典型相关系数及平方;
  5. 使用典型载荷说明函数在两个变量集中的实质含义;
  6. 报告冗余度,避免把高典型相关误解为高平均解释量;
  7. 说明异常值、多元正态性和样本量稳定性的诊断情况。

结果写作示例:典型相关分析显示,两组变量的总体关联显著(Wilks’ Lambda = 0.218,近似 F = 53.68,P < 0.001)。第一典型函数显著(r = 0.880),而排除第一函数后的剩余函数未达统计学显著性(P = 0.117)。集合 1 中收缩压、舒张压和炎症指标在第一函数上绝对载荷较高,集合 2 中生活质量、临床评分和功能指标也主要定义该函数,提示两组指标共享一个主要线性共变模式。

10.83.15 常见问题

1. 两个变量集可以重复吗?

不可以。同一变量不能同时放入集合 1 和集合 2。

2. 每个变量集必须有相同数量的变量吗?

不需要。典型函数数量由两个变量集中较少的变量数决定。

3. 第一典型相关很高,是否就说明两组原始变量高度相关?

只能说明两组的最优线性组合高度相关。原始变量平均被对侧解释的程度还要看冗余度。

4. 应该解释多少个典型函数?

通常只解释序贯检验显著、典型相关有实质大小、载荷可理解且冗余度有意义的函数。

5. 为什么标准化系数和载荷方向不一致?

集合内共线性可使系数对小的数据变化很敏感。载荷是原始变量与典型得分的相关,通常更适合作实质解释。

6. 载荷全部反号,是否结果变了?

没有。同一函数的两侧得分、系数和载荷同时反号,不改变典型相关和实质含义。

7. 缺失数据怎么处理?

当前模块使用完整案例,任一入选变量缺失的行会被排除。应在分析概览中核对排除数,并评估缺失机制。

8. 为什么提示完全线性依赖?

常见原因是放入了重复变量、总分与构成分同时进入,或一列是其他列的精确线性组合。应根据研究问题减少冗余变量。

9. 典型相关能证明因果吗?

不能。它描述两个变量集的线性关联,不能自动排除混杂、逆向因果或选择偏倚。

10. 可以将典型得分用于后续分析吗?

可以,但应保留原始行号并注意得分是在当前样本中估计的。用于新样本时需要固定同一组预处理和系数,并做外部验证。

10.83.16 小结

本模块的最佳用法是:先根据理论划分两个变量集,再按总体检验、序贯检验、典型相关、载荷和冗余度的顺序判断哪些函数值得解释。

典型相关是多变量探索与假设检验工具,不是自动的变量选择器或因果分析方法。透明报告样本量、缺失排除、变量集定义、载荷和冗余度,比只报告一个较大的典型相关系数更重要。

10.84 重复测量与交叉相关

10.84.1 模块功能

本模块把两个名称相近、统计含义不同的分析放在同一套界面中:

  • 重复测量相关:用于同一对象具有多次成对连续测量的长数据,估计控制对象间均值差异后的对象内共同线性关联;
  • 交叉相关:用于两个按行顺序排列的有序数值序列,估计不同滞后下的相关。

“重复测量相关”回答的是:当同一个对象的测量 1 高于其个人平均水平时,测量 2 是否也倾向于高于其个人平均水平?“交叉相关”回答的是:测量 1 相对测量 2 提前或滞后若干位置时,两序列的相关有多大?

10.84.2 适用场景

10.84.2.1 重复测量相关

适合以下问题:

  1. 同一患者多个访视的炎症指标与症状评分是否同步变化;
  2. 同一受试者多次血压测量与压力评分是否存在对象内关联;
  3. 同一动物多个时间点的生物标志物与组织学评分是否共同变化;
  4. 同一运动员多次训练中的负荷与恢复指标是否相关;
  5. 希望区分对象内关联与对象间均值差异。

纵向随访例子:36 名患者各接受 5 次访视,每次记录生理指标和临床评分。普通 Pearson 相关会混合“不同患者平均水平不同”和“同一患者随时间共同变化”两种信息;重复测量相关通过控制患者固定差异,重点估计后者。

10.84.2.2 交叉相关

适合以下探索性问题:

  1. 连续监测的心率变化是否领先于症状评分变化;
  2. 某项实验信号与另一项同步采集信号在何种滞后下关联最强;
  3. 按等间隔时间记录的暴露序列与结局序列是否存在领先或滞后关系;
  4. 为后续时间序列模型确定可能的滞后范围。

不建议直接使用的情况:

  • 两项测量不是连续数值变量;
  • 重复测量数据没有可靠的对象 ID;
  • 每个对象只有一次观测,却选择重复测量相关;
  • 交叉相关数据行没有按真实时间或空间顺序排列;
  • 两序列具有明显趋势、季节性或强自相关但尚未预处理;
  • 目标是建立调整协变量、非线性关系或随机斜率的纵向模型;
  • 希望仅凭相关分析证明因果、领先机制或生物学通路。

10.84.3 支持的分析内容

本模块支持:

  • 重复测量相关、交叉相关或同时分析;
  • 90%、95% 和 99% 重复测量相关置信区间;
  • 交叉相关最大滞后自动选择或固定为 5、10、20;
  • 非平衡重复次数与完整案例处理;
  • 自动排除只有一次有效配对的对象;
  • 分析概览、重复测量相关系数表和交叉相关系数表;
  • 对象内平行回归线图和交叉相关图;
  • 主表与主图的中文、英文描述;
  • Word 报告和分析明细 CSV。

10.84.4 主要特点

  • 所有表格和图形默认勾选;
  • 左侧没有图像宽高设置,图像按固定出版尺寸渲染;
  • 两种分析使用独立的数据规则,概览会分别报告有效样本;
  • 无对象 ID、重复变量、零方差、对象内无变异和样本不足均显示明确中文错误;
  • 分析失败时不会中断 Shiny 会话,修改设置后可在原页面继续;
  • 每张主表提供“对表格进行中文描述”和“对表格进行英文描述”;
  • 每幅图支持中英文描述和 PNG、TIFF、SVG、PDF 下载;
  • Word 报告与界面当前启用的表格和图形一致。

10.84.5 生成的表格和图形

一键自动生成以下表格和图形:

1. 分析概览

核对分析类型、两个测量变量、原始案例、完整配对、有效对象、置信水平和实际最大滞后。

重复测量与交叉相关:分析概览
重复测量与交叉相关:分析概览

2. 重复测量相关系数

报告相关系数、自由度、P 值、置信区间、有效对象数和有效观测数。

重复测量与交叉相关:重复测量结果
重复测量与交叉相关:重复测量结果

3. 交叉相关系数

逐滞后报告相关系数、有效配对数、近似 95% 界限及是否超出界限。

重复测量与交叉相关:交叉相关结果
重复测量与交叉相关:交叉相关结果

4. 两类统计图

重复测量相关图用对象内平行线展示共同斜率;交叉相关图用竖线展示各滞后相关,并以虚线标出零相关下的近似 95% 界限。

重复测量与交叉相关:统计图
重复测量与交叉相关:统计图

10.84.6 数据准备

10.84.6.1 重复测量相关的数据格式

使用长格式:每行是一名对象在一次访视中的成对测量。

SubjectID Visit Measure1 Measure2
P001 1 78.4 43.1
P001 2 82.7 46.8
P001 3 76.2 40.5
P002 1 71.9 38.4
P002 2 75.1 41.2

对象 ID 可以是因子、字符或整数标识。每个纳入对象至少需要两对完整测量;模块至少需要 3 个有效对象。

10.84.6.2 交叉相关的数据格式

每行是一个等间隔顺序位置。数据行顺序就是序列顺序。

Time Measure1 Measure2
1 12.4 7.1
2 13.8 7.5
3 15.1 8.2
4 14.6 8.9

模块使用两变量完整配对,并在删除缺失配对后按剩余行重新形成连续序列。因此,缺失位置较多时,应先判断这种压缩是否符合研究问题。

交叉相关要求有意义的顺序和大致等间隔观测。若数据按患者、医院或随机顺序排列,计算出的“滞后”没有可解释的时间含义。

10.84.7 操作步骤

顶部菜单选择 “按统计学分类模块” → “相关分析” → “重复测量与交叉相关” 进入模块。

  1. 选择“重复测量相关”“交叉相关”或“同时分析”;
  2. 重复测量相关时选择对象 ID;
  3. 分别选择测量 1 和测量 2;
  4. 选择置信水平和最大滞后;
  5. 保留需要的表格和图形,默认已全部勾选;
  6. 点击“开始相关分析”;
  7. 先核对分析概览,再分别阅读系数表和统计图。
重复测量与交叉相关:完整设置面板
重复测量与交叉相关:完整设置面板

10.84.8 重复测量相关的统计含义

设对象 \(i\) 在第 \(j\) 次观测的两个变量为 \(X_{ij}\)\(Y_{ij}\)。重复测量相关关注去除各对象均值后的共同线性变化,可直观写成:

\[Y_{ij}=\alpha_i+\beta X_{ij}+\varepsilon_{ij}\]

其中 \(\alpha_i\) 是每个对象自己的截距,\(\beta\) 是所有对象共享的斜率。相关系数的方向与共同斜率一致,绝对值表示对象内线性关联强度。

与普通 Pearson 相关相比:

方法 主要信息 对重复观测的处理
普通 Pearson 相关 所有行合并后的总体线性关联 将重复行近似视为独立
对象均值相关 不同对象平均水平之间的关联 每个对象压缩为一行
重复测量相关 同一对象偏离自身均值时的共同变化 控制对象固定差异

较高的重复测量相关并不表示所有对象的斜率完全相同。若怀疑不同对象具有明显不同的斜率、需要调整时间或协变量,宜改用线性混合效应模型。

10.84.9 重复测量结果如何阅读

建议依次查看:

  1. 有效对象数和有效观测数:确认排除后仍覆盖研究对象;
  2. 相关系数:正值表示对象内同向变化,负值表示反向变化;
  3. 置信区间:判断估计精度和可能的效应范围;
  4. P 值:检验总体对象内线性相关是否为 0;
  5. 平行线图:核对共同方向、散布和潜在异常观测。

不要只按“弱、中、强”的固定阈值机械解释。应结合指标测量误差、临床量纲、重复次数和研究领域预期判断实质意义。

10.84.10 交叉相关的统计含义

对滞后 \(k\),本模块计算测量 1 在位置 \(t+k\) 与测量 2 在位置 \(t\) 的相关。于是:

  • \(k=0\):同一顺序位置的相关;
  • \(k>0\):测量 1 的较晚值与测量 2 的较早值相关;
  • \(k<0\):测量 1 的较早值与测量 2 的较晚值相关。

“超出近似界限”表示相关系数绝对值大于约 \(1.96/\sqrt{N}\)。该界限是探索性参照,默认近似序列为独立白噪声;若序列存在自相关、趋势或季节性,界限可能过于乐观。

10.84.11 交叉相关结果如何阅读

  1. 先确认行顺序、间隔单位和实际最大滞后;
  2. 查看 \(k=0\) 的同期相关;
  3. 比较正负滞后下相关峰值的位置、方向和大小;
  4. 核对峰值附近是否形成连续结构,而不是单个偶然尖峰;
  5. 检查两序列的趋势、自相关和季节性;
  6. 将发现的滞后作为后续预先设定模型或外部数据验证的候选,而不是直接作因果结论。

两个共同上升的序列可能在多个滞后上都显示较高相关,即使彼此没有直接关系。必要时应先去趋势、差分或拟合时间序列模型,再分析残差之间的交叉相关。

10.84.12 分析概览中的两套样本数

选择“同时分析”时,概览可能出现两类样本数:

  • 两变量完整配对数/交叉相关序列长度:只要求两个测量变量完整;
  • 重复测量有效观测数:还要求 ID 完整,并剔除最终只有一次有效配对的对象。

因此,两类分析的有效观测数可能不同。论文中应分别报告,不要只写一个笼统的样本量。

10.84.13 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合分析类型、变量、有效对象、序列长度和滞后设置生成医学论文 Results 风格初稿。

每幅图也提供中文和英文描述。自动描述会区分对象内共同斜率和有序序列滞后,不会把图形直接解释为因果关系;研究者仍需核对测量方向、时间单位和临床含义。

10.84.14 Word 报告与明细下载

“下载 Word 文档”会导出当前勾选的统计表和图形。“下载分析明细 CSV”包含原始行号、对象 ID、序列位置、两项测量、对象内中心化值和重复相关拟合值;同时分析时,两类明细以“分析类型”列区分。

重复测量与交叉相关:下载页面
重复测量与交叉相关:下载页面

请用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.84.15 从模块结果转入论文写作

10.84.15.1 重复测量相关

Methods 建议说明:数据为长格式、对象 ID、两项测量、重复次数、完整案例规则、置信水平,以及采用对象内共同斜率估计相关。

结果写作示例:共纳入 36 名对象的 175 对完整重复测量。生理指标与临床评分呈正向对象内相关(\(r_{rm}=0.736\),99% CI 0.618–0.822,\(P<0.001\)),提示同一对象的生理指标高于其个人平均水平时,临床评分也倾向于升高。该结果表示对象内线性关联,不代表因果效应。

10.84.15.2 交叉相关

Methods 建议说明:序列排序变量、采样间隔、缺失处理、最大滞后,以及是否在分析前去趋势或差分。Results 应报告同期相关、主要峰值的滞后和相关系数,并把近似界限称为探索性参照。

10.84.16 常见问题

1. 为什么重复测量相关必须选择 ID?

因为分析需要区分对象内变化与对象间差异。没有 ID 就无法知道哪些行属于同一对象。

2. 每个对象必须有相同次数的观测吗?

不需要。模块支持非平衡重复次数,但每个纳入对象至少需要两对完整测量。

3. 只有一次观测的对象如何处理?

该对象不能贡献对象内变化,会从重复测量相关中排除,并在分析概览报告排除观测数。

4. 为什么普通相关和重复测量相关方向不同?

普通相关混合对象间和对象内信息;两者可能方向不同。这不是计算矛盾,而是回答的问题不同。

5. 相关系数显著,是否说明一个指标影响另一个指标?

不能。相关不能自动排除共同时间趋势、混杂、反向关系或测量偏倚。

6. “最大滞后自动”是什么意思?

系统根据有效序列长度选择常用的探索范围。固定值超过数据允许范围时会自动截断,并在概览显示实际最大滞后。

7. 交叉相关的正负滞后怎么解释?

滞后 \(k\) 表示测量 1 的 \(t+k\) 位置与测量 2 的 \(t\) 位置相关。解释前应明确每一行对应的时间单位。

8. 交叉相关超出虚线就一定显著吗?

不一定。虚线是白噪声假设下的近似界限;趋势、自相关、多重滞后搜索都会增加假阳性风险。

9. 缺失数据如何处理?

两项测量使用完整配对。重复测量还要求 ID 完整;交叉相关会在删除缺失配对后压缩剩余序列。

10. 什么时候应该使用混合效应模型?

需要调整时间、治疗组、协变量、非线性项、随机斜率,或估计组间差异时,应使用线性或广义混合效应模型。

10.84.17 小结

本模块的最佳用法是:先判断研究问题究竟是对象内共同变化,还是有序序列的领先/滞后关联;再选择相应分析并透明报告有效样本、缺失处理和统计限制。

重复测量相关不是普通相关的重复版本,交叉相关也不是纵向混合模型。正确的数据结构、对象 ID 和时间顺序,比得到一个较大的相关系数更重要。

10.85 多水平相关分析

10.85.1 模块功能

本模块用于具有明确群组或聚类结构的连续变量相关分析,例如患者隶属于医院、学生隶属于学校、居民隶属于社区,或重复记录隶属于同一对象。它把同一变量对的关联拆分为两个层级:

  • 群组内相关:在控制各群组平均差异后,考察同一群组内个体偏离本组均值时,两变量是否共同变化;
  • 群组间相关:先计算每个群组的变量均值,再考察不同群组平均水平之间的关联。

模块同时计算 ICC1 和 ICC2,用于判断每个变量的群组聚集程度以及群组均值的可靠性。

多水平相关回答的核心问题是:观察到的总体相关主要来自同一群组内个体差异,还是来自不同群组平均水平之间的差异?

10.85.2 适用场景

适合以下问题:

  1. 多中心研究中,患者层面的收缩压与炎症指标是否相关,同时不同中心的平均水平是否相关;
  2. 学校抽样中,同校学生的学习时间与成绩是否相关,不同学校均值之间是否呈相同方向;
  3. 社区调查中,居民暴露与健康评分的个体层关联是否不同于社区平均暴露与平均健康水平的关联;
  4. 重复测量资料中,记录隶属于对象,希望区分对象内关联与对象平均水平间关联;
  5. 在建立混合效应模型前,初步评估连续指标的聚类程度和层级关联方向。

多中心例子:18 个中心分别纳入若干患者,记录收缩压、炎症指标和功能评分。将所有患者直接合并计算普通相关,会混合中心内患者差异与中心间平均水平差异。多水平相关分别报告两种关联,避免把中心构成差异误解为患者层面的关系。

不建议直接使用的情况:

  • 数据不存在可解释的群组结构;
  • 只有 1 至 2 个有效群组;
  • 大多数群组只有 1 条有效记录;
  • 连续变量在各群组内几乎没有变化;
  • 目标是调整协变量、时间趋势、非线性项或随机斜率;
  • 结局是二分类、计数或生存时间,需要相应的回归模型;
  • 希望仅凭相关结果推断因果关系或群组干预效果。

10.85.3 支持的分析内容

本模块支持:

  • 同时选择 2 至 10 个连续变量;
  • Pearson、Spearman 和 Kendall 三种相关方法;
  • 90%、95% 和 99% 置信区间;
  • 不校正、Holm、Bonferroni 和 FDR 多重检验校正;
  • 成对完整与全部变量完整案例两种缺失处理;
  • ICC1、ICC2、有效群组数、有效观测数和平均群组规模;
  • 群组内相关表、群组间相关表和群组均值数据;
  • ICC 图和群组内/群组间分层相关热图;
  • 主表与主图的中文、英文描述;
  • Word 报告和群组均值 CSV。

10.85.4 主要特点

  • 所有表格和图形默认勾选;
  • 左侧没有图像宽高设置,图像按固定出版尺寸渲染;
  • 群组内和群组间结果分表展示,不把两个层级混为一个相关系数;
  • 自动剔除少于 2 条有效记录的群组,并要求至少 3 个有效群组;
  • 无分组变量、连续变量不足、零方差、群组内无变异和群组数不足均显示明确中文错误;
  • 分析失败时不会中断 Shiny 会话,修改设置后可在原页面继续;
  • 每张主表提供“对表格进行中文描述”和“对表格进行英文描述”;
  • 每幅图支持中英文描述和 PNG、TIFF、SVG、PDF 下载;
  • Word 报告与界面当前启用的表格和图形一致。

10.85.5 生成的表格和图形

一键自动生成以下表格和图形:

1. 分析概览

核对原始记录、分析记录、排除记录、有效群组、群组规模、连续变量、相关方法、置信水平、P 值校正和缺失处理。

多水平相关分析:分析概览
多水平相关分析:分析概览

2. ICC1 与 ICC2

逐变量报告 ICC1、ICC2、有效群组数、有效观测数和平均群组规模。

多水平相关分析:ICC 结果
多水平相关分析:ICC 结果

3. 群组内和群组间相关

逐变量对报告相关系数、置信区间、检验统计量、自由度、P 值和有效观测数。秩相关方法不使用相同的自由度表达,相关单元格可能留空。

多水平相关分析:群组内和群组间结果
多水平相关分析:群组内和群组间结果

4. ICC 图

并列显示各连续变量的 ICC1 和 ICC2,便于比较群组聚集程度与群组均值可靠性。

多水平相关分析:ICC 图
多水平相关分析:ICC 图

5. 分层相关热图

同一幅图分别展示群组内和群组间相关矩阵,用颜色、方向和数值比较两个层级。

多水平相关分析:分层相关热图
多水平相关分析:分层相关热图

10.85.6 数据准备

使用长格式:每行是一名个体或一次记录,分组变量标明该行所属群组。

Center PatientID SystolicBP Biomarker FunctionScore
C01 P001 132.4 7.1 55.2
C01 P002 126.8 6.4 58.7
C01 P003 139.2 8.0 51.6
C02 P004 118.5 5.2 64.3
C02 P005 121.1 5.7 62.8

连续变量必须为数值型。分组变量可以是因子、字符或整数标识,例如中心、医院、学校、社区、家庭、病区或对象 ID。

模块保留至少有 2 条有效记录的群组,并要求最终至少存在 3 个有效群组。群组间相关的有效样本量是群组数,而不是个体记录数。

群组间相关只基于群组均值。当有效群组较少时,相关系数和置信区间会很不稳定,即使个体总数很大也不能弥补群组数不足。

10.85.7 操作步骤

顶部菜单选择 “按统计学分类模块” → “相关分析” → “相关分析及相关系数矩阵”,再打开 “多水平相关与 ICC” 页签。

  1. 选择至少 2 个连续变量;
  2. 选择分组变量;
  3. 根据变量尺度和分布选择 Pearson、Spearman 或 Kendall;
  4. 选择置信水平、P 值校正和缺失处理;
  5. 根据变量名长度选择热图标签角度;
  6. 保留需要的表格和图形,默认已全部勾选;
  7. 点击“开始多水平相关分析”;
  8. 先核对分析概览和 ICC,再比较群组内、群组间相关与热图。
多水平相关分析:完整设置面板
多水平相关分析:完整设置面板

10.85.8 群组内与群组间相关的统计含义

设个体 \(i\) 属于群组 \(j\),两个连续变量为 \(X_{ij}\)\(Y_{ij}\)。可将每个观测拆成群组均值与群组内偏差:

\[X_{ij}=\bar X_j+(X_{ij}-\bar X_j)\]

\[Y_{ij}=\bar Y_j+(Y_{ij}-\bar Y_j)\]

  • 群组内相关关注 \((X_{ij}-\bar X_j)\)\((Y_{ij}-\bar Y_j)\) 的关联;
  • 群组间相关关注 \(\bar X_j\)\(\bar Y_j\) 的关联。

两者回答不同问题,因此方向可以相同、大小可以不同,甚至可能完全相反。

群组内正相关、群组间负相关并不表示计算矛盾。它说明个体层和群组层的统计关系不同,论文中应分别报告,并避免用其中一个层级替代另一个层级的结论。

10.85.9 ICC1 和 ICC2 如何理解

ICC1 表示一个连续变量总变异中可由群组归属解释的比例。ICC1 越高,同一群组内记录越相似,忽略聚类结构的普通分析越值得谨慎。

ICC2 表示群组均值的可靠性。它不仅受 ICC1 影响,也受平均群组规模影响;在其他条件相同时,每个群组纳入的记录越多,群组均值通常越稳定。

在群组规模近似相等时,可直观理解为:

\[ICC2 \approx \frac{k\times ICC1}{1+(k-1)\times ICC1}\]

其中 \(k\) 为平均群组规模。实际模块按观测数据估计,不要求群组规模完全相等。

抽样波动可能产生轻微负 ICC。此时通常解释为没有明确的正向群组聚集证据,不应把负值机械解释为“负可靠性”。

10.85.10 相关方法如何选择

方法 主要假设和信息 常见用途
Pearson 线性关系,对极端值较敏感 近似连续、线性且无严重异常值
Spearman 基于秩,评估单调关系 偏态、等级信息或异常值影响较明显
Kendall 基于一致/不一致对,样本较小时较稳健 群组数较少或存在较多并列秩

相关方法会同时应用于群组内和群组间分析。若群组间样本量较小,建议结合散点分布和置信区间,不要只按 P 值判断。

10.85.11 缺失数据处理

  • 成对完整:每个变量对使用该对变量均非缺失的记录,通常保留更多信息,但不同变量对的有效观测数可能不同;
  • 全部变量完整案例:只有所有选定连续变量均完整的记录进入分析,各变量对样本一致,但可能排除更多记录。

分组变量缺失的记录无法确定层级,会被排除。清理后少于 2 条记录的群组也会被排除。分析概览报告最终记录数和群组规模。

10.85.12 多重检验校正

选择多个连续变量时会形成多组变量对。例如 4 个变量产生 6 个相关检验,10 个变量产生 45 个检验。

  • 不校正:保留原始 P 值,适合少量预先设定的相关;
  • Holm:控制家族错误率,通常比 Bonferroni 更有检验效能;
  • Bonferroni:保守控制家族错误率;
  • FDR:控制预期错误发现比例,适合较多探索性变量对。

应在分析前根据研究目的选择校正方法,不要在看到结果后反复切换以追求显著性。

10.85.13 结果如何阅读

建议依次查看:

  1. 分析概览:确认有效群组数、群组规模、排除记录和缺失处理;
  2. ICC1:判断各变量是否存在明显群组聚集;
  3. ICC2:判断群组均值是否足够可靠;
  4. 群组内相关:解释同一群组内个体差异的方向和大小;
  5. 群组间相关:解释不同群组平均水平之间的探索性关联;
  6. 置信区间和 P 值:同时判断估计精度与统计证据;
  7. 分层热图:比较同一变量对在两个层级是否同向、异向或强度明显不同。

不要把群组间相关写成个体层结论,也不要把群组内相关写成群组政策或机构层结论。这两类错误分别接近生态谬误和个体主义谬误。

10.85.14 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合连续变量、分组变量、有效群组、相关方法、缺失处理和多重校正生成医学论文 Results 风格初稿。

两幅图也提供中文和英文描述。自动描述会区分 ICC1、ICC2、群组内相关和群组间相关,不会把不同层级的相关直接解释为因果关系;研究者仍需核对变量方向、群组定义和临床含义。

10.85.15 Word 报告与群组均值下载

“下载 Word 文档”会导出当前勾选的统计表和图形。“下载群组均值 CSV”包含每个群组的样本量和各连续变量均值,可用于核对群组间分析、绘制群组层散点图或开展后续敏感性分析。

请用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.85.16 从模块结果转入论文写作

Methods 建议说明:数据的群组结构、连续变量、有效群组数、群组规模、相关方法、置信水平、缺失处理、多重检验校正,以及分别估计群组内和群组间相关。

结果写作示例:共纳入 18 个中心的 157 名患者。收缩压的 ICC1 为 0.552,提示其约一半变异与中心归属有关;ICC2 为 0.915,提示中心平均收缩压具有较高可靠性。患者层面上,收缩压与炎症指标呈正向群组内相关(Spearman \(\rho=0.637\),99% CI 0.497–0.744,FDR 校正 \(P<0.001\));中心平均水平之间则呈负相关(\(\rho=-0.651\),99% CI -0.898 至 -0.092,FDR 校正 \(P=0.007\))。两个层级方向不同,应分别解释,且不作因果推断。

10.85.17 常见问题

1. 分组变量应该选什么?

选择能表示记录聚类归属的变量,例如中心、医院、学校、社区、家庭、病区或对象 ID。同一取值下应包含多条记录。

2. 每个群组必须有相同样本量吗?

不需要。模块支持非平衡群组,但至少需要 3 个各有 2 条及以上有效记录的群组。

3. 群组内相关与重复测量相关相同吗?

两者都关注组内共同变化,但估计与使用场景不同。只有两个变量、群组是对象 ID 且研究重点是对象内共同线性关系时,可使用“重复测量与交叉相关”模块;需要多个变量、ICC 和群组均值层结果时,使用本模块。

4. 为什么群组间相关的有效观测数很小?

因为群组间分析先把每个群组压缩为一行均值,所以有效观测数等于有效群组数,而不是个体总数。

5. 群组内和群组间相关方向相反,哪一个是正确的?

两者都可能正确,因为回答的问题不同。应按研究推断层级分别解释,不应二选一。

6. ICC1 多大才算需要考虑聚类?

没有通用绝对阈值。即使 ICC1 较小,群组规模很大时设计效应也可能明显。应结合研究设计、群组规模和后续模型目的判断。

7. ICC1 为什么会出现负值?

有限样本下,组间变异估计可能小于组内变异而产生轻微负值。通常解释为没有明确正向聚集证据,不把负值视为有实质意义的负相关。

8. P 值已经校正,是否可以忽略置信区间?

不可以。校正后的 P 值反映多重检验证据,置信区间反映估计范围和精度,两者信息不同。

9. 能否用本模块调整年龄、性别或治疗组?

不能。本模块是分层相关分析。需要调整协变量、估计固定效应或随机效应时,应使用线性混合效应模型或广义混合效应模型。

10. 相关显著是否说明群组干预有效?

不能。相关分析不能自动排除混杂、反向关系、选择偏倚或共同原因,也不能替代组间干预效应模型。

10.85.18 小结

本模块的最佳用法是:先确认群组结构和有效群组数,再用 ICC 判断聚集程度,最后把群组内与群组间相关作为两个不同层级的结果分别报告。

总体相关可能掩盖层级差异。正确区分个体层和群组层,比得到一个单一相关系数更重要。

10.86 组间网络比较

10.86.1 模块功能

本模块用于比较两个独立群体的网络结构。每个节点代表一个变量,节点之间的边表示在控制其他网络变量后仍然保留的条件关联。模块通过置换检验回答三类问题:

  • 网络结构是否不同:两组中差异最大的边是否超出随机分组可解释的范围;
  • 全局强度是否不同:两组所有绝对边权之和是否存在差异;
  • 具体哪些边不同:对每一对节点的边权差进行置换检验,并可进行多重检验校正。

模块同时输出两组网络的边权表和共同布局图,便于将统计检验与图形差异相互核对。

10.86.2 适用场景

适合以下问题:

  1. 比较干预组与对照组的症状网络是否不同;
  2. 比较患病人群与健康人群中生物标志物之间的条件关联;
  3. 比较男性与女性、不同年龄层或两个研究中心的心理特征网络;
  4. 比较两个时期中独立样本的风险因素网络;
  5. 使用二分类症状指标比较两个独立群体的症状共现结构。

干预研究例子:研究者在干预组和对照组分别测量焦虑、抑郁、睡眠、疲劳和压力。总均值比较只能回答各指标水平是否不同,组间网络比较则评估这些指标之间的条件关联方式是否改变。

不建议直接使用的情况:

  • 分组变量不是恰好两组;
  • 两组不是独立样本,而是同一对象的配对或重复测量;
  • 每组有效样本少于 10,或样本量相对节点数明显不足;
  • 变量在某组内没有变异;
  • 目标是比较节点均值、因果效应或中介效应;
  • 存在需要调整的复杂分层、纵向或抽样设计。

10.86.3 支持的分析内容

本模块支持:

  • 3 至 12 个数值型网络变量;
  • 恰好含两个水平的分组变量;
  • 连续数据和二分类数据;
  • 100、200 和 500 次置换;
  • 不校正、Holm、Bonferroni 和 FDR 边差异 P 值校正;
  • 弹簧布局和圆形布局;
  • 网络结构、全局强度和具体边差异检验;
  • 两组边权表、共同布局网络图、Word 报告和边明细 CSV;
  • 主表和主图的中文、英文描述。

10.86.4 主要特点

  • 所有表格和图形默认勾选;
  • 左侧没有图像宽高设置,每幅图按固定出版尺寸渲染;
  • 两组网络固定使用相同节点坐标和同一边宽标尺,避免布局差异造成视觉误判;
  • 连续和二分类网络分别按相应数据类型建模;
  • 固定随机种子,使相同数据和设置可重复得到一致的置换结果;
  • 分析失败时仅显示明确中文错误,不中断 Shiny 会话;
  • 每张主表都提供中英文描述按钮,每幅图都支持 PNG、TIFF、SVG 和 PDF 下载;
  • Word 报告和 CSV 与当前选项一致。

10.86.5 生成的表格和图形

一键自动生成以下表格和图形:

1. 分析概览

核对原始记录、分析记录、排除记录、两组样本量、网络变量、数据类型、置换次数、P 值校正和布局。

组间网络比较:分析概览
组间网络比较:分析概览

2. 网络不变性检验

报告网络结构不变性与全局强度不变性的统计量和置换 P 值。

组间网络比较:不变性检验
组间网络比较:不变性检验

3. 具体边差异与两组边权

逐边报告两组边权、边权差、检验统计量和校正后 P 值,并提供无检验列的精简边权表。

组间网络比较:边差异和边权
组间网络比较:边差异和边权

4. 共同布局网络图

两图的节点位置与边宽标尺完全一致。蓝色表示正条件关联,红色表示负条件关联,边越粗表示关联绝对值越大。

组间网络比较:第一组网络图
组间网络比较:第一组网络图
组间网络比较:第二组网络图
组间网络比较:第二组网络图

10.86.6 数据准备

使用宽格式:每行是一名独立研究对象,分组变量指定其所属的两个群体,其余列是网络节点。

ID Group Anxiety Depression Sleep Fatigue Stress
P001 Control 48.2 42.1 55.4 44.8 51.7
P002 Control 53.6 49.3 47.2 50.1 58.4
P003 Treatment 45.9 40.5 60.2 41.6 46.3
P004 Treatment 50.7 44.8 57.1 46.2 52.0

连续数据模式下,网络变量必须是数值型并在每组内存在变异。二分类数据模式下,每个网络变量在整体及每组内都必须恰好观察到两个值;模块会自动重编码为 0 和 1。

分析使用所有选定网络变量和分组变量均完整的记录。因此,变量越多,完整案例排除的记录可能越多。

网络估计的参数数量随节点数快速增加。每组仅达到 10 例只是程序运行的最低边界,不代表估计已经稳定。实际研究应尽量增加每组样本量,并谨慎解释单条边的结果。

10.86.7 操作步骤

顶部菜单选择 “按统计学分类模块” → “聚类分析与多元统计” → “组间网络比较” 进入模块。

  1. 选择 3 至 12 个网络变量;
  2. 选择恰好含两组的分组变量;
  3. 根据变量取值选择连续数据或二分类数据;
  4. 选择置换次数和具体边的 P 值校正方法;
  5. 选择弹簧布局或圆形布局;
  6. 保留需要的表格和图形,默认已全部勾选;
  7. 点击“开始组间网络比较”;
  8. 先核对分析概览,再解读不变性检验、具体边和共同布局网络图。
组间网络比较:完整设置面板
组间网络比较:完整设置面板

10.86.8 三类检验如何理解

网络结构不变性使用两组对应边权差的最大绝对值作为统计量。若置换 P 值较小,说明两组网络中至少有一条边的差异超出随机分组可解释的范围。

全局强度不变性比较两组全部绝对边权之和。若 P 值较小,说明两组整体连接程度不同,但不说明哪一条边造成差异。

具体边差异对每一对节点的边权差分别检验。选择多个节点时会产生多次检验,应优先解读校正后 P 值。

“网络结构检验显著”不意味着每一条边都不同;“全局强度不显著”也不意味着所有具体边都相同。三类检验回答不同层次的问题,应分开报告。

10.86.9 置换次数与 P 值校正

置换次数越多,P 值的蒙特卡罗误差通常越小,但运行时间越长。100 次适合快速探索,200 次是默认平衡设置,500 次更适合最终报告前的结果核对。当 P 值接近显著性阈值时,应谨慎看待有限置换次数产生的波动。

  • 不校正:保留每条边的原始 P 值;
  • Holm:控制家族错误率,通常比 Bonferroni 更有检验效能;
  • Bonferroni:保守地控制家族错误率;
  • FDR:控制预期错误发现比例,适合边数较多的探索性分析。

10.86.10 网络图如何阅读

本模块为两组生成共同坐标。因此,同一节点在两图中位置不变,相同粗细的边也表示相同的边权绝对值。

  • 弹簧布局便于观察连接紧密的节点群;
  • 圆形布局便于固定位置逐边对比;
  • 蓝边为正条件关联,红边为负条件关联;
  • 没有显示的边表示正则化后未保留,不等于证明真实关联精确为零。

网络图主要用于展示和定位差异,是否存在统计证据仍应以置换检验表为准。

10.86.11 结果如何阅读

建议按以下顺序:

  1. 分析概览:确认两组样本量、排除记录、数据类型和置换次数;
  2. 网络结构不变性:判断两组网络是否存在总体结构差异证据;
  3. 全局强度不变性:判断两组整体连接程度是否不同;
  4. 具体边差异:在预先选定的 P 值校正下定位差异边;
  5. 两组边权和网络图:核对差异方向、大小和视觉模式;
  6. 稳定性与研究设计:结合样本量、节点数和研究假设谨慎解释。

10.86.12 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合网络变量、分组、数据类型、置换次数和 P 值校正生成医学论文 Results 风格初稿。

两幅网络图也提供中英文描述。自动描述会区分网络结构、全局强度与具体边,不会把条件关联写成因果作用。研究者仍需核对变量方向、分组定义和临床含义。

10.86.13 Word 报告与边明细下载

“下载 Word 文档”会导出当前勾选的表格和两组网络图。“下载网络边明细 CSV”包含每一对节点的两组边权、边权差、检验统计量和 P 值,可用于附录、复核或后续整理。

请用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.86.14 从模块结果转入论文写作

Methods 建议说明:两组独立样本的定义、网络变量、连续或二分类数据类型、完整案例处理、置换次数、多重检验校正、网络结构与全局强度检验。

结果写作示例:完整案例分析包括对照组 80 例和干预组 84 例。基于 500 次置换,两组网络结构存在差异证据(\(M=0.512\)\(P=0.006\)),但全局强度差异未达统计学显著(\(S=0.465\)\(P=0.653\))。FDR 校正后,焦虑—睡眠及抑郁—疲劳边的组间差异仍有统计学证据。这些结果表明两组在部分条件关联上存在差异,但不作因果推断。

10.86.15 常见问题

1. 为什么分组变量必须恰好两组?

当前模块检验两个独立网络的不变性。多于两组时会涉及多组成对比较和额外的多重检验问题,不能直接当作一次两组检验。

2. 二分类变量可以用 1/2 或“是/否”编码吗?

可以使用两个数值。模块会按大小自动重编码为 0/1。字符型“是/否”应先在数据处理中转换为数值型二分类变量。

3. 为什么某些边权为 0?

网络估计使用正则化以降低噪声边。零值表示该边未被估计过程保留,不是对真实效应精确为零的证明。

4. 网络结构显著,为什么全局强度不显著?

两组可能有若干边的位置或强度不同,但全部绝对边权之和仍然接近。因此两类检验结果不一致并不矛盾。

5. 弹簧布局和圆形布局会改变检验结果吗?

不会。布局只改变节点在图中的坐标,不改变网络边权、统计量或 P 值。

6. 可以比较配对的前后测量吗?

不建议。本模块按两组独立样本设计。对同一批对象的前后测量直接拆成两组会忽略配对依赖。

7. 是否应只报告显著边?

不建议。论文中应先报告整体网络结构和全局强度检验,再报告预先关注或校正后仍有证据的具体边。

8. 网络边能解释为因果通路吗?

不能。横断面网络的边是条件关联,不自动排除混杂、选择偏倚、反向关系或测量误差。

10.86.16 小结

本模块的最佳使用方式是:先确认两组独立样本与数据类型,再按“网络结构—全局强度—具体边”的层次解读,最后用共同布局图核对差异方向。

网络图提供直观展示,置换检验提供统计证据,两者必须结合阅读,且均不应被扩展为因果结论。

10.87 因子维度判定

10.87.1 模块功能

本模块用于在探索性因子分析之前,比较多种统计准则对“应保留多少个潜在维度”的建议。它同时运行原始 MAP、修订 MAP、平行分析、经验 Kaiser 准则和 HULL 方法,并把五种建议放在同一张汇总表中。

因子维度判定不直接产生最终因子载荷,也不代替后续的探索性或验证性因子分析。它的作用是缩小候选维度范围,并让研究者看到不同准则是否得出一致结论。

量表开发例子:一份 18 条目的症状量表可能包含躯体、情绪和社会功能维度。研究者先使用本模块比较五种维度准则,再在探索性因子分析中分别拟合 2、3 和 4 因子解,根据载荷结构、理论可解释性和拟合结果确定最终方案。

10.87.2 适用场景

适合以下问题:

  1. 新量表开发时,初步判断条目可能形成几个维度;
  2. 现有量表应用于新人群时,核对原有维度数是否仍获得数据支持;
  3. 多个临床症状、心理条目或行为指标之间存在较强相关,需要进行降维;
  4. 平行分析、特征值和理论预期之间存在分歧,需要增加 MAP、经验 Kaiser 和 HULL 作为敏感性依据;
  5. 需要在论文方法和结果中透明报告维度判定过程。

不建议直接使用的情况:

  • 只有少于 6 个指标;
  • 指标基本不相关,不存在值得提取的共同结构;
  • 把 ID、日期、自由文本或无序名义变量当作因子指标;
  • 完整观测少于 30,或样本量相对指标数过少;
  • 研究者已有明确、固定且需严格检验的测量模型,此时应直接使用验证性因子分析;
  • 目标是检验因果效应、中介效应或组间均值差异。

10.87.3 支持的分析内容

本模块支持:

  • 6 至 20 个数值型指标;
  • Pearson、Spearman、Kendall、Goodman-Kruskal Gamma 和 Polychoric 相关;
  • 原始 MAP(1976)与修订 MAP(2000);
  • 固定 100 次模拟的平行分析;
  • 经验 Kaiser 准则和 HULL 方法;
  • 分析概览、维度建议汇总、初始特征值、MAP 平均偏相关和经验参考值表;
  • 碎石图与平行分析参考线、MAP 曲线;
  • 主表和主图的中文、英文描述;
  • Word 报告和维度建议 CSV。

10.87.4 主要特点

  • 五种维度准则在一次分析中完成,无需反复切换;
  • 所有表格和图形默认勾选;
  • 左侧不设图像宽高选项,每幅图按固定出版尺寸渲染;
  • 使用固定随机种子,使相同数据和设置的模拟结果可重复;
  • 主表均提供中英文描述按钮,主图均支持 PNG、TIFF、SVG 和 PDF 下载;
  • 分析失败时只显示可读中文错误,不中断 Shiny 会话;
  • Word 和 CSV 与当前变量、相关类型和输出勾选保持一致。

10.87.5 生成的表格和图形

一键自动生成以下表格和图形:

1. 分析概览与维度建议

分析概览核对原始记录数、完整观测数、排除记录、变量和相关类型。维度建议表将五种方法并列展示。

因子维度判定:概览与建议
因子维度判定:概览与建议

2. 特征值与 MAP 明细

初始特征值表报告每个维度的特征值、解释比例和累计解释比例;MAP 表报告移除不同维度数后的平均平方偏相关和平均四次方偏相关;经验 Kaiser 表将观测特征值与经验参考值比较。

因子维度判定:特征值与 MAP 明细
因子维度判定:特征值与 MAP 明细

3. 碎石图与平行分析

将观测特征值曲线与随机数据参考曲线放在同一张图中。观测特征值高于模拟参考值的前几个维度是平行分析的保留候选。

因子维度判定:碎石图与平行分析
因子维度判定:碎石图与平行分析

4. MAP 曲线

原始 MAP 寻找平均平方偏相关的最小值,修订 MAP 寻找平均四次方偏相关的最小值。曲线最小点对应的移除维度数即为相应建议。

因子维度判定:MAP 曲线
因子维度判定:MAP 曲线
因子维度判定:诊断图标签页
因子维度判定:诊断图标签页

10.87.6 数据准备

使用宽格式:每行是一名研究对象,每列是一个量表条目或指标。

ID Item1 Item2 Item3 Item4 Item5 Item6
P001 4 5 3 2 4 3
P002 3 4 4 2 5 4
P003 5 5 4 3 4 5
P004 2 3 2 1 3 2

连续指标通常选择 Pearson;连续但明显偏态或受离群值影响时可考虑 Spearman 或 Kendall。对于 2 至 10 个有序水平的数值编码条目,可选择 Gamma 或 Polychoric。

分析使用所有选定指标都非缺失的记录。若指标较多或缺失分散在不同条目,完整案例数可能明显减少,因此应首先核对分析概览。

“至少 30 个完整观测”只是程序运行边界,不代表维度判定已经稳定。实际研究中,样本量应结合指标数、公因子度、载荷大小、缺失比例和数据分布综合评估。

10.87.7 操作步骤

顶部菜单选择 “按统计学分类模块” → “因子分析与结构方程” → “因子维度判定” 进入模块。

  1. 选择 6 至 20 个数值型分析变量;
  2. 根据指标的测量尺度和分布选择相关类型;
  3. 保留需要的表格和图形,默认已全部勾选;
  4. 点击“开始因子维度判定”;
  5. 先核对分析概览,再比较五种维度建议;
  6. 结合特征值、平行分析和 MAP 曲线查看建议产生的依据;
  7. 把有统计支持的候选维度数带入后续探索性因子分析。
因子维度判定:完整设置面板
因子维度判定:完整设置面板

10.87.8 五种判定方法如何理解

原始 MAP通过逐步移除主要维度,寻找平均平方偏相关最小的位置。它倾向保留能使剩余共同关联最小化的维度数。

修订 MAP使用平均四次方偏相关,对较大的剩余偏相关更敏感。原始与修订 MAP 可能给出不同建议。

平行分析比较观测数据与随机数据的特征值。当观测特征值不再高于模拟参考值时,后续维度通常不保留。

经验 Kaiser 准则不是简单使用“特征值大于 1”,而是将观测特征值与根据数据条件构建的经验参考值比较。

HULL 方法在模型拟合与简约性之间寻找凸包平衡点。它不仅看单个特征值,而是关注增加维度后的改善是否仍值得。

五种方法的统计出发点不同,结果不一致不等于计算错误。通常应将它们形成的相邻维度数作为候选,再通过因子载荷、交叉载荷、因子可解释性和独立样本验证作出最终决定。

10.87.9 结果如何阅读

建议按以下顺序:

  1. 分析概览:确认变量、相关类型、完整观测和排除记录;
  2. 维度建议汇总:查看多数方法是否集中在相同或相邻的维度数;
  3. 初始特征值:观察前几个维度的衰减速度和累计解释比例;
  4. 平行分析图:核对观测特征值与模拟参考线的交点;
  5. MAP 曲线:核对原始和修订曲线的最小值位置;
  6. 后续模型:对候选维度数分别运行探索性因子分析,比较载荷结构与理论含义。

个别 MAP 结果可能建议 0 个维度。这表示相应偏相关准则在移除任何维度之前已经达到最小值,不是程序丢失结果。此时应检查相关矩阵、数据质量和因子分析适用性。

10.87.10 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合指标、相关类型、完整观测数和判定方法生成医学论文 Results 风格初稿。

两幅统计图也提供中英文描述。自动描述用于概括曲线转折、模拟参考值和 MAP 最小点,不会把某一种统计建议写成唯一正确的测量结构。

10.87.11 Word 报告与 CSV 下载

“下载 Word 文档”会导出当前勾选的五类表格和两幅统计图。“下载维度建议 CSV”保存五种方法的建议维度数和判定依据,便于附录、复核或后续整理。

请用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.87.12 从模块结果转入论文写作

Methods 建议说明:用于维度判定的指标、相关类型、完整案例处理、平行分析模拟次数,以及同时使用的 MAP、经验 Kaiser 和 HULL 方法。

结果写作示例:维度判定纳入 236 例具有 8 个完整指标的研究对象。原始 MAP、修订 MAP、平行分析、经验 Kaiser 准则和 HULL 方法均建议保留 3 个维度。前 3 个观测特征值均高于相应参考值,且 MAP 曲线在移除 3 个维度处达到最小值。因此,后续探索性因子分析以 3 因子解为主要候选。

10.87.13 常见问题

1. 五种方法给出不同结果时选哪个?

不建议机械选择最大或最小值。应把相邻建议作为候选,分别运行因子分析,再根据载荷清晰度、每个因子的指标数、理论可解释性和稳定性决定。

2. 为什么至少要 6 个指标?

本模块默认同时运行全部判定方法,HULL 方法需要至少 6 个指标来形成可比较的候选维度。

3. 五级 Likert 条目应选哪种相关?

若将条目视为有序分类指标,通常优先考虑 Polychoric;若样本较小、分类极度不平衡,应进行敏感性比较并检查估计稳定性。

4. 为什么特征值大于 1 与本模块的结果不一致?

简单 Kaiser 准则仅使用固定阈值 1,而平行分析和经验 Kaiser 使用与数据条件相关的参考值,因此可能产生不同建议。

5. MAP 建议 0 个维度是报错吗?

不是。这表示偏相关准则的最小值出现在未移除任何维度的位置。应检查指标间相关、编码方向和数据质量。

6. 维度数建议能直接写成“证明量表有 3 个因子”吗?

不能。它只是统计候选依据,还需要观察因子载荷、交叉载荷、因子含义和后续验证结果。

7. 缺失值如何处理?

当前分析使用完整案例。应在分析概览中报告排除记录,并在缺失较多时评估选择偏倚。

8. 不同相关类型会改变维度建议吗?

可能。相关矩阵是所有判定方法的基础,对测量尺度或分布不合适的相关类型可能改变特征值和最终建议。

10.87.14 小结

本模块的最佳使用方式是:先根据指标尺度选择相关类型,再比较五种维度准则,最后把候选维度数带入因子分析评估载荷结构与理论可解释性。

维度判定是建立测量结构的一步,不是对最终因子数的自动裁决。

10.88 有序相关与网络分析

10.88.1 模块功能

本模块用于分析有序等级条目、二分类指标或不满足线性正态假设的连续指标之间的相关结构。一次分析可以生成相关矩阵、近似 P 值、二分类阈值、EBIC 正则化网络、偏相关网络和网络中心性。

模块提供 Spearman、Polychoric 和 Tetrachoric 三种相关类型。三者回答的问题不同:Spearman 描述观察值的单调秩关联;Polychoric 和 Tetrachoric 则把有序或二分类观察值视为潜在连续变量被切分后的结果。

症状网络例子:研究者收集 6 个二分类症状指标,希望了解哪些症状在控制其他指标后仍保持较强关联。可选择 Tetrachoric 相关,先核对阈值和相关矩阵,再查看正则化网络、偏相关网络和中心性。网络边表示条件关联,不表示某个症状导致另一个症状。

10.88.2 适用场景

适合以下问题:

  1. Likert 条目、疾病分级、症状严重度等有序多分类指标之间的关联;
  2. 是/否、阳性/阴性、存在/不存在等二分类指标之间的潜在相关;
  3. 连续变量明显偏态或含离群值,需要用秩相关描述单调关系;
  4. 需要从相关矩阵进一步探索条件关联网络;
  5. 需要报告网络节点的强度、接近中心性、中介中心性和预期影响。

不建议直接使用的情况:

  • 名义分类变量没有自然顺序;
  • 每个变量只有极少数高水平或低水平观测,导致分类极度不平衡;
  • 样本量相对变量数过小,相关矩阵和网络估计不稳定;
  • 研究问题是因果效应、治疗效果或时间先后关系;
  • 需要比较两个独立群体的网络差异,此时应使用组间网络比较;
  • 需要检验预设潜变量测量模型,此时应使用验证性因子分析。

10.88.3 三种相关类型如何选择

Spearman基于秩次,适合连续或有序变量之间的单调关系。它不要求线性关系和正态分布,但仍要求观察彼此独立,并且不应把名义分类编码当作有序值。

Polychoric适合每个变量有 2 至 10 个有序水平的条目。它假定观察到的等级来自潜在连续变量的阈值切分,并假定变量对的潜在分布近似二元正态。五级或七级 Likert 条目通常可考虑该方法。

Tetrachoric是二分类指标的专用形式,要求每个变量恰好有两个观察水平。模块同时报告各变量的阈值和高水平比例,以帮助识别分类不平衡。

Polychoric 和 Tetrachoric 的近似 P 值根据估计相关系数与完整案例数计算,并不是精确检验。主要结论应优先结合相关大小、置信背景、样本量和敏感性分析,不应只按 P 值筛选网络边。

10.88.4 支持的分析内容

本模块支持:

  • 每次选择 2 至 12 个变量;
  • Spearman、Polychoric 和 Tetrachoric 相关矩阵;
  • 显著性星号、近似 P 值矩阵和 Tetrachoric 阈值表;
  • 完整矩阵、下三角和上三角显示;
  • 圆形、方形、椭圆、数值、阴影、颜色和饼图 7 种矩阵样式;
  • EBIC 正则化网络和基于逆相关矩阵的偏相关网络;
  • 原始值、含零点原始值、Z 分数和相对值 4 种中心性尺度;
  • 0°、45° 和 90° 标签角度;
  • 所有主表和主图的中文、英文描述;
  • PNG、TIFF、SVG、PDF、Word 和变量对明细 CSV 下载。

10.88.5 主要特点

  • 表格和图形默认全部勾选;
  • 左侧不设置图宽或图高,每幅图使用固定出版尺寸;
  • 分析失败时只显示可读中文错误,不会终止整个 Shiny 会话;
  • 可在同一会话内修改变量或相关类型后重新分析;
  • 主表使用固定语义 ID,切换相关类型后描述按钮不会串位;
  • Word 与 CSV 始终对应当前分析设置。

10.88.6 数据准备

使用宽格式:每行是一名研究对象,每列是一个指标。

ID Item1 Item2 Item3 Item4 Item5 Item6
P001 1 0 1 0 1 1
P002 0 0 1 0 0 1
P003 1 1 1 1 0 1
P004 0 1 0 0 1 0

二分类变量可以使用 0/1、否/是或两个因子水平;程序会把较高的数值或后一个因子水平作为高水平。Polychoric 变量应按自然顺序编码,不能把血型、地区或治疗名称等名义类别强行编号。

分析采用完整案例:只有所有选定变量均非缺失的记录进入相关和网络估计。变量越多,完整案例数可能下降得越明显,因此第一步应核对“分析概览”。

10.88.7 操作步骤

顶部菜单选择 “按统计学分类模块” → “相关分析” → “有序相关与网络分析” 进入模块。

  1. 选择 2 至 12 个分析变量;
  2. 根据测量尺度选择 Spearman、Polychoric 或 Tetrachoric;
  3. 选择矩阵显示范围与图形样式;
  4. 选择中心性尺度和标签角度;
  5. 保留需要的表格和图形,默认已全部勾选;
  6. 点击“开始有序相关与网络分析”;
  7. 依次核对分析概览、相关结果、网络指标和统计图;
  8. 在下载页导出 Word 报告或变量对明细 CSV。
有序相关与网络分析:完整设置面板
有序相关与网络分析:完整设置面板

10.88.8 生成的表格和图形

一键自动生成以下结果:

1. 分析概览

报告原始记录数、分析记录数、排除记录数、变量、相关类型、缺失处理和网络估计方式。

2. 相关矩阵与近似 P 值

相关矩阵报告方向和大小,可附显著性星号;近似 P 值矩阵用于辅助判断统计不确定性。Tetrachoric 分析还会报告每个指标的阈值和高水平比例。

有序相关与网络分析:Tetrachoric 相关、P 值与阈值
有序相关与网络分析:Tetrachoric 相关、P 值与阈值

3. 网络中心性表

中心性表报告强度、接近中心性、中介中心性和预期影响。中心性是当前网络中的相对结构指标,不能解释为临床重要性或干预优先级。

有序相关与网络分析:网络中心性表
有序相关与网络分析:网络中心性表

4. 相关矩阵图

颜色表示相关方向,图形大小或色深反映相关绝对值。下三角视图减少重复信息。

有序相关与网络分析:相关矩阵图
有序相关与网络分析:相关矩阵图

5. EBIC 正则化网络

蓝色边表示正关联,红色边表示负关联,线宽反映正则化后的边权绝对值。正则化会把较弱、证据不足的边收缩为零,以获得更简约的网络。

有序相关与网络分析:EBIC 正则化网络
有序相关与网络分析:EBIC 正则化网络

6. 偏相关网络

偏相关网络根据相关矩阵的逆矩阵计算,表示控制其他选定变量后的线性条件关联。它没有正则化网络的收缩过程,因此可能保留更多弱边。

有序相关与网络分析:偏相关网络
有序相关与网络分析:偏相关网络

7. 网络中心性图

将四类中心性并列展示,便于比较节点在不同结构指标下的位置。

有序相关与网络分析:网络中心性图
有序相关与网络分析:网络中心性图

10.88.9 网络结果如何阅读

建议按以下顺序阅读:

  1. 完整案例数:确认样本量是否因缺失明显减少;
  2. 变量分布:Tetrachoric 时重点查看高水平比例是否过度接近 0 或 1;
  3. 相关矩阵:先识别成组的强相关和可能的负相关;
  4. 正则化网络:查看经收缩后仍保留的边以及网络是否出现分离子群;
  5. 偏相关网络:与正则化网络比较,区分稳健边和较弱边;
  6. 中心性:检查结论是否在不同中心性指标下相近;
  7. 敏感性分析:必要时改变相关类型、变量集合或样本定义复核稳定性。

网络边是模型条件下的统计关联,不是时间顺序、机制路径或因果效应。横断面网络尤其不能据此决定干预靶点。

10.88.10 四类中心性如何理解

强度(Strength)是节点与其他节点所有边权绝对值之和,反映直接连接总量。

接近中心性(Closeness)根据节点到其他节点的最短路径计算。网络不连通时可能不稳定或不可定义。

中介中心性(Betweenness)统计节点位于其他节点最短路径上的程度,对样本波动和网络结构变化较敏感。

预期影响(Expected Influence)保留边的正负号后求和,适合同时存在正边和负边的网络。它与只看绝对值的强度不同。

中心性尺度只改变展示方式,不改变底层网络:原始值保留指标单位,Z 分数显示相对均值的标准化差异,相对值按每类指标的最大绝对值缩放。

10.88.11 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合变量、相关类型、完整案例数和当前表格生成医学论文 Results 风格初稿。

四张统计图也提供中英文描述按钮。自动描述只概括相关方向、边权和中心性,不会把关联写成因果关系。

10.88.12 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的所有表格和图形;“下载变量对明细 CSV”保存每个变量对的相关系数、近似 P 值、完整案例数和相关类型。

有序相关与网络分析:下载页面
有序相关与网络分析:下载页面

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.88.13 从模块结果转入论文写作

Methods 建议说明:变量测量尺度、所选相关类型、完整案例处理、网络估计方法、中心性指标和敏感性分析方案。

结果写作示例:Tetrachoric 分析纳入 236 名具有 6 个完整二分类指标的研究对象。指标 1 与指标 2、指标 3 与指标 4 以及指标 5 与指标 6 的潜在相关较强。EBIC 正则化网络保留了上述主要正关联,并删除多条较弱边。指标 1 和指标 4 的强度相对较高;该结果描述的是横断面条件关联,不能解释为因果作用。

10.88.14 常见问题

1. 五级 Likert 条目应选 Spearman 还是 Polychoric?

若把等级视为潜在连续变量的切分,通常优先考虑 Polychoric;若样本较小、类别极不平衡或潜在正态假设不合理,可同时运行 Spearman 作为敏感性分析。

2. 0/1 变量能选择 Spearman 吗?

可以计算,但 Spearman 描述观察编码的秩关联。若研究目标是估计二分类指标背后的潜在连续相关,选择 Tetrachoric 更合适。

3. 为什么 Polychoric 不能用于有几十个不同值的连续变量?

该方法面向有限有序类别。连续变量应使用 Spearman,或在有充分依据时先进行有意义的有序分组。

4. 近似 P 值与网络边为什么不完全一致?

P 值针对单个两变量相关的近似检验;正则化网络同时考虑整个相关结构并对边进行收缩,两者回答的问题不同。

5. 正则化网络没有边是报错吗?

不是。它表示在当前样本、变量和惩罚条件下,较弱关联均被收缩为零。此时应检查样本量、变量变异和相关矩阵。

6. 中心性最高的节点就是最重要的治疗靶点吗?

不能这样解释。中心性只反映当前统计网络的位置,不能证明改变该节点会改变其他节点或临床结局。

7. 为什么完整案例数比原始样本少?

只要一条记录在任一选定变量上缺失,该记录就不会进入本次分析。可减少非必要变量或先评估缺失机制。

8. 网络不连通时还能看接近中心性吗?

应谨慎。断开的子网络之间不存在有限最短路径,接近中心性可能不可定义或高度不稳定,应优先报告网络结构和强度。

10.88.15 小结

本模块的最佳使用方式是:先根据测量尺度选择相关类型,再核对相关矩阵和阈值,随后比较正则化网络与偏相关网络,最后谨慎解释中心性。

相关和网络分析用于描述多变量关联结构,不能替代研究设计、时间信息和因果推断。

10.89 层次分析法

10.89.1 模块功能

本模块用于把多位决策者对若干项目给出的 1–9 分评分汇总为综合判断矩阵、项目权重和优先顺序,并检查每位决策者及综合结果的一致性。

这是评分型层次分析法:每行是一个待比较项目,每个数值列是一位决策者。程序根据同一决策者对项目的评分差构造成对比较,再用几何平均汇总多位决策者的判断。它不同于要求用户直接录入完整两两比较矩阵的传统录入方式。

卫生技术优先级例子:研究小组希望在疗效、安全性、生活质量、依从性、成本和可及性之间确定综合优先顺序。5 位专家分别给每个项目 1–9 分。模块生成综合判断矩阵,计算各项目权重,并用一致性比率检查专家判断是否需要复核。

10.89.2 适用场景

适合以下问题:

  1. 多位专家对有限数量的评价项目进行优先级排序;
  2. 需要把多个主观判断汇总为可解释的权重;
  3. 需要同时报告每位决策者和综合判断的一致性;
  4. 项目数为 2–10 个,决策者数为 1–20 位;
  5. 每位决策者可对全部项目给出 1–9 分且不出现并列评分。

不建议直接使用的情况:

  • 同一位决策者必须允许多个项目并列;
  • 项目超过 10 个或决策者超过 20 位;
  • 数据是受试者结局、量表条目反应或重复测量,而不是决策评分;
  • 研究需要估计治疗效应、预测风险或检验因果关系;
  • 需要建立多层准则树并逐层合成局部权重;
  • 需要直接输入成对比较判断矩阵而非项目评分。

10.89.3 数据结构与评分规则

本模块的数据方向与常见受试者数据库不同:每行是项目,每列是决策者

项目名称 专家甲 专家乙 专家丙 专家丁 专家戊
疗效 9 8 9 8 9
安全性 8 9 7 7 8
生活质量 6 5 6 9 7
依从性 4 3 3 4 2
成本 2 1 2 2 3
可及性 1 2 1 1 1

评分必须满足:

  • 数值在 1–9 之间,分数越高表示项目越重要;
  • 同一决策者对不同项目不能给相同分数;
  • 每个纳入项目必须具有所有选定决策者的评分;
  • 项目名称可放在单独文本列,也可让程序自动生成;
  • 项目名称必须唯一。

若一位决策者给两个项目相同评分,评分差为 0,无法形成有效的倒数判断矩阵。模块会在计算前停止,并明确列出存在并列评分的变量。不要用随机微调分数的方法绕过校验,应由决策者重新确认项目顺序。

10.89.4 缺失值如何处理

只要某个项目在任一选定评分变量上缺失,该项目就不会进入本次分析。分析概览同时报告原始项目数、分析项目数和排除项目数。

项目名称缺失不会删除项目,程序会为该行生成名称;评分缺失则会整行排除。若排除后少于 2 个项目或仍多于 10 个项目,分析会给出可读错误。

10.89.5 支持的分析内容

本模块支持:

  • 2–10 个项目和 1–20 位决策者;
  • 可选项目名称变量;
  • 综合倒数判断矩阵;
  • 综合项目权重、百分比和排名;
  • 综合及各决策者的一致性指数(CI);
  • 综合及各决策者的一致性比率(CR);
  • CR < 0.10 的自动一致性判定;
  • 项目权重排名图、一致性比率图和判断矩阵热图;
  • 所有主表和主图的中文、英文描述;
  • PNG、TIFF、SVG、PDF、Word 和项目权重 CSV 下载。

10.89.6 主要特点

  • 所有表格和图形默认勾选;
  • 左侧不设置图宽或图高,每幅图使用固定出版尺寸;
  • 主表统一提供中英文描述按钮;
  • 主图统一提供中英文描述和四种图像格式;
  • 分析失败时只显示错误信息,不会终止整个 Shiny 会话;
  • Word 和 CSV 始终对应当前成功分析;
  • 并列、越界、非数值、重复项目名和维度超限均在分析前检查。

10.89.7 操作步骤

顶部菜单选择 “按统计学分类模块” → “决策分析” → “层次分析法” 进入模块。

  1. 确认数据中每行是项目、每个评分列是一位决策者;
  2. 在“项目名称变量”选择文本标签列,或保留自动生成;
  3. 选择 1–20 个决策者评分变量;
  4. 保留需要的表格和图形,默认已全部勾选;
  5. 点击“开始层次分析法”;
  6. 先核对分析概览和综合判断矩阵;
  7. 再解释项目权重、排名和一致性比率;
  8. 在下载页导出 Word 报告或项目权重 CSV。
层次分析法:完整设置面板
层次分析法:完整设置面板

10.89.8 生成的表格和图形

一键自动生成以下结果:

1. 分析概览

报告原始项目数、分析项目数、排除项目数、决策者数、评分变量、评分范围、缺失处理和一致性判定阈值。

2. 综合判断矩阵

矩阵的行、列均为项目。对角线固定为 1,任意两个对称位置互为倒数。值大于 1 表示行项目相对列项目具有更高的综合优先程度。

3. 项目权重与排名

权重之和为 1,百分比之和为 100%。排名 1 表示当前评分和汇总规则下综合权重最高。

4. 一致性指数与比率

第一行是综合结果,后续各行对应一位决策者。CR < 0.10 标记为“可接受”;CR ≥ 0.10 标记为“需复核”。

层次分析法:项目权重与一致性表
层次分析法:项目权重与一致性表

5. 项目权重排名图

按综合权重从高到低显示项目,条形末端给出权重数值。

层次分析法:项目权重排名图
层次分析法:项目权重排名图

6. 一致性比率图

每个点表示综合结果或一位决策者的 CR;红色虚线是 0.10 阈值。点越靠近 0,当前判断越接近内部一致。

层次分析法:一致性比率图
层次分析法:一致性比率图

7. 综合判断矩阵热图

颜色显示项目两两比较的方向和强度,格内数字是综合判断比值。暖色对应小于 1,冷色对应大于 1。

层次分析法:综合判断矩阵热图
层次分析法:综合判断矩阵热图

10.89.9 判断矩阵如何阅读

判断矩阵应满足三个基本特征:

  1. 对角线为 1:项目与自身同等重要;
  2. 互为倒数:若 A 相对 B 为 4,则 B 相对 A 为 1/4;
  3. 方向一致:高分项目相对低分项目通常位于矩阵大于 1 的一侧。

判断矩阵不是相关矩阵。矩阵值不在 -1 到 1 之间,也没有 P 值。它描述的是相对优先程度,不是变量之间的统计关联。

10.89.10 权重与排名如何解释

项目权重表示项目在当前决策者评分集合中的相对份额。权重 0.35 可表述为“该项目占综合优先权重的 35%”,但不能写成“该项目使结局提高 35%”。

排名只给出相对次序,不反映相邻项目差异是否具有统计显著性。若两个项目权重接近,应结合研究目的、评分不确定性和敏感性分析谨慎解释。

权重依赖纳入的项目集合和决策者集合。添加、删除项目或更换决策者后,全部权重都可能改变,因此报告中应明确项目定义、决策者资格和评分流程。

10.89.11 CI 与 CR 如何理解

一致性指数(CI)衡量判断矩阵偏离完全一致的程度。CI 越接近 0,内部判断越一致。

一致性比率(CR)把 CI 与同维度随机判断的预期不一致程度进行比较。模块以 CR < 0.10 作为可接受阈值。

当某位决策者 CR ≥ 0.10 时,应回到原始评分复核是否存在顺序矛盾、录入错误或对项目定义理解不一致。综合 CR 可接受不代表每位决策者都可接受,因此两类结果都应查看。

10.89.12 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合项目数、决策者数、权重、排名和一致性结果生成论文 Results 风格初稿。

三张统计图也提供中英文描述按钮。自动描述只概括判断矩阵、权重和一致性,不会把优先权重解释为因果效应或临床疗效。

10.89.13 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格和图形;“下载项目权重 CSV”保存项目名称、权重、权重百分比和排名。

层次分析法:下载页面
层次分析法:下载页面

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.89.14 从模块结果转入论文写作

Methods 建议说明:项目定义、决策者人数及资格、评分范围、是否允许并列、缺失处理、综合判断矩阵的汇总方式、权重计算和 CR 判定阈值。

结果写作示例:5 位专家对 6 个评价项目完成 1–9 分评分。综合一致性比率为 0.003,低于预设的 0.10 阈值。疗效的综合权重最高(0.351),其次为安全性(0.286)和生活质量(0.203);依从性、成本和可及性的权重分别为 0.069、0.048 和 0.042。所有专家的 CR 均低于 0.10,未发现需要重新评分的一致性问题。

10.89.15 常见问题

1. 为什么每行不是一名研究对象?

本模块分析的是项目优先级,不是受试者结局。每行必须是一个待比较项目,每个评分列是一位决策者。

2. 可以选择一位决策者吗?

可以。模块会给出该决策者的判断矩阵、权重和一致性;综合结果与该决策者结果相同。

3. 为什么不能给两个项目相同分数?

本模块用评分差构造成对判断。并列会产生 0 差值,不能形成有效倒数矩阵,因此需要决策者明确先后次序。

4. 有一个评分缺失会怎样?

该项目整行从当前分析排除。应先确认缺失是否可以由原决策者补全,避免项目集合发生非计划改变。

5. 综合 CR 合格就可以忽略个体 CR 吗?

不可以。不同决策者的不一致可能在汇总后相互抵消,仍应检查每位决策者的 CR。

6. CR 低是否证明权重正确?

不能。低 CR 只说明判断内部一致,不证明项目选择、评分者资格或研究结论具有外部效度。

7. 权重可以当作回归系数或效应量吗?

不可以。权重是决策优先份额,没有标准误、置信区间或 P 值,也不表示对临床结局的因果影响。

8. 项目超过 10 个怎么办?

应先依据理论或决策框架分层整理项目,或改用支持多层准则树和更大判断矩阵的专门决策分析工具,不应随意删除项目以满足上限。

10.89.16 小结

本模块的最佳使用方式是:先确认项目行和决策者列的数据方向,再检查 1–9 分、缺失和并列,随后阅读综合判断矩阵与权重,最后同时核对综合和个体 CR。

层次分析法用于把明确的决策判断结构化,不替代研究设计、临床证据或因果推断。

10.90 层次分析法问卷分析

10.90.1 模块功能

本模块用于分析多名受访者完成的层次分析法两两比较问卷。程序把每名受访者的有符号 1–9 比较值还原为判断矩阵,计算个体属性权重和一致性比率(CR),再汇总群体偏好权重与综合判断矩阵。

本模块与“层次分析法”模块的数据方向不同:

  • 层次分析法:每行是项目,每列是决策者给出的项目评分;
  • 层次分析法问卷分析:每行是一名受访者,每列是一对属性的直接比较。

医疗服务方案偏好例子:60 名受访者比较疗效、安全性、生活质量、成本和可及性。5 个属性共有 10 对比较。模块汇总群体属性权重,报告每名受访者的 CR,并比较不同权重算法是否会明显改变个体结果。

10.90.2 适用场景

适合以下问题:

  1. 受访者直接填写属性之间的两两比较问卷;
  2. 需要估计群体层面的属性优先权重;
  3. 需要检查每名受访者判断的一致性;
  4. 需要比较不同权重计算方法的敏感性;
  5. 属性数为 3–12 个,且问卷包含全部属性组合。

不建议直接使用的情况:

  • 数据只有各项目的独立评分,没有两两比较;
  • 每一对属性没有统一的方向和编码规则;
  • 问卷只抽取部分属性组合,不能形成完整判断矩阵;
  • 需要估计治疗效应、诊断效能、风险预测或因果关系;
  • 属性存在多层准则树,需要逐层合成局部与全局权重;
  • 受访者使用的不是可转换为有符号 1–9 的比较标度。

10.90.3 数据结构与变量顺序

每行是一名受访者。若有 \(k\) 个属性,需要 \(k(k-1)/2\) 个两两比较变量。

以 5 个属性“疗效、安全性、生活质量、成本、可及性”为例,需要 10 个变量,顺序固定为:

  1. 疗效 vs 安全性;
  2. 疗效 vs 生活质量;
  3. 疗效 vs 成本;
  4. 疗效 vs 可及性;
  5. 安全性 vs 生活质量;
  6. 安全性 vs 成本;
  7. 安全性 vs 可及性;
  8. 生活质量 vs 成本;
  9. 生活质量 vs 可及性;
  10. 成本 vs 可及性。
受访者 ID 疗效_安全性 疗效_生活质量 疗效_成本 …… 成本_可及性
R001 -3 -5 -7 …… 2
R002 2 -4 -6 …… -1
R003 -1 -3 5 …… 3

左侧面板会根据属性名称自动列出所需变量数和完整配对顺序。两两比较变量必须严格按这个顺序选择,不能只依赖数据库中的列名猜测方向。

10.90.4 有符号 1–9 如何编码

每个比较值的绝对值必须在 1–9 之间,不能为 0:

  • 负值:偏向该变量所代表的前一个属性;
  • 正值:偏向后一个属性;
  • 绝对值越大:偏好强度越高;
  • 绝对值为 1:表示轻微偏向,而不是完全相等;
  • 0:不能形成有效方向,模块会停止并提示。

例如,“疗效 vs 安全性”为 -5,表示受访者明显偏向疗效;若为 5,则表示明显偏向安全性。

编码方向是分析中最容易出现的系统性错误。录入前必须核对问卷说明、变量标签和数值正负方向。若方向整体反了,程序仍可能正常计算,但权重解释会完全相反。

10.90.5 缺失值与受访者 ID

任一选定比较变量缺失,该受访者会从本次分析中排除。分析概览同时报告原始受访者数、有效受访者数和排除人数。

“受访者 ID 变量”可以不选,程序会按数据行号自动生成。若选择 ID 变量,则 ID 必须唯一;缺失 ID 会用对应行号补齐。ID 只用于个体结果识别,不参与权重计算。

10.90.6 支持的汇总方法

10.90.6.1 偏好权重方法

  • 特征向量:从判断矩阵的主特征向量获得权重;
  • 几何平均:根据各行元素的几何平均获得权重;
  • 算术平均:按算术平均规则计算个体偏好;
  • 均方根:按均方根规则计算个体偏好。

模块保留方法返回的原始汇总偏好权重,同时另外计算总和为 100% 的归一化权重,用于排序和直观解释。

10.90.6.2 判断矩阵汇总方法

  • 几何平均:群体矩阵保持严格倒数关系,通常作为默认选择;
  • 算术平均:对个体判断按算术平均汇总;
  • 均方根:对个体判断按均方根汇总。

几何平均汇总后的对称元素互为倒数。算术平均和均方根汇总强调不同的群体中心位置,其对称元素不一定严格互为倒数,因此应在 Methods 中说明选择的方法。

10.90.6.3 方法比较 A 与 B

可从四种偏好权重方法中分别选择 A 和 B。模块计算每名受访者在两种方法下所有属性权重的最大绝对差,并绘制方法敏感性图。

图中的 0.05 参考线用于提示值得关注的差异,不是显著性检验阈值,也没有对应 P 值。

10.90.7 支持的分析内容

本模块支持:

  • 3–12 个唯一属性;
  • 自动计算所需两两比较变量数和顺序;
  • 可选受访者 ID;
  • 四种个体偏好权重方法;
  • 三种群体判断矩阵汇总方法;
  • 群体偏好原始权重、归一化百分比和排名;
  • 综合判断矩阵;
  • 每名受访者的属性权重和 CR;
  • CR ≤ 0.10 的一致性判定;
  • 权重图、CR 分布图和方法差异图;
  • 所有主表和主图的中文、英文描述;
  • PNG、TIFF、SVG、PDF、Word 和个体结果 CSV 下载。

10.90.8 主要特点

  • 所有表格和图形默认勾选;
  • 左侧不设置图宽或图高,每幅图使用固定出版尺寸;
  • 主表统一提供中英文描述按钮;
  • 主图统一提供中英文描述和四种图像格式;
  • 分析和下载均有可恢复错误边界;
  • Word 和 CSV 始终对应最近一次成功分析;
  • 变量数、编码范围、重复 ID 和方法参数均在计算前校验。

10.90.9 操作步骤

顶部菜单选择 “按统计学分类模块” → “决策分析” → “层次分析法问卷分析” 进入模块。

  1. 确认每行是一名受访者,每列是一对属性的比较;
  2. 按问卷顺序输入 3–12 个属性名称,用英文逗号分隔;
  3. 核对面板显示的配对顺序;
  4. 可选受访者 ID 变量;
  5. 按提示顺序选择全部两两比较变量;
  6. 选择偏好权重方法、判断矩阵汇总方法和方法比较 A/B;
  7. 保留需要的表格和图形,默认已全部勾选;
  8. 点击“开始层次分析法问卷分析”;
  9. 依次核对分析概览、偏好权重、判断矩阵和 CR;
  10. 在下载页导出 Word 报告或个体结果 CSV。
层次分析法问卷分析:完整设置面板
层次分析法问卷分析:完整设置面板

10.90.10 生成的表格和图形

一键自动生成以下结果:

1. 分析概览

报告原始与有效受访者数、属性数、属性名称、比较变量数、权重方法、矩阵汇总方法、方法比较、编码方向和缺失处理。

2. 综合偏好权重

给出各属性的原始汇总偏好权重、归一化权重百分比和排名。排名 1 表示当前受访者集合与算法下综合偏好最高。

层次分析法问卷分析:综合偏好权重表
层次分析法问卷分析:综合偏好权重表

3. 综合判断矩阵

矩阵行列均为属性。几何平均汇总时,对角线为 1,两个对称位置互为倒数。值大于 1 表示行属性相对列属性具有更高的群体偏好程度。

4. 一致性比率汇总

报告 CR ≤ 0.10 和 CR > 0.10 的人数、可接受比例、平均 CR、中位数 CR 和最大 CR。

层次分析法问卷分析:一致性比率汇总表
层次分析法问卷分析:一致性比率汇总表

5. 综合偏好权重图

按属性显示归一化群体权重。条形长度表示当前属性在全部属性中的相对份额。

层次分析法问卷分析:综合偏好权重图
层次分析法问卷分析:综合偏好权重图

6. 个体一致性比率分布图

显示全部有效受访者的 CR 分布,虚线为 0.10。图形用于识别整体一致性质量和高 CR 尾部。

层次分析法问卷分析:个体一致性比率分布图
层次分析法问卷分析:个体一致性比率分布图

7. 权重计算方法差异图

每个点表示一名受访者在方法 A 与方法 B 下最大的属性权重绝对差。点越高,说明该受访者的权重对算法选择越敏感。

层次分析法问卷分析:权重计算方法差异图
层次分析法问卷分析:权重计算方法差异图

10.90.11 权重如何解释

归一化权重表示当前受访者群体在纳入属性之间的相对偏好份额。例如某属性权重为 44%,可表述为“该属性在当前群体综合偏好中的相对权重为 44%”。

不能写成“该属性使结局提高 44%”,也不能把权重当作回归系数、相对危险度、优势比或治疗效应。权重没有常规意义下的标准误、置信区间或 P 值。

权重依赖属性集合、受访者构成、问卷编码和计算方法。增加或删除属性、更换样本或改变算法后,全部权重和排名都可能变化。

10.90.12 CR 如何理解

CR 衡量同一受访者多项两两比较之间的内部逻辑一致性。模块将 CR ≤ 0.10 标记为“可接受”,CR > 0.10 标记为“需复核”。

CR 较高可能来自:

  • 受访者真实偏好存在循环矛盾;
  • 问卷题意理解不一致;
  • 正负方向录入错误;
  • 疲劳、随机作答或漏答后的不当补值;
  • 属性定义重叠,难以稳定比较。

CR 低只表示内部判断较一致,不证明偏好“正确”,也不代表样本具有代表性或结论具有因果意义。

10.90.13 方法比较如何解释

若大多数点接近 0,说明个体权重对两种算法较稳健。若部分点明显高于 0.05,可进一步检查这些受访者的原始比较、CR 和属性权重。

方法差异图是描述性敏感性分析。不能根据 0.05 参考线写“差异具有统计学意义”,也不应仅因图中存在高点就删除受访者。

10.90.14 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合属性、受访者数、权重方法、矩阵汇总方法和 CR 结果生成论文 Results 风格初稿。

三张统计图也提供中英文描述按钮。自动描述用于概括偏好结构、一致性分布和方法敏感性,不会把偏好权重写成治疗效应、因果效应或临床推荐。

10.90.15 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格和图形;“下载个体结果 CSV”保存受访者 ID、CR、一致性判定和当前偏好方法下的各属性权重。

层次分析法问卷分析:下载页面
层次分析法问卷分析:下载页面

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.90.16 从模块结果转入论文写作

Methods 建议说明:属性定义和顺序、比较题目数量、正负编码方向、受访者人数、缺失处理、个体权重方法、群体矩阵汇总方法、CR 阈值以及是否进行方法敏感性比较。

结果写作示例:60 名受访者完成 5 个属性的 10 项两两比较,其中 38 名(63.3%)的 CR 不超过 0.10。采用几何平均法时,安全性的归一化群体权重最高(44.7%),其次为成本(27.9%)和疗效(16.1%);生活质量与可及性的权重分别为 7.2% 和 4.1%。个体 CR 的中位数为 0.084,提示多数受访者判断达到预设一致性标准,但仍有 22 名受访者需要结合原始问卷进一步复核。

10.90.17 常见问题

1. 为什么属性数改变后变量数也改变?

因为必须包含全部两两组合。\(k\) 个属性需要 \(k(k-1)/2\) 个变量;5 个属性需要 10 个,6 个属性需要 15 个。

2. 变量名必须写成“属性 A_属性 B”吗?

不必须。程序按选择顺序读取变量,不靠列名计算。但清楚的变量名有助于人工核对方向和顺序。

3. 可以输入 0 表示两属性同等重要吗?

不可以。本模块使用有方向的有符号 1–9 编码,0 无法确定偏向方向。应在问卷设计阶段明确同等判断如何转换或改用支持等权值的录入方案。

4. 有一个比较缺失会怎样?

该受访者整行从当前分析排除,因为完整判断矩阵不能由不完整比较直接恢复。分析概览会报告排除人数。

5. CR 超过 0.10 就应删除受访者吗?

不应自动删除。先核对录入、编码方向、题意理解和预先规定的质量控制方案。任何排除都应在分析前定义并透明报告。

6. 为什么不同权重方法的原始权重之和不一定等于 1?

不同算法的原始汇总尺度可能不同。模块保留原始值用于追溯,同时提供总和为 100% 的归一化权重用于比较和排名。

7. 方法比较差异超过 0.05 是否显著?

不是。0.05 只是描述性参考线,没有统计检验或 P 值含义。

8. 综合判断矩阵为什么不总是严格互为倒数?

几何平均汇总保持倒数关系;算术平均和均方根汇总强调不同的群体中心,可能不保持严格倒数。报告时应注明矩阵汇总方法。

9. 可以把权重用于临床决策吗?

权重可以作为结构化决策信息的一部分,但不能单独替代临床证据、患者安全、成本效果评价或正式决策程序。

10. 与普通层次分析法模块如何选择?

若数据是“项目行、专家评分列”,使用“层次分析法”;若数据是“受访者行、两两比较列”,使用“层次分析法问卷分析”。

10.90.18 小结

本模块的最佳使用方式是:先确认受访者行和两两比较列的数据方向,再严格核对属性顺序与正负编码,随后解释群体权重和判断矩阵,最后同时检查个体 CR 与方法敏感性。

层次分析法问卷用于结构化群体偏好,不替代研究设计、临床证据、代表性评估或因果推断。

10.91 多个诊断试验比较

10.91.1 模块功能

本模块用于比较同一批研究对象上完成的 2–3 项诊断试验。每项试验都与同一金标准比较,同时报告列联表、诊断性能、置信区间、总体一致率(OPA)、配对统计比较、性能指标差值和分层结果。

核心问题是:在受试者和金标准完全配对的前提下,哪项试验的灵敏度、特异度、预测值、似然比和准确度更合适,各试验总体正确性是否存在统计学差异,以及这种表现是否在不同亚组中保持一致。

影像学检查例子:240 名受试者均完成病理金标准和 A、B、C 三种影像诊断方法。模块比较三种方法的诊断性能,进行 Cochran Q 总体检验和 Holm 校正的成对比较,并按研究中心展示分层结果。

10.91.2 适用场景

适合以下研究:

  1. 同一批受试者同时完成 2 或 3 项待评价试验;
  2. 每名受试者具有同一可用的二分类金标准;
  3. 需要比较试验总体诊断正确性,而不只是分别报告性能指标;
  4. 需要使用外部目标人群患病率重新计算 PPV 和 NPV;
  5. 需要描述不同中心、性别、年龄组或病程分层的诊断表现。

不建议直接使用的情况:

  • 不同试验来自不同受试者,无法逐例配对;
  • 金标准为连续值,且尚未定义阳性界值;
  • 只有一项待评价试验,不需要试验间比较;
  • 试验结果是有序多分类或无序多分类,且不能二分化;
  • 需要直接比较非配对试验、多个金标准或无金标准潜在类诊断模型;
  • 研究目标是 ROC 曲线或 AUC 比较,应转入“诊断试验 ROC 分析”模块。

10.91.3 数据结构

每行必须是同一名受试者,每列是金标准、一项待评价试验或可选的分层变量。

ID Gold TestA TestB TestC Site
001 Positive Positive Positive Negative Center A
002 Negative Negative Negative Negative Center B
003 Positive Positive Negative Positive Center A

金标准和试验变量应定义为分类变量,并明确指定哪个水平代表“阳性”。当勾选“排除阳性和明确阴性以外的未确定结果”时,还需指定每个变量的“明确阴性”水平。

变量的阳性方向必须与临床定义一致。若把“阴性”误选为阳性,程序仍可以计算,但灵敏度、特异度、PPV、NPV 和似然比的解释都会发生根本性错误。

10.91.4 缺失值与未确定结果

模块先对金标准、全部选定试验和分层变量执行完整案例分析。任一必需变量缺失,该受试者都不进入当前比较。“分析概览”会分别报告原始样本数、缺失排除数和未确定结果排除数。

默认勾选未确定结果排除:只保留所有变量都明确属于阳性或阴性的行。取消勾选后,各试验中非阳性的水平由统计核心归入非阳性结果。若“可疑”或“无法判定”具有独立临床意义,不应为了增加样本量而直接并入阴性;应在统计分析计划中预先规定处理方式。

10.91.5 诊断性能指标

对每项试验构造 \(2\times2\) 列联表,其中 TP、FP、FN 和 TN 分别表示真阳性、假阳性、假阴性和真阴性。

  • 灵敏度 \(=TP/(TP+FN)\):金标准阳性者中被试验检出的比例;
  • 特异度 \(=TN/(TN+FP)\):金标准阴性者中被正确排除的比例;
  • 阳性预测值(PPV) \(=TP/(TP+FP)\):试验阳性者真正患病的比例;
  • 阴性预测值(NPV) \(=TN/(TN+FN)\):试验阴性者真正无病的比例;
  • 准确度 \(=(TP+TN)/N\):全部受试者中分类正确的比例;
  • 阳性似然比(LR+) \(=Sensitivity/(1-Specificity)\)
  • 阴性似然比(LR-) \(=(1-Sensitivity)/Specificity\)

PPV 和 NPV 会随患病率变化。LR+ 和 LR- 相对不受目标人群患病率影响,更适合用于跨场景的检验后概率更新。

10.91.6 PPV / NPV 的患病率来源

左侧面板提供两种选择:

  • 当前样本:PPV 和 NPV 基于分析样本中金标准阳性所占比例,并显示比例指标的 95% 置信区间;
  • 外部目标人群:输入 0.1%–99.9% 的目标患病率,按该患病率重新计算 PPV 和 NPV,而灵敏度、特异度和似然比不改变。

外部患病率应来自与实际应用场景相匹配的流行病学资料、队列研究或医疗机构数据,并在 Methods 中说明来源。不应为了获得更理想的预测值而事后选择患病率。

10.91.7 OPA 与非劣效判定

OPA 是试验与金标准的总体一致率,数值与二分类准确度相同。模块支持 Wilson、Logit 和 Clopper–Pearson 精确法的 95% 置信区间。

非劣效判定使用预先设定的 50%–99% OPA 界值。只有当 OPA 置信区间下限高于界值时,才标记为达到非劣效要求。界值应在研究开始前根据临床可接受性、监管要求或既往研究确定。

OPA 未校正随机一致,不能代替 Kappa;这个基于单项试验 OPA 下限的判定也不是两项试验之间的正式等效或非劣效试验。

10.91.8 配对统计比较

模块先把每项试验转换为“相对金标准分类正确”或“分类错误”,然后进行配对比较。

  • 2 项试验:使用 McNemar 检验,重点考察“A 正确而 B 错误”与“A 错误而 B 正确”两类不一致对是否平衡;
  • 3 项试验:先使用 Cochran Q 检验判断三项试验的总体正确性是否相同,再进行成对 McNemar 比较,并使用 Holm 方法校正多重比较的 P 值。

建议每个成对比较至少具有 10 个不一致对。当不一致对较少时,P 值和差值置信区间可能不稳定。

“配对性能指标差值”表分别报告灵敏度、特异度和准确度的前一试验减后一试验,单位为百分点。置信区间使用配对比例差的相关标准误正态近似计算。小样本、稀疏格子或所有不一致都朝同一方向时应谨慎解释。

多个诊断试验比较:配对检验与指标差值
多个诊断试验比较:配对检验与指标差值

10.91.9 分层分析

选择分层变量后,模块在每个亚组内分别计算各试验的灵敏度、特异度、PPV、NPV 和准确度。分层表用于描述表现异质性,不包含正式交互作用检验。

多个诊断试验比较:分层诊断性能
多个诊断试验比较:分层诊断性能

若亚组样本少、金标准阳性或阴性人数过少,分层指标会非常不稳定。不应仅根据两个亚组点估计不同就宣称存在效果修饰。

10.91.10 操作步骤

顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “多个诊断试验比较” 进入模块。

  1. 确认每行是同一名受试者,且各试验与金标准逐行对齐;
  2. 选择金标准变量和金标准阳性水平;
  3. 选择 2 或 3 个不同的诊断试验变量,分别指定阳性水平;
  4. 如果存在可疑或未确定结果,保留默认排除选项,并指定明确阴性水平;
  5. 可选分层变量;
  6. 选择 PPV / NPV 的患病率来源;
  7. 选择 OPA 置信区间方法并设置预先规定的非劣效界值;
  8. 保留所需表格和图形,默认已全部勾选;
  9. 点击“开始多个诊断试验比较”;
  10. 依次核对概览、诊断性能、配对比较、分层结果和统计图,最后导出 Word 或 CSV。
多个诊断试验比较:完整设置面板
多个诊断试验比较:完整设置面板

10.91.11 生成的表格和图形

一键自动生成以下结果:

1. 分析概览

报告原始与有效样本数、缺失与未确定结果排除数、金标准、试验数量、患病率来源、OPA 方法、非劣效界值和分层变量。

2. 各诊断试验 \(2\times2\) 列联表

对每项试验显示试验阳性、试验阴性与金标准阳性、阴性的计数。

3. 诊断性能比较与 95% 置信区间

汇总灵敏度、特异度、准确度、PPV、NPV、LR+ 和 LR-。当患病率来源为当前样本时,同时显示比例指标的 95% 置信区间。

4. 总体一致率与非劣效判定

报告每项试验的 OPA、95% 置信区间、非劣效界值和判定。

多个诊断试验比较:列联表、性能指标和 OPA
多个诊断试验比较:列联表、性能指标和 OPA

5. 配对试验与性能差值

两项试验显示 McNemar 检验;三项试验显示 Cochran Q 总体检验和 Holm 校正的成对结果。差值表按百分点报告灵敏度、特异度和准确度差值及其 95% 置信区间。

6. 分层诊断性能

在每个亚组内分别报告各试验的性能指标,用于识别需要进一步验证的异质性线索。

7. 诊断性能对比图

将各试验的灵敏度、特异度、准确度、PPV 和 NPV 放在同一图中比较。

多个诊断试验比较:诊断性能对比图
多个诊断试验比较:诊断性能对比图

8. 诊断性能雷达图

以多轴轮廓同时展示五项比例指标。轮廓用于快速识别性能取舍,不能取代表格中的数值和置信区间。

多个诊断试验比较:诊断性能雷达图
多个诊断试验比较:诊断性能雷达图

9. 逐病例一致性热图

将金标准和各试验的阳性、阴性结果按病例并列,最多显示 200 个排序病例。成片的不一致可提示需要回到原始数据核查的结构。

多个诊断试验比较:逐病例一致性热图
多个诊断试验比较:逐病例一致性热图

10.91.12 结果解释顺序

  1. 先核对有效样本数、患病率、阳性水平和排除数;
  2. 检查各试验的 \(2\times2\) 列联表,确认数据方向正确;
  3. 结合研究目标解释灵敏度与特异度的取舍,不只根据准确度排名;
  4. 在明确患病率来源后再解释 PPV 和 NPV;
  5. 两项试验阅读 McNemar,三项试验先阅读 Cochran Q,再阅读 Holm 校正的成对比较;
  6. 结合性能差值及其 95% 置信区间评估差异方向和不确定性;
  7. 把分层结果视为描述性证据,必要时另行设计交互作用或外部验证分析。

10.91.13 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合样本数、试验数、患病率来源、性能指标、配对比较和分层背景生成论文 Results 风格初稿。

三张统计图也提供中英文描述和 PNG、TIFF、SVG、PDF 下载。自动描述用于整理结果,不会把无统计学差异解释为等效,也不会据此生成临床推荐。

10.91.14 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格和图形;“下载诊断性能 CSV”保存每项试验的主要性能指标。

多个诊断试验比较:下载页面
多个诊断试验比较:下载页面

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.91.15 从模块结果转入论文写作

Methods 建议说明:研究设计和受试者来源、金标准、各试验的阳性界定、配对测量流程、缺失和未确定结果处理、患病率来源、置信区间方法、McNemar 或 Cochran Q 检验、Holm 多重比较校正、OPA 界值以及分层变量。

结果写作示例:共纳入 240 名同时完成金标准和三项诊断试验的受试者。TestA、TestB 和 TestC 的灵敏度分别为 82.47%、73.20% 和 85.57%,特异度分别为 80.42%、86.01% 和 70.63%,准确度分别为 81.25%、80.83% 和 76.67%。Cochran Q 检验未发现三项试验总体正确性存在统计学差异(\(Q=1.91\)\(df=2\)\(P=0.384\)),Holm 校正后的成对比较亦均无统计学意义。尽管 TestC 的灵敏度较高,其特异度较低,提示三项试验之间存在性能取舍,不应仅根据单一指标确定最优试验。

10.91.16 常见问题

1. 为什么至少要选两项试验?

本模块的目标是配对比较。若只有一项试验,应使用单项诊断准确性或 ROC 分析模块。

2. 不同试验可以来自不同人群吗?

不可以。McNemar 和 Cochran Q 要求同一受试者上的配对结果。非配对研究应使用其他比较方法。

3. 为什么只能比较最多三项试验?

当前模块按两试验和三试验的结果结构设计,三试验时已包含总体检验和三个成对比较。更多试验应使用专门的多检验比较设计。

4. 未确定结果是否应一律排除?

不应只为了结果更好而选择处理方式。默认排除是较保守的二分类处理,但主分析和敏感性分析的方案应事先制定。

5. 为什么输入外部患病率后 PPV 和 NPV 变了?

预测值依赖疾病的先验概率。外部患病率将性能投射到目标人群,但不改变当前数据估计的灵敏度和特异度。

6. OPA 达到非劣效是否说明两项试验等效?

不是。该判定是单项试验与金标准的 OPA 下限是否超过界值,不是两项试验差值的等效或非劣效检验。

7. Cochran Q 不显著是否证明三项试验相同?

不是。不显著只表示当前样本未提供足够证据拒绝总体正确性相同的假设,不代表已证明等效。

8. 为什么总体检验不显著,仍然显示成对比较?

成对表用于完整呈现预先规定的比较并给出 Holm 校正结果。当总体检验不显著时,应谨慎解释任何个别成对结果。

9. 灵敏度差值显著,但 McNemar 不显著,是否矛盾?

不矛盾。McNemar 比较全部受试者上的总体分类正确性,灵敏度差值只在金标准阳性者中计算,两者的估计对象不同。

10. 分层表中两个亚组数值不同,能否说明存在交互作用?

不能。分层表是描述性分析,没有直接检验亚组之间的性能差异。正式结论需要事先规定的交互检验或分层比较方法。

10.91.17 小结

本模块的最佳使用方式是:先确认同一受试者的金标准与全部试验逐行对齐,再核对阳性方向、缺失与未确定结果,随后联合解释性能指标、配对检验和差值置信区间,最后把分层结果作为需要进一步验证的描述性证据。

多个诊断试验比较能够在配对设计下展示各试验的诊断取舍,但不替代外部验证、临床效用评估、成本效果分析或正式决策研究。

10.92 联合诊断策略分析

10.92.1 模块功能

本模块用于评价同一批研究对象上 2–3 项二分类诊断试验的联合判定策略。除逐项报告每项试验的诊断性能外,模块还评价所有精确结果模式,以及并联、串联和三项试验时的多数规则。

核心问题是:当多项检查结果共同用于判断时,不同阳性组合和联合规则会如何改变灵敏度、特异度、预测值、准确度、似然比和诊断优势比,哪种规则在当前数据中表现出更合适的灵敏度与特异度平衡。

联合筛查例子:240 名受试者均完成病理金标准和 A、B、C 三项检查。研究者希望比较“任一检查阳性即判阳性”的并联策略、“三项均阳性才判阳性”的串联策略,以及“至少两项阳性”的多数策略,并保留每一种精确结果模式用于追溯。

10.92.2 适用场景

适合以下研究:

  1. 同一批受试者同时完成 2 或 3 项待评价试验;
  2. 每名受试者具有同一个可用的二分类金标准;
  3. 需要设计并联、串联或多数联合判定规则;
  4. 需要比较联合策略在漏诊和误诊之间的取舍;
  5. 需要保存逐病例结果模式,用于核查规则与原始数据的一致性。

不建议直接使用的情况:

  • 各试验来自不同受试者,无法逐病例配对;
  • 金标准或待评价试验尚未定义阳性水平;
  • 试验是连续指标,研究目标是估计最佳截断值或比较 AUC;
  • 需要训练加权评分、回归模型或机器学习模型,而不是使用预先规定的逻辑规则;
  • 试验超过三项,组合数迅速增加,应使用专门的多标志物建模与验证方案;
  • 需要评价净获益、成本效果或临床决策曲线,应转入相应模块。

10.92.3 数据结构

每行必须代表同一名受试者,每列是金标准或一项待评价试验。

ID Gold TestA TestB TestC
001 Positive Positive Positive Negative
002 Negative Negative Negative Negative
003 Positive Positive Negative Positive

金标准和每项试验均应为分类变量,并在左侧面板分别指定阳性水平。程序会把所选阳性水平编码为阳性,其余有效水平编码为阴性。

阳性方向是分析中最重要的设置之一。若把阴性水平误选为阳性,程序仍可能返回完整结果,但 TP、FP、FN、TN 及全部诊断性能指标的解释都会改变。

模块对金标准和全部选定试验执行完整案例分析。任一必需变量缺失,该受试者不进入当前分析。“分析概览”会报告原始样本数、有效样本数和缺失排除数。

10.92.4 联合判定规则

模块把每一种结果模式视为一个候选阳性规则。例如三项试验的 +/−/+ 表示 TestA 阳性、TestB 阴性、TestC 阳性;计算该模式的性能时,恰好符合该模式的受试者判为联合阳性,其余模式判为联合阴性。

此外自动构造以下临床常用逻辑规则:

  • 并联规则:至少一项试验阳性即判定为联合阳性。通常提高灵敏度,但可能降低特异度;
  • 串联规则:全部试验均阳性才判定为联合阳性。通常提高特异度,但可能降低灵敏度;
  • 多数规则:仅在选择三项试验时生成,至少两项阳性即判定为联合阳性,常用于平衡并联与串联的极端取舍。

两项试验会生成 4 种精确模式、并联和串联,共 6 种策略;三项试验会生成 8 种精确模式、并联、串联和多数规则,共 11 种策略。

并联、串联和多数规则不估计权重,也不会从数据中学习系数。它们是透明、可复核的逻辑判定规则。若需要让不同试验贡献不同权重,应使用回归或机器学习建模,并在独立数据中验证。

10.92.5 诊断性能指标

每个候选策略都构造一个 \(2\times2\) 列联表,并报告:

  • 灵敏度 \(=TP/(TP+FN)\)
  • 特异度 \(=TN/(TN+FP)\)
  • 阳性预测值(PPV) \(=TP/(TP+FP)\)
  • 阴性预测值(NPV) \(=TN/(TN+FN)\)
  • 准确度 \(=(TP+TN)/N\)
  • 平衡准确度 \(=(Sensitivity+Specificity)/2\)
  • Youden J \(=Sensitivity+Specificity-1\)
  • 阳性似然比(LR+) \(=Sensitivity/(1-Specificity)\)
  • 阴性似然比(LR-) \(=(1-Sensitivity)/Specificity\)
  • 诊断优势比(DOR) \(=LR+/LR-\)

PPV 和 NPV 受当前样本患病率影响。平衡准确度和 Youden J 同时考虑灵敏度与特异度,适合描述二者的总体平衡,但不能代替临床后果、成本和阈值偏好。

比例指标以及 LR+、LR-、DOR 同时报告 95% 置信区间。小样本、极端格子或某个格子为零时,似然比和 DOR 的区间可能很宽,应结合 TP、FP、FN、TN 一起解释。

10.92.6 图形过滤

“统计指标”可以选择全部常用指标,或单独选择患病率、灵敏度、特异度、PPV、NPV、准确度、平衡准确度、Youden J、LR+、LR- 和 DOR。

“结果模式类型”可以选择:

  • 全部模式与策略;
  • 全部试验阳性;
  • 全部试验阴性;
  • 混合或不一致模式。

这两个选择用于聚焦统计图,不删除主结果表中的策略。若需要完整报告,建议保留默认“全部常用指标”和“全部模式与策略”;若图中信息过密,再选择具体指标或结果模式。

10.92.7 推荐策略的含义

“最优联合策略推荐”先优先保留 TP、FP、FN、TN 四格计数均不小于 5 的策略,再从中选择 Youden J 最大者。若没有策略满足四格稳定性条件,则在全部策略中选择 Youden J 最大者,并显示稳定性警告。

联合诊断策略分析:推荐策略
联合诊断策略分析:推荐策略

该推荐是基于当前样本和 Youden J 的统计排序,不是临床指南,也没有考虑不同漏诊与误诊的损失、检查成本、可及性或患者偏好。正式采用前应预先规定规则,并进行外部验证和临床效用评估。

10.92.8 操作步骤

顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “联合诊断策略分析” 进入模块。

  1. 确认每行是同一名受试者,各试验与金标准逐行对齐;
  2. 选择金标准变量,并指定金标准阳性水平;
  3. 选择诊断试验 1 和诊断试验 2,分别指定阳性水平;
  4. 需要多数规则时,继续选择诊断试验 3;否则选择“不使用第三项试验”;
  5. 选择统计指标和结果模式过滤条件;
  6. 保留所需表格和图形,默认已全部勾选;
  7. 点击“开始联合诊断策略分析”;
  8. 先核对分析概览,再阅读联合策略、原始分布和统计图;
  9. 在下载页导出 Word、策略性能 CSV 和逐病例结果模式 CSV。
联合诊断策略分析:完整设置面板
联合诊断策略分析:完整设置面板

10.92.9 生成的表格和图形

一键自动生成以下结果:

1. 分析概览

报告原始与有效样本数、缺失排除数、金标准、阳性水平、诊断试验、试验数、精确模式数和自动生成的联合规则。

2. 联合诊断策略性能

逐行报告所有精确模式和逻辑规则的 TP、FP、FN、TN、患病率、灵敏度、特异度、PPV、NPV、准确度、平衡准确度、Youden J、LR+、LR- 和 DOR。

联合诊断策略分析:策略性能表
联合诊断策略分析:策略性能表

3. 联合策略 95% 置信区间

按策略和指标长格式报告灵敏度、特异度、PPV、NPV、准确度、LR+、LR- 和 DOR 的估计值及 95% 置信区间。

4. 金标准频数与结果模式列联表

显示金标准阳性和阴性人数,并将每种试验结果模式与金标准交叉汇总,用于核对组合规则的原始计数。

5. 单项试验列联表与诊断性能

分别报告每项试验的列联计数及灵敏度、特异度、PPV 和 NPV,帮助判断联合策略的表现来自哪些单项试验。

6. 最优联合策略推荐

报告当前样本中 Youden J 最大且优先满足四格稳定性条件的策略,并同时显示灵敏度、特异度、准确度和稳定性说明。

7. 联合策略性能条形图

并列比较所选指标。默认展示灵敏度、特异度、PPV、NPV 和准确度。

联合诊断策略分析:性能条形图
联合诊断策略分析:性能条形图

8. 联合策略性能热图

以颜色和数值同时展示各策略的性能轮廓,适合快速识别不同规则的优势与代价。

联合诊断策略分析:性能热图
联合诊断策略分析:性能热图

9. 联合策略置信区间森林图

默认将五项比例指标分面展示;选择 LR+、LR- 或 DOR 时会切换到相应指标。森林图用于同时观察点估计和不确定性。

联合诊断策略分析:置信区间森林图
联合诊断策略分析:置信区间森林图

10. 灵敏度-特异度决策空间图

横轴为灵敏度,纵轴为特异度。越靠近右上角的策略在当前样本中越接近二者同时较高,但仍需结合置信区间和临床后果。

联合诊断策略分析:灵敏度-特异度决策空间
联合诊断策略分析:灵敏度-特异度决策空间

10.92.10 结果解释顺序

  1. 先核对有效样本数、阳性水平和缺失排除数;
  2. 查看金标准频数和结果模式列联表,确认模式计数合理;
  3. 结合 TP、FP、FN、TN 判断每种策略的漏诊与误诊方向;
  4. 根据研究目的优先解释灵敏度或特异度,不只根据准确度排名;
  5. 在明确样本患病率后解释 PPV 和 NPV;
  6. 结合 95% 置信区间判断估计精度,尤其关注 LR 和 DOR 的宽区间;
  7. 把 Youden J 推荐视为候选方案,而不是自动临床结论;
  8. 使用逐病例 CSV 核对规则,并在独立数据中验证预先选定的策略。

10.92.11 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合金标准、试验数量、样本量、联合规则和表格内容生成医学论文 Results 风格初稿。

四张统计图也提供中英文描述,以及 PNG、TIFF、SVG、PDF 下载。自动描述会说明灵敏度与特异度的取舍和不确定性,不会把基于 Youden J 的排序写成临床指南。

10.92.12 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格和图形。“下载策略性能 CSV”保存每种精确模式和联合规则的主要诊断性能;“下载逐病例结果模式 CSV”保存原始行号、金标准、每项试验的阳性或阴性状态及组合模式。

联合诊断策略分析:下载页面
联合诊断策略分析:下载页面

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.92.13 从模块结果转入论文写作

Methods 建议说明:研究设计和受试者来源、金标准、各试验的阳性界定、配对测量流程、缺失处理、预先规定的联合规则、诊断性能指标、置信区间方法,以及是否使用 Youden J 进行探索性排序。

结果写作示例:共纳入 240 名同时完成金标准和三项诊断试验的受试者,金标准阳性率为 40.42%。并联规则的灵敏度为 100.00%、特异度为 51.05%,串联规则的灵敏度为 49.48%、特异度为 97.90%。多数规则的灵敏度为 91.75%、特异度为 88.11%,准确度为 89.58%,Youden J 为 0.799。在四格计数均不小于 5 的候选策略中,多数规则具有最高 Youden J。上述排序为当前样本的探索性结果,仍需在独立样本中验证。

10.92.14 常见问题

1. 并联和串联有什么区别?

并联是任一试验阳性即判阳性,通常减少漏诊;串联是全部试验阳性才判阳性,通常减少误诊。实际选择取决于研究目标和错误代价。

2. 两项试验为什么没有多数规则?

两项试验不存在独立于并联和串联的多数规则。“至少一项阳性”就是并联,“两项均阳性”就是串联。

3. 精确结果模式应怎样解释?

每一行表示把恰好符合该模式的受试者判为联合阳性,其余受试者判为联合阴性。它适合探索和追溯,不意味着所有模式都应作为独立临床规则。

4. 为什么并联策略灵敏度高但特异度低?

并联放宽了阳性条件,更多患者被检出,同时更多无病者也可能被判阳性。这是规则本身的预期取舍。

5. 为什么串联策略特异度高但灵敏度低?

串联要求所有试验均阳性,阳性条件更严格,因此假阳性通常减少,但部分真正患者会因任一试验阴性而被漏掉。

6. Youden J 最大是否代表策略最好?

不一定。Youden J 对灵敏度和特异度赋予相同权重,没有考虑漏诊和误诊的不同后果、检查成本或患者偏好。

7. 为什么某些 LR 或 DOR 的置信区间很宽?

精确模式可能只包含少数病例,或四格表中出现接近零的格子。此时比值指标不稳定,应同时报告原始计数并谨慎解释。

8. 图形过滤会改变主结果表吗?

不会。统计指标和结果模式过滤用于图形聚焦,主结果表仍保留完整策略,便于审计和导出。

9. 可以根据当前样本推荐直接制定临床流程吗?

不可以。当前结果可能存在过拟合和样本选择偏倚。候选规则应预先明确,并在独立人群中验证准确性、临床效用和可实施性。

10. 联合诊断策略分析与机器学习分类有什么区别?

本模块使用透明的逻辑规则,不学习权重;机器学习可以学习复杂组合关系,但需要训练集、测试集、调参、校准和外部验证。规则简单且预先规定时优先使用本模块,需要数据驱动建模时使用分类建模模块。

10.92.15 小结

本模块的最佳使用方式是:先确认金标准和全部试验逐病例配对,再核对阳性方向与结果模式,随后结合原始四格计数解释并联、串联和多数规则的灵敏度-特异度取舍,最后把候选策略带入独立验证和临床效用评价。

联合诊断策略分析提供透明、可追溯的规则比较,但不替代外部验证、临床决策曲线、成本效果研究或正式诊疗规范。

10.93 无金标准诊断试验评估

10.93.1 模块功能

本模块用于在没有完美金标准时,结合同一批受试者的 2–5 项二分类诊断试验,估计潜在患病率、各试验的灵敏度、特异度、阳性预测值和阴性预测值。

模块同时报告试验对的观察一致率与 Cohen Kappa,并列出所有阳性/阴性结果模式的频数和百分比。核心问题是:当真实疾病状态无法被一个完美参照直接观察时,不同统计假设下的试验性能估计是什么。

肿瘤标志物例子:356 名受试者同时完成 5 项二分类检测,但没有一项检查能作为完美金标准。研究者用潜在类别模型估计潜在患病状态,比较各标志物的灵敏度和特异度,并检查试验间一致性与结果模式。

10.93.2 适用场景

适合以下研究:

  1. 同一批受试者同时完成 2–5 项二分类试验;
  2. 不存在可被视为无误差的金标准,或现有参照本身不完美;
  3. 需要用潜在类别模型或组合参照方法估计试验性能;
  4. 需要同时报告试验间一致性和结果组合分布;
  5. 需要对方法假设做敏感性分析,比较不同伪参照定义。

不建议直接使用的情况:

  • 存在高质量、可信的金标准,应优先使用标准诊断准确性分析;
  • 各试验来自不同受试者,无法逐例对齐;
  • 试验是连续数值,研究目标是比较 AUC 或估计最佳截断值;
  • 需要显式建模条件依赖、多人群 Hui–Walter 模型、随机效应或先验分布的完整不确定性;
  • 样本很小、结果模式稀疏,或多数试验几乎完全相同。

10.93.3 数据结构

每行代表一名受试者,每列代表一项诊断试验,不需要金标准列。

ID TestA TestB TestC TestD TestE
001 Positive Positive Negative Positive Positive
002 Negative Negative Negative Negative Negative
003 Positive Negative Positive Negative Positive

每项试验应是至少含两个有效水平的分类变量。在左侧面板中为每项试验指定阳性水平,所选水平编码为阳性,其他有效水平编码为阴性。

阳性方向会决定潜在患病类别的识别和所有性能指标。即使程序能返回数值,错误的阳性定义仍会导致完全相反的解释。

模块使用全部选定试验的完整案例。任一必需试验缺失时,该受试者不进入当前分析。“分析概览”会报告原始样本数、有效样本数和缺失排除数。

10.93.4 估计方法

1. 潜在类别模型

把真实疾病状态视为两个不可直接观察的潜在类别,依据各试验的阳性概率识别潜在患病类别。本模块的该方法至少需要 3 项试验,默认两个潜在类别,并依赖给定潜在类别后试验间条件独立的假设。

2. 贝叶斯 EM 模型

通过 EM 迭代估计每名受试者的潜在患病概率,并用 Beta 先验对患病率、灵敏度和特异度进行平滑。该方法不等同于完整 MCMC 后验分析,结果应视为带先验约束的迭代估计。

3. 半数及以上阳性组合参照

用各试验中至少半数阳性作为伪参照阳性。例如两项试验时,至少一项阳性就归为伪参照阳性;五项试验时,至少三项阳性才归为阳性。

4. 全部试验阳性参照

只有全部试验均阳性时才定义伪参照阳性,属于严格、偏向高特异性的定义。

5. 任一试验阳性参照

任一试验阳性即定义伪参照阳性,属于宽松、偏向高灵敏度的定义。

组合参照方法把待评价试验本身纳入参照定义,存在纳入偏倚。“全部阳性”定义下单项试验灵敏度可能因定义而接近 100%;“任一阳性”定义下特异度可能因定义而接近 100%。这些是伪参照的数学结果,不是独立验证证据。

10.93.5 临床场景预设

预设不只显示说明,会真实更新分析参数:

临床场景 默认方法 Bootstrap 重抽次数 alpha
新诊断试验验证 潜在类别模型 1000 0.05
病理或评定者一致性 半数及以上阳性组合参照 500 0.05
肿瘤标志物验证 潜在类别模型 1000 0.05
人群筛查评估 任一试验阳性参照 500 0.05

预设是起点而不是自动最优选择。使用者应根据疾病流行率、试验机制、条件独立假设和研究目标决定方法。

10.93.6 Bootstrap 与置信区间

不勾选 Bootstrap 时,患病率、灵敏度和特异度使用正态近似区间。勾选后,模块按受试者重抽样,报告百分位数置信区间。可选 100–10000 次重抽,随机种子用于复现结果。

潜在类别 Bootstrap 需要在每个重抽样本中重新拟合模型,运行时间明显长于其他方法。建议先不勾选 Bootstrap 核对数据与模型,再在正式结果中启用足够的重抽次数。

10.93.7 操作步骤

顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “无金标准诊断试验评估” 进入模块。

  1. 确认每行是同一名受试者,所有试验逐行对齐;
  2. 选择临床场景预设,或保留“不使用预设”;
  3. 至少选择诊断试验 1 和 2,需要时继续选择试验 3–5;
  4. 为每项试验指定阳性水平;
  5. 选择估计方法;潜在类别模型至少需要 3 项试验;
  6. 设定 Bootstrap、重抽次数、alpha 和随机种子;
  7. 保留所需表格和图形,默认已全部勾选;
  8. 点击“开始无金标准诊断试验评估”;
  9. 先核对分析概览和方法,再解释性能、一致性和结果模式;
  10. 在下载页导出 Word、诊断试验性能 CSV 和结果模式 CSV。
无金标准诊断试验评估:完整设置面板
无金标准诊断试验评估:完整设置面板

10.93.8 生成的表格和图形

一键自动生成以下结果:

1. 分析概览

报告原始样本数、有效样本数、缺失排除数、各试验的阳性水平、估计方法、置信水平和区间方法。

无金标准诊断试验评估:分析概览
无金标准诊断试验评估:分析概览

2. 估计患病率

报告潜在患病率的点估计和置信区间。该患病率是所选模型或伪参照下的估计,不是金标准观察比例。

3. 各诊断试验性能

对每项试验报告灵敏度、特异度及其置信区间,以及 PPV 和 NPV。

4. 潜在类别模型拟合度

潜在类别方法报告 BIC、AIC、对数似然、G-squared、Chi-squared 和残差自由度。其他方法不生成该表。

无金标准诊断试验评估:试验性能与拟合度
无金标准诊断试验评估:试验性能与拟合度

5. 试验对一致性

列出每两项试验的 Cohen Kappa、P 值和观察一致率。Kappa 描述超越偶然一致的程度,不等同于灵敏度或特异度。

6. 试验结果模式分布

列出全部 \(2^k\) 种阳性/阴性组合。两项试验为 4 种,三项为 8 种,五项为 32 种。该表用于检查稀疏模式、高度一致或严重不一致。

无金标准诊断试验评估:一致性与结果模式
无金标准诊断试验评估:一致性与结果模式

7. 诊断试验性能图

并列显示每项试验的灵敏度、特异度和置信区间,便于比较试验之间的性能轮廓与不确定性。

无金标准诊断试验评估:试验性能图
无金标准诊断试验评估:试验性能图

8. 观察一致率热图

用颜色和百分比显示所有试验对的观察一致率。对角线为 100%,非对角线用于识别一致程度较高或较低的试验对。

无金标准诊断试验评估:观察一致率热图
无金标准诊断试验评估:观察一致率热图

9. Cohen Kappa 图

按试验对展示 Kappa,便于比较超越偶然一致的程度。图形应与观察一致率和原始结果模式一起解释。

无金标准诊断试验评估:Cohen Kappa 图
无金标准诊断试验评估:Cohen Kappa 图

10. 结果模式分布图

按频数显示全部阳性/阴性组合。当试验数较多时,可直观看出全部阴性、全部阳性和主要不一致模式。

无金标准诊断试验评估:结果模式分布图
无金标准诊断试验评估:结果模式分布图

10.93.9 结果解释顺序

  1. 先核对有效样本数、各试验的阳性定义和缺失排除数;
  2. 确认所选方法与研究问题一致,不把伪参照视为完美金标准;
  3. 查看结果模式表,识别稀疏、极端或几乎不存在的组合;
  4. 潜在类别方法下先查看拟合度,再解释患病率和试验性能;
  5. 同时解释灵敏度、特异度和置信区间,不只按单一点估计排名;
  6. 在明确模型估计患病率后解释 PPV 和 NPV;
  7. 用 Kappa 和观察一致率评估试验间一致性,不把一致性等同于准确性;
  8. 比较多种方法与阳性定义,把方法依赖性作为敏感性分析报告。

10.93.10 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合试验数、阳性水平、估计方法、样本量、置信区间和表格内容生成医学论文 Results 风格初稿。

四张统计图也提供中英文描述,以及 PNG、TIFF、SVG、PDF 下载。自动描述会强调无完美金标准下的方法假设,不会把模型估计写成经金标准证实的性能。

10.93.11 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格和图形。“下载诊断试验性能 CSV”保存每项试验的灵敏度、特异度、置信区间、PPV 和 NPV;“下载结果模式 CSV”保存所有阳性/阴性组合的频数和百分比。

无金标准诊断试验评估:下载页面
无金标准诊断试验评估:下载页面

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.93.12 从模块结果转入论文写作

Methods 建议说明:研究设计和受试者来源、为什么没有完美金标准、每项试验的阳性界定、完整案例处理、所选估计方法及其假设、潜在类别数、Bootstrap 次数、随机种子、置信水平,以及方法敏感性分析。

结果写作示例:共纳入 356 名完成五项诊断试验的受试者。在两类潜在类别模型下,估计患病率为 39.92%(95% CI:34.83%–45.00%)。TestA 的灵敏度和特异度分别为 79.41% 和 87.93%,TestD 分别为 95.34% 和 62.66%。试验对的观察一致率为 66.57%–75.00%。上述结果依赖两类潜在类别和条件独立假设,不代表经完美金标准验证的诊断性能。

10.93.13 常见问题

1. 没有金标准时,灵敏度和特异度是真实值吗?

它们是在所选模型和假设下的估计,不是直接对照完美金标准计算的真值。应报告假设,并尽可能做多方法敏感性分析。

2. 为什么潜在类别模型至少需要三项试验?

两项试验和一个人群下,患病率、两项试验的灵敏度和特异度通常无法同时被识别。增加第三项试验可提供更多结果模式,但仍需要条件独立等假设。

3. 如何选择潜在类别法与组合参照法?

潜在类别法通过概率模型估计不可观察状态,但依赖模型假设;组合参照法直观,但存在将待评试验纳入参照的偏倚。建议根据研究问题预先规定主方法,其他方法用于敏感性分析。

4. 试验间高度相关会怎样?

高度条件依赖可破坏基本潜在类别模型的条件独立假设,导致患病率、灵敏度和特异度估计偏移。Kappa 和一致率可提供线索,但不能单独证明或排除条件依赖。

5. 为什么勾选 Bootstrap 后很慢?

每次重抽都需要重新拟合模型。潜在类别方法还会使用多个随机起点寻找更好解,因此比组合参照和贝叶斯 EM 更耗时。

6. 为什么某些 Bootstrap 区间很宽?

结果模式稀疏、小样本、潜在类别分离不稳定或试验间高度依赖都会使重抽估计波动增大。应同时报告点估计、区间和模式分布。

7. Kappa 高是否表示试验都很准确?

不是。两项试验可能高度一致地给出错误结果。Kappa 评估一致性,准确性则需要额外的金标准或可信模型假设。

8. 为什么“全部阳性”方法中灵敏度很高?

因为伪参照阳性本身就要求所有试验阳性,每项试验都参与了参照定义。这是纳入偏倚的表现,不能作为试验高准确性的证据。

9. 为什么“任一阳性”方法中特异度很高?

伪参照阴性要求所有试验均阴性,因此每项试验对伪参照阴性的区分会受定义保证。同样不能将该结果视为独立验证。

10. 可以仅报告一种方法吗?

可以预先规定一种主方法,但无金标准结果对假设敏感。高质量报告通常会增加至少一种合理的替代方法或阳性定义作为敏感性分析。

10.93.14 小结

本模块的最佳使用方式是:先确认各试验逐例对齐和阳性定义,再根据研究问题选择潜在类别或组合参照方法,随后同时检查拟合、结果模式、一致性和不确定性,最后用替代方法做敏感性分析。

无金标准诊断评估能在参照不完美时提供量化估计,但结果永远依赖所选方法和假设,不替代独立验证、高质量参照或完整的临床证据。

10.94 正则化 Logistic 回归

10.94.1 模块功能

本模块用于二分类结局的正则化预测建模。它通过 LASSO、Ridge 或 Elastic Net 对回归系数进行收缩,降低多重共线性和候选特征过多时的过拟合风险。

模块可完成交叉验证选择 Lambda、特征筛选、预测性能评估、Bootstrap 内部验证、特征选择稳定性分析,并可将收缩后的模型近似换算为整数评分系统。

临床风险预测例子:研究者拟根据年龄、多项生物标志物、基线指标和疾病分期预测某临床事件。候选特征之间存在相关性,研究者使用 LASSO 筛选简约特征集,用 Bootstrap 估计乐观偏倚,再将模型转换为方便临床使用的整数评分。

10.94.2 适用场景

适合以下研究:

  1. 结局恰好包含两个有效水平;
  2. 研究目标是个体预测、候选特征筛选或模型简化;
  3. 候选特征较多,或特征之间存在明显相关性;
  4. 需要用交叉验证选择收缩强度;
  5. 需要用 Bootstrap 评估模型表观性能的乐观偏倚;
  6. 需要探索性构建整数风险评分。

不建议直接使用的情况:

  • 主要目标是对单个暴露的因果效应或经典假设检验进行推断;
  • 结局为连续、有序多分类、无序多分类或生存时间;
  • 有效样本少于 30,或事件组、参照组任一组少于 5 例;
  • 需要处理时间依赖、竞争风险、重复测量或随机效应;
  • 需要把当前样本中的表观性能直接解释为外部人群性能。

10.94.3 数据结构

每行代表一名研究对象,结局列是二分类变量,候选特征可以是数值型或分类变量。

ID Outcome Age Biomarker1 Biomarker2 Stage Center
001 Event 63 1.28 -0.31 III A
002 NoEvent 51 -0.46 0.72 II B
003 Event 67 0.91 -0.88 I A

在“事件水平”中明确哪个结局代表需要预测的事件。分类特征会在模型矩阵中展开为指示变量,因此“展开后的候选特征数”可能多于左侧面板选择的列数。

事件水平决定预测概率、优势比方向、灵敏度和特异度的含义。正式分析前必须核对编码。

模块对结局和所有候选特征使用完整案例。常量特征会自动移除;移除后至少需要两个可用候选特征。“分析概览”会报告原始样本、有效样本和缺失排除数。

10.94.4 惩罚类型与 Lambda

1. LASSO(L1)

对系数绝对值施加惩罚,可将部分系数收缩为精确的 0,适合特征筛选和构建简约模型。当高度相关特征同时存在时,LASSO 可能仅保留其中部分特征。

2. Ridge(L2)

对系数平方施加惩罚,通常保留全部特征,但将不稳定系数向 0 收缩。它适合相关特征共同承载预测信号的情况,不应将 Ridge 视为严格的变量删除方法。

3. Elastic Net

组合 L1 和 L2 惩罚。alpha 越接近 1,行为越接近 LASSO;越接近 0,越接近 Ridge。它适合既希望筛选特征,又希望成组保留相关特征的场景。

4. Lambda 选择规则

  • 最小交叉验证误差:选择交叉验证偏差最小的 Lambda,通常保留更多特征。
  • 1SE 规则:在最佳误差一个标准误范围内选择惩罚更强的模型,通常更简约。

交叉验证折数必须小于有效样本数。样本较小或事件少时,过多折数会使每折评估不稳定。随机种子用于复现分折和重抽样过程。

10.94.5 标准化、内部验证与整数评分

标准化候选特征使数值特征在可比尺度上接受惩罚,通常应保持勾选。否则,测量单位可能影响收缩程度。

Bootstrap 内部验证在每个重抽样本中重新拟合模型,估计 AUC、Brier 分数和校准斜率的乐观偏倚。校正值比表观值更适合描述内部验证后的预测性能,但仍不等同于外部验证。

整数评分系统将正则化系数近似换算为整数分值。可选系数乘 10 取整、最小绝对系数缩放、参考变量缩放,或同时比较全部方法。评分性能与连续模型的差距反映取整带来的信息损失。

“总分与事件率对照表”中的事件率来自当前建模样本。未经独立验证和必要的重校准,不应把该表直接当作其他人群的绝对风险表。

10.94.6 操作步骤

顶部菜单选择 “按统计学分类模块” → “回归分析和线性模型” → “正则化 Logistic 回归” 进入模块。

  1. 选择恰好包含两个有效水平的结局变量;
  2. 指定需要预测的事件水平;
  3. 选择至少两个候选特征,包括预先确定的临床特征;
  4. 选择 LASSO、Ridge 或 Elastic Net,Elastic Net 需设定 alpha
  5. 选择 Lambda 规则、交叉验证折数和随机种子;
  6. 通常保留“标准化候选特征”和“数据适用性评估”;
  7. 正式报告建议启用 Bootstrap 内部验证,并设定重抽次数;
  8. 需要简化临床工具时启用整数评分,并比较评分方法;
  9. 保留所需表格和图形,默认输出已全部勾选;
  10. 点击“开始正则化 Logistic 回归”;
  11. 依次核对概览、系数、性能、评分、验证和统计图;
  12. 在下载页导出 Word、模型系数 CSV 和逐病例预测 CSV。
正则化 Logistic 回归:完整设置面板
正则化 Logistic 回归:完整设置面板

10.94.7 生成的表格和图形

一键自动生成以下结果:

1. 分析概览与正则化模型摘要

报告原始与有效样本数、事件和参照数、候选特征、惩罚类型、alpha、所选 Lambda、交叉验证折数、标准化和 Bootstrap 设置,并给出展开后特征数与非零系数数量。

正则化 Logistic 回归:分析概览和模型摘要
正则化 Logistic 回归:分析概览和模型摘要

2. 非零系数与优势比

列出当前 Lambda 下的非零特征、收缩后系数、优势比和相对重要性。正则化系数以预测和收缩为目标,模块不把这些优势比配上传统回归的标准误、P 值和置信区间。

3. 模型性能

报告表观 AUC 及其区间、最佳概率阈值、准确率、灵敏度、特异度、精确率、F1 分数和 Brier 分数。这些指标基于当前建模数据,应结合 Bootstrap 校正值解释。

正则化 Logistic 回归:非零系数与模型性能
正则化 Logistic 回归:非零系数与模型性能

4. 整数评分表与评分性能

给出每个入选特征的方向和整数分值,并报告评分 AUC、分界值、分类性能、事件组与参照组平均分和评分范围。

正则化 Logistic 回归:整数评分表
正则化 Logistic 回归:整数评分表

5. 评分方法比较

选择“比较全部评分法”时,对比三种整数换算方法和未取整的连续模型,并报告 AUC、准确率和信息损失。

正则化 Logistic 回归:评分方法比较
正则化 Logistic 回归:评分方法比较

6. Bootstrap 内部验证

对 AUC、Brier 分数和校准斜率报告表观值、乐观偏倚与校正值。对 Brier 分数而言越小通常越好;校准斜率越接近 1 通常表明预测强度与观察数据更一致。

正则化 Logistic 回归:Bootstrap 内部验证
正则化 Logistic 回归:Bootstrap 内部验证

7. 变量重要性与选择稳定性

报告重要性得分、选择频率和稳定性排名。选择频率较低的特征可能对样本扰动敏感,不宜仅因一次拟合的非零系数就宣称它是稳定预测因子。

正则化 Logistic 回归:变量重要性与稳定性
正则化 Logistic 回归:变量重要性与稳定性

8. 正则化与普通 Logistic 模型比较

对比正则化模型、仅使用入选特征的普通 Logistic 模型和使用全部特征的普通 Logistic 模型。该比较主要展示复杂度和表观性能,不是独立测试集上的模型选择证据。

正则化 Logistic 回归:模型比较
正则化 Logistic 回归:模型比较

9. 交叉验证与 Lambda 选择图

横轴为 log(Lambda),纵轴为交叉验证偏差,阴影表示误差范围,虚线标示所选 Lambda。

正则化 Logistic 回归:交叉验证图
正则化 Logistic 回归:交叉验证图

10. 非零系数图

用条形方向和长度展示非零正则化系数。该图便于比较相对方向和幅度,但系数仍受标准化、参照水平和所选 Lambda 影响。

正则化 Logistic 回归:非零系数图
正则化 Logistic 回归:非零系数图

11. ROC 曲线

展示当前模型在建模样本中的区分能力。AUC 接近 0.5 表示区分能力接近随机,越接近 1 表示区分能力越强。ROC 不能代替校准、临床效用或外部验证。

正则化 Logistic 回归:ROC 曲线
正则化 Logistic 回归:ROC 曲线

10.94.8 结果解释顺序

  1. 先核对事件水平、有效样本数、事件数和缺失排除数;
  2. 确认惩罚类型、alpha、Lambda 规则、交叉验证折数和标准化设置;
  3. 核对展开后特征数和非零特征数,评估模型简化程度;
  4. 查看交叉验证图,确认所选 Lambda 处于合理区域;
  5. 解释非零系数的方向和相对重要性,不把非零自动解释为因果关系;
  6. 同时查看 AUC、Brier 分数、灵敏度、特异度和阈值,不仅报告单一 AUC;
  7. 正式结果优先解释 Bootstrap 校正后性能和选择稳定性;
  8. 如使用整数评分,比较其与连续模型的性能差异;
  9. 使用逐病例预测 CSV 进行审计,并在独立样本中做外部验证。

10.94.9 表格描述和统计图描述

每张主表下方都有“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会结合事件定义、候选特征、惩罚类型、样本量、交叉验证、性能和内部验证结果,生成医学论文 Results 风格初稿。

三张统计图也提供中英文描述,以及 PNG、TIFF、SVG、PDF 下载。自动描述会区分表观性能和内部验证结果,不会把收缩后关联写成因果结论。

10.94.10 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格和图形。“下载模型系数 CSV”保存非零特征、收缩后系数、优势比和相对重要性;“下载逐病例预测 CSV”保存原始行号、观察结局、预测概率和预测类别。

正则化 Logistic 回归:下载页面
正则化 Logistic 回归:下载页面

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.94.11 从模块结果转入论文写作

Methods 建议说明:研究设计和数据来源、结局与事件定义、候选特征的预先确定依据、缺失值处理、惩罚类型、alpha、标准化、交叉验证折数、Lambda 规则、随机种子、Bootstrap 次数、评分换算法,以及正式外部验证计划。

结果写作示例:共 260 例进入数据审查,排除 3 例候选特征缺失者后,257 例用于建模,其中 110 例发生事件。标准化 LASSO 模型采用 10 折交叉验证和 1SE 规则选择 Lambda,8 个展开后候选特征中保留 4 个非零系数。模型表观 AUC 为 0.801(95% CI:0.746–0.855),灵敏度为 0.800,特异度为 0.721,Brier 分数为 0.187。50 次 Bootstrap 内部验证后校正 AUC 为 0.781,校正 Brier 分数为 0.196。整数评分的 AUC 为 0.739,低于未取整的连续模型。该结果为当前数据的内部验证结果,仍需独立外部样本验证区分度、校准和临床效用。

10.94.12 常见问题

1. LASSO 入选特征是否就是独立危险因素?

不是。非零系数表示特征在当前数据、编码、候选集和 Lambda 下对预测有贡献,不能单独证明因果关系或稳定的独立效应。

2. LASSO、Ridge 和 Elastic Net 如何选择?

希望稀疏筛选时可优先 LASSO;希望保留相关特征并稳定系数时可考虑 Ridge;既需筛选又希望成组保留相关特征时可使用 Elastic Net。建议预先规定主方法,其他方法用于敏感性比较。

3. 应选最小误差还是 1SE 规则?

最小误差规则更追求当前交叉验证性能;1SE 规则通常产生更简约、惩罚更强的模型。应结合预测性能、可实施性和外部验证选择。

4. 为什么要标准化数值特征?

惩罚直接作用于系数。如果特征尺度差异很大,同一惩罚对各特征的实际影响不可比。标准化可使收缩更公平。

5. 为什么没有 P 值和系数置信区间?

本模块以预测和系数收缩为目标。数据驱动的 Lambda 选择和特征筛选会使传统标准误与 P 值的常规解释不再直接成立。如研究目标是推断,应根据预先规定模型使用合适的回归或选择后推断方法。

6. 表观 AUC 和 Bootstrap 校正 AUC 有什么区别?

表观 AUC 在参与建模的数据中计算,通常偏乐观。Bootstrap 通过重复重抽和重拟合估计该乐观偏倚,校正 AUC 更保守,但仍是内部验证。

7. 为什么整数评分性能会下降?

整数化会将精确系数转为较粗的分值,丢失部分信息。取整后性能下降是可解释性和可实施性的代价,应与连续模型并列报告。

8. 选择频率多高才算稳定?

没有对所有研究都适用的单一阈值。应结合样本量、候选特征数、相关结构、重抽次数和外部验证结果判断,不应对边界频率做刚性分类。

9. 可以直接使用最佳概率阈值做临床决策吗?

不可以。根据当前样本选出的阈值可能过拟合,且没有纳入漏诊、误诊、成本和患者偏好。应在外部样本中验证,并结合临床效用评估。

10. 为什么普通 Logistic 全特征模型的表观 AUC 可能更高?

全特征模型在同一建模样本中拟合更多参数,表观 AUC 可因过拟合而更高。不能仅根据该表宣称全特征模型更好,应比较内部校正或外部验证性能。

10.94.13 小结

本模块的最佳使用方式是:先根据研究背景预先确定候选特征和事件方向,再选择惩罚与 Lambda 规则,随后同时核对区分度、校准、稳定性和整数化信息损失,最后在独立人群中验证并必要时重校准。

正则化可帮助缓解过拟合和多重共线性,但不会自动解决偏倚、数据泄漏、缺失处理、外部适用性或临床决策问题。

10.95 序贯诊断试验分析

10.95.1 模块功能

本模块用于评估两项诊断试验按特定次序或并联使用时的理论联合性能。用户输入每项试验的灵敏度、特异度和单次成本,再设定目标人群患病率、检验策略和示例人群数。

模块可以计算:

  1. 串联阳性、串联阴性和并联三种策略的联合灵敏度与特异度;
  2. 单项检验及联合策略的阳性预测值、阴性预测值和似然比;
  3. 在示例人群中的真阳性、假阳性、假阴性和真阴性期望人数;
  4. 两项检验的使用次数和直接检验成本;
  5. 验前概率到阳性或阴性结果后患病概率的更新;
  6. 阳性和阴性预测值随患病率变化的敏感性分析。

临床路径例子:某个筛查试验灵敏度较高、特异度中等,后续确认试验特异度很高但成本更高。研究者可使用“串联阳性”策略,只对首次阳性者进行确认试验,比较联合特异度、漏诊人数和总成本的变化。

10.95.2 适用场景

适合以下问题:

  • 设计“初筛—确认”或“初试—补充排除”诊断路径;
  • 比较串联与并联策略的灵敏度—特异度权衡;
  • 估算不同策略下第二项检验的需求量和直接检验成本;
  • 在不同目标人群患病率下预估阳性和阴性预测值;
  • 为诊断路径方案、研究设计或教学演示提供定量依据。

不建议把本模块作为以下分析的替代:

  • 需要从逐例原始数据重新估计每项试验灵敏度和特异度;
  • 两项试验由相同生物标志物、相同技术平台或相同评定信息产生,存在明显条件相关;
  • 需要同时处理三项及以上检验的全部结果模式;
  • 需要基于真实患者数据估计相关结构、置信区间或不确定性传播;
  • 需要完整的成本效果、成本效用或净效益分析。

关键假设:联合灵敏度、特异度、预测值和人群流程均假定两项检验在“真实患病”和“真实未患病”两个条件内相互独立。如果检验高度相关,计算得到的联合性能可能偏乐观。

10.95.3 三种检验策略

10.95.3.1 1. 串联阳性(双阳性判阳)

所有人先接受第一项检验,仅第一项阳性者接受第二项检验,两项都阳性才判为最终阳性。在条件独立假设下:

\[ Se_C=Se_1Se_2, \qquad Sp_C=Sp_1+(1-Sp_1)Sp_2. \]

该策略通常提高特异度、阳性似然比和阳性预测值,代价是联合灵敏度降低。它常用于希望减少假阳性的确认路径。

10.95.3.2 2. 串联阴性(双阴性判阴)

所有人先接受第一项检验,仅第一项阴性者接受第二项检验,两项都阴性才判为最终阴性。

\[ Se_C=Se_1+(1-Se_1)Se_2, \qquad Sp_C=Sp_1Sp_2. \]

该策略通常提高灵敏度和阴性预测值,代价是特异度降低。它常用于不愿意仅凭首次阴性就排除疾病的场景。

10.95.3.3 3. 并联(任一阳性判阳)

所有人同时接受两项检验,任一项阳性就判为最终阳性。

\[ Se_C=Se_1+Se_2-Se_1Se_2, \qquad Sp_C=Sp_1Sp_2. \]

在条件独立和相同判定规则下,并联与串联阴性的最终灵敏度、特异度相同;两者的差别在于检验流程和第二项检验的使用量。并联需要每个人都接受两项检验,通常更快,但直接检验成本更高。

序贯诊断试验:策略流程图
序贯诊断试验:策略流程图

10.95.4 预测值、似然比与患病率

设目标人群患病率为 \(P\),联合灵敏度和特异度为 \(Se_C\)\(Sp_C\),则:

\[ PPV=\frac{PSe_C}{PSe_C+(1-P)(1-Sp_C)}, \]

\[ NPV=\frac{(1-P)Sp_C}{(1-P)Sp_C+P(1-Se_C)}. \]

阳性和阴性似然比为:

\[ LR^+=\frac{Se_C}{1-Sp_C}, \qquad LR^-=\frac{1-Se_C}{Sp_C}. \]

患病率是该模块的重要输入,而不是可以随意调整的装饰参数。低患病率筛查人群中,即使灵敏度和特异度都很高,阳性预测值仍可能不高;高风险专科人群则可能出现相反的情况。

序贯诊断试验:验前与验后概率
序贯诊断试验:验前与验后概率
序贯诊断试验:预测值的患病率敏感性
序贯诊断试验:预测值的患病率敏感性

患病率应对应试验将要使用的目标人群和临床阶段。病例—对照研究中人为设定的病例比例通常不能直接作为真实目标人群患病率。

10.95.5 成本与人群流程

示例人群数只用于把概率换算为期望人数,不改变灵敏度、特异度或预测值。因为结果是概率乘以人群数,真阳性、假阳性等数值可以为小数;它们是期望人数,不是某个已观察队列的实际计数。

第二项检验的使用次数为:

  • 串联阳性:第一项检验的阳性人数;
  • 串联阴性:第一项检验的阴性人数;
  • 并联:全部人群数。

总直接检验成本为:

\[ C_{total}=N_1C_1+N_2C_2. \]

本成本表只累加输入的单次检验成本,未包含标本采集、人员、设备、延迟、并发症、误诊或漏诊后果、治疗或生命质量损失。因此它是诊断路径的直接资源计算,不是完整卫生经济学评价。

序贯诊断试验:人群流程和成本表
序贯诊断试验:人群流程和成本表
序贯诊断试验:最终人群分类
序贯诊断试验:最终人群分类

10.95.6 操作步骤

顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “序贯诊断试验分析” 进入模块。

  1. 如果需要教学或方案讨论,可先选择一个临床场景预设;正式分析应改为本研究有依据的参数;
  2. 填写第一项和第二项检验的名称;
  3. 为两项检验输入 0.01–0.99 之间的灵敏度和特异度;
  4. 如需资源测算,输入每项检验的单次成本;
  5. 选择串联阳性、串联阴性或并联策略;
  6. 输入目标人群患病率,确保它与实际使用场景一致;
  7. 设置 100–100000 之间的示例人群数;
  8. 保留需要的表格和图形,所有主要输出默认已勾选;
  9. 点击“开始序贯诊断试验分析”;
  10. 先核对分析概览和联合策略摘要,再查看诊断性能、人群流程和统计图;
  11. 进入下载页导出 Word 报告、诊断性能 CSV 和人群流程 CSV。
序贯诊断试验:完整设置面板
序贯诊断试验:完整设置面板

10.95.7 生成的表格和图形

一键自动生成以下结果:

1. 分析概览和联合策略摘要

概览表列出临床预设、联合策略、两项检验、患病率、示例人群数和条件独立假设。摘要表给出联合灵敏度、特异度、阳性和阴性预测值,以及发现一例真阳性所需筛查的期望人数。

序贯诊断试验:分析概览和策略摘要
序贯诊断试验:分析概览和策略摘要

2. 单项及联合检验性能

性能表把第一项检验、第二项检验和最终联合策略置于同一表中,展示灵敏度、特异度、预测值和似然比。比较时应重点观察联合策略是否按预期提高了规则特异性或排除灵敏性,同时查看对应代价。

序贯诊断试验:诊断性能、策略解释和公式
序贯诊断试验:诊断性能、策略解释和公式
序贯诊断试验:单项与联合性能比较
序贯诊断试验:单项与联合性能比较

3. 人群流程和成本

人群流程表依次展示初始人群、完成第一项检验和完成联合策略后的期望人数。成本表展示每项检验的单次成本、使用次数和直接总成本。

4. 五类统计图

模块生成策略流程图、检验性能比较图、验前与验后概率图、最终人群分类图和患病率敏感性图。所有图形都使用固定的稳定尺寸,左侧不需要设置图宽和图高。

10.95.8 结果解释顺序

  1. 首先核对两项检验名称、灵敏度、特异度及其证据来源;
  2. 确认联合策略的判阳或判阴规则符合实际临床流程;
  3. 检查目标人群患病率是否与试验将要使用的场景一致;
  4. 比较联合策略与单项检验的灵敏度和特异度,明确优势和代价;
  5. 查看阳性和阴性预测值及患病率敏感性图,避免把单一患病率下的结果不加限制地外推;
  6. 使用人群流程表量化漏诊、误诊和第二项检验使用量;
  7. 在成本输入有据可依时比较直接检验成本,但不把它写成完整成本效果结论;
  8. 始终说明条件独立假设,并根据两项检验的生物学和技术关系评估其合理性。

10.95.9 表格和统计图描述

每张主表下方都提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会将检验名称、联合策略、患病率、人群数和条件独立假设作为背景,生成医学论文 Results 风格初稿。

五幅统计图也提供中英文描述,以及 PNG、TIFF、SVG 和 PDF 下载。自动描述不应替代研究者对参数来源、条件相关和临床后果的专业判断。

10.95.10 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格、分析提示和统计图。“下载诊断性能 CSV”保存两项检验和联合策略的全部性能指标;“下载人群流程 CSV”保存三个阶段的期望人数。

序贯诊断试验:下载页
序贯诊断试验:下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.95.11 从模块结果进入论文写作

Methods 建议说明:目标人群和临床场景、两项检验的名称及执行顺序、灵敏度和特异度的证据来源、联合判定规则、目标人群患病率来源、条件独立假设、示例人群数和成本范围。

Results 建议先报告联合灵敏度和特异度,再给出指定患病率下的预测值和似然比,最后以示例人群表达真阳性、假阳性、假阴性、真阴性和第二项检验需求量。

结果写作例子:设目标人群患病率为 10%,筛查试验灵敏度为 0.95、特异度为 0.70,确认试验灵敏度为 0.80、特异度为 0.98。采用串联阳性策略时,理论联合灵敏度为 0.760,联合特异度为 0.994,阳性预测值为 0.934,阴性预测值为 0.974。在 1000 人的示例人群中,预期第一项检验阳性 365.0 人,最终真阳性 76.0 人、假阳性 5.4 人、假阴性 24.0 人和真阴性 894.6 人。上述联合指标依赖两项检验条件独立的假设,预测值仅适用于设定的 10% 患病率场景。

例子数值只用于展示写法。实际报告必须替换为本研究输入和模块输出,并清楚标注它们是基于输入参数和条件独立假设的理论估算,不是对实际患者队列的直接观察。

10.95.12 常见问题

1. 灵敏度和特异度应填百分比还是小数?

填 0–1 之间的小数,例如 95% 填写为 0.95。界面允许的范围为 0.01–0.99。

2. 串联阳性为什么特异度更高、灵敏度更低?

最终阳性需要两项检验都阳性,因此假阳性更难通过两个阶段,但真阳性也可能在任一阶段被漏掉。

3. 串联阴性与并联的性能为什么相同?

在条件独立假设和“任一阳性判阳”规则下,两者最终分类规则等价。串联阴性只对首次阴性者使用第二项检验,并联则对所有人同时使用两项检验,因此资源使用和时间流程不同。

4. 患病率应填当前研究样本比例吗?

只有当样本能代表目标人群时才可考虑使用样本比例。病例—对照设计、富集抽样或专科转诊人群中的比例往往不是普通筛查人群患病率。

5. 临床场景预设可以直接用于正式论文吗?

不建议。预设用于展示模块和讨论策略;正式分析应使用与目标人群、检验版本、阈值、执行方式和参考标准一致的外部证据或本研究估计值。

6. 两项检验高度相关时怎么办?

不应继续把条件独立公式当作精确结果。应收集同一批对象的两项检验和金标准数据,直接评估联合规则,或使用能表达条件相关的模型。

7. 人群流程为什么有小数?

这些是理论概率乘以示例人群数得到的期望值。为了保留计算一致性,模块不强制把它们四舍五入为整数。

8. 成本表能否说明某策略更具成本效果?

不能。成本表只包含两项检验的直接成本。完整经济学评价还需要考虑误诊、漏诊、后续确诊、治疗、不良后果、时间跨度和效用。

9. 模块是否给出置信区间?

不给出。当前结果是根据输入参数的理论换算。如果需要置信区间,应根据参数来源的方差—协方差信息进行不确定性传播,或在逐例数据上进行重抽样评估。

10.95.13 小结

序贯诊断试验分析的可靠流程是:先明确目标人群和两项检验的证据来源,再按真实临床路径选择串联或并联规则,联合性能与人群流程同时解释,并对条件独立假设和患病率外推保持透明。

本模块适合诊断路径的方案测算和策略比较,但不会自动消除输入参数的不确定性、两项检验的条件相关,也不能替代真实目标人群中的前瞻性验证。

10.96 双检验联合概率分析

10.96.1 模块功能

双检验联合概率分析用于回答:当同一对象已完成两项诊断检验时,不同阳性/阴性组合对患病概率意味着什么?

用户输入两项检验的灵敏度、特异度和目标人群验前患病概率,模块计算:

  • 任一检验阳性(并联判阳)时的验后患病概率;
  • 仅第一项检验阳性时的验后患病概率;
  • 仅第二项检验阳性时的验后患病概率;
  • 两项均阳性和两项均阴性时的验后患病概率;
  • 各结果组合在真实患病组和未患病组内的条件概率;
  • 验后概率随验前患病概率变化的敏感性曲线。

与序贯诊断试验分析的区别:序贯模块关心“先做哪一项、什么结果后再做第二项”的流程、联合性能和成本;本模块关心两项结果已知时的概率更新,并可显式处理两项检验的条件相关。

10.96.2 适用场景

本模块适合:

  • 同一对象同时或相继完成两项检验,且最终需根据两项具体结果组合判断风险;
  • 需要比较“两项均阳性”、“一阳一阴”和“两项均阴性”所对应的验后概率;
  • 两项检验可能反映相近生物学过程或使用相近技术平台,需讨论条件相关;
  • 需要展示验前概率如何经过两项检验结果更新为验后概率;
  • 进行诊断教学、路径设计或方案讨论。

不建议将本模块替代:

  • 基于逐例原始数据估计灵敏度、特异度和置信区间;
  • 从配对原始数据直接估计两项检验的条件相关结构;
  • 三项及以上检验的全部结果组合建模;
  • 需要外部验证、决策曲线或完整卫生经济学评价的分析。

10.96.3 条件独立与条件相关

两项检验的相关性必须在真实疾病状态内讨论。

条件独立表示:已知对象真实患病或未患病后,第一项检验结果不再改变第二项检验的条件概率。例如在独立假设下:

\[ P(T_1+,T_2+\mid D+)=Se_1Se_2. \]

条件相关表示:即使已知真实疾病状态,两项检验仍可能共同受某些因素影响。模块分别设定患病组和未患病组的条件相关参数:

\[ P_{11}=p_1p_2+\rho\sqrt{p_1(1-p_1)p_2(1-p_2)}. \]

因为给定边际概率时,联合概率只能位于 Fréchet 范围:

\[ \max(0,p_1+p_2-1)\le P_{11}\le\min(p_1,p_2), \]

当输入的相关程度超出当前灵敏度和特异度允许的可行范围时,模块会将联合概率裁剪到可行边界,并在分析提示中说明。概览表中的“实现 phi”是裁剪后的实际相关系数。

10.96.4 贝叶斯概率更新

设验前患病概率为 \(P\),验前比值为:

\[ O_{pre}=\frac{P}{1-P}. \]

对某一具体结果组合 \(R\),其结果组合似然比为:

\[ LR_R=\frac{P(R\mid D+)}{P(R\mid D-)}. \]

验后比值和验后概率为:

\[ O_{post}=O_{pre}LR_R,\qquad P_{post}=\frac{O_{post}}{1+O_{post}}. \]

因此,同一结果组合在不同目标人群中可以得到不同验后概率。病例—对照研究中人为设定的病例比例通常不能直接作为目标人群的验前患病概率。

10.96.5 操作步骤

在顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “双检验联合概率分析”

  1. 正式分析建议选择“自定义参数”;临床预设用于演示和方案讨论;
  2. 填写两项检验的名称;
  3. 分别输入灵敏度和特异度,使用 0.01–0.99 的小数;
  4. 根据两项检验的生物学和技术关系选择“条件相关”或“条件独立”;
  5. 选择条件相关时,分别输入患病组和未患病组的相关参数;
  6. 输入与实际使用场景一致的验前患病概率;
  7. 保留需要的表格和图形;所有主要输出默认已勾选;
  8. 点击“开始双检验联合概率分析”;
  9. 先核对概览和单项检验参数,再解释结果组合和条件联合概率;
  10. 在下载页导出 Word 报告和 CSV 表。
双检验联合概率分析:完整设置面板与概览结果
双检验联合概率分析:完整设置面板与概览结果

10.96.6 生成的表格和图形

10.96.7 一键自动生成以下结果:

1. 分析概览和单项检验参数

概览表列出两项检验、验前患病概率、依赖模型、输入的相关参数和实现 phi。单项检验参数表给出灵敏度、特异度、阳性似然比和阴性似然比。

双检验联合概率分析:分析概览与单项检验参数
双检验联合概率分析:分析概览与单项检验参数

2. 联合结果的验后概率

该表展示五种结果情形的验后患病概率、相对验前概率和验后比值。“任一检验阳性”是一个并联规则;“仅某项阳性”则是已知另一项阴性的具体结果模式,两者不应混淆。

双检验联合概率分析:结果组合验后概率与解释
双检验联合概率分析:结果组合验后概率与解释

3. 条件联合概率和统计公式

联合概率表分别给出患病组和未患病组内的四种阳阴组合。每个真实状态内的四个条件概率合计为 1。“目标人群联合概率”还乘以了当前设定的患病率或未患病率。

双检验联合概率分析:条件联合概率与统计公式
双检验联合概率分析:条件联合概率与统计公式

4. 四类统计图

模块生成结果组合验后概率图、条件联合概率图、贝叶斯概率更新图和验前概率敏感性图。图形使用稳定尺寸渲染,左侧无需设置图宽和图高。

双检验联合概率分析:结果组合验后概率图
双检验联合概率分析:结果组合验后概率图
双检验联合概率分析:条件联合概率图
双检验联合概率分析:条件联合概率图
双检验联合概率分析:贝叶斯概率更新图
双检验联合概率分析:贝叶斯概率更新图
双检验联合概率分析:验前概率敏感性图
双检验联合概率分析:验前概率敏感性图

10.96.8 结果解释顺序

  1. 先核对两项检验的名称、阈值、灵敏度和特异度来源;
  2. 确认验前患病概率对应实际应用的目标人群;
  3. 评估条件独立或条件相关假设是否合理;
  4. 查看患病组和未患病组内的四种联合概率是否完整且可解释;
  5. 报告两项均阳性、两项均阴性和一阳一阴的验后患病概率;
  6. 结合敏感性图说明结论对验前概率的依赖;
  7. 对临床预设、相关参数或外部准确性数据的不确定性保持透明。

10.96.9 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把两项检验、依赖模型和验前概率作为背景,生成医学论文 Results 风格的客观初稿。

四幅统计图也提供中英文描述,以及 PNG、TIFF、SVG 和 PDF 下载。自动描述不应替代研究者对检验参数来源、依赖假设和临床后果的专业判断。

10.96.10 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格、分析提示和统计图。“下载结果组合 CSV”保存五种结果情形的验后概率;“下载联合概率 CSV”保存两个真实疾病状态内的八行联合概率。

双检验联合概率分析:下载页
双检验联合概率分析:下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.96.11 从模块结果进入论文写作

Methods 建议说明:目标人群、两项检验及其阈值、灵敏度和特异度的证据来源、验前患病概率来源、条件独立/相关模型、条件相关参数的来源与可行范围处理。

Results 建议先报告两项检验的单项性能和依赖模型,再给出两项均阳性、一阳一阴和两项均阴性的验后患病概率,最后说明结果对验前概率和相关假设的敏感性。

结果写作例子:设目标人群验前患病概率为 10%,第一项检验的灵敏度和特异度分别为 0.80 和 0.90,第二项检验分别为 0.75 和 0.95。在条件相关模型下,患病组和未患病组的条件相关参数均设为 0.05。两项均阳性时的验后患病概率为 89.1%,仅第一项阳性和仅第二项阳性时分别为 18.8% 和 27.3%,两项均阴性时降至 0.8%。

该例子数值只用于展示写法。实际报告必须替换为本研究输入和模块输出,并明确说明它们是基于外部准确性参数、验前概率和依赖模型的理论估计。

10.96.12 常见问题

1. 灵敏度、特异度和验前概率填百分比还是小数?

填 0–1 之间的小数。例如 90% 填写为 0.90

2. 条件相关参数可以凭经验填写吗?

正式分析不建议。它应来自同一批对象的配对检验数据、外部研究或有根据的敏感性范围。如果无可靠估计,应并列多个合理值做敏感性分析。

3. 条件相关和两项检验在全样本中的相关是同一概念吗?

不是。条件相关必须分别在真实患病组和未患病组内定义。全样本相关还会受患病率影响,不能直接代替这两个参数。

4. “任一检验阳性”与“仅第一项阳性”有什么不同?

“任一阳性”包含三种模式:仅第一项阳性、仅第二项阳性和两项均阳性。“仅第一项阳性”则明确第二项为阴性。

5. 为什么相关参数输入 1,实现 phi 不一定是 1?

给定两项检验不同的边际阳性率后,可达到的最大联合概率受 Fréchet 界限约束。输入参数超出可行范围时会被裁剪,所以实现 phi 可以小于输入值。

6. 验前患病概率应该填当前样本的病例比例吗?

只有样本可代表目标人群时才可考虑。病例—对照设计、富集抽样或专科转诊人群中的病例比例通常不是普通筛查人群的验前概率。

7. 模块是否给出置信区间?

不给出。当前结果是根据输入参数进行的理论换算。若需要置信区间,应在逐例数据上进行重抽样,或对输入参数的方差—协方差进行不确定性传播。

10.96.13 小结

双检验联合概率分析的可靠流程是:先确认两项检验的阈值和准确性证据,再为真实目标人群设定验前概率,根据检验机制选择条件独立或相关模型,最后在依赖假设下解释各阳阴组合的验后概率。

本模块用于理论概率更新和方案讨论,不会自动解决输入参数的不确定性,也不能替代基于真实配对数据的相关估计和外部验证。

10.97 诊断四格表计算器

10.97.1 模块功能

诊断四格表计算器用于回答:当诊断试验结果与金标准结果已经汇总为真阳性、假阳性、真阴性和假阴性计数时,怎样完整计算并解释诊断准确性?

模块由四个计数自动生成:

  • 诊断四格表和样本计数摘要;
  • 灵敏度、特异度、准确率、阳性预测值和阴性预测值;
  • 阳性似然比、阴性似然比、Youden 指数和诊断比值比;
  • 平衡准确率、F1 分数和 Matthews 相关系数;
  • 主要诊断指标的 95% 置信区间;
  • 已知目标人群患病率下的预测值和验后概率;
  • 当前主四格表与两个额外阈值方案的诊断性能比较;
  • Word 报告、诊断性能 CSV、阈值比较 CSV 和四类统计图。

10.97.2 适用场景

本模块适合:

  • 已有论文、系统综述、试验报告或研究数据中的 TP、FP、TN、FN 汇总计数;
  • 需要从一个固定阈值下的四格表计算完整诊断性能;
  • 需要同时报告点估计和 95% 置信区间;
  • 需要将研究样本中的灵敏度、特异度应用到另一个已知患病率的人群;
  • 同一诊断指标有多个阈值,需要比较灵敏度与特异度的权衡;
  • 进行诊断试验教学、方案讨论或结果核对。

不建议用本模块替代:

  • 从连续检测值寻找最佳阈值或绘制完整 ROC 曲线;
  • 比较同一批对象中多个配对诊断试验的统计差异;
  • 缺少可靠金标准时的潜在类别分析;
  • 根据逐例数据进行分层、协变量调整、内部验证或外部验证;
  • 对多个阈值进行数据驱动筛选后仍把所选阈值当作预先设定阈值报告。

10.97.3 四格表定义

四个计数必须根据诊断试验判定金标准状态共同定义:

计数 定义
TP(真阳性) 检验阳性且金标准阳性
FP(假阳性) 检验阳性但金标准阴性
TN(真阴性) 检验阴性且金标准阴性
FN(假阴性) 检验阴性但金标准阳性

灵敏度和特异度分别为:

\[ Sensitivity=\frac{TP}{TP+FN},\qquad Specificity=\frac{TN}{TN+FP}. \]

阳性预测值和阴性预测值分别为:

\[ PPV=\frac{TP}{TP+FP},\qquad NPV=\frac{TN}{TN+FN}. \]

阳性与阴性似然比为:

\[ LR+=\frac{Sensitivity}{1-Specificity},\qquad LR-=\frac{1-Sensitivity}{Specificity}. \]

输入前必须确认检验阳性方向、金标准阳性定义和四个格子的排列。把 FP 与 FN 或 TP 与 TN 对调,会系统性改变全部结果,软件无法仅凭四个数字识别这种编码错误。

10.97.4 患病率与预测值

模块提供三种模式:

  1. 使用研究样本患病率:预测值直接根据当前四格表计算;
  2. 研究样本患病率 + 95% 置信区间:在第一种模式基础上报告主要指标的区间估计;
  3. 使用已知目标人群患病率:保留当前灵敏度和特异度,但按输入的目标人群患病率重新计算预测值和验后概率。

设目标人群患病率为 \(P\),则:

\[ PPV=\frac{Sensitivity\times P}{Sensitivity\times P+(1-Specificity)\times(1-P)}, \]

\[ NPV=\frac{Specificity\times(1-P)}{(1-Sensitivity)\times P+Specificity\times(1-P)}. \]

因此,灵敏度和特异度不变时,阳性预测值通常随患病率升高而升高,阴性预测值通常随患病率升高而降低。

病例—对照研究中人为设定的病例比例通常不是目标人群患病率。只有当研究样本能够代表实际应用人群时,样本患病率下的预测值才可直接外推。

10.97.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “诊断四格表计算器”

  1. 根据检验结果与金标准的交叉分类输入 TP、FN、FP 和 TN;
  2. 选择患病率与不确定性模式;
  3. 选择“使用已知目标人群患病率”时,输入 0.001–0.999 之间的目标患病率;
  4. 如需比较额外阈值,勾选“比较两个额外阈值方案”;
  5. 为两个阈值填写不同名称及各自的 TP、FN、FP、TN;
  6. 保留需要的表格和图形;所有主要输出默认已勾选;
  7. 点击“开始诊断四格表计算”;
  8. 先核对四格表和样本总数,再查看诊断性能与置信区间;
  9. 开启阈值比较时,同时解释灵敏度、特异度、准确率和 Youden 指数;
  10. 在下载页导出 Word 报告、诊断性能 CSV 和阈值比较 CSV。
诊断四格表计算器:完整设置面板
诊断四格表计算器:完整设置面板

10.97.6 生成的表格和图形

一键自动生成以下结果:

1. 诊断四格表和样本计数摘要

四格表按检验阳性/阴性和金标准阳性/阴性排列,并给出行列合计。样本计数摘要列出总样本数、真实患病、真实未患病、检验阳性、检验阴性、判定正确和判定错误人数。

诊断四格表计算器:四格表与样本计数
诊断四格表计算器:四格表与样本计数

2. 基本与高级诊断性能

基本性能表报告灵敏度、特异度、准确率、患病率、预测值、验后概率和似然比。高级指标表报告 Youden 指数、平衡准确率、F1 分数、Matthews 相关系数和诊断比值比。

3. 诊断指标 95% 置信区间

选择区间模式后,模块报告患病率、灵敏度、特异度、准确率、预测值、错误率、诊断比值比、Youden 指数和似然比等指标的区间。平衡准确率、F1 分数和 Matthews 相关系数仅显示点估计时,表中会明确标注未计算区间。

4. 多阈值方案比较

模块把两个额外阈值和当前主四格表置于同一表中,比较灵敏度、特异度、预测值、准确率和 Youden 指数。Youden 指数最高的方案会被标注,但这不是自动的临床最佳阈值结论。

5. 四类统计图

模块生成诊断四格表热图、诊断性能指标图、验前与验后概率图和多阈值方案比较图。图形使用稳定尺寸渲染,左侧无需设置图宽和图高。

诊断四格表计算器:四格表热图
诊断四格表计算器:四格表热图
诊断四格表计算器:诊断性能指标图
诊断四格表计算器:诊断性能指标图
诊断四格表计算器:验前与验后概率图
诊断四格表计算器:验前与验后概率图
诊断四格表计算器:多阈值方案比较图
诊断四格表计算器:多阈值方案比较图

10.97.7 结果解释顺序

  1. 先核对四个计数的定义、总样本数和边际合计;
  2. 明确诊断试验阈值、判阳方向与金标准;
  3. 先报告灵敏度和特异度,再报告预测值;
  4. 说明预测值使用研究样本患病率还是外部目标人群患病率;
  5. 同时查看点估计和 95% 置信区间,避免仅根据 P 值或单个点估计下结论;
  6. 使用似然比解释检验结果对患病概率的更新;
  7. 比较阈值时明确提高灵敏度通常会牺牲特异度,反之亦然;
  8. 结合漏诊和误诊的临床后果决定阈值,不把 Youden 指数最高自动等同于临床最优;
  9. 说明样本来源、研究设计及是否进行了独立验证。

10.97.8 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会将 TP、FP、TN、FN 和患病率模式作为背景,生成医学论文 Results 风格的客观初稿。

四幅统计图也提供中英文描述,以及 PNG、TIFF、SVG 和 PDF 下载。自动描述不会替代研究者对阈值、金标准、抽样方式和临床后果的专业判断。

10.97.9 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格、分析提示和统计图。“下载诊断性能 CSV”保存基本和高级诊断指标;开启阈值比较后,“下载阈值比较 CSV”保存三个方案的比较结果。

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.97.10 从模块结果进入论文写作

Methods 建议说明:研究设计、目标人群、诊断试验和金标准、判阳阈值、盲法、TP/FP/TN/FN 定义、缺失数据处理、患病率来源、区间估计方法及阈值是否预先设定。

Results 建议先报告纳入人数和四格表,再依次报告灵敏度、特异度、预测值、似然比及 95% 置信区间;使用目标人群患病率换算时,应把外部患病率及其来源写清楚。

结果写作例子:共纳入 220 例受试者,其中金标准阳性和阴性各 110 例。该检验获得 90 例真阳性、30 例假阳性、80 例真阴性和 20 例假阴性。灵敏度为 81.8%,特异度为 72.7%,阳性预测值为 75.0%,阴性预测值为 80.0%;阳性似然比为 3.00,阴性似然比为 0.25,诊断比值比为 12.0。各指标的 95% 置信区间见诊断性能表。

例子数值只用于展示写法。实际报告应替换为本研究结果,并说明预测值对应的患病率模式、阈值选择过程及验证人群。

10.97.11 常见问题

1. 四个输入应填比例还是人数?

填非负整数人数。比例、百分比或加权人数不能直接代替四格表计数。

2. 为什么必须同时有金标准阳性和阴性对象?

没有真实患病者无法估计灵敏度,没有真实未患病者无法估计特异度;四格表也必须同时包含检验阳性和阴性结果。

3. 预测值为什么与其他研究不一致?

预测值依赖患病率。即使灵敏度和特异度相同,不同筛查阶段、转诊层级和抽样设计也会得到不同 PPV 和 NPV。

4. 何时应选择“使用已知目标人群患病率”?

当当前研究样本的病例比例不能代表实际应用人群,但灵敏度和特异度可合理迁移时使用。目标患病率应来自与应用场景匹配的可靠数据。

5. 置信区间模式会改变点估计吗?

不会。它在研究样本患病率模式下为主要诊断指标增加 95% 置信区间。

6. 多阈值方案的样本量必须相同吗?

理想情况下,应来自同一批对象或可比人群。若样本量或人群构成不同,不能把表中的数值差异直接解释为阈值本身造成的变化。

7. Youden 指数最高就是最佳阈值吗?

不一定。Youden 指数对灵敏度和特异度赋予相同权重,而实际临床中漏诊和误诊的后果往往不同。

8. 四格表中出现零计数怎么办?

模块允许部分格子为零,但必须保留可估计的疾病状态和检验结果边际。零格可能产生无限似然比或不稳定区间,应结合样本量和研究设计谨慎解释。

9. 可以据此比较两个独立研究的诊断试验吗?

只能进行描述性对照。正式比较还应考虑人群、金标准、阈值、研究质量和抽样差异,必要时采用诊断准确性 Meta 分析。

10.97.12 小结

诊断四格表计算的可靠流程是:先核对 TP、FP、TN、FN 的编码和金标准,再依次解释灵敏度、特异度、预测值、似然比和区间估计,最后结合目标人群患病率与临床后果评价阈值。

本模块适合汇总四格表的完整计算、核对和报告,但不能替代连续指标的 ROC 建模、配对试验比较、缺少金标准时的模型或独立验证。

10.98 二分类诊断试验评估

10.98.1 模块功能

二分类诊断试验评估用于回答:当每名受试者都有二分类金标准结果和二分类待评价检验结果时,该检验的诊断准确性如何,哪些个案被误判,检验结果怎样更新患病概率?

模块直接读取逐例数据,自动完成:

  • 金标准与待评价检验的水平核对和完整案例筛选;
  • 真阳性、假阳性、假阴性和真阴性的逐例分类;
  • 诊断四格表、样本计数摘要和误分类个案回查;
  • 灵敏度、特异度、准确率、预测值和似然比计算;
  • 主要诊断指标的 95% 置信区间;
  • 研究样本或已知目标人群患病率下的验后概率更新;
  • 混淆矩阵、诊断性能、验前验后概率、Fagan 概率更新和分类构成图;
  • Word 报告、诊断性能 CSV、误分类个案 CSV 和逐例分类 CSV。

10.98.2 适用场景

本模块适合:

  • 同一批受试者同时接受二分类金标准和二分类待评价检验;
  • 检验结果已经按临床阈值判定为阳性或阴性;
  • 需要从逐例数据自动建立诊断四格表;
  • 需要定位假阳性和假阴性对象,回查数据或开展误分类分析;
  • 需要报告灵敏度、特异度、预测值、似然比及其区间估计;
  • 需要把诊断准确性换算到一个已知患病率的目标人群;
  • 需要导出每名受试者的真阳性、假阳性、假阴性或真阴性分类。

不建议用本模块替代:

  • 连续检测指标的 ROC 曲线和最佳阈值寻找;
  • 同一批对象中两个或多个诊断试验的配对比较;
  • 没有可靠金标准时的潜在类别模型;
  • 需要协变量调整、分层验证、内部验证或外部验证的诊断预测模型;
  • 需要评价时间依赖性结局的动态 ROC 或生存模型。

10.98.3 数据结构与编码

数据应为“一行一名受试者”。至少包含两列:

变量 要求 示例
金标准变量 恰好两个非缺失水平 患病、未患病
待评价检验变量 恰好两个非缺失水平 阳性、阴性

模块不会仅凭变量名猜测阳性方向。必须分别指定疾病存在、疾病不存在、检验阳性和检验阴性水平。四类结果定义如下:

分类 金标准 待评价检验
真阳性 患病 阳性
假阳性 未患病 阳性
假阴性 患病 阴性
真阴性 未患病 阴性

金标准或待评价检验缺失的记录不进入诊断性能计算。分析概览会同时报告原始样本数、完整案例数和排除数;逐例分类 CSV 只包含进入分析的完整案例,并保留原数据行号以便回查。

10.98.4 诊断指标与概率更新

设真阳性、假阳性、假阴性和真阴性分别为 (TP)、(FP)、(FN) 和 (TN),则:

\[ Sensitivity=\frac{TP}{TP+FN},\qquad Specificity=\frac{TN}{TN+FP}. \]

\[ PPV=\frac{TP}{TP+FP},\qquad NPV=\frac{TN}{TN+FN}. \]

\[ LR+=\frac{Sensitivity}{1-Specificity},\qquad LR-=\frac{1-Sensitivity}{Specificity}. \]

模块提供三种患病率与不确定性模式:

  1. 使用研究样本患病率:根据当前完整案例中的疾病比例计算预测值;
  2. 研究样本患病率 + 95% 置信区间:在第一种模式基础上增加主要指标区间;
  3. 使用已知目标人群患病率:保留灵敏度和特异度,并使用输入患病率重新计算阳性、阴性检验后的概率及预测值。

目标人群患病率为 (P) 时:

\[ PPV=\frac{Sensitivity\times P}{Sensitivity\times P+(1-Specificity)\times(1-P)}, \]

\[ NPV=\frac{Specificity\times(1-P)}{(1-Sensitivity)\times P+Specificity\times(1-P)}. \]

Fagan 概率更新图把验前概率、似然比和验后概率连接起来,用于展示一次阳性或阴性结果如何改变患病概率。它是概率更新工具,不是自动寻找诊断阈值的工具。

10.98.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “二分类诊断试验评估”

  1. 在“金标准变量”中选择疾病状态变量;
  2. 分别指定“疾病存在水平”和“疾病不存在水平”;
  3. 在“待评价检验变量”中选择二分类检验结果;
  4. 分别指定“检验阳性水平”和“检验阴性水平”;
  5. 选择研究样本患病率、研究样本患病率加区间,或已知目标人群患病率;
  6. 使用目标人群患病率时,输入 0.001–0.999 之间的数值;
  7. 设定误分类个案最大显示数;界面允许 10–500 行,CSV 可导出全部误分类对象;
  8. 保留需要的表格和图形;全部主要输出默认已勾选;
  9. 点击“开始二分类诊断试验评估”;
  10. 先核对分析概览和四格表,再查看诊断性能、误分类个案及概率更新;
  11. 在下载页导出 Word 报告和三类 CSV。
二分类诊断试验评估:完整设置面板
二分类诊断试验评估:完整设置面板

10.98.6 生成的表格和图形

一键自动生成以下结果:

1. 分析概览、四格表与样本计数

分析概览记录变量、阳阴性水平、患病率模式、原始样本数、完整案例数和排除数。四格表按金标准和检验结果交叉排列,样本计数表汇总疾病状态、检验结果与判定正确人数。

二分类诊断试验评估:分析概览和四格表
二分类诊断试验评估:分析概览和四格表

2. 诊断性能和 95% 置信区间

诊断性能表报告灵敏度、特异度、准确率、患病率、阳性预测值、阴性预测值、阳性后患病概率、阴性后健康概率、阳性似然比和阴性似然比。选择区间模式后,单独的区间表报告主要指标估计值及 95% 置信区间。

3. 逐例分类与误分类个案

逐例分类构成表汇总四类对象的人数和构成比。假阳性与假阴性表保留原数据行号、金标准结果、检验结果和分类,便于核查录入、样本处理、阈值附近个案和潜在临床差异。

二分类诊断试验评估:逐例分类与误分类个案
二分类诊断试验评估:逐例分类与误分类个案

4. 结果解释和论文报告要点

结果解释表按指标、当前数值和解释顺序组织结论;论文报告要点表提示应交代的样本、编码、指标、患病率来源和误分类信息。

5. 五类统计图

模块分别生成混淆矩阵热图、诊断性能指标图、验前与验后概率图、Fagan 概率更新图和逐例分类构成图。图形使用稳定尺寸渲染,左侧不提供冗余的图宽与图高设置。

二分类诊断试验评估:混淆矩阵热图
二分类诊断试验评估:混淆矩阵热图
二分类诊断试验评估:诊断性能指标图
二分类诊断试验评估:诊断性能指标图
二分类诊断试验评估:验前与验后概率图
二分类诊断试验评估:验前与验后概率图
二分类诊断试验评估:Fagan 概率更新图
二分类诊断试验评估:Fagan 概率更新图
二分类诊断试验评估:逐例分类构成图
二分类诊断试验评估:逐例分类构成图

10.98.7 结果解释顺序

  1. 核对金标准、疾病水平、检验水平和完整案例数;
  2. 核对四格表中的 TP、FP、FN 和 TN 是否符合研究定义;
  3. 先报告灵敏度和特异度,再报告预测值和似然比;
  4. 同时查看点估计和 95% 置信区间,特别注意小样本或少数类别的区间宽度;
  5. 明确预测值使用研究样本患病率还是外部目标人群患病率;
  6. 使用验前验后概率图和 Fagan 图解释检验结果带来的概率变化;
  7. 分别查看假阳性和假阴性人数,结合误诊与漏诊后果解释;
  8. 回查误分类个案时保护受试者隐私,不在公开报告中暴露可识别信息;
  9. 说明样本来源、阈值是否预先设定、金标准是否独立和评价过程是否盲法;
  10. 如检验将在新机构或新人群使用,应说明是否完成外部验证。

10.98.8 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把金标准、阳阴性水平、样本量和患病率模式作为背景,生成医学论文 Results 风格的客观初稿。

五幅统计图也提供中英文描述及 PNG、TIFF、SVG 和 PDF 下载。自动描述只依据当前表格或图形,不会代替研究者对偏倚、金标准质量、阈值来源和临床后果的判断。

10.98.9 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格、分析提示和五幅统计图。

  • 下载诊断性能 CSV:保存主要诊断性能点估计;
  • 下载误分类个案 CSV:保存全部假阳性和假阴性完整案例;
  • 下载逐例分类 CSV:保存每个完整案例的原数据行号、金标准结果、检验结果和四分类。

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.98.10 从模块结果进入论文写作

Methods 建议说明:研究设计、目标人群、入排标准、待评价检验与金标准、判阳阈值、阳阴性编码、盲法、缺失数据处理、区间估计方法、患病率来源,以及是否预先注册阈值。

Results 建议先报告原始样本和完整案例数,再给出四格表、灵敏度、特异度、预测值、似然比及 95% 置信区间;随后报告假阳性和假阴性人数。使用外部患病率换算时,应明确其数值、来源和适用人群。

结果写作例子:共纳入 220 名受试者,216 名同时具有完整金标准和待评价检验结果。该检验获得 71 例真阳性、11 例假阳性、12 例假阴性和 122 例真阴性;灵敏度为 85.5%,特异度为 91.7%,准确率为 89.4%,阳性预测值为 86.6%,阴性预测值为 91.0%。阳性似然比为 10.34,阴性似然比为 0.16,各指标的 95% 置信区间见诊断性能表。

例子数值只用于展示写法。实际报告应替换为本研究结果,并说明预测值对应的患病率模式、金标准质量、阈值设定过程和验证人群。

10.98.11 常见问题

1. 为什么变量没有出现在下拉菜单中?

金标准和待评价检验都必须恰好具有两个非缺失水平。连续变量、多分类变量或只有一个有效水平的变量不会作为合格二分类变量。

2. 金标准和待评价检验可以使用同一列吗?

不可以。两者必须来自不同变量,否则无法评价检验相对于金标准的一致与误分类情况。

3. 为什么必须手动指定阳性和阴性水平?

不同数据可能使用 0/1、是/否、阴性/阳性或自定义编码。显式指定可以避免因因子排序或字符顺序造成方向颠倒。

4. 为什么分析人数少于上传数据行数?

金标准或待评价检验缺失的记录会被完整案例分析排除。分析概览会显示排除数,逐例分类 CSV 中的原数据行号仍可追溯到上传数据。

5. “误分类个案最大显示数”会删除数据吗?

不会。它只限制界面上每类误分类表的显示行数。误分类 CSV 仍导出全部假阳性和假阴性完整案例。

6. 什么时候使用已知目标人群患病率?

当研究样本中的病例比例不代表实际应用人群,但灵敏度和特异度可合理迁移时使用。输入患病率应来自与临床场景和时间范围匹配的可靠证据。

7. 为什么改变目标人群患病率后灵敏度和特异度不变?

模块把灵敏度和特异度视为当前试验的条件准确性,并根据目标患病率重新计算预测值和验后概率。预测值会变化,灵敏度和特异度不会因这一步换算而改变。

8. Fagan 图能否寻找最佳阈值?

不能。Fagan 图使用既定灵敏度、特异度和患病率展示概率更新;连续指标的阈值选择应使用 ROC 或其他专门方法。

9. 误分类个案可以直接用于解释病因吗?

不能。个案回查可发现数据问题、流程差异或可能的亚组特征,但不能仅凭误分类列表作因果推断或机制解释。

10. 结果可以直接推广到其他医院吗?

不一定。疾病谱、样本来源、设备、操作者、阈值和患病率改变都可能影响性能。跨机构应用前通常需要独立外部验证。

10.98.12 小结

二分类诊断试验评估的可靠流程是:先明确金标准和阳阴性编码,再核对完整案例与四格表,依次解释灵敏度、特异度、预测值、似然比和区间估计,最后回查误分类并结合目标人群患病率解释验后概率。

本模块的优势是把逐例数据、诊断性能、误分类回查、概率更新和报告导出连成完整工作流;它不能替代连续指标的阈值建模、多个配对试验的统计比较、无金标准模型或外部验证。

10.99 Kappa 置信区间样本量

10.99.1 模块功能

Kappa 置信区间样本量用于回答:在一致性研究开始前,为了使预期 Kappa 的置信区间达到指定下限,或同时达到指定下限和上限,至少需要多少名受试者或样本?

模块根据结局类别数、评估者人数、预期 Kappa、目标置信界限、类别比例和显著性水平,自动生成:

  • 完成全部评估所需的受试者或样本数;
  • 样本数乘以评估者人数得到的总评分次数;
  • 研究设计设置、目标区间和类别比例核对表;
  • 区间界限改变时的样本量敏感性分析;
  • 评估者人数改变时的样本量与总评分工作量分析;
  • 类别比例图、区间精度与样本量图、评估者人数与样本量图;
  • Word 报告和敏感性分析 CSV。

10.99.2 适用场景

本模块适合:

  • 两名或多名评估者对同一批对象进行分类判断的一致性研究;
  • 结局为 2–5 个互斥名义类别;
  • 研究目标是保证 Kappa 的单侧置信下限达到要求;
  • 研究目标是让 Kappa 的双侧置信区间同时满足预设下限和上限;
  • 已有预实验、既往研究或目标人群资料,可预先估计各类别比例;
  • 需要比较增加评估者和增加受试者两种设计对工作量的影响。

不建议用本模块替代:

  • 连续测量的一致性分析,此时通常应考虑 ICC、Bland–Altman 分析或测量误差模型;
  • 有序类别且需要对不同距离赋权的加权 Kappa 设计;
  • 同一评估者重复测量的复杂层级、交叉或不完全区组设计;
  • 研究完成后的 Kappa 点估计和置信区间计算;
  • 仅希望给出 Kappa 置信区间总宽度,而没有明确下限或上限目标的设计。

本模块与“统计功效与样本量”菜单中已有的“Kappa 一致性”模块关注点不同。已有模块适合按对称的目标区间总宽度规划;本模块可以直接设定单侧下限,也可以设置不对称的双侧下限和上限。

10.99.3 Kappa 与置信区间目标

Kappa 用于校正偶然一致,其基本形式为:

\[ \kappa=\frac{P_o-P_e}{1-P_e}, \]

其中,\(P_o\) 为观察一致率,\(P_e\) 为根据类别边际比例计算的偶然一致率。Kappa 越高,表示超出偶然水平的一致程度越高。

本模块提供两种区间目标:

  1. 双侧置信区间:同时输入目标下限和目标上限。预期 Kappa 必须位于两者之间;区间越窄,通常需要的样本越多;
  2. 单侧下限:只规定 Kappa 的置信下限不低于某个值。它适合研究的核心要求是排除“一致性低于最低可接受水平”。

显著性水平 \(\alpha\) 决定置信水平。例如 \(\alpha=0.05\) 对应 95% 置信水平。预期 Kappa、目标界限和类别比例都应在查看研究结果前确定,避免根据当前数据反向调整设计目标。

10.99.4 类别比例与评估者人数

类别比例是预计每个真实或主要分类水平在目标样本中的构成,必须满足:

  • 输入个数与结局类别数一致;
  • 每个比例严格介于 0 和 1 之间;
  • 所有比例之和为 1;
  • 比例来自与计划研究相近的人群、预实验或可靠文献。

明显不均衡的类别分布会改变偶然一致率并影响 Kappa 的方差。即使预期 Kappa 相同,少见类别很少的设计也可能需要不同的样本量。因此,不应在缺少依据时简单填写等比例。

评估者人数可设为 2–6。增加评估者可能减少所需受试者数,但总评分次数不一定减少。实际方案应同时考虑:

  • 受试者招募难度;
  • 每名评估者的时间和成本;
  • 是否能保证所有评估者独立完成全部对象的评价;
  • 评估者培训、盲法和评分缺失的可能性。

10.99.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “统计功效与样本量” → “Kappa 置信区间样本量”

  1. 选择 2、3、4 或 5 类结局;
  2. 选择计划参与的评估者人数;
  3. 选择“双侧置信区间”或“单侧下限”;
  4. 输入预期 Kappa;
  5. 输入目标置信下限;双侧模式下同时输入目标置信上限;
  6. 按界面顺序输入各类别预期比例,并确认合计为 1;
  7. 设定显著性水平 \(\alpha\)
  8. 保留需要的表格和图形,全部主要输出默认已勾选;
  9. 点击“开始 Kappa 样本量计算”;
  10. 先核对研究设置、类别比例和主要样本量,再查看区间精度及评估者人数的敏感性结果;
  11. 在下载页导出 Word 报告和敏感性分析 CSV。
Kappa 置信区间样本量:完整设置面板
Kappa 置信区间样本量:完整设置面板

10.99.6 生成的表格和图形

一键自动生成以下结果:

1. 研究设计设置

列出结局类别数、评估者人数、区间类型、预期 Kappa、目标界限、显著性水平、置信水平和类别比例。正式解释前应先核对这一表,尤其要确认单侧模式下目标上限显示为“不适用”。

2. 主要样本量和类别比例

主要结果表给出所需受试者或样本数、评估者人数、总评分次数和区间目标。类别比例表把每个类别的比例和百分比单独列出。

Kappa 置信区间样本量:设计与主要结果
Kappa 置信区间样本量:设计与主要结果

3. 区间界限敏感性分析

模块在保持预期 Kappa 和其他设置不变时,比较更窄界限、当前设置和更宽界限。更窄的目标表示更高精度,通常会增加所需样本量。单侧模式中的“区间跨度”表示预期 Kappa 与目标下限之间的距离。

4. 评估者人数敏感性分析

模块将评估者人数从 2 依次变化到 6,分别计算所需样本数和总评分次数。研究者应同时比较这两个指标,不能只选择受试者数最少的方案。

Kappa 置信区间样本量:敏感性分析
Kappa 置信区间样本量:敏感性分析

5. 类别比例图

柱形图直观展示预期类别分布,可快速发现稀有类别和明显不均衡的设计。

Kappa 置信区间样本量:预期类别比例图
Kappa 置信区间样本量:预期类别比例图

6. 区间精度与样本量图

折线图显示界限从更窄到更宽时所需样本量的变化。它用于说明精度要求与招募负担之间的权衡。

Kappa 置信区间样本量:区间精度与样本量图
Kappa 置信区间样本量:区间精度与样本量图

7. 评估者人数与样本量图

折线图显示 2–6 名评估者对应的受试者或样本数。图中样本数下降并不自动表示总工作量下降,仍应结合敏感性表中的总评分次数判断。

Kappa 置信区间样本量:评估者人数与样本量图
Kappa 置信区间样本量:评估者人数与样本量图

10.99.7 结果解释顺序

  1. 明确研究是单侧最低保证目标还是双侧区间精度目标;
  2. 核对预期 Kappa 是否来自相似人群和相同评分规则;
  3. 核对类别数、类别比例和评估者人数;
  4. 报告主要所需样本数及其对应的总评分次数;
  5. 查看界限敏感性分析,评价目标稍有变化时样本量是否剧烈波动;
  6. 查看评估者人数敏感性分析,比较招募负担和评分负担;
  7. 根据预计失访、无法判定和评分缺失额外增加样本,不把计算值直接当作最终招募数;
  8. 在研究方案中预先说明 Kappa 类型、置信区间方向、类别定义和评估者独立性;
  9. 研究完成后报告观察一致率、Kappa 点估计、置信区间和实际类别分布;
  10. 不把样本量计算结果解释为研究必然达到目标一致性。

10.99.8 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把区间类型、预期 Kappa、目标界限、类别比例、评估者人数和样本量作为背景,生成医学论文 Results 风格的客观初稿。

三幅统计图也提供中英文描述,以及 PNG、TIFF、SVG 和 PDF 下载。自动描述不会替代研究者对预期参数来源、类别定义、评分流程和额外预留比例的专业判断。

10.99.9 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格、分析提示和三幅统计图。“下载敏感性分析 CSV”保存三种区间精度方案和 2–6 名评估者方案,包括目标界限、区间跨度、所需样本数和总评分次数。

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.99.10 从模块结果进入研究方案写作

Methods 建议说明:研究对象、分类结局及类别定义、评估者人数和资质、评分是否独立及盲法、预期 Kappa 的依据、单侧或双侧区间目标、类别比例来源、显著性水平、所需样本数、总评分次数和额外预留比例。

方案写作例子:本研究计划由 2 名独立且相互盲法的评估者对三分类结局进行判定。根据预实验,三个类别的预期比例为 0.20、0.50 和 0.30,预期 Kappa 为 0.60。采用单侧 95% 置信下限设计,要求 Kappa 的置信下限不低于 0.40。计算至少需要 40 名受试者完成两名评估者的全部评价,共计 80 次评分;考虑 10% 的评分缺失,计划纳入 45 名受试者。

例子数值只用于展示写法。实际方案应使用本研究参数和模块结果,并说明额外预留比例的依据。

10.99.11 常见问题

1. 类别比例按哪位评估者的结果填写?

应使用设计阶段对目标总体类别构成的最佳估计,而不是任意指定某位评估者。可参考预实验、共识分类、既往研究或相似人群资料,并在方案中说明来源。

2. 类别比例可以全部相等吗?

只有在等比例具有实际依据时才建议这样设置。人为使用等比例可能低估或高估真实研究所需样本量。

3. 单侧下限与双侧区间怎样选择?

如果核心要求是排除低于最低可接受水平的一致性,单侧下限更直接;如果上下界的精度都重要,应使用双侧区间并明确两个目标界限。

4. 为什么双侧上限必须高于预期 Kappa?

预期 Kappa 必须位于目标双侧区间内部。下限不低于预期值或上限不高于预期值都不构成有效的预期区间设计。

5. 增加评估者一定能减少总成本吗?

不一定。受试者数可能下降,但每名受试者需要更多评分。应比较总评分次数、培训成本和排班可行性。

6. 所需样本数是否包含失访和无法判定?

不包含。模块给出的是完成全部计划评分的有效样本数,应根据研究流程另行增加失访、拒绝、无法判定或评分缺失的预留量。

7. 研究完成后实际类别比例与计划不同怎么办?

应如实报告实际分布、Kappa 及置信区间,并讨论精度是否仍满足要求。不能在结果阶段修改计划参数来掩盖偏差。

8. 可以用于有序分类的加权 Kappa 吗?

当前模块按名义类别的一般 Kappa 设计,不提供权重矩阵。需要加权 Kappa 时,应使用与计划权重结构相匹配的专门方法。

9. 为什么更窄界限需要更多样本?

更窄界限要求估计更精确,随机波动必须被限制在更小范围内,因此通常需要更多独立样本。

10. 可以根据模块结果宣称一致性达标吗?

不可以。它是研究设计工具。是否达标必须由研究完成后的 Kappa 点估计、置信区间和预先定义的判定规则决定。

10.99.12 小结

Kappa 置信区间样本量的可靠流程是:先确定类别定义和评估者设计,再用可靠资料设定预期 Kappa 与类别比例,明确单侧下限或双侧界限,比较区间精度和评估者人数的敏感性,最后在有效样本数基础上增加合理预留。

本模块用于一致性研究的置信区间样本量规划和工作量评估;它不能替代研究完成后的 Kappa 分析,也不处理加权 Kappa、复杂评分结构或不完整评分设计。

10.100 固定样本量 Kappa 下限评估

10.100.1 模块功能

固定样本量 Kappa 下限评估用于回答:当可纳入的受试者或样本数已经确定时,在预期 Kappa、类别构成和评估者人数的假设下,Kappa 的单侧置信下限预计可以达到多少?

模块自动生成:

  • 固定样本数对应的预期 Kappa 单侧置信下限;
  • 预期 Kappa 与置信下限之间的差距;
  • 样本数、评估者人数和总评分次数;
  • 研究设置与类别比例核对表;
  • 固定样本数上下变化时的下限敏感性分析;
  • 评估者人数从 2 到 6 时的下限和工作量分析;
  • 类别比例图、样本数与预期下限图、评估者人数与预期下限图;
  • Word 报告和敏感性分析 CSV。

10.100.2 适用场景

本模块适合:

  • 招募名额、标本数量、病例库规模或研究经费已经限定;
  • 需要判断现有样本数能否为预期 Kappa 提供足够的最低精度保证;
  • 结局为 2–5 个互斥名义类别;
  • 计划由 2–6 名评估者评价同一批对象;
  • 已有预实验、既往文献或目标总体资料可估计预期 Kappa 和类别比例;
  • 需要比较增加样本和增加评估者对置信下限及总评分工作量的影响。

不建议用本模块替代:

  • 按目标置信下限反推最少样本数的研究设计;
  • 连续测量的一致性分析;
  • 有序类别的加权 Kappa 设计;
  • 研究完成后的实际 Kappa、观察一致率和置信区间估计;
  • 存在不完全评分、嵌套评估者、重复测量或复杂抽样结构的设计;
  • 仅凭设计阶段下限判断临床或诊断一致性已经达标。

本模块与“Kappa 置信区间样本量”互为正向与反向工具:前者输入目标界限并求所需样本数;本模块输入已经固定的样本数并评估可达到的预期下限。若样本量仍可调整,优先使用目标驱动的样本量规划;若样本量确实受限,再使用本模块评价设计可行性。

10.100.3 统计原理

Kappa 校正了偶然一致,其基本形式为:

\[ \kappa=\frac{P_o-P_e}{1-P_e}, \]

其中,\(P_o\) 为观察一致率,\(P_e\) 为根据类别边际比例计算的偶然一致率。

固定样本量设计把预期 Kappa 视为研究设计阶段的中心值,并根据样本数、评估者人数、类别比例和显著性水平估计其单侧置信下限。模块同时报告:

\[ \text{下限差距}=\text{预期 Kappa}-\text{预期置信下限}. \]

下限差距越小,表示设计阶段预计的精度越高;但它并不是偏倚、测量质量或研究有效性的综合评分。

显著性水平 \(\alpha\) 决定单侧置信水平。例如 \(\alpha=0.05\) 表示单侧 95% 置信下限,\(\alpha=0.10\) 表示单侧 90% 置信下限。置信水平越高,对下限的要求越保守。

10.100.4 设计参数

1. 固定样本数

指能够完成全部计划评估者评分的有效对象数,不是最初筛查人数或计划邀请人数。界面接受 11–100000 之间的整数。

2. 预期 Kappa

应来自相似人群、相同类别定义、相近评估者培训水平和相同评分流程的预实验或既往证据。过于乐观的预期 Kappa 会让下限评估失去实际意义。

3. 类别比例

输入个数必须与结局类别数一致,每个比例严格介于 0 和 1,合计为 1。明显不均衡的类别分布会改变偶然一致率和 Kappa 方差。

4. 评估者人数

增加评估者通常能改善精度,但每名对象需要更多评分。模块同时报告受试者数和总评分次数,便于比较两种资源。

固定样本数不应包含预计失访、标本损坏、无法判定或评分缺失。若预计 10% 的对象无法完成全部评分,应先从可招募人数中扣除损耗,或把有效样本数除以完成率反推实际招募量。

10.100.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “统计功效与样本量” → “固定样本量 Kappa 下限评估”

  1. 选择 2、3、4 或 5 类结局;
  2. 选择计划参与的评估者人数;
  3. 输入能够完成全部评分的固定样本数;
  4. 输入预期 Kappa;
  5. 按类别顺序输入各类别预期比例,并确认合计为 1;
  6. 设定显著性水平 \(\alpha\)
  7. 保留需要的表格和图形,全部主要输出默认已勾选;
  8. 点击“开始 Kappa 下限评估”;
  9. 先核对研究设置和主要下限,再查看样本数与评估者人数敏感性分析;
  10. 同时比较预期下限和总评分次数,不仅比较单一精度指标;
  11. 在下载页导出 Word 报告和敏感性分析 CSV。
固定样本量 Kappa 下限评估:完整设置面板
固定样本量 Kappa 下限评估:完整设置面板

10.100.6 生成的表格和图形

一键自动生成以下结果:

1. 研究设计设置

列出结局类别数、评估者人数、固定样本数、预期 Kappa、显著性水平、单侧置信水平和类别比例。正式解释结果前应先核对这些假设。

2. 固定样本量 Kappa 下限

主要结果表报告固定样本数、评估者人数、总评分次数、预期 Kappa、预期置信下限、下限差距和单侧置信水平。

3. 预期类别比例

类别比例表按输入顺序列出各类别比例和百分比,用于核对类别数、顺序和分布是否符合研究对象。

固定样本量 Kappa 下限评估:设计与主要结果
固定样本量 Kappa 下限评估:设计与主要结果

4. 样本数敏感性分析

模块以当前样本数的约 50%、75%、100%、125% 和 150% 构建比较方案,分别报告预期下限、下限差距和总评分次数。样本数增加时,下限通常逐渐接近预期 Kappa,但改善幅度可能递减。

5. 评估者人数敏感性分析

模块保持固定样本数不变,把评估者人数从 2 变化到 6。增加评估者可能提高预期下限,但总评分次数会按样本数乘以评估者人数增加。

固定样本量 Kappa 下限评估:敏感性分析
固定样本量 Kappa 下限评估:敏感性分析

6. 类别比例图

柱形图展示各类别的预期构成,可快速识别少见类别和明显不均衡的分布。

固定样本量 Kappa 下限评估:预期类别比例图
固定样本量 Kappa 下限评估:预期类别比例图

7. 样本数与预期下限图

折线图显示固定样本数变化时预期下限的变化,虚线表示预期 Kappa。曲线越接近虚线,预期下限与中心值的差距越小。

固定样本量 Kappa 下限评估:样本数与预期下限图
固定样本量 Kappa 下限评估:样本数与预期下限图

8. 评估者人数与预期下限图

折线图显示 2–6 名评估者时的预期下限,虚线仍表示预期 Kappa。应与敏感性表中的总评分次数一起解释。

固定样本量 Kappa 下限评估:评估者人数与预期下限图
固定样本量 Kappa 下限评估:评估者人数与预期下限图

10.100.7 结果解释顺序

  1. 确认输入的是有效完成全部评分的样本数;
  2. 核对预期 Kappa、类别比例和评估者人数的证据来源;
  3. 报告单侧置信水平及对应的预期下限;
  4. 计算并解释预期 Kappa 与下限之间的差距;
  5. 将预期下限与研究预先定义的最低可接受一致性比较;
  6. 查看样本数敏感性曲线,判断增加样本能否带来具有实际意义的精度改善;
  7. 查看评估者敏感性结果,同时比较下限和总评分次数;
  8. 对低于 0 的预期下限或期望格数过小提示保持谨慎;
  9. 根据失访、缺失评分和无法判定比例修正实际招募数;
  10. 研究完成后使用实际数据重新估计 Kappa 和置信区间,不把设计结果当作观察结果。

10.100.8 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把固定样本数、结局类别数、评估者人数、预期 Kappa 和预期下限作为背景,生成医学论文 Methods 或样本量段落风格的客观初稿。

三幅统计图也提供中英文描述,以及 PNG、TIFF、SVG 和 PDF 下载。自动描述不会代替研究者对参数来源、评分流程、最低可接受下限和资源约束的专业判断。

10.100.9 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格、分析提示和三幅统计图。“下载敏感性分析 CSV”保存样本数方案和 2–6 名评估者方案,包括固定样本数、评估者人数、总评分次数、预期 Kappa、预期置信下限和下限差距。

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.100.10 从模块结果进入研究方案写作

Methods 建议说明:样本数受限的原因、有效样本定义、类别及编码、评估者人数和资质、评分独立性及盲法、预期 Kappa 和类别比例的来源、单侧置信水平、预计下限、总评分次数及缺失预留。

方案写作例子:本研究可获得 200 份满足评价条件的标本,由 6 名相互独立且对临床信息盲法的评估者完成五分类判定。预计五个类别比例分别为 0.10、0.15、0.20、0.25 和 0.30,预期 Kappa 为 0.70。采用单侧 90% 置信下限评估,固定 200 份标本时预计 Kappa 下限为 0.667,下限差距为 0.033,共需完成 1200 次评分。

例子数值只用于展示写法。实际方案必须替换为本研究设置和模块结果,并说明样本受限原因及参数证据来源。

10.100.11 常见问题

1. 固定样本数是招募人数还是有效分析人数?

是能够完成全部计划评分的有效人数或样本数。预计会失访、损坏、缺失或无法判定的对象应额外预留。

2. 预期下限就是研究完成后的置信下限吗?

不是。它是设计参数假设下的预期值。实际下限取决于观察到的一致性、类别分布、缺失和抽样波动。

3. 下限差距越小越好吗?

它表示估计精度更高,但不能替代对预期 Kappa 本身、临床阈值、偏倚和研究流程的评价。

4. 为什么小样本时下限可能低于 0?

样本较少或类别分布不利时,不确定性很大,单侧下限可能低于 0。这提示当前固定样本数无法为正向一致性提供有力保证。

5. 为什么出现期望格数小于 5 的提示?

少见类别与小样本组合可能导致部分预期格数过小,使近似结果不稳定。应考虑增加样本、合并有理论依据的类别,或重新评价研究可行性。

6. 增加评估者与增加样本哪种更有效?

没有统一答案。应比较两张敏感性表中的下限改善幅度、总评分次数、招募成本、培训成本和实际排班。

7. 可以把显著性水平设为 0.20 吗?

界面允许 0.01–0.20,但较大的 \(\alpha\) 对应较低的单侧置信水平。正式研究应根据方案目的、规范和领域惯例预先确定。

8. 类别比例可以用当前数据计算后再输入吗?

若当前数据就是最终研究数据,不应把同一数据用于事后设计论证。设计阶段应使用独立预实验、可靠文献或目标总体资料。

9. 可以用于加权 Kappa 吗?

当前模块按名义类别的一般 Kappa 进行评估,不提供权重矩阵。加权 Kappa 需要与权重结构相匹配的专门方法。

10. 固定样本量下限低于最低要求怎么办?

可比较增加样本、增加评估者或调整研究范围后的敏感性结果。不能为了得到满意结论而事后抬高预期 Kappa 或使用没有依据的类别比例。

10.100.12 小结

固定样本量 Kappa 下限评估的可靠流程是:先确认真正可完成全部评分的有效样本数,再用独立证据设定预期 Kappa 与类别比例,评估单侧置信下限,比较增加样本和增加评估者的收益与工作量,最后为缺失和无法判定预留资源。

本模块用于样本资源已经受限时的一致性研究可行性评估;它不能替代目标驱动的样本量设计、研究完成后的 Kappa 分析或复杂评分结构模型。

10.101 Kappa 功效法样本量

10.101.1 模块功能

Kappa 功效法样本量用于回答:在给定原假设 Kappa、备择 Kappa、类别构成、评估者人数、显著性水平和目标功效时,一致性研究至少需要多少名受试者或样本?

模块自动生成:

  • 功效法所需的有效样本数与总评分次数;
  • 原假设、备择假设、Kappa 差值和检验方向;
  • 研究设置与预期类别比例核对表;
  • 目标功效从 60% 到 99% 时的样本量敏感性分析;
  • Kappa 差异变化时的样本量敏感性分析;
  • 评估者人数从 2 到 6 时的样本量和评分工作量分析;
  • 类别比例图、功效与样本量图、Kappa 差异与样本量图、评估者人数与样本量图;
  • Word 报告和敏感性分析 CSV。

10.101.2 适用场景

本模块适合:

  • 研究主要目标是检验总体 Kappa 是否不同于预先规定的原假设值;
  • 结局为 2–5 个互斥名义类别;
  • 计划由 2–6 名评估者独立评价同一批对象;
  • 已有预实验、既往文献或专业共识可设定原假设 Kappa、备择 Kappa 和类别比例;
  • 需要在研究开始前比较功效、效应差异、评估者人数与评分工作量;
  • 需要把样本量设计写入研究方案、伦理申请或论文 Methods。

不建议用本模块替代:

  • 以置信区间宽度或目标下限为核心的精度设计;
  • 样本数已经固定后的预期下限评估;
  • 连续测量的一致性分析;
  • 有序类别的加权 Kappa 设计;
  • 研究完成后的实际 Kappa、观察一致率、置信区间和 P 值计算;
  • 存在不完全评分、嵌套评估者、重复测量或复杂抽样结构的研究。

三个 Kappa 设计模块解决不同问题:“Kappa 功效法样本量”按假设检验的目标功效求样本数;“Kappa 置信区间样本量”按目标置信下限或区间精度求样本数;“固定样本量 Kappa 下限评估”在样本数不能调整时估计可达到的下限。应根据研究主要目标选择模块,不能只挑选样本量最小的结果。

10.101.3 统计原理

Kappa 校正偶然一致,其基本形式为:

\[ \kappa=\frac{P_o-P_e}{1-P_e}, \]

其中,\(P_o\) 为观察一致率,\(P_e\) 为根据类别边际比例计算的偶然一致率。

功效法设计比较两个预先规定的总体 Kappa:

\[ H_0:\kappa=\kappa_0, \qquad H_1:\kappa=\kappa_1, \]

并在显著性水平 \(\alpha\) 下寻找使检验功效达到 \(1-\beta\) 的最小样本数。模块报告的 Kappa 差值为:

\[ \Delta\kappa=\kappa_1-\kappa_0. \]

绝对差值越小,越难区分原假设与备择假设,通常需要更多样本。目标功效越高,所需样本通常越多。类别比例会改变偶然一致率和 Kappa 方差,因此即使两个 Kappa 假设相同,不同类别构成也可能产生不同样本量。

10.101.4 设计参数

1. 原假设 Kappa

代表需要拒绝或区分的基准一致性水平,例如不可接受的最低水平、历史水平或专业上认为没有实际价值的水平。它不应为了降低样本量而任意设低。

2. 备择 Kappa

代表研究期望识别的总体一致性水平。应来自同类研究、预实验或有依据的专业判断。原假设和备择假设都接受 0.01–0.99,但两者必须不同。

3. 类别比例

输入个数必须与结局类别数一致,每个比例严格介于 0 和 1,合计为 1。二分类时也可以只输入第一个类别比例,系统会自动补齐其互补比例。

4. 评估者人数

增加评估者可能减少所需受试者数,但每名对象需要更多评分。模块同时报告样本数和总评分次数,避免把受试者数减少误认为总工作量一定减少。

5. 显著性水平与目标功效

界面允许显著性水平 0.01–0.20、目标功效 0.50–0.99。正式研究通常预先使用 \(\alpha=0.05\) 和 80% 或 90% 功效;参数应由方案目的和领域规范决定,不能根据结果反复调整。

模块给出的是完成全部计划评分的有效样本数,不包含失访、拒绝、标本损坏、无法判定或评分缺失。实际招募数可按“有效样本数 ÷ 预计完成率”向上取整,并记录预留依据。

10.101.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “统计功效与样本量” → “Kappa 功效法样本量”

  1. 选择 2、3、4 或 5 类结局;
  2. 选择计划参与的评估者人数;
  3. 输入原假设 Kappa;
  4. 输入备择 Kappa,并确认检验方向符合研究问题;
  5. 按类别顺序输入各类别预期比例,并确认合计为 1;
  6. 设定显著性水平 \(\alpha\)
  7. 设定目标功效;
  8. 保留需要的表格和图形,全部主要输出默认已勾选;
  9. 点击“开始 Kappa 功效样本量计算”;
  10. 先核对研究设置和主要样本量,再查看三类敏感性分析;
  11. 比较所需样本数与总评分次数,并为不完整评分增加预留;
  12. 在下载页导出 Word 报告和敏感性分析 CSV。
Kappa 功效法样本量:完整设置面板
Kappa 功效法样本量:完整设置面板

10.101.6 生成的表格和图形

一键自动生成以下结果:

1. 研究设计设置

列出结局类别数、评估者人数、原假设 Kappa、备择 Kappa、检验方向、Kappa 差值、显著性水平、目标功效和类别比例。正式解释样本量前应先核对这些假设。

2. Kappa 功效法样本量

主要结果表报告所需有效样本数、评估者人数、总评分次数、两个 Kappa 假设、Kappa 差值、显著性水平和目标功效。

3. 预期类别比例

类别比例表按输入顺序列出比例和百分比,用于核对类别数、顺序和总体构成。

Kappa 功效法样本量:设计与主要结果
Kappa 功效法样本量:设计与主要结果

4. 目标功效敏感性分析

模块比较 60%、70%、80%、90%、95% 和 99% 功效,并保留当前设置。功效提高时样本量通常增加,可用于比较统计把握度与招募可行性。

5. Kappa 差异敏感性分析

模块在保持原假设不变时,按当前 Kappa 差值的约 50%、75%、100%、125% 和 150% 构建备择方案。差异越接近 0,通常越难检出并需要更多样本。

6. 评估者人数敏感性分析

模块比较 2–6 名评估者,分别报告所需样本数和总评分次数。增加评估者可能减少受试者数,但总评分工作量未必下降。

Kappa 功效法样本量:三类敏感性分析
Kappa 功效法样本量:三类敏感性分析

7. 类别比例图

柱形图显示各类别预期构成,便于识别稀有类别和明显不均衡的分布。

Kappa 功效法样本量:预期类别比例图
Kappa 功效法样本量:预期类别比例图

8. 目标功效与样本量图

折线图显示功效提高时所需样本数的变化,帮助识别从 80% 提高到 90% 或 95% 所需的额外资源。

Kappa 功效法样本量:目标功效与样本量图
Kappa 功效法样本量:目标功效与样本量图

9. Kappa 差异与样本量图

横轴为原假设与备择假设的绝对差值。曲线用于展示效应假设越接近时样本量通常上升的规律。

Kappa 功效法样本量:Kappa 差异与样本量图
Kappa 功效法样本量:Kappa 差异与样本量图

10. 评估者人数与样本量图

折线图显示 2–6 名评估者对应的受试者数,应与敏感性表中的总评分次数一起判断设计效率。

Kappa 功效法样本量:评估者人数与样本量图
Kappa 功效法样本量:评估者人数与样本量图

10.101.7 结果解释顺序

  1. 确认研究的主要目标确实是 Kappa 假设检验,而不是置信区间精度;
  2. 核对类别定义、类别顺序和预期比例;
  3. 说明原假设 Kappa 的科学或临床依据;
  4. 说明备择 Kappa 的证据来源及实际意义;
  5. 报告检验方向、Kappa 差值、显著性水平和目标功效;
  6. 报告有效样本数和评估者人数;
  7. 报告总评分次数,并考虑培训、盲法和排班成本;
  8. 使用三类敏感性分析判断设计对假设变化是否稳定;
  9. 对期望格数过小或样本量极小的提示保持谨慎;
  10. 根据预计完成率修正实际招募数;
  11. 研究完成后报告实际观察一致率、Kappa、置信区间和预先规定的检验结果。

10.101.8 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把类别数、评估者人数、两个 Kappa 假设、目标功效、样本数和评分工作量作为背景,生成医学论文 Methods 或样本量段落风格的客观初稿。

四幅统计图也提供中英文描述,以及 PNG、TIFF、SVG 和 PDF 下载。自动描述不会替代研究者对假设来源、评分流程、最低可接受一致性和资源约束的专业判断。

10.101.9 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的全部表格、分析提示和四幅统计图。“下载敏感性分析 CSV”整合目标功效、Kappa 差异和 2–6 名评估者方案,包含每个方案的 Kappa 假设、目标功效、评估者人数、所需样本数和总评分次数。

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.101.10 从模块结果进入研究方案写作

Methods 建议说明:结局类别及编码、评估者人数和资质、评分独立性及盲法、原假设和备择 Kappa 的来源、类别比例来源、显著性水平、目标功效、计算得到的有效样本数、总评分次数及缺失预留。

方案写作例子:本研究计划由 4 名相互独立且对临床信息盲法的评估者完成四分类判定。预计四个类别比例分别为 0.15、0.25、0.30 和 0.30。原假设 Kappa 设为 0.30,备择 Kappa 设为 0.65,采用显著性水平 0.05 和 90% 功效。计算得到至少需要 13 份完成全部评分的有效样本,共需完成 52 次评分。考虑评分缺失后,将按预先设定的完成率增加实际纳入量。

例子数值只用于展示写法。实际方案必须替换为本研究设置和模块结果,并说明参数证据来源。

10.101.11 常见问题

1. 原假设 Kappa 应该设为 0 吗?

不一定。原假设应代表需要拒绝的基准水平。若研究问题是证明一致性高于某个最低可接受水平,应使用该水平,而不是机械使用 0。

2. 备择 Kappa 可以直接设为预实验结果吗?

可以作为依据,但应考虑预实验样本量、不确定性、人群和评分流程差异。过于乐观的备择值会低估所需样本数。

3. 原假设可以高于备择假设吗?

可以。此时检验方向为备择 Kappa 低于原假设。必须确认这确实对应研究问题,而不是输入顺序错误。

4. 为什么两个 Kappa 越接近,样本量越大?

差异越小,随机波动越容易掩盖真实差别。为了在固定显著性水平和功效下区分它们,需要更精确的估计和更多样本。

5. 为什么类别比例会影响样本量?

类别比例决定偶然一致率并影响 Kappa 方差。少见类别或高度不均衡分布可能降低信息量并使近似结果不稳定。

6. 增加评估者一定更省资源吗?

不一定。受试者数可能减少,但每名受试者需要更多评分。应比较总评分次数、培训成本、排班和评估者疲劳。

7. 所需样本数是否已经包含失访或评分缺失?

没有。结果指完成全部计划评分的有效样本数,实际招募应根据预计完成率向上调整。

8. 功效应该选 80% 还是 90%?

取决于研究重要性、错误代价、规范和资源。应在方案阶段确定,并用敏感性分析展示不同选择的资源影响。

9. 可以用于加权 Kappa 吗?

当前模块按名义类别的一般 Kappa 设计,不提供权重矩阵。加权 Kappa 需要与类别顺序和权重结构匹配的专门方法。

10. 功效法样本量能保证研究达到目标 Kappa 吗?

不能。它是在设计假设成立时提供预定统计功效,并不保证观察结果。最终结论必须基于实际 Kappa、置信区间和预先规定的检验。

10.101.12 小结

Kappa 功效法样本量的可靠流程是:先明确要检验的基准一致性和具有实际意义的备择一致性,再用独立证据设定类别比例,预先确定显著性水平和功效,比较功效、Kappa 差异及评估者人数的敏感性,最后在有效样本数基础上增加合理预留。

本模块用于名义分类一致性研究的功效驱动样本量设计;它不能替代置信区间精度设计、固定样本量可行性评估、研究完成后的 Kappa 分析或复杂评分结构模型。

10.102 简单中介效应分析

10.102.1 模块功能

简单中介效应分析用于回答:主要自变量 (X) 与连续结局 (Y) 之间的关联,有多少可能经一个或多个预先指定的中介变量 (M) 传递?

模块支持 1–3 个并行中介,并自动生成:

  • 分析变量、区间方法、缺失处理和有效样本量概览;
  • 每条 (XMY) 路径的间接效应及区间;
    1. 路径和 (b) 路径分量;
  • 直接效应、总效应和总间接效应;
  • 中介模型、结局模型和总效应模型的拟合指标;
  • 各组成回归模型的系数表;
  • 概念或统计路径图;
  • 间接效应区间图;
  • Word 报告和清洁结果 CSV。

10.102.2 适用场景

本模块适合:

  • 结局变量为连续数值型;
  • 中介变量为连续数值型;
  • 主要自变量可以是连续变量,也可以是二分类或多分类变量;
  • 研究假设已经指定 1–3 个并行中介,而不是让数据自动寻找路径;
  • 需要调整连续协变量或分类协变量;
  • 需要同时报告间接效应、直接效应、总效应和组成回归模型;
  • 需要用 Delta 法或 Bootstrap 区间评价间接效应的不确定性。

不建议把本模块用于:

  • 二分类、计数或生存结局;
  • 链式中介或路径之间存在先后传递关系的模型;
  • 中介路径受到调节变量影响的模型;
  • 需要潜变量测量模型的结构方程分析;
  • 仅凭横断面资料作强因果结论;
  • 变量之间缺少明确时间顺序或存在严重未测混杂的研究。

简单中介分析分解的是统计关联。只有在暴露先于中介、中介先于结局、模型设定合理且不存在重要未测混杂等附加假设得到支持时,才可能讨论因果中介。模块结果本身不能证明机制或因果链条。

10.102.3 统计模型

对于单个中介变量,模块拟合:

\[ M = i_M + aX + \boldsymbol{\gamma}^{\mathsf T}\mathbf{C} + \varepsilon_M, \]

\[ Y = i_Y + c'X + bM + \boldsymbol{\delta}^{\mathsf T}\mathbf{C} + \varepsilon_Y, \]

以及不含中介的总效应模型:

\[ Y = i_T + cX + \boldsymbol{\eta}^{\mathsf T}\mathbf{C} + \varepsilon_T. \]

其中,(a) 为 (XM) 路径,(b) 为控制 (X) 和协变量后 (MY) 的路径,(c’) 为直接效应,(c) 为总效应。间接效应为:

\[ ab=a\times b. \]

在线性且模型设定一致的条件下,通常有:

\[ c=c'+ab. \]

对于多个并行中介,每个中介都有一条特定间接效应 (a_jb_j),总间接效应为:

\[ \sum_{j=1}^{k}a_jb_j,\qquad k=1,2,3. \]

每条特定间接效应均是在同时纳入其他中介后得到,因此不能把多个单中介模型的结果直接当作并行中介结果。

10.102.4 区间与缺失处理

1. Delta 法

根据系数及其协方差近似计算间接效应标准误和区间,计算较快,适合初步分析和样本量较充足、间接效应分布不过度偏斜的资料。

2. 百分位 Bootstrap

通过重复重抽样构建间接效应经验分布,并取相应分位数形成区间。间接效应是两个系数的乘积,分布常不对称,因此 Bootstrap 常用于正式报告。

3. 偏倚校正 Bootstrap

在经验分布基础上校正偏倚。它可能比普通百分位区间更敏感,样本较小或模型不稳定时应结合敏感性分析解释。

4. 完整案例

只分析所有指定变量均无缺失的观测。应报告完整观测数,并比较纳入与排除对象是否存在系统差异。

5. 全信息极大似然

利用模型中可用信息处理缺失。该方法依赖模型和缺失机制假设,不等于自动消除缺失偏倚。

10.102.5 数据准备

建议在分析前完成以下检查:

  1. 确认 (X)、(M) 和 (Y) 的时间顺序与研究假设一致;
  2. 检查连续变量单位、极端值、线性关系和残差;
  3. 确认分类变量水平及参考组具有明确含义;
  4. 避免把同一变量同时放入结局、中介、自变量或协变量角色;
  5. 检查中介之间是否高度相关;
  6. 明确协变量是基线混杂因素,而不是暴露后的变量或碰撞变量;
  7. 记录每个分析变量的缺失比例和完整观测数;
  8. 对 Bootstrap 结果固定分析方案和重复次数。

10.102.6 操作步骤

顶部菜单选择 “按统计学分类模块” → “中介与调节效应分析” → “简单中介效应分析”

  1. 选择连续型结局变量 (Y);
  2. 选择 1–3 个连续型中介变量 (M);
  3. 选择主要自变量 (X);
  4. 按研究方案加入连续协变量和分类协变量;
  5. 选择间接效应区间方法;
  6. 设定区间水平;
  7. 使用 Bootstrap 时设定重复次数;
  8. 选择完整案例或全信息极大似然;
  9. 选择连续变量中心化、标准化或不处理;
  10. 若模型中含分类变量,选择其编码方式;
  11. 选择路径图类型、标签、节点形状和大小;
  12. 保留需要的表格和统计图,全部主要输出默认勾选;
  13. 点击“开始简单中介效应分析”;
  14. 先核对分析概览,再依次查看效应分解、组成回归和统计图;
  15. 在下载页导出 Word 报告和结果 CSV。
简单中介效应分析:完整设置面板
简单中介效应分析:完整设置面板

10.102.7 生成的表格

一键自动生成以下结果:

1. 中介分析设置

列出结局、中介、主要自变量、协变量、区间方法、缺失处理、连续变量处理和完整观测数。解释任何效应前应先核对本表。

简单中介效应分析:分析概览
简单中介效应分析:分析概览

2. 焦点自变量的间接效应

每行对应一条特定中介路径。重点报告效应估计、标准误、区间和检验结果。区间不跨 0 表示数据支持该指定路径的非零关联,但不能单独证明因果中介。

3. 中介路径分量

分别报告 (XM) 的 (a) 路径和 (MY) 的 (b) 路径。路径分量有助于判断间接效应的方向和来源。

4. 直接效应与总效应

直接效应是在中介进入模型后 (X) 与 (Y) 的条件关联;总效应来自不含中介的模型。总效应不显著并不自动排除间接效应,反向或相互抵消的路径可能使总效应接近 0。

简单中介效应分析:间接效应、路径分量、直接效应与总效应
简单中介效应分析:间接效应、路径分量、直接效应与总效应

5. 组成回归模型拟合

列出总效应模型、中介模型和结局模型的拟合信息。它用于检查各组成模型是否成功估计,并帮助识别模型复杂度和解释度。

6. 组成回归模型系数

列出各回归方程的估计系数、标准误、检验统计量和区间。所有系数都以当前变量编码、缩放和协变量设置为条件。

简单中介效应分析:组成回归模型
简单中介效应分析:组成回归模型

10.102.8 生成的统计图

1. 简单中介效应路径图

概念路径图突出变量和路径结构;统计路径图进一步展示模型估计信息。路径图用于概括预先指定的分析结构,不代表从数据中自动发现的机制。

简单中介效应分析:路径图
简单中介效应分析:路径图

2. 间接效应及区间图

点表示各特定间接效应估计,线段表示所选区间。多中介模型中应同时比较方向、大小和不确定性,不应只挑选区间最窄或 P 值最小的路径。

简单中介效应分析:间接效应区间图
简单中介效应分析:间接效应区间图

10.102.9 结果解释顺序

  1. 核对变量角色、时间顺序和完整观测数;
  2. 说明中介模型是单中介还是并行多中介;
  3. 说明协变量、参考组、连续变量处理和缺失处理;
  4. 报告间接效应区间方法和 Bootstrap 次数;
  5. 报告各条特定间接效应及区间;
  6. 结合 (a) 和 (b) 路径解释间接效应方向;
  7. 报告直接效应和总效应,但不要用“直接效应比例”替代完整解释;
  8. 查看组成回归模型是否存在明显估计异常;
  9. 比较 Delta、百分位 Bootstrap 和偏倚校正 Bootstrap 的敏感性;
  10. 明确说明结果是关联分解还是满足额外假设的因果中介分析。

10.102.10 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把结局、主要自变量、中介、协变量、有效样本量和模型类型作为背景,生成医学论文 Results 部分风格的客观初稿。

两幅统计图也提供中英文描述,以及 PNG、TIFF、SVG 和 PDF 下载。自动描述不会替代研究者对时间顺序、混杂控制、模型设定和因果假设的专业判断。

10.102.11 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选的表格、分析提示和统计图。“下载分析结果 CSV”把分析概览、间接效应、路径分量、直接与总效应、回归拟合和回归系数整合为结构化数据。

简单中介效应分析:Word 和 CSV 下载页
简单中介效应分析:Word 和 CSV 下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.102.12 从模块结果进入论文写作

Methods 建议说明:研究设计和时间顺序、(X)、(M)、(Y) 的定义与测量时间、并行中介结构、协变量及其选择依据、分类变量编码、连续变量处理、缺失处理、区间方法、Bootstrap 次数和统计软件版本。

Results 建议按“样本与模型设置 → 特定间接效应 → 路径分量 → 直接和总效应 → 敏感性分析”的顺序书写。

结果写作例子:在调整基线协变量后,主要自变量与结局之间存在经中介 M1 传递的间接关联,间接效应为 0.XX,95% Bootstrap 区间为 0.XX–0.XX。经 M2 的特定间接效应为 0.XX,95% Bootstrap 区间为 0.XX–0.XX。纳入两个中介后,主要自变量的直接效应为 0.XX;未纳入中介时的总效应为 0.XX。上述结果反映预先指定模型下的关联分解,不单独构成因果机制证据。

例子中的数值必须替换为本研究结果,不能照抄。若区间跨 0,应客观报告不确定性,不能写成“存在趋势”来替代预先规定的推断标准。

10.102.13 常见问题

1. 总效应不显著,还能分析间接效应吗?

可以。不同路径可能方向相反并相互抵消,因此总效应不显著不等于所有间接效应均为 0。但中介模型必须有明确理论依据,不能事后大量搜索。

2. 间接效应显著是否说明存在因果机制?

不能。统计显著只表示在当前模型和假设下区间未跨 0。因果解释还需要时间顺序、无重要未测混杂、正确模型设定等条件。

3. 多个中介应分别分析还是一起分析?

若研究假设是并行中介,建议在同一模型中同时纳入。分别拟合多个单中介模型不能控制中介之间的关联,结果含义不同。

4. 为什么 Bootstrap 常用于间接效应?

间接效应是两个系数的乘积,其抽样分布可能偏斜。Bootstrap 不强制使用对称正态近似,通常更适合描述这种不确定性。

5. Bootstrap 次数应该设多少?

快速检查可使用较少次数;正式报告通常应使用更充分的重复次数,并固定随机方案。次数越高,计算更慢,但区间通常更稳定。

6. 什么时候使用全信息极大似然?

当模型适用且缺失机制假设合理时可考虑。仍应报告缺失比例、模型纳入变量和完整案例敏感性结果。

7. 连续变量应该中心化还是标准化?

中心化便于解释截距且不改变单位尺度;标准化便于比较不同量纲的系数;不处理保留原始单位。选择应在分析前确定,并在论文中说明。

8. 分类自变量如何解释?

必须结合当前编码方式和参考组。分类自变量可能产生多条对比路径,不能把其中一条系数当作整个变量的唯一效应。

9. 可以把暴露后的变量作为协变量吗?

一般不应机械调整。暴露后的变量可能位于因果路径上或成为碰撞变量,导致新的偏倚。协变量应依据预先规定的因果和临床知识选择。

10. 可以计算“中介比例”吗?

中介比例在总效应接近 0、直接与间接效应方向相反或模型尺度不一致时可能不稳定甚至无意义。本模块优先报告各效应及区间,不把比例作为默认核心结论。

10.102.14 小结

简单中介效应分析的可靠流程是:先用理论和时间顺序确定 (XMY) 结构,再选择必要的基线混杂因素,核对变量编码与缺失处理,报告特定间接效应及其区间,同时给出路径分量、直接效应和总效应,最后通过区间方法和缺失处理进行敏感性检查。

本模块适用于连续结局下 1–3 个预先指定的并行中介;链式中介、调节中介、潜变量模型或其他类型结局应使用相应的专门模块。

10.103 高级 ROC 与临床效用分析

10.103.1 模块功能

高级 ROC 与临床效用分析用于回答:一个或多个连续检测指标能否区分二分类结局,如何选择符合研究目标的阈值,以及这种区分能力能否转化为有意义的临床净获益?

模块支持 1–6 个连续检测指标,并自动生成:

  • 分析设置、事件方向、检测指标和共同完整案例概览;
  • AUC、标准误、置信区间和部分 AUC;
  • 多种阈值优化方法及完整阈值表现;
  • 固定灵敏度或固定特异度下的阈值与诊断表现;
  • AUC 成对比较和分类器综合表现比较;
  • IDI、NRI、检测指标效应量、ROC 功效与样本量;
  • Bootstrap AUC 区间和先验加权 Bootstrap ROC;
  • 临床效用汇总、决策曲线数据和净获益图;
  • ROC、AUC 区间、阈值权衡、预测值-患病率、检测值分布和精确率-召回率图;
  • Word 报告和清洁结果 CSV。

10.103.2 适用场景

本模块适合:

  • 金标准或结局变量恰好包含两个有效水平;
  • 检测指标为连续数值型;
  • 同一批研究对象接受一个或多个候选检测指标;
  • 需要比较完整 AUC、部分 AUC或成对 AUC 差异;
  • 需要按筛查、确诊、成本或预设灵敏度/特异度选择阈值;
  • 需要评价预测值随目标人群患病率变化的情况;
  • 需要在已有基础模型上评价新指标的重分类改善;
  • 需要把统计区分度与决策曲线净获益结合解释。

不建议把本模块用于:

  • 没有可信二分类金标准的资料;
  • 检测结果本身只有阳性/阴性两个水平且不存在连续阈值;
  • 不同检测指标来自彼此独立的样本,却按同一对象的配对 AUC 进行比较;
  • 需要时间依赖 ROC 的生存结局;
  • 在同一数据上反复筛选指标、调阈值并把结果当作外部验证;
  • 仅凭 AUC、IDI、NRI 或净获益作因果或临床推广结论。

ROC 曲线评价的是排序区分能力,阈值表评价特定决策规则,决策曲线评价预设阈值概率范围内的净获益。这三类结果回答的问题不同,不能互相替代。正式应用还需要明确目标人群、检测流程、验证设计和误判后果。

10.103.3 统计基础

10.103.3.1 ROC 曲线与 AUC

对阈值 \(c\),灵敏度和特异度分别为:

\[ \mathrm{Sensitivity}(c)=\frac{TP(c)}{TP(c)+FN(c)},\qquad \mathrm{Specificity}(c)=\frac{TN(c)}{TN(c)+FP(c)}. \]

ROC 曲线以 \(1-\mathrm{Specificity}\) 为横轴、\(\mathrm{Sensitivity}\) 为纵轴。AUC 可理解为随机抽取一名事件对象和一名非事件对象时,检测指标把事件对象排在更高风险位置的概率。AUC 为 0.5 表示接近随机排序,越接近 1 表示区分度越强。

判阳方向必须与阈值同时解释。“大于等于阈值”适合指标升高对应事件的情况;若指标降低对应事件,应选择“小于等于阈值”。方向错误会使阈值、灵敏度、特异度和后续效用解释全部反转。

10.103.3.2 部分 AUC

部分 AUC 只评价预先规定的特异度范围。例如将特异度范围设为 0.80–1.00,可聚焦于假阳性率较低的区域。部分 AUC 必须连同评价范围和是否标准化一起报告,不能与完整 AUC 直接作数值比较。

10.103.3.3 阈值优化

Youden 指数为:

\[ J(c)=\mathrm{Sensitivity}(c)+\mathrm{Specificity}(c)-1. \]

最大化 Youden 指数对灵敏度和特异度赋予相同权重。模块还支持准确率、预测值、F1、Kappa、诊断优势比、误分类成本、总效用、ROC 理想点距离等目标,以及 LOESS、Bootstrap、核平滑、参数法、手动阈值、成本效益、灵敏度等于特异度和最接近理想点等阈值方法。

最优阈值取决于目标函数、患病率、成本设定和当前样本。不同方法得到不同阈值并不表示程序矛盾,而是说明研究问题和损失函数不同。

10.103.3.4 预测值和先验患病率

阳性预测值和阴性预测值受患病率影响。若当前样本是病例-对照抽样、富集队列或事件比例明显偏离目标人群,可启用“按人群先验患病率校正预测值”,但先验患病率必须来自可辩护的外部资料,并进行敏感性分析。

10.103.3.5 AUC 比较、IDI 与 NRI

同一批对象上的多个检测指标彼此相关,成对 AUC 比较用于检验相关曲线的 AUC 差值。它回答“总体排序区分度是否不同”,不能说明某个临床阈值一定更好。

IDI 概括新指标相对参照指标在事件与非事件平均预测分离度上的改善。NRI 根据预设风险阈值评价对象是否朝正确风险类别移动。两者依赖参照指标、风险尺度、阈值和模型校准;尤其是 NRI,阈值必须在分析前根据临床决策定义,不能事后搜索使结果最大的界值。

10.103.3.6 决策曲线与净获益

阈值概率 \(p_t\) 表示当预测风险达到何种程度时采取干预。标准净获益可写为:

\[ \mathrm{Net\ Benefit}(p_t)=\frac{TP}{N}-\frac{FP}{N}\frac{p_t}{1-p_t}. \]

决策曲线把检测策略与“全部干预”和“均不干预”进行比较。只有当检测策略在预先规定的临床阈值范围内获得更高净获益时,才说明它在该决策场景下可能有优势。曲线不能代替成本效果分析、临床试验或外部验证。

10.103.4 数据准备

建议在分析前完成以下检查:

  1. 每行代表一名独立研究对象;
  2. 金标准恰好有两个有效水平,并明确哪个水平为阳性事件;
  3. 检测指标均为连续数值型,单位、测量时间和判阳方向清楚;
  4. 所有候选指标来自同一批对象,便于使用配对比较;
  5. 检查极端值、检测下限、重复值和缺失模式;
  6. 记录事件数、非事件数和共同完整案例数;
  7. 预先规定主要指标、主要比较、阈值目标和多重比较处理;
  8. 若使用亚组,确认每个亚组内均有足够事件和非事件;
  9. 若使用 IDI/NRI,预先指定参照指标和风险阈值;
  10. 若使用决策曲线,预先规定有临床意义的阈值概率范围。

模块使用金标准、全部所选检测指标和亚组变量的共同完整案例。增加一个缺失较多的指标可能使所有曲线的分析样本同时减少,因此比较前必须先看概览表。

若检测指标是在当前数据中经过变量筛选、模型拟合或反复阈值优化后得到,AUC、最优阈值、IDI/NRI和净获益都会偏乐观。独立验证集必须固定指标计算方式、方向、阈值和决策规则后重新评价。

10.103.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “高级 ROC 与临床效用分析”

  1. 选择二分类金标准变量;
  2. 选择阳性事件水平;
  3. 选择 1–6 个连续检测指标;
  4. 如需分层展示,选择亚组变量;
  5. 选择基础临床、高级研究或综合统计分析层级;
  6. 根据用途选择自定义、筛查、确诊、平衡诊断或研究比较预设;
  7. 明确判阳方向和 ROC 曲线布局;
  8. 选择阈值方法、优化指标和并列阈值处理;
  9. 按需设置先验患病率、部分 AUC、平滑和 Bootstrap 区间;
  10. 如需固定灵敏度或特异度,启用固定目标并填写目标值;
  11. 如需比较指标,启用 AUC 比较、分类器综合比较、IDI/NRI、效应量或功效分析;
  12. 如需临床效用分析,设置阈值概率范围与伤害-获益比;
  13. 保留需要的表格和图形,全部展示项默认勾选;
  14. 点击“开始高级 ROC 与临床效用分析”;
  15. 依次核对分析概览、ROC 与阈值、模型比较、临床效用和统计图;
  16. 在下载页导出 Word 报告和结果 CSV。
高级 ROC 与临床效用分析:完整设置面板
高级 ROC 与临床效用分析:完整设置面板

10.103.6 分析概览

概览表列出金标准、事件与非事件水平、检测指标、亚组、原始样本、共同完整案例、事件数、分析层级、临床用途预设、判阳方向、阈值方法和优化指标。任何曲线或阈值解释都应从核对本表开始。

高级 ROC 与临床效用分析:分析概览
高级 ROC 与临床效用分析:分析概览

10.103.7 ROC 与阈值结果

一键自动生成以下结果:

1. AUC 与区间

报告每个指标的 AUC、标准误和置信区间。先看区间宽度,再解释点估计;AUC 显著高于 0.5 不等于达到临床可用水平。

2. 最优阈值与阈值表现表

报告阈值、判阳方向、灵敏度、特异度、预测值、似然比、准确率、F1、Youden 指数等。阈值必须和优化目标、方向及验证状态一起报告。

3. 固定灵敏度或特异度分析

当研究目标是“灵敏度至少达到 0.90”或“特异度至少达到 0.95”时,本表比单纯 Youden 阈值更贴近问题。结果同时给出达到目标时的实际灵敏度、特异度和预测值。

4. 部分 AUC 与 Bootstrap 区间

部分 AUC 聚焦预设特异度范围;Bootstrap 区间用于评价抽样不确定性。正式报告应说明范围、重复次数和随机方案。

高级 ROC 与临床效用分析:ROC 与阈值结果
高级 ROC 与临床效用分析:ROC 与阈值结果

10.103.8 模型比较结果

1. AUC 成对比较

报告两个相关 AUC 的差值、区间和检验结果。比较对象名称会直接显示在表中;多指标分析应预先指定主要比较并考虑多重比较。

2. 分类器综合表现比较

把 AUC、阈值分类表现和其他综合指标放在同一表中。不同指标可能在 AUC、灵敏度、特异度或预测值上各有优势,不应只按一个排序列选择“最佳”指标。

3. IDI 与 NRI

IDI 和 NRI 均相对于当前参照指标计算。先核对参照指标和 NRI 风险阈值,再解释方向、大小及 Bootstrap 区间;不建议只报告 P 值或百分比而省略阈值定义。

4. 效应量、功效与样本量

效应量比较用于量化事件组与非事件组的分离程度。观察功效是当前结果的函数,不应替代区间;前瞻功效和样本量依赖预期 AUC 差值、显著性水平及 ROC 相关性,应使用外部依据设定。

5. 先验加权 Bootstrap ROC

该结果把当前数据与预先指定的 AUC 和先验精度结合。先验必须在查看当前结果前确定,并通过不同先验设定进行敏感性分析。

高级 ROC 与临床效用分析:模型比较结果
高级 ROC 与临床效用分析:模型比较结果

10.103.9 临床效用结果

临床效用汇总概括各检测指标在指定阈值概率范围内的净获益表现。决策曲线数据表逐阈值列出检测策略、全部干预和均不干预的净获益,便于检查曲线是否只在极窄区间内占优。

解释时应先说明目标人群、干预是什么、阈值概率代表什么,以及误治和漏治的相对后果。若这些临床前提不明确,净获益曲线只能作为探索性结果。

高级 ROC 与临床效用分析:临床效用结果
高级 ROC 与临床效用分析:临床效用结果

10.103.10 生成的统计图

模块最多生成 7 幅统计图,图形尺寸由模块自动设置,左侧不需要宽高输入。

1. ROC 曲线:比较不同阈值下灵敏度和假阳性率;

2. AUC 区间图:比较点估计及其不确定性;

3. 阈值权衡图:显示灵敏度和特异度随阈值变化;

4. 预测值-患病率图:显示 PPV 和 NPV 对患病率的依赖;

5. 检测值分布图:检查事件组和非事件组的重叠、离群和方向;

6. 精确率-召回率曲线:在事件较少时补充评价阳性预测质量;

7. 决策曲线:比较检测策略、全部干预和均不干预的净获益。

高级 ROC 与临床效用分析:全部统计图
高级 ROC 与临床效用分析:全部统计图
高级 ROC 与临床效用分析:ROC 曲线
高级 ROC 与临床效用分析:ROC 曲线
高级 ROC 与临床效用分析:决策曲线
高级 ROC 与临床效用分析:决策曲线

10.103.11 结果解释顺序

  1. 核对金标准、阳性事件、判阳方向和共同完整案例;
  2. 报告事件数、非事件数和缺失排除数;
  3. 报告各指标 AUC 及区间,不只报告 P 值;
  4. 若比较多个指标,报告成对 AUC 差值及区间;
  5. 说明阈值方法、优化目标、判阳方向和阈值本身;
  6. 报告阈值对应的灵敏度、特异度、预测值和似然比;
  7. 若使用先验患病率,说明来源并报告敏感性分析;
  8. 若使用 IDI/NRI,明确参照指标、风险阈值和 Bootstrap 次数;
  9. 若使用决策曲线,说明临床阈值范围以及与两种默认策略的比较;
  10. 明确结果来自开发、内部验证还是独立外部验证。

10.103.12 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把金标准、阳性事件、检测指标、共同完整案例和当前结果主题作为背景,生成医学论文 Results 部分风格的客观初稿。

每幅图也提供中英文描述,以及 PNG、TIFF、SVG 和 PDF 下载。自动描述不会替代研究者对事件方向、阈值定义、患病率来源、模型比较和临床效用前提的核对。

10.103.13 Word 报告与 CSV 下载

“下载 Word 文档”导出当前勾选且成功生成的统计表、说明和图形;“下载分析结果 CSV”把分析概览、AUC、阈值、比较、重分类、功效和临床效用结果整合为结构化数据。

高级 ROC 与临床效用分析:Word 和 CSV 下载页
高级 ROC 与临床效用分析:Word 和 CSV 下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.103.14 从模块结果进入论文写作

Methods 建议说明:研究设计、对象来源、金标准和事件定义、检测指标单位与测量时间、判阳方向、缺失处理、AUC 和区间方法、阈值选择规则、成对比较、先验患病率来源、IDI/NRI 阈值、Bootstrap 次数、决策曲线阈值范围及验证设计。

Results 建议按“样本与完整案例 → AUC 与区间 → 指标比较 → 阈值及诊断表现 → 重分类 → 临床净获益”的顺序书写。

结果写作例子:共纳入 236 名共同完整案例,其中目标事件 88 例。指标 A 的 AUC 为 0.87(95% CI:0.82–0.91),高于指标 B 的 0.70(95% CI:0.63–0.77);配对 AUC 差值为 0.17(95% CI:0.XX–0.XX,P=0.XXX)。按预先指定的 Youden 准则,指标 A 的阈值为 0.XX,采用检测值大于等于该阈值判阳时,灵敏度为 0.XX、特异度为 0.XX。决策曲线显示,在阈值概率 0.XX–0.XX 范围内,指标 A 的净获益高于全部干预和均不干预策略。上述阈值和净获益来自当前数据,仍需在独立样本中验证。

例子中的数值必须替换为本研究结果。不要把 AUC 显著写成“临床效果显著”,不要把样本内最优阈值写成已验证界值,也不要把净获益曲线写成治疗有效性证据。

10.103.15 常见问题

1. AUC 很高,为什么决策曲线不一定更好?

AUC评价全阈值范围的排序区分度,净获益评价特定阈值概率下的决策后果。一个指标可能总体排序很好,但在实际临床阈值范围内误判代价仍然较高。

2. 应该选择哪个阈值方法?

由研究目的决定。筛查通常优先灵敏度,确诊通常优先特异度;成本或效用明确时可使用相应目标。Youden 适合平衡灵敏度和特异度的统计学参考,但不是通用临床标准。

3. 为什么增加一个指标后样本数变少?

模块使用全部所选变量的共同完整案例。新指标存在缺失时,所有曲线会在更小但相同的样本上重新分析,以保持配对比较的一致性。

4. 什么时候使用部分 AUC?

当研究只关心高特异度或高灵敏度区域时使用。范围必须预先规定,并与完整 AUC 分开报告。

5. IDI 和 NRI 显著是否说明新指标有临床价值?

不能单独说明。还需检查参照指标、风险尺度、阈值合理性、校准、区间、决策曲线和外部验证。事后选择 NRI 阈值会夸大结果。

6. Bootstrap 次数应该设多少?

快速检查可使用较少次数;正式报告应使用更充分的重复次数并固定随机种子。次数越多计算越慢,但区间和阈值稳定性通常更好。

7. 可以在病例-对照研究中报告 PPV 和 NPV 吗?

可以描述当前样本结果,但不能直接外推到目标人群。应优先使用目标人群患病率进行校正,并明确患病率来源和不确定性。

8. 亚组分析时为什么不进行 AUC 成对比较?

亚组会改变配对比较的数据结构和推断条件。模块优先保证各亚组 AUC 的稳定展示;需要正式检验亚组间 AUC 差异时,应使用预先规定的交互或专门比较模型。

9. 观察功效可以证明样本量足够吗?

不能。观察功效主要由当前效应和 P 值决定,信息量有限。研究设计应使用外部预期效应进行前瞻功效或样本量计算,并结合事件数与失访预留。

10. 决策曲线中哪条线最高就一定应该采用吗?

不一定。先确认阈值概率范围具有真实临床意义,再看优势是否持续且大小是否有实际意义,同时考虑模型校准、实施成本、检测伤害和外部验证。

10.103.16 小结

高级 ROC 与临床效用分析的可靠流程是:先固定金标准、阳性事件和判阳方向,在共同完整案例中评价 AUC 与区间,再按预先规定的筛查、确诊或成本目标选择阈值,随后使用配对比较、IDI/NRI和功效结果补充证据,最后在有临床含义的阈值概率范围内检查净获益,并在独立样本中验证阈值和决策规则。

本模块把区分度、阈值表现、模型比较和临床效用放在同一分析流程中,但不能替代独立验证、模型校准、成本效果评价或前瞻性临床研究。

10.104 肿瘤疗效瀑布图与蜘蛛图

10.104.1 模块功能

肿瘤疗效瀑布图与蜘蛛图模块用于回答:研究对象的肿瘤负荷较基线如何变化,客观缓解率和疾病控制率是多少,不同组别的疗效分布是否不同,以及每名患者的肿瘤负荷随时间如何变化?

模块同时提供:

  • 每名患者的基线后最佳肿瘤负荷变化;
  • CR、PR、SD 和 PD 的探索性分类及构成比;
  • 客观缓解率(Objective Response Rate, ORR)和疾病控制率(Disease Control Rate, DCR);
  • ORR 和 DCR 的 95% 置信区间;
  • 有时间信息时的疗效人时、至首次缓解时间和缓解持续时间;
  • 各组 ORR、DCR 及 Fisher 确切检验;
  • 患者级瀑布图和纵向蜘蛛图;
  • 中文/英文表格与图形描述、Word 报告和 CSV 结果下载。

方法边界:模块中的 CR、PR、SD 和 PD 为根据肿瘤负荷百分比变化生成的探索性简化分类。它不能识别新病灶、非靶病灶进展、影像学确认要求或独立评审中心的判定,不应替代正式 RECIST 1.1 疗效终点评定,也不用于监管申报结论。

10.104.2 适用场景

本模块适合以下场景:

  1. 早期肿瘤临床研究中探索患者级肿瘤负荷变化;
  2. 单臂研究中汇总 ORR、DCR 和疗效构成;
  3. 多组或多队列研究中比较探索性缓解率;
  4. 展示患者在多个访视时点的肿瘤负荷轨迹;
  5. 在正式影像学评审前进行数据质量检查、可视化和假设生成。

不适合用该模块单独完成:

  • 包含新病灶、非靶病灶和完整确认规则的正式 RECIST 1.1 判定;
  • 独立中心影像评审或监管级临床试验终点复现;
  • 存在明显删失时的正式缓解持续时间生存分析;
  • 用未随机分组的组间疗效率差异推断因果治疗效果。

10.104.3 数据准备

模块支持两种数据格式。

10.104.3.1 格式一:百分比变化

疗效数值已是相对基线的百分比变化:

\[ \text{变化百分比}=\frac{\text{随访值}-\text{基线值}}{\text{基线值}}\times 100\%. \]

负值表示肿瘤缩小,正值表示肿瘤增大。只有一个疗效值时,每名患者一行;需要蜘蛛图时,每名患者可以有多个时间点。

当同一患者存在多个时间点,并且同时提供时间变量时,模块会把时间为 0 的记录视为 0% 基线,只在时间大于 0 的随访记录中寻找最佳百分比变化;如果每名患者只有一条患者级最佳变化记录,则直接使用该值。

10.104.3.2 格式二:原始肿瘤测量

数据应为长格式,每行为一名患者在一个时间点的肿瘤负荷测量。每名患者必须:

  • 恰有一条时间为 0 的基线记录;
  • 至少有一条时间大于 0 的随访记录;
  • 基线测量为大于 0 的有限数值;
  • 患者 ID 在所有访视中保持一致。
变量角色 要求 说明
患者 ID 必选 唯一标识患者,可为字符或数值
疗效数值 必选 百分比变化或原始肿瘤测量,必须为数值型
时间变量 原始测量必选 建议用统一的天、周、月或年
分组变量 可选 用于分组着色和各组 ORR/DCR 汇总
疗效确认状态 可选 用于在图形上标记确认信息
持续治疗/持续缓解标志 可选 用于标识仍在持续的疗效或治疗
RECIST 分类覆盖 可选 使用已审核的 CR/PR/SD/PD 替换自动分类

数据质量建议:在分析前检查患者 ID 是否重复或拼写不一致、同一患者各访视的分组是否一致、时间单位是否混用,以及基线是否恰好标记为 0。

10.104.4 探索性 RECIST 分类

当未提供已审核的 RECIST 分类时,模块根据每名患者的基线后最佳百分比变化进行简化分类:

分类 百分比变化阈值 含义
CR \(\le -100\%\) 完全缓解
PR \(>-100\%\)\(\le -30\%\) 部分缓解
SD \(>-30\%\)\(\le 20\%\) 疾病稳定
PD \(>20\%\) 疾病进展

\[ \mathrm{ORR}=\frac{n_{CR}+n_{PR}}{N}, \qquad \mathrm{DCR}=\frac{n_{CR}+n_{PR}+n_{SD}}{N}. \]

这些阈值只使用肿瘤负荷变化。如果已有经过影像专家复核的疗效分类,应优先把该变量放入“RECIST 分类覆盖”。

10.104.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “肿瘤疗效与随访可视化” → “肿瘤疗效瀑布图与蜘蛛图”

  1. 选择患者 ID 和疗效数值;
  2. 如需生成蜘蛛图、人时或疗效时间结果,选择时间变量;
  3. 如需分组汇总或按组着色,选择分组变量;
  4. 根据数据实际含义选择“百分比变化”或“原始肿瘤测量”;
  5. 根据图形用途设置瀑布图排序、着色、参考线、中位数和异常变化标记;
  6. 选择蜘蛛图着色方式、配色和时间轴单位;
  7. 核对左侧结果输出项;默认已全部勾选;
  8. 点击“开始肿瘤疗效分析”。
肿瘤疗效分析:完整设置面板
肿瘤疗效分析:完整设置面板

10.104.6 生成的表格

模块根据当前数据和勾选项生成以下结果。某类结果缺少所需的时间或分组信息时,对应表格不会生成。

  1. 分析设置与样本概览:显示变量、数据类型、有效记录、排除记录、可评价患者和图形设置。
  2. RECIST 疗效分类:列出 CR、PR、SD 和 PD 的人数及比例。
  3. 临床疗效指标:汇总 ORR、DCR、可评价患者和可用的时间指标。
  4. ORR 与 DCR 精确区间:给出二项比例及 95% 置信区间。
  5. 疗效人时分析:按疗效分类列出患者数、人时和中位疗效时间。
  6. 至缓解与缓解持续时间:描述至首次 PR 或更佳疗效的时间和未校正删失的持续时间。
  7. 患者级最佳疗效:显示每名患者的基线后最佳百分比变化、疗效分类和组别。
  8. 分组 ORR 与 DCR:列出各组患者数、疗效率及区间。
  9. 分组疗效率检验:使用 Fisher 确切检验探索各组 ORR 和 DCR 是否存在差异。
肿瘤疗效分析:分析概览
肿瘤疗效分析:分析概览
肿瘤疗效分析:临床疗效结果
肿瘤疗效分析:临床疗效结果
肿瘤疗效分析:分组疗效结果
肿瘤疗效分析:分组疗效结果

10.104.7 生成的统计图

10.104.7.1 肿瘤疗效瀑布图

每根柱代表一名患者的基线后最佳肿瘤负荷变化。图中的 \(-30\%\)\(+20\%\) 参考线帮助识别 PR 和 PD 的简化阈值。应同时观察:

  • 缩小程度的整体分布;
  • 达到 \(-30\%\) 的患者比例;
  • 明显进展或异常变化的患者;
  • 不同组别的患者是否均匀分布。
肿瘤疗效瀑布图
肿瘤疗效瀑布图

10.104.7.2 肿瘤负荷变化蜘蛛图

每条线代表一名患者的纵向轨迹。蜘蛛图适合观察缩小速度、缓解稳定性、后续反弹或进展、以及组内异质性。线条较多时,不宜根据单个患者轨迹做总体推断。

肿瘤负荷变化蜘蛛图
肿瘤负荷变化蜘蛛图

10.104.8 结果解释顺序

建议按以下顺序阅读:

  1. 数据结构:确认输入类型、时间单位、有效记录和可评价患者数;
  2. 疗效分布:先看 CR/PR/SD/PD 人数和患者级最佳变化;
  3. 疗效率与不确定性:同时报告 ORR、DCR 及 95% 置信区间;
  4. 分组结果:结合各组样本量、区间宽度和 Fisher 检验,不只看 P 值;
  5. 图形结构:用瀑布图看横断面分布,用蜘蛛图看纵向轨迹;
  6. 方法边界:明确自动分类不等于完整 RECIST 评审,时间结果也不替代正式生存分析。

10.104.9 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把疗效数值、输入类型、可评价患者数和当前结果主题作为背景,生成医学论文 Results 部分风格的客观初稿。

两张图形也提供中英文描述和多种格式下载。自动描述不会把探索性分类写成正式 RECIST 独立影像评审,也不会将组间差异写成因果治疗效果。

10.104.10 Word 报告与 CSV 下载

“下载 Word 文档”会导出当前成功生成的统计表、说明和两张图;“下载分析结果 CSV”会把各结果表整合为结构化数据。

肿瘤疗效分析:Word 和 CSV 下载页
肿瘤疗效分析:Word 和 CSV 下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.104.11 从模块结果进入论文写作

Methods 建议说明:研究设计、对象来源、影像评估时点、肿瘤负荷定义、基线和随访时间单位、可评价患者定义、RECIST 分类来源、ORR/DCR 定义、置信区间和组间检验。

Results 建议按“可评价患者 → 疗效构成 → ORR/DCR 与区间 → 分组结果 → 瀑布图 → 纵向轨迹”的顺序书写。

结果写作例子:共有 120 例患者纳入疗效分析。经审核的最佳总体疗效为 CR 4 例、PR 38 例、SD 51 例和 PD 27 例。ORR 为 35.0% (95% CI:XX.X%–XX.X%),DCR 为 77.5% (95% CI:XX.X%–XX.X%)。瀑布图显示患者最佳肿瘤负荷变化存在明显异质性;蜘蛛图显示部分患者缩小持续,部分患者在早期缩小后出现反弹。该分析为探索性可视化,不替代完整的独立影像学疗效评审。

例子中的数值必须替换为本研究的实际结果。不要把自动分类写成监管级 RECIST 评审,不要把未随机分组的 ORR 差异写成治疗因果效应,也不要把未校正删失的持续时间当作正式 Kaplan–Meier 估计。

10.104.12 常见问题

1. 百分比变化和原始肿瘤测量怎么选?

如果数据已经是相对基线的变化百分比,选“百分比变化”;如果数据保存的是每次访视的原始肿瘤负荷,选“原始肿瘤测量”。不能把原始尺寸误当百分比。

2. 为什么原始测量要求每名患者恰有一条 0 时点?

基线是计算后续百分比变化的分母。没有基线无法计算,多条基线则会使对应关系不唯一。如需合并多个靶病灶,应先按研究方案得到每名患者每个时点的总负荷。

3. 为什么有时不生成疗效人时表?

疗效人时表需要时间信息,且在原始测量长格式中最有意义。单个疗效百分比无法提供完整人时。

4. ORR 和 DCR 为什么要同时报告置信区间?

疗效率是样本估计。小样本中点估计可能波动很大,区间能显示不确定性。不应只报一个百分比。

5. 可以用分组 Fisher 检验证明两种治疗一样吗?

不可以。P 值不显著不等于疗效等同。应结合研究设计、各组样本量、疗效率差值、置信区间以及预先规定的优效、非劣效或等效框架。

6. 有 RECIST 审核结果时还要用自动分类吗?

不建议。应将已审核的 CR/PR/SD/PD 变量放入“RECIST 分类覆盖”,使疗效率、分组比较和图形着色使用审核结果。

7. 蜘蛛图线条很多怎么办?

可以按疗效状态或患者组别着色,并把图形作为总体轨迹的探索性附图。患者数很多时,可预先分层作图,但应防止事后挑选局部轨迹。

8. 缓解持续时间能否直接写成中位 DOR?

当存在删失、失访、死亡或未进展患者时,不应把未校正删失的简单中位数当作正式 DOR 估计。应在预先定义事件和删失规则后使用生存分析。

10.104.13 小结

肿瘤疗效瀑布图与蜘蛛图的可靠流程是:先整理患者级基线和随访长格式,明确数值是百分比变化还是原始测量,再核对可评价患者和 RECIST 分类来源,同时报告 ORR/DCR 与区间,用瀑布图展示最佳变化、用蜘蛛图展示纵向轨迹,最后明确探索性分类和时间结果的局限。

本模块把患者级可视化、疗效率、置信区间和分组比较放在同一流程中,但不替代完整 RECIST 1.1 判定、独立影像评审、正式删失时间分析或前瞻性临床试验设计。

10.105 患者随访泳道图

10.105.1 模块功能

患者随访泳道图模块用于回答:每名患者从进入观察到末次随访或事件经历了多长时间,治疗、疗效评估、疾病进展等关键节点何时发生,持续随访患者如何分布,以及不同疗效状态或组别的随访结构是否存在差异?

模块同时提供:

  • 患者级开始、结束、随访时间和人时;
  • 按疗效状态汇总的患者数、总随访时间和平均随访时间;
  • 中位随访、四分位距、总人时和随访密度;
  • 数据允许时的 ORR、DCR 及 95% 置信区间;
  • 分组疗效率的探索性 Fisher 确切检验;
  • 最多 5 类临床里程碑及其数量、中位时间和范围;
  • 额外事件标记的数量、构成比和中位时间;
  • 数值时间或日期时间模式的患者随访泳道图;
  • 中文/英文表格与图形描述、Word 报告和 CSV 结果下载。

方法边界:泳道图是患者级时间线可视化。图中的横线、箭头和事件标记不能替代 Kaplan-Meier、竞争风险、复发事件或多状态模型;未调整的组间疗效率检验也不能证明治疗因果效果。

10.105.2 适用场景

本模块适合以下场景:

  1. 肿瘤临床研究中展示治疗和随访持续时间;
  2. 早期单臂试验中同时呈现缓解、进展和持续治疗;
  3. 多队列研究中按疗效状态或患者组别着色;
  4. 核对手术、首次给药、疗效评估、进展和末次随访的时序;
  5. 在正式生存分析前检查患者级时间数据和异常时间点。

不适合用该模块单独完成:

  • 估计中位总生存期、无进展生存期或正式缓解持续时间;
  • 处理时间依赖暴露、复发事件、竞争风险或多状态转移;
  • 在未随机、未调整的观察性数据中比较治疗效果;
  • 根据图形外观选择性报告患者或时间窗。

10.105.3 数据准备

推荐每名患者一行,每列对应患者 ID、随访起止时间、疗效状态、删失/事件状态、组别和临床节点。开始和结束时间必须采用相同口径。

变量角色 要求 说明
患者 ID 必选 唯一标识患者,建议每名患者一行
开始时间 必选 数值时间或可解析日期
结束时间 必选 必须不早于开始时间
疗效/状态变量 可选 可使用 CR、PR、SD、PD 或其他状态
删失/事件状态 可选 用于区分持续随访和已发生事件
分组变量 可选 用于分组汇总和探索性比较
自定义排序变量 可选 用于保留预先规定的患者排序依据
临床里程碑 可选,最多 5 个 每个节点由名称和对应时间变量组成
事件类型与事件时间 可选,必须成对选择 用于在泳道上叠加额外事件标记

数据质量建议:分析前核对患者 ID 是否唯一、结束时间是否早于开始时间、日期格式是否混用、事件时间是否落在合理观察窗内,以及删失状态的编码是否与研究方案一致。

10.105.4 时间输入与随访指标

10.105.4.1 原始数值时间

开始和结束变量均为数值,例如入组后第 0 月和末次随访第 18 月。时间单位可选择天、周、月或年,但模块不会自动识别原始数值的实际单位,因此选择项必须与数据定义一致。

10.105.4.2 日期时间

开始和结束变量保存实际日期。模块支持年-月-日、月-日-年、日-月-年等 7 种日期顺序。应选择与原始数据完全一致的格式,不能把月和日互换。

相对时间把每名患者的开始点对齐到 0,便于比较持续时间;绝对时间保留实际日历日期,便于观察入组批次、治疗时点和研究历程。

每名患者的基本随访时间为:

\[ T_i=\mathrm{End}_i-\mathrm{Start}_i. \]

总人时为所有可评价患者随访时间之和:

\[ \mathrm{Person\ Time}=\sum_{i=1}^{N}T_i. \]

模块中的“每 100 时间单位患者密度”是描述性随访密度,不是事件发生率。若研究问题涉及事件率,应明确事件数、风险时间和重复事件处理方式,并使用相应模型。

10.105.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “肿瘤疗效与随访可视化” → “患者随访泳道图”

  1. 选择患者 ID、开始时间和结束时间;
  2. 按数据实际类型选择“原始数值”或“日期时间”;
  3. 日期时间模式下,选择与数据一致的日期格式;
  4. 设置时间单位和相对/绝对显示方式;
  5. 如有疗效、删失、分组或排序变量,放入对应位置;
  6. 输入最多 5 个里程碑名称,并选择各自的时间变量;
  7. 如需额外事件标记,同时选择事件类型和事件时间变量;
  8. 设置主题、配色、参考线和患者排序;
  9. 核对左侧结果输出项;默认已全部勾选;
  10. 点击“开始患者随访泳道图分析”。
患者随访泳道图:完整设置面板
患者随访泳道图:完整设置面板

10.105.6 图形设置

设置 含义 使用建议
图形主题 清爽浅色、深色或极简 浅色适合报告,深色适合屏幕展示,极简适合进一步排版
配色 MSTATA、色觉友好、高对比或黑白出版 投稿前应检查灰度打印和色觉可辨性
泳道粗细 横线宽度 患者较多时可适当减小
标记大小 里程碑和事件标记大小 应避免遮挡相邻患者泳道
参考线 无、中位随访、方案时点或自定义时点 应优先使用方案预设、具有临床含义的时点
患者排序 持续时间、患者 ID 或疗效状态 应在查看结果前确定,避免为突出个别患者而事后排序

绝对日期模式下,中位随访和方案时点不是单一日历日期,因此不绘制这两类参考线。需要日历参考线时,应选择“自定义时点”并输入实际日期。

10.105.7 生成的表格

模块根据当前数据和勾选项生成以下结果。某类结果缺少所需的疗效、分组、里程碑或事件信息时,对应表格不会生成。

  1. 分析设置与样本概览:显示变量、时间类型、单位、有效记录、排除记录和患者数。
  2. 患者时间线汇总:汇总患者数、总观测数、随访时间和疗效构成。
  3. 疗效分层人时分析:按疗效状态列出患者数、总随访、平均随访和描述性密度。
  4. 随访与临床疗效指标:报告中位随访、四分位距、总人时、ORR 和 DCR。
  5. 分组疗效率检验:使用 Fisher 确切检验探索当前样本中的组间差异。
  6. 临床里程碑汇总:报告各里程碑的事件数、中位时间和范围。
  7. 事件标记汇总:报告事件类型的数量、构成比和中位时间。
  8. 患者级随访时间线:列出患者的开始、结束、随访、人时、疗效、状态和组别。
患者随访泳道图:分析概览
患者随访泳道图:分析概览
患者随访泳道图:随访与疗效结果
患者随访泳道图:随访与疗效结果
患者随访泳道图:事件与里程碑结果
患者随访泳道图:事件与里程碑结果
患者随访泳道图:患者级时间线
患者随访泳道图:患者级时间线

10.105.8 泳道图解释

每根横线表示一名患者的观察或治疗持续时间。颜色优先表示疗效状态;未选择疗效变量时,可使用患者组别。持续随访患者的末端箭头表示观察仍在延续,不代表未来一定维持疗效。

里程碑和事件标记应结合图例解释。建议依次观察:

  1. 患者随访时间是否存在明显长短差异;
  2. 关键里程碑是否按临床预期顺序发生;
  3. 进展、末次随访或安全性事件是否集中在特定时段;
  4. 持续随访患者是否足以支持成熟的时间结局分析;
  5. 不同疗效状态或组别的图形差异是否可能由入组时间和随访成熟度造成。
患者随访泳道图
患者随访泳道图

10.105.9 结果解释顺序

建议按以下顺序阅读:

  1. 数据结构:确认时间输入类型、日期格式、有效记录和患者数;
  2. 随访成熟度:查看中位随访、四分位距、总人时和持续随访患者;
  3. 疗效构成:结合 CR、PR、SD、PD 人数以及 ORR/DCR 的区间;
  4. 事件时序:检查里程碑和额外事件的数量、中位时间和范围;
  5. 患者级图形:识别异常时序、极短随访和仍在持续的患者;
  6. 方法边界:把泳道图视为描述性可视化,再由正式时间结局模型完成推断。

10.105.10 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把时间口径、患者数、疗效、组别和当前表格主题作为背景,生成医学论文 Results 部分风格的客观初稿。

泳道图也提供中英文描述和多种格式下载。自动描述不会把箭头解释为确定的未来疗效,不会把未调整组间差异写成因果治疗效果,也不会把描述性随访时间写成生存概率。

10.105.11 Word 报告与 CSV 下载

“下载 Word 文档”会导出当前成功生成的统计表、说明和泳道图;“下载分析结果 CSV”会把各结果表整合为结构化数据。

患者随访泳道图:Word 和 CSV 下载页
患者随访泳道图:Word 和 CSV 下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.105.12 从模块结果进入论文写作

Methods 建议说明:研究设计、患者来源、时间起点、事件和删失定义、日期或数值时间口径、临床里程碑定义、疗效分类来源、ORR/DCR 定义、分组检验和随访截止日期。

Results 建议按“可评价患者 → 随访成熟度 → 疗效构成 → 关键事件时间 → 患者级图形”的顺序书写。

结果写作例子:共有 120 例患者纳入患者级随访分析,中位随访时间为 XX.X 月(四分位距:XX.X–XX.X 月),累计观察 XXXX.X 人月。至数据截止日,XX 例仍处于持续随访。客观缓解率为 XX.X%(95% CI:XX.X%–XX.X%),疾病控制率为 XX.X%(95% CI:XX.X%–XX.X%)。泳道图显示关键治疗与疗效评估节点总体符合预设时序,但患者间随访长度存在明显异质性。该图为描述性患者级时间线,不替代正式生存终点分析。

例子中的数值必须替换为本研究的实际结果。持续随访箭头不等于持续缓解;简单时间中位数不等于 Kaplan-Meier 中位生存期;未调整的分组 P 值也不能作为治疗因果结论。

10.105.13 常见问题

1. 应该选择原始数值还是日期时间?

如果数据是入组后第几天、第几周或第几月,选择“原始数值”;如果数据保存实际年月日,选择“日期时间”。两种模式下的开始和结束变量必须使用同一种口径。

2. 为什么切换日期时间后还要选择日期格式?

同一个字符串可能按年-月-日、月-日-年或日-月-年产生不同日期。格式必须与原始数据完全一致;含时分秒时应选择对应格式。

3. 相对时间和绝对时间有什么区别?

相对时间把患者起点对齐到 0,适合比较治疗后持续时间;绝对时间保留日历日期,适合展示实际入组和随访历程。

4. 为什么事件类型和事件时间必须同时选择?

图形需要知道“发生了什么”和“何时发生”。只选择其中一个无法把事件正确放到患者泳道上。

5. 为什么某些表格没有生成?

疗效、人时、分组检验、里程碑和事件表依赖相应变量。未选择所需变量或没有可评价记录时,模块只保留能够可靠生成的结果。

6. 每 100 时间单位患者密度是事件率吗?

不是。它只是患者数相对于累计观察时间的描述性指标,没有事件数作为分子,不能解释为发病率、进展率或风险率。

7. 箭头表示患者一定仍然有效吗?

不是。箭头只表示按当前删失/事件编码,该患者在数据截止时仍处于持续观察。疗效是否持续必须由疗效状态和后续评估共同判断。

8. 可以把泳道长度直接比较为治疗优劣吗?

不可以。泳道长度同时受入组时间、随访截止、失访、事件定义和删失影响。治疗比较应基于研究设计和正式时间结局模型。

9. 输入错误会不会使整个应用退出?

不会。时间类型不匹配、结束早于开始、事件变量未成对选择或有效患者过少时,错误会显示在当前模块内;修正后可在同一会话重新分析。

10.105.14 小结

患者随访泳道图的可靠流程是:先固定时间起点、随访截止、事件和删失定义,整理每名患者的开始、结束、疗效和临床节点,选择正确的时间类型与日期格式,再核对中位随访和总人时,用泳道图检查患者级时序和随访成熟度,最后使用与研究问题匹配的正式生存或事件模型完成推断。

本模块把患者级时间线、里程碑、事件、随访成熟度和探索性疗效汇总放在同一流程中,但不替代 Kaplan-Meier、Cox 回归、竞争风险、复发事件、多状态模型或前瞻性临床试验设计。

10.106 诊断试验 Meta 分析

10.106.1 模块功能

诊断试验 Meta 分析模块用于回答:多项独立研究对同一诊断试验的灵敏度和特异度估计如何联合,研究间差异有多大,汇总 ROC 结构怎样,研究层面协变量能否解释部分差异,以及结果是否存在小样本效应或漏斗图不对称?

模块同时提供:

  • 多项研究灵敏度和特异度的联合模型估计;
  • 合并阳性似然比、阴性似然比和诊断比值比;
  • 汇总 ROC 模型参数和 SROC 图;
  • 灵敏度与特异度的 Q、I² 和研究间方差;
  • 连续或分类研究层面协变量的 Meta 回归;
  • 漏斗图不对称检验与发表偏倚漏斗图;
  • 单项研究灵敏度、特异度和四格表汇总;
  • 灵敏度与特异度森林图;
  • 中文/英文表格与图形描述、Word 报告和 CSV 结果下载。

方法边界:诊断准确性 Meta 分析合并的是研究级四格表。模型不能自动修复原研究的偏倚、阈值差异、金标准不一致、病例谱差异或不恰当的排除标准。联合估计必须结合研究质量评价和临床适用性解释。

10.106.2 适用场景

本模块适合以下场景:

  1. 系统评价中合并同一检测方法的诊断准确性;
  2. 汇总影像、病理、生物标志物或算法的灵敏度和特异度;
  3. 比较研究间诊断表现并绘制 SROC;
  4. 探索年份、地区、阈值、检测平台或研究设计与准确性的关联;
  5. 在存在零格研究时进行预先规定的连续性校正敏感性分析。

不适合用该模块单独完成:

  • 只有一项研究或只有逐例数据的单研究诊断评价;
  • 没有可还原 TP、FP、FN、TN 的研究;
  • 同一受试者贡献多行但未处理研究内相关性的资料;
  • 直接比较不同目标疾病、不同金标准或临床用途完全不同的检测;
  • 用研究层面 Meta 回归代替个体受试者数据分析。

10.106.3 数据准备

推荐每项研究一行,至少包含研究标识和 TP、FP、FN、TN 五列。四格表定义必须在所有研究中一致。

金标准 检测阳性 检测阴性
患病 TP(真阳性) FN(假阴性)
非患病 FP(假阳性) TN(真阴性)
变量角色 要求 说明
研究标识 必选 每项研究唯一,不能重复或留空
TP 必选 患病且检测阳性,非负整数
FP 必选 非患病但检测阳性,非负整数
FN 必选 患病但检测阴性,非负整数
TN 必选 非患病且检测阴性,非负整数
Meta 回归协变量 可选 可为连续变量或至少两个水平的分类变量

每项研究必须同时包含至少一名患病者和一名非患病者:

\[ n_{D+}=TP+FN>0, \qquad n_{D-}=FP+TN>0. \]

数据质量建议:先核对疾病阳性方向、检测阳性方向、四格表总数与原文样本量是否一致;同一篇文献报告多个阈值时,应按方案预先规定一个阈值或使用能够处理多阈值相关性的专门模型,不能简单把每个阈值当成独立研究。

10.106.4 基本诊断指标

每项研究的灵敏度和特异度分别为:

\[ \mathrm{Sensitivity}=\frac{TP}{TP+FN}, \qquad \mathrm{Specificity}=\frac{TN}{TN+FP}. \]

阳性和阴性似然比分别为:

\[ LR^+=\frac{\mathrm{Sensitivity}}{1-\mathrm{Specificity}}, \qquad LR^-=\frac{1-\mathrm{Sensitivity}}{\mathrm{Specificity}}. \]

诊断比值比为:

\[ DOR=\frac{TP\times TN}{FP\times FN}=\frac{LR^+}{LR^-}. \]

灵敏度和特异度常因阈值变化而相关。模块使用联合模型同时处理两者,而不是把它们当成互不相关的两个普通比例分别合并。DOR 越大通常表示总体区分能力越强,但它不能说明误诊与漏诊的临床后果,也不能替代灵敏度和特异度本身。

10.106.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “诊断试验分析” → “诊断试验 Meta 分析”

  1. 选择唯一研究标识;
  2. 依次选择 TP、FP、FN 和 TN 计数变量;
  3. 如需探索研究层面差异,选择一个连续或分类 Meta 回归协变量;
  4. 核对联合模型、汇总 ROC、异质性、Meta 回归和发表偏倚分析开关;
  5. 设置置信水平和估计方法;
  6. 根据零格情况选择连续性校正,并预先规定主要方法;
  7. 选择图形配色;
  8. 核对左侧结果输出项;默认已全部勾选;
  9. 点击“开始诊断试验 Meta 分析”。
诊断试验 Meta 分析:完整设置面板
诊断试验 Meta 分析:完整设置面板

10.106.6 估计方法

方法 含义 使用建议
限制性最大似然 估计研究间方差时减少部分有限样本偏倚 推荐作为主要随机效应分析
最大似然 同时估计模型参数与方差 适合模型比较或预先规定的敏感性分析
矩估计 由样本矩估计研究间变异 计算直接,可作为稳健性检查
方差分量 基于方差分解估计研究间变异 可作为补充敏感性分析

主要分析应在查看结果前确定。研究数较少时,不同方差估计法可能给出明显不同的区间;此时应报告敏感性分析,而不是只选择最有利的方法。

10.106.7 零格校正

当某项研究的 TP、FP、FN 或 TN 为 0 时,似然比和 DOR 可能出现无穷或无法取对数。模块提供四种处理:

方法 处理方式 注意事项
不校正(模型处理) 尽量由联合模型直接处理 推荐先作为主要分析,需检查模型是否稳定
所有格加 0.5 对含零格研究的四格均加 0.5 简单但可能影响小样本研究
仅零格校正 只对零格加入校正值 对非零格影响较小,仍可能改变研究权重
研究特异经验校正 按研究结构使用自适应校正 适合敏感性分析,需清楚报告方法

连续性校正不是数据修复。正式报告应列出含零格研究数,并比较“不校正”和至少一种合理校正方法的结果是否一致。

10.106.8 生成的表格

模块根据当前勾选项生成以下结果:

  1. 分析设置与研究概览:列出变量、研究数、排除研究数、含零格研究数、患病者与非患病者总数、估计法和校正方法。
  2. 诊断准确性联合合并结果:报告合并灵敏度、特异度、阳性似然比、阴性似然比和 DOR 及区间。
  3. 汇总 ROC 模型参数:报告诊断准确性参数和研究间变异参数。
  4. 研究间异质性:分别给出灵敏度和特异度的 Q、自由度、P 值、I² 和 tau²。
  5. Meta 回归:报告协变量与灵敏度、特异度对数尺度结果的回归系数、标准误、Z 值和 P 值。
  6. 发表偏倚评估:报告漏斗图不对称检验及方向性解释。
  7. 单项研究诊断性能:列出每项研究灵敏度、特异度、四格表和样本量。
诊断试验 Meta 分析:研究概览
诊断试验 Meta 分析:研究概览
诊断试验 Meta 分析:联合合并结果
诊断试验 Meta 分析:联合合并结果
诊断试验 Meta 分析:异质性、Meta 回归和发表偏倚
诊断试验 Meta 分析:异质性、Meta 回归和发表偏倚
诊断试验 Meta 分析:单项研究结果
诊断试验 Meta 分析:单项研究结果

10.106.9 灵敏度与特异度森林图

森林图分面显示每项研究灵敏度、特异度及其置信区间,红色菱形表示联合估计。建议观察:

  1. 研究点估计是否集中在相近范围;
  2. 小样本研究的区间是否明显更宽;
  3. 灵敏度较高的研究是否同时具有较低特异度,提示阈值差异;
  4. 单项研究是否远离联合估计;
  5. 联合区间是否足以支持预设临床用途。
诊断试验 Meta 分析:灵敏度与特异度森林图
诊断试验 Meta 分析:灵敏度与特异度森林图

10.106.10 汇总 ROC 图

SROC 图横轴为假阳性率 \(1-\mathrm{Specificity}\),纵轴为灵敏度。每个点代表一项研究,曲线表示灵敏度与特异度的联合权衡,菱形表示联合点,阴影区域表示联合点附近的不确定性。

曲线靠近左上角通常表示更好的诊断区分能力,但临床解释仍取决于具体阈值、疾病严重性、漏诊和误诊后果。不能仅根据曲线外观选定临床阈值。

诊断试验 Meta 分析:汇总 ROC 图
诊断试验 Meta 分析:汇总 ROC 图

10.106.11 发表偏倚漏斗图

漏斗图根据研究诊断比值比和有效样本量展示小样本效应。回归线明显偏斜时可能提示不对称,但不对称还可能来自阈值、病例谱、研究质量、检测平台和真实异质性。

研究数较少时,漏斗图检验效能有限;即使 P 值不显著,也不能证明不存在发表偏倚。应结合检索完整性、注册平台、会议摘要、选择性结局报告和研究质量评价综合判断。

诊断试验 Meta 分析:发表偏倚漏斗图
诊断试验 Meta 分析:发表偏倚漏斗图

10.106.12 Meta 回归解释

Meta 回归使用研究层面协变量探索灵敏度和特异度差异。连续协变量的系数表示协变量每增加一个单位时相应对数尺度参数的变化;分类协变量的系数相对于参照水平解释。

解释时应注意:

  • 协变量必须在分析前定义并具有足够研究数;
  • 研究层面关联不能直接推断个体层面的效应修饰;
  • 同时尝试多个协变量会增加偶然发现;
  • 分类变量某些水平研究数过少时,系数可能不稳定;
  • 显著结果可能混杂于阈值、地区、年份、质量和人群差异。

Meta 回归更适合假设生成。除非研究数充足并有外部验证,否则不应把单个 P 值写成确定的异质性机制。

10.106.13 结果解释顺序

建议按以下顺序阅读:

  1. 研究结构:核对研究数、患病与非患病总数、排除记录和零格;
  2. 单项研究:检查四格表、灵敏度、特异度和异常研究;
  3. 联合估计:同时报告灵敏度、特异度、似然比和 DOR 及区间;
  4. 阈值权衡:结合森林图和 SROC 判断灵敏度与特异度的相关变化;
  5. 异质性:结合 I²、tau²、研究设计、阈值和人群差异;
  6. Meta 回归:只解释预先规定且数据支持的研究层面协变量;
  7. 发表偏倚:把漏斗图作为补充证据,而非单一判定;
  8. 临床适用性:回到目标人群、检测用途、误诊漏诊后果和研究质量。

10.106.14 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把研究数、患病与非患病总数、估计方法、置信水平和当前表格主题作为背景,生成医学论文 Results 部分风格的客观初稿。

三幅图也提供中英文描述以及 PNG、TIFF、SVG 和 PDF 下载。自动描述不会把研究层面 Meta 回归写成个体因果作用,不会把漏斗图不显著写成不存在发表偏倚,也不会绕过研究质量和阈值差异。

10.106.15 Word 报告与 CSV 下载

“下载 Word 文档”会导出当前成功生成的统计表、方法说明和图形;“下载分析结果 CSV”会把研究概览、联合估计、异质性、Meta 回归、发表偏倚和单项研究结果整合为结构化数据。

诊断试验 Meta 分析:Word 和 CSV 下载页
诊断试验 Meta 分析:Word 和 CSV 下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.106.16 从模块结果进入论文写作

Methods 建议说明:数据库与检索日期、纳入排除标准、目标疾病、目标检测、金标准、阈值处理、四格表提取、研究质量工具、联合模型、方差估计法、零格校正、置信水平、异质性、Meta 回归协变量、发表偏倚方法和敏感性分析。

Results 建议按“检索与纳入 → 研究特征和质量 → 单项研究范围 → 联合灵敏度/特异度 → 似然比与 DOR → SROC → 异质性 → Meta 回归 → 发表偏倚 → 敏感性分析”的顺序书写。

结果写作例子:共纳入 24 项诊断准确性研究,包括 XXXX 名患病者和 XXXX 名非患病者。联合灵敏度为 XX.X%(95% CI:XX.X%–XX.X%),联合特异度为 XX.X%(95% CI:XX.X%–XX.X%);阳性似然比为 X.XX(95% CI:X.XX–X.XX),阴性似然比为 0.XX(95% CI:0.XX–0.XX),诊断比值比为 XX.X(95% CI:XX.X–XX.X)。森林图和 SROC 图显示研究间诊断表现存在差异。预先规定的 Meta 回归提示协变量 X 与特异度参数相关(P=0.XXX),但该结果为研究层面探索性发现。漏斗图不对称检验 P=0.XXX,结合研究数和异质性谨慎解释。

例子中的数值必须替换为本研究实际结果。不要把合并 DOR 写成临床获益,不要把高 AUC 或靠近左上角的 SROC 写成已经可用于临床,也不要根据未预设的 Meta 回归结果推断机制。

10.106.17 常见问题

1. 为什么不能分别用普通比例 Meta 合并灵敏度和特异度?

灵敏度和特异度通常受共同阈值影响并存在相关性。联合模型同时处理两者的研究内精度和研究间相关结构,更符合诊断准确性资料特点。

2. 每篇文章报告多个阈值,可以每个阈值放一行吗?

不能直接当作独立研究,因为同一批受试者产生的多个阈值结果相关。应预先选择临床阈值,或使用能够处理多阈值与研究内相关性的专门模型。

3. 有零格时应该选哪种校正?

先检查零格是否真实、方向是否正确。主要分析可优先尝试模型直接处理,再用 0.5、仅零格或研究特异校正做敏感性分析。若结论明显变化,应完整报告而不是只保留一种方法。

4. I² 很高是否说明 Meta 分析不能做?

不一定。诊断研究常因阈值、人群和设计差异出现异质性。应先确认研究是否仍回答同一临床问题,再用 SROC、分层、预设 Meta 回归和敏感性分析解释差异;不能只依据一个 I² 界值决定。

5. Meta 回归至少需要多少研究?

没有适用于所有情形的固定数字,但研究数越少、协变量水平越多,模型越不稳定。应限制协变量数量、避免稀疏水平,并把小样本 Meta 回归视为探索性结果。

6. 漏斗图检验不显著是否证明没有发表偏倚?

不能。检验可能因研究数少而缺乏效能,异质性也会改变图形。应结合检索策略、研究注册、灰色文献和选择性报告风险综合判断。

7. 合并灵敏度和特异度都很高,可以直接推荐临床使用吗?

不能。还需考虑研究质量、外部适用性、阈值可重复性、检测失败、资源成本、校准、误诊漏诊后果和前瞻性验证。

8. 为什么研究标识必须唯一?

模块假设每行是一项独立研究。重复标识通常表示重复录入、多个阈值或同一队列的多个亚组,需要先明确相关结构和分析单位。

9. 输入错误会不会使整个应用退出?

不会。变量重复、负数、非整数、研究数不足或模型失败时,错误会显示在当前模块内;修正后可在同一会话重新分析。

10.106.18 小结

诊断试验 Meta 分析的可靠流程是:先统一目标疾病、金标准、检测阳性方向和阈值口径,核对每项研究的四格表和研究质量,再使用联合模型同时合并灵敏度与特异度,结合森林图和 SROC 解释阈值权衡,以预先规定的 Meta 回归探索异质性,并通过零格、研究质量和估计法敏感性分析检验结论稳定性。

本模块把诊断准确性联合估计、异质性、研究层面协变量、发表偏倚和图形展示放在同一流程中,但不替代系统评价的规范检索、独立双人数据提取、研究质量评价、多阈值模型、个体受试者数据 Meta 分析或前瞻性临床验证。

10.107 信度系数 Meta 分析

10.107.1 模块功能

信度系数 Meta 分析模块用于回答:多项独立研究报告的 Cronbach’s alpha 如何合并,量表内部一致性在不同研究间是否稳定,单项研究对合并结果有多大影响,以及结果是否存在小样本效应或漏斗图不对称?

模块同时提供:

  • 原始 alpha、Hakstian-Whalen 变换和 Bonett 变换;
  • 随机效应与固定效应合并结果;
  • 合并 alpha、置信区间和随机效应预测区间;
  • tau、tau²、I²、H² 和 Q 检验;
  • 模型拟合指标;
  • 三种失效安全数、秩相关检验和回归不对称检验;
  • 单项研究 alpha、置信区间和模型权重;
  • 信度系数森林图、发表偏倚漏斗图和影响诊断图;
  • 中文/英文表格与图形描述、Word 报告和 CSV 结果下载。

方法边界:Cronbach’s alpha 反映特定样本、特定条目组合和特定测量条件下的内部一致性,不等同于量表单维性、效度、稳定性或测量质量的全部内容。高 alpha 也可能由条目重复、条目数较多或样本同质性造成。合并结果必须结合量表版本、语言、研究人群、施测情境和结构效度解释。

10.107.2 适用场景

本模块适合以下场景:

  1. 系统评价中汇总同一量表或同一分量表的内部一致性;
  2. 比较同一测量工具在不同地区、语言或临床人群中的信度范围;
  3. 评价多项验证研究中 alpha 的研究间异质性;
  4. 识别对合并信度影响较大的研究;
  5. 对不同效应变换和研究间方差估计方法进行敏感性分析。

不适合用该模块单独完成:

  • 只有受试者级原始条目数据、尚未在各样本中计算 alpha;
  • 将不同量表、不同分量表或条目集合明显不同的结果直接合并;
  • 同一研究报告多个相关 alpha,但把它们当成相互独立的研究;
  • 使用 alpha 证明单维性、结构效度或跨组测量等值性;
  • 用研究级合并结果替代重测信度、评分者信度、Omega 或广义信度分析。

10.107.3 数据准备

推荐每项独立研究一行,至少包含研究标识、Cronbach’s alpha、项目数和样本量四列。

变量角色 要求 说明
研究标识 必选 每项研究唯一,不能重复或留空
Cronbach’s alpha 必选 大于 0 且小于 1 的数值
项目数 必选 至少为 2 的整数,须与该 alpha 对应的条目集合一致
样本量 必选 至少为 4 的整数,须为计算该 alpha 的有效样本量

模块至少需要 5 项具有完整信息的研究。缺失研究会在分析前排除,并在研究概览中报告数量。

数据质量建议:在录入前逐篇核对 alpha 对应的是总量表还是分量表、条目是否反向计分、量表版本和语言是否一致、项目数是否变化、样本量是否为完整案例数。同一研究的多个分量表不能仅因来自同一篇文章就合并成一个 alpha。

10.107.4 为什么需要效应变换

alpha 的取值被限制在 0 到 1 之间,其抽样分布和方差会受到 alpha 水平、项目数与样本量影响。直接在原始尺度合并容易在接近边界时出现偏态,因此模块提供三种尺度:

效应变换 特点 使用建议
原始 alpha 直接在报告尺度建模,解释直观 适合主要结果展示,也便于与原研究对照
Hakstian-Whalen 变换 调整 alpha 的边界和抽样分布 适合作为主要或敏感性分析,最终结果反变换回 alpha 尺度
Bonett 变换 对 alpha 进行稳定化变换 适合检验结果对变换方法是否稳健,最终结果反变换回 alpha 尺度

使用变换方法时,表格同时保留模型尺度估计和反变换后的合并 alpha。论文正文应优先报告反变换后的 alpha、置信区间和预测区间,并在 Methods 中说明所用变换。

10.107.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “Meta 分析” → “信度系数 Meta 分析”

  1. 选择唯一研究标识;
  2. 选择 Cronbach’s alpha、项目数和样本量变量;
  3. 选择效应变换;
  4. 选择研究间方差估计方法和置信水平;
  5. 核对是否显示预测区间与研究权重;
  6. 选择失效安全数方法和森林图排序方式;
  7. 选择漏斗图纵轴、方向和置信轮廓;
  8. 核对左侧结果输出项;默认已全部勾选;
  9. 点击“开始信度系数 Meta 分析”。
信度系数 Meta 分析:完整设置面板
信度系数 Meta 分析:完整设置面板

10.107.6 模型与异质性估计

默认使用限制性最大似然随机效应模型。模块还提供多种研究间方差估计方法,以便按方案选择或进行敏感性分析。

方法 主要特点 使用建议
限制性最大似然 对研究间方差进行似然估计 推荐作为随机效应主要分析
DerSimonian-Laird 经典矩估计方法 计算直接,可作为敏感性分析
Hedges 基于矩的研究间方差估计 可用于方法稳健性比较
Hunter-Schmidt 经典方差校正思路 适合作为预先规定的补充方法
Sidik-Jonkman 对异质性采用不同的方差估计结构 异质性较大时可作敏感性分析
最大似然 用最大似然估计模型参数 适合模型比较或敏感性分析
经验贝叶斯 对研究间方差进行经验收缩估计 适合作为补充分析
Paule-Mandel 迭代矩估计 常用于检验方差估计结果是否稳健
固定效应 假定所有研究共享同一真实 alpha 仅在该假定有充分依据时使用,不提供随机效应预测区间

随机效应模型允许各研究的真实 alpha 存在差异。固定效应模型只估计当前纳入研究共同的单一效应,不能把其较窄区间理解为更可靠。正式分析应在查看结果前确定主要模型,并报告不同合理方法是否改变结论。

10.107.7 生成的表格

模块根据当前勾选项生成以下结果:

  1. 分析设置与研究概览:报告研究数、排除研究数、总样本量、alpha 范围、项目数范围、效应变换和模型;
  2. 信度系数合并结果:报告模型尺度估计、反变换后的合并 alpha、标准误、检验结果、置信区间和预测区间;
  3. 研究间异质性:报告 tau、tau²、tau² 标准误、I²、H²、Q、自由度和 P 值;
  4. 模型拟合指标:报告对数似然、离差、AIC、BIC 和 AICc;
  5. 发表偏倚与小样本效应:报告失效安全数、秩相关检验和回归不对称检验;
  6. 单项研究信度结果:列出每项研究的 alpha、项目数、样本量、模型尺度效应、标准误、区间和权重。
信度系数 Meta 分析:研究概览
信度系数 Meta 分析:研究概览
信度系数 Meta 分析:合并结果
信度系数 Meta 分析:合并结果
信度系数 Meta 分析:异质性、模型拟合和小样本效应
信度系数 Meta 分析:异质性、模型拟合和小样本效应
信度系数 Meta 分析:单项研究结果
信度系数 Meta 分析:单项研究结果

10.107.8 置信区间与预测区间

置信区间描述合并平均 alpha 的估计不确定性;预测区间描述在相似条件下开展一项新研究时,其真实 alpha 可能落入的范围。研究间异质性较大时,合并 alpha 的置信区间可能较窄,但预测区间仍会很宽。

因此,量表是否在不同场景中表现稳定,不能只看合并 alpha 是否超过某个经验界值。预测区间跨越多个解释区间时,应进一步检查量表版本、人群、项目数、语言、文化背景和施测方式。

10.107.9 异质性解释

异质性结果应联合解释:

  • tau²:变换模型尺度上的研究间方差;
  • tau:研究间标准差;
  • :总变异中可归因于研究间异质性的比例;
  • :观察到的总变异相对于抽样变异的比值;
  • Q 检验:检验所有研究共享同一真实效应的假设。

I² 很高不自动意味着不能合并,I² 较低也不证明研究完全同质。研究数较少时 Q 检验效能不足,研究数很多时微小差异也可能显著。应结合 tau²、预测区间、森林图和研究设计差异判断异质性的实际意义。

10.107.10 信度系数森林图

森林图显示每项研究 alpha 及其置信区间,红色菱形表示合并 alpha,右侧百分比表示当前模型权重;启用预测区间时,底部绿色线段显示随机效应预测范围。研究可按观察值、拟合值、精度、残差或绝对残差排序。

阅读时建议观察:

  1. 单项研究区间是否大量重叠;
  2. 是否存在 alpha 明显偏低或偏高的研究;
  3. 高权重研究是否主导合并结果;
  4. 预测区间是否覆盖实际关注的最低信度水平;
  5. 异常研究是否对应不同量表版本、人群或项目数。
信度系数 Meta 分析:森林图
信度系数 Meta 分析:森林图

10.107.11 发表偏倚漏斗图

漏斗图横轴为当前效应变换的模型尺度,纵轴可选择标准误、方差、样本量、样本量平方根或样本量对数。标准误纵轴下可显示 95% 置信轮廓。

图形不对称可能提示小样本效应,但也可能来自真实异质性、量表版本差异、样本构成、项目数、估计精度或研究质量差异。秩相关检验或回归不对称检验不显著,不能证明不存在发表偏倚;失效安全数也不能替代完整检索、研究注册和选择性报告风险评价。

信度系数 Meta 分析:发表偏倚漏斗图
信度系数 Meta 分析:发表偏倚漏斗图

10.107.12 单项研究影响诊断图

影响诊断图分面显示外部标准化残差、Cook 距离、帽子值和研究权重。它用于识别可能异常或对合并结果影响较大的研究:

  • 外部标准化残差绝对值较大,提示该研究与模型预期差异较大;
  • Cook 距离较大,提示删除该研究可能明显改变模型;
  • 帽子值较大,提示该研究在模型中具有较高杠杆;
  • 权重较大,表示该研究对合并平均值贡献较多。

影响诊断只是进一步核查的线索。不能仅因某个指标较大就删除研究;应先检查数据提取、量表版本、样本构成和研究质量,并报告预先规定的留一法或排除敏感性分析。

信度系数 Meta 分析:影响诊断图
信度系数 Meta 分析:影响诊断图

10.107.13 结果解释顺序

建议按以下顺序阅读:

  1. 研究结构:核对研究数、总样本量、项目数和 alpha 范围;
  2. 单项研究:检查异常 alpha、样本量、项目数和区间;
  3. 合并结果:报告反变换后的合并 alpha 与置信区间;
  4. 预测范围:判断新研究可能出现的真实 alpha 范围;
  5. 异质性:联合解释 tau²、I²、Q 和研究设计差异;
  6. 影响诊断:识别并核查高影响研究;
  7. 小样本效应:把漏斗图和统计检验作为补充证据;
  8. 敏感性分析:比较效应变换、方差估计方法和关键研究处理后的稳定性。

10.107.14 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把研究数、总样本量、效应变换、模型、置信水平和当前表格主题作为背景,生成医学论文 Results 部分风格的客观初稿。

三幅图也提供中英文描述以及 PNG、TIFF、SVG 和 PDF 下载。自动描述不会把 alpha 写成效度、不会把漏斗图不显著写成不存在发表偏倚,也不会根据影响指标自行排除研究。

10.107.15 Word 报告与 CSV 下载

“下载 Word 文档”会导出当前成功生成的统计表、方法说明和三幅图形;“下载分析结果 CSV”会把研究概览、合并结果、异质性、模型拟合、发表偏倚和单项研究结果整合为结构化数据。

信度系数 Meta 分析:Word 和 CSV 下载页
信度系数 Meta 分析:Word 和 CSV 下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.107.16 从模块结果进入论文写作

Methods 建议说明:检索数据库与日期、纳入排除标准、量表及版本、语言、人群、alpha 提取规则、同一研究多个结果的处理、效应变换、主要模型、研究间方差估计法、置信水平、预测区间、异质性指标、小样本效应方法和敏感性分析。

Results 建议按“检索与纳入 → 研究特征 → 单项 alpha 范围 → 合并 alpha 与置信区间 → 预测区间 → 异质性 → 影响诊断 → 小样本效应 → 敏感性分析”的顺序书写。

结果写作例子:共纳入 XX 项研究,总样本量为 XXXX,单项研究 Cronbach’s alpha 范围为 0.XX–0.XX。采用 XX 变换和限制性最大似然随机效应模型,反变换后的合并 alpha 为 0.XX(95% CI:0.XX–0.XX),95% 预测区间为 0.XX–0.XX。研究间异质性为 tau²=X.XXX、I²=XX.X%(Q=XX.XX,P=0.XXX)。影响诊断提示研究 X 对模型影响较大,但在预先规定的敏感性分析中排除该研究后结论未发生实质变化。漏斗图不对称检验 P=0.XXX,结合研究数、异质性和检索完整性谨慎解释。

例子中的数值必须替换为本研究实际结果。不要把合并 alpha 写成量表已经具有良好效度或单维性,也不要仅根据常用经验阈值给出脱离研究场景的“合格/不合格”结论。

10.107.17 常见问题

1. alpha 超过 0.70 就一定说明量表好吗?

不能。0.70 是常见经验参考而非普遍适用的质量界线。alpha 受项目数、条目相关、样本构成和测量目的影响,还需结合结构效度、内容效度、重测信度和测量误差。

2. 总量表和各分量表的 alpha 可以一起合并吗?

通常不可以。它们对应不同条目集合和测量构念,应分别分析。只有在构念、项目集合和计分规则具有充分可比性时才考虑合并。

3. 同一研究报告多个亚组 alpha,可以每个亚组放一行吗?

不能直接视为独立研究。若亚组互不重叠且方案明确,可在说明分析单位后分别录入;若共享受试者或同一量表有多个相关结果,需要处理相关性或预先选择一个结果。

4. 应选原始 alpha 还是变换后的模型?

建议预先规定一种主要方法,并用其他合理变换做敏感性分析。若 alpha 接近边界或研究精度差异明显,稳定化变换通常更合适;最终解释仍使用反变换后的 alpha。

5. I² 很高是否说明量表不能使用?

不一定。高 I² 表示研究间结果差异超过抽样误差所能解释的程度,应检查人群、语言、版本、项目数和施测情境。它不能直接转化为量表可用性结论。

6. 固定效应模型的区间更窄,是否应优先使用?

不应仅因区间更窄而选择。固定效应模型要求所有研究共享同一真实 alpha;当研究场景存在实际差异时,这一假设通常过强。

7. 漏斗图或检验不显著是否证明没有发表偏倚?

不能。研究数少时检验效能有限,真实异质性也会造成或掩盖不对称。应结合检索策略、注册信息和选择性报告风险评价。

8. 影响诊断提示某项研究异常,是否应删除?

不能自动删除。先核对数据和研究设计,再根据预先规定的标准进行敏感性分析,并同时报告包含与排除该研究的结果。

9. 为什么项目数和样本量是必填项?

alpha 的抽样方差与项目数和样本量有关。缺少这些信息就无法为每项研究建立合理的精度和权重。

10. 输入错误会不会使整个应用退出?

不会。变量重复、alpha 越界、项目数或样本量不合法、研究数不足或模型失败时,错误会显示在当前模块内;修正后可在同一会话重新分析。

10.107.18 小结

信度系数 Meta 分析的可靠流程是:先统一量表版本、构念、条目集合和分析单位,逐项核对 alpha、项目数和样本量,再预先规定效应变换与随机效应方法,联合解释合并 alpha、预测区间和异质性,用影响诊断核查异常研究,并通过变换、方差估计和研究排除敏感性分析评价结论稳定性。

本模块把信度系数合并、异质性、模型拟合、小样本效应和影响诊断放在同一流程中,但不替代原始条目级信度分析、Omega、结构效度、测量等值性、研究质量评价或规范的系统评价流程。

10.108 标志物取样异质性分析

10.108.1 模块功能

标志物取样异质性分析模块用于回答:同一病例不同取样区域的标志物测量是否具有足够重复性,局部取样能否代表全切片参考测量,是否存在系统偏倚,病例内变异来自哪些层面,以及不同空间区室的测量分布是否一致?

模块同时提供:

  • 全切片参考与多个区域测量的相关和一致性评价;
  • 区域平均值相对参考测量的系统偏倚分析;
  • 病例内变异系数及当前可接受阈值比较;
  • 病例间、病例内和区域位置变异的描述性分解;
  • 参考相关检验的近似功效和样本量情景;
  • 空间区室的均值、CV、ICC、偏倚和差异检验;
  • 区域测量分布图、病例内取样变异图和空间异质性图;
  • 中文/英文表格与图形描述、Word 报告和 CSV 结果下载。

方法边界:相关反映病例排序是否相近,ICC 反映测量值的一致性,系统偏倚反映区域测量相对参考测量的平均偏移,CV 反映相对于均值的离散程度。这些指标回答的问题不同,不能用高相关替代一致性,也不能仅根据一个经验阈值断定某种取样方案具有临床可替代性。

10.108.2 适用场景

本模块适合以下场景:

  1. 比较针吸、穿刺、组织芯或多个视野与全切片测量的一致性;
  2. 评价同一病例多个肿瘤区域的标志物表达异质性;
  3. 比较肿瘤中心、浸润前沿、边缘等空间区室;
  4. 评估局部取样是否存在相对全切片的系统偏高或偏低;
  5. 为后续取样数量、病例数和空间分层方案提供探索性依据。

不适合用该模块单独完成:

  • 不同病例的测量被误当成同一病例的重复区域;
  • 各区域使用不同抗体、平台、计量单位或评分标准;
  • 只包含一个区域且没有全切片参考测量;
  • 用观察性区室差异直接推断生物学机制或因果关系;
  • 用近似功效结果替代针对主要终点和正式设计的样本量计算;
  • 用相关或 ICC 自动证明局部取样在临床上可替代全切片。

10.108.3 数据准备

推荐每名病例一行,每个测量位置一列。所有参考与区域变量必须对应同一标志物、相同单位和相同计量方向。

变量角色 要求 说明
全切片参考测量 可选 连续数值;作为局部区域代表性和系统偏倚的参考
区域测量 1 必选 连续数值;每行与同一病例的其他测量配对
区域测量 2 必选 连续数值;底层异质性结构至少需要两个区域测量
区域测量 3–4 可选 连续数值;用于提高对病例内和区域位置差异的描述能力
其他区域测量 可选、多选 用于纳入第 5 个及更多区域位置
空间区室 可选 分类变量;至少两个有效水平才能进行区室比较

至少需要 5 名具有区域测量的有效病例。仅当所有区域测量均缺失时,该病例才从分析中排除;不同结果表仍可能因配对完整性不同而使用不同的有效样本量。

数据质量建议:分析前核对病例行是否唯一、区域列是否对应固定位置、评分者和批次是否一致、缺失是否与病变大小或取样困难有关,以及空间区室是否在病例间具有可比定义。若不同区域来自不同实验批次,应先处理或记录批次效应。

10.108.4 操作步骤

顶部菜单选择 “按统计学分类模块” → “信度与一致性分析” → “标志物取样异质性分析”

  1. 选择全切片参考测量;没有参考时可选择“不使用”;
  2. 选择至少两个区域测量,并按需要加入更多区域;
  3. 如需比较空间位置,选择空间区室变量;
  4. 选择分析重点和取样策略;
  5. 设定可接受 CV 阈值与最低相关阈值;
  6. 核对区室比较、差异检验、变异来源分解和功效分析开关;
  7. 核对左侧结果输出项;默认已全部勾选;
  8. 点击“开始标志物取样异质性分析”。
标志物取样异质性分析:完整设置面板
标志物取样异质性分析:完整设置面板

10.108.5 分析重点与取样策略

模块提供四种分析重点:

分析重点 主要问题 数据要求与建议
重复性 多个测量位置能否给出相近排序和一致数值 至少两个区域;有参考时可同时评价区域代表性
系统偏倚 区域平均值是否持续高于或低于参考测量 需要全切片参考测量
变异性 病例内取样离散程度及变异来源 至少两个区域测量
综合分析 同时评价重复性、偏倚、变异和空间区室 推荐至少两个区域,并尽量提供参考测量

取样策略用于记录研究设计背景,包括随机、系统、分层和未知。它不会把非随机数据自动变成随机样本,但会进入结果概览和解释背景。若选择“未知”,正式报告中应说明区域如何获得以及其代表性限制。

10.108.6 阈值设置

可接受 CV 阈值用于在病例内取样变异图和空间异质性图中标记当前研究预先规定的可接受范围,可设置为 5%–50%。最低相关阈值用于解释区域与参考或区域间相关是否达到研究预设要求,可设置为 0.50–0.99。

阈值应在查看结果前根据测量误差、标志物动态范围、临床用途和既有验证研究确定。不能为了使当前结果“通过”而事后移动阈值,也不能把 CV 或相关阈值直接当作普遍适用的监管标准。

10.108.7 生成的表格

模块根据数据结构和当前勾选项生成以下结果:

  1. 分析设置与病例概览:报告参考与区域变量、病例数、排除数、区域数、空间区室、分析重点、取样策略和阈值;
  2. 重复性与代表性:报告区域-参考相关、ICC、区域间相关和平均病例内 CV;
  3. 系统偏倚:报告区域平均值及各区域相对参考测量的均值差、P 值、效应量和相对偏倚;
  4. 变异来源分解:描述病例间、病例内取样和区域位置变异及其占比;
  5. 功效与样本量评估:报告观察相关及小、中、大相关情景下的近似功效和目标样本量;
  6. 空间区室汇总:按区室报告病例数、平均标志物值、CV 和异质性等级;
  7. 空间区室指标比较:比较区室的 ICC、CV 和偏倚;
  8. 空间区室差异检验:报告区室间 CV 方差和标志物分布的检验结果。
标志物取样异质性分析:病例概览
标志物取样异质性分析:病例概览
标志物取样异质性分析:重复性与系统偏倚
标志物取样异质性分析:重复性与系统偏倚
标志物取样异质性分析:变异来源与功效
标志物取样异质性分析:变异来源与功效
标志物取样异质性分析:空间区室结果
标志物取样异质性分析:空间区室结果

10.108.8 相关与 ICC 的区别

相关系数评价两个测量是否随病例同步升降。即使区域测量始终比参考测量高出固定数值,相关仍可能很高。ICC 同时受到病例间差异和测量位置差异影响,更接近绝对或条件一致性的评价。

因此建议同时报告:

  • 区域-参考相关及其区间;
  • ICC 及其区间;
  • 系统偏倚的方向和大小;
  • 病例内 CV 的分布;
  • 是否存在少数高异质性病例。

病例间差异很大时,ICC 可能较高,即使病例内差异仍具有实际意义。相反,样本高度同质时,ICC 可能偏低。解释时应结合标志物值范围和研究人群构成。

10.108.9 系统偏倚

系统偏倚表使用“区域测量减参考测量”的方向。平均差为正表示区域测量总体偏高,为负表示总体偏低。P 值回答平均差是否有统计学证据偏离 0,效应量和相对偏倚用于说明差异大小。

统计学不显著不等同于两种测量等效。若研究目的是证明可替代性,应预先规定临床可接受差异,并采用等效性、一致性界限或其他与用途匹配的方法。

10.108.10 变异来源分解与功效

变异来源表把总变异描述性地分为病例间差异、病例内取样差异和区域位置差异。该分解用于定位主要波动来源,但不等同于针对复杂嵌套设计拟合的正式随机效应模型。存在评分者、批次、中心或层级嵌套时,应使用专门的混合效应模型或概化理论分析。

功效表用于理解当前病例数对参考相关的检出能力,并给出不同相关效应情景下的近似目标样本量。它适合探索性规划,正式研究仍应根据主要参数、目标精度、预期缺失和多重终点重新计算。

10.108.11 区域测量分布图

区域测量分布图把全切片参考和各区域的箱线图与病例观测点并列显示。阅读时关注不同位置的中心、离散程度、极端值和整体偏移。

标志物取样异质性分析:区域测量分布图
标志物取样异质性分析:区域测量分布图

图形适合发现总体分布差异,但不能单独显示每名病例的配对方向。应与系统偏倚表、ICC 和病例内变异图联合解释。

10.108.12 病例内取样变异图

病例内取样变异图显示每名病例所有可用测量位置的 CV,虚线为当前设定阈值,平滑线用于呈现随病例序号变化的总体模式。超过阈值的病例提示局部取样差异较大,应结合原始切片、病灶大小、坏死、染色质量和取样位置核查。

标志物取样异质性分析:病例内取样变异图
标志物取样异质性分析:病例内取样变异图

病例序号本身没有时间或因果含义。平滑线仅用于视觉辅助,不能据此推断异质性随病例顺序变化。

10.108.13 空间异质性图

空间异质性图按区室显示平均标志物值,并用颜色标记相对于当前 CV 阈值的低、中、高变异等级。只有空间变量至少包含两个有效水平时才生成。

标志物取样异质性分析:空间异质性图
标志物取样异质性分析:空间异质性图

区室均值差可能同时受到病例构成、可用区域数和缺失模式影响。若同一病例在多个区室都有测量,应进一步使用能处理病例内相关性的配对或混合效应分析验证区室差异。

10.108.14 结果解释顺序

建议按以下顺序阅读:

  1. 数据结构:核对病例数、区域数、参考测量、缺失和空间区室;
  2. 分布与范围:检查不同测量位置是否在同一尺度并识别极端值;
  3. 排序关联:查看区域-参考和区域间相关;
  4. 测量一致性:结合 ICC 及其区间评价一致程度;
  5. 系统偏移:报告偏倚方向、大小和不确定性;
  6. 病例内异质性:查看 CV 分布及超过预设阈值的病例;
  7. 变异来源:判断主要波动来自病例间、病例内还是位置差异;
  8. 空间区室:在样本构成和配对结构背景下解释区室结果;
  9. 敏感性分析:改变合理阈值、区域组合或排除明显技术失败后检查稳定性。

10.108.15 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把病例数、区域数、参考测量、分析重点、取样策略和阈值作为背景,生成医学论文 Results 部分风格的客观初稿。

三幅图也提供中英文描述以及 PNG、TIFF、SVG 和 PDF 下载。自动描述会区分相关、ICC、CV 和系统偏倚,不会把相关写成一致性,也不会根据区室差异作因果或机制推断。

10.108.16 Word 报告与 CSV 下载

“下载 Word 文档”会导出当前成功生成的统计表、方法说明和统计图;“下载分析结果 CSV”会把病例概览、重复性、偏倚、变异、功效和空间区室结果整合为结构化数据。

标志物取样异质性分析:Word 和 CSV 下载页
标志物取样异质性分析:Word 和 CSV 下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.108.17 从模块结果进入论文写作

Methods 建议说明:病例来源、标志物与检测平台、评分尺度、全切片和区域定义、每例区域数、取样策略、评分者与盲法、缺失处理、预设 CV 和相关阈值、ICC 类型、系统偏倚方向、空间区室定义及敏感性分析。

Results 建议按“病例与测量结构 → 各位置分布 → 区域-参考相关 → ICC → 系统偏倚 → 病例内 CV → 变异来源 → 空间区室 → 敏感性分析”的顺序书写。

结果写作例子:共纳入 XX 名病例,每例获得 X–X 个区域测量,并以全切片测量作为参考。区域平均值与参考测量的相关为 r=0.XX(95% CI:0.XX–0.XX),全部测量位置的 ICC(3,1) 为 0.XX(95% CI:0.XX–0.XX)。区域平均值相对参考测量的平均差为 X.XX(P=0.XXX),相对偏倚为 X.X%。病例内 CV 中位水平为 X.X%,XX/XX 名病例超过预设的 XX% 阈值。描述性方差分解显示,病例间、病例内取样和区域位置分别占总变异的 XX.X%、XX.X% 和 XX.X%。

例子中的数值必须替换为本研究实际结果。不要把高相关写成局部取样已经可以替代全切片,也不要把统计学不显著写成两种测量等效。

10.108.18 常见问题

1. 为什么分析提示至少需要两个区域测量?

该分析需要估计病例内区域差异及区域间结构。只有一个区域时无法形成区域间比较,即使另有全切片参考也不满足底层异质性分析的区域结构要求,因此必须增加第二个区域测量。

2. 没有全切片参考测量还能分析吗?

可以评价多个区域之间的重复性和变异,但不能估计区域相对全切片的系统偏倚或参考相关。此时至少需要两个区域测量。

3. 相关很高但 ICC 较低,如何解释?

这通常表示病例排序相近,但测量位置之间存在固定偏移、尺度差异或病例内误差。应结合偏倚表、分布图和 CV 判断差异来源。

4. CV 越低一定越好吗?

CV 较低表示相对于均值的离散程度较小,但它受均值接近 0、量纲和测量下限影响。是否可接受应由研究用途和预设阈值决定。

5. 一个病例可以缺少部分区域吗?

可以。模块保留至少有一个区域测量的病例,但不同统计量可能基于不同的完整配对。缺失与病灶特征有关时,应报告缺失模式并进行敏感性分析。

6. 空间区室检验显著是否证明存在生物学机制?

不能。它只提示当前数据中的区室分布或变异不同,还可能受病例构成、取样位置、批次和缺失影响。机制需要独立设计与验证。

7. 方差分解能代替混合效应模型吗?

不能。当前分解用于描述主要变异来源。存在评分者、中心、批次或更复杂嵌套时,应使用线性混合效应模型或概化理论分析。

8. 近似功效表能直接用于研究方案吗?

不建议。它用于探索参考相关的检出能力。正式样本量还需考虑主要终点、目标精度、预期效应、缺失和多重比较。

9. 多个区域是否越多越好?

更多区域能更充分描述异质性,但也增加成本和缺失。应根据病灶大小、空间结构、测量误差和研究目标确定,并避免只在易取区域增加重复。

10. 输入或模型错误会不会使整个应用退出?

不会。变量重复、连续值无效、病例数不足、区域数不足、阈值越界或分析失败时,错误会显示在当前模块内;修正后可在同一会话重新分析。

10.108.19 小结

标志物取样异质性分析的可靠流程是:先保证每行对应同一病例、各区域使用相同标志物和尺度,再明确全切片参考、区域定义与取样策略,预先规定 CV 和相关阈值,联合解释相关、ICC、系统偏倚和病例内 CV,最后结合变异来源与空间区室结果评价取样代表性并进行敏感性分析。

本模块把重复性、系统偏倚、病例内变异和空间区室评价放在同一流程中,但不替代正式的临床可替代性验证、复杂混合效应建模、检测平台验证或生物学机制研究。

10.109 P 曲线与证据价值分析

10.109.1 模块功能

P 曲线与证据价值分析模块用于回答:一组达到统计学显著的独立研究结果是否呈现右偏,是否存在与真实效应相符的证据价值,显著结果的分布是否过于平坦,以及这些结果所反映的总体统计功效大致处于什么水平?

模块同时提供:

  • 效应量与标准误、相关系数与样本量两种输入方式;
  • 完整 P 曲线、半 P 曲线和二项检验;
  • 证据价值存在与证据价值不足的联合判据;
  • 总体统计功效及其区间估计;
  • 五个显著 P 值区间的观察分布与参考分布;
  • 每项研究的效应量、标准误、Z 值、双侧 P 值和纳入状态;
  • P 曲线分布图、中英文表格与图形描述、Word 报告和 CSV 结果下载。

方法边界:P 曲线只分析达到双侧 P<0.05 的结果,并通过这些显著 P 值的相对分布评价证据价值。它不能证明研究不存在发表偏倚、选择性报告、分析灵活性或数据质量问题,也不能把统计学证据自动转化为因果结论或临床有效性结论。

10.109.2 适用场景

本模块适合以下场景:

  1. 系统评价中已收集多项针对同一研究问题的独立检验结果;
  2. 希望评价显著结果是否更多集中在较小的 P 值区间;
  3. 希望把右偏检验、平坦度检验和功效估计作为传统发表偏倚评价的补充;
  4. 已知每项研究的效应量及标准误,或相关系数及样本量;
  5. 希望核对哪些研究实际进入 P 曲线以及其显著性位置。

不适合用该模块单独完成:

  • 把同一研究中的多个高度相关结局当成独立研究重复纳入;
  • 只分析不显著结果,或显著研究数量过少;
  • 混合完全不同的研究问题、效应方向或统计检验;
  • 用 P 曲线替代系统检索、研究质量评价和常规 Meta 分析;
  • 根据“存在证据价值”直接宣称干预具有因果作用或临床价值;
  • 根据“未形成明确结论”断定真实效应为零。

10.109.3 方法原理

若一组研究检验的原假设确实为零,条件于 P<0.05 后,显著 P 值在 0–0.05 范围内大致呈平坦分布。若存在真实效应并具有一定统计功效,较小的 P 值通常更常见,曲线表现为右偏,即靠近 0.01 的区间比例高于靠近 0.05 的区间。

模块同时评价:

  • 右偏检验:检验显著 P 值是否比零效应平坦分布更集中于较小区间;
  • 完整 P 曲线:使用所有达到 P<0.05 的结果;
  • 半 P 曲线:只使用达到 P<0.025 的结果,对接近显著性阈值的结果较不敏感;
  • 二项检验:比较较小与较大的显著 P 值所占比例;
  • 平坦度检验:评价观察分布是否缺少预期的右偏;
  • 功效估计:根据显著结果分布反推一组研究的平均统计功效及不确定性。

至少需要 3 项达到 P<0.05 的独立研究,并且至少 2 项达到 P<0.025,模块才会运行完整检验。样本接近最低数量时结果可能不稳定,应把检验值、图形形态和研究背景联合解释。

10.109.4 数据准备

推荐每项独立研究结果一行。研究标识必须能够区分研究,数值方向应统一,使正负号在所有研究中代表相同的效应方向。

输入方式一:效应量与标准误

变量角色 要求 说明
研究标识 必选 研究名称、第一作者与年份或唯一编号
效应量 必选 连续数值,可正可负;必须与标准误处于同一尺度
标准误 必选 严格大于 0 的连续数值

模块根据效应量除以标准误得到 Z 值,并计算双侧 P 值。

输入方式二:相关系数与样本量

变量角色 要求 说明
研究标识 必选 研究名称、第一作者与年份或唯一编号
相关系数 必选 必须严格位于 -1 与 1 之间
样本量 必选 每项研究的有效样本量,必须大于 3
相关系数尺度 必选 Fisher Z、原始相关系数或偏倚校正相关系数

数据质量建议:分析前确认效应方向一致、每行代表独立检验、标准误与样本量对应正确、同一研究没有因多个结局或多个时间点被重复计数,并记录未发表研究和不显著结果的检索情况。即使不显著结果不进入曲线,它们仍是判断选择性报告的重要背景。

10.109.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “Meta 分析” → “P 曲线与证据价值分析”

  1. 选择“效应量与标准误”或“相关系数与样本量”;
  2. 指定研究标识变量;
  3. 根据输入方式选择效应量与标准误,或相关系数与样本量;
  4. 使用相关系数输入时选择相关系数尺度;
  5. 核对左侧结果输出项;默认已全部勾选;
  6. 点击“开始 P 曲线分析”;
  7. 依次查看研究概览、证据价值检验、单项研究和 P 曲线图;
  8. 在下载页导出 Word 报告或结构化 CSV 结果。
P 曲线与证据价值分析:完整设置面板
P 曲线与证据价值分析:完整设置面板

10.109.6 输入尺度选择

如果已经获得同一尺度上的效应估计及标准误,优先使用“效应量与标准误”。该方式直接保留研究原来的检验尺度,适用于回归系数、均值差、对数效应量以及其他可由估计值与标准误构成 Z 检验的结果。

相关研究可选择“相关系数与样本量”:

相关系数尺度 含义 使用建议
Fisher Z 转换 对原始相关系数进行方差稳定化转换 默认推荐,尤其适合相关接近边界或样本量不一致时
原始相关系数 直接在相关系数尺度上形成效应与方差 便于保持原尺度,但大相关时正态近似可能较弱
偏倚校正相关系数 对小样本相关估计进行校正 可用于小样本敏感性分析

三种尺度可能产生不同的 Z 值和 P 值。正式分析应在查看结果前确定主尺度,并用其他合理尺度进行敏感性分析,而不应根据哪一种更容易得到显著结果来选择。

10.109.7 生成的表格

模块根据当前勾选项生成以下结果:

  1. 分析设置与研究概览:报告输入方式、原始和完整研究数、显著研究数、证据价值判据和综合判断;
  2. 证据价值检验:报告右偏和平坦度的二项检验、完整 P 曲线和半 P 曲线统计量;
  3. 统计功效估计:报告平均功效及其区间下限与上限;
  4. P 值区间分布:报告 0.01–0.05 五个区间的观察比例、33% 功效预期比例和零效应平坦比例;
  5. 单项研究显著性信息:报告效应量、标准误、Z 值、双侧 P 值及是否进入 P 曲线。
P 曲线与证据价值分析:研究概览与功效
P 曲线与证据价值分析:研究概览与功效
P 曲线与证据价值分析:证据价值检验与区间分布
P 曲线与证据价值分析:证据价值检验与区间分布
P 曲线与证据价值分析:单项研究显著性信息
P 曲线与证据价值分析:单项研究显著性信息

10.109.8 证据价值判据

阅读检验表时应先区分“存在证据价值”和“证据价值不足”两个问题。右偏检验显著,表示较小 P 值相对更集中,为真实效应提供统计学证据;平坦度检验达到相应判据,则提示当前显著结果缺少预期的右偏,可能体现较低功效或证据价值不足。

完整 P 曲线使用全部 P<0.05 的结果,信息较多,但也更容易受靠近 0.05 的结果影响。半 P 曲线只使用 P<0.025 的结果,通常更稳健,但研究数更少。建议:

  1. 同时报告完整与半 P 曲线;
  2. 核对两者方向是否一致;
  3. 研究数较少时避免仅按 P<0.05 二分结论;
  4. 检验冲突时结合曲线形态、研究质量和敏感性分析说明不确定性;
  5. 不把“没有检出平坦度”写成“已经排除选择性报告”。

10.109.9 功效估计

功效表根据显著结果的相对分布估计研究集合的平均统计功效。较高功效通常对应更多很小的 P 值,较低功效则使显著结果更接近 0.05。该估计受研究异质性、效应尺度、非独立结果和选择性纳入影响,因此应报告区间,而不是只报告单一点估计。

功效估计不等于每项研究各自的设计功效,也不能直接用于下一项研究的样本量。正式样本量应根据主要终点、目标效应、设计结构、方差和失访重新计算。

10.109.10 P 曲线分布图

P 曲线图比较三条曲线:

  • 观察分布:当前达到 P<0.05 的研究在五个区间中的实际比例;
  • 33% 功效预期:低至中等功效条件下的参考分布;
  • 零效应平坦分布:原假设为零时的平坦参考线。
P 曲线与证据价值分析:P 曲线分布图
P 曲线与证据价值分析:P 曲线分布图

观察曲线在靠近 0.01 的区间较高,并随 P 值增大总体下降,通常表现为右偏。若观察曲线接近平坦线,或大量结果聚集在 0.04–0.05,应谨慎评价证据价值,并检查研究选择、分析灵活性和结果独立性。图形用于展示分布形态,正式判断仍应结合完整 P 曲线、半 P 曲线和二项检验。

10.109.11 结果解释顺序

建议按以下顺序阅读:

  1. 研究独立性:确认每行确实代表一项独立检验;
  2. 输入完整性:核对原始研究数、完整研究数和排除数;
  3. 显著研究数量:查看 P<0.05 与 P<0.025 的研究数是否足够;
  4. 单项研究:核对效应方向、标准误、Z 值、P 值和纳入状态;
  5. 右偏检验:联合解释二项、完整和半 P 曲线;
  6. 平坦度检验:判断是否出现证据价值不足信号;
  7. 功效与图形:结合区间和曲线形态评价稳定性;
  8. 敏感性分析:排除重复结果、异常研究或改变合理相关尺度后核查结论;
  9. 外部证据:与常规 Meta 分析、漏斗图、研究质量和检索完整性共同报告。

10.109.12 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把完整研究数、显著研究数、输入尺度和结果类型作为背景,生成医学论文 Results 部分风格的客观初稿。

P 曲线图也提供中英文描述以及 PNG、TIFF、SVG 和 PDF 下载。自动描述会区分右偏、平坦度和功效参考分布,不会根据曲线单独宣称已排除发表偏倚,也不会添加机制或因果解释。

10.109.13 Word 报告与 CSV 下载

“下载 Word 文档”会导出当前成功生成的统计表、分析说明和 P 曲线图;“下载分析结果 CSV”会把当前勾选的结果表整合为结构化数据。

P 曲线与证据价值分析:Word 和 CSV 下载页
P 曲线与证据价值分析:Word 和 CSV 下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。若取消所有表格但保留图形,Word 仍会导出图形;若取消图形,Word 只导出当前勾选的统计表。

10.109.14 从模块结果进入论文写作

Methods 建议说明:研究问题与检索范围、每项研究所选检验、效应方向、结果独立性处理、输入尺度、双侧检验、显著研究数量、完整与半 P 曲线、平坦度检验、功效估计及敏感性分析。

Results 建议按“研究数量与输入完整性 → 显著结果数量 → 右偏检验 → 平坦度检验 → 功效估计 → 曲线形态 → 敏感性分析”的顺序书写。

结果写作例子:共纳入 XX 项完整研究结果,其中 XX 项达到双侧 P<0.05,XX 项达到 P<0.025。完整 P 曲线右偏检验为 Z=X.XX(P=0.XXX),半 P 曲线右偏检验为 Z=X.XX(P=0.XXX),二项检验 P=0.XXX。平坦度检验未提示/提示证据价值不足。基于显著结果分布估计的平均统计功效为 XX.X%(区间:XX.X%–XX.X%)。观察曲线在较小 P 值区间的比例高于/接近零效应平坦参考分布。

例子中的数值必须替换为本研究实际结果。不要把右偏写成因果效应已经得到证明,也不要把未检出平坦度写成不存在发表偏倚。

10.109.15 常见问题

1. 为什么提示达到 P<0.05 的研究不足 3 项?

完整 P 曲线至少需要 3 项显著研究。数量更少时无法形成稳定分布,应增加符合相同研究问题的独立研究,而不是重复纳入同一研究的多个结果。

2. 为什么还要求至少 2 项 P<0.025?

半 P 曲线只分析 P<0.025 的结果。少于 2 项时不能稳定完成半曲线检验,因此模块会在计算前提示。

3. 不显著研究为什么没有进入曲线?

P 曲线的方法对象就是条件于 P<0.05 的分布。不显著研究不会进入曲线,但其存在和检索完整性仍应在系统评价中报告,并用于评价选择性报告风险。

4. 同一研究有多个结局可以全部放入吗?

通常不可以直接作为独立行。高度相关的多个结局、时间点或模型会重复计算同一受试者信息。应预先规定一个主要检验,或采用能够处理依赖效应的专门方法。

5. 效应量可以是负数吗?

可以,但所有研究的方向必须统一。若负值表示有利方向,应确保每项研究都采用同一编码;混合方向会改变 Z 值和显著性解释。

6. 应选择哪一种相关系数尺度?

默认推荐 Fisher Z 转换。原始相关与偏倚校正尺度可用于敏感性分析。主尺度应根据研究方案和效应性质预先确定。

7. 右偏显著是否说明没有发表偏倚?

不能。右偏提示显著结果中存在证据价值,但发表偏倚、选择性结局报告和分析灵活性仍可能同时存在。

8. 平坦度检验不显著是否说明证据充分?

不能。检验不显著可能来自证据价值存在,也可能来自研究数少、检验功效不足或研究异质性。应联合解释右偏、曲线形态和区间。

9. 功效估计可以直接用于新研究样本量吗?

不建议。该估计概括当前显著研究集合,不包含新研究的具体设计、方差、失访和主要终点要求。

10. 输入或分析错误会不会使整个应用退出?

不会。变量重复、标准误或样本量无效、相关系数越界、显著研究不足或计算失败时,错误会显示在当前模块内;修正后可在同一会话重新分析。

10.109.16 小结

P 曲线与证据价值分析的可靠流程是:先定义统一的研究问题和独立检验,统一效应方向并核对输入尺度,再确认显著研究数量满足方法要求,联合解释完整 P 曲线、半 P 曲线、二项检验、平坦度和功效区间,最后结合常规 Meta 分析、研究质量、检索完整性和敏感性分析报告证据价值。

本模块把显著 P 值分布、证据价值判据和功效估计放在同一流程中,但不替代系统检索、偏倚风险评价、常规 Meta 分析、依赖效应处理或因果推断。

10.110 相关系数估计统计

10.110.1 模块功能

相关系数估计统计模块用于回答:两个连续变量之间的线性相关方向和强度如何,相关系数的估计不确定性有多大,该相关是否超出预先规定的可忽略区间,以及简单线性回归在指定 X 取值下给出怎样的均值与个体预测区间?

模块同时提供:

  • 原始数据与汇总数据两种分析入口;
  • Pearson 相关系数及 90%、95% 或 99% 置信区间;
  • 相关系数标准误和自由度;
  • 点零假设检验与区间零假设评估;
  • 简单线性回归的截距、斜率及置信区间;
  • 指定 X 取值下的均值预测区间和个体预测区间;
  • 相关系数估计图以及散点、回归线、置信带、预测带和残差图;
  • 中英文表格与图形描述、Word 报告和 CSV 结果下载。

方法边界:Pearson 相关描述两个连续变量的线性关联,不等于因果关系。显著相关不能证明 X 导致 Y;不显著也不能证明两者完全无关。离群值、非线性、范围受限、重复测量和混杂因素均可能改变相关系数。

10.110.2 适用场景

本模块适合以下场景:

  1. 两个变量均为连续数值,希望报告 Pearson r 及置信区间;
  2. 希望从估计量和区间出发评价相关强度,而不只报告 P 值;
  3. 已预先规定一个可忽略相关区间,希望区分可忽略、实质性和不明确结果;
  4. 希望查看原始散点形态、回归线、置信带和预测带;
  5. 只有相关系数和有效样本量,希望由汇总数据获得区间与假设评估;
  6. 希望在指定 X 取值下估计平均 Y 或单个未来观测的预测范围。

以下情况不宜直接把本模块作为最终分析:

  • 变量明显呈曲线关系而非线性关系;
  • 数据包含重复测量、配对簇、中心效应或其他层级结构;
  • 主要目标是控制协变量后的偏相关或多元回归效应;
  • 变量为有序分类、二分类或计数资料;
  • 散点图存在强影响点,但未进行数据核查和稳健性分析;
  • 根据同一批数据反复调整可忽略边界,直到得到期望结论。

10.110.3 方法原理

Pearson 相关系数 r 的范围为 -1 至 1。正值表示两个变量总体同向变化,负值表示总体反向变化,绝对值越大表示线性关系越强。r 接近 0 只说明线性相关较弱,不能排除非线性关系。

模块把点估计与置信区间同时报告。置信区间越窄,估计越精确;区间越宽,表示样本对总体相关的约束较弱。置信水平从 90% 提高到 99% 时,区间通常会变宽。

点零假设检验总体相关是否等于一个预先指定值,通常为 0。区间零假设则先规定可忽略相关范围,例如 (-0.10, 0.10),再比较相关系数区间与该范围:

  • 区间完全落在可忽略范围内:支持相关在预设标准下可忽略;
  • 区间完全位于可忽略范围之外:支持相关超过预设可忽略程度;
  • 两个区间发生重叠:当前数据不足以明确区分可忽略与实质性相关。

区间零假设边界必须由临床、测量或研究设计依据预先确定,不能把 0.10 当作适用于所有研究的固定标准。

10.110.4 数据准备

10.110.4.1 原始数据入口

每行对应一个独立观察对象,X 与 Y 分别放在两个连续数值变量中。模块只使用 X、Y 均完整且为有限数值的配对,并报告实际有效配对数。

变量角色 要求 说明
X 变量 必选 连续数值;作为散点横轴和回归自变量
Y 变量 必选 连续数值;作为散点纵轴和回归因变量

分析前应核对计量单位、极端值、录入错误、缺失机制、观察独立性和散点关系。若变量量纲很大或偏态明显,必要时先进行有研究依据的转换。

10.110.4.2 汇总数据入口

如果只有已经计算好的 Pearson r 和有效样本量 n,可选择“输入汇总数据”。相关系数必须严格位于 -1 与 1 之间,样本量必须大于 3。

汇总模式能够生成相关系数区间、估计图和假设评估,但没有原始观测,因此不能生成变量描述统计、散点图、简单线性回归或指定 X 取值的预测。

数据质量建议:优先保存并分析原始数据。汇总数据无法检查离群点、非线性、范围受限或异方差,也不能确认相关系数是否由同一批完整配对计算得到。

10.110.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “效应量与估计统计” → “相关系数估计统计”

  1. 选择“分析原始数据”或“输入汇总数据”;
  2. 原始数据模式下选择 X 变量和 Y 变量;汇总模式下填写 r、n 以及变量名称;
  3. 选择 90%、95% 或 99% 置信水平;
  4. 按需显示标准误、自由度以及 Fisher Z 尺度估计图;
  5. 如需回归,勾选简单线性回归及相应图形元素,并填写需要预测的 X 取值;
  6. 如需假设评估,填写点零假设相关系数和可忽略相关边界;
  7. 核对结果输出项目;默认已全部勾选;
  8. 点击“开始相关系数估计”;
  9. 依次查看分析概览、相关估计、回归与预测、假设评估和统计图;
  10. 在下载页导出 Word 报告或结构化 CSV 结果。
相关系数估计统计:完整设置面板
相关系数估计统计:完整设置面板

10.110.6 菜单选项说明

置信水平决定区间覆盖目标,可选 90%、95% 或 99%。正式报告应在查看结果前确定主要置信水平。

显示标准误和自由度会在相关结果中补充相关系数标准误、有效配对数和自由度,便于核查估计精度。

估计图使用 Fisher Z 尺度只改变相关估计图的横纵尺度表达,不改变原始 Pearson r 的报告值。相关接近边界时,该尺度更便于显示区间的不对称性。

进行简单线性回归以 X 预测 Y。回归线表示条件均值,均值置信带描述平均反应的不确定性,个体预测带描述单个未来观测的不确定性,后者通常更宽。

显示残差线段把每个观测点与拟合线之间的垂直距离画出,有助于发现异常残差和模型拟合问题。显示均值参考线标出 X 与 Y 的样本均值,在图中标注相关系数显示当前 r。

点零假设相关系数允许检验总体相关是否等于 0 或其他预设值。可忽略相关边界填写正数 b 后,对应区间为 (-b, b)。

10.110.7 分析概览与描述统计

分析概览首先核对数据入口、X 与 Y、有效配对数、置信水平、是否执行回归以及预设假设值。变量描述统计报告均值及区间、中位数及区间、标准差、范围、四分位数、有效数和缺失数。

相关系数估计统计:分析概览与变量描述统计
相关系数估计统计:分析概览与变量描述统计

示例数据中共有 86 个完整配对。Marker 均值为 4.9276,Outcome 均值为 5.8796。描述统计用于理解数据尺度与分布,但不能替代散点图对非线性和异常点的检查。

10.110.8 相关系数与置信区间

相关估计表报告 X、Y、Pearson r、区间下限、区间上限、标准误、有效配对数和自由度。

相关系数估计统计:相关系数与置信区间
相关系数估计统计:相关系数与置信区间

示例中 Marker 与 Outcome 的 Pearson r=0.6599,95% CI 0.5180–0.7632,有效配对数为 86。点估计提示中等至较强的正线性相关,区间下限仍为正值,表明总体正相关方向较稳定。该结果不说明 Marker 对 Outcome 存在因果作用。

10.110.9 简单线性回归与预测

简单线性回归表报告截距和斜率及其置信区间。指定 X 取值的预测表同时报告:

  • Y 预测值:给定 X 时的拟合条件均值;
  • 均值区间:该 X 水平下总体平均 Y 的置信区间;
  • 个体预测区间:该 X 水平下单个未来观测的预测区间。
相关系数估计统计:简单线性回归与指定 X 取值预测
相关系数估计统计:简单线性回归与指定 X 取值预测

示例回归的截距为 2.5131,斜率为 0.6832(95% CI 0.5144–0.8520)。当 X=0 时,Y 的预测值为 2.5131,均值区间为 1.6523–3.3740,个体预测区间为 0.2801–4.7462。由于 X=0 低于示例 Marker 的观察范围,正式解释时应避免把该预测作为可靠的样本外外推。

10.110.10 点零与区间零假设

点零假设表把预设相关值、置信区间、P 值、统计决策和结论放在同一行。区间零假设表则把可忽略区间与相关系数区间进行比较。

相关系数估计统计:点零假设与区间零假设
相关系数估计统计:点零假设与区间零假设

示例中点零假设为 r=0,P<0.0001,且 95% CI 不包含 0,因此拒绝点零假设。预设可忽略区间为 (-0.10, 0.10),相关区间完全位于该范围之外,因此在当前预设标准下,相关可判定为超过可忽略程度。

点零假设显著与区间零假设超出边界回答的是不同问题:前者关注是否与一个点值相容,后者关注相关是否大到超过预先定义的实际可忽略范围。建议同时报告点估计、置信区间和边界依据。

10.110.11 统计图

相关系数估计图同时显示点估计、置信区间、零相关参考线和可忽略区间。散点与回归诊断图显示原始配对、回归线、均值置信带、个体预测带、残差线段、均值参考线和相关系数标注。

相关系数估计统计:相关估计图与散点回归诊断图
相关系数估计统计:相关估计图与散点回归诊断图

阅读散点图时,应先检查关系是否大致线性,再看离群点、范围受限、异方差和局部聚集。置信带描述平均回归线的不确定性,预测带描述个体结果的不确定性,不能把较窄的均值置信带误解为每个个体都能被精确预测。

10.110.12 结果解释顺序

建议按以下顺序阅读:

  1. 数据入口和有效配对:确认变量、样本量和缺失处理正确;
  2. 散点形态:检查线性、离群点、范围受限和异方差;
  3. 描述统计:了解量纲、中心位置和离散程度;
  4. 相关点估计:说明方向和强度;
  5. 置信区间:评价精度以及与 0、可忽略边界的关系;
  6. 点零假设:报告预设值、P 值和区间是否包含该值;
  7. 区间零假设:说明边界依据以及结果为可忽略、实质性或不明确;
  8. 回归与预测:区分斜率、均值区间和个体预测区间;
  9. 敏感性分析:核查异常点、合理转换、亚组或替代模型下结论是否稳定;
  10. 研究边界:避免因果化、机制化或超出观察范围的解释。

10.110.13 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把变量、样本量、置信水平、点零假设、可忽略边界和回归设置作为背景,生成医学论文 Results 部分风格的客观初稿。

两幅统计图也提供中英文描述以及 PNG、TIFF、SVG 和 PDF 下载。自动描述用于整理图形所呈现的统计信息,不会根据相关关系添加机制解释、临床建议或因果结论。

10.110.14 Word 报告与 CSV 下载

“下载 Word 文档”会导出当前成功生成的统计表、分析说明和统计图;“下载分析结果 CSV”会把当前勾选的结果表整合为结构化数据。

相关系数估计统计:Word 和 CSV 下载页
相关系数估计统计:Word 和 CSV 下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。下载按钮之间保留独立间距,避免误点;取消某项结果输出后,相应内容不会进入当前报告。

10.110.15 从模块结果进入论文写作

Methods 建议说明:研究设计、观察单位、X 与 Y 的定义和量纲、有效配对数、缺失处理、Pearson 相关、置信水平、点零假设、可忽略相关边界及其依据、回归与预测设置、离群点和敏感性分析方法。

Results 建议按“样本与描述统计 → 散点形态 → Pearson r 与置信区间 → 点零假设 → 区间零假设 → 回归斜率与预测区间 → 敏感性分析”的顺序书写。

结果写作例子:共纳入 86 个完整配对。Marker 与 Outcome 呈正线性相关(Pearson r=0.660,95% CI 0.518–0.763,P<0.0001)。相关系数置信区间完全位于预设可忽略区间 (-0.10, 0.10) 之外,提示该相关在预设标准下超过可忽略程度。简单线性回归斜率为 0.683(95% CI 0.514–0.852)。当 Marker=0 时,Outcome 的预测均值为 2.513(均值 95% CI 1.652–3.374;个体 95% 预测区间 0.280–4.746);由于该 X 值超出主要观察范围,该项预测仅作方法展示,不作样本外实质解释。

例子中的数值和变量名称必须替换为本研究实际结果。结果段应说明区间边界的预设依据,并避免把相关或回归斜率写成因果效应。

10.110.16 常见问题

1. 为什么汇总数据模式没有描述统计和散点图?

汇总输入只有 r 和 n,不包含每个观察对象的 X、Y 数值,因此无法计算均值、标准差、回归参数、残差或散点图。

2. 为什么提高置信水平后区间变宽?

更高置信水平要求更高的长期覆盖概率,因此需要更宽的区间。应按研究方案选择主要置信水平,而不是根据区间是否越过边界反复切换。

3. Fisher Z 尺度会改变相关系数吗?

不会。它用于区间计算和估计图显示,主表仍报告原始 Pearson r。相关接近 -1 或 1 时,原始尺度上的区间通常不对称。

4. 相关显著是否说明存在重要关系?

不一定。大样本中很小的相关也可能显著。应联合解释 r、置信区间、预设可忽略边界、变量可靠性和临床背景。

5. P 值不显著是否说明没有关系?

不能。结果可能来自样本不足、区间较宽、测量误差或关系非线性。应查看置信区间以及散点图是否支持“可忽略”的结论。

6. 可忽略边界应该设为多少?

没有适用于所有研究的统一值。边界应由临床最小重要程度、测量误差、既往研究或方案预先规定,并在 Methods 中说明依据。

7. 为什么个体预测区间比均值区间宽?

均值区间只估计某个 X 水平下的平均反应,个体预测还包含个体随机差异,因此通常明显更宽。

8. 可以把 X 和 Y 对调吗?

Pearson r 不会改变,但简单线性回归和预测会改变,因为回归明确区分自变量和因变量。应按研究问题指定方向。

9. 出现离群点怎么办?

先核对录入和测量,再评估其研究合理性和影响。不要仅因为删除后结果更显著而排除。可报告含与不含合理影响点的敏感性分析,或采用稳健相关方法。

10. 输入或分析错误会不会使整个应用退出?

不会。变量重复、有效配对不足、汇总 r 或 n 无效、接近完全相关导致计算边界问题或其他分析失败时,错误会显示在当前模块内;修正后可在同一会话重新分析。

10.110.17 小结

相关系数估计统计的可靠流程是:先确认独立观察、连续变量和大致线性关系,核对缺失与异常点,再联合报告 Pearson r、置信区间和预设可忽略边界,随后解释回归斜率、均值区间与个体预测区间,最后通过散点诊断和敏感性分析确认结论稳定性。

本模块把相关估计、点零与区间零假设、简单线性回归、预测和图形诊断放在同一流程中,但不替代偏相关、多元回归、重复测量模型、非线性模型、稳健统计或因果推断。

10.111 独立两组比例差估计统计

10.111.1 模块功能

独立两组比例差估计统计模块用于回答:两个独立组的事件比例相差多少,绝对比例差和相对比例的估计不确定性有多大,组别与二分类结局是否存在关联,以及比例差是否超出预先规定的可忽略区间?

模块同时提供:

  • 原始数据和 2×2 汇总计数两种分析入口;
  • 两组事件比例及 90%、95% 或 99% 置信区间;
  • 比较组减参考组的绝对比例差及置信区间;
  • 经小样本校正的比例比(近似相对风险)及置信区间;
  • Pearson 卡方检验、Phi 关联效应和观测/期望频数列联表;
  • 点零假设检验与区间零假设评估;
  • 事件比例与比例差估计图;
  • 中英文表格与图形描述、Word 报告和 CSV 结果下载。

方法边界:本模块比较的是两个独立组的二分类结局。如果同一对象在两个时点重复测量、数据成对或存在中心/家族等聚类,则独立性假设不成立,应改用配对比例检验、广义估计方程或混合效应模型。

10.111.2 适用场景

本模块适合以下场景:

  1. 随机平行对照研究中比较两组应答率、不良事件率或达标率;
  2. 队列研究中比较暴露组与非暴露组的结局比例;
  3. 横断面研究中比较两个独立组的阳性率或患病比例;
  4. 希望同时报告绝对效应和相对效应,而不只给出卡方 P 值;
  5. 已预先规定临床可忽略比例差,需要评估置信区间与该边界的关系;
  6. 只有 2×2 事件数与无事件数,但仍需要完整估计和报告。

以下情况不宜直接使用本模块作为最终分析:

  • 结局包含三个或以上类别;
  • 分组包含三个或以上水平,且需要全局比较或多重校正;
  • 数据为配对、重复测量或聚类结构;
  • 需要调整年龄、性别、基线风险等混杂因素;
  • 需要生存时间、事件率或人时分母分析;
  • 数据存在极端稀疏单元格,但未预先规定精确检验或小样本策略。

10.111.3 方法原理

设参考组事件比例为 \(p_0\),比较组事件比例为 \(p_1\)。本模块把绝对比例差定义为:

\[ RD = p_1-p_0 \]

\(RD>0\) 表示比较组事件比例更高,\(RD<0\) 表示比较组更低。例如 \(RD=0.15\) 表示比较组比参考组高 15 个百分点,不是高 15%。

校正比例比则描述比较组事件比例相对于参考组的倍数,并通过小样本校正减少边界计数对比值的影响。它在队列或随机对照语境中可近似解释为相对风险,但它不是传统比值比。横断面资料应更谨慎地称为比例比。

Pearson 卡方检验评估组别与二分类结局是否独立。Phi 系数描述 2×2 列联表的关联强度,但其正负号受事件水平和组别排列顺序影响。

点零假设检验总体比例差是否等于一个预设值,通常为 0。区间零假设则把比例差置信区间与预先规定的可忽略范围比较,例如 (-0.10, 0.10)。边界应根据最小临床重要差异、方案或领域共识预先制定。

10.111.4 数据准备

10.111.4.1 原始数据入口

每行对应一个独立观察对象。结局变量和分组变量都必须恰好包含两个有效水平。

变量角色 要求 说明
二分类结局变量 必选 例如有应答/无应答、阳性/阴性、发生/未发生
二水平分组变量 必选 例如干预组/对照组或暴露组/非暴露组
事件水平 必选 明确哪个结局水平计入分子
参考组 必选 所有差值默认按比较组减参考组计算

模块对结局和分组都完整的观察进行分析,并在分析设置表中报告有效样本量。不应用空字符、特殊数字或不一致大小写表示同一类别。

10.111.4.2 2×2 汇总计数入口

已知每组事件数和无事件数时,可直接输入四个非负整数。每组总例数必须大于 0,事件、无事件、参考组和比较组的名称应清晰且互不相同。

数据质量建议:在分析前用 2×2 列联表人工核对事件方向、组别方向和合计。一旦事件水平或参考组选反,比例差和 Phi 的符号可能改变,比例比的解释方向也会改变。

10.111.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “效应量与估计统计” → “独立两组比例差估计统计”

  1. 选择“分析原始数据”或“输入 2×2 汇总计数”;
  2. 原始数据模式下选择结局、分组、事件水平和参考组;
  3. 汇总数据模式下填写参考组与比较组的事件数、无事件数和显示名称;
  4. 选择 90%、95% 或 99% 置信水平;
  5. 按需保留校正比例比、Pearson 卡方、Phi 和列联表单元格选项;
  6. 如需假设评估,填写点零假设比例差和可忽略比例差边界;
  7. 核对结果输出项目;默认已全部勾选;
  8. 点击“开始两组比例差估计”;
  9. 依次查看分析概览、比例差、关联与列联表、假设评估和估计图;
  10. 在下载页导出 Word 报告或结构化 CSV 结果。
独立两组比例差估计统计:完整设置面板
独立两组比例差估计统计:完整设置面板

10.111.6 菜单选项说明

置信水平决定事件比例、比例差和校正比例比区间的覆盖目标。提高置信水平通常会使区间变宽。

显示标准误和校正比例在事件比例和比例差表中增加估计精度与校正值,便于核查边界样本下的结果。

计算校正比例比(相对风险)增加相对尺度估计。正式报告中应与绝对比例差并列,不应只报告相对效应。

显示 Pearson 卡方分析输出卡方统计量、自由度和 P 值。列联表单元格可选观测频数、期望频数或“观测值(期望值)”。如果期望频数过小,渐近卡方近似可能不稳定。

显示 Phi 关联效应提供 2×2 表的无量纲关联指标。解释时应同时说明事件与组别的排列顺序。

点零假设比例差允许检验总体比例差是否等于 0 或其他预设值。可忽略比例差边界填写正数 \(b\) 后,对应区间为 \((-b,b)\)

10.111.7 分析概览与两组事件比例

分析设置表首先核对数据入口、结局、事件水平、分组、参考组、比较方向、有效样本量、置信水平和预设假设。两组事件比例表报告事件数、总例数、比例及区间。

独立两组比例差估计统计:分析概览与事件比例
独立两组比例差估计统计:分析概览与事件比例

示例数据有 177 个完整观察。Control 组事件数为 27/88,事件比例为 0.3068(95% CI 0.2203–0.4102);Treatment 组为 50/89,事件比例为 0.5618(95% CI 0.4582–0.6600)。

10.111.8 比例差与置信区间

比例差表始终标明比较方向。示例中的“Treatment - Control”表示用 Treatment 组事件比例减去 Control 组事件比例。

独立两组比例差估计统计:比例差与置信区间
独立两组比例差估计统计:比例差与置信区间

示例比例差为 0.2550(95% CI 0.1095–0.3891),表示 Treatment 组的事件比例估计比 Control 组高 25.5 个百分点。置信区间未跨越 0,但仍应联合研究设计、事件定义和最小临床重要差异解释。

10.111.9 校正比例比、卡方、Phi 与列联表

关联页把相对效应、全局关联检验和原始 2×2 计数放在同一页,便于核对方向和数值。

独立两组比例差估计统计:相对效应、关联检验与列联表
独立两组比例差估计统计:相对效应、关联检验与列联表

示例校正比例比为 1.8158(95% CI 1.0480–3.1461),表示 Treatment 组事件比例约为 Control 组的 1.82 倍。Pearson \(χ^2=11.7049\),自由度为 1,P=0.0006;Phi=0.257。列联表显示每个单元格的观测频数和期望频数,与两组比例表的合计一致。

10.111.10 点零与区间零假设

点零假设表把预设比例差、置信区间、Z 值、P 值、统计决策和中文结论放在同一行。区间零假设表则展示可忽略区间与比例差区间的关系。

独立两组比例差估计统计:点零假设与区间零假设
独立两组比例差估计统计:点零假设与区间零假设

示例点零假设为 \(RD=0\),Z=3.4953,P=0.0005,因此拒绝点零假设。预设可忽略区间为 (-0.10, 0.10),95% 置信区间完全位于该范围之外,因此在当前预设标准下,该比例差可判定为超出可忽略程度。

10.111.11 估计图

估计图的上部展示两组事件比例及置信区间,下部展示比较组减参考组的绝对比例差、0 参考线和可忽略区间用于帮助判断方向、精度与实质意义。

独立两组比例差估计统计:事件比例与比例差估计图
独立两组比例差估计统计:事件比例与比例差估计图

图形默认按 900×650 像素渲染,不需要在左侧面板单独设置宽高。图形提供中英文描述以及 PNG、TIFF、SVG 和 PDF 下载。

10.111.12 结果解释顺序

建议按以下顺序阅读:

  1. 数据与方向:确认事件水平、参考组、比较方向和有效样本量;
  2. 原始计数:核对 2×2 列联表和每组分母;
  3. 组内事件比例:报告两组比例与置信区间;
  4. 绝对比例差:说明方向、百分点差值和置信区间;
  5. 校正比例比:补充相对效应,并联合基线比例解释;
  6. 关联检验:报告卡方、自由度、P 值和 Phi;
  7. 点零假设:说明预设值和统计相容性;
  8. 区间零假设:说明可忽略边界依据和区间的相对位置;
  9. 精确性与稳健性:检查区间宽度、稀疏单元格和替代方法;
  10. 研究边界:不把观察性关联自动解释为因果效应。

10.111.13 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把结局、事件水平、组别方向、有效样本量、置信水平和预设假设作为背景,生成医学论文 Results 部分风格的客观初稿。

统计图也提供中英文描述。自动描述不会根据表格或图形添加机制推测、临床建议、因果结论或表外信息。

10.111.14 Word 报告与 CSV 下载

“下载 Word 文档”会导出当前成功生成的统计表、表注和估计图;“下载分析结果 CSV”会把当前勾选的结果表整合为结构化数据。

独立两组比例差估计统计:Word 和 CSV 下载页
独立两组比例差估计统计:Word 和 CSV 下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。取消某项结果输出后,相应内容不会进入当前报告。

10.111.15 从模块结果进入论文写作

Methods 建议说明:研究设计、观察单位、二分类结局与事件定义、分组和参考组、每组样本量、缺失处理、置信水平、绝对比例差、校正比例比、Pearson 卡方、Phi、点零假设、可忽略区间及其依据。

Results 建议按“样本与原始计数 → 两组事件比例 → 绝对比例差与置信区间 → 校正比例比 → 卡方与 Phi → 点零假设 → 区间零假设”的顺序书写。

结果写作例子:共纳入 177 个完整观察,Control 组和 Treatment 组分别为 88 例和 89 例。Control 组事件比例为 30.7%(27/88),Treatment 组为 56.2%(50/89)。Treatment 组减 Control 组的绝对比例差为 25.5 个百分点(95% CI 11.0–38.9 个百分点),校正比例比为 1.82(95% CI 1.05–3.15)。组别与事件结局存在统计学关联(Pearson \(χ^2=11.70\),df=1,P=0.0006;Phi=0.257)。比例差置信区间完全位于预设可忽略区间 (-0.10, 0.10) 之外,提示该差异在预设标准下超出可忽略程度。

例子中的数值、事件定义和组别名称必须替换为本研究实际结果。观察性研究不应因为组间差异显著就使用因果用语。

10.111.16 常见问题

1. 为什么比例差的符号与预期相反?

首先检查事件水平和参考组。本模块统一按“比较组减参考组”计算,切换参考组会改变比例差符号。

2. 比例差 0.15 是不是表示高 15%?

应表述为高 15 个百分点。如需表达相对倍数,应另行报告校正比例比。

3. 校正比例比是传统比值比吗?

不是。它基于两组事件比例的比值并进行小样本校正,在适当设计中可近似称为相对风险。

4. 卡方 P 值显著是否已经足够?

不足够。P 值不给出差异大小和精度。应同时报告两组比例、绝对比例差、相对效应及其置信区间。

5. 为什么提高置信水平后区间变宽?

更高置信水平要求更高的长期覆盖概率,因此需要更宽的区间。不应根据区间是否跨 0 而事后切换置信水平。

6. 期望频数很小怎么办?

渐近 Pearson 卡方近似可能不稳定。应核对研究设计,并考虑精确检验、预先规定的小样本方法或稳健性分析。

7. 可忽略比例差边界应设为多少?

没有适用于所有研究的统一值。边界应根据最小临床重要差异、既往研究、方案或专家共识预先制定。

8. 原始数据和汇总数据的结果会一致吗?

如果四个计数、事件定义、参考组和缺失处理完全一致,主要数值应一致。不一致时应优先核对有效样本量和类别方向。

9. 观察性研究中可以直接写治疗导致风险改变吗?

不可以。未调整的两组比例可能受混杂因素和选择偏倚影响,应使用关联性语言,并在需要时改用可调整协变量的回归模型。

10. 输入或分析错误会不会使整个应用退出?

不会。变量水平不合法、四个计数无效、组内总例数为 0、可忽略边界越界或其他分析失败时,错误会显示在当前模块内;修正后可在同一会话重新分析。

10.111.17 小结

独立两组比例差估计统计的可靠流程是:先确认两组独立、事件定义和参考方向,核对 2×2 原始计数和有效样本量,再联合报告两组比例、绝对比例差、校正比例比和置信区间,随后解释卡方、Phi 与预设可忽略区间,最后评估稀疏数据、混杂和研究设计边界。

本模块把绝对效应、相对效应、关联检验、区间零假设和出版级导出放在同一流程中,但不替代配对比例方法、多组模型、精确检验、协变量调整、重复测量模型或因果推断。

10.112 配对比例差估计统计

10.112.1 模块功能

配对比例差估计统计模块用于回答:同一对象在两次二分类测量中的事件比例改变了多少,改变主要来自哪种配对转归,配对比例差的估计不确定性有多大,以及该差值是否超出预先规定的可忽略区间?

模块同时提供:

  • 原始配对数据和 2×2 配对转归计数两种分析入口;
  • 两次测量的事件比例及 90%、95% 或 99% 置信区间;
  • 比较测量减参考测量的配对比例差及置信区间;
  • 完整 2×2 配对转归表,区分状态一致与状态改变的对象;
  • 点零假设检验与区间零假设评估;
  • 两次事件比例与配对比例差估计图;
  • 中英文表格与图形描述、Word 报告和 CSV 结果下载。

方法边界:本模块要求两次测量来自同一对象,且每次测量都恰好为两个有效水平。如果两组来自不同对象,应使用独立两组比例差方法;如果有三个或以上时点、需要调整协变量或存在额外聚类,应使用纵向二项回归、广义估计方程或混合效应模型。

10.112.2 适用场景

本模块适合以下场景:

  1. 比较同一批患者治疗前后的应答率、阳性率或达标率;
  2. 比较同一对象在两种诊断方法下的阳性结果;
  3. 比较匹配对象在两个条件下的二分类结局;
  4. 需要同时报告测量前后比例、绝对变化和置信区间;
  5. 已预先规定可忽略的配对比例差,需要评估区间与该边界的关系;
  6. 只有两次状态组成的四格配对计数,但仍需要完整估计与报告。

以下情况不宜直接使用本模块作为最终分析:

  • 两次测量并非来自同一对象;
  • 结局含三个或以上类别;
  • 有三个或以上时点或条件;
  • 需要调整基线差异、中心效应或其他混杂因素;
  • 配对之间还存在家族、中心或病区层面的聚类;
  • 不一致配对极少,但研究方案要求精确小样本推断。

10.112.3 方法原理

设参考测量的事件比例为 \(p_0\),比较测量的事件比例为 \(p_1\)。本模块把配对比例差定义为:

\[ RD_{paired}=p_1-p_0 \]

\(RD_{paired}>0\) 表示比较测量的事件比例更高,\(RD_{paired}<0\) 表示更低。例如 \(RD_{paired}=0.10\) 表示绝对增加 10 个百分点,而不是增加 10%。

2×2 配对转归表包含四种状态:两次均为事件、参考为事件而比较为无事件、参考为无事件而比较为事件、两次均为无事件。对角线单元格表示状态不变,两个非对角线单元格表示状态改变。配对比例差的方向和检验信息主要受两种不一致转归的差异影响。

点零假设检验总体配对比例差是否等于预设值,通常为 0。区间零假设则把比例差置信区间与预先规定的可忽略范围比较,例如 (-0.10, 0.10)。边界应由最小临床重要差异、方案或领域依据预先确定。

10.112.4 数据准备

10.112.4.1 原始配对数据入口

每行必须对应同一对象,两列分别表示参考测量和比较测量。

变量角色 要求 说明
参考测量 必选 例如治疗前、方法 A 或条件 1
比较测量 必选 例如治疗后、方法 B 或条件 2
两列的事件水平 必选 明确哪个水平计入事件分子

模块仅使用两次测量都完整的配对观察,并在分析设置表中报告完整配对数。不应把同一对象的两次记录放在不同行,也不应分别删除单次缺失后再强行对齐。

10.112.4.2 2×2 配对转归计数入口

已知四种配对状态的人数时,可直接输入四个非负整数。同时填写参考测量、比较测量、事件与无事件的显示名称。

数据质量建议:分析前应人工核对四格计数、行列合计和不一致配对的方向。事件水平或参考/比较测量颠倒后,配对比例差的符号和结论方向会改变。

10.112.5 操作步骤

顶部菜单选择 “按统计学分类模块” → “效应量与估计统计” → “配对比例差估计统计”

  1. 选择“分析原始配对数据”或“输入 2×2 配对转归计数”;
  2. 原始数据模式下,选择参考测量、比较测量以及两列的事件水平;
  3. 汇总数据模式下,填写测量名称、状态名称和四个配对转归计数;
  4. 选择 90%、95% 或 99% 置信水平;
  5. 如需显示更多数值,保留“显示标准误和校正比例”;
  6. 如需假设评估,填写点零假设配对比例差和可忽略比例差边界;
  7. 核对结果输出项目;默认已全部勾选;
  8. 点击“开始配对比例差估计”;
  9. 依次查看分析概览、配对转归、比例差、假设评估和估计图;
  10. 在下载页导出 Word 报告或结构化 CSV 结果。
配对比例差估计统计:完整设置面板
配对比例差估计统计:完整设置面板

10.112.6 菜单选项说明

参考测量和比较测量决定差值方向。本模块始终按“比较测量减参考测量”计算。

事件水平决定哪个类别计入比例分子。两列可以使用不同文字标签,但必须明确它们在业务上代表同一类事件。

置信水平决定比例和配对比例差区间的覆盖目标。提高置信水平通常会使区间变宽。

显示标准误和校正比例会在事件比例和比例差表中加入补充数值,便于核查估计精度和边界样本下的校正结果。

点零假设配对比例差通常设为 0,也可填写预先规定的其他差值。可忽略配对比例差边界填写正数 \(b\) 后,对应区间为 \((-b,b)\)

10.112.7 分析概览与两次事件比例

分析设置表首先核对数据入口、测量名称、事件定义、比较方向、完整配对数、事件增加/减少转归、置信水平和预设假设。两次测量事件比例表报告事件数、配对数、比例及区间。

配对比例差估计统计:分析概览与事件比例
配对比例差估计统计:分析概览与事件比例

示例数据有 158 个完整配对。Before 事件数为 60/158,事件比例为 0.3797(95% CI 0.3079–0.4576);After 为 70/158,事件比例为 0.4430(95% CI 0.3679–0.5210)。

10.112.8 2×2 配对转归表

配对转归表是解释结果方向的核心。对角线为两次状态一致的对象,非对角线为状态发生改变的对象。

配对比例差估计统计:2×2 配对转归表
配对比例差估计统计:2×2 配对转归表

示例中有 45 人两次均为事件,73 人两次均为无事件;15 人从事件转为无事件,25 人从无事件转为事件。后一种转归比前一种多 10 人,因此 After 的事件比例高于 Before。

10.112.9 配对比例差与置信区间

比例差表始终显示比较方向。示例中的“After - Before”表示用 After 事件比例减去 Before 事件比例。

配对比例差估计统计:配对比例差与置信区间
配对比例差估计统计:配对比例差与置信区间

示例配对比例差为 0.0633(95% CI -0.0163–0.1413),表示 After 的事件比例估计比 Before 高 6.33 个百分点。区间跨过 0,说明数据在当前精度下仍与无差异相容;这不等同于证明两次测量完全相同。

10.112.10 点零与区间零假设

点零假设表把预设差值、置信区间、Z 值、P 值、统计决策和中文结论放在同一行。区间零假设表则展示可忽略区间与配对比例差区间的关系。

配对比例差估计统计:点零假设与区间零假设
配对比例差估计统计:点零假设与区间零假设

示例点零假设为 \(RD_{paired}=0\),Z=1.5546,P=0.1200,因此不拒绝点零假设。预设可忽略区间为 (-0.10, 0.10),配对比例差区间与该范围的关系尚不支持明确判定为可忽略或超出可忽略程度。

10.112.11 估计图

估计图的上部展示两次测量事件比例及置信区间,下部展示比较测量减参考测量的配对比例差、0 参考线和预设可忽略区间。

配对比例差估计统计:事件比例与配对比例差估计图
配对比例差估计统计:事件比例与配对比例差估计图

图形默认按 900×650 像素渲染,不需要在左侧面板单独设置宽高。图形提供中英文描述以及 PNG、TIFF、SVG 和 PDF 下载。

10.112.12 结果解释顺序

建议按以下顺序阅读:

  1. 数据与方向:确认配对结构、事件水平、参考测量和比较方向;
  2. 完整配对数:核对缺失处理后实际进入分析的对象数;
  3. 四格转归:报告状态一致与两种不一致配对数;
  4. 两次事件比例:报告分子、分母、比例和置信区间;
  5. 配对比例差:用百分点说明方向、差值和置信区间;
  6. 点零假设:说明预设值、Z 值、P 值和统计决策;
  7. 区间零假设:说明可忽略边界依据与区间的相对位置;
  8. 精确性:检查区间宽度和不一致配对数是否充足;
  9. 临床含义:把统计区间与预先规定的临床重要性边界联合解释;
  10. 研究边界:不把未调整的前后差异自动解释为因果效应。

10.112.13 表格和统计图描述

每张主表下方均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把测量名称、事件定义、比较方向、配对数、置信水平和预设假设作为背景,生成医学论文 Results 部分风格的客观初稿。

统计图也提供中英文描述。自动描述不会根据表格或图形添加机制推测、临床建议、因果结论或表外信息。

10.112.14 Word 报告与 CSV 下载

“下载 Word 文档”会导出当前成功生成的统计表、表注和估计图;“下载分析结果 CSV”会把当前勾选的结果表整合为结构化数据。

配对比例差估计统计:Word 和 CSV 下载页
配对比例差估计统计:Word 和 CSV 下载页

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。取消某项结果输出后,相应内容不会进入当前报告。

10.112.15 从模块结果进入论文写作

Methods 建议说明:研究设计、观察单位、两次测量或条件、事件定义、配对关系、缺失处理、完整配对数、置信水平、配对比例差、点零假设、可忽略区间及其依据。

Results 建议按“完整配对数 → 四格转归 → 两次事件比例 → 配对比例差与置信区间 → 点零假设 → 区间零假设”的顺序书写。

结果写作例子:共纳入 158 个完整配对。Before 事件比例为 38.0%(60/158),After 为 44.3%(70/158)。其中 45 人两次均为事件,73 人两次均为无事件;15 人从事件转为无事件,25 人从无事件转为事件。After 减 Before 的配对比例差为 6.33 个百分点(95% CI -1.63–14.13 个百分点)。对配对比例差为 0 的点零假设不拒绝(Z=1.55,P=0.1200);该区间与预设可忽略范围 (-0.10, 0.10) 的关系仍不支持明确的可忽略或实质性判定。

例子中的数值、测量名称和事件定义必须替换为本研究实际结果。单组前后研究仍可能受时间趋势、自然恢复、回归均值和其他同期变化影响,不应因为前后比例改变就直接使用因果用语。

10.112.16 常见问题

1. 为什么配对比例差的符号与预期相反?

首先检查参考测量、比较测量和两列的事件水平。本模块统一按“比较测量减参考测量”计算。

2. 可以把两次测量当作两个独立组吗?

不可以。同一对象的两次结果相关,独立组方法会丢失配对转归信息,并可能错误估计不确定性。

3. 为什么要查看非对角线计数?

因为两种状态改变的数量差异决定了配对比例差的方向,也直接影响检验精度。即使总样本很大,不一致配对过少时区间仍可能较宽。

4. 配对比例差 0.10 是不是表示增加 10%?

应表述为增加 10 个百分点。相对百分比变化需要另行明确分母。

5. P 值不显著是否说明两次测量相同?

不能。不显著只表示在当前样本和假设下未拒绝点零假设。应联合置信区间和预先规定的可忽略边界判断。

6. 为什么提高置信水平后区间变宽?

更高置信水平要求更高的长期覆盖概率,因此需要更宽的区间。不应根据区间是否跨 0 而事后切换置信水平。

7. 可忽略配对比例差边界应设为多少?

没有适用于所有研究的统一值。边界应根据最小临床重要差异、既往研究、测量误差、方案或专家共识预先制定。

8. 原始数据和汇总数据的结果会一致吗?

如果四格计数、事件定义、比较方向和缺失处理完全一致,主要结果应一致。不一致时应首先核对完整配对数和四格方向。

9. 有三个时点或需要调整协变量怎么办?

应改用适合纵向二分类结局的回归模型,例如广义估计方程或广义混合效应模型,并按研究设计指定相关结构。

10. 输入或分析错误会不会使整个应用退出?

不会。测量重复、类别水平无效、完整配对不足、四格计数非法、可忽略边界越界或其他分析失败时,错误会显示在当前模块内;修正后可在同一会话重新分析。

10.112.17 小结

配对比例差估计统计的可靠流程是:先确认数据真正配对、事件定义和参考方向,核对 2×2 配对转归表和完整配对数,再联合报告两次事件比例、配对比例差和置信区间,随后解释点零与区间零假设,最后评估不一致配对数、临床重要性和研究设计边界。

本模块把配对转归、绝对变化、区间零假设和出版级导出放在同一流程中,但不替代多时点模型、协变量调整、多层相关结构、精确小样本方法或因果推断。

10.113 回归关系可视化

10.113.1 模块功能

回归关系可视化模块以“先看数据关系,再看调整后模型”为主线,根据变量类型自动组织关系图,并同步完成连续结局回归或二分类结局回归。模块可输出:

  • 分析设置、变量角色、事件水平和完整案例数;
  • 连续结局的 R²、调整 R²、F 检验和回归系数;
  • 二分类结局的偏差、似然比检验、伪 R²、比值比和预测概率变化;
  • 方差分析或偏差分析、调整后效应、分类变量两两比较;
  • 连续变量与分类变量的描述性统计;
  • 原始关系图、调整后模型图、诊断图和增量变量图;
  • 中英文表格与图形描述,以及包含当前结果的 Word 报告。

核心思路:关系图保留原始数据结构,调整后模型图固定其他预测变量,回归表给出数值推断,诊断图用于识别非线性、异常模式或模型失配。四部分应联合阅读。

10.113.2 适用场景

本模块适合以下场景:

  1. 探索连续结局与一个或多个连续、分类预测变量之间的关系;
  2. 检查关系是否近似线性,或是否存在弯曲趋势、分组差异和异常点;
  3. 对二分类结局展示事件概率随预测变量变化的趋势;
  4. 需要用分面变量比较不同中心、性别、治疗组或其他亚组中的关系形态;
  5. 在正式回归报告前联合核对原始数据、调整后效应和模型诊断;
  6. 需要把统计表和图形一次性导出到 Word。

以下情况应使用其他模块:

  • 结局有三个或以上无序类别,应使用无序多分类回归;
  • 结局为有序等级,应使用有序分类回归;
  • 数据具有重复测量、中心嵌套或其他层级结构,应使用混合效应模型;
  • 主要目标是建立和验证预测模型,应使用机器学习或回归预测模块;
  • 需要中介、调节、因果效应或生存时间分析,应进入相应专门模块。

10.113.3 数据准备

变量角色 要求 说明
因变量 必选 1 个 连续数值变量,或恰好具有两个有效水平的分类变量
预测变量 必选 1–5 个 可混合选择连续变量和分类变量;选择顺序会影响主图横轴
分面变量 可选 0–2 个 用于按亚组拆分关系图,不进入主回归方程
事件水平 二分类结局必选 决定系数、比值比和预测概率所对应的事件

模块采用完整案例分析。只要因变量、任一预测变量或任一分面变量缺失,该行就不会进入当前分析。结果页会同时报告原始样本量、完整案例数和排除案例数。

变量顺序:第一个预测变量是关系图和调整后模型图的主要横轴。二次、三次和稳健拟合要求第一个预测变量为连续数值变量。分类变量水平应在数据准备阶段设置为有意义的顺序。

10.113.4 操作步骤

顶部菜单选择 “按统计学分类模块” → “回归分析和线性模型” → “回归关系可视化”

  1. 选择因变量;若为二分类结局,确认事件水平;
  2. 选择一个至五个预测变量,并把希望作为横轴的变量放在首位;
  3. 按需要选择一个或两个分面变量;
  4. 选择拟合线方法;
  5. 设置置信区间、参考拟合线、分类图形、分箱、抽样比例、透明度和抖动;
  6. 核对结果表与统计图输出项目;这些输出默认全部勾选;
  7. 点击“开始分析”;
  8. 依次查看样本概览、模型结果、效应估计和统计图;
  9. 使用表格或图形下方的中英文描述按钮生成论文 Results 风格初稿;
  10. 在下载页生成 Word 报告,并使用微软 Word 打开。

10.113.5 拟合线如何选择

方法 适用条件 主要用途
局部平滑 连续结局 在不预设直线形态时探索局部趋势
线性回归 连续结局 展示可直接与回归系数对应的直线关系
二次多项式 连续结局,首个预测变量连续 探索单次弯曲趋势
三次多项式 连续结局,首个预测变量连续 探索更复杂的弯曲或拐点模式
稳健回归 连续结局,首个预测变量连续 降低极端残差对趋势线的影响
逻辑回归 二分类结局 展示事件发生概率随预测变量的变化

局部平滑适合探索,不应只因为曲线更贴合样本而直接用于最终推断。多项式阶数也不应仅按图形美观选择;应结合研究问题、样本量、过拟合风险和独立验证判断。

10.113.6 绘图选项说明

显示拟合线置信区间用于展示趋势估计的不确定性。区间反映均值或概率曲线的估计精度,不是个体预测区间。

显示跨分面的参考拟合线在存在分面变量时提供跨面板参照,便于比较不同亚组的形态。它不替代正式交互作用检验。

配对差值图要求仅选择一个二水平分类预测变量、不设置分面变量,而且两个条件具有相同观测数。若不能确认同一对象的配对顺序,不应使用该选项。

隐藏拟合线只保留原始数据分布,适合先检查数据质量。分类预测变量图形可选择抖动密度点、箱线图或小提琴图。

连续变量分箱离散度决定连续调节变量被分箱后显示四分位数、标准差或标准误。分箱数过少可能掩盖趋势,过多则会导致每箱样本不足。

散点显示比例只减少图中的原始点,不会减少模型估计使用的完整案例数。透明度和横纵向抖动也只改变图形呈现,不改变统计结果。

10.113.7 样本概览和描述性统计

样本概览首先核对因变量、结局类型、事件水平、预测变量、分面变量、拟合线、总样本量、完整案例数和绘图抽样比例。描述性统计表对连续变量报告 N、均值、标准差、中位数和范围,对分类变量报告各水平频数和构成比。

如果完整案例数明显低于原始样本量,应返回数据准备步骤检查缺失模式。不同模型因纳入变量不同,完整案例数也可能不同,因此模型之间比较时必须核对实际分析样本。

10.113.8 模型结果如何阅读

10.113.8.1 连续结局

建议按“整体模型 → 解释度 → 参数估计 → 诊断”的顺序阅读:

  1. F 检验评价所有预测变量共同进入后模型是否优于仅含截距模型;
  2. R² 表示样本中结局变异的解释比例,调整 R² 对预测变量数量进行校正;
  3. 回归系数表示在其他预测变量固定时的条件关联;
  4. 分类预测变量系数应相对于参考水平解释;
  5. 置信区间同时提供方向、大小和估计精度;
  6. 诊断图用于核对线性、方差稳定性和异常点。

10.113.8.2 二分类结局

似然比检验比较当前模型与空模型,残差偏差反映未解释部分,McFadden 伪 R² 不能直接按线性回归 R² 的尺度解释。比值比大于 1 表示事件优势增加,小于 1 表示事件优势降低;应同时报告 95% 置信区间和事件定义。

预测概率变化比比值比更接近绝对尺度,但仍取决于其他预测变量的取值与参考水平。不要把比值比直接写成风险比,也不要把统计关联自动解释为因果效应。

10.113.9 调整后效应和分类变量比较

调整后效应表汇总连续预测变量和分类预测变量的模型化结果。连续结局还可显示分类水平的调整后估计及两两差异;两两比较表中的正负方向由 Comparison 列的顺序决定,Cohen’s d 表示标准化均值差。

分类变量含三个或以上水平时,应先查看整体模型项检验,再解释具体水平或两两比较。不能因为某一对比较显著而忽略整体检验、比较数量和多重性问题。

10.113.10 四类统计图

关系图展示原始数据点、分类分布或拟合趋势,是识别非线性、离群值、数据稀疏和亚组差异的第一步。

调整后模型图固定其他预测变量,展示第一个预测变量与结局之间的模型化关系。二分类结局显示事件概率及区间。

模型诊断图用于检查残差与拟合值之间是否存在系统模式。连续结局还应留意异方差、重尾和高影响点;二分类结局应留意极端拟合概率和结构化残差。

增量变量图展示在调整其他预测变量后,第一个预测变量与结局之间剩余关系。只有连续结局且至少有两个预测变量时才生成。

图形边界:分面曲线不同不等于交互作用显著,曲线弯曲不等于存在真实阈值,个别离群点也不应在没有数据质量依据时直接删除。图形发现应回到预先规定的模型和正式检验中确认。

10.113.11 表格和统计图描述

每张主表均提供“对表格进行中文描述”和“对表格进行英文描述”按钮。系统会把因变量、结局类型、事件水平、预测变量、完整案例数和表格主题作为背景,生成医学论文 Results 部分风格的客观初稿。

统计图也提供中英文描述。自动描述用于总结图中可见关系、拟合形态、置信区间、分面差异和诊断模式,不会把图形趋势自动写成机制、临床建议或因果结论。

10.113.12 Word 报告

“下载 Word 文档”会导出当前勾选的统计表、表注和可生成的统计图。取消某一输出后,相应内容不会进入当前报告。

请使用 Microsoft Word 打开导出文档。WPS 可能导致表头、底注或图片排版兼容性问题。

10.113.13 从模块结果进入论文写作

Methods 建议说明:研究设计、结局定义、事件水平、预测变量及编码、参考水平、缺失处理、完整案例分析、回归类型、拟合线或非线性设定、分面用途、置信水平和诊断方法。

Results 建议按“样本量与缺失 → 描述性统计 → 整体模型 → 解释度 → 主要系数或比值比 → 分类变量比较 → 图形与诊断”的顺序书写。

连续结局写作框架:共纳入 N 个完整案例。多变量线性模型整体检验为 F(df1, df2)=X,P=Y,调整 R²=Z。调整其他预测变量后,主要预测变量每增加 1 单位,结局平均改变 β 单位(95% CI L–U,P=Y)。关系图显示……;残差图未见/提示……模式。

二分类结局写作框架:共纳入 N 个完整案例,事件定义为……。模型似然比检验为 χ²(df)=X,P=Y。调整其他预测变量后,主要预测变量与事件优势的比值比为 OR(95% CI L–U,P=Y)。调整后概率图显示……;偏差残差图提示……。

框架中的变量名称、事件定义和数值必须替换为本研究实际结果。

10.113.14 常见问题

1. 为什么二次、三次和稳健拟合没有出现在菜单中?

这些方法要求第一个预测变量为连续数值变量。请调整预测变量顺序,或使用局部平滑和线性拟合。

2. 为什么没有增量变量图?

增量变量图仅适用于连续结局且至少有两个预测变量。二分类结局或单预测变量模型不会生成。

3. 散点显示 50% 是否只用一半样本建模?

不会。该选项只减少关系图中的原始点,模型仍使用全部完整案例。

4. 分面图不同是否说明存在交互作用?

不能。分面图是描述性证据;应在合适的回归模块中加入交互项并进行正式检验。

5. 为什么二分类结局的纵轴显示事件概率?

逻辑回归在线性预测尺度上拟合,再转换为 0–1 之间的事件概率。事件水平决定纵轴所表示的结果。

6. P 值显著但图形关系很弱,如何解释?

大样本中很小的效应也可能显著。应联合系数、置信区间、绝对概率变化、R² 或伪 R² 以及临床意义解释。

7. 局部平滑曲线出现拐点,是否可以报告阈值?

不能仅凭探索性曲线确定阈值。阈值需要预先规定或使用专门模型估计,并在独立数据中验证。

8. 配对差值图为什么提示设置无效?

它要求仅有一个二水平分类预测变量、没有分面变量、两个条件观察数相同。还应确认行顺序确实代表同一对象的配对测量。

9. 输入或分析错误会不会使整个应用退出?

不会。变量重复、结局水平无效、样本不足、方法不兼容、完全共线或其他分析失败会显示在当前模块内;修正设置后可在同一会话重新运行。

10. Word 页面能下载但内容与当前页面不一致怎么办?

Word 报告以最近一次成功分析及当时的输出勾选状态为准。修改变量或选项后,应重新点击“开始分析”再下载。

10.113.15 小结

回归关系可视化的可靠流程是:先确认结局类型、事件水平和变量顺序,核对完整案例与描述性统计,再联合阅读关系图、整体模型、调整后效应和诊断图,最后在明确研究设计边界的前提下导出报告。

本模块把探索性图形与回归推断放在同一页面,但不替代多水平模型、纵向模型、专门非线性模型、预测模型验证或因果推断。