学习心得
同一场「慢病健康风险评估与统计分析」专题里,中南大学饶蓁蓁博士以《老年跌倒风险评估工具预测效能评价研究》为题,用多队列数据介绍了三项前后衔接的工作,并在最后把话说明白:研究目标应当从「能不能把人群分成高危和低危」,转到「能不能支持对眼前这个人做干预决策」。
这场报告采取的是检验,而不是构建。她没有急着提出一个新量表,而是把已经发表、被指南推荐、临床上用得很广的工具,放回真实人群里反复看。三项研究的结论都偏阴性。我听的时候有一个感觉:阴性结果要写成论文并且发表,对证据是否完备的要求其实更高,因为读者会追问你是不是方法没做对,而不是工具本身不行。

指南都在推荐,系统比过的却不多
国内外指南都要求对老年人开展跌倒风险评估,可用的工具并不少。单项评估里,常用的有跌倒风险自评量表(SIB)、国际跌倒效能量表(FES-I)、居家跌倒风险筛查量表(HOME FAST)和计时起立—行走测试(TUGT)。组合算法则以美国 CDC 的 STEADI(2015)和世界跌倒指南的 WFG(2022)为代表。名字都熟悉,科室里也看得到。
饶老师梳理既往研究后指出一个缺口:已有的 8 项评价里,有 7 项只评价了 1 到 2 种算法,而且多采用回顾性设计。这些工具已经被广泛应用,它们的预测性能却很少被放在同一套设计里、用同一种标准系统地比过。于是后面的工作顺着三个问题往下做。国际推荐的工具,放到中国老年人群里还适用吗?把截断值改成更贴近本土的数值,预测会不会好一些?再把多个工具组合起来,信息更全,性能还能不能再抬一截?
第一重:关联很清楚,人却大多没被找出来
第一项研究做的是外部验证,把国际推荐的工具放回中国人群,看实际表现。数据来自 CHARLS 全国代表性纵向调查,覆盖 28 个省、150 个县(区),对象为基线年龄 60 岁及以上,共形成 6 个分析队列,随访从 2 年到 9 年不等,结局是跌倒和跌倒相关损伤。
结果呈现出一种不容易一下子说圆的对照。一方面,风险分层的关联很清楚。以跌倒为例,低危、中危、高危三组的发生率在 6 个队列中都呈递增趋势,高危组的校正 OR 达到 2.2~2.6;跌伤的梯度方向一致,高危组校正 OR 为 2.1~2.6。若只看组间比较和趋势检验,工具像是「有效」的。另一方面,拿它去找具体会跌倒的人,表现就很难令人满意。灵敏度只有 20.2%~32.5%,意味着多数后来真的发生跌倒或跌伤的人,事先并没有被识别出来。特异度虽然较高,为 84.2%~92.1%,说明被判成低风险的人相对安全,但这补不上漏筛。
讨论给出的解释并不绕。跌倒本身是多因素事件,算法却只纳入了跌倒史、严重程度和步速,肌力、用药、居住环境都没有进去。同时,指南推荐的步速截断值 ≤0.8 m/s,可能并不适合中国人群,国内研究大约在 0.95 m/s。按 0.8 m/s 来划,会把一部分实际上走路已经偏慢的高危者留在筛网外面。
第二重:截断值往下挪了,曲线本身没有动
既然截断值可能不适用,第二个问题就是:按中国社区老年人重新估计截断值,性能能不能改善。
这项研究在长沙市岳麓区 14 个社区开展,为期 12 个月,前瞻观察,共完成 1,237 例,每 2 个月随访一次。12 个月内至少发生 1 次跌倒的累计发生率是 13.6%,跌伤是 8.7%。基于这一人群重新推导的截断值,多数低于既往推荐:SIB 由 ≥4 分降为 3 分,FES-I 由 ≥23 分降为 18 分,HOME FAST 由 ≥9 分降为 5 分,TUGT 由 ≥12 或 15 秒降为 10.6 秒。调整之后,灵敏度确实上升了。以 HOME FAST 为例,灵敏度由 1.2% 升至 40.5%,特异度则由 98.0% 降至 65.9%。多找出一些人,是用更多的误报换来的。
更让我记住的是,AUC 并没有改变。四种工具的 AUC 仍然只有 0.513~0.631。调整截断值,只是在同一条 ROC 曲线上换了一个取舍的位置:误报和漏报的比例变了,个体之间谁风险更高、谁更低,这个排序并没有变,所以判别能力也不会变。再加上量表本身存在地板效应,得分集中在低分段、分布很窄,以及 12 个月跌倒发生率只有 13.6%,能够把人拉开的空间本来就有限。本土化截断值值得做,但它解决的是「这条线画在哪里」,不是「这把尺子能不能量出差别」。
第三重:组合之后,仍没有超过一张简单量表
第三个问题是,单项工具信息不够,把多个工具合在一起,会不会因为信息更全而更好。研究在同一批 1,237 人中,系统比较了 10 种组合算法和 4 种单项工具,其中 STEADI 有 6 种变体,WFG 有 4 种。此前还没有研究把这两类组合算法的各个变体同时比完,临床上因此缺少选择依据:指南推荐了算法,并没有告诉你哪一种写法在中国社区里更好用。
结果同样不理想。10 种组合算法的 AUC 为 0.527~0.575,全部低于 0.70。其中表现最好的是 WFG 算法 3,跌倒 AUC 0.573,跌伤 AUC 0.575,仍然低于单项工具 SIB。也就是说,看起来更全面的组合,并没有胜过一个简单的自评量表。
原因在报告里讲得很清楚。新增加的条目与既往跌倒史高度重叠,带来的是重复信息,不是这张量表原来没有的信息。一部分关键截断值仍然偏低。更关键的是,每个工具先按截断值切成「有风险 / 无风险」两类,连续得分里原本还有的差别,在这一步就已经损失掉了。条目变多,不等于信息变多。
听完之后
学术上,这场报告最值得借的是评价层次,而不是又一个量表的名字。群体层面的关联可以很显著:高危组校正 OR 超过 2,趋势检验在 6 个队列里都成立,这只能说明「这一组人比那一组人更容易跌倒」。个体层面的预测是另一件事:灵敏度只有两成到三成,就说明没法靠它判断眼前这个人会不会跌倒。这两句话完全可以同时成立。我们平时太容易把一个漂亮的 OR、一次显著的趋势检验,当成工具已经好用的证据。饶老师把外部验证、截断值重估和组合算法比较放在同一条逻辑里,让我看到阴性结果也可以一层层做扎实,并且发表在 Journal of Safety Research 和 American Journal of Preventive Medicine 上。诚实写出「这个工具没有那么好用」,可以避免一批老年人被低效工具反复筛查,这份贡献并不比提出一个新模型更小。
对后面的研究,我记下三处可以直接对照的做法。一是不要只报告组间 OR。若课题声称工具能用于筛查或个体预测,方案里就应事先写上灵敏度、特异度、AUC,以及校准和临床净获益,而不是等结果显著了再决定报哪些指标。二是改截断值之前,先分清自己要解决的是取舍还是判别。取舍可以靠移动截断值来谈,判别不行;判别要靠新的、与旧条目不重叠的信息,例如肌力、用药、环境和可重复测量的功能指标。三是组合变量时先看增量,再看条目数量。高度相关的跌倒史若被写进每一个分量表,合在一起也不会产生新的分辨力。饶老师展望里提到的动态预测,如 Landmark 分析和联合模型,则提醒我:一次基线评估把风险定死,跟老年人后来几个月里状态会变,这两件事对不上。若后续课题做到随访,风险应当允许更新,并且用独立人群再验一次。
我个人的体会是,方法上学到哪一步,不看把指标做得多高,而看能不能说清它在哪里不够用、下一步该补什么。三项检验给出的判断是一致的:现有工具可以用于风险评估和干预分层,不宜单独用于个体化预测。研究目标若还停在「高危组比低危组风险高」,做到趋势显著就可以停;若目标是「这个人要不要干预、怎样干预」,评价标准就必须换成灵敏度、校准度和净获益。我回去之后再设计类似题目,会先把这个目标写在方案第一页,免得做到一半才发现,自己证明的只是分组,并不是预测。
陕公网安备61011302000964号
扫码关注公众号