真实世界数据支持药品安全性主动监测的研究设计和分析指导原则(征求意见稿)
药品安全性主动监测(以下简称“主动监测”)是指采取持续有组织的方式,主动收集一个或多个来源的数据,进而利用数据评价药品安全性的过程。真实世界数据(包括医院电子病历、医保数据、区域健康医疗数据等)是开展主动监测的重要数据来源。从数据到证据需要开展真实世界研究,科学的研究设计及合理的数据分析是高质量真实世界研究的关键,也是药品监管科学研究及主动监测评价能力建设的重要内容。
2025年发布的《真实世界数据支持药品安全性主动监测的一般原则》(以下简称《一般原则》),对利用真实世界数据开展主动监测的数据来源及类型、适用范围、一般流程以及实施技术等方面提出了总体要求。作为《一般原则》的延伸以及对具体方法技术的补充,本指导原则重点阐述基于真实世界数据开展药品上市后主动监测的研究设计与统计分析关键考量及基本要求,旨在为药品上市许可持有人、研究机构等相关方提供参考。
本指导原则仅代表药品监管部门当前的观点和认识,随着药品监管科学研究的不断深入,本指导原则中的相关要求及内容也将不断完善。
一、研究方案框架
主动监测的研究目的侧重于基于已有信号的安全性评价,最常采用的研究方法为利用不同来源前瞻或回顾性主动监测数据开展观察性药物流行病学研究。因此,本指导原则主要针对基于真实世界数据,尤其是基于常规诊疗过程形成的数据,通过观察性研究设计进行药品安全性主动监测所涉及的研究方案框架、研究设计与统计分析要求进行阐述。
目前,针对药品安全性主动监测研究方案框架尚无统一要求,其初始的研究方案应在数据收集前完成,包括但不限于以下部分:
(1)标题:阐明研究设计、目标药品、对照以及安全性结局等信息。
(2)研究摘要:对研究方案以下各部分的概括性总结。
(3)研究背景:简述本研究的实施背景。
(4)研究问题与目的:简述本研究拟解决的临床科学问题,明确主要和次要目的,并预先设定研究假设。
(5)研究方法:包括研究设计、数据来源(名称、类型、适用性评估)、研究人群(纳入/排除标准、时间范围等)、变量定义与识别(目标药品暴露、对照、安全性结局、协变量以及相关的研究时间窗)、样本量、数据治理或管理、统计分析计划(主分析和次要分析的统计分析模型、缺失值填补、敏感性分析等)等。
(6)研究局限性:分析研究设计、数据源以及统计分析阶段可能存在的偏倚、混杂、外推性等。
(7)数据安全:充分说明采用何种手段保证患者隐私与数据安全。
(8)研究时间计划:包括研究启动日期、数据收集/治理结束日期、统计分析完成日期、报告提交日期等关键时间节点。
(9)研究注册:描述本研究在公开临床研究注册平台注册情况如网址、登记号等。
(10)伦理:描述本研究伦理审批以及患者知情同意情况。仅涉及回顾性使用患者电子病历信息时,可申请豁免知情同意。
(11)参考文献。
(12)附件等。
在研究方案的方法部分,应充分阐述拟使用的真实世界数据来源与类型(医院电子病历系统数据、医保数据等),及其在回答当前研究问题的适用性依据,包括数据源人群对目标人群的代表性、是否涵盖研究关键变量及其准确性、诊断或药品等编码系统、可获取时间范围、既往临床研究应用情况、潜在局限性等。若采用多个数据源,还应讨论不同数据源在人群特征、临床实践、编码系统等方面的潜在异质性,以及数据库间链接方法和准确性(若适用)。对于数据收集方式、数据治理过程也应有详细的描述,保证研究的透明性与可重复性。
在研究开始之后,针对上述方案内容有任何实质性修改,均应在方案中进行可供追溯和审核的说明,包括记录版本号、修改日期、修改内容以及原因。
二、研究设计要求
总体研究设计通常包括研究问题确定、流行病学设计选择、研究人群选择与定义、关键变量(目标药品暴露与对照、结局、随访、协变量)定义、潜在偏倚识别与控制等关键要素设定。与传统流行病学研究不同,在数据库研究中,研究人群和关键变量的定义与识别涉及两个层面:概念性定义和操作性定义。其中,概念性定义指基于研究问题以及现有医学知识,对各研究变量多个维度进行明确界定和说明,将抽象的研究问题转化为标准化可接受的描述。在构建概念性定义时,应详细列出界定各研究变量所涉及的数据元素,并确保数据源可捕捉所需元素。操作性定义则是将概念性定义转化为可执行的数据提取规则,以解决研究变量如何从数据库测量/识别的问题,包括变量识别所采用的编码或算法、相关评估时间窗等。针对同一概念性定义,不同数据库相应操作性定义可能存在差异,研究者应报告所采用的编码或算法准确性。
推荐借助模拟目标试验框架进行研究设计关键要素设定,并借助可视化图表对设计细节进行展示。模拟目标试验不是一种新的研究设计类型,而是一种设计框架,可以辅助研究者明确观察性研究中的设计要素。该方法可最大程度控制由于非随机化导致的常见偏倚(如不死时间偏倚),提升研究的透明度和可重复性,从而提高观察性研究结果的因果推断强度。
科学的研究设计离不开高质量的数据基础,研究要素的设定与数据源的选择需要相互适配。研究者可从人群代表性、关键变量完整性和准确性、可比对照获取、结局事件数和随访时长等方面进行数据适用性评价,具体参考《一般原则》。
研究问题是制定研究方案、确定研究实施计划的基础。主动监测的研究问题(例如评估罕见迟发信号、或是评价特殊人群用药风险等)可以围绕研究人群、目标药物暴露、对照、不良结局事件、随访时间以及研究场景等方面系统构建。研究问题的提出应对现有安全性信号证据充分综述,基于已知证据及不足或缺乏之处,明确尚需研究解决的关键问题。
基于真实世界数据开展药品安全性主动监测通常采用观察性(或非干预性)流行病学研究设计,常见类型包括队列研究、病例对照研究、巢式病例对照研究、病例队列研究、病例交叉研究等。不同设计类型适用场景以及优缺点不同(如表1所示),应基于当前研究问题以及可疑药品与安全性事件间关联的潜在假设(如急性发作vs.迟发事件)进行选择。不推荐某个设计类型一定优于其他类型。例如队列研究通常被认定为研究因果关系证据等级最高的观察性研究类型,当数据可及性有限时,巢式病例对照研究设计可取得接近队列研究的因果推断效力。在研究方案和最终研究报告中应明确所选流行病学设计类型以及理由。
其次,在流行病学设计中,还应明确定义其他设计特征,如采用新用药或现用药设计,以及对照选择(阳性对照、空白对照、历史对照、自身对照等)。
表1 常用流行病学设计方法
流行病学设计类型 | 适用场景 | 优势 | 局限性 |
横断面研究 | 在没有指向性的研究目标时,可用于药品上市后安全事件的初步发现 | 数据收集和分析较为简单,可用于药品上市后安全信号发现 | 通常无法确定药品暴露与感兴趣结果的时间顺序 |
队列研究 | 评估同一药品暴露研究中的多个不良事件;需要绝对风险估计的研究问题,以及需要明确关联时间先后的研究问题 | 有明确时间线,可明确混杂、药品暴露以及安全结局的时间顺序;可估算治疗组事件发生率(风险或比率),也可估算相对风险或比率差异。队列研究可以评估给定药品治疗的多种安全性结果 | 当安全性结局为罕见事件时队列设计就会变得低效,但在真实世界研究中此局限可能会弱化 |
病例对照研究 | 调查一种药品(或几种药品)与一种特定的罕见不良事件之间是否存在关联,以及确定不良事件的多种风险因素时 | 可以较大限度的获得病例,对于罕见安全性事件的研究可以提高研究效率 | 通常可以提供相对风险估计,但无法直接提供绝对风险估计;由于需要研究对象回溯暴露和混杂信息,存在回忆偏倚 |
巢式病例对照研究 | 实施巢式病例对照研究的前提是有一个基本队列,当产生新的病因假设,但是评估每个人的暴露史过于昂贵时,可在基本队列中采用病例对照设计 | 降低选择偏倚,提高病例组与对照组之间的可比性;避免回顾暴露和混杂信息引入的回忆偏倚;同时具备队列研究因果推断时序性的优点 | 统计学效率比队列研究略有损失;若在研究期结束时进行对照抽取可能存在失访 |
病例队列研究 | 与巢式病例对照设计相比,病例队列设计适用于多个结局的研究 | 病例和对照来自同一基本队列,具有较高可比性;可以估计发病率;同一亚群可作为多个病例的对照 | 通常对照组在结局开始时抽取,病例和对照有重叠;失访、所关注的结局事件频率以及暴露随时间变化可能会限制病例队列设计的可行性 |
病例交叉研究 | 适用于研究短暂药品暴露的急性效应 | 避免了在选择对照组的过程中可能造成的选择偏倚,可以控制未测量混杂;节约样本量的同时统计学效率高 | 只可以用于风险期与对照期暴露历史有差异的病例,且多适用于短暂急性暴露,使用场景有限 |
研究人群应代表拟研究的安全性问题涉及的目标人群,准确定义与识别研究人群是控制选择偏倚的关键环节。药品上市后,实际使用人群往往比上市前临床试验中的研究人群更为复杂,如多病共存、多重用药、用药动态变化、个体差异大等。基于研究问题,通过构建概念性定义,即纳入排除标准(包括来源、时间范围、人口学特征、疾病及其严重程度、实验室指标值等)进行研究人群限定。纳入排除标准的制定需具备科学、合理的依据(如疾病诊断的标准和依据),要尽可能避免选择偏倚的产生,并保证研究人群的代表性。
在此基础上,构建相应操作性定义,从数据库中准确识别研究人群,包括明确上述纳排标准所涉及变量的识别方式(基于诊断编码、药品编码,或采用人工审查等),详细的变量识别编码列表或算法、判定时间窗(如纳入起止时间、纳入排除评估时间窗、新用药或新发病例的回顾时间窗、进入队列的零时刻等),以及算法来源和准确性等。
纳排标准定义及其相关信息在数据库中的完整性和准确性,均可能导致纳入研究对象与未纳入对象之间存在系统差异,从而产生选择偏倚。例如,当仅利用特异度较低的国际疾病分类(International Classification of Diseases,ICD)编码识别研究人群时,可能会纳入大量非目标疾病个体。此时,可考虑结合特异性的检验检查或用药信息构建识别算法,提高研究人群识别准确度。建议采用流程图或表格等方式,清晰展示研究人群各阶段纳入排除情况,保证研究的透明度与可重复性。
1.对照选择
在观察性研究中,选择适宜的对照组是控制偏倚的有效措施。目前,选择具有相同或类似适应证下临床公认的替代治疗,是最常见且偏倚较小的对照形式,其他类型还包括空白对照、常规治疗、历史对照、自身前后对照以及外部对照等。无论选择何种对照,应阐述原因,并尽量保证对照组人群疾病类型、严重程度、病程及其他治疗方案等重要特征与暴露组人群具有可比性。
2.药品暴露
首先,针对不同的安全性问题,药品暴露(包括目标可疑药品和对照药品)需考虑的维度和颗粒度不同,可涉及不同用药类型(新用药或现用药、单用或联用)、测量尺度(二分类、连续性等)、测量单位(人数、人时、处方数等)、给药途径(静脉、口服等)、剂量、暴露次数、暴露时长等。
其次,药物暴露相关时间窗亦是药品暴露定义与识别的关键环节,包括起始/终止用药时间、暴露期、诱导期、滞后期等(如图1),以判断个体药品暴露状态、用药时长、连续/中断用药、是否可导致目标安全性结局。例如,在实际诊疗中,患者可能因为检查等原因推迟用药,可通过设置宽限期来定义连续或中断用药:宽限期为允许两次药物处方时间上存在最大间隔,即处方时间加上宽限期作为患者的暴露期。
图1 药物暴露相关时间窗示意图
与传统临床试验不同,实际诊疗中发生用药状态变化(停药、转换、加载等)普遍存在。除需明确定义和识别用药变化,还应根据变化比例以及对结局潜在影响,选择适宜的暴露定义方式和分析策略。此外,在可行情况下,鼓励采用新用药设计,从一定程度上控制幸存者偏倚(即研究纳入已接受治疗一段时间的患者,往往代表了对药物治疗耐受而不良反应发生率较低的人群,而排除了可能已经发生不良反应的患者)。新用药者可以是新发病例首次用药、停药足够长时间后再次用药或是在现有治疗基础上加载某种新用药的患者,并通过设置合理的回顾期进行识别。回顾期的设置,或使用现用药者定义均应在研究方案中充分说明理由并分析其可能对结果的影响。
3.随访
随访窗口指研究人群在进入队列后,其不良反应/事件可归因于药品暴露的时间范围。应合理、清晰定义该窗口的起止时间,避免将暴露前发生或与暴露无关的事件误判为药物效应。通常,随访窗口应基于暴露风险窗口进行设定,即介于最短与最长诱导期之间的时段,同时考虑删失机制(如失访、退出、停药、转换、研究截止等)。
4.安全性结局事件
研究关注的药品不良事件可能涉及主观症状、生物标志物、疾病诊断、死亡、生活质量等不同类型指标,应明确定义所关注的不良反应/事件。在构建结局事件的概念性定义时,充分考虑当前医学对该事件的普遍认知(如公认的诊断标准及依据等),详细说明所需变量以及判断时点,明确是纳入现患病例或仅为新发病例、是疾病的恶化或是复发等。结局的定义应独立于目标药品暴露状态,即药品暴露不应作为结局定义的组成。
与研究人群相同,在构建安全性结局事件的操作性定义时,应说明上述概念性定义中所涉及变量(疾病诊断、临床操作、实验室指标、病历文本等)识别方法、详细陈列相关编码或算法、并充分报告算法准确性。例如,在采用疾病诊断编码识别时,需明确诊断编码来源(门诊或出院诊断)、诊断顺序(如仅以主要诊断为主、或利用出院记录前三位诊断等)、诊断编码列表、以及诊断编码的准确性评价指标。
5.协变量
基于临床背景知识、既往研究综述、专家咨询等方式,确定影响可疑药品与结局间关联判断的重要协变量(如患者人口学特征、合并疾病、合并治疗等)。可通过绘制因果有向无环图(Directed Acyclic Graphs,DAGs)清晰展示暴露、协变量以及结局间关系,区分协变量的类型如时依性混杂、中介变量、效应修饰因子、碰撞变量等。与上述研究变量相同,研究者应完整列出协变量所涉及的变量、识别方法、是否验证以及评估时间窗。药品安全性主动监测研究设计关键要素考量见表2。
表2 基于真实世界数据的药品安全性主动监测研究设计关键要素
关键设计要素 | 具体考量 |
研究对象 | Ÿ 制定清晰、合理的纳入排除标准; Ÿ 采用流程图等方式清晰展示纳排标准评估时间窗、以及各阶段纳入排除人数情况; Ÿ 评估研究对象代表性以及识别算法准确性指标,如灵敏度、特异度等; |
目标药品暴露 | Ÿ 明确定义暴露特征,包括类型、测量尺度、测量单位、给药途径、剂量、暴露次数、暴露相关时间窗等; Ÿ 在可行情况下,鼓励采用新用药设计; Ÿ 充分识别、定义和处理用药动态变化; |
对照 | Ÿ 尽量保证对照组与暴露组在重要特征上具有可比性; Ÿ 推荐采用相同或相似适应证下临床公认的阳性对照; |
安全性结局指标 | Ÿ 明确需评价的安全性结局指标; Ÿ 详细说明结局指标的识别方法、完整的编码或算法内容; Ÿ 报告算法准确性指标,如灵敏度、特异度等; |
随访 | Ÿ 合理、清晰定义该窗口的开始和结束,包括删失条件; |
协变量 | Ÿ 充分识别影响可疑药品与结局间关联判断的重要协变量; Ÿ 借助因果图等方法,区分协变量的类型如混杂因素、中介变量、效应修饰因子、碰撞变量等。 |
与随机对照试验不同,基于真实世界数据的观察性研究在开展药品安全性主动监测时,不可避免地面临多种偏倚风险。在研究方案中,应充分考虑研究设计、实施和分析阶段的潜在偏倚及其影响,并制定相应的有效控制措施。
选择偏倚是指研究样本选择过程中,实际入选的分析人群与研究目标人群间存在系统性差异,常见类型包括入院率偏倚、健康受试者偏倚、现用药者偏倚、检出症候偏倚等。例如,采用现用药者设计可能导致现用药者偏倚或幸存者偏倚。此时,可考虑采用新用药者设计将研究人群局限于处于疗程初期的患者,比较两组人群中暴露与不良结局的效应值差异。
信息偏倚主要源于测量或识别方法不准确,导致暴露、结局等研究变量的错误分类。在基于常规收集健康医疗数据的研究中,由于此类数据并非基于研究目的产生,错分偏倚(即变量被错误分类到不同组别,导致效应估计偏离真实值)更为常见。为识别和控制错分偏倚,建议对变量识别算法开展验证研究,评估潜在错分的可能性、方向及其程度;必要时可采用定量偏倚分析对研究结果进行校正。其次,建议采用不同的定义和识别方法,通过敏感性分析对结果稳健性进行检验。在可接受范围内,应尽可能降低错分偏倚对结果的影响,保证结果的可信度。
混杂偏倚则是由于混杂因素在暴露和对照组间的分布不均衡,导致药品暴露与安全性结局之间的真实关联被高估、低估甚至发生方向性偏离。基于研究问题,在研究阶段应充分考虑潜在可能的混杂因素,包括人口学特征、适应证、疾病严重程度、合并疾病、合并用药、既往史等。同时,还应分析纳入的混杂因素是否随时间动态变化并影响暴露与结局的发生,即是否存在时依性混杂。建议绘制DAG图以辅助判断变量间关系,识别潜在混杂因素。
三、统计分析
在基于真实世界数据进行药品安全性主动监测时,应事先制订统计分析计划(Statistical Analysis Plan,SAP),说明主分析统计方法、样本量估计、显著性水平、检验效能、缺失数据处理、亚组分析以及敏感性分析等内容。在安全性信号评价部分,需在统计方法中说明如何控制混杂因素,以实现暴露和不良反应间的因果推断。当涉及多个亚组间比较等多次分析或多组比较的情况,应说明对检验水准α进行校正的方式,或采用其他多重检验方法,以控制假阳性风险。
在分析结果中,应提供关于风险估计(包括绝对和相对风险)的点估计值、假设检验结果(如P值)以及置信区间。P值用于判断统计显著性,置信区间可量化风险估计的精度,应综合点估计值和置信区间,对安全性信号评价结果进行科学解读。
在基于真实世界数据开展安全性主动监测研究中,特别是对于罕见严重不良反应,应充分考量数据源中符合纳入排除标准的研究对象数量以及预期可以获得的阳性事件数,是否满足分析所需。
在SAP中,研究者应对确定样本量的方法予以详细描述,提供相关假设和理由、计算公式,并说明纳入排除标准对样本量计算的影响。针对罕见或迟发的安全性事件,样本量计算的理由说明尤为重要,需充分考虑是否可收集到足够的阳性事件数。在分析结束时,应根据研究结果重新审视初始的统计效能对于检验基本假设的有效性,特别是在出现阴性结果的情况下。
在基于真实世界数据开展药品上市后安全性评价研究时,研究者应依据其研究目的、数据类型以及研究设计类型,合理选择统计分析方法,并说明所选方法的相关假设及局限性。安全性结局通常为罕见事件,在选择方法时应考虑事件发生率的影响。同时,实际临床诊疗过程中,患者用药模式复杂,合并用药、多种干预联合治疗以及用药方案的动态调整普遍存在,从而引入了高维、时序性等复杂混杂结构。因此,在选择统计分析方法时,应充分考虑:①潜在的混杂因素间是否存在共线性或交互作用;②是否存在随时间变化的时间依赖性混杂;③是否存在未观测混杂,及其对主分析结果的影响。
在观察性研究中,多变量广义线性回归是常用的混杂控制方法,其中泊松回归和负二项回归可用于罕见结局的分析。此外,针对混杂控制,还可选择倾向评分分析、工具变量等方法。对于统计方法而言没有绝对的优劣,不推荐某种统计方法一定优于其他方法。研究者需根据拟解决的问题和数据情况选择合适的方法。例如,潜在的混杂因素存在高维且共线交互,可采用机器学习方法进行控制;若混杂具有时间依赖性,可选择风险集匹配、G方法等进行分析;如未观测混杂对结果具有较大影响时,工具变量法可作为有效的分析手段。常用控制混杂因素的方法优缺点如表3所示。其基本原理见附1。
表3 基于真实世界数据不良反应评价的统计分析技术特征一览表
统计分析技术 | 使用条件 | 优势 | 局限性 |
多变量回归分析 | 针对含有较多协变量情况的混杂效应调整方法 | 是最常见的控制混杂因素的统计分析方法,简易高效,易操作 | 当混杂因素较多时,易出现多重共线性,需考虑模型的适用性 |
倾向评分分析 | 适用于含有多个结局变量,或暴露因素常见而结局事件罕见的研究 | 观察性研究中常用的控制混杂因素的方法,可同时调整多种混杂因素进行事后随机化 | 不能控制未知未测的混杂因素,匹配基于特定假设,匹配后减少样本量,降低估计精度和原人群代表性 |
工具变量分析 | 存在未知未测的混杂因素,且具有可用的工具变量 | 能控制未知混杂因素如患者健康意识对不良反应评价结果的影响 | 难以找到合适的工具变量,使用不合适的工具变量会带来更严重的估计问题 |
G方法 | 存在时间依赖混杂与时间依赖暴露的观察性研究 | 可处理时依性暴露和时依性混杂随时间变化且相互影响引入的时依性混杂偏倚 | 不能控制未知未观测的混杂因素,原理操作较为复杂 |
结构方程模型 | 存在明确的理论假设及潜变量结构,且样本量充足 | 能研究变量间的直接和间接作用,特别适用于高维自相关纵向数据 | 较复杂,对样本量的要求较高,容易产生过拟合的现象,且在解释上存在难度 |
近年来,针对真实世界数据的统计方法发展迅速,新方法不断涌现,例如针对罕见事件的贝叶斯模型,以及面向多中心分布式数据的联邦学习方法等。新方法为主动监测安全性评价提供了更多分析工具,在使用各类分析方法时,应充分评估并说明其与数据结构和研究问题的适用性。
基于真实世界数据(特别是医院电子病历等常规诊疗形成的数据)开展的研究中,缺失值普遍存在,可能对研究结论产生重大影响。研究者应系统评估并处理缺失数据,包括:①明确存在缺失值的变量及缺失比例;②根据变量的缺失机制(完全随机、随机、非随机)选择合适的填补方式;③采用不同填补方法进行敏感性分析,评估结果可靠性。
常见的缺失值处理方式主要包括删除、填补。删除包括删除含缺失值的样本、删除含缺失值的变量及成对删除。其优点在于操作简便,但可能导致样本量大幅减少,并可能引入选择偏倚。填补则是利用辅助信息,为缺失值寻找替代值,以尽可能还原真实情况,填补的方法可分为单一填补和多重填补。单一填补原理简单,易于实施,但未考虑缺失值存在的潜在变异;多重填补则通过生成多个填补数据集,综合考虑缺失值的均值与变异,更为全面地反映其不确定性。常用的缺失填补方法见附2。
在利用真实世界数据开展药品安全性评价研究时,研究者应通过敏感性分析全面评估潜在偏倚对于结果的影响。主要的敏感性分析方法包括定量偏倚评价和定性分析两类。
在进行敏感性分析时,可考虑以下几个方面:①调整关键研究要素的定义,包括暴露/对照、结局及协变量的识别标准;②改变研究设计,如调整人群纳排标准、更换数据源等;③使用不同的统计分析方法,包括变更分析模型、调整模型参数或缺失值处理策略。另外,针对观察性研究中普遍存在的潜在未观测混杂,应采用E-value、阴性对照等方法评估其对效应估计的影响。
研究者应根据实际情况选择敏感性分析策略,例如当数据存在明显信息缺失时,应采用不同缺失值处理策略进行敏感性分析,评价缺失值影响。另外,对于重大安全性信号验证时,应从多个方面开展敏感性分析,全面评价当前结果的稳健性。研究者需明确说明开展各项敏感性分析的具体理由,并完整报告所有敏感性分析的结果。当敏感性分析结果与主分析结果不一致时,应深入探讨可能的原因,并在研究结论中审慎说明结果的适用范围及潜在不确定性。
附:1.常用混杂控制方法
2.缺失值填补方法
3.词汇表
附1
常用混杂控制方法
1.多变量广义线性回归方法
多变量广义线性回归方法是最常见的控制混杂因素的统计分析方法,但是在应用中需考虑一些关键因素,如模型的基本假设是否成立、变量的结构与分布是否满足模型要求、样本量或结局事件数是否满足模型中所设定个数参数的准确估计、自变量与因变量是否是服从线性关系等,同时,在具体的应用中,根据数据结构和结局变量类型等选择不同的模型,比如当数据存在层次结构时如多中心数据,应考虑选择多水平模型;当是重复测量数据时考虑广义线性混合模型及广义估计方程;依据结局变量的类型考虑选择多重线性回归、Logistic回归、Poisson回归、负二项回归和Cox比例风险回归等回归模型。其中Poisson回归、负二项回归适用于分析罕见事件。多变量广义线性回归不适用于分析混杂因素高维的数据,容易出现共线性的问题而导致结果估计有偏。
2.倾向性评分
倾向性评分分析(Propensity Score Analyzing)是最常见的控制观察性研究中混杂因素的方法,主要是针对含有多种协变量情况的混杂效应调整,用于均衡组间协变量的方法。
常见的倾向性评分法包括倾向性评分分层法(Propensity Score Stratification/ Subclassification),倾向性评分匹配法(Propensity Score Matching, PSM),倾向性评分加权法(Propensity Score Weighting,PSW),以及将倾向性评分作为协变量纳入统计模型进行调整分析的方法。倾向性评分法的原理是通过计算出在给定协变量的条件下观察对象被分到暴露组的概率,将其作为倾向评分值,然后根据得出的倾向评分值作为匹配或分层的依据从而实现对观察对象的事后随机化。倾向性评分法常采用Logistic回归和机器学习方法计算倾向性评分值,在变量较多而样本量偏小或变量间存在多重共线性时,使用机器学习算法计算倾向性评分值产生的偏倚更小,结果更为稳定。值得注意的是,研究者若在药品上市后安全性评价中考虑使用倾向评分方法时,建议在制定研究方案或分析计划时,预先指明用于构建倾向评分模型的变量,避免因想获得“理想”或“预期”结果而反复调整倾向评分模型的现象。
在应用倾向性评分进行统计分析时,需同时报告倾向评分校正前和校正后的混杂因素在处理组和对照组分布情况,并考虑运用倾向评分分析方法对最终结果可能造成的影响。倾向性评分法尤其适用于含有多个结局变量或者当暴露因素常见而结局事件罕见的研究,但倾向评分方法仅能处理可观测到的混杂,对数据库中未采集的残余混杂引入的潜在影响无法消除,因此建议在具体分析中针对残余混杂开展敏感性分析,以论证研究中残余混杂对于主分析结论的影响。
3.工具变量
基于上述多元回归方法和倾向性评分方法来控制混杂均存在一定的局限性——均不能对于未知、未测的混杂因素进行调整。而工具变量(Instrumental Variable)在分析中不涉及对具体的混杂因素/协变量的调整,因此能够控制未知、未测的混杂因素,进而能很好地估计出处理与结局的因果效应。当某变量与处理因素水平相关,且对结局变量的影响只能通过影响处理因素实现,同时又独立于暴露和结局的混杂因素,那么该变量可以称为工具变量,比如可以考虑将选择中成药上市时间或进入医保的时间等因素作为工具变量。确定工具变量后,通过对比工具变量对处理的影响效果和工具变量对结局的影响效果进而估计出暴露对结局的因果效应。此方法最大的难点在于找到合适的工具变量。
4.G方法
G方法是一类统计方法,主要包括G-formula,边际结构模型(Marginal Structural Model, MSM)和结构嵌套模型(Structural Nested Model, SNM)。这类方法除了能处理常规方法中的多维混杂外,还能够处理随时间变化的暴露和随时间变化协变量引起的时依混杂。如图2a中的处理因素A和混杂因素L均是时间独立性的变量,此时可以选择使用倾向评分方法和传统的多元回归分析法;但是图1b中的处理因素A和混杂因素L是时间依赖性变量,此时前述的混杂处理模型无法处理时依混杂,需选择使用G方法。G方法利用标准化、逆概率加权等方式,估计时序性反事实结局。例如MSM,通过计算时序累计暴露概率,模拟序贯随机试验,调整时依混杂,估计随时间发生变化的用药模式对于健康结局的影响。

图2 处理因素、混杂因素及研究结局因果关系示意图
5.结构方程模型
因结构方程模型(Structural Equation Modeling,SEM)能解决传统的回归模型无法分析原因变量对结果变量的间接效应问题而被广泛使用。结构方程模型通过将结构模型和测量模型结合起来进行统计分析。结构模型反映的是潜变量(无法直接观测的指标)之间因果关系;而测量模型反映的是观测指标与潜变量之间关系。传统的多变量回归难以有效地同时研究多指标和多变量之间的复杂关系。结构方程模型又称因果关系模型,在医学研究领域主要应用于验证某种理论假设的结构是否成立,或分析各个潜变量之间的因果关系、间接效应的因果关系等。
作为一种评估和验证因果关系的模型,结构方程模型可适用于多种情况,如在分析其他混杂因素与使用药品之间的关联时用到的中介效应模型;在处理不可测量因素对药品安全性的影响时;在分析使用药品对多个不良结局的影响时。
附2
缺失值填补方法
1.单一填补法
单一填补法(Single Imputation)是给每一个缺失值构造一个替代值,进而对填补后的数据集使用针对完整数据集分析的方法进行分析。常用的单一填补方法有:非条件均值填补(Unconditional Mean Imputation)、条件均值填补(Conditional Mean Imputation)、演绎填补(Deducive Imputation)、回归填补(Regression Imputation)、最近邻法填补(Nearest Neighbor Imputation)、热卡填补(Hot Deck Imputation)和冷卡填补(Cold Deck Imputation)。
2.多重填补法
多重填补法(Multiple Imputation)是同时给一个缺失值填补多个值,不止考虑到缺失值的均值还考虑到方差,在某种程度上克服了单一填补法的局限性。常见的多重填补方法包括:倾向性评分法,马尔科夫链蒙特卡罗(Markov Chain Monte Carlo),预测均值匹配(Predictive Mean Matching)等。
附3
词汇表
1.新用药设计(New User Design):仅纳入研究起始时首次用药的患者,或要求患者在用药前已经过一段未用药的“洗脱期”,通过设立适当的对照组进行比较,排除已用药者带来的偏倚。
2.现用药设计(Prevalent User Design):纳入研究起始时已用药一段时间的患者进行疗效评价,可能引入信息偏倚。
3.有向无环图(Directed Acyclic Graph, DAG):由变量和有向边构成的图形工具,图中封闭无环路,直观反映变量间的因果关系,常用于指导研究设计和统计分析的混杂因素选择。
4.错分偏倚(Misclassification Bias):由于研究对象的某个特征、暴露或结局被划分到了错误的类别中,而导致的研究结果与真实情况间出现了偏差。
5.不死时间偏倚(Immortal Time Bias, ITB):患者在研究开始到真正接受暴露之间可能存在一段时间间隔,这段时间内,患者必须存活才能正式进入研究,因此被称为不死时间。这段时间实际未暴露,如果不死时间被错误分配到暴露时间或未能合理分类,会导致效应估计与真实情况间偏差。