非劣效性研究的桎梏
非劣效性研究的桎梏的核心信息是什么?
概 要 由于认为替代方案必须不劣于已批准的方案,因此试图以较低剂量、较低频率或较短持续时间的替代方案来降低已批准治疗方案的毒性和成本的努力受到限制。非劣效性试验规模大且成本高昂,因为它们必须从统计学上证明替代疗法和批准的疗法在单个结局上存在差异,其界值远小于证明优效所需的界值。非劣效性的缺陷是显而易见的:它忽视了对已批准治疗方案的反复评估所产生的变异性,未能...
概 要 由于认为替代方案必须不劣于已批准的方案,因此试图以较低剂量、较低频率或较短持续时间的替代方案来降低已批准治疗方案的毒性和成本的努力受到限制。非劣效性试验规模大且成本高昂,因为它们必须从统计学上证明替代疗法和批准的疗法在单个结局上存在差异,其界值远小于证明优效所需的界值。非劣效性的缺陷是显而易见的:它忽视了对已批准治疗方案的反复评估所产生的变异性,未能认识到类似设计的试验将被标记为优效性或非劣效性,具体取决于它是在已批准疗法的初始注册之前还是之后进行的,并且弱化了毒性和成本等终点。 属于「Onco前沿」分类。 关键词:临床研究、随机对照试验。 本文由 TalkMED 拓麦医学编辑团队审核发布,内容来源清晰、引用完整,符合平台编辑方针和利益冲突披露政策。
本文核心问答
Q1: 该研究的关键数据和临床意义是什么?
出现这种情况是因为非劣效性试验设定了非常严格的统计限制,替代治疗应导致一定程度的益处(例如,总生存期或其潜在的替代生存率)只能略低于批准的剂量和方案所达到的收益。该界值是主观确定的,但可能要求替代治疗提供的效果(例如,生存风险比HR)比批准的治疗差20%以下(例如,HR小于1·2)。通过绝对衡量标准(例如中位生存期)来描述非劣效性界值也是可能的,这将使患者和肿瘤学家更容易确定什么是可接受的。然而,更常见的是,非劣效性的建立要求替代治疗获得的生存率HR的95%CI的上限应低于标准治疗的非劣效性界值。
Q2: 这篇文章的来源和作者资质如何?
参考文献DOI:10.1016/S1470-2045(24)00218-3。发布于2024-10-14。
Q3: 本文涉及哪些核心医学术语和研究方向?
本文围绕「非劣效性研究的桎梏」主题,涉及临床研究、随机对照试验等核心术语和研究方向。文中涉及的核心术语定义:FDA即美国食品药品监督管理局(Food and Drug Administration);RCT即随机对照试验(Randomized Controlled Trial);HR即风险比(Hazard Ratio),用于衡量两组间事件发生风险的比值;CI即置信区间(Confidence Interval),表示估计值的可信范围;HER2即人表皮生长因子受体2(Human Epidermal Growth Factor Receptor 2)。。研究方法方面,统计分析采用Kaplan-Meier生存分析等方法。
Q4: 该研究采用了什么研究设计和方法?
本研究采用荟萃分析/系统综述和随机对照试验(RCT)和临床试验设计。主要终点指标包括主要终点、次要终点、总生存期(OS)、生活质量评分。

概 要
由于认为替代方案必须不劣于已批准的方案,因此试图以较低剂量、较低频率或较短持续时间的替代方案来降低已批准治疗方案的毒性和成本的努力受到限制。非劣效性试验规模大且成本高昂,因为它们必须从统计学上证明替代疗法和批准的疗法在单个结局上存在差异,其界值远小于证明优效所需的界值。非劣效性的缺陷是显而易见的:它忽视了对已批准治疗方案的反复评估所产生的变异性,未能认识到类似设计的试验将被标记为优效性或非劣效性,具体取决于它是在已批准疗法的初始注册之前还是之后进行的,并且弱化了毒性和成本等终点。例如,虽然通常需要毒性较小且成本较低的 3 月方案来证明自身疗效不劣于 6 个月的标准方案,但所谓标准治疗却没有被要求证明其优效性。这种情况是非劣效性试验的桎梏:它的统计数据使成本效益较低的方案长期存在,这些方案不是以患者为中心的,它对替代方案施加了不成比例的更大举证责任,即使强度较低的疗法具有与标准疗法几乎相同的生存获益。这种方法是不合逻辑的。我们建议放弃将试验指定为优效性或非劣效性,并且从今以后应将随机对照试验简单地描述为“比较性”。
几十年来,抗癌药物的剂量和疗程的批准原则几乎没有变化,试验设计的调整很小,而药物却已从化疗转变为具有明确靶点的靶向药物。传统上,1期临床试验通过增加新药或联合药物的剂量来尝试治疗小样本患者,直到达到某个预定的毒性阈值,然后在2期和3期试验中使用这种最高耐受剂量。尽管在一系列较低剂量下已经具有最大的靶点抑制作用,并且许多靶向药物的剂量与抗癌活性之间没有明显的关联,但这种模式在新靶向药物临床试验中仍然普遍存在,过量剂量时观察到脱靶效应会产生临床毒性。疗程的确定也经常借鉴化疗,其中3周或4周的周期主要考虑允许骨髓恢复,药物开发者很少根据药代动力学或药理学信息而改变疗程设计,而这些信息本可以确定足以维持血液中的药物水平或抑制分子靶标的给药频率。治疗持续时间,尤其是辅助治疗,很少基于前瞻性证据,甚至可能导致比获得最大获益所需的持续时间更长。因此,许多抗癌药物的使用剂量和疗程比提供最大抗肿瘤效果所需的剂量和疗程更强烈,从而产生不必要的毒性。美国食品和药物管理局(FDA)在2021年推出Optimus项目时已经认识到了这个问题,要求进行剂量优化研究,但FDA无权要求对已批准的药物进行此类研究。
当药物获得美国FDA或欧洲药品管理局的批准和注册时,通常基于一两项随机对照试验(RCT),将其与以前的标准疗法进行比较,这些试验中使用的剂量和方案通常会被纳入处方信息,也称为药物说明书。任何偏离批准的剂量和给药方案都是超说明书使用,尽管没有证据表明批准的剂量和给药方案是最佳的,有时甚至会带来不必要的伤害。例如,ibrutinib用于淋巴瘤的注册剂量和sotorasib用于KRAS突变的非小细胞肺癌的注册剂量过高,会引起不必要的毒性。接受不同的(例如,强度较低)剂量和方案被认为需要在非劣效性试验中对疗效和批准的标准治疗方案进行比较。此类试验需要大样本量(通常大于确定新治疗的优效性RCT)。出现这种情况是因为非劣效性试验设定了非常严格的统计限制,替代治疗应导致一定程度的益处(例如,总生存期或其潜在的替代生存率)只能略低于批准的剂量和方案所达到的收益。制药行业不热衷于进行可能降低其利润的临床试验,因此,进行非劣效性剂量和疗程优化试验的重任往往落在学术研究人员和政府资助者身上。对大样本量的要求阻止了学术研究人员进行剂量优化试验。再加上大量的时间和财务费用,这样的试验可能会找到一种替代方案,在数值上等同,但在统计学上并不劣于标准,因此不一定会改变实践,这使得规避风险的学术研究人员和资助者不太可能追求这样的方向。
其他临床上重要的结局指标,如毒性和成本(可能决定治疗的可及性)在典型的非劣效性研究中被弱化为次要终点。此外,如后一段所述,将具有相关对照组的RCT指定为优效性或非劣效性将取决于它们何时进行与药物批准相关的操作。这一因素以及要求通过更大规模的研究来确定可能对患者和卫生系统更友好的替代疗法,而不是关心新疗法是否可能有害是不合逻辑的,并且与审慎的临床原则背道而驰。本文总结了非劣效性试验的这些问题和其他问题,并在以下段落中进行了讨论。我们应该认识到,所有RCT都试图回答同一个基本问题:“哪种治疗方法对患者更好?归根结底,它们都是对照试验。
非劣效性界值
经典非劣效性试验的设计要求围绕标准疗法获得的主要结局建立非劣效性界值。该界值是主观确定的,但可能要求替代治疗提供的效果(例如,生存风险比HR)比批准的治疗差20%以下(例如,HR小于1·2)。通过绝对衡量标准(例如中位生存期)来描述非劣效性界值也是可能的,这将使患者和肿瘤学家更容易确定什么是可接受的。然而,更常见的是,非劣效性的建立要求替代治疗获得的生存率HR的95%CI的上限应低于标准治疗的非劣效性界值。这种方法经常导致非劣效性试验的自相矛盾和令人困惑的结论:缺乏证据证明已批准的治疗具有优越性,但由于替代治疗的生存率可信区间与已批准治疗相关的非劣效性界值重叠,因此无法确定替代治疗的非劣效性。由于正式的非劣效性假说尚未被拒绝,研究人员得出结论,注册的治疗方法继续作为标准治疗。
图中显示了六项此类非劣效性试验的总生存曲线和无病生存曲线,比较了结直肠癌3个月和6个月辅助治疗:这些大型研究表明,尽管他们的生存曲线几乎是重叠的,但它们未能建立非劣效性。一些非劣效试验报告了替代治疗相比于已注册治疗可能导致更差主要结果的概率(即,贝叶斯后验概率),假设前期概率是无信息的。建立经典的非劣效性要求概率小于2·5%,但对于降低毒性和成本的治疗,许多患者和肿瘤学家会接受更高的概率。例如,一种治疗提供的主要终点不如批准的疗法(即,超出预先规定的差异范围)的概率低于20%,在常人眼中,如果它减少了毒性、成本、时间投入和环境影响,则可能被认为优选,从而惠及更多。我们已经估计了每项试验和图中所示的荟萃分析低于劣效性界值的概率:如表所示,这些估计值范围为6%至24%。该分析还忽略了替代疗法可能优于其主要终点的可能性。
比较试验的分析不应取决于何时进行
曲妥珠单抗辅助治疗HER2阳性乳腺癌的试验提供了优效性和非劣效性试验的不合逻辑的一个例子。最初的三臂HERA试验比较了1年和2年的曲妥珠单抗与安慰剂,治疗1年或2年的无病生存曲线基本相同,均优于安慰剂,1年的持续时间在当时被接受:更少的治疗、更少的毒性和更低的成本。另一项大型试验证实了与安慰剂相比,曲妥珠单抗1年的益处。随后,两项大型(和一项较小的)试验比较了6个月和1年的治疗。在大型PHARE试验(图A)和PERSEPHONE试验中,曲妥珠单抗治疗6个月和12个月后的生存曲线基本相同,PHARE中较短治疗的非劣效性被拒绝,因为较短治疗的生存率CI与非劣效性边缘重叠;相比之下,非劣效性在PERSEPHONE中被接受,但并未导致对较短持续时间的广泛采用。随后,在Short-HER和SOLD试验中比较了9周或1年的曲妥珠单抗治疗(图B),再次显示重叠的生存曲线,但未能正式确立非劣效性,尽管对几项试验的荟萃分析得出结论,与1年治疗相比,短期曲妥珠单抗的非劣效性。如果先进行Short-HER和SOLD试验,而不是HERA和其他注册试验,曲妥珠单抗治疗9周是标准的,随后的试验将寻求确定较长治疗持续时间的优越性。尽管与其他药物相比,曲妥珠单抗的毒性不大,但持续时间较短的试验显示心脏毒性较小。此外,与药物相关的支出与持续时间成正比:曲妥珠单抗的治疗持续时间为9周(四个3周周期)而不是1年(17个周期)的曲妥珠单抗可降低76%的直接药物成本,并可能极大地改善低收入和中等收入国家获得该药物的机会,并减轻管理心脏副作用的经济负担。最后,缩短的治疗减少了住院次数(从而带来生活质量和环境效益),可能提高依从性。
曲妥珠单抗生物仿制药的使用降低了治疗成本,增加了可及性。美国FDA已经制定了进行此类试验的指南;它将此类研究视为等效试验,并考虑全部证据,包括药代动力学和药效学信息,从而促进合理样本量的试验。如果将这些试验作为非劣效性试验进行分析,则大多数试验不会确定生物仿制药与注册产品的非劣效性。更广泛的标准也有助于在合理样本量的RCT中评估新产品,例如皮下注射曲妥珠单抗。我们认为这些试验在支持生物类似药和其他产品的使用上是合适的,但令人难以理解的是,曲妥珠单抗生物类似药是基于与原研药对比的随机对照试验(RCT)被接受的,而这些试验纳入的患者数量少于前述一些试验,这些试验显示出治疗时间较短的方案有重叠的结果。
降低主要终点优势的替代方法
比较两种治疗方法的试验的通常原因是确定哪种治疗方法更好——首选的治疗方法可能更好,因为它引起的毒性更小,生活质量更高,更容易管理,需要的医院就诊次数更少(从而对生活质量和环境影响产生好处),或者因为它的成本更低,因此为更多原本负担不起的人提供了机会。该试验必须显示生存率等结局几乎相等,但许多个人和政策制定者会接受生存概率的小幅降低,以减少毒性、降低成本和提高患者可用性,尤其是不可治愈的疾病,例如转移性肿瘤。应该倾听有望从采用毒性较小、成本较低的治疗方法中受益的人的声音:已经或将要接受标准治疗的患者,以及其他因成本而完全被拒绝治疗的患者。
一种认识到在比较替代疗法的研究中考虑多个终点的重要性的分析是广义配对比较方法。比较当前标准和替代(例如,强度较低)治疗的组中的个体被配对,每对被分配一个+1、-1或0的分数,代表获益(有利于当前标准),伤害(支持替代方案),或这对患者的两个患者之间没有差异。然后对所有可能的对分数进行平均,以提供与替代治疗相比当前标准净治疗获益(或危害)的总体衡量标准。获益和危害的定义可以基于优先结果,例如生存时间和严重毒性。如果接受标准治疗的患者存活时间更长,则评分为+1;如果接受替代治疗的患者存活时间更长,则评分为-1;如果两名患者还活着或死亡时间相似,则使用毒性严重程度计算这对患者的评分。
这种方法在概念上很简单,很容易应用于有个体患者数据的前瞻性RCT。例如,在比较前列腺癌间歇性与持续性雄激素去势治疗的试验中,作者得出结论,他们的结果“在统计学上没有定论”。然而,间歇性治疗的总生存率比持续治疗差的概率仅为9%(表格),并且间歇性治疗与更好的勃起功能和改善心理健康相关。使用广义配对比较对这些数据进行分析将对这两种治疗方法的收益-风险概况提供更多的更丰富的信息。
效用是卫生经济学中使用的一个概念。可以通过生存持续时间和患者经历生存状态的效用的乘积来比较两种治疗方法:健康状态以十分位数增加,最高100%为完美健康。一种允许患者在近乎完美的健康状态下中位存活3个月且效用为90%(乘积=0·27)的治疗将比提供中位生存4个月且效用为60%的毒性更大的治疗(乘积=0·24)被认为更好。效用可以应用于比较更多和更不激进的治疗的试验组,配对比较方法是这个概念的延伸。
不接受与注册标准治疗具有相似疗效但毒性较小且成本较低的治疗方法是不合逻辑的,对患者不利。非劣效性试验的设计受到不必要的限制,导致可能对患者更有意义的替代治疗方案被无理排斥。应分析所有比较试验,以确定哪种治疗方法最适合患者。特别是在肿瘤学中,确定哪种治疗方案更好可能基于积极和消极作用之间的平衡。虽然制药行业没有动力评估或支持使用低强度方案,但应激励支付方、学者型医生和患者联合进行这些试验。如果认识到可以用较小的样本来判断风险-收益,那么进行这些基本试验的可行性就会增强,特别是因为此类试验可以因为节省药物成本来资助。
专家小组讨论:非劣效试验设计和解读中的问题
1 非劣效性边缘界值取决于单一终点结果,例如总生存期,或其潜在(通常较差)替代终点。
2 试验需要大样本量才能显示所选结果的非劣效性,因为只有当主要终点被证明不比标准治疗差时,强度较低(和/或毒性较小或成本较低)的治疗才会被接受。确立非劣效性比确立优效需要更多证据。
3尽管非劣效性试验可以自筹资金,替代治疗组的药物成本也更低,但由于样本量大,它们往往因成本昂贵而不可行。
4 由于第 2 项, 强度较低(和/或毒性较小)的治疗可能会被拒绝,即使它们与标准治疗的叠加生存曲线相关。
5 非劣效性试验不强调重要的(有时是主导的)终点,包括毒性(耐受性)和成本。患者权益倡导者应参与这些比较试验的设计,以确保评估相关终点。
6 一项非劣效性试验在单个试验中将减少治疗的结局与标准治疗的结局进行了比较。它没有考虑重复试验中标准治疗结局的可变性。在假设的试验中,治疗结局的固有可变性可能导致无法证明治疗不劣于自身。
7 注册试验通常首先评估高剂量和长疗程,以最大限度地降低阴性的风险;这种风险最小化可能会导致不适当的药物说明书。制药公司有动机不赞助评估低强度治疗的试验,因为此类试验可能会导致药物使用量减少和利润减少。
8 比较不同治疗强度的试验,如果是在批准和注册之前进行的,称为优效性试验。而在已批准和注册特定剂量和方案后进行的类似试验,则称为非劣效试验。试验不应根据其进行的时间来评判,而应根据它们是否显示出对患者的益处来评估。

在非劣效性试验中获得的总生存曲线比较:(A) 1 年与 6 个月 或 (B) 1 年与辅助曲妥珠单抗治疗 HER2 阳性乳腺癌的 9 周;(C) 腹腔镜与切开术治疗 2-3 期结肠癌 (D) 非小细胞肺癌脑转移的最佳支持性治疗,有或没有全脑照射(E) 转移性前列腺癌男性的间歇性或持续性雄激素去势治疗 (F) 间歇化疗与连续化疗用于晚期结直肠癌一线治疗的比较(G) 比较结直肠癌辅助 FOLFOX 或 CAPOX 化疗 3 个月无病生存期与 6 个月无病生存率的试验的荟萃分析
对每项试验和荟萃分析的分析表明,未建立非劣效性(试验详情见表 1)。

表 图中所示7个非劣效性研究的细节
参考文献
1. doi:https://doi.org/10.1016/S1470-2045(24)00218-3
责任编辑丨郭筝
版权声明:本平台旨在帮助医疗卫生专业人士更好地了解相关疾病领域最新进展。本平台对发布的资讯内容,并不代表同意其描述和观点,仅为提供更多信息。若涉及版权问题,烦请权利人与我们联系,我们将尽快处理。仅供医疗卫生专业人士为了解资讯使用,该等信息不能以任何方式取代专业的医疗指导,也不应被视为诊疗建议。如该等信息被用于了解资讯以外的目的,本平台及作者不承担相关责任。合作联系邮箱:ONCO@edoctor.work。


点击"阅读原文"即可看原文
本文涉及的主要医学术语
文中涉及的核心术语定义:FDA即美国食品药品监督管理局(Food and Drug Administration);RCT即随机对照试验(Randomized Controlled Trial);HR即风险比(Hazard Ratio),用于衡量两组间事件发生风险的比值;CI即置信区间(Confidence Interval),表示估计值的可信范围;HER2即人表皮生长因子受体2(Human Epidermal Growth Factor Receptor 2)。
本文研究方法与设计类型
本研究采用荟萃分析/系统综述和随机对照试验(RCT)和临床试验设计。统计分析采用Kaplan-Meier生存分析等方法。
本文临床背景与意义
本文属于临床研究、随机对照试验等医学领域。该研究评估的终点指标包括主要终点、次要终点、总生存期(OS)、生活质量评分。
引用格式:非劣效性研究的桎梏. 发布日期:2024-10-14. 来源:TalkMED拓麦. URL: https://portal.talkmed.com/news/1404 参考DOI: https://doi.org/10.1016/S1470-2045(24)00218-3
分享
收藏
点赞


