腓骨长肌腱比腘绳肌更好吗?解析一篇ACL Meta分析的硬伤
副标题:森林图把方向标反了——一份临床医生的方法学审查日记
引子:一个临床决策背景
在膝关节运动医学里,前交叉韧带(ACL)重建的移植物选择是一个永远不会过时的话题。腘绳肌腱(HT,主要是半腱肌 ± 股薄肌)已经用了三十多年,是当今全球最主流的自体移植物之一。最近几年,腓骨长肌腱(PLT)作为新选择越来越受到关注,特别是亚洲——印度、中国、巴基斯坦、印尼、土耳其的临床比较研究密集涌现。
2026 年 3 月,Cureus 上线了一篇新的系统综述与 Meta 分析:Peroneus Longus Tendon Versus Hamstring Tendon Autograft for Primary Anterior Cruciate Ligament Reconstruction。32 项研究、约 2500 例患者、其中 10 项 RCT —— 数据量看上去相当扎实。
作者的核心结论一句话能讲完:PLT 与 HT 在功能评分(IKDC、Lysholm)和稳定性(Lachman、anterior drawer、pivot shift)上没有差异;PLT 在大腿围度保留方面"显著优于"HT;踝关节功能(AOFAS)"未受影响";因此 PLT 是 HT 的"safe and reliable alternative"——一个"安全可靠的替代方案"。
听起来挺干净。但当我们坐下来逐图、逐表、逐参考文献地核对,会发现这篇文章在多个层面上经不起推敲——而且这些问题中相当一部分,不是高深的方法学争论,而是肉眼可见的硬错误。
下面我们把这些错误一条一条摆出来。这不是为了否定 PLT 这个移植物本身,而是为了让大家看清楚:循证医学在阅读层面,远比"看摘要、看 P 值"复杂。
一、森林图把方向标反了
我们先从最直观的一处错误说起。
论文 Figure 4 比较两组的"大腿围度"。这是论文最强的阳性发现:作者声称 PLT 组的大腿围度比 HT 组显著保留,差异 0.92 cm(95% CI 0.72–1.11),作为"PLT 取材后大腿肌肉萎缩更轻"的核心证据。
问题来了。我们看实际数据:Agarwal 2023 这一行,HT 组数值是 0.88,PLT 组是 0.216;Soni 2026 这一行,HT 是 1.367,PLT 是 0.751。从数值和作者文字看,这显然不是绝对围度(绝对围度通常 40 到 50 cm),而是围度减少量(健患侧之差),也就是肌肉萎缩量。HT 那一侧萎缩更多,意味着 HT 不利、PLT 占优——这一点和作者文字里写的"HT 萎缩更明显"是一致的。
合并的 Mean Difference(HT − PLT)= +0.92,正值,落在森林图的右侧。按照逻辑,正值应当落在 "Favours PLT"(PLT 更好)一侧。但森林图右侧标签写的是 "Favours [HT]"——HT 更好。
这是一个典型的方向标错。如果一个不熟悉数据来源的读者只看图,会以为 HT 更好。如果熟悉的读者只看作者文字,会以为 PLT 更好。两者打架。
而且这不止 Figure 4 一处。Figure 3 Lysholm 评分的 favour 标签同样反了:MD = HT − PLT,Lysholm 越高越好,负 MD 应当 favour PLT,但 Figure 3 把负值一侧标成了 "Favours [HT]"。三张主要森林图里有两张方向标反,提示图表方向设置或最终核对环节存在系统性问题。
更进一步地,作者在不同地方对这个结局的文字描述本身也不统一:正文写"thigh circumference was significantly higher in patients in the hamstring group"——HT 组围度更高;摘要和讨论又写"HT 组 reduction 更大、PLT 组 preservation 更好"。如果这个指标其实是"围度减少量",那"数值越高"反而是越糟。结局名称、方向和解释从头到尾没有统一——这才是读者无法放心使用这个结果的根本原因。
另外,Figure 4 中个别研究的 SD 极小,比如 Soni 2026 的 SD 仅 0.087 / 0.065 cm(也就是不到 1 mm 的标准差),这在生物学上不太可信,需要回到原始研究核查单位、SD 与 SE、或者是否为 change score。该研究在合并中权重达 14.9%,是 thigh circumference 这个"PLT 最强阳性结论"的主要驱动者之一。
二、"八项研究"还是"十项研究"
Figure 4 还有一个更基础的错误。论文正文写:"Eight studies were included in the pooled analysis to compare thigh circumference"——纳入了 8 项研究。
但森林图里实际显示了 10 行:Agarwal 2023、Asif 2024、Dwidmuthe 2024、Gök 2024、Kapoor 2025、Rhatomy 2019、Sari 2025、Saugat 2025、Soni 2026、Waly 2022。Heterogeneity 那一行写的 df = 9,对应 10 项研究。下面的参考文献列表也是 10 个。
是 8 还是 10?作者的正文说 8,所有可核实的图表证据都是 10。这意味着主分析里有两项研究,作者自己都没算清。
三、Table 4 自己和自己打架
继续往下看。论文做了"按随访时间分层"的亚组分析:6 个月、12 个月、24 个月。
Table 4 显示 IKDC 6 个月的 Mean Difference 是 −1.64,95% CI 是 −2.73 到 −0.55。CI 不含 0,统计学上显著。
但同一段落的正文写:"In all follow-up points, neither of the outcomes was significantly different between the two groups"——所有随访点都不显著。
而到了讨论部分(第 12 页),作者又写:"IKDC scores were significantly higher in the PLT group at six months"——6 个月时 PLT 显著更高。
同一个数据,论文里出现了三种相互矛盾的描述:表里显著、结果文字里说不显著、讨论里又说显著。作为读者,你信哪一个?
四、Table 6 表头标"OR",里面塞了 MD
Table 6 是"次要结局比较",包括前抽屉、Lachman、pivot shift、graft failure、graft diameter、AOFAS。表头明确写"OR (95% CI)"——比值比。
但 Graft Diameter 这一行是 −0.69 (−0.86 to −0.52)。比值比怎么会是负数?显然这是 Mean Difference,不是 OR。AOFAS 那一行带了星号,脚注说"Presented as mean difference",但 Graft Diameter 没有星号、没有任何说明。
简单说:表头说一种东西,里面塞另一种东西,从投稿到见刊都没有被纠正。
五、参考文献张冠李戴
论文里被反复引用的"Rhatomy et al. [8]"——所有森林图里都出现了它,因为它是 PLT 与 HT 比较的关键早期研究。但参考文献清单里 [8] 实际是:
Catma MF, Dulgeroglu D, Guroz AN, Kuzucu Y. Association between knee flexor strength and preservation of the tibial attachment of the sartorial fascia during hamstring tendon harvest. Orthop J Sports Med. 2024.
这是一篇关于 sartorial fascia 与膝关节屈曲力量的研究,作者是 Catma 等人,不是 Rhatomy。真正的 Rhatomy 2019 PLT vs HT 比较研究是 [7]。
严格说,我们不能据此断言作者真的从 Catma 那篇文献里提取了 Rhatomy 的数据;更可能的解释是文献编号错位或文献管理软件出错。但无论如何,这个错误意味着——读者无法按引用编号追溯数据来源。对一篇 Meta 分析来说,这是数据可追溯性最起码的一关,连这一关都失守,是一个相当大的红旗。
六、AOFAS 的 MCID 9 分,引的是肩关节文献
论文在讨论 PLT 取材是否影响踝关节功能时,使用 AOFAS(American Orthopaedic Foot and Ankle Society)评分。两组差异 0.17 分,作者写:"the magnitude of difference was far below the established MCID of 9 points [69]"——远低于 9 分的最小临床重要差异,因此踝关节功能 clinically comparable。
听起来很合理。但参考文献 [69] 是:
Su F, Allahabadi S, Bongbong DN, Feeley BT, Lansdown DA. Minimal clinically important difference, substantial clinical benefit, and patient acceptable symptom state of outcome measures relating to shoulder pathology and surgery: a systematic review. Curr Rev Musculoskelet Med. 2021.
一篇关于肩关节 MCID 的系统综述,被拿来支持踝关节 AOFAS 的 MCID = 9。这两件事完全是两个解剖部位、两套量表。
更关键的是,AOFAS 是综合性踝-后足评分,它本身并不是专门用来测量 PLT 取材后外翻力量、第一跖列跖屈力量或动态踝稳定性的工具。即使 AOFAS 没差异,也不能排除细微但与运动相关的踝外翻力矩缺陷——而这恰恰是 PLT 取材最容易出问题的地方。更理想的指标应当包括 FAAM / FADI、等速或等长踝外翻力矩、足底压力分布与运动相关测试。论文用 AOFAS 没差异 + 错引的 MCID 来作"踝功能 clinically unaffected"的判断,论证基础是单薄的。
到这里,六处肉眼可见的错误是论文质量的最直接证据。但这只是表层。
往下看方法学层面,问题更结构性。
七、亚组结果不一致
论文的主分析合并了 10 项 RCT 和 22 项观察性研究。这本身不是绝对禁忌——更稳妥的做法是分层呈现,并做交互检验或敏感性分析。
而论文最有意思的地方在 Table 5:作者按设计做了亚组分析。
| 结局 | RCT 亚组 | 观察性亚组 |
|---|---|---|
| IKDC | MD = −1.85 (−3.29 to −0.42),显著 | MD = −0.10 (−1.14 to 0.94),点估计接近零 |
| Lysholm | MD = −2.11 (−3.61 to −0.62),显著 | MD = +0.20 (−0.55 to 0.96),点估计方向相反 |
也就是说:IKDC 上 RCT 显示出小幅 PLT 优势、而观察性研究接近无差异;Lysholm 上则连点估计的方向都相反——RCT 提示 PLT 更好,观察性研究则微微偏向 HT。
这种不一致可能来自多个层面——偏倚、随机误差、设计差异或临床异质性。可能是观察性研究里的 confounding by indication(医生选择移植物时会考虑患者身材、依从性、运动水平,造成两组本身就不可比),可能是 RCT 里盲法不充分(10 项 RCT 中有 4 项被作者自己评为 outcome measurement high risk),也可能是研究数较少、亚组样本不足导致的随机波动,或是不同设计里入选患者本身存在临床差异。
但作者的处理方式是:把这两个不一致的亚组结果直接平均掉,得到主分析"无差异",然后又用 RCT 亚组"显著"作为推荐 PLT 的证据。这两件事不能同时被用来支撑强结论——如果你信主分析的"无差异",就不能再用 RCT 亚组的"显著"去推荐;如果你信 RCT 亚组的"显著",就不能再用主分析的"无差异"去说"两者等效"。
更关键的是,论文没有做 subgroup interaction test——也就是说"RCT 显著、观察性不显著"是否真是统计上的差别,作者没检验,只看了一组 P 值显著、另一组不显著就下了结论。这是 Meta 分析里很常见的解释陷阱:两个亚组各自的显著性差别,并不等于亚组之间存在交互效应。
八、偏倚风险评估工具偏粗、不匹配
论文 22 项观察性研究使用的是 Newcastle-Ottawa Scale(NOS)。NOS 是一个流行但相对粗糙的工具,对队列研究的"选择 / 可比性 / 结局"做总分评估。
NOS 可以粗略评价选择、可比性和结局,但对非随机干预比较里最关键的几个核心偏倚——confounding by indication(适应证混杂)、selection into intervention(干预选择)、deviation from intended intervention(偏离预期干预)——它的评估框架不够细。Cochrane 推荐的工具是 ROBINS-I,正是为非随机干预比较设计的。
后果是:作者用 NOS 把 22 项里 16 项评为 good,结论里写"included studies demonstrated moderate to high methodological quality"——总体质量中到高。但如果把这些研究放进 ROBINS-I 框架里重评,部分研究可能因混杂控制不足、干预选择不清、结局评估不盲等问题被降级(具体等级需要逐篇核实)。仅在工具层面,"NOS good"不应直接等同于"低偏倚风险"。
九、没有方案注册,没有 GRADE,没有发表偏倚评估
这里需要先把三件事分清楚:
- PRISMA 2020 是报告规范——要求作者透明说明方案 / 注册情况、检索策略、纳入排除标准等。它本身不是质量评分工具。
- AMSTAR 2 是方法学质量评估工具,强调预先方案、PICO、检索充分性、RoB 工具、统计模型、发表偏倚等核心域。
- GRADE 是结局层面证据确定性评级框架——对每个主要结局单独评分,分为 high / moderate / low / very low。
三者方向一致但层级不同。
具体到这篇论文:
- 没有 PROSPERO 注册号或公开方案——主要结局、亚组分析(特别是按时间和按设计的亚组)、敏感性分析是否预先指定,无从判断。
- 没有 GRADE 证据确定性评价——摘要和结论里"safe / reliable / viable"等措辞理应对应每个结局的证据等级,但既然没有这一层评估,强语气就站不住。
- 没有发表偏倚 / 小研究效应评估——IKDC 29 项、Lysholm 23 项研究数充足,按通行做法应当至少考虑并说明(漏斗图、Egger 等是常见手段,在高异质性下解释要谨慎,但不至于只字不提)。
PLT 是新兴术式,相关研究多为单中心小样本研究,地区分布也比较集中,正是发表偏倚和小研究效应最容易出现的领域。作者没有评估这些风险,因此无法判断阳性结论是否受到选择性发表的影响。
十、统计显著 ≠ 临床有意义
这是临床医生最容易忽略的一关。
论文 RCT 亚组显示 IKDC MD = −1.85,Lysholm MD = −2.11,CI 不含 0,统计显著。作者自己在讨论里也提到 IKDC 的 MCID(minimal clinically important difference,最小临床重要差异)是 9 到 20 分。
也就是说,这 1.85 分的差异,通常低于患者可感知或临床决策所需的最小差异。MCID 的意义就在于这是一条群体层面的"临床显著阈值"——低于这个阈值的群体均值差异,不应被作为临床优越性的证据,更不应该指导手术决策。
需要补一句的是:Lysholm 的 MCID 不能直接套用 IKDC 的 MCID。Lysholm 是另一套量表,在 ACL 重建人群里的 MCID 文献报告各有不同(常见区间约 8–10 分),但本篇论文既没引用 Lysholm 自己的 MCID,也没单独讨论 −2.11 在 Lysholm 量纲下的临床意义——它直接把 IKDC 的"低于 MCID"逻辑挪用到了 Lysholm 上。这是一种偷懒,也是另一种 spin。
但摘要里这一条被写成了 "demonstrated significantly higher IKDC and Lysholm scores in the peroneus longus tendon group"。统计显著被包装成临床优越——这是循证医学里被反复批评的 outcome reporting spin(结论偏移)。
那么,PLT 到底比 HT 好还是不好?
讲到这里,我得说清楚态度:上述所有批评,都不是说 PLT 这个移植物本身不好。
PLT 在生物力学上的特性是确实存在的——长度足够(25–28 cm)、直径稳定、抗拉强度不输四股 HT、取材在膝关节远端、不破坏屈伸平衡。这些都是真实的解剖学和力学优势。临床上,对身材较小、HT 直径偏细的患者,PLT 是值得考虑的选择。
我们要说的是:这篇 2026 年的 Meta 分析,在它现有的形式下,无法支持"PLT 是 HT 的安全可靠替代"这个结论。它能支持的最多是:"在低确定性证据下,未发现 PLT 和 HT 在 IKDC、Lysholm、粗略稳定性测试和 AOFAS 上有临床意义的差异。"
而我们最缺的,恰恰是这篇 Meta 分析没真正回答的几个关键问题:
- PLT 移植物长期再断裂率(≥ 5 年随访)
- 翻修率
- 重返运动率(RTS)和 ACL-RSI
- KT-1000 / 2000 定量松弛度
- 长期骨关节炎进展
- 等速踝外翻力矩(不是 AOFAS)
- 同期半月板 / 软骨损伤的处理
- 不同 PLT 形态(半束 / 全束 / 双束)的差别
- HT 不同股数(4-strand vs 6-strand)的差别
需要澄清一点:论文 Table 6 确实合并了 graft failure(OR = 1.24,95% CI 0.55–2.80),但没有清楚交代事件定义、事件数、随访时间是否对齐。这远不足以替代上面这种"长期硬终点"。其余几条则要么没报告、要么没分层、要么没做。
给读者的三条建议
如果你是临床医生、医学生、或任何会读 Meta 分析做决策的人,下面三条值得记住。
第一,看图比看摘要更重要。
摘要是作者最想让你看到的版本。森林图、表格、PRISMA 流程图、参考文献清单才是数据本身。本篇论文的摘要写得相当克制和漂亮,但所有"硬伤"都在图表里。养成至少看一眼森林图方向标签的习惯,比读三遍摘要更有用。
第二,"统计显著"和"临床有意义"是两件事。
P 值 < 0.05 不等于差异值得让你改变手术决策。学会问一句:"这个差异有没有超过 MCID?"如果作者没提 MCID,你应当主动去找原始量表的研究——这是一分钟的工作,但能挡掉一半的"循证决策"陷阱。
第三,亚组结果方向不一致时,应当怀疑而不是高兴。
本篇 RCT 亚组 PLT 占优、观察性亚组无差异,作者把它当作"证据更强"的迹象。但这其实是偏倚警报。当不同设计、不同人群、不同分析方法给出方向相反的结果时,第一反应应当是问"哪一组更可信、为什么",而不是挑一个对自己叙事有利的去用。
写在最后
这篇 Meta 分析最让人感慨的不是它错了几处——任何论文都会有错——而是它的错呈现出一种集中性:图表方向、研究计数、表头单位、参考文献编号、MCID 引用,多个层面同时失守。这通常意味着作者团队在数据提取、图表生成、结果撰写之间缺乏统一的核对环节。
它真正能支持的结论,最多是:在低确定性证据下,现有研究未显示 PLT 与 HT 在 IKDC、Lysholm、粗略稳定性检查和 AOFAS 上存在临床重要的差异。
而它最强的阳性结论——PLT 更好地保留大腿围度——受到 Figure 4 研究数不一致、结局方向解释混乱、森林图 favour 标签反向和高度异质性的影响,不能直接作为临床推荐的依据。至于 PLT 是否能在长期再断裂率、翻修率、重返运动、踝外翻力量和运动表现上真正不输 HT,还需要更规范的 RCT 和更长期的硬终点数据。
ACL 移植物的选择是临床真实的难题。我们需要更好的证据,而不是更多看上去整齐的 Meta 分析。
下一次再有人拿"32 项研究、2500 例患者"作为权威依据时,不妨先把森林图放大看一眼方向标签——很多事情,从那里就能看出端倪。
作者:茅泳涛医生,苏州大学附属第二医院骨科运动医学
本文基于对 Rasul 等 2026 年 Cureus 论文(DOI: 10.7759/cureus.105983)的方法学审查