手术机器人开发与临床应用的评估框架,强调多维度协作、标准化
发布时间:2026-09-21 06:53 浏览量:1
手术机器人正在全球范围内快速铺开,但一个尴尬的现实是:这些设备“用得怎么样”,长期缺乏系统性的评价手段。过去,评价散落在学术研究、企业自证和医院的单点探索中,始终没有形成一套官方认可、横向可比、与支付挂钩的使用评价体系-45。
这个问题的根源在于手术机器人本身的特殊性。它既是一台精密设备,又是一个与外科医生的操作深度耦合的系统,还涉及人工智能的集成和远程操作的可能性。传统医疗器械“上市前试验+上市后监测”的线性评价模式,很难覆盖这种复杂性。更麻烦的是,手术机器人经常在没有经过系统测试的情况下就被引入临床——这与药物治疗的阶梯式验证流程形成了鲜明对比。设备制造商积极向医生和患者推广产品,而不确定性、改善的愿望和个人偏见可能导致创新未经严格评估就被采用,给患者安全带来风险-
正是基于这一背景,近年来多个国际学术组织和监管机构开始构建专门针对手术机器人的评估框架。下面从几个核心维度展开介绍。
手术机器人评估的一个关键认识是:单靠任何一个群体都无法完成完整的评价。
2024年,IDEAL协作网发表了专门适用于手术机器人的评估框架,这是目前国际上最具系统性的成果之一。该框架由来自12个国家、81名研究者共同完成,从四个视角出发提出评估建议-6-:
设备开发者视角
:要求在同行评审期刊中标准化发布技术和临床数据,透明记录设备、适应症、患者和AI模型的变更-6。这意味着开发者不能只公布“好数据”,设备迭代过程中的每一次修改都需要有据可查。
临床医生视角
:需要定义并迭代“临床医生—设备整合”的过程,考虑认知负荷和操作行为,对于自主系统还要评估交接机制的可靠性和人类接管的原因-6。简单说,就是不仅看机器人“能不能做”,还要看医生“用起来怎么样”。
患者视角
:强调透明同意流程,涉及理论风险、证据水平、系统故障缓解方案、自主性水平、手术团队经验和潜在利益冲突-6。患者有权知道自己接受的机器人手术处于什么发展阶段、有哪些已知和未知的风险。
医疗卫生系统视角
:要求进行早期和迭代的经济建模,考虑手术机器人对不同医疗保健生态系统的影响,尽可能使用生命周期评估来提高可及性和可持续性-6。
另一个值得关注的协作视角来自学术研究。有学者提出,手术机器人评估中存在着 “隐形工作” ——即厂商派驻的临床支持专家在手术室中承担着设备调试、故障诊断和团队协调等关键角色,但这些贡献往往不被正式记录和认可。研究指出,这类协作实际上是一种“团队工作”,责任在工程师、临床医生、医院和监管机构之间是共享且分散的-。工程师创造系统,临床医生部署它,医院批准使用,监管机构认证其安全性——每个环节都参与了对“这台机器人是否安全”这个问题的回答-。
2026年发表的一项研究进一步提出了面向领导层决策的多学科评估框架,覆盖临床、运营、技术、治理、财务和患者安全六个领域,并开发了三种权重模型——临床医生加权模型、管理者加权模型和平衡模型,以适应不同组织的决策偏好-。
有了多方的参与,还需要统一的“尺子”。目前主流的评估框架通常从以下几个层面构建指标体系。
硬件与软件的基础指标。
美国胃肠内镜外科医师协会(SAGES)2025年发布的STARSS工具,将评估指标分为七个类别:基本信息、软件信息、硬件信息、可用性、安全特性、人机工程能力和培训与认证-1。这个工具的设计目的是帮助医院在采购时进行系统化的横向比较,同时也能揭示现有平台的优势和不足,为未来的系统开发提供方向-1。
临床结果指标。
在临床层面,脊柱手术机器人领域的系统综述提炼出五类核心指标:精度基准(如椎弓根螺钉置入的Gertzbein-Robbins分级)、手术参数(手术时间、术中出血量)、安全性与并发症、功能结局(如VAS疼痛评分、ODI功能障碍指数)、恢复与住院指标(住院时间、再入院率、再手术率)-。这些指标虽然具体内容因手术类型而异,但提供了一个可迁移的指标框架。
人因与操作性能指标。
腹腔镜手术机器人质量评估体系的研究通过24项核心指标和组合赋权法,发现机械安全性、操作范围与灵活性、系统稳定性、操作精确度被评估为最重要的指标-4。值得注意的是,这些指标中“操作精确度”和“灵活性”属于性能范畴,而“系统稳定性”和“机械安全性”则直接关系到患者安全——性能和安全在评估中是不可分割的。
标准化指标的制定方法。
目前国际上普遍采用
德尔菲法
来达成指标共识。例如,一项针对机器人手术系统标准化设置的国际共识研究,通过三轮德尔菲调查,来自13个国家的57名专家最终形成了涵盖系统知识、端口放置、对接操作等5大领域的85项核心标准-。另一项针对机器人辅助全腹腔镜子宫切除术的研究,通过两轮德尔菲会议达成了20个手术阶段和134项错误指标的共识-。这种方法的优势在于,它把“什么算合格”的判断从单一专家或厂商手中转移到了多学科专家群体的共识之上。
手术机器人的评估不能止于上市审批。长期监测是评估框架中最容易被忽视、却可能最关键的一环。
注册登记系统是目前长期监测的主要方法。
以Mako-MORE注册研究为例,这是一项前瞻性、多中心、基于注册的观察性研究,对使用Mako机器人臂辅助系统进行髋膝关节置换的患者进行从术前到术后五年的随访评估-。类似的,avatera系统在欧洲10个临床中心建立了注册登记,用于收集泌尿外科和妇科手术的上市后临床随访数据-。Versius机器人的注册研究则采用累积入组的方式,覆盖多个外科专业,并通过CUSUM图、p图和VLAD图等多种统计方法对医生学习曲线和设备性能进行实时监测-。
但目前注册登记系统存在明显短板。
IDEAL框架的研究者指出,现有的注册登记大多是企业内部数据集,聚焦于单一机器人系统,通常缺乏独立验证,且对真实世界数据的获取有限-。这意味着,厂商掌握的数据可能无法全面反映设备在实际临床环境中的表现,尤其是那些罕见但严重的不良事件。
上市后监测的另一条路径是监管数据库分析。
美国FDA的MAUDE数据库记录了大量手术机器人相关的不良事件报告。一项针对机器人辅助前列腺切除术的17年回顾分析发现,由于机器人系统上市时所需的上市前临床测试较少,上市后监测对于识别设备故障和患者伤害至关重要-。这类分析虽然是被动报告机制,但能为主动监测提供重要的信号补充。
长期监测需要向协作式、透明化的联盟模式转型。
IDEAL框架明确提出,长期监测应由真实世界数据主导,建立协作、透明和包容的联盟来进行数据收集-17。这意味着,未来的监测不能仅靠单个厂商或单个医院,而需要跨机构、跨厂商的数据共享机制。同时,对于集成了AI的系统,监测还需要定制化设计,以检测设备性能的动态变化-6。
综合以上各维度,一个完整的手术机器人评估框架可以概括为以下结构:
第一阶段(开发与早期验证)
:在同行评审期刊上标准化发布技术和临床数据,透明记录设备迭代变更。AI集成系统应先分别评估AI方面,再通过离线和模拟评估来评估集成系统。
第二阶段(比较研究)
:通过前瞻性数据收集评估风险和获益,使用验证过的工具探索人因因素,研究真实世界中的学习曲线,建立一致的机构临床治理政策。
第三阶段(长期监测)
:建立协作式注册登记联盟,由真实世界数据主导,评估设备性能的动态变化,对所有不良事件进行人类和卫生系统因素分析,并进行外科医生的再验证和认证-6。
积极意义方面
,这套评估框架至少解决了三个长期存在的问题。第一,它把评估从“厂商自证”转变为多利益相关方的共同责任,患者视角和卫生系统视角的纳入尤其具有突破性。第二,标准化指标的建立使得不同系统之间的横向比较成为可能,这对医院采购决策和监管审评都有直接价值。第三,长期监测的制度化设计,有助于发现那些在短期试验中无法暴露的迟发性和罕见性安全问题。
但挑战同样显著。
首先是
标准化与灵活性的张力
。不同手术类型(骨科、腹腔镜、神经外科)的评估需求差异很大,一套框架很难同时适用于所有场景。北京近期启动的手术机器人使用评价体系构建项目也注意到这个问题——骨科手术机器人的两种技术路线(如Mako的力反馈路径与天玑的导航路径)在技术原理和安全边界上完全不同,强行放在同一套指标下比较,结论容易失真-45。比较合理的路径是按技术路线分类建立评价子标准,在同一技术路线内进行横向比较-45。
其次是
数据共享的激励问题
。长期监测的有效性依赖于跨机构的数据汇集,但医院和厂商是否有足够的动力共享数据?注册登记系统的可持续性如何保障?IDEAL框架提出的“联盟模式”在理念上是对的,但在实践中需要解决数据所有权、隐私保护和利益分配等具体问题。
第三是
AI集成带来的新挑战
。随着手术机器人向智能化、自主化方向发展,传统的“静态分类”监管逻辑面临根本性冲击。有学者提出参照自动驾驶汽车的分级体系(L0-L5)对智能手术机器人进行类比分级,这种动态分级思路有别于传统医疗器械按风险进行的静态三级分类,对监管提出了全新命题-。如何在评估框架中纳入对AI自主决策能力的动态评价,目前仍是开放性问题。
总体而言,手术机器人评估框架的构建已经取得了实质性进展,多维度协作、标准化指标和长期监测这三个支柱的框架已经清晰。但框架的落地执行——尤其是在数据共享机制、分类评价标准和AI动态评估方法等方面——还需要监管机构、学术组织、产业界和临床一线的持续协作。评估框架本身也需要随着技术演进不断迭代,而不是一套固定不变的“考试大纲”。