“数据基建”升级,江苏医疗AI加速应用临床

发布时间:2026-08-26 04:40  浏览量:1

(视觉中国供图)

□ 本报记者 杨彦 安莹

数据是燃料,算力是引擎,算法是方向盘——在医疗健康领域,大模型、智能辅助诊断、新药研发都离不开大规模、标准化、合规化的高质量医疗数据集。没有高质量数据,再强大的算法也难逃“输入垃圾,输出垃圾”的窘境。江苏系统性推进医疗高质量数据集建设,实现医疗数据从零星探索走向批量入场,打通从临床采集、治理标注、确权登记到交易流通、成果转化的完整链条,让沉睡的医疗数据真正“活起来”,一场“医疗数据基建”的升级,正驱动着AI医疗加速推向临床、落地市场的变革。

认证提速,批量入场!

江苏医疗数据集建设进入“快车道”

“过去我能使用的公开数据,比如说文献发表的数据,或是一些公开的数据库,并不能满足我们项目研究的要求。”江南大学附属医院副院长曹宏教授告诉记者。

“不对味”,这是很多数据集建设项目的缘起。

数据,是医疗中最不缺的资源,但医疗机构感到的这种“不对味”来自多个层面:部分公开数据集样本量偏小,难以满足AI分析对样本量的需要,也难以为一些医疗卫生政策的制定提供可靠的证据;有些现有的数据集的研究目标和现有项目存在偏差,适配性不足;部分文献数据年代久远,受限于当时的技术水平,数据完整度、规范性不及当下。而医院自有的海量病历、影像、检验报告,格式不一、标准不一,“沉睡”在各个医院、各个科室的系统里,成为一个个“信息孤岛”。

“这些‘痛点’都在倒逼医院必须依托自身丰富的临床资源,自主构建高质量的数据体系。我们依托队列研究探索构建了Nutriseek高质量数据集。”曹宏表示。

2025年9月,南京医科大学第三附属医院(常州市第二人民医院)成功完成“益生菌用于儿童肺炎伴腹泻疗效数据集”的数据知识产权登记与转化工作。此举标志着江苏省公立三甲医院在数据资产化管理与成果转化领域实现“零的突破”。

2025年12月,江苏省肿瘤医院医疗大数据中心卢欣博士与麻醉科谭婧副教授联合团队完成的“肿瘤围手术期麻醉镇痛数据集”获得江苏省数据知识产权登记证书,并在省数交所上架交易,成为全省首家数据价值变现的省级三甲医院。

此后,江苏省人民医院、南京鼓楼医院等都加入了先行先试的行列。据江苏省知识产权局统计,江苏医疗健康领域已有90家经营主体完成了249项数据登记,其中不乏医疗机构。

2026年6月,江苏省人民医院(南京医科大学第一附属医院、江苏省妇幼保健院)更是一举获批10项医疗数据知识产权证书,这10项数据集覆盖糖尿病、冠心病、脑卒中等高发慢病与重点专科,全部依托院内真实世界临床数据搭建,历经严格脱敏与标准化规整,成为全国首家通过DCMM4级测评的医疗机构在数据确权领域的最大单笔收获。

江苏的医疗数据集建设,已然进入“快车道”。

数据基建,“高”在何处?

深耕临床场景,“一把尺子量到底”

在今年5月份举办的江苏省“人工智能+医疗健康”系列主题沙龙——医疗健康高质量数据集建设沙龙上,北京大学软件工程国家工程研究中心研究员、国家重点研发计划项目首席科学家黄雨曾给“高质量数据集”一个通俗解释:它不是简单把医疗数据收集在一起,而是经过清洗、整理、标注、治理之后,让数据成为真正能够支持人工智能模型训练和应用的数据资源。数据质量往往决定模型能走多远、用多稳。

江南大学附属医院的“精准营养多模态队列数据集”项目入选了2026年江苏省高质量数据集建设先行先试项目试点,该院临床营养科主任张烽教授告诉记者,项目从肿瘤营养队列起步,后续逐步拓展至肌少症、肥胖症、糖尿病等多个病种研究,采用了全国多中心协作模式推进。全国共计90余家医院报名参与,其中40余家医院顺利通过伦理审查正式加入研究,最终建成涵盖4万例肿瘤患者的大型队列数据库。

数据的“质控”挑战很大。“很多肿瘤患者长期随访,饮食记录依从性很难维持;40余家医院在同一个标准下采集数据,统一步调并不容易。”张烽告诉记者,数据的搜集依托中国抗癌协会肿瘤营养专业委员会的组织基础,也用上了AI工具。我们构建了Nutriseek数据集,其患者端为简易操作界面,方便自主上传日常饮食、治疗、用药、营养、运动等信息,数据自动完成结构化归档。医生端支持电脑、手机登录,可查阅完整数据,项目还联动社区卫生服务中心协同管理,社区医生拥有对应数据查看权限,部分患者由社区同步跟进管理,打通院内、社区的数据链条,才能将数据采集与治理“一把尺子量到底”。

作为拥有140余年历史的全国首批三级甲等医院,苏大附一院依托血液系统疾病国家临床医学研究中心这一国家级平台,系统展示了从六大专病数据库到医疗质控智能体的完整建设路径,为医疗行业高质量数据集建设提供了一个可复制的“血液样本”。

血液病诊疗已进入分子分型驱动的精准医学时代,但数据资源分散、基层检测能力缺失、多模态信息整合困难,成为制约精准医疗普及的三大结构性瓶颈。面对这一挑战,苏大附一院于2021年7月上线了血液系统疾病国家临床医学研究中心大数据平台——这是国内首个、病种最全、系统性最强的血液病数据库。

该平台全面覆盖六大核心专病数据库:造血干祖细胞肿瘤、成熟淋巴细胞与浆细胞肿瘤、骨髓衰竭综合征、红细胞疾病、出凝血疾病、造血干细胞移植患者数据库,基本覆盖血液系统疾病所有病种。截至目前,六大专病库已汇集近33万患者数据,数据整理输出效率缩短50%以上,近5年该中心依托数据库发表临床相关学术论文300余篇,科研规范性与成果质量大幅提升。

从“数据资源”到“数据资产”

构建“建设—交易—转化”完整闭环

建好数据集,只是第一步。如何让合规的数据产品顺畅流动,完成从“数据资源”到“数据资产”再到产业价值的跃迁,是医疗数据要素改革的核心命题。江苏给出的答案是构建完善的交易生态与协同模式。

2015年12月26日,江苏省数据交易所医药服务行业专区正式揭牌。定位于“最懂医药产业的数交所”,该专区针对医疗数据特性,制定专项交易指南,并建设数据资产管理平台、多源数据汇聚平台与AI共性技术平台。数据产品“一地上架、全省流通”,这一模式打破区域壁垒,数据需求方无需与各地分别对接,大大降低了流通成本。

各地也在因地制宜,探索医疗数据集建设与转化路径,让数据集建设贯穿于标准统一、权属清晰、安全可控的制度框架之中。比如,苏州市“三医”协同创新可信数据空间建设,探索“红区、蓝区、绿区”分区管理机制:原始数据严格管控,脱敏脱密数据在专网环境中使用,样本和仿真数据可用于更开放的场景。保护隐私是底线,释放价值是方向,让数据在安全合规前提下发挥价值。

一个个新样本,正在临床与产业的“双向奔赴”中诞生。

苏州大学附属第一医院所提供的高质量数据集“血液样本”,不仅服务临床科研,更深度对接苏州“中国药谷”建设,打通基础研究、临床试验到产业应用的转化链条。

因江苏省肿瘤医院“肿瘤围手术期麻醉镇痛数据集”而诞生的新药也在路上。谭婧告诉记者,这份高质量数据集落地之后,具有直接面向临床与产业的双重价值。在临床端,数据集训练出AI“麻醉参谋”,辅助麻醉医生制定精准用药方案、科学管理术后疼痛,也为远程机器人手术等前沿技术筑牢数据底座。面向产业端,数据集赋能下一代麻醉镇痛新药研发,医院已经和制药企业开展联合攻关,依托真实临床数据发现现有药物短板,助力开发更安全高效的镇痛药物。

江南大学附属医院的“精准营养多模态队列数据集”项目从规划之初,便将成果转化纳入整体设计,把特医食品开发作为重要落地方向。曹宏告诉记者,依托全国多中心队列采集的多模态数据和Nutriseek分析平台,在开展科学研究的同时同步推进相关产品研发,实现科研数据向产业成果转化。目前已有两项成果顺利转化,同时也吸引了新的企业落户无锡建厂。这种以落地应用为目标的建设思路,也为医疗高质量数据集打造出全新的建设模式,打破数据集仅用于基础科研的传统定位,实现科研、数据建设、产业转化一体化推进。