因为临床数据是为"看病"设计的,不是为"研究"设计的。 HIS 关心的是收费和流程,LIS 关心的是这次化验结果, 电子病历里最有价值的部分——现病史、体格检查、手术记录、出院小结—— 全是自由文本。它们对医生看病足够,对统计分析完全不可用。
专病数据库要解决的核心问题有三个: ① 把人串起来——同一个患者在不同科室、不同就诊、不同系统里 是多条互不关联的记录,先要做患者主索引; ② 把文本变成字段——从病程记录里把肿瘤分期、 病理类型、用药方案抽取成可统计的结构化字段,这一步叫后结构化; ③ 把随访补上——生存分析要的终点事件(复发、转移、死亡) 医院系统里根本没有,必须靠主动随访补齐。
一句最实在的提醒:专病库项目失败最常见的原因, 不是技术做不出来,而是数据标准没定就开始建。 同一个"高血压",内科、心内、体检中心录法都不同; 同一个指标,不同年份的检验方法和参考区间也变过。 这些不先统一,建出来的库只能看,不能算。
科主任和科研秘书最熟悉的几种痛
一个回顾性研究,几个研究生翻几百份病历手工填 Excel,几个月过去,数据还未必准。
门诊在 HIS、检验在 LIS、影像在 PACS、病理另一套,同一个患者要跨系统人工拼。
肿瘤分期、病理类型、并发症全写在病程记录中,无法直接筛选统计。
电话随访靠人工排期、手工记录,失访率高,生存分析所需的终点事件严重缺失。
换过检验设备、改过参考区间、诊断编码升过版,跨年度数据直接对比会得出错误结论。
患者隐私、伦理审批、数据出院区限制,科研需求和合规要求之间没有可操作的通道。
第 2 步和第 5 步是决定成败的两环
先定专病数据集:要哪些字段、值域、单位与编码标准
关键环节:跨系统跨就诊把同一患者的记录关联为一条主线
从 HIS、LIS、PACS、EMR、手麻、病理抽取数据并做质量校验
诊断编码、检验项目、药品名称统一映射,跨年度口径对齐
关键环节:用 NLP 从自由文本抽取关键字段,人工审核校正
按方案自动排期、多渠道触达、结构化录入终点事件
按伦理批件范围授权,脱敏后供检索、导出与统计分析
队列筛选、基线表生成、导出对接统计软件,支撑课题与论文
医疗数据的合规约束比一般行业严格得多
| 要求来源 | 核心要求 | 系统需要具备的能力 |
|---|---|---|
| 个人信息保护法 医疗健康属敏感个人信息 |
处理敏感个人信息须具备特定目的与充分必要性,并采取严格保护措施 | 数据分级分类;最小必要授权;去标识化与假名化;处理活动全程留痕可审计;数据导出审批 |
| 伦理审查 涉及人的生命科学和医学研究 |
研究须经伦理审查批准,数据使用不得超出批准范围 | 课题与伦理批件绑定;按批件范围限定可访问的患者范围与字段;到期自动收回权限;使用日志可追溯 |
| 等保 2.0 医疗行业通常定级三级 |
身份鉴别、访问控制、安全审计、数据完整性与保密性 | 双因素认证;细粒度权限;操作日志留存六个月以上;传输与存储加密;堡垒机接入与数据库审计 |
| 电子病历应用水平分级 评级数据准备 |
各级别对数据的完整性、闭环管理与数据利用有相应要求 | 数据完整性统计与缺失分析;闭环环节数据核查;评级材料的数据支撑与导出 |
| 互联互通标准化测评 数据集与共享文档 |
数据集与共享文档需符合相应标准规范 | 标准数据集映射;共享文档生成与校验;平台交互服务的数据支撑。具体测评指标以主管机构当期发布版本为准 |
| 数据不出院区 医院普遍的内部要求 |
患者原始数据不得离开医院内网 | 纯内网私有化部署;统计分析在院内完成;仅允许导出脱敏后的聚合结果并留审批记录 |
建议以单个专病为起点,跑通后再扩展
这个领域有个绕不开的现实:数据在谁手里
有一项不是钱的问题,但比钱更容易卡住项目
建议以单病种试点起步,不要一上来就铺全院
临床专家主导,明确研究问题与专病数据集字段定义
信息科牵头与各系统厂商确认取数方式,此环节进度风险最大
归集、治理、主索引、CRF、随访模块开发与 NLP 模型训练并行
抽样人工核对,评估抽取准确率与数据完整性,迭代优化
先在一个专病一个科室跑通,用真实课题验证可用性
逐步扩展病种与科室,模型持续优化,配合评级与测评
科主任、科研秘书与信息科问得最多的几个
医疗与生命科学领域的能力可跨场景复用
覆盖数据标准制定、接口协调、字段来源评估、后结构化验收标准、 随访方案设计与合规要点共 40 余项检查点,标注了每项最容易卡住的地方。 无论最终是否选择我们,这份清单都能帮你在立项前就把风险看清楚。
联系获取清单