数巨有谱数据集团
[01 · SHP-MED-02-008]

专病基线队列数据

一个专病队列从定义到成员的完整构造过程。队列定义与入排条件版本化,逐条可复算。候选索引事件、条件评价、成员与基线变量分层保存。每条评价都记下证据时间与首次可用时间。适用于预测模型的队列与标签构造、专病登记建库与可复算的研究设计。

专病与全病程 · 评估与研究使用许可 · 更新日期 2026-08-05

10
实体
61
字段
3
实体关系
02
所属体系
[02 · 产品说明]

读懂数据结构与交付边界

以下内容来自产品说明书,包含数据拓扑、字段字典、脱敏样例、使用场景及定制方式。

[01]

数据产品概览

数量内容
实体10队列定义 · 入排条件 · 候选索引事件 · 条件评价 · 队列成员 · 基线变量 · 亚组归属 · 队列流程步骤 · 数据质量项 · 来源沿袭
字段61交付范围内的字段总数
实体关系3队列定义 1—n 入排条件/候选索引事件/队列成员/流程步骤;候选、条件评价与成员三者分列不互代 · 队列成员 1—n 基线变量与亚组归属;索引后才确认的信息其首次可用时间标为未知,不进入入院时预测特征 · 每个交付的队列对象 1—1 来源沿袭记录

交付与供应方式

  1. 数据集交付:队列定义与规则表达式 + 成员与基线 CSV/Parquet + 流程步骤表 + Meta
  2. API 调用
  3. Token 计量
  4. 数巨有谱可信数据空间连接器合约使用

权利与来源

  • 数据取得方式:数据资源持有方书面授权
  • 数据来源机构:医疗机构(含等级医院、专科医院及康复机构)
  • 数据加工机构:数巨有谱或数据资源持有方
  • 数据经营机构:数巨有谱(经营权权利人)
[02 · DATA CONTENT]

数据内容与字段结构

在同一位置切换字段字典、实体血缘与脱敏样例,避免重复铺陈造成页面过长。

数据血缘拓扑

实体与连接关系分层呈现:上方先识别全部数据对象,下方逐条阅读关系基数,避免连线交叠、标签遮挡或内容被裁切。

10 个实体8 条连接响应式完整展示

实体概览

核心实体以品牌蓝标识
01核心实体

队列定义

名称 · 版本

02关联实体

入排条件

类型 · 规则表达式

03关联实体

候选索引事件

索引时点 · 候选状态

04关联实体

条件评价

结论 · 证据与可用时间

05关联实体

队列成员

成员状态 · 资格依据

06关联实体

基线变量

取值 · 覆盖状态

07关联实体

亚组归属

亚组名 · 归属状态

08关联实体

队列流程步骤

步骤名 · 计数

09辅助实体

数据质量项

quality_issue

10辅助实体

来源沿袭

source_lineage

连接关系

每条关系独占一行,基数置于两实体之间

实体 A01

队列定义

名称 · 版本

1—n
实体 B

入排条件

类型 · 规则表达式

实体 A02

队列定义

名称 · 版本

1—n
实体 B

候选索引事件

索引时点 · 候选状态

实体 A03

候选索引事件

索引时点 · 候选状态

1—n
实体 B

条件评价

结论 · 证据与可用时间

实体 A04

入排条件

类型 · 规则表达式

1—n
实体 B

条件评价

结论 · 证据与可用时间

实体 A05

候选索引事件

索引时点 · 候选状态

1—1
实体 B

队列成员

成员状态 · 资格依据

实体 A06

队列成员

成员状态 · 资格依据

1—n
实体 B

基线变量

取值 · 覆盖状态

实体 A07

队列成员

成员状态 · 资格依据

1—n
实体 B

亚组归属

亚组名 · 归属状态

实体 A08

队列定义

名称 · 版本

1—n
实体 B

队列流程步骤

步骤名 · 计数

核心实体关联实体1—1 / 1—n / n—1 表示关系基数
查看关系语义清单
基数关系语义
队列定义1—n入排条件一个队列定义下的全部入排条件
队列定义1—n候选索引事件该定义下筛出的候选索引事件
候选索引事件1—n条件评价每个候选对每条条件各有一次评价
入排条件1—n条件评价条件一侧的评价记录
候选索引事件1—1队列成员通过全部条件的候选成为成员
队列成员1—n基线变量成员在基线窗内的观测变量
队列成员1—n亚组归属成员的亚组归属
队列定义1—n队列流程步骤该定义运行一次形成的筛选流程步骤

候选、条件评价与成员分三层保存。被排除的候选与排除理由一并交付。筛选流程图可由流程步骤直接生成。

[03]

使用场景

预测任务的队列与标签构造

医疗科技企业 · 临床预测模型团队

  • 标签泄漏排查:出院诊断这类索引后才确认的信息,首次可用时间标为未知。据此可判定它只能当结局标签,不能当入模特征
  • 入模特征时点核对:每条基线变量都能追到证据时间与可用时间,逐条核对是否早于预测时点
  • 基线覆盖不足识别:目标基线窗与实际覆盖长度分列。覆盖不足的成员可单独处理,不默认既往史为阴性
  • 未知单独取值:条件评价的未知值单独取值,与满足、不满足并列
  • 队列版本对照:换一条入排条件即换版本,两版成员差异可直接比对,模型指标变化能归因到定义变化

获得:队列与标签的时点合法性可逐条核对

专病队列建库与筛选过程留痕

三甲医院 · 专病中心

  • 入排规则可执行:入排条件写成规则表达式。换人操作也能得到同一批病例
  • 筛选漏斗直接可用:流程步骤表记录每一步的剩余数量,研究流程图不必事后重画
  • 被排除者可查:未通过条件的候选连同排除理由保留,审稿或复核时能回答「为什么这个病人没进来」
  • 多索引处理:同一患者在不同索引事件下可形成多个成员实例,反复发作的患者不必二选一
  • 亚组预设:亚组归属与成员分列保存,事后追加亚组不必重跑整个队列

获得:队列构造全过程留痕、可交接、可复核

可复算入排与目标试验式设计

药械企业 · 真实世界研究

  • 入排对齐试验方案:把方案中的入排标准逐条落成规则表达式与评价记录,两者一一对应可核
  • 索引定义显式:索引事件的选取规则写在数据里,各方对「从哪天开始算」看的是同一条
  • 基线可比性:基线变量与覆盖状态成套给出,组间可比性分析建立在同样的观测条件上
  • 敏感性分析:放宽或收紧某条条件形成新版本,主分析与敏感性分析的队列差异一目了然

获得:入排与索引可被第三方复算的研究队列

队列定义的共享与跨中心复现

多中心研究协作组

  • 定义即交付物:队列定义、条件表达式与版本作为独立对象交付,各中心拿同一份定义各自执行
  • 差异归因:各中心的流程步骤计数并列比较,成员数差异能定位到具体哪一步、哪条条件
  • 键可用性单列:患者与就诊键是否稳定作为独立条件类型,数据接入问题不与临床入排混在一起
  • 未知率对比:各中心同一条件的未知比例反映数据完备度差异,是多中心汇总前必看的一项

获得:跨中心可复现、差异可归因的队列构造方案

[04]

定制与定向

  • 是否支持定制:是
  • 索引定义(单选):首次满足条件的事件 / 每次满足条件的事件
  • 其他定制项(多选):病种/表型定义 / 医院等级 / 指定医院 / 基线窗长度 / 随访窗长度 / 亚组维度 / 索引时间范围
  • 最低定制数量:2,000 名队列成员
  • 队列定义:入排条件、索引规则与基线窗按项目约定生成,规则表达式随数据交付
  • 其他可定制项:与项目商务确定
[05]

去标识化与交付

  1. 直接标识符移除:姓名、证件号码、联系方式、住址
  2. 间接标识符不可逆映射:患者标识、就诊号、报告单号
  3. 时间平移:整体平移并保持时序与时间间隔
  4. 机构与医师信息去除或泛化
  5. 自由文本二次核查:叙述内容中的标识信息
  6. 可按项目追加 K-匿名等泛化处理,匿名化的判定与出具方式随项目约定
  7. 索引时点与全部基线证据时点同步平移,基线窗长度与相对间隔保持不变
  • 加密通道交付:支持
[06]

关联数据集

  • SHP-MED-01-003 患者纵向诊疗数据——成员的跨就诊事件与观察期背景
  • SHP-MED-02-009 专病纵向全病程数据——成员入组后的病程演变
  • SHP-MED-05-033 临床时间事件标注数据——从文本中获得可用于入排判定的时间事件
[07]

常见问题

专病队列数据集包含哪些内容?

专病基线队列(SHP-MED-02-008)交付一个专病队列从定义到成员的完整构造过程,含队列定义与版本、入排条件、候选索引事件、条件评价、队列成员、基线变量、亚组归属与流程步骤。字段有规则表达式、索引时点、证据时间与首次可用时间、基线覆盖状态。

临床预测模型的队列和标签怎么构造?

专病基线队列(SHP-MED-02-008)适合做预测任务的队列与标签构造,每条基线变量都能追到证据时间与首次可用时间,可逐条核对是否早于预测时点。专病中心可用于建库与筛选过程留痕,流程步骤表直接给出筛选漏斗的每步剩余数量。

队列数据交付时包含入排规则吗?

专病基线队列(SHP-MED-02-008)的产品页给出真实脱敏样例与逐字段语义说明,入排条件写成规则表达式随数据交付。交付形态有数据集(定义与规则、成员与基线、流程步骤表)、API 调用、Token 计量与可信数据空间连接器合约使用,数据量按项目商定。

专病队列能按自己的入排标准定制吗?

专病基线队列(SHP-MED-02-008)的索引定义可选首次满足条件的事件或每次满足条件的事件,并可按病种与表型定义、基线窗与随访窗长度、亚组维度定制,起订量为 2,000 名队列成员。起步可先申请开源子集或测试数据核对规则的可复算性。

建专病队列还需要哪些配套数据集?

专病基线队列(SHP-MED-02-008)与患者纵向诊疗数据(SHP-MED-01-003)组合,可补齐成员的跨就诊事件与观察期背景;与专病纵向全病程数据(SHP-MED-02-009)组合,可追踪成员入组之后的病程演变与阶段划分。

[08]

获取方式

  • 有明确科研/临床项目:提供研究方向与所需字段范围,可先申请开源子集用于可行性验证。
  • 有明确数据智能场景:提供模型或应用场景,可先申请测试数据与接入方式完成联调。
  • 许可:评估与研究使用许可。

© 数巨有谱数据集团