数巨有谱数据集团
[01 · SHP-MED-05-033]

临床时间事件标注数据

临床文书上的时间表达与事件时序标注层。时间表达候选按字符偏移定位,各配一条临床事件候选与一条时序关系。每份文书带一个记录时间锚点,供相对时间换算。每条候选带发布类别、规范化状态与复核状态。可用于时间表达识别与时序关系模型训练、院内时间线规则设计与抽取引擎回归测试。

临床文本与标准化 · 评估与研究使用许可 · 更新日期 2026-08-05

6
实体
53
字段
1
实体关系
05
所属体系
[02 · 产品说明]

读懂数据结构与交付边界

以下内容来自产品说明书,包含数据拓扑、字段字典、脱敏样例、使用场景及定制方式。

[01]

数据产品概览

数量内容
实体6标注文书 · 时间锚点 · 时间表达候选 · 临床事件候选 · 时序关系 · 数据质量项
字段53交付范围内的字段总数
实体关系1时间表达候选绑定它所在的文书与解析用的时间锚点。临床事件候选绑定其时间表达候选。时序关系把事件、候选与锚点三者连起来

交付与供应方式

  1. 数据集交付:清单 CSV/Parquet + 单一对象文件夹 + Meta.jsonl/Parquet
  2. API 调用
  3. Token 计量
  4. 数巨有谱可信数据空间连接器合约使用

权利与来源

  • 数据取得方式:数据资源持有方书面授权
  • 数据来源机构:医疗机构(含等级医院、社区医院及康复机构、疾控机构)
  • 数据加工机构:数巨有谱或数据资源持有方
  • 数据经营机构:数巨有谱(经营权权利人)
[02 · DATA CONTENT]

数据内容与字段结构

在同一位置切换字段字典、实体血缘与脱敏样例,避免重复铺陈造成页面过长。

数据血缘拓扑

实体与连接关系分层呈现:上方先识别全部数据对象,下方逐条阅读关系基数,避免连线交叠、标签遮挡或内容被裁切。

6 个实体7 条连接响应式完整展示

实体概览

核心实体以品牌蓝标识
01核心实体

标注文书

文本版本/记录时间

02关联实体

时间锚点

锚点取值/可用状态

03关联实体

时间表达候选

类别/偏移/规范化状态

04关联实体

临床事件候选

事件状态/复核状态

05关联实体

时序关系

左右两端/证据状态

06辅助实体

数据质量项

落到具体条目

连接关系

每条关系独占一行,基数置于两实体之间

实体 A01

标注文书

文本版本/记录时间

1—1
实体 B

时间锚点

锚点取值/可用状态

实体 A02

标注文书

文本版本/记录时间

1—n
实体 B

时间表达候选

类别/偏移/规范化状态

实体 A03

时间表达候选

类别/偏移/规范化状态

1—1
实体 B

临床事件候选

事件状态/复核状态

实体 A04

临床事件候选

事件状态/复核状态

1—n
实体 B

时序关系

左右两端/证据状态

实体 A05

时间表达候选

类别/偏移/规范化状态

1—n
实体 B

时序关系

左右两端/证据状态

实体 A06

时间锚点

锚点取值/可用状态

1—n 关系上记下解析时所用的锚点
实体 B

时序关系

左右两端/证据状态

实体 A07

时间表达候选

类别/偏移/规范化状态

1—n 按受影响对象类型与标识落到具体条目的问题登记
实体 B

数据质量项

落到具体条目

核心实体关联实体1—1 / 1—n / n—1 表示关系基数
查看关系语义清单
基数关系语义
标注文书1—1时间锚点一份文书带一个记录时间锚点,来源缺时锚值留空
标注文书1—n时间表达候选文本上按字符偏移定位的时间表达候选
时间表达候选1—1临床事件候选时间候选与事件候选成对,事件不脱离它的时间线索
临床事件候选1—n时序关系事件侧接入时序关系
时间表达候选1—n时序关系时间侧接入时序关系
时间锚点1—n时序关系关系上记下解析时所用的锚点
时间表达候选1—n数据质量项按受影响对象类型与标识落到具体条目的问题登记

一份文书带一个记录时间锚点。文本上的时间表达候选按字符偏移定位,事件候选与时间候选成对。时序关系再把事件侧与时间侧连起来,并记下解析时所用的锚。问题登记落到受影响的那一条对象上。候选层与复核层在结构上分开,规范化取值在复核前一律留空。

[03]

使用场景

时间表达识别的训练输入与拒识样本

医疗科技企业 · 临床时间信息抽取团队

  • 三类候选分开使用:绝对时间、相对时间与词法假阳性各成一类。可分别训练识别与拒识,不必自己先做一遍粗筛
  • 误命中是现成难例:「现患者」中的「现」被时间规则命中。这类词面误命中在真实病历里成批出现,可直接作拒识样本
  • 规范化取值随复核状态给出:未复核的候选规范化取值留空,模型据此学会缺锚时留空
  • 边界逐条可回放:每条候选带字符区间与规则版本,训练样本可回到原文核对边界切得对不对
  • 锚点显式给出:相对时间的解析锚以独立对象给出并标明可用状态,训练相对时间解析时锚点不用另猜

获得:正例、难例与拒识样本齐备的时间表达训练输入

病历时间线开工前的时间语义盘点

三甲医院 · 临床研究中心时间线建设

  • 先看时间藏在哪:二十六份文书全部命中绝对日期与钟点,二十二份含相对时间词面。据此判断哪些文书值得进入时间线抽取
  • 书写时点单列:文书记录时间以锚点对象单列,状态标明「来源值·非事件时间」。它的用途是给相对时间做换算基准
  • 缺锚就停在原文:四份文书没有记录时间,锚值留空,相对时间保持原表述
  • 相对词面的真实分布:相对时间以「目前」「既往」「今日」这类词面出现。据此决定院内时间线规则要覆盖哪些表达
  • 密度可核到文书:候选按文书归集,某份文书的时间线密度可直接核到具体条数

获得:动手抽时间线之前就能判明的时间语义分布与锚点可用性

抽取规则的基线复算与跨版本对照

医疗信息化企业 · 文本抽取引擎研发

  • 同一输入得同一输出:文本版本与规则版本成对记录。按同样两个版本重跑,得到同一批候选与同一批偏移,可当回归基线
  • 规则改动看差异:新规则跑同一批文书后与本批候选逐条比对,新增命中与消失命中一目了然
  • 精度可按类别算:词法假阳性单独归类,规则精度可按候选类别分别核算,不必人工重新翻一遍文本
  • 候选层与结论层分开:事件候选与时序关系都停在候选层,并标明证据来源。引擎输出接入下游前必经复核

获得:可逐条复算、可跨版本比对的抽取规则基线

时间标注复核队列的组织与排期

医学数据加工团队 · 标注工作流组织

  • 打开即是待判条目:候选带文书、字符区间、类别与复核状态,复核人员无须先做检索即可逐条判读
  • 按类别分派:绝对时间、相对时间与疑似误命中三类判读难度不同,可按类别分派给不同熟练度的人员
  • 工作量开工前可估:候选按文书与类别归集,复核工作量按条数即可估算
  • 改判留痕:复核结论与候选原状分列保存。事后可回看分歧点

获得:条目化、可分派、工作量可估算的时间标注复核队列

[04]

定制与定向

  • 是否支持定制:是
  • 交付层次(单选):只交付候选层 / 候选层+人工复核结果
  • 其他定制项(多选):时间表达类型范围 / 文书类型范围 / 相对时间锚点策略 / 事件类型范围 / 文书时间范围
  • 最低定制数量:10,000 条时间表达候选
  • 复核深度:复核到候选判真判假,还是继续做规范化取值与时序关系判定,按项目确定
  • 其他可定制项:与项目商务确定
[05]

去标识化与交付

  1. 直接标识符移除:姓名、证件号码、联系方式、住址
  2. 间接标识符不可逆映射:患者标识、就诊号、报告单号
  3. 时间平移:整体平移并保持时序与时间间隔
  4. 机构与医师信息去除或泛化
  5. 自由文本二次核查:叙述内容中的标识信息
  6. 可按项目追加 K-匿名等泛化处理,匿名化的判定与出具方式随项目约定
  7. 文书文本与候选片段中的日期统一平移,保序保间隔;候选的字符偏移随平移后的文本重算
  8. 锚点取值随文本同步平移,平移量在同一批数据内一致,相对时间与其锚点之间的间隔不变
  9. 患者与就诊标识在扫描之前移除,不参与时间候选抽取
  • 加密通道交付:支持
[06]

关联数据集

  • SHP-MED-05-031 临床文书分类与章节切分数据——提供被扫描文书的版本与章节坐标
  • SHP-MED-05-032 临床实体与关系标注数据——同一批文本之上的实体与关系标注层
  • SHP-MED-07-043 纵向病程与时间推理评测集——把时间能力做成成题评测的下游用法
[07]

常见问题

临床时间事件标注数据包含哪些内容?

临床时间事件标注数据(SHP-MED-05-033)交付临床文书上的时间表达与事件时序标注层:时间表达候选按字符偏移定位,分绝对时间、相对时间与词法假阳性三类,各配一条临床事件候选与一条时序关系,每份文书带记录时间锚点供相对时间换算。

临床时间事件标注数据适合做什么?

适合时间表达识别与时序关系模型训练,被时间规则误命中的词面可直接作拒识样本;也适合院内病历时间线规则设计前的时间语义盘点、抽取引擎的跨版本回归对照,以及时间标注复核队列的组织与工作量估算。

临床时间事件标注数据有样例吗?怎么交付?

产品页提供真实脱敏样例:二十六份文书上抽出的二百零七个时间表达候选,含绝对时间、相对时间与词法假阳性三类,配套记录时间锚点与时序关系,文本与规则版本固定、结果可复算。交付形态含数据集、API 调用、Token 计量与可信数据空间连接器。

临床时间事件标注数据如何定制与起步?

交付层次可选只交付候选层,或候选层加人工复核结果,再按时间表达类型、文书类型、相对时间锚点策略、事件类型与文书时间范围定制,起订量为 10,000 条时间表达候选,数据量按项目商定。可先申请开源子集或测试数据熟悉候选结构。

临床时间事件标注数据与哪些产品搭配使用?

常与临床文书分类与章节切分数据(SHP-MED-05-031)取得被扫描文书的版本与章节坐标,与临床实体与关系标注数据(SHP-MED-05-032)叠加同一批文本的实体与关系标注层,与纵向病程与时间推理评测集(SHP-MED-07-043)衔接时间能力的成题评测。

[08]

获取方式

  • 有明确科研/临床项目:提供研究方向与所需字段范围,可先申请开源子集用于可行性验证。
  • 有明确数据智能场景:提供模型或应用场景,可先申请测试数据与接入方式完成联调。
  • 许可:评估与研究使用许可。

© 数巨有谱数据集团