数巨有谱数据集团
[01 · SHP-MED-05-031]

临床文书分类与章节切分数据

临床文书的分类与章节切分结果。每份文书归入文书族与规范子类型,正文按声明规则规范化后另存版本。章节以字符起止偏移标出,并附边界证据。可用于文书分类与章节切分模型训练、病历书写核对与章节级检索。

临床文本与标准化 · 评估与研究使用许可 · 更新日期 2026-08-05

6
实体
47
字段
4
实体关系
05
所属体系
[02 · 产品说明]

读懂数据结构与交付边界

以下内容来自产品说明书,包含数据拓扑、字段字典、脱敏样例、使用场景及定制方式。

[01]

数据产品概览

数量内容
实体6临床文书 · 文书分类 · 文书版本 · 章节跨度 · 数据质量项 · 来源沿袭
字段47交付范围内的字段总数
实体关系4文书 1—n 文书版本 1—n 章节跨度 · 每份文书带文书级来源沿袭与具名的配套正文对象 · 文书族、来源文书类型、来源标题与规范子类型四者分列保存 · 来源未给出边界证据的位置不生成章节

交付与供应方式

  1. 数据集交付:清单 CSV/Parquet + 单一对象文件夹 + Meta.jsonl/Parquet
  2. API 调用
  3. Token 计量
  4. 数巨有谱可信数据空间连接器合约使用

权利与来源

  • 数据取得方式:数据资源持有方书面授权
  • 数据来源机构:医疗机构(含等级医院、社区医院及康复机构、疾控机构)
  • 数据加工机构:数巨有谱或数据资源持有方
  • 数据经营机构:数巨有谱(经营权权利人)
[02 · DATA CONTENT]

数据内容与字段结构

在同一位置切换字段字典、实体血缘与脱敏样例,避免重复铺陈造成页面过长。

数据血缘拓扑

实体与连接关系分层呈现:上方先识别全部数据对象,下方逐条阅读关系基数,避免连线交叠、标签遮挡或内容被裁切。

6 个实体5 条连接响应式完整展示

实体概览

核心实体以品牌蓝标识
01核心实体

临床文书

类型/标题/记录时间

02关联实体

文书分类

文书族/规范子类型

03关联实体

文书版本

版本状态/正文指纹

04关联实体

章节跨度

章节名/起止偏移

05辅助实体

数据质量项

编号重复与缺失

06辅助实体

来源沿袭

来源对象/配套正文

连接关系

每条关系独占一行,基数置于两实体之间

实体 A01

临床文书

类型/标题/记录时间

1—n
实体 B

文书版本

版本状态/正文指纹

实体 A02

文书版本

版本状态/正文指纹

1—n
实体 B

章节跨度

章节名/起止偏移

实体 A03

临床文书

类型/标题/记录时间

1—1
实体 B

文书分类

文书族/规范子类型

实体 A04

临床文书

类型/标题/记录时间

1—n
实体 B

数据质量项

编号重复与缺失

实体 A05

临床文书

类型/标题/记录时间

1—1
实体 B

来源沿袭

来源对象/配套正文

核心实体关联实体1—1 / 1—n / n—1 表示关系基数
查看关系语义清单
基数关系语义
临床文书1—n文书版本一份文书的多个正文版本,各带独立正文指纹
文书版本1—n章节跨度版本内按字符偏移定位的章节跨度,无边界证据的版本为零章节
临床文书1—1文书分类一份文书一条分类结果,四层分类值同行并存
临床文书1—n数据质量项文书标识层面的问题登记
临床文书1—1来源沿袭文书级来源沿袭,含配套正文对象与规则版本

文书、版本、章节分三层保存。章节偏移在它所属版本的规范化正文坐标系内有效,换一版正文须重算偏移。文书族、来源文书类型、来源标题与规范子类型在分类结果中并存。来源沿袭与数据质量项挂在文书层。来源文书编号重复或缺失时以内部标识归集,并留下对应的问题记录。

[03]

使用场景

文书分类与章节切分模型的训练语料组织

医疗科技企业 · 临床自然语言处理平台团队

  • 四层标签同时可用:文书族、来源文书类型、来源标题与规范子类型分列存放。可按任一层做标签,也可训练由细到粗的层级分类
  • 细分类的真实难点摆在面上:本例二十一份病程与查房文书还有细分。含日常病程、首次查房、其他日常查房、转科等类别。同族内部标题写法相近,可作为分类模型的难例来源
  • 切分任务带边界依据:每个章节跨度带起止字符偏移与边界证据。训练切分模型时可只采用有来源依据的边界作正样本
  • 零章节文书按未标注处理:未切出章节表示来源未给出显式边界,训练时按未标注处理
  • 规则版本随样本走:正文与偏移都绑定规范化规则版本。规则升级后新旧语料可并存对比,无须回改历史标注

获得:标签分层清楚、边界有依据、可随规则版本演进的文书语料

病历书写与留痕能力的逐份核对

三甲医院 · 病案与病历质量部门

  • 类型与标题对不上先查:来源文书类型与来源标题分列,可直接筛出标题写法与类型登记不一致的文书
  • 编号可用性盘点:来源文书编号状态区分正常、重复、缺失。本例二十六份中有两份编号重复、一份缺号。据此可定位院内编号规则的薄弱环节
  • 必备章节到位程度:看主诉、现病史、入院诊断这类章节的实际出现情况。据此核对各类文书的必备项到位程度
  • 留痕能力可见:文书版本状态如实记为未知,说明来源系统未保留签发与更正痕迹。可作为病历留痕改进的依据
  • 结论能回到具体文书:每条问题带问题代码与处理方式并挂在文书标识上,核对结论可逐份回查

获得:可逐份定位到文书的书写规范与留痕能力盘点结果

病历章节级检索与展示功能的底层数据

医疗信息化企业 · 电子病历产品团队

  • 按区间精确定位:章节起止偏移左闭右开,前端按区间截取即得该章节片段,不必再跑一遍文本匹配
  • 正文与结构分开取:正文以配套对象交付,结构表只存偏移。检索索引可只建在结构表上,正文按需加载
  • 重复正文可识别:正文内容校验值可判断两份文书是否同一份正文。复制粘贴产生的雷同病程记录可据此在检索结果中识别
  • 映射升级可回退:来源类型到规范子类型的映射随规则版本记录。产品升级映射后,旧数据仍可按旧版还原
  • 零章节是正常态:文书允许没有章节。展示层据此可设计成「该文书未提供章节结构」

获得:可直接驱动章节级检索与展示的文书结构底表

按文书类型与章节精确取材

医学研究团队 · 队列构建与文本二次利用

  • 先按类型圈定文书:以文书族与规范子类型圈定入院记录、首次病程、手术记录、出院记录。查房记录另成一类,取材时可分开处理
  • 只取需要的那一段:研究只需现病史或出院诊断时,按章节类型取对应区间。不必把整份文书送进下游处理
  • 文书时间单独成列:文书记录时间与正文中提到的日期分开保存。构建时间线时按文书记录时间取值
  • 取材可被他人复现:文书标识、版本标识、规则版本与字符区间四项共同确定一段取材。他人按同样四项能取到同一段文字

获得:取材范围明确、他人可按同一坐标复现的文本二次利用底料

[04]

定制与定向

  • 是否支持定制:是
  • 章节切分范围(单选):只按来源结构字段边界 / 结构字段边界+显式正文小标题
  • 其他定制项(多选):文书类型范围 / 科室范围 / 医院等级 / 文书时间范围 / 章节类型范围
  • 最低定制数量:20,000 份临床文书
  • 正文交付形态:规范化正文可随结构表一同交付,或只交付结构与偏移、正文按项目另行约定
  • 其他可定制项:与项目商务确定
[05]

去标识化与交付

  1. 直接标识符移除:姓名、证件号码、联系方式、住址
  2. 间接标识符不可逆映射:患者标识、就诊号、报告单号
  3. 时间平移:整体平移并保持时序与时间间隔
  4. 机构与医师信息去除或泛化
  5. 自由文本二次核查:叙述内容中的标识信息
  6. 可按项目追加 K-匿名等泛化处理,匿名化的判定与出具方式随项目约定
  7. 文书正文与章节片段二次核查:患者与家属姓名、联系方式、住址、床号、工号去除;医师姓名与职称改为角色占位,占位在同一批文书内保持一致
  8. 文书记录时间统一平移,保序保间隔;正文中出现的日期同步平移
  9. 章节字符偏移随替换后的正文重算,按偏移截取仍落在同一段内容上
  • 加密通道交付:支持
[06]

关联数据集

  • SHP-MED-05-032 临床实体与关系标注数据——在文书正文之上的实体与关系标注层
  • SHP-MED-05-035 临床文本去标识化数据——同类文书的去标识化结果与替换台账
  • SHP-MED-01-002 住院诊疗数据——文书所依附的住院过程结构数据
[07]

常见问题

临床文书分类与章节切分数据包含哪些内容?

临床文书分类与章节切分数据(SHP-MED-05-031)交付临床文书的分类与章节切分结果:每份文书归入文书族与规范子类型,正文按声明规则规范化后另存版本,章节以字符起止偏移标出并附边界证据,来源标题与编号状态一并保留。

临床文书分类与章节切分数据适合做什么?

适合文书分类与章节切分模型训练,四层标签支持由细到粗的层级分类,病程与查房文书的近义标题细分类是现成难例;也适合病历书写与留痕能力的逐份核对、章节级检索与展示功能建设,以及按文书类型与章节精确取材的研究。

临床文书分类与章节切分数据有样例吗?怎么交付?

产品页提供真实脱敏样例:二十六份临床文书的分类结果,其中门诊、入院、首次病程、手术、出院五份切出十二个带字符偏移与边界证据的章节跨度。交付形态含数据集(CSV/Parquet 加对象文件夹)、API 调用、Token 计量与可信数据空间连接器。

临床文书分类与章节切分数据如何定制与起步?

章节切分范围可选只按来源结构字段边界,或加上显式正文小标题,再按文书类型、科室、医院等级、文书时间与章节类型筛选,起订量为 20,000 份临床文书,数据量按项目商定。可先申请开源子集或测试数据核对偏移口径。

临床文书分类与章节切分数据与哪些产品搭配?

常与临床实体与关系标注数据(SHP-MED-05-032)叠加正文之上的实体与关系标注层,与临床文本去标识化数据(SHP-MED-05-035)衔接同类文书的去标识结果与替换台账,与住院诊疗数据(SHP-MED-01-002)关联文书所依附的住院过程。

[08]

获取方式

  • 有明确科研/临床项目:提供研究方向与所需字段范围,可先申请开源子集用于可行性验证。
  • 有明确数据智能场景:提供模型或应用场景,可先申请测试数据与接入方式完成联调。
  • 许可:评估与研究使用许可。

© 数巨有谱数据集团