数巨有谱数据集团
[01 · SHP-MED-07-044]

临床信息抽取与编码评测集

评测模型从病历文本中抽取临床信息的准确性,以及术语到目标编码体系的映射正确性。文本冻结在一个确定版本上,答案用字符区间标出它在原文的确切位置。实体、关系、时间事件与编码候选各自成条,参考答案与评分细则随题绑定。用于抽取与编码模型的分任务验收,也可用于病案编码质量核查。

医疗模型评测与安全 · 评估与研究使用许可 · 更新日期 2026-08-05

15
实体
205
字段
3
实体关系
07
所属体系
[02 · 产品说明]

读懂数据结构与交付边界

以下内容来自产品说明书,包含数据拓扑、字段字典、脱敏样例、使用场景及定制方式。

[01]

数据产品概览

数量内容
实体15污染记录 · 冻结文本 · 评测题 · 编码候选 · 实体候选 · 时间事件候选 · 关系候选 · 字符区间候选 · 数据质量项 · 参考答案 · 复核记录 · 评分细则 · 来源沿袭 · 数据划分 · 术语发布版本
字段205交付范围内的字段总数
实体关系3每道题绑定一个冻结文本版本,答案位置按可复算的字符区间标注 · 关系候选的两端实体取自同一份文书,且分别指向不同实体 · 编码候选绑定原始术语、目标编码体系、冻结的术语发布版本与复核状态

交付与供应方式

  1. 数据集交付:清单 CSV/Parquet + 单一对象文件夹 + Meta.jsonl/Parquet
  2. API 调用
  3. Token 计量
  4. 数巨有谱可信数据空间连接器合约使用

权利与来源

  • 数据取得方式:数据资源持有方书面授权
  • 数据来源机构:医疗机构(含等级医院、社区医院及康复机构、疾控机构)
  • 数据加工机构:数巨有谱或数据资源持有方
  • 数据经营机构:数巨有谱(经营权权利人)
[02 · DATA CONTENT]

数据内容与字段结构

在同一位置切换字段字典、实体血缘与脱敏样例,避免重复铺陈造成页面过长。

数据血缘拓扑

实体与连接关系分层呈现:上方先识别全部数据对象,下方逐条阅读关系基数,避免连线交叠、标签遮挡或内容被裁切。

15 个实体11 条连接响应式完整展示

实体概览

核心实体以品牌蓝标识
01关联实体

污染记录

训练侧隔离口径

02关联实体

冻结文本

文书类型/文本版本

03核心实体

评测题

任务模式/题干

04关联实体

编码候选

原始术语/目标代码

05关联实体

实体候选

实体类型/断言状态

06关联实体

时间事件候选

事件类型/锚点状态

07关联实体

关系候选

关系类型/两端实体

08关联实体

字符区间候选

起止位置/计位口径

09辅助实体

数据质量项

quality_issue

10关联实体

参考答案

答案正文/结构化答案

11关联实体

复核记录

复核状态/时点

12关联实体

评分细则

计分方法/满分

13辅助实体

来源沿袭

source_lineage

14关联实体

数据划分

主体独立性

15关联实体

术语发布版本

术语域/版本

连接关系

每条关系独占一行,基数置于两实体之间

实体 A01

冻结文本

文书类型/文本版本

1—n
实体 B

评测题

任务模式/题干

实体 A02

冻结文本

文书类型/文本版本

1—1
实体 B

污染记录

训练侧隔离口径

实体 A03

评测题

任务模式/题干

1—n
实体 B

字符区间候选

起止位置/计位口径

实体 A04

字符区间候选

起止位置/计位口径

1—1
实体 B

实体候选

实体类型/断言状态

实体 A05

字符区间候选

起止位置/计位口径

1—1
实体 B

时间事件候选

事件类型/锚点状态

实体 A06

实体候选

实体类型/断言状态

1—n
实体 B

关系候选

关系类型/两端实体

实体 A07

评测题

任务模式/题干

1—n
实体 B

编码候选

原始术语/目标代码

实体 A08

术语发布版本

术语域/版本

1—n
实体 B

编码候选

原始术语/目标代码

实体 A09

评测题

任务模式/题干

1—1
实体 B

参考答案

答案正文/结构化答案

实体 A10

评测题

任务模式/题干

1—1
实体 B

评分细则

计分方法/满分

实体 A11

评测题

任务模式/题干

1—n
实体 B

复核记录

复核状态/时点

核心实体关联实体1—1 / 1—n / n—1 表示关系基数
查看关系语义清单
基数关系语义
冻结文本1—n评测题一份冻结文本可支撑多道题
冻结文本1—1污染记录文本按污染记录声明与训练侧的隔离
评测题1—n字符区间候选题目绑定答案所在的字符区间
字符区间候选1—1实体候选区间对应一个实体候选
字符区间候选1—1时间事件候选时间表达的区间对应一个时间事件候选
实体候选1—n关系候选实体作为端点参与关系候选
评测题1—n编码候选编码题绑定原始术语与目标代码候选
术语发布版本1—n编码候选编码候选按冻结的术语发布版本给出
评测题1—1参考答案一道题对应一份参考答案
评测题1—1评分细则一道题对应一版评分细则
评测题1—n复核记录题目的历次复核记录

评测题是全套结构的锚点。题干、字符区间、实体与关系候选都按题目标识对齐。时间事件、编码候选、参考答案与评分细则同样对齐到题目标识。区间回指冻结文本里的具体位置,每个答案都能原样定位回原文;文本一改版就要重算坐标。术语发布版本单列一个节点,编码答案换版本另立一版,旧结果保留。污染记录写明本题与训练侧数据的隔离口径。数据质量项与来源沿袭覆盖全部对象。

[03]

使用场景

抽取与编码模型的分任务验收

医疗科技企业 · 临床文本结构化研发团队

  • 边界与类型分开算:字符区间边界命中与实体类型判定分列统计
  • 严格与宽松两套口径:同一道区间题同时报严格边界命中与已声明的宽松重叠命中。按下游用途取其中一套
  • 关系两端都要对:关系题要求主体、客体与关系类型同时正确
  • 空结果算对:文本中确无该信息时,输出空结果为正确答案,与漏抽分列统计
  • 无合适概念时判歧义:目标系统里没有合适概念时,判为歧义或未映射才得分

获得:抽取与编码能力可按任务分项验收、失分能落到具体环节

编码结果的抽查口径与版本对照

医院病案与统计部门 · 编码质量核查

  • 原始写法与代码分列:文本里的原始术语与映射结果分开保存,抽查时看得出是写法问题还是映射问题
  • 按版本判对错:每条编码答案绑定术语发布版本,换版本重判时旧结果保留
  • 歧义单独成类:临床写法本身指向不明的条目归入歧义,与错映射分开,核查精力放在真正的错误上
  • 回原文核对:每条代码回指原始术语在文本中的位置,核查人可直接读上下文判断映射是否成立

获得:有原文可回、有版本可对的编码抽查口径

文本处理链路的位置一致性回归

医疗信息化企业 · 结构化引擎质量把关

  • 计位口径统一:区间按 Unicode 字符计位,左闭右开——起点算在内,终点不算在内。可直接拿来对照引擎内部的计位方式
  • 改版即重算:文本经去标识或重新切分后必须重算区间,这套题用来检验引擎有没有沿用旧坐标
  • 时间锚点检验:相对天数一类表达,在锚点缺失时应保留未解状态。用来检验引擎在锚点缺失时给出什么
  • 用例固定可复跑:文本版本、题目与评分细则各自固定,引擎每次改动后跑同一套题直接比对前后结果

获得:覆盖位置、切分与时间解析的结构化链路回归用例

标注分层与数据隔离的研究底座

高校与科研机构 · 临床文本标注方法研究

  • 候选与定稿分层:规则与字典命中形成的候选,与经复核的答案分层保存。可用于研究候选质量与人工复核成本的关系
  • 隔离层级写明:划分记录是否做到主体级独立。只能做到文档级时如实标注
  • 与训练侧不重叠:污染记录声明本题与训练侧数据的隔离口径,可复核地排除考题被训练见过的情况
  • 判分口径可复算:严格与宽松两套口径、关系端点判定、编码版本口径都写成明确规则。第三方按同一规则复算得到同样结果

获得:标注分层与隔离口径写明、结果可复算的研究底座

[04]

定制与定向

  • 是否支持定制:是
  • 任务范围(单选):按单一抽取或编码任务 / 按全任务组合
  • 其他定制项(多选):文书类型构成 / 实体与关系类型体系 / 编码目标系统 / 术语发布版本 / 隔离层级要求
  • 最低定制数量:600 道抽取与编码题
  • 扩展项:任务模式扩充、编码目标系统与术语版本按项目商定
  • 其他可定制项:与项目商务确定
[05]

去标识化与交付

  1. 直接标识符移除:姓名、证件号码、联系方式、住址
  2. 间接标识符不可逆映射:患者标识、就诊号、报告单号
  3. 时间平移:整体平移并保持时序与时间间隔
  4. 机构与医师信息去除或泛化
  5. 自由文本二次核查:叙述内容中的标识信息
  6. 可按项目追加 K-匿名等泛化处理,匿名化的判定与出具方式随项目约定
  7. 冻结文本按字符区间逐段核查,标识符替换后同步重算区间坐标
  • 加密通道交付:支持
[06]

关联数据集

  • SHP-MED-06-038 临床信息抽取训练数据——训练侧对应的抽取数据,与本评测集按文档隔离
  • SHP-MED-05-034 诊断、操作与药品术语标准化数据——编码题所依据的术语标准化数据
  • SHP-MED-05-032 临床实体与关系标注数据——实体与关系标注口径的同源数据
[07]

常见问题

临床信息抽取与编码评测集包含哪些内容?

临床信息抽取与编码评测集(SHP-MED-07-044)把病历文本冻结在确定版本上,答案用字符区间标出它在原文的确切位置。实体、关系、时间事件与编码候选各自成条,参考答案与评分细则随题绑定。术语发布版本随题声明。

抽取与编码评测集适合评什么?

临床信息抽取与编码评测集(SHP-MED-07-044)用于抽取模型与编码模型的分任务评估,也可用于病案编码质量核查。它作为独立评测集使用,与训练侧数据按文档隔离,抽取段与编码段分别出分。

样例能看到什么?交付形态是什么?

公开样例展示临床信息抽取与编码评测集(SHP-MED-07-044)的题目结构:冻结文本、字符区间、实体关系与事件候选、编码候选与评分细则;参考答案随项目交付。交付为题目清单加单一题目文件夹与元数据文件,另支持 API 调用。

怎么定制?起订量是多少?

临床信息抽取与编码评测集(SHP-MED-07-044)起订量为 600 道抽取与编码题,范围按单一抽取或编码任务或全任务组合确定。文书类型构成、实体与关系类型体系、编码目标系统、术语发布版本与隔离层级要求可选配。

和哪些产品搭配使用?

临床信息抽取与编码评测集(SHP-MED-07-044)与临床信息抽取训练数据(SHP-MED-06-038)按文档隔离配套,训练与评测各用各的文书。编码题依据的映射口径可取诊断、操作与药品术语标准化数据(SHP-MED-05-034)。

[08]

获取方式

  • 有明确科研/临床项目:提供研究方向与所需字段范围,可先申请开源子集用于可行性验证。
  • 有明确数据智能场景:提供模型或应用场景,可先申请测试数据与接入方式完成联调。
  • 许可:评估与研究使用许可。

© 数巨有谱数据集团

[03 · 关联产品]

继续查看可连接的数据产品

按产品资料中登记的患者、就诊、事件或任务标识关系继续查看。