数巨有谱数据集团
[01 · SHP-MED-05-034]

诊断、操作与药品术语标准化数据

分领域的来源术语原名及其到参考编码体系的映射结果。原名按书写原样保留,另存一份只做空白规范化的归一取值。每条映射带目标编码、目标名称、映射方法与映射状态。可用于院内术语库建设、编码差距盘点与术语标准化模型训练。

临床文本与标准化 · 评估与研究使用许可 · 更新日期 2026-08-05

6
实体
31
字段
1
实体关系
05
所属体系
[02 · 产品说明]

读懂数据结构与交付边界

以下内容来自产品说明书,包含数据拓扑、字段字典、脱敏样例、使用场景及定制方式。

[01]

数据产品概览

数量内容
实体6术语发布 · 来源术语 · 归一术语 · 术语映射 · 映射复核 · 数据质量项
字段31交付范围内的字段总数
实体关系1一条来源术语保留它的全部来源出现记录,并对应零条或一条候选映射;未命中即登记为未映射,不为凑映射率强行配码

交付与供应方式

  1. 数据集交付:清单 CSV/Parquet + 单一对象文件夹 + Meta.jsonl/Parquet
  2. API 调用
  3. Token 计量
  4. 数巨有谱可信数据空间连接器合约使用

权利与来源

  • 数据取得方式:数据资源持有方书面授权
  • 数据来源机构:医疗机构(含等级医院、社区医院及康复机构、疾控机构)
  • 数据加工机构:数巨有谱或数据资源持有方
  • 数据经营机构:数巨有谱(经营权权利人)
[02 · DATA CONTENT]

数据内容与字段结构

在同一位置切换字段字典、实体血缘与脱敏样例,避免重复铺陈造成页面过长。

数据血缘拓扑

实体与连接关系分层呈现:上方先识别全部数据对象,下方逐条阅读关系基数,避免连线交叠、标签遮挡或内容被裁切。

6 个实体5 条连接响应式完整展示

实体概览

核心实体以品牌蓝标识
01核心实体

来源术语

原名/出现次数

02关联实体

归一术语

归一取值/规范化档

03关联实体

术语映射

目标编码/方法/状态

04关联实体

术语发布

目标体系版本口径

05关联实体

映射复核

复核后方可接受

06辅助实体

数据质量项

随数据交付

连接关系

每条关系独占一行,基数置于两实体之间

实体 A01

来源术语

原名/出现次数

1—1
实体 B

归一术语

归一取值/规范化档

实体 A02

来源术语

原名/出现次数

1—n
实体 B

术语映射

目标编码/方法/状态

实体 A03

术语发布

目标体系版本口径

1—n
实体 B

术语映射

目标编码/方法/状态

实体 A04

术语映射

目标编码/方法/状态

1—n
实体 B

映射复核

复核后方可接受

实体 A05

术语映射

目标编码/方法/状态

1—n 映射层的问题登记,随数据一同交付
实体 B

数据质量项

随数据交付

核心实体关联实体1—1 / 1—n / n—1 表示关系基数
查看关系语义清单
基数关系语义
来源术语1—1归一术语一条来源术语对应一条归一取值,原名与归一值并列存放
来源术语1—n术语映射一条来源术语对应零条或一条候选映射,未命中即为未映射
术语发布1—n术语映射映射所指向的目标编码体系发布及其版本口径
术语映射1—n映射复核该条映射的复核记录,经复核才可标为已接受
术语映射1—n数据质量项映射层的问题登记,随数据一同交付

来源原名、归一取值与目标概念分居三处,映射可撤回而原名不变。一条来源术语对应零条或一条候选映射,没命中就是未映射。四个领域在结构上分开,同一个词在诊断域与药品域不共用概念标识。

[03]

使用场景

编码开工前的术语盘点与未映射清单

三甲医院 · 病案编码与医保结算团队

  • 差距先成清单:来源原名与参考体系逐条比对后,未命中条目单独成清单交付。编码工作可直接从这张清单开始
  • 整段书写才是常态:诊断字段里成段出现主要与次要诊断标题、带序号的多诊断并列。本批十七条诊断原名中这类写法占多数,拆分要排在配码前面
  • 脏写法各有实例:末尾多一个句号、后面粘着两个时间、两个诊断用空格连成一条。这几类写法在本批中都能找到实例,可据此定院内录入规范的整改重点
  • 整改按频次排序:每条原名带来源出现次数,可先修最常出现的那几条写法,投入产出比一目了然
  • 命中也要人过一遍:八条严格原名命中,映射状态标为待复核。经人工复核后才可标为已接受

获得:一份可直接排期的术语整改与编码工作清单

院内术语库建设的起点数据

医疗信息化企业 · 术语服务与主数据产品团队

  • 四域分开建库:诊断、操作、药品商品名、药品医嘱名各成一域。同名词不跨域共用概念标识
  • 原名一字不改:归一只收拢空白与换行。术语库日后升级归一规则可从原名重跑,不必回到来源系统重取
  • 去重仍能回源:术语按原名去重,每条保留全部来源出现位置。主数据审校时查得到某个写法出自哪些字段
  • 可信度可分层:严格匹配与保持未映射分别记录。术语库可按映射方法分层展示
  • 版本口径写在数据里:目标编码体系的性质随映射交付。本例标为本地参考快照,对外承诺可据此写准

获得:分域清楚、原名可回溯、可信度可分层的术语库起点数据

术语归一模型的训练样本与拒配能力

医疗科技企业 · 医学术语归一模型团队

  • 拒配是要学的能力:一百六十九条未映射条目是明确的负样本。可训练模型在无把握时输出「未映射」
  • 先拆后配成两段:整段诊断原名与其中的单一诊断词同时在册。可直接构造「先切分再配码」的两段式训练任务
  • 命中样本形态单一:八条命中的都是单一诊断词。复合写法才是训练重心所在
  • 药品名信息密度高:药品医嘱名里同时含药名、规格、包装、数量、给药途径与频次。可用作从长串文本中抽出药品概念的训练输入
  • 噪声不预先清洗:句号、序号、粘连时间等噪声原样交付。模型在训练阶段就见到真实输入

获得:含拒配负样本与真实噪声的术语归一训练样本

多来源病历合并前的术语口径核对

医学研究团队 · 跨系统统计口径对齐

  • 合并前先看重合度:以原名对参考体系的严格命中比例,判断两个来源的术语可否合并统计
  • 同词不同域先隔离:领域字段让统计时不会把药品商品名与诊断名混进同一个计数
  • 频次可用于加权:出现次数随术语交付,人群统计可按术语频次加权
  • 未映射单独成组:未映射条目单独成组参与统计,口径与已映射条目分开

获得:合并前口径可核、未映射不被静默丢弃的统计底表

[04]

定制与定向

  • 是否支持定制:是
  • 映射目标(单选):按诊断与操作编码体系 / 按药品概念体系
  • 其他定制项(多选):术语领域范围 / 科室范围 / 术语出现频次下限 / 映射方法范围 / 来源时间范围
  • 最低定制数量:5,000 条来源术语
  • 复核深度:交付到候选映射,还是继续做人工复核与已接受判定,按项目确定
  • 其他可定制项:与项目商务确定
[05]

去标识化与交付

  1. 直接标识符移除:姓名、证件号码、联系方式、住址
  2. 间接标识符不可逆映射:患者标识、就诊号、报告单号
  3. 时间平移:整体平移并保持时序与时间间隔
  4. 机构与医师信息去除或泛化
  5. 自由文本二次核查:叙述内容中的标识信息
  6. 可按项目追加 K-匿名等泛化处理,匿名化的判定与出具方式随项目约定
  7. 术语原名中夹带的日期统一平移,保序保间隔;粘在术语后面的时间片段随之平移,不单独删除
  8. 来源出现位置登记只保留字段与对象层级,不含患者与就诊标识
  • 加密通道交付:支持
[06]

关联数据集

  • SHP-MED-05-032 临床实体与关系标注数据——给出待标准化术语在文本中的位置与类别
  • SHP-MED-01-006 病案首页与诊断操作数据——诊断与操作编码所服务的首页结构
  • SHP-MED-06-038 临床信息抽取训练数据——把术语标准化接进抽取任务的训练形态
[07]

常见问题

诊断、操作与药品术语标准化数据包含哪些内容?

诊断、操作与药品术语标准化数据(SHP-MED-05-034)交付分领域的来源术语原名及其到参考编码体系的映射结果,分诊断、操作、药品商品名与药品医嘱名四域。原名按书写原样保留,每条映射带目标编码、目标名称、映射方法与映射状态。

诊断、操作与药品术语标准化数据适合什么任务?

适合术语归一与标准化模型训练,未映射条目是现成的拒配负样本,整段诊断可构造先切分再配码的两段式任务;也适合病案编码开工前的术语差距盘点、院内术语库建设的起点数据,以及多来源病历合并前的统计口径核对。

诊断、操作与药品术语标准化数据的样例与交付形态?

产品页提供真实脱敏样例:一百七十七条来源术语原名及出现次数,句号、序号、粘连时间等真实噪声原样保留,严格命中与保持未映射分别登记。支持数据集交付、API 调用、Token 计量与可信数据空间连接器。

诊断、操作与药品术语标准化数据怎么定制?

映射目标可选诊断与操作编码体系或药品概念体系,再按术语领域、科室、术语出现频次下限、映射方法与来源时间范围定制,起订量为 5,000 条来源术语,数据量按项目商定。可先申请开源子集或测试数据核对映射与复核口径。

诊断、操作与药品术语标准化数据可以和哪些产品组合?

常与临床实体与关系标注数据(SHP-MED-05-032)取得待标准化术语在文本中的位置与类别,与病案首页与诊断操作数据(SHP-MED-01-006)对接编码所服务的首页结构,与临床信息抽取训练数据(SHP-MED-06-038)把术语标准化接进抽取任务。

[08]

获取方式

  • 有明确科研/临床项目:提供研究方向与所需字段范围,可先申请开源子集用于可行性验证。
  • 有明确数据智能场景:提供模型或应用场景,可先申请测试数据与接入方式完成联调。
  • 许可:评估与研究使用许可。

© 数巨有谱数据集团