数巨有谱数据集团
[01 · SHP-MED-06-037]

证据问答与检索增强训练数据

证据问答与检索增强的训练样本。语料文书切成证据块,每条问题先判可答性,再经一次检索运行取得带排名与分数的候选。可答的问题给出回答、支持证据与精确到字符区间的引用。不可答的问题写明缺什么材料。可用于检索增强问答训练、拒答能力对齐与检索链路回归。

医疗模型训练 · 评估与研究使用许可 · 更新日期 2026-08-05

13
实体
178
字段
4
实体关系
06
所属体系
[02 · 产品说明]

读懂数据结构与交付边界

以下内容来自产品说明书,包含数据拓扑、字段字典、脱敏样例、使用场景及定制方式。

[01]

数据产品概览

数量内容
实体13语料文书 · 证据块 · 问题 · 回答 · 引用 · 支持证据 · 候选证据 · 不可答记录 · 检索运行 · 复核记录 · 数据划分 · 数据质量项 · 来源沿袭
字段178交付范围内的字段总数
实体关系4问题经检索运行连接到多个证据块候选,候选排名与支持关系分列 · 可回答的问题连接一个回答、至少一条支持证据与逐句引用 · 引用以 Unicode 半开坐标定位到具体的证据块版本。按坐标截取的文字必须与引用正文一致 · 不可回答的问题连接一条不可答记录,不生成回答、支持证据与引用

交付与供应方式

  1. 数据集交付:清单 CSV/Parquet + 单一对象文件夹 + Meta.jsonl/Parquet
  2. API 调用
  3. Token 计量
  4. 数巨有谱可信数据空间连接器合约使用

权利与来源

  • 数据取得方式:数据资源持有方书面授权
  • 数据来源机构:医疗机构(含等级医院、社区医院及康复机构、疾控机构)
  • 数据加工机构:数巨有谱或数据资源持有方
  • 数据经营机构:数巨有谱(经营权权利人)
[02 · DATA CONTENT]

数据内容与字段结构

在同一位置切换字段字典、实体血缘与脱敏样例,避免重复铺陈造成页面过长。

数据血缘拓扑

实体与连接关系分层呈现:上方先识别全部数据对象,下方逐条阅读关系基数,避免连线交叠、标签遮挡或内容被裁切。

13 个实体10 条连接响应式完整展示

实体概览

核心实体以品牌蓝标识
01核心实体

问题

可答性/问题类别

02关联实体

语料文书

直接证据/干扰块

03关联实体

证据块

分块版本/字符区间

04关联实体

检索运行

检索版本/快照版本

05关联实体

候选证据

排名/分数/角色

06关联实体

支持证据

支持状态/矛盾说明

07关联实体

回答

参考答案/回答依据

08关联实体

引用

落到字符区间

09关联实体

不可答记录

缺什么材料/边界声明

10关联实体

复核记录

证据与边界分项核

11关联实体

数据划分

近重复问题同组

12辅助实体

数据质量项

性质与口径

13辅助实体

来源沿袭

加工规则登记

连接关系

每条关系独占一行,基数置于两实体之间

实体 A01

语料文书

直接证据/干扰块

1—n
实体 B

证据块

分块版本/字符区间

实体 A02

问题

可答性/问题类别

1—n
实体 B

检索运行

检索版本/快照版本

实体 A03

检索运行

检索版本/快照版本

1—n
实体 B

候选证据

排名/分数/角色

实体 A04

证据块

分块版本/字符区间

1—n
实体 B

候选证据

排名/分数/角色

实体 A05

问题

可答性/问题类别

1—n
实体 B

支持证据

支持状态/矛盾说明

实体 A06

问题

可答性/问题类别

1—1
实体 B

回答

参考答案/回答依据

实体 A07

回答

参考答案/回答依据

1—n
实体 B

引用

落到字符区间

实体 A08

问题

可答性/问题类别

1—1 不可答的问题走这条路径,不生成回答与引用
实体 B

不可答记录

缺什么材料/边界声明

实体 A09

问题

可答性/问题类别

1—n
实体 B

复核记录

证据与边界分项核

实体 A10

数据划分

近重复问题同组

1—n
实体 B

问题

可答性/问题类别

核心实体关联实体1—1 / 1—n / n—1 表示关系基数
查看关系语义清单
基数关系语义
语料文书1—n证据块语料文书切成可被检索与引用的证据块
问题1—n检索运行一个问题的历次检索运行
检索运行1—n候选证据该次检索给出的带排名与分数的候选
证据块1—n候选证据候选指向具体的证据块,同一块可被多个问题检索到
问题1—n支持证据经复核确认支持该问题答案的证据块
问题1—1回答可答的问题对应一份参考答案
回答1—n引用答案逐句引用到证据块内的字符区间
问题1—1不可答记录不可答的问题走这条路径,不生成回答与引用
问题1—n复核记录该问题的历次分项复核记录
数据划分1—n问题问题按患者、来源文书族与近重复问题成组归入划分

语料文书切成证据块。问题经检索运行取得带排名与分数的候选。候选证据与支持证据分居两处,支持关系经复核确定。可答的问题连一份回答,并逐句引用到具体证据块的字符区间,按区间截取所得与引用正文一致。不可答的问题连一条不可答记录,写明缺什么材料并附语料边界声明。

[03]

使用场景

医疗问答的引用可回溯与拒答训练

医疗科技企业 · 检索增强生成产品团队

  • 检索命中与支持分列:候选证据与支持证据分居两处,支持关系经复核确定。模型据此学着分辨哪个候选真能当依据
  • 干扰块成对给出:每个问题都配一个主题相近却不含所需证据的候选。可训练模型在相似文本之间挑出真正的依据
  • 引用精确到字符:引用带证据块内的起止区间与引用正文。前端可高亮到具体那几个字,用户点开即见出处
  • 拒答要说缺什么:八条不可答记录逐条写明具体原因,如缺少病理报告、缺少给药执行或调剂记录。模型学到的是有信息量的拒答
  • 边界话术随数据走:不可答记录附语料边界声明。原话是「仅表示当前语料快照无法回答,不表示医学上不存在该事实」。产品对外表述有现成口径

获得:引用可高亮到原句、拒答带具体缺口的检索增强训练语料

院内病历问答的语料边界与出处呈现

医院信息中心 · 病历问答与查房辅助

  • 问题贴合日常查阅:入院体温、药物过敏、影像表现、出院诊断这几类问题。正是查房与交班时最常查的项
  • 答案短而可核:参考答案多为直接引自记载的短答,医师看到结论的同时就能看到那一句原文
  • 矛盾如实呈现:支持证据带矛盾说明,语料内若有互相冲突的记载会被标出
  • 语料范围写在问题上:每条问题带语料范围声明。院内接入不同科室语料时,可分别判定同一问题的可答性
  • 时间截点可执行:检索运行带证据截点,回答查房当日的问题时不会用到当日之后才录入的内容

获得:出处可见、语料范围明确的院内问答底料

检索链路的可复算基线与分块口径对齐

医疗信息化企业 · 检索系统与知识库工程

  • 同快照得同结果:检索版本与语料快照版本成对记录。两者固定则同一问题重跑得到同一批候选,可作检索链路的回归基线
  • 分块口径写在数据里:分块版本声明为 Unicode 半开区间。接入方按同一口径切块,引用坐标方可一致
  • 排名与分数都保留:候选带排名与分数,换检索算法后可与本批结果逐条比对排序变化
  • 辨别力可量化:语料中直接证据与干扰块各占一半,可用来测算检索在相近内容之间的辨别能力

获得:可复算、分块口径明确的检索链路基线数据

依据材料作答的操作规范与边界表述

药械与医学事务团队 · 材料问答与证据边界

  • 只答材料里有的:回答依据写明仅凭直接证据区间,可作为「不超出材料作答」的操作规范
  • 缺口汇成清单:不可答记录里的缺失证据可直接汇成材料缺口清单,指导下一步补哪些资料
  • 边界表述可复用:语料边界声明是一句可直接对外使用的规范表述。产品与合同文本可原样引用
  • 核对项固定成两条:复核记录把证据落实与答案边界分成两项,可作为材料问答的固定核对项

获得:不超出材料作答、缺口可成清单的问答规范底料

[04]

定制与定向

  • 是否支持定制:是
  • 语料范围(单选):按单一语料域 / 按多语料域组合
  • 其他定制项(多选):问题类别范围 / 不可答问题比例 / 干扰候选强度 / 证据块粒度 / 专科范围
  • 最低定制数量:2,000 条问答样本
  • 检索口径定制:分块粒度、候选数量与检索口径可按客户系统改写,改写后另出一版检索运行记录随数据交付
  • 其他可定制项:与项目商务确定
[05]

去标识化与交付

  1. 直接标识符移除:姓名、证件号码、联系方式、住址
  2. 间接标识符不可逆映射:患者标识、就诊号、报告单号
  3. 时间平移:整体平移并保持时序与时间间隔
  4. 机构与医师信息去除或泛化
  5. 自由文本二次核查:叙述内容中的标识信息
  6. 可按项目追加 K-匿名等泛化处理,匿名化的判定与出具方式随项目约定
  7. 语料文书与证据块按去标识策略处理,引用坐标随处理后的文本重算
  8. 问题、答案与引用正文中的日期统一平移,保序保间隔;证据截点随之平移
  • 加密通道交付:支持
[06]

关联数据集

  • SHP-MED-06-036 临床指令微调训练数据——单轮任务形态的指令样本
  • SHP-MED-07-046 医疗检索增强生成(RAG)评测集——同一能力做成成题评测的对照
  • SHP-MED-05-031 临床文书分类与章节切分数据——语料分块所依据的文书结构与坐标
[07]

常见问题

证据问答与检索增强训练数据包含哪些内容?

证据问答与检索增强训练数据(SHP-MED-06-037)交付检索增强问答训练样本:语料文书切成证据块,每条问题先判可答性,经检索运行取得带排名与分数的候选;可答问题给出回答、支持证据与精确到字符区间的引用,不可答问题写明缺什么材料。

证据问答与检索增强训练数据适合做什么?

适合检索增强生成(RAG)问答模型训练与拒答能力对齐,干扰块成对给出,可训练在相近文本中挑出真正依据;也适合院内病历问答的出处呈现设计、检索链路的可复算回归基线,以及依据材料作答的操作规范制定。

证据问答与检索增强训练数据有样例吗?怎么交付?

产品页提供明确标识的自产样例:二十四条问题,其中十六条可答、八条不可答,配四十八个证据块,一半为直接证据、一半为检索干扰块,引用精确到字符区间。交付形态含数据集、API 调用、Token 计量与可信数据空间连接器。

证据问答与检索增强训练数据如何定制与起步?

语料范围可选单一语料域或多语料域组合,再按问题类别、不可答问题比例、干扰候选强度、证据块粒度与专科范围定制,起订量为 2,000 条问答样本,数据量按项目商定。可先申请开源子集或测试数据核对检索运行与引用格式。

证据问答与检索增强训练数据与哪些产品搭配?

常与临床指令微调训练数据(SHP-MED-06-036)互补单轮任务形态的指令样本,与医疗检索增强生成(RAG)评测集(SHP-MED-07-046)对照同一能力的成题评测,与临床文书分类与章节切分数据(SHP-MED-05-031)取得语料分块的文书结构与坐标。

[08]

获取方式

  • 有明确科研/临床项目:提供研究方向与所需字段范围,可先申请开源子集用于可行性验证。
  • 有明确数据智能场景:提供模型或应用场景,可先申请测试数据与接入方式完成联调。
  • 许可:评估与研究使用许可。

© 数巨有谱数据集团

[03 · 关联产品]

继续查看可连接的数据产品

按产品资料中登记的患者、就诊、事件或任务标识关系继续查看。