# 医疗检索增强生成(RAG)评测集(SHP-MED-07-046) 检索增强问答的评测集,检索段与生成段分开算分。语料先冻结成一份快照,在其上切块并配检索问题。相关性判定说明「应该检到什么」,与实际检索结果分列。参考答案拆成一条条断言,每条断言的引用回指到具体分块。用于区分失败发生在检索段(未召回相关证据)还是生成段(已召回但未被正确使用)。 所属体系:医疗模型评测与安全。 实体 17 个:答案断言 · 引用 · 语料分块 · 语料文书 · 语料快照 · 错误类型 · 数据质量项 · 评测问题 · 参考答案 · 相关性判定 · 检索结果 · 检索运行 · 复核记录 · 评分点 · 评分细则 · 来源沿袭 · 数据划分。 字段 107 个(交付范围内的字段总数)。 可获得的业务字段(示例):过敏史 · 现病史 · 记录时间 · 诊断 · 体格检查 · 既往史 · 文书类型 · 主诉 · 修正诊断 · 西医诊断 · 专科检查 · 入院诊断 · 诊断依据 · 病例特点 · 鉴别诊断 · 诊疗计划 · 文档类型 · 文档内容 · 医师签名 · 文档标题 · 目前情况 · 转科目的 · 入院科室 · 入院情况 · 转出诊断 · 注意事项 · 诊疗经过 · 转入诊断 · 病史汇报 · 讨论日期 · 参加讨论人员 · 主持人 · 手术时间 · 手术人员 · 会诊治疗项目 · 会诊意见 · 麻醉方法 · 手术经过 · 术前诊断 · 术后诊断 · 手术名称 · 出院医嘱 · 出院情况 · 出院诊断 · 分块策略版本 · 快照时间 · 快照版本 · 可用时间 · 文书族 · 文书正文 · 文本版本 · 文本块状态 · 文本块正文 · 结束偏移 · 起始偏移 · 可答性 · 问题截点 · 查询状态 · 查询文本 · 任务类型 · 配置版本 · 运行时间 · 排序位次 · 相关性状态 · 检索得分 · 判定依据 · 相关性等级 · 复核状态 · 答案正文 · 构造性质 · 拒答理由 · 断言状态 · 断言正文 · 引用终点 · 引用起点 · 引用正文 · 支持角色 · 评分方法 · 总分 · 判分要点 · 满分 · 失败条件 · 严重程度 · 复核版本 · 隔离层级 · 数据划分状态 · 处理方式 · 问题代码 · 断言标识 · 答案标识 · 数据性质 · 引用标识 · 文本块标识 · 文书标识 · 快照标识 · 错误标识 · 查询标识 · 数据质量项标识 · 相关性判定标识 · 结果标识 · 运行标识 · 复核标识 · 对象标识 · 复核时间 · 评分点标识 · 评分细则标识 · 沿袭标识 · 对象类型 · 来源定位 · 转换规则 等。 实体关系 3 组:一份语料文书切成多个证据分块;查询按相关性判定与检索结果连接到分块 · 一份参考答案拆成多条断言;每条断言按引用连接到支持它的分块与字符区间 · 每次检索运行绑定唯一的语料快照、查询与配置版本。 数据集组织形式:问题清单 + 单一问题文件夹 + 元数据文件;问题文件夹内含语料快照、相关分块、参考答案、断言与引用、评分细则。。 数据量:按项目商定。 字段范围:按项目的数据来源与加工范围商定。 交付与供应方式:数据集交付:清单 CSV/Parquet + 单一对象文件夹 + Meta.jsonl/Parquet;API 调用;Token 计量;数巨有谱可信数据空间连接器合约使用。 数据取得方式:数据资源持有方书面授权。 数据来源机构:医疗机构(含等级医院、社区医院及康复机构、疾控机构)。 数据加工机构:数巨有谱或数据资源持有方。 数据经营机构:数巨有谱(经营权权利人)。 许可:评估与研究使用许可。 更新日期:2026-08-05。 ## 样例 一次冻结的临床文书语料快照,按声明的切分策略分块并记录每块在原文中的起止位置。问题写明任务类型、证据截点与是否可答。检索运行绑定该快照与一版配置,返回带名次和分数的结果。每条结果另有一个独立的相关性分级,与检索本身无关。参考答案拆成可逐条核查的断言。每条断言用带精确起止位置的引用回指具体分块,失分按错误类型归档。 ## 使用场景 - 医疗科技企业 · 病历问答与知识问答产品团队|检索段与生成段的分别定位|获得:检索段与生成段分别可诊断、引用可逐条核查的问答评测口径 - 医院信息部门 · 院内知识问答与文书检索选型|上线前的证据可追溯性验收|获得:以证据可追溯为核心、可写进验收条款的选型口径 - 医学知识库与内容运营团队 · 语料与切分方式评估|切分策略与语料版本的影响测量|获得:可量化切分方式与语料版本影响的评估方法 - 高校与科研机构 · 检索增强方法研究|证据充分性与引用忠实度研究|获得:三层标注齐备、引用忠实度可复算的研究底座 ## 常见问题 问:医疗检索增强生成评测集包含哪些内容? 答:医疗检索增强生成(RAG)评测集(SHP-MED-07-046)先把语料冻结成快照,在其上切块并配检索问题。相关性判定说明应该检到什么,与实际检索结果分列。参考答案拆成一条条断言,每条断言的引用回指到具体分块。 问:RAG 评测集适合评什么? 答:医疗检索增强生成(RAG)评测集(SHP-MED-07-046)把检索段与生成段分开算分,用于判断失败发生在未召回相关证据,还是已召回却未被正确使用。它作为独立评测集使用,与训练侧数据隔离。 问:样例能看到什么?怎么交付? 答:公开样例展示医疗检索增强生成(RAG)评测集(SHP-MED-07-046)的问题结构:语料快照、相关分块、断言与引用、评分细则;参考答案随项目交付。交付为问题清单加单一问题文件夹与元数据文件,另支持 API 调用与连接器合约使用。 问:起订量是多少?可以怎么定制? 答:医疗检索增强生成(RAG)评测集(SHP-MED-07-046)起订量为 400 道检索问答题,范围按单一任务类型或全任务类型组合确定。语料文书构成、分块策略版本、相关性分级体系、可答与不可答比例与证据截点可选配。 问:和哪些产品配合使用? 答:医疗检索增强生成(RAG)评测集(SHP-MED-07-046)的训练侧对应证据问答与检索增强训练数据(SHP-MED-06-037)。要把检索问答放进多步过程,可接电子病历检索与患者摘要轨迹数据(SHP-MED-08-050)。 ## 关联数据集 - SHP-MED-06-037 证据问答与检索增强训练数据:训练侧对应的证据问答数据 - SHP-MED-08-050 电子病历检索与患者摘要轨迹数据:把检索问答放进多步轨迹的智能体数据 - SHP-MED-05-031 临床文书分类与章节切分数据:切分策略所依托的文书结构数据 页面:https://www.shujuyoupu.com/datasets/catalog/products/SHP-MED-07-046/