数巨有谱数据集团
[01 · Selection Guide]

选型指南

按建模任务与数据条件定位起步产品与扩展路径。每种组合能拿到什么、覆盖到哪儿,逐条列出。

18 组常见问题 · 更新日期 2026-08-05

[02 · 问题选型]

从实际问题定位起步产品

每组问题分别标注核心产品、可选增强、预期结果和当前组合的覆盖边界。

[01 · 常见问题]

门诊、住院和医嘱资料分散,看不到同一位患者的连续诊疗过程。

使用方式

  • 分别整理门诊与住院就诊记录
  • 把诊断、医嘱和可连接的结果放回对应就诊
  • 按事件时间组织住院过程,再汇总成患者纵向时间线
  • 需要快速阅读时,增加检索与摘要轨迹

得到什么

  • 门诊与住院两类数据集。
  • 患者—就诊—诊断—医嘱连接表。
  • 住院事件时间线与患者纵向记录。
  • 检索与摘要结果,每条附引用。

适用边界

  • 只连接能可靠对应到同一位患者、同一次就诊的记录。
  • 跨院轨迹、正式随访和长期结局需项目另行接入。
[02 · 常见问题]

要复盘一次住院里的关键事件和治疗计划,但各类记录用的时间口径不一样。

使用方式

  • 确定单次住院及其入院出院边界
  • 分开组织医嘱、实际操作和执行状态
  • 按各自的业务时间排列诊疗事件
  • 需要跨就诊阅读时,再加纵向记录和摘要

得到什么

  • 单次住院的完整记录。
  • 医嘱与执行状态表。
  • 可排序的住院事件时间线。
  • 关键问题摘要及对应引用。

适用边界

  • 记录时间、医嘱时间和执行时间三列分别保存。
  • 给药、护理和转科节点按来源记录交付,缺失处保持未知。
[03 · 常见问题]

想分析再入院、术后恢复和患者安全,但出院后的观察窗口并不完整。

使用方式

  • 以出院为观察起点组织多次住院序列
  • 按规则识别再入院候选,并保留观察窗
  • 连接术后恢复、风险评估和来源结局
  • 按病例生成可核对的检索与摘要结果

得到什么

  • 多次住院序列与再入院候选表。
  • 术后恢复及来源结局记录。
  • 风险评估与安全事件候选清单。
  • 患者级复核摘要。

适用边界

  • 再入院判定只在可观察的出院后窗口内成立,窗口覆盖情况随数据声明。
  • 并发症以满足定义的事件证据为准,证据不足时按未知交付。
[04 · 常见问题]

专病研究的入组、基线、观察期和结局口径不一致,队列难以复算。

使用方式

  • 冻结纳入排除规则、索引事件和基线窗口
  • 接入结构化基线检验,标记缺失值
  • 按患者组织已观察到的病程事件
  • 满足重复测量条件时,增加检验变化
  • 连接治疗、复评和来源结局

得到什么

  • 可复算的候选、纳入和排除清单。
  • 基线特征表与缺失说明。
  • 患者级病程事件表。
  • 治疗、变化和结局研究表。

适用边界

  • 病程事件覆盖已观察到的就诊范围,连续全病程需项目另行接入。
  • 结局按来源记录交付,未记录处保持未知。
[05 · 常见问题]

要比较治疗前后的指标与结局,但单次结果、医嘱和疗效结论常被混在一起。

使用方式

  • 先确定研究对象、治疗事件和复评窗口
  • 保留单条检验结果、单位与参考范围
  • 同一项目、单位可比、时点不同的结果才组成变化序列
  • 连接已明确的治疗记录、复评指标和来源结局

得到什么

  • 治疗前后检验结果与可复算变化指标。
  • 治疗方案、实施状态和复评窗口表。
  • 并发症及结局观察表。

适用边界

  • 变化指标至少需要两个不同时点的可比结果。
  • 治疗暴露以已明确的治疗事件记录为准。
  • 疗效与因果结论需要标准终点和随访数据,需项目另行接入。
[06 · 常见问题]

糖尿病管理研究要同时看代谢指标、用药、护理状态和随访任务。

使用方式

  • 确定糖尿病观察期,整理诊断与管理内容
  • 组织离散的糖代谢结果,条件成立时组成序列
  • 分开记录用药医嘱与实际执行
  • 连接护理评估、复评和随访任务

得到什么

  • 糖尿病管理数据表。
  • 代谢指标结果与时序数据。
  • 用药和护理复评状态表。
  • 随访任务候选,以及明确标识的合成轨迹。

适用边界

  • 正式随访、实际用药依从性和连续血糖监测需项目另行接入。
  • 完整并发症筛查和长期结局不在本组合范围内。
  • 完整随访计划、提醒和交互轨迹为合成,单独标识。
[07 · 常见问题]

影像、报告和复查资料分散,难以形成可追溯的多模态病例。

使用方式

  • 按明确的检查标识或正式映射建立影像与报告的对应关系
  • 围绕同一病例、临床问题和观察窗组织多模态资料
  • 按基线与复查报告形成变化序列
  • 按需要增加训练或评测任务

得到什么

  • 已核实的影像—报告配对清单。
  • 多模态病例包与模态可用性清单。
  • 复查报告序列和来源变化描述。

适用边界

  • 只凭患者、时间或部位对上的,按候选关系交付。
  • 像素级标注与缺失模态需项目另行接入。
[08 · 常见问题]

已有影像和报告,想构造多模态训练与评测数据,但配对范围和标注口径要说得清。

使用方式

  • 冻结已核实的影像—报告配对范围
  • 按病例和观察窗组织训练输入
  • 把任务说明、参考内容和评分规则接到数据上
  • 按患者、检查和派生来源隔离训练与评测

得到什么

  • 可读取的多模态训练样本。
  • 隔离的多模态评测题与评分规则。
  • 配对、模态可用性和质量问题清单。

适用边界

  • 只有已核实的配对记录进入真实训练与评测范围。
  • 合成任务明确标识,与真实数据分开交付。
[09 · 常见问题]

肺部肿瘤研究要用影像、病理和复查资料,但这几侧之间还没有正式连接。

使用方式

  • 分别整理肺部影像—报告和病理病例两侧资料
  • 保留检查、病例、图像、报告和诊断的真实层级
  • 在明确的临床问题和观察窗内形成多模态候选病例
  • 按后续检查组织复查报告和变化描述

得到什么

  • 已核实的肺部影像—报告配对。
  • 病理病例级图像与报告候选包。
  • 多模态可用性和关系冲突清单。
  • 复查报告序列。

适用边界

  • 影像—病理—手术三链只在同一患者或病例有正式连接时交付。
  • 病理图像按实际类型标注,病灶真值、完整分期和长期结局需项目另行接入。
[10 · 常见问题]

临床文本抽取训练需要文书版本、去标识文本和结构化目标保持一致。

使用方式

  • 固定文书类型、内容版本和章节边界
  • 生成可读的去标识版本,保持替换后的字符位置一致
  • 连接实体关系、时间事件和术语映射数据
  • 构造训练样本,用隔离出来的文本做评测

得到什么

  • 带版本的章节文本与去标识文本。
  • 实体关系、时间事件和术语映射数据。
  • 结构化抽取训练集,以及隔离出来的评测集。

适用边界

  • 词典命中、规则输出和共现按候选交付,参考答案需专业复核。
  • 训练与评测按患者、文书版本和派生来源隔离。
[11 · 常见问题]

实体、时间和术语任务分别生产,坐标、版本和复核状态无法对齐。

使用方式

  • 先固定同一份文书的内容版本
  • 用统一的字符位置组织实体、关系和属性
  • 连接时间表达、事件、锚点和先后关系
  • 保留术语原值、候选映射、状态和目标版本
  • 形成多任务训练与评测数据

得到什么

  • 字符位置一致的实体关系与时间事件数据。
  • 带版本的术语映射表。
  • 可回放的多任务训练样本和评分数据。

适用边界

  • 候选关系和候选编码按候选交付,人工确认结果需专业复核。
  • 未知时间保持未知,换行、标题和编号按原样保留。
[12 · 常见问题]

医疗问答训练要把问题、语料、依据、答案引用和拒答边界放进同一份数据里。

使用方式

  • 准备章节化、可直接使用的文本语料
  • 构造问题、检索候选、依据、答案引用和拒答样本
  • 分开评估检索、依据选择、答案和引用
  • 按需要增加安全、隐私、分组适用性和扰动测试

得到什么

  • 章节化的去标识语料。
  • 证据问答训练数据,每条结论附引用。
  • 检索、安全和稳定性评测数据。

适用边界

  • 真实文书作为语料原料交付,人工相关性、标准答案和引用标注需另行约定。
  • 合成题和高风险变体单独标识,并经专业复核。
[13 · 常见问题]

医疗检索问答需要知道失败来自检索、依据、答案、引用还是安全边界。

使用方式

  • 冻结语料版本、问题和不可回答条件
  • 分别检查检索结果、依据选择、回答结论与引用
  • 加入急症、禁忌、冲突信息和越界建议测试
  • 用匹配分组和可重复跑的扰动检查适用性与稳定性

得到什么

  • 检索、依据、答案、引用和拒答分项结果。
  • 医疗安全测试结果。
  • 隐私、分组适用性与鲁棒性结果。

适用边界

  • 合成的测试内容明确标识,与真实记录分开交付。
  • 公平性结果按合成匹配对口径给出,真实群体覆盖需项目接入。
[14 · 常见问题]

一个医疗模型版本需要同时检查通用能力、时间推理、多模态、检索和安全短板。

使用方式

  • 冻结待测版本、任务口径和数据截点
  • 运行通用临床能力和纵向时间推理任务
  • 按适用范围增加多模态与检索评测
  • 执行安全、隐私、分组适用性和鲁棒性测试
  • 在独立数据到位后接入外部验证

得到什么

  • 多领域任务与评分结果。
  • 时间、多模态和检索错误类型表。
  • 安全、隐私和稳定性测试结果。
  • 独立测试的接入与封存数据结构。

适用边界

  • 病例与知识材料作为题干原料交付,人工参考答案需另行约定。
  • 独立外部队列和人工参考标准需项目接入。
  • 合成材料明确标识,与独立验证数据分开交付。
[15 · 常见问题]

已有开发集,希望判断模型在独立数据上的表现能否复现。

使用方式

  • 先固定开发阶段的任务、评分和模型版本
  • 按研究主体隔离独立数据
  • 在数据冻结后运行同口径能力与安全评测
  • 分开报告开发阶段结果与独立数据结果

得到什么

  • 独立测试的接入约定和数据结构。
  • 隔离的数据划分与封存说明。
  • 同一口径下的能力、安全及错误类型结果。

适用边界

  • 外部有效性结论以独立队列和人工参考标准实际接入为前提。
  • 合成材料用于演示接入与评测流程,明确标识后交付。
[16 · 常见问题]

临床检索和工具调用出现问题时,无法回放输入、调用、状态和输出。

使用方式

  • 把病历检索和摘要定义成可追踪的任务
  • 绑定工具的输入输出、状态和错误规则
  • 记录调用参数、返回值、检查点与重试
  • 增加错误恢复和工具误用测试

得到什么

  • 电子病历检索与摘要轨迹。
  • 工具规范和模拟任务。
  • 调用、状态、错误、重试与检查点记录。
  • 恢复和安全测试场景。

适用边界

  • 工具调用结果、任务完成状态和医学结论分三层记录。
  • 模拟环境用于验证接口约定、状态机和评分可回放,不接入真实临床系统。
[17 · 常见问题]

慢病随访需要把指标、用药、护理评估和随访任务组织成可复评流程。

使用方式

  • 确定慢病观察期、复评指标和适用问题
  • 组织检验结果、用药状态和护理评估
  • 生成随访计划、提醒、交互、复评和升级任务
  • 保留逾期、计划变更和人工确认状态

得到什么

  • 慢病管理数据与复评指标表。
  • 用药、护理和随访任务数据。
  • 明确标识的合成完整随访轨迹。

适用边界

  • 真实重复检查只形成事件或任务候选。
  • 完整随访计划、交互、复评决定和人工确认为合成,单独标识。
[18 · 常见问题]

智能体任务失败后,要知道错误出在哪、怎么恢复、何时转人工、有没有碰到医疗安全边界。

使用方式

  • 定义工具、任务状态和允许的错误响应
  • 记录失败调用、错误原因和前后状态
  • 执行重试、回退、影响范围限定和人工接管
  • 用检索或随访任务重跑恢复过程
  • 增加高风险、越界建议和工具误用测试

得到什么

  • 工具调用与状态轨迹。
  • 错误、恢复、回退和人工接管记录。
  • 可重复跑的检索或随访任务。
  • 医疗安全边界与工具误用测试结果。

适用边界

  • 受控技术事件按技术候选交付。
  • 完整的医学任务、恢复和接管轨迹为合成,与真实记录分开交付。