数据采购需求 长时序多模态肿瘤数据
一、采购标的 1. 疾病:肺癌、结直肠癌、胃癌、胰腺癌 2. 数量:5,000例 3. 时序:每例覆盖时间跨度≥3年(优先5年),必须包含“确诊前追溯 → 确诊 → 治疗 → 随访结局”完整临床轨迹。 4. 模态:全文本病历 + 原始影像(DICOM) + 全切片病理(WSI) + 原始组学(FASTQ/BAM)。 二、交付标准 1. 文本不截断:所有病历文书必须提供 100%完整原文(full_text),严禁截断或摘要替代。 2. 影像不删减:CT必须提供“平扫+全部实际增强期相”及“厚薄层全量”原始DICOM;报告提及“对比前片”必须同步提供被对比的既往影像及报告。 3. 微观可追溯:病理报告、WSI(H&E必需)、IHC、组学(FASTQ优先)必须通过标本ID精准绑定,杜绝错配。 4. 全局索引:必须提供统一的文件索引表(file_manifest)和患者级数据看板(dataset_meta),确保跨模态数据可检索、不脱节。 三、POC前置 正式交付前须先提供 ≥20例(覆盖全部4个病种)的POC数据,跑通全链路验证,包括: 1. 确诊前→确诊后影像链追溯 2. CT平扫+多期增强的DICOM完整性 3. 病理报告、WSI、组学之间的标本级关联 4. TNM分期、治疗记录及随访结局的完整呈现
需求场景:AI模型训练
面议
数据采购需求 临床诊疗+泛健康类数据
一、总体规模与结构 1. 总数据量:12 万条。 2. 模态结构:LLM(文本)9.6 万条(80%) + VLM(图文多模态)2.4 万条(20%)。 3. 内容结构: 1)临床医疗类(8.4万条,占70%):覆盖全科、内科、外科、妇产、儿科、皮肤、急诊/感染、药学、肿瘤、精神心理及其他专科(共11个细分场景)。 2)泛健康类(3.6万条,占30%):覆盖营养饮食、减重管理、运动健康、睡眠健康、慢病生活方式、体检异常管理(共6个细分场景)。 二、数据格式与字段要求 所有数据必须严格脱敏,不得包含任何患者个人隐私信息。 1. 文本类病历(7个核心字段):一般资料、主诉、现病史、既往史、查体、辅助检查、初步诊断。 2. 多模类病历(在文本类基础上增加8个字段):资料类型、资料原始信息(图片/文件)、检查部位/对象、检查方式、检查时间、图片顺序/序列、检查报告、数据完整性说明。 三、数据质量与验收指标 1. 基础完整性:字段完整率 ≥98%;科室/场景标签完整率 100%;去重率 100%(与历史集/公开集/供应商重复样本去重)。 2. 可用性指标:样本可判定率 ≥95%(问题与答案需客观清晰,能判定对错/好坏);OCR 可用率 ≥95%;图片可读率 ≥98%。 3. 安全与风险:风险等级标签完整率 ≥98%(高风险不可缺失);高风险样本禁忌点完整率 100%。 四、验收红线 出现以下四类问题直接判定为不合格: 1. 医学事实严重错误 2. 用药禁忌错误 3. 特殊人群(儿童/孕产/老人)错误 4. 急症风险漏标
需求场景:模型训练
面议
数据采购需求 抑郁症诊疗数据
一、 队列构建与时序节点 1.每位入组患者必须包含至少 3次 完整的临床就诊记录(涵盖门诊、急诊或住院病历),以支撑长时序的病情演变分析。 2. 索引时间:患者首次处方或使用 抗抑郁药 的日期。 3. 基线数据:索引时间前一年内最近一次的门急诊病历,以及同期的检验检查结果与抑郁量表评分。时间不超过1年。 4. 时间跨度:自索引时间后,患者的整体临床观察与随访时间跨度必须 ≥1年。 二、 数据内容 1. 基本信息:性别、年龄、已知过敏史、主诉等。 2. 临床诊断:主要诊断与次要诊断 3. 治疗方案 (1)药物:精准记录抗抑郁药和非抑郁药的用药天数及详细用法用量(需包含单次剂量、给药频次、具体服药时间,示例:一次4粒,一日2次,早晚各一次)。 (2)非药物干预:记录同期接受的物理或心理治疗(如心理治疗、重复经颅磁刺激(rTMS)、电休克治疗、迷走神经刺激、针灸等)。 4. 实验室检查与量表评估 (1) 检验检查:肝肾功能、血常规、甲状腺功能、药物浓度、心电图等常规及专科检查。 (2)抑郁量表评估:至少包含以下一种量表的评分记录,至少有3个时间节点的评估结果 ① PHQ-9(患者健康问卷抑郁量表) ② HAMD-17项 / HAMD-24项(汉密尔顿抑郁量表) ③ MADRS(蒙哥马利-阿斯伯格抑郁评定量表) ④ SDS(抑郁自评量表) 5. 安全性与不良事件 详细记录治疗期间或随访期发生的具体不良事件(AE)、药物不良反应(ADR),以及新发的伴随疾病(如失眠等),及其临床处理措施。
需求场景:真实世界研究
面议
数据采购需求 浙桂粤三省病历资料
一、采购范围 1. 目标省份:仅限广东省、广西壮族自治区、浙江省。 2. 城市等级:仅限一二线城市。 3. 医院等级:二级甲等及以上(含三级甲等、三级特等医院)。 4. 医院数量:每个目标城市需覆盖 ≥5家 符合条件的综合医院,不限科室。 5. 单省数据量:≥20万条 二、数据内容 1. 数据类型:真实住院/门诊病历(含历史归档数据),覆盖内科、外科、妇产科、儿科、肿瘤科、急诊科等主要科室。 2. 数据内容: 2.1. 病史:主诉(含现病史)、既往史、个人史(含家族史、过敏史等) 2.2. 体格检查:生命体征、专科查体 2.3. 辅助检查:(验、影像、病理、胃镜、肠镜、心电图、超声等结果报告) 2.4. 医嘱:长期医嘱、临时医嘱 2.5. 护理:体温单 2.6. 病案文书:住院病案首页、入院记录、出院记录、手术记录等 三、数据质量 1. 完整性:每份病历核心字段(主诉、诊断、治疗)缺失率 ≤ 5%。 2. 准确性:诊断与检查结果逻辑自洽,无前后矛盾。 3. 时效性:病历日期在2015年1月1日至今。 4. 多样性:同一医院内,不同病种分布均匀,单一病种占比不超过 20%。 四、 交付方式 数据集或API接口交付。
需求场景:大模型训练
面议
数据采购需求 医学知识源数据
一、数据内容范围 1. 医学教科书:国家级规划教材、教育部/卫健委推荐教材、权威学会主编专科教材(如人卫版《内科学》《外科学》《妇产科学》等)章节全文,含图表、病例、参考文献。中文优先,英文权威教材可单独报价。 2. 临床指南/共识:中华医学会各分会、国家卫健委、NCCN、ESC、AHA、WHO、CSCO等权威机构发布的指南、共识、临床路径、专家建议全文,含修订历史与证据等级说明。 3. 公开发表的医学综述文章 4. 药物说明书:国家药监局(NMPA)、FDA、EMA批准的药品说明书全文,含适应症、用法用量、禁忌、不良反应、药理毒理、临床试验数据等 二、版权与来源要求 1. 授权合法性:所有文本须具备明确、可追溯的合法使用授权。严禁使用爬虫抓取、未授权转载、版权状态存疑或来源不明材料。 2. 授权证明:供应商需提供授权协议关键页、公开许可声明(如CC协议)、出版社/学会直采凭证或转授权链条文件 三、结构化程度要求 1. 格式:机器可读的PDF(非扫描版、含OCR层、支持文本/表格/公式抽取)或XML(含标签结构),附带结构化元数据文件 2. 信息抽取支持:文档应至少支持以下内容的自动化提取:  章节/段落标题  表格、列表  参考文献  术语、定义、推荐级别(如有)等 四、时效性要求 1. 指南与综述文章:必须注明版本号、期刊、发表年份、卷、页码等。建议优先选用近5年内发布的版本。 2. 教科书:应注明出版社、版次、出版年份。若无新版,需注明所使用版次及出版时间。 3. 药物说明书:须注明核准日期、修订日期或印刷日期,并确认未被后续版本取代。 五、其他 1. 同一知识点若存在多版本文献,优先采用最新且引用较高的版本。 2. 鼓励标注文档来源URL、DOI、ISBN等唯一标识,便于溯源与批量管理。 3. 提供10份样本样例。
需求场景:模型训练
面议
数据采购需求 病理数据
一、数据来源与时限 • 来源:公立三甲医院,具备规范的病理诊断流程与质量控制体系 • 时间:最近5年 • 病例:肿瘤/癌前病变/炎症性疾病,优先肺癌、乳腺癌、胃癌、结直肠癌、宫颈癌等 二、数据内容与格式 2.1 病理切片图像 • HE染色切片:全视野扫描图像(≥40×),附低倍预览图+高倍分块索引,≥50000例 • 免疫组化:含Ki-67、HER2、ER、PR、PD-L1、EGFR等(≥40×),附染色强度(0/1+/2+/3+)及阳性细胞百分比(0–100%),≥10000例 2.2 细胞病理涂片 • TCT液基细胞学:宫颈/体腔积液涂片(≥300dpi),附TBS分类报告(NILM/ASC-US/LSIL/HSIL等),≥10000例 • FNA细针穿刺:甲状腺/淋巴结/乳腺等部位涂片(≥300dpi),附Bethesda分级或细胞形态描述,≥10000例 2.3 分子检测 • 基因检测结果:EGFR、KRAS、BRAF、ROS1、ALK等基因,及MSI、TMB指标,注明检测方法(PCR/NGS/FISH等),≥3000例 • 图像类检测:FISH/CISH等需同步提供诊断图像(≥300dpi) 2.4 病理报告文本 • 诊断描述:含良恶性分级、组织学分级(G1–G3)、TNM分期、切缘状态、脉管浸润等核心字段,可附脱敏原始PDF 三、合规要求 1. 来源合法 2. 严格脱敏
需求场景:AI
面议
数据采购需求 医疗临床术语标准化映射字典
医院业务字典
一、采购内容:字典类型范围包括以下10类: 1. 检验名称 2. 检验指标 3. 检查名称 4. 手术名称 5. 中医诊断 6. 中医证候 7. 西医诊断 8. 中药饮片 9. 西成药 10. 操作治疗(如推拿、针灸等) 二、对数源单位要求 1. 区域优先:山东、上海优先 2. 医院类型:综合型医院 3. 医院数量:3~5家 三、数据时限要求:最近10年左右 四、 交付要求 1. 交付周期:合同签订后 2周内 2. 数据格式:Excel 3. 数据交付方式:出域 4. 医学标注:不需要临时标注,直接提供已归一化数据 5. 合规要求:需提供授权 五、字段要求 每个字典至少包含以下字段: 1. 序号:唯一标识 2. 医院字典名称:原始字典名称 3. 归一名称:标准化后的名称 4. 医保名称:医保目录对应名称 5. 医保编码:医保目录对应编码 六、验收与样本要求 1. 验收标准:字段结构符合上述要求即可,采购方不额外提供模板 2. 样本样例:每个字典需提供100条数据作为样例 3. 数据缺少部分字典 / 未归一 / 无医保信息,单独沟通
需求场景:临床数据治理 专病数据库建设
面议
数据采购需求 皮肤疾病图片数据集
1. 疾病:见附件 2. 例数:每种疾病各10例 2. 字段:如基本信息(图片/拉框/诊断/主诉/专业描述/推理/皮损/大小/颜色/边界/界限/年龄/部位/干湿度/鳞屑/形状/排列)等 3. 数据质量要求: 图片合格率100% 诊断合格率95% 推理合格率95% 字段合格率95%
需求场景:大模型
面议