需求发布
联系我们
一、采购标的
1. 疾病:肺癌、结直肠癌、胃癌、胰腺癌
2. 数量:5,000例
3. 时序:每例覆盖时间跨度≥3年(优先5年),必须包含“确诊前追溯 → 确诊 → 治疗 → 随访结局”完整临床轨迹。
4. 模态:全文本病历 + 原始影像(DICOM) + 全切片病理(WSI) + 原始组学(FASTQ/BAM)。
二、交付标准
1. 文本不截断:所有病历文书必须提供 100%完整原文(full_text),严禁截断或摘要替代。
2. 影像不删减:CT必须提供“平扫+全部实际增强期相”及“厚薄层全量”原始DICOM;报告提及“对比前片”必须同步提供被对比的既往影像及报告。
3. 微观可追溯:病理报告、WSI(H&E必需)、IHC、组学(FASTQ优先)必须通过标本ID精准绑定,杜绝错配。
4. 全局索引:必须提供统一的文件索引表(file_manifest)和患者级数据看板(dataset_meta),确保跨模态数据可检索、不脱节。
三、POC前置
正式交付前须先提供 ≥20例(覆盖全部4个病种)的POC数据,跑通全链路验证,包括:
1. 确诊前→确诊后影像链追溯
2. CT平扫+多期增强的DICOM完整性
3. 病理报告、WSI、组学之间的标本级关联
4. TNM分期、治疗记录及随访结局的完整呈现
需求场景:AI模型训练
面议
一、总体规模与结构
1. 总数据量:12 万条。
2. 模态结构:LLM(文本)9.6 万条(80%) + VLM(图文多模态)2.4 万条(20%)。
3. 内容结构:
1)临床医疗类(8.4万条,占70%):覆盖全科、内科、外科、妇产、儿科、皮肤、急诊/感染、药学、肿瘤、精神心理及其他专科(共11个细分场景)。
2)泛健康类(3.6万条,占30%):覆盖营养饮食、减重管理、运动健康、睡眠健康、慢病生活方式、体检异常管理(共6个细分场景)。
二、数据格式与字段要求
所有数据必须严格脱敏,不得包含任何患者个人隐私信息。
1. 文本类病历(7个核心字段):一般资料、主诉、现病史、既往史、查体、辅助检查、初步诊断。
2. 多模类病历(在文本类基础上增加8个字段):资料类型、资料原始信息(图片/文件)、检查部位/对象、检查方式、检查时间、图片顺序/序列、检查报告、数据完整性说明。
三、数据质量与验收指标
1. 基础完整性:字段完整率 ≥98%;科室/场景标签完整率 100%;去重率 100%(与历史集/公开集/供应商重复样本去重)。
2. 可用性指标:样本可判定率 ≥95%(问题与答案需客观清晰,能判定对错/好坏);OCR 可用率 ≥95%;图片可读率 ≥98%。
3. 安全与风险:风险等级标签完整率 ≥98%(高风险不可缺失);高风险样本禁忌点完整率 100%。
四、验收红线
出现以下四类问题直接判定为不合格:
1. 医学事实严重错误
2. 用药禁忌错误
3. 特殊人群(儿童/孕产/老人)错误
4. 急症风险漏标
需求场景:模型训练
面议
一、 队列构建与时序节点
1.每位入组患者必须包含至少 3次 完整的临床就诊记录(涵盖门诊、急诊或住院病历),以支撑长时序的病情演变分析。
2. 索引时间:患者首次处方或使用 抗抑郁药 的日期。
3. 基线数据:索引时间前一年内最近一次的门急诊病历,以及同期的检验检查结果与抑郁量表评分。时间不超过1年。
4. 时间跨度:自索引时间后,患者的整体临床观察与随访时间跨度必须 ≥1年。
二、 数据内容
1. 基本信息:性别、年龄、已知过敏史、主诉等。
2. 临床诊断:主要诊断与次要诊断
3. 治疗方案
(1)药物:精准记录抗抑郁药和非抑郁药的用药天数及详细用法用量(需包含单次剂量、给药频次、具体服药时间,示例:一次4粒,一日2次,早晚各一次)。
(2)非药物干预:记录同期接受的物理或心理治疗(如心理治疗、重复经颅磁刺激(rTMS)、电休克治疗、迷走神经刺激、针灸等)。
4. 实验室检查与量表评估
(1) 检验检查:肝肾功能、血常规、甲状腺功能、药物浓度、心电图等常规及专科检查。
(2)抑郁量表评估:至少包含以下一种量表的评分记录,至少有3个时间节点的评估结果
① PHQ-9(患者健康问卷抑郁量表)
② HAMD-17项 / HAMD-24项(汉密尔顿抑郁量表)
③ MADRS(蒙哥马利-阿斯伯格抑郁评定量表)
④ SDS(抑郁自评量表)
5. 安全性与不良事件
详细记录治疗期间或随访期发生的具体不良事件(AE)、药物不良反应(ADR),以及新发的伴随疾病(如失眠等),及其临床处理措施。
需求场景:真实世界研究
面议
一、采购范围
1. 目标省份:仅限广东省、广西壮族自治区、浙江省。
2. 城市等级:仅限一二线城市。
3. 医院等级:二级甲等及以上(含三级甲等、三级特等医院)。
4. 医院数量:每个目标城市需覆盖 ≥5家 符合条件的综合医院,不限科室。
5. 单省数据量:≥20万条
二、数据内容
1. 数据类型:真实住院/门诊病历(含历史归档数据),覆盖内科、外科、妇产科、儿科、肿瘤科、急诊科等主要科室。
2. 数据内容:
2.1. 病史:主诉(含现病史)、既往史、个人史(含家族史、过敏史等)
2.2. 体格检查:生命体征、专科查体
2.3. 辅助检查:(验、影像、病理、胃镜、肠镜、心电图、超声等结果报告)
2.4. 医嘱:长期医嘱、临时医嘱
2.5. 护理:体温单
2.6. 病案文书:住院病案首页、入院记录、出院记录、手术记录等
三、数据质量
1. 完整性:每份病历核心字段(主诉、诊断、治疗)缺失率 ≤ 5%。
2. 准确性:诊断与检查结果逻辑自洽,无前后矛盾。
3. 时效性:病历日期在2015年1月1日至今。
4. 多样性:同一医院内,不同病种分布均匀,单一病种占比不超过 20%。
四、 交付方式
数据集或API接口交付。
需求场景:大模型训练
面议
一、数据内容范围
1. 医学教科书:国家级规划教材、教育部/卫健委推荐教材、权威学会主编专科教材(如人卫版《内科学》《外科学》《妇产科学》等)章节全文,含图表、病例、参考文献。中文优先,英文权威教材可单独报价。
2. 临床指南/共识:中华医学会各分会、国家卫健委、NCCN、ESC、AHA、WHO、CSCO等权威机构发布的指南、共识、临床路径、专家建议全文,含修订历史与证据等级说明。
3. 公开发表的医学综述文章
4. 药物说明书:国家药监局(NMPA)、FDA、EMA批准的药品说明书全文,含适应症、用法用量、禁忌、不良反应、药理毒理、临床试验数据等
二、版权与来源要求
1. 授权合法性:所有文本须具备明确、可追溯的合法使用授权。严禁使用爬虫抓取、未授权转载、版权状态存疑或来源不明材料。
2. 授权证明:供应商需提供授权协议关键页、公开许可声明(如CC协议)、出版社/学会直采凭证或转授权链条文件
三、结构化程度要求
1. 格式:机器可读的PDF(非扫描版、含OCR层、支持文本/表格/公式抽取)或XML(含标签结构),附带结构化元数据文件
2. 信息抽取支持:文档应至少支持以下内容的自动化提取:
章节/段落标题
表格、列表
参考文献
术语、定义、推荐级别(如有)等
四、时效性要求
1. 指南与综述文章:必须注明版本号、期刊、发表年份、卷、页码等。建议优先选用近5年内发布的版本。
2. 教科书:应注明出版社、版次、出版年份。若无新版,需注明所使用版次及出版时间。
3. 药物说明书:须注明核准日期、修订日期或印刷日期,并确认未被后续版本取代。
五、其他
1. 同一知识点若存在多版本文献,优先采用最新且引用较高的版本。
2. 鼓励标注文档来源URL、DOI、ISBN等唯一标识,便于溯源与批量管理。
3. 提供10份样本样例。
需求场景:模型训练
面议
一、数据来源与时限
• 来源:公立三甲医院,具备规范的病理诊断流程与质量控制体系
• 时间:最近5年
• 病例:肿瘤/癌前病变/炎症性疾病,优先肺癌、乳腺癌、胃癌、结直肠癌、宫颈癌等
二、数据内容与格式
2.1 病理切片图像
• HE染色切片:全视野扫描图像(≥40×),附低倍预览图+高倍分块索引,≥50000例
• 免疫组化:含Ki-67、HER2、ER、PR、PD-L1、EGFR等(≥40×),附染色强度(0/1+/2+/3+)及阳性细胞百分比(0–100%),≥10000例
2.2 细胞病理涂片
• TCT液基细胞学:宫颈/体腔积液涂片(≥300dpi),附TBS分类报告(NILM/ASC-US/LSIL/HSIL等),≥10000例
• FNA细针穿刺:甲状腺/淋巴结/乳腺等部位涂片(≥300dpi),附Bethesda分级或细胞形态描述,≥10000例
2.3 分子检测
• 基因检测结果:EGFR、KRAS、BRAF、ROS1、ALK等基因,及MSI、TMB指标,注明检测方法(PCR/NGS/FISH等),≥3000例
• 图像类检测:FISH/CISH等需同步提供诊断图像(≥300dpi)
2.4 病理报告文本
• 诊断描述:含良恶性分级、组织学分级(G1–G3)、TNM分期、切缘状态、脉管浸润等核心字段,可附脱敏原始PDF
三、合规要求
1. 来源合法
2. 严格脱敏
需求场景:AI
面议
一、采购内容:字典类型范围包括以下10类:
1. 检验名称
2. 检验指标
3. 检查名称
4. 手术名称
5. 中医诊断
6. 中医证候
7. 西医诊断
8. 中药饮片
9. 西成药
10. 操作治疗(如推拿、针灸等)
二、对数源单位要求
1. 区域优先:山东、上海优先
2. 医院类型:综合型医院
3. 医院数量:3~5家
三、数据时限要求:最近10年左右
四、 交付要求
1. 交付周期:合同签订后 2周内
2. 数据格式:Excel
3. 数据交付方式:出域
4. 医学标注:不需要临时标注,直接提供已归一化数据
5. 合规要求:需提供授权
五、字段要求
每个字典至少包含以下字段:
1. 序号:唯一标识
2. 医院字典名称:原始字典名称
3. 归一名称:标准化后的名称
4. 医保名称:医保目录对应名称
5. 医保编码:医保目录对应编码
六、验收与样本要求
1. 验收标准:字段结构符合上述要求即可,采购方不额外提供模板
2. 样本样例:每个字典需提供100条数据作为样例
3. 数据缺少部分字典 / 未归一 / 无医保信息,单独沟通
需求场景:临床数据治理 专病数据库建设
面议
1. 疾病:见附件
2. 例数:每种疾病各10例
2. 字段:如基本信息(图片/拉框/诊断/主诉/专业描述/推理/皮损/大小/颜色/边界/界限/年龄/部位/干湿度/鳞屑/形状/排列)等
3. 数据质量要求:
图片合格率100%
诊断合格率95%
推理合格率95%
字段合格率95%
需求场景:大模型
面议