PAICON
PAICON 借 ProsperPower 把癌症诊断模型的全量重训从两周缩到两天
一家医疗 AI 公司如何用 ProsperPower 的多卡集群,为以数据为中心的病理诊断模型提供弹性算力,让研究迭代节奏彻底改变。
PAICON
7x
训练加速
2天
全量重训
40+
合作机构
100+
峰值并行卡数
行业:医疗 AI
重点领域:数据密集型模型训练
挑战:研究级迭代需要弹性大算力
PAICON 的病理模型需要在来自不同机构、不同扫描设备的异构数据上反复重训,以验证泛化能力。
自建集群规模固定,跑一次全量重训要排队近两周,严重拖慢研究节奏;而长期租用大规模 GPU 又太贵、利用率低。
方案:按需拉起的多卡集群
PAICON 改用 ProsperPower 的集群编排,需要时一键拉起上百张 H100、NCCL 自动组网,跑完即释放,只为真正用到的算力付费。
容错型批处理配合检查点,让抢占式实例也能安全承担长任务。
结果:迭代速度提升 7 倍
全量重训周期从约两周缩短到两天,训练吞吐提升约 7 倍,研究团队可以在一周内跑完过去一个月的实验量。
弹性算力也让跨机构数据的对照实验第一次变得可负担。
关于 PAICON
PAICON 是一家专注以数据为中心的医疗 AI 公司,与全球多家医院与研究机构合作,构建可泛化的病理诊断模型。
「弹性拉起上百张 H100,让我们的研究节奏彻底改变。」
— PAICON 研究负责人