双节点 DGX Box 集群落地高校实验室,福科创新依托 DGX Spark APU 与蜜蝶科研智能体构建 AI4S 分布式科研平台
福科创新(Fouinn)宣布,面向高校 AI for Science 科研场景的双机 DGX Spark 集群方案(双 DGX Box 终端)在国内双一流高校生命科学与计算交叉课题组正式落地。整套方案由两台 DGX Box 终端、DGX Spark GB10 Grace Blackwell APU、200G 高速互联链路以及自研蜜蝶科研智能体(蜜蝶智能机器陪伴人)组成,为课题组提供本地分布式算力,支撑超大分子体系仿真、AlphaFold3 批量蛋白预测、大模型分布式微调、多组学数据挖掘等科研任务,打造 “桌面级小型超算 + 私有化科研智能体” 一体化科研底座。
一、双机 DGX Spark 集群架构:两台 DGX Box,构建桌面分布式算力
单台 DGX Spark 搭载 GB10 Grace Blackwell APU,拥有 128GB 统一内存;双机组网后,通过 200G QSFP56(ConnectX-7 NDR)高速直连链路,实现分布式算力与显存协同,聚合统一内存容量达 256GB,可原生支撑最高 405B 参数量化大模型推理、70B 级别模型全精度分布式微调,以及超大体系分子动力学模拟。
整套集群封装于两台标准化 DGX Box 终端内,区别于传统机架式 HPC 服务器:轻量化部署:两台 DGX Box 直接放置于实验室桌面,无需机房改造,低功耗设计,无需复杂散热工程;开箱预装 DGX OS、CUDA、NCCL、NGC 科研容器,支持 DDP 分布式训练、张量并行。弹性扩展:双节点集群可独立拆分为两台单机,分别给不同博士生独立使用;也可合并为分布式集群,运行超大规模科研任务,灵活适配课题组多任务并发需求。本地数据闭环:全部计算、仿真、大模型推理均在双机集群本地完成,蛋白序列、多组学、未发表实验数据不出硬件,满足科研知识产权与数据隐私合规要求,规避校级公共超算的数据上传风险。
技术亮点:蜜蝶科研智能体深度适配双节点分布式调度,可自动识别双 DGX Spark 集群算力资源,智能拆分科研任务,自动分配仿真作业、模型微调任务到双节点,自动处理 NCCL 通信、任务断点续跑、结果合并,无需科研人员手动编写分布式调度脚本。
二、蜜蝶科研智能体:面向双节点集群的全链路科研自动化 Agent
蜜蝶科研智能体(蜜蝶智能机器陪伴人)作为方案软件核心,打通双机集群硬件算力与 AI4S 科研工具链,把科研工作流自动化延伸至分布式集群场景。
核心能力:
集群任务智能编排:接收自然语言科研指令,自动判断任务规模,自动选择单机 / 双机分布式模式;例如大规模候选药物分子虚拟筛选、全原子蛋白复合物模拟、多模态科研大模型微调,自动切分任务分配至两台 DGX Spark。
本地私有知识库 RAG:在双机集群本地部署课题组私有知识库,收录论文、历史仿真参数、实验原始数据;智能体跨节点检索文献、对比实验参数、自动识别仿真异常,全程不调用公有大模型云端 API。
多工具链协同调用:原生调用 AlphaFold3、GROMACS、OpenMM、PyTorch 等 AI4S 工具;任务运行中实时监控双节点显存、算力、互联带宽,动态调整采样步数、批大小;任务结束后自动汇总两个节点的输出文件,合并可视化图表,整理实验日志,生成论文可用结果。
教学实训能力:双节点集群同时作为 AI 交叉学科教学平台,学生可以动手实践分布式训练、多节点智能体协同开发,直观学习 NCCL 通信、并行仿真原理,支撑研究生 AI4S 课程与毕业设计。
三、高校落地案例:双一流高校计算生物课题组双 DGX Box 集群应用
本次合作的国内双一流高校计算生物课题组,长期开展蛋白质复合物结构解析、靶向药物分子批量筛选、多组学 AI 挖掘。此前课题组依赖学校公共超算中心,面临三大痛点:任务排队周期长达 3~7 天、大规模蛋白复合物仿真受限于单卡显存,敏感生物数据集上传至校级超算存在知识产权顾虑;同时分布式任务配置复杂,博士生需要投入大量时间调试并行脚本。
部署福科创新双 DGX Box(双 DGX Spark)+ 蜜蝶科研智能体方案之后,项目成效:
算力与显存翻倍,突破单卡上限:256GB 聚合统一内存,可直接开展超大蛋白复合物、多链蛋白体系的 AlphaFold3 预测;原本需要拆分、分批提交超算的任务,现在本地一次性完成。
任务周期大幅压缩:大规模药物分子虚拟筛选任务,从原先一周排队 + 计算,缩短至 12~24 小时本地完成;随时提交、即时迭代,科研人员可以快速验证科研假设。
蜜蝶智能体简化分布式操作门槛:科研人员仅需自然语言描述任务,蜜蝶科研智能体自动完成双节点调度、分布式参数配置、结果合并,无需科研人员精通 HPC 并行编程,大幅降低分布式 AI4S 仿真门槛。
科研 + 教学复用一套硬件:白天支撑博士生课题仿真、药物筛选;晚间开放作为研究生 AI4S 实训平台,学生在真实双节点分布式环境下练习大模型微调、科研 Agent 开发,实现一套硬件兼顾前沿科研与人才培养。
课题组负责人评价:“传统公共超算资源紧张、排队周期长,而单机桌面 AI 算力受显存限制,很难处理超大生物分子体系。福科创新这套双 DGX Box 集群方案,用两台桌面级 DGX Spark 搭建分布式科研算力,搭配蜜蝶科研智能体自动调度双节点任务,把小型超算搬进实验室桌面。数据本地闭环,兼顾科研保密与迭代效率,同时支撑交叉学科人才培养,非常适配课题组的科研模式。”
四、方案价值总结
模块化分布式算力:以 DGX Box 为标准化单元,双 DGX Spark 集群提供 256GB 聚合统一内存,可运行更大规模 AI4S 仿真与大模型任务;未来可继续横向扩展多节点集群。
降低分布式科研门槛:蜜蝶科研智能体屏蔽多节点调度、并行通信等底层复杂操作,生物、材料、化学等非计算机背景科研人员,也能便捷使用分布式算力。
私有化安全科研底座:全部数据、仿真、模型训练与推理在双机集群本地闭环,保护未发表成果、原始实验数据知识产权。
一机多用,投入性价比高:集群既可合并做分布式科研任务,也可拆分为两台独立终端供多名学生并行使用,兼顾科研项目与新工科 AI+X 教学实训。
五、后续规划
福科创新表示,后续将持续迭代蜜蝶科研智能体,完善多节点集群负载均衡、故障自动迁移能力,拓展材料动力学、流体仿真、计算化学等更多 AI4S 工具插件;持续深化国内高校产学研合作,向更多院系提供从单机 DGX Box 到双节点、多节点 DGX Spark 集群的阶梯式 AI4S 算力解决方案,推动自主科研智能体与私有化桌面超算在国内高校普及。