
AI 场景示意:计算还没开始,用户先卡在了作业参数上。
计算没开始,先卡在参数上
一名科研用户准备提交 CFD 仿真。他会使用 Fluent,也准备好了输入文件,却仍要确认一串集群规则:项目对应哪个 Account、能用哪条队列、申请多少 CPU 和 GPU、最长能跑多久、工作目录写在哪里。
任何一项填错,作业都可能被拒绝、长时间排队,甚至占用了资源却没有正确启动。
问题不在 Slurm,而在于我们要求每位用户都记住同一套集群规则。

产品页面示意:基于当前前端代码和脱敏演示数据生成。
把规则做进模板
SimpleHPC 让管理员先把规则配置好。
作业名称、项目 Account、队列、节点、CPU、GPU、运行时长、工作目录和输入文件,都可以作为组件加入模板。每个组件直接对应一个 Slurm 参数。
其中,项目和队列不是写死的选项:系统会按当前用户的授权关系动态加载;队列返回的 CPU、GPU 和时限信息,也会成为填写约束。

产品页面示意:左侧填写本次任务,右侧预览最终提交脚本;画面使用演示数据。
用户只做三件事
- 选择自己参与的项目。
- 选择可用队列,填写本次资源和输入文件。
- 核对右侧脚本,然后提交。
生成的 #SBATCH --account、--partition、CPU、GPU 和运行时长都清楚可见。提交时,后端还会重新校验参数,避免只靠前端限制。
解决的不是"少写几行脚本"
- 用户不用背参数,也不会看到无权使用的项目和队列。
- 管理员只维护一份模板,规则变更后统一生效。
- 作业从提交开始就带有项目归属,后续可以按项目查看任务和资源用量。
SimpleHPC 不替代 Slurm。它只是把已经存在的调度规则,变成一个可复用、可校验、看得懂的提交入口。
下一期,我们继续讲:作业提交后,项目如何自动形成自己的计算账本。
本文基于 SimpleHPC v0.5.0 仓库代码撰写。产品截图由当前前端代码配合脱敏演示数据生成,不包含客户数据。