对智算中心用户来说,最难受的时刻往往不是 GPU 计算慢,而是不知道发生了什么:申请了八张卡却排队两天,作业刚启动就退出,日志散落在节点里,训练到 90% 因超时丢失,又没人能解释该换资源还是改代码。
智算中心的用户体验,核心是把分布式系统的不确定性变得可预测、可解释、可恢复。界面只是表面,真正需要设计的是从第一次运行到完成实验的整条旅程。
## 先理解用户要完成的工作
典型旅程包括选择环境、准备数据、估算资源、提交作业、等待调度、观察运行、保存产物、分析失败和复现实验。每一步都跨越门户、命令行、调度器、存储与监控系统。
把这些步骤画成旅程图,记录用户目标、输入、系统状态、等待和错误。优先处理高频断点,例如不知道选哪种 GPU、容器缺驱动、数据路径错误和作业被内存杀死。
用户类型也不同。学生需要安全模板,算法工程师需要批量实验,平台专家需要底层控制。不要让新手界面限制专家,也不要要求新手先掌握几十个调度参数。
## 资源选择要从型号转向任务
用户未必知道 HBM、互联带宽与卡型差异,却知道模型规模、精度、批量和预计时长。提交界面可以先询问任务,再展示推荐资源与估算依据。
推荐不是强制。显示显存余量、节点互联、队列等待与费用,让用户理解“更大资源”不一定更快开始。对常见框架提供经过验证的单卡、多卡和推理模板。
提交前做静态检查:镜像是否存在,数据路径是否可访问,申请 GPU 与代码配置是否矛盾,预计磁盘是否足够。提前一分钟发现错误,胜过排队两小时后失败。

## 队列必须能解释“为什么等”
调度器根据优先级、资源、配额、预留和回填安排作业。Slurm 的 `squeue --start` 可以提供候选作业预计开始时间,但官方说明也指出,远期估计会受运行作业结束时间和依赖影响。
界面应显示状态、主要等待原因、预计范围和影响因素,而不是给一个看似精确的时间。若等待因为请求八张同型 GPU,而四张可以更早启动,应提供可操作建议,但让用户决定是否修改。
展示队列位置往往会误导,因为后提交的小作业可能通过回填先运行。更有用的是资源满足概率、预计区间和最近同类作业的实际等待。
状态变化要有历史。用户能看到何时提交、何时具备资格、何时分配、为何重新排队,减少“系统吞了作业”的不安。
## 运行中只展示可行动指标
GPU 利用率、显存、网络、CPU、磁盘、吞吐和训练损失都可以监控,但一个挤满曲线的面板不等于好体验。按问题组织信息:是否在计算,是否被数据加载拖慢,是否存在单卡异常,预计何时完成。
异常提示应带证据与下一步。例如“GPU 利用率低”后显示 CPU 已满、数据读取等待,并链接到对应优化方法。不能只用红色告警让用户自己猜。
日志支持按节点、时间和错误级别聚合,保留原始下载。多节点任务若只有主节点日志,通信故障很难定位。
## 失败页面是最重要的产品页面
作业失败后,系统先区分用户代码、资源不足、环境、节点故障、超时和调度取消。显示退出码、最后日志、节点事件和建议,不把所有问题归成“运行失败”。
对常见错误提供一键生成修订副本,而不是原地修改历史作业。新副本保留父作业、参数差异和失败原因,便于比较。
平台故障导致的失败应自动标记并支持重新排队。用户代码错误则保留调试入口。责任清楚能减少无效工单,也让运营团队看见系统性问题。
## 断点续训要成为默认能力
长训练不能假设一次跑完。模板应默认周期保存 checkpoint,并验证它真的可恢复。作业接近时间上限时发出信号,让训练进程保存状态后退出。
恢复操作选择上次有效 checkpoint,显示模型、优化器、随机数与数据进度是否完整。若环境或代码版本改变,明确警告差异。
产物与临时文件分开。训练成功后自动登记模型、指标、代码提交和镜像;失败作业的临时数据设置保留期,避免存储悄悄堆满。

## 环境要可复现而不是“能打开”
提供版本化容器、驱动兼容矩阵和锁定依赖。Notebook 适合探索,正式训练应能导出为批作业,并保存实际启动命令。
用户自定义镜像要先扫描体积、入口和 GPU 兼容,再进入共享集群。基础镜像更新不能静默改变旧实验;给出迁移窗口与对照测试。
数据集也要版本化。记录挂载路径、快照与权限,不让同名目录在几周后指向不同内容。
## 用体验指标连接用户与资源效率
平台常只看 GPU 利用率。还应记录首次成功运行时间、提交后立即失败率、排队预测误差、故障定位时间、断点恢复成功率、重复工单和用户人工等待。
GPU 高利用率若伴随大量无效训练,并不代表中心高效。反过来,短暂空闲用于快速调试,可能减少后续数小时浪费。
按任务类型和用户经验分层分析。新手首次运行慢,可能需要模板;专家作业失败多,可能是底层环境变化。不要用一个平均满意度遮住不同旅程。
## 一个最小改造顺序
先打通统一作业详情页,汇集参数、状态、等待原因、日志、指标和产物。第二步做提交前检查与三类稳定模板。第三步补失败分类和重试副本。
第四步上线队列预计区间与依据。第五步让 checkpoint、版本和产物登记成为默认。每一步用真实作业回放,邀请新手与专家完成同一任务,记录卡点。
智算中心的好体验不是隐藏复杂性,而是让复杂性在正确时刻显露。用户知道系统为何等待、正在做什么、失败在哪里、怎样继续,昂贵算力才能真正变成可用的科研与工程能力。
## 参考资料