算力资源申请与选择
配置快照
下表来自 2026-08-03 更新的 Master Course“设备情况”页。主机在线状态、GPU 占用、价格和项目授权会变化;启动任务前仍须用 tailscale status、nvidia-smi 和当前分配记录确认。
用途
根据任务是否需要可视化、运行时长、GPU 数量和分布式规模,选择合适的实验室算力资源。
联系人与资源入口
| 需求 | 联系人 |
|---|---|
| 工作电脑接入 Headscale、可视化工作站 | @nilou(郑烨) |
| AutoDL 单节点任务(通常至多 8 卡) | @赖咏曦 |
| 常开单卡资源 | @赵浩宇-Postdoc 或算力管理员 |
| 超过 8 卡的阿里云 DLC 分布式训练 | 提前联系算力管理员 |
前置条件
- 已明确项目、代码仓库、数据位置和负责人。
- 已估算 GPU 类型、显存、卡数、运行时长和存储需求。
- 已在本地或单卡环境完成最小可运行验证。
- 涉及按量计费资源时,已获得项目负责人和算力管理员批准。
资源选择
| 任务需求 | 建议资源 | 启动前要求 |
|---|---|---|
| 强可视化、实时交互或远程 GUI | 已授权的实验室工作站 | 先完成个人工作电脑的 Headscale 接入 |
| 普通训练、单节点临时 GPU | AutoDL 等按量平台 | 估算费用;通常不超过单节点 8 卡,以平台当前规格为准 |
| 需要持续运行的单卡任务 | 三台常开单卡共享服务器 | 向维护者申请时间窗口、存储和负责人 |
| 超过单节点规模的分布式训练 | 阿里云 DLC 等分布式平台 | 先在单卡开发环境完成烟测和一行启动命令 |
| 不需要 GPU | CPU、本地或低成本开发环境 | 不占用稀缺 GPU 资源 |
当前设备清单
| Tailscale 设备名 | Tailscale IP | 算力 | 当前分配 | 位置 |
|---|---|---|---|---|
sg-ai-gateway |
100.64.0.1 |
无 GPU | VPS 控制面,不用于开发 | 云端 |
boris-pc |
100.64.0.4 |
RTX 3070 Ti | Franka 真机控制 | E2-01-06 |
dm-26zj-020 |
100.64.0.7 |
RTX 5060 | 戴盟 benchmark 搭建 | 戴盟公司内 |
dm-26zj-008 |
100.64.0.3 |
RTX 5090 | 戴盟 benchmark 搭建 | 戴盟公司内 |
lvrobotics-System-Product-Name |
100.64.0.10 |
RTX 4060 Ti | 松灵 NERO 真机控制 | E2-01-06 |
shaol-PC |
100.64.0.5 |
RTX 4090 | Ego2Dex | COM2-01-04 |
jingxiang-B850M-C |
100.64.0.6 |
RTX 5090 | Robot Harness Gen-Env | COM2-01-06 |
yuhang-B850M-C |
100.64.0.9 |
RTX 5090 | UMI WAM Stage 2 | E2-01-06 |
aliyun-dsw-1055 |
100.64.0.11 |
A100 | UMI WAM Stage 1 | 云端 |
aliyun-dsw-1021-h20 |
100.64.0.13 |
H20 | UMI WAM Stage 1 | 云端 |
aliyun-dsw-1056 |
100.64.0.21 |
A100 | UMI WAM Stage 1 | 云端 |
aliyun-dsw-1019 |
100.64.0.25 |
4×A10 | 数据管线编解码 | 云端 |
访问说明
上述 IP 只能从实验室 Tailscale/Headscale 网络访问。表格表示配置与项目归属快照,不代表设备当前在线或空闲;AutoDL 按量计费且不会常开。
申请信息
- 项目名称和负责人角色
- 目标主机或资源类型,以及是否需要调整当前项目分配
- 代码仓库、目标分支和可复现的环境说明
- GPU 型号、卡数、预计时长和开始时间
- 是否需要桌面可视化、外网、数据挂载或跨节点通信
- 单卡烟测结果、检查点策略和一行启动命令
- 预算来源及任务结束后的关闭责任人
操作步骤
- 按上表选择资源类别,并向对应联系人提交申请信息。
- 管理员确认实时在线状态、GPU 占用、费用、权限和数据路径。
- 先运行小规模烟测,验证依赖、数据读取、日志和检查点写入。
- 获得批准后启动正式任务,并记录作业 ID、负责人和预计结束时间。
- 监控 GPU、日志、费用和检查点;异常时先停止扩容或高成本作业。
- 作业完成后关闭按量资源,确认数据与检查点已安全落盘。
使用规范
- 按量平台必须随用随开、用完即关,禁止无人负责的长期空转。
- 不要把“机器在线”当作“已获授权”;每次使用前重新确认项目分配。
- 大规模训练不能只凭启动成功判断健康,必须检查真实进程、GPU、日志和检查点。
- 主机名、IP 和 GPU 规格可以记录;密码、API key、token、私钥和远程控制密码不得写入命令、环境文件、日志或 Wiki。
- 需要远程桌面时使用获批渠道,不在 Wiki 保存无人值守访问密码。
验证
tailscale status中的目标设备名和 IP 与表格一致,且当前可达。nvidia-smi显示的 GPU 型号、数量和占用符合本次批准。- 烟测能够完成至少一个有效步骤,并生成预期日志或检查点。
- GPU 数量、进程拓扑和任务配置与申请一致。
- 按量资源在任务结束后已关闭,费用和产物由负责人确认。
故障排查
- 设备离线或 IP 不一致:以实时 Headscale 状态为准,并把差异报告给维护者更新本页。
- 无可用 GPU:缩小规模、调整时间或联系管理员重新分配。
- 多卡任务无法通信:保留错误摘要和作业 ID,检查当前平台是否支持目标拓扑。
- 远程桌面不可用:先确认网络路径,再联系
@nilou或现场维护者。 - 数据或检查点不可写:停止正式训练,验证权限和剩余空间后再恢复。
- 费用异常:立即停止作业并通知项目负责人和算力管理员。
维护信息
- Headscale / 工作站:
@nilou(郑烨) - AutoDL:
@赖咏曦 - 常开资源:
@赵浩宇-Postdoc、算力管理员 - 配置来源:Master Course → 设备情况
- 最后核验:2026-08-03