跳转至

算力资源申请与选择

配置快照

下表来自 2026-08-03 更新的 Master Course“设备情况”页。主机在线状态、GPU 占用、价格和项目授权会变化;启动任务前仍须用 tailscale statusnvidia-smi 和当前分配记录确认。

用途

根据任务是否需要可视化、运行时长、GPU 数量和分布式规模,选择合适的实验室算力资源。

联系人与资源入口

需求 联系人
工作电脑接入 Headscale、可视化工作站 @nilou(郑烨)
AutoDL 单节点任务(通常至多 8 卡) @赖咏曦
常开单卡资源 @赵浩宇-Postdoc 或算力管理员
超过 8 卡的阿里云 DLC 分布式训练 提前联系算力管理员

前置条件

  • 已明确项目、代码仓库、数据位置和负责人。
  • 已估算 GPU 类型、显存、卡数、运行时长和存储需求。
  • 已在本地或单卡环境完成最小可运行验证。
  • 涉及按量计费资源时,已获得项目负责人和算力管理员批准。

资源选择

任务需求 建议资源 启动前要求
强可视化、实时交互或远程 GUI 已授权的实验室工作站 先完成个人工作电脑的 Headscale 接入
普通训练、单节点临时 GPU AutoDL 等按量平台 估算费用;通常不超过单节点 8 卡,以平台当前规格为准
需要持续运行的单卡任务 三台常开单卡共享服务器 向维护者申请时间窗口、存储和负责人
超过单节点规模的分布式训练 阿里云 DLC 等分布式平台 先在单卡开发环境完成烟测和一行启动命令
不需要 GPU CPU、本地或低成本开发环境 不占用稀缺 GPU 资源

当前设备清单

Tailscale 设备名 Tailscale IP 算力 当前分配 位置
sg-ai-gateway 100.64.0.1 无 GPU VPS 控制面,不用于开发 云端
boris-pc 100.64.0.4 RTX 3070 Ti Franka 真机控制 E2-01-06
dm-26zj-020 100.64.0.7 RTX 5060 戴盟 benchmark 搭建 戴盟公司内
dm-26zj-008 100.64.0.3 RTX 5090 戴盟 benchmark 搭建 戴盟公司内
lvrobotics-System-Product-Name 100.64.0.10 RTX 4060 Ti 松灵 NERO 真机控制 E2-01-06
shaol-PC 100.64.0.5 RTX 4090 Ego2Dex COM2-01-04
jingxiang-B850M-C 100.64.0.6 RTX 5090 Robot Harness Gen-Env COM2-01-06
yuhang-B850M-C 100.64.0.9 RTX 5090 UMI WAM Stage 2 E2-01-06
aliyun-dsw-1055 100.64.0.11 A100 UMI WAM Stage 1 云端
aliyun-dsw-1021-h20 100.64.0.13 H20 UMI WAM Stage 1 云端
aliyun-dsw-1056 100.64.0.21 A100 UMI WAM Stage 1 云端
aliyun-dsw-1019 100.64.0.25 4×A10 数据管线编解码 云端

访问说明

上述 IP 只能从实验室 Tailscale/Headscale 网络访问。表格表示配置与项目归属快照,不代表设备当前在线或空闲;AutoDL 按量计费且不会常开。

申请信息

  • 项目名称和负责人角色
  • 目标主机或资源类型,以及是否需要调整当前项目分配
  • 代码仓库、目标分支和可复现的环境说明
  • GPU 型号、卡数、预计时长和开始时间
  • 是否需要桌面可视化、外网、数据挂载或跨节点通信
  • 单卡烟测结果、检查点策略和一行启动命令
  • 预算来源及任务结束后的关闭责任人

操作步骤

  1. 按上表选择资源类别,并向对应联系人提交申请信息。
  2. 管理员确认实时在线状态、GPU 占用、费用、权限和数据路径。
  3. 先运行小规模烟测,验证依赖、数据读取、日志和检查点写入。
  4. 获得批准后启动正式任务,并记录作业 ID、负责人和预计结束时间。
  5. 监控 GPU、日志、费用和检查点;异常时先停止扩容或高成本作业。
  6. 作业完成后关闭按量资源,确认数据与检查点已安全落盘。

使用规范

  • 按量平台必须随用随开、用完即关,禁止无人负责的长期空转。
  • 不要把“机器在线”当作“已获授权”;每次使用前重新确认项目分配。
  • 大规模训练不能只凭启动成功判断健康,必须检查真实进程、GPU、日志和检查点。
  • 主机名、IP 和 GPU 规格可以记录;密码、API key、token、私钥和远程控制密码不得写入命令、环境文件、日志或 Wiki。
  • 需要远程桌面时使用获批渠道,不在 Wiki 保存无人值守访问密码。

验证

  • tailscale status 中的目标设备名和 IP 与表格一致,且当前可达。
  • nvidia-smi 显示的 GPU 型号、数量和占用符合本次批准。
  • 烟测能够完成至少一个有效步骤,并生成预期日志或检查点。
  • GPU 数量、进程拓扑和任务配置与申请一致。
  • 按量资源在任务结束后已关闭,费用和产物由负责人确认。

故障排查

  • 设备离线或 IP 不一致:以实时 Headscale 状态为准,并把差异报告给维护者更新本页。
  • 无可用 GPU:缩小规模、调整时间或联系管理员重新分配。
  • 多卡任务无法通信:保留错误摘要和作业 ID,检查当前平台是否支持目标拓扑。
  • 远程桌面不可用:先确认网络路径,再联系 @nilou 或现场维护者。
  • 数据或检查点不可写:停止正式训练,验证权限和剩余空间后再恢复。
  • 费用异常:立即停止作业并通知项目负责人和算力管理员。

维护信息

  • Headscale / 工作站:@nilou(郑烨)
  • AutoDL:@赖咏曦
  • 常开资源:@赵浩宇-Postdoc、算力管理员
  • 配置来源:Master Course → 设备情况
  • 最后核验:2026-08-03