首页
/
工具详情
RunPod 使用指南
一、平台介绍
RunPod 是海外专为 AI 场景设计的 GPU 云平台,核心优势在于按需租用显卡容器,支持秒级启动 Docker 环境。
- 核心产品线:
- Community Cloud:社区云,主打低价抢占式资源,存在回收风险。
- Secure Cloud:安全云,独享稳定实例,适合长时训练,价格稍高。
- Serverless:无服务器推理,自动弹性扩缩容,按请求计费。
- 资源覆盖:支持 30+ 种显卡型号,全球 30+ 个部署区域。
- 对标竞品:主要对标 AWS/GCP GPU 实例,但价格通常更低。
- 核心场景:专为大模型(LLM)训练、微调、推理、Stable Diffusion AI 绘图等设计。
- 计费亮点:按秒计费,无出站流量费,不用不扣费。
二、主要功能
1. Pods 长时 GPU 容器
- 环境预装:提供 PyTorch / TensorFlow / LLaMA / SD 等一键模板。
- 连接方式:支持 Jupyter Notebook、SSH 远程连接、端口映射。
- 存储持久化:支持挂载持久化存储(卷),数据不丢失。
- 实例选择:可切换社区机(低价)与独享机(稳定)。
2. Serverless 无服务器推理
- 弹性计算:自动扩缩容,闲置时计费归零。
- API 服务:对外提供 API 接口,适配 LLM 与文生图批量服务。
- 冷启动:响应极快,最低仅需 2 秒。
3. 集群 Clusters
- 多卡互联:支持多卡 NVLink 互联。
- 适用场景:适合超大模型分布式训练及企业批量任务。
4. 配套工具
- 管理:提供 API / SDK 用于程序化管理实例。
- 监控:内置用量监控、预算告警、自动关机功能。
- 协作:支持团队协作权限分配、自定义 Docker 镜像。
三、适用人群分析
✅ 适合人群
- AI 开发者与学生:LLM 微调、Stable Diffusion 绘图、本地硬件跑不动时租用。
- 个人/小团队:搭建私有化 AI API、提供 7×24 小时推理服务。
- MLOps 从业者:批量推理、分布式训练、寻找低成本替代公有云 GPU 方案。
❌ 不适合人群
- 国内合规业务:无国内节点,直连网络存在不稳定性。
- 纯小白用户:无 Linux / Docker / 命令行基础,操作门槛高于可视化 AI 工具。
- 大带宽需求者:存储单独计费,若高频文件传输,成本可能偏高。
四、免费 & 付费方案
1. 免费政策说明
- 注册权益:注册账号免费开通控制台,查看价格。
- 新户福利:首充满 $10,随机赠送 $5 ~ $500 平台余额(一次性,仅限新用户)。
- 注意:无永久免费 GPU 时长,无免费算力额度,仅赠送抵扣金。
2. 付费模式详解
Pods 容器计费
- Community 抢占机:单价极低,但资源随时可能被平台回收,训练需保存断点。
- Secure 独享机:稳定不中断,单价较高,适合长时间运行任务。
- 计费规则:
- 算力:按实际使用秒数计费。
- 存储:$0.10/GB/月(持久化磁盘),删除 Pod 后停止计费,单纯关机不释放存储。
Serverless 推理计费
- Flex 模式:闲置自动停机,仅运行时扣费(推荐)。
- Active 模式:常驻实例,随时调用。
优惠套餐
- Savings Plan:预存 3 或 6 个月享受折扣。
- 预留集群:1–12 个月预留集群大幅降价。
🔗 官方定价页面(实时更新)
五、快速使用步骤
- 注册登录:访问
runpod.io使用邮箱注册,完成验证。 - 绑定支付:必须添加境外信用卡(Visa/Mastercard/Amex)以解锁 GPU 租用权限。
- 部署 Pods(训练/绘图):
- 进入左侧菜单
Pods→Deploy Pod。 - 选择预制模板或上传自定义 Docker 镜像。
- 选择显卡型号、部署区域、磁盘大小。
- 开启 Jupyter 或 SSH 端口。
- 启动容器,通过网页或 SSH 连接操作。
- 关键设置:务必配置 Auto Shutdown 自动停机,防止超额扣费。
- 部署 Serverless API:
- 进入左侧菜单
Serverless→New Endpoint。 - 填入推理镜像或选择官方模板。
- 设置扩缩容规则、GPU 规格。
- 生成公开 API 地址,直接 POST 调用 JSON。
- 配套配置:
- 进入
Settings配置 SSH 密钥、API Key,用于代码批量管理。
六、避坑重点(高频踩坑指南)
1. 网络硬伤
- 问题:国内用户直连加载慢、Jupyter 页面容易掉线、大模型下载极易超时。
- 建议:无国内服务器节点,必须优化网络环境(如配置节点加速或代理),刚需用户请慎重。
2. 抢占机中断风险
- 风险:Community Cloud 实例随时可能被平台回收,训练无断点保存会直接丢失进度。
- 建议:长时间训练任务,优先选择 Secure 独享机。
3. 扣费隐形坑
- 磁盘计费:磁盘是持续计费的,删除 Pod 才会停止存储扣费。
- 关机不释放:仅仅关闭 Pod 不释放存储卷,关机后仍需支付磁盘费。
- 忘记关机:忘记关机持续跑 GPU,几小时即可产生高额账单。
- 对策:务必开启 Auto Shutdown 自动停机功能。
4. 支付限制
- 硬性限制:仅支持境外信用卡,不支持微信/支付宝。
- 虚拟卡:部分虚拟卡可能触发风控导致无法绑定,建议准备多张备用卡。
5. 新手门槛
- 技术依赖:平台高度依赖 Linux 和 Docker,可视化操作少。
- 操作要求:不会 SSH、不会命令行(YAML/JSON 配置)极易卡壳。
6. 存储成本
- 注意:大模型数据集如果长期挂载,费用较高。
- 建议:用完及时清理无用卷,仅保留必要数据集。
7. API 密钥安全
- 风险:API Key 一旦泄露,会被他人占用你的 GPU 算力。
- 建议:禁止将密钥明文上传至公共代码仓库(如 GitHub)。
8. 无国内售后
- 现状:工单沟通全英文,故障排查响应慢。
- 注意:无本土化技术支持,需具备独立排查能力。
暂无评论