Google Colab 新手指南:从免费 GPU 到训练、部署与在线应用
原创 · 约 29 分钟阅读 · 阅读 --

Google Colab 新手指南:从免费 GPU 到训练、部署与在线应用

作者: Alex Xiang


我是 Alex,一个古董级程序员,在公众号「字与码」持续写 AI 工程实践与一线踩坑笔记。如果这篇文章对你有帮助,欢迎关注公众号「字与码」,第一时间收到后续更新与可复现的实验代码。

一、Colab 是什么?为什么值得一用?

Google Colab 是一个在浏览器里运行的 Jupyter Notebook 托管服务。你不需要在本地安装 Python、CUDA 或显卡驱动,只要有一个 Google 账号,打开网页就能写代码、跑实验、训练模型。

对于初学者来说,它最大的吸引力是免费 GPU/TPU;对于有经验的开发者,它则是一个快速验证想法、共享可复现实验、临时借用算力的便利工具。

二、上手第一步:创建笔记本并切换运行时

访问 colab.research.google.com,登录后点击「新建笔记本」。你会看到一个空的代码格,按 Shift + Enter 即可运行。

默认是 CPU 环境。要启用加速器,进入菜单 运行时 → 更改运行时类型,在「硬件加速器」里选择 GPU 或 TPU,然后保存。

Colab 运行时选择界面 图 1:免费用户可选 T4 GPU 与 v5e-1 TPU;H100、A100、L4、G4、v6e-1 TPU 等需消耗付费计算单元。

T4 GPU 与 v5e-1 TPU 怎么选?

免费档能稳定拿到的两张卡各有侧重:

维度T4 GPUv5e-1 TPU
适用框架PyTorch、TensorFlow、JAX 通用对 JAX/TensorFlow 最友好;PyTorch 需 PyTorch/XLA
显存/芯片内存约 15 GB 可用显存Cloud TPU v5e,单芯片 HBM 较大,吞吐高
调试体验更接近本地 PyTorch,报错直观编译/图模式更强,调试门槛略高
推荐场景绝大多数入门教程、Stable Diffusion、Whisper、BERT 微调大规模 Transformer 训练、JAX/Flax 生态
免费可用时长通常比 TPU 更长(约 5 小时 20 分)通常更短(约 1 小时 50 分)

建议: 如果你是 PyTorch 新手或只是跑推理、微调小模型,优先选 T4 GPU;如果你已经在用 JAX/TensorFlow 做大规模训练,可以尝试 v5e-1 TPU。

T4 GPU 在推理上到底相当于什么级别?

选了 T4,自然想知道「这张免费卡到底啥水平」。一句话结论:T4 的 FP32 裸算力约等于 2019 年的中端消费卡(GTX 1660 Super / RTX 2060 / RTX 2070),但在 INT8/FP16 量化推理 + 16GB 大显存的加持下,实际推理表现明显优于它的「纸面算力」,是部署 BERT、ResNet、Whisper、7B–13B 级别 LLM 的「甜点卡」。

先看 T4 的真实规格(NVIDIA 官方数据):

规格NVIDIA Tesla T4说明
架构 / 制程Turing / 12nm数据中心专用,被动散热、70W 低功耗
CUDA 核心2560略多于 RTX 2060,但优化方向不同
显存16 GB GDDR6(带宽 320 GB/s)最大优势:同算力档消费卡多为 6–8GB
FP32 单精度8.1 TFLOPS约等于 GTX 1660 Super / RTX 2070
FP16 混合精度65 TFLOPS靠 Tensor Core 提上来
INT8 推理130 TOPS量化推理才是它的主场

把它和常见消费卡放在一起对比(数值为各家公开规格的近似值,仅供量级参考):

显卡FP32 (TFLOPS)显存推理定位对照
Colab T4~8.116 GB GDDR6量化推理 + 大显存,性价比甜点
GTX 1660 Super~7.16 GBFP32 裸算力最接近 T4,但显存只有 1/3
RTX 2060~6.56 GBFP32 接近 T4,显存偏小
RTX 2070~7.58 GBFP32 与 T4 基本同档
RTX 3060 (12GB)~12.712 GBFP32 更强、带宽略高,但显存仍少于 T4
A10G(付费)~3124 GBFP16 碾压 T4,价格也高数倍

几个关键点,避免误解:

  • 看 FP32 会低估它:T4 的强项在 INT8/FP16 量化推理(Tensor Core 加持),用 torch.amp 半精度或 bitsandbytes 4-bit 量化跑模型时,吞吐量远超它的 8.1 TFLOPS「纸面值」。
  • 16GB 显存是杀手锏:同价位消费卡常见 6–8GB,T4 的 16GB 能直接塞下 7B 模型 4-bit 量化、甚至 13B 模型 + 少量上下文,这对本地跑 LLM 推理非常关键。
  • LLM 推理受带宽制约:大模型推理是「显存带宽受限」而非算力受限,T4 的 320 GB/s 属中规中矩(RTX 3060 12GB 约 360 GB/s、RTX 3090 约 936 GB/s)。所以 T4 能跑 7B/13B,但 token 速度别指望太快——相比「能不能跑」,它更擅长「稳不稳、够不够装」。
  • 它不该干啥:不适合大模型训练(FP32 弱、带宽窄、单卡容量有限),也不支持游戏驱动,更不适合当 3D 渲染工作站。

总结:把 T4 当成「一张自带 16GB 显存、擅长量化推理的 1660 Super」来理解最直观——免费、稳定、够装,是入门 AI 推理/微调最省心的起手卡。

三、确认你到底拿到了哪张卡

连接 GPU 后,在代码格里运行:

!nvidia-smi

nvidia-smi 输出显示 Tesla T4 图 2:nvidia-smi 输出确认当前分配的是 Tesla T4,显存 15.36 GB。

或者用 PyTorch 检查:

import torch
print(torch.cuda.is_available())
print(torch.cuda.get_device_name(0))

四、看懂资源面板:别让免费额度偷偷溜走

点击右上角的「资源」标签,你能看到当前会话的 RAM、显存/TPU 内存、磁盘占用,以及预计剩余可用时间。

Colab 资源监控面板 图 3:切换到 T4 GPU 后,资源面板显示系统 RAM 12.7 GB、GPU RAM 15.0 GB、磁盘 112.6 GB,当前用量下预计可用 5 小时 20 分钟。

省电技巧: 写代码、查文档、调试时切回 CPU,只在做矩阵运算、训练、推理时再切换到 GPU/TPU。GPU 空闲约 90 分钟会自动断开,断开后临时盘会清空。

那个「预计可用时长」到底是什么?

图 3 里「在您当前的用量水平下,此运行时可能会持续长达 5 小时 20 分钟」这句话,是 Google 对当前这台虚拟机还能活多久的实时预测,不是一张「每天/每周发放、到点归零」的额度表

  • 它是会话存活估计:基于当前资源负载和你此刻的用量水平动态计算。负载高时会缩到 1 小时 50 分(切到 TPU 时常出现),空闲或低峰时更长。
  • 它没有固定的「重置时刻」:这个数字会随负载实时浮动,不绑定日历上的某天某点。
  • 真正的上限是「计算单元(Compute Units)」:免费档按计算单元计费,属于滚动配额——约 15–30 GPU 小时/周(Google 不公开精确值,随区域和负载浮动)。用完会被限流或临时降级回 CPU,待滚动窗口释放后逐步恢复,节奏大致以周为单位,而非固定日历重置。

一句话:面板上显示的是「这台机器还能撑多久」,会随负载实时变化;背后真正限量的是计算单元,属于不公开、按周滚动的动态配额。

五、持久存储:数据到底该放哪儿?

这是新手最容易踩的坑。Colab 给你的虚拟机磁盘是临时的,断开连接或超时后会被回收。因此,重要数据必须放到持久化位置。

1. 挂载 Google Drive(最常用)

from google.colab import drive
drive.mount('/content/drive')

运行后会弹出授权链接,按提示允许访问即可。之后你的 Drive 文件会出现在 /content/drive/MyDrive 下,可以像本地路径一样读写。

2. 数据集/权重的存放策略

  • 小数据集:直接上传到 Drive,训练时从 Drive 读取。
  • 大文件:用 !wget!gdown 下载到临时盘,训练完把结果拷贝回 Drive。
  • 训练输出:检查点、模型、日志一律写到 /content/drive/MyDrive/...,不要只存在 /content

3. 快速上传小文件

from google.colab import files
uploaded = files.upload()  # 弹出文件选择框

4. 下载结果到本地

files.download('/content/drive/MyDrive/model.pt')

持久化口诀: 临时盘只放「可重下的中间文件」,/content/drive 放「丢了会心疼的文件」,files.download() 用于「把最终结果拿回本地」。

六、保存与上传代码

1. 自动保存

Colab 笔记本默认自动保存到你的 Google Drive(路径通常是 Colab Notebooks 文件夹),你也可以通过「文件 → 在云端硬盘中定位」找到它。

2. 下载为其他格式

「文件 → 下载」支持导出 .ipynb.py.html.pdf。导出 .py 适合把实验脚本拿到本地 IDE 里继续开发;导出 .html 适合分享只读报告。

3. 上传本地笔记本

在 Colab 首页点击「上传」,或在打开状态下「文件 → 上传笔记本」,选择本地的 .ipynb 文件即可。

4. 把长代码写成 .py 文件再导入

如果 Notebook 里代码太多,可以用魔法命令把代码写入文件:

%%writefile train.py
import torch
# ... 你的训练代码 ...

# 然后在另一个 cell 里导入/运行
!python train.py

七、使用别人的代码

1. 打开 GitHub 上的 Notebook

把 GitHub 仓库里 .ipynb 文件的 URL 粘贴到 Colab 首页的「打开笔记本 → GitHub」标签页,就能直接打开并运行。别人分享给你的 Colab 链接也是同理。

2. 克隆整个仓库

!git clone https://github.com/用户名/仓库名.git
%cd 仓库名

3. 安装依赖

!pip install -r requirements.txt -q

4. 复制片段调试

从 Stack Overflow、论文仓库或官方示例里复制代码片段,直接贴进新的代码格运行,是 Colab 最常见的用法之一。

八、训练模型:一个最小但完整的流程

下面是一个用 Colab 训练神经网络的经典流程,几乎适用于任何框架。

步骤 1:挂载 Drive 并检查设备

from google.colab import drive
drive.mount('/content/drive')

import torch
print(torch.cuda.get_device_name(0))

步骤 2:安装依赖并下载数据

!pip install transformers datasets accelerate -q
from datasets import load_dataset
dataset = load_dataset('glue', 'mrpc')

步骤 3:定义模型、优化器、训练循环

from transformers import AutoModelForSequenceClassification, AutoTokenizer

model = AutoModelForSequenceClassification.from_pretrained('bert-base-chinese', num_labels=2).cuda()
# ... 训练循环 ...

步骤 4:保存检查点到 Drive

output_dir = '/content/drive/MyDrive/colab_models/my_bert'
model.save_pretrained(output_dir)
tokenizer.save_pretrained(output_dir)

步骤 5:用 TensorBoard 监控

%load_ext tensorboard
%tensorboard --logdir /content/drive/MyDrive/colab_logs

九、训练结果怎么用、怎么下载?

1. 直接在 Colab 里继续推理

from transformers import pipeline
p = pipeline('sentiment-analysis', model=output_dir)
print(p('今天天气不错'))

2. 下载到本地

from google.colab import files
files.download(output_dir + '/pytorch_model.bin')

3. 推到 Hugging Face Hub

!pip install huggingface_hub -q
from huggingface_hub import notebook_login
notebook_login()
model.push_to_hub('你的用户名/my-colab-model')

4. 部署到云端

把模型文件下载到本地后,可以上传到阿里云、AWS SageMaker、Hugging Face Inference API、腾讯云 TI 平台等进行生产部署。

十、除了训练模型,Colab 还能做什么?

Colab 不只是一个「免费显卡出租机」。只要有浏览器,它就是一台随时可以启动的 Linux 云主机:

  • 数据分析与可视化:pandas、matplotlib、plotly、seaborn 直接运行,生成图表。
  • 爬虫与自动化:用 requests、BeautifulSoup、Selenium 抓取网页,跑定时脚本。
  • 文档与音视频处理:PyMuPDF 读 PDF、Whisper 转写音频、FFmpeg 处理视频。
  • API 原型与后端测试:快速验证 Flask/FastAPI 代码、调用第三方 API。
  • Stable Diffusion 与 LLM 推理:免费 T4 足够跑量化 7B 模型和 SD 1.5。
  • 教学与协作:把代码、说明、运行结果放在同一个 Notebook 里分享给学生或同事。

十一、能做在线应用吗?

答案是:可以做小 demo,但不适合正式生产环境。

1. 用 Gradio 做可交互页面

!pip install gradio -q
import gradio as gr

def greet(name):
    return '你好,' + name

gr.Interface(fn=greet, inputs='text', outputs='text').launch(share=True)

设置 share=True 后,Gradio 会生成一个公开 URL,任何人都能访问你的 demo。这个 URL 只在当前 Colab 会话存活时有效。

2. 用 Streamlit 做更复杂的界面

!pip install streamlit pyngrok -q
!ngrok authtoken 你的_TOKEN
%%writefile app.py
import streamlit as st
st.title('我的 Colab App')
st.write('Hello from Streamlit')
!streamlit run app.py & npx localtunnel --port 8501

3. 为什么不能直接当服务器用?

  • 会话会断开:免费 GPU 约 90 分钟空闲即断开,最长约 12 小时。
  • 端口不公开:Colab 本身没有固定公网 IP,需要 Gradio/ngrok/localtunnel 做穿透。
  • 违反使用政策:运行长期服务、代理、矿机、爬虫农场等会被限制账号。

结论: Colab 非常适合快速演示和验证,真正的线上服务请用 Hugging Face Spaces、Streamlit Cloud、阿里云函数计算、Vercel、Railway 等专门平台。

十二、避坑清单与最佳实践

  • 先切 CPU 写代码,再切 GPU 跑训练,避免浪费免费 GPU 时长。
  • 长任务做断点续训:定时保存 checkpoint,避免因超时从头再来。
  • 大文件别往临时盘堆:超过 112 GB 会撑爆,随时用 !df -h 检查。
  • 安装包加 -q:减少日志刷屏,Notebook 更清爽。
  • 善用 %timeit!nvidia-smi -l 1:观察代码是否真的在跑 GPU。
  • 不要滥用免费资源:遵守 Google 使用条款,频繁绕过 UI 自动化操作可能导致封号。

十三、除了 Colab,还有哪些免费 GPU 平台?

免费 GPU 不止 Colab 一家。把多个平台串起来,一周能凑出 50–70 小时免费算力。下面是 2026 年仍可稳定薅到的几家(均不需要信用卡):

平台免费 GPU会话 / 配额特点
Kaggle NotebooksP100 或 2×T4(16–32 GB),含 TPU v5e-8GPU 会话 ≤12h;约 30 GPU-h/周(固定配额,每周重置内置 5 万+ 数据集、竞赛生态;20 GB 持久存储;需手机号验证
Lightning AIT4 / L4 / A10G / L40S 等每月 15 免费额度 ≈ 22–80 GPU-h(按卡型浮动),4h 重启持久化 IDE,文件/环境跨会话保留;仅需手机号验证
Saturn CloudT4-class(≤16 GB)循环免费档,无需信用卡最接近 Colab/Kaggle 的日常 Notebook 体验,存储持久
Paperspace GradientM4000(8 GB)单次 ≤6h 自动关,1 并发现属 DigitalOcean;5 GB 存储;免费笔记本默认公开
Hugging Face ZeroGPURTX Pro 6000 Blackwell(48/96 GB)约 5 min/天(PRO 40 min),单次调用 ~60s只做推理 / Demo(Gradio Spaces),不能训练
Intel Tiber AI CloudIntel Gaudi / Max GPU限时使用,按项目英特尔硬件,适合尝鲜

另外还有一类「免费推理 API」(Groq、Cerebras、Google AI Studio、Cloudflare Workers AI):它们返回的是托管模型的 token,不是给你跑自定义代码的 GPU,适合做 LLM 应用原型,不能替代训练平台。

组合策略: Colab 抽不到卡时切到 Kaggle 续上;想要持久化 IDE 用 Lightning AI;做模型 Demo 发到 Hugging Face Spaces。多平台轮转,比单吊 Colab 稳得多。

十四、总结

Google Colab 是初学者踏入 AI 与数据科学门槛最低的入口之一:没有环境配置,没有显卡门槛,打开浏览器就能获得免费的 T4 GPU 或 v5e-1 TPU。

但用好它有三个关键点:会切换运行时、会挂载 Drive 做持久化、会管理会话生命周期。掌握了这三点,你就可以在 Colab 上完成从学习 Python、复现论文、训练模型到制作可交互 demo 的完整链路。

最小行动清单:

  1. 打开 colab.new → 2. 切 T4 GPU → 3. 跑 !nvidia-smi 验证 → 4. 挂载 Drive → 5. 开始你的第一个训练实验。
打开原图 ↗