Google Colab 新手指南:从免费 GPU 到训练、部署与在线应用
一、Colab 是什么?为什么值得一用?
Google Colab 是一个在浏览器里运行的 Jupyter Notebook 托管服务。你不需要在本地安装 Python、CUDA 或显卡驱动,只要有一个 Google 账号,打开网页就能写代码、跑实验、训练模型。
对于初学者来说,它最大的吸引力是免费 GPU/TPU;对于有经验的开发者,它则是一个快速验证想法、共享可复现实验、临时借用算力的便利工具。
二、上手第一步:创建笔记本并切换运行时
访问 colab.research.google.com,登录后点击「新建笔记本」。你会看到一个空的代码格,按 Shift + Enter 即可运行。
默认是 CPU 环境。要启用加速器,进入菜单 运行时 → 更改运行时类型,在「硬件加速器」里选择 GPU 或 TPU,然后保存。
图 1:免费用户可选 T4 GPU 与 v5e-1 TPU;H100、A100、L4、G4、v6e-1 TPU 等需消耗付费计算单元。
T4 GPU 与 v5e-1 TPU 怎么选?
免费档能稳定拿到的两张卡各有侧重:
| 维度 | T4 GPU | v5e-1 TPU |
|---|---|---|
| 适用框架 | PyTorch、TensorFlow、JAX 通用 | 对 JAX/TensorFlow 最友好;PyTorch 需 PyTorch/XLA |
| 显存/芯片内存 | 约 15 GB 可用显存 | Cloud TPU v5e,单芯片 HBM 较大,吞吐高 |
| 调试体验 | 更接近本地 PyTorch,报错直观 | 编译/图模式更强,调试门槛略高 |
| 推荐场景 | 绝大多数入门教程、Stable Diffusion、Whisper、BERT 微调 | 大规模 Transformer 训练、JAX/Flax 生态 |
| 免费可用时长 | 通常比 TPU 更长(约 5 小时 20 分) | 通常更短(约 1 小时 50 分) |
建议: 如果你是 PyTorch 新手或只是跑推理、微调小模型,优先选 T4 GPU;如果你已经在用 JAX/TensorFlow 做大规模训练,可以尝试 v5e-1 TPU。
T4 GPU 在推理上到底相当于什么级别?
选了 T4,自然想知道「这张免费卡到底啥水平」。一句话结论:T4 的 FP32 裸算力约等于 2019 年的中端消费卡(GTX 1660 Super / RTX 2060 / RTX 2070),但在 INT8/FP16 量化推理 + 16GB 大显存的加持下,实际推理表现明显优于它的「纸面算力」,是部署 BERT、ResNet、Whisper、7B–13B 级别 LLM 的「甜点卡」。
先看 T4 的真实规格(NVIDIA 官方数据):
| 规格 | NVIDIA Tesla T4 | 说明 |
|---|---|---|
| 架构 / 制程 | Turing / 12nm | 数据中心专用,被动散热、70W 低功耗 |
| CUDA 核心 | 2560 | 略多于 RTX 2060,但优化方向不同 |
| 显存 | 16 GB GDDR6(带宽 320 GB/s) | 最大优势:同算力档消费卡多为 6–8GB |
| FP32 单精度 | 8.1 TFLOPS | 约等于 GTX 1660 Super / RTX 2070 |
| FP16 混合精度 | 65 TFLOPS | 靠 Tensor Core 提上来 |
| INT8 推理 | 130 TOPS | 量化推理才是它的主场 |
把它和常见消费卡放在一起对比(数值为各家公开规格的近似值,仅供量级参考):
| 显卡 | FP32 (TFLOPS) | 显存 | 推理定位对照 |
|---|---|---|---|
| Colab T4 | ~8.1 | 16 GB GDDR6 | 量化推理 + 大显存,性价比甜点 |
| GTX 1660 Super | ~7.1 | 6 GB | FP32 裸算力最接近 T4,但显存只有 1/3 |
| RTX 2060 | ~6.5 | 6 GB | FP32 接近 T4,显存偏小 |
| RTX 2070 | ~7.5 | 8 GB | FP32 与 T4 基本同档 |
| RTX 3060 (12GB) | ~12.7 | 12 GB | FP32 更强、带宽略高,但显存仍少于 T4 |
| A10G(付费) | ~31 | 24 GB | FP16 碾压 T4,价格也高数倍 |
几个关键点,避免误解:
- 看 FP32 会低估它:T4 的强项在 INT8/FP16 量化推理(Tensor Core 加持),用
torch.amp半精度或bitsandbytes4-bit 量化跑模型时,吞吐量远超它的 8.1 TFLOPS「纸面值」。 - 16GB 显存是杀手锏:同价位消费卡常见 6–8GB,T4 的 16GB 能直接塞下 7B 模型 4-bit 量化、甚至 13B 模型 + 少量上下文,这对本地跑 LLM 推理非常关键。
- LLM 推理受带宽制约:大模型推理是「显存带宽受限」而非算力受限,T4 的 320 GB/s 属中规中矩(RTX 3060 12GB 约 360 GB/s、RTX 3090 约 936 GB/s)。所以 T4 能跑 7B/13B,但 token 速度别指望太快——相比「能不能跑」,它更擅长「稳不稳、够不够装」。
- 它不该干啥:不适合大模型训练(FP32 弱、带宽窄、单卡容量有限),也不支持游戏驱动,更不适合当 3D 渲染工作站。
总结:把 T4 当成「一张自带 16GB 显存、擅长量化推理的 1660 Super」来理解最直观——免费、稳定、够装,是入门 AI 推理/微调最省心的起手卡。
三、确认你到底拿到了哪张卡
连接 GPU 后,在代码格里运行:
!nvidia-smi
图 2:nvidia-smi 输出确认当前分配的是 Tesla T4,显存 15.36 GB。
或者用 PyTorch 检查:
import torch
print(torch.cuda.is_available())
print(torch.cuda.get_device_name(0))
四、看懂资源面板:别让免费额度偷偷溜走
点击右上角的「资源」标签,你能看到当前会话的 RAM、显存/TPU 内存、磁盘占用,以及预计剩余可用时间。
图 3:切换到 T4 GPU 后,资源面板显示系统 RAM 12.7 GB、GPU RAM 15.0 GB、磁盘 112.6 GB,当前用量下预计可用 5 小时 20 分钟。
省电技巧: 写代码、查文档、调试时切回 CPU,只在做矩阵运算、训练、推理时再切换到 GPU/TPU。GPU 空闲约 90 分钟会自动断开,断开后临时盘会清空。
那个「预计可用时长」到底是什么?
图 3 里「在您当前的用量水平下,此运行时可能会持续长达 5 小时 20 分钟」这句话,是 Google 对当前这台虚拟机还能活多久的实时预测,不是一张「每天/每周发放、到点归零」的额度表。
- 它是会话存活估计:基于当前资源负载和你此刻的用量水平动态计算。负载高时会缩到 1 小时 50 分(切到 TPU 时常出现),空闲或低峰时更长。
- 它没有固定的「重置时刻」:这个数字会随负载实时浮动,不绑定日历上的某天某点。
- 真正的上限是「计算单元(Compute Units)」:免费档按计算单元计费,属于滚动配额——约 15–30 GPU 小时/周(Google 不公开精确值,随区域和负载浮动)。用完会被限流或临时降级回 CPU,待滚动窗口释放后逐步恢复,节奏大致以周为单位,而非固定日历重置。
一句话:面板上显示的是「这台机器还能撑多久」,会随负载实时变化;背后真正限量的是计算单元,属于不公开、按周滚动的动态配额。
五、持久存储:数据到底该放哪儿?
这是新手最容易踩的坑。Colab 给你的虚拟机磁盘是临时的,断开连接或超时后会被回收。因此,重要数据必须放到持久化位置。
1. 挂载 Google Drive(最常用)
from google.colab import drive
drive.mount('/content/drive')
运行后会弹出授权链接,按提示允许访问即可。之后你的 Drive 文件会出现在 /content/drive/MyDrive 下,可以像本地路径一样读写。
2. 数据集/权重的存放策略
- 小数据集:直接上传到 Drive,训练时从 Drive 读取。
- 大文件:用
!wget或!gdown下载到临时盘,训练完把结果拷贝回 Drive。 - 训练输出:检查点、模型、日志一律写到
/content/drive/MyDrive/...,不要只存在/content。
3. 快速上传小文件
from google.colab import files
uploaded = files.upload() # 弹出文件选择框
4. 下载结果到本地
files.download('/content/drive/MyDrive/model.pt')
持久化口诀: 临时盘只放「可重下的中间文件」,/content/drive 放「丢了会心疼的文件」,files.download() 用于「把最终结果拿回本地」。
六、保存与上传代码
1. 自动保存
Colab 笔记本默认自动保存到你的 Google Drive(路径通常是 Colab Notebooks 文件夹),你也可以通过「文件 → 在云端硬盘中定位」找到它。
2. 下载为其他格式
「文件 → 下载」支持导出 .ipynb、.py、.html、.pdf。导出 .py 适合把实验脚本拿到本地 IDE 里继续开发;导出 .html 适合分享只读报告。
3. 上传本地笔记本
在 Colab 首页点击「上传」,或在打开状态下「文件 → 上传笔记本」,选择本地的 .ipynb 文件即可。
4. 把长代码写成 .py 文件再导入
如果 Notebook 里代码太多,可以用魔法命令把代码写入文件:
%%writefile train.py
import torch
# ... 你的训练代码 ...
# 然后在另一个 cell 里导入/运行
!python train.py
七、使用别人的代码
1. 打开 GitHub 上的 Notebook
把 GitHub 仓库里 .ipynb 文件的 URL 粘贴到 Colab 首页的「打开笔记本 → GitHub」标签页,就能直接打开并运行。别人分享给你的 Colab 链接也是同理。
2. 克隆整个仓库
!git clone https://github.com/用户名/仓库名.git
%cd 仓库名
3. 安装依赖
!pip install -r requirements.txt -q
4. 复制片段调试
从 Stack Overflow、论文仓库或官方示例里复制代码片段,直接贴进新的代码格运行,是 Colab 最常见的用法之一。
八、训练模型:一个最小但完整的流程
下面是一个用 Colab 训练神经网络的经典流程,几乎适用于任何框架。
步骤 1:挂载 Drive 并检查设备
from google.colab import drive
drive.mount('/content/drive')
import torch
print(torch.cuda.get_device_name(0))
步骤 2:安装依赖并下载数据
!pip install transformers datasets accelerate -q
from datasets import load_dataset
dataset = load_dataset('glue', 'mrpc')
步骤 3:定义模型、优化器、训练循环
from transformers import AutoModelForSequenceClassification, AutoTokenizer
model = AutoModelForSequenceClassification.from_pretrained('bert-base-chinese', num_labels=2).cuda()
# ... 训练循环 ...
步骤 4:保存检查点到 Drive
output_dir = '/content/drive/MyDrive/colab_models/my_bert'
model.save_pretrained(output_dir)
tokenizer.save_pretrained(output_dir)
步骤 5:用 TensorBoard 监控
%load_ext tensorboard
%tensorboard --logdir /content/drive/MyDrive/colab_logs
九、训练结果怎么用、怎么下载?
1. 直接在 Colab 里继续推理
from transformers import pipeline
p = pipeline('sentiment-analysis', model=output_dir)
print(p('今天天气不错'))
2. 下载到本地
from google.colab import files
files.download(output_dir + '/pytorch_model.bin')
3. 推到 Hugging Face Hub
!pip install huggingface_hub -q
from huggingface_hub import notebook_login
notebook_login()
model.push_to_hub('你的用户名/my-colab-model')
4. 部署到云端
把模型文件下载到本地后,可以上传到阿里云、AWS SageMaker、Hugging Face Inference API、腾讯云 TI 平台等进行生产部署。
十、除了训练模型,Colab 还能做什么?
Colab 不只是一个「免费显卡出租机」。只要有浏览器,它就是一台随时可以启动的 Linux 云主机:
- 数据分析与可视化:pandas、matplotlib、plotly、seaborn 直接运行,生成图表。
- 爬虫与自动化:用 requests、BeautifulSoup、Selenium 抓取网页,跑定时脚本。
- 文档与音视频处理:PyMuPDF 读 PDF、Whisper 转写音频、FFmpeg 处理视频。
- API 原型与后端测试:快速验证 Flask/FastAPI 代码、调用第三方 API。
- Stable Diffusion 与 LLM 推理:免费 T4 足够跑量化 7B 模型和 SD 1.5。
- 教学与协作:把代码、说明、运行结果放在同一个 Notebook 里分享给学生或同事。
十一、能做在线应用吗?
答案是:可以做小 demo,但不适合正式生产环境。
1. 用 Gradio 做可交互页面
!pip install gradio -q
import gradio as gr
def greet(name):
return '你好,' + name
gr.Interface(fn=greet, inputs='text', outputs='text').launch(share=True)
设置 share=True 后,Gradio 会生成一个公开 URL,任何人都能访问你的 demo。这个 URL 只在当前 Colab 会话存活时有效。
2. 用 Streamlit 做更复杂的界面
!pip install streamlit pyngrok -q
!ngrok authtoken 你的_TOKEN
%%writefile app.py
import streamlit as st
st.title('我的 Colab App')
st.write('Hello from Streamlit')
!streamlit run app.py & npx localtunnel --port 8501
3. 为什么不能直接当服务器用?
- 会话会断开:免费 GPU 约 90 分钟空闲即断开,最长约 12 小时。
- 端口不公开:Colab 本身没有固定公网 IP,需要 Gradio/ngrok/localtunnel 做穿透。
- 违反使用政策:运行长期服务、代理、矿机、爬虫农场等会被限制账号。
结论: Colab 非常适合快速演示和验证,真正的线上服务请用 Hugging Face Spaces、Streamlit Cloud、阿里云函数计算、Vercel、Railway 等专门平台。
十二、避坑清单与最佳实践
- 先切 CPU 写代码,再切 GPU 跑训练,避免浪费免费 GPU 时长。
- 长任务做断点续训:定时保存 checkpoint,避免因超时从头再来。
- 大文件别往临时盘堆:超过 112 GB 会撑爆,随时用
!df -h检查。 - 安装包加
-q:减少日志刷屏,Notebook 更清爽。 - 善用
%timeit与!nvidia-smi -l 1:观察代码是否真的在跑 GPU。 - 不要滥用免费资源:遵守 Google 使用条款,频繁绕过 UI 自动化操作可能导致封号。
十三、除了 Colab,还有哪些免费 GPU 平台?
免费 GPU 不止 Colab 一家。把多个平台串起来,一周能凑出 50–70 小时免费算力。下面是 2026 年仍可稳定薅到的几家(均不需要信用卡):
| 平台 | 免费 GPU | 会话 / 配额 | 特点 |
|---|---|---|---|
| Kaggle Notebooks | P100 或 2×T4(16–32 GB),含 TPU v5e-8 | GPU 会话 ≤12h;约 30 GPU-h/周(固定配额,每周重置) | 内置 5 万+ 数据集、竞赛生态;20 GB 持久存储;需手机号验证 |
| Lightning AI | T4 / L4 / A10G / L40S 等 | 每月 15 免费额度 ≈ 22–80 GPU-h(按卡型浮动),4h 重启 | 持久化 IDE,文件/环境跨会话保留;仅需手机号验证 |
| Saturn Cloud | T4-class(≤16 GB) | 循环免费档,无需信用卡 | 最接近 Colab/Kaggle 的日常 Notebook 体验,存储持久 |
| Paperspace Gradient | M4000(8 GB) | 单次 ≤6h 自动关,1 并发 | 现属 DigitalOcean;5 GB 存储;免费笔记本默认公开 |
| Hugging Face ZeroGPU | RTX Pro 6000 Blackwell(48/96 GB) | 约 5 min/天(PRO 40 min),单次调用 ~60s | 只做推理 / Demo(Gradio Spaces),不能训练 |
| Intel Tiber AI Cloud | Intel Gaudi / Max GPU | 限时使用,按项目 | 英特尔硬件,适合尝鲜 |
另外还有一类「免费推理 API」(Groq、Cerebras、Google AI Studio、Cloudflare Workers AI):它们返回的是托管模型的 token,不是给你跑自定义代码的 GPU,适合做 LLM 应用原型,不能替代训练平台。
组合策略: Colab 抽不到卡时切到 Kaggle 续上;想要持久化 IDE 用 Lightning AI;做模型 Demo 发到 Hugging Face Spaces。多平台轮转,比单吊 Colab 稳得多。
十四、总结
Google Colab 是初学者踏入 AI 与数据科学门槛最低的入口之一:没有环境配置,没有显卡门槛,打开浏览器就能获得免费的 T4 GPU 或 v5e-1 TPU。
但用好它有三个关键点:会切换运行时、会挂载 Drive 做持久化、会管理会话生命周期。掌握了这三点,你就可以在 Colab 上完成从学习 Python、复现论文、训练模型到制作可交互 demo 的完整链路。
最小行动清单:
- 打开 colab.new → 2. 切 T4 GPU → 3. 跑
!nvidia-smi验证 → 4. 挂载 Drive → 5. 开始你的第一个训练实验。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。