AI模型开发全链路【90天系统化学习计划】
本文最后更新于 2026年7月29日 下午
AI模型开发全链路【90天系统化学习计划】
适配目标:完整掌握数据采集→数据清洗→数据标注→数据集划分→模型训练/微调→模型评估→推理部署
兼顾【人工智能训练师三级备考】+ 工程落地,偏向嵌入式/边缘AI、计算机视觉方向(贴合你的背景)
预设:每日有效学习 3~4 小时;有基础 C 语言基础,零基础 Python 也可执行
技术栈主线:Python + Pandas + OpenCV + PyTorch + LabelStudio/CVAT + HuggingFace
整体阶段划分
| 阶段 | 时间 | 核心内容 |
|---|---|---|
| 阶段1 | 第1~21天 | Python & 数据处理基础 |
| 阶段2 | 第22~42天 | 数据标注工程 + 数据集流水线 |
| 阶段3 | 第43~63天 | 深度学习基础 + PyTorch模型训练 |
| 阶段4 | 第64~80天 | 预训练模型微调、训练调参 |
| 阶段5 | 第81~90天 | 端到端完整项目 + 边缘部署 |
阶段1|第1~21天:Python & 数据处理基础
核心目标:看懂数据、写清洗脚本,处理图像/表格脏数据,对应AI训练师实操考点
学习资源站点
- Python基础:菜鸟教程
- Pandas官方文档:https://pandas.pydata.org/docs/
- NumPy文档:https://numpy.org/doc/stable/
- OpenCV-Python文档:https://docs.opencv.org/4.x/d0/d3d/tutorial_py_table_of_contents.html
- 实战练习:Kaggle Learn
- 国内练习平台:阿里云天池
周计划
第1周(1~7天)Python基础
知识点:变量、循环、函数、类、文件读写、json/yaml解析、异常处理
任务:
- 学会读写图片、批量遍历文件夹(图像数据集必备)
- 编写脚本:批量重命名、筛选图片、过滤过小/模糊图片(简易图像清洗)
第2周(8~14天)NumPy + Pandas|结构化数据清洗
核心技能(工业高频):
- 缺失值填充、删除重复样本、异常值过滤
- 数据集划分:训练集/验证集/测试集分割
- 数据统计、可视化分析
实战任务:Kaggle泰坦尼克数据集,独立完成全套数据清洗代码
第3周(15~21天)OpenCV + 图像预处理(CV方向)
知识点:图像读取、缩放、归一化、裁剪、降噪、亮度增强
数据清洗图像场景:剔除模糊图、曝光异常、重复截图
阶段里程碑
输出一份通用数据集清洗脚本(表格 + 图像两套)
阶段2|第22~42天:数据标注工程、数据集规范
核心目标:掌握标注工具、标注规范、标注质检、标注格式转换(YOLO/COCO)
这是人工智能训练师三级核心考点
学习网站 & 工具文档
- Label Studio官方指南(通用标注首选)
- CVAT(工业视觉主流)
- LabelImg(YOLO入门)
- COCO数据集格式说明
- HuggingFace Datasets库文档
周计划
第4周(22~28天)标注基础理论
- 任务区分:分类、目标检测、语义分割、关键点
- 标注规范、标注质检标准、常见标注错误
- 数据集均衡、正负样本配比
- 标注格式:YOLO txt、COCO json理解
实战:本地部署Label Studio,导入50张图片完成目标检测标注
第5周(29~35天)CVAT部署 + AI辅助预标注
重点学习:自动标注、批量修正、导出数据集
实操:把LabelImg标注数据转为COCO格式
第6周(36~42天)数据集流水线工程
- 清洗原始图片 → 筛选有效样本 → 标注 → 清洗标注错误
- 脚本实现:标注文件校验、脏标签自动筛查
- 数据集划分脚本(train/val/test)
阶段里程碑
完成一套闭环:原始图片 → 清洗 → 标注 → 校验 → 标准训练数据集
阶段3|第43~63天:深度学习基础 + PyTorch模型训练
核心目标:看懂训练代码,理解训练循环、损失函数、过拟合、优化器
指定学习资料站点
- 动手学深度学习(中文首选)
- PyTorch官方教程
- TorchVision文档
- AI Studio(免费GPU运行代码)
周计划
第7周(43~49天)深度学习理论
神经元、激活函数、CNN基础;训练/验证流程;评估指标:Acc、Precision、Recall、F1、mAP
第8周(50~56天)PyTorch基础
Dataset、DataLoader、自定义数据集加载;搭建简单CNN,训练手写数字MNIST
第9周(57~63天)迁移学习训练
使用ResNet预训练模型做图像分类;完整训练脚本:训练循环、保存模型、测试推理
阶段里程碑
本地训练图像分类模型,输出训练日志、准确率曲线
阶段4|第64~80天:模型微调、训练调参、工程优化
面向真实项目:不从头训练,基于预训练模型微调(现在行业主流方案)
学习站点
- HuggingFace文档(国内镜像)
- Ultralytics YOLOv8官方文档(目标检测首选)
- Kaggle开源notebook参考调参方案
周计划
第10周(64~70天)YOLOv8实战训练
目标检测完整流程:数据集(yolo格式)→训练→评估mAP→推理测试
第11周(71~77天)训练调优
学习学习率、batchsize、正则、数据增强;解决过拟合;训练日志分析
第12周(78~80天)大模型微调基础(LoRA概念)
了解LLM/多模态微调思路;区分全量微调/LoRA高效微调
阶段5|第81~90天:端到端完整项目 + 模型部署
核心目标:独立走完全链路项目,贴合嵌入式硬件部署需求(RK3588/RV1126)
学习站点
- ONNX Runtime文档
- Ultralytics模型导出教程
- AutoDL算力平台(租用GPU训练大数据集)
任务清单(综合大项目,二选一)
方案A【计算机视觉项目】(推荐,适配嵌入式)
自定义目标检测项目:
- 采集图片 → OpenCV清洗过滤脏图
- CVAT标注 → 标注校验
- 划分训练集
- YOLOv8训练,调参优化
- 模型导出ONNX
- 编写本地Python推理脚本
方案B【文本分类NLP项目】
文本数据清洗 → 文本标注 → HuggingFace Transformer微调
✅ 90天最终产出
- 全套可复用脚本:数据清洗、数据集划分、标注校验
- 完整训练工程代码
- 训练完成模型 + ONNX权重文件
- 项目文档(适合简历作品集)
常备资源汇总(永久收藏)
数据集网站(练习素材)
免费算力平台(没有高端显卡必用)
- 百度AI Studio - 国内免费GPU
- Google Colab - https://colab.research.google.com/
- AutoDL - 按需付费GPU,适合大训练任务
论文 & 开源代码参考
Papers With Code - 论文+开源代码,复现SOTA模型
可选拓展路线(90天之后)
- MLOps:MLflow实验跟踪、数据集版本管理DVC
- 边缘部署:RKNN工具链、模型量化(适配瑞芯微硬件)
- 多模态模型、RAG、Agent开发
嵌入式工程师学AI - 从工具使用者到模型开发者的进阶之路