AI模型开发全链路【90天系统化学习计划】

本文最后更新于 2026年7月29日 下午

AI模型开发全链路【90天系统化学习计划】

适配目标:完整掌握数据采集→数据清洗→数据标注→数据集划分→模型训练/微调→模型评估→推理部署

兼顾【人工智能训练师三级备考】+ 工程落地,偏向嵌入式/边缘AI、计算机视觉方向(贴合你的背景)

预设:每日有效学习 3~4 小时;有基础 C 语言基础,零基础 Python 也可执行
技术栈主线:Python + Pandas + OpenCV + PyTorch + LabelStudio/CVAT + HuggingFace

整体阶段划分

阶段 时间 核心内容
阶段1 第1~21天 Python & 数据处理基础
阶段2 第22~42天 数据标注工程 + 数据集流水线
阶段3 第43~63天 深度学习基础 + PyTorch模型训练
阶段4 第64~80天 预训练模型微调、训练调参
阶段5 第81~90天 端到端完整项目 + 边缘部署

阶段1|第1~21天:Python & 数据处理基础

核心目标:看懂数据、写清洗脚本,处理图像/表格脏数据,对应AI训练师实操考点

学习资源站点

  1. Python基础:菜鸟教程
  2. Pandas官方文档:https://pandas.pydata.org/docs/
  3. NumPy文档:https://numpy.org/doc/stable/
  4. OpenCV-Python文档:https://docs.opencv.org/4.x/d0/d3d/tutorial_py_table_of_contents.html
  5. 实战练习:Kaggle Learn
  6. 国内练习平台:阿里云天池

周计划

第1周(1~7天)Python基础

知识点:变量、循环、函数、类、文件读写、json/yaml解析、异常处理

任务:

  • 学会读写图片、批量遍历文件夹(图像数据集必备)
  • 编写脚本:批量重命名、筛选图片、过滤过小/模糊图片(简易图像清洗)

第2周(8~14天)NumPy + Pandas|结构化数据清洗

核心技能(工业高频):

  • 缺失值填充、删除重复样本、异常值过滤
  • 数据集划分:训练集/验证集/测试集分割
  • 数据统计、可视化分析

实战任务:Kaggle泰坦尼克数据集,独立完成全套数据清洗代码

第3周(15~21天)OpenCV + 图像预处理(CV方向)

知识点:图像读取、缩放、归一化、裁剪、降噪、亮度增强

数据清洗图像场景:剔除模糊图、曝光异常、重复截图

阶段里程碑

输出一份通用数据集清洗脚本(表格 + 图像两套)


阶段2|第22~42天:数据标注工程、数据集规范

核心目标:掌握标注工具、标注规范、标注质检、标注格式转换(YOLO/COCO)
这是人工智能训练师三级核心考点

学习网站 & 工具文档

  1. Label Studio官方指南(通用标注首选)
  2. CVAT(工业视觉主流)
  3. LabelImg(YOLO入门)
  4. COCO数据集格式说明
  5. HuggingFace Datasets库文档

周计划

第4周(22~28天)标注基础理论

  • 任务区分:分类、目标检测、语义分割、关键点
  • 标注规范、标注质检标准、常见标注错误
  • 数据集均衡、正负样本配比
  • 标注格式:YOLO txt、COCO json理解

实战:本地部署Label Studio,导入50张图片完成目标检测标注

第5周(29~35天)CVAT部署 + AI辅助预标注

重点学习:自动标注、批量修正、导出数据集

实操:把LabelImg标注数据转为COCO格式

第6周(36~42天)数据集流水线工程

  1. 清洗原始图片 → 筛选有效样本 → 标注 → 清洗标注错误
  2. 脚本实现:标注文件校验、脏标签自动筛查
  3. 数据集划分脚本(train/val/test)

阶段里程碑

完成一套闭环:原始图片 → 清洗 → 标注 → 校验 → 标准训练数据集


阶段3|第43~63天:深度学习基础 + PyTorch模型训练

核心目标:看懂训练代码,理解训练循环、损失函数、过拟合、优化器

指定学习资料站点

  1. 动手学深度学习(中文首选)
  2. PyTorch官方教程
  3. TorchVision文档
  4. AI Studio(免费GPU运行代码)

周计划

第7周(43~49天)深度学习理论

神经元、激活函数、CNN基础;训练/验证流程;评估指标:Acc、Precision、Recall、F1、mAP

第8周(50~56天)PyTorch基础

Dataset、DataLoader、自定义数据集加载;搭建简单CNN,训练手写数字MNIST

第9周(57~63天)迁移学习训练

使用ResNet预训练模型做图像分类;完整训练脚本:训练循环、保存模型、测试推理

阶段里程碑

本地训练图像分类模型,输出训练日志、准确率曲线


阶段4|第64~80天:模型微调、训练调参、工程优化

面向真实项目:不从头训练,基于预训练模型微调(现在行业主流方案)

学习站点

  1. HuggingFace文档(国内镜像)
  2. Ultralytics YOLOv8官方文档(目标检测首选)
  3. Kaggle开源notebook参考调参方案

周计划

第10周(64~70天)YOLOv8实战训练

目标检测完整流程:数据集(yolo格式)→训练→评估mAP→推理测试

第11周(71~77天)训练调优

学习学习率、batchsize、正则、数据增强;解决过拟合;训练日志分析

第12周(78~80天)大模型微调基础(LoRA概念)

了解LLM/多模态微调思路;区分全量微调/LoRA高效微调


阶段5|第81~90天:端到端完整项目 + 模型部署

核心目标:独立走完全链路项目,贴合嵌入式硬件部署需求(RK3588/RV1126)

学习站点

  1. ONNX Runtime文档
  2. Ultralytics模型导出教程
  3. AutoDL算力平台(租用GPU训练大数据集)

任务清单(综合大项目,二选一)

方案A【计算机视觉项目】(推荐,适配嵌入式)

自定义目标检测项目:

  1. 采集图片 → OpenCV清洗过滤脏图
  2. CVAT标注 → 标注校验
  3. 划分训练集
  4. YOLOv8训练,调参优化
  5. 模型导出ONNX
  6. 编写本地Python推理脚本

方案B【文本分类NLP项目】

文本数据清洗 → 文本标注 → HuggingFace Transformer微调


✅ 90天最终产出

  1. 全套可复用脚本:数据清洗、数据集划分、标注校验
  2. 完整训练工程代码
  3. 训练完成模型 + ONNX权重文件
  4. 项目文档(适合简历作品集)

常备资源汇总(永久收藏)

数据集网站(练习素材)

  1. HuggingFace Datasets
  2. 百度飞桨数据集中心
  3. Kaggle数据集

免费算力平台(没有高端显卡必用)

  1. 百度AI Studio - 国内免费GPU
  2. Google Colab - https://colab.research.google.com/
  3. AutoDL - 按需付费GPU,适合大训练任务

论文 & 开源代码参考

Papers With Code - 论文+开源代码,复现SOTA模型


可选拓展路线(90天之后)

  1. MLOps:MLflow实验跟踪、数据集版本管理DVC
  2. 边缘部署:RKNN工具链、模型量化(适配瑞芯微硬件)
  3. 多模态模型、RAG、Agent开发

嵌入式工程师学AI - 从工具使用者到模型开发者的进阶之路


AI模型开发全链路【90天系统化学习计划】
https://www.huahuaguonai.com/2026/07/29/ai-model-dev-90day-learning-plan/
作者
安河桥工作室
发布于
2026年7月29日
更新于
2026年7月29日
许可协议