ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

机器学习基础:监督学习、无监督学习与强化学习全面解析

机器学习基础:监督学习、无监督学习与强化学习全面解析 机器学习基础监督学习、无监督学习与强化学习全面解析1. 什么是机器学习机器学习Machine Learning, ML是人工智能Artificial Intelligence, AI的一个重要分支。传统程序设计通常是输入数据 人工设计规则 → 输出结果例如图片 ↓ 人工设计规则 ↓ 判断是否包含车辆而机器学习的思想是输入数据 结果反馈 ↓ 学习规律 ↓ 自动预测也就是说机器学习的核心目标是让计算机通过数据自动学习规律而不是依靠人工编写所有规则。2. 机器学习的主要分类机器学习通常分为三大类机器学习 Machine Learning ├── 监督学习 Supervised Learning │ ├── 无监督学习 Unsupervised Learning │ └── 强化学习 Reinforcement Learning三者最大的区别类型是否有标签核心思想监督学习有学习输入和输出之间的关系无监督学习无发现数据内部结构强化学习无直接标签但有奖励反馈通过试错学习最优策略3. 监督学习Supervised Learning3.1 基本思想监督学习的特点是训练数据中包含正确答案标签。数据形式[(X,Y)]其中X输入数据Y对应标签例如图像分类输入 一张猫的图片 标签 猫模型学习[X \rightarrow Y]最终能够预测未知数据。4. 监督学习主要任务监督学习主要包括监督学习 ├── 分类 Classification │ └── 回归 Regression4.1 分类任务分类用于预测类别。例如邮件 ↓ 垃圾邮件 / 正常邮件输出类别标签常见算法SVMKNN决策树随机森林朴素贝叶斯4.2 回归任务回归用于预测连续数值。例如房屋面积 ↓ 预测房价输出600000元常见算法线性回归决策树回归随机森林回归5. 监督学习经典算法介绍5.1 线性回归Linear Regression线性回归用于预测连续值。基本形式[ywxb]其中w权重b偏置例如房屋面积 ↓ 线性模型 ↓ 预测价格模型目标让预测值与真实值尽可能接近。常用损失[MSE\frac{1}{N}\sum(y_i-\hat y_i)^2]5.2 逻辑回归Logistic Regression虽然名字叫“回归”但主要用于分类。核心思想通过 Sigmoid 函数输出概率[\sigma(z)\frac{1}{1e^{-z}}]例如邮件 ↓ 逻辑回归 ↓ 垃圾邮件概率 0.95表示该邮件属于垃圾邮件的概率约为95%。5.3 K近邻算法KNNKNN根据距离最近的几个样本判断类别。例如已知 ● ● ● ○ ○ ○ 新样本 ? 查看附近K个点 多数属于● 因此预测为●核心计算样本之间的距离[d(x,y)\sqrt{\sum_i(x_i-y_i)^2}]优点简单易理解缺点数据量大时计算慢高维数据效果下降5.4 决策树Decision Tree决策树类似人类决策过程。例如收入 9000? 是 | 年龄 30? 是 | 买车模型不断寻找哪个特征可以最好地区分数据。常用划分指标信息增益信息增益率基尼指数5.5 随机森林Random Forest随机森林多棵决策树共同进行预测。结构数据 ┌─────┼─────┐ 树1 树2 树3 ↓ ↓ ↓ 猫 猫 狗 ↓ 投票 ↓ 猫随机森林包含两个随机1随机采样数据通过 Bootstrap训练数据 ↓ 随机抽取 ↓ 生成不同训练集2随机选择特征每棵树只观察部分特征树1 年龄、收入 树2 学历、工作经验 树3 收入、房产优点降低过拟合泛化能力强5.6 支持向量机SVMSVMSupport Vector Machine中文支持向量机。核心思想找到一个最大间隔的分类边界。例如○ ○ ○ ------------ ● ● ●SVM希望分类边界距离两类样本尽可能远。这个距离称为[Margin]什么是支持向量支持向量距离分类边界最近并决定边界位置的样本。例如○ ○ ○ ★ ----------- ★ ● ● ●两个 ★ 就是支持向量。如果删除远处样本分类边界基本不变。但是删除支持向量边界会发生变化。因此称为Support Vector。6. SVM核函数Kernel Function6.1 为什么需要核函数普通SVM只能处理线性分类○ ○ ○ ------------ ● ● ●但是现实数据可能● ● ● ● ○ ● ● ● ●无法用直线分开。6.2 核技巧Kernel Trick思想将低维数据映射到高维空间。例如二维[(x_1,x_2)]映射[(x_1,x_2,x_12x_22)]在高维空间中可能变得线性可分。6.3 常见核函数Linear Kernel线性核[K(x,z)x^Tz]适合数据本身接近线性。Polynomial Kernel多项式核[K(x,z)(\gamma xTzr)d]可以产生更复杂边界。RBF Kernel径向基核[K(x,z)exp(-\gamma ||x-z||^2)]核心思想计算两个样本之间的相似度。距离越近[K(x,z)\approx1]距离越远[K(x,z)\approx0]RBF中的参数γγ控制一个样本影响范围大小。γ大影响范围小 边界复杂 容易过拟合γ小影响范围大 边界平滑 容易欠拟合7. 无监督学习Unsupervised Learning7.1 什么是无监督学习无监督学习不提供标签让模型自己发现数据规律。数据形式[X]没有[Y]例如10000张图片 ↓ 自动发现图片结构8. 无监督学习主要任务无监督学习 ├── 聚类 Clustering └── 降维 Dimensionality Reduction8.1 聚类Clustering目标将相似的数据自动分到同一组。例如● ● ● ▲ ▲ ▲ ■ ■ ■模型自动发现Cluster 1 Cluster 2 Cluster 3K-MeansK-Means将数据划分为K个簇。流程初始化中心 ↓ 计算距离 ↓ 重新分配类别 ↓ 更新中心 ↓ 重复目标最小化簇内距离[\sum ||x_i-\mu_k||^2]8.2 DBSCANDBSCAN基于密度进行聚类。特点不需要提前指定类别数量可以发现异常点例如●●●● × ●●●×可能被认为是异常点。9. 降维Dimensionality Reduction降维用更少的特征表示原始数据。例如1000维 ↓ 20维注意降维不等于无监督。判断是否无监督关键看是否使用标签。9.1 PCAPrincipal Component AnalysisPCA主成分分析。核心寻找数据变化最大的方向。例如二维● ● ●主要变化方向↗压缩到这个方向即可。10. 强化学习Reinforcement Learning强化学习也是机器学习的重要分支。核心智能体通过环境反馈不断试错学习最佳策略。主要元素Agent 智能体 Environment 环境 State 状态 Action 动作 Reward 奖励流程状态 ↓ Agent选择动作 ↓ 环境反馈 ↓ 奖励 ↓ 更新策略11. 强化学习与监督学习区别监督学习输入 ↓ 正确答案 ↓ 学习强化学习尝试动作 ↓ 获得奖励 ↓ 调整策略12. 强化学习经典算法Q-Learning学习[Q(s,a)]表示某个状态下采取某动作的价值。深度强化学习结合神经网络状态 ↓ 神经网络 ↓ 动作代表算法DQNPPOActor-Critic13. 三大机器学习范式总结类型是否有标签目标监督学习有预测结果无监督学习无发现数据结构强化学习奖励反馈学习策略14. 最终机器学习体系人工智能 AI ↓ 机器学习 ML ├──监督学习 │ │ ├──SVM │ ├──随机森林 │ ├──KNN │ └──神经网络 │ ├──无监督学习 │ │ ├──K-Means │ ├──DBSCAN │ └──PCA │ └──强化学习 │ ├──Q-Learning ├──DQN └──PPO总结机器学习的核心可以概括为监督学习有答案学习预测关系无监督学习没有答案寻找数据结构强化学习通过奖励反馈学习决策策略其中SVM通过最大间隔寻找分类边界随机森林通过多个决策树投票提高稳定性K-Means通过相似性自动聚类PCA通过寻找主要变化方向实现降维强化学习通过不断试错获得最优策略。理解这些基础算法是进一步学习深度学习、CNN、Transformer、YOLO、SAM等现代视觉模型的重要基础。
返回列表