机器学习最核心的问题是:机器如何从数据中学到规律?按照数据形态和反馈信号的不同,学习范式主要分为监督学习、无监督学习和强化学习三种。它们的本质区别在于有没有标签、以及反馈以什么形式给出

监督学习

监督学习像一个带着标准答案刷题的学生:每条训练数据都带有”正确答案”(标签),模型不断比较自己的预测与标签之间的差距,纠正偏差,最终学会从输入到输出的映射。

  • 分类:预测离散值,如垃圾邮件识别、图像分类、疾病诊断
  • 回归:预测连续值,如房价预测、销量预估、气温预报

常见算法有线性回归、逻辑回归、决策树、支持向量机、神经网络等。监督学习的前提是有标注数据,而标注成本往往是项目里最大的一笔开销,这也是为什么很多场景退而求其次选择半监督或弱监督方案。

无监督学习

无监督学习像没有答案的自学:数据只有输入没有标签,模型需要自己发现数据中的结构和模式。

  • 聚类:把相似的样本归到一起,如用户分群、文档主题划分(K-Means、DBSCAN)
  • 降维:把高维数据压缩到低维且尽量保留信息,如 PCA,常用于可视化和特征压缩
  • 异常检测:找出不符合多数模式的样本,如刷卡欺诈、设备故障预警

无监督学习不依赖标注,能直接用在海量原始数据上,但结果的好坏往往缺乏统一的评价标准,更多是为下游任务做数据准备。

强化学习

强化学习和前两者都不同:没有现成的数据集,智能体(Agent)在与环境的交互中采取行动、获得奖励或惩罚,目标是让长期累计奖励最大化。可以类比训练一只狗:做对了给食物,做错了不给,狗慢慢学会”在什么情况下该做什么动作”。

  • 三要素:状态(环境是什么样)、动作(能做什么)、奖励(做得好不好)
  • 难点:奖励可能延迟到来(下棋到最后才知道输赢),需要解决”功劳归谁”的信用分配问题
  • 典型应用:游戏 AI(AlphaGo)、机器人控制、推荐策略优化,以及大模型对齐用的 RLHF

如何选择

  • 有带标签的数据、想预测结果 → 监督学习
  • 只有数据没有标签、想发现结构 → 无监督学习
  • 是序贯决策问题、能在环境中试错 → 强化学习

三者并不对立,实际项目经常组合使用。以 ChatGPT 为例:预训练和指令微调阶段本质是监督学习,而 RLHF 阶段则是强化学习,两种范式接力才训出了最终的产品形态。