Skip to content

机器学习基础

什么是机器学习

机器学习(Machine Learning)是人工智能的核心分支,它让计算机能够从数据中自动学习规律,并利用学到的规律对新数据做出预测或决策,而无需显式地编写规则。

与传统编程的区别在于:传统编程是「输入数据 + 规则 → 输出结果」,而机器学习是「输入数据 + 结果 → 学习出规则(模型)」。

机器学习的分类

根据学习方式的不同,机器学习主要分为以下几类:

监督学习

监督学习使用带标签的数据进行训练,目标是学习从输入到输出的映射关系。典型任务包括:

  • 分类:预测离散的类别标签,如垃圾邮件识别、图像分类。
  • 回归:预测连续的数值,如房价预测、销量预测。

常见的监督学习算法有线性回归、逻辑回归、决策树、支持向量机(SVM)、随机森林、梯度提升等。

无监督学习

无监督学习使用不带标签的数据,目标是发现数据内在的结构和规律。典型任务包括:

  • 聚类:将相似的数据分组,如用户分群、文档聚类。
  • 降维:在保留主要信息的前提下减少特征维度,如主成分分析(PCA)。

常见的无监督学习算法有 K-Means、层次聚类、DBSCAN、PCA、t-SNE 等。

强化学习

强化学习通过与环境交互,根据奖励信号来学习最优策略。智能体在每一步采取行动,环境返回奖励,智能体据此调整策略以最大化累计奖励。典型应用包括游戏 AI、机器人控制、自动驾驶等。

机器学习的基本流程

一个完整的机器学习项目通常包含以下步骤:

  1. 问题定义:明确要解决的问题类型(分类、回归、聚类等)。
  2. 数据收集:获取足够数量和质量的数据。
  3. 数据预处理:清洗数据、处理缺失值和异常值、特征工程。
  4. 模型选择:根据问题类型选择合适的算法。
  5. 模型训练:使用训练集训练模型参数。
  6. 模型评估:使用验证集和测试集评估模型性能。
  7. 调优与部署:调整超参数、优化性能,并部署到生产环境。

常见的评估指标

评估机器学习模型性能的常用指标包括:

  • 准确率(Accuracy):预测正确的样本占比。
  • 精确率(Precision):预测为正的样本中真正为正的比例。
  • 召回率(Recall):真正为正的样本中被正确预测的比例。
  • F1 分数:精确率和召回率的调和平均。
  • 均方误差(MSE):回归任务中预测值与真实值差异的平方平均。

过拟合与欠拟合

  • 欠拟合:模型过于简单,无法捕捉数据中的规律,在训练集和测试集上表现都较差。
  • 过拟合:模型过于复杂,过度拟合了训练数据中的噪声,在训练集上表现很好但泛化能力差。

解决过拟合的常见方法包括增加训练数据、正则化(L1/L2)、交叉验证、早停(Early Stopping)、集成学习等。

分享人工智能、机器学习与大模型的学习笔记