Appearance
机器学习基础
什么是机器学习
机器学习(Machine Learning)是人工智能的核心分支,它让计算机能够从数据中自动学习规律,并利用学到的规律对新数据做出预测或决策,而无需显式地编写规则。
与传统编程的区别在于:传统编程是「输入数据 + 规则 → 输出结果」,而机器学习是「输入数据 + 结果 → 学习出规则(模型)」。
机器学习的分类
根据学习方式的不同,机器学习主要分为以下几类:
监督学习
监督学习使用带标签的数据进行训练,目标是学习从输入到输出的映射关系。典型任务包括:
- 分类:预测离散的类别标签,如垃圾邮件识别、图像分类。
- 回归:预测连续的数值,如房价预测、销量预测。
常见的监督学习算法有线性回归、逻辑回归、决策树、支持向量机(SVM)、随机森林、梯度提升等。
无监督学习
无监督学习使用不带标签的数据,目标是发现数据内在的结构和规律。典型任务包括:
- 聚类:将相似的数据分组,如用户分群、文档聚类。
- 降维:在保留主要信息的前提下减少特征维度,如主成分分析(PCA)。
常见的无监督学习算法有 K-Means、层次聚类、DBSCAN、PCA、t-SNE 等。
强化学习
强化学习通过与环境交互,根据奖励信号来学习最优策略。智能体在每一步采取行动,环境返回奖励,智能体据此调整策略以最大化累计奖励。典型应用包括游戏 AI、机器人控制、自动驾驶等。
机器学习的基本流程
一个完整的机器学习项目通常包含以下步骤:
- 问题定义:明确要解决的问题类型(分类、回归、聚类等)。
- 数据收集:获取足够数量和质量的数据。
- 数据预处理:清洗数据、处理缺失值和异常值、特征工程。
- 模型选择:根据问题类型选择合适的算法。
- 模型训练:使用训练集训练模型参数。
- 模型评估:使用验证集和测试集评估模型性能。
- 调优与部署:调整超参数、优化性能,并部署到生产环境。
常见的评估指标
评估机器学习模型性能的常用指标包括:
- 准确率(Accuracy):预测正确的样本占比。
- 精确率(Precision):预测为正的样本中真正为正的比例。
- 召回率(Recall):真正为正的样本中被正确预测的比例。
- F1 分数:精确率和召回率的调和平均。
- 均方误差(MSE):回归任务中预测值与真实值差异的平方平均。
过拟合与欠拟合
- 欠拟合:模型过于简单,无法捕捉数据中的规律,在训练集和测试集上表现都较差。
- 过拟合:模型过于复杂,过度拟合了训练数据中的噪声,在训练集上表现很好但泛化能力差。
解决过拟合的常见方法包括增加训练数据、正则化(L1/L2)、交叉验证、早停(Early Stopping)、集成学习等。