登录社区云,与社区用户共同成长
邀请您加入社区
在高维数据日益普遍的今天,降维技术已成为数据预处理、可视化和提升模型性能的关键步骤。主成分分析(PCA)和线性判别分析(LDA)作为两种经典且广泛应用的降维方法,分别从无监督和有监督的角度出发,有效提取数据的主要特征并降低计算复杂度。Python 的 scikit-learn(sklearn)库提供了简洁高效的接口,使得 PCA 与 LDA 的实现变得极为便捷。本文将通过实际数据集,详细演示如何在
本文详细介绍了机器学习中两种核心特征提取方法:主成分分析(PCA)和线性判别分析(LDA)。PCA作为无监督降维技术,通过最大化方差寻找数据主成分;LDA则是有监督方法,利用类别信息优化类间/类内方差比。文章对比了两者的特点、几何解释及应用场景,并提供了sklearn实现代码和参数调优建议。通过人脸识别和葡萄酒分类等案例,展示了特征提取在实际问题中的应用价值,最后以手写数字识别为例完整演示了特征提
决策树是一种基于树结构的分类模型,通过信息熵、信息增益、信息增益率和基尼系数等指标进行特征选择与数据划分。本文以天气数据为例,详细计算了信息熵(H(S)=0.940)、信息增益(天气特征增益最大为0.2467),并针对多值特征问题引入信息增益率(天气特征增益率0.156)。同时演示了基尼系数的计算(初始Gini=0.459),说明不同分裂准则的差异。通过Python代码实现了关键指标的计算,揭示了
获取数据、数据处理、特征工程后,就可以交给预估器进行机器学习,流程和常用API如下。1.实例化预估器(估计器)对象(estimator), 预估器对象很多,都是estimator的子类(1)用于分类的预估器sklearn.neighbors.KNeighborsClassifier k-近邻sklearn.naive_bayes.MultinomialNB 贝叶斯sklearn.linear_mo
支持向量机(support vector machine,SVM)是一种二分类模型,它的基本模型是定义在特征空间上的间隔最大的线性分类器,间隔最大使它有别于感知机;SVM还包括核技巧,这使它成为实质上的非线性分类器。SVM的学习策略就是间隔最大化,可形式化为一个求解凸二次规划的问题,也等价于正则化的合页损失函数的最小化问题。SVM的学习算法就是求解凸二次规划的最优化算法。
文章中,我们将一起探索如何利用Python的sklearn库来训练和使用一个简单的判别式AI模型。无论你是初学者还是希望深入了解sklearn的开发者,这篇文章都将为你提供有价值的信息和实用的示例。我们将从基础的模型训练开始,逐步学习如何使用训练好的模型进行预测。此外,我还会分享一些模型调优的技巧和如何收集反馈(classification_report)以改进模型质量的方法。希望通过这篇博客,您
load_boston 已经在 scikit-learn 1.2 版本中被移除,需要使用 fetch_openml 函数来加载波士顿房价数据集
本文综述了监督学习中多种分类算法的核心概念与应用示例,强调了从线性模型到非线性核方法、支持向量机(SVM)及神经网络模型的演变。线性模型如普通最小二乘法和岭回归,通过优化误差和正则化策略处理简单至中等复杂度的数据分类。岭回归通过引入惩罚项提高模型在多重共线性数据上的稳定性。线性和二次判别分析(LDA/QDA)提供了解决分类问题的经典框架,尤其适合具有特定统计属性的数据分布。核岭回归和SVM引入核