登录社区云,与社区用户共同成长
邀请您加入社区
💥💥💞💞❤️❤️💥💥博客内容尽量做到思维缜密,逻辑清晰,为了方便读者。⛳️行百里者,半于九十。📋📋📋🎁🎁🎁。
摘要:本文介绍了朴素贝叶斯算法和聚类算法的原理与应用。朴素贝叶斯是一种基于概率的分类算法,假设特征相互独立,适用于文本分类等场景。聚类算法则是一种无监督学习方法,通过样本相似性进行分组,包括K-means、层次聚类等。K-means算法流程包括初始化聚类中心、计算距离、重新计算中心点等步骤,评估指标有SSE、轮廓系数等。文章还提供了商品评论情感分析和客户聚类两个实际案例,展示了算法在文本处理和商业
本文探讨了K-Means聚类算法中不同距离度量的应用与影响。文章首先介绍了欧氏距离作为默认度量的特点,指出其对连续数值型数据的适用性及其对量纲和异常值的敏感性。随后详细解析了曼哈顿距离(L1范数)的特性,说明其在高维数据、异常值场景中的优势。此外还简要提及了闵可夫斯基距离、余弦相似度和汉明距离等其他度量方式。通过Python代码示例,作者展示了如何计算和对比欧氏距离与曼哈顿距离在实际数据点上的差异
K-means是一种基于距离的划分聚类方法,通过迭代将数据划分为K个簇。核心思想是使簇内样本的平方误差最小化。算法流程包括初始化聚类中心、分配样本到最近中心、重新计算中心位置,直到收敛。
基于Kmeans算法对鸢尾花数据集前两个特征进行聚类,并比对不同类别数的分析结果
K-means 聚类算法以其简单、高效的特点,在数据分析领域有着重要的地位。通过本文的学习,我们了解了 K-means 的基本原理、优势与局限性,并结合啤酒数据进行了实战演练,同时也深入解析了 sklearn 中 KMeans 的 API。合理选择 K 值,可以结合多种评估指标进行综合判断。对数据进行预处理,如标准化或归一化,消除量纲对距离计算的影响。
在肘部法则中,我们关注的是随着簇数增加,Inertia(簇内平方和)的变化情况。通常情况下,Inertia值越低表示数据点更接近其簇中心,但并非绝对。在肘部法则中,我们寻找的是Inertia急剧下降并趋于平缓的点,这个点可能是最佳的聚类数量。因此,对于肘部法则,我们要找到Inertia值下降幅度显著变小,即形成一个“肘部”样的点,这时候增加簇数不再显著地降低Inertia。