博客 > 人工智能&数据科学 > 通用算法和模型
# 机器学习初步认识 ## 机器学习的分类 - 数理学派 - 符号主义 - 贝叶斯 - 联结主义 - 仿生学派 - 进化主义 - 行为类推主义 ## 机器学习的发展过程 - 以前的发展过程省略 - 蚁群算法、遗传算法、决策树 - 支持向量机、随机森林 - 神经网络、深度学习 ## 机器学习的过程 需求-模型-预处理/执行/调优-评估-部署 (类比软件开发:需求-模型-实现-测试-部署) ## 机器学习算法的分类 ### 有监督(Supervised):人工标识数据 - 回归分析(Regression) - 决策树(Decision Trees) - 随机森林(Random Forests) ### 无监督(Unsupervised) - 聚类(Clustering) - 关联分析(Association Analysis):啤酒换尿布 ### 分类算法(有监督) 目的:把给定的单个样本预测为某一种类事物 - 训练集-分类算法-分类模型 - 测试集-分类模型-分类结果 - 支持向量机(SVM):低维投影到高维,变得可分 - 决策树:特征在树上路径上形成组合 - 贝叶斯网络:基于概率的推理 - 神经网络:可解释性低 ![96b60ab61aa9c5ed906f73c140ae9f73.png](/resources/7cc57f2ef4094189a17ff598a3049bf5) ### 聚类算法(无监督) 目的:把给定的样本集分成不同的簇(聚类) - K-均值(K-means):簇间距离大,簇内距离小 - 基于层次的算法 - 基于密度的算法 - 基于约束的算法 - 神经网络 ### 回归分析(有监督) 目的:将离散的样本点拟合为一个函数 ### 关联分析(无监督) 目的:建立样本集内看似无关但常常同时发生的某些事间的联系 常见应用:购物车分析,是推荐算法的一种;可以洞察各种套路 关联不一定是因果,可能都是果,也可能因果相反 ### 推荐(数据挖掘) 目的:推荐 - 协同过滤 ### 社会网络分析-文本分析(数据挖掘) 目的:微博用户情感分析、交通事故分析 ### 神经网络 ### 深度学习 - 逐层训练的神经网络 ## 数据质量问题与预处理 - 数据质量:完备、真实、一致、可靠 - 预处理:占用整个机器学习60%的工作量 - 数据质量常见问题: - 数据量过少:欠拟合、假规律,数据量应为自变量数量10~20倍 - 数据量过多(重复):数据抽样 - 维度过多 - 数据不完整:抽样时应该多次抽样 - 数据不可靠:异常数据,聚类方法去噪 - 数据不一致 - 欠拟合:underfit - 过拟合:overfit