机器学习-降低维度算法

内容导读

互联网集市收集整理的这篇技术教程文章主要介绍了机器学习-降低维度算法，小编现在分享给大家，供广大互联网技能从业者学习和参考。文章包含3612字，纯文字阅读大概需要6分钟。

内容图文

像聚类算法一样，降低维度算法试图分析数据的内在结构，不过降低维度算法是以非监督学习的方式试图利用较少的信息来归纳或者解释数据。这类算法可以用于高维数据的可视化或者用来简化数据以便监督式学习使用。

常见的算法包括：主成份分析，偏最小二乘回归， Sammon映射，多维尺度, 投影追踪等。

from __future__ import print_function
from sklearn import datasets
import matplotlib.pyplot as plt
import matplotlib.cm as cmx
import matplotlib.colors as colors
import numpy as np




def shuffle_data(X, y, seed=None):
    if seed:
        np.random.seed(seed)

    idx = np.arange(X.shape[0])
    np.random.shuffle(idx)

    return X[idx], y[idx]



# 正规化数据集 X
def normalize(X, axis=-1, p=2):
    lp_norm = np.atleast_1d(np.linalg.norm(X, p, axis))
    lp_norm[lp_norm == 0] = 1
    return X / np.expand_dims(lp_norm, axis)


# 标准化数据集 X
def standardize(X):
    X_std = np.zeros(X.shape)
    mean = X.mean(axis=0)
    std = X.std(axis=0)

    # 做除法运算时请永远记住分母不能等于0的情形
    # X_std = (X - X.mean(axis=0)) / X.std(axis=0)
    for col in range(np.shape(X)[1]):
        if std[col]:
            X_std[:, col] = (X_std[:, col] - mean[col]) / std[col]

    return X_std


# 划分数据集为训练集和测试集
def train_test_split(X, y, test_size=0.2, shuffle=True, seed=None):
    if shuffle:
        X, y = shuffle_data(X, y, seed)

    n_train_samples = int(X.shape[0] * (1-test_size))
    x_train, x_test = X[:n_train_samples], X[n_train_samples:]
    y_train, y_test = y[:n_train_samples], y[n_train_samples:]

    return x_train, x_test, y_train, y_test



# 计算矩阵X的协方差矩阵
def calculate_covariance_matrix(X, Y=np.empty((0,0))):
    if not Y.any():
        Y = X
    n_samples = np.shape(X)[0]
    covariance_matrix = (1 / (n_samples-1)) * (X - X.mean(axis=0)).T.dot(Y - Y.mean(axis=0))

    return np.array(covariance_matrix, dtype=float)


# 计算数据集X每列的方差
def calculate_variance(X):
    n_samples = np.shape(X)[0]
    variance = (1 / n_samples) * np.diag((X - X.mean(axis=0)).T.dot(X - X.mean(axis=0)))
    return variance


# 计算数据集X每列的标准差
def calculate_std_dev(X):
    std_dev = np.sqrt(calculate_variance(X))
    return std_dev


# 计算相关系数矩阵
def calculate_correlation_matrix(X, Y=np.empty([0])):
    # 先计算协方差矩阵
    covariance_matrix = calculate_covariance_matrix(X, Y)
    # 计算X, Y的标准差
    std_dev_X = np.expand_dims(calculate_std_dev(X), 1)
    std_dev_y = np.expand_dims(calculate_std_dev(Y), 1)
    correlation_matrix = np.divide(covariance_matrix, std_dev_X.dot(std_dev_y.T))

    return np.array(correlation_matrix, dtype=float)



class PCA():
    """
    主成份分析算法PCA，非监督学习算法.
    """
    def __init__(self):
        self.eigen_values = None
        self.eigen_vectors = None
        self.k = 2

    def transform(self, X):
        """
        将原始数据集X通过PCA进行降维
        """
        covariance = calculate_covariance_matrix(X)

        # 求解特征值和特征向量
        self.eigen_values, self.eigen_vectors = np.linalg.eig(covariance)

        # 将特征值从大到小进行排序，注意特征向量是按列排的，即self.eigen_vectors第k列是self.eigen_values中第k个特征值对应的特征向量
        idx = self.eigen_values.argsort()[::-1]
        eigenvalues = self.eigen_values[idx][:self.k]
        eigenvectors = self.eigen_vectors[:, idx][:, :self.k]

        # 将原始数据集X映射到低维空间
        X_transformed = X.dot(eigenvectors)

        return X_transformed


def main():
    # Load the dataset
    data = datasets.load_iris()
    X = data.data
    y = data.target

    # 将数据集X映射到低维空间
    X_trans = PCA().transform(X)

    x1 = X_trans[:, 0]
    x2 = X_trans[:, 1]

    cmap = plt.get_cmap('viridis')
    colors = [cmap(i) for i in np.linspace(0, 1, len(np.unique(y)))]

    class_distr = []
    # Plot the different class distributions
    for i, l in enumerate(np.unique(y)):
        _x1 = x1[y == l]
        _x2 = x2[y == l]
        _y = y[y == l]
        class_distr.append(plt.scatter(_x1, _x2, color=colors[i]))

    # Add a legend
    plt.legend(class_distr, y, loc=1)

    # Axis labels
    plt.xlabel('Principal Component 1')
    plt.ylabel('Principal Component 2')
    plt.show()


if __name__ == "__main__":
    main()

内容总结

以上是互联网集市为您收集整理的机器学习-降低维度算法全部内容，希望文章能够帮你解决机器学习-降低维度算法所遇到的程序开发问题。如果觉得互联网集市技术教程内容还不错，欢迎将互联网集市网站推荐给程序员好友。

内容备注

版权声明：本文内容由互联网用户自发贡献，该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容，请发送邮件至 gblab@vip.qq.com 举报，一经查实，本站将立刻删除。

内容手机端

扫描二维码推送至手机访问。

本文链接：https://qyyshop.com/info/609708.html

来源：【匿名】

【上一篇】最短路算法Dijkstra 【下一篇】浅谈php实现映射的两种方法（链表和二叉树）

更多 ►

【机器学习-降低维度算法】教程文章相关的互联网学习教程文章

词向量:将词语"嵌入"到一个N维空间，使得词语相近的词语放到相近的位置。机器翻译类不类似于矩阵的变换？谷歌出品的一个工具Word2Vec，用于入门。句向量？段向量？文档向量?很多事情向量化，可以解决很多问题。传统的one-hot 编码的原来是，有多少个字就有多少个维度.科[1,0,0,0,0,0,0,0]学[0,1,0,0,0,0,0,0]one hot -- >词向量表(全连接的大矩阵)-->输出(该词的矩阵)Embedding层就是one hot 层。时间序列:每次作预测都是一个序列...

机器学习之聚类算法【图】

（一）K-means提到k-means不得不说的许高建老师，他似乎比较偏爱使用这种聚类方法，在N个不同场合听到他提起过，k-means通过设置重心和移动中心两个简答的步骤，就实现了数据的聚类。下面就来介绍下k-means算法。一、数值属性距离度量度量数值属性相似度最简单的方法就是计算不同数值间的“距离”，如果两个数值之间“距离”比较大，就可以认为他们的差异比较大，而相似度较低；换而言之，如果两数值之间“距离”较小，可认为他...

# 机器学习算法总结-第四天(SKlearn/数据处理and特征工程)【图】

总结：量纲化（归一化，标准化）缺失值处理（补0、均值、中值、众数、自定义）编码/哑变量：忽略数字中自带数学性质（文字->数值类型）连续特征离散化（二值化/分箱处理）原文：https://www.cnblogs.com/afanti/p/10881435.html

【机器学习实战之三】：C++实现K-均值（K-Means）聚类算法【图】

聚类是一种无监督的学习，它将相似的对象归到同一个簇中。它有点像全自动分类（类别体系是自动构建的）。聚类方法几乎可以应用于所有对象，簇内的对象越相似，聚类的效果越好。本文要介绍一种称为K-均值（K-means）聚类的算法。之所以称之为K-均值是因为它可以发现k个不同的簇，且每个簇的中心采用簇中所含值的均值计算而成。在介绍K-均值之前，先讨论一席簇识别（cluster identification）。簇识别给出聚类结果的含义。假定有一些...

机器学习经典算法详解及Python实现--CART分类决策树、回归树和模型树【图】

摘要：Classification And Regression Tree(CART)是一种很重要的机器学习算法，既可以用于创建分类树（Classification Tree），也可以用于创建回归树（Regression Tree），本文介绍了CART用于离散标签分类决策和连续特征回归时的原理。决策树创建过程分析了信息混乱度度量Gini指数、连续和离散特征的特殊处理、连续和离散特征共存时函数的特殊处理和后剪枝；用于回归时则介绍了回归树和模型树的原理、适用场景和创建过程。个人认为...

机器学习算法学习---模型融合和提升的算法（六）

XGBoost原理：https://www.jianshu.com/p/7467e616f227 python实现：https://www.cnblogs.com/harekizgel/p/7683803.html 算法优势和调参：http://www.cnblogs.com/mfryf/p/6293814.html 原文：https://www.cnblogs.com/zhenpengwang/p/10898637.html

机器学习——03K均值算法【代码】【图】

1）. 扑克牌手动演练k均值聚类过程：>30张牌，3类图1 统计表格图2 第一轮实际情况图3 第二轮实际情况2）. *自主编写K-means算法，以鸢尾花花瓣长度数据做聚类，并用散点图显示。（加分题）ps：之前人工智能老师教过这个算法，所以代码基本一样。源代码： # 导入数据集 from sklearn.datasets import ...

漫谈机器学习经典算法—人工神经网络

更新：文章迁移到了这里。http://lanbing510.info/2014/11/07/Neural-Network.html，有对应的PPT链接。注：整理自向世明老师的PPT 看不到图片的同学能够直接打开链接：https://app.yinxiang.com/shard/s31/sh/61392246-7de4-40da-b2fb-ccfd4f087242/259205da4220fae3内容提要1 发展历史 2 前馈网络（单层感知器，多层感知器。径向基函数网络RBF） 3 反馈网络（Hopfield网络。联想存储网络，SOM。Boltzman及受限的玻尔兹曼机RBM，D...

机器学习 - 相关标签

机器学习分类机器学习和深度学习机器学习模型机器学习实战机器学习算法

算法 - 最热教程

浅谈SQLServer查询优化器中的JOIN算法有没那种可逆算法是密文比明文短的呢？...javascript-类似Excel里面的NORMDIST函...C++中的分治算法及常见题目汇总压缩感知重构算法综述-学习笔记 c++中内置函数qsort（快速排序）和bsea...一、fpga图像处理算法整合基于遗传算法（deap）的非线性函数寻优...集成学习-Bagging集成学习算法随机森林...机器学习笔记（九）聚类算法及实践（K-...

首页 / 算法 / 机器学习-降低维度算法

机器学习-降低维度算法

内容导读

内容图文

内容总结

内容备注

内容手机端

【机器学习-降低维度算法】教程文章相关的互联网学习教程文章

机器学习---算法学习3

机器学习之聚类算法【图】

# 机器学习算法总结-第四天(SKlearn/数据处理and特征工程)【图】

【机器学习实战之三】：C++实现K-均值（K-Means）聚类算法【图】

机器学习经典算法详解及Python实现--CART分类决策树、回归树和模型树【图】

机器学习算法学习---模型融合和提升的算法（六）

机器学习——03K均值算法【代码】【图】

漫谈机器学习经典算法—人工神经网络

机器学习实战（2）—— k-近邻算法【代码】【图】

机器学习/数据挖掘/算法岗位面试题汇总

机器学习中的算法(1)-决策树模型组合之随机森林与GBDT【图】

机器学习-EM算法-pLSA模型笔记【图】

机器学习十大算法之C4.5【图】

数学建模及机器学习算法（一）：聚类-kmeans（Python及MATLAB实现，包括k值选取与聚类效果评估）【代码】【图】

机器学习算法综述

机器学习 - 相关标签

算法 - 相关标签

算法 - 最新教程

算法 - 最热教程