Python代码实现-主成分分析（PCA）降维及故障诊断中的T2和SPE统计量Matplotlib出图|Python技能树征题

2023年9月3日下午6:43 • Python • 阅读 59

PCA降维

PCA(Principal Component Analysis)，即主成分分析方法，是一种使用最广泛的数据降维算法。

; T2的计算

基本原理见这里。

故障判断

如系统正常运行，则样本的T2值应该满足T2 < Tα ，反之，可认为出现故障。

SPE（Q统计量）的计算

基本原理见这里。

; 故障判断

如系统正常运行，则样本的SPE值应该满足SPE < Qα ，反之，可认为出现故障。

Python程序如下

下面是封装成function的块

可直接调用

传入你需要训练的数据集即可

注意数据集最好为 .xls 后缀

def PCA_x(train_file_name, test_file_name, num_name):

    train_data = pd.read_excel(train_file_name, sheet_name=num_name)    # 导入训练数据
    test_data = pd.read_excel(test_file_name, sheet_name=num_name)     # 导入测试数据
    # *****************使用pandas方法读取样本数据功能模块（结束）*********************
    m = train_data.shape[1];  # 获取数据表格的列数
    n = train_data.shape[0];  # 获取数据表格的行数
    # ******************数据标准化处理（开始）*********************
    S_mean = np.mean(train_data, axis=0)  # 健康数据矩阵的列均值
    S_mean = np.array(S_mean)  # 健康数据的列均值，narry数据类型
    S_var = np.std(train_data, ddof=1);  # 健康数据矩阵的列方差,默认ddof=0表示对正态分布变量的方差的最大似然估计，ddof=1提供了对无限总体样本的方差的无偏估计（与Matlab一致）
    S_var[S_var == 0.0] = 0.0000000000000001  # 将集合S_var中的0替换为0.0000000000000001
    S_var = np.array(S_var)  # 健康数据的列方差，narry数据类型
    train_data -= S_mean  # 求取矩阵X的均值
    train_data /= S_var  # 求取矩阵X的方差
    train_data = np.where(train_data < 4.0e+11, train_data, 0.0)  # 把标准化后的矩阵X中的0替换为0.0000000000000001
    X_new = train_data;  # 求得标准化处理后的矩阵X_new
    # ******************求矩阵Y的协方差矩阵Z*********************
    X_new = np.transpose(X_new);  # 对矩阵进行转秩操作
    Z = np.dot(X_new, train_data / (n - 1))  # 求取协方差矩阵Z
    # ******************计算协方差矩阵Z的特征值和特征向量*********************
    a, b = np.linalg.eig(Z)  ##特征值赋值给a，对应特征向量赋值给b
    lambda1 = sorted(a, reverse=True)  # 特征值从大到小排序
    lambda_i = [round(i, 3) for i in lambda1]  # 保留三位小数
    print('lambda特征值由大到小排列：', lambda_i)
    # 计算方差百分比
    sum_given = 0  # 设置初值为0
    sum_given = sum(lambda_i)
    variance_hud = []  # 设置存放方差百分比的矩阵
    for i in tqdm(range(m)):
        if i  m:
            variance_hud.append(lambda_i[i] / sum_given)
        else:
            break
    variance_hud = [round(i, 3) for i in variance_hud]  # 保留三位小数
    print('方差百分比从大到小排序：', variance_hud)

    # 累计贡献率
    leiji_1 = []
    new_value = 0
    for i in tqdm(range(0, m)):
        if i  m:
            new_value = new_value + variance_hud[i]
            leiji_1.append(new_value)
        else:
            break

    print('累计贡献率：', leiji_1)

    # ******************主元个数选取 *********************
    totalvar = 0   # 累计贡献率，初值0
    for i in tqdm(range(m)):
        totalvar = totalvar + lambda1[i] / sum(a)  # 累计贡献率，初值0
        if totalvar >= 0.85:
            k = i + 1  # 确定主元个数
            break  # 跳出for循环
    PCnum = k  # 选取的主元个数
    PC = np.eye(m, k)  # 定义一个矩阵，用于存放选取主元的特征向量
    for j in tqdm(range(k)):
        wt = a.tolist().index(lambda1[j])  # 查找排序完成的第j个特征值在没排序特征值里的位置。
        PC[:, j:j + 1] = b[:, wt:wt + 1]  # 提取的特征值对应的特征向量
    print('成分矩阵：', PC)
    print('贡献率85%以上的主元个数为：', k)

    df_cfjz = pd.DataFrame(PC)

    # ******************根据建模数据求取 T2 阈值限 *********************
    # ******************置信度 = (1-a)% =（1-0.05）%=95% *************
    F = f.ppf(1 - 0.05, k, n - 1)  # F分布临界值
    T2 = k * (n - 1) * F / (n - k)  # T2求取
    # ****************** 健康数据的 SPE 阈值限求解  *********************
    ST1 = 0  # 对应SPE公式中的角1初值
    ST2 = 0  # 对应SPE公式中的角2初值
    ST3 = 0  # 对应SPE公式中的角3初值
    for i in range(k - 1, m):
        ST1 = ST1 + lambda1[i]  # 对应SPE公式中的角1
        ST2 = ST2 + lambda1[i] * lambda1[i]  # 对应SPE公式中的角2
        ST3 = ST3 + lambda1[i] * lambda1[i] * lambda1[i]  # 对应SPE公式中的角3
    h0 = 1 - 2 * ST1 * ST3 / (3 * pow(ST2, 2))
    Ca = 1.6449
    SPE = ST1 * pow(Ca * pow(2 * ST2 * pow(h0, 2), 0.5) / ST1 + 1 + ST2 * h0 * (h0 - 1) / pow(ST1, 2),
                    1 / h0)  # 健康数据SPE计算
    # ******************测试样本数据*********************
    m1 = test_data.shape[1];  # 获取数据表格的列数
    n1 = test_data.shape[0];  # 获取数据表格的行数
    test_data = np.array(test_data)  # 将DataFrame数据烈性转化为ndarray类型，使得数据矩阵与Matlab操作一样。
    I = np.eye(m)  # 产生m*m的单位矩阵
    PC1 = np.transpose(PC)  # PC的转秩
    SPEa = np.arange(n1).reshape(1, n1)  # 定义测试数据的SPE矩阵,为正数矩阵
    SPEa = np.double(SPEa)  # 将正数矩阵，转化为双精度数据矩阵
    TT2a = np.arange(n1).reshape(1, n1)  # 定义测试数据的T2矩阵,为正数矩阵
    TT2a = np.double(TT2a)  # 将正数矩阵，转化为双精度数据矩阵
    DL = np.diag(lambda1[0:k])  # 特征值组成的对角矩阵
    DLi = np.linalg.inv(DL)  # 特征值组成的对角矩阵的逆矩阵
    # ******************绘制结果 *********************
    # mpl.rcParams['font.sans-serif'] = ['SimHei']  # 在图形中显示汉字
    for i in range(n1):
        xnew = (test_data[i, :] - S_mean) / S_var;  # 对应 Matlab程序：xnew=(Data2(i,1:m)-S_mean)./S_var;
        # 以下是实现Matlb程序：  err(1,i)=xnew*(eye(14)-PC*PC')*xnew';
        xnew1 = np.transpose(xnew)  # xnew的转秩
        PC1 = np.transpose(PC)  # PC的转秩
        XPC = np.dot(xnew, PC)  # 矩阵xnew与PC相乘
        XPCPC1 = np.dot(XPC, PC1)  # 矩阵XPC与PC1相乘
        XXPCPC1 = xnew - XPCPC1  # 矩阵xnew减去XPCPC1
        SPEa[0, i] = np.dot(XXPCPC1, XXPCPC1)  # 矩阵XXPCPC1与XXPCPC1相乘
        XPi = np.dot(XPC, DLi)  # 矩阵XPC与DLi相乘
        XPiP = np.dot(XPi, PC1)  # 矩阵XPi与PC1相乘
        TT2a[0, i] = np.dot(XPiP, xnew1)  # 矩阵XPiP与xnew1相乘
    Sampling = r_[0.:n1]  # 产生的序列值式0到n1
    SPE1 = SPE * ones((1, n1))  # 产生SPE数值相同的矩阵
    print('spe统计量的值：', SPEa)
    # df_spe = pd.DataFrame(SPEa.T)
    new_SPE = SPEa.T
    # df_spe.to_csv('SPE值.csv')     # 将SPE值保存成.csv
    T21 = T2 * ones((1, n1))  # 产生T2数值相同的矩阵
    print('t2统计量的值：', TT2a)
    # df_T2 = pd.DataFrame(TT2a.T)
    new_TT = TT2a.T
    # df_T2.to_csv('T2值.csv')       # 将T2值保存成.csv
    return new_SPE, new_TT, Sampling, TT2a, T21, SPEa, SPE1, n1, T2, SPE, m, variance_hud, leiji_1, df_cfjz

上面程序会把T2和SPE的值保存在后台，且每次有超过阈值会打标签，以 label 保存结果在后台。

返回值有好几个，可用作其他用处，各取所需。

下面给出T2和SPE制图Python程序：

可视化T2和SPE
def graph_TT_SPE(Sampling, TT2a, T21, SPEa, SPE1, n1, T2, SPE, layer):

    figure(1)  # 画的第一张图
    plot(Sampling, TT2a[0, :], '*-', Sampling, T21[0, :], 'r-')  # 绘制出测试数据SPEa的数据集合，和健康数据训练得到的SPE阈值限
    xlabel('sample points')  # 给X轴加标注
    ylabel('T^2')  # 给Y轴加标注
    legend(['T^2 value', 'T^2 limit'])  # 为绘制出的图形线条添加标签注明
    title("T^2 statistic" + layer)  # 绘制的图形主题为"SPE统计量"

    figure(2)
    plot(Sampling, SPEa[0, :], '*-', Sampling, SPE1[0, :], 'r-')  # 绘制出测试数据TT2a的数据集合，和健康数据训练得到的T2阈值限
    xlabel('sample points')  # 给X轴加标注
    ylabel('SPE')  # 给Y轴加标注
    legend(['SPE value', 'SPE limit'])  # 为绘制出的图形线条添加标签注明
    title("SPE statistic" + layer)  # 绘制的图形主题为"SPE统计量"
    show()  # 显示绘制的图形

    # 循环对象TT2a,SPEa,循环基线T2,SPE
    sum1 = 0
    for ij in range(n1):  # 对测试样本个数进行循环
        if ((TT2a[0, ij]  T2) & (SPEa[0, ij]  SPE)):  # 判断各个值是否小于阈值线
            TT2a[0, ij] = 0  # 将小于阈值线的样本点位置上的数置为0
            SPEa[0, ij] = 0  # 将小于阈值线的样本点位置上的数置为0
        else:
            TT2a[0, ij] = 1  # 将小于阈值线的样本点位置上的数置为1
            SPEa[0, ij] = 1  # 将小于阈值线的样本点位置上的数置为1
            sum1 += 1
            # print(i)#输出有故障的样本点
    print(sum1)

    d1 = pd.DataFrame(TT2a.T)
    d1['label'] = d1[0]
    d1.drop(0, axis=1, inplace=True)
    d1.to_csv('label.csv', index=False)
    print(d1.sum())
    print(SPEa)

上面 layer 是我为了主程序循环，每次出图能够传入不同层的数据，可自行修改。

运行效果如下：

T2结果

SPE结果

在第二部分制图， 样式、颜色、图例、坐标等均可自行 Matplot进行修改。

完整程序（ 功能很多、 分量很大）：

主成分分析PCA降为及故障诊断T2和SPE统计量出图Python.py

另外还有个 MATLAB的 PCA程序：

超全PCA_ICA_SFA算法程序集合

比心♥️～

“

这个世界

有人不了解海

不知爱海

也有人了解海

不敢爱海

“

Reference:

（1）：主成分分析（PCA）原理详解

https://blog.csdn.net/program_developer/article/details/80632779

（2）：主成分分析（PCA）原理与故障诊断（SPE、T^2以及结合二者的综合指标）-MATLAB实现

https://blog.csdn.net/u013829973/article/details/77981701

（3）：基于PCA的线性监督分类的故障诊断方法-T2与SPE统计量的计算

https://blog.csdn.net/And_ZJ/article/details/90576240

（4）：3多变量统计故障诊断方法

https://wenku.baidu.com/view/b9ef2df9dd3383c4bb4cd2e0.html

（5）：PCA故障诊断步骤

https://wenku.baidu.com/view/f8b6c51c08a1284ac9504339.html

Original: https://blog.csdn.net/weixin_44333889/article/details/118410189
Author: 府学路18号车神
Title: Python代码实现-主成分分析（PCA）降维及故障诊断中的T2和SPE统计量Matplotlib出图|Python技能树征题

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/767138/

转载文章受原作者版权保护。转载请注明原作者出处！

python

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

立体匹配（视差估计）评价指标（MiddleBurry、KITTI 2012、KITTI 2015、Scene Flow、ETH3D)

MiddleBurry 数据集：评估区域： dics(Depth Discontinuity Region)：视差不连续区域 all(All Region)：全部区域 non-o…

Python 2023年9月27日
0071
mongodb 持久化 mysql_scrapy数据持久化存储(MySQL、MongoDB)

1、在setting.py中定义相关变量定义mysql相关变量 MYSQL_HOST = ‘127.0.0.1’ MYSQL_USER = ‘…

Python 2023年10月7日
0044
Matplotlib数据可视化入门

目录前言 1.基础知识 * 1.1 图形绘制 1.2 标题、标签、坐标轴刻度 – 1.2.1 标题的设置 1.2.2 标签的设置 1.2.3 坐标轴刻度的设置 1.3…

Python 2023年9月3日
0043
python-matplotlib 绘制函数曲线

写数值分析实验的途中，搜到了很多好文章，做一下笔记，方便日后使用笔记一、先画条线 * 1.plt.plot() 函数 – 1.1plt.plot(x, y, &#8…

Python 2023年8月30日
0085
YOLOX改进之添加ASFF

文章内容：如何在YOLOX官网代码中添加 ASFF模块环境：pytorch1.8 修改内容：（1）在 PAFPN尾部添加ASFF模块（ YOLOX-s等版本）（2）在 FPN…

Python 2023年10月27日
0033
python pip3 安装psycopg2报错

[root@edb ~]$ pip3 install psycopg2Defaulting to user installation because normal site-pac…

Python 2023年8月2日
0072
手部21个关键点检测+手势识别-[MediaPipe]

MediaPipe 是一款由 Google Research 开发并开源的多媒体机器学习模型应用框架，可以直接调用其API完成目标检测、人脸检测以及关键点检测等。本篇文章介绍其手部…

Python 2023年8月2日
0098
Qt Quick入门 — 安装Qt6

吐槽QWidget 前段时间，在研究pyside6,用的是传统的QtWidget，学了一些常用件，布局和QSS，打算写个仿QQ登录界面的窗口，在布局时遇到了困难：因为头像控件位于…

Python 2023年5月24日
0063
Python爬虫实战+数据分析+数据可视化（前程无忧招聘信息）

一、爬虫部分爬虫说明：1、本爬虫是以面向对象的方式进行代码架构的2、本爬虫是通过将前程无忧网页转换成移动端来进行求职信息爬取的3、本爬虫爬取的数据存入到MongoDB数据库中4、…

Python 2023年8月14日
0059
latex论文作图（python+matplotlib）

20210425 – 引言论文中进行作图，需要对图片中的各种元素进行控制，最近在论文写作过程中为了能够得到匹配文章的高质量图片，也是花了很多心血。除了对图片中的风格进…

Python 2023年9月3日
0065
python中cpca库用法详解（从文本中提取省市区）

一个用于提取简体中文字符串中省，市和区并能够进行映射，检验和简单绘图的python模块。首先安装cpca库： pip install cpca Github： GitHub &#…

Python 2023年8月7日
00113
实训——基于大数据Hadoop平台的医疗平台项目实战

啊哦~你想找的内容离你而去了哦内容不存在，可能为如下原因导致： ① 内容还在审核中 ② 内容以前存在，但是由于不符合新的规定而被删除 ③ 内容地址错误 ④ 作者删除了内容。可…

Python 2023年8月2日
0063
NumPy的版本出错问题

NumPy的版本出错问题在对数据进行预处理时候，jupyter显示numpy的版本出错问题 ; 报错：版本过低，需要版本是1.17.3以上解决：查看numpy版本 pip …

Python 2023年8月23日
0040
【宝藏级】全网最全的Pandas详细教程（2万字总结）

抵扣说明： 1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。 Original: https://blo…

Python 2023年8月2日
0039
Python读取csv文件

#导入pandas包并设置别名为pd import pandas as pd #读取csv格式文件并把格式设置为DataFrame格式 df=pd.read_csv("1…

Python 2023年8月17日
0045
QQ发生大规模账号泄露事件，二十行Python代码，带你了解前因后果

六月，秋秋发生大规模盗号事件，众说纷纭，也有说因为某习通买卖个人信息导致的，有说是因为点了图片中的网站导致中毒被盗的，还有说企鹅数据库被攻击导致账号被盗的，反正公说公有理婆说婆有理…

Python 2023年11月2日
0045

2024 年 4 月
一	二	三	四	五	六	日
1	2	3	4	5	6	7
8	9	10	11	12	13	14
15	16	17	18	19	20	21
22	23	24	25	26	27	28
29	30