分位数回归（quantile regression）简介和代码实现

2023年6月19日上午9:43 • 人工智能 • 阅读 86

普通最小二乘法如何处理异常值？它对待一切事物都是一样的——它将它们平方！但是对于异常值，平方会显著增加它们对平均值等统计数据的巨大影响。

我们从描述性统计中知道，中位数对异常值的鲁棒性比均值强。这种理论也可以在预测统计中为我们服务，这正是分位数回归的意义所在——估计中位数（或其他分位数）而不是平均值。通过选择任何特定的分位数阈值，我们既可以缓和异常值，也可以调整错误的正/负权衡。我们还可以处理需要分位数界限的情况，例如：婴儿的安全出生体重，顶级竞技电子竞技玩家的技能水平，等等。

; 什么是分位数？

分位数（Quantile），亦称分位点，是指将一个随机变量的概率分布范围分为几个等份的数值点，常用的有中位数（即二分位数）、四分位由3个部分组成(第25、50和75个百分位，常用于箱形图)和百分位数等。

什么是分位数回归？

分位数回归是简单的回归，就像普通的最小二乘法一样，但不是最小化平方误差的总和，而是最小化从所选分位数切点产生的绝对误差之和。如果 q=0.50（中位数），那么分位数回归会出现一个特殊情况 – 最小绝对误差（因为中位数是中心分位数）。我们可以通过调整超参数 q，选择一个适合平衡特定于需要解决问题的误报和漏报的阈值。

statsmodels中的分位数回归

分位数回归是一种不太常见的模型，但 Python中的StatsModel库提供了他的实现。这个库显然受到了R的启发，并从它借鉴了各种语法和API。

StatsModel使用的范例与scikit-learn稍有不同。但是与scikit-learn一样，对于模型对象来说，需要公开一个.fit()方法来实际训练和预测。但是不同的是scikit-learn模型通常将数据(作为X矩阵和y数组)作为.fit()的参数，而StatsModel是在初始化对象时传入数据，而fit方法只传递一些可以调试的超参数。

下面是来自statsmodel的例子(Engel数据集包含在与statmodels中)

%matplotlib inline
import numpy as np
import pandas as pd
import statsmodels.api as sm
import statsmodels.formula.api as smf
import matplotlib.pyplot as plt

data = sm.datasets.engel.load_pandas().data
mod = smf.quantreg("foodexp ~ income", data)
res = mod.fit(q=0.5)
print(res.summary())

我们可以看看quantile regression model fit的帮助文档：

help(quant_mod.fit)

分位数回归与线性回归

标准最小二乘回归模型仅对响应的条件均值进行建模，并且计算成本较低。相比之下，分位数回归最常用于对响应的特定条件分位数进行建模。与最小二乘回归不同，分位数回归不假设响应具有特定的参数分布，也不假设响应具有恒定方差。

下表总结了线性回归和分位数回归之间的一些重要区别：

; xgboost的分位数回归

最后如果想使用xgboost，又想试试分位数回归，那么可以参考以下代码

class XGBQuantile(XGBRegressor):
  def __init__(self,quant_alpha=0.95,quant_delta = 1.0,quant_thres=1.0,quant_var =1.0,base_score=0.5, booster='gbtree', colsample_bylevel=1,
                colsample_bytree=1, gamma=0, learning_rate=0.1, max_delta_step=0,max_depth=3, min_child_weight=1, missing=None, n_estimators=100,
                n_jobs=1, nthread=None, objective='reg:linear', random_state=0,reg_alpha=0, reg_lambda=1, scale_pos_weight=1, seed=None,silent=True, subsample=1):
    self.quant_alpha = quant_alpha
    self.quant_delta = quant_delta
    self.quant_thres = quant_thres
    self.quant_var = quant_var

    super().__init__(base_score=base_score, booster=booster, colsample_bylevel=colsample_bylevel,
       colsample_bytree=colsample_bytree, gamma=gamma, learning_rate=learning_rate, max_delta_step=max_delta_step,
       max_depth=max_depth, min_child_weight=min_child_weight, missing=missing, n_estimators=n_estimators,
       n_jobs= n_jobs, nthread=nthread, objective=objective, random_state=random_state,
       reg_alpha=reg_alpha, reg_lambda=reg_lambda, scale_pos_weight=scale_pos_weight, seed=seed,
       silent=silent, subsample=subsample)

    self.test = None

  def fit(self, X, y):
    super().set_params(objective=partial(XGBQuantile.quantile_loss,alpha = self.quant_alpha,delta = self.quant_delta,threshold = self.quant_thres,var = self.quant_var) )
    super().fit(X,y)
    return self

  def predict(self,X):
    return super().predict(X)

  def score(self, X, y):
    y_pred = super().predict(X)
    score = XGBQuantile.quantile_score(y, y_pred, self.quant_alpha)
    score = 1./score
    return score

  @staticmethod
  def quantile_loss(y_true,y_pred,alpha,delta,threshold,var):
    x = y_true - y_pred
    grad = (x<(alpha-1.0)*delta)*(1.0-alpha)- ((x>=(alpha-1.0)*delta)& (x<alpha*delta) )*x delta-alpha*(x>alpha*delta)
    hess = ((x>=(alpha-1.0)*delta)& (x<alpha*delta) ) delta grad="(np.abs(x)<threshold" )*grad - (np.abs(x)>=threshold )*(2*np.random.randint(2, size=len(y_true)) -1.0)*var
    hess = (np.abs(x)<threshold )*hess + (np.abs(x)>=threshold )
    return grad, hess

  @staticmethod
  def original_quantile_loss(y_true,y_pred,alpha,delta):
    x = y_true - y_pred
    grad = (x<(alpha-1.0)*delta)*(1.0-alpha)-((x>=(alpha-1.0)*delta)& (x<alpha*delta) )*x delta-alpha*(x>alpha*delta)
    hess = ((x>=(alpha-1.0)*delta)& (x<alpha*delta) ) delta return grad,hess @staticmethod def quantile_score(y_true, y_pred, alpha): score="XGBQuantile.quantile_cost(x=y_true-y_pred,alpha=alpha)" quantile_cost(x, (alpha-1.0)*x*(x<0)+alpha*x*(x>=0)

  @staticmethod
  def get_split_gain(gradient,hessian,l=1):
    split_gain = list()
    for i in range(gradient.shape[0]):
      split_gain.append(np.sum(gradient[:i])/(np.sum(hessian[:i])+l)+np.sum(gradient[i:])/(np.sum(hessian[i:])+l)-np.sum(gradient)/(np.sum(hessian)+l) )

    return np.array(split_gain)
</alpha*delta)></alpha*delta)></(alpha-1.0)*delta)*(1.0-alpha)-((x></threshold></alpha*delta)></alpha*delta)></(alpha-1.0)*delta)*(1.0-alpha)->

https://gist.github.com/benoitdescamps/af5a8e42d5cfc7981e960e4d559dad19#file-xgboostquantile-py

对于LightGBM这里有一篇详细的实现文章：

http://jmarkhou.com/lgbqr/

Original: https://blog.csdn.net/m0_46510245/article/details/121073727
Author: deephub
Title: 分位数回归（quantile regression）简介和代码实现

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/638660/

转载文章受原作者版权保护。转载请注明原作者出处！

人工智能

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

Python进阶——网课不愁系列AI换脸技术

俗话说的好：网络一线牵，珍惜这段缘！网络的水很深，年轻人你把握不住，众所周知照片是可以P的，但是”视频”是”P”不了的（狗头保命）…

人工智能 2023年7月4日
0062
神经网络正向与反向传播

一、神经网络的前向传播原理在全连接神经网络中，每一层的每个神经元都会与前一层的所有神经元或者输入数据相连，例如图中的 f 1 ( e ) f _1 ( e )f 1 (e )就…

人工智能 2023年7月14日
0047
Python: pip安装Opencv包成功，但在Pycharm中无法使用

背景简述：版本python3.9.7 系统环境：windows10 针对问题：电脑中有多个用户（管理员加另一个），还有把python装到了D盘的系统文件夹（读写需要管理员权限的文…

人工智能 2023年7月19日
0063
detr目标检测算法源码详解

1.图像数据加上mask 对于每一批次的图像，首先找出每一批次图片的H,W的最大值Hmax,Wmax,然后将原始图像填充为3HmaxWmax大小，并将图像部分置为False，填充部…

人工智能 2023年7月28日
0041
习题解答chapter09

1. Java中流的分类有哪些? 从流动的方向上看：一般为输入流（InputStream）和输出流（OutputStream）两类。从读取类型上看，一般分为字节流和字符流。字节流是…

人工智能 2023年6月4日
0072
ConsensusClusterPlus，一步到位的一致性聚类！

欢迎关注”生信修炼手册”! 在之前的文章中分享了一致性聚类的原理，本文介绍下如何用R语言进行分析。ConsensusClusterPlus这个R包，就是专门…

人工智能 2023年5月31日
0082
科创人·奇点云CEO张金银：数据赋能始于场景终于价值，深山出不了武林高手

张金银（行在）奇点云创始人兼CEO 近20年资深数据玩家，12年阿里系数据经验，阿里巴巴首个数据仓库建立者，阿里巴巴TCIF主持创建者，阿里巴巴大数据和人工智能平台”…

人工智能 2023年7月17日
0047
5个拿来就能用的整人代码脚本

「作者主页」：士别三日wyx「作者简介」：CSDN top100、阿里云博客专家、华为云享专家、网络安全领域优质创作者整蛊代码脚本一、你的电脑正在被攻击！！！二、CMD炸弹 …

人工智能 2023年7月31日
0080
YOLO学习02（解决CUDA和Pytorch版本不匹配的问题）[CUDA11.6+PyTorch1.12.0]

接着上一章解决问题：目录一、CUDA版本选择二、卸载装错的CUDA 三、安装对应PyTorch 一、CUDA版本选择 PyTorch下载界面，通过这里可以看到PyTorch最…

人工智能 2023年7月23日
00152
南航数据分析与挖掘课设1(上)——基于多元线性回归模型，ARIMA序列的中国GDP增长影响因素研究及预测（R语言）

基于多元线性回归模型，ARIMA序列的中国GDP增长影响因素研究及预测在国民经济发展的过程中,国内生产总值（GDP）是指按国家市场价格计算的一个国家（或地区）所有常驻单位在一定时…

人工智能 2023年6月18日
0072
强化学习与自动驾驶-Deep Reinforcement Learning for Autonomous Driving: A Survey

最近一直在看用cv的方法进行轨迹预测，大老板说也许可以用强化学习来做，于是读了21年的 “Deep Reinforcement Learning for Autonom…

人工智能 2023年6月10日
0065
Pytorch环境配置——cuda、、cudnn、torch、torchvision对应版本（最全）及安装方法

Pytorch环境配置——cuda、、cudnn、torch、torchvision对应版本（最全）及安装方法一、查询可支持的最高cuda版本二、查看cuda、cudnn、py…

人工智能 2023年7月24日
0070
机器学习——聚类算法简单汇总

[TencentCloudSDKException] code:FailedOperation.ServiceIsolate message:service is stopped …

人工智能 2023年6月2日
0057
stata学习笔记

1.描述性分析、线性回归 summarize y x //描述性分析correlate y x //相关分析pwcorr y x,sig //相关性检验graph twoway s…

人工智能 2023年6月17日
0067
阿里云杨国彦：云上护航，陪伴成长

以下整理自杨国彦在云栖大会”云上成就创新梦想”论坛中发表的《云上护航，陪伴成长》的主题演讲） 11月5日，以”云上成就创新梦想”为主…

人工智能 2023年6月29日
0090
MATLAB处理WOA18浮标数据

1、利用woa18数据，查找浮标坐标点、并对坐标点处绘制声速剖面。2、利用Krakenc计算传播损失差。环境：Matlab 2015b以上版本ACTup水声学综合工具箱数据来源：W…

人工智能 2023年6月20日
00107

2024 年 4 月
一	二	三	四	五	六	日
1	2	3	4	5	6	7
8	9	10	11	12	13	14
15	16	17	18	19	20	21
22	23	24	25	26	27	28
29	30