面板数据固定效应线性回归模型的变量选择

田果 ,  杨宜平

山西大学学报(自然科学版) ›› 2026, Vol. 49 ›› Issue (05) : 832 -839.

PDF (733KB)
山西大学学报(自然科学版) ›› 2026, Vol. 49 ›› Issue (05) : 832 -839. DOI: 10.13451/j.sxu.ns.2024023
基础科学与技术

面板数据固定效应线性回归模型的变量选择

作者信息 +

Variable Selection of Linear Panel Data Models with Fixed Effects

Author information +
文章历史 +
PDF (750K)

摘要

本文基于弹性网(Elastic net)惩罚为面板数据固定效应线性回归模型提出了一种新的变量选择过程,所提出的变量选择过程能处理强相关变量的变量选择问题。先通过正向正交偏差变换消除固定效应,然后构造了基于Elastic net惩罚的最小二乘目标函数,进而同时进行回归系数的估计和变量选择,证明了所得估计的组效应性质。所提出的变量选择过程不仅消除了固定效应的影响,而且即使协变量存在共线性时,也能很好地识别出真实模型。其次,模拟研究了本文提出方法的有限样本性质。模拟研究表明:与Lasso,ALasso以及SCAD变量选择方法相比,提出的Elastic net变量选择方法能够很好的将强相关变量选入模型。最后,采用文中提出的方法分析了实际数据。

Abstract

Based on Elastic net, a new variable selection method is proposed in this paper for linear panel data models with fixed effects. The variable selection problem with the strongly correlated variables can be dealt with by the proposed variable selection method. Firstly, the fixed effect is eliminated by the forward orthogonal deviation transformation. Then, the penalized least squares objective function based on the Elastic net penalty is constructed, which can estimate regression coefficients and select important variables simultaneously. The group effect property of the obtained estimation is proved. The influence of fixed effects is eliminated by the proposed variable selection method and the real model can be identified well even if the covariates are collinear. Secondly, the finite sample properties of the proposed method are accessed by the simulation. The simulation results show that compared with Lasso, ALasso and SCAD variable selection methods, strongly correlated variables can be better selected by the proposed Elastic net variable selection method. Finally, a real dataset is analyzed by the proposed method.

关键词

强相关变量 / 正向正交偏差变换 / 弹性网 / 组效应

Key words

strongly correlated variables / the forward orthogonal deviations transform / Elastic net / grouping effect

引用本文

引用格式 ▾
田果,杨宜平. 面板数据固定效应线性回归模型的变量选择[J]. 山西大学学报(自然科学版), 2026, 49(05): 832-839 DOI:10.13451/j.sxu.ns.2024023

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

在科学研究的过程中经常会产生面板数据。面板数据是多个个体在不同时间点上进行重复测度,得到每个个体在不同时间点上的观测值。因此,面板数据同时具有截面和时间双重的特性,是截面与时间的结合。面板数据广泛应用于经济学、生物学、医学、管理学等领域。由于信息技术不断发展,数据变得越来越复杂,对于面板数据而言,如何从众多变量中选取出重要的变量,成为了当前统计学研究的热点问题之一。

目前,关于惩罚变量选择的方法已经有很多。Tibshirani1在惩罚函数的启发下,提出了针对普通线性模型下的Lasso(Least absolute shrinkage and selection operator)变量选择方法,它可以将无显著影响的变量系数压缩为0,并且同时进行变量选择和系数的估计。为了有效地解决Lasso的计算问题,Efron等2提出了最小角回归算法(Least Angel Regression,Lars),这种方法显著提高了Lasso方法的计算速度,使Lasso方法在模型估计和变量选择方面得到更广泛的应用。由于Lasso变量选择方法不具有Oracle性质,Zou3提出了ALasso(Adaptive Least absolute shrinkage and selection operator)变量选择方法,ALasso不仅具有Lasso方法在系数压缩时的相同力度,而且ALasso具有Oracle性质。一方面,Fan和Li4改进了Lasso方法,提出了具有Oracle性质的SCAD(Smoothly Clipped Absolute Deviation)惩罚变量选择方法。另一方面,Zou和Hastie5结合岭回归和Lasso变量选择方法,提出了Elastic net变量选择方法,该变量选择方法相比于Lasso,它的优点在于可以处理变量之间强相关的数据。因此,Elastic net变量选择方法被广泛应用。舒时克和李路6建立逻辑回归模型,采用Elastic net变量选择方法研究上证180指数成分股数据的选股问题。王文胜和宋家辉7基于Elastic net分位数回归对开放性基金绩效评价进行了研究。黄登香等8将Elastic net变量选择方法推广到部分线性模型,并讨论了变量选择的组效应性质。唐礼智等9将Elastic net方法用于面板数据的贝叶斯分位数回归,并将所提出的方法分析了互联网金融类上市公司经济增加值数据。Shi等10将Elastic net变量选择方法应用到了广义线性模型。Li和Ding11针对Elastic net惩罚提出了广义条件梯度算法。邹璟婧等12结合QR分解和Elastic net惩罚方法提出了一种线性混合效应模型中固定效应的变量选择方法。由于面板数据从截面和时间两个维度分析实际问题,已有学者讨论了面板数据固定效应线性回归模型的变量筛选。

关于高维面板数据模型的研究,李扬和曾宪斌13针对面板数据模型的惩罚似然变量选择问题,给出了Lasso、ALasso、岭回归和SCAD四种惩罚函数的渐近性质。朱利荣等14针对面板数据模型提出了ALasso的复合分位数回归估计。Li等15采用SCAD惩罚变量选择方法研究了变系数固定效应模型的变量选择问题。已有针对高维面板数据模型的变量筛选,不能有效地处理相关性较强的变量。上述文献关于面板数据线性回归模型的变量选择并不能有效地处理相关性强的变量。为了解决该问题,本文运用Elastic net惩罚,消除固定效应的影响构造一种能处理高度相关变量的变量选择过程。首先引入正向正交偏差变换矩阵,消除固定效应项;然后结合Elastic net惩罚构造惩罚目标函数,进而同时估计回归系数和变量选择。进一步,证明了所提出估计的组效应性质。最后,模拟研究了所提出方法的有限样本性质。本文提出的方法具有两个优势:一、通过采用正向正交偏差变换的方法消除固定效应,避免了误差项序列相关。二、利用Elastic net惩罚有效地处理了强相关变量地变量筛选问题,所提出的方法具有组效应。

1 参数的变量选择

考虑如下面板数据固定效应模型

Yit=XitTβ+ci+εit,i=1,2,,n,t=1,2,,T

其中Yit是响应变量,βp维未知参数,Xitp维协变量,εit是模型误差,ci是不可观测的个体固定效应项。为了模型可识别,假定i=1nci=0,并且T有界。

Yi=(Yi1,Yi2,,Yit)TXi=(Xi1,Xi2,,XiT)Tεi=(εi1,εi2,,εit)T,Ci=1Tci,1T是全为1的T维向量。则(1)式可写为

Yi=Xiβ+Ci+εi,i=1,2,,n ,

由于ci是个体固定效应,如果忽略ci直接估计β获得的估计是有偏的。即如果直接估计ci,随着n的增加待估计参数ci增加,会造成“维数祸根”问题。一个有效的办法就是消除ci。因此,本文借鉴了Arellano16的思想,通过正向正交偏差变换消除固定效应项。给出(T-1)×T维的滤子矩阵D,其形式为

D=-110000-110000010000-11

在(2)式两边乘以矩阵(DDT)-1/2D,得到

Y˜i=X˜iβ+ε˜i,i=1,2,,n ,

其中Y˜i=(DDT)-1/2DYiX˜i=(DDT)-1/2DXiε˜i=(DDT)-1/2Dεi式(3)通过正向正交偏差变换消除了固定效应。避免了所转换的误差项的序列相关性,即

Varεi=σ2ITVarε˜i=σ2IT-1

通过变换后,样本量nT变成了n(T-1),我们记N=nT-1

Y˜=(Y˜1,Y˜2,,Y˜n)TX˜=(X˜1,X˜2,,X˜n)Tε˜=(ε˜1,ε˜2,,ε˜n)T。对于模型(3),我们可以构造基于弹性网惩罚最小二乘估计,即

β^=argmini=1nY˜i-X˜iβTY˜i-X˜iβ+λ2β22+λ1β1 ,

其中λ1,λ2是非负调节参数,β22=j=1pβj2β1=j=1pβj

给出数据集(Y˜,X˜)和(λ1,λ2),定义一个新的数据集(Y˜*,X˜*),其中

X˜(N+p)×p*=(1+λ2)-1/2X˜λ2IY˜(N+p)*=Y˜0

γ=λ1/1+λ2β*=1+λ2β,弹性网惩罚最小二乘的解等价于以下Lasso方法的解

β^*=argminY˜*-X˜*β*TY˜*-X˜*β*+γβ*1

从而

β^=11+λ2β^*

因此,目标函数(4)式的算法问题得到有效解决。注意到弹性网惩罚最小二乘目标函数涉及两个调节参数λ1λ2的选取,为了避免二维最优化问题,类似Li等17在模拟研究中,固定调节参数λ2=0.01,采用最小化下面BIC目标函数选取λ1

BIC(λN)=log(σ^λN)+logNNdfλN

其中σ^λN=1Ni=1nt=1T-1(Y˜it-X˜itTβ^)2,第一项控制模型拟合的好坏,第二项控制模型的稀疏性,dfλNβ^中的非零系数个数,称为自由度。Y˜itX˜itT分别是经过正向正交偏差变换消除固定效应项后的响应变量和协变量。

2 估计的组效应

现在给出弹性网方法的组效应性质,即将强相关变量全部选入模型或者全部剔出模型。

定理1 给出数据(X˜,Y˜)和参数(λ1,λ2),响应变量Y˜是经过中心化的,解释变量X˜是经过标准化的。令β^(λ1,λ2)是弹性网的估计。假设β^l(λ1,λ2)β^k(λ1,λ2)>0。定义

Dλ1,λ2(l,k)=1Y˜1β^l(λ1,λ2)-β^k(λ1,λ2)

则有

Dλ1,λ2(l,k)1λ22(1-ρ)

其中ρ=X˜'lTX˜k'是样本相关系数,X˜l'X˜k'是矩阵X˜的第l列和第k列。

证明β^l(λ1,λ2)β^k(λ1,λ2)>0,则有sgnβ^l(λ1,λ2)=sgnβ^k(λ1,λ2),且二者非零,其中sgn是符号函数。由β^=argminL(λ1,λ2,β),则β^(λ1,λ2)满足

L(λ1,λ2,β)βk=0 

所以有

i=1nt=1T-1(-2)X˜itk(Y˜it-j=1pX˜itjβ^j(λ1,λ2))+λ1sgnβ^k(λ1,λ2)+2λ2β^k(λ1,λ2)=0 

又有

i=1nt=1T-1(-2)X˜itl(Y˜it-j=1pX˜itjβ^j(λ1,λ2))+λ1sgnβ^l(λ1,λ2)+2λ2β^l(λ1,λ2)=0 

(7)减(6)得

i=1nt=1T-1(-2)(X˜itl-X˜itk)(Y˜it-j=1pX˜itjβ^j(λ1,λ2))+2λ2(β^l(λ1,λ2)-β^k(λ1,λ2))=0 

整理(8)得

β^l(λ1,λ2)-β^k(λ1,λ2)=1λ2i=1nt=1T-1(X˜itl-X˜itk)(Y˜it-j=1pX˜itjβ^j(λ1,λ2))=1λ2X˜'lT-X˜'kTγ^λ1,λ2 ,

其中γ^λ1,λ2=Y˜-X˜β^λ1,λ2X˜l'X˜k'是矩阵X˜的第l列和第k列。由β^=argminL(λ1,λ2,β)

L(λ1,λ2,β)L(λ1,λ2,0)

等价于

i=1nt=1T-1(Y˜it-j=1pX˜itjβj)2+λ2β2+λ1β1i=1nt=1T-1Y˜it2 ,

γ^2λ1,λ2+λ2β22+λ1β1i=1nt=1T-1Y˜it2 

则可以得到γ^2λ1,λ2Y˜2,其中Y˜=i=1nt=1T-1Y˜it2,令Y˜1=i=1nj=1T-1Y˜it,易得Y˜Y˜1

γ^λ1,λ2Y˜

则有

Dλ1,λ2(l,k)=1Y˜1β^l(λ1,λ2)-β^k(λ1-λ2)1λ2γ^λ1,λ2Y˜X˜l'-X˜k'1λ221-ρ

因此,定理1得证。

注:定理1给出了弹性网的组效应性质,Dλ1,λ2(l,k)展示了两个变量X˜lX˜k的系数路径之间的差异。如果X˜lX˜k强相关,即若ρ=1,两者的系数路径之间的差异几乎为零。因此,可以看出弹性网变量选择方法可以有效处理强相关变量,而Lasso变量选择不能处理强相关变量。

3 模拟研究

本节通过模拟研究所提出方法的有限样本性质。模拟研究考虑了两种情形:协变量不存在完全相关变量和存在完全相关变量。为了度量变量选择和估计的精度,我们计算了非零变量错误估计为0的平均个数,记为“IC”,零变量正确估计为0的平均个数,记为“C”。

以及MSE,其中MSE的定义为:

MSEβ^=β^-βTβ^-β

为了比较,模拟研究考虑了弹性网,Lasso,ALasso和SCAD四种变量选择方法,其中Lasso和ALasso利用R软件中的包“lar”,SCAD采用包“ncvreg”。样本容量分别取n=50,100和150,每种情况重复运行1 000次。由于面板数据是不同个体不同时间上的观测,观测次数为T=5,个体效应满足i=1nci=0

模拟1 协变量不存在完全相关的情形。数据由以下模型产生

Yit=XitTβ+ci+εit,i=1,2,,n,t=1,,5 ,

其中β=(3,1.5,1.5,0,,0)T,维数p=10,协变量X=X1,X2,,X10产生均值为零,协方差矩阵为CovXi,Xj=ρi-j的多元正态分布,ρ的取值为0.5,ci=Xi,1+Vi,i=2,,n,其中Vi~N(0,1)Xi,1=15t=15Xit,1,且c1=-i=2nci,模型误差εit~0.5N(0,1)。计算结果见表1

表1可以得到以下结论:

(1)随着样本量的增加,弹性网,Lasso,ALasso和SCAD四种变量选择的方MSE都减小。

(2)Elastic net和Lasso变量选择的方法的MSE相差不大,并且IC和C也相差不大,说明在协变量不存在完全相关时,弹性网和Lasso两种方法效果相当。

(3)由于ALasso和SCAD两种方法具有Oracle性质,弹性网和Lasso两种方法不具有Oracle性质,所以ALasso和SCAD两种方法的MSE更小。

模拟2 协变量之间存在完全相关的情形。数据由以下模型产生

Yit=XitTβ+ci+εit,i=1,2,,n,t=1,,5,

其中β=(3,1.5,1.5,0,,0)T,维数p=10,协变量X=X1,X2,,X10,其中产生X2~N0,1,变量X2=X3(协变量完全相关),其余变量Xi产生均值为零,协方差矩阵为CovXi,Xj=ρi-j的多元正态分布,ρ为0.5,ci=Xi,1+Vi,i=2,,n,其中Vi~N(0,1)Xi,1=15t=15Xit,1,且c1=-i=2nci,模型误差εit~0.5N(0,1)。计算结果见表2

表2可以看出:Lasso,ALasso和SCAD三种方法的IC值都为1,说明三种方法都将某个非零系数估计为零,并且导致了MSE过大。而弹性网方法的IC值为0,这表明了弹性网方法具有组效应,能够同时将强相关变量一起选入模型。

4 实例分析

本节分析一组来自北卡罗来纳州的犯罪数据。该数据可以从R软件包“plm”获得。该组数据采集了90个观测单位的数据,每个单位进行7次观测(每年观测一次),总共630个数据。本文构建如下面板数据模型分析该数据集,即

Yit=β1Xit,1+β2Xit,2++β16Xit,16+β17Xit,17+Ci+εit

其中Yit,Xit代表的变量在表3中给出。

类似模拟研究,采用四种方法分析了该数据集。为了比较四种方法的优劣,我们也计算了均方误差(MSE),其定义为:

MSE=1630i=190t=17(Yit-β^1Xit,1+β^2Xit,2++β^16Xit,16+β^17Xit,17)2

其中β^为对应方法的系数估计值。计算结果见表4

表4可以看出,Lasso和SCAD从17个变量中选出了10个重要变量,ALasso和弹性网从17个变量中选出了7个重要变量。然而,与Lasso、ALasso和SCAD相比,弹性网给出了最小的MSE。

5 结束语

本文针对面板数据固定效应线性回归模型,提出了基于弹性网的变量选择过程。在构造弹性网惩罚目标函数时,为了消除固定效应,采用正向正交偏差变换的方法,避免了转换后的误差项存在序列相关性。通过最小化弹性网惩罚最小二次目标函数来实现系数压缩,将有些系数压缩为零。进一步,证明了所提出的变量选择过程的组效应性质。

参考文献

[1]

Tibshirani R. Regression Shrinkage and Selection via the Lasso[J]. J R Stat Soc Ser B Methodol, 1996, 58(1): 267-288. DOI: 10.1111/j.2517-6161.1996.tb02080.x .

[2]

Efron B, Hastie T, Johnstone I, et al. Least Angle Regression[J]. Ann Statist, 2004, 32(2): 407-499. DOI: 10.1214/009053604000000067 .

[3]

Zou H. The Adaptive Lasso and Its Oracle Properties[J]. J Am Stat Assoc, 2006, 101(476): 1418-1429. DOI: 10.1198/016214506000000735 .

[4]

Fan J Q, Li R Z. Variable Selection via Nonconcave Penalized Likelihood and Its Oracle Properties[J]. J Am Stat Assoc, 2001, 96(456): 1348-1360. DOI: 10.1198/016214501753382273 .

[5]

Zou H, Hastie T. Regularization and Variable Selection via the Elastic Net[J]. J R Stat Soc Ser B Stat Methodol, 2005, 67(2): 301-320. DOI: 10.1111/j.1467-9868.2005.00503.x .

[6]

舒时克, 李路. 基于Elastic Net惩罚的多因子选股策略[J]. 统计与决策, 2021, 37(16): 157-161. DOI: 10.13546/j.cnki.tjyjc.2021.16.036 .

[7]

Shu S K, Li L. Multi-factor Stock Selection Strategy Based on Elastic Net Punishment[J]. Stat Decis, 2021, 37(16): 157-161. DOI: 10.13546/j.cnki.tjyjc.2021.16.036 .

[8]

王文胜, 宋家辉. 基于弹性网分位数回归的开放型基金绩效研究[J]. 数理统计与管理, 2020, 39(4): 721-733. DOI: 10.13860/j.cnki.sltj.20191021-003 .

[9]

Wang W S, Song J H. Open-end Fund Investment Performance Based on Elastic Net Quantile Regression[J]. J Appl Stat Manag, 2020, 39(4): 721-733. DOI: 10.13860/j.cnki.sltj.20191021-003 .

[10]

Huang D X, Li C H, Qin C Y, et al. The Application and Property of Elastic Net Procedure for Partially Linear Models[J]. Chin Q J Math, 2020, 35(3): 290-301. DOI: 10.13371/j.cnki.chin.q.j.m.2020.03.004 .

[11]

唐礼智, 李雨佳, 赵力静. 面板数据的贝叶斯Elastic Net分位数回归方法及其应用研究[J]. 统计研究, 2020, 37(3): 94-113. DOI: 10.19343/j.cnki.11-1302/c.2020.03.008 .

[12]

Tang L Z, Li Y J, Zhao L J. Study on the Bayesian Elastic Net Quantile Regression for Panel Data: Methods and Applications[J]. Stat Res, 2020, 37(3): 94-113. DOI: 10.19343/j.cnki.11-1302/c.2020.03.008 .

[13]

Shi X Y, Liang B, Zhang Q. Post-selection Inference of Generalized Linear Models Based on the Lasso and the Elastic Net[J]. Commun Stat Theory Meth, 2022, 51(14): 4739-4756. DOI: 10.1080/03610926.2020.1821892 .

[14]

Li H L, Ding L. Generalized Conditional Gradient Method for Elastic-net Regularization[J]. J Comput Appl Math, 2022, 403: 113872. DOI: 10.1016/j.cam.2021.113872 .

[15]

邹璟婧, 杨宜平, 赵培信. 基于正交投影的线性混合效应模型的弹性网变量选择[J]. 应用数学, 2024, 37(2): 547-553. DOI: 10.13642/j.cnki.42-1184/o1.2024.02.004 .

[16]

Zou J J, Yang Y P, Zhao P X. The Elastic Net Variable Selection for Linear Mixed-effects Models Based on the Orthogonal Projection[J]. Mathematica Applicata, 2024, 37(2): 547-553. DOI: 10.13642/j.cnki.42-1184/o1.2024.02.004 .

[17]

李扬, 曾宪斌. 面板数据模型的惩罚似然变量选择方法研究[J]. 统计研究, 2014, 31(3): 83-89. DOI: 10.19343/j.cnki.11-1302/c.2014.03.012 .

[18]

Li Y, Zeng X B. Research on Variable Selection Method of Penalized Likelihood for Panel Data Model[J]. Stat Res, 2014, 31(3): 83-89. DOI: 10.19343/j.cnki.11-1302/c.2014.03.012 .

[19]

朱利荣, 胡超竹, 罗幼喜. 面板数据模型的惩罚复合分位回归方法[J]. 统计与决策, 2022, 38(13): 40-45. DOI: 10.13546/j.cnki.tjyjc.2022.13.008 .

[20]

Zhu L R, Hu C Z, Luo Y X. A Penalized Composite Quantile Regression Method for Panel Data Model[J]. Stat Decis, 2022, 38(13): 40-45. DOI: 10.13546/j.cnki.tjyjc.2022.13.008 .

[21]

Li G R, Lian H, Lai P, et al. Variable Selection for Fixed Effects Varying Coefficient Models[J]. Acta Math Sin Engl Ser, 2015, 31(1): 91-110. DOI: 10.1007/s10114-015-3159-2 .

[22]

Arellano M. Panel Data Econometrics[M]. Oxford: Oxford University Press, 2003.

[23]

Li N, Yang H, Yang J. Nonnegative Estimation and Variable Selection via Adaptive Elastic-net for High-dimensional Data[J]. Commun Stat Simul Comput, 2021, 50(12): 4263-4279. DOI: 10.1080/03610918.2019.1642484 .

基金资助

国家社会科学基金项目(18BTJ035)

重庆市自然科学基金(cstc2021jcyj-msxmX0079)

重庆市社科规划委托项目(2019WT58)

AI Summary AI Mindmap
PDF (733KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/