复杂统计数据的参数和半参数模型选择及在金融大数据中的应用

 


项目组成员:杨虎 杨玥含 徐建文 黎雅莲 郭朝会 杨晶 王少新 刘惠篮 李宁 涂静雯

复杂统计数据的参数和半参数模型选择及在金融大数据中的应用项目成果介绍

杨虎主页 电子邮件 English

地址:重庆大学城西路17号13栋  邮编:401331

 

     

 

    内容简介:

根据项目的研究内容,四年来,我们围绕四个方面开展研究工作,首先结合资产配置和指数跟踪长期致力于非负参数的模型选择研究。这是上一个国家自然科学基金面上项目研究工作的延续,提出了在低维和超高维环境下对系数都有非负约束的非负层次LASSO,它可以重叠地在组内和组间两级同时选择,即双层选择。在理论分析中,我们证明了在一定的正则性条件下,当协变量个数随样本量发散时,非负层次LASSO在群体选择中具有Oracle性质。

其次是变量选择的各种拓展研究,比如模型的半参数拓展,最小一乘拓展,对抗噪声的稳健估计问题,惩罚项的分组效应,自适应的“反向”惩罚方法,高维甚至超高维的变量选择问题等。并且上一个项目提到的在刘估计的变量选择研究中没有获得理想的突破在本项目结束前顺利突破,获得理想的结果。提出了一种自适应的“反向”惩罚方法,重点在于消除压缩偏差和突出分组效应。结合L_1罚函数和Minimax凹罚函数,提出了两种相关效应平滑调整方法和广义相关效应平滑调整方法。

第三研究两步估计高维高斯图模型的方法,第一步为筛选步,其中精度矩阵的许多元素被识别为零,因此可从进一步考虑中移除。在第二步中,通过关注精度矩阵的剩余项,并对精度矩阵的非零项进行选择和估计。由于筛选步骤有效地降低了参数空间的维数,因此可以潜在地提高估计精度矩阵的估计精度。

第四是人工智能与大数据研究,主要致力于支持向量分类与支持向量回归问题,把现有的方法都有所拓展和深化。通过复合惩罚提出了一种弹性网络支持向量机(ENSVM)。与双正则支持向量机不同,我们对超平面的松弛变量施加惩罚,而不是对超平面的法向量施加惩罚,证明了ENSVM的定义比标准SVM和DrSVM更合理。ENSVM有更稳定的高维性质,仿真结果有力地支持了这些优点。

1. 研究计划执行情况概述。

(1)按计划执行情况。

项目研究完全按照计划进行,每年的报告也都有说明,在对研究内容进行了全面评估和分阶段规划后,各项研究工作逐年都进展顺利,取得了一定的研究成果,但也存在的一些意料之中的困难。比如正相关模型选择与指数跟踪研究中,针对高维数据的不可表示性条件的充分性仍然是一个难点,但在支持向量聚类、稀疏主成分、稀疏因子分析等方面的研究都有良好进展,并且上一个项目提到的在刘估计的变量选择研究中没有获得理想的突破在本项目结束前顺利突破,获得理想的结果。

(2)研究目标完成情况。

四年来,通过课题组的共同努力,随时跟踪国际最新的前沿研究对项目任务进行深化和完善,全部完成预定的研究任务,在很多方面都有新的发现和较大的进展,我们在后面会详细叙述。

2. 研究工作主要进展、结果和影响。

(1)主要研究内容。

研究主要集中在以下几个方面:结合资产配置和指数跟踪长期致力于非负参数的模型选择研究;变量选择的各种拓展研究,比如模型的半参数拓展,最小一乘拓展,对抗噪声的稳健估计问题,惩罚项的分组效应,自适应的“反向”惩罚方法,高维甚至超高维的变量选择问题等;研究稀疏问题比如稀疏主成分,稀疏因子分析,稀疏分类判别方法等;人工智能与大数据研究:主要致力于支持向量分类与支持向量回归问题,把现有的方法都有所拓展和深化。

(2)取得的主要研究进展、重要结果、关键数据等及其科学意义或应用前景。

本项目课题组四年来,主要围绕基金项目任务书规定的内容展开研究,在研究的过程中,针对国际前沿研究的最新动态对项目任务进行适当调整,如稀疏主成分与支持向量分类研究,均取得了高水平的研究成果。

代表性成果按要求共提供了5篇,均发表在国内外高水平专业期刊上,分别叙述如下:

Adaptive and Reversed Penalty for Analysis of high-Dimensional Correlated Data,Applied mathematical modeling, 2021, 92(4):63-77.

提出了一种自适应的“反向”惩罚方法,重点在于消除压缩偏差和突出分组效应。结合L_1罚函数和Minimax凹罚函数,提出了两种相关效应平滑调整方法和广义相关效应平滑调整方法。它们可以看作是一种特殊的自适应估计,但不同于传统的高度依赖初始估计的自适应估计。提出的估计即使从错误的初始估计中也能获得有效的信息,从而在有限样本中提供稳定而准确的估计。在温和的正则性条件下,证明了这些方法满足oracle性质。仿真结果表明,这些方法能准确地估计相关结构中的系数。提出的估计可应用于金融数据,在资产配置选择上有优良表现。

The Structured Smooth Adjustment for Square-root Regularization: Theory, algorithm and applications,Knowledge-Based Systems, 2020, 207:0-106278.

提出了一种新的平方根正则化结构光滑平差(SSASR)方法,能同时选择分组变量,并在每个分组内突出分段光滑的作用。这种方法基于平方根正则化和一个联合的L_2,1范数正则化,这与组lasso一样,将一组系数同时压缩到零,此外,包括一个额外的IGTV正则化来对系数实施某些结构约束(而不是纯稀疏性)。可以证明在设计矩阵的一些温和条件下,SSASR估计可以实现对未知噪声水平的最优估计和预测。为了实现该算法,提出了一种称为标度对偶正反向分裂的算法,并证明了算法的收敛性。而应用角度,针对多形性胶质母细胞瘤样本和灰度图像的合成数据和真实数据进行了实验评估。

A two-step method for estimating high-dimensional Gaussian graphical models,Science China Mathematics, 2020, 63(6):1203-1218.

提出了一种两步估计高维高斯图模型的方法:第一步用作筛选步骤,其中精度矩阵的许多元素被识别为零,因此从进一步考虑中移除。然后在第二步中,通过关注精度矩阵的剩余项,并对精度矩阵的非零项进行选择和估计。由于筛选步骤有效地降低了参数空间的维数,因此可以潜在地提高估计精度矩阵的估计精度。理论证明表明该方法具有令人满意的渐近性质。通过与几种现有方法的数值比较,该方法是有效的。最后将该方法应用于乳腺癌微阵列数据集,得到了一些有生物学意义的结果。

A new adaptive weighted imbalanced data classifier via improved support vector machines with high-dimension nature,Knowledge-Based Systems, 2019, 185:0-104933.

通过复合惩罚提出了一种弹性网络支持向量机(ENSVM)。与双正则支持向量机不同,我们对超平面的松弛变量施加惩罚,而不是对超平面的法向量施加惩罚,证明了ENSVM的定义比标准SVM和DrSVM更合理。ENSVM有更稳定的高维性质,仿真结果有力地支持了这些优点。此外,将融合权值与ENSVM相结合,还可以给出一种自适应加权弹性网络支持向量机(AWENSVM),使原始模型对不平衡数据具有更好的适应性和鲁棒性。与目前流行的支持向量机相比,本研究项目提出的AWENSVM模型具有更好的性能。

A robust and efficient estimation and variable selection method for partially linear models with large-dimensional covariates,Statistical Papers, 2020, 61:1911-1937.

提出了一种新的基于局部模态回归的高维协变量部分线性模型估计方法。当存在异常值或重尾误差分布时,参数分量和非参数分量的估计都是有效的,当没有异常值且误差分布为正态分布时,与相应的最小二乘估计一样渐近有效。当协变量维数以根号n更高阶的速率发散时,还可以建立估计量的渐近性质。为了达到稀疏性和提高可解释性,项目开发了一个基于SCAD惩罚的变量选择过程来选择重要的参数协变量,并证明了该方法在温和的正则性条件下具有oracle性质。此外,还提出了一种实用的改进MEM算法。通过蒙特卡洛模拟和实际数据验证了估计的有限样本性质。并最终提出了一种稳健的两步方法来处理超高维数据。

“研究成果目录”列出了全部已经发表和少量online的论文,除此之外还有一些会议分组报告未列入,出于培养学生的需要,项目鼓励多参加学术会议并做分组报告。另外有一本研究生教材在最后完稿中,由于尚未出版,没有列入。

3. 研究人员的合作与分工。

申请书列入项目成员名单如下:杨虎 杨玥含 徐建文 黎雅莲 郭朝会 杨晶 王少新 刘惠蓝 李宁 涂静雯

以后加入人员:夏思薇 谢宛玲 齐凯 胡青渝 吴小飞 明浩 陈银钧

项目主要研究人员:杨虎 杨玥含 徐建文 黎雅莲 郭朝会 杨晶 王少新 刘惠蓝 李宁 涂静雯 夏思薇 齐凯 谢宛玲

项目后续加入的人员都是重庆大学新入学的博士生和少量学术硕士,合作单位中央财经大学副教授杨玥含从上一个项目开始就一直参加合作研究,也经常通过学术报告,联合指导研究生,共同开展本项目各项研究任务,取得了丰硕的研究成果。

4. 国内外学术合作交流等情况。

项目第一主研在本项目研究过程中与密西根大学朱冀教授合作,完成并在中国科学英文版发表论文一篇(见代表性成果3)。

项目组成员郭朝会去新加坡国立大学做访问研究,取得高水平的研究成果。

在代表性成果4中与本校去澳大利亚的留学生杨栋钧有合作。

参加统计学与计算经济学国际研讨会,并担任加拿大姜华大会报告的主持人。

两次担任答辩主席,主持了新加坡国立大学夏应存教授在电子科大指导的博士生的答辩。邀请了新加坡国立大学栗家量副教授访问重庆大学。

5. 存在的问题、建议及其他需要说明的情况。

由于疫情影响,原来计划组织一次与项目相关的有国际国内同行参加的小型学术交流会没有举行,虽然采用了线上的方式弥补,但经费节约了不少,同样也是因为疫情的影响,项目组成员2020年参加学术会议也受到影响。由于项目成果丰硕,在很多方面都有很大的进展,建议在后续研究中继续深化,为下一个项目打下更加扎实的基础。

没有其它需要说明的情况。

6. 人才培养情况。

四年时间,新录取博士生3人,以前在读的博士生陆续毕业6人,未来的半年内还将毕业2人,剩下两人在读。培养硕士生15人,其中学硕8人,指导两名本科生毕业论文,后来都转为研究生。

资助项目执行期间已答辩博士研究生情况

郭朝会 线性模型 博士论文题目:线性模型与单指标模型的若干研究 导师:杨虎 已答辩

杨晶 统计学方向 博士论文题目:若干半参数模型的稳健推断与模型选择方法 导师:杨虎 已答辩

刘惠蓝 线性模型 博士论文题目:基于复合分位数回归方法的统计模型的相关研究 导师:杨虎 已答辩

王少新 统计计算方向 博士论文题目:不定最小二乘问题和近似因子模型的相关研究 导师:杨虎 已答辩

李宁 统计学方向 博士论文题目:线性与部分线性模型的变量选择及其应用研究 导师:杨虎 已答辩

涂静雯 统计学方向 博士论文题目:稀疏化方法在半参数模型中的若干研究 导师:杨虎 已答辩

7. 项目取得成果的总体情况。

项目组四年时间里按照预定的研究目标和任务开展项目研究,到去年12月项目到期前,超额完成预定的研究任务,在很多方面都有新发现,新突破,获得一批高水平研究成果,总共在国内外严格双审制有良好口碑的学术期刊发表论文30篇(含3篇已经online并被SCI收录,但尚没有安排卷号页码)。既有国内顶级期刊中国科学中英文版,数学学报,数学年刊,也有国际顶级期刊AMM,KBS,Q1期刊LMA,Calcolo,Q2期刊CSDA,SP等。研究主要集中在变量选择的相关领域,解决了高维或超高维,稳健选择,支持向量分类,刘估计正则化,图模型,组惩罚等理论问题。很多研究得到同行跟踪和良好评价,多次在国内外相关学术会议报告。

8. 项目成果转化及应用情况。

项目属于基础或应用基础研究,本身没有成果转化的预期,应用也主要是相关学科在学术上的交叉应用和模拟研究,比如在金融市场资产配置、套期保值、风险对冲、指数追踪,机器学习和人工智能中的支持向量分类,稀疏主成分,文本分析等,几乎都是学术界通用的应用案例,文献中较多,为了便于验证新方法的有效性,很自然会选择这些应用案例。

 

sail.gif"
Prof/Dr/Dean:Yanghu,  College of  Mathematics and Statistics, Chongqing UniversityChongqing, 401331,  P.R.China