分享自:

机器学习与ESG整合在投资组合优化中的理论与实践

期刊:Decisions in Economics and FinanceDOI:10.1007/s10203-026-00577-6

本文为类型a:单一原创研究学术报告。

作者为Giuseppe Caristi、David Barilla(意大利墨西拿大学经济系)、Michael Morabito(墨西拿大学政治与法律科学系)与Massimiliano Ferrara(意大利雷焦卡拉布里亚大学法律、经济与人文科学系)。论文发表于期刊 *Decisions in Economics and Finance*,在线发表日期为2026年,论文数字对象唯一标识符(DOI)为10.1007/s10203-026-00577-6。研究使用了2017–2022年Russell 3000指数成分股数据,提出了一个将机器学习与ESG约束整合进投资组合优化的综合框架。

研究的学术背景在于可持续金融与量化资产管理的交叉领域。随着欧盟分类法(EU Taxonomy)和可持续金融披露条例(SFDR)等监管压力增加,机构投资者越来越需要在投资组合中纳入环境、社会和治理(ESG)标准。然而,将ESG因素纳入数量化投资模型面临四个主要障碍:ESG数据多维且缺乏统一标准;ESG变量与传统金融因子之间存在严重多重共线性;带约束的组合优化在引入非负权重后不再具有闭式解;静态前沿分析难以刻画市场均衡与ESG溢价的动态形成。Azzone等人在2026年的研究中提出了基于追踪误差波动率(TEV)最小化并施加ESG约束的框架,证明了在特定条件下ESG约束可以改善均值-方差效率,但其模型将预期收益视为外生变量或仅使用简单线性估计,也未系统处理多重共线性与市场不确定性下的稳健优化问题。本研究旨在通过三个主题模块扩展这一框架:机器学习收益预测、带均衡分析的组合优化、以及基于多准则决策的组合选择。

研究工作流程包括三个核心模块。第一模块为机器学习收益预测。研究采用Gram-Schmidt正交化方法将ESG综合得分相对于Fama-French因子(市场、规模、价值、盈利、投资)进行正交分解,构造标准正交基{q₁,…,q_k},进而提取ESG变量的正交分量ξ⊥,该分量表示与传统因子空间正交的“纯ESG”效应。在2017–2022年样本中,原始ESG得分与价值因子(HML)相关性约为0.35,与盈利因子(RMW)相关性约为0.40;正交化后相关系数均降至约0.20,决定系数r²<0.05,同时正交化ESG指标仍保留约0.28的横截面标准差。随后,研究使用XGBoost梯度提升模型预测个股超额收益。模型以池化面板方式训练,训练集为2017–2020年,样本外测试集为2021–2022年。特征集包括滞后1–12个月收益、基本面比率(市盈率、市净率、股息率)、正交化ESG得分、Fama-French因子暴露及月度宏观指标。XGBoost模型通过顺序组合多个弱学习器(决策树)来修正前一集成模型的残差,并利用L1与L2正则化防止过拟合。模型损失函数采用平方误差或Huber损失。第二模块为带ESG约束的组合优化与市场均衡分析。优化问题以最小化追踪误差波动率(x−x₀)ᵀΣ(x−x₀)为目标,约束包括全额投资xᵀ1=1、非负权重x≥0、收益目标(x−x₀)ᵀμ=g以及ESG约束(x−x₀)ᵀξ≥0。其中x为组合权重,x₀为Russell 3000市值加权基准,Σ为收益协方差矩阵,μ为XGBoost预测的期望收益向量,ξ为原始(非正交化)ESG得分向量,g为相对基准的收益超调目标。由于非负约束的存在,该问题不存在闭式解,须通过凸二次规划数值求解。研究进一步构建了异质投资者市场均衡的蒙特卡洛模拟。设定比例为α的投资者面临ESG约束型委托(问题7),比例为(1−α)的传统投资者求解相同的TEV最小化问题但无ESG下限(问题8)。总需求为d_i=αx_i^(esg)+(1−α)x_i^(trad)。市场出清条件为αx^(esg)(p)+(1−α)x^(trad)(p)=s,其中s为归一化供给向量。价格与预期收益通过μi=(E[v{i,t+1}]−p_i)/p_i联系。均衡价格通过试探法(tâtonnement)迭代求解,每次迭代根据超额需求z=d−s更新价格p_i^(τ+1)=p_i^(τ)(1+ηz_i^(τ)),当‖z‖∞<10⁻⁵时收敛。基准情景设定α=0.30,进行10000次蒙特卡洛情景模拟,每次情景中随机抽取收益向量r~(s)~N(μ,Σ),更新期望收益并重新求解组合优化。第三模块为基于TOPSIS的多准则组合选择。每个候选组合的性能向量c_j=(r_j,σ_j^(TEV),esg_j^(active),ρ_j),分别表示期望追踪误差收益(最大化)、追踪误差波动率(最小化)、主动ESG得分(最大化)与稳健性度量(例如蒙特卡洛情景收益标准差,最小化)。TOPSIS流程包括向量归一化、权重赋值、确定正理想解与负理想解、计算欧氏距离以及计算偏好系数CC_j=d_j⁻/(d_j⁺+d_j⁻),选择CC值最大的组合作为最优组合。

主要结果分为四个层次。第一,机器学习预测性能方面,XGBoost(正交ESG)模型样本外R²约为0.08,显著优于线性因子模型的0.03,相对均方根误差(RMSE)降低约17.5%;使用原始ESG得分的XGBoost样本外R²为0.06,表明正交化处理具有增量价值。样本内R²为0.14,样本外0.08,表明存在中等程度过拟合,但符合XGBoost正则化特性。稳健性检验使用2017–2019年训练、2020–2022年测试的替代窗口,得到样本外R²为0.071,结果定性一致。SHAP分析表明,正交化ESG得分对预测能力的贡献约为8%–12%,且贡献呈非线性模式:在ESG分布尾部资产的边际贡献最大。第二,组合优化前沿方面,ESG约束在收益目标g∈(0%,4.56%)区间内改善均值-方差效率,方差降低最高达最小方差组合方差的1%;当g>4.56%时,ESG约束增加组合方差。二者的交叉点g=4.56%源于两种相反力量的抵消:ESG下限诱导组合向防御性板块(公用事业、必需消费品)倾斜,在负ESG溢价条件下这些板块同时具有高ESG与低绝对方差特征,从而降低总方差xᵀΣx;但当收益目标过高时,收益约束迫使组合加载于高预期收益但低ESG的资产,ESG下限与收益目标冲突,总方差上升。第三,市场均衡分析方面,在α=0.30的基准情景下,ESG溢价约为每年−45个基点(95%置信区间为[−56,−34],p<0.01)。敏感性分析表明,溢价随α近似线性变化:α=0.10时为−15个基点,α=0.20时为−31个基点,α=0.40时为−58个基点,α=0.50时为−69个基点。这表明ESG溢价主要由机构ESG委托产生的需求压力驱动,而非ESG特定风险补偿。第四,样本外回测方面,2021–2022年期间,基于XGBoost的ESG组合年化收益率为9.2%,年化波动率为12.8%,Sharpe比率为0.72,最大回撤为−14.3%,平均月度换手率为8.7%,主动ESG得分为0.18;历史基准组合(使用36个月滚动历史收益均值替代XGBoost预测、其余约束相同)的对应指标为年化收益率7.1%、年化波动率12.3%、Sharpe比率0.58、最大回撤−16.8%、换手率6.2%、主动ESG得分0.15。这表明机器学习预测模块带来的风险调整收益改善具有经济意义,且未因过度再平衡而侵蚀收益。TOPSIS选择结果方面,等权重方案下最优组合的期望收益为8.5%,TEV为4.2%,主动ESG得分为0.18,稳健性为1.8%,偏好系数CC=0.68。在六种替代权重方案(收益导向、风险导向、ESG导向、稳健性导向、收益-风险双导向、ESG-稳健双导向)下,CC值范围为0.55–0.75,最优组合始终处于同一聚类中。

结论指出,当ESG变量经过适当正交化处理且收益通过机器学习预测时,ESG委托不仅能与中等收益目标下的受托责任兼容,还能提供改善的风险调整后绩效;负ESG溢价是一个需求驱动的均衡现象;TOPSIS为多目标权衡提供了原则化选择机制。研究具有双重价值:在科学层面,它将机器学习预测、正交化处理、约束优化、均衡分析与多准则决策整合为统一框架,解决了ESG组合管理中的多重共线性、非线性收益预测与数值优化兼容性问题;在应用层面,该方法操作上可实现,依赖开源工具(Python、scikit-learn、XGBoost、CVXPY)和标准优化求解器,可用于机构投资者的ESG委托资产配置。

研究亮点包括:第一,通过Gram-Schmidt正交化将ESG与传统因子的相关性降至r²<0.05,有效隔离了纯ESG信号,提升了统计稳定性与模型可解释性;第二,XGBoost模型样本外R²较线性基准高出5个百分点,RMSE降低17.5%,SHAP分析揭示了ESG效应的非线性与尾部异质性;第三,在统一的基准相对TEV框架下,精确刻画了ESG约束改善均值-方差效率的收益目标阈值g*=4.56%,并详细解释了总方差降低的机制(防御性板块倾斜效应);第四,通过异质投资者均衡模型与试探法价格调整,量化了ESG溢价的α敏感性,证实其需求驱动属性;第五,TOPSIS多准则选择在多种权重方案下保持稳健性,CC值区间为0.55–0.75。

研究也存在若干局限。样本仅使用LSEG(原Refinitiv)ESG评分,不同评级机构间存在分歧;收益分布假设为正态分布,未考虑尾部风险与不对称性;未显式建模市场状态转换;未纳入交易成本;样本外窗口仅两年且包含疫后复苏期。未来研究应使用Copula模型或Student-t分布处理非正态性,采用隐Markov模型刻画状态转换,并将XGBoost与循环神经网络或Transformer等深度学习架构进行基准比较,以及将框架扩展到多期、多资产类别情景中。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com