分享自:

基于不完整因子设计的航天器空气动力学数据融合代理模型构建

期刊:Advanced Materials ResearchDOI:10.4028/www.scientific.net/amr.1016.405

针对航天器空气动力学问题构建数据融合代理模型:一种基于非完整析因试验设计的方法

一、研究作者、机构与发表信息

本研究的论文题为《Building data fusion surrogate models for spacecraft aerodynamic problems with incomplete factorial design of experiments》,发表于期刊 Advanced Materials Research(第1016卷,2014年,页码405-412)。该研究由多方机构合作完成,主要作者和机构包括:

  • Mikhail Belyaev, Evgeny Burnaev, Ermek Kapushev 来自 Datadvance, LLC(俄罗斯莫斯科)和 俄罗斯科学院信息传输问题研究所 以及 莫斯科物理技术学院预模实验室
  • Stephane Alestra 来自 Airbus Group(法国图卢兹)。
  • Marc Dormieux, Antoine Cavailles, Davy Chaillot, Eugenio Ferreira 来自 Airbus Defence and Space(法国莱米罗)。

该研究于2014年6月26日提交,并于2014年8月28日在线发表,旨在解决航天器设计中空气动力学数据建模的核心挑战。

二、研究背景与目标

在航天器设计与研发过程中,构建精确的空气动力学模型至关重要。该研究领域位于计算工程与数据科学的交叉点。Airbus Defence and Space 在开发各类航天器时,需要整合两种不同来源的数据来生成气动数据库(Aerodynamic Database, AEDB)。第一种是源自风洞试验(Wind Tunnel Testing, WTT)的高保真度(high fidelity, HF)数据,置信度高但成本极其昂贵;第二种是源自计算流体动力学(Computational Fluid Dynamics, CFD)仿真的低保真度(low fidelity, LF)数据,置信度相对较低,其精度取决于所采用的数值方法(如Euler方程或RANS方程)。

生成一个完备的气动数据库面临两大核心挑战:第一,多维插值/外推难题,即如何基于离散的输入数据,在全飞行包线内覆盖所有飞行条件(如马赫数、攻角、侧滑角)和飞行器构型(如舵面偏转);第二,多源数据融合难题,即如何对不同置信度、不同分布的数据进行组合,构建一个一致且同质化的模型。传统的通用近似算法,如高斯过程(Gaussian Process, GP)回归,在处理这类数据时表现不佳,因为其假设试验设计(Design of Experiments, DOE)相对均匀,而本问题中的DOE是由高、低两个具有显著尺寸差异的各向异性网格并集而成的一个非完整析因设计(incomplete factorial design of experiments, incomplete factorial DOE),数据分布极不均匀,导致传统方法在缺乏训练数据的大片区域容易出现震荡和超调(overshoots)。因此,该研究的目标是开发一种快速、精确且能考虑不同数据保真度和特殊DOE结构的代理模型(surrogate model)构建算法。

三、研究工作流程与方法

为攻克上述难题,研究团队基于“张量积近似”(Tensor Product of Approximations)理论,开发了三种不同的数据融合策略,并将其统称为ITA(对非完整析因试验设计的张量积近似)方法。整个方法论的工作流程主要分为以下三个步骤:

第一步:构建基于张量积的近似模型框架 首先,研究者定义了近似问题。对于函数 (g: mathbb{R}^d \rightarrow \mathbb{R}),给定训练集 (S = {x, g(x)}),目标是找到一个函数 (f^*),使其最小化损失函数,该损失函数由误差平方和与一个惩罚项构成。该惩罚项 (p_\lambda(f)) 用于控制模型的变异性,例如可以是函数二阶导数的范数。 针对本问题的特殊DOE结构(多个一维因子的笛卡尔积或其子集),研究者选择了张量积形式的函数字典。具体而言,将定义在每个因子维度 (d_k) 上的函数字典 (Deltak) 通过张量积运算,构建定义在整个高维空间上的函数字典 (Delta{tensor})。近似模型 (f(x)) 即是该字典中所有函数的线性展开,其基函数形式为 (psi_{j1} otimes psi{j2} otimes cdots otimes psi{j_k})。 关键创新在于惩罚项的设计。惩罚项被定义为函数沿某个因子方向(或一组因子方向)的变异性度量。例如,沿第一个因子的变异性可通过对该因子方向求偏导数并取L2范数来计算。由于惩罚项是关于展开系数 (alpha) 的二次型,将原优化问题转化为一个可高效求解的二次型最小化问题:(min_a (y - Psi a)^T W (y - Psi a) + a^T Omega a),其中 (y)是扩展的训练值向量,(Psi) 是回归矩阵,(Omega) 是惩罚矩阵,(W) 是根据点是否属于完整析因网格而设定的对角权重矩阵。通过利用训练集的特殊张量结构、张量运算和共轭梯度法,该优化问题得到了极高效的求解。这套ITA框架为后续的数据融合方案提供了基础近似器。

第二步:提出并实现三种数据融合方案 基于ITA框架,研究提出了三种将高保真(HF)与低保真(LF)数据结合的方案,训练集 (S) 被分为两部分:HF样本 (S_h) 和 LF样本 (S_l)。

  1. 合并解决方案(Merged Solution):此方案直接修改训练集的标签值和权重。对于每个点,新的训练值 (y = w_h y_h + w_l y_l),权重 (w_h, w_l) 代表置信度,且 (w_h + w_l = 1)。数据处理规则如下:

    • 若点仅在LF集((x in sigma_l \setminus sigma_h)),则将LF值视为训练目标,权重为 (w_l)。
    • 若点仅在HF集((x in sigma_h \setminus sigma_l)),则训练目标为HF值,权重为 (w_h)。
    • 若点在两者交集((x in sigma_h \cap sigma_l)),则训练目标为加权和,权重为 (w_h + w_l)。 此方法的意图是在只有单一精度数据的区域拟合对应模型,在二者重叠区域拟合其加权融合模型。
  2. 融合解决方案(Fused Solution):此方案采用分步建模的思路。它假设LF函数 ((g_l(x))) 与HF函数 ((gh(x))) 之间存在一个偏差函数 ((g{diff}(x) = g_h(x) - gl(x)))。该方法首先在二者重叠的区域 ((sigma{both})) 计算出偏差值 (y{diff}),然后使用ITA构建偏差的代理模型 (\hat{g}{diff}(x))。随后,对于缺失HF值的点 (x \in sigma \setminus sigma_h),其HF估计值由公式 (\hat{y} = gl(x) + \hat{g}{diff}(x)) 计算得出。最终,利用包含原始HF值和这些估计值的完整数据集 (\hat{y}),再次使用ITA构建最终的目标函数近似模型。

  3. 局部保真度解决方案(Local Fidelity Solution):前述两种方案均假设数据的置信度是全局的。但研究者观察到,在存在大量HF实验点的区域,周围的CFD点应被视为低置信度的LF;而在完全没有实验点的区域,CFD点则应被当作高置信度的HF数据。基于此,研究提出了局部保真度(local fidelity)概念。其实现对每个点 (x) 动态计算局部权重 (\hat{w}_h(x)) 和 (\hat{w}_l(x))。权重通过一个高斯核密度估计定义:(\hat{w}k(x) = \sum{x’ \in \sigma_k} \exp\left(-\frac{||x - x’||^2}{h^2}\right), k \in {h, l})。这意味着,如果某点邻域内HF点越密集,(\hat{w}_h(x)) 越大,反之亦然。最终的输出值 (y(x)) 由公式 (y(x) = \frac{\hat{w}_h(x)}{\hat{w}_h(x)+\hat{w}_l(x)} g_h(x) + \frac{\hat{w}_l(x)}{\hat{w}_h(x)+\hat{w}_l(x)} g_l(x)) 确定。若某点的 (g_h(x)) 或 (g_l(x)) 未知,则先用对应数据集的近似值代替。

第三步:在真实数据集上进行验证与比较 研究者使用一个具有3维输入、3维输出、包含1846个HF点和180个LF点的真实数据集,从多个维度对三种方案进行了比较分析,包括一维和二维切片的可视化,以及通过移除部分HF点来检验模型在外推区域的预测能力。

四、主要研究结果与讨论

实验比较揭示了三种方案各自的特性和优缺点。

  1. 合并解决方案的结果:该方案在一维切片图中表现出了明显的缺陷。在同时存在HF和LF数据点的重叠区域,近似曲线出现了微小的奇异性(small singularities),表明模型在过渡区域的平滑性不佳。

  2. 融合解决方案的结果:该方法的关键弱点在于偏差模型 (\hat{g}{diff}(x)) 的构建。由于用于训练偏差模型的 (y{diff}) 仅存在于HF与LF数据的重叠区域,当需要将此模型外推到非重叠区域时,偏差近似函数会严重失真。实验结果显示(如图6所示),在外推区域,偏差近似值甚至会达到与HF或LF函数自身相同数量级的大值,这从物理意义上完全不合理,并给最终预测引入了巨大的不确定性。

  3. 局部保真度解决方案的结果:该方案表现出最优的性能。二维切片图清晰显示,局部保真度代理模型提供了平滑的近似,没有出现超调和震荡。尤其是在那些拥有HF点但没有LF点的区域(通过移除部分HF点来模拟),“合并”和“融合”方案的行为会发生剧烈变化并产生超调,而局部保真度模型则保持了稳定和合理的预测。它没有两者前两种方案的明显缺点。 然而,研究者也敏锐地指出了局部保真度方案的潜在不足:在仅有HF数据的区域,该模型会转化为纯粹的HF数据插值器,完全忽略了该区域LF模型与HF模型之间可能存在的系统性偏差,这同样可能不符合物理实际。相比之下,融合解决方案在理论上更能体现“在任何区域都应基于两种数据置信度进行加权”的物理过程,尽管其实践中对外推的精度依赖过高。

五、结论与研究价值

本研究针对拥有特殊非完整析因设计的空气动力学数据融合问题,开发了三种基于张量积近似(ITA)技术的解决方案。ITA技术本身因其能够利用数据集的特殊结构,从而在计算上非常高效。在三种方法中,合并方案主要用作基准参照,局部保真度方案能提供高质量平滑近似但其行为并非始终符合物理规律,而融合方案因其遵循物理过程的潜力被认为是最有前景的。

研究的科学价值与应用价值在于:为处理工程设计中普遍存在的多保真度、非均匀分布数据提供了新的方法论框架。它成功地将高效的张量积近似结构与灵活的局部置信度评估相结合,解决了传统通用算法(如高斯过程回归)在处理此类结构化非均匀数据时的失效问题。

主要结论与展望是:融合解决方案是目前最有前景的方向,但关于局部保真度和融合解决方案的后续工作并未结束,未来需要进一步的发展以消除已指出的缺点,例如提高偏差模型外推的鲁棒性或将物理约束更好地融入局部加权方案中。这项研究为航天器气动数据库的自动、精确生成开辟了新的道路。

六、研究亮点

本研究的亮点体现在以下几个方面: * 问题特异性:直面航天工业界真实的复杂数据问题——非完整析因DOE导致的高度各向异性数据分布,这是许多通用方法所忽略的。 * 方法论创新:将张量积近似这一高效的数学工具与数据融合问题相结合(ITA),并提出了新颖的“局部保真度”概念,动态地根据邻域数据密度调整各数据源的置信度,具有一定的独创性。 * 系统性的比较:不仅提出算法,还对三种不同逻辑(直接合并、分步偏差建模、局部加权)的融合方案进行了系统的定量和定性比较,深刻剖析了各自的物理合理性与数值缺陷,为读者提供了清晰的优劣判断依据。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com