分享自:

保护轨迹隐私:以用户为中心的分析

期刊:Journal of Network and Computer ApplicationsDOI:10.1016/j.jnca.2017.01.018

本文属于类型a,是一篇原创性研究论文。下面为针对该研究的学术报告。

本文的主要作者为Hang Shen、Guangwei Bai、Mei Yang和Zhonghui Wang,均来自南京工业大学计算机科学与技术学院。该研究发表于Journal of Network and Computer Applications,于2017年1月21日在线发表,卷号为82,页码为128–139。

一、研究背景

本研究属于位置隐私保护与移动安全领域,具体关注基于位置的服务中的轨迹隐私保护问题。位置基服务(Location-based Service, LBS)在为用户提供便利的同时,也带来了位置信息泄露的风险。现有位置隐私保护机制(Location Privacy Protection Mechanism, LPPM)的评估方法主要关注单次查询时刻的位置隐私,而较少考虑用户在一段时间内连续发起多次查询所形成的轨迹隐私。攻击者可以利用用户的历史移动数据挖掘兴趣点(Point of Interest, POI),获取用户的活动语义属性和移动特征,从而对用户的连续查询轨迹实施跟踪攻击(Tracking Attack)。现有研究往往忽略了查询行为对轨迹隐私的影响,也未能在统一框架下比较不同类型LPPM在不同约束条件下的表现。因此,本文的核心目标是:在质量损失(Quality-loss)和能量消耗(Energy Cost)约束下,从以用户为中心(User-centric)的视角分析查询行为对轨迹隐私保护效果的影响,并对基于精度(Precision-based)和基于虚假位置(Dummy-based)的两类LPPM进行细粒度比较。攻击与防御问题被形式化为贝叶斯斯塔克尔伯格博弈(Bayesian Stackelberg Game)。

二、研究流程与实验方法

本研究的核心流程包括系统建模、博弈模型构建、真实轨迹数据上的兴趣点挖掘、查询过程刻画以及仿真评估五个主要环节。

首先,研究团队建立了单用户系统模型。假设用户在一个被均匀划分为m个离散区域的范围内移动,每个区域代表一个最小粒度的位置。用户在移动过程中会从对其有意义的POI发起LBS查询,由此形成真实位置轨迹和真实活动轨迹。用户的活动画像(Activity Profile)和移动画像(Mobility Profile)分别通过活动轨迹转移概率分布和位置轨迹转移概率分布来描述。LPPM的功能是将真实位置轨迹替换为伪位置轨迹(Pseudo-location Trajectory)。基于精度的LPPM通过降低位置精度来保护隐私,而基于虚假位置的LPPM则生成多个虚假查询位置以混淆真实查询。攻击者能够获取用户的历史轨迹,挖掘其POI和活动规律,并理解LPPM的算法逻辑,从而对观测到的伪位置轨迹进行轨迹推断攻击。

其次,为量化轨迹隐私,研究定义了三个关键性能指标:质量损失、能量消耗和轨迹隐私。质量损失通过真实轨迹与伪位置轨迹之间的平均欧氏距离度量;能量消耗通过伪位置中包含的额外区域数量来估计,对于基于精度的LPPM,上传每个额外区域消耗一个单位能量,而对于基于虚假位置的LPPM,上传和下载每个虚假位置共消耗两个单位能量;轨迹隐私则综合了位置轨迹隐私和活动轨迹隐私,通过汉明距离(Hamming Distance)计算推断轨迹与真实轨迹之间的误差。

第三,攻击与防御被建模为一个贝叶斯斯塔克尔伯格博弈。用户作为领导者先选择LPPM策略,攻击者作为跟随者在观测到伪位置轨迹后选择最优推断策略。用户的目标是在满足质量损失约束和能量消耗约束的前提下最大化期望轨迹隐私,攻击者的目标是最小化用户的期望轨迹隐私。双方的最优策略分别通过线性规划求解。

第四,在实验环节,研究使用微软亚洲研究院GeoLife项目提供的真实GPS轨迹数据集,选取编号为153的用户全年的轨迹数据进行分析。用户移动区域约为5.5 km × 10.2 km,被划分为4364个区域。为构建用户的活动画像和移动画像,研究采用基于位置历史的POI挖掘算法,其中包括停留点检测算法和OPTICS聚类算法。观测时间长度t分别设为1小时、2小时、3小时和4小时,观测时间内的LBS查询次数n分别设为1、2和3次。查询过程被建模为泊松过程(Poisson Process),泊松速率λ设置为3。

最后,在MATLAB环境下使用线性规划求解器对公式(21)和(29)进行求解,得到最优期望轨迹隐私及其对应的最优攻击与防御策略。

三、主要结果与分析

第一组实验研究了质量损失约束对轨迹隐私的影响。结果显示,随着质量损失约束阈值的增大,最优期望轨迹隐私先增加后保持不变。当n=1时,两类LPPM的轨迹隐私均处于最低水平且数值相近;随着n增加,两者均提高;但在n不变时,随着t延长,轨迹隐私逐渐下降。特殊的是,当n=2、t=1小时时,基于精度LPPM的轨迹隐私低于t为2、3或4小时的情况。在能量约束较紧(e_cost^max=0.25)时,基于虚假位置的LPPM优于基于精度的LPPM;在能量约束较松(e_cost^max=5)时,基于精度的LPPM表现更好。这说明基于虚假位置的LPPM更适合严格能量约束,而基于精度的LPPM在宽松能量约束或严格质量损失约束下更有效。

第二组实验分析了达到最优轨迹隐私时的质量损失特征。研究发现,基于精度LPPM在最优轨迹隐私下的质量损失低于基于虚假位置LPPM,原因在于后者为了增强位置语义多样性,倾向于选择更远的伪位置,从而导致更高的质量损失。随着n增加,质量损失总体上升;但n不变且t增加时,质量损失下降。这表明增加查询次数虽然提升隐私,但会增加质量损失;延长观测时间则可在相同查询次数下降低质量损失。

第三组实验研究了能量消耗约束对轨迹隐私的影响。当质量损失约束较紧(q_loss^max=0.1)时,轨迹隐私随能量约束变化表现出较高波动性,且n=3时的隐私普遍高于n=1或2。当质量损失约束较松(q_loss^max=10)时,轨迹隐私随能量约束增大而上升并最终趋于平稳,n越大隐私越高。对于大部分t和n组合,基于虚假位置的LPPM在严格能量约束下提供更好的隐私保护。

第四组实验分析了达到最优轨迹隐私时的能量消耗特征。结果表明,基于精度的LPPM在最优隐私下的能量消耗通常高于基于虚假位置的LPPM,这是因为其需要覆盖更大的地理区域以增加匿名位置,以满足位置语义多样性要求。结果还表明,能量消耗与质量损失之间存在正相关关系,尤其在约束水平较高时更为明显。这意味着可以在轨迹隐私、质量损失和能量消耗之间寻找最优折中组合。

四、结论与价值

研究得出结论:最优轨迹隐私在很大程度上依赖于用户的查询行为,尤其是观测时间内的LBS查询次数。尽管增加查询次数能够提升轨迹隐私,但在相同查询次数下,延长观测时间会降低LPPM的有效性;而在相同查询速率下,延长观测时间反而有利于隐私提升。基于虚假位置的LPPM在严格能量约束下通常提供更好的保护,而基于精度的LPPM在严格质量损失约束或宽松能量约束下表现更优。在达到最优轨迹隐私时,基于精度LPPM的质量损失更低,但能量消耗更高。

本研究的科学价值在于将轨迹隐私保护问题置于贝叶斯斯塔克尔伯格博弈框架下,实现了查询行为、攻击者背景知识以及质量损失和能量约束的统一建模。应用价值在于为LBS用户提供了在不同约束条件下选择合适LPPM类型的依据,并为设计更高效的轨迹隐私保护机制提供了理论支持。

五、研究亮点

本研究的亮点主要体现在三个方面:第一,提出了以用户为中心且包含查询行为的轨迹隐私量化模型,弥补了现有研究主要关注单次查询隐私的不足;第二,将攻击者背景知识扩展至活动画像与移动画像,揭示了活动语义信息对轨迹推断攻击的影响;第三,在真实轨迹数据上对基于精度和基于虚假位置的LPPM进行了系统比较,明确了它们在不同约束条件下的相对优劣。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com