分享自:

使用机器学习方法识别前列腺癌影响因素的系统综述

期刊:asian pacific journal of cancer preventionDOI:10.31557/apjcp.2025.26.5.1519

基于机器学习方法识别前列腺癌影响因素:一项系统综述的学术报告

一、研究概述

本文介绍的研究由来自伊朗哈马丹医科大学(Hamadan University of Medical Sciences)的研究团队完成,第一作者为Serveh Mohammadi,通讯作者为Behzad Imani(邮箱:behzadiman@yahoo.com),其他作者包括Soheila Saeedi和Mohammad Ali Amirzargar。该研究发表于《Asian Pacific Journal of Cancer Prevention》2025年第26卷第5期,页码1519至1528,数字对象标识符(DOI)为10.31557/APJCP.2025.26.5.1519。该文属于类型b,即一篇系统综述(systematic review),而非单一原始研究。

二、研究背景与目的

前列腺癌(prostate cancer)是全球男性中第二常见的恶性肿瘤,也是第五大癌症相关死因。根据世界卫生组织(WHO)2022年的统计数据,全球前列腺癌新发病例达1,467,854例,死亡病例394,430例,占所有癌症死亡人数的7.3%。美国国立卫生研究院(NIH)估计2024年将有299,010例新发前列腺癌病例,并导致34,250人死亡,其中66岁以上人群占死亡人数的55%。随着全球人口的增长和老龄化,预计到2030年,前列腺癌的发病率将上升至170万例。前列腺癌的病因尚未完全阐明,已确认的不可改变危险因素包括年龄、种族和遗传,而可改变因素包括饮食、体力活动、肥胖和吸烟等。近年来,人工智能(artificial intelligence, AI)和机器学习(machine learning, ML)方法在医疗领域的应用日益广泛,为从海量医疗数据中提取隐藏知识和识别疾病危险因素提供了有力工具。然而,此前尚无系统综述专门总结利用机器学习方法识别前列腺癌风险因素的研究。因此,本研究旨在通过系统综述的方法,引入机器学习技术所识别出的前列腺癌影响因素,并总结常用的机器学习算法、软件工具和数据来源。

三、研究方法

本研究严格遵循PRISMA(Preferred Reporting Items for Systematic Reviews and Meta-Analyses)指南进行。研究团队系统检索了四个主要数据库:PubMed、Scopus、Web of Science和IEEE Xplore,检索时间范围为2015年初至2024年2月17日。检索关键词分为两大类:人工智能相关关键词(如machine learning、deep learning、data mining、neural network、genetic algorithms、random forest、support vector machine、Bayesian network、decision tree等)和前列腺癌相关关键词(如prostatic neoplasms、prostate cancer、cancer of the prostate等)。两类关键词内部使用”OR”运算符连接,两类之间使用”AND”运算符组合。在IEEE Xplore数据库中,仅纳入”会议论文”和”期刊论文”两类文献;在Scopus、PubMed和Web of Science中,限制仅基于文章标题进行筛选。

研究的纳入标准包括:(1)涉及诊断为前列腺癌的人类参与者的研究;(2)使用机器学习方法调查前列腺癌潜在危险因素的研究;(3)以英文发表的研究。排除标准包括:(1)非同行评议的文章、系统综述、荟萃分析、致编辑信和评论;(2)涉及动物或体外实验的研究;(3)未报告前列腺癌危险因素的研究。

文献筛选过程如下:初步检索共获得3,369篇文章(Web of Science 710篇、Scopus 703篇、PubMed 1,020篇、IEEE 936篇)。去除1,018篇重复文献后,剩余2,351篇进行标题和摘要筛选。经过标题和摘要审查后,35篇文章进入全文评估阶段。在全文筛选中,12篇文章被排除,原因包括:无法获取全文(3篇)、未提及影响前列腺癌的危险因素(7篇)、非英语语言(2篇)。最终23篇文章被纳入本系统综述。研究团队还检查了所有纳入文章的参考文献列表,但未发现额外的相关研究。

数据提取使用Excel表格进行,提取的信息包括:作者姓名、发表年份、国家、出版物类型(期刊或会议论文)、期刊或会议名称、机器学习方法、样本量、训练集和测试集大小、危险因素、使用的软件、数据来源、数据收集时间(前瞻性或回顾性)以及研究局限性。需要说明的是,由于并非所有文章都明确说明了研究开展的国家,本综述中”国家”一项对应的是第一作者所属机构所在的国家。数据分析采用描述性报告方式,由于研究结果的多样性,未进行荟萃分析(meta-analysis)。Endnote软件用于文献管理,Excel用于数据分析。

四、主要结果

纳入研究的一般特征

23篇纳入研究中,最早的研究发表于2015年,最新的发表于2024年。大多数研究发表于2019年(6篇,26.09%)和2018年(5篇,21.74%)。第一作者来自澳大利亚、中国、德国、伊朗、以色列、意大利、塞尔维亚、新加坡、西班牙、中国台湾、英国、美国和越南。其中中国有7项研究,西班牙有3项,塞尔维亚和中国台湾各有2项,其余国家各1项。在23篇研究中,21篇发表于期刊,2篇发表于会议。《The Journal of Urology》发表了2篇相关文章,其他期刊各发表1篇。

机器学习方法、软件与性能

大多数研究使用了不止一种机器学习方法进行数据分析。逻辑回归(logistic regression)、支持向量机(support vector machine, SVM)和随机森林(random forest)是最常用的三种方法,每种方法均在6项研究中使用。人工神经网络(artificial neural network, ANN)在4项研究中使用。关于数据分析软件,5项研究未提及所使用的软件。R软件在6项研究中使用,Python在5项研究中使用,MATLAB在3项研究中使用。其他提到的软件包括SPSS、WinBUGS、SAS和Kaluza。

数据来源

数据收集方法方面,2项研究(8.7%)为前瞻性设计,21项(91.3%)为回顾性设计。用于训练和测试机器学习方法的样本量差异很大,最小为71例,最大为514,878例,中位数为941例。10项研究未提及训练集和测试集的数据划分比例;在提及划分比例的研究中,通常使用70%-80%的数据用于训练,20%-30%的数据用于验证或测试。所有23篇文章均说明了数据来源。最常见的数据来源是医院(12项研究),其次是MCC-Spain研究数据库(3项研究)。此外,若干研究使用了已有的数据集或注册数据库,如SEER(Surveillance, Epidemiology, and End Results)、PLCO(National Cancer Institute’s Prostate, Lung, Colorectal, and Ovarian Cancer Screening Trial)和NCBI(National Center for Biotechnology Information)。

影响前列腺癌的因素

机器学习方法揭示了超过30个可能影响前列腺癌的因素。其中,年龄(age)在11项研究中被提及为有效因素,是最常被识别的危险因素。前列腺特异性抗原(prostate-specific antigen, PSA)水平在7项研究中被提及;游离前列腺特异性抗原(free PSA, fPSA)、总前列腺特异性抗原(total PSA, tPSA)和PSA密度(PSA density, PSAD)各在6项研究中被提及;前列腺体积(prostate volume)在4项研究中被提及;单核苷酸多态性(single nucleotide polymorphism, SNP)、体质指数(body mass index, BMI)和游离/总PSA比值(f/t PSA)各在2项以上研究中被识别。其他被提及的因素还包括:内外腺体边界、直肠指检(digital rectal examination, DRE)结果、多种遗传变异、格里森评分(Gleason score)、身高、某些食物和饮料摄入(如人工甜味剂、苏打水、面包、糖、垃圾食品、乳制品甜点、番茄、罐装鱼、红肉和加工肉类、蛋白质、豆奶)、维生素D、微小RNA(microRNAs, miRs)、重金属(锌、砷、锰、锑)、总体变化率(rate of change, ROC)、近期变化率、二甲双胍(metformin)、脑钠肽前体、游离钙、载脂蛋白E比值、载脂蛋白A1、肌酸蛋白T、氯、表型特征、fPSA/PSA比值、iGPSAD、eGPSAD、二维超声评分、超声造影评分、弹性评分和血清锌浓度等。

纳入研究的局限性

纳入研究中提到的主要局限性包括:(1)未考虑所有可能对前列腺癌诊断有用的因素(5项研究提及);(2)样本量小(5项研究提及);(3)单中心设计(4项研究提及);(4)回顾性设计(4项研究提及);(5)推广性受限(3项研究提及)。

五、讨论与结论

本系统综述的核心发现可归纳为以下几点:首先,年龄是前列腺癌最重要的危险因素,在近一半的纳入研究中被确认。多项前期研究也一致支持年龄与前列腺癌风险的密切关联,例如Dite等人的研究发现60-69岁年龄组的前列腺癌患病率最高;Omankwu等人指出55-69岁男性是前列腺癌筛查的关键人群;Barlow等人的研究强调55至69岁是前列腺癌风险评估和筛查的重要年龄段。其次,PSA相关指标(包括PSA水平、fPSA、tPSA和PSAD)是机器学习方法最常识别的生物标志物类危险因素。这与Harvey等人、Merriel等人和Ilic等人的既往系统综述结论一致,即PSA在前列腺癌诊断和筛查中具有较高的敏感性和临床应用价值。第三,R软件和Python是前列腺癌机器学习研究中最常用的数据分析工具。第四,逻辑回归、支持向量机和随机森林是最常使用的机器学习算法。第五,在数据来源方面,医院数据是最常用的来源,而MCC-Spain、SEER、PLCO和NCBI是重要的公共注册数据库。

本研究的科学价值在于,它是首个系统总结利用机器学习方法识别前列腺癌风险因素研究的系统综述,为后续研究提供了方法学参考和数据来源建议。其应用价值在于,通过明确年龄和PSA相关指标等核心危险因素,有助于指导前列腺癌的预防策略和筛查方案的制定,特别是在中国和西亚等前列腺癌筛查尚未普及的地区。研究团队建议未来研究应考虑更大的样本量、前瞻性设计、多中心合作,并纳入遗传、环境和临床等多维度因素,以提高诊断准确性和临床适用性。

六、研究亮点

本研究的亮点主要体现在以下几个方面:其一,这是该领域首篇系统综述,填补了利用机器学习方法识别前列腺癌危险因素研究的综合性总结空白;其二,研究严格遵循PRISMA指南,系统检索了四个主要数据库,文献筛选流程规范透明;其三,研究不仅总结了危险因素,还全面分析了机器学习算法选择、软件工具使用和数据来源分布,为后续研究提供了实用参考;其四,研究团队还检查了所有纳入文章的参考文献,降低了漏检相关文献的可能性。

七、研究局限性

需要说明的是,本研究存在一些局限性:仅检索了四个数据库且仅限于英文文献;部分合格研究的全文无法获取;由于未进行荟萃分析,无法评估结果的质量;纳入研究中91.3%采用回顾性数据收集方式,可能增加偏倚风险;样本量差异巨大(71至514,878),统计功效差异显著;10项研究未明确报告训练集和测试集的划分,数据处理的透明度不足;单中心研究因数据来源局限而在结果推广性方面存在限制。此外,前列腺癌受地理和空间因素影响,本研究的结论可能更适用于西亚国家。尽管如此,该综述仍为前列腺癌风险因素的机器学习研究提供了有价值的见解,明确了年龄、PSA水平、fPSA、tPSA和PSAD为最重要的危险因素,并指出了逻辑回归、支持向量机和随机森林为最常用的机器学习方法,对推动该领域的后续研究和临床应用具有重要的参考意义。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com