Open Access
A pulmonary nodule is worth 8 × 8 × 8 words: Computed tomography-based 3D vision transformer predicts early-stage high-grade lung adenocarcinoma of micropapillary and/or solid subtypes Yin Zhou, Yiyang Wang, Cheng Li, Shanshan Wang, Yuning Pan, Weiyu Shen, Chengbin Lin, Xinzhong Ruan, Xianwang Ye, Zhenya Zhao, et al.
Intelligent Medicine Vol.06, No.02 2026
DOI: 10.1016/j.imed.2025.11.001
背景 早期高级别肺浸润性腺癌(IAC)预后不良,使用常规放射学评估难以识别。目前依赖术后组织学来识别高级别亚型延迟了风险适应的手术计划。三维(3D)视觉转换器(ViTs)可以通过对计算机断层扫描(CT)扫描中的长程依赖性建模来改进预测。我们旨在开发和验证3D-ViT和Swin Transformer(SwinT),用于术前基于CT的早期高级别IAC亚型(微乳头状/实性)预测,以ResNet为基准。
方法 将1028例手术证实的早期肺腺癌患者的多中心队列分为训练(n =806),验证(n =100)和外部测试(n =122)组。在CT上训练3D-ViT、SwinT和ResNet模型,以对具有高级组织学模式的结节进行分类。为IAC手术提供了一种新的决策辅助工具。使用曲线下面积(AUC)、准确度、灵敏度、特异性和精密度评估性能。进行注意力映射以解释3D-ViT决策。
结果 3D-ViT模型的AUC值为0.856(95%CI:0.845-0.877)(验证)和0.806(95%CI:0.790-0.816)(测试),而ResNet基线的AUC值为0.854(95%CI:0.841-0.872)(验证)和0.760(95%CI:0.743-0.776)(测试)。3D-ViT在验证集中显示了平衡的准确度、灵敏度、特异性和精密度。在外部测试中,3D-ViT在所有指标上都显著优于ResNetP< 0.01.决策辅助工具中基于SwinT的AlignSen模型优先考虑高等级IAC的敏感性(88.0%验证,93.4%测试),同时保持特异性(76.0%验证,54.1%测试),这显著优于基于ViT和ResNet的AlignSen模型的特异性(分别为60.0%和54%验证,52.5%和24.6%测试)。注意力图突出了3D结节异质性和外周不规则性。
结论 3D-ViT模型在使用CT图像预测高级别IAC亚型方面表现出稳健的准确性和可推广性。将术前SwinT整合到临床工作流程中可能为术中病理分型提供一种可行的替代方案,有可能减少对冰冻切片的依赖,同时优化手术计划。
Open Access
Cross-sectional comparative evaluation of US and China-developed large language models for bilingual coronary heart disease patient education Kaiyuan Liu, Long Cheng, Wanxin Wang, Runda Wu, Chenguang Li, Kang Yao, Junbo Ge
Intelligent Medicine Vol.06, No.02 2026
DOI: 10.1016/j.imed.2025.11.002
背景 大型语言模型(大语言模型)越来越多地促进了冠心病(CHD)的患者教育。然而,尚不清楚模型的起源(美国与中国)是否会影响其在提供冠心病相关患者教育方面的表现。本研究旨在系统比较六种主流大语言模型在回答以英文和中文提出的常见冠心病相关患者问题时。
方法 2025年2月1日至15日期间,我们向六名大语言模型提出了30个经临床医生验证的冠心病问题(从门诊记录中提取):GPT-4o、OpenAI o1、Gemini 1.5(美国);以及DeepSeek-R1、“文心一言”3.5、斗宝(中)。每个提示都是用英文和中文询问的。每个提示都是用英文和中文询问的。三名盲态心脏病专家采用4分李克特量表对每个答案的准确性、全面性、可理解性和同理心进行评分。使用具有logit链接函数的累积链接混合模型(CLMMs)分析评级,包括模型、语言和维度的固定效应,以及它们的相互作用和问题和评级者的随机截距。III型似然比χ 2 测试评估了主要效应和相互作用,然后是霍尔姆调整的成对对比。使用Fleiss'量化评分者之间的一致性κ .
结果 三名心脏病专家独立评估了360份双语回答,评分者间可靠性高(Fleiss’κ =0.821).在CLMMs中,存在显著的模型和维度主效应,以及模型×语言交互和模型×语言×维度主效应。与GPT-4o相比,OpenAI o1获得卓越评级的几率最高(OR=4.45,95%CI:3.01-6.57,P< 0.001),其次是DeepSeek-R1(OR=1.32,95%CI:0.97-1.78,P =0.038).语言分层对比显示,中文提示提高了全面性(OR=1.48,95%CI:1.01-2.17,P =0.045)和同理心(OR=2.14,95%CI:1.47-3.11,P< 0.001),但可理解性降低(OR=0.64,95%CI:0.42-0.98,P =0.042).Gemini 1.5中文优秀(OR=3.55, 95%CI:2.35-5.38,P< 0.001),而DeepSeek-R1更喜欢英语(OR=0.64,95%CI:0.41-0.99,P =0.046)和豆包青睐中文(OR=1.64,95%CI:1.08-2.49,P =0.020).
结论 提示语言和评价维度强烈影响模型性能。我们的基准为选择大语言模型进行双语患者教育的临床医生、患者和健康信息提供者提供了实用指导。
Open Access
Hemodynamic-morphologic machine learning model improves rupture risk stratification of intradural internal carotid artery aneurysms: A retrospective multicenter study Rong Zou, Shijie Zhu, Lifen Gan, Zhiwen Lu, Wei Lu, Jing Cai, Li Li, Lili Jiang, Jianping Xiang, Qinghai Huang
Intelligent Medicine Vol.06, No.02 2026
DOI: 10.1016/j.imed.2025.12.011
背景 与硬膜内颈内动脉(ICA)动脉瘤相关的破裂风险值得相当关注。我们的目标是开发第一个机器学习(ML)模型,该模型将标准化血流动力学特征与临床和形态学数据相结合,以对硬膜内ICA动脉瘤的破裂风险进行分层。
方法 我们连续纳入了2017年7月至2022年7月在四家医院接受DSA检查的511例硬膜内ICA动脉瘤。利用电子病历系统和AneuFlow软件的计算流体动力学,我们提取了动脉瘤的10个临床基线特征、13个形态学特征和12个血流动力学特征。随后,通过随机森林(RF)、XGBoost(XGB)、LightGBM(LGB)和逻辑回归(LR)模型对动脉瘤破裂的风险进行分层。来自三家医院的数据用于开发内部培训队列(n =331)和内部验证队列(n =83),而来自第四医院的数据有助于外部验证队列(n =97).使用曲线下面积(AUC)、敏感性、特异性和Youden指数评估模型在三个队列中的性能。此外,我们确定了ML模型的特征重要性排名。
结果 RF模型在内部训练队列中达到最高AUC 0.980(95%CI:0.969-0.989)。内部验证队列中RF、XGB、LGB和LR模型的AUC分别为0.872(95%CI:0.792-0.929)、0.874(95%CI:0.794-0.931)、0.852(95%CI:0.769-0.914)和0.827(95%CI:0.740-0.894)。在外部验证队列中,这些模型的AUC分别为0.820(95%CI:0.729-0.891)、0.772(95%CI:0.675-0.851)、0.782(95%CI:0.686-0.859)和0.782(95%CI:0.686-0.859)。此外,RF模型在外部验证队列中实现了最大的Youden指数(0.517),表明卓越的辨别能力。血流动力学占分层功效的57%,具有不规则几何形状(非球形指数>0.15)和微血管炎症标志物(最小壁切应力<0.3 Pa)被确定为关键驱动因素。
结论 针对硬膜内ICA动脉瘤设计的ML框架展示了强大的风险分层能力,允许更及时和个性化的临床诊断和治疗。
Open Access
Artificial intelligence-based retinal vascular fractal dimension quantification and related factors: A retrospective study Chuan Zhang, Haotian Wu, Saiguang Ling, Zhou Dong, Li Dong, Ruiheng Zhang, Wenbin Wei, Lei Shao
Intelligent Medicine Vol.06, No.02 2026
DOI: 10.1016/j.imed.2025.12.002
背景 分形维数f )量化血管网络复杂性和空间填充密度,为微血管病理学评估提供非侵入性生物标志物。我们的目标是建立一个人工智能(AI)驱动的自动化D框架f 定量并调查其在北京眼科研究普通人群中的临床意义。
方法 这项回顾性研究利用了2011年北京眼科研究的数据。用人工智能算法处理符合质量标准的眼底图像,以分割视网膜脉管系统并计算Df 多元线性和逻辑回归模型用于评估视网膜血管D的相关性f 包括全身和眼部参数。
结果 基于人工智能的视网膜血管D定量f 在3,298名参与者(3,468名参与者中的95.1%)中成功进行,证明了高模型性能:分割准确性(0.9660)、敏感性(0.8879)、特异性(0.9743)和交集超过并集(IoU)(0.7110)。平均Df 为1.51±0.09(中位数:1.53;四分位距:1.50-1.55)。在多元线性回归分析中,减少Df 与年龄较大显著相关(标准化回归系数β )=−2.346;P< 0.001),收缩压升高(sβ =−0.341;P< 0.001),臀围较小β =0.518;P =0.014),较低等效屈光度(sβ =3.589;P< 0.001),视网膜神经纤维层厚度较薄β =0.390;P =0.002),动静脉比值较小β =524.590;P< 0.001),中心凹下脉络膜厚度较薄β =0.071;P< 0.001).在logistic回归模型中,高血压的危险患病率随着D的减少而增加f (OR=0.853, 95%CI:0.651-0.801)。
结论 人工智能驱动的Df 分析可用作表征视网膜微血管形态学改变的新定量平台。
Open Access
From radiology findings to artificial intelligence-powered impressions: A retrospective study on the comparative performance of recent large language models Nanziba Tasneem, Christian B. van der Pol, Ambreen Zahoor, Nitin Juggath, Kyle McGowan, Cynthia Lokker, Ashirbani Saha
Intelligent Medicine Vol.06, No.02 2026
DOI: 10.1016/j.imed.2025.11.003
背景 大语言模型(大语言模型)是人工智能的革命性突破,可以用来自动生成放射学报告的印象,这通常需要时间、精力和训练。我们的目标是评估最近五款大语言模型(GPT-4、GPT-4O Mini、Gemini 1.5-Pro、Gemini 1.5-Flash和Llama 3.1)在印象生成方面的性能。
方法 在这项回顾性研究中,从来自PhysioNet的公开可用的“BioNLP 2023报告摘要”数据集(2001-2016年间收集,考虑抽样的训练子集大小为59,320)中抽取了100份放射学报告(每个报告组0-400、400-800、800-1,200、1,200-2,000和2,000-8,000,基于调查结果部分的字符计数)。然后,五名大语言模型中的每一名都被零镜头提示使用样本中的发现产生印象。评估生成的印象:(a)由两名放射学研究员和一个大型推理模型(LRM)Gemini 2.5-Pro主观地评估一致性、全面性、简洁性和医学危害性,以及(b)客观地使用复合准确性指标,包括面向回忆的gisting评估替角(ROUGE)-1、双语评估替角(BLEU)和余弦相似性,与原始人类专家生成的印象进行比较。根据主观分数和综合分数的百分比一致性排名对大语言模型进行排名。统计检验(Friedman和事后Nemenyi检验)用于评估模型间差异。
结果 排名靠前的型号是双子座1.5-Pro、GPT-4和双子座1.5-Flash。人类和LRM评分者在模型中的表现不同(Friedman检验:人类P< 1.82×10−6 ;LRMP< 9.10×10−40 ).前三个模型(0.69、0.68和0.68)的综合准确性得分显著高于其他模型(0.65;NemenyiP< 1.11×10−16 ).LRM与人类评分者密切一致(2.15%完全不同意),并识别了所有人类评分的不准确印象。
结论 Gemini 1.5-Pro在一致性、全面性和医疗危害性方面优于GPT-4,且成本更低。人类和LRM的评估通常是一致的,尽管LRM更保守。
Open Access
A retrospective validation of a federated machine learning framework (Hepa-FedBoost) for improving liver cancer computed tomography diagnosis across heterogeneous hospital networks Chengquan Li, Xiaobin Feng, Dong Li, Jiahong Dong
Intelligent Medicine Vol.06, No.02 2026
DOI: 10.1016/j.imed.2025.08.003
背景 使用对比增强计算机断层扫描(CT)开发用于肝癌诊断的准确人工智能(AI)模型通常受到患者隐私法规和医院之间相当大的数据差异的阻碍。这些变化——CT扫描仪、患者群体和疾病患病率——会降低标准协作训练方法(如联合学习(FL))的性能。这项回顾性研究评估了一种新的机器学习框架Hepa-FedBoost是否可以克服这些挑战,以提高模拟多中心网络中肝癌分类的诊断准确性,而无需共享原始患者图像。
方法 我们开发了一个新的基准数据集,以更好地代表真实世界的临床多样性。这是通过将来自MedMNIST v2数据集的公共OrganCMNIST子集的11个腹部器官的23,583张CT图像与来自500名组织病理学证实的肝癌患者的11,000张肝脏病变图像合并来完成的。这些癌症相关数据回顾性地从中国国家肝胆标准数据库(由北京清华长庚医院发起,数据收集自2019年12月)中获得。使用来自公共和私人来源的数据不需要患者或所有者的授权。该34,583张图像的组合数据集用于模拟12家医院的网络,这些医院在数据量和类别标签方面存在显著的不平衡。Hepa-FedBoost框架是一种聚类FL模型,在该网络上进行训练。该模型的工作原理是让每个模拟医院仅共享紧凑、匿名的数据摘要(原型),而不是模型参数或原始数据。中央服务器使用这些摘要对具有相似数据的医院进行分组,并指导训练过程以提高整体准确性。主要终点是受试者工作特征曲线下的宏观面积(mAUC)。此外,我们将Hepa-FedBoost的性能与其他6种已建立的FL方法进行了比较。
结果 在模拟医院网络上,Hepa-FedBoost展示了优越的诊断性能,与次优方法相比,肝癌分类mAUC提高了4.9个绝对点,整体准确度提高了2.4个绝对点。它仅在17轮训练中就达到了临床级准确性的阈值,比标准FedAvg方法快43%,同时将所需的总数据传输量减少了大约一半(至800 MB)。
结论 Hepa-FedBoost框架显著提高了CT图像上多中心肝癌分类的准确性和效率。通过支持强大的协作模型训练,同时维护患者隐私并最大限度地减少IT资源需求,它代表了现实世界医院网络的可行人工智能解决方案。
Open Access
A retrospective magnetic resonance imaging-based radiomics study for predicting lymph node regression status following neoadjuvant therapy in patients with locally advanced rectal cancer Tianxu Ma, Di Hao, Ruiqing Liu, Wentao Xie, Mingyu Yang, Junhao Zhang, Jingnong Liu, Zhenying Xu, Rujie Jiang, Xuejun Liu, et al.
Intelligent Medicine Vol.06, No.02 2026
DOI: 10.1016/j.imed.2025.12.005
背景 淋巴结转移(LNM)状态是局部晚期直肠癌(LARC)患者的关键预后标志物。新辅助放化疗(nCRT)可通过诱导消退来影响淋巴结状态,患者之间的治疗反应表现出很大的可变性。我们旨在开发和验证一种基于随机森林的放射组学模型,用于使用治疗前磁共振成像(MRI)无创预测LARC患者新辅助治疗后的淋巴结消退状态。
方法 这项回顾性研究纳入了2019年10月至2023年10月期间在青岛大学附属医院接受nCRT治疗后择期切除的285例LARC患者。患者以7:3的比例随机分配到训练组和测试组。比较了两组之间的基线特征,包括性别、年龄、体重指数(BMI)和其他13个临床变量,未观察到显著差异(P> 0.05).术前收集直肠区域的高分辨率T2加权MRI扫描。在MRI扫描上手动描绘对应于原发性肿瘤病变的感兴趣区域,随后进行放射组学特征提取。使用最小绝对收缩和选择算子(LASSO)回归模型进行特征选择。随后构建了机器学习随机森林预测模型,结合了选定的放射组学特征和临床变量。
结果 使用受试者工作特征曲线分析、曲线下面积(AUC)和校准曲线评估预测淋巴结状态的模型性能。从1,051个放射组学特征中选择四个特征来构建放射组学模型,在测试集中实现了0.743的AUC。还从19个临床参数中提取了4个特征以开发临床数据模型,AUC为0.727。整合放射组学特征和临床数据产生了在测试集中具有优异性能的组合模型(AUC 0.794)。
结论 源自LARC患者治疗前直肠MRI的放射组学模型显示了评估转移性淋巴结对nCRT反应的强大预测能力。
Open Access
Microscopic image processing platform for multi-class cell segmentation using deep learning Yuzhou Wang, Xiaojie Li, Frank Kulwa, Xiaoyan Li, Shuochen Tai, Shuaiyi Tian, Kunyang Teng, Marcin Grzegorzek, Xinyu Huang, Tao Jiang, et al.
Intelligent Medicine Vol.06, No.02 2026
DOI: 10.1016/j.imed.2025.08.002
背景 从肺癌、心脏病到罕见疾病,几乎每一种疾病的研究都在加速。显微细胞图像分析是医学研究的一个重要领域。作为分析的第一步,分割是一个重要的临床问题。然而,许多复杂性,如细胞大小或形状的变化、重叠区域、潜在的差对比度和背景噪声,使得显微图像的自动分割成为一个复杂的问题。此外,在用户友好且能够提供可信结果的图像处理系统中存在显著缺陷。
方法 本文提出了一种显微细胞处理平台,以实现高效、准确的显微图像分析。首先,来自2018年Kaggle细胞分割竞赛的2018数据科学碗(DSB2018)数据集被分组为训练集、验证集和测试集。然后,结合分水岭算法的U-Net++用于显微细胞图像分割任务。第三,设计了基于QT的图形用户界面,用于显示分割过程,根据临床需求对模型进行微调,自动生成诊断结论。
结果 交集超过并集、精度、召回率和F1分数的平均值分别达到0.846、0.908、0.925和0.917,这是非常令人满意的结果,表明了该平台的有效性。此外,分水岭算法的平均误差达到0.113,这是临床诊断中可接受的范围。与传统方法相比,该方法显著提高了性能。
结论 凭借基于深度学习的高效分割和对结果的准确定量分析,这一显微图像处理平台可能会超越许多现有的医学分析系统,在医学辅助诊断领域有应用。
Open Access
One-stop automated diagnostic system for active sacroiliitis in three-dimensional magnetic resonance images using artificial intelligent models: a retrospective study Xiaojian Ji, Zhuofeng Li, Lulu Zeng, An’an Wang, Jing Dong, Lei Sun, Shiwei Yang, Jian Zhu, Feng Huang, Tao Li, et al.
Intelligent Medicine Vol.06, No.02 2026
DOI: 10.1016/j.imed.2025.07.005
背景 中轴性脊柱关节炎(axSpA)可能进展为强直性脊柱炎,诊断延迟可能导致不可逆的结构损伤。尽管骶髂关节磁共振成像(MRI)可以检测骨髓水肿(BME)进行早期诊断,但复杂的病因和对专家解释的依赖阻碍了慢性腰痛人群的有效识别。因此,我们开发了一个人工智能(AI)系统,该系统集成了MRI分析并自动生成报告,以促进活动性骶髂关节炎的检测和BME定量。
方法 这项回顾性研究分析了中国人民解放军总医院(2011-2023年)的691名患者(540名axSpA患者和151名非脊柱关节炎患者)。将数据分为训练和测试队列(4:1比例),对训练集应用五重交叉验证。该系统包括四个模块:(1)图像预处理(强度归一化),(2)基于从粗到细的3D U-Net的象限分割,(3)ResNet18驱动的水肿识别(深度/强度分类),以及(4)使用QWEN大语言模型生成诊断报告。
结果 在691名患者(335名活动性骶髂关节炎阳性和356名阴性)中,AI系统在阳性组和阴性组中分别获得了加拿大脊柱关节炎研究联盟(SPARCC)的(15.12±10.73)和(0.88±1.13)评分。象限分割模块在训练、验证和测试数据集上实现了高于0.7的DICE相似系数。水肿炎症、深度和强度分类器在测试数据集上表现出良好的性能,平衡准确率分别为77.54%、76.26%和80.91%,曲线下面积值分别为0.85、0.87和0.92。在测试数据集中,我们系统的SPARCC评分与风湿病学家评分之间的组内相关系数为0.84。在患者水平,我们的系统在测试数据集上对活动性骶髂关节炎的诊断达到了90.81%的灵敏度。
结论 开发的自动化系统通过自动识别活动性骶髂关节炎和能够定量评估BME来提高axSpA诊断效率。