MedNexus
2026年 · 第06卷第02期
MedNexus
大型语言模型(大语言模型)在医学自然语言处理(NLP)任务中表现出令人鼓舞的性能,在一些标准基准中接近人类的性能,使其成为医疗保健领域的游戏规则改变者。然而,由于现有评估范式的限制,NLP算法的高基准性能和临床实用性之间仍然存在持续的差距。现有的基准倾向于使用静态的、特定于任务的基准,因此,它们没有捕捉到在诊所中安全部署所需的复杂性、安全性、可解释性和工作流集成的全部维度。这篇社论主张将评估范式从狭隘的基于分数的指标转变为动态的、多维的、以患者为中心的临床把关系统。拟议的框架集成了一个四阶段过程,包括回顾性基准测试、试点测试、多中心验证和现实世界监控,以及能力-任务-行为-价值进展和持续的人在回路反馈机制。这一全面的战略不仅确保了技术稳健性,还确保了临床相关性、伦理责任和适应性改进,将大语言模型从实验工具转变为可靠的临床合作伙伴,以实现更安全、更以患者为中心的医疗保健服务。
早期高级别肺浸润性腺癌(IAC)预后不良,使用常规放射学评估难以识别。目前依赖术后组织学来识别高级别亚型延迟了风险适应的手术计划。三维(3D)视觉转换器(ViTs)可以通过对计算机断层扫描(CT)扫描中的长程依赖性建模来改进预测。我们旨在开发和验证3D-ViT和Swin Transformer(SwinT),用于术前基于CT的早期高级别IAC亚型(微乳头状/实性)预测,以ResNet为基准。
将1028例手术证实的早期肺腺癌患者的多中心队列分为训练(n=806),验证(n=100)和外部测试(n=122)组。在CT上训练3D-ViT、SwinT和ResNet模型,以对具有高级组织学模式的结节进行分类。为IAC手术提供了一种新的决策辅助工具。使用曲线下面积(AUC)、准确度、灵敏度、特异性和精密度评估性能。进行注意力映射以解释3D-ViT决策。
3D-ViT模型的AUC值为0.856(95%CI:0.845-0.877)(验证)和0.806(95%CI:0.790-0.816)(测试),而ResNet基线的AUC值为0.854(95%CI:0.841-0.872)(验证)和0.760(95%CI:0.743-0.776)(测试)。3D-ViT在验证集中显示了平衡的准确度、灵敏度、特异性和精密度。在外部测试中,3D-ViT在所有指标上都显著优于ResNetP<0.01.决策辅助工具中基于SwinT的AlignSen模型优先考虑高等级IAC的敏感性(88.0%验证,93.4%测试),同时保持特异性(76.0%验证,54.1%测试),这显著优于基于ViT和ResNet的AlignSen模型的特异性(分别为60.0%和54%验证,52.5%和24.6%测试)。注意力图突出了3D结节异质性和外周不规则性。
3D-ViT模型在使用CT图像预测高级别IAC亚型方面表现出稳健的准确性和可推广性。将术前SwinT整合到临床工作流程中可能为术中病理分型提供一种可行的替代方案,有可能减少对冰冻切片的依赖,同时优化手术计划。
大型语言模型(大语言模型)越来越多地促进了冠心病(CHD)的患者教育。然而,尚不清楚模型的起源(美国与中国)是否会影响其在提供冠心病相关患者教育方面的表现。本研究旨在系统比较六种主流大语言模型在回答以英文和中文提出的常见冠心病相关患者问题时。
2025年2月1日至15日期间,我们向六名大语言模型提出了30个经临床医生验证的冠心病问题(从门诊记录中提取):GPT-4o、OpenAI o1、Gemini 1.5(美国);以及DeepSeek-R1、“文心一言”3.5、斗宝(中)。每个提示都是用英文和中文询问的。每个提示都是用英文和中文询问的。三名盲态心脏病专家采用4分李克特量表对每个答案的准确性、全面性、可理解性和同理心进行评分。使用具有logit链接函数的累积链接混合模型(CLMMs)分析评级,包括模型、语言和维度的固定效应,以及它们的相互作用和问题和评级者的随机截距。III型似然比χ2测试评估了主要效应和相互作用,然后是霍尔姆调整的成对对比。使用Fleiss'量化评分者之间的一致性κ.
三名心脏病专家独立评估了360份双语回答,评分者间可靠性高(Fleiss’κ=0.821).在CLMMs中,存在显著的模型和维度主效应,以及模型×语言交互和模型×语言×维度主效应。与GPT-4o相比,OpenAI o1获得卓越评级的几率最高(OR=4.45,95%CI:3.01-6.57,P<0.001),其次是DeepSeek-R1(OR=1.32,95%CI:0.97-1.78,P=0.038).语言分层对比显示,中文提示提高了全面性(OR=1.48,95%CI:1.01-2.17,P=0.045)和同理心(OR=2.14,95%CI:1.47-3.11,P<0.001),但可理解性降低(OR=0.64,95%CI:0.42-0.98,P=0.042).Gemini 1.5中文优秀(OR=3.55, 95%CI:2.35-5.38,P<0.001),而DeepSeek-R1更喜欢英语(OR=0.64,95%CI:0.41-0.99,P=0.046)和豆包青睐中文(OR=1.64,95%CI:1.08-2.49,P=0.020).
提示语言和评价维度强烈影响模型性能。我们的基准为选择大语言模型进行双语患者教育的临床医生、患者和健康信息提供者提供了实用指导。
与硬膜内颈内动脉(ICA)动脉瘤相关的破裂风险值得相当关注。我们的目标是开发第一个机器学习(ML)模型,该模型将标准化血流动力学特征与临床和形态学数据相结合,以对硬膜内ICA动脉瘤的破裂风险进行分层。
我们连续纳入了2017年7月至2022年7月在四家医院接受DSA检查的511例硬膜内ICA动脉瘤。利用电子病历系统和AneuFlow软件的计算流体动力学,我们提取了动脉瘤的10个临床基线特征、13个形态学特征和12个血流动力学特征。随后,通过随机森林(RF)、XGBoost(XGB)、LightGBM(LGB)和逻辑回归(LR)模型对动脉瘤破裂的风险进行分层。来自三家医院的数据用于开发内部培训队列(n=331)和内部验证队列(n=83),而来自第四医院的数据有助于外部验证队列(n=97).使用曲线下面积(AUC)、敏感性、特异性和Youden指数评估模型在三个队列中的性能。此外,我们确定了ML模型的特征重要性排名。
RF模型在内部训练队列中达到最高AUC 0.980(95%CI:0.969-0.989)。内部验证队列中RF、XGB、LGB和LR模型的AUC分别为0.872(95%CI:0.792-0.929)、0.874(95%CI:0.794-0.931)、0.852(95%CI:0.769-0.914)和0.827(95%CI:0.740-0.894)。在外部验证队列中,这些模型的AUC分别为0.820(95%CI:0.729-0.891)、0.772(95%CI:0.675-0.851)、0.782(95%CI:0.686-0.859)和0.782(95%CI:0.686-0.859)。此外,RF模型在外部验证队列中实现了最大的Youden指数(0.517),表明卓越的辨别能力。血流动力学占分层功效的57%,具有不规则几何形状(非球形指数>0.15)和微血管炎症标志物(最小壁切应力<0.3 Pa)被确定为关键驱动因素。
针对硬膜内ICA动脉瘤设计的ML框架展示了强大的风险分层能力,允许更及时和个性化的临床诊断和治疗。
分形维数f)量化血管网络复杂性和空间填充密度,为微血管病理学评估提供非侵入性生物标志物。我们的目标是建立一个人工智能(AI)驱动的自动化D框架f定量并调查其在北京眼科研究普通人群中的临床意义。
这项回顾性研究利用了2011年北京眼科研究的数据。用人工智能算法处理符合质量标准的眼底图像,以分割视网膜脉管系统并计算Df多元线性和逻辑回归模型用于评估视网膜血管D的相关性f包括全身和眼部参数。
基于人工智能的视网膜血管D定量f在3,298名参与者(3,468名参与者中的95.1%)中成功进行,证明了高模型性能:分割准确性(0.9660)、敏感性(0.8879)、特异性(0.9743)和交集超过并集(IoU)(0.7110)。平均Df为1.51±0.09(中位数:1.53;四分位距:1.50-1.55)。在多元线性回归分析中,减少Df与年龄较大显著相关(标准化回归系数β)=−2.346;P<0.001),收缩压升高(sβ=−0.341;P<0.001),臀围较小β=0.518;P=0.014),较低等效屈光度(sβ=3.589;P<0.001),视网膜神经纤维层厚度较薄β=0.390;P=0.002),动静脉比值较小β=524.590;P<0.001),中心凹下脉络膜厚度较薄β=0.071;P<0.001).在logistic回归模型中,高血压的危险患病率随着D的减少而增加f(OR=0.853, 95%CI:0.651-0.801)。
人工智能驱动的Df分析可用作表征视网膜微血管形态学改变的新定量平台。
大语言模型(大语言模型)是人工智能的革命性突破,可以用来自动生成放射学报告的印象,这通常需要时间、精力和训练。我们的目标是评估最近五款大语言模型(GPT-4、GPT-4O Mini、Gemini 1.5-Pro、Gemini 1.5-Flash和Llama 3.1)在印象生成方面的性能。
在这项回顾性研究中,从来自PhysioNet的公开可用的“BioNLP 2023报告摘要”数据集(2001-2016年间收集,考虑抽样的训练子集大小为59,320)中抽取了100份放射学报告(每个报告组0-400、400-800、800-1,200、1,200-2,000和2,000-8,000,基于调查结果部分的字符计数)。然后,五名大语言模型中的每一名都被零镜头提示使用样本中的发现产生印象。评估生成的印象:(a)由两名放射学研究员和一个大型推理模型(LRM)Gemini 2.5-Pro主观地评估一致性、全面性、简洁性和医学危害性,以及(b)客观地使用复合准确性指标,包括面向回忆的gisting评估替角(ROUGE)-1、双语评估替角(BLEU)和余弦相似性,与原始人类专家生成的印象进行比较。根据主观分数和综合分数的百分比一致性排名对大语言模型进行排名。统计检验(Friedman和事后Nemenyi检验)用于评估模型间差异。
排名靠前的型号是双子座1.5-Pro、GPT-4和双子座1.5-Flash。人类和LRM评分者在模型中的表现不同(Friedman检验:人类P<1.82×10−6;LRMP<9.10×10−40).前三个模型(0.69、0.68和0.68)的综合准确性得分显著高于其他模型(0.65;NemenyiP<1.11×10−16).LRM与人类评分者密切一致(2.15%完全不同意),并识别了所有人类评分的不准确印象。
Gemini 1.5-Pro在一致性、全面性和医疗危害性方面优于GPT-4,且成本更低。人类和LRM的评估通常是一致的,尽管LRM更保守。
使用对比增强计算机断层扫描(CT)开发用于肝癌诊断的准确人工智能(AI)模型通常受到患者隐私法规和医院之间相当大的数据差异的阻碍。这些变化——CT扫描仪、患者群体和疾病患病率——会降低标准协作训练方法(如联合学习(FL))的性能。这项回顾性研究评估了一种新的机器学习框架Hepa-FedBoost是否可以克服这些挑战,以提高模拟多中心网络中肝癌分类的诊断准确性,而无需共享原始患者图像。
我们开发了一个新的基准数据集,以更好地代表真实世界的临床多样性。这是通过将来自MedMNIST v2数据集的公共OrganCMNIST子集的11个腹部器官的23,583张CT图像与来自500名组织病理学证实的肝癌患者的11,000张肝脏病变图像合并来完成的。这些癌症相关数据回顾性地从中国国家肝胆标准数据库(由北京清华长庚医院发起,数据收集自2019年12月)中获得。使用来自公共和私人来源的数据不需要患者或所有者的授权。该34,583张图像的组合数据集用于模拟12家医院的网络,这些医院在数据量和类别标签方面存在显著的不平衡。Hepa-FedBoost框架是一种聚类FL模型,在该网络上进行训练。该模型的工作原理是让每个模拟医院仅共享紧凑、匿名的数据摘要(原型),而不是模型参数或原始数据。中央服务器使用这些摘要对具有相似数据的医院进行分组,并指导训练过程以提高整体准确性。主要终点是受试者工作特征曲线下的宏观面积(mAUC)。此外,我们将Hepa-FedBoost的性能与其他6种已建立的FL方法进行了比较。
在模拟医院网络上,Hepa-FedBoost展示了优越的诊断性能,与次优方法相比,肝癌分类mAUC提高了4.9个绝对点,整体准确度提高了2.4个绝对点。它仅在17轮训练中就达到了临床级准确性的阈值,比标准FedAvg方法快43%,同时将所需的总数据传输量减少了大约一半(至800 MB)。
Hepa-FedBoost框架显著提高了CT图像上多中心肝癌分类的准确性和效率。通过支持强大的协作模型训练,同时维护患者隐私并最大限度地减少IT资源需求,它代表了现实世界医院网络的可行人工智能解决方案。
淋巴结转移(LNM)状态是局部晚期直肠癌(LARC)患者的关键预后标志物。新辅助放化疗(nCRT)可通过诱导消退来影响淋巴结状态,患者之间的治疗反应表现出很大的可变性。我们旨在开发和验证一种基于随机森林的放射组学模型,用于使用治疗前磁共振成像(MRI)无创预测LARC患者新辅助治疗后的淋巴结消退状态。
这项回顾性研究纳入了2019年10月至2023年10月期间在青岛大学附属医院接受nCRT治疗后择期切除的285例LARC患者。患者以7:3的比例随机分配到训练组和测试组。比较了两组之间的基线特征,包括性别、年龄、体重指数(BMI)和其他13个临床变量,未观察到显著差异(P>0.05).术前收集直肠区域的高分辨率T2加权MRI扫描。在MRI扫描上手动描绘对应于原发性肿瘤病变的感兴趣区域,随后进行放射组学特征提取。使用最小绝对收缩和选择算子(LASSO)回归模型进行特征选择。随后构建了机器学习随机森林预测模型,结合了选定的放射组学特征和临床变量。
使用受试者工作特征曲线分析、曲线下面积(AUC)和校准曲线评估预测淋巴结状态的模型性能。从1,051个放射组学特征中选择四个特征来构建放射组学模型,在测试集中实现了0.743的AUC。还从19个临床参数中提取了4个特征以开发临床数据模型,AUC为0.727。整合放射组学特征和临床数据产生了在测试集中具有优异性能的组合模型(AUC 0.794)。
源自LARC患者治疗前直肠MRI的放射组学模型显示了评估转移性淋巴结对nCRT反应的强大预测能力。
从肺癌、心脏病到罕见疾病,几乎每一种疾病的研究都在加速。显微细胞图像分析是医学研究的一个重要领域。作为分析的第一步,分割是一个重要的临床问题。然而,许多复杂性,如细胞大小或形状的变化、重叠区域、潜在的差对比度和背景噪声,使得显微图像的自动分割成为一个复杂的问题。此外,在用户友好且能够提供可信结果的图像处理系统中存在显著缺陷。
本文提出了一种显微细胞处理平台,以实现高效、准确的显微图像分析。首先,来自2018年Kaggle细胞分割竞赛的2018数据科学碗(DSB2018)数据集被分组为训练集、验证集和测试集。然后,结合分水岭算法的U-Net++用于显微细胞图像分割任务。第三,设计了基于QT的图形用户界面,用于显示分割过程,根据临床需求对模型进行微调,自动生成诊断结论。
交集超过并集、精度、召回率和F1分数的平均值分别达到0.846、0.908、0.925和0.917,这是非常令人满意的结果,表明了该平台的有效性。此外,分水岭算法的平均误差达到0.113,这是临床诊断中可接受的范围。与传统方法相比,该方法显著提高了性能。
凭借基于深度学习的高效分割和对结果的准确定量分析,这一显微图像处理平台可能会超越许多现有的医学分析系统,在医学辅助诊断领域有应用。
中轴性脊柱关节炎(axSpA)可能进展为强直性脊柱炎,诊断延迟可能导致不可逆的结构损伤。尽管骶髂关节磁共振成像(MRI)可以检测骨髓水肿(BME)进行早期诊断,但复杂的病因和对专家解释的依赖阻碍了慢性腰痛人群的有效识别。因此,我们开发了一个人工智能(AI)系统,该系统集成了MRI分析并自动生成报告,以促进活动性骶髂关节炎的检测和BME定量。
这项回顾性研究分析了中国人民解放军总医院(2011-2023年)的691名患者(540名axSpA患者和151名非脊柱关节炎患者)。将数据分为训练和测试队列(4:1比例),对训练集应用五重交叉验证。该系统包括四个模块:(1)图像预处理(强度归一化),(2)基于从粗到细的3D U-Net的象限分割,(3)ResNet18驱动的水肿识别(深度/强度分类),以及(4)使用QWEN大语言模型生成诊断报告。
在691名患者(335名活动性骶髂关节炎阳性和356名阴性)中,AI系统在阳性组和阴性组中分别获得了加拿大脊柱关节炎研究联盟(SPARCC)的(15.12±10.73)和(0.88±1.13)评分。象限分割模块在训练、验证和测试数据集上实现了高于0.7的DICE相似系数。水肿炎症、深度和强度分类器在测试数据集上表现出良好的性能,平衡准确率分别为77.54%、76.26%和80.91%,曲线下面积值分别为0.85、0.87和0.92。在测试数据集中,我们系统的SPARCC评分与风湿病学家评分之间的组内相关系数为0.84。在患者水平,我们的系统在测试数据集上对活动性骶髂关节炎的诊断达到了90.81%的灵敏度。
开发的自动化系统通过自动识别活动性骶髂关节炎和能够定量评估BME来提高axSpA诊断效率。
恶性肿瘤对全球健康构成重大挑战。虽然存在已建立的筛查方法,但它们在很大程度上是位点特异性的,限制了全面预防。同时检测多种癌症的多癌症筛查具有显著优势,包括优化样本利用率、降低参与者成本、提高效率和改善资源分配。人工智能(AI)已经成为一项变革性技术,通过分析复杂的生物医学数据和提高诊断准确性来彻底改变医疗保健。将人工智能集成到多种癌症筛查中对于推进早期癌症检测具有巨大的潜力。这篇综述全面概述了人工智能驱动的多种癌症筛查。我们研究基础技术和当前应用,包括生物标志物数据和医学成像数据分析,以及核心人工智能技术,如机器学习、深度学习、自然语言处理、可解释人工智能和基本预处理步骤。我们评估关键的技术瓶颈,如数据稀疏性、模型泛化性、误报和漏报以及可负担性,以及迁移学习、联合学习和贝叶斯优化等解决方案。此外,我们强调了多种癌症筛查的临床验证、监管批准和伦理考虑。此外,我们探索未来的前景,设想提高准确性和扩大覆盖面,更深入的多模态数据融合,个性化和动态筛查,以及具有更好可访问性的智能决策支持系统。我们还为发展中国家进行人工智能驱动的多种癌症筛查概述了有针对性的建议,以全球最佳实践为基础,同时适应包括中国在内的当地现实。这篇综述提供了一个前瞻性的观点,说明人工智能将如何将多种癌症筛查发展成为更加个性化、动态和可访问的癌症预防基石。
临床实践指南(CPGs)支持循证护理,但制定起来非常耗时。我们旨在使用已发表的乳腺癌CPG的数据,比较Covidence中人工智能(AI)辅助与手动标题和摘要筛查(I期)。
本系统综述(SR)包括通过医学文献检索确定的8,774篇文章,删除重复内容后。三个文章子集(n=500、1000和2000)从8774篇文章中随机选择,分别进行30、30和10项独立的I期AI辅助试验。每个试验的主要结果是通过人工智能辅助识别95%和100%的相关文章(例如,敏感性)以及100%的最终纳入文章来节省工作量。当每个子集的灵敏度达到95%时,次要结局被遗漏—最终纳入的文章。
在95%的灵敏度下,确定了100%的相关文章和100%的最终纳入文章,中位(最小、最大)工作量节省分别为40.7%(4.4%,59.4%)、25.0%(0.4%,55.2%)和57.6%(6.2%,76.4%)n=500;38.3%(6.2%,54.0%)、17.3%(0.0%,39.1%)和63.9%(0.4%,77.5%)n=1,000;16.6%(10.8%,41.8%)、4.4%(0.3%,20.9%)和17.9%(0.8%,64.6%)n=2,000。对于具有多个复杂研究问题的CPG,Covidence的性能不会随着子集大小的增加而提高。在所有70项试验中,Covidence初始培训中相关文章的比例与I期工作量节省之间存在潜在的正相关。在95%的敏感性下,五项试验遗漏了一篇文章(n=500);两次审判遗漏两条一次审判遗漏一条(n=1,000);且一审漏三条五审漏一条(n=2,000).
Covidence中的人工智能辅助I期筛查显示了乳腺癌CPG在一个复杂主题的SR中的前景和陷阱。需要进一步的前瞻性研究来更好地理解人工智能辅助在CPG主题的Covidence和复杂性中的性能。
远程医疗在管理慢性病方面越来越突出,特别是在新冠肺炎之后。然而,干预措施通常缺乏基于患者参与水平的一致分类,有效性的证据仍然是异质性的。本综述综合了系统综述的发现,以评估远程医疗在慢性病管理中的益处和挑战。对Medline、EMBASE和Web of Science数据库进行了系统搜索,以确定2022年1月至2024年12月期间发表的带有荟萃分析的系统综述。三重目标框架用于评估远程医疗对临床结果、患者体验和医疗费用的影响。开发了一个数字患者参与水平框架,以探索参与水平和干预有效性之间的关系。共有81项系统评价符合纳入标准。其中,31%关注心血管疾病,30%关注糖尿病,28%关注癌症,4%关注慢性肺病,7%关注一般慢性疾病。干预水平分为咨询(9%)、参与(42%)、伙伴关系/共享领导(13%)或未指明(36%)。61篇综述报告了临床结果,23篇综述报告了患者报告的结果,仅4篇综述报告了经济影响,表明存在巨大的研究差距。远程医疗增强了患者护理体验和人群健康,在管理糖尿病、癌症、心血管和慢性肺病方面显示出巨大的益处。它在降低医疗成本方面具有相当大的潜力。然而,需要进一步的研究来评估远程医疗在不同参与水平上的可行性和有效性。此外,标准化的方法和改进的工具对于推进远程医疗的研究和实施至关重要。
本期目次

