arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

共收录 1612
2604.13291 2026-04-16 cs.LG

Physics-informed reservoir characterization from bulk and extreme pressure events with a differentiable simulator

基于可微模拟器的物理信息流体储层表征:从总体和极端压力事件

Harun Ur Rashid, Mingxin Li, Aleksandra Pachalieva, Georg Stadler, Daniel O'Malley

机构 * Earth and Environmental Sciences Division, Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室地球与环境科学部) Courant Institute School of Mathematics, Computing and Data Science, New York University(纽约大学柯朗研究所数学、计算与数据科学学院)

AI总结 本文提出一种融合物理信息的机器学习方法,通过可微流体模拟器提升储层异质性表征的精度与物理一致性,有效降低压力推断误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05740 2026-04-16 cs.HC cs.AI

RECOVER: Designing a Large Language Model-based Remote Patient Monitoring System for Postoperative Gastrointestinal Cancer Care

RECOVER:基于大语言模型的术后胃肠癌远程患者监测系统设计

Ziqi Yang, Yuxuan Lu, Jennifer Bagdasarian, Vedant Das Swain, Ritu Agarwal, Collin Campbell, Waddah Al-Refaire, Jehan El-Bayoumi, Guodong Gao, Dakuo Wang, Bingsheng Yao, Nawar Shara

机构 * University of California, Irvine(加州大学尔湾分校) Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学) MedStar Health Research Institute(梅斯塔健康研究院) Creighton University(克里普顿大学) Georgetown University(乔治城大学)

AI总结 本文设计了基于大语言模型的RECOVER系统,用于术后胃肠癌的远程患者监测,通过临床整合提升术后护理效率,并探讨了AI伦理与未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12857 2026-04-15 cs.AI cs.RO cs.SY eess.SY

Artificial Intelligence for Modeling and Simulation of Mixed Automated and Human Traffic

人工智能在混合自动化与人类交通建模与模拟中的应用

Saeed Rahmani, Shiva Rasouli, Daphne Cornelisse, Eugene Vinitsky, Bart van Arem, Simeon C. Calvert

机构 * Department of Transport & Planning, Delft University of Technology(代尔夫特理工大学交通与规划系) Department of Industrial and Systems Engineering, University of Michigan, Dearborn(密歇根大学迪尔伯恩分校工业与系统工程系) Tandon School of Engineering, New York University(纽约大学Tandon工程学院)

AI总结 本文探讨了人工智能在混合自动化与人类交通模拟中的应用,提出了一种分类方法,涵盖行为模型、环境模拟和认知物理方法,旨在填补现有研究的空白。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08291 2026-04-15 cs.AI

A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning

多模态数学推理综述:从感知、对齐到推理

Tianyu Yang, Sihong Wu, Yilun Zhao, Zhenwen Liang, Lisen Dai, Chen Zhao, Minhao Cheng, Arman Cohan, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Yale University(耶鲁大学) Columbia University(哥伦比亚大学) New York University(纽约大学) Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 本文综述了多模态数学推理的研究进展,探讨了如何从多模态输入中提取信息、对齐文本与视觉信息、进行推理以及评估推理过程的正确性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19728 2026-04-15 cs.LG

Hard Negative Sample-Augmented DPO Post-Training for Small Language Models

增强的DPO后训练用于小型语言模型

Haocheng Lu, Minjun Zhu, Henry Yu

机构 * Computer Science NYU Shanghai(纽约大学上海学院)

AI总结 本文提出一种轻量级后训练方法,通过MathVerifier检测结构化错误,改进DPO以提升小型模型在数学推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11720 2026-04-14 cs.CV cs.AI cs.CR

On the Robustness of Watermarking for Autoregressive Image Generation

关于自回归图像生成中水印的鲁棒性

Andreas Müller, Denis Lukovnikov, Shingo Kodama, Minh Pham, Anubhav Jain, Jonathan Petit, Niv Cohen, Asja Fischer

机构 * Ruhr University Bochum(波鸿鲁尔大学) Middlebury College(米德尔伯里学院) New York University(纽约大学) Independent Researcher(独立研究员) Qualcomm(高通)

AI总结 研究自回归图像生成中水印技术的鲁棒性,揭示其易受移除和伪造攻击的影响,并提出三种新攻击方法,表明现有水印方案无法可靠检测合成内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11447 2026-04-14 cs.RO cs.SY eess.SY

Safe Human-to-Humanoid Motion Imitation Using Control Barrier Functions

安全的人到人形机器人运动模仿使用控制障碍函数

Wenqi Cai, John Abanes, Nikolaos Evangeliou, Anthony Tzes

机构 * New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校) New York University(纽约大学) NYUAD Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比人工智能与机器人中心)

AI总结 本文提出了一种基于视觉的框架,通过控制障碍函数层确保人形机器人在模仿人类动作时的安全性,利用单摄像头捕捉人体骨骼关键点并转换为关节角度,通过二次规划过滤模仿指令以避免碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11259 2026-04-14 cs.AI cs.CR

Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

基于轨迹诱导的偏好优化的移动GUI代理隐私个性化

Zhixin Lin, Jungang Li, Dongliang Xu, Shidong Pan, Yibo Shi, Yuchi Liu, Yuecong Min, Yue Yao

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) New York University(纽约大学) Xi'an Jiaotong University(西安交通大学) Australian National University(澳大利亚国立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 本文研究移动GUI代理的隐私个性化问题,提出轨迹诱导偏好优化方法,通过偏好强度加权和填充门机制提升隐私保护与任务执行效率。

Comments 10 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18073 2026-04-14 cs.CV

FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis

FPBench: 多模态大语言模型在指纹分析中的综合基准测试

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。

Comments Revised version with additional experiments and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13292 2026-04-14 cs.CV

DiffClean: Diffusion-based Makeup Removal for Accurate Age Estimation

DiffClean: 基于扩散模型的化妆去除用于准确年龄估计

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

AI总结 本文提出DiffClean,通过文本引导的扩散模型去除化妆痕迹,提升年龄估计和面部验证的准确性,有效对抗化妆攻击。

Comments Revised version with minor changes and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10496 2026-04-14 cs.LG

CodeQuant: Unified Clustering and Quantization for Enhanced Outlier Smoothing in Low-Precision Mixture-of-Experts

CodeQuant: 一种统一的聚类和量化方法以提升低精度混合专家模型中的异常值平滑

Xiangyang Yin, Xingyu Liu, Tianhua Xia, Bo Bao, Vithursan Thangarasa, Valavan Manohararajah, Eric Sather, Sai Qian Zhang

机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所) Tandon School of Engineering, New York University(纽约大学坦登工程学院) Cerebras Systems Inc.(Cerebras系统公司)

AI总结 本文提出CodeQuant,通过可学习旋转平滑激活异常值并吸收权重异常值到细调的聚类中心,提升低精度混合专家模型的准确性与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10412 2026-04-14 stat.ML cs.LG stat.ME

Orthogonal machine learning for conditional odds and risk ratios

正交机器学习用于条件比值和风险比

Jiacheng Ge, Iván Díaz

机构 * New York University Grossman School of Medicine(纽约大学格罗斯曼医学院)

AI总结 本文提出基于正交风险函数的非参数估计方法,用于估计条件比值和风险比,通过蒙特卡洛模拟比较不同估计器的性能,展示其在真实世界复杂场景中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22403 2026-04-14 cs.LG

MoveFM-R: Advancing Mobility Foundation Models via Language-driven Semantic Reasoning

MoveFM-R: 通过语言驱动的语义推理推进移动基础模型

Fanjin Meng, Yuan Yuan, Jingtao Ding, Jie Feng, Chonghua Han, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系,BNRist) New York University (NYU)(纽约大学)

AI总结 MoveFM-R通过语言驱动的语义推理解决移动基础模型中地理坐标与语言 token 的词汇不匹配及潜在向量与语义世界之间的表示差距问题,实现更全面、可解释的人类移动建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17188 2026-04-14 cs.AI

PosterGen: Aesthetic-Aware Multi-Modal Paper-to-Poster Generation via Multi-Agent LLMs

PosterGen:基于多智能体LLM的美观化论文到海报生成

Zhilin Zhang, Xiang Zhang, Jiaqi Wei, Yiwei Xu, Chenyu You

机构 * Stony Brook University(石溪大学) New York University(纽约大学) University of British Columbia(不列颠哥伦比亚大学) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 PosterGen通过多智能体LLM实现论文到海报的美观化生成,包含四个协作专业代理,提升设计质量和视觉吸引力。

Comments Project Website: https://Y-Research-SBU.github.io/PosterGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09793 2026-04-14 cs.CL cs.AI

GIANTS: Generative Insight Anticipation from Scientific Literature

GIANTS:从科学文献生成洞察预判

Joy He-Yueya, Anikait Singh, Ge Gao, Michael Y. Li, Sherry Yang, Chelsea Finn, Emma Brunskill, Noah D. Goodman

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

AI总结 本文提出GIANTS任务,通过生成模型预测下游论文的核心洞察,开发了包含17000个示例的GIantsBench基准,展示了GIANTS-4B模型在多个领域中的优越性能,其生成的洞察在概念清晰度和引用潜力上均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09666 2026-04-14 cs.IR cs.AI

Do We Still Need GraphRAG? Benchmarking RAG and GraphRAG for Agentic Search Systems

我们仍然需要GraphRAG吗?对RAG和GraphRAG在代理搜索系统中的基准测试

Dongzhe Fan, Zheyi Xue, Siyuan Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学)

AI总结 本文通过RAGSearch基准测试,评估了代理搜索系统对密集RAG和代表性的GraphRAG方法的影响,发现代理搜索显著提升了密集RAG性能,但在复杂多跳推理中GraphRAG仍具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13876 2026-04-14 cs.CV

Dual-R-DETR: Resolving Query Competition with Pairwise Routing in Transformer Decoders

Dual-R-DETR: 通过Transformer解码器中的成对路由解决查询竞争

Ye Zhang, Qi Chen, Wenyou Huang, Rui Liu, Zhengjian Kang

机构 * University of Pittsburgh(匹兹堡大学) University of California, Irvine(加州大学尔湾分校) Stevens Institute of Technology(史蒂文斯理工学院) Illinois Institute of Technology(伊利诺伊理工学院) New York University(纽约大学)

AI总结 Dual-R-DETR通过在Transformer解码器中引入成对路由机制,解决DETR中查询之间的竞争问题,提升检测效率和性能。

Comments 6 pages, 2 figures, Accepted at ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09531 2026-04-13 cs.CV cs.AI cs.CL

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

VisionFoundry: 通过合成图像教授VLMs的视觉感知

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。

Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09114 2026-04-13 cs.CV cs.LG

FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval

FIRE-CIR:细粒度复合时尚图像检索中的精细推理

François Gardères, Camille-Sovanneary Gauthier, Jean Ponce, Shizhe Chen

机构 * Louis Vuitton(路易威登) Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所, 巴黎高等师范学院, 法国国家科学研究中心, 巴黎文理研究大学) Courant Institute of Mathematical Sciences and Center for Data Science, New York University(纽约大学库朗数学科学研究所与数据科学中心)

AI总结 FIRE-CIR通过问题驱动的视觉推理提升时尚图像检索的可解释性和准确性,通过生成属性聚焦的视觉问题并验证参考与候选图像中的证据,实现更精确的检索结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08804 2026-04-13 stat.ML cs.LG stat.ME

Policy-Aware Design of Large-Scale Factorial Experiments

面向政策的大规模因子实验设计

Xin Wen, Xi Chen, Will Wei Sun, Yichen Zhang

机构 * Stern School of Business, New York University(纽约大学斯特恩商学院) Daniels School of Business, Purdue University(普渡大学丹尼尔斯商学院)

AI总结 本文研究如何在有限预算下设计大规模因子实验,通过两阶段方法集中重叠实验,利用低秩张量建模预期结果,提升组合产品设计的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08781 2026-04-13 eess.IV cs.AI cs.CV eess.SP physics.med-ph

PSIRNet: Deep Learning-based Free-breathing Rapid Acquisition Late Enhancement Imaging

PSIRNet:基于深度学习的自由呼吸快速获取晚期增强成像

Arda Atalik, Hui Xue, Rhodri H. Davies, Thomas A. Treibel, Daniel K. Sodickson, Michael S. Hansen, Peter Kellman

机构 * Health Futures, Microsoft Research(微软研究院健康未来) Center for Data Science, New York University(纽约大学数据科学中心) Center for Advanced Imaging Innovation and Research (CAI2R), Department of Radiology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院放射学系高级成像创新与研究中心) Bernard and Irene Schwartz Center for Biomedical Imaging, Department of Radiology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院放射学系伯纳德和艾琳·施瓦茨生物医学成像中心) Institute of Cardiovascular Science, University College London(伦敦大学学院心血管科学研究所) Barts Heart Centre, Barts Health NHS Trust(巴茨健康NHS信托巴茨心脏中心)

AI总结 本文提出PSIRNet深度学习方法,通过单次呼吸获取两心跳数据生成诊断级自由呼吸PSIR晚期增强成像,相比传统需多次运动校正信号平均的方法,将扫描时间减少8-24倍。

Comments 25 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08706 2026-04-13 cs.LG

Efficient RL Training for LLMs with Experience Replay

为大语言模型高效训练的体验回放

Charles Arnal, Vivien Cabannes, Taco Cohen, Julia Kempe, Remi Munos

机构 * FAIR at Meta(Meta FAIR) NYU Courant Institute and CDS(纽约大学库朗数学科学研究所与数据科学中心)

AI总结 本文研究了大语言模型训练中体验回放的优化设计,通过平衡陈旧性方差、样本多样性与生成成本,证明了严格策略采样在生成成本高时效果不佳,实验表明合理设计的回放缓冲器能显著降低推理计算成本而不影响模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08661 2026-04-13 quant-ph cond-mat.dis-nn cs.LG physics.comp-ph

Geometry-Induced Long-Range Correlations in Recurrent Neural Network Quantum States

递归神经网络量子态中的几何诱导长程相关性

Asif Bin Ayub, Amine Mohamed Aboussalah, Mohamed Hibat-Allah

机构 * University of Waterloo(滑铁卢大学) Perimeter Institute for Theoretical Physics(圆周理论物理研究所) NYU Tandon School of Engineering(纽约大学坦登工程学院) Vector Institute(向量研究所)

AI总结 本文提出稀疏递归神经网络波函数,通过扩张连接引入长程归纳偏差,实现O(N log N)的前向传递规模,展示其在1D transverse-field Ising模型中恢复幂律相关性的能力。

Comments 16 pages, 4 figures, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08643 2026-04-13 cs.LG cs.CY cs.GT cs.SI

Creator Incentives in Recommender Systems: A Cooperative Game-Theoretic Approach for Stable and Fair Collaboration in Multi-Agent Bandits

推荐系统中的创作者激励:一种基于合作博弈的稳定且公平的多智能体老虎机方法

Ramakrishnan Krishnamurthy, Arpit Agarwal, Lakshminarayanan Subramanian, Maximilian Nickel

机构 * Courant Institute, New York University(纽约大学库朗数学研究所) Indian Institute of Technology Bombay(印度理工学院孟买分校) FAIR, Meta AI(Meta AI 基础人工智能研究团队)

AI总结 本文提出基于合作博弈的多智能体老虎机模型,分析推荐系统中创作者激励问题,证明在同质智能体下博弈凸性,提出基于 regrets 的支付规则,实验显示支付与Shapley公平性的一致性与差异。

Comments Accepted in AISTATS 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04072 2026-04-13 cs.CL cs.AI

SkillFactory: Self-Distillation For Learning Cognitive Behaviors

SkillFactory:用于学习认知行为的自我蒸馏

Zayne Sprague, Jack Lu, Manya Wadhwa, Sedrick Keh, Mengye Ren, Greg Durrett

机构 * New York University(纽约大学) Toyota Research Institute(丰田研究所)

AI总结 SkillFactory通过监督微调阶段学习认知技能,为强化学习奠定基础,提升模型在复杂任务中的泛化能力与鲁棒性。

Comments Published at ICLR 2026; code at https://github.com/Zayne-sprague/SkillFactory

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02826 2026-04-13 cs.LG cs.AI

From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity

从导航到细化:通过Oracle速度揭示基于流的扩散模型的两阶段本质

Haoming Liu, Jinnuo Liu, Yanhao Li, Liuyang Bai, Yunkai Ji, Yuanhe Guo, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

AI总结 本文通过分析基于流的扩散模型的边际速度场,揭示其两阶段训练目标,解释了模型在早期阶段的全局布局生成和后期阶段的细节记忆行为,为模型设计和算法改进提供了指导。

Comments Accepted to CVPR 2026 (Findings track); 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20638 2026-04-13 cs.SD cs.CV cs.MM eess.AS

Music Audio-Visual Question Answering Requires Specialized Multimodal Designs

音乐音频视觉问答需要专门的多模态设计

Wenhao You, Xingjian Diao, Wenjun Huang, Chunhui Zhang, Keyi Kong, Weiyi Wu, Chiyu Ma, Zhongyu Ouyang, Tingxuan Wu, Ming Cheng, Soroush Vosoughi, Jiang Gui

机构 * University of Waterloo(滑铁卢大学) Dartmouth College(达特茅斯学院) UC Irvine(加州大学尔湾分校) New York University(纽约大学)

AI总结 本文探讨了音乐音频视觉问答任务中多模态设计的必要性,指出需专门的输入处理、空间时间架构和音乐特定建模策略以应对连续密集的音频视觉内容和复杂时间动态。

Comments Accepted to Annual Meeting of the Association for Computational Linguistics (ACL 2026). The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08366 2026-04-10 cs.LG cs.AI cs.CV

Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems

面向端到端自动驾驶系统的缩放感知数据选择

Tolga Dimlioglu, Nadine Chang, Maying Shen, Rafid Mahmood, Jose M. Alvarez

机构 * New York University(纽约大学) NVIDIA(英伟达) University of Ottawa(渥太华大学)

AI总结 本文提出MOSAIC框架,通过分域、拟合神经缩放规律和迭代优化数据混合,提升自动驾驶模型在EPDMS指标上的性能,比基线模型减少80%的数据使用。

Comments Accepted to CVPR 2026, 8 pages of main body and 10 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05674 2026-04-10 cs.CR cs.AI

Towards Effective Offensive Security LLM Agents: Hyperparameter Tuning, LLM as a Judge, and a Lightweight CTF Benchmark

迈向高效的攻击性安全LLM代理:超参数调优、LLM作为裁判以及一个轻量级CTF基准

Minghao Shao, Nanda Rani, Kimberly Milner, Haoran Xi, Meet Udeshi, Saksham Aggarwal, Venkata Sai Charan Putrevu, Sandeep Kumar Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Ramesh Karri, Muhammad Shafique

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎比分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) International Institute of Information Technology Hyderabad(国际信息技术学院海得拉巴分校)

AI总结 本文系统研究了驱动代理成功的关键因素,提出CTFJudge框架和CTF Competency Index指标,分析超参数对性能的影响,并开放CTFTiny基准供研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00084 2026-04-10 cs.CL cs.AI

Vision-Language and Large Language Model Performance in Gastroenterology: GPT, Claude, Llama, Phi, Mistral, Gemma, and Quantized Models

视觉-语言与大语言模型在胃肠病学中的表现:GPT、Claude、Llama、Phi、Mistral、Gemma及量化模型

Seyed Amir Ahmad Safavi-Naini, Shuhaib Ali, Omer Shahab, Zahra Shahhoseini, Thomas Savage, Sara Rafiee, Jamil S Samaan, Reem Al Shabeeb, Farah Ladak, Jamie O Yang, Juan Echavarria, Sumbal Babar, Aasma Shaukat, Samuel Margolis, Nicholas P Tatonetti, Girish Nadkarni, Bara El Kurdi, Ali Soroush

机构 * Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院) University of Texas Health(德克萨斯大学健康科学中心) Virginia Hospital Center(弗吉尼亚医院中心) Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学) Stanford University(斯坦福大学) Cedars-Sinai Medical Center(西达赛奈医疗中心) Inova Fairfax Medical Campus(伊诺瓦费尔法克斯医疗中心) University of California–Los Angeles(加州大学洛杉矶分校) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Columbia University(哥伦比亚大学)

AI总结 本研究评估了大语言模型和视觉-语言模型在胃肠病学中的医学推理性能,比较了不同模型配置、参数及提示工程策略对性能的影响,发现专有模型在准确性上优于开源模型,且图像描述对视觉-语言模型性能有显著影响。

Comments Manuscript Pages: 34, Figures: 7, Tables: 2, Supplementary File Pages: 35, Data Transparency Statement: Code is available at: https://github.com/Sdamirsa/LLM-VLM-in-Gastroenterology . Study data from American College of Gastroenterology (ACG) are restricted and available upon request with ACG permission. Correction: updated abstract considering Llama3.1 results

Journal ref npj Digital Medicine 8, 797 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏