arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

共收录 1184
2512.23978 2026-05-19 cs.LG math.OC stat.ML

Assured autonomy: How operations research powers and orchestrates generative AI systems

保障自主性:如何用运筹学赋能和协调生成式AI系统

Tinglong Dai, David Simchi-Levi, Michelle Xiao Wu, Yao Xie

机构 * Carey Business School, Johns Hopkins University(约翰霍普金斯大学卡里商学院) Data Science and AI Institute, Johns Hopkins University(约翰霍普金斯大学数据科学与人工智能研究院) Institute for Data, Systems and Society, Operations Research Center, Department of Civil and Environmental Engineering, Massachusetts Institute of Technology(麻省理工学院数据、系统与社会研究所,运筹学中心,土木与环境工程系) Purdue University(普渡大学) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H.米尔顿·斯图尔特工业与系统工程学院)

AI总结 本文探讨生成式AI在向自主决策系统转变过程中,如何通过运筹学方法提升系统的可行性、鲁棒性和风险控制能力。

Comments Authors are listed alphabetically; Production and Operations Management (POM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19953 2026-05-19 cs.CV

Supervise Less, See More: Training-free Nuclear Instance Segmentation with Prototype-Guided Prompting

少监督,多观察:基于原型引导的提示方法实现无训练核实例分割

Wen Zhang, Qin Ren, Wenjing Liu, Haibin Ling, Chenyu You

机构 * Stony Brook University(石溪大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出SPROUT框架,通过组织学先验知识构建滑片特定参考原型,利用部分最优传输方案指导特征对齐,使SAM模型无需训练即可实现精准核分割。

Comments ICML 2026; 44 pages, 25 figures, 26 tables; Code at https://github.com/Y-Research-SBU/SPROUT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16054 2026-05-18 cs.LG cs.AI

Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making

Ada-Diffuser: 面向决策制定的潜在意识自适应扩散模型

Fan Feng, Selena Ge, Minghao Fu, Zijian Li, Yujia Zheng, Zeyu Tang, Yingyao Hu, Biwei Huang, Kun Zhang

机构 * University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出Ada-Diffuser,通过显式建模潜在动态过程,提升决策制定的精度与适应性,实验验证其在模拟控制与机器人基准中的有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09231 2026-05-18 cs.CV stat.ML

An Elastic Shape Variational Autoencoder for Skeleton Pose Trajectories

一种弹性形状变分自编码器用于骨骼姿态轨迹

Arafat Rahman, Shashwat Kumar, Laura E. Barnes, Anuj Srivastava

机构 * Systems and Information Engineering, University of Virginia(弗吉尼亚大学系统与信息工程系) Biomedical Engineering, Johns Hopkins University(约翰霍普金斯大学生物医学工程系) Dept. of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系)

AI总结 本文提出ES-VAE,通过运输平方根速度场表示在Kendall形状流形上学习骨骼轨迹的生成模型,有效分离形状动态,优于标准VAE和序列建模基线,在步态分析和动作识别中表现优异。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21536 2026-05-18 cs.CV

IHF-Harmony: Multi-Modality Magnetic Resonance Images Harmonization using Invertible Hierarchy Flow Model

IHF-Harmony:基于可逆分层流模型的多模态磁共振图像统一化

Pengli Zhu, Yitao Zhu, Haowen Pang, Anqi Qiu

机构 * Department of Health Technology and Informatics, The Hong Kong Polytechnic University, Hong Kong(健康科技与信息技术系,香港理工大学,香港) School of Integrated Circuits and Electronics, Beijing Institute of Technology, China(集成电路与电子学院,北京理工大学,中国) Mental Health Research Center, The Hong Kong Polytechnic University, Hong Kong(心理健康研究中心,香港理工大学,香港) Department of Biomedical Engineering, Johns Hopkins University, USA(生物医学工程系,约翰霍普金斯大学,美国)

AI总结 本文提出IHF-Harmony,通过可逆分层流模型实现多模态MRI图像统一化,利用无配对数据提升跨模态可扩展性,保留解剖结构并提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15569 2026-05-18 cs.CR cs.AI cs.SE

Detecting Privilege Escalation in Polyglot Microservices via Agentic Program Analysis

通过代理程序分析检测多语言微服务中的特权提升

Penghui Li, Hong Yau Chong, Yinzhi Cao, Junfeng Yang

机构 * Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出Neo框架,结合LLM和经典程序分析,解决微服务中特权提升检测的复杂性问题,发现24个零日漏洞,精度和召回率均优于现有方法。

Comments In Proceedings of the 47th IEEE Symposium on Security and Privacy (S&P)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15326 2026-05-18 cs.CV

Multimodal Object Detection Under Sparse Forest-Canopy Occlusion

多模态目标检测在稀疏森林冠层遮挡下的应用

Nitik Jain, Mangal Kothari

机构 * Robotics & AI, Johns Hopkins University, USA(约翰霍普金斯大学机器人与人工智能系,美国) Department of Aerospace Engineering, IIT Kanpur(印度理工学院坎浦尔航空航天工程系) Senior Principal Flight Control Engineer, ADASI, EDGE Group, Abu Dhabi, UAE(阿布扎赫尔ADASI高级飞行控制系统工程师,EDGE集团)

AI总结 本文提出一种多模态管道,结合激光雷达、可见-热成像融合和合成孔径成像技术,以提高森林冠层下人类检测的可靠性,展示了改进的YOLOv5检测器在热成像和融合图像上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16981 2026-05-15 cs.CV cs.GR

SyncLight: Single-Edit Multi-View Relighting

SyncLight:单编辑多视角光照

David Serrano-Lozano, Anand Bhattad, Luis Herranz, Jean-François Lalonde, Javier Vazquez-Corral

机构 * Computer Vision Center Universitat Autònoma de Barcelona(Autonomous University of Barcelona计算机视觉中心) Johns Hopkins University(约翰霍普金斯大学) Universidad Politécnica de Madrid(马德里理工大学) Université Laval(拉瓦尔大学)

AI总结 SyncLight通过单视角参考编辑实现多视角一致的参数化光照控制,采用多视角扩散变压器实现高保真多视角图像集重绘。

Comments Project page: http://sync-light.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14415 2026-05-15 cs.SE cs.AI cs.CL

SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades

SWE-Chain:基于链式发布级包升级的编码代理基准测试

Man Ho Lam, Chaozheng Wang, Hange Liu, Jingyu Xiao, Haau-sing Li, Jen-tse Huang, Terry Yue Zhuo, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Independent(独立) ELLIS Technical University of Darmstadt(达姆施塔特技术大学) Johns Hopkins University(约翰霍普金斯大学) Monash University(墨尔本大学)

AI总结 SWE-Chain通过链式发布级包升级评估编码代理,包含12个升级链和155个版本过渡,揭示当前代理在连续维护中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14269 2026-05-15 cs.CV cs.AI

PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation

PhyMotion: 结构化3D运动奖励用于物理基础的人体视频生成

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Jaemin Cho, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(UNC夏洛特希尔大学) FieldAI NTU Singapore(新加坡国立大学) AI2 Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出PhyMotion,一种结构化的3D运动奖励机制,通过物理模拟器评估人体运动的物理可行性,提升视频生成中人体动作的真实感。

Comments First two authors contributed equally, website: https://phy-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03814 2026-05-15 cs.AI cs.LG

Conformal Thinking: Risk Control for Reasoning on a Compute Budget

conformal thinking: 用于计算预算上的推理风险控制

Xi Wang, Anushri Suresh, Alvin Zhang, Rishi More, William Jurayj, Benjamin Van Durme, Mehrdad Farajtabar, Daniel Khashabi, Eric Nalisnick

机构 * Johns Hopkins University, Baltimore, Maryland, USA(约翰霍普金斯大学,巴尔的摩,马里兰州,美国) Apple, USA(苹果公司,美国)

AI总结 本文提出一种风险控制框架,通过设置上界和下界阈值来优化计算预算,提升推理效率并降低错误率。

Comments ICMl 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07060 2026-05-15 cs.CL

Does Local News Stay Local?: Online Content Shifts in Sinclair-Acquired Stations

本地新闻仍然本地吗?:西恩斯集团收购电台的在线内容变化

Miriam Wanner, Sophia Hager, Anjalie Field

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究探讨西恩斯集团收购本地新闻电台后,其在线内容对本地与全国性话题的报道变化,发现电台更频繁报道全国性新闻,且对具有争议性的全国性话题的报道增加。

Comments Published at NLP+CSS Workshop @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13737 2026-05-14 cs.AI cs.CL

Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

宽视角闭合:多模态大语言模型中的表征-行动鸿沟

Trung Nguyen Quang, Yiming Gao, Fanyi Pu, Kaichen Zhang, Shuo Sun, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) LMMs-Lab Team(多模态大模型实验室团队) Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究发现多模态大语言模型在感知与行动之间存在鸿沟,通过IMAVB基准测试揭示模型在处理冲突信息时的不足,提出PGLA方法提升拒绝行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13711 2026-05-14 cs.LG

MILM: Large Language Models for Multimodal Irregular Time Series with Informative Sampling

MILM:用于多模态不规则时间序列的大型语言模型与信息采样

Hsing-Huan Chung, Shijun Li, Yoav Wald, Xing Han, Suchi Saria, Joydeep Ghosh

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Technion-IIT(技术学院-以色列理工学院) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出MILM模型,通过两阶段策略处理多模态不规则时间序列,有效利用采样模式和观测值进行分类,提升医疗记录中住院死亡率预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13675 2026-05-14 cs.CV cs.LG q-bio.NC

Characterizing Universal Object Representations Across Vision Models

跨视觉模型的通用对象表示表征

Florian P. Mahner, Johannes Roth, Ka Chun Lam, Michael F. Bonner, Francisco Pereira, Martin N. Hebart

机构 * Vision and Computational Cognition Group(视觉与计算认知组) Max Planck Institute(马克斯·普朗克研究所) Justus-Liebig-University Giessen(吉森约瑟夫·李贝大学) Machine Learning Core(机器学习核心) Department of Cognitive Science(认知科学系) National Institute of Mental Health(国家心理健康研究所) Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究通过分解162种不同视觉模型的对象相似性结构,发现通用维度比模型特定维度更可解释,且与概念图像属性相关,表明生物视觉与深度学习模型的对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13625 2026-05-14 cs.AI

How to Interpret Agent Behavior

如何解释智能体行为

Jie Gao, Kaiser Sun, Jen-tse Huang, Katherine Van Koevering, Sijie Ji, Heyuan Huang, Weiyan Shi, Zhuoran Lu, Ziang Xiao, Daniel Khashabi, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) California Institute of Technology(加州理工学院) Northeastern University(东北大学) Purdue University(普渡大学)

AI总结 本文提出ACT*ONOMY框架,通过构建行为分类体系和开放仓库,帮助研究人员更一致地解读智能体行为,提升监控与控制能力。

Comments 34 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13595 2026-05-14 cs.CL

Inducing Artificial Uncertainty in Language Models

在语言模型中诱导人工不确定性

Sophia Hager, Simon Zeng, Nicholas Andrews

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软)

AI总结 本文研究了在缺乏挑战性数据时如何通过诱导人工不确定性来提升语言模型的不确定性量化能力,通过训练探测器识别人工不确定性,实现了在困难数据上的高校准性,且对简单数据的性能影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01502 2026-05-14 q-bio.NC cs.CV cs.LG

Behavioral Geometric Supervision Aligns Video Foundation Models with Human Social Perception

行为几何监督使视频基础模型与人类社会感知对齐

Kathy Garcia, Leyla Isik

机构 * Department of Cognitive Science(认知科学系) Department of Biomedical Engineering(生物医学工程系) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出行为几何监督(BGS),通过引入人类社会判断数据,提升视频模型对社会关系的感知能力,实验表明该方法能显著提升模型性能并揭示可解释的社会情感属性。

Comments v2: Major revision. Retitled; expanded from TimeSformer alone to four backbones (V-JEPA 2/2.1, TimeSformer, VideoMAE, CLIP), with V-JEPA 2.1 nearly tripling pretrained performance. Adds zero-shot PHASE transfer, attention-rollout analysis, and a language-distillation control. Data (OOO sim. judgments) & core hybrid triplet+RSA LoRA method unchanged from v1. Prepared for NeurIPS 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12449 2026-05-13 cs.CV

LychSim: A Controllable and Interactive Simulation Framework for Vision Research

LychSim:一种可控且交互式的视觉研究仿真框架

Wufei Ma, Chloe Wang, Siyi Chen, Jiawei Peng, Patrick Li, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 LychSim基于Unreal Engine 5构建,提供简洁的Python API、生成多样化高保真环境的流程数据管道以及MCP协议集成,用于视觉研究中的可控仿真与闭环优化。

Comments 3D-LLM/VLA Workshop at CVPR 2026. Project page: https://lychsim.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12419 2026-05-13 cs.CL cs.IR cs.LG

ORBIT: Preserving Foundational Language Capabilities in GenRetrieval via Origin-Regulated Merging

ORBIT:通过起源调节合并在生成检索中保留基础语言能力

Neha Verma, Nikhil Mehta, Shao-Chuan Wang, Naijing Zhang, Alicia Tsai, Li Wei, Lukasz Heldt, Lichan Hong, Ed Chi, Xinyang Yi

机构 * Johns Hopkins University(约翰霍普金斯大学) Google DeepMind(谷歌DeepMind) Google(谷歌)

AI总结 ORBIT通过跟踪模型权重距离并使用加权平均策略,在生成检索微调中减少模型漂移,有效保留语言基础能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07767 2026-05-13 cs.LG

Taking the Road Less Scheduled with Adaptive Polyak Steps

走少计划之路:自适应Polyak步长

Dimitris Oikonomou, Matthew Buchholz, Yuen-Man Pun, Robert M. Gower, Nicolas Loizou

机构 * Johns Hopkins University(约翰霍普金斯大学) University of British Columbia(不列颠哥伦比亚大学) Australian National University(澳大利亚国立大学) Center for Computational Mathematics(计算数学中心) Flatiron Institute, Simons Foundation(Flatiron 机构,Simons 基金会)

AI总结 本文提出自适应Polyak步长的Schedule-Free SGD和Adam,通过迭代平均实现无调度优化,无需调优基础学习率,统一了标准与无调度Polyak方法,实验显示其在语言建模中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11438 2026-05-13 cs.CV

Beyond Masks: The Case for Medical Image Parsing

超越遮罩:医疗图像解析的必要性

Siddharth Gupta, Alan L. Yuille, Zongwei Zhou

机构 * Johns Hopkins University(约翰霍普金斯大学) Northwestern University(西北大学) Johns Hopkins Medicine(约翰霍普金斯医学)

AI总结 医疗影像研究应转向医疗图像解析作为核心输出,通过结构化表示实体、属性与关系,实现一致且完整的描述,以提升诊断、重建和预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11229 2026-05-13 cs.CR cs.AI cs.SE

Comment and Control: Hijacking Agentic Workflows via Context-Grounded Evolution

评论与控制:通过上下文引导进化劫持代理工作流

Neil Fendley, Zhengyu Liu, Aonan Guan, Jiacheng Zhong, Yinzhi Cao

机构 * Johns Hopkins University Applied Physics Lab(约翰霍普金斯大学应用物理实验室) Johns Hopkins University(约翰霍普金斯大学) Wyze Labs(Wyze实验室)

AI总结 本文提出JAW框架,通过上下文引导进化方法劫持自动化平台上的代理工作流,揭示代理工作流中因输入操控导致的安全风险,并展示了对GitHub和n8n的广泛影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11135 2026-05-13 cs.MA cs.AI cs.LG

Control Charts for Multi-agent Systems

多智能体系统的控制图

Hayden Helm, Carey Priebe, Brandon Duderstadt

机构 * Johns Hopkins University(约翰霍普金斯大学) Calcifer Computing(Calcifer公司)

AI总结 本文提出基于适应性控制图的多智能体系统监控方法,通过仿真展示其在学习环境中的必要性,并揭示对抗性智能体对系统安全性的根本矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07668 2026-05-13 cs.CV cs.AI cs.LG cs.RO

Looking and Listening Inside and Outside: Multimodal Artificial Intelligence Systems for Driver Safety Assessment and Intelligent Vehicle Decision-Making

观察与聆听内外:多模态人工智能系统用于驾驶员安全评估和智能车辆决策

Ross Greer, Laura Fleig, Maitrayee Keskar, Erika Maquiling, Giovanni Tapia Lopez, Angel Martinez-Sanchez, Parthib Roy, Jake Rattigan, Mira Sur, Alejandra Vidrio, Thomas Marcotte, Mohan Trivedi

机构 * Machine Intelligence, Interaction, and Imagination (Mi3) Laboratory(机器智能、交互与想象实验室) Laboratory for Intelligent and Safe Automobiles (LISA)(智能与安全汽车实验室) Johns Hopkins University(约翰霍普金斯大学) Center for Medicinal Cannabis Research (CMCR)(医药大麻研究中心)

AI总结 本文提出L-LIO框架,通过融合音频与视觉数据提升驾驶员状态评估和环境理解,探讨音频在车辆安全中的作用,包括驾驶员语音分类、乘客指令分析及视觉不足时的音频辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10761 2026-05-12 cs.CV

RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology

RadThinking:放射学中纵向临床推理的数据集

Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Alan L. Yuille, Zongwei Zhou

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Clinic of Radiology and Nuclear Medicine, University Hospital Basel(巴塞尔大学医院放射科与核医学科) Department of Oncology, Johns Hopkins School of Medicine(约翰霍普金斯医学院肿瘤科)

AI总结 RadThinking数据集通过三个难度层级的VQA任务,提供放射学纵向临床推理的训练和评估框架,支持多步骤推理和临床指南标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10621 2026-05-12 cs.LG cs.SY eess.SY

Hierarchical End-to-End Taylor Bounds for Complete Neural Network Verification

分层端到端泰勒界用于完全神经网络验证

Taha Entesari, Mahyar Fazlyab

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出HiTaB框架,利用二阶光滑性及Hessian和其Lipschitz常数,通过分层方法改进神经网络可达集分析,提供更精确的安全性证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10130 2026-05-12 cs.CV

Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection

Thermal-Det: 语言引导的跨模态蒸馏用于开放词汇热成像目标检测

Yasiru Ranasinghe, Elim Schenck, Florence Yellin, Shuowen Hu, Christopher Funk, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Kitware DEVCOM Army Research Laboratory(国防部陆军研究实验室)

AI总结 本文提出Thermal-Det,首个针对热成像的开放词汇检测器,通过合成数据集和跨模态蒸馏提升热成像目标检测性能,实验显示在公开基准上取得2-4%的AP提升。

Comments Accepted at CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10622 2026-05-12 cs.CL cs.AI cs.LG

SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation

SDialog:一个用于端到端代理构建、用户模拟、对话生成和评估的Python工具包

Sergio Burdisso, Séverin Baroudi, Yanis Labrak, David Grunert, Pawel Cyrta, Yiyang Chen, Srikanth Madikeri, Thomas Schaaf, Esaú Villatoro-Tello, Ahmed Hassoon, Ricard Marxer, Petr Motlicek

机构 * Idiap Research Institute(Idiap研究 institute) Université de Toulon(里昂大学) Aix Marseille Univ(马赛大学) LIS(LIS实验室) Avignon University(阿维尼翁大学) Zenidoc University of Zurich(苏黎世Zenidoc大学) Stenograf Solventum CNRS & ILLS(Solventum CNRS与ILLs) Johns Hopkins University(约翰霍普金斯大学)

AI总结 SDialog工具包通过统一的对话生成、评估和可解释性框架,提供多代理模拟、综合评估、机制可解释性和音频生成功能,支持混合后端实验。

Comments Pre-print submitted to EACL System Demonstration (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09679 2026-05-12 cs.CV cs.AI

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) Tongji University(同济大学)

AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏