arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-05-12 至 2026-05-12 共收录 10
2605.10761 2026-05-12 cs.CV

RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology

RadThinking:放射学中纵向临床推理的数据集

Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Alan L. Yuille, Zongwei Zhou

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Clinic of Radiology and Nuclear Medicine, University Hospital Basel(巴塞尔大学医院放射科与核医学科) Department of Oncology, Johns Hopkins School of Medicine(约翰霍普金斯医学院肿瘤科)

AI总结 RadThinking数据集通过三个难度层级的VQA任务,提供放射学纵向临床推理的训练和评估框架,支持多步骤推理和临床指南标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10621 2026-05-12 cs.LG cs.SY eess.SY

Hierarchical End-to-End Taylor Bounds for Complete Neural Network Verification

分层端到端泰勒界用于完全神经网络验证

Taha Entesari, Mahyar Fazlyab

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出HiTaB框架,利用二阶光滑性及Hessian和其Lipschitz常数,通过分层方法改进神经网络可达集分析,提供更精确的安全性证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10130 2026-05-12 cs.CV

Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection

Thermal-Det: 语言引导的跨模态蒸馏用于开放词汇热成像目标检测

Yasiru Ranasinghe, Elim Schenck, Florence Yellin, Shuowen Hu, Christopher Funk, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Kitware DEVCOM Army Research Laboratory(国防部陆军研究实验室)

AI总结 本文提出Thermal-Det,首个针对热成像的开放词汇检测器,通过合成数据集和跨模态蒸馏提升热成像目标检测性能,实验显示在公开基准上取得2-4%的AP提升。

Comments Accepted at CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10622 2026-05-12 cs.CL cs.AI cs.LG

SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation

SDialog:一个用于端到端代理构建、用户模拟、对话生成和评估的Python工具包

Sergio Burdisso, Séverin Baroudi, Yanis Labrak, David Grunert, Pawel Cyrta, Yiyang Chen, Srikanth Madikeri, Thomas Schaaf, Esaú Villatoro-Tello, Ahmed Hassoon, Ricard Marxer, Petr Motlicek

机构 * Idiap Research Institute(Idiap研究 institute) Université de Toulon(里昂大学) Aix Marseille Univ(马赛大学) LIS(LIS实验室) Avignon University(阿维尼翁大学) Zenidoc University of Zurich(苏黎世Zenidoc大学) Stenograf Solventum CNRS & ILLS(Solventum CNRS与ILLs) Johns Hopkins University(约翰霍普金斯大学)

AI总结 SDialog工具包通过统一的对话生成、评估和可解释性框架,提供多代理模拟、综合评估、机制可解释性和音频生成功能,支持混合后端实验。

Comments Pre-print submitted to EACL System Demonstration (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09679 2026-05-12 cs.CV cs.AI

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) Tongji University(同济大学)

AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09355 2026-05-12 cs.LG

FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning

FLAME:适应性专家混合用于连续多模态多任务学习

Xing Han, Shravan Chaudhari, Tanvi Ranade, Rama Chellappa, Suchi Saria

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 FLAME提出了一种可扩展的专家混合框架,支持多任务预训练和连续学习,通过模态特定路由器处理不同模态的任务,同时利用低秩内存子空间压缩专家知识,提升参数效率和减少灾难性遗忘。

Comments 37 pages, 25 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13107 2026-05-12 cs.RO

Towards Robust Surgical Automation via Digital Twin Representations from Foundation Models

通过基础模型生成的数字孪生表示实现鲁棒的手术自动化

Hao Ding, Lalithkumar Seenivasan, Hongchao Shu, Grayson Byrd, Han Zhang, Pu Xiao, Juan Antonio Barragan, Russell H. Taylor, Peter Kazanzides, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出基于数字孪生的感知方法,结合LLM代理与dVRK平台,实现手术任务规划的鲁棒性与泛化能力,为手术自动化提供新的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11906 2026-05-12 cs.CV cs.RO

SegSTRONG-C: Segmenting Surgical Tools Robustly On Non-adversarial Generated Corruptions -- An EndoVis'24 Challenge

SegSTRONG-C: 在非对抗性生成扰动下稳健分割手术工具 -- 一个EndoVis'24挑战

Hao Ding, Yuqian Zhang, Tuxun Lu, Ruixing Liang, Hongchao Shu, Lalithkumar Seenivasan, Yonghao Long, Qi Dou, Cong Gao, Yicheng Leng, Seok Bong Yoo, Eung-Joo Lee, Negin Ghamsarian, Klaus Schoeffmann, Raphael Sznitman, Zijian Wu, Yuxin Chen, Septimiu E. Salcudean, Samra Irshad, Shadi Albarqouni, Seong Tae Kim, Yueyi Sun, An Wang, Long Bai, Hongliang Ren, Ihsan Ullah, Ho-Gun Ha, Attaullah Khan, Hyunki Lee, Satoshi Kondo, Satoshi Kasai, Kousuke Hirasawa, Sita Tailor, Ricardo Sanchez-Matilla, Imanol Luengo, Tianhao Fu, Jun Ma, Bo Wang, Marcos Fernández-Rodríguez, Estevao Lima, João L. Vilaça, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Intuitive Surgical Inc.(Intuitive Surgical公司) University of Arizona(亚利桑那大学) Chonnam National University(全州大学) University of British Columbia(不列颠哥伦比亚大学) Kyung Hee University(庆熙大学) University H(大学H)

AI总结 SegSTRONG-C挑战旨在研究模型在非对抗性扰动下的退化问题,通过生成清洁与扰动样本,评估工具分割算法的鲁棒性,并揭示提升鲁棒性的关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08681 2026-05-12 stat.ML cs.AI cs.LG cs.NA math.NA

Core-Halo Decomposition: Decentralizing Large-Scale Fixed-Point Problems

核心-环分解:解大规模固定点问题的去中心化

Haixiang, Yang Xu, Jiefu Zhang, Xudong Wu, Zihan Zhou, Jun He, Jiayu Chen

机构 * Purdue University(普渡大学) The University of Hong Kong(香港大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出核心-环分解方法,通过分离写入所有权与只读评估上下文,解决严格分解导致的结构偏差问题,实现去中心化多智能体系统中大规模固定点问题的准确求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05611 2026-05-12 cs.SD cs.AI eess.AS

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

X-Voice:通过零样本跨语言语音克隆让每个人都能说30种语言

Rixi Xu, Qingyu Liu, Haitao Li, Yushen Chen, Zhikang Niu, Yunting Yang, Jian Zhao, Ke Li, Berrak Sisman, Qinyuan Cheng, Xipeng Qiu, Kai Yu, Xie Chen

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(摩埃人工智能重点实验室、X-LANCE实验室、上海交通大学) Shanghai Innovation Institute(上海创新研究院) Center for Language and Speech Processing, Johns Hopkins University(语言与语音处理中心、约翰霍普金斯大学) Geely(吉利) Dataocean AI(数据海洋人工智能) Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 X-Voice通过双阶段训练和多语言语音合成架构,实现零样本跨语言语音克隆,优于现有多语言系统并在性能上接近大规模模型。

Comments 16 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏