arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

共收录 1179
2604.17473 2026-06-24 cs.CV cs.AI 版本更新

Dual-Anchoring: Addressing State Drift in Vision-Language Navigation

双锚定:解决视觉语言导航中的状态漂移问题

Kangyi Wu, Pengna Li, Kailin Lyu, Xi Lin, Lin Zhao, Qingrong He, Jinjun Wang, Jianyi Liu

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Johns Hopkins University(约翰霍普金斯大学) Joy Future Academy, JD(京东探索研究院)

AI总结 提出双锚定框架,通过指令进度锚定和记忆地标锚定分别解决进度漂移和记忆漂移,显著提升长场景导航成功率。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00069 2026-06-24 cs.CY cs.AI cs.CL 版本更新

Societal Alignment Frameworks Can Improve LLM Alignment

社会对齐框架可以改进大语言模型对齐

Karolina Stańczak, Nicholas Meade, Mehar Bhatia, Hattie Zhou, Konstantin Böttinger, Jeremy Barnes, Jason Stanley, Jessica Montgomery, Richard Zemel, Nicolas Papernot, Nicolas Chapados, Denis Therien, Timothy P. Lillicrap, Ana Marasović, Sylvie Delacroix, Gillian K. Hadfield, Siva Reddy

机构 * ETH Zurich(苏黎世联邦理工学院) Mila, McGill University(麦吉尔大学米尔人工智能实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) University of Toronto, Google DeepMind(多伦多大学与DeepMind) McGill University, ServiceNow(麦吉尔大学与ServiceNow) Google DeepMind(谷歌DeepMind) University of Utah(犹他大学) King's College London(伦敦国王学院) Johns Hopkins University(约翰霍普金斯大学) Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)

AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04458 2026-06-23 cs.CL cs.IR 版本更新

DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

DoGMaTiQ:面向报告评估的问答片段自动生成

Bryan Li, William Walden, Yu Hou, Gabrielle Kaili-May Liu, Dawn Lawrie, James Mayfield, Eugene Yang, Chris Callison-Burch, Laura Dietz

机构 * Google Inc.(谷歌公司) Johns Hopkins University(约翰霍普金斯大学) University of Maryland(马里兰大学) Yale University(耶鲁大学) University of Pennsylvania(宾夕法尼亚大学) University of New Hampshire(新罕布什尔大学)

AI总结 提出DoGMaTiQ流水线,通过文档锚定生成、释义聚类和基于质量准则的子选择三步自动生成高质量QA片段,实现报告的全自动评估,在跨语言任务中与人工判断高度相关。

Comments ICTIR '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21414 2026-06-23 eess.IV cs.AI cs.CV 新提交

2D Versus 3D Diffusion for In Silico Training of Interventional X-ray AI Models

二维与三维扩散在介入X射线AI模型模拟训练中的比较

Sampath Rapuri, Jeremy Ko, Benjamin D. Killeen, Russell H. Taylor, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文比较了基于3D条件潜在扩散模型生成CT体数据用于DRR合成与基于视图条件的2D扩散模型直接生成合成X射线两种方法,发现2D扩散生成的合成X射线可用于训练解剖标志检测模型,性能接近真实数据训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23664 2026-06-23 cs.LG cs.MA 新提交

MAS-PromptBench: When Does Prompt Optimization Improve Multi-Agent LLM Systems?

MAS-PromptBench:提示优化何时能提升多智能体LLM系统?

Juyang Bai, Laixi Shi

机构 * Johns Hopkins University(约翰霍普金斯大学) Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)

AI总结 系统研究提示优化在多智能体LLM系统中的效果,发现其能显著提升性能,但收益依赖于任务、工作流和团队规模等配置。

Comments Project page: https://juyangbai.github.io/MAS-PromptBench/ ; Code: https://github.com/juyangbai/MAS-PromptBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22877 2026-06-23 cs.CL 新提交

DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings

DynamicMem:真实世界场景下的长时记忆基准测试

Wenya Xie, Shengming Zhou, Zelin Li, Pouya Parsa, Shuang Zhou, Xinheng Ding, Chinmay Arvind, Guanchu Wang, Vladimir Braverman, Ali Payani, Yantao Zheng, Zirui Liu

机构 * University of Minnesota(明尼苏达大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Johns Hopkins University(约翰霍普金斯大学) Cisco(思科) Adobe

AI总结 提出DynamicMem基准,通过合成15个月的多应用用户活动数据,评估LLM代理在异构、动态变化且隐含的用户画像记忆能力,发现记忆检索是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22673 2026-06-23 cs.AI cs.SE 新提交

AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent

AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导

Weidi Luo, Qiming Zhang, Yihao Quan, Mingyu Jin, Jie Cai, Chaowei Xiao, Jingcheng Niu, Zhen Xiang

机构 * University of Georgia(佐治亚大学) University of South Florida(南佛罗里达大学) Rutgers University(罗格斯大学) University of Southern California(南加州大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22375 2026-06-23 cs.AI cs.CE cs.IR 新提交

ARIA: A Causal-Aware Framework for Rescuing LLM Reasoning in Trustworthy Materials Discovery

ARIA: 一种用于在可信材料发现中拯救LLM推理的因果感知框架

Yi Cao, Liaoyaqi Wang, Jieneng Chen, Benjamin Van Durme, Alan Yuille, Paulette Clancy

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出ARIA框架,通过因果感知的三级级联(直接因果推理、物理类比迁移、参数回退)解决LLM在材料发现中的上下文隧道问题,提升物理可信性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22305 2026-06-23 cs.CL 新提交

Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning

以合适的速度学习:自适应数据调度改进大语言模型强化学习

Zicheng Xu, Ruixuan Zhang, Yu-Neng Chuang, Xiuyi Lou, Hoang Anh Duy Le, Oren Gal, Alexander S. Szalay, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) Rice University(莱斯大学) University of Haifa(海法大学) Workato University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 针对LLM强化学习后训练中均匀采样忽视数据语义和策略变化的问题,提出自适应数据调度框架ADS,通过语义聚类和策略边界样本选择实现双层级调度,在三个LLM和七个推理基准上平均准确率提升5.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22085 2026-06-23 cs.AI cs.CL cs.LG 新提交

Can Reasoning Models Detect Changes to their Chains of Thought?

推理模型能否检测其思维链的变化?

Sathvik Napa, Utkarsh Singh, Chengyuan Xue, Miriam Wanner, William Walden

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究推理模型在多种条件下检测自身思维链干预的能力,发现模型检测准确率很低,且难以识别修改方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21886 2026-06-23 cs.HC cs.AI cs.CL cs.CY 新提交

AI-Mediated Negotiation: Design Reflections and Lessons

AI中介谈判:设计反思与经验教训

Veda Duddu, Jash Rajesh Parekh, Andy Mao, Hanyi Min, Ziang Xiao, Vedant Das Swain, Koustuv Saha

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

AI总结 通过构建理论驱动的教练系统Trucey并进行实验,发现对话AI在谈判准备中施加线性执行模型,而任务本质是递归的,静态手册反而优于AI条件,提出“先映射后路径,先路径后模拟”的序列原则。

Journal ref CSCW Companion '26: Companion Publication of the 2026 Conference on Computer-Supported Cooperative Work and Social Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21398 2026-06-23 cs.RO 新提交

BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation

BIT-Nav: 具身导航的脑启发轨迹记忆

Rithvik Jonna, Aakash Gurram, Man Namgung, Wyatt Mackey, Tinoosh Mohsenin

机构 * Johns Hopkins University(约翰霍普金斯大学) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

AI总结 提出BIT-Nav框架,通过轻量级学习轨迹记忆增强冻结的视觉-语言模型导航,解决长序列中帧采样稀疏问题,以恒定token成本编码结构化运动历史。

Comments Accepted to CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21238 2026-06-23 cs.DC cs.AI cs.LG 新提交

Recency/Frequency Adaptive KV Caching for Large Language Model Serving

面向大语言模型服务的近期/频率自适应KV缓存

Yang Shen, Meghana Madhyastha, Robert Underwood, Bogdan Nicolae, Randal Burns

机构 * Department of Computer Science, Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学计算机科学系) Argonne National Laboratory, Lemont, USA(阿贡国家实验室) Parasail, Inc., San Mateo, USA(Parasail公司)

AI总结 针对LRU策略在多工作负载下缓存失效问题,提出自适应KV缓存,动态分配近期与高频KV块的空间,在合成文档问答中缓存命中率提升10.8%,首令牌时间降低12.6%。

Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference (AdaptFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21099 2026-06-23 cs.CV 新提交

ShuffleFlow: Scalable Posterior Inference for Bayesian Inverse Imaging

ShuffleFlow: 贝叶斯逆成像的可扩展后验推断

Tianao Li, Tjitske Starkenburg, Yu Sun, Emma Alexander

机构 * Northwestern University(西北大学) Department of Physics and Astronomy, Northwestern University(西北大学物理与天文学系) NSF-Simons AI Institute for the Sky (SkAI)(NSF-Simons天空人工智能研究所) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出ShuffleFlow框架,通过像素重排、神经场编码和条件归一化流,实现大规模图像重建中可扩展的后验推断,比扩散采样器更快生成高样本数后验。

Comments Accepted to IEEE International Conference on Computational Photography (ICCP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20905 2026-06-23 cs.RO cs.AI 新提交

Vesta: A Generalist Embodied Reasoning Model

Vesta: 一种通用具身推理模型

Johan Bjorck, Zhiqi Li, Yunze Man, Jing Wang, An-Chieh Cheng, Sifei Liu, Shihao Wang, Zhiding Yu, Abhishek Badki, Stan Birchfield, Valts Blukis, Yevgen Chebotar, Siyi Chen, Sicong Leng, Yu-Cheng Chou, Tianli Ding, Boyi Li, Zhengyi Luo, Hang Su, Jonathan Tremblay, Tingwu Wang, Bowen Wen, Jimmy Wu, Xianghui Xie, Hanrong Ye, Hongxu Yin, K. R. Zentner, Liangyan Gui, Yu-Xiong Wang, Yuke Zhu, Linxi "Jim" Fan, Jan Kautz

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学) University of Michigan(密歇根大学) Nanyang Technological University(南洋理工大学) Johns Hopkins University(约翰霍普金斯大学) University of Tübingen(图宾根大学)

AI总结 提出统一的基础模型Vesta,整合定位、空间推理、导航和长时规划能力,通过大规模空间感知语料库和简单多模态记忆机制,在多个基准上平均优于专用模型20%以上,在真实机器人任务中成功率提升35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23364 2026-06-23 cs.LG math.DS math.OC 新提交

Convergence of Gradient Descent for General Neural Network Architectures Beyond the NTK Regime

超越NTK机制的一般神经网络架构的梯度下降收敛性

Yuqing Wang

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出一个分析梯度下降动力学的收敛框架,适用于广泛神经网络架构和数据集,证明在温和假设下梯度下降几乎必然收敛到驻点邻域,并给出学习率缩放规律。

Comments arXiv admin note: text overlap with arXiv:2506.24120

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22859 2026-06-23 cs.AI astro-ph.IM physics.soc-ph 新提交

AI Scientists as Engines of Discovery: A Case for Development within Reformed Institutions

作为发现引擎的AI科学家:在改革机构内发展的案例

Raul Jimenez, Boris Bolliet, Francisco Villaescusa-Navarro, Rabih Zbib, Benjamin Wandelt, David N. Spergel, Thomas Meier, Jessica Montgomery, Hana Aliee, Licia Verde

机构 * Institute of Cosmos Sciences (ICCUB), University of Barcelona(巴塞罗那大学宇宙科学研究所) ICREA Cavendish Astrophysics, University of Cambridge(剑桥大学卡文迪什天体物理学) Kavli Institute for Cosmology, University of Cambridge(剑桥大学卡维里宇宙学研究所) Center for Computational Astrophysics, Flatiron Institute(弗拉蒂隆研究所计算天体物理中心) Department of Astrophysical Sciences, Princeton University(普林斯顿大学天体物理科学系) Avature Department of Physics and Astronomy, Johns Hopkins University(约翰霍普金斯大学物理与天文学系) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系) Flatiron Institute(弗拉蒂隆研究所) Munich Center for Machine Learning, LMU Munich(慕尼黑大学慕尼黑机器学习中心) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) School of Clinical Medicine, University of Cambridge(剑桥大学临床医学院)

AI总结 本文论证多智能体AI系统将从被动工具进化为“AI科学家”,通过原型框架Denario加速发现周期,并提出机构需为验证、问责、可解释性和双重用途安全进行改革。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08819 2026-06-23 cs.IR cs.AI 版本更新

Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage

超越相关性:检索与RAG信息覆盖之间的关系

Saron Samuel, Alexander Martin, Eugene Yang, Andrew Yates, Dawn Lawrie, Ian Soboroff, Laura Dietz, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) National Institute of Standards and Technology(国家标准与技术研究院) University of New Hampshire(新罕布什尔大学)

AI总结 研究检索质量与生成响应信息覆盖的关系,发现基于覆盖的检索指标与生成响应中的要点覆盖强相关,支持用检索指标代理RAG性能。

Comments 12 pages, ICTIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24551 2026-06-23 cs.CV 版本更新

PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation

PhyGDPO: 物理感知的分组直接偏好优化以实现物理一致的文本到视频生成

Yuanhao Cai, Kunpeng Li, Menglin Jia, Jialiang Wang, Junzhe Sun, Feng Liang, Weifeng Chen, Felix Juefei-Xu, Chu Wang, Ali Thabet, Xiaoliang Dai, Xuan Ju, Alan Yuille, Ji Hou

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰霍普金斯大学) Meta BizAI(Meta商业人工智能)

AI总结 提出PhyAugPipe构建大规模物理增强数据集PhyVidGen-135K,并设计PhyGDPO框架,利用分组Plackett-Luce模型和物理引导奖励机制,实现物理一致的文本到视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09416 2026-06-23 cs.CL cs.CY 版本更新

Are Language Models Sensitive to Morally Irrelevant Distractors?

语言模型对道德无关干扰因素敏感吗?

Andrew Shaw, Christina Hahn, Catherine Rasgaitis, Yash Mishra, Alisa Liu, Natasha Jaques, Yulia Tsvetkov, Amy X. Zhang

机构 * University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本研究借鉴道德心理学中的“情境主义”观点,通过构建包含60种道德无关干扰因素的多模态数据集,发现这些干扰因素能使大语言模型的道德判断偏移超过30%,揭示了其道德判断的不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20556 2026-06-19 cs.CV 新提交

Thinking in Boxes: 3D Editing in Real Images Made Easy

Thinking in Boxes: 真实图像中的3D编辑变得简单

Pradhaan S Bhat, Naveen Chandra R, Rishubh Parihar, Vaibhav Vavilala, R. Venkatesh Babu, D. A. Forsyth, Anand Bhattad

机构 * Indian Institute of Science(印度科学研究所) Apple(苹果公司) UIUC(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出使用3D盒子作为结构化规范,通过用户提供输入和输出盒子来精确控制真实图像中的平移、旋转、缩放和视角变化,同时保持场景和物体身份,恢复未见的物体区域。

Comments Project Page: https://thinking-in-boxes.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20544 2026-06-19 cs.AI cs.LG 新提交

Toward Calibrated Mixture-of-Experts Under Distribution Shift

面向分布偏移下的校准混合专家模型

Gina Wong, Drew Prinster, Suchi Saria, Rama Chellappa, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究混合专家模型在分布偏移下的校准问题,提出对抗性重加权方法以改善路由聚合的校准误差,提升准确率-校准权衡。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01391 2026-06-19 cs.CV 版本更新

Relighting as a Probe of Visual Priors via Augmented Latent Intrinsics

通过增强潜在本征属性将重光照作为视觉先验的探针

Xiaoyan Xing, Xiao Zhang, Sezer Karaoglu, Theo Gevers, Anand Bhattad

机构 * UvA-Bosch Delta Lab, University of Amsterdam, Amsterdam, Netherlands(乌得勒支大学阿姆斯特丹分校博世Delta实验室) The University of Chicago, Chicago, USA(芝加哥大学) Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学)

AI总结 提出增强潜在本征属性(ALI)方法,融合密集像素对齐视觉特征到潜在本征重光照模型,平衡语义与光度保真度,提升复杂材质重光照质量。

Comments Camera-ready version for ICML 2026. Project page: https://augmented-latent-intrinsics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21978 2026-06-19 cs.LG cs.AI 版本更新

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

超越推理增益:缓解大型推理模型中的通用能力遗忘

Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

机构 * Meta Superintelligence Labs(Meta超智能实验室) New York University(纽约大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 针对强化学习训练导致推理模型遗忘基础能力的问题,提出RECAP重放策略,通过动态目标重加权在线调整训练重点,在保持通用能力的同时提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18596 2026-06-18 cs.HC cs.AI 新提交

Better Adherence, Richer Context: A Field Evaluation of LLM-Powered Conversational Voice Diaries for Sleep

更好的依从性,更丰富的上下文:基于LLM的对话式语音睡眠日记的现场评估

Amama Mahmood, Bokyung Kim, Honghao Zhao, Molly E. Atwood, Luis F. Buenaver, Michael T. Smith, Chien-Ming Huang

机构 * The Johns Hopkins University(约翰霍普金斯大学) Department of Psychiatry and Behavioral Sciences, The Johns Hopkins University School of Medicine(精神病学与行为科学系,约翰霍普金斯大学医学院)

AI总结 通过现场实验评估基于LLM的对话式语音睡眠日记,发现相比文本日记,语音日记提高了依从性并收集了更详细的上下文信息,但结构化字段完整性较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10827 2026-06-18 cs.SD cs.AI 版本更新

Speaker Verification with Speech-Aware LLMs: Evaluation and Augmentation

语音感知大语言模型的说话人验证:评估与增强

Thomas Thebaud, Yuzhe Wang, Laureano Moro-Velazquez, Jesus Villalba-Lopez, Najim Dehak

机构 * Electrical and Computer Engineering Department, Johns Hopkins University, Baltimore, MD, USA(约翰霍普金斯大学电气与计算机工程系) Human Language Technology Center of Excellence, Johns Hopkins University, Baltimore, MD, USA(约翰霍普金斯大学人机语言技术中心卓越中心)

AI总结 提出模型无关的评分协议评估语音感知LLM的说话人区分能力(EER>20%),并通过注入冻结的ECAPA-TDNN说话人嵌入和LoRA微调,实现接近专用系统的性能(EER 1.03%)。

Comments 3 Tables, 1 Figure, Published in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09185 2026-06-18 cs.CV cs.AI 版本更新

Learning Patient-Specific Disease Dynamics with Latent Flow Matching for Longitudinal Imaging Generation

学习患者特异性疾病动态:基于潜在流匹配的纵向影像生成

Hao Chen, Rui Yin, Yifan Chen, Qi Chen, Chao Li

机构 * University of Cambridge(剑桥大学) Nanjing First Hospital(南京第一医院) Nanjing Medical University(南京医科大学) Johns Hopkins University(约翰霍普金斯大学) University of Dundee(邓迪大学)

AI总结 提出Δ-LFM框架,利用流匹配对齐患者潜在轨迹,通过患者特异性潜在对齐实现单调疾病进展建模,在三个纵向MRI基准上验证了可解释性和性能。

Comments ICLR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17340 2026-06-17 cs.CV cs.AI 新提交

Geometry-Consistent Endoscopic Representations for Image-Guided Navigation via Structured Foundation Model Adaptation

几何一致的内窥镜表示用于图像引导导航:基于结构化基础模型适配

Hongchao Shu, Roger D. Soberanis-Mukul, Hao Ding, Morgan Ringel, Mali Shen, Saif Iftekar Sayed, Hedyeh Rafii-Tari, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Semaphor Surgical Johnson & Johnson MedTech(强生医疗科技)

AI总结 提出统一框架,结合合成数据管道与层级感知几何语义适配,学习几何一致且领域鲁棒的图像表示,提升单目内窥镜中的位姿估计与深度预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17298 2026-06-17 cs.CV 新提交

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生

Yiqing Shen, Hao Ding, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17279 2026-06-17 cs.CV 新提交

Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA

基于数字孪生表示的强化学习训练LLMs用于推理密集型手术视频问答

Yiqing Shen, Han Zhang, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出强化学习框架,通过手术基础模型构建数字孪生表示,解耦视觉感知与推理,并引入分层表示与新型奖励,在三个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏