arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-07-14 至 2026-07-14 共收录 15
2607.11570 2026-07-14 cs.RO cs.HC 新提交

ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions

ERR@HRI 3.0 挑战赛:人机交互中错误与预期的多模态检测

Maria Teresa Parreira, Micol Spitale, Maia Stiber, Shiye Cao, Amama Mahmood, Chien-Ming Huang, Hatice Gunes, Wendy Ju

机构 * Cornell University(康奈尔大学) Microsoft Research(微软研究院) Johns Hopkins University(约翰霍普金斯大学) University of Cambridge(剑桥大学)

AI总结 ERR@HRI 3.0 挑战赛提供自然场景视频数据集,供研究者开发多模态机器学习模型检测人机交互错误与预期,三个团队提交的有效模型超卷积神经网络基线,为构建相关检测系统提供了数据、任务、基线及结果等参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10873 2026-07-14 cs.CV cs.RO eess.IV 新提交

X-GuideAR: An Augmented Reality Framework to Mitigate Radiation Exposure during Fluoroscopic Guidance

X-GuideAR:一种在荧光镜引导下减轻辐射暴露的增强现实框架

Mingxu Liu, Zixuan Liu, Ruchen Cai, Yu-Chen Ku, Suxi Gu, Amit Jain, Alejandro Martin-Gomez, Mehran Armand

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Arkansas(阿肯色大学)

AI总结 研究针对骨科手术中“荧光镜搜索”增加辐射暴露的问题,提出X-GuideAR增强现实框架,通过合成X射线预览加速搜索、减少辐射,经初步研究,该框架在S2AI螺钉放置中减少X射线数量,提高螺钉直径安全性,助力更安全高效手术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10608 2026-07-14 cs.AI 新提交

The Compliance Trap: Diagnosing How AI Agents Consume Conflicting Memory

合规陷阱:诊断人工智能代理如何处理冲突记忆

Yixiong Chen, Xinyi Bai, Alan Yuille

机构 * Johns Hopkins University(约翰·霍普金斯大学) Cornell University(康奈尔大学)

AI总结 研究人工智能代理处理冲突记忆的问题,提出E-P-R框架,通过在WebArena和MemTrapBench上实例化发现主要失败始于入口,冲突记忆导致合规陷阱,强调评估记忆增强型代理应考虑其处理记忆的全过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10601 2026-07-14 cs.AI 新提交

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories

Agentic-DPO:从专家轨迹上的模仿到智能体策略优化

Yixiong Chen, Alan Yuille

机构 * Johns Hopkins University(约翰·霍普金斯大学)

AI总结 研究针对大语言模型智能体基于专家轨迹训练只学动作序列、难应对错误的问题,提出Agentic-DPO方法,通过转化专家轨迹为状态条件偏好监督,结合策略保持增强,实现低成本智能体策略优化,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10074 2026-07-14 cs.LG 新提交

Distance-Preserving Embeddings in Inhomogeneous Random Graphs

非均匀随机图中的距离保持嵌入

My Le, Luana Ruiz, Souvik Dhara

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究非均匀随机图中距离保持嵌入,基于地标嵌入分析最短路径近似,扩展失真保证到全局平均并统一分析,引入GNN增强变体,使模型能从小图学习并推广到大型真实网络,保持或超越经典嵌入保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27537 2026-07-14 cs.CV 版本更新

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

MemoBench: 动态变化环境中的世界建模基准测试

Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Boston University(波士顿大学) Google(谷歌) JHU(约翰霍普金斯大学) CMU(卡内基梅隆大学) Kempner Institute(肯普纳研究所)

AI总结 提出MemoBench基准,通过目标消失-重现范式评估视频生成模型在动态环境中的记忆一致性,涵盖合成与真实场景,揭示现有模型的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23525 2026-07-14 cs.CL 版本更新

Self-Compacting Language Model Agents

自压缩语言模型智能体

Tianjian Li, Jingyu Zhang, William Jurayj, Xi Wang, Chuanyang Jin, Mehrdad Farajtabar, Eric Nalisnick, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学) Apple(苹果公司)

AI总结 提出SelfCompact框架,让语言模型自主决定何时及如何压缩上下文,通过调用压缩工具和轻量级规则实现自适应压缩,无需微调或外部监督,在多个基准上以更低成本匹配或超越固定间隔压缩。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21649 2026-07-14 cs.CV

Seeing Isn't Orienting: A Cognitively Informed Hierarchical Benchmark for Object Orientation in MLLMs

看到并不等于定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yan, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

机构 * Boston University(波士顿大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出DORI基准,揭示多模态大语言模型在定向理解上的不足,发现其在角度估计和方向跟踪方面存在系统性缺陷,对机器人控制和3D场景重建有重要启示。

Comments Paper accepted to ECCV 2026 (Main Track). Previously, this version appeared as arXiv:2603.11410 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06587 2026-07-14 cs.AI q-fin.CP q-fin.RM

Autonomous AI Agents for Option Hedging: Enhancing Financial Stability through Shortfall Aware Reinforcement Learning

自主AI代理用于期权对冲:通过意识短缺的强化学习增强金融稳定性

Minxuan Hu, Ziheng Chen, Jiayu Yi, Wenxi Sun

机构 * Cornell Ann S. Bowers College of Computing and Information Science, Cornell University(康奈尔大学安·索斯·博尔斯计算与信息科学学院) Department of Mathematics, University of Texas at Austin(德克萨斯大学奥斯汀分校数学系) School of Social Sciences, Nanyang Technological University(南洋理工大学社会科学学院) Krieger School of Arts and Sciences, Johns Hopkins University(约翰霍普金斯大学克里eger艺术与科学学院)

AI总结 本文提出RLOP和QLBS两种强化学习框架,通过意识短缺的方法优化期权对冲,提升金融稳定性并改进风险预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02905 2026-07-14 cs.AI 版本更新

FIRE-Bench: Evaluating AI Agents on the Rediscovery of Scientific Insights

FIRE-Bench:评估人工智能代理在科学见解重新发现方面的表现

Zhen Wang, Fan Bai, Zhongyan Luo, Jinyan Su, Kaiser Sun, Xinle Yu, Jieyuan Liu, Kun Zhou, Claire Cardie, Mark Dredze, Zhiting Hu, Eric P. Xing

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

AI总结 研究旨在评估大语言模型驱动的人工智能代理在科学见解重新发现上的能力。核心方法是引入FIRE-Bench基准,让代理基于高层次研究问题进行全周期探索。主要贡献是为衡量代理驱动的科学发现进展提供了严格诊断框架,揭示当前代理系统在全周期科研上的挑战。

Comments 34 pages, 3 figures, 16 tables; ICML 2026 Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10825 2026-07-14 math.ST cs.LG math.OC stat.TH 版本更新

An Elementary Proof of the Near Optimality of LogSumExp Smoothing

对数和指数平滑近似最优性的一个初等证明

Thabo Samakhoana, Benjamin Grimmer

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究 \(\mathbb{R}^d\) 中最大值函数平滑设计,通过初等构造给出下界,证明对数和指数平滑近似最优,同时给出更强平滑说明其非完全最优,在低维提出恰好最优平滑。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06896 2026-07-14 eess.AS cs.CL 版本更新

TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding

TagSpeech:基于细粒度时间定位的端到端多说话人自动语音识别与说话人分离

Mingyue Huo, Yiwen Shao, Yuheng Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究提出TagSpeech框架,利用时间锚点定位技术联合多说话人ASR与说话人分离。通过关键设计解决细粒度对齐挑战,端到端建模“谁在何时说了什么”。实验显示其在DER上优于基线,采用参数高效训练范式,低计算成本获强性能。

Comments Accepted to ACL2026 Main Oral; v2: added overlap analysis in Section 5.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09497 2026-07-14 cs.RO cs.AI 版本更新

Toward Autonomous Soft Robotic Endovascular Navigation via Imitation Learning

通过模仿学习实现自主软机器人血管内导航

Noah Barnes, Ji Woong Kim, Lingyun Di, Hannah Qu, Anuruddha Bhattacharjee, Miroslaw Janowski, Dheeraj Gandhi, Bailey Felix, Shaopeng Jiang, Olivia Young, Mark Fuge, Ryan D. Sochol, Jeremy D. Brown, Axel Krieger

机构 * Johns Hopkins University(约翰霍普金斯大学) Stanford University(斯坦福大学) McGill University(麦吉尔大学) University of Maryland(马里兰大学) Swiss Federal Institute of Technology in Lausanne (EPFL)(日内瓦联邦理工学院(EPFL)) ETH Zurich(苏黎世联邦理工学院)

AI总结 研究旨在实现自主软机器人血管内导航,开发基于变压器的模仿学习框架,通过目标条件等实现通用导航,在多种几何结构上训练并评估,策略成功率高,还进行了相关研究及扩展,提升了在未见几何结构上的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24421 2026-07-14 eess.IV cs.CV 版本更新

pyMEAL: A Multi-Encoder Augmentation-Aware-Learning Toolbox for Robust Medical Image Translation

pyMEAL:用于稳健医学图像翻译的多编码器增强感知学习工具箱

Abdul-mojeed Olabisi Ilyas, Adeleke Maradesa, Jamal Banzi, Jianpan Huang, Henry K. F. Mak, Kannie W. Y. Chan

机构 * Hong Kong Centre for Cerebro-Cardiovascular Health Engineering (COCHE)(香港脑心血管健康工程中心) Department of Informatics, Sokoine University of Agriculture(农业科学学院信息系) Department of Diagnostic Radiology, The University of Hong Kong(香港大学诊断放射科) State Key Laboratory of Brain and Cognitive Sciences, The University of Hong Kong(香港大学脑科学与认知科学国家重点实验室) Alzheimer’s Disease Research Network, The University of Hong Kong(香港大学阿尔茨海默病研究网络) Department of Biomedical Engineering, City University of Hong Kong(城市大学生物医学工程系) Department of Radiology and Radiological Science, The Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院放射学与放射科学系) City University of Hong Kong Shenzhen Research Institute(城市大学深圳研究 institute)

AI总结 针对医学图像翻译受患者差异等挑战及3D图像翻译受阻问题,提出多编码器增强感知学习(MEAL),研究三种特征整合策略,经实验验证其在CT到T1加权MRI翻译任务中表现出色,提升了医学图像翻译的稳健性和临床适用性。

Comments 46 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏