arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-06-02 至 2026-06-02 共收录 13
2606.02562 2026-06-02 cs.RO cs.AI cs.LG cs.SY eess.SY

Permissive Safety Through Trusted Inference: Verifiable Belief-Space Neural Safety Filters for Assured Interactive Robotics

通过可信推理实现许可安全:可验证的信念空间神经安全滤波器用于保证交互式机器人

Haimin Hu

机构 * Department of Computer Science, Johns Hopkins University, USA(约翰霍普金斯大学计算机科学系)

AI总结 针对交互式机器人中人类不确定性带来的安全问题,提出一种基于共形预测的信念空间安全滤波器验证方法,在考虑推理可靠性的前提下保证高概率安全,并减少保守性。

Comments Accepted to the 17th World Symposium on the Algorithmic Foundations of Robotics (WAFR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01827 2026-06-02 math.OC cs.LG stat.ML

Adaptive Sharpness-Aware Minimization with a Polyak-type Step size: A Theory-Grounded Scheduler

自适应锐度感知最小化与Polyak型步长:一种理论驱动的调度器

Dimitris Oikonomou, Nicolas Loizou

机构 * Mathematical Institute for Data Science (MINDS), Johns Hopkins University, Baltimore, MD, USA(数据科学数学研究所(MINDS),约翰霍普金斯大学,巴尔的摩,MD,美国) Department of Computer Science, Johns Hopkins University, Baltimore, MD, USA(计算机科学系,约翰霍普金斯大学,巴尔的摩,MD,美国) Department of Applied Mathematics and Statistics, Johns Hopkins University, Baltimore, MD, USA(应用数学与统计学系,约翰霍普金斯大学,巴尔的摩,MD,美国)

AI总结 针对锐度感知最小化(SAM)对学习率敏感的问题,受随机Polyak步长启发,提出适用于SAM的Polyak调度器,在确定性和随机设置下实现自适应算法,并证明收敛性,实验表明性能优于或媲美调优的SAM基线。

Comments 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01481 2026-06-02 cs.CV

SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation

SafeGen-Bench: 图像条件文本到视频生成中的安全性基准测试

Yingzi Ma, Xiaogeng Liu, Yawen Zheng, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 针对图像条件文本到视频生成中安全文本和图像组合仍可能产生有害内容的问题,提出SafeGen-Bench基准,定义10个恶意类别并评估现有模型,发现当前模型难以避免生成恶意内容,且单模态护栏防御不足。

Comments 8 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00922 2026-06-02 physics.med-ph cs.RO

A Machine-to-Machine Knowledge-Guided LLM Agent for Generalizable Radiotherapy Treatment Planning

一种机器到机器知识引导的LLM智能体用于泛化放射治疗计划

Md Mainul Abrar, Xun Jia, Yujie Chi

机构 * National Institutes of Health (NIH)(国家卫生研究院) Department of Physics, The University of Texas at Arlington(德克萨斯理工大学阿灵顿分校物理系) Department of Radiation Oncology and Molecular Radiation Sciences, Johns Hopkins University(约翰霍普金斯大学放射肿瘤学与分子放射科学系)

AI总结 提出一种机器到机器知识引导的大语言模型框架,通过深度强化学习发现的治疗计划参数分布知识迁移至LLM智能体,实现无需人工干预的自主迭代规划,在多种病例中显著提升规划质量和泛化能力。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00315 2026-06-02 cs.AI cond-mat.mtrl-sci

Coupling Language Models with Physics-based Simulation for Synthesis of Inorganic Materials

将语言模型与基于物理的模拟相结合用于无机材料的合成

Edward W. Staley, Tom Arbaugh, Michael Pekala, Alexander New, Christopher D. Stiles, Nam Q. Le, Gregory Bassen, Wyatt Bunstine, Tyrel McQueen

机构 * Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出一种结合热力学数据库与简化动力学模型的混合框架,评估大语言模型在无机材料合成规划中的表现,以铌氧体系为例证明其能生成更可行的合成策略。

Comments Accepted to the AI for Accelerated Materials Design (AI4Mat) Workshop at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00144 2026-06-02 cs.LG cs.AI

BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding

BudgetDraft:面向稀疏KV投机解码的接受感知多视角训练

Liang He, Jingbo Wen, Qishi Zhan, Yixiong Chen, Kangning Cui, Qizhen Lan, Xilu Wang

机构 * Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所) The University of Sydney(悉尼大学) Marquette University(马基特大学) Johns Hopkins University(约翰·霍普金斯大学) Wake Forest University(威克森林大学) University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分部) University of Surrey(萨里大学)

AI总结 针对中长上下文推理中稀疏/全缓存不匹配导致接受率下降的问题,提出BudgetDraft多视角稀疏训练方法,通过接受感知损失和多视角损失训练单一鲁棒草稿模型,在固定KV预算下恢复接受率,实现最高6.55倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29341 2026-06-02 cs.CV cs.CL

WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

WorldMemArena: 通过动作-世界交互评估多模态智能体记忆

Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu, Yepeng Liu, Lin Long, Yichen Guo, Nuo Chen, Zhaotian Weng, Elena Kochkina, Simerjot Kaur, Charese Smiley, Xiaomo Liu, James Zou, Sheng Liu, Yuheng Bu, Songyou Peng, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) J.P. Morgan Chase(摩根大通) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出WorldMemArena基准,通过动作-世界交互循环的四阶段生命周期评估多模态智能体记忆,揭示现有方法在写入、维护、检索和使用中的失败点。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24828 2026-06-02 cs.AI

Test-Time Deep Thinking to Explore Implicit Rules

测试时深度思考以探索隐式规则

Wentong Chen, Xin Cong, Zhong Zhang, Yaxi Lu, Siyuan Zhao, Yesai Wu, Qinyu Luo, Haotian Chen, Yankai Lin, Zhiyuan Liu, Maosong Sun

机构 * Renmin University of China(中国人民大学) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) School of Computer Science and Engineering, UESTC(UESTC计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Mathematical Sciences, Nankai University(南开大学数学科学学院) Whiting School, Johns Hopkins University(约翰斯·霍普金斯大学惠特林学院) School of Artificial Intelligence, Shanghai Jiaotong University(上海交通大学人工智能学院)

AI总结 针对智能体在隐式规则环境中失败的问题,提出TTExplore框架,通过训练专用模型Exp-Thinker进行测试时推理,平均提升基线性能14-19点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09095 2026-06-02 cs.CL cs.CV

Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs

阅读,而非思考:理解并弥合多模态大语言模型中文本变为像素时的模态差距

Kaiser Sun, Xiaochuang Yuan, Hongjun Liu, Chen Zhao, Cheng Zhang, Mark Dredze, Fan Bai

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊) New York University(纽约大学) Texas A&M University(德克萨斯大学)

AI总结 本文系统诊断多模态大语言模型在处理图像文本时的模态差距,发现其源于模型推理意愿不足而非感知失败,并提出一种轻量级自蒸馏方法有效弥合该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05412 2026-06-02 cs.CV cs.CL

Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues

视觉-语言模型将头部方向误认为注视方向:非语言对话线索

Zory Zhang, Pinyuan Feng, Bingyang Wang, Tianwei Zhao, Suyang Yu, Qingying Gao, Hokin Deng, Ziqiao Ma, Yijiang Li, Dezhi Luo

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Emory University(埃默里大学) Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC San Diego(圣地亚哥大学)

AI总结 本研究通过控制头部方向的实验发现,视觉-语言模型(VLMs)在推断注视目标时主要依赖头部方向而非眼睛外观,导致与人类存在显著性能差距,并指出数据偏差是主要原因。

Comments Accepted by ACL 2026. Project page at https://zoryzhang.github.io/gaze/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13602 2026-06-02 cs.CV cs.LG

Towards Sparse Video Understanding and Reasoning

迈向稀疏视频理解与推理

Chenwei Xu, Zhen Ye, Shang Wu, Weijian Li, Zihan Wang, Zhuofan Xia, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu

机构 * Northwestern University(西北大学) Johns Hopkins University(约翰霍普金斯大学) Dolby Laboratories(杜比实验室)

AI总结 提出一种多轮视频问答代理,通过稀疏帧选择、状态摘要和早期停止机制,在减少帧数和令牌数的同时提升准确率。

Comments Accepted to CVPR 2026. Project page: https://sparsevideounderstanding.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02342 2026-06-02 math.OC cs.LG stat.ML

Safeguarded Stochastic Polyak Step Sizes for Non-smooth Optimization: Robust Performance Without Small (Sub)Gradients

非光滑优化的保护性随机Polyak步长:无需小(次)梯度的鲁棒性能

Dimitris Oikonomou, Nicolas Loizou

机构 * Mathematical Institute for Data Science (MINDS), Johns Hopkins University, Baltimore, MD, USA(数据科学数学研究所(MINDS),约翰霍普金斯大学,巴尔的摩,MD,美国) Department of Computer Science, Johns Hopkins University, Baltimore, MD, USA(计算机科学系,约翰霍普金斯大学,巴尔的摩,MD,美国) Department of Applied Mathematics and Statistics, Johns Hopkins University, Baltimore, MD, USA(应用数学与统计学系,约翰霍普金斯大学,巴尔的摩,MD,美国)

AI总结 针对非光滑凸优化问题,提出保护性随机Polyak步长(SPS_safe)用于随机次梯度方法,在无需强假设下提供收敛保证,并融入动量机制,实验验证其在深度神经网络训练中避免梯度消失的鲁棒性。

Comments 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24870 2026-06-02 cs.CL cs.CV cs.IR

Seeing Through the MiRAGE: Evaluating Multimodal Retrieval Augmented Generation

看穿MiRAGE:评估多模态检索增强生成

Alexander Martin, William Walden, Reno Kriz, Dengjia Zhang, Kate Sanders, Eugene Yang, Chihsheng Jin, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人类语言技术卓越中心)

AI总结 提出MiRAGE框架,通过InfoF1和CiteF1指标评估多模态RAG的事实性和引用支持,并验证其与人工判断的一致性。

Comments https://github.com/alexmartin1722/mirage

详情

展开后加载摘要…

URL PDF HTML 收藏