arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-05 至 2026-03-05 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 4 篇

2603.04364 2026-03-05 cs.LG cs.AI cs.CL 87%

Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks

双模多阶段对抗安全训练:增强多模态网络代理对跨模态攻击的鲁棒性

Haoyu Liu, Dingcheng Li, Lukas Rutishauser, Zeyu Zheng

机构 * UC Berkeley, IEOR & BAIR(伯克利大学) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(title);分类 cs.CL、cs.AI

AI总结 DMAST通过三阶段对抗训练提升多模态网络代理对跨模态攻击的鲁棒性,显著提高任务完成效率并优于现有防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04363 2026-03-05 cs.RO 78%

ManipulationNet: An Infrastructure for Benchmarking Real-World Robot Manipulation with Physical Skill Challenges and Embodied Multimodal Reasoning

ManipulationNet: 一个用于基于现实世界机器人操作的基准测试基础设施,包含物理技能挑战和具身多模态推理

Yiting Chen, Kenneth Kimble, Edward H. Adelson, Tamim Asfour, Podshara Chanrungmaneekul, Sachin Chitta, Yash Chitambar, Ziyang Chen, Ken Goldberg, Danica Kragic, Hui Li, Xiang Li, Yunzhu Li, Aaron Prather, Nancy Pollard, Maximo A. Roa-Garzon, Robert Seney, Shuo Sha, Shihefeng Wang, Yu Xiang, Kaifeng Zhang, Yuke Zhu, Kaiyu Hang

机构 * Rice University(里士大学) U.S. National Institute of Standards and Technology(美国国家标准与技术研究院) Massachusetts Institute of Technology(麻省理工学院) Karlsruhe Institute of Technology(卡尔斯鲁厄技术大学) Autodesk Research(Autodesk研究) University of California, Berkeley(加州大学伯克利分校) KTH Royal Institute of Technology(皇家理工学院) Tsinghua University(清华大学) Columbia University(哥伦比亚大学) ASTM International(美国材料与试验协会) Carnegie Mellon University(卡内基梅隆大学) German Aerospace Center (DLR)(德国航空航天中心) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) NVIDIA Research(NVIDIA研究)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 ManipulationNet通过标准化硬件和统一软件客户端,为机器人操作提供现实世界基准测试,促进物理技能和具身推理能力的系统性发展。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03762 2026-03-05 cs.CV 57%

Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding

如同专家所见:一个知识增强的代理用于开放集细粒度视觉理解

Junhan Chen, Zilu Zhou, Yujun Tong, Dongliang Chang, Yitao Luo, Zhanyu Ma

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 KFRA通过知识增强推理代理实现开放集细粒度视觉理解,提升推理准确率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04329 2026-03-05 cs.RO 50%

Gaussian Mixture-Based Inverse Perception Contract for Uncertainty-Aware Robot Navigation

基于高斯混合的逆感知合同用于不确定性感知的机器人导航

Bingyao Du, Joonkyung Kim, Yiwei Lyu

机构 * Department of Computer Science, Columbia University(计算机科学系,哥伦比亚大学) Department of Computer Science and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出基于高斯混合的逆感知合同,通过联合椭球置信集表示不确定性,提升机器人导航的安全性和适应性。

Comments 8 pages, 5 figures. Accepted to ACC 2026 (American Control Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏