arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-03-05 至 2026-03-05 共收录 5
2603.04364 2026-03-05 cs.LG cs.AI cs.CL

Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks

双模多阶段对抗安全训练:增强多模态网络代理对跨模态攻击的鲁棒性

Haoyu Liu, Dingcheng Li, Lukas Rutishauser, Zeyu Zheng

机构 * UC Berkeley, IEOR & BAIR(伯克利大学) Google(谷歌) Google Deepmind(谷歌DeepMind)

AI总结 DMAST通过三阶段对抗训练提升多模态网络代理对跨模态攻击的鲁棒性,显著提高任务完成效率并优于现有防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04363 2026-03-05 cs.RO

ManipulationNet: An Infrastructure for Benchmarking Real-World Robot Manipulation with Physical Skill Challenges and Embodied Multimodal Reasoning

ManipulationNet: 一个用于基于现实世界机器人操作的基准测试基础设施,包含物理技能挑战和具身多模态推理

Yiting Chen, Kenneth Kimble, Edward H. Adelson, Tamim Asfour, Podshara Chanrungmaneekul, Sachin Chitta, Yash Chitambar, Ziyang Chen, Ken Goldberg, Danica Kragic, Hui Li, Xiang Li, Yunzhu Li, Aaron Prather, Nancy Pollard, Maximo A. Roa-Garzon, Robert Seney, Shuo Sha, Shihefeng Wang, Yu Xiang, Kaifeng Zhang, Yuke Zhu, Kaiyu Hang

机构 * Rice University(里士大学) U.S. National Institute of Standards and Technology(美国国家标准与技术研究院) Massachusetts Institute of Technology(麻省理工学院) Karlsruhe Institute of Technology(卡尔斯鲁厄技术大学) Autodesk Research(Autodesk研究) University of California, Berkeley(加州大学伯克利分校) KTH Royal Institute of Technology(皇家理工学院) Tsinghua University(清华大学) Columbia University(哥伦比亚大学) ASTM International(美国材料与试验协会) Carnegie Mellon University(卡内基梅隆大学) German Aerospace Center (DLR)(德国航空航天中心) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) NVIDIA Research(NVIDIA研究)

AI总结 ManipulationNet通过标准化硬件和统一软件客户端,为机器人操作提供现实世界基准测试,促进物理技能和具身推理能力的系统性发展。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01222 2026-03-05 cs.CL cs.AI

WebDS: An End-to-End Benchmark for Web-based Data Science

WebDS: 一种端到端的基于网络的数据科学基准

Ethan Hsu, Hong Meng Yam, Ines Bouissou, Aaron Murali John, Raj Thota, Josh Koe, Vivek Sarath Putta, G K Dharesan, Alexander Spangher, Shikhar Murty, Tenghao Huang, Christopher D. Manning

机构 * Stanford University(斯坦福大学) Pinetree Research(Pinetree研究公司) University of California, Berkeley(加州大学伯克利分校) Singapore University of Technology and Design(新加坡科技设计大学) University of Southern California(南加州大学)

AI总结 WebDS提出了一种端到端的基于网络的数据科学基准,旨在评估代理在复杂多步骤任务中的表现,揭示当前LLM在实际数据科学任务中的性能差距。

Comments 14 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06512 2026-03-05 cs.CV cs.AI

Merlin: A Computed Tomography Vision-Language Foundation Model and Dataset

Merlin:一种计算断层扫描视觉-语言基础模型和数据集

Louis Blankemeier, Ashwin Kumar, Joseph Paul Cohen, Jiaming Liu, Longchao Liu, Dave Van Veen, Syed Jamal Safdar Gardezi, Hongkun Yu, Magdalini Paschali, Zhihong Chen, Jean-Benoit Delbrouck, Eduardo Reis, Robbie Holland, Cesar Truyts, Christian Bluethgen, Yufu Wu, Long Lian, Malte Engmann Kjeldskov Jensen, Sophie Ostmeier, Maya Varma, Jeya Maria Jose Valanarasu, Zhongnan Fang, Zepeng Huo, Zaid Nabulsi, Diego Ardila, Wei-Hung Weng, Edson Amaro Junior, Neera Ahuja, Jason Fries, Nigam H. Shah, Greg Zaharchuk, Marc Willis, Adam Yala, Andrew Johnston, Robert D. Boutin, Andrew Wentland, Curtis P. Langlotz, Jason Hom, Sergios Gatidis, Akshay S. Chaudhari

机构 * Stanford University(斯坦福大学) Stanford Center for Artificial Intelligence in Medicine and Imaging(斯坦福大学医学与成像人工智能中心) Department of Electrical Engineering(电气工程系) University of California Berkeley(加州大学伯克利分校) Department of Radiology(放射科) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Hospital Israelita Albert Einstein(以色列特医院阿尔伯特·爱因斯坦医院)

AI总结 Merlin是一种基于3D视觉-语言模型的医学影像分析工具,通过多阶段预训练框架,实现了对腹部CT扫描、电子健康记录和放射科报告的综合学习,提升了医学影像分析的自动化水平。

Comments Nature (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13231 2026-03-05 cs.CV cs.AI cs.RO

VITA: Vision-to-Action Flow Matching Policy

VITA:视觉到动作流匹配策略

Dechen Gao, Boqi Zhao, Andrew Lee, Ian Chuang, Hanchu Zhou, Hang Wang, Zhe Zhao, Junshan Zhang, Iman Soltani

机构 * University of California, Davis(加州大学戴维斯分校) University of California, Berkeley(加州大学伯克利分校)

AI总结 VITA是一种无噪声、无条件的视觉到动作流匹配策略,通过动作自动编码器和流潜在解码技术,在9个模拟和5个现实任务中实现更快的推理速度和更优的性能。

Comments Project page: https://ucd-dare.github.io/VITA/ Code: https://github.com/ucd-dare/VITA

详情

展开后加载摘要…

URL PDF HTML 收藏