arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-03-17 至 2026-03-17 共收录 7
2603.15469 2026-03-17 cs.RO cs.AI

RoCo Challenge at AAAI 2026: Benchmarking Robotic Collaborative Manipulation for Assembly Towards Industrial Automation

AAAI 2026机器人协作操作挑战赛:面向工业自动化的协作操作基准测试

Haichao Liu, Yuheng Zhou, Zhenyu Wu, Ziheng Ji, Ziyu Shan, Qianzhun Wang, Ruixuan Liu, Zhiyuan Yang, Yejun Gu, Shalman Khan, Shijun Yan, Jun Liu, Haiyue Zhu, Changliu Liu, Jianfei Yang, Jingbing Zhang, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学,北京,中国) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,匹兹堡,美国) Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)

AI总结 本文提出RoCo挑战赛,通过模拟和真实世界装配任务,推动工业机器人协作操作能力的发展,展示了双模型框架和故障恢复数据在长周期多任务学习中的有效性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14989 2026-03-17 cs.CV

MMSpec: Benchmarking Speculative Decoding for Vision-Language Models

MMSpec:用于视觉-语言模型的推测解码基准测试

Hui Shen, Xin Wang, Ping Zhang, Yunta Hsieh, Qi Han, Zhongwei Wan, Ziheng Zhang, Jingxuan Zhang, Jing Xiong, Ziyuan Liu, Yifan Zhang, Hangrui Cao, Chenyang Zhao, Mi Zhang

机构 * University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学) Independent(独立) Indiana University(印第安纳大学) The University of Hong Kong(香港大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织)

AI总结 本文提出MMSpec基准,评估视觉-语言模型中的推测解码方法,发现文本模型在多模态场景下表现下降,视觉意识在大批次中更关键,且吞吐量提升不等于延迟降低,提出ViSkip方法实现最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14910 2026-03-17 eess.SY cs.RO cs.SY

Transformers As Generalizable Optimal Controllers

变换器作为通用最优控制器

Turki Bin Mohaya, Maitham F. AL-Sunni, John M. Dolan, Peter Seiler

机构 * Department of Electrical & Computer Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学电气与计算机工程系,匹兹堡,PA,美国) Robotics Institute, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器人研究所,匹兹堡,PA,美国)

AI总结 本文研究变换器能否捕捉异构MIMO线性时不变系统的最优状态反馈律,通过训练单一控制器在不同维度系统上实现轻量级微调,验证其在结构化线性系统家族中的实用性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13385 2026-03-17 cs.CV cs.AI cs.CR cs.IR

VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering

VisualLeakBench: 对大型视觉-语言模型在PII泄露和社会工程中的脆弱性进行审计

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) New York University(纽约大学)

AI总结 本文提出VisualLeakBench,通过合成对抗图像评估LVLMs对OCR注入和PII泄露的鲁棒性,揭示了Claude~4在PII识别上的高风险及防御策略的模板依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13359 2026-03-17 cs.AI

From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions

从拒绝标记到拒绝控制:发现并引导类别特定的拒绝方向

Rishab Alagharu, Ishneet Sukhvinder Singh, Shaibi Shamsudeen, Zhen Wu, Ashwinee Panda

机构 * Algoverse AI Research(Algoverse AI研究院) School of Computer Science, University of Maryland, College Park, United States(美国马里兰大学计算机科学学院) School of Computer Science, Carnegie Mellon University, Pittsburgh, United States(美国卡内基梅隆大学计算机科学学院)

AI总结 本文通过训练模型生成类别化拒绝标记,实现推理时对细粒度拒绝行为的控制,提升安全性和可靠性,通过提取残差流方向构建类别引导向量,并引入低秩组合实现多类拒绝控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11750 2026-03-17 q-bio.QM cs.LG

PRISM: Enhancing Protein Inverse Folding through Fine-Grained Retrieval on Structure-Sequence Multimodal Representations

PRISM:通过结构-序列多模态表示的细粒度检索增强蛋白质反向折叠

Sazan Mahbub, Souvik Kundu, Eric P. Xing

机构 * Carnegie Mellon University(卡内基梅隆大学) GenBio AI(基因组生物人工智能) Intel(英特尔)

AI总结 PRISM通过结构-序列多模态表示的细粒度检索提升蛋白质反向折叠性能,结合混合自交叉注意力解码器,实现更高效的序列生成与折叠预测。

Comments Published as a conference paper at International Conference on Learning Representation (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11894 2026-03-17 cs.CV cs.AI cs.LG

3D-LFM: Lifting Foundation Model

3D-LFM:提升基础模型

Mosam Dabhi, Laszlo A. Jeni, Simon Lucey

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Adelaide(阿德莱德大学)

AI总结 本文提出3D-LFM,利用Transformer的排列等变性处理不同数量的3D点,提升3D结构和相机的重建能力,实现跨领域的高泛化性能。

Comments Visit the project page at https://3dlfm.github.io for links to additional media, code, and videos. The site also features a custom GPT tailored to address queries related to 3D-LFM. Accepted at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏