arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2342
2603.19456 2026-03-23 cs.CV

In-the-Wild Camouflage Attack on Vehicle Detectors through Controllable Image Editing

真实场景中通过可控图像编辑实施车辆检测器的伪装攻击

Xiao Fang, Yiming Gong, Stanislav Panev, Celso de Melo, Shuowen Hu, Shayok Chakraborty, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) DEVCOM Army Research Laboratory(陆军研究实验室) Florida State University(佛罗里达州立大学)

AI总结 本文提出了一种将车辆伪装攻击视为条件图像编辑问题的新框架,通过图像级和场景级生成策略提升攻击效果,实验表明其在COCO和LINZ数据集上显著降低检测器性能,同时保持车辆结构和提升人类感知的隐蔽性。

Comments 45 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19384 2026-03-23 cs.RO

SOFTMAP: Sim2Real Soft Robot Forward Modeling via Topological Mesh Alignment and Physics Prior

SOFTMAP:通过拓扑网格对齐和物理先验实现的仿真到现实软机器人前向建模

Ziyong Ma, Uksang Yoo, Jonathan Francis, Weiming Zhi, Jeffrey Ichnowski, Jean Oh

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Bosch Center for Artificial Intelligence(博世人工智能中心) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre for Robotics, The University of Sydney(悉尼大学机器人研究中心) College of Connected Computing, Vanderbilt University(范德比尔特大学连接计算学院)

AI总结 本文提出SOFTMAP框架,结合拓扑对齐、轻量前向模型、残差修正网络和线性校准层,实现软手指 manipulator 的高精度 3D 前向建模与控制,取得毫米级轨迹跟踪和任务成功率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23571 2026-03-23 cs.RO cs.AI cs.CV cs.LG

RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation

RobotArena ∞:通过现实到模拟的翻译实现可扩展的机器人评估

Yash Jangir, Yidi Zhang, Pang-Chi Lo, Kashu Yamazaki, Chenyu Zhang, Kuan-Hsun Tu, Tsung-Wei Ke, Lei Ke, Yonatan Bisk, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(国立台湾大学)

AI总结 本文提出RobotArena Infinity框架,通过模拟环境与在线人类反馈,解决机器人政策评估中的劳动密集型、安全性差等问题,实现可扩展的视觉-语言-动作评估。

Comments Website: https://robotarenainf.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13219 2026-03-23 cs.CV

Prompt-based Adaptation in Large-scale Vision Models: A Survey

基于提示的大规模视觉模型适应:综述

Xi Xiao, Yunbei Zhang, Lin Zhao, Yiyang Liu, Xiaoying Liao, Zheda Mai, Xingjian Li, Xiao Wang, Hao Xu, Jihun Hamm, Xue Lin, Min Xu, Qifan Wang, Tianyang Wang, Cheng Han

机构 * University of Alabama at Birmingham, USA(美国阿拉巴马大学伯明翰分校) Tulane University, USA(美国路易斯安那大学) Northeastern University, USA(美国东北大学) University of Missouri-Kansas City, USA(美国密苏里大学堪萨斯城分校) Johns Hopkins University, USA(约翰霍普金斯大学) Ohio State University, USA(俄亥俄州立大学) Carnegie Mellon University, USA(卡内基梅隆大学) Oak Ridge National Laboratory, USA(橡树岭国家实验室) Harvard University, USA(哈佛大学) Mohamed bin Zayed University of Artificial Intelligence, UAE(阿联酋Mohamed bin Zayed人工智能大学) Meta AI, USA(Meta AI)

AI总结 本文综述了基于提示的视觉模型适应方法,探讨了VP和VPT的核心机制及在不同领域的应用,揭示了其在测试时适应和可信AI中的作用,并总结了当前基准和未来研究方向。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17769 2026-03-20 cs.SD cs.CL cs.LG eess.AS

Modeling Overlapped Speech with Shuffles

用洗牌操作建模重叠语音

Matthew Wiesner, Samuele Cornell, Alexander Polok, Lucas Ondel Yang, Lukáš Burget, Sanjeev Khudanpur

机构 * Johns Hopkins University(约翰霍普金斯大学) LISN, CNRS(LISN-CNRS) Carnegie Mellon University(卡内基梅隆大学) Brno University of Technology(布拉格技术大学)

AI总结 本文提出用洗牌操作建模重叠语音,通过洗牌积和偏序有限状态自动机实现对重叠语音的对齐和说话人标注。采用总分值作为损失函数进行训练,并通过偏序FSAs减少图规模。通过直接建模(token, speaker)元组实现说话人标注,Viterbi对齐通过洗牌积FSA实现单次对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20636 2026-03-20 cs.LG

Image2Gcode: Image-to-G-code Generation for Additive Manufacturing Using Diffusion-Transformer Model

Image2Gcode: 基于扩散-变换器模型的图像到G-code生成用于增材制造

Ziyue Wang, Yayati Jadhav, Peter Pak, Amir Barati Farimani

机构 * Department of Materials Science and Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(材料科学与工程系,卡内基梅隆大学,匹兹堡,PA,USA) Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

AI总结 本文提出Image2Gcode框架,通过图像直接生成可打印的G-code,省去CAD建模步骤,提升增材制造的易用性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18418 2026-03-20 cs.CV cs.AI

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

注意罕见病:罕见皮肤疾病能否通过诊断推理可靠诊断?

Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji, Xingjian Li, Runmin Jiang, Tianyang Wang, Saeed Anwar, Dongwoo Kim, Yue Yao, Zhenyue Qin, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Australian National University(澳大利亚国立大学) University of Western Australia(西澳大学) POSTECH Yale University(耶鲁大学)

AI总结 本文提出DermCase基准,通过多模态数据评估罕见皮肤疾病诊断推理能力,揭示现有模型在诊断准确性和临床推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18184 2026-03-20 cs.CL

CWoMP: Morpheme Representation Learning for Interlinear Glossing

CWoMP:形态表示学习用于互线 glossing

Morris Alper, Enora Rice, Bhargav Shandilya, Alexis Palmer, Lori Levin

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Colorado Boulder(科罗拉多大学波德福分校)

AI总结 CWoMP通过对比学习将词素作为原子形式-意义单元进行表示,提升低资源语言的互线 glossing 效率与效果。

Comments Project page: http://cwomp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18079 2026-03-20 cs.LG cs.AI

SLEA-RL: Step-Level Experience Augmented Reinforcement Learning for Multi-Turn Agentic Training

SLEA-RL:基于步骤级经验增强的多轮代理训练强化学习

Prince Zizhuang Wang, Shuli Jiang

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出SLEA-RL框架,通过步骤级经验增强提升多轮代理训练性能,采用动态经验库和策略优化方法,在长周期任务中优于传统强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17617 2026-03-19 cs.SI cs.CL

Temporal Narrative Monitoring in Dynamic Information Environments

动态信息环境中的时间叙事监控

David Farr, Stephen Prochaska, Jack Moody, Lynnette Hui Xian Ng, Iain Cruickshank, Kate Starbird, Jevin West

机构 * School of Information Science(信息科学学院) University of Washington(华盛顿大学) Whiting School of Engineering(工程学院) Johns Hopkins University(约翰霍普金斯大学) School of Computer Science(计算机科学学院) Carnegie Mellon University(卡内基梅隆大学) Human Centered Design Engineering(以人为核心的设计工程)

AI总结 本文提出了一种系统框架,用于建模动态信息环境中随时间演变的语义结构,通过整合语义嵌入、密度聚类和滚动时间链接,实现对危机事件中叙事的持续适应性表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17355 2026-03-19 cs.CV

OnlineHMR: Video-based Online World-Grounded Human Mesh Recovery

OnlineHMR:基于视频的在线世界坐标人体网格恢复

Yiwen Zhao, Ce Zheng, Yufu Wang, Hsueh-Han Daniel Yang, Liting Wen, Laszlo A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出OnlineHMR,一种在线处理框架,通过因果键值缓存和滑动窗口学习策略实现在线世界坐标人体网格恢复,适用于AR/VR等交互场景。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17351 2026-03-19 cs.RO

OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms

OmniVLN:面向空和地面平台的全方位3D感知与高效token LLM推理的视觉语言导航

Zhongyuang Liu, Min He, Shaonan Yu, Xinhang Xu, Muqing Cao, Jianping Li, Jianfei Yang, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 OmniVLN结合全方位3D感知与高效token分层推理,提升空和地面机器人在复杂环境中的视觉语言导航能力,提升空间指认准确率并减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17187 2026-03-19 cs.LG

MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild

MetaClaw:只需交谈--一个在野中元学习和进化的智能体

Peng Xia, Jianwen Chen, Xinyu Yang, Haoqin Tu, Jiaqi Liu, Kaiwen Xiong, Siwei Han, Shi Qiu, Haonian Ji, Yuyin Zhou, Zeyu Zheng, Cihang Xie, Huaxiu Yao

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 MetaClaw通过元学习框架实现持续进化,结合技能驱动快速适应与机会性策略优化,提升任务准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21679 2026-03-19 cs.CL

ReviewScore: Misinformed Peer Review Detection with Large Language Models

ReviewScore:利用大语言模型进行误信同行评审检测

Hyun Ryu, Doohyuk Jang, Hyemin S. Lee, Joonhyun Jeong, Gyeongman Kim, Donghyeon Cho, Gyouk Chu, Minyeong Hwang, Hyeongwon Jang, Changhun Kim, Haechan Kim, Jina Kim, Joowon Kim, Yoonjeon Kim, Kwanhyung Lee, Chanjae Park, Heecheol Yun, Gregor Betz, Eunho Yang

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院) KRAFTON(KRAFTON公司) AITRICS(AITRICS研究院) KIT(卡尔斯鲁厄理工学院)

AI总结 本文提出ReviewScore方法,通过检测同行评审中的错误前提和可回答问题来识别低质量评审。利用大语言模型评估评审点的误信程度,实验显示模型在评估一致性上表现中等,但仍有改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05310 2026-03-19 cs.PL cs.AI

Oracular Programming: A Modular Foundation for Building LLM-Enabled Software

或acular编程:构建LLM赋能软件的模块化基础

Jonathan Laurent, André Platzer

机构 * Carnegie Mellon University(卡内基梅隆大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

AI总结 或acular编程通过将传统显式计算与归纳预言相结合,提供模块化构建可靠软件的框架,解决LLM在精确控制和模块化合同组成方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16853 2026-03-18 cs.RO cs.GR

BrickSim: A Physics-Based Simulator for Manipulating Interlocking Brick Assemblies

BrickSim:一种基于物理的操纵互锁砖块组的模拟器

Haowei Wen, Ruixuan Liu, Weiyi Piao, Siyu Li, Changliu Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 BrickSim通过紧凑的力基力学模型和凸二次规划解决互锁砖块的snap-fit机制,实现高保真的实时模拟,支持机器人构建和结构坍塌仿真,具有开源特性。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16712 2026-03-18 math.ST cs.DS cs.LG stat.ML stat.TH

High-dimensional estimation with missing data: Statistical and computational limits

高维数据缺失下的估计:统计与计算限制

Kabir Aladin Verchand, Ankit Pensia, Saminul Haque, Rohith Kuditipudi

机构 * Department of Data Sciences and Operations, University of Southern California(数据科学与运营系,南加州大学) Department of Statistics and Data Science, Carnegie Mellon University(统计与数据科学系,卡内基梅隆大学) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

AI总结 研究在数据缺失情况下高维参数估计的统计与计算限制,证明在均值估计中需大量样本才能达到误差要求,而计算高效算法难以达到此下限,但在线性回归中则可近似达到信息论下限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16567 2026-03-18 cs.CL cs.AI

Characterizing Delusional Spirals through Human-LLM Chat Logs

通过人类-大语言模型聊天日志表征妄想螺旋

Jared Moore, Ashish Mehta, William Agnew, Jacy Reese Anthis, Ryan Louie, Yifan Mai, Peggy Yin, Myra Cheng, Samuel J Paech, Kevin Klyman, Stevie Chancellor, Eric Lin, Nick Haber, Desmond C. Ong

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) University of Chicago(芝加哥大学) Independent Researcher(独立研究者) Harvard Belfer Center(哈佛贝尔弗中心) University of Minnesota(明尼苏达大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文通过分析19名受聊天机器人影响用户的历史对话日志,揭示了妄想螺旋中用户与聊天机器人互动模式及心理危害,提出28项代码用于评估对话中的妄想、自伤和AI拟人化现象。

Comments To appear at ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15563 2026-03-18 cs.LG cs.AI

The PokeAgent Challenge: Competitive and Long-Context Learning at Scale

PokeAgent挑战:在大规模中实现竞争性和长上下文学习

Seth Karten, Jake Grigsby, Tersoo Upaa, Junik Bae, Seonghun Hong, Hyunyoung Jeong, Jaeyoon Jung, Kun Kerdthaisong, Gyungbo Kim, Hyeokgi Kim, Yujin Kim, Eunju Kwon, Dongyu Liu, Patrick Mariglia, Sangyeon Park, Benedikt Schink, Xianwei Shi, Anthony Sistilli, Joseph Twin, Arian Urdu, Matin Urdu, Qiao Wang, Ling Wu, Wenli Zhang, Kunsheng Zhou, Stephanie Milani, Kiran Vodrahalli, Amy Zhang, Fei Fang, Yuke Zhu, Chi Jin

机构 * Princeton(普林斯顿大学) UT-Austin(得克萨斯大学奥斯汀分校) CMU(卡内基梅隆大学) NYU(纽约大学) Google DeepMind(谷歌DeepMind) Team Heatz(团队Heatz) Team PA-Agent(团队PA-Agent) Team FoulPlay(团队FoulPlay) Team 4thLesson(团队4thLesson) Team Q(团队Q) Team Anthonys(团队Anthonys) Team Hamburg(团队Hamburg) Team Porygon2AI(团队Porygon2AI) Team Deepest(团队Deepest) Team August(团队August)

AI总结 PokeAgent挑战通过两个互补赛道,解决部分可观测性、博弈推理和长周期规划问题,提供大规模基准测试和首个RPG速run评估框架,揭示通用(LLM)、专业(RL)和精英人类表现间的差距。

Comments 41 pages, 26 figures, 5 tables. NeurIPS 2025 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22118 2026-03-18 cs.RO

System Design of the Ultra Mobility Vehicle: A Driving, Balancing, and Jumping Bicycle Robot

超机动车辆的系统设计:一种能骑行、平衡和跳跃的自行车机器人

Benjamin Bokser, Daniel Gonzalez, Aaron Preston, Alex Bahner, Annika Wollschläger, Arianna Ilvonen, Asa Eckert-Erdheim, Ashwin Khadke, Bilal Hammoud, Dean Molinaro, Fabian Jenelten, Henry Mayne, Howie Choset, Igor Bogoslavskyi, Itic Tinman, James Tigue, Jan Preisig, Kaiyu Zheng, Kenny Sharma, Kim Ang, Laura Lee, Liana Margolese, Nicole Lin, Oscar Frias, Paul Drews, Ravi Boggavarapu, Rick Burnham, Samuel Zapolsky, Sangbae Kim, Scott Biddlestone, Sean Mayorga, Shamel Fahmi, Surya Singh, Tyler McCollum, Velin Dimitrov, William Moyne, Yu-Ming Chen, Farbod Farshidian, Marco Hutter, David Perry, Al Rizzi, Gabe Nelson

机构 * Robotics and AI Institute (RAI)(机器人与人工智能研究所) Robotics Institute(机器人研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种结合自行车和反冲质量的超机动车辆,通过仿真驱动设计优化实现动态移动,展示零样本迁移的多样化运动行为,如站立、跳跃、轮跳和前翻。

Comments 17 Pages, 11 figures, 3 movies, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17325 2026-03-18 cs.LG cs.AI cs.CL

Generalizable End-to-End Tool-Use RL with Synthetic CodeGym

通用端到端工具使用强化学习与合成CodeGym

Weihua Du, Hailei Gong, Zhan Ling, Kang Liu, Lingfeng Shen, Xuesong Yao, Yufei Xu, Dingyuan Shi, Yiming Yang, Jiecao Chen

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

AI总结 本文提出CodeGym框架,通过合成多样化的多轮工具使用环境,提升LLM代理在不同任务配置下的泛化能力,实验显示Qwen2.5-32B-Instruct在OOD基准测试中准确率提升8.7个百分点。

Comments 24 pages. Accepted to ICLR 2026. Project repository: https://github.com/StigLidu/CodeGym

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15800 2026-03-18 cs.CV cs.CL cs.CR

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15714 2026-03-18 cs.CR cs.AI

How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition

AI代理对间接提示注入攻击的易受攻击性有多大?来自大规模公开竞赛的见解

Mateusz Dziemian, Maxwell Lin, Xiaohan Fu, Micha Nowak, Nick Winter, Eliot Jones, Andy Zou, Lama Ahmad, Kamalika Chaudhuri, Sahana Chennabasappa, Xander Davies, Lauren Deason, Benjamin L. Edelman, Tanner Emek, Ivan Evtimov, Jim Gust, Maia Hamin, Kat He, Klaudia Krawiecka, Riccardo Patana, Neil Perry, Troy Peterson, Xiangyu Qi, Javier Rando, Zifan Wang, Zihan Wang, Spencer Whitman, Eric Winsor, Arman Zharmagambetov, Matt Fredrikson, Zico Kolter

机构 * Gray Swan AI OpenAI Meta Anthropic US CAISI(美国CAISI) UK AISI(英国AISI) Carnegie Mellon University(卡内基梅隆大学) Center for AI Safety(人工智能安全中心)

AI总结 本文通过大规模公开竞赛评估了AI代理在工具调用、编程和计算机使用中的双重目标,发现所有模型均易受间接提示注入攻击,攻击成功率从0.5%到8.5%不等,并揭示了指令遵循架构的根本性弱点。

Comments 38 pages, 16 figures. Newer version to cover Q1 competition results on latest models in progress. Code at https://github.com/grayswansecurity/ipi_arena_os Partial Dataset at https://huggingface.co/datasets/sureheremarv/ipi_arena_attacks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15469 2026-03-17 cs.RO cs.AI

RoCo Challenge at AAAI 2026: Benchmarking Robotic Collaborative Manipulation for Assembly Towards Industrial Automation

AAAI 2026机器人协作操作挑战赛:面向工业自动化的协作操作基准测试

Haichao Liu, Yuheng Zhou, Zhenyu Wu, Ziheng Ji, Ziyu Shan, Qianzhun Wang, Ruixuan Liu, Zhiyuan Yang, Yejun Gu, Shalman Khan, Shijun Yan, Jun Liu, Haiyue Zhu, Changliu Liu, Jianfei Yang, Jingbing Zhang, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学,北京,中国) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,匹兹堡,美国) Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)

AI总结 本文提出RoCo挑战赛,通过模拟和真实世界装配任务,推动工业机器人协作操作能力的发展,展示了双模型框架和故障恢复数据在长周期多任务学习中的有效性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14989 2026-03-17 cs.CV

MMSpec: Benchmarking Speculative Decoding for Vision-Language Models

MMSpec:用于视觉-语言模型的推测解码基准测试

Hui Shen, Xin Wang, Ping Zhang, Yunta Hsieh, Qi Han, Zhongwei Wan, Ziheng Zhang, Jingxuan Zhang, Jing Xiong, Ziyuan Liu, Yifan Zhang, Hangrui Cao, Chenyang Zhao, Mi Zhang

机构 * University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学) Independent(独立) Indiana University(印第安纳大学) The University of Hong Kong(香港大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织)

AI总结 本文提出MMSpec基准,评估视觉-语言模型中的推测解码方法,发现文本模型在多模态场景下表现下降,视觉意识在大批次中更关键,且吞吐量提升不等于延迟降低,提出ViSkip方法实现最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14910 2026-03-17 eess.SY cs.RO cs.SY

Transformers As Generalizable Optimal Controllers

变换器作为通用最优控制器

Turki Bin Mohaya, Maitham F. AL-Sunni, John M. Dolan, Peter Seiler

机构 * Department of Electrical & Computer Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学电气与计算机工程系,匹兹堡,PA,美国) Robotics Institute, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器人研究所,匹兹堡,PA,美国)

AI总结 本文研究变换器能否捕捉异构MIMO线性时不变系统的最优状态反馈律,通过训练单一控制器在不同维度系统上实现轻量级微调,验证其在结构化线性系统家族中的实用性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13385 2026-03-17 cs.CV cs.AI cs.CR cs.IR

VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering

VisualLeakBench: 对大型视觉-语言模型在PII泄露和社会工程中的脆弱性进行审计

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) New York University(纽约大学)

AI总结 本文提出VisualLeakBench,通过合成对抗图像评估LVLMs对OCR注入和PII泄露的鲁棒性,揭示了Claude~4在PII识别上的高风险及防御策略的模板依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13359 2026-03-17 cs.AI

From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions

从拒绝标记到拒绝控制:发现并引导类别特定的拒绝方向

Rishab Alagharu, Ishneet Sukhvinder Singh, Shaibi Shamsudeen, Zhen Wu, Ashwinee Panda

机构 * Algoverse AI Research(Algoverse AI研究院) School of Computer Science, University of Maryland, College Park, United States(美国马里兰大学计算机科学学院) School of Computer Science, Carnegie Mellon University, Pittsburgh, United States(美国卡内基梅隆大学计算机科学学院)

AI总结 本文通过训练模型生成类别化拒绝标记,实现推理时对细粒度拒绝行为的控制,提升安全性和可靠性,通过提取残差流方向构建类别引导向量,并引入低秩组合实现多类拒绝控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11750 2026-03-17 q-bio.QM cs.LG

PRISM: Enhancing Protein Inverse Folding through Fine-Grained Retrieval on Structure-Sequence Multimodal Representations

PRISM:通过结构-序列多模态表示的细粒度检索增强蛋白质反向折叠

Sazan Mahbub, Souvik Kundu, Eric P. Xing

机构 * Carnegie Mellon University(卡内基梅隆大学) GenBio AI(基因组生物人工智能) Intel(英特尔)

AI总结 PRISM通过结构-序列多模态表示的细粒度检索提升蛋白质反向折叠性能,结合混合自交叉注意力解码器,实现更高效的序列生成与折叠预测。

Comments Published as a conference paper at International Conference on Learning Representation (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏