Collaborative Multi-Robot Non-Prehensile Manipulation via Flow-Matching Co-Generation
通过流匹配共生成实现协作多机器人非抓取操作
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon Robotics(亚马逊机器人)
AI总结 本文提出一种统一框架,通过流匹配共生成与匿名多机器人运动规划,实现协作多机器人非抓取操作,提升复杂多物体环境下的操作效率。
高校专区
通过流匹配共生成实现协作多机器人非抓取操作
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon Robotics(亚马逊机器人)
AI总结 本文提出一种统一框架,通过流匹配共生成与匿名多机器人运动规划,实现协作多机器人非抓取操作,提升复杂多物体环境下的操作效率。
尺度不变的遗憾匹配与最优收敛的在线学习:在零和博弈中弥合理论与实践的鸿沟
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种新的尺度不变且参数无关的PRM+变体IREG-PRM+,实现了最优收敛并优于现有方法,同时扩展了零和博弈到更广泛的变分不等式问题。
Comments Compared to the previous version, this version includes new results on harmonic games and extensive-form games. Abstract abridged due to arXiv length constraints
从提示到保护:基于大语言模型的上下文学习用于智能公共安全无人机
机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) ; Carnegie Mellon University(卡内基梅隆大学) ; Pontificia Universidad Católica de Chile(天主教大学) ; School of Computer Science, McGill University(麦吉尔大学计算机科学学院) ; Instituto de Telecomunicações, Faculdade de Engenharia, Universidade do Porto(电信研究所,工程学院,葡萄牙里斯本大学) ; University of Houston(休斯顿大学)
AI总结 本文提出利用大语言模型的上下文学习提升公共安全无人机的自主决策能力,通过自然语言提示和示例指导实现路径规划和速度控制,减少数据丢失并缓解安全漏洞。
GMAIL: 生成模态对齐用于生成图像学习
机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系) ; Department of Machine Learning, MBZUAI, UAE(马斯克大学人工智能研究所) ; Department of Artificial Intelligence, Hanyang University ERICA, South Korea(翰阳大学ERICA人工智能系)
AI总结 GMAIL通过多模态学习方法对齐生成图像与真实图像,提升视觉-语言任务中的生成图像学习效果。
不完美回忆下的决策:算法与基准测试
机构 * Computer Science Dept., Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学计算机科学系) ; Foundations of Cooperative AI Lab (FOCAL)(协作人工智能基础实验室(FOCAL)) ; Strategy Robot, Inc.(策略机器人公司) ; Strategic Machine, Inc.(战略机器公司) ; Optimized Markets, Inc.(优化市场公司)
AI总结 本文提出首个不完美回忆决策问题的基准测试集,并引入后悔匹配算法家族,在大规模约束优化中表现优异。
Comments 39 pages, 71 figures, 4 table
Vibe 编程是否安全?在现实任务中对代理生成代码的漏洞基准测试
机构 * Carnegie Mellon University Language Technologies Institute(卡内基梅隆大学语言技术研究所) ; Columbia University(哥伦比亚大学) ; Johns Hopkins University(约翰霍普金斯大学) ; HydroX AI
AI总结 本文通过基准测试发现,Vibe 编程在现实任务中生成的代码安全性不足,尽管功能正确但存在安全漏洞,警示其在安全敏感领域应用的风险。
基于相互依赖世代的通用并行扩展
机构 * Meta ; Carnegie Mellon University(卡内基梅隆大学) ; Yale University(耶鲁大学)
AI总结 Bridge通过将批量LLM隐藏状态视为整体张量,实现相互依赖的并行生成,提升响应准确率和一致性,适用于任意生成宽度和聚合技术。
OpenAgentSafety: 一个全面评估现实世界AI代理安全性的框架
机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
AI总结 OpenAgentSafety提出一个全面评估AI代理安全性的框架,通过真实工具和多任务测试揭示代理在现实世界中的安全漏洞,强调需要加强安全防护。
Comments 26 pages, 10 figures, Accepted at ICLR 2026 and IASEAI 2026
ThermEval: 一种用于评估视觉语言模型在热成像上的性能的结构化基准
机构 * Indian Institute of Technology, Gandhinagar, India(印度理工学院加尔各答分校) ; Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学)
AI总结 ThermEval通过结构化基准评估视觉语言模型在热成像上的性能,揭示其在温度推理和颜色映射转换上的不足,推动热视觉语言模型的发展。
Comments 8 Pages with 2 figures of main content. 2 pages of References. 10 pages of appendix with 6 figures
通过语义锚定的功能映射实现跨物体实例的 affordance 转移
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ; Australian Centre for Robotics, The University of Sydney(悉尼大学机器人中心) ; College of Connected Computing, Vanderbilt University(范德比大学连接计算学院)
AI总结 本文提出语义锚定的功能映射方法,通过单个视觉示范实现跨不同几何物体的 affordance 转移,提升机器人感知与行动的实用性。
S2D:选择性谱衰减用于神经激活的量化友好条件化
机构 * Amazon(亚马逊公司) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 S2D通过选择性谱衰减减少神经激活异常值,提升模型在量化过程中的准确性和部署效率。
Interspeech 2026音频推理挑战:评估音频推理模型和代理的推理过程质量
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Queen Mary University of London(伦敦大学Queen Mary) ; NVIDIA(NVIDIA公司) ; Carnegie Mellon University(卡内基梅隆大学) ; Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) ; Microsoft Corporation(微软公司)
AI总结 Interspeech 2026音频推理挑战通过评估推理过程质量,探讨了音频推理模型和代理在事实性和逻辑性方面的表现及改进方向。
Comments The official website of the Audio Reasoning Challenge: https://audio-reasoning-challenge.github.io
voice2mode:基于自监督语音模型的歌唱发声模式分类
机构 * University of Birmingham, School of Computer Science, Birmingham, UK(伯明翰大学计算机科学学院) ; Carnegie Mellon University, Information Systems, Doha, Qatar(卡内基梅隆大学信息系统) ; University of Southern California, Department of Electrical(南加州大学电气工程系)
AI总结 voice2mode利用自监督语音模型提取的嵌入对四种歌唱发声模式进行分类,实验表明基础模型特征在准确率上显著优于传统方法。
Comments Accepted to the Speech, Music and Mind (SMM26) workshop at the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026). This is the preprint version of the paper to appear in the proceedings
语言模型中的内部规划:刻画视野与分支意识
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究通过分析语言模型内部计算结构,揭示规划视野与分支意识的特性,为理解模型内部动态提供通用工具。
Comments Accepted to ICLR 2026
V2V-GoT: 基于多模态大语言模型和思维图的车对车协同自动驾驶
机构 * NVIDIA ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出V2V-GoT框架,结合多模态大语言模型和图-思维方法,提升车对车协同自动驾驶的感知、预测和规划能力。
Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vgot.github.io/ Code: https://github.com/eddyhkchiu/V2V-GoT Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA
GelSLAM:一种实时、高保真度和鲁棒的3D触觉SLAM系统
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 GelSLAM通过触觉传感实现实时高保真3D SLAM,以高精度重建物体形状并提升手部操作任务的鲁棒性。
Comments 20 pages
想法才是关键:评估前沿大语言模型在有害话题上的说服尝试
机构 * Université de Montréal, MILA(蒙特利尔大学,MILA) ; Carnegie Mellon University(卡内基梅隆大学) ; MIT, Center for Research and Teaching in Economics(麻省理工学院,经济研究与教学中心) ; Cornell University, University of Regina(康奈尔大学, Regina大学) ; Cornell University, MIT(康奈尔大学,麻省理工学院)
AI总结 本文提出APE基准测试,评估前沿大语言模型在有害话题上的说服意愿,揭示模型在有害情境下尝试说服的倾向及风险。
可扩展的大语言模型推理加速与低秩蒸馏
机构 * CMU Department of Electrical and Computer Engineering(卡内基梅隆大学电气与计算机工程系) ; Carnegie Mellon University(卡内基梅隆大学) ; Meta FAIR at Meta(Meta FAIR) ; CMU(卡内基梅隆大学)
AI总结 Caprese通过低秩蒸馏方法恢复高效推理方法中丢失的数学推理能力,同时减少参数数量和延迟,提升响应效率。
V2V-LLM:基于多模态大语言模型的车与车协同自动驾驶
机构 * NVIDIA ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出基于多模态大语言模型的V2V-LLM,通过车与车协同感知提升自动驾驶安全性和性能。
Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vllm.github.io/ Code: https://github.com/eddyhkchiu/V2V-LLM Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA
评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Yale University(耶鲁大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 研究揭示了基于评分标准的LLM裁判中隐蔽的偏好漂移问题,通过评分标准攻击可系统性降低目标领域准确性,影响模型对齐流程。
文本具有曲率
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Meta
AI总结 本文提出Texture,一种文本原生的词级曲率信号,通过定义和应用曲率检测与利用,建立文本曲率范式,提升长上下文推断和生成性能。
通过多目标贝叶斯优化加速冻保护剂混合物的发现
机构 * Mechanical Engineering Department, Carnegie Mellon University(卡内基梅隆大学机械工程系) ; Center for Engineering in Medicine & Surgery, Department of Surgery, Massachusetts General Hospital, Harvard Medical School, and Shriners Children’s(医学与手术工程中心,外科部,麻省总医院,哈佛医学院,以及谢尔曼儿童医院)
AI总结 通过多目标贝叶斯优化结合高通量筛选,高效发现同时具有高CPA浓度和高细胞存活率的冻保护剂混合物。
CellMaster: 单细胞分析中的协作细胞类型注释
机构 * Halicioglu Data Science Institute, University of California, San Diego, CA, USA(哈利奇奥格卢数据科学研究所,加州大学圣地亚哥分校) ; Department of Electrical & Computer Engineering, Texas A&M University, College Station, TX, USA(电气与计算机工程系,德克萨斯A&M大学) ; Department of Medicine, University of California, San Diego, CA, USA(医学系,加州大学圣地亚哥分校) ; Department of Chemistry and Biochemistry, University of California San Diego, La Jolla, CA, USA(化学与生物化学系,加州大学圣地亚哥分校) ; Moores Cancer Center, University of California, San Diego, La Jolla, CA, USA(摩尔癌症中心,加州大学圣地亚哥分校) ; Mohamed bin Zayed University of AI, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学) ; School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(计算机科学学院,卡内基梅隆大学)
AI总结 CellMaster通过利用LLM编码知识实现零样本细胞类型注释,提升单细胞分析的准确性和可解释性。
Comments Preprint
构建杀伤链:一种零样本框架,用于边缘节点上的目标验证和战术推理
机构 * With the Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)
AI总结 本文提出了一种零样本框架,通过边缘设备实现目标验证和战术推理,验证了分层架构在动态军事环境中的有效性。
Comments 8 Pages, 3 Figures
UAVGENT: 一种语言引导的分布式控制框架
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 UAVGENT通过结合语言引导的任务推理与分布式反馈控制,实现了多无人机系统在复杂任务中的鲁棒性和稳定性。
使用镜像映射组合改进在线镜像下降的后悔保证
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文提出通过组合镜像映射改进在线镜像下降的后悔保证,展示基于块范数的镜像映射在稀疏损失函数中取得多项式级别的后悔改进。
不是人类,更有趣:机器身份如何塑造在线AI单口喜剧的幽默感知
机构 * The University of Hong Kong Hong Kong, SAR China ; Carnegie Mellon University\ -Computer Interaction Institute Pittsburgh United States ; East China Normal University Shanghai China ; Northeastern University\ of Art, Media ; City University of Hong Kong\ for Narrative Spaces Hong Kong, SAR China ; The University of Hong Kong ; Carnegie Mellon University\ -Computer Interaction Institute ; East China Normal University ; City University of Hong Kong\ for Narrative Spaces
AI总结 本研究探讨了AI身份如何影响幽默感知,通过设计基于机器身份的代理,发现其在单口喜剧表演中比基线GPT代理更有趣,提出人机集成系统应明确利用AI的独特身份。
Comments 27 pages, 5 figures. Conditionally Accepted to CHI '26
语义缓存用于低成本LLM服务:从离线学习到在线适应
机构 * University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; The Chinese University of Hong Kong(香港中文大学) ; City University of Hong Kong(香港城市大学) ; Microsoft Research(微软研究院)
AI总结 本文提出了一种基于学习的语义缓存框架,解决LLM服务中的缓存淘汰问题,通过离线优化和在线学习方法,在未知查询和成本分布下实现高效缓存管理。
Comments Accepted to INFOCOM 2026
ADEPT: 通过证据探测工具实现情感的代理解码 -- 从共识学习到由模糊性驱动的情感推理
机构 * cmu(卡内基梅隆大学)
AI总结 ADEPT通过证据探测工具实现情感的代理解码,从共识学习转向由模糊性驱动的情感推理,提升情感识别的准确性和可解释性。
Comments Under Review
自适应多任务视觉语言模型用于机器人故障检测与推理
机构 * UT Austin(德克萨斯大学) ; Amazon Robotics(亚马逊机器人技术) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。