arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 192
2607.09218 2026-07-14 cs.RO cs.AI 版本更新

TACTIC: Tactile and Vision Conditioned Contact-Centric Control for Whole-Arm Manipulation

用于全臂操作的触觉和视觉条件下的以接触为中心的控制

Rishabh Madan, Angchen Xie, Samantha Saak, Andres Blanco, Dohyeok Lee, Sarah Grace Brown, Yunting Yan, Mark Zolotas, Jose Barreiros, Tapomayukh Bhattacharjee

机构 * Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学) Toyota Research Institute(丰田研究机构)

AI总结 研究全臂操作问题,提出TACTIC控制器,它采用以接触为中心的混合预测模型,结合多种传感,通过接触雅可比矩阵耦合动力学与运动学,集成到MPC规划器,在模拟和实际任务中表现出色,优于其他方法。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31651 2026-07-14 cs.AI 版本更新

FARS: A Fully Automated Research System Deployed at Scale

FARS:一个大规模部署的全自动研究系统

Qiong Tang, Tianxiang Sun, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao, Bobo Li, Changze Lv, Cheng Xu, Chengsong Huang, Chunyang Li, Dizhan Xue, Hao Bai, Haodong Duan, Hengquan Guo, Hongyang He, Hongyi Chen, Hui Shen, Jiahao Yuan, Jiankai Sun, Jikang Cheng, Jinfeng Xu, Jingqi Tong, Jingye Chen, Jinxiu Liu, Jixuan Leng, Junchi Yu, Kaixun Jiang, Kun Xiang, Kunpeng Yao, Lang Feng, Liangqi Yuan, Longsen Gao, Meng Li, Qi Jia, Qiushi Sun, Shengyuan Ding, Shizhan Gong, Siru Zhong, Terry Jingchen Zhang, Tianle Gu, Tianyi Liang, Weijie Liu, Weikai Yang, Weizhi Fei, Xin Wang, Xinpeng Liu, Xuanwen Ding, Yihong Tang, Yuanli Wang, Yukun Jiang, Yuming Yang, Zhengbao He, Zhikai Chen, Zhikun Xu, Zhuang Li, Zihao Huang

机构 * Analemma National University of Singapore(新加坡国立大学) Fudan University(复旦大学) University College Dublin(都柏林大学) Washington University in St. Louis(圣路易斯华盛顿大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ByteDance(字节跳动) ShanghaiTech University(上海科技大学) University of Warwick(华威大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) East China Normal University(华东师范大学) Stanford University(斯坦福大学) Tencent(腾讯) The University of Hong Kong(香港大学) Shanghai Innovation Institute(上海创新研究院) Nex-AGI Team(Nex-AGI团队)

AI总结 提出FARS系统,通过分阶段智能体协作自动生成研究项目,在67个AI/ML主题上产出166篇论文,经282份评审验证其可产出有价值成果,同时暴露实验范围窄、方法局限和诚信问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27537 2026-07-14 cs.CV 版本更新

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

MemoBench: 动态变化环境中的世界建模基准测试

Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Boston University(波士顿大学) Google(谷歌) JHU(约翰霍普金斯大学) CMU(卡内基梅隆大学) Kempner Institute(肯普纳研究所)

AI总结 提出MemoBench基准,通过目标消失-重现范式评估视频生成模型在动态环境中的记忆一致性,涵盖合成与真实场景,揭示现有模型的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29042 2026-07-14 cs.CL cs.LG cs.SD eess.AS 版本更新

An Empirical Recipe for Universal Phone Recognition

一种通用电话识别的实证配方

Shikhar Bharadwaj, Chin-Jou Li, Kwanghee Choi, Eunjung Yeo, William Chen, Shinji Watanabe, David R. Mortensen

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出PhoneticXEUS模型,通过大规模多语言数据训练,在多语言和口音英语语音任务中取得最佳性能,分析了SSL表示、数据规模和损失目标的影响。

Comments Accepted at Interspeech 2026. Code: https://github.com/changelinglab/PhoneticXeus

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14046 2026-07-14 cs.CL cs.SD 版本更新

PRiSM: Benchmarking Phone Realization in Speech Models

PRiSM:语音模型中电话实现的基准测试

Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim, Kwanghee Choi, Eunjung Yeo, Ryan Soh-Eun Shim, Hanyu Zhou, Brendon Boldt, Karen Rosero Jacome, Kalvin Chang, Darsh Agrawal, Keer Xu, Chao-Han Huck Yang, Jian Zhu, Shinji Watanabe, David R. Mortensen

机构 * CMU(卡内基梅隆大学) Gwangju Institute of Science and Technology(光州科学技术院) UT Austin(得克萨斯大学奥斯汀分校) LMU Munich(慕尼黑路德维希-马克西米利安大学) UC Berkeley(伯克利加州大学) NVIDIA(英伟达) UBC(不列颠哥伦比亚大学)

AI总结 该研究针对语音模型中电话实现进行基准测试,引入PRiSM开源基准用内在和外在评估揭示语音感知盲点,标准化评估并通过探针评估下游效用,发现训练语言接触对PR性能关键,编码器-CTC模型稳定,专门PR模型优于大型音频语言模型,还发布相关资源推动多语言语音模型发展。

Comments Presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14129 2026-07-14 cs.SD eess.AS 版本更新

OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder

OpenBEATs:一个完全开源的通用音频编码器

Shikhar Bharadwaj, Samuele Cornell, Kwanghee Choi, Satoru Fukayama, Hye-jin Shim, Soham Deshmukh, Shinji Watanabe

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国) National Institute of Advanced Industrial Science and Technology (AIST), Japan(国家工业科学与技术研究院(AIST),日本)

AI总结 研究旨在填补通用音频理解中掩码令牌预测应用空白,提出开源框架OpenBEATs,通过多域音频预训练扩展BEATs。经多任务、多数据集和多音频域全面评估,其在多个数据集上达最优性能,证明方法有效性并开源相关代码等。

Comments Accepted at WASPAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12145 2026-07-10 cs.LG 版本更新

Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling

阈值差分注意力:用于无汇、超稀疏和非分散语言建模

Xingyue Huang, Xueying Ding, Mingxuan Ju, Yozen Liu, Neil Shah, Tong Zhao

机构 * University of Oxford(牛津大学) Carnegie Mellon University(卡内基梅隆大学) Snap Inc

AI总结 本文提出阈值差分注意力机制,解决长上下文下的注意力汇问题,实现超稀疏和鲁棒性提升,无需投影方法或标准注意力的噪声积累。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15543 2026-07-10 cs.CL cs.AI 版本更新

ParamMute: Suppressing Knowledge-Critical FFNs for Faithful Retrieval-Augmented Generation

ParamMute:抑制知识关键的前馈神经网络以实现忠实的检索增强生成

Pengcheng Huang, Zhenghao Liu, Yukun Yan, Haiyan Zhao, Xiaoyuan Yi, Hao Chen, Zhiyuan Liu, Maosong Sun, Tong Xiao, Ge Yu, Chenyan Xiong

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Language Technologies Institute, Carnegie Mellon University, United States(卡内基梅隆大学语言技术研究所)

AI总结 研究RAG中LLMs不忠实生成问题,提出ParamMute框架抑制相关FFNs激活并校准模型,通过CoFaithfulQA基准评估,显著提升忠实性,减少对参数记忆依赖,为提高LLM在RAG中的可信度提供新方向。

Comments 26 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29358 2026-07-09 cs.RO 版本更新

LAMP: Long-Horizon Adaptive Manipulation Planning for Multi-Robot Collaboration in Cluttered Space

LAMP: 杂乱空间中多机器人协作的长时域自适应操作规划

Shuai Zhou, Yorai Shaoul, Jiaoyang Li

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 提出LAMP框架,结合学习生成的操作模型与两种规划器(LAMPA*和LAMP-Lazy),实现多机器人在密集杂乱环境中的长时域协作操作规划,解决现有方法无法处理的复杂任务。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21489 2026-07-09 cs.CL cs.AI 版本更新

Effective Strategies for Asynchronous Software Engineering Agents

异步软件工程代理的有效策略

Jiayi Geng, Graham Neubig

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)

AI总结 本文提出CAID框架,通过集中任务委派、异步执行和隔离工作区三个核心SWE原语,提升多代理协作效率,在论文复现和Python库开发任务中分别提升26.7%和14.3%的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17588 2026-07-09 cs.CL cs.HC 版本更新

Modeling Distinct Human Interaction in Web Agents

建模网络代理中不同的人类交互

Faria Huq, Zora Zhiruo Wang, Zhanqiu Guo, Venu Arvind Arangarajan, Tianyue Ou, Frank Xu, Shuyan Zhou, Graham Neubig, Jeffrey P. Bigham

机构 * Carnegie Mellon University(卡内基梅隆大学) Duke University(杜克大学)

AI总结 本文通过收集400条真实用户网络导航轨迹,识别四种人机交互模式,并训练语言模型预测用户干预时机,将干预预测准确率提升61.4%-63.4%,用户评价的代理有用性提高36.8%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01256 2026-07-08 stat.ML cs.LG stat.ME 版本更新

Distribution-free changepoint localization after sequential change detection

顺序变化检测后的无分布变化点定位

Aytijhya Saha, Aaditya Ramdas

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种无分布框架,在停止顺序变化检测程序后构建变化点的后检测置信集,无需任何分布假设,并保证了有限样本覆盖率和渐近有界期望大小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02537 2026-07-08 cs.CL cond-mat.mtrl-sci 版本更新

PolyJarvis: An LLM-Orchestrated Agent for Automated All-Atom Molecular Dynamics of Amorphous Homopolymers

PolyJarvis:用于自主聚合物分子动力学模拟的LLM代理

Alexander Zhao, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 PolyJarvis结合大语言模型与RadonPy平台,通过MCP服务器实现从自然语言输入自主执行聚合物分子动力学模拟,预测密度、体积模量和玻璃化温度等性质,验证结果在不同聚合物中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20182 2026-07-08 cs.RO cs.MA 版本更新

IndoorR2X: Indoor Robot-to-Everything Coordination with LLM-Driven Planning

IndoorR2X: 基于大语言模型的室内机器人与万物协调

Fan Yang, Soumya Teotia, Shaunak A. Mehta, Prajit KrisshnaKumar, Quanting Xie, Jun Liu, Yueqi Song, Wenkai Li, Atsunori Moteki, Kanji Uchino, Yonatan Bisk

机构 * Fujitsu Research(富士通研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 IndoorR2X通过整合移动机器人和静态物联网设备的观测数据,构建全局语义状态,实现可扩展的场景理解、减少冗余探索并利用大语言模型进行高层协调,提升多机器人系统的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28553 2026-07-08 cs.HC cs.CY cs.LG 版本更新

Multimodal Analytics of Cybersecurity Crisis Preparation Exercises: What Predicts Success?

多模态分析网络安全危机准备演习:什么预测成功?

Conrad Borchers, Valdemar Švábenský, Sandesh K. Kafle, Kevin K. Tang, Jan Vykopal

机构 * Carnegie Mellon University(卡内基梅隆大学) Masaryk University, Faculty of Informatics(马萨里克大学信息学院)

AI总结 研究通过多模态追踪分析网络安全演习中的教学对齐,发现对齐度预测成功,而单纯Bloom分类无效。

Comments Accepted as full paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026), see https://doi.org/10.1007/978-3-032-29760-0_47

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15275 2026-07-08 cs.CV cs.LG 版本更新

RayRoPE: Projective Ray Positional Encoding for Multi-view Attention

RayRoPE: 多视角注意力的投影位置编码

Yu Wu, Minsik Jeon, Jen-Hao Rick Chang, Oncel Tuzel, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司)

AI总结 本文提出RayRoPE,一种基于投影坐标的位置编码方法,用于多视角Transformer,实现SE(3)不变的注意力机制,并能适应3D场景几何。

Comments Project page: https://rayrope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10954 2026-07-08 cs.SE cs.AI 版本更新

Empirical Computation: Prompting versus Programming

经验计算:提示与编程

Eric Tang, Jing Liu, Marcel Böhme

机构 * CMU(卡内基梅隆大学) MPI-SP(马克斯·普朗克研究所)

AI总结 探讨经验计算(用提示让大语言模型解决问题而非编程)的挑战与机遇,呼吁软件工程界分析其特性,如正确性、属性及极限等,以将经验计算确立为软件工程领域。

Comments Accepted at ACM/IEEE ASE'26 (New Ideas and Emerging Results; NIER), 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08678 2026-07-07 cs.LG 版本更新

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

MLS-Bench:对构建更好AI的AI系统的全面且严格评估

Bohan Lyu, Yucheng Yang, Siqiao Huang, Jiaru Zhang, Qixin Xu, Xinghan Li, Xinyang Han, Yicheng Zhang, Huaqing Zhang, Runhan Huang, Kaicheng Yang, Zitao Chen, Wentao Guo, Junlin Yang, Xinyue Ai, Wenhao Chai, Yadi Cao, Ziran Yang, Kun Wang, Dapeng Jiang, Huan-ang Gao, Shange Tang, Chengshuai Shi, Simon S. Du, Max Simchowitz, Jiantao Jiao, Dawn Song, Chi Jin

机构 * UC Berkeley(伯克利大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of Washington(华盛顿大学) Purdue University(Purdue 大学) Harvard University(哈佛大学) University of Pennsylvania(宾夕法尼亚大学) Shanghai Jiao Tong University(上海交通大学) UC San Diego(圣地亚哥大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出MLS-Bench基准,包含12个领域140个任务,评估AI系统能否发明通用且可扩展的机器学习方法,发现当前智能体在方法发明上仍远逊于人类,瓶颈在于科学洞察而非单纯搜索或计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15579 2026-07-07 cs.SE cs.AI cs.CR 版本更新

Don't Make Models Guess Security and Safety: Symbolic Guardrails for Domain-Specific AI Agents

领域特定智能体的符号护栏:在不牺牲效用的情况下提供更强的安全性和安全性保证

Yining Hong, Yining She, Eunsuk Kang, Christopher S. Timperley, Christian Kästner

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究了符号护栏在提高AI智能体安全性和安全性方面的有效性,通过系统回顾80个最新基准测试,发现74%的政策要求可通过符号护栏实现,从而在不牺牲效用的情况下提升安全性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15267 2026-07-07 cs.GT cs.AI cs.CL cs.CY cs.MA 版本更新

CoopEval: Benchmarking Cooperation-Sustaining Mechanisms and LLM Agents in Social Dilemmas

CoopEval:社会困境中合作维持机制与LLM代理的基准测试

Emanuel Tewolde, Xiao Zhang, David Guzman Piedrahita, Vincent Conitzer, Zhijing Jin

机构 * Carnegie Mellon University Foundations of Cooperative AI Lab (FOCAL) Jinesis Lab, University of Toronto \& Vector Institute ETH Z\" u rich Max Planck Institute for Intelligent Systems, T\" u bingen, Germany

AI总结 研究探讨了社会困境中合作维持机制与LLM代理的交互效果,发现重复游戏和声誉系统最有效,但合作效果随对手变化而下降,且在进化压力下更有效。

Comments Published paper at the International Conference on Machine Learning (ICML) 2026. 65 pages, 38 Figures, 8 Tables, 17 Listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13103 2026-07-07 cs.LG cs.MA cs.SY eess.SY 版本更新

Transformer-Based Multi-Agent Reinforcement Learning for Networked Systems with Long-Range Interactions

基于Transformer的具有长程交互的网络系统多智能体强化学习

Vidur Sinha, Muhammed Ustaomeroglu, Guannan Qu

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University(电气与计算机工程系,卡内基梅隆大学)

AI总结 研究针对现有多智能体强化学习在处理长程交互及网络泛化性上的局限,提出均值场稳定性分析等,贡献了基于Transformer的STACCA框架,提升了在相关网络控制任务中的性能与泛化性。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00566 2026-07-07 cs.LG cs.AI cs.DB 版本更新

Panorama: Fast-Track Nearest Neighbors

全景图:快速跟踪最近邻

Vansh Ramani, Alexis Schlomer, Akash Nayar, Sayan Ranu, Jignesh M. Patel, Panagiotis Karras

机构 * Carnegie Mellon University(卡内基梅隆大学) IIT Delhi(德里印度理工学院) UCPH(乌兹堡大学) Indian Institute of Technology Delhi(德里印度理工学院) University of Copenhagen(哥本哈根大学)

AI总结 针对高维神经嵌入的近似最近邻搜索,提出PANORAMA技术,利用嵌入固有频谱衰减加速验证,通过PCA压缩信号能量,增量评估候选距离,解决与乘积量化假设冲突问题,在FAISS库中优化,实现加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02641 2026-07-07 physics.chem-ph cs.LG 版本更新

FastCSP: Accelerated Molecular Crystal Structure Prediction with Universal Model for Atoms

FastCSP:基于原子通用模型的加速分子晶体结构预测

Vahe Gharakhanyan, Yi Yang, Luis Barroso-Luque, Daniel S. Levine, Sushree Jagriti Sahoo, Brandon M. Wood, Kyle Michel, Muhammed Shuaibi, Gregory J. O. Beran, Viachaslau Bernat, Misko Dzamba, Xiang Fu, Meng Gao, Xingyu Liu, Benjamin K. Miller, Keian Noori, Lafe J. Purvis, Tingling Rao, Ammar Rizvi, Matt Uyttendaele, Andrew J. Ouderkirk, Chiara Daraio, C. Lawrence Zitnick, Arman Boromand, Noa Marom, Zachary W. Ulissi, Anuroop Sriram

机构 * Fundamental AI Research at Meta(Meta 基础人工智能研究) Department of Materials Science and Engineering, Carnegie Mellon University(卡内基梅隆大学材料科学与工程系) Department of Chemistry, University of California Riverside(加州大学河滨分校化学系) Reality Labs Research at Meta(Meta 现实实验室研究) Department of Physics, Carnegie Mellon University(卡内基梅隆大学物理系) Department of Chemistry, Carnegie Mellon University(卡内基梅隆大学化学系)

AI总结 研究分子晶体结构预测难题,提出FastCSP工作流程,由预训练通用机器学习原子间势驱动,无需特定系统微调或DFT计算,能可靠恢复已知结构,降低计算成本。

Comments 32 pages, 10 figures, 32 pages supplementary information. Code available at https://github.com/facebookresearch/fairchem/tree/main/src/fairchem/applications/fastcsp

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22435 2026-07-03 cs.RO cs.AI 版本更新

CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation

CaP-X: 用于基准测试和改进机器人操作编码智能体的框架

Letian Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Dantong Niu, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

机构 * nvidia stanford(斯坦福大学) cmu(卡内基梅隆大学)

AI总结 提出CaP-X框架,通过CaP-Gym交互环境和CaP-Bench评估,发现编码智能体依赖人工抽象,但通过扩展测试时计算可提升鲁棒性,并推出无需训练的CaP-Agent0和强化学习CaP-RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12311 2026-07-03 cs.CL cs.SD eess.AS 版本更新

Phonikud: Overcoming Phonetic Underspecification for Hebrew Text-To-Speech

Phonikud:克服希伯来语文本转语音中的语音欠指定问题

Yakov Kolani, Maxim Melichov, Cobi Calev, Morris Alper

机构 * Independent Researcher(独立研究者) Reichman University(雷赫曼大学) Tel Aviv University(特拉维夫大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出Phonikud框架,通过开源G2P系统、语料库、基准和评估模型,解决希伯来语TTS中重音等语音特征欠指定问题,实现更准确的音素预测。

Comments Accepted to Interspeech 2026. Project page: https://phonikud.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23405 2026-07-02 cs.MA cs.AI cs.RO 版本更新

Planning over MAPF Agent Dependencies via Multi-Dependency PIBT

通过多依赖PIBT规划MAPF智能体依赖关系

Zixiang Jiang, Yulun Zhang, Rishi Veerapaneni, Jiaoyang Li

机构 * University Of Melbourne(墨尔本大学) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 提出多依赖PIBT(MD-PIBT)框架,通过搜索智能体依赖关系来规划多智能体路径,在拥挤环境中高效处理多达10000个智能体,支持多种运动学约束。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11103 2026-07-02 cs.AI cs.CL cs.SE 版本更新

GameDevBench: Evaluating Agentic Capabilities Through Game Development

GameDevBench: 通过游戏开发评估智能体能力

Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wang, Valerie Chen, Ameet Talwalkar, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出GameDevBench基准,包含333个游戏开发任务,评估智能体在多模态软件开发中的能力,发现最佳智能体仅解决53.8%任务,并引入视觉反馈机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18224 2026-07-02 cs.DC cs.LG 版本更新

FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel

FSA:原生稀疏注意力核的一种替代高效实现

Ran Yan, Youhe Jiang, Zhuoming Chen, Haohui Mai, Beidi Chen, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对现有稀疏注意力核在GQA组中查询头数较少时效率低的问题,提出Flash Sparse Attention (FSA)核实现,通过优化循环顺序,在多种流行LLM上实现平均1.6倍核延迟降低和1.09倍端到端训练加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10180 2026-07-02 cs.CV 版本更新

TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval

TCMA:面向无人机跨模态文本-视频检索的文本条件多粒度对齐

Zixu Zhao, Yang Zhan, Yunhao Li, Yan Li

机构 * Carnegie Mellon University(卡内基梅隆大学) The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学)

AI总结 针对无人机视频检索中数据集粗粒度、冗余标注问题,构建细粒度多样化标注数据集DVTMD,并提出文本条件多粒度对齐框架TCMA,实现全局-局部多层级对齐,在无人机文本-视频检索任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29173 2026-07-01 cs.RO 版本更新

TacGen: Touch Is a Necessary Dimension of Physical-World Representation -- Addressing Tactile Data Scarcity with Scalable Vision-to-Touch Alignment and Generation

TacGen: 触觉是物理世界表征的必要维度——通过可扩展的视觉到触觉对齐与生成解决触觉数据稀缺问题

Wanghao Ye, Aarosh Das, Sihan Chen, Yiting Wang, Bowei Tian, Guoheng Sun, Shwai He, Zheyu Shen, Ziyao Wang, Yexiao He, Zhaoyi Liu, Meng Liu, Yuning Zhang, Meng Feng, Ziyi Wang, Yilong Dai, Yifei Dong, Siyuan Peng, Zhenle Duan, Joshua Liu, Lang Xiong, Ang Li

机构 * University of Maryland, College Park(马里兰大学帕克分校) Carnegie Mellon University(卡内基梅隆大学) University of Alabama(阿拉巴马大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 针对触觉数据稀缺问题,提出TacGen方法,通过视觉-触觉对比对齐和潜在空间残差MLP生成器合成触觉潜在表示,在质量、密度、硬度等物理属性预测上显著优于纯视觉模型,并大幅提升触觉操作性能。

Comments 49 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏