arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 192
2507.22080 2026-07-28 cs.SE cs.AI cs.CL 版本更新

CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback

CodeEvo:通过混合和迭代反馈以交互驱动方式合成以代码为中心的数据

Qiushi Sun, Jinyang Gong, Lei Li, Qipeng Guo, Fei Yuan

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 为解决高质量指令-代码对获取难题,提出双智能体架构CodeEvo,审查器制定模式并结合混合验证协议,构建CodeEvo-100K数据集,实验表明基于此数据微调的模型在代码生成基准测试中表现出色。

Comments ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15768 2026-07-28 cs.RO cs.SY eess.SY 版本更新

Error-State LQR Formulation for Quadrotor UAV Trajectory Tracking

四旋翼无人机轨迹跟踪的误差状态LQR公式

Micah I. Reich

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一种基于误差状态线性二次型调节器的四旋翼无人机轨迹跟踪方法,利用指数坐标表示姿态误差,结合全状态反馈与级联体速率控制器实现鲁棒控制。

Comments metadata fix

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02130 2026-07-27 cs.AI cs.LG 版本更新

Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning

Re-FORC:用于高效思维链推理的自适应奖励预测

Renos Zabounidis, Aditya Golatkar, Michael Kleinman, Alessandro Achille, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS智能代理部门) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究提出Re-FORC自适应奖励预测方法,通过在推理模型上训练轻量级适配器,实现早期停止无前景推理链、优化模型和思维长度选择以及自适应测试时缩放,有效提升推理效率和准确率。

Comments Accepted at ICML 2026; previously accepted as a non-archival paper at the Efficient Reasoning Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19212 2026-07-27 cs.CL cs.AI cs.CY 版本更新

When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas

当伦理与收益相悖时:道德两难情境下的大语言模型智能体

Steffen Backmann, David Guzman Piedrahita, Terry Jingchen Zhang, Emanuel Tewolde, Rada Mihalcea, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18049 2026-07-27 cs.LG math.OC stat.ML 版本更新

Online Pricing and Allocation with Demand Learning and Fulfillment Cost

具有需求学习和履行成本的在线定价与分配

Jianyu Xu, Xuan Wang, Yu-Xiang Wang, Jiashuo Jiang

机构 * Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科技大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 研究卖方联合选库存位置与价格并满足实际需求的在线学习问题,提出OCSAA算法,利用反事实翻译和低置信度乐观主义做决策,对有理多面体库存集有多项式时间加法精度实现,有高概率后悔保证及信息论下界,有效整合了统计学习与运筹学。

Comments 32 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23706 2026-07-24 eess.SP cs.HC cs.LG 版本更新

Zero-Shot Neural Priors for Generalizable Cross-Subject and Cross-Task EEG Decoding

零样本神经先验用于可泛化的跨被试和跨任务脑电解码

Baimam Boukar Jean Jacques, Brandone Fonya, Nchofon Tagha Ghogomu, Pauline Nyaboe, Kipngeno Koech

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对脑电信号跨被试和跨任务泛化难题,提出零样本解码框架,采用渐进解冻策略微调Transformer,在大型数据集上实现优于基线的性能。

Comments EEG Decoding research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31119 2026-07-23 cs.RO cs.LG 版本更新

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning

不要愚弄我两次:通过经验驱动推理在野外适应逆境

Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer

机构 * Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 提出一种持续学习框架,使移动机器人能够在线从干扰中学习,通过语义将异常行为归因于原因,从而更好地预测和规划未来。

Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08287 2026-07-23 stat.ML cs.LG 版本更新

Posterior Sampling Reinforcement Learning with Gaussian Processes for Continuous Control: Sublinear Regret Bounds for Unbounded State Spaces

基于高斯过程的后验采样强化学习用于连续控制:无界状态空间的次线性遗憾界

Hamish Flynn, Joe Watson, Ingmar Posner, Jan Peters

机构 * University of Oxford(牛津大学) Carnegie Mellon University(卡内基梅隆大学) Technical University of Darmstadt(达姆施塔特技术大学) Robotics Institute Germany(德国机器人研究所)

AI总结 本文通过递归应用Borell-Tsirelson-Ibragimov-Sudakov不等式和链式方法,在弱平滑条件下证明了GP-PSRL算法的贝叶斯遗憾界为$\widetilde{\mathcal{O}}(H\sqrt{\gamma_TT})$,解决了先前理论工作的局限性。

Comments Accepted at ICML 2026. 45 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06488 2026-07-23 cs.LG cs.CR stat.ML 版本更新

Membership Inference Attacks for Unseen Classes

针对未见类别的成员推理攻击

Pratiksha Thaker, Neil Kale, Zhiwei Steven Wu, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究针对未见类别的成员推理攻击,指出多数现有攻击因无法访问完整目标分布而失败,提出“未见类”设置,证明分位数回归攻击在此设置下优于其他方法,从实证和理论上展示其优势并给出成功所需泛化属性模型。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27039 2026-07-22 cs.CL 版本更新

Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

长度值模型:用于令牌级长度建模的可扩展值预训练

Zhen Zhang, Changyi Yang, Zijie Xia, Zhen Yang, Chengzhi Liu, Zhaotiao Weng, Yepeng Liu, Haobo Chen, Jin Pan, Chenyang Zhao, Yuheng Bu, Alkesh Patel, Zhe Gan, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) LMSYS Org(LMSYS组织) Apple Inc.(苹果公司)

AI总结 本文提出Length Value Model,通过令牌级建模实现高效的长度预测,提升生成长度的准确性和效率,实验显示其在多个任务中优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21014 2026-07-22 cs.LG cs.CL 版本更新

CLT-Forge: A Scalable Library for Cross-Layer Transcoders and Attribution Graphs

CLT-Forge:一种可扩展的跨层转码器和归因图库

Florent Draye, Vedant Palit, Abir Harrasse, Tung-Yu Wu, Jiarui Liu, Punya Syon Pandey, Roderick Wu, Chih-Hao Hsu, Terry Jingchen Zhang, Zhijing Jin, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Jinesis AI Lab(Jinesis人工智能实验室) University of Toronto(多伦多大学) Vector Institute(向量研究所) CMU(卡内基梅隆大学) EuroSafeAI ELLIS Institute Tübingen(图宾根ELLIS研究所)

AI总结 本文提出CLT-Forge库,通过分布式训练、模型分片和压缩激活缓存提升跨层转码器的可扩展性,提供统一的可解释性流程和可视化接口,解决归因图的冗余问题。

Comments 9 pages, 7 figures, 1 table. Code: https://github.com/LLM-Interp/CLT-Forge. Demonstration video: https://youtu.be/6ptrrLawTl8

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14473 2026-07-21 cs.CL cs.AI 版本更新

Does RAG Know When Retrieval Is Wrong? Diagnosing Context Compliance under Knowledge Conflict

RAG 能知道检索错误吗?知识冲突下的上下文合规性诊断

Yihang Chen, Pin Qian, Su Wang, Sipeng Zhang, Huan Xu, Shuhuai Lin, Xinpeng Wei

机构 * Georgia Institute of Technology(佐治亚理工学院) Carnegie Mellon University(卡内基梅隆大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 提出上下文驱动分解(CDD)方法,在推理时探测并干预检索增强生成中的上下文与参数知识冲突,揭示上下文合规性模式并提升鲁棒性。

Comments Preprint. 3 figures, 3 tables. Diagnostic study of context compliance in RAG under knowledge conflict; closed-API evaluations (Gemini-2.5-Flash and Claude family)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08523 2026-07-21 cs.CL cs.AI 版本更新

ClawBench: Can AI Agents Complete Everyday Online Tasks?

ClawBench:AI代理能否完成日常在线任务?

Yuxuan Zhang, Yubo Wang, Yipeng Zhu, Penghui Du, Junwen Miao, Xuan Lu, Zhuofeng Li, Xingwei Qu, Zhengkang Guo, Yuanzhe Shen, Dingjie Song, Han Zhou, Tuney Zheng, Xian Wu, Hao Yu, Songcheng Cai, Yi Lu, Yunzhuo Hao, Minyi Lei, Liang Chen, Kai Zou, Huifeng Yin, Wendong Xu, Dongfu Jiang, Ping Nie, Jiaheng Liu, Wenhu Chen, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Etude AI Carnegie Mellon University(卡内基梅隆大学) University of Waterloo(滑铁卢大学) Shanghai Jiao Tong University(上海交通大学) UniPat AI Zhejiang University(浙江大学) HKUST(香港科技大学) Tsinghua University(清华大学)

AI总结 ClawBench通过153个日常任务测试AI代理能力,涵盖15类144个平台,挑战多步骤流程和复杂操作,揭示现有模型在真实环境中的局限性。

Comments Project page: https://claw-bench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00594 2026-07-21 cs.AI 版本更新

Agent psychometrics: Task-level performance prediction in agentic coding benchmarks

代理心理测量:在代理编码基准中的任务级性能预测

Chris Ge, Daria Kryvosheieva, Daniel Fried, Uzay Girit, Kaivalya Hariharan

机构 * Massachusetts Institute of Technology(麻省理工学院) Fulcrum Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种基于任务级性能预测的代理编码基准评估框架,结合IRT理论与任务特征,区分LLM和支架能力,以更准确预测未见基准和组合的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21492 2026-07-21 cs.LG cs.AI cs.CL 版本更新

GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning

GradAlign: 用于大语言模型强化学习的梯度对齐数据选择

Ningyuan Yang, Weihua Du, Weiwei Sun, Sean Welleck, Yiming Yang

机构 * Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(交叉信息学院(IIIS)、清华大学) Language Technologies Institute (LTI), Carnegie Mellon University(语言技术研究所(LTI)、卡内基梅隆大学)

AI总结 GradAlign通过梯度对齐数据选择方法提升大语言模型强化学习的训练稳定性与性能。

Comments 20 pages. Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21372 2026-07-21 cs.AI 版本更新

NEMO: Execution-Aware Optimization Modeling via Autonomous Coding Agents

NEMO: 通过自主编码代理实现执行感知的优化建模

Yang Song, Anoushka Vyas, Zirui Wei, Sina Khoshfetrat Pakazad, Henrik Ohlsson, Graham Neubig

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)

AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20155 2026-07-20 cs.CV cs.CL 版本更新

NAMESAKES: Probing Identity Memorization in Text-to-Image Models

NAMESAKES: 探究文本到图像模型中的身份记忆

Morris Alper, Vasudha Varadarajan, Moran Yanuka, Angelina Wang, Hadar Averbuch-Elor

机构 * Carnegie Mellon University(卡内基梅隆大学) Tel Aviv University(特拉维夫大学) Cornell University(康奈尔大学)

AI总结 提出一种黑盒行为探针,无需参考照片或训练数据,即可区分文本到图像模型生成的图像是记忆还是虚构,并在NAMESAKES数据集上验证其有效性。

Comments Project page: https://namesakes-web.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03751 2026-07-20 cs.RO cs.AI 版本更新

Interaction-Aware Whole-Body Control for Compliant Object Transport

具有交互意识的全身控制用于柔顺物体运输

Hao Zhang, Yves Tseng, Ding Zhao, H. Eric Tseng

机构 * Department of Electrical Engineering, the University of Texas at Arlington(电气工程系,德克萨斯大学阿灵顿分校) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

AI总结 本文提出了一种生物启发式的交互导向全身控制方法,通过分离上身交互执行与下身支撑控制,实现稳定且灵活的柔顺物体运输。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01475 2026-07-20 eess.SY cs.LG cs.SY 版本更新

Comparative Field Deployment of Reinforcement Learning and Model Predictive Control for Residential HVAC

强化学习与模型预测控制在住宅暖通空调中的现场对比部署

Ozan Baris Mulayim, Elias N. Pergantis, Levi D. Reyes Premer, Bingqing Chen, Guannan Qu, Kevin J. Kircher, Mario Bergés

机构 * College of Engineering, Carnegie Mellon University, 5000 Forbes Ave, Pittsburgh, PA 15213, USA Wilton E. Scott Institute for Energy Innovation, Carnegie Mellon University, 5000 Forbes Ave, Pittsburgh, PA 15213, USA Center for High Performance Buildings, Purdue University, 177 S Russell St, West Lafayette, IN 47907, USA Trane Technologies, Residential R\&D Group, 6200 Troup Hwy, Tyler, TX 75707, USA Bosch Center for Artificial Intelligence

AI总结 研究对比强化学习与模型预测控制应用于住宅暖通空调的情况,通过在寒冷气候住宅中各部署一个月,对比两者节能效果、居住者舒适度及数据需求等,发现RL节能略优、部署工作量少但面临初始化等困难。

Comments 26 pages, 9 figures, 5 tables. Under review for Applied Energy

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19877 2026-07-17 cs.CL 版本更新

Scaling Evaluation-time Compute with Reasoning Models as Evaluators

通过推理模型作为评估器来提升评估时的计算能力

Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学) UIUC(伊利诺伊大学) KAIST AI(韩国科学技术院人工智能研究所) NEC Laboratories Europe(日本 NEC 欧洲实验室) Ss.Cyril and Methodius University of Skopje(斯科普里塞尔吉尔和梅蒂乌斯大学)

AI总结 本文探讨了通过增加评估时的计算量来提升语言模型的评估能力,利用推理模型作为评估器,分别评估响应整体和每个步骤,从而提高评估效果。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05050 2026-07-17 cs.AI econ.GN q-fin.EC 版本更新

Large language models can effectively convince people to believe conspiracies

大语言模型能够有效地说服人们相信阴谋论

Thomas H. Costello, Kellin Pelrine, Matthew Kowal, Jasper Timm, Antonio A. Arechar, Jean-François Godbout, Adam Gleave, David Rand, Gordon Pennycook

机构 * Carnegie Mellon University(卡内基梅隆大学) York University(约克大学) Center for Research and Teaching in Economics(经济研究中心) MIT(麻省理工学院) Université de Montréal(蒙特利尔大学) Mila Cornell University(康奈尔大学) University of Regina(Regina大学)

AI总结 研究大语言模型能否有效说服人们相信阴谋论,通过四项实验发现其既能增加也能降低阴谋信念,反驳效果更佳,特定提示可降低支持阴谋论有效性,还存在信息分享上的真理不对称,有潜在技术方案减轻风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08016 2026-07-16 cs.CV cs.GR 版本更新

LightCrafter: PBR-Conditioned Video Diffusion Refinement for Controllable and Consistent Relighting

LightCrafter:用于可控且一致的重光照的PBR条件视频扩散细化

Zixin Guo, Yehonathan Litman, Yifeng He, John Miller, Chuhan Chen, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Bosch Research(博世研究)

AI总结 研究视频重光照问题,提出LightCrafter混合管道,将其重表述为代理视频转换,利用PBR渲染并结合光度先验,在真实世界重光照基准上优于现有技术,还贡献合成基准及相关资源。

Comments Project page: https://www.zixinguo.me/lightcrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05364 2026-07-16 cs.CL cs.AI cs.SD 版本更新

REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing

REDDIT:基于回放的分布编辑在无遗忘条件下校正ASR的模型生成时间戳漂移

Cheng-Kang Chou, Ming-To Chuang, Ke-Han Lu, Chan-Jan Hsu, Hung-yi Lee

机构 * National Taiwan University(台湾大学) Carnegie Mellon University(卡内基梅隆大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立清华大学人工智能研究中心(NTU AI-CoRE))

AI总结 针对自回归ASR的非语音区间时间戳漂移问题,提出REDDIT两阶段后训练框架,仅用少量数据和参数更新校正时间戳,避免普通微调的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18798 2026-07-16 cs.MM cs.AI 版本更新

ELF: A Family of Encoder-Free ECG-Language Models

ELF:无编码器心电图语言模型家族

William Han, Tony Chen, Chaojing Duan, Xiaoyu Song, Yihang Yao, Yuzhe Yang, Michael A. Rosenberg, Emerson Liu, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Allegheny Health Network(阿勒格尼医疗网络) University of California Los Angeles(加州大学洛杉矶分校) University of Colorado(科罗拉多大学) Allergy and Immunology(过敏与免疫学)

AI总结 提出三种无编码器架构的ECG语言模型ELF,简化架构和训练流程,在两个数据集上达到或超越现有最优模型。

Comments 34 pages, 12 figures; Accepted to MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05860 2026-07-16 cs.CL 版本更新

Overcoming Language Barriers: Multilingual Analysis of the 2023 Swiss Privacy Law's Impact

克服语言障碍:对2023年瑞士隐私法影响的多语言分析

Luka Nenadic, David Rodriguez, Joseph A. Calandrino

机构 * ETH Zurich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究2023年瑞士隐私法与欧盟法规对齐对瑞士网站隐私政策的影响,开发基于大语言模型的管道提取法律信息,应用于超35000个网站隐私政策,发现政策中数据主体权利披露增加,还揭示了政策生成器对披露率的影响。

Journal ref Proceedings on Privacy Enhancing Technologies 2026(4) 703-723

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01311 2026-07-15 cs.CL 版本更新

Catalyst-Agent: Autonomous heterogeneous catalyst screening with an LLM Agent

Catalyst-Agent:基于LLM Agent的自主异质催化剂筛选

Achuth Chandrasekhar, Janghoon Ock, Amir Barati Farimani

机构 * Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学机械工程系,匹兹堡,PA 15213,USA) Department of Chemical and Biomolecular Engineering, University of Nebraska--Lincoln, Lincoln, NE 68588, USA(内布拉斯加大学林肯分校化学与生物分子工程系,林肯,NE 68588,USA)

AI总结 提出Catalyst-Agent,一种基于MCP服务器和LLM的AI代理,通过OPTIMADE API探索材料数据库、利用UMA模型计算吸附能,实现闭环自主催化剂筛选,在ORR、NRR和CO2RR反应中成功率达33-41%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05995 2026-07-15 cs.RO cs.AI cs.LG 版本更新

TADPO: Reinforcement Learning Goes Off-road

TADPO:强化学习走向越野

Zhouchonghao Wu, Raymond Song, Vedant Mundheda, Luis E. Navarro-Serment, Christof Schoenborn, Jeff Schneider

机构 * Robotics Institute, School of Computer Science, Carnegie Mellon University(机器人研究所,计算机科学学院,卡内基梅隆大学)

AI总结 TADPO通过改进的策略梯度方法,首次在全规模越野平台上实现了基于强化学习的自动驾驶解决方案,能够应对复杂地形和低信号奖励环境。

Comments Accepted for Oral Presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12339 2026-07-15 cs.HC cs.AI 版本更新

SheetMind: An End-to-End LLM-Powered Multi-Agent Framework for Spreadsheet Automation

SheetMind:一个由端到端大语言模型驱动的用于电子表格自动化的多智能体框架

Xi Cheng, Ruiyan Zhu, Ke Liu, Rakesh Chowdary Machineni, Lyuhao Chen, Brian Zhu, Daniel Jin, Zheng Qi, Neeraj Parihar, Zhoutian Xu, Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)

AI总结 介绍由大语言模型驱动的多智能体框架SheetMind用于电子表格自动化,其分层系统含三个智能体,经评估在SheetCopilot基准测试中执行成功率达100%、功能正确性54.8%超对手,消融研究验证配置优势,还集成到谷歌表格。

详情

展开后加载摘要…

URL PDF HTML 收藏