arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-15 至 2026-04-15 共收录 36 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 36 篇

2604.12282 2026-04-15 cs.CL 89%

Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning

面向多代理多格式推理的鲁棒现实世界电子表格理解

Houxing Ren, Mingjie Zhan, Zimu Lu, Ke Wang, Yunqiao Yang, Haotian Hou, Hongsheng Li

机构 * CUHK MMLab(CUHK多模态实验室) SenseTime Research(商汤科技研究院) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 本文提出SpreadsheetAgent框架,通过多模态逐步阅读推理解决大规模电子表格处理问题,通过结构草图和行列摘要提升推理可靠性,实验表明其在Spreadsheet Bench上表现优异。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11271 2026-04-15 cs.LG cs.CL cs.CV cs.MA 86%

OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning

OctoTools: 一个具有可扩展工具的代理框架,用于复杂推理

Pan Lu, Bowen Chen, Sheng Liu, Rahul Thapa, Joseph Boen, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 规划决策 :agentic(title);agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 OctoTools通过标准化工具卡、规划器和执行器,提供一种无需训练的多代理框架,实现跨领域复杂推理,其在16种任务中达到9.3%的平均准确率提升。

Comments 88 pages, 18 figures. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04850 2026-04-15 physics.chem-ph cs.AI cs.MA 85%

El Agente Quntur: A research collaborator agent for quantum chemistry

El Agente Quntur:一种用于量子化学研究的协作代理

Juan B. Pérez-Sánchez, Yunheng Zou, Jorge A. Campos-Gonzalez-Angulo, Marcel Müller, Ignacio Gustin, Andrew Wang, Han Hao, Tsz Wai Ko, Changhyeok Choi, Eric S. Isbrandt, Mohammad Ghazi Vakili, Hanyong Xu, Chris Crebolder, Varinia Bernales, Alán Aspuru-Guzik

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute) NVIDIA Institute of Medical Science(医学科学研究所)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出El Agente Quntur,一种多代理AI系统,旨在通过推理驱动决策和指导深度研究,提升量子化学计算工具的可访问性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12874 2026-04-15 cs.AI 83%

LIFE -- an energy efficient advanced continual learning agentic AI framework for frontier systems

LIFE -- 一种面向前沿系统的高效高级持续学习智能体框架

Anne Lee, Gurudutt Hosangadi

机构 * AI Research Lab(人工智能研究实验室) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出LIFE框架,通过整合四个组件实现HPCs的自进化网络管理和操作,旨在提升AI在HPCs中的持续学习能力与能效。

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12776 2026-04-15 cs.CL 83%

EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative Evolution

EvoSpark:内生交互代理社会的统一长周期叙述进化

Shiyu He, Minchi Kuang, Mengxian Wang, Bin Hu, Tingxiang Gu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 规划决策 :agent(title,abstract);multi-agent(abstract);分类 cs.CL

AI总结 EvoSpark通过内生交互代理社会框架,解决LLM多代理系统中长周期叙述演化的矛盾,通过分层叙述记忆和生成场景机制实现逻辑一致的持续叙事。

Comments Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11978 2026-04-15 cs.AI 83%

The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break

长远任务的幻觉?诊断代理系统何时及为何失效

Xinyu Jessica Wang, Haoyue Bai, Yiyou Sun, Haorui Wang, Shuibai Zhang, Wenjie Hu, Mya Schroder, Bilge Mutlu, Dawn Song, Robert D Nowak

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文通过HORIZON基准测试分析LLM代理在长周期任务中的失效模式,提出轨迹驱动的评估方法,并通过人类标注验证其有效性,为构建更可靠的代理系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11957 2026-04-15 cond-mat.mtrl-sci cs.LG 83%

Agentic LLM Reasoning in a Self-Driving Laboratory for Air-Sensitive Lithium Halide Spinel Conductors

具有自主推理能力的LLM在空气敏感性锂卤化物尖晶石导体自驱动实验室中的应用

Yuxing Fei, Bernardus Rendy, Xiaochen Yang, Junhee Woo, Xu Huang, Chang Li, Shilong Wang, David Milsted, Yan Zeng, Gerbrand Ceder

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文提出A-Lab GPSS平台,通过整合代理AI框架,实现对空气敏感性材料的自主实验设计,探索锂卤化物尖晶石固态离子导体的广阔化学空间,提升离子导电性和相纯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12628 2026-04-15 math.OC cs.RO 82%

A Comparison of Reinforcement Learning and Optimal Control Methods for Path Planning

强化学习与最优控制方法在路径规划中的比较

Qiang Le, Yaguang Yang, Isaac E. Weintraub

机构 * Department of Electrical and Computer Engineering, Hampton University(哈珀学院电气与计算机工程系) Air Warfare Directorate, Air Force Research Laboratory(空军研究实验室空战 Directorate)

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 本文比较了强化学习与最优控制方法在路径规划中的应用,提出基于DDPG的方法能快速生成安全路径,但存在不可行区域,未来将改进奖励函数和探索其他方法。

Comments 8 pages, 9 figures, submitted to AAAI Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12493 2026-04-15 cs.CL cs.AI 81%

Latent Planning Emerges with Scale

在规模下显现的潜在规划

Michael Hanna, Emmanuel Ameisen

机构 * ILLC, University of Amsterdam(伊拉斯姆斯自由大学,阿姆斯特丹大学) Anthropic

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文研究了LLM在简单规划任务中潜在规划能力随规模增加而增强的现象,发现模型能通过内部表示生成未来词并影响上下文,但复杂任务如押韵对句中规划能力有限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06794 2026-04-15 cs.AI 79%

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning

不再有陈旧的反馈:为开放世界智能体学习的共进化批评者

Zhicong Li, Lingjie Jiang, Yulan Hu, Xingchen Zeng, Yixia Li, Xiangwen Zhang, Guanhua Chen, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 赛洛岭人工智能学院) Amap, Alibaba Group(阿里巴巴集团 阿里地图) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southern University of Science and Technology(南方科技大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出ECHO框架,通过同步共进化循环联合优化策略和批评者,解决开放世界环境中策略演变导致的反馈过时问题,提升长周期任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12421 2026-04-15 cs.CL 79%

Agentic Insight Generation in VSM Simulations

代理洞察生成在价值流图模拟中的应用

Micha Selak, Dirk Krechel, Adrian Ulges, Sven Spieckermann, Niklas Stoehr, Andreas Loehr

机构 * RheinMain University of Applied Sciences(莱茵美因应用科学大学) SimPlan AG(SimPlan公司)

专题命中 规划决策 :agentic(title,abstract);分类 cs.CL

AI总结 本文提出一种分步代理架构,通过分离协调与数据分析,利用领域专家知识进行渐进数据发现,提升复杂价值流图模拟中提取可操作洞察的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12285 2026-04-15 cs.AI 79%

GAM: Hierarchical Graph-based Agentic Memory for LLM Agents

GAM:基于图的代理记忆用于大语言模型代理

Zhaofen Wu, Hanrong Zhang, Fulin Lin, Wujiang Xu, Xinran Xu, Yankai Chen, Henry Peng Zou, Shaowen Chen, Weizhi Zhang, Xue Liu, Philip S. Yu, Hongwei Wang

机构 * Zhejiang University(浙江大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Rutgers University(罗格斯大学) MBZUAI(麦吉尔大学人工智能研究所) McGill University(麦吉尔大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出GAM框架,通过解耦记忆编码与巩固,解决LLM代理在快速上下文感知与稳定知识保留间的矛盾,提升推理准确性和效率。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01236 2026-04-15 cs.NE cs.AI cs.DC cs.MA cs.NI 79%

DarwinNet: An Evolutionary Network Architecture for Agent-Driven Protocol Synthesis

DarwinNet: 一种基于进化算法的网络架构用于智能体驱动的协议合成

Jinliang Xu, Bingqi Li

机构 * China Academy of Information and Communications Technology(信息与通信技术研究院)

专题命中 规划决策 :agent(title);autonomous agent(abstract);分类 cs.AI

AI总结 DarwinNet通过生物启发的自进化架构,将通信协议从设计时静态模式转向运行时增长模式,利用三层次框架和双循环机制合成业务意图,通过协议固结指数量化系统进化成熟度,实验表明其具备抗脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19917 2026-04-15 cs.CL 79%

PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models

PILOT:通过内部化潜在优化轨迹进行大语言模型的规划

Haoyu Zheng, Yun Zhu, Yuqian Yuan, Bo Yuan, Wenqiao Zhang, Siliang Tang, Jun Xiao

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 PILOT通过内部化潜在优化轨迹,帮助大语言模型克服长周期任务中的推理不稳定问题,实验显示其在数学和编码基准测试中性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18081 2026-04-15 cs.LG 79%

DRPG (Decompose, Retrieve, Plan, Generate): An Agentic Framework for Academic Rebuttal

DRPG(分解、检索、计划、生成):一种用于学术反驳的代理框架

Peixuan Han, Yingjie Yu, Jingjun Xu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agentic(title,abstract);分类 cs.LG

AI总结 本文提出DRPG框架,通过分解评审、检索证据、计划反驳策略和生成回应四个步骤,提升学术反驳的自动化水平,实验表明其性能超越现有方法并达到人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23026 2026-04-15 cs.AI cs.RO 79%

Mixed-Density Diffuser: Efficient Planning with Non-Uniform Temporal Resolution

混合密度扩散器:非均匀时间分辨率下的高效规划

Crimson Stambaugh, Rajesh P. N. Rao

机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, USA(保罗·G·艾伦计算机科学与工程学院,华盛顿大学,西雅图,美国)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出混合密度扩散器,通过可调超参数实现规划时间分辨率的非均匀分布,提升在D4RL任务中的规划效率与性能。

Comments European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning (ESANN, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11201 2026-04-15 cs.CL cs.AI 79%

CocoaBench: Evaluating Unified Digital Agents in the Wild

CocoaBench:评估真实世界的统一数字代理

CocoaBench Team, Shibo Hao, Zhining Zhang, Zhiqi Liang, Tianyang Liu, Yuheng Zha, Qiyue Gao, Jixuan Chen, Zilong Wang, Zhoujun Cheng, Haoxiang Zhang, Junli Wang, Hexi Jin, Boyuan Zheng, Kun Zhou, Yu Wang, Feng Yao, Licheng Liu, Yijiang Li, Zhifei Li, Zhengtao Han, Pracha Promthaw, Tommaso Cerruti, Xiaohan Fu, Ziqiao Ma, Jingbo Shang, Lianhui Qin, Julian McAuley, Eric P. Xing, Zhengzhong Liu, Rupesh Kumar Srivastava, Zhiting Hu

机构 * CocoaBench Team(CocoaBench 团队)

专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 CocoaBench评估统一数字代理在多样化场景中的表现,通过人类设计的长周期任务测试其视觉、搜索和编码能力的灵活组合,发现当前代理在推理、规划和视觉理解方面仍有较大提升空间。

Comments Project page: https://cocoabench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10929 2026-04-15 cs.RO 78%

Ro-SLM: Onboard Small Language Models for Robot Task Planning and Operation Code Generation

Ro-SLM:机器人任务规划与操作代码生成的 onboard 小语言模型

Wenhao Wang, Yanyan Li, Long Jiao, Jiawei Yuan

机构 * Department of Computer & Information Science, University of Massachusetts Dartmouth(达特茅斯大学计算机与信息科学系) Department of Computer Science & Engineering, California State University San Marcos(加州州立大学桑马克斯分校计算机科学与工程系)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出Ro-SLM框架,通过蒸馏大语言模型知识提升机器人任务规划与代码生成能力,实验证明其性能接近大语言模型。

Comments 25 pages, 2 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12374 2026-04-15 cs.LG cs.AI cs.CL 78%

Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

Nemotron 3 Super:开放、高效的混合专家混合Mamba-Transformer模型用于代理推理

NVIDIA, :, Aakshita Chandiramani, Aaron Blakeman, Abdullahi Olaoye, Abhibha Gupta, Abhilash Somasamudramath, Abhinav Khattar, Adeola Adesoba, Adi Renduchintala, Adil Asif, Aditya Agrawal, Aditya Vavre, Ahmad Kiswani, Aishwarya Padmakumar, Ajay Hotchandani, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Aleksandr Shaposhnikov, Alex Gronskiy, Alex Kondratenko, Alex Neefus, Alex Steiner, Alex Yang, Alexander Bukharin, Alexander Young, Ali Hatamizadeh, Ali Taghibakhshi, Alina Galiautdinova, Alisa Liu, Alok Kumar, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Anahita Bhiwandiwalla, Ananth Subramaniam, Andrew Tao, Anjaney Shrivastava, Anjulie Agrusa, Ankur Srivastava, Ankur Verma, Ann Guan, Anna Shors, Annamalai Chockalingam, Anubhav Mandarwal, Aparnaa Ramani, Arham Mehta, Arti Jain, Arun Venkatesan, Asha Anoosheh, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asli Sabanci Demiroz, Asma Kuriparambil Thekkumpate, Atefeh Sohrabizadeh, Avinash Kaur, Ayush Dattagupta, Barath Subramaniam Anandan, Bardiya Sadeghi, Barnaby Simkin, Ben Lanir, Benedikt Schifferer, Benjamin Chislett, Besmira Nushi, Bilal Kartal, Bill Thiede, Bita Darvish Rouhani, Bobby Chen, Boris Ginsburg, Brandon Norick, Branislav Kisacanin, Brian Yu, Bryan Catanzaro, Buvaneswari Mani, Carlo del Mundo, Chankyu Lee, Chanran Kim, Chantal Hwang, Chao Ni, Charles Wang, Charlie Truong, Cheng-Ping Hsieh, Chenhan Yu, Chenjie Luo, Cherie Wang, Chetan Mungekar, Chintan Patel, Chris Alexiuk, Chris Holguin, Chris Wing, Christian Munley, Christopher Parisien, Chuck Desai, Chunyang Sheng, Collin Neale, Cyril Meurillon, Dakshi Kumar, Dan Gil, Dan Su, Dane Corneil, Daniel Afrimi, Daniel Burkhardt Eliuth Triana, Daniel Egert, Daniel Fatade, Daniel Lo, Daniel Rohrer, Daniel Serebrenik, Daniil Sorokin, Daria Gitman, Daria Levy, Darko Stosic, David Edelsohn, David Messina, David Mosallanezhad, David Tamok, Deena Donia, Deepak Narayanan, Devin O'Kelly, Dheeraj Peri, Dhruv Nathawani, Di Wu, Dima Rekesh, Dina Yared, Divyanshu Kakwani, Dmitry Konyagin Brandon Tuttle, Dong Ahn, Dongfu Jiang, Dorrin Poorkay, Douglas O'Flaherty, Duncan Riach, Dusan Stosic, Dustin Van Stee, Edgar Minasyan, Edward Lin, Eileen Peters Long, Elad Segal, Elena Lantz, Elena Lewis, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric W. Tramel, Erick Galinkin, Erik Pounds, Esti Etrog, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Farshad Saberi Movahed, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Fortuna Zhang, Frankie Siino, Frida Hou, Gantavya Bhatt, Gargi Prasad, Geethapriya Venkataramani, Geetika Gupta, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Grace Wu, Greg Pauloski, Greyson Davis, Grigor Nalbandyan, Guoming Zhang, Guy Farber, Guyue Huang, Haifeng Qian, Haran Kumar Shiv Kumar, Harry Kim, Harsh Sharma, Hayate Iso, Hayley Ross, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hiren Upadhyay, Huy Nguyen, Iain Cunningham, Ido Galil, Ido Shahaf, Igino Padovani, Igor Gitman, Igor Shovkun, Ikroop Dhillon, Ilya Loshchilov, Ingrid Kelly, Itamar Schen, Itay Levy, Ivan Moshkov, Izik Golan, Izzy Putterman, Jain Tu, Jan Baczek, Jan Kautz, Jane Polak Scowcroft, Janica Rosenberg, Jared Casper, Jarrod Pflum, Jason Grant, Jason Sewall, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiaqi Zeng, Jie Lou, Jill Milton, Jim Chow, Jimmy Zhang, Jinhang Choi, Jining Huang, Jocelyn Huang, Joel Caruso, Joey Conway, Joey Guman, Johan Jatko, John Kamalu, Johnny Greco, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joyjit Daw, Juan Yu, Julio Tapia, Junkeun Yi, Jupinder Parmar, Jyothi Achar, Kari Briski, Kartik Mattoo, Katherine Cheung, Katherine Luna, Keith Wyss, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirill Buryak, Kirthi Shankar Sivamani, Konstantinos Krommydas, Kris Murphy, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Laikh Tewari, Laya Sleiman, Leo Du, Leon Derczynski, Li Ding, Lilach Ilan, Lingjie Wu, Lizzie Wei, Luis Vega, Lun Su, Maarten Van Segbroeck, Maer Rodrigues de Melo, Magaret Zhang, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Sreedhar, Makesh Tarun Chandran, Manuel Reyes Gomez, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Margaret Zhang, Mark Cai, Mark Gabel, Markus Kliegl, Martyna Patelka, Maryam Moosaei, Matthew Varacalli, Matvei Novikov, Mauricio Ferrato, Mehrzad Samadi, Melissa Corpuz, Meng Xin, Mengdi Wang, Mengru Wang, Meredith Price, Micah Schaffer, Michael Andersch, Michael Boone, Michael Evans, Michael Z Wang, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Hollinger, Mingyuan Ma, Minseok Lee, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Nader Khalil, Najeeb Nabwani, Nancy Agarwal, Nanthini Balasubramaniam, Narimane Hennouni, Narsi Kodukula, Natalie Hereth, Nathaniel Pinckney, Nave Assaf, Negar Habibi, Nestor Qin, Neta Zmora, Netanel Haber, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Jukar, Nikki Pope, Nikolai Ludwig, Nima Tajbakhsh, Nir Ailon, Nirmal Juluru, Nirmalya De, Nowel Pitt, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Almog, Omri Puny, Oren Tropp, Otavio Padovani, Ouye Xie, Parth Chadha, Pasha Shamis, Paul Gibbons, Pavlo Molchanov, Peter Belcak, Peter Jin, Pinky Xu, Piotr Januszewski, Pooya Jannaty, Prachi Shevate, Pradeep Thalasta, Pranav Prashant Thombre, Prasoon Varshney, Prerana Gambhir, Pritam Gundecha, Przemek Tredak, Qing Miao, Qiyu Wan, Quan Tran Minh, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Rahul Kandu, Raina Zhong, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Renee Yao, Renjie Pi, Richard Mazzarese, Richard Wang, Rick Izzo, Ridhima Singla, Rima Shahbazyan, Rishabh Garg, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Roger Waleffe, Rohit Varma Kalidindi, Rohit Watve, Roi Koren, Ron Fan, Ruchika Kharwar, Ruisi Cai, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Timbrook, Ryota Egashira, Sadegh Mahdavi, Sagar Singh Ashutosh Joshi, Sahil Modi, Samuel Kriman, Sandeep Pombra, Sanjay Kariyappa, Sanjeev Satheesh, Santiago Pombo, Saori Kaji, Satish Pasumarthi, Saurav Mishra, Saurav Muralidharan, Scott Hara, Sean Narenthiran, Sebastian Rogawski, Seonjin Na, Seonmyeong Bak, Sepehr Sameni, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh Adam Lord, Sharath Turuvekere Sreenivas, Shaun Kotek, Shaya Gharghabi, Shelby Thomas, Sheng-Chieh Lin, Shibani Likhite, Shiqing Fan, Shiyang Chen, Shreya Gopal, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuo Zhang, Shuoyang Ding, Shyam Renjith, Shyamala Prayaga, Siddhartha Jain, Simeng Sun, Sirisha Rella, Sirshak Das, Smita Ithape, Sneha Harishchandra S, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sriharsha Niverty, Stas Sergienko, Stefana Gloginic, Stefania Alborghetti, Stephen Ge, Stephen McCullough, Sugam Dipak Devare, Suguna Varshini Velury, Sukrit Rao, Sumeet Kumar Barua, Sunny Gai, Suseella Panguluri, Sushil Koundinyan, Swathi Patnam, Sweta Priyadarshi, Swetha Bhendigeri, Syeda Nahida Akter, Sylendran Arunagiri, Tailling Yuan, Talor Abramovich, Tan Bui, Tan Yu, Terry Kong, Thanh Do, Thomas Gburek, Thorgane Marques, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Timothy Ma, Tiyasa Mitra, Tomasz Grzegorzek, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Traian Rebedea, Trenton Starkey, Tugrul Konuk, Twinkle Vashishth, Tyler Condensa, Udi Karpas, Ushnish De, Vahid Noorozi, Vahid Noroozi, Vanshil Atul Shah, Veena Vaidyanathan, Venkat Srinivasan, Venmugil Elango, Victor Cui, Vijay Korthikanti, Vikas Mehta, Virginia Adams, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Wan Seo, Wanli Jiang, Wasi Uddin Ahmad, Wei Du, Wei Ping, Wei-Ming Chen, Wendy Quan, Wenliang Dai, Wenwen Gao, Will Jennings, William Zhang, Xiaowei Ren, Xiaowen Xin, Xin Li, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Yoshi Suhara, Youngeun Kwon, Yuan Zhang, Yuki Huang, Zach Moshe, Zhilin Wang, Zhiyu Cheng, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijia Chen, Zijie Yan, Zuhair Ahmed

机构 * NVIDIA

专题命中 规划决策 :agentic(title);分类 cs.AI、cs.CL、cs.LG

AI总结 Nemotron 3 Super是首个采用NVFP4预训练、LatentMoE架构和MTP层加速推理的混合Mamba-Transformer模型,实现更高的推理吞吐量和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02821 2026-04-15 cs.RO cs.SY eess.SY 78%

Goal-Conditioned Neural ODEs with Guaranteed Safety and Stability for Learning-Based All-Pairs Motion Planning

具有保证安全性和稳定性的目标条件神经ODEs用于基于学习的全对运动规划

Dechuan Liu, Ruigang Wang, Ian R. Manchester

机构 * Australian Centre for Robotics(澳大利亚机器人中心) School of Aerospace, Mechanical and Mechatronic Engineering(航空航天、机械与机电工程学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种基于学习的全对运动规划方法,通过双 Lipschitz 双射构造平滑的目标条件神经ODEs,理论结果表明该模型在任意目标位置下能保证全局指数稳定性与安全性,且提供了收敛速率、跟踪误差和向量场大小的显式界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11554 2026-04-15 cs.CL 77%

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

Relax:一种用于大规模多模态后训练的异步强化学习引擎

Liujie Zhang, Benzhe Ning, Rui Yang, Xiaoyan Yu, Jiaxing Li, Lumeng Wu, Jia Liu, Minghao Li, Weihang Chen, Weiqi Hu, Lei Zhang

机构 * AI Platform, Xiaohongshu Inc(小红书AI平台) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agentic(abstract,abstract_cn);tool-use(abstract);分类 cs.CL

AI总结 Relax通过三个协同设计的架构层解决多模态数据流、大规模鲁棒性和延迟-吞吐量平衡问题,实现比veRL快1.20倍的端到端加速,并在多模态强化学习中表现出稳定收敛性。

Comments 17 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12896 2026-04-15 cs.CV cs.LG 70%

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

不要显示像素,显示提示:通过感知程序解锁语言模型中的视觉工具推理

Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

机构 * Huawei Technologies, Canada(华为技术(加拿大)) University of Alberta, Canada(阿尔伯塔大学(加拿大))

专题命中 规划决策 :tool-use(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出感知程序(P²),通过将视觉工具输出转换为结构化摘要,提升语言模型的视觉推理能力,在六个任务中均取得显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12196 2026-04-15 cs.CL 70%

Beyond Majority Voting: Efficient Best-Of-N with Radial Consensus Score

超越多数投票:基于径向共识得分的高效最佳-N选择

Manh Nguyen, Sunil Gupta, Hung Le

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(应用人工智能倡议,德肯大学,澳大利亚)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出Radial Consensus Score方法,通过计算答案嵌入的加权Fréchet均值并计算径向距离,实现高效最佳-N选择,优于现有方法并在多代理辩论中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12486 2026-04-15 cs.RO 67%

DeCoNav: Dialog enhanced Long-Horizon Collaborative Vision-Language Navigation

DeCoNav:基于对话的长时程协作视觉语言导航

Sunyao Zhou, Yunzi Wu, Tianhang Wang, Xinhai Li, Guang Chen, Lizheng Liu, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI)) China Telecom Fudan University(中国电信复旦大学) Tongji University(同济大学)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 DeCoNav通过事件触发对话与动态任务分配实现多机器人协作,提升了多机器人系统的长时程协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12177 2026-04-15 cs.AI cs.CL cs.CR cs.LG 67%

Policy-Invisible Violations in LLM-Based Agents

基于大语言模型的智能体中的政策不可见违规

Jie Wu, Ming Gong

机构 * Atlassian

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究探讨了大语言模型智能体在执行符合语法、用户授权和语义合适的行为时,仍可能因决策时缺乏关键事实而违反组织政策的问题,提出了PhantomPolicy基准和Sentinel框架以提升政策执行效果。

Comments 26 pages,1 figure, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12126 2026-04-15 cs.AI cs.CL 62%

Long-Horizon Plan Execution in Large Tool Spaces through Entropy-Guided Branching

在大规模工具空间中通过熵引导分支实现长周期计划执行

Rongzhe Wei, Ge Shi, Min Cheng, Na Zhang, Pan Li, Sarthak Ghosh, Vaibhav Gorde, Leman Akoglu

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出熵引导分支算法,解决大规模工具库中长周期任务执行的挑战,通过动态扩展高预测熵的决策分支,提升任务成功率和计算效率。

Comments This work was completed during an internship at Amazon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07083 2026-04-15 cs.LG 57%

Dreamer-CDP: Improving Reconstruction-free World Models Via Continuous Deterministic Representation Prediction

Dreamer-CDP: 通过连续确定性表示预测改进无重建世界模型

Michael Hauri, Friedemann Zenke

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出Dreamer-CDP,通过连续确定性表示预测提升世界模型性能,在Crafter环境中达到与传统重建方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09152 2026-04-15 cs.AI 57%

PrivacyReasoner: Can LLM Emulate a Human-like Privacy Mind?

PrivacyReasoner: LLM能否模拟出类似人类的隐私思维?

Yiwen Tu, Xuan Liu, Lianhui Qin, Haojian Jin

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出PrivacyReasoner,通过构建基于三个核心理念的代理架构,模拟人类隐私思维,评估结果显示其在预测个人隐私关切和跨领域泛化方面优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11914 2026-04-15 cs.AI 57%

Self-Monitoring Benefits from Structural Integration: Lessons from Metacognition in Continuous-Time Multi-Timescale Agents

自我监控从结构整合中获益:来自连续时间多时间尺度智能体中元认知的启示

Ying Xie

机构 * Kennesaw State University(肯尼斯州立大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究探讨了自我监控能力在连续时间多时间尺度智能体中的有效性,发现结构整合方法在非平稳环境中能提升性能,但未显著优于无自我监控基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05404 2026-04-15 cs.PF cs.SE 57%

Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning

超越准确性:揭示工具集成推理中的低效模式

Qisheng Su, Shiting Huang, Zhen Fang, Ziyan Chen, Zehui Chen, Feng Zhao

专题命中 规划决策 :tool-use(abstract);分类 cs.SE

AI总结 本文提出PTE指标,用于衡量工具集成推理的效率,揭示了低效模式,并发现高PTE成本与推理正确性下降相关。

Comments Accepted at ACL 2026. Code: https://github.com/sqs-ustc/tool-reasoning-framework-PTE

详情

展开后加载摘要…

URL PDF HTML 收藏