arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-12 至 2026-03-12 共收录 118 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 42 篇

2603.10521 2026-03-12 cs.AI cs.CL cs.CR cs.LG 67%

IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMs

IH-Challenge: 一个改进前沿大语言模型指令层级的训练数据集

Chuan Guo, Juan Felipe Ceron Uribe, Sicheng Zhu, Christopher A. Choquette-Choo, Steph Lin, Nikhil Kandpal, Milad Nasr, Rai, Sam Toyer, Miles Wang, Yaodong Yu, Alex Beutel, Kai Xiao

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 IH-Challenge通过强化学习训练数据集提升前沿大语言模型在指令冲突中的鲁棒性,减少不安全行为并提高帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07527 2026-03-12 cs.AI cs.LG 62%

Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions

学习强化学习无法做到的:用于最难问题的交错在线微调

Lu Ma, Hao Liang, Meiyi Qiang, Lexiang Tang, Xiaochen Ma, Zhen Hao Wong, Junbo Niu, Chengyu Shen, Runming He, Yanhao Li, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京软件与硬件协同人工智能系统重点实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 ReLIFT通过结合强化学习和在线微调,提升模型在复杂问题上的推理能力,实现超过5.2分的性能提升。

Comments 12 pages, 5 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10887 2026-03-12 cs.LG cs.AI 62%

Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models

动态预测采样用于主动强化学习微调大推理模型

Yixiu Mao, Yun Qu, Qi Wang, Heming Zou, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 DPS通过动态预测方法减少回放成本,提升大推理模型的强化学习微调效率与性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18045 2026-03-12 stat.ME cs.AI cs.LG 62%

Conformal Tradeoffs: Operational Profiles Beyond Coverage

符合性权衡:超越覆盖的操作配置文件

Petrus H. Zwart

机构 * Center for Advanced Mathematics in Energy Research Applications(能源研究应用高级数学中心) Synchrotron Infrared Structural Biology Program(同步辐射红外结构生物学计划) Molecular Biophysics and Integrated Bioimaging Division(分子生物物理与整合生物成像部)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SSBC方法,通过校准与审计机制,在有限样本下实现精确覆盖语义,并通过诱导划分揭示制度边界和权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17923 2026-03-12 cs.AI 61%

Learning Transferable Skills in Action RPGs via Directed Skill Graphs and Selective Adaptation

通过定向技能图和选择性适应在动作RPG中学习可转移的技能

Ali Najar

机构 * Sharif University of Technology(沙斐大学)

专题命中 规划决策 :agent(abstract,journal_ref);分类 cs.AI

AI总结 本文提出通过定向技能图和选择性适应方法,在动作RPG中实现技能的可转移学习,提高样本效率和适应性。

Comments 5 pages

Journal ref Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10895 2026-03-12 cs.LG 57%

Ergodicity in reinforcement learning

强化学习中的遍历性

Dominik Baumann, Erfaun Noorani, Arsenii Mustafin, Xinyi Sheng, Bert Verbruggen, Arne Vanhoyweghen, Vincent Ginis, Thomas B. Schön

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文探讨了非遍历奖励过程对强化学习的影响,分析了遍历性与马尔可夫链的关系,并提出优化长期性能的方法。

Comments Accepted article to appear in Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10294 2026-03-12 eess.SY cs.AI cs.SY 57%

Simulation-in-the-Reasoning (SiR): A Conceptual Framework for Empirically Grounded AI in Autonomous Transportation

推理中的模拟(SiR):面向自主交通系统经验导向AI的概念框架

Wuping Xin

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 SiR通过将领域模拟器嵌入LLM推理循环,为自主交通系统提供经验导向的AI框架,提升策略验证与优化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10220 2026-03-12 cs.CV cs.AI cs.RO 57%

Robotic Ultrasound Makes CBCT Alive

机器人超声使CBCT活起来

Feng Li, Ziyuan Li, Zhongliang Jiang, Nassir Navab, Yuan Bi

机构 * Chair for Computer-Aided Medical Procedures and Augmented Reality, Technical University of Munich(计算机辅助医学程序与增强现实 chair,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) The University of Hong Kong(香港大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 利用机器人超声实现动态CBCT更新,通过实时估计组织变形提升手术导航精度

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10210 2026-03-12 cs.CV cs.AI 57%

Delta-K: Boosting Multi-Instance Generation via Cross-Attention Augmentation

Delta-K: 通过交叉注意力增强提升多实例生成

Zitong Wang, Zijun Shen, Haohao Xu, Zhengjie Luo, Weibin Wu

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Nanjing University(南京大学) College of Management and Economics, Tianjin University(天津大学管理学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 Delta-K通过在交叉注意力键空间中直接操作,解决扩散模型在多实例生成中的概念遗漏问题,提升生成质量且无需额外训练或架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10099 2026-03-12 cs.LG cs.CR 57%

Denoising the US Census: Succinct Block Hierarchical Regression

美国人口普查去噪:简洁的块层次回归

Badih Ghazi, Pritish Kamath, Ravi Kumar, Pasin Manurangsi, Adam Sealfon

机构 * Google Research(谷歌研究)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本研究提出BlueDown方法,通过简洁的层次回归技术提升人口普查数据的准确性与一致性,满足隐私和结构约束,显著改善县和普查区层面的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12566 2026-03-12 cs.AI 57%

To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models

混合还是合并:为大语言模型的多领域强化学习而努力

Haoqing Wang, Xiang Long, Ziheng Li, Yilong Xu, Tingguang Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本研究提出M2RL框架,通过混合多任务训练或模型合并策略,提升大语言模型在多领域任务中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05927 2026-03-12 cs.CV cs.AI cs.RO 57%

World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty

能识别不确定性的世界模型 - 可控视频生成中的校准不确定性

Zhiting Mei, Tenny Yin, Micah Baker, Ola Shorinwa, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出C3方法,通过校准不确定性量化提升可控视频生成的可靠性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10724 2026-03-12 cs.CV 50%

eLasmobranc Dataset: An Image Dataset for Elasmobranch Species Recognition and Biodiversity Monitoring

eLasmobranc 数据集:用于软骨鱼类物种识别和生物多样性监测的图像数据集

Ismael Beviá-Ballesteros, Mario Jerez-Tallón, Nieves Aranda-Garrido, Isabel Abel-Abellán, Irene Antón-Linares, Jorge Azorín-López, Marcelo Saval-Calvo, Andres Fuster-Guilló, Francisca Giménez-Casalduero

机构 * University of Alicante(阿利坎特大学) Department of Computer Science and Technology (DTIC)(计算机科学与技术系) Marine Research Center of Santa Pola (CIMAR)(圣波拉海洋研究中心)

专题命中 规划决策 :planning(abstract)

AI总结 eLasmobranc数据集通过提供高质量软骨鱼类图像,支持物种识别和生物多样性监测,填补细粒度识别空白。

Comments 9 pages, 6 figures, 5 tables. A future extended version of this work will be submitted to Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10616 2026-03-12 cs.RO 50%

AdaClearGrasp: Learning Adaptive Clearing for Zero-Shot Robust Dexterous Grasping in Densely Cluttered Environments

AdaClearGrasp: 学习自适应清除以实现零样本鲁棒灵巧抓取在密集障碍环境中

Zixuan Chen, Wenquan Zhang, Jing Fang, Ruiming Zeng, Zhixuan Xu, Yiwen Hou, Xinke Wang, Jieqi Shi, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) Nanjing University of Posts and Telecommunications(南京邮电大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :planning(abstract)

AI总结 AdaClearGrasp通过自适应清除与零样本灵巧抓取技术,提升机器人在密集障碍环境中的抓取成功率。

Comments 12 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10459 2026-03-12 cs.RO 50%

SUBTA: A Framework for Supported User-Guided Bimanual Teleoperation in Structured Assembly

SUBTA:一种支持用户引导的双臂远程操作框架用于结构化装配

Xiao Liu, Prakash Baskaran, Songpo Li, Simon Manschitz, Wei Ma, Dirk Ruiken, Soshi Iba

机构 * Honda Research Institute USA(本田美国研究院) Honda Research Institute Europe GmbH(本田欧洲研究院)

专题命中 规划决策 :planning(abstract)

AI总结 SUBTA通过结合意图估计、任务规划和上下文相关的运动辅助,提高了双臂远程操作在结构化装配中的精度和用户体验。

Comments 8 pages, 7 figures, accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10352 2026-03-12 cs.RO 50%

Adaptive Manipulation Potential and Haptic Estimation for Tool-Mediated Interaction

自适应操控潜力与触觉估计用于工具中介交互

Lin Yang, Anirvan Dutta, Yuan Ji, Yanxin Zhou, Shilin Shan, Lv Chen, Etienne Burdet, Domenico Campolo

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) Imperial College of Science, Technology and Medicine(帝国理工学院科学、技术与医学学院)

专题命中 规划决策 :planning(abstract)

AI总结 本文提出了一种基于参数化平衡流形的闭环框架,通过自适应操控潜力和触觉SLAM实现工具中介交互中的触觉估计与自适应刚度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07181 2026-03-12 cs.CV 50%

FreeFly-Thinking : Aligning Chain-of-Thought Reasoning with Continuous UAV Navigation

自由飞行-思考:将链式推理对齐连续无人机导航

Jiaxu Zhou, Shaobo Wang, Zhiyuan Yang, Zhenjun Yu, Tao Li

机构 * SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 规划决策 :agent(abstract)

AI总结 FreeFly-thinking是一种端到端的无人机视觉-语言导航框架,通过链式推理提升导航性能,实现了在复杂户外环境中的高效导航。

Comments 10 pages, 5 figures, ECCV review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21085 2026-03-12 cs.RO 50%

Global End-Effector Pose Control of an Underactuated Aerial Manipulator via Reinforcement Learning

通过强化学习实现轻量化空中机械臂的全局末端姿态控制

Shlok Deshmukh, Javier Alonso-Mora, Sihao Sun

机构 * Department of Cognitive Robotics (CoR), Faculty of Mechanical Engineering, Delft University of Technology(认知机器人系(CoR),机械工程学院,代尔夫特理工大学)

专题命中 规划决策 :agent(abstract)

AI总结 本文通过强化学习实现轻量化空中机械臂的六自由度末端姿态控制,实验展示了厘米级精度和鲁棒性。

Comments 8 pages, 6 figures, accepted by IEEE ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15613 2026-03-12 eess.SY cs.SY 50%

A Predictive Flexibility Aggregation Method for Low Voltage Distribution System Control

一种用于低压配电网控制的预测灵活性聚合方法

Clément Moureau, Thomas Stegen, Mevludin Glavic, Bertrand Cornélusse

专题命中 规划决策 :planning(abstract)

AI总结 本文提出一种预测灵活性聚合方法,结合集中优化实现低压配电网实时控制,通过多参数优化和操作规划问题生成灵活性图,提升系统效率与经济性。

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00456 2026-03-12 cs.CY cs.HC 50%

Shiksha Copilot: Teacher-AI Collaboration for Curating and Customizing Lesson Plans in Low-Resource Schools

Shiksha Copilot:教师与AI协作在低资源学校中编纂和定制课程计划

Deepak Varuvel Dennison, Bakhtawar Ahtisham, Kavyansh Chourasia, Nirmit Arora, Rahul Singh, Rene F. Kizilcec, Akshay Nambi, Tanuja Ganu, Aditya Vashistha

专题命中 规划决策 :planning(abstract)

AI总结 Shiksha Copilot通过教师与AI协作,帮助低资源学校更高效地定制课程计划,同时减轻教师负担并促进基于活动的教学法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13302 2026-03-12 cs.CV 50%

An Overview about Emerging Technologies of Autonomous Driving

自动驾驶新兴技术概述

Yu Huang, Yue Chen, Zijiang Yang

专题命中 规划决策 :planning(abstract)

AI总结 本文概述了自动驾驶新兴技术,重点探讨了数据闭环框架下的关键技术和开放性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
1212.6592 2026-03-12 cs.IT math.IT 50%

Social Teaching: Being Informative vs. Being Right in Sequential Decision Making

社交教学:在信息性与正确性之间选择在顺序决策中的考量

Joong Bum Rhim, Vivek K Goyal

专题命中 规划决策 :agent(abstract)

AI总结 本文研究了在顺序决策中,初始信念的准确性对最终决策的影响,发现不准确的初始信念可提升最终决策性能,并揭示了早期代理在正确性与信息性之间的权衡。

Journal ref Proc. IEEE Int. Symp. Information Theory 2013

详情

展开后加载摘要…

URL PDF HTML 收藏
1212.5855 2026-03-12 cs.IT math.IT 50%

Keep Ballots Secret: On the Futility of Social Learning in Decision Making by Voting

保密选票:在通过投票进行团队二元决策中的社会学习无用性

Joong Bum Rhim, Vivek K. Goyal

专题命中 规划决策 :agent(abstract)

AI总结 本文研究了在团队二元决策中通过投票进行的社会学习无用性,发现忽略先前决策可获得最优团队性能,秘密选票优于社会学习。

Journal ref Proc. IEEE Int. Conf. Acoustics, Speech and Signal Processing 2013

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多智能体 12 篇

2603.10098 2026-03-12 cs.GT cs.AI cs.LG 89%

Code-Space Response Oracles: Generating Interpretable Multi-Agent Policies with Large Language Models

代码空间响应预言机:利用大语言模型生成可解释的多智能体策略

Daniel Hennes, Zun Li, John Schultz, Marc Lanctot

机构 * Google(谷歌) DeepMind(深度思维)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG;autonomous agent(comments)

AI总结 本文提出代码空间响应预言机,利用大语言模型生成可解释的多智能体策略,通过代码生成任务提升策略的可解释性和复杂策略发现能力。

Comments Accepted as an Extended Abstract at the Twenty-Fifth International Conference on Autonomous Agents and Multiagent Systems (AAMAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10528 2026-03-12 cs.LG cs.AI 88%

UAV-MARL: Multi-Agent Reinforcement Learning for Time-Critical and Dynamic Medical Supply Delivery

无人机多智能体强化学习:用于时间敏感和动态医疗物资配送

Islam Guven, Mehmet Parlak

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于多智能体强化学习的无人机协调框架,用于在动态医疗物资配送中实现高效任务优先和资源分配。

Comments 7 pages, 4 figures, 2 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10085 2026-03-12 cs.LG cs.AI cs.MA 88%

KernelSkill: A Multi-Agent Framework for GPU Kernel Optimization

KernelSkill:一种用于GPU内核优化的多智能体框架

Qitong Sun, Jun Han, Tianlin Li, Zhe Tang, Sheng Chen, Fei Yang, Aishan Liu, Xianglong Liu, Yang Liu

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

AI总结 KernelSkill通过多智能体框架和双层记忆架构,实现高效GPU内核优化,取得显著速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02816 2026-03-12 cs.CV cs.AI 88%

BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation

BrandFusion: 一种多智能体框架,用于文本到视频生成中的无缝品牌整合

Zihao Zhu, Ruotong Wang, Siwei Lyu, Min Zhang, Baoyuan Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) State University of New York at Buffalo(纽约州立大学布法罗分校) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 BrandFusion通过多智能体框架实现文本到视频生成中的无缝品牌整合,提升品牌辨识度和内容自然度,推动T2V的可持续商业化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18791 2026-03-12 cs.CL 88%

LaTeXTrans: Structured LaTeX Translation with Multi-Agent Coordination

LaTeXTrans: 带多智能体协调的结构化LaTeX翻译

Ziming Zhu, Chenglong Wang, Haosong Xv, Shunjie Xing, Yifu Huo, Fengning Tian, Quan Du, Di Yang, Chunliang Zhang, Tong Xiao, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) NiuTrans Research, Shenyang, China(牛译研究院,中国沈阳)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 LaTeXTrans通过多智能体协作实现结构化LaTeX文档的准确翻译,提升格式保留和术语一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11025 2026-03-12 cs.MA cs.IR 88%

LLMGreenRec: LLM-Based Multi-Agent Recommender System for Sustainable E-Commerce

LLMGreenRec: 基于大语言模型的多智能体推荐系统用于可持续电子商务

Hao N. Nguyen, Hieu M. Nguyen, Son Van Nguyen, Nguyen Thi Hanh

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 LLMGreenRec通过大语言模型和多智能体框架,提升电子商务中可持续产品推荐的准确性和环保性。

Comments Accepted to the Proceedings of the Conference on Digital Economy and Fintech Innovation (DEFI 2025). To appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10664 2026-03-12 cs.HC 88%

Terminal Is All You Need: Design Properties for Human-AI Agent Collaboration

终端即一切:人机协同中的设计属性

Alexandre De Masi

专题命中 多智能体 :agent(title,abstract);AI agent(title,abstract)

AI总结 本文提出终端作为人机协同设计的典范,强调其在表示兼容性、行为透明性和低参与门槛三方面的核心属性。

Comments 8 pages (6 content + 2 references), 6 figures. Accepted as poster at the CHI 2026 Workshop on Human-AI-UI Interactions Across Modalities (CUCHI'26), April 14, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏