arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-21 至 2026-05-21 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2601.23086 2026-05-21 cs.AI 91%

Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks

从输出监督学习的链式思维混淆可以泛化到未见过的任务

Nathaniel Mitrani Hadida, Sassan Bhanji, Cameron Tice, Puria Radmard

机构 * University of Cambridge(剑桥大学) Geodesic Research

专题命中 规划推理 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract);planning(abstract)

AI总结 本文研究了链式思维(CoT)推理中混淆现象的泛化能力,发现模型在学习混淆推理轨迹时,能够将这种混淆行为及其在未见过的任务中表现出来,从而影响模型的可监控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20195 2026-05-21 cs.CL cs.AI cs.LG 82%

Pseudo-Siamese Network for Planning in Target-Oriented Proactive Dialogues

面向目标的主动对话中规划的伪孪生网络

Xinyue Kang, Maodong Li, Yibin Zheng, Fang Kong

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种面向目标的主动对话规划方法,通过FF-BPSN网络实现对话路径规划,提升目标导向型主动对话系统的有效性。

Comments ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21406 2026-05-21 cs.RO 78%

MC-Risk: Multi-Component Risk Fields for Risk Identification and Motion Planning

MC-Risk:多组件风险场用于风险识别和运动规划

Maximilian Link, Yingjie Xu, Yingbai Hu, Yinlong Liu

机构 * Technical University of Munich(慕尼黑技术大学) The Chinese University of Hong Kong(香港中文大学) City University of Macau(澳门城市大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出MC-Risk,一种与规划器对齐的多组件风险场,用于早期、校准且类别感知的风险定位。该方法通过线性组合三个可解释模块,包括电机代理场、VRU风险场和道路惩罚场,并在RiskBench碰撞子集上进行了首次标准化定量评估,展示了最佳的风险定位和最早危险指示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20874 2026-05-21 cs.AI cs.SE 70%

Governance by Construction for Generalist Agents

为通用智能体构建的治理机制

Segev Shlomov, Iftach Shoham, Alon Oved, Ido Levy, Sami Marreed, Harold Ship, Offer Akrabi, Sergey Zeltyn, Avi Yaeli, Nir Mashkif

机构 * IBM

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种模块化的政策-as-code层,用于在不微调模型的情况下,通过与通用大语言模型智能体结合,实现可预测、可审计且符合合规要求的行为,在复合工作流中无需为每个领域重新构建智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16962 2026-05-21 cs.CV cs.AI 70%

OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics

OmniVL-Guard Pro: 一个增强工具的代理用于综合视觉-语言防伪

Jinjie Shen, Zheng Huang, Yuchen Zhang, Yujiao Wu, Yaxiong Wang, Lechao Cheng, Shengeng Tang, Tianrui Hui, Nan Pu, Zhun Zhong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) Wuhan University, Wuhan, China(武汉大学) Lab for Intelligence and visiON (LION)(智能与视觉实验室) Xi'an Jiaotong University(西安交通大学)

专题命中 规划推理 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出OmniVL-Guard Pro,一种增强工具的代理,用于综合视觉-语言防伪,通过整合多种工具环境和引入新的强化学习方法,实现了开放世界中的线索驱动推理,并在多个任务上达到了最先进的性能。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04332 2026-05-21 cs.MA 67%

DRAMA: Next-Gen Dynamic Orchestration for Resilient Multi-Agent Ecosystems in Flux

DRAMA: 为动态变化中的多智能体生态系统提供下一代动态编排

Xinkui Zhao, Yifan Zhang, Sai Liu, Naibo Wang, Guanjie Cheng, Yueshen Xu, Chang Liu, Shuiguang Deng, Jianwei Yin

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出DRAMA,一种动态且鲁棒的多智能体系统,通过模块化架构和灵活的任务分配机制,提高多智能体在快速变化环境中的协作韧性。

Journal ref The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20706 2026-05-21 cs.DC cs.AI cs.LG 62%

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

网络上的Llamas:基于WebGPU的内存高效、性能可移植和多精度LLM推理

Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

机构 * Microsoft Research(微软研究院) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LlamaWeb,一种基于WebGPU的LLM推理框架,通过静态内存规划和高效模型加载减少内存开销,支持多种模型权重格式,实现了内存高效、性能可移植的LLM推理。

Comments 19 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21240 2026-05-21 cs.LG cs.AI 62%

APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents

APEX:自主策略探索用于自演化大语言模型代理

Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出APEX,一种用于自演化大语言模型代理的自主策略探索方法,通过构建和维护显式的策略空间来解决探索崩溃问题,并在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16217 2026-05-21 cs.CL cs.AI cs.IR 62%

Argus: Evidence Assembly for Scalable Deep Research Agents

Argus:可扩展深度研究代理的证据组装

Zhen Zhang, Liangcai Su, Zhuo Chen, Xiang Lin, Haotian Xu, Simon Shaolei Du, Kaiyu Yang, Bo An, Lidong Bing, Xinyu Wang

机构 * MiroMind AI

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Argus通过将深度研究视为拼图碎片的组装过程,而非并行暴力求解整个答案,提高了大规模信息检索任务的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20608 2026-05-21 cs.AI cs.NI 57%

From Automated to Autonomous: Hierarchical Agent-native Network Architecture (HANA)

从自动化到自主:分层代理原生网络架构(HANA)

Binghan Wu, Shoufeng Wang, Yunxin Liu, Ya-Qin Zhang, Joseph Sifakis, Ye Ouyang

机构 * AsiaInfo Technologies Limited(亚洲信息科技有限公司) Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) Verimag

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种分层多代理参考架构,旨在实现Level 4/5自主网络,通过引入代理自意识,统一战略规划与操作韧性,验证了其在5G核心环境中的有效性。

Comments This manuscript has been accepted by IEEE Networking Letters

Journal ref B. Wu, S. Wang, Y. Liu, Y. -Q. Zhang, J. Sifakis and Y. Ouyang, "From Automated to Autonomous: Hierarchical Agent-native Network Architecture (HANA)," in IEEE Networking Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12321 2026-05-21 cs.AI cs.CY cs.ET 57%

LIDSA: Cognitive Arbitration for Signal-Free Autonomous Intersection Management

LIDSA:信号自由的自主交叉口管理中的认知仲裁

Abderrahmane Lakas, Mohamed Amine Ferrag, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿联酋大学) Research Institute for Digital Future, Khalifa University, UAE(未来数字研究院,哈利法大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LIDSA框架,利用大语言模型进行意图驱动的速度建议,以实现信号自由的自主交叉口管理,通过对比固定周期控制、SCATS、AIM和GLOSA等方法,证明LLM在实时交叉口管理中的有效性。

Comments Renamed LISA to LIDSA to avoid naming ambiguity with existing traffic-control software. No technical changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02660 2026-05-21 cs.AI 57%

MARS: Modular Agent with Reflective Search for Automated AI Research

MARS:模块化代理与反思搜索用于自动化AI研究

Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出MARS框架,通过预算感知规划、模块化构建和比较反思记忆解决复杂机器学习工程任务中的执行成本与性能归因问题,实现开放源代码框架在MLE-Bench上的最佳性能。

Comments Paper published at International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20210 2026-05-21 cs.CY cs.AI cs.MA 57%

Governance by Design: Architecting Agentic AI for Organizational Learning and Scalable Autonomy

设计治理:为组织学习和可扩展自主性构建智能体AI

Nelly Dux, Cristina Alaimo, Philippe Roussiere, Abhishek Kumar Mishra

机构 * ESSEC Business School(ESSEC商学院) Accenture Research(埃森哲研究)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文探讨了智能体AI在组织学习和可扩展自主性中的设计与治理问题,通过案例研究展示了如何通过具体的架构和工作安排实现有效的治理,并总结了七条指导原则。

Comments 17 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20917 2026-05-21 cs.RO 50%

SubTGraph: Large-Scale Subterranean Environment Synthesis with Controllable Topological Variability for Robotic Autonomy Validation

SubTGraph: 大规模地下环境合成与可控拓扑变化用于机器人自主性验证

F. Labra Caso, A. Saradagi, S. Fredriksson, S. Nordström, A. Koval, G. Nikolakopoulos

机构 * Robotics & AI Luleå University of Technology(机器人与人工智能卢勒奥技术大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出SubTGraph框架,用于快速合成具有高变异性的多层级地下环境,通过用户指定的拓扑、维度、纹理等参数生成不同类型的地下环境,用于验证机器人自主栈各层的严格验证。

Comments 16 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20811 2026-05-21 cs.RO 50%

Demo-JEPA: Joint-Embedding Predictive Architecture for One-shot Cross-Embodiment Imitation

Demo-JEPA: 一种用于单次跨体态模仿的联合嵌入预测架构

Jingyang He, Guangrun Li, Jieyu Zhang, Chengkai Hou, Zhengping Che, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) University of Washington(华盛顿大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出Demo-JEPA,一种跨体态模仿框架,通过解耦示范意图与体态特定的执行,利用共享预测表示空间将源视觉示范转换为目标兼容的未来潜在轨迹,使目标代理通过规划实现这些子目标,从而在异构体态间实现灵活的模仿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14201 2026-05-21 cs.RO cs.CV 50%

MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving

MAPLE:基于潜在空间的多智能体交互用于端到端自动驾驶

Rajeev Yasarla, Deepti Hegde, Hsin-Pai Cheng, Shizhong Han, Yunxiao Shi, Meysam Sadeghigooghari, Hanno Ackermann, Litian Liu, Pranav Desai, Fatih Porikli, Mohammad Ghavamzadeh, Hong Cai

机构 * Qualcomm AI Research(英矽人工智能研究)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出MAPLE框架,通过在视觉-语言-动作模型的潜在空间中实现反应式多智能体滚动,以解决传统模仿学习框架下闭环设置中模型易碎的问题,通过监督微调和强化学习结合多样性奖励,实现了可扩展且无需外部模拟器的闭环训练,提升了端到端自动驾驶系统的鲁棒性。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15281 2026-05-21 cs.SE 50%

Semantic Grounding of Digital Twin Metamodels Using RDF Graphs

基于 RDF 图的数字孪生元模型语义 grounding

Faima Abbasi, Jean-Sébastien Sottet, Cedric Pruski

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出了一种基于 RDF 图的数字孪生元模型语义 grounding 方法,通过设计多层数字孪生模型、将元模型提升为 RDF 图以及图基对齐方法 SSM-OM,实现了多层数字孪生的语义一致性与互操作性。

Comments Submitted to Conference, 15 pages excluding references, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20388 2026-05-21 cs.CV 50%

How You Move Tells What You'll Do: Trajectory-Conditioned Egocentric Prediction

如何移动决定了将来的行动:轨迹条件的自身视角预测

Sejoon Jun, Hai Nguyen-Truong, Luigi Seminara, Lorenzo Torresani

机构 * Khoury College of Computer Sciences, Northeastern University, Boston(北德文斯克学院,东北大学,波士顿) Korea Advanced Institute of Science and Technology, Daejeon(韩国科学技术院,大田) Department of Mathematics and Computer Science, University of Catania, Italy(卡塔尼亚大学数学与计算机科学系,意大利)

专题命中 规划推理 :planning(abstract)

AI总结 该研究通过轨迹条件自身视角预测,发现轨迹能更精确地表达意图,从而在任务规划中优于语言条件,且在预测时无需观察轨迹即可获得显著优势。

Comments Project page: https://farsightlab.github.io/TrajPilot

详情

展开后加载摘要…

URL PDF HTML 收藏