arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-04 至 2026-06-04 共收录 172 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 57 篇

2604.04944 2026-06-04 cs.CL cs.AI 73%

Inclusion-of-Thoughts: Mitigating Preference Instability via Purifying the Decision Space

包含思维:通过净化决策空间缓解偏好不稳定性

Mohammad Reza Ghasemi Madani, Soyeon Caren Han, Shuo Yang, Jey Han Lau

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出包含思维(IoT)策略,通过逐步自过滤干扰选项来重构多选题,从而稳定模型偏好并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.06070 2026-06-04 eess.SY cs.SY 71%

Decentralized Abstractions and Timed Constrained Planning of a General Class of Coupled Multi-Agent Systems

去中心化抽象与一般耦合多智能体系统的时约束规划

Alexandros Nikou, Shahab Heshmati-alamdari, Christos Verginis, Dimos V. Dimarogonas

专题命中 规划推理 :planning(title)

AI总结 本文提出一种自动控制器合成方法,针对具有耦合约束的多智能体系统,设计满足MITL规格的控制器并保持连接性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.05097 2026-06-04 eess.SY cs.SY 71%

Cooperative Planning for Coupled Multi-Agent Systems under Timed Temporal Specifications

耦合多智能体系统的 timed 时间规范下的协作规划

Alexandros Nikou, Dimitris Boskos, Jana Tumova, Dimos V. Dimarogonas

专题命中 规划推理 :planning(title)

AI总结 本文提出一种自动控制器合成方法,针对耦合约束下的多智能体系统设计控制输入以满足MITL规范,通过离散化和形式验证技术实现任务满足。

Comments submitted to ACC 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05112 2026-06-04 cs.CL 70%

Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases

评估大型语言模型在标准化病人案例中的动态临床决策能力

Cheng Liang, Pengcheng Qiu, Ya Zhang, Yanfeng Wang, Chaoyi Wu, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 规划推理 :planning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 本文提出MedSP1000基准,通过标准化病人案例模拟动态临床交互,评估LLM在信息收集、治疗计划和长期管理中的表现,发现当前模型在过程级评估中远未达到临床安全标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13384 2026-06-04 cs.SE cs.AI 70%

VulnAgent-R2: Evidence-Calibrated Multi-Agent Auditing for Repository-Level Vulnerability Detection

VulnAgent-R2: 证据校准的多智能体审计用于仓库级漏洞检测

Renwei Meng, Haoyi Wu, Jingming Wang

机构 * stu.ahu.edu.cn(安徽大学)

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出VulnAgent-R2,一个预算感知的多智能体审计框架,通过反事实证据重加权、构建感知验证计划合成和成本风险帕累托调度器,在仓库级漏洞检测中提升F1和AUROC,并降低在线令牌消耗。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04641 2026-06-04 cs.DB 67%

Bridge the Last-Mile Gap to Semantic Analytics: Compiling Natural-Language Queries into Semantic Operator Pipelines

弥合语义分析的最后一步差距:将自然语言查询编译为语义操作符流水线

Wenkai Dong, Ruyu Li, Sairam Gurajada, Yifan Wang

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出NL2Pipe中间件系统,通过查询-数据链接、语义规划和代码生成三阶段编译,将自然语言问题自动转化为可执行的语义操作符流水线,显著提升跨源工作负载的F1分数。

Comments 4 figures, 7 tables. Code: https://github.com/dongw-netize/NL2Pipe-Compiling-Natural-Language-Questions-into-Semantic-Operator-Pipelines

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04046 2026-06-04 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation

深入场景:通过焦点计划生成打破视觉-语言决策中的感知瓶颈

Boyuan Xiao, Bohong Chen, Yumeng Li, Ji Feng, Yao-Xiang Ding, Kun Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SceneDiver方法,通过从粗到细的焦点计划生成,逐步构建场景图并分解任务,减少视觉幻觉,提升视觉-语言模型和视觉-语言-动作模型在具身决策任务中的表现。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13081 2026-06-04 cs.RO 67%

Agentic AI for Robot Control: Flexible but still Fragile

用于机器人控制的智能体AI:灵活但依然脆弱

Oscar Lima, Marc Vinci, Martin Günther, Marian Renz, Alexander Sung, Sebastian Stock, Johannes Brust, Lennart Niecksch, Zongyao Yi, Felix Igelbrink, Benjamin Kisliuk, Martin Atzmueller, Joachim Hertzberg

机构 * ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) Technical University of Munich(慕尼黑技术大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) German Aerospace Center (DLR)(德国航空航天中心(DLR))

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种基于推理型语言模型的智能体控制系统,通过迭代规划-执行循环选择并调用机器人技能完成任务,在两种物理平台上实验表明系统灵活但存在非确定性行为、指令遵循错误和提示敏感等脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05130 2026-06-04 cs.LG cs.AI 62%

Towards Efficient and Evidence-grounded Mobility Prediction with LLM-Driven Agent

面向高效且基于证据的移动预测:基于LLM驱动的智能体

Linyao Chen, Qinlao Zhao, Zechen Li, Mingming Li, Likun Ni, Jinyu Chen, Yuhao Yao, Xuan Song, Noboru Koshizuka, Hiroki Kobayashi

机构 * The University of Tokyo(东京大学) Huazhong University of Science and Technology(华中科技大学) University of New South Wales, Sydney(新南威尔士大学(悉尼)) LocationMind Inc.(LocationMind公司) Southern University of Science and Technology(南方科技大学) Jilin University(吉林大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种无需训练的LLM驱动智能体框架AgentMob,通过自适应证据收集机制解决移动预测中的模糊情况,在多个数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04661 2026-06-04 cs.CL cs.LG 62%

CRAFT: Cost-aware Refinement And Front-aware Tuning of Prompts

CRAFT: 成本感知的提示精炼与前沿感知的调优

Shanu Kumar, Shubhanshu Khandelwal, Akhila Yesantarao Venkata, Parag Agrawal, Yova Kementchedjhieva, Manish Gupta

机构 * MBZUAI Microsoft(微软)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出CRAFT方法,通过帕累托前沿优化提示的准确性和成本,避免标量化崩溃,在多个基准上实现更广泛的准确-成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04262 2026-06-04 cs.CL cs.AI 62%

Can I Take Another Dose? Evaluating LLM Decision-Making Under Temporal Uncertainty in OTC Dosing QA

我可以再服一剂吗?评估LLM在OTC剂量问答中时间不确定性下的决策能力

Maroof Kousar, Yibo Hu

机构 * Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出DOSEBENCH基准测试,评估大语言模型在非处方药剂量问答中处理时间推理、约束遵循和不确定性的能力。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04246 2026-06-04 cs.AI cs.AR cs.CL 62%

StepPRM-RTL: Stepwise Process-Reward Guided LLM Fine-Tuning for Enhanced RTL Synthesis

StepPRM-RTL:基于逐步过程奖励引导的LLM微调以增强RTL综合

Prashanth Vijayaraghavan, Apoorva Nitsure, Luyao Shi, Ehsan Degan, Vandana Mukherjee

机构 * IBM Research San Jose CA USA(IBM研究院圣何塞加州美国)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出StepPRM-RTL框架,结合逐步轨迹建模、过程奖励模型和检索增强微调,通过密集反馈和蒙特卡洛树搜索探索推理路径,提升LLM生成RTL代码的功能正确性和推理保真度,在基准数据集上相比先前方法提升超10%。

Comments 6 pages, 2 figures, DAC'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04063 2026-06-04 cs.LG cs.AI 62%

LLM Compression with Jointly Optimizing Architectural and Quantization choices

联合优化架构与量化选择的大语言模型压缩

Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi, Phuong Hoai Ha

机构 * UiT The Arctic University of Norway(UiT北莫斯科斯大学) University of Oslo, Norway(奥斯陆大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种可微神经架构搜索框架,联合优化大语言模型的架构配置与混合精度量化,实现更优的精度-延迟权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10891 2026-06-04 cs.LG cs.AI cs.CV cs.RO cs.SY eess.SY 62%

Transformer-Based Autonomous Driving Models and Deployment-Oriented Compression: A Survey

基于Transformer的自动驾驶模型与面向部署的压缩:综述

Juan Zhong, Yuhang Shi, Zukang Xu, Xi Chen

机构 * Renmin University of China(中国人民大学) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院) Department of houmo.ai(houmo.ai部门)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了基于Transformer的自动驾驶模型,并从部署角度分析了压缩与加速策略(如量化、剪枝、知识蒸馏等)如何影响模型设计、部署性、鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01421 2026-06-04 cs.AI cs.CL 62%

SciDER: Scientific Data-centric End-to-end Researcher

SciDER: 以科学数据为中心的端到端研究者

Ke Lin, Owais Aijaz, Yilin Lu, Yiyang Luo, Xuehang Guo, Preslav Nakov

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SciDER多智能体系统,通过数据驱动方法和动态多模态技能系统,自动化科学研究的全生命周期,并在六个基准测试中取得领先结果。

Comments 10 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23841 2026-06-04 cs.CL cs.AI 62%

PoliticsBench: Benchmarking Political Values in Large Language Models with Multi-Turn Roleplay

PoliticsBench: 通过多轮角色扮演基准测试大型语言模型中的政治价值观

Rohan Khetan, Ashna Khetan

机构 * Northville High School, Northville, USA(北维尅高中) Department of Computer Science, Stanford University, Stanford, USA(斯坦福大学计算机科学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出PoliticsBench,一个多阶段角色扮演基准,通过20个演化场景评估LLM的细粒度价值表达,发现场景提示比直接提问能引发更广泛和强烈的价值表达。

Comments 7 pages, 5 tables, 5 figures, 4 appendix pages. Accepted to the ICML 2026 Trustworthy AI for Good Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19921 2026-06-04 cs.CL cs.AI 62%

Demystifying Multi-Agent Debate: The Role of Confidence and Diversity

揭秘多智能体辩论:置信度与多样性的作用

Xiaochen Zhu, Caiqi Zhang, Yizhou Chi, Tom Stafford, Nigel Collier, Andreas Vlachos

机构 * University of Cambridge(剑桥大学) University of Sheffield(谢菲尔德大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多智能体辩论(MAD)在提升大语言模型性能时效果不佳的问题,提出多样性感知初始化和置信度调节辩论协议两种轻量级干预方法,显著提升辩论有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04967 2026-06-04 cs.SE cs.AI 57%

From Prompt to Process: a Process Taxonomy and Comparative Assessment of Frameworks Supporting AI Software Development Agents

从提示到流程:支持AI软件开发智能体的框架流程分类与比较评估

Sanderson Oliveira de Macedo

机构 * Federal Institute of Goias(戈亚斯联邦理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出六维流程分类法,对六个AI软件开发框架进行评分比较,揭示流程深度与可移植性之间的结构性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25649 2026-06-04 cs.LG 57%

Towards interpretable AI with quantum annealing feature selection

迈向可解释的人工智能:基于量子退火的特征选择

Francesco Aldo Venturelli, Emanuele Costa, Sikha O K, Bruno Juliá-Díaz, Miguel A. González Ballester, Alba Cervera-Lierta

机构 * BCN Medtech, Universitat Pompeu Fabra, Barcelona, Spain(BCN医疗科技,庞培法布拉大学,巴塞罗那,西班牙) Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心(BSC)) Departament de Física Quàntica i Astrofísica, Facultat de Física, Universitat de Barcelona(巴塞罗那大学物理量子与天体物理系,物理系) Institut de Ciències del Cosmos, Universitat de Barcelona, ICCUB(巴塞罗那大学宇宙科学研究所,ICCUB) ICREA, Barcelona, Spain(ICREA,巴塞罗那,西班牙)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出一种利用量子退火选择最具代表性特征图的方法,以解释卷积神经网络的图像分类预测,相比GradCAM和GradCAM++提升了类别解缠和解释质量。

Comments Text improvement and extra tests in v2. 15 pages, 10 figures, 1 table, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04248 2026-06-04 cs.RO 50%

RSC: Decentralized Rigid Formation Flocking for Large-Scale Swarms via Hybrid Predictive Control and Online Reconfiguration

RSC:通过混合预测控制与在线重配置实现大规模集群的分散式刚性编队集群

Ganyu Zou, Linhan Wang, Chen Dai, Siji Chen, Chang-Tien Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :planning(abstract)

AI总结 提出一种分散式控制框架RSC,结合有限时域轨迹预测与反应式人工势场安全控制器,并引入在线领航-跟随重配置机制,在25架无人机杂乱环境中实现83%的编队保持、避障与目标跟踪成功率。

Comments 8 pages, 4 figures, two-column format

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20007 2026-06-04 cs.DB 50%

Rosetta Statements: Simplifying FAIR Knowledge Graph Construction with a User-Centered Approach

Rosetta Statements: 以用户为中心简化FAIR知识图谱构建

Lars Vogt, Kheir Eddine Farfar, Pallavi Karanth, Marcel Konrad, Allard Oelen, Manuel Prinz, Philip Stroemert

专题命中 规划推理 :reasoning(abstract)

AI总结 提出Rosetta Statement方法,通过自然语言语句建模和元模型,降低领域专家构建FAIR知识图谱的语义门槛,并在ORKG中实现。

Journal ref Database, Volume 2026, 2026, baag030

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.06172 2026-06-04 eess.SY cs.RO cs.SY 50%

Experimental Resilience Assessment of An Open-Source Driving Agent

开放源代码驾驶代理的实验韧性评估

Abu Hasnat Mohammad Rubaiyat, Yongming Qin, Homa Alemzadeh

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于系统理论过程分析(STPA)的故障注入框架,用于评估开放源代码驾驶代理openpilot在不同环境条件和传感器数据故障下的韧性,通过战略性软件故障注入方法提高不安全场景的覆盖率,从而更有效地模拟安全关键故障并测试自动驾驶车辆。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.06811 2026-06-04 eess.SY cs.SY 50%

Socio-technical Smart Grid Optimization via Decentralized Charge Control of Electric Vehicles

通过电动汽车去中心化充电控制实现社会技术智能电网优化

Evangelos Pournaras, Seoho Jung, Srivatsan Yadhunathan, Huiting Zhang, Xingliang Fang

专题命中 规划推理 :planning(abstract)

AI总结 本文从社会技术角度研究电动汽车充电管理问题,提出一种去中心化参与式学习机制,以提升智能电网的可靠性、舒适度和公平性,通过本地知识生成能量需求计划,减少电力峰值和能源成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.04035 2026-06-04 eess.SY cs.SY 50%

A Simulation Framework for Fast Design Space Exploration of Unmanned Air System Traffic Management Policies

一种用于无人机系统交通管理政策快速设计空间探索的仿真框架

Ziyi Zhao, Chen Luo, Jin Zhao, Qinru Qiu, M. Cenk Gursoy, Carlos Caicedo, Franco Basti

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种多智能体空气交通和资源使用仿真框架,用于快速评估不同的空交通管理政策及其与环境和交通模式的关系,同时为智能城市建设中的资源分配和发射站点选址提供工具。

Comments The Integrated Communications Navigation and Surveillance (ICNS) Conference in 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.03819 2026-06-04 eess.SY cs.MA cs.RO cs.SY 50%

Cooperative control of multi-agent systems to locate source of an odor

多智能体系统协作控制以定位气味源

Abhinav Sinha, Rishemjit Kaur, Ritesh Kumar, Amol P. Bhondekar

专题命中 规划推理 :planning(abstract)

AI总结 本文提出分层协作控制方法,通过多智能体系统定位气味源,结合粒子群算法和滑模控制器实现决策与控制层的协同,验证了分层分布式控制的有效性。

Comments 8 pages, initial results on our work

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.05264 2026-06-04 cs.MA cs.RO cs.SY eess.SY 50%

Asynchronous and Dynamic Coverage Control Scheme for Persistent Surveillance Missions

异步和动态覆盖控制方案用于持续监视任务

Jeffrey R. Peters, Sean J. Wang, Amit Surana, Francesco Bullo

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种基于分解的多智能体持续监视任务覆盖控制方案,通过模块化框架解耦高层任务分配与低层运动规划,利用中央基站管理覆盖分配和监视参数,并通过非计划和异步交换传输至移动代理,实现负载平衡和有效路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.05297 2026-06-04 eess.SY cs.SY 50%

Decentralized Abstractions For Multi-Agent Systems Under Coupled Constraints

去中心化抽象用于受耦合约束的多智能体系统

Dimitris Boskos, Dimos V. Dimarogonas

专题命中 规划推理 :planning(abstract)

AI总结 本文提出去中心化框架,通过有限或可数转移系统抽象多智能体系统动态,利用反馈律和自由输入满足系统与网络要求,并设计参数实现多过渡与路径规划。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.07761 2026-06-04 eess.SY cs.MA cs.SY 50%

Designing Distributed Fixed-Time Consensus Protocols for Linear Multi-Agent Systems Over Directed Graphs

设计用于有向图上的线性多智能体系统的分布式固定时间一致性协议

Yu Zhao, Yongfang Liu, Guanrong Chen

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种基于运动规划方法的分布式固定时间一致性算法,解决了线性多智能体系统在有向图上的固定时间一致性问题,并首次实现了该问题的通用解。

详情

展开后加载摘要…

URL PDF HTML 收藏
1503.06133 2026-06-04 eess.SY cs.SY math.OC 50%

An Optimal Control Approach for the Data Harvesting Problem

数据采集问题的最优控制方法

Yasaman Khazaeni, Christos G. Cassandras

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种基于最优控制的方法,用于在二维任务空间中规划轨迹,以最小化预期延迟。通过参数化智能体轨迹并利用微扰分析优化,解决了数据采集和传输问题,展示了方法的鲁棒性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1403.3434 2026-06-04 eess.SY cs.SY math.OC 50%

A New Event-Driven Cooperative Receding Horizon Controller for Multi-agent Systems in Uncertain Environments

多智能体系统在不确定环境中的一种新型事件驱动协作递推控制器

Yasaman Khazaeni, Christos G. Cassandras

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种事件驱动的协作递推控制器,用于解决多智能体在不确定环境中最大化收集奖励的问题,通过减少可行控制集维度提升性能。

Comments One results subsection added. Some typos corrected

详情

展开后加载摘要…

URL PDF HTML 收藏