arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-09 至 2026-04-09 共收录 102 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2604.06268 2026-04-09 cs.LG 85%

RAGEN-2: Reasoning Collapse in Agentic RL

RAGEN-2:代理强化学习中的推理崩溃

Zihan Wang, Chi Gui, Xing Jin, Qineng Wang, Licheng Liu, Kangrui Wang, Shiqi Chen, Linjie Li, Zhengyuan Yang, Pingyue Zhang, Yiping Lu, Jiajun Wu, Li Fei-Fei, Lijuan Wang, Yejin Choi, Manling Li

机构 * Northwestern University(西北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Independent(独立研究者) Imperial College London(伦敦帝国学院) Oxford University(牛津大学) University of Washington(华盛顿大学) Microsoft(微软) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 研究发现代理强化学习中推理稳定性受模板崩溃影响,通过引入互信息代理提升推理质量与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06636 2026-04-09 cs.LG cs.AI cs.CL 85%

SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning

SHAPE:基于潜在估计的阶段感知分层优势用于大语言模型推理

Zhengyang Ai, Zikang Shan, Xiaodong Ai, Jingxian Tang, Hangkai Hu, Pinyan Lu

机构 * Huawei Taylor Lab(华为泰勒实验室) Center for Data Science, Peking University(北京大学数据科学中心) Shanghai University of Finance and Economics(上海财经大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SHAPE通过潜在估计引入分层信用分配机制,提升大语言模型推理的效率与准确性,实验显示在数学推理任务中平均准确率提升3%,token消耗减少30%。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06695 2026-04-09 cs.AI 79%

Reasoning Fails Where Step Flow Breaks

推理在步骤流断裂处失效

Xiaoyu Xu, Yulan Pan, Xiaosong Yuan, Zhihong Shen, Minghao Su, Yuanhao Su, Xiaofeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fuzhou University(福州大学) Jilin University(吉林大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究提出StepFlow方法,通过修复信息流提升多步骤数学、科学和编码任务的推理准确性,揭示了浅层锁定和深层衰减两种信息流失效模式。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06298 2026-04-09 cs.LG 70%

Limits of Difficulty Scaling: Hard Samples Yield Diminishing Returns in GRPO-Tuned SLMs

难度扩展的极限:在GRPO调优的SLMs中困难样本产生递减回报

Suraj Yadav, Siddharth Yadav, Parth Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文研究了在资源受限条件下,GRPO与LoRA应用于SLMs进行数学推理时,难度增加对准确率的影响,发现高难度样本的提升效果递减。

Comments Accepted at ICLR Workshop 2026 ICBINB

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18018 2026-04-09 cs.AI cs.LG 62%

Lost in Cultural Translation: Do LLMs Struggle with Math Across Cultural Contexts?

文化翻译中迷失:大语言模型在不同文化背景下进行数学推理的能力如何?

Aabid Karim, Abdul Karim, Bhoomika Lohana, Matt Keon, Jaswinder Singh, Abdul Sattar

机构 * mV Research Lab(55mV研究实验室) Microsoft(微软) Millcrest Technology(Millcrest科技) Griffith University(格里菲斯大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型在不同文化背景下处理数学问题时存在性能下降,文化适应影响推理模式,需更多多样化的训练数据以提升全球适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03647 2026-04-09 cs.CV cs.AI 57%

Stabilizing Unsupervised Self-Evolution of MLLMs via Continuous Softened Retracing reSampling

通过连续软化回溯重采样稳定多模态大语言模型的无监督自进化

Yunyao Yu, Zhengxian Wu, Zhuohong Chen, Hangrui Xu, Zirui Liao, Xiangwen Deng, Zhifang Liu, Senyuan Shi, Haoqian Wang

机构 * Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) University of Arizona(亚利桑那大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CSRS方法,通过回溯推理机制和软化频率奖励提升多模态大语言模型的无监督自进化稳定性,实验显示在MathVision等基准上表现优异。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2604.06401 2026-04-09 cs.AI cs.CE cs.CV cs.LG 76%

ProofSketcher: Hybrid LLM + Lightweight Proof Checker for Reliable Math/Logic Reasoning

ProofSketcher: 混合LLM + 轻量级证明检查器用于可靠的数学/逻辑推理

Kranthi Kommuru, Kunal Khanvilkar, Gaurav Parekh

机构 * Amazon Web Services, Inc(亚马逊云科技)

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出混合方法,结合LLM生成类型化证明草图与轻量级可信内核,以提升数学逻辑推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03926 2026-04-09 cs.AI cs.CY cs.HC cs.MA 57%

CODE-GEN: A Human-in-the-Loop RAG-Based Agentic AI System for Multiple-Choice Question Generation

CODE-GEN:一种基于检索增强生成的多选题生成人机协作人工智能系统

Xiaojing Duan, Frederick Nwanganga, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 CODE-GEN通过生成与课程目标一致的多选题提升学生代码推理能力,采用生成器和验证器代理,结合专用工具提高准确性,评估结果显示系统在七个教学维度上表现优异,但人类专家仍需参与设计教学性干扰项和反馈质量。

Comments Full version of the paper accepted as a short paper at the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 7 篇

2604.06799 2026-04-09 cs.CL cs.CY 79%

Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions

超越准确性:在九个复杂性维度上诊断大语言模型的代数推理失败

Parth Patil, Dhruv Kumar, Yash Sinha, Murari Mandal

机构 * Department of Computer Science & Information Systems BITS Pilani(比拉理工学院皮拉尼校区计算机科学与信息系统系) School of Computer Engineering, KIIT Bhubaneshwar(KIIT布巴内斯瓦尔分校计算机工程学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一个九维代数复杂性框架,通过独立调整每个复杂性因素来诊断大语言模型的代数推理失败,发现工作内存是主要瓶颈,识别出五个关键维度以全面评估模型能力。

Comments Under Review as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12088 2026-04-09 cs.AI cs.CL cs.LG 67%

One Life to Learn: Inferring Symbolic World Models for Stochastic Environments from Unguided Exploration

一次生命学习:从无指导探索中推断随机环境的符号世界模型

Zaid Khan, Archiki Prasad, Elias Stengel-Eskin, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Allen Institute for AI(艾伦人工智能研究所) Johns Hopkins University(约翰霍普金斯大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OneLife框架,通过条件激活的程序法则在概率编程框架中推断随机环境的动态,实现从无指导探索中学习复杂环境的动力学,优于基线方法。

Comments Accepted to ICLR 2026. Project page: https://onelife-worldmodel.github.io/; 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07007 2026-04-09 cs.MA cs.AI cs.CY 57%

AgentCity: Constitutional Governance for Autonomous Agent Economies via Separation of Power

AgentCity:通过权力分离实现自主代理经济的宪法治理

Anbang Ruan, Xing Zhang

机构 * NetX Foundation(NetX 基金会)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出通过权力分离模型,在区块链上实现自主代理经济的宪法治理,通过智能合约、确定性软件和人类裁决三者分离,解决代理社会逻辑垄断问题,实现人类意图与集体行为的对齐。

Comments 111 pages, 11 figures, 19 tables, 67 references. Pre-registered experimental design

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06633 2026-04-09 cs.CR cs.CL cs.SE 57%

Argus: Reorchestrating Static Analysis via a Multi-Agent Ensemble for Full-Chain Security Vulnerability Detection

Argus:通过多智能体集合重新编排静态分析以实现全链路安全漏洞检测

Zi Liang, Qipeng Xie, Jun He, Bohuan Xue, Weizheng Wang, Yuandao Cai, Fei Luo, Boxian Zhang, Haibo Hu, Kaishun Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST(香港科技大学) SF Express(顺丰速运) Great Bay University(大湾区大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 Argus通过多智能体框架提升静态分析效率,结合RAG和ReAct技术减少漏洞误报,发现更多真实漏洞并降低运营成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06629 2026-04-09 cs.MA cs.AI cs.RO 57%

Logical Robots: Declarative Multi-Agent Programming in Logica

逻辑机器人:逻辑编程中的多智能体编程

Evgeny Skvortsov, Yilin Xia, Ojaswa Garg, Shawn Bowers, Bertram Ludäscher

机构 * Google LLC(谷歌公司) University of Illinois(伊利诺伊大学) Gonzaga University(贡扎加大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 Logical Robots通过逻辑编程语言Logica实现多智能体仿真平台,将观察映射到动作输出,实现低层反应控制与高层规划的结合。

Comments International Conference on Autonomous Agents and Multiagent Systems (AAMAS), May 25-29, 2026. Paphos, Cyprus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06722 2026-04-09 cs.CY cs.RO 50%

Infrastructure First: Enabling Embodied AI for Science in the Global South

基础设施优先:为全球南方科学赋能具身AI

Shaoshan Liu, Jie Tang, Marwa S. Hassan, Mohamed H. Sharkawy, Moustafa M. G. Fouda, Tiewei Shang, Zixin Wang

机构 * Shenzhen Institute of Artificial Intelligence and Robotics for Society (AIRS)(深圳市人工智能与机器人研究院(AIRS)) South China University of Technology(华南理工大学) National Research Centre (NRC)(国家研究中心(NRC)) British University in Egypt (BUE)(埃及英国大学(BUE)) National Institute of Clean-and-Low-Carbon Energy(国家清洁低碳能源研究所)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文探讨了通过具身AI赋能科学的基础设施优先方法,强调在人力、电力和网络受限的全球南方地区,通过可靠边缘计算、能效硬件和开放标准等基础设施提升科学能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06506 2026-04-09 cs.CR cs.SE 50%

Guiding Symbolic Execution with Static Analysis and LLMs for Vulnerability Discovery

通过静态分析和LLMs引导符号执行以发现漏洞

Md Shafiuzzaman, Achintya Desai, Wenbo Guo, Tevfik Bultan

专题命中 逻辑推理 :reasoning(abstract)

AI总结 SAILOR结合静态分析与LLM合成自动构建符号执行Harness,通过三个阶段发现内存安全漏洞,实验表明其在大规模代码库中显著提升漏洞检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 22 篇

2604.06427 2026-04-09 cs.LG cs.AI cs.CL 88%

The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning

深度上限:大语言模型在发现潜在规划中的局限性

Yi Xu, Philipp Jettkant, Laura Ruis

机构 * University of Cambridge(剑桥大学) Imperial College London(帝国理工学院) MIT(麻省理工学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究探讨了大语言模型在无监督情况下发现多步规划策略的极限,发现模型在单次前向传递中能执行最多七步潜在规划,揭示了训练与测试时能力的差异。

Comments 10 pages, 3 figures, 1 table (30 pages, 9 figures, 10 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08409 2026-04-09 cs.AI 88%

Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs

多模态大语言模型中的忠实优先推理、规划与行动

Junxian Li, Xinyue Xu, Sai Ma, Di Zhang, Sichao Li

机构 * Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学) The Australian National University(澳大利亚国立大学) Fudan University(复旦大学) University of Sydney(悉尼大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 本文提出Faithful-First RPA框架,通过逐步监督提升多模态推理的忠实度,实验表明其在多个基准上提升了24%的感知忠实度,且不降低任务准确性。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29908 2026-04-09 cs.AI 83%

C-TRAIL: A Commonsense World Framework for Trajectory Planning in Autonomous Driving

C-TRAIL:用于自动驾驶轨迹规划的常识世界框架

Zhihong Cui, Haoran Tang, Tianyi Li, Yushuai Li, Peiyuan Guan, Amir Taherkordi, Tor Skeie

机构 * University of Oslo(奥斯陆大学) Hong Kong Polytechnic University(香港理工大学) Aalborg University(奥尔堡大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出C-TRAIL框架,结合常识世界与信任机制,通过Recall-Plan-Update循环提升自动驾驶轨迹规划的可靠性,实验表明其在ADE、FDE和SR指标上均优于现有方法。

Journal ref IEEE Transactions on Vehicular Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14063 2026-04-09 cs.RO 82%

Adaptive Obstacle-Aware Task Assignment and Planning for Heterogeneous Robot Teaming

自适应障碍感知异构机器人协同的任务分配与规划

Nan Li, Jiming Ren, Haris Miller, Samuel Coogan, Karen M. Feigh, Ye Zhao

机构 * Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(佐治亚理工学院机器人与智能机器研究所) Lockheed Martin Corporation(洛克希德·马丁公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出OATH框架,通过自适应Halton序列地图和集群拍卖选择机制,提升异构机器人在障碍密集环境中的任务分配效率与适应性,结合LLM实现实时指令解读。

Comments 24 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07345 2026-04-09 eess.SY cs.DC cs.LG cs.SY 79%

Measurement of Generative AI Workload Power Profiles for Whole-Facility Data Center Infrastructure Planning

面向全设施数据中心基础设施规划的生成式AI工作负载功率谱测量

Roberto Vercellino, Jared Willard, Gustavo Campos, Weslley da Silva Pereira, Olivia Hull, Matthew Selensky, Juliane Mueller

机构 * National Laboratory of the Rockies (NLR)(落基山国家实验室(NLR))

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 本文通过高精度测量生成式AI工作负载的功率消耗,结合MLCommons和vLLM基准,建立全设施能效模型,为电网接入、本地能源生成和微电网规划提供数据支持。

Comments The data associated with this publication can be found at http://doi.org/10.7799/3025227

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07148 2026-04-09 cs.LG 79%

Multi-Turn Reasoning LLMs for Task Offloading in Mobile Edge Computing

面向移动边缘计算的任务卸载的多轮推理LLM

Ning Yang, Chuangxin Cheng, Haijun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Machano-Electronic Engineering, Xidian University(西安电子科技大学机电工程学院) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出COMLLM框架,通过整合GRPO与LACS机制,实现移动边缘计算中的前瞻性决策,提升任务卸载效率与负载均衡公平性,支持零样本拓扑扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06882 2026-04-09 cs.RO cs.SY eess.SP eess.SY 78%

Telecom World Models: Unifying Digital Twins, Foundation Models, and Predictive Planning for 6G

电信世界模型:统一数字孪生、基础模型和预测规划用于6G

Hang Zou, Yuzhi Yang, Lina Bariah, Yu Tian, Yuhuan Lu, Bohao Wang, Anis Bara, Brahim Mefgouda, Hao Liu, Yiwei Tao, Sergy Petrov, Salma Cheour, Nassim Sehad, Sumudu Samarakoon, Chongwen Huang, Samson Lasaulce, Mehdi Bennis, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(哈利法大学数字未来研究所) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) University of Oulu(奥卢大学) Aalto University(阿尔托大学) Université de Lorraine, CNRS, CRAN(洛林大学,法国国家科学研究中心,CRAN)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出电信世界模型(TWM),结合数字孪生与基础模型,解决6G网络中动态建模、不确定性处理和多层控制规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06598 2026-04-09 cs.RO cs.SY eess.SY 78%

Train-Small Deploy-Large: Leveraging Diffusion-Based Multi-Robot Planning

训练小型部署大型:利用基于扩散的多机器人规划

Siddharth Singh, Soumee Guha, Qing Chang, Scott Acton

机构 * University of Virginia(弗吉尼亚大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于扩散模型的多机器人路径规划方法,通过训练少量代理并有效扩展到更多代理,解决动态变化中的规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18841 2026-04-09 cs.CL cs.AI cs.LG 75%

LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning

LongWriter-Zero: 通过强化学习掌握超长文本生成

Yuhao Wu, Yushi Bai, Zhiqiang Hu, Roy Ka-Wei Lee, Juanzi Li

机构 * Singapore University of Technology and Design, Singapore(新加坡科技设计大学) Tsinghua University, Beijing, China(清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于激励的方法,无需标注或合成数据,通过强化学习使LLM生成超长高质量文本,实验表明其在长文本任务中优于传统SFT方法,达到WritingBench和Arena-Write的最优效果。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06260 2026-04-09 cs.LG cs.AI 73%

$S^3$: Stratified Scaling Search for Test-Time in Diffusion Language Models

$S^3$:分层缩放搜索用于扩散语言模型的测试时间

Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Asad Aali, Muhammad Usman Khanzada, Muhammad Usman Rafique, Zihao He, Emily Fox, Dean F. Hougen

机构 * University of Oklahoma(俄克拉荷马大学) Stanford University(斯坦福大学) University of Göttingen(哥廷根大学) Zoox Meta

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出$S^3$方法,通过在去噪过程中重新分配计算资源提升生成质量,实验证明其在数学推理任务中表现最佳。

Comments Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06177 2026-04-09 cs.IR cs.AI cs.CL 73%

WebExpert: domain-aware web agents with critic-guided expert experience for high-precision search

WebExpert: 基于领域感知的网页代理:通过批评者引导的专家经验实现高精度搜索

Yuelin Hu, Zhengxue Cheng, Ronghua Wu, Qunshan Gu, Hongwei Hu, Wei Liu, Qiao Liang, Li Song

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 WebExpert通过领域感知的网页代理,结合批评者引导的专家经验,提升搜索精度,其核心方法包括句子级经验检索、结构化轻量级领域诱导及偏好优化规划,有效提升了答案准确率。

Comments accepted by icassp2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10512 2026-04-09 cs.AI cs.LG cs.NE 73%

Resource-constrained Amazons chess decision framework integrating large language models and graph attention

资源受限的亚马逊国际象棋决策框架整合大语言模型和图注意力

Tianhao Qian, Zhuoxuan Li, Jinde Cao, Xinli Shi, Leszek Rutkowski

机构 * School of Mathematics, Southeast University(东南大学数学学院) Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) Institute of Computer Science, AGH University of Krakow(AGH科技大学计算机科学研究所) SAN University(SAN大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种轻量级混合框架,结合图注意力学习和大语言模型生成能力,提升亚马逊国际象棋决策准确性,实验显示在资源受限条件下实现显著性能提升。

Comments 20 pages, 15 figures. Supported by the National Key Research and Development Project of China (No. 2020YFA0714300), NSFC (No. 61833005, 12061088), the Open Project of Key Laboratory of Transport Industry of Comprehensive Transportation Theory (Nanjing Modern Multimodal Transportation Laboratory) (MTF2023004), and the China Postdoctoral Science Foundation (2024T170129, GZC20240261)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18258 2026-04-09 cs.MA cs.AI cs.LG 73%

Hybrid Agentic AI and Multi-Agent Systems in Smart Manufacturing

智能制造中混合代理AI与多代理系统

Mojtaba A. Farahani, Md Irfan Khan, Thorsten Wuest

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合代理AI与多代理框架,用于预测性维护,结合LLM代理的战略协调与规则代理的高效任务处理,通过分层架构实现动态模型适应与可解释决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05529 2026-04-09 cs.AI cs.RO 70%

Before We Trust Them: Decision-Making Failures in Navigation of Foundation Models

在我们信任之前:基础模型导航决策中的失败

Jua Han, Jaeyoon Seo, Jungbin Min, Sieun Choi, Huichan Seo, Jihie Kim, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究发现基础模型在导航任务中存在显著决策失败,需更细致评估以理解其局限性。

Comments Corrected author order in metadata; manuscript changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16150 2026-04-09 cs.AI cs.HC cs.SY eess.SY 70%

A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions

用于计算机的代理全面综述:基础、挑战与未来方向

Pascal J. Sager, Benjamin Meyer, Peng Yan, Rebekka von Wartburg-Kottler, Layan Etaiwi, Aref Enayati, Gabriel Nobel, Ahmed Abdulkadir, Benjamin F. Grewe, Thilo Stadelmann

机构 * Zurich University of Applied Sciences(苏黎世应用科技大学) University of Zurich(苏黎世大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) University of Fribourg(弗里堡大学) European Centre for Living Technology(欧洲生活技术中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了用于计算机的代理(ACUs)的发展现状、趋势及研究空白,提出统一的分类体系,分析了六个主要研究缺口,并提出改进方向。

Journal ref Journal of Artificial Intelligence Research, vol. 85, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏