arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-21 至 2026-05-21 共收录 115 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2505.19075 2026-05-21 cs.AI cs.CL cs.LG 75%

Universal Reasoner: A Single, Composable Plug-and-Play Reasoner for Frozen LLMs

Universal Reasoner: 一个单一、可组合的即插即用推理器用于冻结的LLM

Jaemin Kim, Hangeol Chang, Hyunmin Hwang, Choonghan Kim, Jong Chul Ye

机构 * Graduate School of Artificial Intelligence, Korea Advanced Institute of Science and Technology(人工智能研究生院,韩国科学技术院)

专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Universal Reasoner,一种可组合且即插即用的推理模块,能够在冻结的大规模语言模型上提供专门的推理能力,通过共享或对齐的token空间实现弱到强的泛化,实验表明其在数学推理和机器翻译中优于现有微调方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08819 2026-05-21 cs.LG cs.CL 73%

Bayesian Preference Learning for Test-Time Steerable Reward Models

基于测试时间可调节的贝叶斯偏好学习的奖励模型

Jiwoo Hong, Shao Tang, Zhipeng Wang

机构 * LinkedIn Corporation(LinkedIn公司) Nubank

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种新的贝叶斯奖励建模目标,即变分上下文奖励建模(ICRM),通过上下文偏好演示实现测试时间可调节性,从而适应未见过的偏好分布,提高了奖励模型的准确性和鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20369 2026-05-21 cs.CL cs.AI cs.LG 67%

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

DEL:用于大语言模型数值学习的数字熵损失

Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Digit Entropy Loss (DEL)用于大语言模型的自回归数值学习,通过重新设计传统无监督熵优化,引入数字条件概率和二元交叉熵,使熵优化转向监督方式,同时推广整数基于的数值学习到浮点数优化,从而提升数值预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21468 2026-05-21 cs.LG cs.CL 62%

You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

你只需要最小的RLVR训练:通过秩-1轨迹来扩展LLMs

Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Chengsong Huang, Jiaxin Huang, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过秩-1轨迹扩展LLMs的方法,发现RLVR参数轨迹具有极低的秩和高度可预测性,并提出RELEX方法,通过简单的线性回归在无需训练模型的情况下实现高效的超量扩展。

Comments preprint. Code: https://github.com/weizhepei/RELEX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21467 2026-05-21 cs.LG cs.CL 62%

DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards

DelTA: 一种用于可验证奖励强化学习的判别性token信用分配

Kaiyi Zhang, Wei Wu, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) Ant International(蚂蚁国际)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DelTA方法,通过估计token系数来增强特定侧的token梯度方向,从而改进可验证奖励强化学习中的token概率更新,提升了模型在数学基准测试中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21266 2026-05-21 cs.LG cs.AI 62%

How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR

在线强化学习需要多少?用于RLVR中离线偏好优化的信息性回放

Richa Verma, Balaraman Ravindran

机构 * TCS Research Department of CSE(TCS计算机科学系研究部) IIT Madras(印度理工学院马德拉斯分校) Department of Data Science & AI(数据科学与人工智能系) Wadhwani School of Data Science & AI(Wadhwani数据科学与人工智能学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出G2D方法,通过短时GRPO预热、构建静态偏好数据集和离线DPO微调,以较低的计算成本实现优于GRPO的性能,强调偏好数据信息性而非数量的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20994 2026-05-21 cs.CL cs.AI 62%

Towards Context-Invariant Safety Alignment for Large Language Models

面向大语言模型的上下文不变安全对齐

Yixu Wang, Yang Yao, Xin Wang, Yifeng Gao, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种上下文不变的安全对齐方法,通过引入锚点不变正则化(AIR)来提升模型在不同上下文中的鲁棒性,从而增强安全约束对对抗性框架的抵抗力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20722 2026-05-21 cs.LG cs.AI 62%

AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback

AGPO: 基于双统计反馈的自适应群体策略优化

Miaobo Hu, Shuhao Hu, Bokun Wang, Ruohan Wang, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AGPO,一种无 critic 的 GRPO 改进方法,通过群体层面的统计信息控制更新幅度和探索。在九个英语和中文数学/STEM 基准上,Qwen2.5-14B 在相同生成 token 预算下优于 PPO/GRPO,达到 GSM8K 67.3% 和 MATH 40.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06824 2026-05-21 cs.LG 57%

Efficient numeracy in language models through single-token number embeddings

通过单token数字嵌入提升语言模型的数值处理效率

Linus Kreitner, Paul Hager, Jonathan Mengedoht, Georgios Kaissis, Daniel Rueckert, Martin J. Menten

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital, Munich, Germany(人工智能在医疗和医学中的Chair,慕尼黑技术大学(TUM)和慕尼黑技术大学医院,德国慕尼黑) Department of Computing, Imperial College London, UK(计算系,伦敦帝国学院,英国) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑) Hasso Plattner Institute for Digital Engineering, University of Potsdam, Germany(哈索·platzer研究所数字工程学院,波茨坦大学,德国)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出BitTokens,一种利用IEEE 754二进制浮点表示将数字编码为单token的方法,使语言模型能更高效地处理数值计算,从而提升其解决复杂问题的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2605.20242 2026-05-21 cs.LG cond-mat.mtrl-sci cs.AI physics.chem-ph 62%

LEAP: A closed-loop framework for perovskite precursor additive discovery

LEAP:一种用于钙钛矿前驱体添加剂发现的闭环框架

Xin-De Wang, Zhi-Rui Chen, Ze-Feng Gao, Peng-Jie Guo, Cheng Mu, Zhong-Yi Lu

机构 * School of Physics, Renmin University of China(中国人民大学物理学院) School of Chemistry and Life Resource, Renmin University of China(中国人民大学化学与生命资源学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出LEAP框架,结合大语言模型和主动学习,通过文献驱动的机制相关描述符和贝叶斯优化,实现了钙钛矿太阳能电池添加剂的高效发现,实验验证显示其在性能提升方面优于通用模型。

Comments 30 pages; 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21180 2026-05-21 cs.LG cs.SE 57%

Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

用于密集奖励的领域可适应强化学习代码生成

Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand, Mert Tiftikci, Mira Mezini

机构 * Hessian Center for Artificial Intelligence (hessian.AI)(海斯曼人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 代码与定理证明 :planning(abstract);分类 cs.LG

AI总结 本研究提出了一种领域可适应的强化学习框架,用于改进代码生成的正确性、质量和安全性,通过定制化的执行感知奖励公式和令牌级奖励映射机制,提高了代码生成在不同领域中的适应性和执行效率。

Comments 10 pages, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20584 2026-05-21 cs.CV 50%

QwenSafe: Multimodal Content Rating Description Identification via Preference-Aligned VLMs

QwenSafe: 通过偏好对齐的视觉语言模型实现多模态内容评级描述识别

Dishanika Denipitiyage, Aruna Seneviratne, Suranga Seneviratne

机构 * University of Sydney(悉尼大学) University of New South Wales(新南威尔士大学)

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出QwenSafe,一种通过联合推理应用元数据和截图来自动识别苹果定义的内容评级描述(CRDs)的视觉语言模型,通过引入metadata2CRD数据构建管道和直接偏好优化(DPO)提升模型预测准确性,实验结果显示QwenSafe在二元CRD分类中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 7 篇

2604.11661 2026-05-21 cs.LG cs.AI 86%

Towards Autonomous Mechanistic Reasoning in Virtual Cells

向虚拟细胞中的自主机理推理迈进

Yunhui Jang, Lu Zhu, Jake Fawkes, Alisandra Kaye Denton, Dominique Beaini, Emmanuel Noutahi

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Valence Labs(Valence实验室) University College London(伦敦大学学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结构化解释形式化方法,用于虚拟细胞中的生物推理,通过机理动作图实现系统验证和反驳,并引入VCR-Agent多智能体框架,结合生物基础知识检索和基于验证器的过滤方法,生成并验证机理推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21299 2026-05-21 cs.CL cs.AI 84%

Tracing the ongoing emergence of human-like reasoning in Large Language Models

追踪大型语言模型中类人推理的持续涌现

Paolo Morosi, Nikoleta Pantelidou, Fritz Günther, Elena Pagliarini, Evelina Leivada

机构 * Departament de Filologia Catalana, Universitat Autònoma de Barcelona(加泰罗尼亚语言系系,巴塞罗那自治大学) Institut für Psychologie, Humboldt-Universitat zu Berlin(柏林洪堡大学心理学研究所) Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究与高级教育研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型在条件推理任务中是否具备类人推理能力,发现人类通过语用推理丰富逻辑推理,而模型行为更不稳定,部分模型遵循条件语义但忽视语用推理,表明LLMs在语义准确性上表现良好,但缺乏人类推理中的语用丰富性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20946 2026-05-21 cs.CL 83%

Thinking-while-speaking: A Controlled, Interleaved Reasoning Method for Real-Time Speech Generation

思考-言语:一种受控交错推理方法用于实时语音生成

Xuan Du, Qiangyu Yan, Wenshuo Li, Borui Jiang, Changming Xiao, Han Shu, Xinghao Chen

机构 * Huawei Technologies(华为技术)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出了一种受控交错推理方法InterRS,用于实时语音生成,通过在自然语音生成过程中插入推理步骤,提高了语音流畅性和推理深度,实验表明其在数学和逻辑基准测试中表现更优,并生成更自然流畅的答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20743 2026-05-21 cs.CV cs.CL 79%

Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction

Draw2Think: 通过约束引擎交互增强几何推理

Juncheng Hu, Jiawei Du, Xin Zhang, Joey Tianyi Zhou

机构 * National University of Singapore(新加坡国立大学) Centre for Frontier AI Research, Agency for Science, Technology and Research(科技研究局前沿人工智能研究中心) Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 Draw2Think通过与GeoGebra约束引擎交互,将几何推理从潜在空间推断转换为与约束引擎的代理交互,从而提高几何推理的准确性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20189 2026-05-21 cs.AI cs.LG 73%

SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation

SOLAR:一种自优化的开放式自主代理,用于终身学习和持续适应

Nitin Vetcha, Dianbo Liu

机构 * Department of Ophthalmology, Yong Loo Lin School of Medicine, National University of Singapore, Singapore(眼科学系,Yong Loo Lin医学院,新加坡国立大学,新加坡) Department of Computational and Data Sciences, Indian Institute of Science, Bangalore, Karnataka, India(计算与数据科学系,印度科学研究院,班加罗尔,卡纳塔克邦,印度)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SOLAR,一种自优化的开放式自主代理,通过参数级元学习实现自我改进,解决了动态真实世界中概念漂移和梯度基适应成本高的问题,展示了在常识、数学、医学、编程、社交和逻辑推理任务上的优越性能。

Comments Accepted at "Association for the Advancement of Artificial Intelligence 2026 Conference" in Streaming Continual Learning Bridge. Published in CEUR Workshop Proceedings (Original version at https://ceur-ws.org/Vol-4183/paper2.pdf)

Journal ref CEUR Workshop Proceedings, Vol. 4183, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21082 2026-05-21 cs.AI 57%

AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions

AutoRPA: 通过基于LLM的代码合成实现高效的GUI自动化

Minghao Chen, Xinyi Hu, Zhou Yu, Yufei Yin

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission(浙江空间信息感知与传输重点实验室) School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoRPA框架,通过将ReAct风格代理的决策逻辑自动转化为鲁棒的RPA功能,提高GUI自动化效率和可重用性,同时减少82%到96%的token使用量。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10568 2026-05-21 cs.LO cs.SE 50%

Correct-by-Construction G-Code Generation: A Neuro-Symbolic Approach via Separation Logic

通过分离逻辑的正确性构建G代码生成:一种神经符号方法

Yeonseok Lee

专题命中 逻辑推理 :self-correction(abstract)

AI总结 本文提出了一种神经符号框架,通过分离逻辑证明器将GLLM方法的神经生成能力与形式验证相结合,利用几何数据构建两组件架构,将物理碰撞转化为逻辑空间数据 race,从而生成自我校正的G代码生成系统,减少人工监督,提高自主制造的安全性和验证性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 18 篇

2601.23086 2026-05-21 cs.AI 91%

Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks

从输出监督学习的链式思维混淆可以泛化到未见过的任务

Nathaniel Mitrani Hadida, Sassan Bhanji, Cameron Tice, Puria Radmard

机构 * University of Cambridge(剑桥大学) Geodesic Research

专题命中 规划推理 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract);planning(abstract)

AI总结 本文研究了链式思维(CoT)推理中混淆现象的泛化能力,发现模型在学习混淆推理轨迹时,能够将这种混淆行为及其在未见过的任务中表现出来,从而影响模型的可监控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20195 2026-05-21 cs.CL cs.AI cs.LG 82%

Pseudo-Siamese Network for Planning in Target-Oriented Proactive Dialogues

面向目标的主动对话中规划的伪孪生网络

Xinyue Kang, Maodong Li, Yibin Zheng, Fang Kong

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种面向目标的主动对话规划方法,通过FF-BPSN网络实现对话路径规划,提升目标导向型主动对话系统的有效性。

Comments ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21406 2026-05-21 cs.RO 78%

MC-Risk: Multi-Component Risk Fields for Risk Identification and Motion Planning

MC-Risk:多组件风险场用于风险识别和运动规划

Maximilian Link, Yingjie Xu, Yingbai Hu, Yinlong Liu

机构 * Technical University of Munich(慕尼黑技术大学) The Chinese University of Hong Kong(香港中文大学) City University of Macau(澳门城市大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出MC-Risk,一种与规划器对齐的多组件风险场,用于早期、校准且类别感知的风险定位。该方法通过线性组合三个可解释模块,包括电机代理场、VRU风险场和道路惩罚场,并在RiskBench碰撞子集上进行了首次标准化定量评估,展示了最佳的风险定位和最早危险指示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20874 2026-05-21 cs.AI cs.SE 70%

Governance by Construction for Generalist Agents

为通用智能体构建的治理机制

Segev Shlomov, Iftach Shoham, Alon Oved, Ido Levy, Sami Marreed, Harold Ship, Offer Akrabi, Sergey Zeltyn, Avi Yaeli, Nir Mashkif

机构 * IBM

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种模块化的政策-as-code层,用于在不微调模型的情况下,通过与通用大语言模型智能体结合,实现可预测、可审计且符合合规要求的行为,在复合工作流中无需为每个领域重新构建智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16962 2026-05-21 cs.CV cs.AI 70%

OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics

OmniVL-Guard Pro: 一个增强工具的代理用于综合视觉-语言防伪

Jinjie Shen, Zheng Huang, Yuchen Zhang, Yujiao Wu, Yaxiong Wang, Lechao Cheng, Shengeng Tang, Tianrui Hui, Nan Pu, Zhun Zhong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) Wuhan University, Wuhan, China(武汉大学) Lab for Intelligence and visiON (LION)(智能与视觉实验室) Xi'an Jiaotong University(西安交通大学)

专题命中 规划推理 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出OmniVL-Guard Pro,一种增强工具的代理,用于综合视觉-语言防伪,通过整合多种工具环境和引入新的强化学习方法,实现了开放世界中的线索驱动推理,并在多个任务上达到了最先进的性能。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04332 2026-05-21 cs.MA 67%

DRAMA: Next-Gen Dynamic Orchestration for Resilient Multi-Agent Ecosystems in Flux

DRAMA: 为动态变化中的多智能体生态系统提供下一代动态编排

Xinkui Zhao, Yifan Zhang, Sai Liu, Naibo Wang, Guanjie Cheng, Yueshen Xu, Chang Liu, Shuiguang Deng, Jianwei Yin

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出DRAMA,一种动态且鲁棒的多智能体系统,通过模块化架构和灵活的任务分配机制,提高多智能体在快速变化环境中的协作韧性。

Journal ref The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20706 2026-05-21 cs.DC cs.AI cs.LG 62%

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

网络上的Llamas:基于WebGPU的内存高效、性能可移植和多精度LLM推理

Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

机构 * Microsoft Research(微软研究院) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LlamaWeb,一种基于WebGPU的LLM推理框架,通过静态内存规划和高效模型加载减少内存开销,支持多种模型权重格式,实现了内存高效、性能可移植的LLM推理。

Comments 19 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21240 2026-05-21 cs.LG cs.AI 62%

APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents

APEX:自主策略探索用于自演化大语言模型代理

Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出APEX,一种用于自演化大语言模型代理的自主策略探索方法,通过构建和维护显式的策略空间来解决探索崩溃问题,并在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16217 2026-05-21 cs.CL cs.AI cs.IR 62%

Argus: Evidence Assembly for Scalable Deep Research Agents

Argus:可扩展深度研究代理的证据组装

Zhen Zhang, Liangcai Su, Zhuo Chen, Xiang Lin, Haotian Xu, Simon Shaolei Du, Kaiyu Yang, Bo An, Lidong Bing, Xinyu Wang

机构 * MiroMind AI

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Argus通过将深度研究视为拼图碎片的组装过程,而非并行暴力求解整个答案,提高了大规模信息检索任务的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20608 2026-05-21 cs.AI cs.NI 57%

From Automated to Autonomous: Hierarchical Agent-native Network Architecture (HANA)

从自动化到自主:分层代理原生网络架构(HANA)

Binghan Wu, Shoufeng Wang, Yunxin Liu, Ya-Qin Zhang, Joseph Sifakis, Ye Ouyang

机构 * AsiaInfo Technologies Limited(亚洲信息科技有限公司) Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) Verimag

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种分层多代理参考架构,旨在实现Level 4/5自主网络,通过引入代理自意识,统一战略规划与操作韧性,验证了其在5G核心环境中的有效性。

Comments This manuscript has been accepted by IEEE Networking Letters

Journal ref B. Wu, S. Wang, Y. Liu, Y. -Q. Zhang, J. Sifakis and Y. Ouyang, "From Automated to Autonomous: Hierarchical Agent-native Network Architecture (HANA)," in IEEE Networking Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12321 2026-05-21 cs.AI cs.CY cs.ET 57%

LIDSA: Cognitive Arbitration for Signal-Free Autonomous Intersection Management

LIDSA:信号自由的自主交叉口管理中的认知仲裁

Abderrahmane Lakas, Mohamed Amine Ferrag, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿联酋大学) Research Institute for Digital Future, Khalifa University, UAE(未来数字研究院,哈利法大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LIDSA框架,利用大语言模型进行意图驱动的速度建议,以实现信号自由的自主交叉口管理,通过对比固定周期控制、SCATS、AIM和GLOSA等方法,证明LLM在实时交叉口管理中的有效性。

Comments Renamed LISA to LIDSA to avoid naming ambiguity with existing traffic-control software. No technical changes

详情

展开后加载摘要…

URL PDF HTML 收藏