arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-05 至 2026-06-05 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 31 篇

2606.06475 2026-06-05 cs.LG cs.AI 88%

RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

RREDCoT: 推理模型的片段级奖励再分配

Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger, Sepp Hochreiter

机构 * ELLIS Unit Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University Linz, Austria(林茨ELLIS单元和LIT人工智能实验室,机器学习研究所,林茨约瑟夫·冯·拉格纳大学,奥地利) Cognizant AI Lab, San Francisco, USA(认知人工智能实验室,美国旧金山) NXAI GmbH, Linz, Austria(NXAI公司,奥地利林茨)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 针对推理语言模型强化学习微调中的延迟奖励问题,提出RREDCoT方法,利用模型自身近似最优奖励再分配,无需额外生成,降低方差并提升信用分配效率。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05859 2026-06-05 cs.CL 87%

TARPO: Token-Wise Latent-Explicit Reasoning via Action-Routing Policy Optimization

TARPO:通过动作路由策略优化的逐令牌隐式-显式推理

Liting Zhang, Shiwan Zhao, Xuyang Zhao, Zichen Xu, Jianye Wang, Qicheng Li

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 提出TARPO框架,通过动作路由策略优化在每一步自适应切换离散令牌生成和连续隐式推理,以解决隐式推理中连续表示限制策略探索的问题,实验表明其优于现有显式和隐式推理基线。

Comments 18 pages, 12 figures. Code available at https://github.com/NKU-LITI/TARPO-master

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20613 2026-06-05 cs.LG cs.AI cs.MA 84%

Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning

能否用Vibe编码击败研究生计算机科学学生?一个LLM与人类编码竞赛在市场驱动的战略规划中的表现

Panayiotis Danassis, Naman Goel

机构 * University of Southampton(苏塞克斯大学) University of Oxford and Alan Turing Institute(牛津大学和艾伦·图灵研究所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于现实物流优化问题(拍卖、取件和送货问题)的多智能体推理驱动基准,该问题结合了竞争拍卖与容量受限路由。研究通过比较40个LLM编码代理与17个人类编码代理在12场双打全部比赛和约4万场比赛中的表现,揭示了人类编码代理在战略规划和优化任务中的优势,以及LLM在现实世界中生成有效代码的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18383 2026-06-05 cs.AI cs.CL cs.LG 82%

Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models

动态思维-令牌选择用于大型推理模型中的高效推理

Zhenyuan Guo, Tong Chen, Wenlong Meng, Chen Gong, Xin Yu, Chengkun Wei, Wenzhi Chen

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出动态思维-令牌选择方法,通过分析推理轨迹发现只有部分关键令牌影响最终答案,从而优化大型推理模型的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21700 2026-06-05 cs.CL cs.AI cs.IR cs.MA cs.SI 81%

Toward Culturally Aligned LLMs through Ontology-Guided Multi-Agent Reasoning

通过本体引导的多智能体推理实现文化对齐的大型语言模型

Wonduk Seo, Wonseok Choi, Junseo Koh, Juhyeon Lee, Hyunjin An, Minhyeong Yu, Jian Park, Qingshan Zhou, Seunghyun Lee, Yi Bu

机构 * KAIST(韩国科学技术院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出OG-MAR框架,通过本体引导的多智能体推理方法,提高大型语言模型在文化对齐和鲁棒性方面的性能,并生成更透明的推理轨迹。

Comments Accepted by ICML 2026 Regular Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05464 2026-06-05 cs.AI 79%

Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces

大语言模型中在扩展搜索空间上的逐步优化类推理

Nicolás Astorga, Nabeel Seedat, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出OPT*任务族,通过可验证奖励训练和搜索引导策略,提升LLM在扩展搜索空间中的逐步优化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01935 2026-06-05 cs.CV 78%

Unified Driving Tokens: Representation- and Geometry-Guided Discrete Tokenizer for Driving World Models and Planning

统一驾驶令牌:面向驾驶世界模型和规划的表示与几何引导的离散分词器

Ziyang Yao, Zeyu Zhu, YunCheng Jiang, Zibin Guo, Huijing Zhao

机构 * Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 规划推理 :planning(title,abstract)

AI总结 提出一种表示引导与几何增强的离散分词器,通过联合监督学习紧凑令牌,同时优化重建保真度、表示一致性和规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24481 2026-06-05 cs.CV 78%

OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

OmniEgo-R$^2$:面向CVPR 2026首届跨领域EgoCross挑战赛的路由推理框架

Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 规划推理 :reasoning(title,abstract)

AI总结 针对跨领域自我中心视频推理中的时间边界模糊、语义粒度不匹配和决策不稳定问题,提出OmniEgo-R$^2$路由推理框架,在Source-Limited和Open-Source赛道均获第二名。

Comments Technical Report for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26179 2026-06-05 cond-mat.mtrl-sci cs.AI cs.CE 70%

AutoDFT: A Closed-Loop Multi-Agent Framework for Autonomous DFT Calculations

AutoDFT:用于自主DFT计算的闭环多智能体框架

Penghui Yang, Zhonghan Zhang, Yue Li, Xinrun Wang, Yanchen Deng, Yuhao Lu, Bijun Tang, Zheng Liu, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Singapore Management University(新加坡管理大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出AutoDFT闭环多智能体框架,通过将LLM推理嵌入DFT计算全生命周期,实现从规划到执行的自主适应,在VASPBench基准上达到94.1%任务成功率,并可靠预测电子、磁性和能量性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21288 2026-06-05 cs.AI cs.CV 70%

Drive-KD: Multi-Teacher Distillation for VLMs in Autonomous Driving

Drive-KD:自动驾驶中用于视觉语言模型的多教师知识蒸馏

Weitong Lian, Zecong Tang, Haoran Li, Tianjian Gao, Yifei Wang, Zixu Wang, Lingyi Meng, Tengju Ru, Zhejun Cui, Yichen Zhu, Hangshuo Cao, Qi Kang, Tianxing Chen, Kaixuan Wang, Yu Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Drive-KD框架,通过将自动驾驶分解为感知-推理-规划三元组,并利用知识蒸馏转移能力,构建了专用教师模型,并通过异构梯度投影缓解跨能力梯度冲突,验证了方法在不同模型家族和规模上的泛化能力,展示了蒸馏模型在自动驾驶任务中的优越性能。

Comments Preprint. 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05567 2026-06-05 cs.CR cs.MA 67%

ZERO-APT: A Closed-Loop Adversarial Framework for LLM-Driven Automated Penetration Testing under Intelligent Defense

ZERO-APT: 智能防御下LLM驱动的自动化渗透测试的闭环对抗框架

Anlan Zheng, Tiantian Zhu

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出ZERO-APT框架,通过集成可配置的LLM防御者、架构级因果一致性机制和专用裁判智能体,解决了LLM驱动渗透测试在真实性、一致性和可审计性方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05414 2026-06-05 cs.CL cs.AI cs.HC cs.LG 67%

When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories

当证据稀疏时:对话和LLM-Agent轨迹中的弱监督早期失败预警

Avinash Baidya, Xinran Liang, Ruocheng Guo, Xiang Gao, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究院) Princeton University(普林斯顿大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对对话和LLM-Agent轨迹中早期失败预警问题,提出一种两阶段方法,通过注意力机制从稀疏的轨迹级标签中学习回合级失败证据,并结合α-STOP策略实现可控的早期预警,在多个基准上显著提升帕累托前沿质量并降低训练成本。

Comments 9 pages, 14 figures, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09574 2026-06-05 cs.CL cs.AI cs.LG 67%

Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs

在LLMs的测试时间扩展中对树搜索策略与固定令牌预算对齐

Sora Miyamoto, Daisuke Oba, Naoaki Okazaki

机构 * University of Tokyo(东京大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种名为Budget-Guided MCTS (BG-MCTS)的树搜索解码算法,通过将搜索策略与剩余令牌预算对齐,以提高在不同令牌预算下的推理性能。

Comments Accepted at ICML 2026. Code: https://github.com/Sora-Miyamoto/bg-mcts

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06473 2026-06-05 cs.AI cs.CL 62%

MLEvolve: A Self-Evolving Framework for Automated Machine Learning Algorithm Discovery

MLEvolve:一种用于自动化机器学习算法发现的自我进化框架

Shangheng Du, Xiangchao Yan, Jinxin Shi, Zongsheng Cao, Shiyang Feng, Zichen Liang, Boyuan Sun, Tianshuo Peng, Yifan Zhou, Xin Li, Jie Zhou, Liang He, Bo Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(东华大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出MLEvolve框架,通过渐进式MCGS、回溯记忆和分层控制解决LLM智能体在长期任务中的信息隔离、无记忆搜索和缺乏分层控制问题,在MLE-Bench和数学算法优化任务上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05296 2026-06-05 cs.LG cs.AI 62%

Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents

智能体蒙特卡洛:黑盒智能体的强化学习模拟

Dae Yon Hwang, Raunaq Suri, Valentin Villecroze, Anthony L. Caterini, Jesse C. Cresswell, Noël Vouitsis, Brendan Leigh Ross

机构 * University of Cambridge(剑桥大学)

专题命中 规划推理 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 提出Agentic Monte Carlo (AMC)方法,利用序贯蒙特卡洛从最优策略后验中采样,无需参数级优化即可对黑盒LLM智能体进行强化学习式优化,在AgentGym基准上超越提示基线并随测试时计算扩展优于GRPO。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05774 2026-06-05 cs.CV cs.AI cs.CL 62%

Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding

主动视频感知:用于代理长视频理解的迭代证据寻求

Ziyang Wang, Honglu Zhou, Shijie Wang, Junnan Li, Caiming Xiong, Silvio Savarese, Mohit Bansal, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce AI研究院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种主动视频感知框架AVP,通过迭代计划-观察-反思过程,主动决定视频内容的观察目标和时间,以提高长视频理解的准确性和效率。

Comments Website: https://activevideoperception.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06011 2026-06-05 cs.RO cs.LG cs.MA 57%

Merging model-based control with multi-agent reinforcement learning for multi-agent cooperative teaming strategies

将基于模型的控制与多智能体强化学习相结合以实现多智能体协作团队策略

Christian Llanes, Spencer W. Jensen, Samuel Coogan

机构 * Georgia Institute of Technology(佐治亚理工学院) Sandia National Laboratories(桑地亚国家实验室)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出一种结合多智能体强化学习与模型预测控制的框架(MA-AC-MPC),通过扩展演员-评论家模型预测控制实现安全、动态可行的协作策略,并在追逃场景和异构环境中验证其优于多层感知机模型。

Comments 12 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06003 2026-06-05 cs.AI 57%

Beyond Vector Similarity: A Structural Analysis of Graph-Augmented Retrieval for Industrial Knowledge Graphs

超越向量相似性:面向工业知识图谱的图增强检索结构分析

Grama Chethan

机构 * Grama Chethan

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过对比八种检索架构,提出操作符词汇表论点,证明基于LLM的图推理瓶颈在于计算操作符而非模型智能,并引入LLM查询规划器,在工业知识图谱上实现优于定制处理器的性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05925 2026-06-05 cs.AI 57%

Towards World Models in Biomedical Research

迈向生物医学研究的世界模型

Guangyu Wang, Jingkun Yue, Siqi Zhang, Yu Liu, Xiaoyu Wang, Mingyuan Meng, Changwei Ji, Zongbo Han, Yulin Wang, Yang Yue, Frank Fu, Ting Chen, Song Wu, Ziwei Liu, Jiangning Song, Ming Li, Gao Huang, Xiaohong Liu, Athanasios Vasilakos, Xingcai Zhang, Ping Zhang, Yong Li

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China(网络与交换技术国家重点实验室,北京邮电大学,北京,中国) Department of Engineering Science, University of Oxford, Oxford, United Kingdom(英国牛津大学工程科学系,牛津,英国) Institute of Medical Artificial Intelligence, South China Hospital, Medical School, Shenzhen University, Shenzhen, Guangdong, China(医学人工智能研究所,南方医院,医学学院,深圳大学,深圳,广东,中国) Zhongguancun Academy & Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村学院及中关村人工智能研究院,北京,中国) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University, 100084, Beijing, China(北京信息科学与技术国家研究中心(BNRist),清华大学,100084,北京,中国) Department of Chemical and Nano Engineering, University of California, San Diego, La Jolla, CA, USA(美国加州大学圣地亚哥分校化学与纳米工程系,La Jolla,CA,美国) Nanyang Technological University, Singapore(新加坡南洋理工大学) Monash Biomedicine Discovery Institute and Department of Biochemistry and Molecular Biology, Monash University, Melbourne, Victoria, Australia(莫纳什大学生物医学发现研究所和生物化学与分子生物学系,墨尔本,维多利亚,澳大利亚) David R. Cheriton School of Computer Science, University of Waterloo, Waterloo, Ontario, Canada(加拿大滑铁卢大学戴维·R·切里顿计算机科学学校,滑铁卢,安大略,加拿大) Department of ICT and Center for AI Research, University of Agder (UiA), Jon Lilletuns vei 9, Grimstad, Norway(挪威阿格德大学(UiA)信息与通信技术系及人工智能研究中心,Jon Lilletuns vei 9,Grimstad,挪威) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出生物医学世界模型作为AI驱动发现的新范式,通过学习分子、细胞、组织和临床状态的潜在表征及干预条件动态,实现未来轨迹模拟,并探讨其在虚拟细胞、类器官、虚拟患者和手术模拟等应用中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05805 2026-06-05 cs.AI 57%

From Risk Classification to Action Plan Remediation: A Guardrail Feedback Driven Framework for LLM Agents

从风险分类到行动方案修复:一种基于护栏反馈驱动的LLM代理框架

Yuhao Sun, Jiacheng Zhang, Shaanan Cohney, Zhexin Zhang, Feng Liu, Xingliang Yuan

机构 * The University of Melbourne(墨尔本大学) Tsinghua University(清华大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出TRIAD框架,通过护栏生成的言语反馈引导代理在规划步骤中保持良性目标,实现安全与效用的最佳平衡。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05684 2026-06-05 cs.AI 57%

AdaMEM: Test-Time Adaptive Memory for Language Agents

AdaMEM:语言代理的测试时自适应记忆

Yunxiang Zhang, Yiheng Li, Ali Payani, Lu Wang

机构 * Yunxiang Zhang(张 Yunxiang) Yiheng Li(李 Yiheng) Ali Payani(Payani Ali) Lu Wang(王 Lu)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AdaMEM框架,通过混合记忆架构(长期轨迹记忆+动态短期策略记忆)实现测试时自适应,无需在线更新参数,在ALFWorld、WebShop等任务上显著优于静态记忆基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05449 2026-06-05 cs.AI cs.GT econ.EM 57%

Insurance of Agentic AI

代理型人工智能的保险

Quanyan Zhu

机构 * Department of Electrical and Computer Engineering, New York University, Tandon School of Engineering(电气与计算机工程系,纽约大学,工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文分析了代理型AI带来的新型风险,提出了承保、定价、再保险和产品设计的框架,并构建了整合多种保险覆盖的协调架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05445 2026-06-05 cs.AI 57%

Brick-Composer: Using MLLMs for Assembly with Diverse Bricks

Brick-Composer: 使用多模态大语言模型进行多样化积木组装

Jiateng Liu, Bingxuan Li, Zhenhailong Wang, Rushi Wang, Kaiwen Hong, Cheng Qian, Jiayu Liu, Denghui Zhang, Katherine Driggs-Campbell, Manling Li, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Brick-Composer框架,通过人类设计火花、世界反馈和合成经验三种信号训练多模态大语言模型,解决积木组装中的积木选择和姿态估计问题,将步骤级组装成功率从低于1%提升至约15%。

Comments 10 Pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05391 2026-06-05 cs.SE cs.AI 57%

Human oversight of agentic systems in practice: Examining the oversight work, challenges, and heuristics of developers using software agents

实践中对智能体系统的人类监督:考察使用软件代理的开发者的监督工作、挑战与启发式方法

Shipi Dhanorkar, Samir Passi, Mihaela Vorvoreanu

机构 * Microsoft Redmond USA(微软红mond美国)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 通过访谈17位经验丰富的开发者,探索人类对自主软件代理的监督实践,发现四种监督工作形式(先验控制、协同规划、实时监控、事后审查),并总结监督挑战与应对策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16475 2026-06-05 cs.AI 57%

Breaking the Chain: A Causal Analysis of LLM Faithfulness to Intermediate Structures

打破链条:对LLM对中间结构忠实性的因果分析

Oleg Somov, Mikhail Chaichuk, Gleb Ershov, Karim Vafin, Mikhail Seleznyov, Alexander Panchenko, Elena Tutubalina

机构 * AIRI MIPT(莫斯科国立交通大学) HSE University(高等经济大学) Avito AI Lab(Avito人工智能实验室) Skoltech(斯克里普钦科技学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了在模式引导推理(SGR)管道中,LLM对中间结构的忠实性,发现尽管模型在自身中间结构上自洽,但对干预的响应不足,当将最终决策的推导委托给外部工具时,这种不稳定性显著降低。

Comments 20 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09923 2026-06-05 cs.AI 57%

CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents

CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents

Hanna Foerster, Tom Blanchard, Kristina Nikolić, Ilia Shumailov, Cheng Zhang, Robert Mullins, Nicolas Papernot, Florian Tramèr, Yiren Zhao

机构 * University of Cambridge(剑桥大学) University of Toronto & Vector Institute(多伦多大学及向量研究所) ETH Zurich(苏黎世联邦理工学院) AI Security Company(人工智能安全公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种系统级安全方法,用于计算机使用代理(CUAs),通过单次规划和NOVA框架在动态UI状态下提供控制流完整性保障,同时在保持性能的同时提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22067 2026-06-05 cs.AI 57%

Semantic Partial Grounding via LLMs

通过大语言模型实现语义部分 grounding

Giuseppe Canonaco, Alberto Pozanco, Daniel Borrajo

机构 * Department of Computer Science, University of Cambridge(剑桥大学计算机科学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出SPG-LLM,利用大语言模型分析领域和问题文件,提前识别可能不相关的对象、动作和谓词,从而减少grounding任务的规模,提升grounding效率并在某些领域实现更优的计划成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05843 2026-06-05 cs.CL 57%

OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions

OdysseyArena: 为长视界、主动和归纳交互评估大型语言模型

Hang Yan, Fangzhi Xu, Qiushi Sun, Jinyang Wu, Zixian Huang, Muye Huang, Jingyang Gong, Zichen Ding, Kanzhi Cheng, Yian Wang, Xinyu Che, Zeyi Sun, Jian Zhang, Zhangyue Yin, Haoran Luo, Ben Kao, Qika Lin

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出OdysseyArena,通过长视界、主动和归纳交互评估大型语言模型,提供120个任务测量归纳效率和长视界发现,并通过OdysseyArena-Challenge测试极端交互视界下的模型稳定性,揭示前沿模型在复杂环境中的归纳能力瓶颈。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11618 2026-06-05 cs.LG 57%

Optimal CO2 storage management considering safety constraints in multi-stakeholder multi-site CCS projects: a Markov game perspective

考虑安全约束的多利益相关者多地点碳捕集与封存项目最优存储管理:从马尔可夫博弈视角

Jungang Chen, Seyyed A. Hosseini

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文基于马尔可夫博弈方法,研究多利益相关者多地点碳捕集与封存项目中不同联盟结构对利益相关者目标的影响,提出一种考虑安全约束的多智能体强化学习框架,以实现多利益相关者的最优存储管理。

Comments 58 pages

Journal ref Int. J. Greenh. Gas Control 149 (2026) 104683

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15231 2026-06-05 cs.AI 57%

CangLing-KnowFlow: A Unified Knowledge-and-Flow-fused Agent for Comprehensive Remote Sensing Applications

CangLing-KnowFlow: 一个统一的知识与流程融合代理用于综合遥感应用

Zhengchao Chen, Haoran Wang, Jing Yao, Jianshe Zhang, Pedram Ghamisi, Jun Zhou, Peter M. Atkinson, Bing Zhang

机构 * State Key Laboratory of Remote Sensing and Digital Earth, Aerospace Information Research Institute, Chinese Academy of Sciences(遥感与数字地球国家重点实验室,航天信息研究所,中国科学院) Beijing Tiandi Shijie Technology Co., Ltd.(北京天帝世纪科技有限公司) Faculty of Science and Technology, Lancaster University(兰卡斯特大学科学与技术学院) Faculty of Electrical and Computer Engineering, University of Iceland(冰岛大学电气与计算机工程学院) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克亥姆霍尔茨中心) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出CangLing-KnowFlow,一个融合知识与流程的统一智能代理框架,通过整合过程知识库、动态工作流调整和进化记忆模块,解决遥感数据处理中任务特定、缺乏统一框架的问题,并在KnowFlow-Bench基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏