arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-13 至 2026-04-13 共收录 100 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2604.09150 2026-04-13 cs.CL 85%

Think Less, Know More: State-Aware Reasoning Compression with Knowledge Guidance for Efficient Reasoning

少思多知:基于知识引导的状态感知推理压缩以实现高效推理

Yi Sui, Chaozhuo Li, Dawei Song

机构 * Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Open University(开放大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出STACK框架,通过建模阶段特定冗余源并整合检索增强指导,实现逐步推理压缩,减少冗余验证,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08865 2026-04-13 cs.AI 85%

SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks

SPPO:用于长时间 horizon 推理任务的序列级 PPO

Tianyi Wang, Yixia Li, Long Li, Yibiao Chen, Shaohan Huang, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) INFLY TECH Beijing University of Posts and Telecommunications(北京邮电大学) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出 SPPO,一种结合 PPO 的样本效率与结果稳定性的序列级算法,通过将推理过程转化为序列级上下文老虎机问题,实现低方差优势信号生成,提升推理 LLM 的对齐性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04256 2026-04-13 cs.CL 57%

SSPO: Subsentence-level Policy Optimization

SSPO:子短语级策略优化

Kun Yang, Zikang chen, Yanmeng Wang, Zhigen Li, Ning Cheng, Shaojun Wang, Jing Xiao

机构 * Ping An Technology(平安科技) TJUNLP Lab, Tianjin University(天津大学TJUNLP实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 SSPO在子短语层面计算重要性比率,平衡GRPO与GSPO的优劣,缓解训练崩溃和方差问题,同时避免整个响应被保留导致的不稳定更新。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2604.09155 2026-04-13 cs.LG cs.AI 62%

CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation

CORA: 为保障移动GUI自动化设计的符合性风险控制代理

Yushi Feng, Junye Du, Qifan Wang, Zizhan Ma, Qian Niu, Yutaka Matsuo, Long Feng, Lequan Yu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) The University of Tokyo(东京大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CORA通过统计保障减少有害操作,利用Guardian模型评估行动风险并校准执行/中止边界,结合Goal-Lock机制和Phone-Harm基准验证其在自主GUI执行中的安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 8 篇

2602.02188 2026-04-13 cs.AI 79%

Reasoning in a Combinatorial and Constrained World: Benchmarking LLMs on Natural-Language Combinatorial Optimization

在组合与约束世界中的推理:在自然语言组合优化上对LLM的基准测试

Xia Jiang, Jing Chen, Cong Zhang, Jie Gao, Chengpeng Hu, Chenhao Zhang, Yaoxin Wu, Yingqian Zhang

机构 * Eindhoven University of Technology(埃因霍温理工大学) Brandenburg University of Technology(勃兰登堡工业大学) Nanyang Technological University(南洋理工大学) Delft University of Technology(代尔夫特理工大学) Southeast University(东南大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出NLCO基准测试,评估LLM在组合优化中的推理能力,涵盖43个问题,通过四层分类体系进行细粒度评估,发现随着问题规模增大,LLM的性能下降,尤其是在图结构问题和瓶颈目标上表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08863 2026-04-13 cs.AI 70%

Hidden in Plain Sight: Visual-to-Symbolic Analytical Solution Inference from Field Visualizations

隐于 plain sight:从场可视化中推断视觉到符号的解析解

Pengze Li, Jiaquan Zhang, Yunbo Long, Xinping Liu, Zhou wenjie, Encheng Su, Zihang Zeng, Jiaqi Liu, Jiyao Liu, Junchi Yu, Lihao Liu, Philip Torr, Shixiang Tang, Aoran Wang, Xi Chen

机构 * Fudan University, China(复旦大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) University of Cambridge, UK(剑桥大学) Nankai University, China(南开大学) University of Oxford, UK(牛津大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究了从二维线性稳态场的可视化中推断视觉到符号的解析解,提出ViSA-R2模型并发布ViSA-Bench基准,通过结构模式识别和物理学家路径验证,实现高精度符号表达推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17788 2026-04-13 cs.AI cs.CL cs.LG cs.MA 67%

Bayesian Social Deduction with Graph-Informed Language Models

基于图信息的语言模型的贝叶斯社会推断

Shahab Rahimirad, Guven Gergerli, Lucia Romero, Angela Qian, Matthew Lyle Olson, Simon Stepputtis, Joseph Campbell

机构 * Purdue University(普渡大学) Oracle(甲骨文公司) Virginia Tech(弗吉尼亚理工大学) Intel Labs(英特尔实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种混合推理框架,通过外部化信念推断到结构化概率模型,结合语言模型进行理解和交互,在Agent-Agent游戏中实现与大模型相当的性能,并首次在受控研究中击败人类玩家。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09189 2026-04-13 cs.CL cs.AI cs.LG 67%

Do LLMs Follow Their Own Rules? A Reflexive Audit of Self-Stated Safety Policies

大语言模型是否遵循自身规则?对自我声明安全政策的反思审计

Avni Mittal

机构 * Microsoft(微软)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SNCA框架,通过提取模型自述安全规则并形式化为类型谓词,评估模型行为一致性,发现模型在安全政策与行为间存在系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08905 2026-04-13 cs.AI cs.LG 62%

StaRPO: Stability-Augmented Reinforcement Policy Optimization

StaRPO:稳定性增强的强化策略优化

Jinghan Zhang, Fengran Mo, Tharindu Cyril Weerasooriya, Ruimin Dai, Xiaoyan Han, Yanjie Fu, Dakuo Wang, Kunpeng Liu

机构 * Clemson University(克莱姆森大学) Université de Montréal(蒙特利尔大学) Accenture (United States)(埃森哲(美国)) Arizona State University(亚利桑那州立大学) Northeastern University(东北大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 StaRPO通过引入推理稳定性指标提升强化学习在复杂推理任务中的表现,通过ACF和PE指标增强逻辑稳定性和响应准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09308 2026-04-13 cs.AI 57%

Constraint-Aware Corrective Memory for Language-Based Drug Discovery Agents

基于约束的纠正记忆:用于基于语言的药物发现代理

Maochen Sun, Youzhi Zhang, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出CACM框架,通过精确的集合级诊断和简洁的记忆写回机制,提升语言基药物发现代理的可靠性,实验表明其在目标级成功率提升36.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09075 2026-04-13 cs.CL 57%

Hierarchical Alignment: Enforcing Hierarchical Instruction-Following in LLMs through Logical Consistency

层级对齐:通过逻辑一致性在LLM中强制执行层级指令遵循

Shu Yang, Zihao Zhou, Di Wang, Wenda Li

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出NSHA方法,通过显式建模和执行指令优先级,解决LLM在多指令环境下保持一致性与安全性的挑战,提升任务性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08762 2026-04-13 cs.CV cs.AI 57%

InstrAct: Towards Action-Centric Understanding in Instructional Videos

InstrAct:迈向指令视频中的动作中心理解

Zhuoyi Yang, Jiapeng Yu, Reuben Tan, Boyang Li, Huijuan Xu

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 17 篇

2604.09069 2026-04-13 cs.CL cs.AI cs.LG 82%

NyayaMind- A Framework for Transparent Legal Reasoning and Judgment Prediction in the Indian Legal System

NyayaMind:一个用于印度法律体系中透明法律推理和判决预测的框架

Parjanya Aditya Shukla, Shubham Kumar Nigam, Debtanu Datta, Balaramamahanthi Deepak Patnaik, Noel Shallum, Pradeep Reddy Vanga, Saptarshi Ghosh, Arnab Bhattacharya

机构 * IIT Kanpur, India(印度理工学院坎普尔分校) IIT Kharagpur, India(印度理工学院克勒格布尔分校) Symbiosis Law School Pune, India(印度共生法学院浦那分校) Dattam Labs, India(印度Dattam实验室) University of Birmingham, Dubai, United Arab Emirates(英国伯明翰大学迪拜校区)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NyayaMind通过整合检索、推理和验证机制,提升印度司法系统中判决预测与解释的透明度和准确性,为可信的人工智能辅助法律决策提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26435 2026-04-13 cs.CL cs.AI 81%

Adaptive Planning for Multi-Attribute Controllable Summarization with Monte Carlo Tree Search

多属性可控摘要的自适应规划

Sangwon Ryu, Heejin Do, Yunsu Kim, Gary Geunbae Lee, Jungseul Ok

机构 * GSAI, POSTECH(浦项科技大学人工智能研究院) CSE, POSTECH(浦项科技大学计算机科学与工程学院) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) LILT(LILT公司)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出PACO框架,通过定制化的MCTS实现多属性可控摘要的自适应规划,有效满足相关约束,实验表明其在不同领域和模型上表现优异,甚至超越大模型基线。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08947 2026-04-13 cs.AI 79%

AlphaCast: A Human Wisdom-LLM Intelligence Co-Reasoning Framework for Interactive Time Series Forecasting

AlphaCast:一种用于交互式时间序列预测的人类智慧-大语言模型智能协同推理框架

Xiaohan Zhang, Tian Gao, Mingyue Cheng, Bokai Pan, Ze Guo, Yaguo Liu, Xiaoyu Tao, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 AlphaCast提出一种交互驱动的代理推理框架,利用无训练大语言模型实现准确的时间序列预测,通过多阶段工作流整合上下文准备、基于推理的生成和反思评估,将预测转化为多轮自主交互过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25835 2026-04-13 cs.AI 79%

Chain-in-Tree: Back to Sequential Reasoning in LLM Tree Search

链式树搜索:LLM树搜索中的回归顺序推理

Xinzhe Li

机构 * Independent Researcher(独立研究员)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Chain-in-Tree框架,通过在搜索过程中决定分支时机而非每步扩展,显著减少计算开销,在GSM8K和Math500上提升效率达75-85%。

Comments ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08588 2026-04-13 cs.LG cs.AI 73%

Act or Escalate? Evaluating Escalation Behavior in Automation with Language Models

行动或升级?基于语言模型评估自动化中的升级行为

Matthew DosSantos DiSorbo, Harang Ju

机构 * Harvard Business School(哈佛商学院) Johns Hopkins Carey Business School(约翰霍普金斯大学凯瑞商学院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了语言模型在自动化决策中如何平衡行动与升级,发现模型在成本权衡上的隐含阈值存在显著差异,且自我评估存在偏差,通过干预测试发现链式思维训练能产生稳健的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08719 2026-04-13 cs.CV cs.AI cs.RO 70%

LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving

LMGenDrive: 联合多模态理解与生成世界建模以实现端到端驾驶

Hao Shao, Letian Wang, Yang Zhou, Yuxuan Hu, Zhuofan Zong, Steven L. Waslander, Wei Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出LMGenDrive框架,结合LLM多模态理解与生成世界模型,提升自动驾驶的闭环性能,通过视频预测和控制信号生成,增强时空场景建模和指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09493 2026-04-13 cs.NI 67%

Policy-Aware Edge LLM-RAG Framework for Internet of Battlefield Things Mission Orchestration

面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架

Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架,结合轻量检索模块与本地LLM进行任务规划,并通过JudgeLLM验证用户指令以提高可靠性。

Comments 10 pages, 5 figures, Accepted at AIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09036 2026-04-13 cs.RO 67%

V-CAGE: Vision-Closed-Loop Agentic Generation Engine for Robotic Manipulation

V-CAGE:用于机器人操作的视觉闭环代理生成引擎

Yaru Liu, Ao-bo Wang, Nanyang Ye

机构 * University of Cambridge(剑桥大学) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 V-CAGE通过闭环代理生成框架实现机器人数据合成,结合语义布局规划和视觉自验证,提升环境生成的语义结构和可达性,解决传统方法在场景生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08727 2026-04-13 cs.CY 67%

Communicate-Predict-Act: Evaluating Social Intelligence of Agents

沟通-预测-行动:评估智能体的社会智能

David Shoresh, Sarit Kraus, Yonatan Loewenstein

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文通过混合合作与竞争的社会游戏,评估LLM的社会智能,发现社会智能的多维特征,揭示影响智能体成功的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09029 2026-04-13 cs.CL cs.AI 62%

CONDESION-BENCH: Conditional Decision-Making of Large Language Models in Compositional Action Space

CONDESION-BENCH:大语言模型在组合动作空间中的条件决策

Yeonjun Hwang, Sungyong Park, Minju Kim, Dongha Lee, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CONDESION-BENCH基准,用于评估大语言模型在组合动作空间中的条件决策能力,通过引入变量、上下文和分配层级的显式条件限制,提升决策质量评估的严谨性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08609 2026-04-13 cs.CV cs.AI cs.LG 62%

Detection of Hate and Threat in Digital Forensics: A Case-Driven Multimodal Approach

数字取证中的仇恨与威胁检测:基于案例的多模态方法

Ponkoj Chandra Shill

机构 * University of Nevada, Reno(内华达大学雷诺分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于案例的多模态方法,用于数字取证中的仇恨与威胁检测,通过区分文本证据、关联上下文文本和图像证据,提升取证的可追溯性和准确性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08603 2026-04-13 cs.AI cs.CL 62%

From Business Events to Auditable Decisions: Ontology-Governed Graph Simulation for Enterprise AI

从商业事件到可审计决策:面向企业AI的本体引导图模拟

Hongyin Zhu, Jinming Liang, Mengjun Hou, Ruifan Tang, Xianbin Zhu, Jingyuan Yang, Yuanman Mao, Feng Wu

机构 * Yonyou AI Lab(用友AI实验室) Yonyou Network Technology Co., Ltd.(用友网络科技股份有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOM-action框架,通过本体引导的图模拟实现企业AI决策,确保决策基于模拟图而非无限制知识空间,提升决策可信度与可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06737 2026-04-13 cs.CL cs.AI 62%

WisdomInterrogatory (LuWen): An Open-Source Legal Large Language Model Technical Report

WisdomInterrogatory (LuWen): 一种开源法律大语言模型技术报告

Yiquan Wu, Yuhang Liu, Yifei Liu, Ang Li, Siying Zhou, Kun Kuang, Fei Wu

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于Baichuan模型的开源中文法律语言模型LuWen,通过持续预训练、监督微调和检索增强生成技术,提升法律领域任务表现。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08555 2026-04-13 cs.CL 57%

SynDocDis: A Metadata-Driven Framework for Generating Synthetic Physician Discussions Using Large Language Models

SynDocDis:一种基于元数据的生成合成医生讨论的框架

Beny Rubinstein, Sergio Matos

机构 * University of Aveiro(阿威罗大学) IEETA, DETI, LASI, University of Aveiro(阿威罗大学 IEETA、DETI、LASI)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 SynDocDis通过结合结构化提示技术和隐私保护的去标识病例元数据,生成临床准确的医生间对话,经九个肿瘤学和肝病学场景评估,显示优异的沟通效果和医学内容质量。

Journal ref In: Valente de Oliveira, J., Leite, J., Rodrigues, J., Dias, J., Cardoso, P. (eds) Progress in Artificial Intelligence. EPIA 2025. Lecture Notes in Computer Science(), vol 16121. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15313 2026-04-13 cs.CL 57%

Mnemis: Dual-Route Retrieval on Hierarchical Graphs for Long-Term LLM Memory

Mnemis:基于分层图的双路检索用于长期LLM记忆

Zihao Tang, Xin Yu, Ziyu Xiao, Zengxuan Wen, Zelin Li, Jiaxi Zhou, Hualei Wang, Haohua Wang, Haizhen Huang, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Microsoft(微软)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 Mnemis提出一种结合系统1相似性搜索和系统2全局选择机制的新型记忆框架,通过分层图实现语义层次的自顶向下检索,提升长期记忆检索性能。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04418 2026-04-13 cs.MA cs.AI cs.DC cs.ET cs.SE 57%

SPEAR: An Engineering Case Study of Multi-Agent Coordination for Smart Contract Auditing

SPEAR:智能合约审计中的多智能体协调工程案例研究

Indraveni Chebolu, Arnab Mallick, Harmesh Rana

机构 * Centre for Development of Advanced Computing(先进计算发展中心)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 SPEAR通过多智能体框架提升智能合约审计效率,采用风险感知启发式优先级分配与自动修复策略,实验证明其在协调性、恢复能力和资源利用方面的优势。

Comments Accepted at 14th International Workshop on Engineering Multi-Agent Systems(EMAS @ AAMAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19396 2026-04-13 cs.AI 57%

EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration

EchoTrail-GUI: 通过批评者引导的自我探索构建可操作的记忆以改进GUI代理

Runze Li, Yuwen Zhai, Bo Xu, LiWu Xu, Nian Shi, Wei Zhang, Ran Lin, Liang Wang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EchoTrail-GUI框架,通过动态记忆系统提升GUI代理任务成功率和效率,验证了结构化记忆在GUI自动化中的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 14 篇

2604.09338 2026-04-13 cs.AI cs.CL 86%

Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym

注意空间推理与行动之间的差距!通过Spatial-Gym进行分步评估代理

Lars Benedikt Kaesberg, Tianyu Yang, Niklas Bauer, Terry Ruas, Jan Philip Wahle, Bela Gipp

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Spatial-Gym环境,通过2D网格谜题的分步决策任务评估模型在空间推理中的能力,发现分步格式对弱模型有益但对强模型有负面影响,且视觉模型在空间环境中的表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏