arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-14 至 2026-04-14 共收录 233 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 47 篇

2604.09682 2026-04-14 cs.NI cs.AI 57%

Decision-Theoretic Safety Assessment of Persona-Driven Multi-Agent Systems in O-RAN

基于决策理论的面向角色驱动的多智能体系统在O-RAN中的安全性评估

Zeinab Nezami, Syed Ali Raza Zaidi, Maryam Hafeez, Louis Powell, Vara Prasad Talari, Mallik Tatipamula

机构 * GSMA(全球移动通信系统协会) University of Leeds(利兹大学) AWS(亚马逊云服务) Ericsson(爱立信)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种基于角色驱动的多智能体框架,通过角色行为规范影响五个专业智能体,结合决策理论构建三维评估框架,验证486种角色配置在O-RAN优化挑战中的性能与协调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09666 2026-04-14 cs.IR cs.AI 57%

Do We Still Need GraphRAG? Benchmarking RAG and GraphRAG for Agentic Search Systems

我们仍然需要GraphRAG吗?对RAG和GraphRAG在代理搜索系统中的基准测试

Dongzhe Fan, Zheyi Xue, Siyuan Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过RAGSearch基准测试,评估了代理搜索系统对密集RAG和代表性的GraphRAG方法的影响,发现代理搜索显著提升了密集RAG性能,但在复杂多跳推理中GraphRAG仍具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09571 2026-04-14 cs.HC cs.AI 57%

Tuning Qwen2.5-VL to Improve Its Web Interaction Skills

调优 Qwen2.5-VL 以提升其网页交互能力

Alexandra Yakovleva, Henrik Pärssinen, Harri Valpola, Juho Kannala, Alexander Ilin

机构 * Aalto University(阿尔托大学) University of Oulu(奥卢大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文通过调优 Qwen2.5-VL 模型,改进其在网页交互中的可靠性,解决元素定位不准确、指令敏感性和过度乐观偏差等问题,提升单次点击任务的成功率。

Comments Accepted to the Short Paper Track of ACM Web Conference 2026 (WWW 2026). The final version will appear in the ACM Digital Library

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09556 2026-04-14 cs.DC cs.AI 57%

Para-B&B: Load-Balanced Deterministic Parallelization of Solving MIP

Para-B&B: 解决MIP问题的负载均衡确定性并行化

Jinyu Zhang, Di Huang, Yue Liu, Shuo Wang, Zhenyu Pu, Zhiyuan Liu

机构 * School of Transportation, Southeast University(东南大学交通学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出Para-B&B,通过AI驱动的负载平衡机制和数据并行架构,实现HiGHS求解器的确定性并行化,实验显示在80个MIPLIB 2017实例上取得2.17的几何平均加速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03515 2026-04-14 cs.SE cs.AI cs.ET 57%

Inside the Scaffold: A Source-Code Taxonomy of Coding Agent Architectures

在框架内:基于源代码的编码代理架构分类

Benjamin Rombaut

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文通过分析13个开源编码代理框架的源代码,提出了一种基于架构的分类方法,揭示了控制策略、工具使用和资源管理的多样性,为研究代理行为和设计新框架提供了可复用的参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23834 2026-04-14 cs.CY cs.AI 57%

Artificial Intelligence for All? Brazilian Teachers on Ethics, Equity, and the Everyday Challenges of AI in Education

人工智能为所有人服务?巴西教师对伦理、公平及教育中人工智能的日常挑战的看法

Bruno Florentino, Camila Sestito, Wellington Cruz, André de Carvalho, Robson Bonidia

机构 * University of São Paulo(圣保罗大学) Federal University of Technology-Paraná (UTFPR)(巴拉那联邦理工大学) Instituto Significare(Significare研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究探讨巴西K-12教师对AI在教育中应用的看法,发现教师对AI的兴趣主要集中在互动内容、教学计划和个性化评估,但面临缺乏培训和技术支持等结构性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08574 2026-04-14 cs.RO cs.MA 50%

DeepFleet: Multi-Agent Foundation Models for Mobile Robots

DeepFleet:用于移动机器人群的多智能体基础模型

Ameya Agaskar, Sriram Siva, William Pickering, Kyle O'Brien, Charles Kekeh, Alexandre Ormiga Galvao Barbosa, Ang Li, Brianna Gallo Sarker, Alicia Chua, Mayur Nemade, Charun Thattai, Jiaming Di, Isaac Iyengar, Ramya Dharoor, Dino Kirouani, Jimmy Erskine, Tamir Hegazy, Scott Niekum, Usman A. Khan, Federico Pecora, Joseph W. Durham

机构 * Amazon Robotics(亚马逊机器人)

专题命中 规划推理 :planning(abstract)

AI总结 DeepFleet通过多智能体基础模型支持大规模移动机器人编队的协调与规划,提出四种架构分别体现不同的归纳偏差,评估设计对预测任务性能的影响。

Comments 27 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14383 2026-04-14 cs.RO 50%

MARLIN: Multi-Agent Reinforcement Learning Guided by Language-Based Inter-Robot Negotiation

MARLIN:基于语言的多智能体强化学习引导的多机器人协商

Toby Godfrey, William Hunt, Mohammad D. Soorati

机构 * University of Southampton(南安普顿大学)

专题命中 规划推理 :planning(abstract)

AI总结 MARLIN通过语言引导的多机器人协商与强化学习结合,提升早期训练性能和最终效果,采用语言模型进行高层规划和行动协商。

Comments 15 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10938 2026-04-14 cs.MA 50%

AgentWebBench: Benchmarking Multi-Agent Coordination in Agentic Web

AgentWebBench: 多智能体协调在代理网络中的基准测试

Shanshan Zhong, Kate Shen, Chenyan Xiong

专题命中 规划推理 :planning(abstract)

AI总结 AgentWebBench评估用户代理与网站特定内容代理交互回答问题的能力,发现多智能体协调在大规模模型下可超越集中检索,但需更高效的规划与证据质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10449 2026-04-14 cs.SE 50%

AdverMCTS: Combating Pseudo-Correctness in Code Generation via Adversarial Monte Carlo Tree Search

AdverMCTS:通过对抗性蒙特卡洛树搜索对抗代码生成中的伪正确性

Qingyao Li, Weiwen Liu, Weinan Zhang, Yong Yu, Bo An

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出AdverMCTS,通过将代码搜索与主动漏洞发现结合,对抗代码生成中的伪正确性问题,实验表明其优于现有方法,有效降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26163 2026-04-14 cs.CY 50%

Exploring Dissatisfaction in Bus Route Reduction through LLM-Calibrated Agent-Based Modeling

通过LLM校准的Agent-Based建模探索公交路线削减中的不满

Qiumeng Li, Xinxi Yang, Suhong Zhou

专题命中 规划推理 :planning(abstract)

AI总结 研究通过LLM校准的ABM探讨公交路线削减对不同群体不满及网络韧性的影响,发现网络结构对系统稳定性影响大于容量因素,路线削减导致不满指数急剧上升,尤其影响残疾人士和老年人。

Comments The authors have withdrawn this preprint due to errors in figure presentation and labeling. A revised manuscript will be submitted once these issues are resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19374 2026-04-14 eess.SY cs.SY 50%

A Review of Hydrogen-Enabled Resilience Enhancement for Multi-Energy Systems

多能源系统中氢能赋能的韧性增强综述

Liang Yu, Haoyu Fang, Goran Strbac, Dawei Qiu, Dong Yue, Xiaohong Guan, Gerhard P. Hancke

专题命中 规划推理 :planning(abstract)

AI总结 本文综述了氢能赋能多能源系统韧性增强的挑战与方法,提出韧性提升框架,分类规划与运营措施,探讨未来研究方向。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09616 2026-04-14 cs.DC 50%

DCGen 1.1 Technical Report: Generating Datacenter Configurations (including IT, Power, Cooling)

DCGen 1.1 技术报告:生成数据中心配置(包括IT、电力、冷却)

Wedan Emmanuel Gnibga, Andrew A. Chien

专题命中 规划推理 :planning(abstract)

AI总结 为研究数据中心硬件设计、运营动态、冷却机制及与电网的交互,DCGen工具能生成多种数据中心配置,涵盖IT硬件、冷却和电力分配基础设施,并支持不同电力、计算能力和面积目标的场景探索。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 12 篇

2604.09712 2026-04-14 cs.CV cs.AI 79%

LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models

LAST:利用工具作为提示以增强多模态大语言模型的空间推理能力

Shi-Yu Tian, Zhi Zhou, Kun-Yang Yu, Ming Yang, Yang Chen, Ziqiao Shang, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 LAST通过整合专用视觉模型,解决多模态大语言模型在复杂几何布局解析中的幻觉和不精确问题,提出统一框架提升空间推理能力。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11177 2026-04-14 cs.CV 78%

Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding

推理流是否重要?评估Gemini视觉-语言模型在视频场景理解中的推理能力

Shivam Sharma, Sankalp Nagaonkar, Ashish Choithani, Ashutosh Trivedi

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究评估了Gemini视频语言模型中推理流对视频场景理解的影响,提出三个评估指标,并发现增加推理量对输出质量的提升迅速达到平台期,Flash Lite在质量和token使用之间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18373 2026-04-14 cs.CV 78%

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

MASS:面向视觉-语言模型中物理推理与理解的运动感知空间-时间 grounding

Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) University of Southern California(南加州大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 MASS通过引入空间-时间信号提升视觉-语言模型对物理现象的理解能力,提出MASS-Bench基准测试集并验证模型在物理推理中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11627 2026-04-14 cs.CV 71%

POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs

POINTS-Long: 基于人类视觉系统的自适应双模式视觉推理MLLM

Haicheng Wang, Yuan Liu, Yikun Liu, Zhemeng Yu, Zhongyin Zhao, Yangxiu You, Zilin Yu, Le Tian, Xiao Zhou, Jie Zhou, Weidi Xie, Yanfeng Wang

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院) WeChat AI, Tencent(腾讯微信人工智能)

专题命中 视觉空间推理 :reasoning(title)

AI总结 POINTS-Long引入动态视觉token缩放机制,通过聚焦模式和待机模式实现效率与精度的动态平衡,在细粒度视觉任务中保持最优性能,在长形式视觉理解中使用1/40-1/10的视觉token保留97.7-99.7%的精度,支持流式视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10426 2026-04-14 cs.CL cs.AI 62%

CodaRAG: Connecting the Dots with Associativity Inspired by Complementary Learning

CodaRAG: 通过互补学习启发的关联性连接点

Cheng-Yen Li, Xuanjun Chen, Claire Lin, Wei-Yu Chen, Wenhua Nie, Hung-Yi Lee, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CodaRAG通过互补学习系统启发,提出了一种将碎片化信息整合为稳定记忆基础,通过多维路径遍历图结构,消除超关联噪声,提升检索和生成精度的框架。

Comments Preprint, Submitted to ACM TIST

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09604 2026-04-14 cs.AI cs.LG 62%

LLMs for Text-Based Exploration and Navigation Under Partial Observability

基于部分可观测性的文本基于探索与导航中的大型语言模型

Stephan Sandfuchs, Maximilian Melchert, Jörg Frochte

机构 * AKIS -- Interdisciplinary Institute for Applied AI and Data Science Ruhr(AKIS——鲁尔跨学科应用人工智能与数据科学研究所) Bochum University of Applied Sciences(波鸿应用科学大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在部分可观测环境下作为纯文本控制器的可行性,评估了九种不同LLM在探索和导航任务中的表现,发现推理调优模型在导航任务中表现更可靠,但效率仍低于理想路径。

Comments 15 pages, (to be published Springer Lecture Notes of the Institute for Computer Sciences, Social Informatics and Telecommunications Engineering [LNICST] )

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04849 2026-04-14 physics.chem-ph cs.AI cs.MA 57%

El Agente Estructural: An Artificially Intelligent Molecular Editor

结构代理:一种人工智能分子编辑器

Changhyeok Choi, Yunheng Zou, Marcel Müller, Han Hao, Yeonghun Kang, Juan B. Pérez-Sánchez, Ignacio Gustin, Hanyong Xu, Andrew Wang, Mohammad Ghazi Vakili, Chris Crebolder, Alán Aspuru-Guzik, Varinia Bernales

机构 * University of Toronto(多伦多大学) Acceleration Consortium(加速联盟) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出El Agente Estructural,一种多模态、自然语言驱动的几何生成与操控代理,用于自主化学和分子建模。该代理通过整合领域知识工具和视觉语言模型,实现对分子结构的精确操控,无需重建核心分子框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10568 2026-04-14 cs.LG cond-mat.mtrl-sci 57%

ReadMOF: Structure-Free Semantic Embeddings from Systematic MOF Nomenclature for Machine Learning

ReadMOF:基于系统化MOF命名的无结构语义嵌入用于机器学习

Kewei Zhu, Cameron Wilson, Bartosz Mazur, Yi Li, Ashleigh M. Chester, Peyman Z. Moghadam

机构 * University College London(伦敦大学学院) Wroclaw University of Science and Technology(弗罗茨瓦夫理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 ReadMOF通过系统化MOF命名生成无结构语义嵌入,无需原子坐标或连接图即可建模结构-性质关系,实现材料信息学中的性质预测、相似性检索与聚类,性能可与几何依赖方法相比拟。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09780 2026-04-14 cs.AI 57%

The Myth of Expert Specialization in MoEs: Why Routing Reflects Geometry, Not Necessarily Domain Expertise

专家专业化在MoEs中的神话:为什么路由反映几何,而非领域专业知识

Xi Wang, Soufiane Hayou, Eric Nalisnick

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了MoEs中专家专业化的机制,指出路由依赖于隐藏状态相似性,而非领域专业知识,并揭示了专业化的几何属性及在不同数据下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11538 2026-04-14 cs.HC 50%

ResearchCube: Multi-Dimensional Trade-off Exploration for Research Ideation

ResearchCube: 多维权衡探索用于研究构想

Zijian Ding, Fenghai Li, Ziyi Wang, Joel Chan

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ResearchCube通过多维权衡谱帮助研究者探索和优化构想,提供三维空间交互,提升认知和控制感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10493 2026-04-14 cs.SE 50%

SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents

SWE-Shepherd:推进基于强化学习的代码代理的PRMs

Mahir Labib Dihan, Md Ashrafur Rahman Khan

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SWE-Shepherd框架,通过引入过程奖励模型为代码代理提供密集的步骤级监督,提升代码代理在大型代码库中的交互效率和动作质量。

Comments Code is available at https://github.com/mahirlabibdihan/swe-shepherd

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09862 2026-04-14 cs.CV 50%

FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views

FF3R:从无约束视角实现前馈特征三维重建

Chaoyi Zhou, Run Wang, Feng Luo, Mert D. Pesé, Zhiwen Fan, Yiqi Zhong, Siyu Huang

机构 * Microsoft(微软) Clemson University(克莱姆森大学) Texas A&M University(德克萨斯A&M大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 FF3R提出一种无需标注的前馈框架,统一处理几何与语义推理,解决全局语义不一致和局部结构不一致问题,实验显示其在视图合成、语义分割和深度估计中表现优异。

Comments CVPR 2026 Findings. Project Page: https://chaoyizh.github.io/ff3r_project/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 17 篇

2604.00013 2026-04-14 cs.CL cs.AI 86%

C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis

C2F-Thinker:基于提示引导强化学习的粗到细推理用于多模态情感分析

Miaosen Luo, Zhenhao Yang, Jieshen Long, Jinghu Sun, Yichu Liu, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出C2F-Thinker框架,通过粗到细结构推理与提示引导强化学习,提升多模态情感分析的可解释性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10335 2026-04-14 cs.CL cs.LG 86%

Adaptive Multi-Expert Reasoning via Difficulty-Aware Routing and Uncertainty-Guided Aggregation

基于难度感知路由和不确定性引导聚合的自适应多专家推理

Mohamed Ehab, Ali Hamdi

机构 * Faculty of Computer Science October University for Modern Science \& Arts Giza, Egypt

专题命中 测试时计算 :reasoning(title,abstract);math reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AMR框架,通过动态适应策略提升数学推理鲁棒性,利用难度感知路由和不确定性引导聚合在GSM8K数据集上取得75.28%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00748 2026-04-14 cs.CV 85%

Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning

通过强化学习提升多图像接地在MLLMs中的推理能力

Bob Zhang, Haoran Li, Tao Zhang, Jianan Li, Cilin Yan, Xikai Liu, Jiayin Cai, Yanbin Hao

机构 * Xiaohongshu Inc.(小红书公司) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Technical University of Munich(慕尼黑工业大学) Hefei University of Technology(合肥工业大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文通过强化学习策略提升多图像接地任务中MLLMs的推理能力,采用合成CoT数据、LoRA微调和规则引导的RL方法,实验表明在MIG-Bench和多个领域外基准上效果显著。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10660 2026-04-14 cs.CL cs.AI cs.LG 83%

Efficient Process Reward Modeling via Contrastive Mutual Information

通过对比互信息实现高效的进程奖励建模

Nakyung Lee, Sangwoo Hong, Jungwoo Lee

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔大学电气与计算机工程系) Department of Computer Science and Engineering, Konkuk University(建国大学计算机科学与工程系)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 本文提出CPMI方法,通过模型内部概率推断步骤监督,减少标注计算负担,提升过程级评估和数学推理准确性。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10739 2026-04-14 cs.AI 83%

When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling

更多思考反而有害:在LLM测试时间计算扩展中的过度思考

Shu Zhou, Rui Ling, Junan Chen, Xin Wang, Tao Fan, Hao Wang

机构 * Nanjing University(南京大学) Baidu(百度) Nanjing University of Finance & Economics(南京财经大学)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究探讨了在LLM测试时间计算扩展中,增加推理token的边际效用随计算预算增加而下降的现象,发现模型存在过度思考问题,且最优思考长度因问题难度而异。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏