arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-04 至 2026-08-04 共收录 260 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 60 篇

2608.01633 2026-08-04 cs.LG 新提交 57%

GraphIR: Architecture-Level Search States for LLM-Guided Neural Architecture Evolution

GraphIR:面向大语言模型引导的神经架构演化的架构级搜索状态

Zhen Liu, Wanqi Zhou, Shuanghao Bai, Yuhan Liu, Jinjun Wang, Jingwen Fu

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 针对LLM引导NAS中代码级表示无法满足架构变异需求的问题,提出架构感知中间表示GraphIR,在六个下游基准中集成到OpenEvolve后实现最佳搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01507 2026-08-04 cs.SE cs.AI cs.IR cs.MA 新提交 57%

Deep Agentic Search for Repository-Level Code Question Answering: An Empirical Study

面向仓库级代码问答的深度智能体搜索:一项实证研究

Amirkia Rafiei Oskooei, Bora Ilci, Alperen Kayim, Mehmet Egemen Uzun, Berat Can, Kaan Emre Kara, Ozan Orhan, Mehmet S. Aktas

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究在SWE-QA基准上对比语义搜索与深度智能体搜索的代码问答效果,发现语义搜索正确率更高、成本更低,深度智能体搜索存在交接环节的新失败问题。

Comments 41 pages, 21 figures, 6 tables. Under review at a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01324 2026-08-04 cs.AI 新提交 57%

G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution

G-ReAct:基于结构-状态协同演化的图引导深度搜索

Shaoxiong Yang, Mengyuan Zhang, Shaojun Lin, Chao Li, Wei Liu, Kun Shao, Jian Luan

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出图引导深度搜索框架G-ReAct,通过结构-状态协同演化解决现有LLM深度搜索的上下文遗忘等问题,仅用少量轨迹微调即提升模型在BrowseComp-ZH、XBench上的准确率,且推理时可增强现有LLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01321 2026-08-04 cs.CL 新提交 57%

BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

BiCAA:面向搜索增强智能体的双向信用分配

Yibin Huang, Bin Xu, Hailong Cao, Conghui Zhu

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01311 2026-08-04 cs.CL 新提交 57%

RH-RAG: Trustworthy Long-Form Generation for Privacy-Constrained Settings

RH-RAG:适用于隐私受限场景的可信长文本生成

Raj Shekhar Singh

机构 * Indian Institute of Technology, Roorkee(鲁尔基印度理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 该研究针对隐私受限场景下的长文本生成难题,提出基于本地语言模型的多智能体框架RH-RAG,通过三阶段协同生成与双层检索索引提升生成质量,且兼顾数据隐私。

Comments accepted in KDD 2026 SeT-LLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01001 2026-08-04 cs.AI cs.CR cs.SE 新提交 57%

From AI Technical Debt to Agentic Technical Debt: A Systematic Mapping of Root Causes and Manifestations in Agentic AI Systems

从AI技术债务到智能体技术债务:智能体AI系统中根本原因与表现形式的系统映射

Muhammad Tukur, Hayatullahi B. Adeyemo, Tao Chen, Nour Ali, Anis Zarrad, Marco Agus, Rick Kazman, Rami Bahsoon

机构 * University of Birmingham(伯明翰大学) Bournemouth University(伯恩茅斯大学) Brunel University London(伦敦布鲁内尔大学) HBKU(哈迈德·本·哈利法大学) University of Hawaii(夏威夷大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对智能体AI系统引入智能体技术债务(AgTD)概念,通过转换方法建立AITD到智能体表现的系统映射,明确其影响并提出管理框架与研究议程。

Comments 32 pages, 7 figures, 7 tables, submitted to IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00969 2026-08-04 cs.AI 新提交 57%

PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent

PROGRESS:基于覆盖引导的强化学习训练搜索增强型大语言模型智能体

Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Aounon Kumar, Yashas Malur Saidutta, Wenbo Li, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城人工智能中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对搜索增强型大语言模型智能体结果级奖励监督不足的问题,提出PROGRESS方法,通过教师引导的覆盖奖励结合R1框架训练,提升了智能体任务性能,凸显了搜索策略监督的重要性。

Comments Accepted in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24223 2026-08-04 cs.CL 版本更新 57%

A New Role for Relevance: Guiding Corpus Interaction in Agentic Search

相关性的新作用:在智能搜索中指导语料库交互

Jiangnan Li, Yuqing Li, Mo Yu, Jinchao Zhang, Jie Zhou

机构 * Tencent(腾讯) IIE-CAS(中国科学院计算技术研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究提出相关性在智能搜索中作用新观点,介绍相关性感知的RipGrep搜索代理RARG,它能将相关性转化为语料库交互执行先验,提供从粗到细的相关性指导,在浏览问答和检索中提升准确性与效率,实现更快更可靠的搜索收敛。

Comments code is available at https://github.com/LeqsNaN/RARG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20997 2026-08-04 cs.AI 版本更新 57%

BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery

BioInsight: 面向交互式生物医学知识发现的多智能体编排

Jieyi Wang, Bingxuan Li, Nanyi Jiang, Desong Meng, Zirui Fan, Yuxin Guo, Jiayu Liu, Kunlun Zhu, Eddie Yang, Xiusi Chen, Pan Lu, Bingxin Zhao

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Purdue University(普渡大学) Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出多智能体系统BioInsight,通过交互式界面生成替代静态报告,实现疾病证据的组织、推理与可视化,在多项生物医学任务中取得最优性能。

Comments Update some experiments and contents

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18109 2026-08-04 cs.LG cs.OS cs.SY eess.SY 版本更新 57%

TempoNet: Slack-Quantized Transformer-Guided Reinforcement Scheduler for Adaptive Deadline-Centric Real-Time Dispatchs

TempoNet:基于Transformer的强化学习调度器用于自适应截止时间导向的实时调度

Rong Fu, Yibo Meng, Zeyu Zhang, Ziming Guo, Jia Yee Tan, Xiaojing Du, Simon James Fong

机构 * University of Macau(澳门大学) Tsinghua University(清华大学) Northeast Normal University(东北师范大学) Shanghai AI Laboratory(上海人工智能实验室) The Australian National University(澳大利亚国立大学) Peking University(北京大学) Harbin University of Science and Technology(哈尔滨理工大学) Renmin University of China(中国人民大学) Adelaide University(阿德莱德大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 TempoNet结合Transformer与深度Q近似,通过时间松弛量化和稀疏注意力机制提升实时调度性能,实现高吞吐量下的截止时间保障。

Comments 43 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15038 2026-08-04 cs.AI 版本更新 57%

LADY: Linear Attention for Autonomous Driving Efficiency without Transformers

LADY:用于自动驾驶效率的线性注意力,无需Transformer

Jihao Huang, Xi Xia, Zhiyuan Li, Tianle Liu, Jingke Wang, Junbo Chen, Tengju Ye

机构 * Udeer AI Zhejiang University(浙江大学) Yuanshi Intelligence(元世智能)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LADY是首个基于线性注意力的端到端自动驾驶生成模型,通过常数时间与内存复杂度实现高效长时序建模与跨模态交互。

Comments Accepted by IEEE RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01949 2026-08-04 cs.IR 新提交 50%

A Self-Triggered Agentic Push Recommendation System

一种自触发智能推送推荐系统

Zhao-Yu Zhang, Qingying Chen, Chunyuan Zheng, Jing Zhou, Jian Sun, Siqi Chen, Leiying Chen, Chuan Zhou, Huiyou Jiang, Xin Tao, Haoxuan Li, Zhouchen Lin

专题命中 规划推理 :planning(abstract)

AI总结 本文提出端到端自触发智能推送系统STEPS,含规划、执行、过滤智能体,已在抖音部署,可提升用户活跃天数、降低权限禁用率并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01561 2026-08-04 cs.HC 新提交 50%

FedWorld: Scope-Aware Federation of Agent World Models

FedWorld:感知范围的智能体世界模型联邦

Yuchao Hou

专题命中 规划推理 :planning(abstract)

AI总结 FEDWORLD是一种感知范围的智能体世界模型联邦协议,通过交换结构化抽象转移规则,减少冲突动态下的负迁移,提升智能体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01250 2026-08-04 eess.SY cs.SY 新提交 50%

Smoothing the Ramp, Not the Peak: Scheduling-Induced Power Dynamics of LLM Inference and Their Grid-Scale Consequences

平滑斜坡而非峰值:LLM推理的调度诱导功率动态及其电网级后果

Pan Li, Yize Chen, Xia Miao, Dai Wang

专题命中 规划推理 :planning(abstract)

AI总结 该研究揭示LLM分块预填充调度可降低功率斜坡速率,随系统饱和度提升效益增大,经转化为电网调节备用采购问题后,可减少电网快速斜坡备用容量,为运营商提供无成本需求侧塑形工具。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00959 2026-08-04 cs.GT cs.RO cs.SY eess.SY 新提交 50%

MixedComplementarityProblems.jl: A Fast, Batched, Open-Source Interior Point Solver for Mixed Complementarity Problems

MixedComplementarityProblems.jl:用于混合互补问题的快速、批处理开源内点求解器

David Fridovich-Keil

专题命中 规划推理 :planning(abstract)

AI总结 本文提出开源Julia实现的混合互补问题内点求解器MixedComplementarityProblems.jl,其批处理CPU版本处理多智能体变道轨迹博弈的速度约为PATH的100倍,GPU版本仅在KKT系统规模大时更具优势,且可靠性与PATH相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00690 2026-08-04 cs.NI 新提交 50%

LLM-Assisted Coalition Formation for Cooperative Perception in Autonomous Driving

大语言模型辅助的自动驾驶协同感知联盟形成

Ahmad Sarlak, Hao Wang, Rahul Amin, Abolfazl Razi

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究针对现有协同感知方法未优化车辆选择的问题,提出LLM辅助的联盟形成框架,结合DPP与ADMM优化,在OPV2V等数据集上实现更优性能与网络效率。

Comments Accepted for presentation at IEEE Global Communications Conference (GLOBECOM 2026), Cognitive Radio and AI-Enabled Networks Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00669 2026-08-04 cs.IR 新提交 50%

GARDRec: Decision-Level Graph Grounding for Large Language Model Recommendation

GARDRec:面向大语言模型推荐的决策级图接地方法

Yong Wang, Hongliang Sun, Jinlan Liu, Hua Zhang, Dianbo Sui, Dianhui Chu, Zhiying Tu

专题命中 规划推理 :reasoning(abstract)

AI总结 本文针对现有图增强型LLM推荐器排序决策受用户-物品关系约束弱的问题,提出GARDRec框架,通过图接地技术提升下一项推荐的候选排序性能,经实验验证其优于代表性基线。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00648 2026-08-04 cs.MA 新提交 50%

MDGAM-Based Cooperative Task Scheduling for Communication-Constrained Distributed Multi-Agent Systems

基于MDGAM的通信受限分布式多智能体系统协同任务调度

Licheng Wang, Mingtao Huang, Yuan Shen

专题命中 规划推理 :planning(abstract)

AI总结 针对通信受限分布式多智能体系统的任务调度问题,本文提出基于MDGAM的神经调度框架,结合GRMAPG算法,经实验验证其可提升任务完成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29009 2026-08-04 cs.RO 版本更新 50%

D-VLC: Decentralized Vision-Language Collaboration for Heterogeneous Embodied Multi-Robot Systems in Unknown Environments

D-VLC:面向未知环境中异构具身多机器人系统的去中心化视觉-语言协作框架

Yuan Zhou, Ruitong Lin, Shen Wang, Weiqi Gai, Mo Zhu, Xin Zhou, Yuze Wu, Fei Gao

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出D-VLC框架,结合去中心化异步推理等技术,让通用VLM生成机器人特定动作,多场景实验显示其任务成功率超70%,完成时间较几何贪心基线最多缩短55.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01788 2026-08-04 cs.SE 版本更新 50%

KRCA: An Efficient Root Cause Analysis System in Hyper-scale Microservice Systems via Agentic AI

KRCA:一种基于智能体AI的超大规模微服务系统高效根因分析系统

Jiamin Jiang, Jingfei Feng, Yu Luo, Qingliang Zhang, Yongqian Sun, Wenwei Gu, Shenglin Zhang, Tianyu Cui, Yao Wu, Jielong Huang, Nan Qi, Dan Pei

专题命中 规划推理 :reasoning(abstract)

AI总结 提出KRCA系统,通过多阶段流水线(API级钻取、骨架因果图、记忆增强多智能体框架)实现超大规模微服务的高效根因定位与故障分类,AC@1达0.88和0.79,诊断时间减少77.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26613 2026-08-04 cs.DB 版本更新 50%

EcoTable: Cost-effective Table Integration in Data Lakes for Natural Language Queries

EcoTable: 数据湖中面向自然语言查询的经济高效的表集成

Yuhui Wang, Jinqi Liu, Chengliang Chai, Hangyu Zhao, Yuhao Deng, Yuyu Luo, Xin Tang, Ye Yuan, Guoren Wang, Fengjin Wang, Lei Cao

专题命中 规划推理 :reasoning(abstract)

AI总结 针对数据湖中表格格式多样导致ETL困难的问题,提出EcoTable框架,利用LLM的语义理解和复杂推理能力,通过图结构搜索和轻量级模型降低LLM调用成本,在4个基准数据集上准确率提升30%以上,成本降低5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 24 篇

2608.01709 2026-08-04 cs.CV 新提交 89%

SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models

SpatialQuery:评估视觉语言模型中基于几何的多实例空间推理能力

Hai Nguyen, Tung Vu, Cong Tran

机构 * Posts and Telecommunications Institute of Technology(邮电技术学院)

专题命中 视觉空间推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract)

AI总结 该研究针对视觉语言模型的多实例空间推理缺陷,推出SPATIALQUERY框架及含百万对问答的SPATIALQUERY-1M基准,结合UA-CoT提示,使Qwen3-VL-8B在空间推理任务中表现优于多种模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02449 2026-08-04 cs.CV cs.RO 新提交 85%

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

MoRAL:面向边缘自动驾驶的紧凑型视觉语言模型的传感器接地鸟瞰图推理

Ambarish Govindarajulu Kaliamurthi, Kaikai Liu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 MoRAL是一种两阶段微调流水线,指导Cosmos-Reason2-2B基于物理编码的BEV表示进行驾驶决策,在参数仅为零样本基准四分之一的情况下,在8类驾驶问题中7类胜出,紧急制动召回率提升至47.8%,可在消费级8GB GPU高效运行。

Comments 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00540 2026-08-04 cs.CV 新提交 82%

DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

DiffuseAgent-MI:用于忠实视觉推理的基于分布、集成工具的自进化智能体

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 DiffuseAgent-MI是基于分布、集成工具的自进化视觉推理智能体,通过KL最小能量模型与轨迹级验证器提升忠实性,在多数据集上准确率及相关指标表现优于现有模型。

Comments 11 pages, 9 figures, accepted by ICML 2026 manitrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31986 2026-08-04 cs.CV 版本更新 80%

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

CoLT: 教会多模态模型通过潜在思维链进行思考

Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) NKIARI AAIS & VCIP, Nankai University(南开大学AAIS & VCIP) Tianjin University(天津大学)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 提出CoLT框架,用潜在思维链代替文本推理,通过前向和后向解码器监督及内部监督实现高效多模态推理,在8个基准上优于现有方法,推理时间减少10.1倍。

Comments Accepted by ECCV2026. Code is available at https://github.com/hulianyuyy/CoLT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06090 2026-08-04 cs.SE cs.AI cs.CV 版本更新 79%

SVRepair: Structured Visual Reasoning for Automated Program Repair

SVRepair: 结构化视觉推理用于自动化程序修复

Jincheng Wang, Liwei Luo, Xiaoxuan Tang, Jingxuan Xu, Sheng Zhou, Dajun Chen, Wei Jiang, Yong Li

机构 * Ant Group(蚂蚁集团) Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems(浙江可感知智能系统重点实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SVRepair 通过结构化视觉表示框架,结合多模态信息提升程序修复的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00743 2026-08-04 cs.CV 新提交 78%

LUT: Latent Utility Training for Visual Reasoning

LUT:用于视觉推理的隐式效用训练

Jiaxuan Kang, Siyu Chen, Mingda Li, Mingjie Liu, Tianyue Wang, Zhaoyang Wei, Yongheng Zhang, Yanchao Hao, Zheng Wei

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00518 2026-08-04 cs.CV 新提交 78%

GuideGround: VLM-guided Semantic Understanding and Viewpoint-aware Reasoning for 3D Visual Grounding

GuideGround:用于3D视觉定位的VLM引导语义理解与视点感知推理

Yiwen Wang, Yuyang Deng, Yihao Long, Xi Zhao

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 GuideGround是一种VLM引导的3D视觉定位框架,用VLM生成的语义描述替代闭集分类、逐视图保留假设并经VLM验证,在ReferIt3D基准上性能优于现有SOTA。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01954 2026-08-04 cs.CV 新提交 71%

StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field

StyleForge:基于超图场中反事实推理的室内家具风格生成

Lingwei Dang, Shishuo Shang, Pan Liu, Jiajia Cheng, Ziyan Qiu, Zhenhao Zhang, Yufei Zhu, Shenghui Huang, Qingxin Xiao, Yun Hao, Juntong Li, Qingyao Wu

专题命中 视觉空间推理 :reasoning(title)

AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01899 2026-08-04 cs.CV cs.CL cs.LG 新提交 62%

SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

SpatioLM:面向视觉-语言模型的通用物理空间智能

Jing Wu, Jianhua Wu, Jiayi Guan, Jiahong Chen, Jinghui Lu, Hangjun Ye, Bingzhao Gao, Long Chen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 SpatioLM是一种参数高效的视觉-语言模型,通过内置空间视觉模块和伪深度、相机监督提升空间智能,在VSI-Bench获71.6分,还可迁移至具身操纵任务,同时保留通用能力。

Comments 27 pages,13 figures,16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏