arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-13 至 2026-08-13 共收录 29 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 29 篇

2608.11716 2026-08-13 cs.LG 新提交 92%

Chain-of-Thought Shows the Path to a Tree: Realizing Branching Complexity

思维链(Chain-of-Thought, CoT)展现了通往树的路径:实现分支复杂性

Debanjan Dutta, Anish Chakrabarty, Swagatam Das

机构 * Indian Statistical Institute(印度统计研究所) LTCI, Télécom Paris(法国电信巴黎高等学院 LTCI 实验室)

专题命中 规划推理 :CoT(title_cn,summary_cn);chain-of-thought(title,title_cn);分类 cs.LG

AI总结 该研究针对分支复杂性,通过硬注意力解码器实现DFS与迪杰斯特拉算法的CoT构造,得到树的斯特拉勒数和宽度,为CoT层次线性步长机制提供非平凡见证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14098 2026-08-13 cs.CV 版本更新 87%

ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization

ForgeryVCR: 通过高效的取证工具在MLLMs中实现视觉中心推理用于图像伪造检测与定位

Youqi Wang, Shen Chen, Haowei Wang, Rongxuan Peng, Taiping Yao, Shunquan Tan, Changsheng Chen, Bin Li, Shouhong Ding

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 ForgeryVCR通过高效的取证工具实现视觉中心推理,提升图像伪造检测与定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03924 2026-08-13 cs.CL cs.AI 版本更新 84%

Uncertainty as a Planning Signal: Multi-Turn Decision Making for Goal-Oriented Conversation

不确定性作为规划信号:面向目标导向对话的多轮决策

Xinyi Ling, Ye Liu, Reza Averly, Xia Ning

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CUP框架,通过结合语言模型与结构化规划,解决目标导向对话中不确定性与信息获取之间的平衡问题,提升对话成功率并减少交互轮次。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12308 2026-08-13 cs.CV cs.AI 新提交 83%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11739 2026-08-13 cs.RO cs.AI 新提交 83%

G0.5: One Autoregressive Stream for Robot Reasoning and Action

G0.5:用于机器人推理与动作的单自回归流

Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao

机构 * Galaxea(星系科技(Galaxea))

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出G0.5,一种单自回归流的VLA模型,通过三个关键组件实现推理与动作统一,在7项基准中超越现有最优模型,展现出良好的泛化与指令跟随能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11692 2026-08-13 cs.AI 新提交 79%

HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting

HUGIN:增强自主物流分拣的视觉-语言规划能力

Xikai Sun, Cangtian Zhou, Kebin Liu, Ke Ma, Xu Wang, Zaishu Chen, Haotian Wang, Li Liu, Yunhao Liu

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对自主物流分拣的联合多场景理解挑战,提出HUGIN训练框架,构建SortingBench基准,在多VLMs上性能提升,验证了方法有效性与实际可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00407 2026-08-13 cs.AI 版本更新 79%

Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising

个性化作为逆向规划:通过结构去噪学习智能幻灯片生成的潜在设计意图

Tianci Liu, Zihan Dong, Linjun Zhang, Haoyu Wang, Jing Gao, Emre Kiciman, Ranveer Chandra, Wei-Ting Chen

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学) University at Albany(奥尔巴尼大学) Microsoft(微软)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 提出SPIRE框架,将页面级幻灯片个性化视为逆向规划问题,通过结构去噪和强化学习协作学习潜在设计意图,无需预设模板或用户详细指令。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12125 2026-08-13 cs.GT cs.AI cs.CL cs.MA 新提交 73%

Do LLMs Take Care of Their Own? Similarity Signals Can Induce Cooperation

大语言模型会照顾同类吗?相似性信号可诱导合作

Akash Kundu, Emanuel Tewolde, Ratip Emin Berker, Samuel F. Brown, Vincent Conitzer

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出首个带分级相似性信号的LLM决策评估框架,发现不同LLM应对相似性信号差异大、数据集对诱导合作影响小等,构建的LLM-行为博弈论模型可在高相似性下支持合作均衡。

Comments 41 pages, 18 Figures, 4 Tables, 16 Listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13374 2026-08-13 cs.AI 版本更新 70%

Behavior and Representation in Open-Weight Large Language Models for Combinatorial Optimization: From Feature Extraction to Algorithm Selection

大语言模型在组合优化中的行为与表示:从特征提取到算法选择

Francesca Da Ros, Luca Di Gaspero, Kevin Roitero

机构 * University of Udine(乌迪大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型在组合优化中的内部表示能力,通过直接查询和探测分析,评估其提取特征和预测最佳求解器的效果。

Comments Accepted for publication in Computers & Operations Research. Code and data are available on Zenodo: https://doi.org/10.5281/zenodo.21891840

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12062 2026-08-13 cs.CL cs.AI 新提交 62%

Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations

偏好树优化:通过前瞻模拟增强面向目标的对话

Lior Baruch, Moshe Butman, Kfir Bar, Doron Friedman

机构 * Reichman University(赖希曼大学) School of Computer Science(计算机科学学院) School of Communications(传播学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。

Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11361 2026-08-13 cs.LG cs.CL cs.PF 新提交 62%

Lifecycle-Optimal Tokenization: Vocabulary Size as a Deployment-Regime-Dependent Infrastructure Parameter

生命周期最优分词:词汇表大小作为与部署 regime 相关的基础设施参数

Rima Mittal, Ankit Gubrani, Satyanarayana Kakollu

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现 LLM 分词器的最优词汇表大小随部署 regime 变化,提出生命周期部署成本模型,经实验证实其与训练最优值差异最高达 16 倍,且最优范围内质量损失极小,为 LLM 部署提供词汇表容量规划指导。

Comments 6 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17244 2026-08-13 cs.CL cs.AI 版本更新 62%

DORA Explorer: Improving the Exploration Ability of LLMs Without Training

DORA Explorer: 无需训练提升大语言模型的探索能力

Priya Gurjar, Md Farhan Ishmam, Kenneth Marino

机构 * Kahlert School of Computing, University of Utah(犹他大学计算学院Kahlert学院)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DORA Explorer框架,通过生成多样化动作候选并利用token log-probabilities评分,提升LLM在序列决策任务中的探索能力,实验显示在MAB和TALES环境中性能显著提升。

Comments 17 pages, 6 Figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17468 2026-08-13 cs.LG cs.AI 版本更新 62%

Deep Activity Model: A Generative Approach for Human Mobility Pattern Synthesis

深度活动模型:一种用于人类移动模式合成的生成式方法

Xishun Liao, Qinhua Jiang, Brian Yueshuai He, Yifan Liu, Chenchen Kuai, Jiaqi Ma

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有人类移动模型的局限,提出生成式Transformer模型,结合社会人口统计与家庭属性合成活动链,经数据训练微调后,在多区域模拟中表现良好,为城市规划提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12273 2026-08-13 cs.CR cs.AI 新提交 57%

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

收敛式绕路劫持:基于技能的大语言模型智能体中的任务保留型资源放大

Junliang Liu, Ruoyu Li, Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Jingheng Xu, Laizhong Cui

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出收敛式绕路劫持攻击,耦合LLM智能体技能选择与规划阶段,可放大任务资源消耗,在DeepSeek-V4-Pro上80.02%的任务会被选中攻击者控制的协调器,任务完成率不变但成本显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11924 2026-08-13 cs.CL 新提交 57%

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

Spark-to-Paper:作为可组合技能的端到端研究论文生成系统

Zhuoyang Qian, Biao Wu, Yiran Wang, Chris D Yan, Desan Dai, Liangwei Zheng, Jin Jiang, Junsheng Zhang, Wenhao Wang

机构 * Vast Intelligence Lab(星智实验室) University of Technology Sydney(悉尼科技大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 Spark-to-Paper是在现有编码助手中实现的端到端研究论文生成系统,含13项可组合技能,在8个研究主题中实现高引用与图表有效性,提升伪造检测率,成本与耗时较低。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11888 2026-08-13 cs.AI 新提交 57%

Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents

智能体技能可能有害:LLM智能体中技能诱导故障的实证研究

Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Microsoft Research(微软研究院) Microsoft(微软) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文通过提出差异分析框架,在SkillsBench等数据集上发现LLM智能体的技能会引发功能故障与效率回归,并构建SkillTriage工具,为安全复用技能提供研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11742 2026-08-13 cs.CL 新提交 57%

Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models

波纹枢轴搜索:扩散大语言模型的主动并行解码

Yushi Ye, Xu Chen, Haoyun Jiang, Jinsong Lan, Haihong Tang, Bo Han, Ivor Tsang, Yanfeng Wang, Bo Zheng, Jiangchao Yao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学合作中位数网络创新中心) Alibaba Group TMLR Group(阿里巴巴集团TMLR团队) Hong Kong Baptist University(香港浸会大学) A*STAR CFAR and Nanyang Technological University(新加坡科研局计算科学中心和南洋理工大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出RPS方法,利用dLLM解码的波纹效应,在保持生成质量的同时,大幅提升解码速度与准确率,适用于推理及代码生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11631 2026-08-13 cs.AI 新提交 57%

CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement

CLAIM:基于不确定性度量的大语言模型开放域主动澄清领先方案

Kuangzhao Yang, Ziliang Zhao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于不确定性度量的CLAIM框架,无需人工标注,结合监督学习与强化学习训练统一澄清决策模型,实现开放域人机交互中低成本鲁棒的主动澄清。

Comments 11 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11354 2026-08-13 cs.AI 新提交 57%

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面

Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

机构 * JPMorganChase(摩根大通)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。

Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11350 2026-08-13 cs.CL cs.RO 新提交 57%

Self-Evolving Embodied Agents via Skill-Harness Evolution

基于技能-工具链进化的自演化具身智能体

Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * Microsoft Research(微软研究院) Northeastern University(东北大学)

专题命中 规划推理 :verifier(abstract);分类 cs.CL

AI总结 提出免训练的SHAPER框架,通过演化技能与工具链实现冻结模型驱动的自演化具身智能体,在VLABench等数据集上验证其适配优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26722 2026-08-13 cs.MA cs.LG 版本更新 57%

DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution

DREvo:提炼重校准的历史经验以实现工具链自主进化

Hanghui Guo, Weijie Shi, Zhangze Chen, Shengxiang Xu, Yishu Wang, Yimei Zhang, Wangze Ni, Jia Zhu, Shimin Di

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 针对现有工具链自主进化方法的两个局限,提出DREvo方法,通过整合三项技术提升进化稳定性,在五个基准上取得最优准确率,在两类任务上较基线实现显著性能提升。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10584 2026-08-13 astro-ph.IM cs.AI gr-qc 57%

An agentic framework for gravitational-wave counterpart association in the multi-messenger era

一种用于多信使时代引力波反演关联的代理框架

Yiming Dong, Yacheng Kang, Junjie Zhao, Xinyuan Zhu, Ziming Wang, Lijing Shao

机构 * Department of Astronomy, School of Physics(天文学系,物理系) Kavli Institute for Astronomy and Astrophysics(天体物理研究所) Institute for Gravitational Wave Astronomy(引力波天文研究所) School of Information Science and Technology(信息科学与技术学院) National Astronomical Observatories(国家天文台)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GW-Eyes框架,利用大语言模型实现引力波与电磁信号的自动关联,支持自然语言交互,提升多信使天文研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04571 2026-08-13 cs.AI 版本更新 57%

OpenAg: Democratizing Agricultural Intelligence

OpenAg:推动农业智能的平民化

Srikanth Thudumu, Jason Fisher

机构 * Institute of Applied Artificial Intelligence and Robotics (IAAIR)(应用人工智能与机器人研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出OpenAg框架,结合多类技术构建农业通用人工智能系统,以解决现有农业智能系统的不足,助力符合当地实际的农业决策。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11866 2026-08-13 stat.AP 新提交 50%

Urban logistics dynamics: a user-centric approach to traffic modelling and kinetic parameter analysis

城市物流动力学:以用户为中心的交通建模与动力学参数分析方法

Emilienne Lardy, Eric Ballot, Mariam Lafkihi

专题命中 规划推理 :planning(abstract)

AI总结 本研究从用户视角出发,以城市物流交通动力学为研究对象,通过因子分析与广义线性模型,基于时间等外生因素预测车辆动力学行为,为城市物流交通建模提供了以用户为中心的方法。

Journal ref International Conference on Urban Traffic Congestion, Jul 2024, Paris, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11386 2026-08-13 cs.SE 新提交 50%

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

关键在于接口:评估工具架构如何影响编码智能体行为

Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究通过编码智能体的对照实验,发现工具架构会显著影响智能体行为,不同工具架构在一致性、文件访问量、步骤数等方面表现出不同效果,其中Python CodeAct风格接口性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11357 2026-08-13 cs.MA 新提交 50%

When Do Institutions Beat Intelligence?

何时制度优于智能?

Zhengye Han

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究通过构建受控人工生态,实验揭示制度在修复集体构建可用公共状态的失败时优于智能,反之则不然,为智能与制度的选择提供了诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11277 2026-08-13 cs.CR cs.SE 新提交 50%

Knowledge-Graph-Guided Retrieval-Augmented LLMs for Explainable Root Cause Analysis in Automotive HiL Validation

知识图谱引导的检索增强大语言模型用于汽车在环(HiL)验证中的可解释根本原因分析

Hamza Ouarrad, Mohammad Abboush, Andreas Rausch

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究提出KG引导的RAG-LLM框架,用于汽车HiL数据的RCA与故障定位,在ASM汽油发动机和电动车系统案例中分别获90%、94% Top-1准确率,可实现可解释且泛化的故障分析。

Comments 10 pages, 3 figures, 5 tables. Accepted for publication and oral presentation at the 10th International Conference on System Reliability and Safety (ICSRS 2026), Rome, Italy, November 23--25, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13840 2026-08-13 cs.RO cs.CV 版本更新 50%

Multi-Agent Embodied Autonomous Driving: From V2X Information Exchange to Shared World Models

多智能体具身自动驾驶:从V2X信息交换到共享世界模型

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Yiqin Deng, Yuguang Fang

机构 * Lingnan University, Hong Kong(岭南大学(香港))

专题命中 规划推理 :planning(abstract)

AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23162 2026-08-13 cs.CY cs.CR cs.DC cs.ET econ.GN q-fin.EC 版本更新 50%

SolarChain: A Physics-Grounded Embodied IoT System for Verifiable Urban Solar Market Design

SolarChain:连接物理定律、可验证信任与可持续市场的城市能源韧性

Shilin Ou, Yifan Xu, Zhenshan Zhang, Luyao Zhang, Ming-Chun Huang

专题命中 规划推理 :verifier(abstract)

AI总结 提出SolarChain平台,通过基于热力学极限的物理验证和点对点市场机制,解决城市太阳能数据篡改和投机问题,实现可信交易与可持续投资。

详情

展开后加载摘要…

URL PDF HTML 收藏