arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-22 至 2026-07-22 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 10 篇

2607.19088 2026-07-22 cs.CL cs.AI 新提交 88%

DAIS: Dependency-Aware Intermediate QA Supervision for Complex Reasoning

DAIS:用于复杂推理的依赖感知中间问答监督

Yu Wang, Ming Fan, Xicheng Zhang, Zhiyong Li, Zhihu Wang, Caiyue Xu, Dahai Hu, Ting Liu

机构 * Xi’an Jiaotong University(西安交通大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究针对思维链监督的局限性,提出依赖感知中间问答监督(DAIS)框架,将教师推理依据转换为阶段级记录,在多个数据集上提升了最终答案准确率,在政策合规基准测试中有显著增益,证明其作为辅助监督信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18664 2026-07-22 cs.CV 新提交 78%

DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking

DeforM:通过时空掩码实现推理引导的物理感知视频生成

Yunyi Li, Yu Qiao, Yaohui Wang, Xinyuan Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 研究针对视频生成模型难以生成物理感知视频的问题,提出DeforM框架,引入VLM引导的物理推理模块及两种策略,经实验验证该框架能提高生成变形场景的真实感,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18767 2026-07-22 cs.CV cs.AI cs.CL 新提交 73%

Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks

使用边界框提高小语言模型在基于视觉的评分任务中的性能

Lachlan McGinness

机构 * Australian National University(澳大利亚国立大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究在基于视觉的简答题评分任务中,用边界框裁剪学生答案对小语言模型性能的影响,通过实验表明此方法能显著提高评分准确性并降低计算成本,是大规模视觉教育评估中部署小语言模型的关键预处理步骤。

Comments Accepted for 1st Workshop on Small Language Models for Education (SLM4ED '26) at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18754 2026-07-22 cs.AI cs.CL 新提交 62%

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

AgentDebugX:用于大语言模型代理中故障可观测性、归因和恢复的开源工具包

Kunlun Zhu, Xuyan Ye, Zhiguang Han, Yuchen Zhao, Bingxuan Li, Weijia Zhang, Muxin Tian, Xiangru Tang, Pan Lu, James Zou, Jiaxuan You, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) Google(谷歌公司) Stanford University(斯坦福大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型代理故障调试难题,提出开源框架AgentDebugX,其核心DeepDebug通过多轮诊断定位根源,在基准测试中表现出色,能修复更多失败任务,还通过多种方式公开工作流程并提供错误中心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18316 2026-07-22 cs.SE cs.AI cs.CL 新提交 62%

Binding Drift in Multi-Step Tool-Augmented Agents

多步工具增强智能体中的绑定漂移

Rahul Suresh Babu, Shashank Indukuri

专题命中 复杂问题求解 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究多步工具增强智能体中实体绑定随时间的变化,区分绑定漂移与错误传播。通过实验发现实体锁定会放大错误操作,实用的重新验证器可减少错误,自然设置下基线智能体有漂移现象,且持久性和重新验证不可互换。

Comments 14 pages, 5 tables, 1 figure. Equal contribution by both authors. Code and data: https://github.com/shashank-indukuri/binding-drift

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16345 2026-07-22 cs.SE cs.AI cs.LG cs.PF 版本更新 62%

AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows

AEVAL:从轶事性到确定性的智能体技能工作流测试

Tejas Singh Anand, Yuet Ying Christina Wang, Wanting Jiang, Steve Masson, Tian Zheng, Bingjie Zhou

机构 * nvidia(NVIDIA公司)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 研究针对智能体技能工作流测试缺乏确定性和可重复性的问题,提出AEVAL框架,通过执行器与评分器分离等方法,实现确定性、可重复的测试,给出分层修复建议,能将虚假通过率转换为可重复失败信号并记录修复过程。

Comments 8 pages, 1 figure, 1 table, accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05493 2026-07-22 cs.CL cs.AI cs.MA 版本更新 62%

LinguistAgent Technical Report: A Reflective Multi-Model Platform for Automated Linguistic Annotation

LinguistAgent: 一个用于自动化语言标注的反思多模型平台

Bingru Li

机构 * University of Birmingham(伯明翰大学)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 LinguistAgent通过反思多模型架构实现自动化语言标注,采用双代理工作流程模拟同行评审,支持多种标注范式并提供实时评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18243 2026-07-22 cs.AI 新提交 57%

From Agent Failure Paths to Quantified Residual Risk: A Compositional Framework for Resilient Agentic AI

从智能体故障路径到量化残余风险:一种用于弹性智能体人工智能的组合框架

Hassan Karim, Sai Sitharaman, Deepti Gupta, Danda B. Rawat

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究智能体人工智能风险表示问题,提出CPSAINT和FRIESA-K结合故障机制与风险估计,通过单独惩罚报告治理可观测性,形式化结构可组合性,在两个场景展示框架,获支持跨域推理等的紧凑内核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14751 2026-07-22 cs.LG 版本更新 57%

HERAKLES: Hierarchical Skill Compilation for Open-ended LLM Agents

HERAKLES:用于开放式语言模型智能体的分层技能编译

Thomas Carta, Clément Romac, Loris Gaven, Pierre-Yves Oudeyer, Olivier Sigaud, Sylvain Lamprier

机构 * Inria(Flowers)(Inria) University of Bordeaux(波尔多大学) Sorbonne Université (ISIR)(索邦大学) Univ Angers (LERIA) SFR MATHSTIC(昂格斯大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.LG

AI总结 研究部分可观测、稀疏奖励且目标空间大的环境中目标条件强化学习,提出HERAKLES分层智能体,联合学习高级语言模型策略与低级控制器,通过同时训练实现可扩展技能组合,提升开放式组合环境下的效率和适应性。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18869 2026-07-22 cs.CR 新提交 50%

Tracing the Shadows: Automatic Tracking and Analysis of Crypto Money Laundering via Transaction Semantic Analysis

追踪阴影:通过交易语义分析对加密货币洗钱进行自动跟踪与分析

Hao Wu, Haijun Wang, Shangwang Li, Yin Wu, Ming Fan, Ting Liu, Xiapu Luo

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究针对加密货币洗钱问题,提出AMLGuard语义感知框架,结合静态规则分析与LLM推理,对复杂DeFi交易语义分析,实现非法资金流追踪,在真实案例评估中取得高精度召回率,有效应对加密货币洗钱。

详情

展开后加载摘要…

URL PDF HTML 收藏