arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-04 至 2026-08-04 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 23 篇

2507.02778 2026-08-04 cs.CL cs.AI cs.LG 版本更新 91%

Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models

Self-Correction Bench:揭示并解决大语言模型中的自校正盲点

Ken Tsui

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :self-correction(title,title_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出Self-Correction Bench框架,发现大语言模型存在64.5%的自校正盲点,经微调或添加“Wait”可显著降低该盲点,揭示了自校正能力未激活的机制。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02089 2026-08-04 cs.LG cs.AI 新提交 84%

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models

推理摘要能透露多少信息?大语言模型的可观测性阶梯

Andres Algaba, Francesca Carlon, Lynn Delcon, Marthe Ballon, Bert Verbruggen, Vincent Ginis

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大语言模型的可观测性阶梯,通过实验发现有提示时摘要对正确性监测的帮助远小于完整轨迹,可监测性由显示内容和读者共同决定。

Comments 71 pages, 13 figures, 65 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01095 2026-08-04 cs.CV cs.LG 版本更新 83%

NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

NarrativeTrack: 评估实体中心推理在叙事理解中的表现

Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma, Gargi Chakraborty

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。

Comments Project Page: https://github.com/apple/ml-NarrativeTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交 81%

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05158 2026-08-04 cs.CL cs.AI cs.MA 版本更新 81%

Streaming Communication in Multi-Agent Reasoning

多智能体推理中的流式通信

Zhen Yang, Xiaogang Xu, Wen Wang, Cong Chen, Xander Xu, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) ZJU(浙江大学) HKUST(香港科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出流式多智能体推理系统StreamMA,通过将推理步骤实时流式传输给下游智能体来降低延迟,并意外地提升了效果,同时首次给出流式、串行和单协议三种模式的闭式联合分析。

Comments project page: https://zhenyangcs.github.io/StreamMA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02291 2026-08-04 cs.AI 新提交 79%

Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning

共享前缀,更优信用:面向多智能体推理的自适应路由

Yiqing Liu, Zihao Wang, Hantao Yao, Wu Liu, Yongdong Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对现有多智能体推理自适应路由方法的粗粒度监督缺陷,提出TreeCredit共享前缀信用分配框架,通过状态匹配下游比较估计算子效用,在六个推理基准上实现了准确率与推理成本的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24140 2026-08-04 cs.AI 版本更新 79%

HyperGuide: Hyperbolic Guidance for Efficient Multi-Step Reasoning in Large Language Models

HyperGuide: 用于大型语言模型高效多步推理的双曲引导

Yuyu Liu, Haotian Xu, Yanan He, Sarang Rajendra Patil, Mengjia Xu, Tengfei Ma

机构 * Department of Computer Science(计算机科学系) Stony Brook University(石英布鲁克大学) Department of Applied Mathematics and Statistics(应用数学与统计学系) Yale University(耶鲁大学) Department of Data Science(数据科学系) New Jersey Institute of Technology(新泽西理工学院) Department of Biomedical Informatics(生物医学信息学系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多步推理中单次生成效率高但精度低、树搜索计算量大的问题,提出通过将推理进度蒸馏为双曲几何信号来引导逐步生成,利用双曲空间的距离和角度特性编码解接近度与分支区分,训练轻量头投影隐状态并微调适配器,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01930 2026-08-04 cs.CV cs.AI 新提交 77%

Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

重新计算还是复用?诊断与缓解视觉语言模型自反思中的文本捷径

Wenxiao Fan, Jingling Fu, Fang Li, Luohang Liu, Yu He, Lichen Ma, Zhiyang Yu, Weishan Bi, Junshi Huang, Yan Li, Gu Simiu, Kan Li

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 该研究针对VLM自反思中存在的文本捷径问题,通过反事实分析诊断其特性,提出无需训练的FSAF干预,显著提升视觉更新率、降低先前答案率,为缓解VLM的文本复用偏差提供了有效方案。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01314 2026-08-04 cs.CV 新提交 67%

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Remember-R1:通过强化学习缓解长上下文视觉遗忘

Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

机构 * Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22583 2026-08-04 cs.AI cs.CL 版本更新 62%

Multi-Objective Structured Pruning of LLMs for Latency and Model Size Optimization

用于延迟和模型大小优化的大语言模型多目标结构化剪枝

Muhammad Junaid Ali, Smail Niar, El-Ghazali Talbi

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在边缘计算环境部署的挑战,提出硬件感知多目标结构化剪枝框架,分两阶段优化,粗粒度移除模块,细粒度搜索最优剪枝率,实验证明能降低模型复杂度,在多方面实现良好权衡,适合边缘部署。

Comments Submitted to the ICTAI 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28488 2026-08-04 cs.CL cs.AI cs.MA 版本更新 62%

Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verification

courtroom 风格多智能体辩论与渐进式 RAG 和角色切换用于争议性主张验证

Masnun Nuha Chowdhury, Nusrat Jahan Beg, Umme Hunny Khan, Syed Rifat Raiyan, Md Kamrul Hasan, Hasan Mahmud

机构 * Systems and Software Lab (SSL), Department of Computer Science and Engineering(系统与软件实验室(SSL),计算机科学与工程系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 PROClaim 框架,通过结构化对抗辩论和角色切换提升争议性主张验证的可靠性,实验显示其在 Check-COVID 数据集上准确率达 81.7%。

Comments Under review, 29 pages, 7 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00740 2026-08-04 cs.CL cs.AI 版本更新 62%

MedTextWeaver: Procedural Knowledge Evolution in Agentic Medical Text Editing

ExperienceWeaver: 优化基于 LLM 的临床文本改进的小样本经验学习

Ziyan Xiao, Yinghao Zhu, Liang Peng, Kyongtae T Bae, Lequan Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ExperienceWeaver 通过经验学习优化小样本下 LLM 的临床文本改进,通过提炼反馈知识提升模型修订能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01927 2026-08-04 cs.SE cs.AI 新提交 57%

Effective and Efficient Context Retrieval via Partial Dependency Graph for Repository-Level Code Generation

基于部分依赖图的高效上下文检索用于仓库级代码生成

Zhongxin Liu, Zhonghao Jiang, Zhifan Ye, Haoye Wang, Jiakun Liu, Xiaoxue Ren

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对仓库级代码生成中RAG方法的不足,提出基于部分依赖图的DyRetriever,构建DyCoder并在CoderEval、DevEval上取得显著性能提升且效率更高。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01881 2026-08-04 cs.MM cs.AI 新提交 57%

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体

Yuwen Wang, Tian-Hao Zhang, Minghao Cai, Yilin Ren, Ziyang Jiang, Xin Wang, Zhichao Wang, Pan Zhou, Kun Zhan, Xinyuan Qian

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01175 2026-08-04 cs.AI 新提交 57%

The Graph Language: How Knowledge Graphs Speak to Large Language Models

图语言:知识图谱如何与大语言模型对话

Giuseppe Pirrò

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究针对知识图谱与大语言模型融合的挑战,提出GRALAN模型,通过关系令牌实现KG在LLM语义空间的适配,在问答任务中显著优于现有方法,为KG-LLM融合提供新范式。

Comments Accepted to ISWC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00658 2026-08-04 cs.CL 新提交 57%

Select-And-Extract: A Lightweight Plugin for Retrieval-Augmented Generation

Select-And-Extract:一种用于检索增强生成的轻量级插件

Chenming Tang, Jiawei Han

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对RAG的检索与阅读两类失效模式,提出轻量级插件SANE,通过语义检索+LM选候选、蓝图引导证据提取实现稳定性能提升,且开销适度。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28978 2026-08-04 cs.AI cs.CE 版本更新 57%

VFEAgent: A Multimodal Agent Framework for End-to-End Automated Finite Element Analysis

VFEAgent: 面向端到端自动化有限元分析的多模态智能体框架

Jiachen Zhang, Junyi Lao, Chenghao Liu, Siyuan Liu, Shixin Wu, Linsen Zhang, Boyu Wang, Songfang Huang

机构 * Peking University(北京大学) China Agricultural University(中国农业大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出VFEAgent多智能体系统,通过多模态视觉-语言流水线和验证优先的代码合成框架,实现从输入图像和问题描述到有限元建模与仿真的端到端自动化。

Comments 9 pages, 3 figures, 2 tables. Equal contribution: Jiachen Zhang and Junyi Lao. Corresponding author: Songfang Huang. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05220 2026-08-04 cs.CL cs.SD 版本更新 57%

Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

Bagpiper: 通过丰富描述解决开放式音频任务

Jinchuan Tian, Haoran Wang, Bo-Hao Su, Chien-yu Huang, Qingzheng Wang, Jiatong Shi, William Chen, Xun Gong, Siddhant Arora, Chin-Jou Li, Masao Someki, Takashi Maekaku, Keita Goto, Yusuke Shinohara, Jin Sakuma, Chao-Han Huck Yang, Shinji Watanabe

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) LY Corporation(LY公司) NVIDIA Research(NVIDIA研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出Bagpiper,一个8B参数音频基础模型,通过丰富描述(自然语言描述)实现音频理解和生成的统一,在MMAU和AIRBench上超越Qwen-2.5-Omni,生成质量优于CosyVoice3和TangoFlux。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05698 2026-08-04 cs.AI 版本更新 57%

AIC-VDS: Attention-Based In-Context Learning for Joint Velocity Control and Data Collection Scheduling in Multi-UAV-Assisted Pipeline Monitoring

AIC-VDS:面向多无人机辅助管道监测的联合速度控制与数据采集调度的基于注意力的上下文学习

Yousef Emami, Miguel Gutierrez Gaitan, Atefeh Hajijamali Arani, Jingjing Zheng, Hao Zhou

机构 * IEEE

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多无人机辅助管道监测中丢包率高的问题,提出AIC-VDS框架,通过注意力模块压缩输入后利用LLM生成调度与速度决策,可将平均提示长度降50%并稳定丢包率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01535 2026-08-04 cs.CV cs.RO 新提交 50%

STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision

STAR-VLM:基于汽车雷达监督的时空视觉语言模型,用于运动与速度估计

Pou-Chun Kung, Aryaman Rao, Utkrisht Sahai, Hemanth Murali, Yi Liu, Rui-Yu Lin, Katherine A. Skinner

机构 * University of Michigan(密歇根大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究提出STAR-VLM框架,利用汽车雷达监督提升时空视觉语言模型的运动推理与度量速度估计能力,在驾驶场景相关任务上实现了优于特定任务方法的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00202 2026-08-04 cs.CR 新提交 50%

From Monoliths to Swarms: A Study of Attack Surface Evolution in the Transition to Multi-Agent Web Systems

从单体到群体:多智能体Web系统转型中的攻击面演化研究

Yashaswi Malla, Sandra Siby

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文针对从单智能体到多智能体Web系统转型的安全问题,提出MAS攻击向量分类法,构建WebMASLab测试平台,发现新型电话环路攻击对多数前沿多智能体模型威胁显著,提示防御通用性有限,揭示多智能体架构的新型安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05637 2026-08-04 cs.SE 版本更新 50%

Real Faults in Model Context Protocol (MCP) Software: a Comprehensive Taxonomy

模型上下文协议(MCP)软件中的真实故障:一种全面的分类

Mina Taraghi, Mohammad Mehdi Morovati, Foutse Khomh

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文首次提出MCP服务器故障的分类,通过实证研究识别出五个高层故障类别,揭示MCP特定故障与非MCP故障的区别,为提升AI软件系统的可靠性提供依据。

Comments Revised version following peer review. Expanded methodological details, practitioner-survey validation, statistical analyses, and discussion; main conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04630 2026-08-04 cs.CY 版本更新 50%

Reflection-Satisfaction Tradeoff: Investigating Impact of Reflection on Student Engagement with AI-Generated Programming Hints

反思与满足度的权衡:探讨反思对学生成就AI生成编程提示的影响

Heeryung Choi, Tung Phung, Mengyan Wu, Adish Singla, Christopher Brooks

专题命中 复杂问题求解 :planning(abstract)

AI总结 本研究探讨了反思提示对学生成就AI生成编程提示的影响,发现反思质量与提示满意度呈负相关,强调需重新考虑AI在教育中的训练和评估方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏