arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-25 至 2026-05-25 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2605.20201 2026-05-25 cs.CL cs.AI cs.LG 89%

Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning

基于代理思维链调优的长上下文推理

Miao Li, Irina Saparina, Alexander Gurung, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ProxyCoT训练框架,通过将短代理上下文中的推理能力迁移到完整长上下文中,以提升大语言模型在长上下文复杂推理任务上的表现。

Comments Long paper, ACL 2026 (Main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16331 2026-05-25 cs.LG 89%

Decoding the Critique Mechanism in Large Reasoning Models

解码大型推理模型中的批判机制

Hoang Phan, Quang H. Nguyen, Hung T. Q. Le, Xiusi Chen, Heng Ji, Khoa D. Doan

机构 * VinUni-Illinois Smart Health Center(VinUniversity-伊利诺伊州智能健康中心) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);self-correction(abstract)

AI总结 本文通过插入算术错误研究大型推理模型如何从错误中恢复,发现存在隐藏的批判向量,通过引导潜在表示可提升错误检测和测试时扩展性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23074 2026-05-25 cs.AI 87%

PathCal: State-Aware Reflection-Marker Calibration for Efficient Reasoning

PathCal: 状态感知的反思标记校准用于高效推理

Lingyu Jiang, Zirui Li, Shuo Xing, Peiran Li, Tsubasa Takahashi, Dengzhe Hou, Zhengzhong Tu, Kazunori Yamada, Fangzhou Lin

机构 * Tohoku University(东大大学) Texas A&M University(德克萨斯A&M大学) Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出PathCal,一种无需训练的解码控制器,通过区分反思标记类型并在局部不确定状态进行干预,校准推理路径,在保持或提升准确率的同时减少生成长度。

Comments 21 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22826 2026-05-25 cs.CL cs.AI cs.GT cs.MA 73%

Evaluating Large Language Models in a Complex Hidden Role Game

评估大型语言模型在复杂隐藏角色游戏中的表现

Niklas Bauer

机构 * University of Göttingen(哥廷根大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过社交推理游戏《秘密希特勒》评估大型语言模型的推理、说服和欺骗能力,引入新指标并发现当前模型在复杂多轮操纵中效果不佳。

Comments Master's thesis, University of Göttingen

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22902 2026-05-25 cs.LG cs.AI cs.CL 67%

Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

Transcoders 追踪视觉语言模型中的视觉基础与幻觉

Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos, Vassilis Katsouros, Georgios Paraskevopoulos

机构 * Institute of Language and Speech Processing(语言与语音处理研究所) Athena Research Center(雅典研究中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 采用基于Transcoders的功能中心框架分解视觉语言模型的计算路径,揭示视觉输入如何影响文本生成,并通过反事实分析和图结构特征预测幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11243 2026-05-25 cs.LG cs.CL 62%

Evaluating Memory Structure in LLM Agents

评估LLM智能体中的记忆结构

Alina Shutova, Alexandra Olenina, Ivan Vinogradov, Anton Sinitsin

机构 * HSE University(莫斯科国立高等经济学院) Yandex YSDA New Economic School(新经济学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出StructMemEval基准测试,通过结构化记忆任务(如交易账本、待办事项列表、树结构等)评估LLM智能体组织长期记忆的能力,发现简单检索增强LLM难以胜任,而记忆智能体在提示下可解决,但现代LLM在无提示时无法自主识别记忆结构。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22883 2026-05-25 cs.AI cs.LG cs.PF 62%

Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems

每个成功目标的能量:面向智能体AI系统的目标级能量核算

Deepak Panigrahy, Aakash Tyagi

机构 * Independent Researcher(独立研究者) Texas A\&M University(德克萨斯A&M大学) Texas A\&M University Department of Computer Science(德克萨斯A&M大学计算机科学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出A-LEMS框架,将AI能量核算单位从每次推理能量转换为每个成功目标能量(EpG),并定义编排开销指数(OOI),实验表明智能体工作流平均能耗是线性基线的4.33倍,且能耗主要由编排结构而非推理计算驱动。

Comments 34 pages, 16 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23753 2026-05-25 cs.LG 57%

SeedER: Seed-and-Expand Retrieval from Knowledge Graphs

SeedER: 基于种子扩展的知识图谱检索

Hamed Shirzad, Frederik Wenkel, Dominique Beaini, Danica J. Sutherland, Emmanuel Noutahi

机构 * Valence Labs, Montréal, QC, Canada(Valence实验室,加拿大魁北克省蒙特利尔) University of British Columbia, Department of Computer Science, Vancouver, BC, Canada(不列颠哥伦比亚大学计算机科学系,加拿大不列颠哥伦比亚省温哥华)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 提出SeedER框架,通过轻量级种子节点选取和图感知策略的强化学习迭代扩展,高效检索知识图谱中与查询相关的节点,在组合泛化和图约束子模优化上具有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18470 2026-05-25 cs.SE cs.AI cs.MA 57%

SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios

SWE-EVO:在长周期软件演化场景中基准测试编码智能体

Tue Le, Minh V. T. Thai, Dung Nguyen Manh, Huy Phan Nhat, Nghi D. Q. Bui

机构 * FPT Software AI Center(FPT软件人工智能中心) School of Computing and Information Systems(计算与信息系统学院) University of Melbourne(墨尔本大学) Center of AI Research(人工智能研究中心) VinUniversity(文大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对现有基准测试仅关注孤立单任务问题,提出SWE-EVO基准,包含48个需跨多文件多步骤修改的长周期任务,实验显示当前智能体在此类任务上表现显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23636 2026-05-25 eess.SY cs.SY 50%

RF Instrument Agent (RFIA): Empowering RF Instruments with Natural Language Understanding, Scheduling and Execution of Complex Tasks

RF仪器智能体 (RFIA): 赋予射频仪器自然语言理解、调度与执行复杂任务的能力

Chunhui Li, Wei Fan

专题命中 复杂问题求解 :planning(abstract)

AI总结 提出RFIA框架,通过解耦意图-规划-执行架构和结构化知识库,实现基于自然语言的可靠射频仪器控制,并在商用矢量网络分析仪上验证了多任务自动化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23463 2026-05-25 eess.AS 50%

StepAudio 2.5 Technical Report

StepAudio 2.5 技术报告

Bin Lin, Bo Zhao, Boyong Wu, Chao Yan, Chen Wu, Cheng Yi, Chengyuan Yao, Daijiao Liu, Fei Tian, Feng Tian, Haiyang Sun, Haoyang Zhang, Jiangjie Zhen, Jinglan Gong, Jun Chen, Li Xie, Peilin Li, Peng Yang, Pengfei Tan, Qingjian Lin, Runze Li, Shenghua Hu, Siyi Zhou, Wenwen Qu, Xiangyu Li, Xiangyu Tony Zhang, Xuerui Yang, Yang Yang, Yechang Huang, Yu Fu, Yuchu Luo, Yuxin Li, Yuxin Zhang, Zhengyan Sheng, Brian Li, Chang Zeng, Changlin Zhang, Chen Geng, Chenghao Dong, Chengli Feng, Dan Zhou, Danni Wan, Di Chen, Die Zhang, Dongqing Pang, Guanglong Yang, Guoqiang Hu, Huangxi Zhu, Jianzheng Gao, Jinghua Liang, Jinmei Wan, Junjie Yuan, Kang An, Lei Lei, Limin Zhong, Lun Cai, Mengqiang Ren, Min Xu, Mingliang Li, Mingxiao Li, Na Wang, Qiang Tong, Qiaoling Huang, Qingfu Du, Rui Wang, Shengchen Zhou, Shi Qiu, Shihao Peng, Shiliang Yang, Siqi Tu, Tianjiao Deng, Ting Xu, Tong Wang, WeiMing Niu, Wuxun Xie, Xianwei Zhang, Xianyu Feng, Xiaojia Liu, Xing Chen, Xiongbin Wu, Yan Wu, Yang Li, Yi Liu, Yifan Zhang, Yile Liu, Yongshen Long, Yu Luo, Yuanhao Ding, Yuhao Wang, Yuhe Yin, Yunfang Xu, Yuxiang Yang, Zhiguo Huang, Zhiyue Wu, Zichao Li, Zichao Zhou, Daxin Jiang, Future Li, Gang Yu, Xiangyu Zhang, Yibo Zhu

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出统一音频语言基础模型StepAudio 2.5,通过任务定制的RLHF后训练和专用解码策略,在ASR、TTS和实时口语交互三项任务上达到或超越专用系统水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22942 2026-05-25 cs.CV 50%

Improved Vision-to-Chart Buoy Association with Learned World-to-Image Projection

改进的视觉到图表浮标关联:学习世界到图像投影

Borja Carrillo-Perez

机构 * Arquimea Research Center(阿基米德研究中心)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对MaCVi 2026视觉到图表数据关联挑战,提出在DETR融合变压器基线中增加专用MLP(QueryMLP)来显式预测浮标水线接触点的像素坐标,从而减轻变压器的几何推理负担,在测试集上取得Overall 0.7386、F1 0.8055、mIoU 0.6718,排名第二。

Comments 5 pages, 3 figures. Technical report for the MaCVi 2026 Vision-to-Chart Data Association Challenge at the CVPR 2026 Workshop; 2nd place submission. Code: https://github.com/bcarrpe/macvi26-visionmap-querymlp

详情

展开后加载摘要…

URL PDF HTML 收藏