arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4991 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4991 篇

2606.05382 2026-06-05 cs.AI 79%

Synthetic Contrastive Reasoning for Multi-Table Q&A

合成对比推理用于多表问答

Ankit Pratap Singh, Xin Su, Phillip Howard

机构 * Iowa State University(爱荷华州立大学) Thoughtworks

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多表问答缺乏推理监督的问题,提出通过异构LLM生成合成对比推理轨迹,并利用对比偏好优化微调模型,在MMQA上提升9.7%-16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04454 2026-06-04 cs.CL 79%

Stepwise Reasoning Enhancement for LLMs via External Subgraph Generation

通过外部子图生成增强大语言模型的逐步推理

Xin Zhang, Yang Cao, Baoxing Wu, Kai Song, Siying Li

机构 * School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出SGR框架,通过从知识图谱生成查询相关子图来引导大语言模型进行逐步推理,提升复杂多步推理的准确性、鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01161 2026-06-04 cs.LG 79%

Reasoning Shift: How Context Silently Shortens LLM Reasoning

推理偏移:上下文如何无声地缩短LLM推理

Gleb Rodionov, Roman Garipov, George Yakushev

机构 * Yandex HSE University(俄罗斯高等经济学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 通过系统评估,发现推理模型在不同上下文条件下(如无关长上下文、多轮对话、子任务)对同一问题的推理链长度显著缩短(最高65%),且伴随自我验证和不确定性管理行为减少,但简单任务性能不受影响,复杂任务可能受影响。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03205 2026-06-04 cs.CL 79%

Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use

学习何时行动或拒绝:为安全的多步骤工具使用守护代理推理模型

Aradhye Agarwal, Gurdit Siyan, Yash Pandya, Joykirat Singh, Akshay Nambi, Ahmed Awadallah

机构 * Microsoft Research(微软研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出MOSAIC框架,通过显式安全推理和基于偏好的强化学习,使代理模型在工具使用中安全决策,减少有害行为并保持良性性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14760 2026-06-04 cs.CL 79%

Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Deliberation

推理边界:通过测试时深思增强规范对齐

Haoran Zhang, Yafu Li, Xuyang Hu, Dongrui Liu, Zhilin Wang, Bo Li, Yu Cheng

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) University of Science and Technology of China, Hefei, Anhui, China(中国科学技术大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出Align3方法,利用测试时深思(TTD)和分层反思修正来推理规范边界,并构建SpecBench基准,实验表明TTD能有效增强规范对齐。

Comments 10 pages main text, 52 pages total (including appendix). Code and resources are available at https://github.com/zzzhr97/SpecBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03705 2026-06-03 cs.AI 79%

Code-on-Graph: Iterative Programmatic Reasoning via Large Language Models on Knowledge Graphs

图上的代码:通过大型语言模型在知识图谱上进行迭代式程序化推理

Weiwei Ding, Zixuan Li, Long Bai, Zhuo Chen, Kun Su, Fei Wang, Xiaolong Jin, Jin Zhang, Jiafeng Guo, Xueqi Cheng

机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全重点实验室) Shandong University(山东大学) Shandong University-Weihai Research Institute of Industrial Technology(山东大学威海工业技术研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出Code-on-Graph (CoG)框架,通过将知识图谱模式表示为Python类并生成可执行代码,解决现有LLM-KG集成中操作符不灵活和知识注入不可扩展的问题,在WebQSP、CWQ和GrailQA上提升高达10.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16302 2026-06-03 cs.AI cs.IR 79%

DTKG: Dual-Track Knowledge Graph-Verified Reasoning Framework for Multi-Hop QA

DTKG: 用于多跳问答的双轨知识图谱验证推理框架

Changhao Wang, Yanfang Liu, Xinxin Fan, Ao Tian, Lanzhi Zhou, Yunfeng Lu

机构 * School of Computer Science Engineering, Beihang University, Beijing, China School of Reliability Systems Engineering, Beihang University, Beijing, China State Key Laboratory of Complex \& Critical Software Environment National Key Laboratory of Reliability State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出DTKG框架,通过分类阶段和分支处理阶段分别处理并行事实验证和链式多跳推理,提升多跳问答的效率和准确性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01912 2026-06-02 cs.AI 79%

SMH-Bench: Benchmarking LLM Agents for Environment-Grounded Reasoning and Action in Smart Homes

SMH-Bench:用于智能家居中环境基础推理与行动的LLM代理基准测试

Kuan Li, Shuo Zhang, Huacan Wang, Fangzhou Yu, Zecheng Sheng, Yi Gu, Weipeng Ming, Lei Xue, Chen Liu, Sen Hu, Ronghao Chen, Siyue Lin, Yuqing Hou, Xiaofeng Mou, Yi Xu

机构 * Midea Group(美的集团) Beijing University of Posts and Telecommunications(北京邮电大学) Donghua University(东华大学) The University of Sydney(悉尼大学) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出SMH-Bench基准,基于可执行模拟器HomeEnv,通过1100个任务评估LLM在智能家居中的推理与行动能力,发现前沿模型在自动化调度、模糊处理和个性化推理方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00564 2026-06-02 cs.CV cs.CL 79%

Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding

面向视觉-语言推理的分解式在策略蒸馏:引导梯度实现视觉定位

Hee Suk Yoon, Eunseop Yoon, Jaehyun Jang, SooHwan Eom, Ji Woo Hong, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, Chang D. Yoo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 通过将视觉-语言模型蒸馏损失分解为语言先验和视觉定位两个正交分量,提出视觉梯度引导(VGS)方法动态调整更新方向以优先优化视觉子空间,从而提升小模型在复杂多模态任务中的定位能力。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23161 2026-06-02 cs.AI 79%

PATRA: Pattern-Aware Alignment and Balanced Reasoning for Time Series Question Answering

PATRA: 面向时间序列问答的模式感知对齐与平衡推理

Junkai Lu, Peng Chen, Xingjian Wu, Yang Shu, Chenjuan Guo, Christian S. Jensen, Bin Yang

机构 * East China Normal University, Shanghai, China(华东师范大学) Aalborg University, Aalborg, Denmark(奥胡斯大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对现有LLM方法在时间序列推理中忽略模式提取和简单任务主导学习的问题,提出模式感知对齐与平衡推理模型PATRA,通过提取趋势和季节模式实现深度对齐,并设计任务感知平衡奖励以协调不同难度任务的学习,在多种时间序列问答任务中优于强基线。

Comments Accepted By ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31378 2026-06-01 cs.CL 79%

Unlocking Fine-Grained Translation Quality Estimation in LRMs through Synergistically Evolving Implicit and Explicit Reasoning

解锁大型推理模型中细粒度翻译质量评估:通过协同演化隐式和显式推理

Renfei Dang, Xinye Wang, Zhejian Lai, Weilu Xu, Shimin Tao, Daimeng Wei, Min Zhang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Huawei Translation Services Center, Beijing, China(北京华为翻译服务中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 针对大型推理模型在细粒度翻译质量评估上的困难,提出RIEQE两阶段训练框架,通过非思考监督微调(隐式推理)和思考强化学习(显式推理)协同演化,在WMT测试集上超越基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07905 2026-06-01 cs.AI 79%

MedCoG: Maximizing LLM Inference Density in Medical Reasoning via Meta-Cognitive Regulation

MedCoG:通过元认知调节最大化医学推理中的LLM推理密度

Yu Zhao, Hao Guan, Yongcheng Jing, Ying Zhang, Dacheng Tao

机构 * College of Computer Science, VCIP, DISSec Center, Nankai University, China 300350(南开大学计算机学院、VCIP、DISSec中心、中国300350) Generative AI Lab, College of Computing and Data Science(生成式人工智能实验室、计算与数据科学学院) Nanyang Technological University, Singapore 639798(南洋理工大学,新加坡639798)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出MedCoG框架,利用元认知评估动态调节知识使用,以缓解推理扩展定律下的收益递减,提升推理效率与准确性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02743 2026-06-01 cs.CV cs.AI 79%

Reasoning-Aware Multimodal Fusion for Hateful Video Detection

面向仇恨视频检测的推理感知多模态融合

Shuonan Yang, Tailin Chen, Jiangbei Yue, Guangliang Cheng, Jianbo Jiao, Zeyu Fu

机构 * Multimodal Intelligence Lab(多模态智能实验室) Department of Computer Science(计算机科学系) University of Exeter(埃克塞特大学) School of Computer Science(计算机科学学院) University of Leeds(利兹大学) School of Computer Science and Informatics(计算机科学与信息学学院) University of Liverpool(利物浦大学) University of Birmingham(伯明翰大学) Machine Intelligence + x Group(机器智能+X小组)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出推理感知多模态融合框架,通过局部-全局上下文融合和语义交叉注意力实现多模态交互,并引入对抗推理生成互补语义视角,在仇恨视频检测中提升Macro-F1和召回率3%和7%。

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10228 2026-05-29 cs.AI 79%

SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning

SVSR:一种用于多模态推理的自我验证与自我修正范式

Zhe Qian, Nianbing Su, Zhonghua Wang, Hebei Li, Zhongxing Xu, Yueying Li, Fei Luo, Zhuohan Ouyang, Yanbiao Ma

机构 * South China Agricultural University(华南农业大学) University of Glasgow(格拉斯哥大学) University of Electronic Science and Technology of China(电子科技大学) Monash University(莫纳什大学) University of Science and Technology of China(中国科学技术大学) National University of Defense Technology(国防科技大学) Renmin University of China(中国人民大学) South China Normal University(华南师范大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出SVSR框架,通过三阶段训练(统一偏好数据集构建、冷启动监督微调、半在线直接偏好优化)将自我验证与自我修正显式集成到多模态推理流程中,提升复杂视觉理解和多模态推理的鲁棒性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19202 2026-05-29 cs.CL 79%

Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning

通过探针知识和推理揭示LLMs中的科学问题解决

Alan Li, Yixin Liu, Arpan Sarkar, Doug Downey, Arman Cohan

机构 * Department of Computer Science, Yale University Department of Molecular \& Cellular Biology, Harvard University Allen Institute for AI Department of Computer Science, Northwestern University

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SciReas基准和KRUX探针框架,系统评估LLMs在科学推理中的知识与推理角色,发现知识检索是主要瓶颈,外部上下文知识和推理增强均能提升性能。

Comments 33 pages, 18 figures

Journal ref ICML 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27150 2026-05-29 cs.AI cs.MA 79%

MediHive: A Decentralized Agent Collective for Medical Reasoning

MediHive:用于医学推理的去中心化智能体集体

Xiaoyang Wang, Christopher C. Yang

机构 * College of Computing and Informatics, Drexel University(德雷塞尔大学计算与信息学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出一种去中心化多智能体框架MediHive,通过共享记忆池和迭代融合机制,使LLM智能体自主分配角色、进行条件性基于证据的辩论并融合观点,在MedQA和PubMedQA上分别达到84.3%和78.4%的准确率。

Comments Accepted by Journal of Healthcare Informatics Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00994 2026-05-29 cs.AI 79%

Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning

推理与工具使用在智能体强化学习中的竞争:从量化干扰到解耦调优

Yu Li, Mingyang Yi, Xiuyu Li, Ju Fan, Fuxin Jiang, Binbin Chen, Peng Li, Jie Song, Tieying Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Bytedance Inc.(字节跳动公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过引入能力效应归因(CEA)量化推理与工具使用行为之间的干扰,并提出解耦动作-推理调优(DART)框架,通过分离参数更新来提升智能体强化学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28774 2026-05-28 cs.CL 79%

Agent Explorative Policy Optimization for Multimodal Agentic Reasoning

Agent探索性策略优化用于多模态Agent推理

Minki Kang, Shizhe Diao, Ryo Hachiuma, Sung Ju Hwang, Pavlo Molchanov, Yu-Chiang Frank Wang, Byung-Kwan Lee

机构 * NVIDIA KAIST(韩国科学技术院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 针对多模态Agent推理中思考与工具使用的不对称性(Thinking-Acting Gap),提出AXPO算法,通过固定思考前缀并重采样工具调用及其延续,结合基于不确定性的前缀选择,显著提升工具使用率和模型性能。

Comments Project page: https://byungkwanlee.github.io/AXPO-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27596 2026-05-28 cs.CL 79%

Can Hallucinations Be Useful? Solving Multi-Hop Questions With SLMs By Chaining System-I/II Reasoning

幻觉能否有用?通过链式系统I/II推理用SLM解决多跳问题

Saptarshi Sengupta, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出一种“先回答后推理”的认知启发框架,利用SLM的初始答案(可能包含幻觉)作为假设来检索证据,再通过系统II深度推理,从而在多跳问答任务上超越传统的“先思考后检索”方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03491 2026-05-28 cs.CV cs.CL 79%

Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance

解耦骨架与血肉:基于解缠对齐和结构感知引导的高效多模态表格推理

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Xiaoqiang Zhou, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出DiSCo解缠结构-内容对齐框架和Table-GLS全局到局部结构引导推理框架,高效增强LVLM的表格理解与推理能力,无需昂贵监督或外部工具。

Comments Accepted as a Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23395 2026-05-26 cs.LG 79%

Convex Compositional Reasoning Models

凸组合推理模型

Meir Roketlishvili, Semyon Semenov, Maksim Bobrin, Viktor Kovalchuk, Albert Baichorov, Abduragim Shtanchaev, Fakhri Karray, Dmitry V. Dylov, Martin Takáč, Arip Asadulaev

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Applied AI Institute(应用人工智能研究所) Computational Imaging Lab(计算成像实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 针对组合推理中能量景观的非凸几何瓶颈,提出凸组合能量最小化框架,通过输入凸神经网络参数化因子并优化紧凸松弛,实现确定性投影一阶优化,在小问题上训练后可零样本迁移到大实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24050 2026-05-26 cs.LG 79%

Bridging On-Device and Cloud LLMs for Collaborative Reasoning: A Unified Methodology for Local Routing and Post-Training

桥接设备端与云端大语言模型实现协作推理:本地路由与后训练的统一方法

Wenzhi Fang, Dong-Jun Han, Liangqi Yuan, Evan Chen, Christopher Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 提出通过强化学习后训练使设备端LLM内部决定是否调用云端,结合分层奖励和自适应提示过滤,显著缩小与纯云端LLM的性能差距。

Comments We propose a unified post-training framework that integrates routing optimization, enabling the on-device LLM to improve its problem-solving ability while learning routing strategies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22072 2026-05-22 cs.CL cs.CV 79%

Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

Faithful-MR1: 通过锚定和强化视觉注意力实现忠实的多模态推理

Changyuan Tian, Zhicong Lu, Huaxing Liu, Xiang Wang, Shuai Li, Yu Chen, Wenqian Lv, Zichuan Lin, Juncheng Diao, Deheng Ye

机构 * AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Faithful-MR1框架,通过锚定和强化视觉注意力解决多模态推理中的忠实性问题,提升模型在多模态基准上的表现。

Comments 20 pages, 7 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07021 2026-05-21 cs.AI 79%

Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight

行为线索推理:通过监督提高推理的效率和安全性

Christopher Z. Cui, Taylor W. Killian, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Brigham Young University

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出行为线索推理方法,通过引入行为线索来增强大语言模型的可控性和可监控性,从而在复杂数学问题解决中减少50%的无效推理token,并在安全行动恢复方面将成功率从46%提升至96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14184 2026-05-21 cs.CV cs.AI 79%

Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models

更深入的思考,更弱的目标:理解并缓解多模态大语言模型推理过程中感知障碍

Ruiying Peng, Xueyu Wu, Jing Lei, Lu Hou, Yuanzheng Ma, Xiaohui Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies(华为技术)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在推理过程中出现的视觉感知障碍问题,提出了一种无需训练的视觉区域引导注意力框架,通过选择和重新加权视觉头部来引导模型关注与问题相关区域,从而提高视觉定位和推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19485 2026-05-20 cs.AI 79%

Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models

基于注意力引导的强化学习对抗大推理模型的 jailbreak 方法

Zheng Lin, Zhenxing Niu, Haoxuan Ji, Yuzhe Huang, Haichang Gao

机构 * Xidian University(西安电子科技大学) Xi’an Jiaotong University(西安交通大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了对抗大推理模型的 jailbreak 攻击,发现攻击成功率与模型的注意力模式密切相关,并提出了一种基于强化学习的方法,通过将注意力信号纳入奖励函数设计来提升攻击效果,同时引入多样化的说服策略以提高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22530 2026-05-19 cs.AI 79%

Enhancing Table Reasoning with Deterministic Table-State Rewards

通过确定性表格状态奖励增强表格推理

Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He, Xiaofeng Lin, Peng Lu, Liheng Ma, Chunhe Wang, Chun Ho Mak, Yuyu Luo, Ying Nian Wu, Lei Ding, Guang Cheng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) University College London(伦敦大学学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manitoba(曼尼托巴大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TABROUGE,一种无需训练的确定性状态奖励,通过改进的LCS指标评估表格状态,提升表格推理准确率并减少样本需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16117 2026-05-18 cs.CL 79%

SGR: A Stepwise Reasoning Framework for LLMs with External Subgraph Generation

SGR:一种用于LLM的分步推理框架,通过外部子图生成

Xin Zhang, Yang Cao, Baoxing Wu, Kai Song, Siying Li

机构 * School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 SGR通过外部子图生成提升LLM推理能力,利用结构化知识支持多步推理,实验表明在多个基准数据集上均优于基线方法,提高了推理准确性和事实可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14928 2026-05-15 cs.CL 79%

Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA

过程链:用于过程问答的层次视觉语言推理

Guanhua Chen, Yutong Yao, Shenghe Sun, Ci-Jun Gao, Shudong Liu, Lidia S. Chao, Feng Wan, Derek F. Wong

机构 * NLP CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学CT实验室) Department of Electrical and Computer Engineering, University of Macau(电气与计算机工程系,澳门大学) Centre for Cognitive and Brain Sciences, University of Macau(认知与脑科学中心,澳门大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ProcedureVQA基准,针对视觉过程问答任务,通过过程链框架解决现有VLMs在跨模态检索和步骤分解上的不足,实验显示其在六个VLMs上提升达13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13213 2026-05-15 cs.AI 79%

Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning

多模态多智能体推理的分层攻击

Hao Zhou, Tiru Wu, Yan Jiang, Wanqi Zhou, Junxing Hu, Ai Han

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出HAM³框架,通过感知、通信、推理三层分层攻击,评估多智能体系统在不同推理范式下的攻击成功率,揭示多模态多智能体系统的安全漏洞。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏