arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-20 至 2026-04-20 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2604.16158 2026-04-20 cs.CL cs.AI cs.LG 88%

AtManRL: Towards Faithful Reasoning via Differentiable Attention Saliency

AtManRL:通过可微注意力显著性实现更忠实的推理

Max Henning Höth, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu

机构 * Aleph Alpha Research Lab(Aleph Alpha研究实验室) TU Darmstadt(图林根大学) Hessian.AI Lab(黑森AI实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AtManRL方法,通过可微注意力操控学习更忠实的推理过程,结合GRPO框架优化正确性与可解释性,实验证明能识别关键推理token并提升模型透明度。

Comments 14 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15847 2026-04-20 cs.CL 87%

CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization

CiPO:通过迭代偏好优化实现大型推理模型的反事实去学习

Junyi Li, Yongqiang Chen, Ningning Ding

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 针对大型推理模型去学习难题,CiPO通过迭代偏好优化重新定义去学习为对推理过程的针对性干预,有效去除中间推理步骤和最终答案的知识,同时保持推理能力。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13792 2026-04-20 cs.CL cs.AI 82%

Interpretable Traces, Unexpected Outcomes: Investigating the Disconnect in Trace-Based Knowledge Distillation

可解释的轨迹,意外的结果:探讨基于轨迹的知识蒸馏中的断层

Siddhant Bhambri, Upasana Biswas, Subbarao Kambhampati

机构 * School of Computing & AI, Arizona State University(计算与人工智能学院,亚利桑那州立大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文通过规则问题分解设计实验,探讨基于轨迹的知识蒸馏中轨迹语义正确性与可解释性之间的断层,发现轨迹正确性并不能保证最终答案正确,且可解释的分解轨迹在准确性上不具优势。

Comments Accepted at The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09953 2026-04-20 cs.CL 79%

ATTNPO: Attention-Guided Process Supervision for Efficient Reasoning

ATTNPO:基于注意力的高效推理过程监督

Shuaiyi Nie, Siyu Ding, Wenyuan Zhang, Linhao Yu, Tianmeng Yang, Yao Chen, Weichong Yin, Yu Sun, Hua Wu, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司) Tianjin University(天津大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ATTNPO,通过利用模型内在注意力信号进行步骤级信用分配,有效减少推理长度并提升性能,适用于9个基准测试。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15648 2026-04-20 cs.CL cs.CV 79%

HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning

HyperGVL:超图理解与推理中大视觉-语言模型的基准测试与改进

Yanbin Wei, Chun Kang, Siwei Li, Haoxuan Che, Yang Chen, Hua Liu, Jian Liu, Zhuang Liu, Can Ouyang, Fei Xing, Lei Sha, Rui Liu, Yu Zhang, James Kwok

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究) Beihang University(北航)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出HyperGVL基准,评估12种先进LVLM在超图理解与推理中的能力,通过84,000个样本覆盖12种任务,引入可泛化的WiseHyGR路由器提升模型性能。

Comments Under Review; Opensource after accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16024 2026-04-20 cs.MA cs.CV 71%

AstroVLM: Expert Multi-agent Collaborative Reasoning for Astronomical Imaging Quality Diagnosis

AstroVLM:专家多智能体协作推理用于天体成像质量诊断

Yaohui Han, Tianshuo Wang, Zixi Zhao, Zhengchun Zhu, Shuo Ren, Yiru Wang, Rongliang Fu, Tinghuan Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区)

专题命中 复杂问题求解 :reasoning(title)

AI总结 本文提出AstroVLM,通过多智能体协作推理解决复杂天体成像质量诊断问题,实验表明其在实际任务中优于所有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13920 2026-04-20 cs.CL 70%

FACTS: Table Summarization via Offline Template Generation with Agentic Workflows

FACTS: 通过离线模板生成实现基于表格的摘要的代理工作流

Ye Yuan, Mohammad Amin Shabani, Siqi Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) RBC Borealis

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 FACTS通过离线模板生成实现高效、准确且隐私合规的表格摘要,优于现有方法,适用于实际查询需求。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21623 2026-04-20 cs.CL cs.AI cs.LG 67%

OjaKV: Context-Aware Online Low-Rank KV Cache Compression

OjaKV: 基于上下文的在线低秩KV缓存压缩

Yuxuan Zhu, David H. Yang, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati, Pin-Yu Chen

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OjaKV通过结合战略混合存储策略与在线子空间适应,实现KV缓存压缩,提升长上下文推理效率,无需微调模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15687 2026-04-20 cs.CL 57%

Preference Estimation via Opponent Modeling in Multi-Agent Negotiation

通过对手建模进行多智能体谈判中的偏好估计

Yuta Konishi, Kento Yamamoto, Eisuke Sonomoto, Rikuho Takeda, Ryo Furukawa, Yusuke Muraki, Takafumi Shimizu, Kazuma Fukumura, Yuya Kanemoto, Takayuki Ito, Shiyao Ding

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究生院) Accenture Japan Ltd(Accenture日本公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种整合自然语言信息的结构化贝叶斯对手建模框架,提升多智能体谈判中的偏好估计准确性与一致性。

Comments This paper is accepted as a Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23304 2026-04-20 cs.CV cs.AI 57%

MedGemma vs GPT-4: Open-Source and Proprietary Zero-shot Medical Disease Classification from Images

MedGemma vs GPT-4:开源与专有零样本医学疾病图像分类

Md. Sazzadul Islam Prottasha, Nabil Walid Rafi

机构 * Department of Information and Communication Technology, Bangladesh University of Professionals(信息与通信技术系,孟加拉国专业大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文比较了开源MedGemma与专有GPT-4在医学图像零样本疾病分类中的性能,MedGemma通过LoRA微调在准确率和敏感性上均表现更优,凸显了领域特定微调对临床应用的重要性。

Comments Accepted for publication in the Journal of Machine Learning and Deep Learning (JMLDL). 9 pages, 9 figures, 10 tables

Journal ref Journal of Machine Learning and Deep Learning, Vol. 2, No. 2, pp. 1-9, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15020 2026-04-20 cs.SE cs.HC 50%

Applying SHAPR in AI-Assisted Research Software Development: Lessons Learnt from Building a Share Trading System

在AI辅助研究软件开发中应用SHAPR:从构建股票交易系统中获得的经验

Ka Ching Chan

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文通过构建模块化股票交易系统案例,展示了SHAPR框架在AI辅助软件开发中的应用,强调持续文档更新、合同稳定编码、源码层提升连贯性等核心方法与贡献。

Comments 6 pages, 2 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08480 2026-04-20 cs.CV 50%

Video-STAR: Reinforcing Open-Vocabulary Action Recognition with Tools

Video-STAR: 通过工具强化开放词汇动作识别

Zhenlong Yuan, Xiangyan Qu, Chengxuan Qian, Rui Chen, Jing Tang, Lei Sun, Xiangxiang Chu, Dapeng Zhang, Yiwei Wang, Yujun Cai, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) University of California at Merced(加州大学默塞德分校) University of Queensland(昆士兰大学) Case Western Reserve University(凯斯西储大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Video-STAR通过结合上下文子动作分解与工具增强强化学习,提升开放词汇动作识别的细粒度匹配与跨模态推理能力,有效减少跨模态幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏