arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-04 至 2026-05-04 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 9 篇

2601.21214 2026-05-04 cs.CL cs.LG 88%

Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models

推理步扩展揭示弱点:解密和改进大语言模型中的推理泛化

Zhaoyi Li, Jiatong Li, Gangwei Jiang, Linqi Song, Defu Lian, Ying Wei

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学) City University of Hong Kong, Shenzhen Research Institute(香港城市大学深圳研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文通过多领域任务研究发现,推理错误集中在少数关键错误类型的位置,而非均匀分布。提出在推理过程中动态识别并禁用错误处理头,从而提升推理步泛化能力。

Comments 52 pages, accepted by ICLR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00257 2026-05-04 cs.CL cs.AI cs.IR 88%

Retrieval-Augmented Reasoning for Chartered Accountancy

增强推理的会计师事务所应用

Jatin Gupta, Akhil Sharma, Saransh Singhania, Ali Imam Abidi

机构 * Dept. of Computer Science and Engineering(计算机科学与工程系) Sharda University(沙达大学) Greater Noida, India(印度Greater Noida)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CA-ThinkFlow框架,通过参数高效检索增强生成方法,结合量化推理模型和文档布局感知系统,实现与大型专有模型相当的性能,但对复杂法规文本的推理能力仍有不足。

Comments 9 pages, 2 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10368 2026-05-04 cs.CL cs.AI 81%

Exploring the System 1 Thinking Capability of Large Reasoning Models

探索大型推理模型的系统1思维能力

Wenyuan Zhang, Shuaiyi Nie, Xinghua Zhang, Zefeng Zhang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型推理模型的系统1思维能力,提出S1-Bench基准测试,发现现有模型在简单问题上存在准确率低和效率差的问题,揭示了模型对问题难度的隐含编码。

Comments Accepted by IJCAI 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13595 2026-05-04 cs.AI 79%

The Quantization Trap: Breaking Linear Scaling Laws in Multi-Hop Reasoning

量化陷阱:多跳推理中的线性扩展定律破裂

Henry Han, Xiyang Liu, Xiaodong Wang, Fei Han, Xiaodong Li

机构 * School of Engineering and Computer Science, Baylor University(贝勒大学工程与计算机科学学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) School of Computer Science and Communication Engineering, Jiangsu University(江苏大学计算机科学与通信工程学院) Beijing Electronic Science and Technology Institute(北京电子科技学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究揭示多跳推理中量化降低反而增加能耗和降低准确性的现象,提出关键模型规模理论解释其成因。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00267 2026-05-04 cs.LG cs.AI cs.CR 62%

Jailbroken Frontier Models Retain Their Capabilities

突破边界模型仍保留其能力

Daniel Zhu, Zihan Wang, Jenny Bao, Jerry Wei

机构 * Anthropic

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,模型能力越强,越能抵御 jailbreak,且推理任务比知识回忆任务更易受攻击,边界点 jailbreaking 几乎无损安全模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13933 2026-05-04 cs.AI 57%

HyMem: Hybrid Memory Architecture with Dynamic Retrieval Scheduling

HyMem:混合内存架构与动态检索调度

Xiaochen Zhao, Kaikai Wang, Xiaowen Zhang, Chen Yao, Aili Wang

机构 * ZJU-UIUC Institute(浙大-伊利诺伊大学联合研究院) Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 HyMem通过多粒度内存表示实现动态按需调度,结合轻量级模块和LLM深度模块,有效平衡效率与性能,在长时记忆管理中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02327 2026-05-04 cs.CV 50%

PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance

PPLLaVA:通过提示引导的视频序列理解

Shangkun Sun, Ruyang Liu, Haoran Tang, Yixiao Ge, Haibo Lu, Wei Gao, Jiankun Yang, Chen Li

机构 * Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) XPeng Inc.(小鹏汽车有限公司) Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。

Comments Accepted to ICLR' 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00282 2026-05-04 cs.HC 50%

Developing an AI Concept Envisioning Toolkit to Support Reflective Juxtaposition of Values and Harms

开发一种AI概念展望工具包以支持反思性地比较价值观与危害

Pitch Sinlapanuntakul, Soyun Moon, Yuri Kawada, Yeha Chung, Mark Zachry

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出AI概念展望工具包,通过价值-危害卡片和价值-张力图,帮助设计者在早期阶段反思价值观与潜在危害,提升伦理透明度。

Comments 22 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00280 2026-05-04 cs.HC 50%

How Designers Envision Value-Oriented AI Design Concepts with Generative AI

设计师如何用生成式AI构思价值导向的人工智能设计概念

Pitch Sinlapanuntakul, Aayushi Dangol, Xiaoyi Xue, Mark Zachry

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究探讨设计师在使用生成式AI工具时如何平衡价值与潜在危害,揭示了递归价值冲突及多层级价值张力,提出通过元设计推理进行前瞻性判断的方法。

Comments 19 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏