arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-13 至 2026-05-13 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2510.17062 2026-05-13 cs.CL cs.AI 81%

Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation

探究基于推理的语言模型在缓解社会偏见中的思维行为

Guoqing Luo, Iffat Maab, Lili Mou, Junichi Yamagishi

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于推理的语言模型在缓解社会偏见中的思维机制,发现两种导致偏见累积的失败模式,并提出轻量级提示方法减少偏见同时保持准确性。

Comments Due to issues found with the annotations in Section 4.3, we have decided to withdraw this preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11388 2026-05-13 cs.CL cs.AI 81%

Deep Reasoning in General Purpose Agents via Structured Meta-Cognition

通过结构化元认知实现通用代理中的深度推理

Dean Light, Michael Theologitis, Kshitish Ghate, Shuyue Stella Li, Benjamin Newman, Chirag Shah, Aylin Caliskan, Pang Wei Koh, Dan Suciu, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出深度推理方法,通过结构化元认知构建任务特定框架,提升复杂任务处理能力,在四个基准测试中超越现有方法,减少早终止和幻觉。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10082 2026-05-13 cs.CL cs.LG 81%

FERA: Uncertainty-Aware Federated Reasoning for Large Language Models

FERA:面向大语言模型的不确定性感知联邦推理

Ruhan Wang, Chengkai Huang, Zhiyong Wang, Junda Wu, Rui Wang, Tong Yu, Julian McAuley, Lina Yao, Dongruo Zhou

机构 * Indiana University(印第安纳大学) The University of New South Wales(新南威尔士大学) The Chinese University of Hong Kong(香港中文大学) University of California San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 FERA通过迭代服务器-客户端协同细化,解决联邦推理中客户端可靠性依赖查询的问题,提升多步骤推理能力,实验表明其在多个推理基准上优于联邦训练和无训练基线。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04476 2026-05-13 cs.CV 78%

Vision-aligned Latent Reasoning for Multi-modal Large Language Model

多模态大语言模型中的视觉对齐潜在推理

Byungwoo Jeon, Yoonwoo Jeong, Hyunseok Lee, Minsu Cho, Jinwoo Shin

机构 * Byungwoo Jeon Yoonwoo Jeong Hyunseok Lee Minsu Cho Jinwoo Shin

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出视觉对齐潜在推理框架,通过动态生成视觉对齐的潜在标记,提升多模态大语言模型在长上下文理解和精确视觉感知任务中的表现。

Comments Published as conference proceeding for ICML 2026. Last two authors advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09678 2026-05-13 cs.AI cs.LG cs.SE 76%

EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages

EsoLang-Bench: 通过奇特编程语言评估大语言模型的真实推理能力

Aman Sharma, Paras Chopra

机构 * Lossfunk

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI、cs.LG

AI总结 EsoLang-Bench通过五种奇特编程语言评估大语言模型在分布外编程语言上的推理能力,发现前沿模型在处理陌生语言时存在显著能力差距。

Comments 45 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12495 2026-05-13 cs.CV cs.AI cs.LG 62%

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

AlphaGRPO:通过分解性可验证奖励解锁UMMs中的自反思多模态生成

Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AlphaGRPO通过分解性可验证奖励提升多模态生成能力,实现文本到图像生成和自反思修正,验证了自反思强化方法在生成高质量输出中的有效性。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14717 2026-05-13 cs.AI cs.CR cs.CY cs.LG 62%

Layered Mutability: Continuity and Governance in Persistent Self-Modifying Agents

分层可变性:持续性与治理在持久自修改代理中的作用

Krti Tallam

机构 * Kamiwaza AI

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出分层可变性框架,分析持久自修改代理中行为持续性和治理挑战,指出突变速度、下游耦合强度、可逆性弱和可观测性低会导致层间不匹配,主要贡献是揭示了自修改代理的失效模式是组合漂移而非突变对齐。

Comments 17 pages, 2 figures, 3 tables. self-modifying agents; AI governance; identity drift; persistent memory; runtime adaptation; model editing Primary: cs.AI Cross-list: cs.LG, cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12087 2026-05-13 cs.AI cs.MA 57%

Intermediate Artifacts as First-Class Citizens: A Data Model for Durable Intermediate Artifacts in Agentic Systems

中间产物作为第一公民:代理系统中持久中间产物的数据模型

Josh Rosen, Seth Rosen

机构 * ThruWire, Inc.(ThruWire公司)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出一种数据模型,旨在保存可追溯、可版本化且可被下游计算使用的持久中间产物,以提高AI生成工作的可审查性和可维护性。

Comments 18 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07001 2026-05-13 cs.SE cs.CL 57%

SmellBench: Evaluating LLM Agents on Architectural Code Smell Repair

SmellBench:评估LLM代理在建筑代码异味修复上的表现

Ion George Dinu, Marian Cristian Mihăescu, Traian Rebedea

机构 * University of Craiova(克劳索瓦大学) NVIDIA(NVIDIA公司) University Politehnica of Bucharest(布加勒斯特理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出SmellBench框架,用于评估LLM代理在修复建筑代码异味方面的性能,通过专家验证发现最佳代理修复率为47.7%,但修复 aggressiveness 与代码库质量呈负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11814 2026-05-13 cs.AI 57%

MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

MedMemoryBench:个性化医疗中智能体记忆的基准测试

Yihao Wang, Haoran Xu, Renjie Gu, Yixuan Ye, Xinyi Chen, Xinyu Mu, Yuan Gao, Chunxiao Guo, Peng Wei, Jinjie Gu, Huan Li, Ke Chen, Lidan Shou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MedMemoryBench,通过合成真实医疗场景数据,评估智能体长期记忆能力,并揭示主流架构在复杂医疗推理中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09461 2026-05-13 cs.AI 57%

VulTriage: Triple-Path Context Augmentation for LLM-Based Vulnerability Detection

VulTriage:基于LLM的漏洞检测三路径上下文增强

Wenxin Tang, Xiang Zhang, Junliang Liu, Jingyu Xiao, Xi Xiao, Jinlong Yang, Yuehe Ma, Zhenyu Liu, Zhengheng Li, Zicheng Wang, Wang Luo, Qing Li, Lei Wang, Peng Xiangli

机构 * Tsinghua University(清华大学) Henan University(河南大学) Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Northwestern Polytechnical University(西北工业大学) BNU-HKBU United International College(北京理工大学-香港大学联合国际学院) Southeast University(东南大学) Jilin University(吉林大学) Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Guangzhou Intelligence Communications Technology Co., Ltd.(广州智能通信技术有限公司) The Fifth Electronic Research Institute of MIIT(信息产业部第五电子研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VulTriage框架,通过三路径上下文增强提升LLM在漏洞检测中的性能,实验表明其在关键指标上优于现有方法,且在低资源和类别不平衡场景下具有良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19207 2026-05-13 cs.CV 50%

Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs

长话短说:在对比视觉语言模型中解构组合性与长描述理解

Israfel Salazar, Desmond Elliott, Yova Kementchedjhieva

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文研究对比视觉语言模型中组合推理与长描述理解之间的关系,通过实验发现两者存在双向但敏感的关联,高质量数据和合理架构设计有助于提升模型泛化能力。

Comments To be published in Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏