arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-16 至 2026-04-16 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 18 篇

2604.13271 2026-04-16 cs.LG 91%

Enhancing Confidence Estimation in Telco LLMs via Twin-Pass CoT-Ensembling

通过双通道CoT-集成增强电信领域LLM的置信度估计

Anton Saenko, Pranshav Gajjar, Abiodun Ganiyu, Vijay K. Shah

机构 * NextG Wireless Lab(NextG无线实验室) North Carolina State University(北卡罗来纳州立大学)

专题命中 复杂问题求解 :CoT(title,title_cn);reasoning(abstract);分类 cs.LG

AI总结 本文提出双通道CoT-集成方法,通过多独立推理评估提升电信领域LLM的置信度估计,降低ECE误差达88%,提高模型自我评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10164 2026-04-16 cs.AI 90%

Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization

通过小规模偏好优化修剪大推理模型的长推理链

Bin Hong, Jiayu Liu, Kai Zhang, Jianwen Sun, Mengdi Zhang, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence(人工智能研究院) Hefei Comprehensive National Science Center(合肥综合性国家科学中心) Central China Normal University(中部师范大学) Meituan(美团) NeoShell

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出LCPO方法,通过统一的Bradley-Terry损失框架,有效减少大推理模型的输出长度,同时保持推理性能,实验显示在多个基准上平均输出长度减少超过50%。

Comments 26 pages, 8 figures, ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10245 2026-04-16 cs.AI cs.CL cs.LG 85%

TRIM: Hybrid Inference via Targeted Stepwise Routing in Multi-Step Reasoning Tasks

TRIM:通过多步推理任务中的目标逐步路由进行混合推理

Vansh Kapoor, Aman Gupta, Hao Chen, Anurag Beniwal, Jing Huang, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TRIM通过目标逐步路由在多步推理任务中提升推理效率,通过识别错误步骤并分配不同模型处理,实现更高的成本效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13395 2026-04-16 cs.AI cs.LG 81%

Quantifying and Understanding Uncertainty in Large Reasoning Models

对大规模推理模型中不确定性量化与理解的研究

Yangyi Li, Chenxu Zhao, Mengdi Huai

机构 * Department of Computer Science, Iowa State University(爱荷华州立大学计算机科学系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种量化推理-答案结构不确定性的新方法,并开发了基于Shapley值的统一解释框架,通过理论分析和实验验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20490 2026-04-16 cs.MA cs.CL cs.CV 79%

RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows

RadAgents: 多模态代理推理用于胸片解读的放射科工作流程

Kai Zhang, Corey D Barrett, Jangwon Kim, Lichao Sun, Tara Taghavi, Krishnaram Kenthapadi

机构 * Oracle Health AI Lehigh University(莱荷大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 RadAgents通过结合临床先验知识和任务感知的多模态推理,构建模块化、可审计的放射科工作流程,提升胸片解读的可靠性与临床一致性。

Comments MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23137 2026-04-16 cs.CV cs.CL 79%

When 'YES' Meets 'BUT': Can Large Models Comprehend Contradictory Humor Through Comparative Reasoning?

当‘是’遇见‘但是’:大型模型能否通过比较推理理解矛盾的幽默?

Tuo Liang, Zhe Hu, Jing Li, Hao Zhang, Yiren Lu, Yunlai Zhou, Yiran Qiao, Disheng Liu, Jeirui Peng, Jing Ma, Yu Yin

机构 * Computer and Data Sciences Department, Case Western Reserve University(卡内基梅隆大学计算机与数据科学系) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文探讨了大型视觉-语言模型在理解涉及复杂矛盾叙述的幽默时的挑战,通过分析漫画中的矛盾对比,提出YesBut基准,并评估了多种模型在比较推理任务中的表现,揭示了模型在视觉感知和叙事理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22750 2026-04-16 cs.CL cs.AI 73%

MARCH: Evaluating the Intersection of Ambiguity Interpretation and Multi-hop Inference

MARCH:评估歧义解释与多跳推理的交集

Jeonghyun Park, Ingeol Baek, Seunghyun Yoon, Haeun Jang, Aparna Garimella, Akriti Jain, Nedim Lipka, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang 大学) Adobe Research(Adobe 研究)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MARCH基准,通过多LLM验证和人工标注,包含2209个多跳歧义问题,揭示了当前模型在结合歧义解决与多步推理上的挑战,并提出CLARION框架提升推理系统鲁棒性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14142 2026-04-16 cs.LG cs.AI cs.CL 67%

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

从P(y|x)到P(y):在预训练空间中研究强化学习

Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tencent AI Lab(腾讯AI实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13634 2026-04-16 cs.CL cs.LG 62%

Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference

校准的推测解码:基于频率的候选选择以实现高效的推理

Xuwen Zhou, Fangxin Liu, Chao Wang, Xiao Zheng, Hao Zheng, Min He, Li Jiang, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Cloud Computing(阿里云 computing)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出校准的推测解码,通过频率引导的候选选择和概率保护的接受机制,提升大语言模型推理效率,实测效果优于现有方法。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13318 2026-04-16 cs.AI cs.CL 62%

WebXSkill: Skill Learning for Autonomous Web Agents

WebXSkill:自主网页代理的技能学习

Zhaoyang Wang, Qianhui Wu, Xuchao Zhang, Chaoyun Zhang, Wenlin Yao, Fazle Elahi Faisal, Baolin Peng, Si Qin, Suman Nath, Qingwei Lin, Chetan Bansal, Dongmei Zhang, Saravan Rajmohan, Jianfeng Gao, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft(微软)

专题命中 复杂问题求解 :planning(abstract);分类 cs.CL、cs.AI

AI总结 WebXSkill通过可执行技能框架解决自主网页代理在长周期任务中的执行与适应问题,提升任务成功率。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18847 2026-04-16 cs.CV cs.AI cs.CL 62%

Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions

失败让智能体更强:通过结构化反思提升准确性以实现可靠的工具交互

Junhao Su, Yuanliang Wan, Junwei Yang, Hengyu Shi, Tianyang Han, Junfeng Luo, Yurui Qiu

机构 * Vision Agent Team, Meituan(美团视觉代理团队) MeiGen AI Team, Meituan(美团MeiGen AI团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结构化反思方法,通过显式反思和优化提升工具交互的可靠性,实验表明在多轮工具调用中显著提高成功率并减少冗余调用。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08791 2026-04-16 cs.CL cs.AI 62%

Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments

通过自动化构建环境提升大语言模型的反馈驱动工具使用

Junjie Ye, Changhao Jiang, Zhengyin Du, Yufei Xu, Xuesong Yao, Zhiheng Xi, Xiaoran Fan, Qi Zhang, Tao Gui, Xuanjing Huang, Jiecao Chen

机构 * Fudan University(复旦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自动化环境构建流程和可验证奖励机制,提升大语言模型的工具使用能力,实验表明在不降低通用能力的情况下显著增强工具使用性能。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13417 2026-04-16 cs.SE cs.AI cs.MA 57%

Bridging Protocol and Production: Design Patterns for Deploying AI Agents with Model Context Protocol

Vasundra Srinivasan

机构 * Data Engineering for Multimodal AI (O’Reilly)(多模态AI数据工程(O’Reilly))

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

Comments 23 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20352 2026-04-16 cs.AI 57%

AMA: Adaptive Memory via Multi-Agent Collaboration

AMA:通过多智能体协作实现自适应记忆

Weiquan Huang, Zixuan Wang, Hehai Lin, Sudong Wang, Bo Xu, Qian Li, Beier Zhu, Linyi Yang, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Shandong University(山东大学) Nanyang Technological University(南洋理工大学) Southern University of Science and Technology(南方科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AMA框架,通过多智能体协作实现自适应记忆管理,解决传统方法在记忆粒度和一致性维护上的不足,实验表明其在长上下文任务中表现优异,减少约80%的token消耗。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14133 2026-04-16 cs.AI cs.CR cs.MA 57%

Formalizing the Safety, Security, and Functional Properties of Agentic AI Systems

形式化代理AI系统的安全、安全性和功能性属性

Edoardo Allegrini, Ananth Shreekumar, Z. Berkay Celik

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个统一的语义框架,用于分析、设计和部署正确、可靠且稳健的代理AI系统,通过形式化验证确保系统行为的安全性和功能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13313 2026-04-16 cs.LG 57%

Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding

具体丛林:迈向由具体性铺就的对比负样本挖掘以实现组合理解

Eun Woo Im, Dhruv Madhwal, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ConcretePlant,通过增强具体性术语的修改来提升对比学习信号,解决负样本生成中的梯度失衡问题,提出Cement损失函数以动态校准惩罚,实现更有效的组合理解。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19088 2026-04-16 cs.CL cs.CV 57%

Cracking the Code of Juxtaposition: Can AI Models Understand the Humorous Contradictions

破解 juxtaposition 的密码:AI 模型能否理解幽默的矛盾

Zhe Hu, Tuo Liang, Jing Li, Yiren Lu, Yunlai Zhou, Yiran Qiao, Jing Ma, Yu Yin

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了AI在理解基于矛盾叙事的幽默中的挑战,通过引入YesBut基准测试,评估大型语言模型在识别和解释漫画中的表现,发现即使是最先进的模型仍无法匹敌人类水平。

Comments NeurIPS 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13092 2026-04-16 cs.SE 50%

PlanCompiler: A Deterministic Compilation Architecture for Structured Multi-Step LLM Pipelines

PlanCompiler:一种确定性编译架构用于结构化多步骤LLM流水线

Pranav Harikumar

专题命中 复杂问题求解 :planning(abstract)

AI总结 PlanCompiler通过类型节点注册表、静态图验证和确定性编译分离规划与执行,提升结构化LLM流水线的可靠性与效率,实现高成功率和成本效益。

Comments 31 pages, 1 figure, 7 tables, includes appendices and reproduction details

详情

展开后加载摘要…

URL PDF HTML 收藏