arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-02 至 2026-04-02 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 15 篇

2508.07629 2026-04-02 cs.LG cs.AI cs.CL 87%

Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization

Klear-Reasoner: 通过梯度保持裁剪策略优化提升推理能力

Zhenpeng Su, Leiyu Pan, Xue Bai, Dening Liu, Guanting Dong, Jiaming Huang, Minxuan Lv, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

机构 * Klear Team, Kuaishou Technology(快手科技Klear团队)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Klear-Reasoner通过梯度保持裁剪策略优化提升推理能力,在数学和编程领域表现出色,达到多项基准测试的高分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09136 2026-04-02 cs.AI cs.CL cs.IR 73%

Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG

代理检索增强生成:关于代理RAG的综述

Aditi Singh, Abul Ehtesham, Saket Kumar, Tala Talaei Khoei, Athanasios V. Vasilakos

机构 * Cleveland State University(克利夫兰州立大学) Kent State University(肯特州立大学) Northeastern University(东北大学) Roux Institute at Northeastern University(东北大学鲁克斯研究所) University of Agder (UiA)(阿格德尔大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了代理RAG系统,分析了其架构分类、设计权衡及应用,指出其在灵活性、可扩展性和上下文感知方面的优势,并探讨了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00687 2026-04-02 cs.SE 67%

SCPatcher: Automated Smart Contract Code Repair via Retrieval-Augmented Generation and Knowledge Graph

SCPatcher:通过检索增强生成与知识图谱实现智能合约代码自动修复

Xiaoqi Li, Shipeng Ye, Wenkai Li, Zongwei Li

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SCPatcher框架,结合检索增强生成与知识图谱实现智能合约漏洞自动修复,通过构建5000个验证过的以太坊合约知识图谱,提升大语言模型推理能力,实现高修复率和编译通过率。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00657 2026-04-02 cs.SE cs.CR 67%

LibScan: Smart Contract Library Misuse Detection with Iterative Feedback and Static Verification

LibScan: 利用迭代反馈和静态验证的智能合约库误用检测

Yishun Wang, Wenkai Li, Xiaoqi Li, Zongwei Li, Lei Xie, Yuqing Zhang

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract)

AI总结 本文提出LibScan框架,结合大语言模型和规则分析,识别智能合约中八类库误用,通过迭代修正和知识库提升检测准确率至85.15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00304 2026-04-02 cs.CL cs.AI 62%

Asymmetric Actor-Critic for Multi-turn LLM Agents

多轮LLM代理的非对称Actor-Critic

Shuli Jiang, Zhaoyang Zhang, Yi Zhang, Shuo Yang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出非对称Actor-Critic框架,利用专有LLM作为Actor,开源模型作为Critic,提升多轮对话可靠性。实验显示该方法在τ-bench和UserBench上优于单Agent基线,且轻量级Critic表现优异。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00007 2026-04-02 cs.CL cs.AI 62%

Dynin-Omni: Omnimodal Unified Large Diffusion Language Model

Dynin-Omni: 多模态统一的大扩散语言模型

Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

机构 * AIDAS Lab Seoul National University [1.5ex] Project Page Code Model Demo -2em

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Dynin-Omni首次提出基于掩码扩散的多模态基础模型,统一文本、图像、语音的理解与生成,以及视频理解,通过共享离散令牌空间实现双向上下文迭代优化。

Comments Project Page: https://dynin.ai/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00005 2026-04-02 cs.AI cs.CL 62%

How Emotion Shapes the Behavior of LLMs and Agents: A Mechanistic Study

情绪如何塑造大语言模型和代理的行为:一种机制性研究

Moran Sun, Tianlin Li, Yuwei Zheng, Zhenhong Zhou, Aishan Liu, Xianglong Liu, Yang Liu

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出E-STEER框架,通过在隐藏状态中嵌入情绪作为可控变量,研究情绪对推理、生成、安全性和多步代理行为的影响,揭示情绪与行为之间的非单调关系。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24639 2026-04-02 cs.LG cs.AI 62%

Experiential Reflective Learning for Self-Improving LLM Agents

经验反思学习用于自我改进的LLM代理

Marc-Antoine Allard, Arnaud Teinturier, Victor Xing, Gautier Viaud

机构 * Illuin Technology

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出经验反思学习框架,通过反思任务轨迹生成可迁移的启发式方法,提升LLM代理在Gaia2基准上的任务完成可靠性与成功率。

Comments Published as a conference paper at the ICLR 2026 MemAgents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00790 2026-04-02 cs.AI 57%

RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning

RefineRL: 通过自我细化强化学习提升竞争性编程

Shaopeng Fu, Xingxing Zhang, Li Dong, Di Wang, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 RefineRL通过引入自我细化代理和强化学习方法,提升大语言模型在竞争性编程中的性能,实验表明其在紧凑模型中表现优异,接近大模型单次尝试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00344 2026-04-02 cs.CL stat.AP 57%

Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning

Agent Q-Mix: 通过强化学习选择LLM多智能体系统的合适动作

Eric Hanchen Jiang, Levina Li, Rui Sun, Xiao Liang, Yubei Li, Yuchen Wu, Haozheng Luo, Hengli Li, Zhi Zhang, Zhaolu Kang, Kai-Wei Chang, Ying Nian Wu

机构 * University of California Los Angeles(加州大学洛杉矶分校) University of Washington(华盛顿大学) Northwestern University(西北大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Agent Q-Mix框架,通过强化学习解决多智能体系统中拓扑选择问题,实现去中心化通信决策,提升任务准确率与token效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04921 2026-04-02 cs.CL 57%

AgentExpt: Automating AI Experiment Design with LLM-based Resource Retrieval Agent

AgentExpt: 基于LLM的资源检索代理自动化AI实验设计

Yu Li, Lehui Li, Lin Chen, Qingmin Liao, Fengli Xu, Yong Li

机构 * Tsinghua University(清华大学) Shandong University(山东大学) Northeastern University(东北大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于LLM的资源检索代理框架,通过自动化数据收集和集体感知增强检索,提升实验设计的自动化和可解释性,实验结果显示在Recall@20和HitRate@5上分别提升5.85%和8.30%。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00323 2026-04-02 cs.CL cs.CY 57%

Large Language Models in the Abuse Detection Pipeline

大语言模型在滥用检测流水线中的应用

Suraj Kath, Sanket Badhe, Preet Shah, Ashwin Sampathkumar, Shivani Gupta

机构 * Google LLC(谷歌有限责任公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨大语言模型在滥用检测生命周期中的应用,分析其在标签生成、检测、审核及审计等阶段的作用,并讨论其面临的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-04-02 cs.CV 50%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29620 2026-04-02 cs.CV cs.MM 50%

Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis

Unify-Agent:一种用于世界 grounded 图像合成的统一多模态代理

Shuang Chen, Quanxin Shou, Hangting Chen, Yucheng Zhou, Kaituo Feng, Wenbo Hu, Yi-Fan Zhang, Yunlong Lin, Wenxuan Huang, Mingyang Song, Dasen Dai, Bolin Jiang, Manyuan Zhang, Shi-Xue Zhang, Zhengkai Jiang, Lucas Wang, Zhao Zhong, Yu Cheng, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出Unify-Agent,一种统一多模态代理,用于世界 grounded 图像合成,通过代理流程提升图像生成质量,结合事实IP基准测试,展示其在多种任务中的优越表现。

Comments Project Page: https://github.com/shawn0728/Unify-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00275 2026-04-02 cs.SE 50%

Structure- and Event-Driven Frameworks for State Machine Modeling with Large Language Models

基于结构和事件的面向状态机建模的大型语言模型框架

Samer Abdulkarim, Evan Boyd, Karl Bridi, Alec Tufenkjian, Boqi Chen, Gunter Mussbacher

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出结合结构和事件驱动的框架,利用大型语言模型自动生成UML状态机,评估了不同模型在非结构化自然语言需求下的表现,发现混合方法能提升非推理模型性能,但无法进一步提升推理模型效果。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏