arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 5820 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 878 篇

2608.02585 2026-08-11 cs.LG cs.CL 版本更新 87%

GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning

GradCuit:信用分配梯度流实现鲁棒且可解释的测试时潜在推理

Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang, Song-Chun Zhu, Chi Zhang, Zilong Zheng

机构 * Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) School of Artificial Intelligence for Science, Peking University(北京大学科学人工智能学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 GradCuit在测试时插入可优化潜在状态,实现序列级信用分配,在多基准上准确率优于同类方法,且鲁棒性、可解释性更强,为LLM测试时推理扩展提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04815 2026-06-23 cs.LG cs.AI 版本更新 87%

Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents

边行动边学习:面向在线终身学习智能体的技能增强测试时协同进化框架

Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) Software Engineering Institute, East China Normal University(东华大学软件工程学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LifeSkill框架,通过验证器引导的技能学习和在线技能内化,使LLM智能体在测试时持续内化反馈,提升终身学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02880 2026-06-09 cs.AI cs.CL 版本更新 87%

ReTreVal: Reasoning Tree with Validation and Cross-Problem Memory for Large Language Models

ReTreVal:带有验证和跨问题记忆的推理树

Abhishek HS, Pavan C Shekar, Arpit Jain, Ashwanth Krishnan

机构 * QpiAI

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 ReTreVal通过自适应树探索、带工具增强的节点细化、类型化失败回溯和自修改记忆,使大语言模型在无需微调的情况下实现跨问题学习,其在MATH-500上达到85.8%的pass@1准确率,在MMLU-Pro上达到54.4%的准确率。

Comments 15 pages, 1 figure, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08728 2026-07-28 cs.AI cs.CL cs.CV cs.LG 版本更新 87%

Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery

人工智能数学推理:语言模型、神经符号系统与验证发现的综合综述

Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan, Sophia Ananiadou

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了数学推理领域从早期规则系统到当代推理模型、多智能体系统及验证发现工作流的演变,沿非正式推理、形式推理、数学发现及推理技术四轴组织,并评估了基准测试、失败模式及未来方向。

Comments Under review, 47 pages, 14 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15097 2026-07-21 cs.SE cs.CR 版本更新 87%

Veritas: Grounding LLM Agents for Reliable Vulnerability Reasoning over Stripped Binaries

Veritas:一种语义导向的代理框架,用于二进制中的内存破坏漏洞检测

Xinran Zheng, Alfredo Pesoli, Marco Valleri, Suman Jana, Lorenzo Cavallaro

专题命中 推理与问题求解 :LLM(title,summary_cn)

AI总结 Veritas通过结合静态切片、双视角LLM检测器和多代理验证器,利用语义基础和运行时证据检测二进制中的内存破坏漏洞,实现了90%的召回率,并在实际应用中发现了一个未知的Apple漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17889 2026-07-14 cs.CV 版本更新 87%

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20182 2026-07-08 cs.RO cs.MA 版本更新 87%

IndoorR2X: Indoor Robot-to-Everything Coordination with LLM-Driven Planning

IndoorR2X: 基于大语言模型的室内机器人与万物协调

Fan Yang, Soumya Teotia, Shaunak A. Mehta, Prajit KrisshnaKumar, Quanting Xie, Jun Liu, Yueqi Song, Wenkai Li, Atsunori Moteki, Kanji Uchino, Yonatan Bisk

机构 * Fujitsu Research(富士通研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 IndoorR2X通过整合移动机器人和静态物联网设备的观测数据,构建全局语义状态,实现可扩展的场景理解、减少冗余探索并利用大语言模型进行高层协调,提升多机器人系统的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14147 2026-07-08 cs.CV 版本更新 87%

LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

LaViDa-R1:推进统一多模态扩散语言模型的推理

Shufan Li, Yuchen Zhu, Jiuxiang Gu, Kangning Liu, Zhe Lin, Yongxin Chen, Molei Tao, Aditya Grover, Jason Kuen

机构 * Adobe UCLA(加州大学洛杉矶分校) Georgia Tech(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 研究提出多模态通用推理dLLM LaViDa-R1,不同于现有工作,它以统一方式整合多任务,采用新颖统一训练后框架,集成监督微调与多任务强化学习,并运用多种训练技术,在多模态任务上展现强大性能。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12756 2026-08-18 cs.LG 版本更新 86%

Closing the Loop: A Control-Theoretic Framework for Provably Stable Time Series Forecasting with LLMs

闭环:基于控制理论的具有可证明稳定性的时序预测框架与大语言模型

Xingyu Zhang, Jingyao Wang, Zeen Song, Changwen Zheng, Wenwen Qiang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出F-LLM框架,通过控制理论方法解决大语言模型在时序预测中的误差累积问题,提供理论保证并实验验证其有效性。

Comments Accepted by ACM MM26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24148 2026-08-17 cs.SE cs.AI 版本更新 86%

TENET: One Step Toward Test-Driven Development for Repository-Level Code Generation

TENET:迈向仓库级代码生成的测试驱动开发的第一步

Yiran Hu, Shanchao Liang, Nan Jiang, Yi Wu, Lin Tan

机构 * Purdue University(普渡大学) Microsoft Office AI(微软办公人工智能)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。

Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00417 2026-08-11 cs.AI 版本更新 86%

SymboUQ: Symbolic Uncertainty Quantification for Spatial Reasoning in LLMs

SymboUQ:面向大语言模型空间推理的符号化不确定性量化框架

Dahai Yu, Lin Jiang, Rongchao Xu, Guang Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SymboUQ是面向LLMs空间推理的符号化不确定性量化框架,通过区分可符号性与语义确定性,整合三类分数估计最终答案可靠性,在五个空间推理基准的四个冻结LLM骨干上,使AUROC相对提升约8%、Brier损失相对降低7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06574 2026-08-11 cs.LG 版本更新 86%

Skip a Layer or Loop It? Learning Program-of-Layers in LLMs

跳过一层还是循环它?学习LLM中的层程序

Ziyue Li, Yang Li, Tianyi Zhou

机构 * Ziyue Li, Yang Li, Tianyi Zhou(李子悦、李阳、周天毅)

专题命中 推理与问题求解 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PoLar方法,通过轻量级预测网络学习为每个输入动态跳过或重复预训练层,在数学推理任务上以更少层数提升准确率。

Comments Accepted at ICML 2026. Substantially extends arXiv:2507.07996. Updated DART-Math experiments by removing duplicate examples; conclusions remain unchanged. Code: https://github.com/tianyi-lab/PoLar

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18519 2026-08-07 cs.RO cs.AI 版本更新 86%

As You Wish: Mission Planning with Formal Verification using LLMs in Precision Agriculture

如您所愿:利用LLM在精准农业中进行形式化验证的任务规划

Marcos Abel Zuzuárregui, Stefano Carpin

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 针对自然语言歧义性,提出基于线性时序逻辑(LTL)反馈循环的LLM任务规划系统,通过双LLM分工实现规范生成与验证,提升精准农业任务规划的可靠性。

Journal ref Published in Proceedings of 2026 International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00747 2026-08-05 cs.RO cs.AI cs.CR cs.MA 版本更新 86%

When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems

当提示控制机器人时:多智能体机器人系统中的提示注入攻击

Neha Nagaraja, Amisha Bagari, Hayretdin Bahsi

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(北亚利桑那大学信息学、计算与网络安全学院) Department of Software Science, Tallinn University of Technology(塔林理工大学软件科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对基于LLM的多智能体机器人系统,系统研究了直接和间接提示注入攻击的风险、传播特性及架构对攻击成功率的影响,是该领域的首项系统性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06423 2026-08-04 cs.CL 版本更新 86%

On the Wings of Imagination: Conflicting Script-based Multi-role Framework for Humor Caption Generation

在想象之翼上:用于幽默标题生成的冲突脚本多角色框架

Wenbo Shang, Yuxi Sun, Jing Ma, Xin Huang

机构 * Hong Kong Baptist University(香港 Baptist 大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于幽默理论GTVH的HOMER框架,通过多角色LLM协作生成幽默标题,实验表明其在多模态幽默标题生成中优于现有方法。

Comments Paper published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06278 2026-07-28 cs.AI 版本更新 86%

TableMind: An Autonomous Programmatic Agent for Tool-Augmented Table Reasoning

TableMind: 一种用于工具增强表格推理的自主程序化代理

Chuang Jiang, Mingyue Cheng, Xiaoyu Tao, Qingyang Mao, Jie Ouyang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 TableMind通过两阶段训练策略提升表格推理能力,实现自主程序化代理的高效推理与代码生成。

Comments Comments: 10 pages, 6 figures. Submitted to WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12265 2026-07-09 cs.CL 版本更新 86%

Fast, Slow, and Tool-augmented Thinking for LLMs: A Review

大语言模型的快速、慢速和工具增强思维:综述

Xinda Jia, Jinpeng Li, Zezhong Wang, Jingjing Li, Xingshan Zeng, Yasheng Wang, Weinan Zhang, Yong Yu, Weiwen Liu

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学机械工程学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学计算机科学学院) Huawei Technologies Co., Ltd., Beijing 100084, China(华为技术有限公司) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong, Hong Kong 999077, China(香港中文大学系统工程与工程管理系) Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong 999077, China(香港中文大学计算机科学与工程系) Huawei Hong Kong Research Center, Hong Kong 999077, China(华为香港研究中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 综述大语言模型推理进展,基于认知心理学提出LLM推理策略分类法,沿快速/慢速、内部/外部两个知识边界分类,系统调查相关工作并依关键因素归类方法,指出其面临的挑战与未来方向。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-51673-0}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03269 2026-06-29 cs.AI 版本更新 86%

Distilling Answer-Set Programming Rules from LLMs for Neurosymbolic Visual Question Answering

从LLM中蒸馏答案集编程规则用于神经符号视觉问答

Thomas Eiter, Nelson Higuera Ruiz, Johannes Oetsch

机构 * Vienna University of Technology ( TU Wien )(维也纳技术大学) Jönköping University(约克灵厄普大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出从大语言模型中蒸馏答案集编程规则的方法,以可解释的方式扩展视觉问答系统的推理能力,仅需少量示例即可生成正确规则。

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01969 2026-06-26 cs.CL cs.IR 版本更新 86%

Orthogonal Hierarchical Decomposition for Structure-Aware Table Understanding with Large Language Models

正交层次分解:面向结构感知的大语言模型表格理解

Bin Cao, Huixian Lu, Chenwen Ma, Ting Wang, Ruizhe Li, Jing Fan

机构 * Zhejiang University of Technology, China(浙江工业大学,中国) Zhejiang Key Laboratory of Visual Information Intelligent Processing, China(浙江视觉信息智能处理重点实验室,中国) University of Aberdeen, UK(爱丁堡大学,英国)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 针对复杂表格中多级表头、合并单元格等结构导致大语言模型理解困难的问题,提出正交层次分解(OHD)框架,通过空间-语义联合约束的正交树归纳方法将不规则表格分解为列树和行树,并设计双路径关联协议重构单元格语义,在AITQA和HiTab基准上优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17070 2026-06-24 cs.RO cs.AI 版本更新 86%

MuTRAP: Multi-trigger Trojans Attacking Robot Task Planning Systems

MuTRAP: 攻击机器人任务规划系统的多触发器木马

Mohaiminul Al Nahian, Zainab Altaweel, David Reitano, Sabbir Ahmed, Shiqi Zhang, Adnan Siraj Rakin

机构 * Binghamton University (SUNY)(宾夕法尼亚州立大学布林顿分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出首个针对LLM辅助机器人任务规划器的多触发器木马攻击MuTRAP,通过少量任务特定参数注入后门,并优化触发器词以激活特定恶意行为,揭示当前基于LLM的规划器的安全漏洞。

Comments Accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27960 2026-06-12 cs.AI 版本更新 86%

LLMs as ASP Programmers: Self-Correction Enables Task-Agnostic Nonmonotonic Reasoning

LLMs 作为 ASP 程序员:自我纠正实现任务无关的非单调推理

Adam Ishay, Joohyung Lee

机构 * Arizona State University(亚利桑那州立大学) Samsung Research(三星研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 LLM+ASP 框架,通过自我纠正循环将自然语言转化为回答集程序,实现无需任务特定工程的非单调推理,在多个基准上优于 SMT 方法。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05608 2026-06-11 cs.SE cs.AI 版本更新 86%

Agentic Software: How AI Agents Are Restructuring the Software Paradigm

软件工程的终结:AI代理如何根本性地重构软件范式

Zhenfeng Cao

机构 * Lingxi Intelligent Investment (Shenzhen) Development Co., Ltd.(灵犀智能投资(深圳)发展有限公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过第一性原理分析,论证了以LLM为推理引擎的AI代理系统正在根本性地重构软件范式,从传统软件(代码承载决策逻辑)转向代理系统(代码作为临时工具),并提出了代理工程作为新兴学科。

Comments 15 pages, 2 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22536 2026-08-04 cs.CL cs.AI 版本更新 86%

A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models

用于推理增强型语言模型的综合FP8训练方案

Wenjun Wang, Shuo Cai, Congkai Xie, Mingfa Feng, Yiming Zhang, Zhen Li, Kejing Yang, Ming Li, Jiannong Cao, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出整合持续预训练与监督微调的端到端FP8训练方案,通过混合粒度量化实现高效无损失训练,效率较BF16提升显著,将发布代码推动大规模模型训练普及。

Comments This paper has been withdrawn by the authors due to a significant bug discovered in our data processing pipeline. This bug affects the validity of the experimental results, and we can no longer stand by the conclusions presented

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09999 2026-07-24 cs.CL cs.LG 版本更新 86%

Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts

量化语言模型推理中的无声失败:基于分类法的空洞收敛和失败模式转移分析

Renuka Oladri, Mohan Vamsi Varadaraju Priya, Jerry Wu

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究量化大语言模型推理中的无声失败,用六类失败分类法对五个模型在三种精度和四个基准下的思维链输出分类,发现空洞收敛等问题有精度和基准依赖性,且无法从文本特征可靠检测,揭示了标准评估管道未捕捉到的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18814 2026-07-07 cs.LG cs.AI 版本更新 86%

A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning

模型可以自我帮助:无需奖励的自我训练用于大语言模型推理

Mengqi Li, Lei Zhao, Anthony Man-Cho So, Ruoyu Sun, Xiao Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :LLM(title);post-training(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SePT方法,通过自我生成和训练自我生成响应交替进行,无需外部奖励提升大语言模型推理性能,实验表明在多个数学推理基准上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18419 2026-06-15 cs.LG cs.CL stat.ML 版本更新 86%

Knowing When to Quit: A Principled Framework for Dynamic Abstention in LLM Reasoning

知道何时退出:LLM推理中动态弃权的原则性框架

Hen Davidov, Nachshon Cohen, Oren Kalinsky, Yaron Fairstein, Guy Kushilevitz, Ram Yazdi, Patrick Rebeschini

机构 * Hebrew University of Jerusalem(特拉维夫大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出一个基于正则化强化学习框架的动态弃权原则,通过价值函数与弃权奖励的比较来决定是否提前终止推理,在数学推理和毒性避免任务上优于现有方法。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07368 2026-06-15 cs.LG cs.AI 版本更新 86%

Distributional Biases in Post-Training: A Markovian Analysis of Reasoning Trajectories

后训练中的分布偏差:推理轨迹的马尔可夫分析

Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Bo Xue, Qingfu Zhang, Hau-San Wong, Taiji Suzuki

机构 * City University of Hong Kong(香港城市大学) Center for Advanced Intelligence Project, RIKEN(RIKEN高级智能研究中心) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR)(A*STAR的CFAR和IHPC) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :post-training(title,abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 通过马尔可夫链模型分析后训练策略(如RLVR和ORM/PRM)如何强化高概率路径而遗忘稀有但关键的推理步骤,并证明探索策略(如拒绝简单实例和KL正则化)有助于保留稀有CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05150 2026-06-15 cs.CL cs.AI 版本更新 86%

Chronological Thinking in Full-Duplex Spoken Dialogue Language Models

全双工口语对话语言模型中的时间顺序思考

Donghang Wu, Haoyang Zhang, Chen Chen, Tianyu Zhang, Fei Tian, Xuerui Yang, Gang Yu, Hexin Liu, Nana Hou, Yuchen Hu, Eng Siong Chng

机构 * Nanyang Technological University(南洋理工大学) StepFun Mila

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Chronological Thinking机制,让全双工对话模型在听用户说话时增量推理,不增加延迟,提升响应质量。

Comments Accepted by SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09995 2026-06-09 cs.CL cs.AI 版本更新 86%

Context Over Compute Human-in-the-Loop Outperforms Iterative Chain-of-Thought Prompting in Interview Answer Quality

上下文胜过计算 人类在环优于迭代思维链提示在面试回答质量上的表现

Kewen Zhu, Zixi Liu, Yanjing Li, Jing Chen

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比人类在环和自动思维链提示方法,发现人类在环在面试回答质量评估中表现更优,且迭代次数更少,同时具有更高的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13554 2026-06-09 cs.CL cs.LG 版本更新 86%

Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization

注意力揭示大语言模型推理:预规划与锚定节奏实现细粒度策略优化

Yang Li, Zhichen Dong, Yuhan Sun, Weixun Wang, Shaopan Xiong, Yijia Luo, Jiashun Liu, Han Lu, Jiamang Wang, Wenbo Su, Bo Zheng, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过注意力机制揭示大语言模型推理中的预规划与锚定节奏,并据此提出三种细粒度强化学习策略,在多种推理任务上取得一致性能提升。

Comments 31 pages, 9 figures, 20 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏