arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4988 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4988 篇

2607.09803 2026-07-14 cs.LG cs.CL 新提交 84%

Spectral Origins of the Self-Correction Blind Spot in Autoregressive Generation

自回归生成中自我修正盲点的频谱起源

Ingrid Petrova, Luan Vejsiu

机构 * European University of Tirana(地拉那欧洲大学)

专题命中 复杂问题求解 :self-correction(title,abstract);verifier(abstract);分类 cs.CL、cs.LG

AI总结 研究大型自回归语言模型自我修正盲点问题,提出频谱代数理论SPARC,定义错误传播算子,推导激活阈值,证明基于强化学习的验证器-校正器训练收敛条件,实验验证定理,频谱预测与盲点率匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02885 2026-07-10 cs.CL cs.AI cs.HC cs.IR 新提交 84%

Where do LLMs Fall Short in CBT-Guided Affective Reasoning?

大语言模型在认知行为疗法引导的情感推理中存在哪些不足?

Vaishnavi Sinha, Pooja Guttal, Pranay Deep Reddy Katike, Vishal Sinha, Gerald Ndawula, Lira Yoon, Andrea Kleinsmith, Manas Gaur

机构 * UMBC(美国马里兰大学) UC Irvine(美国加州大学 Irvine 分校)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在认知行为疗法引导的情感推理中的不足,采用知识引导框架,将用户叙述分解并基于临床概念验证,用协议杠杆力衡量引导效果,发现单链思维提示无效,多链思维能更好引导策略选择但效果有限。

Comments 12 pages, 7 figures, accepted for publication in Affective Computing and Intelligent Interaction (ACII) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23196 2026-06-23 cs.CL cs.AI 新提交 84%

When Does Intrinsic Self-Correction Help? A Task-Sensitive Analysis

内在自我纠正何时有效?一项任务敏感分析

Elroy Stav, Dvir Berlowitz, Maayan Orner, Sarit Kraus

机构 * Bar-Ilan University(巴伊兰大学) Independent Researcher(独立研究员)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究采用任务敏感视角分析内在自我纠正(SC),发现当任务结构支持验证约束、重新审视推理或提供第二意见时,SC能带来一致性能提升,表明其有效性取决于任务类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02230 2026-06-15 cs.LG cs.AI 版本更新 84%

Generalized Discrete Diffusion with Self-Correction

广义离散扩散与自校正

Linxuan Wang, Ziyi Wang, Yikun Bai, Wei Deng, Guang Lin, Qifan Song

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出自校正离散扩散模型(SCDD),通过显式状态转移和离散时间学习,简化训练噪声调度,消除冗余重掩码步骤,在GPT-2规模上实现高效并行解码并保持生成质量。

Comments 40 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29025 2026-06-10 cs.CL cs.AI 版本更新 84%

The Model Says Walk: How Surface Heuristics Override Implicit Constraints in LLM Reasoning

模型说走:表面启发式如何覆盖LLM推理中的隐式约束

Yubo Li, Lu Zhang, Tianchong Jiang, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM在表面线索与隐式约束冲突时的失败,提出启发式覆盖基准(HOB),通过因果行为分析揭示距离线索影响远大于目标,并验证目标分解提示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05402 2026-06-05 cs.CL cs.AI 84%

ReasoningFlow: Discourse Structures for Understanding LLM Reasoning Traces

ReasoningFlow: 理解LLM推理轨迹的话语结构

Jinu Lee, Shivam Agarwal, Amruta Parulekar, Siddarth Madala, Dilek Hakkani-Tur, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 提出ReasoningFlow框架,将大推理模型的推理轨迹建模为细粒度有向无环图,通过人工和自动标注分析发现模型间结构相似性、多样化推理行为及错误步骤与最终答案的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08503 2026-06-05 cs.CV cs.CL cs.LG 84%

Learning Self-Correction in Vision-Language Models via Rollout Augmentation

通过回滚增强学习视觉-语言模型中的自我纠正

Yi Ding, Ziliang Qiu, Bolian Li, Ruqi Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于回滚增强的强化学习框架Octopus,通过重新组合现有回滚生成密集的自我纠正示例,提高样本效率并稳定RL优化,同时引入响应遮蔽策略以解耦自我纠正与直接推理,从而在7个基准测试中实现开源VLM的SOTA性能。

Comments 18 pages

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15500 2026-05-27 cs.AI cs.LG 84%

Understanding Reasoning in LLMs through Strategic Information Allocation under Uncertainty

不确定性下通过策略信息分配理解LLM中的推理

Jeonghye Kim, Xufang Luo, Minbeom Kim, Sangmook Lee, Dongsheng Li, Yuqing Yang

机构 * Microsoft Research(微软研究院) KAIST(韩国科学技术院) Seoul National University(首尔国立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个信息论框架,将推理分解为程序推进和认知外化(不确定性标记级外化),证明零散外化能在无显式错误触发时恢复收敛,并通过实验表明小规模SFT即可调控该能力,从而将推理重新定义为不确定性下的策略信息分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17305 2026-05-19 cs.AI cs.CL 84%

CyberCorrect: A Cybernetic Framework for Closed-Loop Self-Correction in Large Language Models

CyberCorrect: 一种基于闭环自修正的大型语言模型框架

Yuning Wu, Yingmin Liu, Yang Shu

机构 * School of Software, Henan University, Kaifeng, China(河南大学软件学院,开封,中国) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CyberCorrect框架,将大型语言模型的自我修正建模为闭环控制系统,通过三模态错误检测器、类型导向的修正控制器和收敛判断器,提升模型的自我修正能力和准确性。

Comments 6 pages, 1 figure, submitted to IEEE SMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08936 2026-05-12 cs.AI cs.LG 84%

Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories

Self-ReSET: 通过学习自我恢复来应对不安全推理轨迹

Dongcheng Zhang, Yi Zhang, Yuxin Chen, An Zhang, Xiang Wang, Chaochao Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Self-ReSET框架,通过纯强化学习使大推理模型具备自我恢复能力,提升对抗攻击下的鲁棒性并高效利用数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21285 2026-04-27 cs.AI cs.CL 84%

When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models

当模型超越安全限制:揭示并缓解大推理模型的自我突破

Yingzhi Mao, Chunkang Zhang, Junxiang Wang, Xinyan Guan, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大推理模型存在自我突破现象,提出CoG框架通过分步干预缓解安全问题,平衡安全与推理性能。

Comments ACL 2026. The first two authors contributed equally. The main text is 9 pages, with an appendix of 28 pages. The paper contains 20 figures and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06209 2026-04-24 cs.AI cs.CL 84%

ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models

ReProbe:通过探测大语言模型的内部状态实现多步骤推理的高效测试时间扩展

Jingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin, See-Kiong Ng, Artem Shelmanov, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) National University of Singapore(新加坡国立大学) MBZUAI(马斯喀特人工智能研究所) University of Zürich(苏黎世大学) The University of Melbourne(墨尔本大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于探测大语言模型内部状态的轻量级方法,用于多步骤推理验证,其性能超越了810倍大的Process Reward Models,为可扩展的测试时间扩展和更可 introspective 的大语言模型提供了新路径。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21228 2026-04-21 cs.CL cs.AI 84%

ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following

ImpRIF:更强的隐式推理导致更好的复杂指令遵循

Yuancheng Yang, Lin Yang, Xu Wang, Chao Tong, Haihua Yang

机构 * ByteDance China(字节跳动中国) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImpRIF方法,通过构建可验证推理图提升大语言模型对隐式推理指令的理解,从而增强复杂指令遵循能力,在五个基准测试中表现优异。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00514 2026-04-21 cs.AI cs.CL 84%

The Illusion of Insight in Reasoning Models

推理模型中的“顿悟”幻觉

Liv G. d'Aliberti, Manoel Horta Ribeiro

机构 * Princeton University(普林斯顿大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨推理模型在推理过程中是否出现突然的顿悟现象,发现此类现象罕见且不提升准确性,但高不确定性下人工触发可提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12487 2026-04-15 cs.CL cs.AI 84%

KG-Reasoner: A Reinforced Model for End-to-End Multi-Hop Knowledge Graph Reasoning

KG-Reasoner: 一种用于端到端多跳知识图谱推理的强化模型

Shuai Wang, Yinan Yu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出KG-Reasoner,通过强化学习整合多步推理至LLM的'思考'阶段,实现动态探索推理路径,实验表明其在多跳和知识密集型推理任务中表现优异。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11271 2026-04-15 cs.LG cs.CL cs.CV cs.MA 84%

OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning

OctoTools: 一个具有可扩展工具的代理框架,用于复杂推理

Pan Lu, Bowen Chen, Sheng Liu, Rahul Thapa, Joseph Boen, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 OctoTools通过标准化工具卡、规划器和执行器,提供一种无需训练的多代理框架,实现跨领域复杂推理,其在16种任务中达到9.3%的平均准确率提升。

Comments 88 pages, 18 figures. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11547 2026-04-14 cs.LG cs.CL 84%

Eliciting Medical Reasoning with Knowledge-enhanced Data Synthesis: A Semi-Supervised Reinforcement Learning Approach

通过知识增强的数据合成 eliciting 医学推理:一种半监督强化学习方法

Haolin Li, Shuyang Jiang, Ruipeng Zhang, Jiangchao Yao, Ya Zhang, Yanfeng Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) CMIC, Shanghai Jiao Tong University(上海交通大学CMIC) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Department of Radiology, Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第六人民医院放射科) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院人工智能医学研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MedSSR框架,利用稀有疾病知识生成可控推理问题,并通过自监督和监督强化学习提升医学推理能力,在十个医疗基准测试中取得显著提升。

Comments Accepted to ACL 2026 as a Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07415 2026-04-10 cs.IR cs.AI cs.CL 84%

SubSearch: Intermediate Rewards for Unsupervised Guided Reasoning in Complex Retrieval

SubSearch:复杂检索中无监督引导推理的中间奖励

Roxana Petcu, Evangelos Kanoulas, Maarten de Rijke

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 SubSearch通过引入内部奖励信号,提升复杂检索中推理的鲁棒性,无需外部监督,实现更高效的多步推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06834 2026-04-09 cs.CL cs.AI 84%

On the Step Length Confounding in LLM Reasoning Data Selection

在LLM推理数据选择中的步长混淆问题

Bing Wang, Rui Miao, Chen Shen, Shaotian Yan, Kaiyuan Liu, Ximing Li, Xiaosong Yuan, Sinan Fan, Jun Zhang, Jieping Ye

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University(吉林大学符号计算与知识工程教育部重点实验室) Alibaba Cloud Computing(阿里云) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Mathematics, University of Michigan(密歇根大学数学系) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能研究中心)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了自然性基于的数据选择方法在LLM推理数据中系统性偏好长推理步骤的问题,并提出ASLEC-DROP和ASLEC-CASL方法以缓解此混淆。

Comments Accepted by Findings of ACL 2026. 15 pages, 9 figures. Code: https://github.com/wangbing1416/ASLEC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03004 2026-04-06 cs.CL cs.AI 84%

R2-Write: Reflection and Revision for Open-Ended Writing with Deep Reasoning

R2-Write:基于深度推理的开放性写作反思与修订

Wanlong Liu, Bo Zhang, Chenliang Li, Shaopeng Lai, Yuning Wu, Xuanyu Lei, Ming Yan

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University, Beijing, China(清华大学(中国北京))

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出R2-Write框架,通过迭代作家-评判者交互生成高质量思考轨迹,增强开放性写作的深度推理能力,实验表明显式引入反思与修订模式显著提升了写作任务性能。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18447 2026-02-24 cs.CL cs.AI 84%

ConfSpec: Efficient Step-Level Speculative Reasoning via Confidence-Gated Verification

ConfSpec:通过置信度门控验证实现高效的步骤级推测推理

Siran Liu, Cyril Y. He

机构 * Peking University(北京大学) ScitiX AI

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 ConfSpec通过置信度门控验证框架,在保持准确性的同时,实现高效步骤级推测推理,达到2.24倍的端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14763 2026-02-17 cs.CL cs.AI 84%

Unlocking Reasoning Capability on Machine Translation in Large Language Models

在大语言模型中解锁机器翻译的推理能力

Sara Rajaee, Sebastian Vincent, Alexandre Berard, Marzieh Fadaee, Kelly Marchisio, Tom Kocmi

机构 * University of Amsterdam(阿姆斯特丹大学) Cohere Labs(Cohere实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种针对翻译的结构化推理框架,通过多步骤草稿、充分性细化、流畅性提升和选择性迭代修订,显著提升了大语言模型在机器翻译中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00871 2026-02-03 cs.AI cs.CL 84%

Beyond Output Critique: Self-Correction via Task Distillation

超越输出批评:通过任务蒸馏实现自我纠正

Hossein A. Rahmani, Mengting Wan, Pei Zhou, Longqi Yang, Nick Craswell, Emine Yilmaz, Sujay Kumar Jauhar

机构 * AI Center, University College London(伦敦大学学院人工智能中心) Microsoft(微软)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SELF-THOUGHT通过任务蒸馏引入任务抽象步骤,提升大型和小型语言模型的自我纠正能力,提高准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21418 2026-01-30 cs.LG cs.AI 84%

Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning

通过难度感知强化学习缓解大推理模型中的过度思考

Qian Wan, Ziao Xu, Luona Wei, Xiaoxuan Shen, Jianwen Sun

机构 * Laboratory for Artificial Intelligence and New Forms of Education(人工智能与新教育形式实验室) National Engineering Research Center of Educational Big Data(教育大数据国家工程研究中心) Faculty of Artificial Intelligence in Education, Central China Normal University(教育人工智能学院,中央财经大学) College of Electronics and Information Engineering, South-Central Minzu University(电子与信息工程学院,西南民族大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DiPO框架,通过难度感知强化学习缓解大推理模型的过度思考问题,提升推理效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19588 2026-01-28 cs.LG cs.AI 84%

From Atoms to Chains: Divergence-Guided Reasoning Curriculum for Unlabeled LLM Domain Adaptation

从原子到链:基于分歧引导的推理课程用于无标签LLM领域适应

Yongqi Wang, Xiaofeng Ji, Jie Wang, Qingbin Li, Xiao Xiong, Zheming Yang, Jian Xu, Minghui Qiu, Xinxiao Wu

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science and Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) ByteDance China(字节跳动中国)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGRC方法,通过分歧引导构建从原子知识到推理链的学习课程,提升无标签LLM在医疗和法律领域适应性能。

Comments Code: https://github.com/bytedance/DGRC

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24133 2026-01-23 cs.CL cs.AI 84%

R-KV: Redundancy-aware KV Cache Compression for Reasoning Models

R-KV:面向推理模型的冗余感知KV缓存压缩

Zefan Cai, Wen Xiao, Hanshi Sun, Cheng Luo, Yikai Zhang, Ke Wan, Yucheng Li, Yeyang Zhou, Li-Wen Chang, Jiuxiang Gu, Zhen Dong, Anima Anandkumar, Abedelkadir Asi, Junjie Hu

机构 * University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Microsoft(微软) Carnegie Mellon University(卡内基梅隆大学) California Institute of Technology(加州理工学院) University of California - San Diego(加州大学圣地亚哥分校) University of Surrey(萨里大学) University of California - Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 R-KV通过冗余感知机制实现推理模型KV缓存压缩,以10%的缓存占用率达到接近100%的性能,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03263 2026-01-09 cs.CL cs.AI 84%

Internal Reasoning vs. External Control: A Thermodynamic Analysis of Sycophancy in Large Language Models

内部推理 vs. 外部控制:大型语言模型中谄媚现象的热力学分析

Edward Y. Chang

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出受控因果锚定(RCA)方法,通过评估推理过程而非结果,有效检测大型语言模型中的谄媚现象,无需真实数据且打破自我强化偏见循环。

Comments 20 pages, 1 figure, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03205 2026-01-07 cs.CL cs.AI 84%

UltraLogic: Enhancing LLM Reasoning through Large-Scale Data Synthesis and Bipolar Float Reward

UltraLogic: 通过大规模数据合成和双极浮点奖励增强大语言模型推理

Yile Liu, Yixian Liu, Zongwei Li, Yufei Huang, Xinhua Feng, Zhichao Hu, Jinglu Hu, Jianfeng Yan, Fengzong Lian, Yuhong Liu

机构 * Hunyuan, Tencent(腾讯 Hunyuan) Waseda University(早稻田大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 UltraLogic通过大规模数据合成和双极浮点奖励机制,提升大语言模型的推理能力,强调任务多样性和难度匹配对训练效率的促进作用。

Comments 19 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23713 2026-01-01 cs.CL cs.AI 84%

PyBangla at BLP-2025 Task 2: Enhancing Bangla-to-Python Code Generation with Iterative Self-Correction and Multilingual Agents

在BLP-2025任务2中提升孟加拉语到Python代码生成:通过迭代自我纠正和多语言代理

Jahidul Islam, Md Ataullha, Saiful Azad

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BanglaCodeAct框架,通过多代理提示和迭代自我纠正,提升孟加拉语到Python代码生成的性能,实验显示Qwen3-8B结合该框架在开发集和盲测集上分别达到94.0%和71.6%的准确率。

Comments 6 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05901 2025-12-05 cs.CL cs.AI 84%

Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router

路由与推理:通过强化模型路由扩展大语言模型推理

Chenyang Shao, Xinyang Liu, Yutang Lin, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) BNRist, Tsinghua University(清华大学BNRist)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 R2-Reasoner通过强化模型路由器实现高效的大语言模型推理扩展,减少API成本并保持推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏