arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5757 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5757 篇

2603.28730 2026-05-27 cs.RO cs.CL cs.CV 87%

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning

SOLE-R1:视频语言推理作为机器人强化学习的唯一奖励

Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza

机构 * MIT(麻省理工学院) RAI Institute(机器人智能研究所)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 提出SOLE-R1模型,通过视频语言时空推理生成密集任务进度估计作为唯一奖励信号,实现在无真实奖励、演示或任务特定调优下的零样本在线强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14448 2026-05-15 cs.CV cs.CL cs.IR 87%

Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture

需要时思考:基于双LoRA架构的自适应推理驱动多模态嵌入

Longxiang Zhang, Weilong Dai, Guanghao Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出TWN框架,通过双LoRA架构和自适应推理机制,提升多模态嵌入效率与质量,在78个任务中达到SOTA水平,参数更少,推理成本更低。

Comments 30 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23143 2026-05-14 cs.AI 87%

THINKSAFE: Self-Generated Safety Alignment for Reasoning Models

THINKSAFE: 为推理模型生成的自我安全对齐

Seanie Lee, Sangwoo Park, Yumin Choi, Gyeongman Kim, Minki Kang, Jihun Yun, Dongmin Park, Jongho Park, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) UC Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 THINKSAFE通过自我生成对齐框架提升推理模型的安全性,无需外部教师,实验表明其在安全性和推理能力上优于GRPO,计算成本显著降低。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08930 2026-05-12 cs.AI 87%

Internalizing Safety Understanding in Large Reasoning Models via Verification

通过验证内部化安全理解以提升大推理模型

Yi Zhang, Yuxin Chen, Leheng Sheng, Dongcheng Zhang, Chaochao Lu, Xiang Wang, An Zhang

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Safety Internal框架,通过训练模型在安全验证任务中自我批判生成答案,提升模型对自身输出安全性的判断能力,增强对抗性突破的鲁棒性。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14044 2026-05-01 cs.CV cs.AI 87%

OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving

OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶

Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) MEGVII Technology(美科维七科技) AFARI

专题命中 其他推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17017 2025-06-11 cs.CV cs.AI cs.CL cs.LG 87%

Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO

Chengzhuo Tong, Ziyu Guo, Renrui Zhang, Wenyu Shan, Xinyu Wei, Zhenghao Xing, Hongsheng Li, Pheng-Ann Heng

机构 * CUHK(香港中文大学) MiuLar Lab(MiuLar 实验室) MMLab Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code is released at https://github.com/ZiyuGuo99/Image-Generation-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06374 2026-08-05 cs.CL cs.LG 版本更新 87%

The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models

叠加的幻觉?语言模型中潜在思维的原理性分析

Michael Rizvi-Martel, Guillaume Rabusseau, Marius Mosbach

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了连续链式思维(Latent CoT)中叠加现象的出现条件,发现仅从头训练的模型表现出叠加特性,而其他训练方式下模型倾向于使用捷径解法。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08046 2026-07-10 cs.CL cs.AI 新提交 87%

What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness

大语言模型预测器知道但不说的内容:探究校准和忠实性的内部表示

Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究针对预测微调的大语言模型校准和忠实性问题,通过在中间激活上训练表示池探测器,发现其校准效果更好,还能评估CoT忠实性、追踪行为变化等,证明探究内部表示可用于校准、审计和分类语言模型预测器及推理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26410 2026-03-30 cs.CL cs.AI 87%

Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models

为何模型知道却不说:链式思考中的思考令牌与答案之间的信念差异在开放权重推理模型中

Richard J. Young

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) DeepNeuro AI

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL、cs.AI

AI总结 研究探讨了12种开放权重推理模型在MMLU和GPQA问题中对误导提示的响应,发现思考令牌与答案之间的信念差异显著,且模型对提示的承认存在方向性差异。

Comments 19 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06419 2025-11-11 cs.AI cs.CL 87%

MONICA: Real-Time Monitoring and Calibration of Chain-of-Thought Sycophancy in Large Reasoning Models

Jingyu Hu, Shu Yang, Xilin Gong, Hongming Wang, Weiru Liu, Di Wang

机构 * University of Bristol(布里斯托大学) King Abdullah University of Science and Technology(卡利斯勒国王大学科学与技术学院) University of Georgia(佐治亚大学) Southern University of Science and Technology(南方科技大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00361 2026-07-02 cs.CR 新提交 87%

ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models

ReShift: 视觉-语言模型上基于“啊哈时刻”驱动的推理级后门攻击

Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出ReShift框架,通过“啊哈时刻”驱动推理轨迹重定向,结合PRDC管道和SRJO策略实现隐蔽的后门攻击,理论保证熵反弹与轨迹发散的联系。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31580 2026-07-01 cs.DC 新提交 87%

LASER: Load-Aware Serving with Early-Exit for Reasoning LLMs at the Edge

LASER: 面向边缘推理大模型的负载感知早退服务

Zhiqing Tang, Size Li, Hanshuai Cui, Zilan Huang, Jianxiong Guo, Tian Wang, Yuan Wu, Weijia Jia

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出LASER系统,通过负载感知自适应退出阈值和难度与负载感知的推理预算预分配,联合优化推理质量与服务延迟,在边缘部署中降低延迟17-38%并提升SLO满足率3-6%。

Comments to be published in WASA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22085 2026-06-23 cs.AI cs.CL cs.LG 新提交 87%

Can Reasoning Models Detect Changes to their Chains of Thought?

推理模型能否检测其思维链的变化?

Sathvik Napa, Utkarsh Singh, Chengyuan Xue, Miriam Wanner, William Walden

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理模型在多种条件下检测自身思维链干预的能力,发现模型检测准确率很低,且难以识别修改方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31096 2026-06-01 cs.CV 87%

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型中

Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Independent Researcher(独立研究者) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出iVGR框架,利用强化学习和双流训练策略将视觉定位能力内化到文本推理中,避免显式视觉基础在推理时的干扰,提升细粒度感知性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21967 2026-05-22 cs.IR 87%

Reinforced Preference Optimization for Reasoning-Augmented Recommendations

增强偏好优化用于推理增强的推荐

Jingtong Gao, Zeyu Song, Chi Lu, Xiaopeng Li, Derong Xu, Maolin Wang, Peng Jiang, Kun Gai, Qingpeng Cai, Xiangyu Zhao

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出RPORec框架,通过统一LLM的推理能力与专用推荐头,提升推荐系统的精确性,实验表明其在公开基准和大规模部署中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05922 2026-05-13 cs.CV 87%

Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

思考,然后评分:视频奖励建模中的解耦推理与评分

Yuan Wang, Ouxiang Li, Yulong Xu, Borui Liao, Jiajun Liang, Jinghan Li, Meng Wang, Xintao Wang, Pengfei Wan, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出DeScore模型,通过解耦推理与评分机制提升视频奖励建模的泛化能力,结合冷启动和强化学习优化,实现更稳定的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13117 2026-04-28 cs.LG cs.AI cs.CL 87%

On the Reasoning Abilities of Masked Diffusion Language Models

关于掩码扩散语言模型的推理能力

Anej Svete, Ashish Sabharwal

机构 * ETH Zürich(苏黎世联邦理工学院) Allen Institute for AI(人工智能研究所)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了掩码扩散模型在推理任务中的能力,通过与链式思维和填充循环变压器框架对比,证明了其在有限精度对数宽度下与多项式填充PLTs等效,并展示了其在解决特定问题时的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02066 2026-02-24 cs.LG cs.AI cs.CL 87%

MolReasoner: Toward Effective and Interpretable Reasoning for Molecular LLMs

MolReasoner:迈向分子大语言模型的有效且可解释的推理

Guojiang Zhao, Zixiang Lu, Yutang Ge, Sihang Li, Zheng Cheng, Haitao Lin, Lirong Wu, Hanchen Xia, Hengxing Cai, Wentao Guo, Hongshuai Wang, Mingjun Xu, Siyu Zhu, Guolin Ke, Linfeng Zhang, Zhifeng Gao

机构 * DP Technology, Beijing, China(DP技术有限公司) AI for Science Institute, Beijing, China(AI for Science研究院) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Fudan University, Shanghai, China(复旦大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MolReasoner通过两阶段框架提升分子大语言模型的推理能力和可解释性,有效减少幻觉并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18297 2026-02-23 cs.LG cs.AI cs.CL cs.IT math.IT 87%

Analyzing and Improving Chain-of-Thought Monitorability Through Information Theory

通过信息论分析和改进链式思维可监控性

Usman Anwar, Tim Bakker, Dana Kianfar, Cristina Pinneri, Christos Louizos

机构 * University of Cambridge(剑桥大学) Qualcomm AI Research(高通人工智能研究)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过信息论分析,提出两种方法改进链式思维监控器的可监控性,以提高监控准确性并防止奖励黑客问题。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17307 2026-02-10 cs.LG cs.AI cs.CL 87%

R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning

R-Stitch:动态轨迹拼接以实现高效的推理

Zhuokun Chen, Zeren Chen, Jiahao He, Lu Sheng, Mingkui Tan, Jianfei Cai, Bohan Zhuang

机构 * Monash University, Australia(墨尔本大学,澳大利亚) School of Software, Beihang University, China(北航软件学院,中国) South China University of Technology, China(华南理工大学,中国) ZIP Lab, Zhejiang University, China(浙江大学ZIP实验室,中国)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 R-Stitch通过熵引导的混合解码框架,实现高效推理,减少计算成本并保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01939 2025-11-14 cs.CL cs.AI cs.LG 87%

Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning

Shenzhi Wang, Le Yu, Chang Gao, Chujie Zheng, Shixuan Liu, Rui Lu, Kai Dang, Xionghui Chen, Jianxin Yang, Zhenru Zhang, Yuqiong Liu, An Yang, Andrew Zhao, Yang Yue, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃实验室)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NeurIPS 2025. 25 pages, 17 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05784 2025-11-12 cs.CL cs.AI cs.LG 87%

DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning

Yaxuan Wang, Chris Yuhao Liu, Quan Liu, Jinglong Pang, Wei Wei, Yujia Bao, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Please refer to the NeurIPS 2025 submission: https://openreview.net/forum?id=FNuul0hlin The paper has been accepted to the ICML 2025 MUGen Workshop: https://openreview.net/forum?id=ET24oKP23c

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04909 2025-06-06 cs.AI cs.CL cs.CR cs.LG 87%

When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models

Kai Wang, Yihao Zhang, Meng Sun

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18547 2025-06-03 cs.CL cs.AI cs.LG 87%

Token-Budget-Aware LLM Reasoning

Tingxu Han, Zhenting Wang, Chunrong Fang, Shiyu Zhao, Shiqing Ma, Zhenyu Chen

机构 * Nanjing University(南京大学) Rutgers University(罗格斯大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10440 2025-05-26 cs.CR cs.AI cs.CL cs.IR cs.LG 87%

Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning

Junfeng Guo, Yiming Li, Ruibo Chen, Yihan Wu, Chenxi Liu, Yanshuo Chen, Heng Huang

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The first two authors contributed equally to this work. 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05410 2025-05-09 cs.CL cs.AI cs.LG 87%

Reasoning Models Don't Always Say What They Think

Yanda Chen, Joe Benton, Ansh Radhakrishnan, Jonathan Uesato, Carson Denison, John Schulman, Arushi Somani, Peter Hase, Misha Wagner, Fabien Roger, Vlad Mikulik, Samuel R. Bowman, Jan Leike, Jared Kaplan, Ethan Perez

机构 * Alignment Science Team, Anthropic(Anthropic对齐科学团队)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02361 2025-03-10 cs.CL cs.AI cs.LG 87%

Dialogue Ontology Relation Extraction via Constrained Chain-of-Thought Decoding

Renato Vukovic, David Arps, Carel van Niekerk, Benjamin Matthias Ruppik, Hsien-Chin Lin, Michael Heck, Milica Gašić

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to appear at SIGDIAL 2024. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09804 2025-01-20 cs.LG cs.AI cs.CL 87%

Enhancing Generalization in Chain of Thought Reasoning for Smaller Models

Maxwell J. Yin, Dingyi Jiang, Yongbing Chen, Boyu Wang, Charles Ling

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02128 2024-10-29 cs.LG cs.AI cs.CL 87%

Iteration Head: A Mechanistic Study of Chain-of-Thought

Vivien Cabannes, Charles Arnal, Wassim Bouaziz, Alice Yang, Francois Charton, Julia Kempe

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02563 2024-08-27 cs.CL cs.AI cs.LG 87%

Synergy-of-Thoughts: Eliciting Efficient Reasoning in Hybrid Language Models

Yu Shang, Yu Li, Fengli Xu, Yong Li

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 16 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏