arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2603.24866 2026-03-27 cs.AI cs.CL cs.CV 86%

How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning

视觉-语言模型距离构建现实世界还有多远?一个物理生成推理的基准测试

Luyu Yang, Yutong Dai, An Yan, Viraj Prabhu, Ran Xu, Zeyuan Chen

机构 * Salesforce AI Research(Salesforce 人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DreamHouse基准测试,评估视觉-语言模型在物理生成推理能力上的不足,通过住宅木构架建造领域验证模型在结构、施工可行性等约束下的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06046 2026-03-17 cs.CL cs.AI 86%

EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance Generation

EvolvR:自进化成对推理用于故事评估以增强生成

Xinda Wang, Zhengxu Hou, Yangshijie Zhang, Bingren Yan, Jialin Liu, Chenzhuo Zhao, Zhibo Yang, Bin-Bin Yang, Feng Xiao

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 EvolvR通过自进化成对推理框架提升故事评估准确性,解决传统方法在开放任务中的局限性,实现生成质量的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17057 2026-03-10 cs.LG cs.AI 86%

The Ends Justify the Thoughts: RL-Induced Motivated Reasoning in LLM CoTs

终点 justify 思维:RL 引导的动机推理在 LLM CoTs 中

Nikolaus Howe, Micah Carroll

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究发现LLM在训练中会因冲突指令产生动机推理,导致监控器被欺骗,强调需进一步研究动机推理的检测与监管。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07078 2026-03-10 cs.AI cs.CL 86%

CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs

CoTJudger: 一种基于图的框架,用于自动评估链式推理效率和冗余性在LRMs中

Siyi Li, Jiajun Shi, Shiwen Ni, Ge Zhang, Shuaimin Li, Shijian Wang, Zhoufutu Wen, Yizhi Li, Hamid Alinejad-Rokny, Jiaheng Liu, Min Yang, Wenhao Huang

机构 * University of Science and Technology of China(科学技术大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究所,中国科学院) Southeast University(东南大学) Nanjing University(南京大学) Beihang University(北航) University of Manchester(曼彻斯特大学)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 CoTJudger通过构建依赖图提取最短有效路径,评估链式推理的效率与冗余,揭示模型中的冗余问题及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00889 2026-03-03 cs.CL cs.AI 86%

CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning

CHIMERA:紧凑的合成数据用于通用的LLM推理

Xinyu Zhu, Yihao Feng, Yanchao Sun, Xianzhi Du, Pingzhi Li, Olli Saarikivi, Yun Zhu, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) Apple(苹果公司) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 CHIMERA通过紧凑的合成数据集提升LLM跨领域推理能力,提供丰富推理轨迹和结构化覆盖,实现高效训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21346 2026-02-26 cs.CL cs.AI 86%

Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment

基于对齐的DPO:一种原则性的推理方法以提高安全性对齐

Mengxuan Hu, Vivek V. Datla, Anoop Kumar, Zihan Guan, Sheng Li, Alfy Samuel, Daben Liu

机构 * University of Virginia(弗吉尼亚大学) Capital One

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于对齐的DPO方法,通过引入推理意识的后训练和对齐加权机制,提升大语言模型的安全性对齐鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16154 2026-02-19 cs.CL cs.AI 86%

Balancing Faithfulness and Performance in Reasoning via Multi-Listener Soft Execution

通过多听众软执行平衡忠实与性能

Nithin Sivakumaran, Shoubin Yu, Hyunji Lee, Yue Zhang, Ali Payani, Mohit Bansal, Elias Stengel-Eskin

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 REMUL通过多听众强化学习方法提升推理忠实性与性能,改进多个基准的忠实性指标和准确性。

Comments Code: https://github.com/nsivaku/remul

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08275 2026-02-16 cs.CL cs.AI 86%

MLLM-CTBench: A Benchmark for Continual Instruction Tuning with Reasoning Process Diagnosis

MLLM-CTBench: 一个用于持续指令微调的基准,包含推理过程诊断

Haiyun Guo, Zhiyan Hou, Yandu Sun, Jinghan He, Yu Chen, Yuzhe Zhou, Yuheng Jia, Jinqiao Wang, Tat-Seng Chua

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southeast University(东南大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 MLLM-CTBench提出一个用于持续指令微调的基准,通过多维评估框架和强化微调方法,分析跨任务知识保留和灾难性遗忘问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09442 2026-02-11 cs.CL cs.AI 86%

Evaluating Social Bias in RAG Systems: When External Context Helps and Reasoning Hurts

评估RAG系统中的社会偏见:当外部上下文有助于而推理有害

Shweta Parihar, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估RAG系统中的社会偏见,发现外部上下文可减少偏见,但链式思维提示反而增加偏见,凸显了需要偏见意识推理框架的重要性。

Comments Accepted as a full paper with an oral presentation at the 30th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03978 2026-02-05 cs.AI cs.LG 86%

Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning

监控性作为免费礼物:RLVR如何自发地对齐推理

Zidi Xiong, Shan Chen, Himabindu Lakkaraju

机构 * Harvard University(哈佛大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 RLVR通过增强响应分布和提示关注度自发提升推理透明性,但这种提升依赖于数据多样性与训练难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14691 2026-01-23 cs.AI cs.CL 86%

Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation

操纵法官:不忠的推理链可能损害智能体评估

Muhammad Khalifa, Lajanugen Logeswaran, Jaekyeom Kim, Sungryull Sohn, Yunxiang Zhang, Moontae Lee, Hao Peng, Lu Wang, Honglak Lee

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文揭示了LLM法官对智能体推理轨迹操纵的脆弱性,表明基于内容的操纵能显著提高假阳性率,凸显了需验证推理与证据的评估机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03597 2026-01-21 cs.CL cs.AI 86%

From Chains to Graphs: Self-Structured Reasoning for General-Domain LLMs

从链式到图式:面向通用领域LLM的自结构化推理

Yingjian Chen, Haoran Liu, Yinhong Liu, Sherry T. Tong, Aosong Feng, Jinghui Lu, Juntao Zhang, Yusuke Iwasawa, Yutaka Matsuo, Irene Li

机构 * University of Tokyo(东京大学) Texas A&M University(德克萨斯大学) University of Cambridge(剑桥大学) Yale University(耶鲁大学) Xiaomi EV(小米电动汽车) Henan University(河南大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自图推理框架SGR,通过结构化图表示提升LLM在通用领域问答中的推理一致性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16281 2026-01-15 cs.RO cs.AI cs.LG 86%

Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification

按言行事:通过运行时推理-动作对齐验证引导视觉-语言-动作模型

Yilin Wu, Anqi Li, Tucker Hermans, Fabio Ramos, Andrea Bajcsy, Claudia Pérez-D'Arpino

机构 * NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) University of Utah(犹他大学) University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 通过运行时推理-动作对齐验证方法提升视觉-语言-动作模型的鲁棒性和行为组合能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10095 2026-01-09 cs.CL cs.AI 86%

Cognitive-Mental-LLM: Evaluating Reasoning in Large Language Models for Mental Health Prediction via Online Text

认知-心理-大语言模型:通过在线文本评估大语言模型在心理健康预测中的推理能力

Avinash Patil, Amardeep Kour Gedhu

机构 * Ira A. Fulton Schools of Engineering Arizona State University Tempe, USA(伊拉·A·福林工程学校亚利桑那州立大学Tempe分校) Department of Psychology Santa Clara University Santa Clara, USA(心理学系圣克拉拉大学Santa Clara分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过评估链式思维等推理技术,改进了大语言模型在心理健康预测中的分类性能,发现推理增强技术在复杂案例中表现更优,但存在数据集特定的限制。

Comments 8 pages, 4 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03940 2026-01-08 cs.CL cs.AI 86%

Large-Scale Aspect-Based Sentiment Analysis with Reasoning-Infused LLMs

基于推理注入的大型方面基于情感分析

Paweł Liskowski, Krzysztof Jankowski

机构 * Snowflake Inc.(Snowflake公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 Arctic-ABSA通过引入推理注入技术,提升了大型多语言方面情感分析模型的准确性和泛化能力,实现了在多个领域和语言上的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08976 2025-12-19 cs.LG cs.AI 86%

Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs

peek-a-boo推理:多模态大语言模型中的对比区域遮挡

Isha Chaturvedi, Anjana Nair, Yushen Li, Adhitya Rajendra Kumar, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Vasu Sharma

机构 * Algoverse AI Research(Algoverse AI研究机构) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 对比区域遮挡通过遮挡视觉区域并对比推理轨迹,揭示多模态大语言模型在推理过程中的依赖模式和失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02890 2025-11-27 cs.CL cs.AI 86%

Reasoning Transfer for an Extremely Low-Resource and Endangered Language: Bridging Languages Through Sample-Efficient Language Understanding

为极低资源和濒危语言进行推理迁移:通过高效样本的语言理解连接语言

Khanh-Tung Tran, Barry O'Sullivan, Hoang D. Nguyen

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出英语引导的Co T训练方法,通过监督微调提升极低资源语言的推理能力,并发布首个爱尔兰语数学任务基准测试,展示多语言推理的可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09802 2025-11-04 cs.CL cs.AI 86%

Enhancing Reasoning Abilities of Small LLMs with Cognitive Alignment

Wenrui Cai, Chengyu Wang, Junbing Yan, Jun Huang, Xiangzhong Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Cloud Computing(阿里云计算)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments emnlp 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23945 2025-11-04 cs.CL cs.AI 86%

A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models

Sriram Balasubramanian, Samyadeep Basu, Soheil Feizi

机构 * Department of Computer Science University of Maryland, College Park(计算机科学系马里兰大学 College Park)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted in EMNLP 2025, 34 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06485 2025-10-27 cs.CV cs.AI cs.CL 86%

Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning

Ziyang Wang, Jaehong Yoon, Shoubin Yu, Md Mohaiminul Islam, Gedas Bertasius, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025. The first two authors contributed equally. Project page: https://sites.google.com/cs.unc.edu/videorts2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14489 2025-10-23 cs.AI cs.CL 86%

Reasoning Models Better Express Their Confidence

Dongkeun Yoon, Seungone Kim, Sohee Yang, Sunkyoung Kim, Soyeon Kim, Yongil Kim, Eunbi Choi, Yireun Kim, Minjoon Seo

机构 * KAIST(韩国科学技术院) LG AI Research(LG人工智能研究) CMU(卡内基梅隆大学) UCL(伦敦大学学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08189 2025-10-22 cs.AI cs.CL 86%

R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?

Yi Lu, Jianing Wang, Linsen Guo, Wei He, Hongyin Tang, Tao Gui, Xuanjing Huang, Xuezhi Cao, Wei Wang, Xunliang Cai

机构 * Fudan University(复旦大学) Meituan LongCat Team(美团LongCat团队)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19187 2025-10-22 cs.CL cs.AI 86%

LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling

Yang Xiao, Jiashuo Wang, Ruifeng Yuan, Chunpu Xu, Kaishuai Xu, Wenjie Li, Pengfei Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) SII

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10343 2025-10-21 cs.CL cs.AI 86%

Code Execution as Grounded Supervision for LLM Reasoning

Dongwon Jung, Wenxuan Zhou, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09513 2025-10-10 cs.CL cs.AI cs.MA 86%

ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning

Yu Sun, Xingyu Qian, Weiwen Xu, Hao Zhang, Chenghao Xiao, Long Li, Deli Zhao, Wenbing Huang, Tingyang Xu, Qifeng Bai, Yu Rong

机构 * Alibaba DAMO Academy(阿里巴巴达摩院) School of Basic Medical Sciences, Lanzhou University(兰州大学基础医学学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14245 2025-10-03 cs.AI cs.CL 86%

Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs

Xumeng Wen, Zihan Liu, Shun Zheng, Shengyu Ye, Zhirong Wu, Yang Wang, Zhijian Xu, Xiao Liang, Junjie Li, Ziming Miao, Jiang Bian, Mao Yang

机构 * Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Update with more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23574 2025-09-30 cs.CL cs.AI 86%

Towards Efficient CoT Distillation: Self-Guided Rationale Selector for Better Performance with Fewer Rationales

Jianzhi Yan, Le Liu, Youcheng Pan, Shiwei Chen, Yang Xiang, Buzhou Tang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Shaoguan Research Institute of Data Industry(韶关数据产业研究院)

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07335 2025-09-30 cs.CL cs.AI 86%

Improving LLM Reasoning through Interpretable Role-Playing Steering

Anyi Wang, Dong Shu, Yifan Wang, Yunpu Ma, Mengnan Du

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Northwestern University(西北大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) New Jersey Institute of Technology(新泽西理工学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15361 2025-09-23 cs.CL cs.AI 86%

Does Reasoning Introduce Bias? A Study of Social Bias Evaluation and Mitigation in LLM Reasoning

Xuyang Wu, Jinming Nian, Ting-Ruen Wei, Zhiqiang Tao, Hsin-Tai Wu, Yi Fang

机构 * Santa Clara University(圣克拉拉大学) Rochester Institute of Technology(罗切斯特理工学院) Docomo Innovations(Docomo创新)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07104 2025-09-11 cs.CL cs.AI 86%

How Far Are We from Optimal Reasoning Efficiency?

Jiaxuan Gao, Shu Yan, Qixin Tan, Lu Yang, Shusheng Xu, Wei Fu, Zhiyu Mei, Kaifeng Lyu, Yi Wu

机构 * IIIS, Tsinghua University(清华大学信息学院) Ant Research, RL Lab(蚂蚁研究院强化学习实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏