arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4991 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4991 篇

2603.01637 2026-03-03 cs.CV 82%

DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving

DriveCombo:自主驾驶中组合交通规则推理的基准测试

Enhui Ma, Jiahuan Zhang, Guantian Zheng, Tao Tang, Shengbo Eben Li, Yuhang Lu, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Zhihui Hao, Xianpeng Lang, Kaicheng Yu

机构 * Autolab, Westlake University(西lake大学自动化实验室) Li Auto Inc(Li Auto公司) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract)

AI总结 DriveCombo提出了一种基于文本和视觉的基准,用于评估自动驾驶中复杂交通规则的推理能力,通过五级认知阶梯和Rule2Scene代理提升模型在多规则冲突场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25992 2026-03-02 cs.CL cs.AI cs.LG 82%

Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning

监督强化学习:从专家轨迹到逐步推理

Yihe Deng, I-Hung Hsu, Jun Yan, Zifeng Wang, Rujun Han, Gufeng Zhang, Yanfei Chen, Wei Wang, Tomas Pfister, Chen-Yu Lee

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SRL框架,通过生成逻辑动作序列提升小模型的多步推理能力,结合监督与强化学习实现更有效的训练。

Comments Paper accepted by ICLR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23115 2026-02-25 cs.LG cs.AI cs.CL 82%

RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility

RHYTHM:基于层次时间标记的人类移动推理

Haoyu He, Haozheng Luo, Yan Chen, Qi R. Wang

机构 * Northeastern University(东北大学) Northwestern University(西北大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RHYTHM通过层次时间标记框架提升人类移动预测的准确性和效率,实现更高效的时空推理与预测。

Comments Advances in Neural Information Processing Systems 39 (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23038 2026-02-24 cs.CL cs.AI cs.LG 82%

Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning

通过工具集成强化学习激励LLM裁判的代理推理

Ran Xu, Jingjing Chen, Jiayu Ye, Yu Wu, Jun Yan, Carl Yang, Hongkun Yu

机构 * Emory University(埃默里大学) Google(谷歌) Google Cloud AI Research(谷歌云人工智能研究)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TIR-Judge通过工具集成强化学习提升LLM裁判的推理能力,在多个基准测试中取得显著成效。

Comments ICLR 2026

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11361 2026-02-13 cs.CL cs.AI cs.LG 82%

Finding the Cracks: Improving LLMs Reasoning with Paraphrastic Probing and Consistency Verification

发现裂缝:通过反语探测和一致性验证改进大语言模型推理

Weili Shi, Dongliang Guo, Lehan Yang, Tianlong Wang, Hanzhang Yuan, Sheng Li

机构 * School of Data Science, University of Virginia, Charlottesville, United States.(数据科学学院,弗吉尼亚大学,切萨皮克市,美国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PPCV通过反语探测和一致性验证改进大语言模型推理,通过识别和替换关键标记以提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09829 2026-02-13 cs.IR 82%

Internalizing Multi-Agent Reasoning for Accurate and Efficient LLM-based Recommendation

内部化多智能体推理以实现准确且高效的基于LLM的推荐

Yang Wu, Haoze Wang, Qian Li, Jun Zhang, Huan Yu, Jie Jiang

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出STAR模型,通过轨迹驱动的内部化方法,将多智能体推理能力高效整合到单模型中,实现准确且高效的推荐系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11924 2026-02-12 cs.CL cs.AI cs.LG 82%

Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability

大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示

Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。

Journal ref 4th Deployable AI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21436 2026-02-05 cs.LG cs.AI cs.CL cs.CV 82%

From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning

从一致性到互补性:面向时间序列理解和推理的对齐与解缠多模态学习

Hang Ni, Weijia Zhang, Fei Wang, Zezhi Shao, Hao Liu

机构 * The Hong Kong University of Science(香港科学与技术大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MADI通过细粒度对齐和解缠交互提升多模态时间序列理解和推理能力,实现更精确的数值-视觉模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02313 2026-02-04 cs.AI cs.CL cs.LG 82%

Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient

通过集成策略梯度解释和控制大语言模型的推理

Changming Li, Kaixing Zhang, Haoyun Xu, Yingdong Shi, Zheng Zhang, Kaitao Song, Kan Ren

机构 * Independent Researcher(独立研究者) ShanghaiTech University(上海科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出集成策略梯度框架,通过反向传播复合结果信号,实现对大语言模型推理行为的精确解释与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03485 2026-02-04 cs.CL cs.AI cs.LG 82%

Self-Verification Dilemma: Experience-Driven Suppression of Overused Checking in LLM Reasoning

自我验证困境:经验驱动的过度验证抑制在大语言模型推理中

Quanyu Long, Kai Jie Jiang, Jianda Chen, Xu Guo, Leilei Gan, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种经验驱动的测试时框架,通过抑制过度的自我验证步骤,减少大语言模型推理中的token使用,同时保持或提升准确性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04207 2026-01-29 cs.LG cs.AI cs.CL cs.CV 82%

Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning

推动多模态推理:从优化冷启动到分阶段强化学习

Shuang Chen, Yue Guo, Zhaochen Su, Yafu Li, Yulun Wu, Jiacheng Chen, Jiayu Chen, Weijie Wang, Xiaoye Qu, Yu Cheng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Soochow University(苏州大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ReVisual-R1,通过优化冷启动和分阶段强化学习提升多模态推理能力,在多个挑战性基准测试中取得新突破。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10688 2026-01-27 cs.LG cs.AI cs.CC cs.CL 82%

Neural Algorithmic Reasoning for Hypergraphs with Looped Transformers

具有循环变换器的超图神经算法推理

Zekai Huang, Yingyu Liang, Zhenmei Shi, Zhao Song, Zhen Zhuang

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于循环变换器的超图神经算法推理方法,通过退化机制和超边感知编码方案模拟超图算法,展示其在高维数据处理中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05167 2026-01-09 cs.CL cs.AI cs.LG 82%

RelayLLM: Efficient Reasoning via Collaborative Decoding

RelayLLM: 通过协作解码实现高效推理

Chengsong Huang, Tong Zheng, Langlin Huang, Jinyuan Li, Haolin Liu, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland(马里兰大学) University of Virginia(弗吉尼亚大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RelayLLM通过令牌级协作解码实现高效推理,利用SLM作为主动控制器,仅在必要时调用LLM,显著降低计算成本并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19542 2026-01-07 cs.CV 82%

CVBench: Benchmarking Cross-Video Synergies for Complex Multimodal Reasoning

CVBench: 多视频协同推理的基准测试

Nannan Zhu, Yonghao Dong, Teng Wang, Xueqian Li, Shengjun Deng, Yijia Wang, Zheng Hong, Tiantian Geng, Guo Niu, Hanyan Huang, Xiongfei Yao, Shuaiwei Jiao

机构 * Sun Yat-sen University(中山大学) University of Hong Kong(香港大学) Foshan University(佛山大学) University of Birmingham(伯明翰大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 CVBench通过跨视频关系推理基准测试,揭示多模态大语言模型在跨视频时空推理中的性能差距及架构瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00743 2026-01-01 cs.CL cs.AI cs.LG 82%

Multi-step retrieval and reasoning improves radiology question answering with large language models

多步检索与推理提升大型语言模型在放射学问答中的表现

Sebastian Wind, Jeta Sopa, Daniel Truhn, Mahshad Lotfinia, Tri-Thien Nguyen, Keno Bressem, Lisa Adams, Mirabela Rusu, Harald Köstler, Gerhard Wellein, Andreas Maier, Soroosh Tayebi Arasteh

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RaR通过多步检索与推理提升放射学问答中大型语言模型的诊断准确性和事实一致性。

Comments Published in npj Digital Medicine

Journal ref npj Digit. Med. 8, 790 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05034 2025-11-26 cs.CV 82%

Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

视频大模型训练后:深入探讨大型多模态模型在视频推理中的应用

Yolo Y. Tang, Jing Bi, Pinxin Liu, Zhenyu Pan, Zhangyun Tan, Qianxiang Shen, Jiani Liu, Hang Hua, Junjia Guo, Yunzhong Xiao, Chao Huang, Zhiyuan Wang, Susan Liang, Xinyi Liu, Yizhi Song, Junhua Huang, Jia-Xing Zhong, Bozheng Li, Daiqing Qi, Ziyun Zeng, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Daiki Shimada, Han Liu, Jiebo Luo, Chenliang Xu

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文深入探讨了Video-LMMs训练后处理方法,分析了监督微调、强化学习和测试时扩展等关键技术,总结了设计原则与挑战,为视频推理研究提供了统一框架。

Comments Version v1.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17106 2025-11-24 cs.CV 82%

ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better

ChainV: 原子视觉提示使多模态推理更短更优

Yuan Zhang, Ming Lu, Junwen Pan, Tao Huang, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract)

AI总结 ChainV通过动态整合视觉提示,提升多模态推理的效率和准确性,尤其在数学密集型基准测试中表现突出。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11712 2025-11-18 cs.LG cs.AI cs.CL 82%

Reasoning: From Reflection to Solution

Zixi Li

机构 * Noesis Lab (Independent Research Group)(Noesis实验室(独立研究组)) Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10419 2025-11-13 cs.CL cs.AI cs.LG 82%

ComoRAG: A Cognitive-Inspired Memory-Organized RAG for Stateful Long Narrative Reasoning

Juyuan Wang, Rongchen Zhao, Wei Wei, Yufeng Wang, Mo Yu, Jie Zhou, Jin Xu, Liyan Xu

机构 * Tencent(腾讯)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02834 2025-11-06 cs.AI cs.CL cs.LG 82%

Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything

Huawei Lin, Yunzhi Shi, Tong Geng, Weijie Zhao, Wei Wang, Ravender Pal Singh

机构 * Amazon(亚马逊公司) Rochester Institute of Technology(罗切斯特理工学院) University of Rochester(罗切斯特大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 16 pages, 7 figures, 14 tables. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17266 2025-10-28 q-fin.RM cs.AI cs.CL cs.LG q-fin.CP 82%

Temporal Relational Reasoning of Large Language Models for Detecting Stock Portfolio Crashes

Kelvin J. L. Koa, Yunshan Ma, Yi Xu, Ritchie Ng, Huanhuan Zheng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICAIF 2025 Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17598 2025-10-21 cs.AI cs.CL cs.LG 82%

Reasoning Distillation and Structural Alignment for Improved Code Generation

Amir Jalilifard, Anderson de Rezende Rocha, Marcos Medeiros Raimundo

机构 * Universidade Estadual de Campinas(坎皮纳斯州立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17158 2025-10-21 cs.DC cs.PF cs.SE 82%

Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization

Daniel Nichols, Konstantinos Parasyris, Charles Jekel, Abhinav Bhatele, Harshitha Menon

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09358 2025-10-13 cs.CV 82%

Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models

Qihang Ma, Shengyu Li, Jie Tang, Dingkang Yang, Shaodong Chen, Yingyi Zhang, Chao Feng, Jiao Ran

机构 * ByteDance Douyin Content Group(字节跳动抖音内容团队)

专题命中 复杂问题求解 :chain-of-thought(title);reasoning(abstract);CoT(abstract)

Comments EMNLP2025. Code is avaible at https://github.com/bytedance/DynamicCoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08827 2025-10-10 cs.CL cs.AI cs.LG 82%

A Survey of Reinforcement Learning for Large Reasoning Models

Kaiyan Zhang, Yuxin Zuo, Bingxiang He, Youbang Sun, Runze Liu, Che Jiang, Yuchen Fan, Kai Tian, Guoli Jia, Pengfei Li, Yu Fu, Xingtai Lv, Yuchen Zhang, Sihang Zeng, Shang Qu, Haozhan Li, Shijie Wang, Yuru Wang, Xinwei Long, Fangfu Liu, Xiang Xu, Jiaze Ma, Xuekai Zhu, Ermo Hua, Yihao Liu, Zonglin Li, Huayu Chen, Xiaoye Qu, Yafu Li, Weize Chen, Zhenzhao Yuan, Junqi Gao, Dong Li, Zhiyuan Ma, Ganqu Cui, Zhiyuan Liu, Biqing Qi, Ning Ding, Bowen Zhou

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Fixed typos; added missing and recent citations (117 -> 120 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04204 2025-10-07 cs.CL cs.AI cs.CE cs.LG 82%

CALM Before the STORM: Unlocking Native Reasoning for Optimization Modeling

Zhengyang Tang, Zihan Ye, Chenyu Huang, Xuhan Huang, Chengpeng Li, Sihang Li, Guanhua Chen, Ming Yan, Zizhuo Wang, Hongyuan Zha, Dayiheng Liu, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Qwen Team, Alibaba Inc.(阿里巴巴集团文勤团队) Shanghai University of Finance and Economics(上海财经大学) Southern University of Science and Technology(南方科技大学) Shenzhen Loop Area Institute (SLAI)(深圳环湖研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03349 2025-10-07 cs.LG cs.AI cs.CL physics.ao-ph 82%

AgentCaster: Reasoning-Guided Tornado Forecasting

Michael Chen

机构 * Department of Computing + Mathematical Sciences(计算与数学科学系) California Institute of Technology(加州理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24786 2025-09-30 cs.CV 82%

LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning

Shenghao Fu, Qize Yang, Yuan-Ming Li, Xihan Wei, Xiaohua Xie, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Tongyi Lab, Alibaba Group(阿里巴巴集团 Tongyi 实验室) Peng Cheng Laboratory, China(鹏城实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室) Guangdong Province Key Laboratory of Information Security Technology, China(广东省信息安全技术重点实验室) Pazhou Laboratory (Huangpu), China(琶洲实验室(黄埔))

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13758 2025-09-30 cs.CY 82%

Towards Evaluting Fake Reasoning Bias in Language Models

Qian Wang, Zhenheng Tang, Zhanzhi Lou, Nuo Chen, Wenxuan Wang, Bingsheng He

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05128 2025-09-19 cs.CL cs.AI cs.LG 82%

DiCoRe: Enhancing Zero-shot Event Detection via Divergent-Convergent LLM Reasoning

Tanmay Parekh, Kartik Mehta, Ninareh Mehrabi, Kai-Wei Chang, Nanyun Peng

机构 * Computer Science Department, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏