arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3222 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3222 篇

2511.22173 2025-12-01 cs.CL 57%

RefineBench: Evaluating Refinement Capability of Language Models via Checklists

RefineBench: 通过检查表评估语言模型的细化能力

Young-Jun Lee, Seungone Kim, Byung-Kwan Lee, Minkyeong Moon, Yechan Hwang, Jong Myoung Kim, Graham Neubig, Sean Welleck, Ho-Jin Choi

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 RefineBench通过检查表评估语言模型的细化能力,发现指导细化能显著提升响应质量,而自我细化则需进一步突破。

Comments Project website: https://passing2961.github.io/refinebench-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21756 2025-12-01 cs.CL cs.CE 57%

Dissecting the Ledger: Locating and Suppressing "Liar Circuits" in Financial Large Language Models

拆解账本:在金融大型语言模型中定位并抑制‘骗子电路’

Soham Mirajkar

机构 * Soham Mirajkar ( November 24, 2025 )(Soham Mirajkar)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出通过因果追溯在金融LLM中定位并抑制导致算术幻觉的'骗子电路',通过实验验证了中间层和晚期层的双阶段机制,并展示了抑制特定层可显著降低幻觉输出的置信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21631 2025-12-01 cs.CV cs.AI 57%

Qwen3-VL Technical Report

Qwen3-VL 技术报告

Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, Ke Zhu

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 Qwen3-VL 是一款强大的多模态模型,具备强大的纯文本理解、长上下文处理和多模态推理能力,适用于图像推理、代理决策和多模态代码智能。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00234 2025-12-01 cs.LG cs.CV cs.NA math.NA physics.comp-ph stat.ML 57%

Fast Solvers for Discrete Diffusion Models: Theory and Applications of High-Order Algorithms

离散扩散模型的快速求解器:高阶算法的理论与应用

Yinuo Ren, Haoxuan Chen, Yuchen Zhu, Wei Guo, Yongxin Chen, Grant M. Rotskoff, Molei Tao, Lexing Ying

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出高阶算法用于离散扩散模型,提升推断效率和样本质量,适用于文本、图像等生成任务。

Comments Accepted at NeurIPS 2025 as a Poster (https://openreview.net/forum?id=OuklL6Q3sO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21610 2025-11-27 cs.CL 57%

Auxiliary Metrics Help Decoding Skill Neurons in the Wild

辅助度量帮助解码野生中的技能神经元

Yixiu Zhao, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种方法,通过辅助度量解码技能神经元,验证了其在多种任务中的有效性。

Comments 7 pages, 7 figures. Includes additional appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13841 2025-11-19 cs.LG 57%

Beat the long tail: Distribution-Aware Speculative Decoding for RL Training

Zelei Shao, Vikranth Srivatsa, Sanjana Srivastava, Qingyang Wu, Alpay Ariyak, Xiaoxia Wu, Ameen Patel, Jue Wang, Percy Liang, Tri Dao, Ce Zhang, Yiying Zhang, Ben Athiwaratkun, Chenfeng Xu, Junxiong Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13027 2025-11-18 cs.AI 57%

Scaling Generative Verifiers For Natural Language Mathematical Proof Verification And Selection

Sadegh Mahdavi, Branislav Kisacanin, Shubham Toshniwal, Wei Du, Ivan Moshkov, George Armstrong, Renjie Liao, Christos Thrampoulidis, Igor Gitman

机构 * NVIDIA University of British Columbia(不列颠哥伦比亚大学) Institute for AI R&D of Serbia(塞尔维亚人工智能研究与发展研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09880 2025-11-14 cs.CL cs.CR 57%

EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models

Jialin Wu, Kecen Li, Zhicong Huang, Xinfeng Li, Xiaofeng Wang, Cheng Hong

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Accepted by IEEE Symposium on Security and Privacy (S&P) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07863 2025-11-14 cs.AI 57%

WaterMod: Modular Token-Rank Partitioning for Probability-Balanced LLM Watermarking

Shinwoo Park, Hyejin Park, Hyeseon Ahn, Yo-Sub Han

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

Comments AAAI 2026 (Oral). This is the extended preprint of the copyrighted version at AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04432 2025-11-13 cs.CL 57%

Can Language Models Handle a Non-Gregorian Calendar? The Case of the Japanese wareki

Mutsumi Sasaki, Go Kamoda, Ryosuke Takahashi, Kosuke Sato, Kentaro Inui, Keisuke Sakaguchi, Benjamin Heinzerling

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Accepted to IJCNLP-AACL 2025 (Main). Code available at https://github.com/cl-tohoku/Non-Gregorian-Calendar

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00132 2025-11-11 cs.LG quant-ph 57%

QuanTA: Efficient High-Rank Fine-Tuning of LLMs with Quantum-Informed Tensor Adaptation

Zhuo Chen, Rumen Dangovski, Charlotte Loh, Owen Dugan, Di Luo, Marin Soljačić

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06134 2025-11-11 cs.AI cs.MA 57%

Maestro: Learning to Collaborate via Conditional Listwise Policy Optimization for Multi-Agent LLMs

Wei Yang, Jiacheng Pang, Shixuan Li, Paul Bogdan, Stephen Tu, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13003 2025-11-11 cs.CL 57%

OPLoRA: Orthogonal Projection LoRA Prevents Catastrophic Forgetting during Parameter-Efficient Fine-Tuning

Yifeng Xiong, Xiaohui Xie

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03703 2025-11-10 cs.LG cond-mat.dis-nn cond-mat.stat-mech cond-mat.str-el physics.comp-ph 57%

Learning-at-Criticality in Large Language Models for Quantum Field Theory and Beyond

Xiansheng Cai, Sihan Hu, Tao Wang, Yuan Huang, Pan Zhang, Youjin Deng, Kun Chen

机构 * Institute of Theoretical Physics, Chinese Academy of Sciences, Beijing 100190, China(理论物理研究所,中国科学院,北京) Hefei National Laboratory, University of Science and Technology of China, Hefei 230088, China(合肥国家实验室,中国科学技术大学,合肥) Department of Physics, University of Massachusetts, Amherst, MA 01003, USA(物理系,马萨诸塞大学,阿姆赫斯特) Institute of Physics, Chinese Academy of Sciences, Beijing 100190, China(物理研究所,中国科学院,北京) School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS, Hangzhou 310024, China(基础物理与数学科学学院,杭州高等研究院,UCAS,杭州) Hefei National Laboratory, Hefei 230088, China(合肥国家实验室,合肥) Hefei National Laboratory for Physical Sciences at the Microscale(微尺度物理科学国家实验室,合肥) Department of Modern Physics, University of Science and Technology of China, Hefei 230026, China(现代物理系,中国科学技术大学,合肥)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03492 2025-11-06 cs.LG stat.ML 57%

Why Less is More (Sometimes): A Theory of Data Curation

Elvis Dohmatob, Mohammad Pezeshki, Reyhane Askari-Hemmat

机构 * Concordia University(康科德大学) FAIR at Meta(Meta的FAIR) Mila--Quebec AI Institute(魁北克AI研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03379 2025-11-06 cs.AI cs.SE 57%

Data Dependency-Aware Code Generation from Enhanced UML Sequence Diagrams

Wenxin Mao, Zhitao Wang, Long Wang, Sirong Chen, Cuiyun Gao, Luyang Cao, Ziming Liu, Qiming Zhang, Jun Zhou, Zhi Jin

机构 * WeChat Pay, Tencent Inc(腾讯公司) The Chinese University of Hong Kong(香港中文大学) Wuhan University(武汉大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00606 2025-11-05 cs.CL 57%

SpecDiff-2: Scaling Diffusion Drafter Alignment For Faster Speculative Decoding

Jameson Sandler, Jacob K. Christopher, Thomas Hartvigsen, Ferdinando Fioretto

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01670 2025-11-05 cs.AI physics.chem-ph 57%

QCBench: Evaluating Large Language Models on Domain-Specific Quantitative Chemistry

Jiaqing Xie, Weida Wang, Ben Gao, Zhuo Yang, Haiyuan Wan, Shufei Zhang, Tianfan Fu, Yuqiang Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Wuhan University(武汉大学) Xidian University(西安电子科技大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

Comments Revision at Journal of Chemical Information and Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20527 2025-11-05 cs.CL 57%

SAND-Math: Using LLMs to Generate Novel, Difficult and Useful Mathematics Questions and Answers

Chaitanya Manem, Pratik Prabhanjan Brahma, Prakamya Mishra, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc. (AMD)(先进微器件公司(AMD))

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Accepted at MATH-AI workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00796 2025-11-04 cs.DC cs.LG 57%

AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs

Ran Yan, Youhe Jiang, Tianyuan Wu, Jiaxuan Gao, Zhiyu Mei, Wei Fu, Haohui Mai, Wei Wang, Yi Wu, Binhang Yuan

机构 * HKUST(香港科技大学) Tsinghua University(清华大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13908 2025-11-04 cs.CL 57%

Interpreting the Latent Structure of Operator Precedence in Language Models

Dharunish Yugeswardeenoo, Harshil Nukala, Ved Shah, Cole Blondin, Sean O Brien, Vasu Sharma, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments 11 pages, 6 figures. An earlier version of this work was accepted to CoLM 2024. This is an extended version of our CoLM 2024 paper. Includes additional ablations; added Ved Shah as author for those contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00883 2025-11-03 cs.CL 57%

Mathematics Isn't Culture-Free: Probing Cultural Gaps via Entity and Scenario Perturbations

Aditya Tomar, Nihar Ranjan Sahoo, Ashish Mittal, Rudra Murthy, Pushpak Bhattacharyya

机构 * IIT Bombay(印度班加罗尔理工学院) IBM Research(IBM研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26380 2025-10-31 cs.AI 57%

AI Mathematician as a Partner in Advancing Mathematical Discovery -- A Case Study in Homogenization Theory

Yuanhang Liu, Beichen Wang, Peng Li, Yang Liu

机构 * Qiuzhen College, Tsinghua University, Beijing, China(清华大学北京校区启祯学院) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(清华大学人工智能产业研究院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(清华大学人工智能学院计算机科学与技术系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

Comments 52 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26277 2025-10-31 cs.CL 57%

Do LLMs Signal When They're Right? Evidence from Neuron Agreement

Kang Chen, Yaoning Wang, Kai Xiong, Zhuoka Feng, Wenhe Sun, Haotian Chen, Yixin Cao

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08410 2025-10-31 cs.CL 57%

Large Language Models Have Intrinsic Meta-Cognition, but Need a Good Lens

Ziyang Ma, Qingyue Yuan, Zhenglin Wang, Deyu Zhou

机构 * School of Computer Science and Engineering, Key Laboratory of Computer Network and Information Integration, Ministry of Education, Southeast University, China(计算机科学与工程学院、计算机网络与信息集成重点实验室、教育部、东南大学,中国) Department of Neurosurgery, Shanghai Tenth People’s Hospital, School of Clinical Medicine of Nanjing Medical University, China(神经外科科、上海第十人民医院、南京医科大学临床医学学院,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00799 2025-10-29 cs.LG 57%

Uni-LoRA: One Vector is All You Need

Kaiyang Li, Shaobo Han, Qing Su, Wei Li, Zhipeng Cai, Shihao Ji

机构 * School of Computing University of Connecticut(计算机学院 美国康涅狄格大学) NEC Labs America(NEC美国实验室) Dept. of Computer Science Georgia State University(计算机科学系 美国佐治亚州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23818 2025-10-29 cs.LG 57%

ScaLoRA: Optimally Scaled Low-Rank Adaptation for Efficient High-Rank Fine-Tuning

Yilang Zhang, Xiaodong Yang, Yiwei Cai, Georgios B. Giannakis

机构 * ML Research, Morgan Stanley, New York, NY 10019, USA(ML研究,摩根大通,纽约,纽约州,10019,美国) Visa Research, Austin, TX 78759, USA(Visa研究,奥斯汀,德克萨斯州,78759,美国) Department of ECE, University of Minnesota, MN 55455, USA(电子工程系,明尼苏达大学,明尼苏达州,55455,美国)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21999 2025-10-28 cs.AI 57%

Foundation of Intelligence: Review of Math Word Problems from Human Cognition Perspective

Zhenya Huang, Jiayu Liu, Xin Lin, Zhiyuan Ma, Shangzi Xue, Tong Xiao, Qi Liu, Yee Whye Teh, Enhong Chen

机构 * Department of Statistics, University of Oxford(统计学系、牛津大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21732 2025-10-28 cs.LG 57%

LaX: Boosting Low-Rank Training of Foundation Models via Latent Crossing

Ruijie Zhang, Ziyue Liu, Zhengyang Wang, Zheng Zhang

机构 * University of California at Santa Barbara(加州大学圣芭芭拉分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07851 2025-10-27 cs.CL 57%

Learning to Focus: Causal Attention Distillation via Gradient-Guided Token Pruning

Yiju Guo, Wenkai Yang, Zexu Sun, Ning Ding, Zhiyuan Liu, Yankai Lin

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏