arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45006 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3222 篇

2606.19826 2026-06-19 cs.CR cs.MA 新提交 50%

Heterogeneous LLM Debate Under Adversarial Peers: Honest Gains, Replacement Costs, and Resilience

对抗性同伴下的异构LLM辩论:诚实增益、替代成本与韧性

Prashanti Nilayam, Kiran Kumar Ramanna, Prashil Tumbade, Sankalp Nayak

专题命中 数学推理 :reasoning(abstract)

AI总结 研究异构LLM辩论中诚实与对抗性同伴对修正行为的影响,发现诚实同伴降低有害修正率,对抗性同伴则逆转,且异构性在已有对手时也能作为防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06998 2026-06-11 cond-mat.other 版本更新 50%

Identifying Topological Invariants of Non-Hermitian Systems via Domain-Adaptive Multimodal Model for Mathematics

通过数学多模态模型识别非厄密系统拓扑不变量

Jiuchun Meng, Lichao Sun, Xiumei Wang, Dandan Zhu, Xingping Zhou

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出利用多模态模型识别非厄密系统拓扑不变量,通过输入哈密顿量的本征值和本征向量,结合数学大语言模型进行复杂计算和推理,有效提取拓扑信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.03535 2026-06-04 q-fin.MF econ.GN q-fin.EC 50%

General Stopping Behaviors of Naive and Non-Committed Sophisticated Agents, with Application to Probability Distortion

朴素和非承诺的复杂代理的通用停止行为,及其在概率扭曲中的应用

Yu-Jui Huang, Adrien Nguyen-Huu, Xun Yu Zhou

专题命中 数学推理 :reasoning(abstract)

AI总结 本文研究了在时间不一致的收益函数下停止扩散过程的问题,分析了朴素代理的连续再优化决策和复杂代理的均衡策略,并探讨了概率扭曲对停止策略的影响。

Journal ref Mathematical Finance, Vol. 30 (2020), Issue 1, pp 310-340

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30666 2026-06-01 cs.CY 50%

The Tutoring Effectiveness Index: Predicting LLM Math Tutor Quality from Four Conversation Signals

辅导效果指数:从四个对话信号预测LLM数学辅导质量

Shim Jaechang, Unggi Lee

专题命中 数学推理 :reasoning(abstract)

AI总结 提出无需训练和外部评判的辅导效果指数(TEI),通过四个内部推理信号选择冻结模型,将预错误场景的改进率从59.0%提升至81.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26437 2026-05-27 econ.GN q-fin.EC 50%

Divergent Minds, Convergent Baselines: A Bounded-Rationality Account of LLM-Human Strategic Behaviour

分歧的思维,趋同的基线:LLM与人类战略行为的有界理性解释

Po Han Teo

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出有界理性框架,将人类与LLM在战略博弈中的行为差异归因于计算约束的不同,并给出四个操作测试来区分两者的偏差项δ。

Comments 12 pages, 1 table, no figures. Theoretical prequel paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21924 2026-05-22 cs.CV 50%

Visual-Advantage On-Policy Distillation for Vision-Language Models

基于视觉优势的在线策略蒸馏用于视觉-语言模型

Ruiqi Liu, Xiaolei Lv, Gengsheng Li, Ximo Zhu, Zhiheng Wang, Zhengbo Zhang, Junkai Chen, Zhiheng Li, Bo Li, Jun Gao, Shu Wu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学(UCAS)先进交叉学科学院) Hello Group Inc.(Hello集团有限公司) Sun Yat-sen University(中山大学)

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出了一种基于视觉优势的在线策略蒸馏方法,用于提升视觉-语言模型对视觉输入的依赖性,通过引入视觉优势指标来区分关键视觉token与语言token,从而提高蒸馏效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16410 2026-05-19 cs.CV 50%

Test-Time Hinting for Black-Box Vision-Language Models

测试时提示法用于黑盒视觉-语言模型

Kaihua Hou, Abhijith Varma Mudunuri, Jiaxing Qiu, Roxana Daneshjou, Thomas Hartvigsen, Ahmed Alaa

机构 * AlaaLab(Alaa实验室)

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出测试时提示法,通过单次VLM调用提升性能,无需开放权重模型访问,适用于前沿闭源模型。方法通过轻量提示生成器预测提示,引导VLM避开常见错误模式,提升自然图像VQA基准的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01535 2026-05-11 cs.SE 50%

Assessing, Exploiting, and Mitigating Syntactic Robustness Failures in LLM-Based Code Generation

评估、利用和缓解基于LLM的代码生成中的语法鲁棒性故障

Laboni Sarker, Mara Downing, Achintya Desai, Tevfik Bultan

专题命中 数学推理 :reasoning(abstract)

AI总结 研究评估LLM在代码生成中语法鲁棒性,发现其在包含数学公式的提示下存在缺陷,提出预处理步骤提升鲁棒性,使鲁棒性从54.05%提升至74.42%。

Comments 12 pages, 12 figures. Attack strategies and more experimental evaluation is added. Result and big picture remains the same

Journal ref In Proceedings of the 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering (FORGE'26), April 12-13, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16549 2026-04-21 cs.CV 50%

MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems

MathFlow: 提升多模态大语言模型在视觉数学问题中的感知流

Shuhang Chen, Hangjie Yuan, Yunqiu Xu, Pengwei Liu, Tao Feng, Jun Cen, Zeying Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出MathFlow框架,通过分离感知与推理阶段,提升多模态大语言模型在视觉数学问题中的表现,实验表明其在不同推理模型中均有效。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27584 2026-04-03 cs.MA 50%

Sci-Mind: Cognitively-Inspired Adversarial Debate for Autonomous Mathematical Modeling

Sci-Mind:基于认知的对抗辩论用于自主数学建模

Junhao Jia, Huangwei Chen, Ruiying Sun, Yanhui Song, Haishuai Wang, Jiajun Bu, Lei Wu

专题命中 数学推理 :reasoning(abstract)

AI总结 Sci-Mind通过模仿人类科学发现过程,结合经验记忆回溯和对抗性认知辩证,提升自主数学建模的严谨性和代码可执行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19537 2026-03-23 physics.soc-ph 50%

Discovering Governing Spatial Interaction Mechanisms in Dynamic Urban Systems

在动态城市系统中发现支配的空间交互机制

Zhongfu Ma, Di Zhu

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出统一微分方程形式,分解城市动态为时间不变的空间交互过程和自动态部分,通过U-Discovery框架整合假设生成、神经拟合和方程识别,发现支配空间交互规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06569 2026-03-17 cs.CV 50%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18315 2026-03-11 cs.NI 50%

CovertComBench: A First Domain-Specific Testbed for LLMs in Wireless Covert Communication

CovertComBench: 一个用于无线隐蔽通信中LLM的首个领域特定测试平台

Zhaozhi Liu, Jiaxin Chen, Yuanai Xie, Yuna Jiang, Minrui Xu, Xiao Zhang, Pan Lai, Zan Zhou

专题命中 数学推理 :reasoning(abstract)

AI总结 CovertComBench是首个用于评估LLM在无线隐蔽通信中安全约束优化能力的领域特定测试平台,揭示了LLM在高阶数学推导上的不足,强调需通过外部工具增强构建可信无线AI系统。

Comments 6 pages, corrected a typo: "DeepSeek-R1:70B" was previously incorrectly written as "DeepSeek-V3.2:70B"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08477 2026-03-10 eess.SY cs.SY 50%

Behavioral Generative Agents for Power Dispatch and Auction

行为生成代理在电力调度和拍卖中的应用

Shaoze Li, Justin S. Kim, Cong Chen

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出利用生成代理在电力调度和拍卖中模拟人类决策,通过上下文学习模块提升LLM的决策灵活性和经济理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16670 2026-03-10 cs.CV 50%

Learning to Think Fast and Slow for Visual Language Models

学习快速与缓慢思考以提升视觉语言模型

Chenyu Lin, Cheng Chi, Jinlin Wu, Sharon Li, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, CAS(中国科学院自动化研究所) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 数学推理 :reasoning(abstract)

AI总结 DualMindVLM通过双模式思考机制提升视觉语言模型的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05454 2026-03-06 cs.CV 50%

Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes

超越零散接受:通过最长稳定前缀实现DLMs的快速且一致推理

Pengxiang Li, Joey Tsai, Hongwei Xue, Kunyu Shi, Shilin Yan

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract)

AI总结 通过最长稳定前缀调度器,提升DLMs推理速度3.4倍,同时保持输出质量。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04975 2026-03-05 cs.CE 50%

Sentiment-Aware Stock Price Prediction with Transformer and LLM-Generated Formulaic Alpha

具有Transformer和LLM生成公式性阿尔法的情感感知股价预测

Qizhao Chen, Hiroaki Kawashima

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出一种结合Transformer和LLM的股价预测框架,利用LLM生成情感感知的公式性阿尔法以提升预测准确性并增强可解释性。

Comments This paper has been accepted by the journal Digital Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23348 2026-03-03 cs.RO cs.CV 50%

Physically Ground Commonsense Knowledge for Articulated Object Manipulation with Analytic Concepts

为拟合物体操纵的物理常识知识而引入分析概念

Jiude Wei, Yuxuan Li, Cewu Lu, Jianhua Sun

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出通过引入分析概念,将语义级常识知识接地到物理世界,以提升机器人对关节物体的通用精确操纵能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14362 2026-03-03 cs.CV 50%

DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

DeepEyes: 通过强化学习激励'图像思考'

Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Xi’an Jiaotong University(西安交通大学)

专题命中 数学推理 :reasoning(abstract)

AI总结 DeepEyes通过强化学习实现图像引导的推理,无需预训练数据,提升多模态任务性能。

Comments Accepted by ICLR2026. Ziwei, Michael, Jack, and Chenxiao are equal-contribution. The list order is random

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17100 2026-02-20 cs.MA 50%

AgentConductor: Topology Evolution for Multi-Agent Competition-Level Code Generation

AgentConductor: 多智能体竞争级代码生成中的拓扑演化

Siyu Wang, Ruotian Lu, Zhihao Yang, Yuchao Wang, Yanzhou Zhang, Lei Xu, Qimin Xu, Guojun Yin, Cailian Chen, Xinping Guan

专题命中 数学推理 :reasoning(abstract)

AI总结 AgentConductor通过动态拓扑生成和强化学习优化,提升多智能体系统在竞争级代码生成中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10597 2026-02-12 cs.CY 50%

Llama-Polya: Instruction Tuning for Large Language Model based on Polya's Problem-solving

Llama-Polya:基于波利亚问题解决框架的大型语言模型指令调优

Unggi Lee, Yeil Jeong, Chohui Lee, Gyuri Byun, Yunseo Lee, Minji Kang, Minji Jeon

专题命中 数学推理 :reasoning(abstract)

AI总结 Llama-Polya通过整合波利亚问题解决框架,提升大型语言模型在数学推理和教学对齐方面的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03679 2026-02-04 math.HO 50%

Footprints of the Walking of Numbers: A Dynamic Visualization Task for Understanding Decimal Numbers in Secondary Education

数字行走的足迹:一种动态可视化任务,用于理解中学阶段的小数

Felix De la Cruz Serrano

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出一种动态可视化任务,通过生成小数的几何路径帮助中学学生理解小数结构和特性。

Comments in Spanish language

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03060 2026-02-04 cs.CV 50%

IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning

IVC-Prune: 在大型视觉-语言模型中揭示隐式的视觉坐标以进行视觉标记剪枝

Zhichao Sun, Yidong Ma, Gang Liu, Yibo Chen, Xu Tang, Yao Hu, Yongchao Xu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Xiaohongshu Inc(小红书公司)

专题命中 数学推理 :reasoning(abstract)

AI总结 IVC-Prune通过揭示LVLMs中隐式的视觉坐标,提出一种无训练、提示感知的视觉标记剪枝方法,有效减少标记数量并保持高性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22405 2026-02-02 math.OC 50%

Visibility in Polygonal Environments with Holes: Finding Best Spots for Hiding and Surveillance

多孔多边形环境中可见性研究:寻找最佳隐藏与监视位置

Neilabh Banzal, Jorge Cortés, Sonia Martínez

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出了一种归一化下降算法,用于在多孔多边形环境中寻找最优隐藏或监视位置,通过非光滑分析和随机性处理非凸度量问题,确保高概率收敛到局部极小值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20901 2026-01-30 cs.CR 50%

Towards Sensitivity-Aware Language Models

面向敏感性感知的语言模型

Dren Fazlija, Iyiola E. Olatunji, Daniel Kudenko, Sandipan Sikdar

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出了一种方法,通过监督微调提升四比特量化LLMs的敏感性感知能力,使其在隐私保护方面表现更优,同时保持其他任务性能。

Comments 11 pages, 3 figures, 2 tables, AISTATS 2026; Project Page: https://drenfazlija.github.io/towards-sa-llms/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04752 2026-01-09 cs.CV 50%

Skeletonization-Based Adversarial Perturbations on Large Vision Language Model's Mathematical Text Recognition

基于骨架化的对抗扰动在大视觉语言模型数学文本识别中的应用

Masatomo Yoshida, Haruto Namura, Nicola Adami, Masahiro Okuda

机构 * Doshisha University Kyoto, 610-0394 Japan University of Brescia Brescia, 25134 Italy Independent Researcher Tokyo, Japan

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出基于骨架化的对抗扰动方法,用于评估大视觉语言模型在数学文本识别中的视觉能力和局限性,并通过ChatGPT验证其实际应用价值。

Comments accepted to ITC-CSCC 2025

Journal ref Proc. ITC-CSCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02002 2026-01-01 cs.MA 50%

Dynamic Strategy Adaptation in Multi-Agent Environments with Large Language Models

多智能体环境中基于大语言模型的动态策略适应

Shaurya Mallampati, Rashed Shelim, Walid Saad, Naren Ramakrishnan

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出基于大语言模型和博弈论的动态策略适应框架,提升多智能体协作效率和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10966 2025-12-17 physics.ed-ph 50%

Can Large Language Models Correctly Interpret Equations with Errors?

大型语言模型能否正确解释有误的方程?

Lachlan McGinness, Peter Baumgartner

专题命中 数学推理 :reasoning(abstract)

AI总结 本文研究了大型语言模型在解析学生输入中存在错误的方程时的准确性,发现开源模型无法达到预期效果,并提出未来改进方向。

Comments Published in Physics Review Physics Education Research here: https://journals.aps.org/prper/abstract/10.1103/v8f8-s11v

Journal ref Phys. Rev. Phys. Educ. Res. 21, 020155 Published 15 December, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15573 2025-11-20 cs.CY 50%

Two-Faced Social Agents: Context Collapse in Role-Conditioned Large Language Models

Vikram K Suresh

专题命中 数学推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26647 2025-10-31 math.OC 50%

Accelerating mathematical research with language models: A case study of an interaction with GPT-5-Pro on a convex analysis problem

Adil Salim

专题命中 数学推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏