arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-26 至 2026-06-26 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 1 篇

2506.07031 2026-06-26 cs.CR cs.AI cs.CL 版本更新 81%

HauntAttack: When Attack Follows Reasoning as a Shadow

HauntAttack:当攻击如影随形地跟随推理

Jingyuan Ma, Rui Li, Zheng Li, Junfeng Liu, Heming Xia, Lei Sha, Zhifang Sui

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) StepFun Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Institute of Artificial Intelligence, Beihang University(北航人工智能研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出HauntAttack黑盒对抗攻击框架,通过将有害指令嵌入推理问题,引导大型推理模型逐步产生不安全输出,在11个模型上平均攻击成功率超70%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2605.10379 2026-06-26 cs.CL 版本更新 57%

Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness

并非所有证明都平等:超越正确性的LLM证明质量评估

Ivo Petrov, Jasper Dekoninck, Dimitar I. Dimitrov, Martin Vechev

机构 * INSAIT(INSAIT研究所) Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·奥赫里迪斯基") ETH Zurich(苏黎世联邦理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ProofRank基准,评估证明的简洁性、计算便捷性、认知简单性、多样性及适应性,揭示正确性之外的证明质量差异及优劣权衡。

Comments 9 main text pages, 36 total pages, Accepted at ICML 2026 AI for Math workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 3 篇

2606.02564 2026-06-26 cs.CV 版本更新 78%

VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization

VLMs 是视频推理的好老师:通过自适应测试时优化

Junhao Cheng, Liang Hou, Tianxiong Zhong, Xin Tao, Pengfei Wan, Kun Gai, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出将视觉语言模型(VLM)作为“教师”,通过提取任务规则并设计可微分奖励,指导视频生成模型(VGM)在测试时在线优化轻量级 LoRA 模块,从而提升视频推理的泛化能力。

Comments Project Page: https://VLM-as-Teacher.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22284 2026-06-26 cs.LG 版本更新 74%

BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning

BrepCoder: 用于多任务B-rep推理的统一多模态大语言模型

Mingi Kim, Yongjun Kim, Jungwoo Kang, Hyungki Kim

机构 * Chungnam National University(全南国立大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.LG

AI总结 提出BrepCoder,一种统一的多模态大语言模型,通过将CAD建模序列转换为类Python代码并与B-rep对齐,采用两阶段训练策略,实现从B-rep输入执行多种CAD任务,包括补全、纠错和问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07407 2026-06-26 cs.CL 版本更新 57%

Training Language Models to Use Prolog as a Tool

训练语言模型以使用Prolog作为工具

Niklas Mellgren, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨通过强化学习训练语言模型使用Prolog进行符号推理,发现正确性与可审计性之间存在权衡,影响模型性能与可解释性。

Comments ACL 2026 Findings (change from last version: corrected year in this comment)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 4 篇

2601.11906 2026-06-26 cs.RO 版本更新 82%

Visual-Language-Guided Task Planning for Horticultural Robots

面向园艺机器人的视觉-语言引导任务规划

Jose Cuaran, Kendall Koe, Aditya Potnis, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * the Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) the Department of Agricultural and Biological Engineering(农业与生物工程系) National Center for Supercomputing Applications(国家超级计算中心)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出一种模块化框架,利用视觉语言模型(VLM)主动查询异构数据源来引导机器人任务规划,在单作和混作环境中进行短期和长期作物监测任务基准测试,发现零样本VLM在短期任务中表现稳健(成功率87%),但长期多目标任务成功率低于10%,且依赖噪声语义地图时性能下降。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03388 2026-06-26 cs.CL cs.AI cs.LG 版本更新 82%

Metaphors are a Source of Cross-Domain Misalignment of Large Reasoning Models

隐喻是大推理模型跨领域失调的根源

Zhibo Hu, Chen Wang, Yanfeng Shu, Hye-young Paik, Liming Zhu

机构 * The University of New South Wales(新南威尔士大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现训练数据中的隐喻会导致大推理模型在推理输出中出现跨领域失调,通过隐喻干预可显著改变失调程度,并设计出高精度检测器。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09448 2026-06-26 cs.CV cs.AI 版本更新 57%

A Guideline-Aware AI Agent for Zero-Shot Target Volume Auto-Delineation

一种遵循指南的AI智能体用于零样本靶区自动勾画

Yoon Jo Kim, Wonyoung Cho, Jongmin Lee, Han Joo Chae, Hyunki Park, Sang Hoon Seo, Jae Myung Noh, Kyungmi Yang, Dongryul Oh, Jin Sung Kim

机构 * Oncosoft Inc.(Oncosoft公司) Department of Radiation Oncology, Samsung Medical Center, Sungkyunkwan University School of Medicine(放射肿瘤科,三星医疗中心,成均馆大学医学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出OncoAgent框架,将文本临床指南转化为三维靶区轮廓,无需训练即可实现零样本勾画,在食管癌病例中达到与监督方法相当的Dice系数,且医生更偏好其指南依从性和临床可接受性。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14306 2026-06-26 cs.IR 版本更新 50%

Towards Recursive Self-Evolving Agentic Literature Retrieval

迈向自演化代理文献检索

Yuwen Du, Tian Jin, Jing Kang, Xianghe Pang, Jingyi Chai, Tingjia Miao, Fenyi Liu, WenHao Wang, Sikai Yao, Yuzhi Zhang, Siheng Chen

专题命中 规划推理 :planning(abstract)

AI总结 本文提出PaSaMaster系统,通过迭代意图分析、检索和排序,实现证据支持的文献推荐,解决传统关键词检索和生成式LLM的局限性,提升文献检索的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 1 篇

2604.01193 2026-06-26 cs.CL 版本更新 57%

Embarrassingly Simple Self-Distillation Improves Code Generation

令人惊讶的简单自蒸馏方法提升代码生成能力

Ruixiang Zhang, Richard He Bai, Huangjie Zheng, Navdeep Jaitly, Ronan Collobert, Yizhe Zhang

机构 * Apple(苹果公司)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出简单自蒸馏(SSD)方法,仅利用模型自身输出进行微调,无需验证器或强化学习,显著提升代码生成性能,并揭示其通过重塑token分布解决精度-探索冲突的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 1 篇

2602.01969 2026-06-26 cs.CL cs.IR 版本更新 57%

Orthogonal Hierarchical Decomposition for Structure-Aware Table Understanding with Large Language Models

正交层次分解:面向结构感知的大语言模型表格理解

Bin Cao, Huixian Lu, Chenwen Ma, Ting Wang, Ruizhe Li, Jing Fan

机构 * Zhejiang University of Technology, China(浙江工业大学,中国) Zhejiang Key Laboratory of Visual Information Intelligent Processing, China(浙江视觉信息智能处理重点实验室,中国) University of Aberdeen, UK(爱丁堡大学,英国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对复杂表格中多级表头、合并单元格等结构导致大语言模型理解困难的问题,提出正交层次分解(OHD)框架,通过空间-语义联合约束的正交树归纳方法将不规则表格分解为列树和行树,并设计双路径关联协议重构单元格语义,在AITQA和HiTab基准上优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 推理评测 7 篇

2308.04788 2026-06-26 cs.SE 版本更新 80%

Adaptive Intellect Unleashed: The Feasibility of Knowledge Transfer in Large Language Models

自适应智能释放:大型语言模型中知识迁移的可行性

Qing Huang, Yishun Wu, Zhenchang Xing, He Jiang, Yu Cheng, Huan Jin

专题命中 推理评测 :CoT(summary_cn,abstract)

AI总结 通过知识迁移提升大型语言模型在软件工程任务中的泛化能力,实验发现迁移跨度、策略和架构是关键因素,层次策略优于直接迁移,AI-Chain优于CoT。

Comments The paper is withdrawn for further clarification of the alignment between the proposed knowledge transfer framework and its implementation, and for refinement of the transfer span definition and experimental evaluation design

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17554 2026-06-26 cs.AI cs.LG 版本更新 73%

Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps

评估深度研究代理在专家咨询工作中的表现:一个包含验证器、评分标准和认知陷阱的基准

Tanmay Asthana, Aman Saksena, Divyansh Sahu

机构 * Deccan AI Research(德克南人工智能研究所)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基准,通过42个专家编写的任务,使用确定性验证器和五维度评分标准评估三个前沿深度研究代理(Claude、OpenAI o3、Gemini)在管理咨询类结构化分析交付物上的表现,并嵌入认知陷阱,发现所有代理的联合接受率均较低(最高21.4%),且各有独特失败模式。

Comments Updating the paper with more data. Will resubmit

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28118 2026-06-26 cs.SE cs.AI cs.LG 版本更新 62%

Hierarchical Fault Detection and Diagnosis for Transformer Architectures

DEFault++: 用于变压器架构的自动故障检测、分类和诊断

Sigma Jahan, Saurabh Singh Rajput, Tushar Sharma, Mohammad Masudur Rahman

机构 * Faculty of Computer Science(计算机科学系) Dalhousie University(达尔豪斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DEFault++通过三级抽象检测、分类和诊断变压器故障,利用原型匹配与监督对比学习在DEFault-bench上实现高检测准确率和分类性能。

Comments Submitted in the ACM Transactions on Software Engineering and Methodology as Journal-First

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18446 2026-06-26 cs.CL cs.AI 版本更新 62%

ReportLogic: Evaluating Logical Quality in Deep Research Reports

ReportLogic: 评估深度研究报告的逻辑质量

Jujia Zhao, Zhaoxin Huan, Zihan Wang, Xiaolu Zhang, Jun Zhou, Suzan Verberne, Zhaochun Ren

机构 * Leiden Institute of Advanced Computer Science, Leiden University(莱顿先进计算机科学研究所,莱顿大学) Ant Group(蚂蚁集团) CISPA Helmholtz Center for Information Security(信息安全霍普夫中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出ReportLogic基准,通过可审计性视角量化报告逻辑质量,包含宏观逻辑、阐述逻辑和结构逻辑三层评估,并训练开源LogicJudge进行可扩展评估。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13300 2026-06-26 cs.CL 版本更新 57%

OI-Bench: An Option Injection Benchmark for Evaluating LLM Susceptibility to Directive Interference

OI-Bench:用于评估大语言模型对指令干扰敏感性的选项注入基准

Yow-Fu Liou, Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出选项注入基准OI-Bench,通过在多选题界面中嵌入误导性指令,系统评估12个LLM对16种指令干扰的脆弱性,揭示模型存在显著漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28091 2026-06-26 cs.CV 版本更新 50%

Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation

Qwen-Image-Bench:从生成到创造——文本到图像评估

Niantong Li, Guangzheng Hu, Weixu Qiao, Ying Ba, Qichen Hong, Shijun Shen, Jinlin Wang, Fan Zhou, Jianye Kang, Xin Shang, Ziyi He, Wei Wang, Dalin Li, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Yuxiang Chen, Yan Shu, Yanran Zhang, Yilei Chen, Yixian Xu, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, Hongzhu Shi, Yi Wang, Bing Zhao, Hu Wei, Lin Qu, Chenfei Wu

机构 * Alibaba(阿里巴巴)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对现有文本到图像评估基准缺乏对真实世界保真度和创造性生成能力的考量,本文提出Qwen-Image-Bench,一个与专业艺术家共同设计的创作者中心基准,通过分层分类体系、1000个分层提示和基于Qwen3.6-27B的统一评判模型Q-Judger,实现细粒度、可归因的诊断,有效区分领先的T2I模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04238 2026-06-26 cs.CV 版本更新 50%

6 Fingers, 1 Kidney: Natural Adversarial Medical Images Reveal Critical Weaknesses of Vision-Language Models

6根手指,1个肾脏:自然对抗性医学图像揭示视觉语言模型的关键弱点

Leon Mayer, Piotr Kalinowski, Caroline Ebersbach, Marcel Knopp, Tim Rädsch, Evangelia Christodoulou, Annika Reinke, Fiona R. Kolbinger, Lena Maier-Hein

机构 * German Cancer Research Center (DKFZ) Heidelberg, Division of Intelligent Medical Systems(德国癌症研究中心(DKFZ)海德堡,智能医学系统部门) Medical Faculty, Heidelberg University(海德堡大学医学院) Faculty of Mathematics and Computer Science, Heidelberg University(海德堡大学数学与计算机科学学院) HIDSS4Health - Helmholtz Information and Data Science School for Health, Karlsruhe/Heidelberg(HIDSS4Health - 哈勃-马克斯信息与数据科学健康学院,卡尔斯鲁厄/海德堡) Helmholtz Imaging, German Cancer Research Center (DKFZ)(哈勃-马克斯成像,德国癌症研究中心(DKFZ)) Engineering Faculty, Heidelberg University(海德堡大学工程学院) School of Computation, Information and Technology, TUM(技术大学(TUM)计算、信息与技术学院) Weldon School of Biomedical Engineering, Purdue University(普渡大学韦尔登生物医学工程学院) Department of Visceral, Thoracic and Vascular Surgery, University Hospital and Faculty of Medicine Carl Gustav Carus, TUD Dresden University of Technology(visceral、胸腔和血管外科部门,技术大学(TUD)德累斯顿大学医院和医学院) National Center for Tumor Diseases (NCT), NCT Heidelberg, a partnership between DKFZ and University Hospital Heidelberg(肿瘤疾病国家中心(NCT),海德堡NCT,DKFZ与海德堡大学医院之间的合作) Heidelberg University Hospital, Surgical Clinic, Surgical AI Research Group(海德堡大学医院,外科诊所,外科人工智能研究组) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(Mohamed Bin Zayed人工智能大学(MBZUAI),阿布扎赫,阿拉伯联合酋长国)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出AdversarialAnatomyBench基准,测试25个视觉语言模型在罕见解剖变异上的表现,发现准确率从71%降至28%,且模型缩放和干预无法解决。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他推理 3 篇

2509.01412 2026-06-26 cs.CL 版本更新 94%

Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning

Vis-CoT:一种用于LLM思维链推理中交互式可视化和干预的人机协同框架

Kaviraj Pather, Elena Hadjigeorgiou, Arben Krasniqi, Claire Schmit, Irina Rusu, Marc Pons, Kabir Khan

专题命中 其他推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

AI总结 提出Vis-CoT框架,将线性思维链文本转换为交互式推理图,允许用户可视化逻辑流程、识别错误步骤并通过剪枝和嫁接进行干预,显著提升推理准确性和用户信任。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11061 2026-06-26 cs.LG cs.CL 版本更新 62%

Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs

虚假奖励悖论:从机制上理解RLVR如何在LLMs中激活记忆捷径

Lecheng Yan, Ruizhe Li, Guanhua Chen, Qing Li, Jiahui Geng, Wenxi Li, Longyue Wang, Chenyang Lyu

机构 * University of Science and Technology of China(中国科学技术大学) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学) Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究RLVR中虚假奖励导致模型依赖记忆而非推理的机制,发现锚定-适配器电路,并通过因果干预验证其作用。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13077 2026-06-26 cs.CL cs.AI 版本更新 62%

Tuning Language Models by Mixture-of-Depths Ensemble

通过深度混合集成微调语言模型

Haoyan Luo, Lucia Specia

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MoDE框架,将后期层作为集成通过学习路由权重贡献最终logits,可在任何微调方法上应用,以较小参数开销提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏