arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-04 至 2026-06-04 共收录 172 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 28 篇

2606.04072 2026-06-04 cs.RO cs.DC cs.LG cs.SY eess.SY 57%

CADET: A Modular Platform for Evaluating Distributed Cooperative Autonomy in Connected Autonomous Vehicles

CADET:用于评估网联自动驾驶车辆中分布式协作自主性的模块化平台

Pragya Sharma, Brian Wang, Mani Srivastava

机构 * UCLA Amazon Scholar(亚马逊学者)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 提出CADET模块化平台,通过解耦自动驾驶堆栈并集成网络与工作负载仿真,系统评估分布式协作自主系统在真实部署条件下的安全性与性能。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24782 2026-06-04 cs.LG 57%

The Perception-Physics Paradox: Probing Scientific Alignment with TC-Bench

感知-物理悖论:用TC-Bench探究科学对齐

Dingling Yao, Andrea Polesello, Adeel Pervez, Caroline Muller, Francesco Locatello

机构 * ETH Zurich(苏黎世联邦理工学院) DeepMind University of Cambridge(剑桥大学) University of Amsterdam(阿姆斯特丹大学) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出科学对齐概念,通过结构同构性构建层次化必要条件,并发布TC-Bench基准数据集,揭示视觉基础模型在极端条件下依赖视觉捷径而非科学推理。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11194 2026-06-04 cs.AI 57%

Aligning Deep Implicit Preferences by Learning to Reason Defensively

通过防御性推理对齐深度隐式偏好

Peiming Li, Zhiyuan Hu, Yang Tang, Shiyu Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent(腾讯基本算法中心) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出基于批判驱动推理对齐(CDRA)的方法,通过DeepPref基准和个性化生成过程奖励模型(Pers-GenPRM),将偏好对齐转化为结构化推理过程,以推断用户深层隐式偏好并实现防御性推理。

Journal ref ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20233 2026-06-04 cs.CL 57%

REFLEX: Self-Refining Explainable Fact-Checking via Verdict-Anchored Style Control

REFLEX: 通过裁决锚定风格控制实现自我精炼的可解释事实核查

Chuyi Kong, Wei Gao, Jing Ma, Hongzhan Lin, Yuxi Sun

机构 * Hong Kong Baptist University(香港 Baptist 大学) Singapore Management University(新加坡 Management 大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出REFLEX方法,利用自我分歧的真实性信号构建引导向量,以裁决锚定风格控制实现自我精炼的事实核查,仅需465个样本即达最优性能。

Comments 29 pages

Journal ref ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15416 2026-06-04 cs.AI 57%

Adaptive Minds: Empowering Agents with LoRA-as-Tools

自适应心智:将LoRA作为工具赋予智能体能力

Pavan C Shekar, Aswanth Krishnan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出将LoRA适配器作为可调用工具的框架,通过路由和智能体推理聚合多个专业适配器的优势,在30个适配器库中达到98.3%路由准确率,并在九类任务上显著提升性能。

Comments 13 pages, 3 figures, 9 tables. ICML 2026 CompLearn Workshop camera-ready (non-archival). Code: https://github.com/qpiai/adaptive-minds

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05003 2026-06-04 cs.HC 50%

PhysDox: Benchmarking LLMs on Physical Feasibility Auditing of Physiological Sensing Protocols

PhysDox: 对生理传感协议的物理可行性审计进行LLM基准测试

He Liu, Boyuan Gu, Shuaiqi Cheng, Haiyang Sun, Siyu You, Xuming Hu

专题命中 推理评测 :reasoning(abstract)

AI总结 提出PhysDox基准,通过两阶段评估(严重性检测和约束级诊断)测试LLM对生物医学协议物理可行性的审计能力,发现模型存在支架偏差和隐式约束高漏检率等问题。

Comments 31 Pages,7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05001 2026-06-04 cs.SE 50%

TeleSWEBench: A Commit-Driven Benchmark for Evaluating LLM-Powered Software Engineering in Telecommunications

TeleSWEBench:一个面向电信领域评估基于LLM的软件工程的提交驱动基准

Pranshav Gajjar, Ali Mamaghani, Dinesh Bharadia, Vijay K Shah

专题命中 推理评测 :reasoning(abstract)

AI总结 提出TeleSWEBench,首个面向电信领域的提交驱动基准,通过从srsRAN 5G仓库挖掘真实提交并构建734个可执行测试用例,结合分层LLM评判框架TeleJudge,评估ASE工具在电信软件工程中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04220 2026-06-04 cs.CE 50%

Dead Science Walking: Publication Bias and the AI Scientist Pipeline

Dead Science Walking: 出版偏见与AI科学家管道

Kargi Chauhan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究AI科学家系统因文献中阳性结果过度代表而导致的语料库失真问题,通过量化零结果差距并提出放大指数,揭示了标准管道可放大失真2.18倍,并识别了四种治理失败模式及三种干预措施。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 14 篇

2606.05025 2026-06-04 cs.LG cs.AI 84%

Invariant Gradient Alignment for Robust Reasoning Distillation

不变梯度对齐用于鲁棒推理蒸馏

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * University of Oxford(牛津大学) FLock.io

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出不变梯度对齐(IGA)框架,通过逻辑同构集、连续梯度冲突掩码和截断SVD投影,对齐不同语义域但逻辑结构相同的梯度更新,提升大语言模型在分布外输入上的鲁棒性。

Comments 30 Pages

Journal ref In Proceedings of European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05009 2026-06-04 cs.CL cs.AI 81%

DAR: Deontic Reasoning with Agentic Harnesses

DAR: 基于智能体框架的道义推理

Guangyao Dou, William Jurayj, Nils Holzenberger, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) Télécom Paris, Institut Polytechnique de Paris(巴黎电信学院,巴黎理工学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DAR框架,通过让模型按需与法规交互来提升基于LLM的道义推理能力,实验表明智能体框架可提升性能但存在非均匀改进和弱模型数值任务退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02405 2026-06-04 cs.LG cs.AI 81%

Making Expert Reasoning Learnable with Self-Distillation

通过自蒸馏使专家推理可学习

Ethan Mendes, Jungsoo Park, Alan Ritter

机构 * Georgia Institute of Technology, Atlanta, Georgia(佐治亚理工学院,亚特兰大,佐治亚州)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出分布对齐模仿学习(DAIL),通过两步自蒸馏方法弥合专家解决方案与模型分布之间的差距,利用少量高质量专家数据显著提升大语言模型的推理能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00104 2026-06-04 cs.CV cs.AI 79%

R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

R3G: 一种面向以视觉为中心的答案生成的推理-检索-重排序框架

Zhuohong Chen, Zhengxian Wu, Zirui Liao, Shenao Jiang, Hangrui Xu, Yang Chen, Chaokui Su, Xiaoyu Liu, Haoqian Wang

机构 * The Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) State Key Laboratory of Nuclear Power Safety Technology and Equipment, China(核能安全技术与装备国家重点实验室) School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机科学与信息工程学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出R3G框架,通过先制定推理计划指定所需视觉线索,再采用粗检索加细粒度重排序的两阶段策略选择证据图像,在MRAG-Bench上提升六种多模态大语言模型在九个子场景中的准确率,实现整体最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08665 2026-06-04 cs.CL 70%

Hint Tuning: Less Data Makes Better Reasoners

Hint Tuning:更少的数据造就更好的推理者

Siqi Fan, Minghao Li, Xiaoqian Ma, Xiusheng Huang, Zhuo Chen, Bowen Qin, Liujie Zhang, Shuo Shang, Weihang Chen

机构 * University of Electronic Science and Technology of China(电子科技大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出Hint Tuning方法,通过自动构建三种提示状态(无提示、稀疏提示、完整提示)的训练数据,使推理模型根据问题难度校准推理深度,仅用1K样本即可在多个主流推理模型上平均减少31.5%的token生成,同时保持竞争性准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04236 2026-06-04 cs.CL cs.AI cs.LG 67%

Supportive Token Revealing for Fast Diffusion Language Model Decoding

支持性标记揭示:快速扩散语言模型解码

Giries Abu Ayoub, Mario Barbara, Lluís Pastor-Pérez, Tanja Bien, Aneesh Barthakur, Alaa Maalouf, Loay Mualem

机构 * Department of Computer Science, University of Haifa(海法大学计算机科学系) Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) IMPRS-IS

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AXON模块,通过选择注意力、不确定性和置信度信号中的锚点标记来改善扩散语言模型并行解码的质量-延迟权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04516 2026-06-04 cs.LG cs.AI 62%

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling

GeoMin: 基于几何分布建模的数据高效半监督RLVR

Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Kai Tang, Zhengqing Zang, Bowen Song, Weiqiang Wang, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出GeoMin方法,通过建模标注数据的全局特征分布来解码正确与错误展开的结构差异,从而建立稳健先验评估自奖励信号可靠性,以少量标注数据高效利用未标注数据,在仅用10%标注时超越全监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02834 2026-06-04 cs.LG cs.AI 62%

What Structural Inductive Bias Helps Transformers Reason Over Knowledge Graphs? A Study with Tabula RASA

什么结构归纳偏置帮助Transformer在知识图谱上进行推理?Tabula RASA研究

Jonas Petersen, Camilla Mazzoleni, Gian-Alessandro Lombardi, Federico Martelli, Riccardo Maggioni

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过最小化Transformer修改的消融实验,发现稀疏邻接掩码是驱动多跳推理的主要结构归纳偏置,而关系参数贡献有限。

Comments Accepted at GFM, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05116 2026-06-04 cs.LG 57%

Graph Set Transformer

图集变换器

Jose E. Escrig Molina, Baoquan Chen, Daniel Probst

机构 * Bioinformatics Group Wageningen University(瓦赫宁根大学生物信息学组) Department of Physics Technical University of Munich(慕尼黑技术大学物理系)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 提出图集变换器(GST),通过层间交织节点级特征传播与跨图上下文建模,解决图集合学习任务中局部结构与集合上下文融合问题,在合成和真实基准上优于基线。

Comments 10 pages, 1 figure, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05037 2026-06-04 cs.SE cs.AI 57%

Self-Reflective APIs: Structure Beats Verbosity for AI Agent Recovery

自反式API:结构优于冗长,助力AI代理恢复

Arquimedes Canedo, Grama Chethan

机构 * Siemens Digital Industries Software, USA(西门子数字工业软件公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出自反式API,在验证失败时返回机器可读的结构化建议,使AI代理无需外部推理即可修复请求并重试,在Anthropic模型上将任务完成率提升36.7-40.0个百分点,且每成功令牌效率提升1.8-2.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04378 2026-06-04 cs.CL 57%

DLLG: Dynamic Logit-Level Gating of LLM Experts

DLLG: 大语言模型专家的动态logit级门控

Bingnan Li, Zhaoyang Zhang, Xiaoze Liu, Yantao Shen, Shuli Jiang, Shuo Yang, Wei Xia, Zhuowen Tu, Stefano Soatto

机构 * University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出DLLG框架,通过轻量级门控模块学习token级专家融合权重,利用稀疏的响应级监督实现动态logit级集成,无需token级标签或专家重训练,在推理和代码基准上优于路由、启发式集成和参数合并方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04272 2026-06-04 cs.LG 57%

RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training

预训练期间的强化学习探索:重新审视LLM训练中的策略优化

Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

机构 * Harvard University(哈佛大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文质疑LLM标准训练流程中仅在预训练和监督微调后使用强化学习的做法,通过从头训练LLM并在中间检查点直接应用RL、SFT及SFT后RL,发现RL早期有效且能匹配完整流程,同时提出并行平均合并RL和SFT目标的方法在保持通用能力的同时优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04152 2026-06-04 cs.AI cs.CY 57%

Thinking Through Signs: PEEL as a Semiotic Scaffolding for Epistemically Accountable AI-Enabled Research

通过符号思考:PEEL作为认知可问责的AI赋能研究的符号脚手架

Clarisse de Souza, Gabriel Barbosa, Simone Diniz Junqueira Barbosa, Bárbara Betts, Renato Cerqueira, Juliana Jansen Ferreira

机构 * PUC-Rio(里约热内卢联邦大学) PUC-Behring Institute of Artificial Intelligence(贝林格人工智能研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PEEL框架,结合Voyant Tools的确定性远读与Claude的LLM解释,基于皮尔斯符号学和溯因推理,揭示AI生成摘要中的系统性扭曲,并得出三项设计启示。

Comments 10 pages, 5 figuras

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21892 2026-06-04 cs.CL 57%

Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning

Graph-R1:通过端到端强化学习实现智能图RAG框架

Haoran Luo, Haihong E, Guanting Chen, Qika Lin, Yikai Guo, Fangzhi Xu, Zemin Kuang, Meina Song, Xiaobao Wu, Yifan Zhu, Luu Anh Tuan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Graph-R1,首个通过端到端强化学习的智能图RAG框架,采用轻量知识超图构建、多轮智能体-环境交互检索和端到端奖励机制,在推理准确性、检索效率和生成质量上优于传统图RAG和强化学习增强RAG方法。

Comments Accepted by ICML 2026 main conference

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏