arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-04 至 2026-06-04 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 14 篇

2606.05025 2026-06-04 cs.LG cs.AI 84%

Invariant Gradient Alignment for Robust Reasoning Distillation

不变梯度对齐用于鲁棒推理蒸馏

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * University of Oxford(牛津大学) FLock.io

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出不变梯度对齐(IGA)框架,通过逻辑同构集、连续梯度冲突掩码和截断SVD投影,对齐不同语义域但逻辑结构相同的梯度更新,提升大语言模型在分布外输入上的鲁棒性。

Comments 30 Pages

Journal ref In Proceedings of European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05009 2026-06-04 cs.CL cs.AI 81%

DAR: Deontic Reasoning with Agentic Harnesses

DAR: 基于智能体框架的道义推理

Guangyao Dou, William Jurayj, Nils Holzenberger, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) Télécom Paris, Institut Polytechnique de Paris(巴黎电信学院,巴黎理工学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DAR框架,通过让模型按需与法规交互来提升基于LLM的道义推理能力,实验表明智能体框架可提升性能但存在非均匀改进和弱模型数值任务退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02405 2026-06-04 cs.LG cs.AI 81%

Making Expert Reasoning Learnable with Self-Distillation

通过自蒸馏使专家推理可学习

Ethan Mendes, Jungsoo Park, Alan Ritter

机构 * Georgia Institute of Technology, Atlanta, Georgia(佐治亚理工学院,亚特兰大,佐治亚州)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出分布对齐模仿学习(DAIL),通过两步自蒸馏方法弥合专家解决方案与模型分布之间的差距,利用少量高质量专家数据显著提升大语言模型的推理能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00104 2026-06-04 cs.CV cs.AI 79%

R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

R3G: 一种面向以视觉为中心的答案生成的推理-检索-重排序框架

Zhuohong Chen, Zhengxian Wu, Zirui Liao, Shenao Jiang, Hangrui Xu, Yang Chen, Chaokui Su, Xiaoyu Liu, Haoqian Wang

机构 * The Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) State Key Laboratory of Nuclear Power Safety Technology and Equipment, China(核能安全技术与装备国家重点实验室) School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机科学与信息工程学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出R3G框架,通过先制定推理计划指定所需视觉线索,再采用粗检索加细粒度重排序的两阶段策略选择证据图像,在MRAG-Bench上提升六种多模态大语言模型在九个子场景中的准确率,实现整体最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08665 2026-06-04 cs.CL 70%

Hint Tuning: Less Data Makes Better Reasoners

Hint Tuning:更少的数据造就更好的推理者

Siqi Fan, Minghao Li, Xiaoqian Ma, Xiusheng Huang, Zhuo Chen, Bowen Qin, Liujie Zhang, Shuo Shang, Weihang Chen

机构 * University of Electronic Science and Technology of China(电子科技大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出Hint Tuning方法,通过自动构建三种提示状态(无提示、稀疏提示、完整提示)的训练数据,使推理模型根据问题难度校准推理深度,仅用1K样本即可在多个主流推理模型上平均减少31.5%的token生成,同时保持竞争性准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04236 2026-06-04 cs.CL cs.AI cs.LG 67%

Supportive Token Revealing for Fast Diffusion Language Model Decoding

支持性标记揭示:快速扩散语言模型解码

Giries Abu Ayoub, Mario Barbara, Lluís Pastor-Pérez, Tanja Bien, Aneesh Barthakur, Alaa Maalouf, Loay Mualem

机构 * Department of Computer Science, University of Haifa(海法大学计算机科学系) Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) IMPRS-IS

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AXON模块,通过选择注意力、不确定性和置信度信号中的锚点标记来改善扩散语言模型并行解码的质量-延迟权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04516 2026-06-04 cs.LG cs.AI 62%

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling

GeoMin: 基于几何分布建模的数据高效半监督RLVR

Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Kai Tang, Zhengqing Zang, Bowen Song, Weiqiang Wang, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出GeoMin方法,通过建模标注数据的全局特征分布来解码正确与错误展开的结构差异,从而建立稳健先验评估自奖励信号可靠性,以少量标注数据高效利用未标注数据,在仅用10%标注时超越全监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02834 2026-06-04 cs.LG cs.AI 62%

What Structural Inductive Bias Helps Transformers Reason Over Knowledge Graphs? A Study with Tabula RASA

什么结构归纳偏置帮助Transformer在知识图谱上进行推理?Tabula RASA研究

Jonas Petersen, Camilla Mazzoleni, Gian-Alessandro Lombardi, Federico Martelli, Riccardo Maggioni

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过最小化Transformer修改的消融实验,发现稀疏邻接掩码是驱动多跳推理的主要结构归纳偏置,而关系参数贡献有限。

Comments Accepted at GFM, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05116 2026-06-04 cs.LG 57%

Graph Set Transformer

图集变换器

Jose E. Escrig Molina, Baoquan Chen, Daniel Probst

机构 * Bioinformatics Group Wageningen University(瓦赫宁根大学生物信息学组) Department of Physics Technical University of Munich(慕尼黑技术大学物理系)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 提出图集变换器(GST),通过层间交织节点级特征传播与跨图上下文建模,解决图集合学习任务中局部结构与集合上下文融合问题,在合成和真实基准上优于基线。

Comments 10 pages, 1 figure, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05037 2026-06-04 cs.SE cs.AI 57%

Self-Reflective APIs: Structure Beats Verbosity for AI Agent Recovery

自反式API:结构优于冗长,助力AI代理恢复

Arquimedes Canedo, Grama Chethan

机构 * Siemens Digital Industries Software, USA(西门子数字工业软件公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出自反式API,在验证失败时返回机器可读的结构化建议,使AI代理无需外部推理即可修复请求并重试,在Anthropic模型上将任务完成率提升36.7-40.0个百分点,且每成功令牌效率提升1.8-2.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04378 2026-06-04 cs.CL 57%

DLLG: Dynamic Logit-Level Gating of LLM Experts

DLLG: 大语言模型专家的动态logit级门控

Bingnan Li, Zhaoyang Zhang, Xiaoze Liu, Yantao Shen, Shuli Jiang, Shuo Yang, Wei Xia, Zhuowen Tu, Stefano Soatto

机构 * University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出DLLG框架,通过轻量级门控模块学习token级专家融合权重,利用稀疏的响应级监督实现动态logit级集成,无需token级标签或专家重训练,在推理和代码基准上优于路由、启发式集成和参数合并方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04272 2026-06-04 cs.LG 57%

RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training

预训练期间的强化学习探索:重新审视LLM训练中的策略优化

Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

机构 * Harvard University(哈佛大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文质疑LLM标准训练流程中仅在预训练和监督微调后使用强化学习的做法,通过从头训练LLM并在中间检查点直接应用RL、SFT及SFT后RL,发现RL早期有效且能匹配完整流程,同时提出并行平均合并RL和SFT目标的方法在保持通用能力的同时优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04152 2026-06-04 cs.AI cs.CY 57%

Thinking Through Signs: PEEL as a Semiotic Scaffolding for Epistemically Accountable AI-Enabled Research

通过符号思考:PEEL作为认知可问责的AI赋能研究的符号脚手架

Clarisse de Souza, Gabriel Barbosa, Simone Diniz Junqueira Barbosa, Bárbara Betts, Renato Cerqueira, Juliana Jansen Ferreira

机构 * PUC-Rio(里约热内卢联邦大学) PUC-Behring Institute of Artificial Intelligence(贝林格人工智能研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PEEL框架,结合Voyant Tools的确定性远读与Claude的LLM解释,基于皮尔斯符号学和溯因推理,揭示AI生成摘要中的系统性扭曲,并得出三项设计启示。

Comments 10 pages, 5 figuras

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21892 2026-06-04 cs.CL 57%

Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning

Graph-R1:通过端到端强化学习实现智能图RAG框架

Haoran Luo, Haihong E, Guanting Chen, Qika Lin, Yikai Guo, Fangzhi Xu, Zemin Kuang, Meina Song, Xiaobao Wu, Yifan Zhu, Luu Anh Tuan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Graph-R1,首个通过端到端强化学习的智能图RAG框架,采用轻量知识超图构建、多轮智能体-环境交互检索和端到端奖励机制,在推理准确性、检索效率和生成质量上优于传统图RAG和强化学习增强RAG方法。

Comments Accepted by ICML 2026 main conference

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏