arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-08 至 2026-05-08 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 21 篇

2605.05386 2026-05-08 cs.AI cs.CL cs.LG 82%

BALAR : A Bayesian Agentic Loop for Active Reasoning

BALAR:主动推理的贝叶斯代理循环

Aymen Echarghaoui, Dongxia Wu, Emily B. Fox

机构 * Department of Statistics, Stanford University(统计学系,斯坦福大学) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BALAR是一种无需微调的任务无关外环算法,通过维护潜在状态的结构信念,选择澄清问题以最大化预期互信息,并动态扩展状态表示,从而在三个基准测试中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05411 2026-05-08 cs.RO cs.AI 79%

Creative Robot Tool Use by Counterfactual Reasoning

通过反事实推理实现创意机器人工具使用

M. Tuluhan Akbulut, Varun Satheesh, Ahmed Jaafar, Alper Ahmetoglu, Shane Parr, Aditya Ganeshan, Shivam Vats, George Konidaris

机构 * Brown University(布朗大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种因果推理框架,用于识别超出其主要目标的合适工具。通过动态模型模拟实验发现工具与任务的因果关系,并通过几何和物理特征扰动生成反事实工具,实现更可靠的工具选择和更强的技能关键点迁移。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00199 2026-05-08 cs.CL cs.AI cs.IR cs.LG 67%

RSAT: Structured Attribution Makes Small Language Models Faithful Table Reasoners

RSAT:结构化归因使小型语言模型成为可信表格推理器

Jugal Gajjar, Kamalasankari Subramaniakuppusamy

机构 * Department of Computer Science, The George Washington University, USA(计算机科学系,乔治·华盛顿大学,美国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RSAT通过结构化归因提升小型语言模型的表格推理可信度,采用SFT和GRPO阶段训练,显著提高推理忠实度并确保引用有效性。

Comments 8 pages, 8 tables, 9 figures, and a 3-page Appendix. Accepted at the SURGeLLM Workshop at ACL 2026 and will be included in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05715 2026-05-08 cs.AI cs.CL cs.LG 67%

Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes

可解码但无法通过固定残差-流线性引导进行纠正:来自医疗LLM失败模式的证据

Ming Liu

机构 * Amazon(亚马逊)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了LLM隐藏状态中线性可解码的失败信号能否用于纠正失败,通过Overthinking现象发现线性引导无法有效纠正,但可解码的失败结构支持生成后可靠性估计。

Comments 22 pages (14 main + 8 appendix), 5 figures, 7 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06654 2026-05-08 cs.LG cs.AI math.OC 62%

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less

优化器-模型一致性:使用与预训练相同的优化器进行全微调可减少遗忘

Yuxing Liu, Jianyu Wang, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Apple(苹果公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文发现使用与预训练相同的优化器进行全微调,在监督微调阶段能更少遗忘并保持性能,提出优化器-模型一致性概念,通过实验和理论分析揭示优化器对模型的影响及微调策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06196 2026-05-08 cs.AI cs.CL 62%

The Granularity Axis: A Micro-to-Macro Latent Direction for Social Roles in Language Models

粒度轴:语言模型中社会角色的微到宏观潜在方向

Chonghan Qin, Xiachong Feng, Ziyun Song, Xiaocheng Feng, Jing Xiong, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示语言模型中社会角色粒度的潜在方向,通过定义粒度轴,发现其主导了角色表示空间的几何结构,并通过实验验证其在不同层级和模型间的稳定性与因果相关性。

Comments 28 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05965 2026-05-08 cs.LG cs.AI 62%

Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR

超越均匀信用分配:用于RLVR的选区资格痕迹

Chaoli Mou, Zhan Zhuang, Xinning Chen, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出选区资格痕迹(S-trace),通过稀疏资格痕迹机制减少方差,实现细粒度信用分配,实验显示其在Qwen3系列模型上表现优于GRPO,且具备更高的样本和令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17866 2026-05-08 cs.CL cs.AI 62%

Latent Abstraction for Retrieval-Augmented Generation

检索增强生成的潜在抽象

Ha Lan N. T, Minh-Anh Nguyen, Dung D. Le

机构 * Center for AI Research, VinUniversity, Vietnam(越南Vin大学人工智能研究中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LAnR通过在潜在空间中联合执行编码、检索和生成,提升检索增强生成的效率与效果,减少检索调用次数并增强模型整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15270 2026-05-08 cs.CL cs.AI 62%

From Documents to Spans: Scalable Supervision for Evidence-Based ICD Coding with LLMs

从文档到跨度:基于LLM的证据导向ICD编码可扩展监督方法

Xu Zhang, Wenxin Ma, Chenxu Wu, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Kun Zhang, S. Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, USTC(生物医学工程学院,生命科学与医学系,中国科学技术大学) MIRACLE Center, Suzhou Institute for Advance Research, USTC(MIRACLE中心,苏州先进研究院,中国科学技术大学) Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology(江苏省多模态数字孪生技术重点实验室) State Key Laboratory of Precision and Intelligent Chemistry, USTC(精密与智能化学国家重点实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Span-Centric Learning框架,通过局部跨度学习提升ICD编码能力,以更低成本实现宏F1提升8.2点,并提供明确证据支持预测代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05632 2026-05-08 cs.CR cs.CL cs.LG 62%

Architecture Matters: Comparing RAG Systems under Knowledge Base Poisoning

架构至关重要:在知识库中毒情况下比较RAG系统

Samuel Korn

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了在知识库中毒情况下不同RAG架构的鲁棒性,发现架构设计对攻击成功率影响显著,MADAM-RAG在矛盾检测上表现最佳但仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06403 2026-05-08 cs.CL cs.IR 57%

GATHER: Convergence-Centric Hyper-Entity Retrieval for Zero-Shot Cell-Type Annotation

GATHER:面向零样本细胞类型注释的收敛性超实体检索

Zhonghui Zhang, Feng Jiang, Shaowei Qin, Jiahao Zhao, Min Yang

机构 * Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院) Software College, Northeastern University(东北大学软件学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 GATHER通过全局多源图遍历识别拓扑收敛点,以高信息超实体捕捉实体协同,无需LLM参与检索,提升零样本细胞类型注释效率。

Comments Accepted to SIGIR 2026. 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06347 2026-05-08 cs.HC cs.AI 57%

Human-AI Co-Evolution and Epistemic Collapse: A Dynamical Systems Perspective

人类与人工智能的共演与知识崩溃:一种动态系统视角

Xuening Wu, Yanlan Kang, Qianya Xu, Kexuan Xie, Jiaqi Mi, Honggang Wang, Yubin Liu, Zeping Chen

机构 * Fudan University(复旦大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of California San Diego(加州大学圣地亚哥分校) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文从动态系统视角探讨人类与语言模型的共演及知识崩溃问题,提出人类与模型形成反馈闭环的耦合系统,通过三变量模型揭示共进化增强、脆弱均衡和退化收敛三种动态模式。

Comments 5 pages, 3 figures, ICML EIML Workshop submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06342 2026-05-08 cs.CL 57%

Don't Lose Focus: Activation Steering via Key-Orthogonal Projections

不要失去焦点:通过键正交投影进行激活引导

Haoyan Luo, Mateo Espinosa Zarlenga, Mateja Jamnik

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出SKOP方法,通过约束有害的注意力重路由,减少激活引导对推理和检索性能的负面影响,实现最佳的引导-实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06058 2026-05-08 cs.LG cs.CV 57%

Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions

迈向具有解释链预测的自解释文档视觉问答

Kjetil Indrehus, Adrian Duric, Changkyu Choi, Ali Ramezani-Kebrya

机构 * Department of Informatics, University of Oslo(奥斯陆大学信息学院) Integreat – Norwegian Centre for Knowledge-driven Machine Learning(挪威知识驱动机器学习中心) TRUST – The Norwegian Centre for Trustworthy AI(挪威可信人工智能中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出CoExVQA框架,通过解释链设计实现文档视觉问答的自解释,通过证据识别、答案定位和基于证据解码三步流程提升可解释性,实验显示在PFL-DocVQA上取得SotA性能,ANLS提升12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11016 2026-05-08 cs.CV cs.AI 57%

SoccerMaster: A Vision Foundation Model for Soccer Understanding

SoccerMaster: 一种用于足球理解的视觉基础模型

Haolin Yang, Jiayuan Rao, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SoccerMaster,一种统一的足球视觉理解模型,通过多任务预训练统一处理从细粒度感知到高层语义推理的多种任务,实验表明其在多种下游任务中表现优异。

Comments Accepted by CVPR 2026 (Oral); Project Page: https://haolinyang-hlyang.github.io/SoccerMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12635 2026-05-08 cs.AI 57%

Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks

记忆作为行动:面向长周期智能任务的自主上下文编纂

Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Hithink Research(慧思科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Noah’s Ark Lab(华为诺亚实验室) Peng Cheng Lab(鹏城实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MemAct框架,将工作记忆管理作为可学习的策略动作,通过端到端强化学习优化信息保留与任务表现,实验显示其在保持准确性的同时显著减少上下文长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05410 2026-05-08 cs.AI cs.HC physics.ed-ph 57%

LaTA: A Drop-in, FERPA-Compliant Local-LLM Autograder for Upper-Division STEM Coursework

LaTA:一个符合FERPA规定的本地LLM自动评分器,用于大二STEM课程作业

Jesse A. Rodríguez

机构 * School of Mechanical, Industrial, and Manufacturing Engineering(机械、工业与制造工程学院)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 LaTA是一种本地LLM自动评分器,可有效减轻大二STEM课程的评分负担,通过本地运行和LaTeX流程,实现零成本评分,提升学生自信心并提高考试成绩。

Comments Submitted to Computers & Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05271 2026-05-08 cs.CR cs.AI 57%

Shattering the Echo Chamber: Hidden Safeguards in Manuscripts Against the AI Takeover of Peer Review

打破回声室:对抗AI接管同行评审的隐藏保障

Oubo Ma, Ruixiao Lin, Jiahao Chen, Yuan Su, Yong Yang, Shouling Ji

机构 * Zhejiang University(浙江大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出IntraGuard框架,通过在PDF结构中嵌入异构防御文本对象,有效抵御AI生成的同行评审,实现84%的防御成功率,且不影响人类评审。

Comments 22 pages, 14 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10241 2026-05-08 cs.CL cs.IR 57%

ImCoref-CeS: An Improved Lightweight Pipeline for Coreference Resolution with LLM-based Checker-Splitter Refinement

ImCoref-CeS: 一种改进的轻量级管道用于基于LLM的检查-分割细化的指代消解

Kangyang Luo, Yuzhuo Bai, Shuzheng Si, Cheng Gao, Zhitong Wang, Yingli Shen, Wenhao Li, Zhu Liu, Yufeng Han, Jiayi Wu, Cunliang Kong, Maosong Sun

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI, Tsinghua University(清华大学人工智能研究院) East China Normal University(华东师范大学) Jiangsu Collaborative Innovation Center for Language Ability(江苏省语言能力协同创新中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ImCoref-CeS框架,结合增强的监督模型与LLM推理,通过改进的指代消解方法和LLM多角色检查-分割代理提升性能。

Comments Accepted by ACL2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01270 2026-05-08 astro-ph.IM astro-ph.GA astro-ph.SR 50%

Egent: An Autonomous Agent for Equivalent Width Measurement

Egent:等效宽度测量的自主代理

Yuan-Sen Ting, Serat Mahmud Saad, Fan Liu, Yuting Shen

专题命中 其他推理 :reasoning(abstract)

AI总结 Egent结合传统多Voigt拟合与大语言模型视觉检查,实现自动化等效宽度测量,通过函数调用进行拟合推理,验证结果与专家测量一致,且能压缩专家工作量,提供开源代码和网页接口。

Comments 26 pages, 14 figures, 6 tables. Code available at https://github.com/tingyuansen/Egent. Published in the Open Journal of Astrophysics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14337 2026-05-08 cs.CV 50%

On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs

关于塑造 Omni-LLMs 解码策略的注意力 sink 性质

Suho Yoo, Youngjoon Jang, Joon Son Chung

机构 * KAIST(韩国科学技术院) VGG, University of Oxford(牛津大学视觉感知实验室)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文研究 Omni-LLMs 中注意力 sink 的行为,发现其不仅反映头部冗余,还承担额外功能,提出 OutRo 方法通过特征空间对齐和放松因果掩码提升解码性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏