arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-03 至 2026-08-03 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 16 篇

2606.14142 2026-08-03 cs.CL cs.AI 版本更新 86%

Implicit Reasoning for Large Language Model-based Generative Recommendation

基于大语言模型的生成式推荐的隐式推理

Yinhan He, Liam Collins, Bhuvesh Kumar, Jundong Li, Neil Shah, Donald Loveland

机构 * University of Virginia(弗吉尼亚大学) Snap Inc.(Snap公司)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对大语言模型用于生成式推荐时显式推理的三大局限(世界知识表达弱化、语义ID与自然语言嵌入空间不对齐、推理质量敏感),提出轻量级隐式推理范式PauseRec,在性能、训练成本和推理速度上均优于显式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29287 2026-08-03 cs.CL cs.AI 新提交 84%

Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine Translation

带思考的翻译:面向多领域机器翻译的难度自适应推理强化学习方法

Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) School of Informatics, Xiamen University(厦门大学信息学院) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism(文化和旅游部闽台非物质文化遗产数字化保护与智能处理重点实验室(厦门大学))

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多领域机器翻译的难度差异挑战,提出TwT框架,经两阶段训练后,其7B和14B参数版本在翻译质量上优于更大的SOTA模型,且token使用量降低32%-60%。

Comments 34 pages, 17 figures, and 21 tables. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29211 2026-08-03 cs.CL 新提交 79%

Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

何时该放弃:诊断与训练大语言模型以中止无效推理

Xinyan Guan, Jiali Zeng, Chunlei Xin, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Fandong Meng

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Weixin AI, Tencent Inc(腾讯微信人工智能)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对大语言模型在超能力任务上产生无效推理的问题,提出CaRL方法对齐模型行为与能力边界,实验验证其可减少无效推理且不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28966 2026-08-03 cs.CL 新提交 79%

BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning

BLADE:用于高效大语言模型推理的边界扩展与层自适应动态出口

Keshu Fu, Keqin Peng, Jun Bai, Shuhan Qin, Chen Li, Junzhu Liang, Yefei Chen, Jiaqi Li, Yuanxin Ouyang

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 BLADE是一种轻量级框架,通过构建多粒度检查点、学习紧凑探测层子集等,在保持接近基线准确率的同时,减少大语言模型的推理计算与生成令牌量,提升了LLM推理效率。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13316 2026-08-03 cs.AI 版本更新 79%

ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning

ReSum: 通过强化学习协同LLM推理与摘要生成

Xucong Wang, Ziyu Ma, Yong Wang, Shidong Yang, Hailang Huang, Renda Li, Pengkun Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ReSum框架,利用自摘要机制让LLM压缩和组织推理轨迹,通过对比评估自适应触发摘要,在提升性能4%的同时减少18.6%的推理长度。

Comments 24 pages, including 13 pages of main text and 11 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22580 2026-08-03 cs.SE cs.AI 版本更新 79%

RePaCA: Leveraging Reasoning Large Language Models for Static Automated Patch Correctness Assessment

RePaCA:利用推理型大语言模型实现静态自动化补丁正确性评估

Marcos Fuster-Pena, David de-Fitero-Dominguez, Antonio Garcia-Cabot, Eva Garcia-Lopez

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 RePaCA是利用推理型大语言模型的静态APCA技术,经强化学习微调后在Defects4J测试集上达83.1%准确率,泛化能力优于现有方法,可准确识别过拟合补丁并提升可解释性。

Comments Final published version in the Neurocomputing journal. Volume 701, 7 November 2026, 134583. DOI: https://doi.org/10.1016/j.neucom.2026.134583

Journal ref Neurocomputing (7 November 2026), Volume 701, 134583

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29045 2026-08-03 cs.CV 新提交 78%

Adaptive Emotional Video Captioning via Affective Heterogeneous Graph Reasoning and Multi-task Joint Learning

基于情感异质图推理与多任务联合学习的自适应情感视频描述

Junbo Wang, Liangyu Fu, Yuke Li, Xuecheng Wu, Zhiyong Wang

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Computer Science, The University of Sydney(悉尼大学计算机学院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 针对现有情感视频描述方法情感先验处理的缺陷,提出基于情感异质图与多任务联合学习的SAGML框架,实现了更鲁棒的情感视频描述性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28982 2026-08-03 cs.CL cs.AI 新提交 62%

PARALLEL: A Prefrontal-Aligned Reinforcement inspired Approach for Language-Model Learning under Explicit Limits

PARALLEL:显式约束下语言模型学习的前额叶对齐强化启发式方法

Namkyung Yoon, Sanghong Kim, Hwangnam Kim

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PARALLEL是一种前额叶对齐的强化启发式语言模型学习方法,通过分配样本相关更新强度提升适配效率,在多任务上保留高性能且适配轨迹更稳定,支持高效稳定的部署后流式适配。

Comments 8 pages, 3 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29065 2026-08-03 cs.CL 新提交 57%

Tokenizer-Agnostic Engram Module

与分词器无关的恩格拉姆模块(Tokenizer-Agnostic Engram Module)

Jia Peng Lim, Hai Leong Chieu

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对Deepseek Engram模块与分词器耦合的问题,通过替换哈希方式构建联合嵌入空间,实现了分词器无关性,同时保持了相当的性能。

Comments Preprint, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28979 2026-08-03 cs.CL 新提交 57%

Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language Models

混合翻译器:跨异构大语言模型的KV缓存转换

Jin-woo Lee, Minkyung Song, Junghyun Oh, Seunghoon Han, Soyoung Park, Gwangseon Jang, Sungsu Lim

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出MoT框架解决异构LLM间KV缓存无法复用问题,通过多翻译器模块和上下文校正损失实现缓存转换,在多模型转换和实际场景中验证了性能与复用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28678 2026-08-03 cs.AI cs.CV 新提交 57%

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

ViSAGE:为长视频理解构建自修正记忆

Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

机构 * Zhejiang University(浙江大学) Xidian University(西安电子科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 ViSAGE是一种多模态智能体记忆框架,通过跨模态绑定、双向记忆精调及多智能体交叉验证解决长视频理解中的实体混淆等问题,较最强基线准确率提升5.9%。

Comments Accept by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28640 2026-08-03 cs.CL cs.CV 新提交 57%

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs

TokenSwap:多模态大语言模型中模态差距的基准测试与缩减

Andong Hua, Colton Bishop, Igor Mordatch, Arian Hosseini, Jindong Gu, Aleksandra Faust, Rebecca Roelofs, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Google DeepMind(谷歌DeepMind)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出TokenSwap方法构建基准TokenSwap-Bench,发现42个多模态大语言模型普遍存在模态差距,推理模型差距更小,训练中引入TokenSwap可有效缓解该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21846 2026-08-03 cs.AI cs.HC 版本更新 57%

Shaping Scientific Explanations to Expert Perspectives with Persona-Conditioned Reinforcement Learning

基于知识图谱的自适应科学解释的代理人设

Susana Nunes, Tiago Guerreiro, Catia Pesquita

机构 * LASIGE, Faculdade de Ciências da Universidade de Lisboa, Portugal(里斯本大学科学学院LASIGE,葡萄牙)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于强化学习的科学解释生成方法,通过代理人设引导解释代理器适应专家认知策略,提升解释的适应性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11872 2026-08-03 q-bio.GN cs.AI 版本更新 57%

ELISA: An Interpretable Hybrid Generative AI Agent for Expression-Grounded Discovery in Single-Cell Genomics

ELISA:一种可解释的混合生成式AI代理,用于单细胞组学中的表达基础发现

Omar Coser

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 ELISA结合表达嵌入、语义检索和LLM解释,提供交互式单细胞发现,优于CellWhisperer,尤其在基因签名查询中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06828 2026-08-03 cs.CV cs.AI 版本更新 57%

Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models

步级视觉 grounding 信念预测长视界视觉语言模型的分布外泛化

Md Ashikur Rahman, Md Arifur Rahman, Niamul Hassan Samin, Abdullah Ibne Hanif Arean, Juena Ahmed Noshin

机构 * The KOW Company(KOW公司) University of Dhaka(达卡大学) American International University - Bangladesh (AIUB)(孟加拉国美国国际大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究发现长视界视觉语言模型中,步级视觉接地信念预测分布外泛化能力,揭示了模型中间推理与视觉状态的一致性对鲁棒性的影响。

Comments Following the initial submission, we conducted additional experiments that materially changed our understanding of the problem. These new results do not support the central claim of the current manuscript. To avoid disseminating conclusions that we no longer consider adequately supported, we are withdrawing this version while we reassess the findings and prepare a substantially revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03414 2026-08-03 q-bio.NC 版本更新 50%

Cognitive Dark Matter: Measuring What AI Misses

认知暗物质:测量AI所缺失的东西

Patrick J. Mineault, Thomas L. Griffiths, Sean Escola

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出认知暗物质概念,旨在通过测量AI缺失的认知功能提升模型的通用智能,同时促进对人类智能的理解。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏