arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-07 至 2026-04-07 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 22 篇

2604.03571 2026-04-07 cs.AI 83%

Selective Forgetting for Large Reasoning Models

选择性遗忘用于大推理模型

Tuan Le, Wei Qian, Mengdi Huai

机构 * Iowa State University(爱荷华州立大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出一种选择性遗忘框架,通过多语言模型分析推理轨迹,识别并替换敏感内容,以保护一般推理能力,同时解决大推理模型的知识泄露问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04921 2026-04-07 cs.CL cs.CV 79%

TriAttention: Efficient Long Reasoning with Trigonometric KV Compression

TriAttention: 有效长推理的三角KV压缩

Weian Mao, Xi Lin, Wei Huang, Yuxin Xie, Tianfu Fu, Bohan Zhuang, Song Han, Yukang Chen

机构 * MIT(麻省理工学院) NVIDIA(英伟达) ZJU(浙江大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TriAttention通过三角序列利用KV集中性,提升长推理效率,实现2.5倍吞吐量和10.7倍KV内存节省。

Comments Code is available at https://github.com/WeianMao/triattention

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01528 2026-04-07 cs.CY cs.LG 79%

Making Bias Non-Predictive: Training Robust LLM Reasoning via Reinforcement Learning

消除偏见的可预测性:通过强化学习训练鲁棒的大语言模型推理

Qian Wang, Xuandong Zhao, Zirui Zhang, Zhanzhi Lou, Nuo Chen, Dawn Song, Bingsheng He

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Epistemic Independence Training (EIT)框架,通过使偏见提示非预测性来提升大语言模型的推理鲁棒性,实验表明其在对抗性偏见下表现更优,并能泛化至多种偏见类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22095 2026-04-07 cs.CL 79%

Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation

基于推理引导的多模态知识利用的检索专家混合

Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Yishan Li, Yukun Yan, Shuo Wang, Yu Gu, Minghe Yu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MoRE框架,通过动态选择检索专家提升多模态大语言模型的知识利用效率,实验表明在开放领域问答基准上性能提升超过7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03242 2026-04-07 cs.LG 79%

DRAFT: Task Decoupled Latent Reasoning for Agent Safety

草稿:任务解耦的潜在推理用于代理安全

Lin Wang, Junfeng Fang, Dan Zhang, Fei Shen, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出DRAFT框架,通过解耦安全判断为提取器和推理器两个阶段,利用潜在空间证据聚合提升代理安全性,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03796 2026-04-07 cs.MA 79%

When AI Agents Disagree Like Humans: Reasoning Trace Analysis for Human-AI Collaborative Moderation

当AI代理像人类一样产生分歧:用于人机协作 moderation 的推理轨迹分析

Michał Wawer, Jarosław A. Chudziak

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文研究AI代理在仇恨言论 moderation 中的分歧模式,通过推理轨迹分析发现分歧结构比幅度更能预测人类判断需求,提出从共识寻求转向不确定性揭示的多代理设计。

Comments Accepted to the ICLR 2026 Workshop on "From Human Cognition to AI Reasoning: Models, Methods, and Applications (HCAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04372 2026-04-07 cs.CV 78%

Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning

图到帧RAG:面向无训练和可审计的视频推理的视觉空间知识融合

Songyuan Yang, Weijiang Yu, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出G2F-RAG,通过视觉空间知识融合提升视频推理的可解释性和效率,减少认知负担并保留可追溯的证据轨迹。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13193 2026-04-07 cs.RO 78%

Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control

可调节的视觉-语言-动作策略用于具身推理和分层控制

William Chen, Jagdeep Singh Bhatia, Catherine Glossop, Nikhil Mathihalli, Ria Doshi, Andy Tang, Danny Driess, Karl Pertsch, Sergey Levine

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21343 2026-04-07 cs.CL cs.AI cs.LG 67%

Self-Improving Pretraining: using post-trained models to pretrain better models

自我改进预训练:利用后训练模型来预训练更好的模型

Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, Ilia Kulikov, Sainbayar Sukhbaatar, Jason Weston, Xian Li, Olga Golovneva

机构 * FAIR at Meta(Meta FAIR)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新的预训练和中训练方法,通过利用已有的强后训练模型来重写预训练数据并判断策略模型的 rollout,从而在早期训练中引入安全、事实性、生成质量和推理能力等关键行为,提升模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04732 2026-04-07 cs.CL cs.AI 62%

Metaphors We Compute By: A Computational Audit of Cultural Translation vs. Thinking in LLMs

我们通过什么来计算隐喻:对文化翻译与LLM中思维的计算审计

Yuan Chang, Jiaming Qu, Zhu Li

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过创造性写作任务研究LLM的文化包容性,发现模型在特定文化情境下存在刻板隐喻使用和西方默认倾向,表明单纯提示文化身份无法保证文化思维。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04561 2026-04-07 cs.CR cs.AI cs.CL 62%

Mapping the Exploitation Surface: A 10,000-Trial Taxonomy of What Makes LLM Agents Exploit Vulnerabilities

映射利用表面:一种10000次试验的分类,揭示使LLM代理利用漏洞的因素

Charafeddine Mouzouni

机构 * OPIT -- Open Institute of Technology(OPIT——开放理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过10000次试验分析系统提示特征对LLM代理利用漏洞的影响,发现目标重构是唯一可靠触发因素,其他维度在特定条件下未产生显著利用。

Comments 18 pages, 8 tables, code and data at https://github.com/Cmouzouni/exploitation-surface

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04411 2026-04-07 cs.CL cs.AI cs.CV 62%

Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding

响应未能揭示理解:揭示视觉文档理解中内部表征与响应之间的差距

Haruka Kawasaki, Ryota Tanaka, Kyosuke Nishida

机构 * Human Informatics Labs., NTT, Inc.(日本电信电话株式会社人类信息学实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了视觉文档理解中内部表征与生成响应之间的差距,发现任务所需信息在中间层更线性编码,并通过微调中间层提升性能。

Comments Accepted to CVPR2026 workshop (MULA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01554 2026-04-07 cs.LG cs.AI cs.CV 62%

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

InfoTok: 基于信息理论的容量受限共享视觉标记化在统一多模态大语言模型中的应用

Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出InfoTok,一种基于信息瓶颈原理的信息正则化标记化机制,通过互信息约束平衡压缩与任务相关性,提升统一多模态大语言模型的图像理解和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04895 2026-04-07 cs.MA cs.AI 57%

Agentic Federated Learning: The Future of Distributed Training Orchestration

代理联邦学习:分布式训练编排的未来

Rafael O. Jarczewski, Gabriel U. Talasso, Leandro Villas, Allan M. de Souza

机构 * Institute of Computing, University of Campinas(坎皮纳斯州立大学计算研究所) Hub of Artificial Intelligence and Cognitive Architectures - H.IAAC(人工智能与认知架构中心 - H.IAAC)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出代理联邦学习框架,通过语言模型代理自主协调,缓解客户端异质性和系统动态波动,提升资源利用和公平性,推动联邦学习向去中心化生态系统演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04562 2026-04-07 cs.DL cs.AI 57%

Paper Espresso: From Paper Overload to Research Insight

Paper Espresso:从论文过载到研究洞察

Mingzhe Du, Luu Anh Tuan, Dong Huang, See-kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Paper Espresso通过大规模语言模型自动发现、总结和分析arXiv热点论文,揭示AI研究动态,包括强化学习的爆发、非饱和主题涌现及新颖性与社区参与度的正相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04157 2026-04-07 cs.AI 57%

Readable Minds: Emergent Theory-of-Mind-Like Behavior in LLM Poker Agents

可读心智:LLM扑克代理中涌现的理论心智行为

Hsieh-Ting Lin, Tsung-Yu Hou

机构 * Department of Oncology, Koo Foundation Sun Yat-Sen Cancer Center(辜公亮基金会和信治癌中心医院肿瘤科) Department of Digital Content and Technologies, National Chengchi University(国立政治大学数位内容与科技学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究LLM在动态互动中发展理论心智行为的能力,发现持久记忆是必要且充分条件,使代理达到高级对手建模水平,且领域知识增强应用效果。

Comments 7 pages (PNAS format), 4 figures, 2 tables, 49 references. Submitted to PNAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00495 2026-04-07 cs.AI 57%

AI Runtime Infrastructure

AI 运行时基础设施

Christopher Cruz

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AI运行时基础设施,通过在模型与应用之间引入执行层,主动监控和干预智能体行为,优化任务成功率、延迟、令牌效率、可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18633 2026-04-07 cs.AI cs.ET 57%

An Onto-Relational-Sophic Framework for Governing Synthetic Minds

一个面向合成智能的本体-关系-Sophic框架

Huansheng Ning, Jianguo Ding

机构 * University of Science and Technology Beijing(北京科技大学) Blekinge Institute of Technology(布莱金厄理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ORS框架,通过本体论、数字人格谱系和Cybersophy三支柱,解决合成智能的治理问题,展示其在自主研究代理和医疗AI等场景中的适应性治理能力。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06597 2026-04-07 cs.LG stat.ML 57%

Understanding and inverse design of implicit bias in stochastic learning: a geometric perspective

隐式偏置的理解与逆向设计:从几何视角出发

Nicola Aladrah, Emanuele Ballarin, Matteo Biagetti, Alessio Ansuini, Alberto d'Onofrio, Fabio Anselmi

机构 * Department of Mathematics, Informatics and Geoscience, University of Trieste(的里雅斯特大学数学、信息学与地球科学系) Area Science Park(科学园区) McGovern Institute, MIT(麻省理工学院麦戈文研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文从几何视角探讨了随机学习中隐式偏置的形成机制,提出了一种理论框架,通过梯度噪声与损失连续对称性的相互作用解释隐式偏置,并展示了如何通过参数化设计实现逆向设计,验证了稀疏性和谱稀疏性等特性。

Comments v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04361 2026-04-07 cs.HC 50%

Developing Authentic Simulated Learners for Mathematics Teacher Learning: Insights from Three Approaches with Large Language Models

构建数学教师学习的真挚模拟学习者:基于三种方法与大语言模型的洞察

Jie Cao, Ha Nguyen, Selim Yavuz, Boran Yu, Shuguang Wang, Pavneet Kaur Bharaj, Dionne Cross Francis

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨三种方法提升模拟学生的真实性与教学效用,发现多代理和DPO方法能生成明确的解题策略解释,而微调模型虽生成真实回应但限制思维扩展。

Comments This paper has been accepted in AIED'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03890 2026-04-07 cs.RO 50%

From Prompt to Physical Action: Structured Backdoor Attacks on LLM-Mediated Robotic Control Systems

从提示到物理行动:针对LLM介导机器人控制系统结构后门攻击

Mingyang Xie, Jin Wei-Kocsis

机构 * School of Applied and Creative Computing, Purdue University(普渡大学应用与创意计算学院)

专题命中 其他推理 :reasoning(abstract)

AI总结 研究探讨了LLM介导的机器人控制系统中结构后门攻击的影响,通过LoRA技术验证了后门在不同命令生成阶段的传播效果,并提出基于二次LLM的验证防御方法,揭示了实时机器人系统中的安全与响应权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03865 2026-04-07 cs.CY 50%

The Democratic Ontology Deficit: How AI Systems Fail to Represent What Democracy Requires

民主本体论缺失:AI系统如何未能代表民主所需的内容

Robert M. Ceresa, Juan E. Ceresa

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨AI系统在民主机构生活中本体结构上的缺失,通过对比民主代理需求与AI学习的本体结构,发现角色和身份的代表性不足,提出利用现有工具进行公民对齐的研究方案。

Comments 21 pages, 5 tables, under review at JAIR

详情

展开后加载摘要…

URL PDF HTML 收藏