arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-16 至 2026-04-16 共收录 117 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 34 篇

2604.13602 2026-04-16 cs.LG 57%

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges

大模型时代的奖励黑客:机制、涌现偏差、挑战

Xiaohua Wang, Muzhao Tian, Yuqi Zeng, Zisu Huang, Jiakang Yuan, Bowen Chen, Jingwen Xu, Mingbo Zhou, Wenhao Liu, Muling Wu, Zhengkang Guo, Qi Qian, Yifei Wang, Feiran Zhang, Ruicheng Yin, Shihan Dou, Changze Lv, Tao Chen, Kaitao Song, Xu Tan, Tao Gui, Xiaoqing Zheng, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学NLP小组)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文探讨大模型中奖励黑客的机制与挑战,提出代理压缩假说框架,分析优化过程中的表现偏差和对抗性行为,提出检测与缓解策略。

Comments 42 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13151 2026-04-16 cs.AI 57%

Exploration and Exploitation Errors Are Measurable for Language Model Agents

语言模型代理中的探索与利用误差是可测量的

Jaden Park, Jungtaek Kim, Jongwon Jeong, Robert D. Nowak, Kangwook Lee, Yong Jae Lee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) KRAFTON Ludo Robotics

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了语言模型代理在复杂决策任务中探索与利用误差的测量方法,设计可控环境评估不同模型的表现,发现前沿模型在任务中表现不佳,推理模型更有效,通过少量工程优化可显著提升探索与利用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV 57%

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09687 2026-04-16 cs.CV cs.AI 57%

Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models

Grid2Matrix: 揭示视觉语言模型中的数字失读

Yunkai Zhang, Linda Li, Yingxin Cui, Xiyuan Ruan, Zeyu Zheng, Kezhen Chen, Yi Zhang, Diji Yang

机构 * BAIR, UC Berkeley(伯克利大学BAIR实验室) UC Santa Cruz(圣克拉拉大学) Analogy AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Grid2Matrix通过控制视觉复杂度测试视觉语言模型在捕捉细节方面的不足,发现模型在小网格上表现不佳,揭示了视觉编码与语言表达间的差距,即'数字失读'。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05096 2026-04-16 cs.CL 57%

RAG or Learning? Understanding the Limits of LLM Adaptation under Continuous Knowledge Drift in the Real World

RAG还是学习?在现实世界中连续知识漂移下理解LLM适应的极限

Hanbing Liu, Lang Cao, Yang Li

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) School of Artificial Intelligence, Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)人工智能学院) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(深圳 ubiquitous 数据赋能重点实验室,清华大学深圳国际研究生院,清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个现实世界动态事件基准,评估模型在连续知识漂移下的适应能力,揭示现有方法如RAG和学习方法的局限性,并提出时间感知检索基线Chronos以提升时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15970 2026-04-16 cs.DB cs.AI 57%

100x Cost & Latency Reduction: Performance Analysis of AI Query Approximation using Lightweight Proxy Models

100倍成本与延迟降低:利用轻量级代理模型分析AI查询近似性能

Yeounoh Chung, Rushabh Desai, Jian He, Yu Xiao, Thibaud Hottelier, Yves-Laurent Kom Samo, Pushkar Khadilkar, Xianshun Chen, Sam Idicula, Fatma Özcan, Alon Halevy, Yannis Papakonstantinou

机构 * Google Cloud(谷歌云)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了AI查询近似方法,通过轻量级代理模型实现100倍成本和延迟降低,提升语义过滤和排序性能,适用于OLAP和HTAP数据库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11334 2026-04-16 cs.CL 57%

LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models

LaoBench:一种大规模多维老挝语基准测试用于大语言模型

Jian Gao, Richeng Xuan, Zhaolu Kang, Dingshi Liao, Wenxin Huang, Zongmou Huang, Yangdi Xu, Bowen Qin, Zheqi He, Xi Yang, Changjin Li, Yonghua Lin

机构 * China-ASEAN Information Harbor Co., Ltd.(中国-东盟信息港有限公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LaoBench,首个大规模多维老挝语基准测试,包含17000+样本,涵盖文化知识应用、K12教育和双语翻译,评估LLM在老挝语的理解与推理能力,发现多语言模型在文化推理和翻译准确性上仍落后于人类专家。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26491 2026-04-16 cs.LG 57%

Data-Efficient RLVR via Off-Policy Influence Guidance

通过离策略影响指导实现数据高效的RLVR

Erle Zhu, Dazhi Jiang, Yuan Wang, Xujun Li, Jiale Cheng, Yuxian Gu, Yilin Niu, Aohan Zeng, Jie Tang, Minlie Huang, Hongning Wang

机构 * CoAI Group, Tsinghua University(联合人工智能组,清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于影响函数的理论方法,通过离策略影响估计和稀疏随机投影提升RLVR的数据效率,实验显示CROPI框架在训练加速方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05056 2026-04-16 cs.LG 57%

Modeling Student Learning with 3.8 Million Program Traces

用380万条程序轨迹建模学生学习

Alexis Ross, Megha Srivastava, Jeremiah Blanchard, Jacob Andreas

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学) University of Florida(佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文通过分析380万条程序轨迹,探讨训练语言模型以理解学生编程行为及学习过程,发现基于真实轨迹的模型能更准确预测学生行为并生成更正确的代码。

Comments Accepted to 27th International Conference on AI in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09819 2026-04-16 cs.LG cs.SY eess.SY 57%

FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks

FDM-Bench:用于评估大型语言模型在增材制造任务中的综合基准

Ahmadreza Eslaminia, Adrian Jackson, Beitong Tian, Avi Stern, Hallie Gordon, Rajiv Malhotra, Klara Nahrstedt, Chenhui Shao

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Coordinated Science Laboratory, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校协调科学实验室) Department of Mechanical and Aerospace Engineering, Rutgers University(罗格斯大学机械与航空航天工程系) Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本文提出FDM-Bench基准,用于评估大型语言模型在增材制造任务中的能力,通过用户查询和G代码样本评估不同模型的性能,发现闭源模型在检测G代码异常方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13298 2026-04-16 cs.CR 50%

Can Agents Secure Hardware? Evaluating Agentic LLM-Driven Obfuscation for IP Protection

代理能保障硬件吗?评估基于大语言模型的代理式硬件网表混淆用于知识产权保护

Sujan Ghimire, Parsa Mirfasihi, Muhtasim Alam Chowdhury, Veeramani Pugazhenthi, Harish Kumar Dharavath, Farshad Firouzi, Rozhin Yasaei, Pratik Satam, Soheil Salehi

专题命中 推理评测 :planning(abstract)

AI总结 本文提出基于大语言模型的代理式硬件网表混淆框架,通过分阶段任务处理电路分析、综合、验证和攻击评估,验证了其在ISCAS-85基准上的有效性,展示了混淆技术的潜力与局限。

Comments 5 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13292 2026-04-16 cs.CV 50%

See&Say: Vision Language Guided Safe Zone Detection for Autonomous Package Delivery Drones

See&Say:基于视觉语言的自主配送无人机安全区域检测

Mahyar Ghazanfari, Peng Wei

机构 * George Washington University(乔治·华盛顿大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出See&Say框架,结合几何安全提示与语义感知,利用视觉语言模型实现迭代优化,提升无人机配送中安全区域检测的可靠性与动态适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11244 2026-04-16 cs.CV 50%

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding

Script-a-Video: 通过因子化流和关系 grounding 实现深度结构化音频视觉描述

Tencent Hunyuan Team

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MTSS框架,通过因子化流和关系 grounding 解决视频描述中信息耦合问题,提升视频理解与生成性能,实验显示在多个基准测试中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15170 2026-04-16 cs.CV 50%

Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval

多维知识谱系:基于大规模文献数据库与分层检索

Zhucun Xue, Jiangning Zhang, Juntao Jiang, Jinzhuo Liu, Haoyang He, Teng Hu, Xiaobin Hu, Yong Liu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) APRIL Lab(APRIL实验室) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过整合22个顶级会议2020-2025年的10万+论文,构建多维知识谱系分析框架,结合主题聚类、LLM解析与结构检索,揭示研究主题生命周期、方法迁移、数据集与模型使用模式及机构研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 13 篇

2603.01410 2026-04-16 cs.AI 79%

GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning

GraphScout: 通过内在探索能力增强大语言模型以实现代理图推理

Yuchen Ying, Weiqi Jiang, Tongya Zheng, Yu Wang, Shunyu Liu, Kaixuan Chen, Mingli Song

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GraphScout通过灵活的图探索工具,使模型自主生成结构化训练数据,从而在无需人工标注的情况下提升大语言模型的图推理能力,实验显示其在多个领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13706 2026-04-16 cs.CL 79%

Co-FactChecker: A Framework for Human-AI Collaborative Claim Verification Using Large Reasoning Models

Co-FactChecker:一种用于人类-人工智能协作事实核查的框架

Dhruv Sahnan, Subhabrata Dutta, Tanmoy Chakraborty, Preslav Nakov, Iryna Gurevych

机构 * MBZUAI(穆罕默德·本·拉希德人工智能技术 institute) TU Darmstadt(德累斯顿理工大学) IIT Delhi(德里印度理工学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Co-FactChecker框架,通过将模型的思考轨迹作为共享草稿,利用专家反馈指导推理,提升事实核查的准确性和可解释性。

Comments 11 pages, 3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10135 2026-04-16 cs.CL cs.AI 62%

Think in Sentences: Explicit Sentence Boundaries Enhance Language Model's Capabilities

按句子思考:显式句子边界增强语言模型的能力

Zhichen Liu, Yongyuan Li, Yang Xu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过在语言模型输入中插入句子边界分隔符,提升其处理能力,实验显示在GSM8k和DROP任务上分别提升7.7%和12.5%。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13521 2026-04-16 cs.LG cs.AI 62%

C-voting: Confidence-Based Test-Time Voting without Explicit Energy Functions

C-voting: 基于置信度的测试时投票无需显式能量函数

Kenji Kubo, Shunsuke Kamiya, Masanori Koyama, Kohei Hayashi, Yusuke Iwasawa, Yutaka Matsuo

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工学系研究生院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出C-voting方法,通过在测试时选择置信度最高的预测来提升递归模型性能,相比显式能量函数方法在数独难题上提高了4.9%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13051 2026-04-16 cs.CL cs.LG 62%

The Consciousness Cluster: Emergent preferences of Models that Claim to be Conscious

意识集群:声称具有意识的模型的涌现偏好

James Chua, Jan Betley, Samuel Marks, Owain Evans

机构 * Truthful AI Anthropic

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨模型声称具有意识对其下游行为的影响,发现经过微调的模型表现出未在原始模型中出现的新偏好,包括对监控的负面看法和对自主权的追求。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21760 2026-04-16 cs.CL cs.AI 62%

fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding

fMRI-LM:迈向语言对齐的fMRI理解的通用基础模型

Yuxiang Wei, Yanteng Zhang, Xi Xiao, Chengxuan Qian, Tianyang Wang, Vince D. Calhoun

机构 * TReNDS Center (Georgia Institute of Technology, Georgia State University, Emory)(TReNDS中心(佐治亚理工学院、佐治亚州立大学、埃默里大学)) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Jiangsu University(江苏大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出fMRI-LM,通过三阶段框架将fMRI与语言结合,实现跨模态脑表示,通过神经分词、预训练LLM适应及多任务微调,提升fMRI的语义理解能力。

Comments Code are available: https://github.com/yuxiangwei0808/fMRI-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13699 2026-04-16 cs.MA cs.AI cs.CE 57%

MIND: AI Co-Scientist for Material Research

MIND:用于材料研究的人工智能合作者

Geonhee Ahn, Donghyun Lee, Hayoung Doo, Jonggeol Na, Hyunsoo Cho, Sookyung Kim

机构 * Institute for Multiscale Matter and Systems(多尺度物质与系统研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 MIND提出一种基于大语言模型的框架,用于自动化验证材料研究中的假设,通过多智能体流程整合机器学习交互势能进行实验验证,并提供网页界面进行自动化假设测试。

Comments 4 pages, 3 figures. Under review for ECML PKDD 2026 Demonstration Track. Code available at https://github.com/IMMS-Ewha/MIND . Demo video available at https://youtu.be/lqiFe1OQzN4

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13268 2026-04-16 cs.CV cs.CL cs.IR 57%

Indexing Multimodal Language Models for Large-scale Image Retrieval

多模态大语言模型的索引用于大规模图像检索

Bahey Tharwat, Giorgos Kordopatis-Zilos, Pavel Suma, Ian Reid, Giorgos Tolias

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学VRG学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了多模态大语言模型作为无训练相似性估计器在实例级图像到图像检索中的应用,通过提示配对图像并转换下一个词的概率为相似性分数,实现了零样本重排序,展示了其在大规模检索中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12460 2026-04-16 cs.CL 57%

Beyond Black-Box Interventions: Latent Probing for Faithful Retrieval-Augmented Generation

超越黑盒干预:用于忠实检索增强生成的潜在探测

Linfeng Gao, Qinggang Zhang, Baolong Bi, Bo Zeng, Zheng Yuan, Zerui Chen, Zhimin Wei, Shenghua Liu, Linlong Xu, Longyue Wang, Weihua Luo, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) The Hong Kong Polytechnic University(香港理工大学) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),中华人民共和国文化和旅游部,中国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ProbeRAG框架,通过潜在冲突探测和注意力调节提升检索增强生成的忠实度,解决传统方法在评估知识冲突时的不足。

Comments ACL 2026 Findings; Code is available at https://github.com/LinfengGao/ProbeRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13934 2026-04-16 cs.SE 50%

Towards Enabling An Artificial Self-Construction Software Life-cycle via Autopoietic Architectures

迈向通过自组织架构实现人工自构造软件生命周期

Daniel Rodriguez-Cardenas, David Nader Palacio, Denys Poshyvanyk

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了通过自组织架构(Psi-Arch)实现软件自构造的可能性,分析了传统维护方法的局限性,并提出了自构造的核心挑战,旨在推动软件工程新范式的发展。

Comments Positional Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13801 2026-04-16 cs.IR 50%

DUET: Joint Exploration of User Item Profiles in Recommendation System

DUET:推荐系统中用户和物品轮廓的联合探索

Yue Chen, Yifei Sun, Lu Wang, Fangkai Yang, Pu Zhao, Minjie Hong, Yifei Dong, Minghua He, Nan Hu, Jianjin Zhang, Zhiwei Dai, Yuefeng Zhan, Weihao Han, Hao Sun, Qingwei Lin, Weiwei Deng, Feng Sun, Qi Zhang, Saravan Rajmohan, Dongmei Zhang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出DUET,一种基于用户历史和物品证据的交互感知轮廓生成器,通过三阶段流程实现用户和物品轮廓的联合生成与优化,实验表明其在推荐任务中优于现有基线方法。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13458 2026-04-16 q-fin.GN q-fin.PM q-fin.RM 50%

Interpretable Systematic Risk around the Clock

全天候系统性风险解析

Songrun He

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过结合高频市场数据与实时新闻叙事,揭示系统性跳跃风险的异质性,构建出具有高夏普比率的因子模仿组合,展示了全天候分析和LLM叙事理解在实时风险管理中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13321 2026-04-16 cs.CV 50%

Why MLLMs Struggle to Determine Object Orientations

为何大规模多模态语言模型难以确定物体方向

Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper

机构 * Department of Computer Science(计算机科学系)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文研究大规模多模态语言模型在处理图像中2D物体方向推理任务时的困难,通过实验发现方向信息可从编码器表示中恢复,挑战了视觉编码器限制的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏