arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-05 至 2026-06-05 共收录 145 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 34 篇

2507.15736 2026-06-05 cs.CL 57%

IDRBench: Understanding the Capability of Large Language Models on Interdisciplinary Research

IDRBench: 理解大型语言模型在跨学科研究中的能力

Yuanhao Shen, Daniel Xavier de Sousa, Ricardo Marçal, Hongyu Guo, Xiaodan Zhu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在跨学科研究中的能力,提出IDRBench框架,通过三个任务评估不同模型的跨学科知识整合能力,并为未来研究建立基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06338 2026-06-05 cs.CV 50%

StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset

StoryVideoQA: 通过大规模、多类型和自动生成的数据集扩展深度视频理解

Zhengqian Wu, Zhixian Liu, Aodong Chen, Jingyang Zhang, Ruizhe Li, Hanlin Ge, Zhongyuan Wang, Chunxia Xiao, Chao Liang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) Hubei Key Laboratory of Multimedia and Network Communication Engineering(湖北省多媒体与网络通信工程重点实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出StoryVideoQA数据集和PlotTree方法,通过多智能体协作框架自动生成大规模深度视频理解问答对,并利用层次化情节结构提升复杂故事线推理能力。

Comments Accepted by IJCV 2026

Journal ref International Journal of Computer Vision (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05249 2026-06-05 cs.SE 50%

SWE-InfraBench: Evaluating Language Models on Cloud Infrastructure Code

SWE-InfraBench:评估语言模型在云基础设施代码上的表现

Natalia Tarasova, Enrique Balp-Straffon, Aleksei Iancheruk, Yevhenii Sielskyi, Nikita Kozodoi, Liam H. Byrne, Jack Butler, Dayuan Jiang, Marcin Czelej, Andrew Ang, Yash Shah, Roi Blanco, Sergei Ivanov

专题命中 推理评测 :reasoning(abstract)

AI总结 提出SWE-InfraBench基准,通过AWS CDK仓库中的真实代码修改任务评估LLM在云基础设施即代码(IaC)上的能力,发现当前最先进模型成功率仅34%。

Comments Accepted to NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10528 2026-06-05 cs.CV 50%

BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs

BareBones: 视觉语言模型中零样本几何理解的基准测试

Aaditya Baranwal, Vishal Yadav, Abhishek Rajora

机构 * University of Central Florida(佛罗里达大学中央分校) University of Calgary(卡尔加里大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出BareBones基准,通过去除RGB纹理仅保留轮廓,测试26个视觉语言模型在零样本几何形状理解上的表现,发现模型存在严重的纹理偏置悬崖。

Comments Accepted at CVPR (13th FGVC Workshop) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08491 2026-06-05 cs.CV 50%

Global Cross-Modal Geo-Localization: A Million-Scale Dataset and a Physical Consistency Learning Framework

全球跨模态地理定位:一个百万级数据集和一个物理一致性学习框架

Yutong Hu, Jinhui Chen, Chaoqiang Xu, Yuan Kou, Sili Zhou, Shaocheng Yan, Pengcheng Shi, Qingwu Hu, Jiayuan Li

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院) First Surveying and Mapping Institute of Hunan Province(湖南省第一测绘院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出CORE数据集和PLANET框架,用于解决全球跨模态地理定位问题,通过大规模数据和物理一致性学习提升定位的鲁棒性和全球适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 20 篇

2606.05988 2026-06-05 cs.LG cs.CL 84%

Compress-Distill: Reasoning Trace Compression for Efficient Knowledge Distillation

压缩-蒸馏:面向高效知识蒸馏的推理轨迹压缩

Maxime Griot, Paul Steven Scotti, Tanishq Mathew Abraham

机构 * Université catholique de Louvain(列日天主教大学) Sophont Inc(Sophont公司)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出在知识蒸馏前对推理轨迹进行事后压缩,以降低训练成本并缩短推理输出,实验表明压缩在准确率与效率间存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06260 2026-06-05 cs.IR cs.AI cs.CL 79%

OneReason Technical Report

OneReason 技术报告

OneRec Team, Biao Yang, Boyang Ding, Chenglong Chu, Dunju Zang, Fei Pan, Han Li, Hao Jiang, Honghui Bao, Huanjie Wang, Jian Liang, Jiangxia Cao, Jiao Ou, Jiaxin Deng, Jinghao Zhang, Kun Gai, Lu Ren, Peiru Du, Pengfei Zheng, Rongzhou Zhang, Ruiming Tang, Shiyao Wang, Siyang Mao, Siyuan Lou, Teng Shi, Wei Yuan, Wenlong Xu, Xingchen Liu, Xingmei Wang, Xinqi Jin, Yan Sun, Yan Wang, Yifei Hu, Yingzhi He, Yufei Ye, Yuhao Wang, Yunhao Zhou, Yuqin Dai, Zhao Liu, Zhipeng Wei, Zhixin Ling, Ziming Li, Zixing Zhang, Ziyuan Liu, An Zhang, Changxin Lao, Chaoyi Ma, Chengru Song, Defu Lian, Fan Yang, Guowang Zhang, Hao Peng, Jiayao Shen, Jie Chen, Jun Xu, Junmin Chen, Kun Zhang, Kuo Cai, Mingxing Wen, Minmao Wang, Minxuan Lv, Qi Zhang, Qiang Luo, Sheng Yu, Shijie Li, Shijie Yi, Shuang Yang, Shugui Liu, Shuni Chen, Tinghai Zhang, Tingting Gao, Xiang Wang, Xiangyu Wu, Xiangyu Zhao, Xiao Lv, Xiaoyou Zhou, Xuming Wang, Yong Du, Zejian Zhang, Zhaojie Liu, Zhiyang Zhang, Zhuang Zhuang, Ziqi Wang, Ziyi Zhao

机构 * OneRec Team(OneRec团队)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 针对生成式推荐模型中推理能力难以激活的问题,提出 OneReason 方法,通过增强感知和认知能力实现有效推理。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06474 2026-06-05 cs.CL cs.AI cs.LG 67%

Self-Augmenting Retrieval for Diffusion Language Models

扩散语言模型的自增强检索

Paul Jünger, Justin Lovelace, Linxi Zhao, Dongyoung Go, Kilian Q. Weinberger

机构 * University of California, Berkeley(加州大学伯克利分校) Google Research(谷歌研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SARDI框架,利用扩散语言模型去噪过程中丢弃的低置信度标记作为前瞻信号指导检索,无需训练且与检索器无关,在多跳问答基准上以高达8倍吞吐量超越现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06467 2026-06-05 cs.CL cs.AI cs.LG 67%

You Only Index Once: Cross-Layer Sparse Attention with Shared Routing

仅索引一次:具有共享路由的跨层稀疏注意力

Yutao Sun, Yanqi Zhang, Li Dong, Jianyong Wang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨层稀疏注意力(CLSA),通过共享KV缓存和路由索引,在保持token稀疏注意力精度的同时减少路由开销,显著提升长上下文LLM的解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06098 2026-06-05 cs.CL cs.LG 62%

IR3DE: A Linear Router for Large Language Models

IR3DE:面向大型语言模型的线性路由器

Eros Fanì, Oğuzhan Ersoy

机构 * Gensyn

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出基于岭回归的线性路由器IR3DE,以低成本快速为每个提示选择最合适的领域专家大语言模型,在推理任务中超越基线方法,并支持动态添加或移除专家模型。

Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05983 2026-06-05 cs.AI cs.CL 62%

Framing, Judging, Steering: An Assessable Competency Model for Teach-ing Students to Reason With Generative AI

框架构建、判断、引导:一种可评估的能力模型,用于教授学生与生成式AI进行推理

Alexander Apartsin, Yehudit Aperstein

机构 * Holon Institute of Technology(霍洛恩技术学院) Afeka College of Engineering(阿菲卡工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出CoRe-3能力模型,将有效使用AI分解为框架构建、判断和引导三种可评估技能,并通过模拟实验验证其区分效度。

Comments 18 pages, 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05749 2026-06-05 cs.CL cs.AI 62%

MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QA

MARDoc:面向多模态长文档问答的记忆感知精炼智能体框架

Kaifeng Chen, Hongtao Liu, Qiyao Peng, Jian Yang, Yongqiang Liu, Xiaochen Zhang, Qing Yang

机构 * Tianjin University(天津大学) Qifu Technology(启福科技) Beihang University(北航) Jiangnan University(江南大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MARDoc框架,通过解耦为探索、精炼和反思三个智能体,并利用结构化记忆替代完整交互历史,减少上下文噪声,提升多模态长文档问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05748 2026-06-05 cs.MM cs.AI cs.CL 62%

UNIVID: Unified Vision-Language Model for Video Moderation

UNIVID:用于视频审核的统一视觉语言模型

Kejuan Yang, Yizhuo Zhang, Mingyuan Du, Yue Zhang, Dixin Zheng, Kaili Zhao, Yang Xiao, Hanzhong Liang, Kenan Xiao

机构 * Bytedance(字节跳动)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出UNIVID统一视觉语言模型,通过生成可解释的策略感知字幕,实现端到端视频审核,减少违规泄露42.7%和过度审核率37.0%。

Comments 7 pages, 3 figures. Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05538 2026-06-05 cs.LG cs.CL 62%

Less is MoE: Trimming Experts in Domain-Specialist Language Models

少即是MoE:修剪领域专家语言模型中的专家

Haoze He, Xinkai Zou, Xuan Jiang, Xingyuan Ding, Ao Qu, Juncheng Billy Li, Heather Miller

机构 * Carnegie Mellon University(卡内基梅隆大学) UCSD(加州大学圣地亚哥分校) MIT(麻省理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对MoE模型部署时参数过多的问题,提出基于Fisher重要性的中间维度修剪方法Fisher-MoE,在50%压缩比下保持模型能力,减少约45%权重内存并提升21%推理吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11632 2026-06-05 cs.CL cs.AI 62%

Macro: Enhancing Multilingual Counterfactual Explanations through Alignment-as-Preference Optimization

Macro: 通过偏好对齐优化提升多语言反事实解释

Yilong Wang, Qianli Wang, Bohao Chu, Yihong Liu, Jing Yang, Simon Ostermann

机构 * Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) University of Duisburg-Essen(杜伊斯堡- Essen大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Saarland Informatics Campus(萨尔兰州信息学校区) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Macro框架,通过直接偏好优化改进多语言反事实解释,提升有效性的同时保持最小性,避免翻译基线的严重最小性问题,并在多个指标上优于监督微调方法。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20980 2026-06-05 cs.LG cs.AI stat.AP stat.ML 62%

From Causal Discovery to Dynamic Causal Inference in Neural Time Series

从因果发现到神经时间序列中的动态因果推断

Dmitry Zaytsev, Valentina Kuskova, Michael Coppedge

机构 * Lucy Family Institute for Data & Society(数据与社会卢西家族研究所) University of Notre Dame(诺克斯达大学) Political Science University of Notre Dame(政治学诺克斯达大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出动态因果网络自回归(DCNAR)两阶段框架,通过神经自回归因果发现学习稀疏有向因果网络,并将其作为结构先验用于时变神经网络自回归,实现无需预设网络结构的动态因果推断。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07253 2026-06-05 cs.AI cs.CL 62%

From Out-of-Distribution Detection to Hallucination Detection: A Geometric View

从分布外检测到幻觉检测:一个几何视角

Litian Liu, Reza Pourreza, Yubing Jian, Yao Qin, Roland Memisevic

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过将幻觉检测重新定义为分布外检测问题,利用几何视角提出了一种无需训练、基于单样本的检测方法,在推理任务中实现了高准确率。

Comments ICML 2026 main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05972 2026-06-05 cs.LG 57%

LLM Explainability with Counterfactual Chains and Causal Graphs

基于反事实链和因果图的LLM可解释性

Nirit Nussbaum-Hoffer, Nitay Calderon, Liat Ein-Dor, Roi Reichart

机构 * Faculty of Data and Decision Sciences, Technion I IBM Research(数据与决策科学学院,技术离子IBM研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 提出一种四阶段方法,利用因果图建模LLM推理过程,通过MCMC启发的反事实增强发现类判别性概念并生成可解释图,用于疾病诊断、情感分析等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05639 2026-06-05 cs.LG 57%

Q-GNN: Query-Conditioned Graph Neural Networks with Type Awareness for Knowledge Graph Completion

Q-GNN: 具有类型感知的查询条件图神经网络用于知识图谱补全

Dongxiao He, Ruqiong Zhang, Zhizhi Yu, Ling Ding, Di Jin, Guangquan Xu, Zhiyong Feng

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 提出Q-GNN,通过融合查询实体的结构上下文和语义类型信息,增强图神经网络在知识图谱补全中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05509 2026-06-05 cs.HC cs.AI 57%

The Role of Instructional Guidance in Generative AI-Assisted Learning: Empirical Evidence from Construction Engineering Education

教学指导在生成式AI辅助学习中的作用:来自建筑工程教育的实证证据

Xiaoyu Hou, Bo Xiao, Hexu Liu, Shane Mueller

机构 * Dept. of Civil, Environmental, and Geospatial Engineering, Michigan Technological Univ.(土木、环境与地理空间工程系,密歇根技术大学) Dept. of Civil and Construction Engineering, Western Michigan Univ.(土木与建设工程系,西部密歇根大学) Dept. of Psychology and Human Factors, Michigan Technological Univ.(心理学与人因工程系,密歇根技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过引入基于生成学习理论的五步提示框架,在建筑工程教育中对比无提示AI辅助、有提示AI辅助和幻灯片学习三种条件,发现提示框架显著提升了需要解释和推理的任务表现(开放式评分提高约2-3分,p<0.01),表明AI辅助学习的有效性取决于交互结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10807 2026-06-05 cs.CR cs.AR cs.LG 57%

LLMs for Secure Hardware Design and Related Problems: Opportunities and Challenges

利用大语言模型进行安全硬件设计及相关问题:机遇与挑战

Johann Knechtel, Ozgur Sinanoglu, Ramesh Karri

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校) NYU Tandon School of Engineering(纽约大学塔能工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文探讨了大语言模型在电子设计自动化和硬件安全领域的应用,分析了其在生成RTL代码、自动生成测试平台以及弥合高层次规格与硅芯片之间语义差距方面的潜力,同时指出了其引入的严重安全漏洞,并总结了当前研究的最新进展和未来研究方向。

Comments Accepted for 2026 IEEE Computer Society Annual Symposium on VLSI (ISVLSI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17256 2026-06-05 cs.CL 57%

Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations

大型语言模型的可解释性:朝着生成可信解释的方向机遇与挑战

Shahin Atakishiyev, Housam K. B. Babiker, Jiayi Dai, Nawshad Farruque, Teruaki Hayashi, Nafisa Sadaf Hriti, Md Abed Rahman, Iain Smith, Mi-Young Kim, Osmar R. Zaïane, Randy Goebel

机构 * University of Alberta(阿尔伯塔大学) University of Tokyo(东京大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了大型语言模型的可解释性问题,分析了局部可解释性和机械可解释性方法,并在医疗和自动驾驶两个关键领域进行了实验研究,总结了当前可解释性领域存在的问题和未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06239 2026-06-05 eess.SP 50%

Foundation Models for Wireless Communications: From PHY Intelligence to Network Autonomy

无线通信的基础模型:从物理层智能到网络自治

Le Liang, Jiajia Guo, Jun Zhang, Chan-Byoung Chae, Lu Lu, Shugong Xu, Octavia A. Dobre, Shi Jin, Geoffrey Ye Li

专题命中 其他推理 :reasoning(abstract)

AI总结 本文综述了基础模型在无线通信中的应用,从适配预训练模型、构建无线原生模型到智能体模型,推动物理层处理和资源管理向网络自治演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05909 2026-06-05 cs.SD eess.AS 50%

Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes

超越WER:面向环境临床记录员的配对声学压力测试

Xiao-Hang Jiang, Han-Jie Guo, Ying-Si Liang, Yang Ai, Zhen-Hua Ling, Lei Jiang, Zhi-Yang He

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Co., Ltd.(iFLYTEK公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出配对声学压力测试方法,通过注入噪声并冻结下游模型,揭示噪声对临床推理的安全影响,发现轻微声学扰动可逆转临床意义而不显著增加词错误率,并展示轻量级缓解策略。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16502 2026-06-05 cs.CV 50%

Topology-Aware Layer Pruning for Large Vision-Language Models

面向拓扑的层剪枝用于大型视觉-语言模型

Pengcheng Zheng, Chaoning Zhang, Ya Wen, Wang Liu, Qigan Sun, Jiarong Mo, Jiaquan Zhang, Jewon Lee, Tae-Ho Kim, Kuien Liu, Tianyu Li, Caiyan Qin, Yang Yang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出了一种面向拓扑的层剪枝框架,用于大型视觉-语言模型,通过利用拓扑持续同调量化层间拓扑一致性,实现自适应剪枝以保留关键表示转换。

Comments This manuscript has been withdrawn by the authors. It reproduced the methodology of Gardinazzi et al., arXiv:2410.11042, without citation, and utilized code and data from the associated repository (github.com/RitAreaSciencePark/ZigZagLLMs) without disclosure or violate the MIT License. A revised future version with full attribution may be prepared. For any feedback, please contact Pengcheng Zheng

详情

展开后加载摘要…

URL PDF HTML 收藏