arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-22 至 2026-05-22 共收录 145 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 45 篇

2305.12138 2026-05-22 cs.SE cs.AI 57%

Exploring Code Analysis: Zero-Shot Insights on Syntax and Semantics with LLMs

探索代码分析:利用大语言模型进行语法和语义的零样本洞察

Wei Ma, Zhihao Lin, Shangqing Liu, Qiang Hu, Ye Liu, Wenhan Wang, Cen Zhang, Liming Nie, Li Li, Yang Liu, Lingxiao Jiang

机构 * Singapore Management University(新加坡国立大学) Blekinge Institute of Technology(布莱金厄学院) Beihang University(北航) State Key Laboratory of Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) The University of Tokyo(东京大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Shenzhen Technology University(深圳技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在代码分析中的应用,通过评估21种最先进的LLM在四种语言中的九项任务,揭示了LLM在语法解析、静态语义推断和动态推理方面的性能,发现其在跨语言泛化方面有优势,但动态推理仍有限,提出了一个经过验证的评估框架。

Comments Accepted at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22811 2026-05-22 cs.DB 50%

GS-QA: A Benchmark for Geospatial Question Answering

GS-QA:一个地理空间问答的基准测试

Majid Saeedan, Muhammad Shihab Rashid, Ahmed Eldawy, Vagelis Hristidis

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出GS-QA基准测试,用于评估地理空间问答系统,通过结合多个来源的信息,涵盖广泛的空间对象、谓词和答案类型,展示了现有方法在处理复杂空间谓词和多源推理时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22366 2026-05-22 cs.CV 50%

AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture

AgroTools: 一个用于农业中增强工具的多模态代理基准

Zi Ye, Yibin Wen, Xiaoya Fan, Xinyu Zhang, Jing Wu, Kun Zeng, Zurong Mai, Jiarui Zhang, Bohan Shi, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-Sen University(中山大学) Southwest University(西南大学) Northeastern University(东北大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Southwest Jiaotong University(西南交通大学) China Agricultural University(中国农业大学) Tsinghua University(清华大学)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出AgroTools基准,用于评估农业中增强工具的多模态代理,通过539个问题-答案实例和1097张异构农业图像,评估模型在工具使用中的执行质量和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28177 2026-05-22 cs.CV cs.CY 50%

AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images

AEGIS:一个评估人工智能生成学术图像取证分析的综合基准

Bo Zhang, Tzu-Yen Ma, Zichen Tang, Junpeng Ding, Zirui Wang, Yizhuo Zhao, Peilin Gao, Zijie Xi, Zixin Ding, Haiyang Sun, Haocheng Gao, Yuan Liu, Liangjia Wang, Yiling Huang, Yujie Wang, Yuyue Zhang, Ronghui Xi, Yuanze Li, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出AEGIS基准,通过七个学术类别和39个细粒度子类型覆盖,揭示了人工智能生成学术图像取证分析的内在难度,同时评估了多种模型在检测、推理和定位方面的性能,揭示了不同模型家族的互补优势。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22068 2026-05-22 cs.CV 50%

COCOTree: A Dataset and Benchmark for Open Tree-Structured Visual Decomposition

COCOTree: 一个用于开放树状视觉分解的数据集和基准

Junhyub Lee, Seunghun Chae, Hyosu Kim

机构 * Chung-Ang University(Chung-Ang大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出COCOTree数据集和基准,通过自动化生成管道和开放词汇空间,实现了对复杂物理组装的长尾分布的捕捉,并提出了Open Tree Quality (OTQ)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21882 2026-05-22 cs.CV 50%

Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception

Thermo-VL:扩展视觉语言模型以适应热红外感知

Rusiru Thushara, Yasiru Ranasinghe, Jay Paranjape, Vishal M. Patel

机构 * Department of Electrical & Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Thermo-VL,一种基于热红外感知的视觉语言模型,通过引入可训练的热编码器和文本引导的双注意力融合模块,提升了低光照条件下的多光谱融合能力,并在热红外和RGB+热红外推理任务中取得显著成果。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21642 2026-05-22 cs.CV 50%

Ablate-to-Validate: Are Vision-Language Models Really Using Continuous Thought Tokens?

Ablate-to-Validate: 视觉语言模型真的在使用连续思维令牌吗?

Tianyi Zhang, Mahtab Bigverdi, Ranjay Krishna

机构 * University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种诊断原则Ablate-to-Validate,通过Token Replacement Test(TRT)测试视觉语言模型是否真正利用了连续令牌内容,发现模型性能提升可能并非源于令牌内容,而是令牌存在本身。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24858 2026-05-22 cs.HC cs.MA 50%

Context-Mediated Domain Adaptation in Multi-Agent Sensemaking Systems

多智能体感知系统中的上下文引导领域适应

Anton Wolter, Leon Haag, Vaishali Dhanoa, Niklas Elmqvist

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种上下文引导的领域适应方法,通过多智能体系统中的用户修改来隐式指定领域知识,从而改进大语言模型驱动的多代理推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 17 篇

2605.21967 2026-05-22 cs.IR 87%

Reinforced Preference Optimization for Reasoning-Augmented Recommendations

增强偏好优化用于推理增强的推荐

Jingtong Gao, Zeyu Song, Chi Lu, Xiaopeng Li, Derong Xu, Maolin Wang, Peng Jiang, Kun Gai, Qingpeng Cai, Xiangyu Zhao

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出RPORec框架,通过统一LLM的推理能力与专用推荐头,提升推荐系统的精确性,实验表明其在公开基准和大规模部署中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00139 2026-05-22 cs.AI cs.CL cs.LG stat.ME 82%

Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning

增强大语言模型中的因果推理:一种用于精确微调的因果归因模型

Hengrui Cai, Shengjie Liu, Rui Song

机构 * University of California, Irvine(加州大学尔湾分校) North Carolina State University(北卡罗来纳州立大学) Amazon(亚马逊公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种因果归因模型,通过精确微调提升大语言模型的可解释性和因果推理能力,展示了模型在不同领域中的因果发现任务中的有效性。

Comments A Python implementation of our proposed method is available at https://github.com/ncsulsj/Causal_LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15153 2026-05-22 cs.RO cs.AI 79%

Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action

Pelican-Unify 1.0:一种用于理解和推理、想象和行动的统一具身智能模型

Yi Zhang, Yinda Chen, Che Liu, Zeyuan Ding, Jin Xu, Shilong Zou, Junwei Liao, Jiayu Hu, Xiancong Ren, Xiaopeng Zhang, Yechi Liu, Haoyuan Shi, Zecong Tang, Haosong Sun, Renwen Cui, Kuishu Wu, Wenhai Liu, Yang Xu, Yingji Zhang, Yidong Wang, Senkang Hu, Jinpeng Lu, Nga Teng Chan, Yechen Wu, Zeting Liu, Xianzhou Hou, Yong Dai, Jian Tang, Xiaozhu Ju

机构 * Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京人形机器人创新中心(X-Humanoid))

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Pelican-Unify 1.0,一种基于统一原则训练的首个具身基础模型,通过单一视觉语言模型作为统一理解模块,将场景、指令、视觉上下文和行动历史映射到共享语义空间,并通过统一推理模块生成任务、行动和未来导向的思维链,最终将隐藏状态投影到密集潜在变量中,再通过统一未来生成器生成未来视频和行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21973 2026-05-22 cs.CV 78%

Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding

Foresee-to-Ground: 从预测性时间感知到证据驱动推理的视频时间接地

Zelin Zheng, Xinyan Liu, Ruixin Li, Antoni B. Chan, Guorong Li, Qingming Huang, Laiyun Qing

机构 * Qwen3-VL-8B-Instruct

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出了一种新的视频时间接地框架F2G,通过将时间接地问题重新表述为可验证的识别-测量问题,结合预测性时间感知和证据驱动推理,以提高时间接地的准确性和鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16590 2026-05-22 cs.LG cs.AI q-bio.BM 73%

Atom-anchored LLMs speak Chemistry: A Retrosynthesis Demonstration

原子锚定的大语言模型:化学 retrosynthesis 的演示

Alan Kai Hassen, Andrius Bernatavicius, Antonius P. A. Janssen, Mike Preuss, Gerard J. P. van Westen, Djork-Arné Clevert

机构 * Machine Learning Research(机器学习研究) Pfizer Research and Development(辉瑞研发) Leiden Institute of Advanced Computer Science(莱顿高级计算机科学研究所) Leiden University(莱顿大学) Leiden Academic Centre for Drug Research(莱顿药物研究中心) Leiden Institute of Chemistry(莱顿化学研究所)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种利用通用大语言模型进行分子推理的框架,通过原子标识符将链式推理与分子结构锚定,无需任务特定的模型训练,在单步 retrosynthesis 任务中实现了高成功率。

Comments Alan Kai Hassen and Andrius Bernatavicius contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10129 2026-05-22 cs.LG cs.AI 62%

CacheClip: Accelerating RAG with Effective KV Cache Reuse

CacheClip: 通过有效的KV缓存重用加速RAG

Bin Yang, Qiuyu Leng, Jun Zeng, Zhenhua Wu

机构 * Intel Corporation(英特尔公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CacheClip框架,通过有效利用KV缓存重用,解决了RAG系统中TTFT瓶颈问题,同时保持高质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22791 2026-05-22 cs.AI 57%

Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention

Gated DeltaNet-2:解耦擦除与写入的线性注意力

Ali Hatamizadeh, Yejin Choi, Jan Kautz

机构 * NVIDIA

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Gated DeltaNet-2,通过引入通道级擦除门和写入门,解耦了线性注意力中擦除与写入的控制,从而在语言模型、常识推理和检索任务中取得了最佳性能,特别是在长上下文检索任务中表现突出。

Comments Gated DeltaNet-2 technical report; code at https://github.com/NVlabs/GatedDeltaNet-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22422 2026-05-22 cs.CV cs.AI 57%

FastTab: A Fast Table Recognizer with a Tiny Recursive Module and 1D Transformers

FastTab: 一种快速表格识别器,结合了微小递归模块和1D变换器

Laziz Hamdi, Amine Tamasna, Pascal Boisson, Thierry Paquet

机构 * LITIS

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出FastTab,一种基于网格的表格结构识别模型,通过轻量级的Tiny Recursive Module和轴向1D Transformer编码器,实现了高效的表格结构恢复,同时在多个基准测试中表现出低延迟和良好的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22287 2026-05-22 cs.AI 57%

SciCore-Mol: Augmenting Large Language Models with Pluggable Molecular Cognition Modules

SciCore-Mol: 通过可插拔分子认知模块增强大语言模型

Yuxuan Chen, Changwei Lv, Yunduo Xiao, Zhongjing Du, Daquan Zhou, Yukun Yan, Zheni Zeng, Zhiyuan Liu

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(电子与计算机工程学院,北京大学深圳校区) Tsinghua University, Beijing, China(清华大学,北京) School of Intelligence Science and Technology, Nanjing University, Suzhou, China(智能科学与技术学院,南京大学苏州校区)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SciCore-Mol框架,通过三个深度集成的可插拔认知模块解决大语言模型处理异构科学数据(如分子)时的语义鸿沟问题,实现分子理解、生成、反应预测和化学知识的综合性能提升。

Comments 15 pages, 4 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22269 2026-05-22 cs.CV cs.AI cs.MM 57%

MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering

MuKV:多粒度KV缓存压缩用于长流视频问答

Junbin Xiao, Jiajun Chen, Tianxiang Sun, Xun Yang, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MuKV,一种多粒度KV缓存压缩方法,通过半分层检索方法提升长流视频问答的效率和准确性,实验表明其在答案准确率、内存使用和在线问答效率方面均优于基线方法。

Comments To appear at CVPR'26. Code is available at https://github.com/IMBALDY/MuKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22102 2026-05-22 cs.AI 57%

ExComm: Exploration-Stage Communication for Error-Resilient Agentic Test-Time Scaling

ExComm:探索阶段通信用于容错的代理测试时间扩展

Woomin Song, Beomjun Kim, Daewon Choi, Sai Muralidhar Jayanthi, Saket Dingliwal, Jinwoo Shin, Aram Galstyan

机构 * KAIST(韩国科学技术院) Amazon AGI(亚马逊人工智能实验室) Together AI

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ExComm,一种用于探索阶段的代理测试时间扩展通信协议,通过定期审计代理信念状态以检测跨代理事实冲突,并通过专用工具验证循环解决冲突,从而提升测试时间扩展的容错能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22095 2026-05-22 econ.GN cs.AI cs.GT cs.HC q-fin.EC 57%

Not Yet: Humans Outperform LLMs in a Colonel Blotto Tournament

Not Yet: 人类在布洛托 tournaments 中优于 LLMs

Dmitry Dagaev, Egor Ivanov, Petr Parshakov, Alexey Savvateev, Gleb Vasiliev

机构 * HSE University(俄罗斯高等经济学院) New Economic School(新经济学校) Central Economic Mathematical Institute, Russian Academy of Sciences(俄罗斯科学院中央经济数学研究所) Adyghe State University(阿迪格国立大学) Moscow Institute of Physics and Technology(莫斯科物理技术学院) Innopolis University(因诺波利斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过布洛托博弈 tournaments 比较了人类与 LLMs 的策略表现,发现人类更擅长使用校准良好的中间层次分配启发式方法,而 LLMs 的简单策略表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21948 2026-05-22 cs.LG 57%

SCI-Defense: Defending Manipulation Attacks from Generative Engine Optimization

SCI-Defense: 防御生成引擎优化的操纵攻击

Xucheng Yu, Haibo Jin, Huimin Zeng, Haohan Wang

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学与数据科学学院) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院) Amazon topcited.ai(亚马逊topcited.ai)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SCI-Defense框架,通过检测困惑度、语义完整性评分和跨候选检测三种组件,有效识别生成引擎优化攻击,实现了高精度和低误报率,同时揭示了现有防御方法的局限性及未来研究方向。

Comments 20 pages, NeurIPS 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22403 2026-05-22 cs.CV 50%

Translating Signals to Languages for sEMG-Based Activity Recognition

将信号转换为语言以实现基于sEMG的活动识别

Ming Wang, Haoxuan Qu, Qiuhong Ke, Wei Zhou, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) Monash University(墨尔本大学) Cardiff University(卡迪夫大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出了一种基于大语言模型的sEMG活动识别框架,通过将连续sEMG信号转换为语言形式,提升活动识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18141 2026-05-22 cs.HC 50%

A Brief Overview: On-Policy Self-Distillation In Large Language Models

大语言模型中的在线自蒸馏简要概述:On-Policy Self-Distillation

Fangming Cui, Sunan Li, Jiahong Li

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了在线自蒸馏(OPSD)在大语言模型中的应用,提出了一种统一的学习框架,使单个大语言模型同时扮演教师和学生角色,通过减少每个token的分布分歧来对齐推理行为,从而提高效率并减少GPU内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21931 2026-05-22 cs.CV 50%

EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models

EvoVid: 以时间为中心的自我进化用于视频大语言模型

Shiqi Huang, Ziyue Wang, Zhongrong Zuo, Han Qiu, Qi She, Bihan Wen

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) ByteDance(字节跳动)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出EvoVid,一种以时间为中心的自我进化框架,使视频大语言模型能够直接从未经标注的视频中改进。通过引入两个互补的时间感知奖励,即时间感知的问题生成奖励和时间基础的求解奖励,EvoVid在四个基础模型和六个基准测试中实现了优于基线模型和现有自我进化基线的改进,展示了时间为中心的自我进化在视频理解和推理中的有效性。

Comments Project page: https://huangshiqi128.github.io/EvoVid.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21821 2026-05-22 cs.CR 50%

A Large Language Model Approach to Generating Bypass Rules for Malware Evasion in Analysis Sandbox

利用大型语言模型生成恶意软件规避规则以应对分析沙箱中的规避行为

Zhiyong Sui, Lamine Noureddine, Mst Eshita Khatun, Sideeq Bello, Justin Woodring, Aisha Ali-Gombe

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出了一种基于大型语言模型的方法,用于自动生成绕过沙箱环境中的恶意软件规避检查的YARA规则,通过分析恶意软件的执行轨迹并采用多种推理策略生成针对性的绕过规则,最终在多个真实恶意软件样本上实现了79%的绕过成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏