arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-18 至 2026-05-18 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 24 篇

2512.15693 2026-05-18 cs.CV 85%

Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning

Skyra:通过 grounded artifact reasoning 实现 AI 生成视频检测

Yifei Li, Wenzhao Zheng, Yanran Zhang, Runze Sun, Yu Zheng, Lei Chen, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 推理评测 :reasoning(title,title_cn);CoT(abstract)

AI总结 本文提出 Skyra,一种专门用于识别 AI 生成视频中人类可感知的视觉瑕疵的多模态大语言模型,通过这些瑕疵作为基础证据进行检测和解释,同时构建了首个大规模 AI 生成视频瑕疵数据集并提出两阶段训练策略。

Comments Camera Ready Version. Project Page: https://github.com/JoeLeelyf/Skyra

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14665 2026-05-18 cs.AI cs.CL cs.IR 84%

Falkor-IRAC: Graph-Constrained Generation for Verified Legal Reasoning in Indian Judicial AI

Falkor-IRAC:用于印度司法AI的图约束生成:在验证法律推理中的应用

Joy Bose

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Falkor-IRAC框架,通过图约束生成解决印度法律AI中的验证法律推理问题,利用IRAC知识图谱进行结构化推理,并通过验证代理检查生成路径的正确性。

Comments 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15513 2026-05-18 cs.AI 83%

CAPS: Cascaded Adaptive Pairwise Selection for Efficient Parallel Reasoning

CAPS:级联自适应成对选择用于高效的并行推理

Fangzhou Lin, Shuo Xing, Peiran Li, Siyuan Yang, Qianwen Ge, Kazunori Yamada, Ziming Zhang, Haichong Zhang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) Worcester Polytechnic Institute(沃斯特理工大学) Tohoku University(东北大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 CAPS通过级联自适应成对选择方法,在保持高效并行推理的同时,减少验证器的计算成本,优于现有成对验证方法。

Comments 31 pages, 2 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01970 2026-05-18 cs.AI cs.LG 81%

Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models

小规模可泛化提示预测模型可引导大推理模型的高效强化学习后训练

Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang, Weijie Liu, Clive Bai, Kai Yang, Yangkun Chen, Saiyong Yang, Xiangyang Ji

机构 * Department of Automation, Tsinghua University, Beijing, China(自动化系,清华大学,北京,中国) LLM Department, Tencent, Beijing, China(大模型部门,腾讯,北京,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GPS方法,通过轻量级生成模型进行提示难度的贝叶斯推断,结合中间难度优先和历史锚定多样性,提升大模型强化学习后的训练效率和测试效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15764 2026-05-18 cs.CV cs.AI 79%

GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions

GRASP:学习多个人非语言互动中的社会推理

Junho Kim, Xu Cao, Houze Yang, Bikram Boote, Ana Jojic, Fiona Ryan, Bolin Lai, Sangmin Lee, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) Amazon AGI Korea University(亚马逊AGI韩国大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GRASP通过连接高层社会问答与细粒度目光和指代手势事件,提升多个人非语言互动的社会推理能力,包含290万对问题-答案对,提出Social Grounding Reward提升模型性能。

Comments Project page: https://social-reaoning.github.io/grasp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15997 2026-05-18 cs.CV 78%

Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning

分割、检测与解释:一种用于CT外观推理的统一框架

Yuyuan Liu, Can Peng, Yingyu Yang, Qianye Yang, Cheng Ouyang, J. Alison Noble

机构 * Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(生物医学工程研究所,工程科学系,牛津大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出统一框架,整合语言引导的视觉推理,提升CT图像分割与检测的精度,并提供外观推理输出。

Comments 8 pages, 4 figures, submitted to IEEE Transactions on Medical Imaging (TMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15755 2026-05-18 cs.CV 78%

Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models

基于属性的选型推理用于艺术品情感理解的多模态大语言模型

Cheng Zhang, Yuer Liu, Zhiyu Zhou, Hongxia Xie, Wen-Huang Cheng

机构 * Department of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Department of Computer Science, National Taiwan University(国立台湾大学计算机科学系)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出基于属性的选型推理方法,通过多模态大语言模型实现艺术品情感理解,通过引入属性瓶颈引导框架提升情感预测精度和解释简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15635 2026-05-18 cs.CL 70%

Evaluating Chinese Ambiguity Understanding in Large Language Models

评估大型语言模型中的中文歧义理解

Junwen Mo, Yuanzhi Lu, Yifang Xue, Ke Xu, Hideki Nakayama

机构 * Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文设计了首个基于潜在歧义理论的中文歧义数据集CHA-Gen,评估了LLM在歧义检测中的表现,揭示了模型在歧义识别中的常见失败模式及语义不确定性量化结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15333 2026-05-18 cs.AI 70%

Zero-Shot Goal Recognition with Large Language Models

基于大语言模型的零样本目标识别

Kin Max Piamolini Gusmão, Nathan Gavenski, Nir Oren, Felipe Meneguzzi

机构 * PUCRS Porto Alegre(圣路易斯-波尔图阿legre大学) King’s College London(伦敦国王学院) University of Aberdeen(阿伯丁大学) PUCRS(圣路易斯-波尔图阿legre大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文首次系统评估前沿大语言模型在经典PDDL基准上的零样本目标识别能力,发现其表现不均,部分模型随证据增加而提升精度,而另一些模型则依赖世界知识先验。

Comments 9 pages, 1 figure, 1 table; appendix with 8 figures and 2 code listings (29 pages total); submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15215 2026-05-18 cs.AI cs.SE 70%

SkillSmith: Compiling Agent Skills into Boundary-Guided Runtime Interfaces

SkillSmith:将技能编译为边界引导的运行时接口

Duling Xu, Zheng Chen, Zaifeng Pan, Jiawei Guan, Dong Dong, Jialin Li, Bangzheng Pu

机构 * AetherHeart Tech Co., Ltd.(AetherHeart科技有限公司) Renmin University of China(中国人民大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 SkillSmith通过将技能包编译为最小执行接口,减少运行时冗余,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15341 2026-05-18 cs.LG cs.AI 62%

LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design

LEAP:LLM在迭代科学设计中的轨迹级评估

Marilyn Zhang, Tianfeng Chen, Fabián Barzuna, Ankita Rathod, Mark E. Whiting

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LEAPBench框架,通过轨迹级评估方法揭示LLM在迭代科学设计中的学习效率,发现传统基于结果的评估方法存在偏差,轨迹指标能更准确反映效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16122 2026-05-18 cs.CV cs.AI 57%

GenShield: Unified Detection and Artifact Correction for AI-Generated Images

GenShield:面向AI生成图像的统一检测与伪影校正

Zhipei Xu, Xuanyu Zhang, Youmin Xu, Qing Huang, Shen Chen, Taiping Yao, Shouhong Ding, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出GenShield框架,通过闭环诊断与修复流程实现可解释的AI生成图像检测与可控伪影校正,结合视觉链式推理课程学习策略,提升校正效果与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10810 2026-05-18 cs.LG 57%

Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities

数学文本延续的似然评分:一个自监督基准及快捷漏洞测试

Daniel Ranard

机构 * Department of Physics, California Institute of Technology(加州理工学院物理系)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一个自动基准,用于预测技术论文中的隐藏文本。通过比较模型生成的辅助预测字符串与评分器对延续的预测,评估信息传递效果。实验显示,GPT-5.5等模型在方程后缀预测任务中优于基线,支持似然评分作为静态基准和快捷漏洞测试的工具。

Comments 13 pages + appendices, 4 figures; v2: expanded related work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15887 2026-05-18 cs.CL 57%

Mind the Motions: Benchmarking Theory-of-Mind in Everyday Body Language

留意动作:在日常肢体语言中评估共情理论

Seungbeen Lee, Jinhong Jeong, Donghyun Kim, Yejin Son, Youngjae Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Motion2Mind框架,通过专家编纂的肢体语言参考库评估机器解读非言语线索的能力,发现现有AI在非言语解读上存在显著差距。

Comments The authors identified issues in the current version and would like to withdraw the manuscript for substantial revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20641 2026-05-18 cs.LG cs.SD 57%

Investigating Modality Contribution in Audio LLMs for Music

在音乐音频大语言模型中探讨模态贡献

Giovana Morais, Magdalena Fuentes

机构 * Audio Research Lab, New York University, USA Integrated Design \& Media, New York University, USA

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文通过MM-SHAP框架量化音频大语言模型中各模态的贡献,发现高准确率模型更依赖文本回答问题,但音频仍能局部化关键声音事件,首次将MM-SHAP应用于音频大语言模型。

Comments 5 pages, 2 figures, accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15710 2026-05-18 cs.CL 57%

SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory

SMMBench:一种用于源分布多模态智能体记忆的基准测试

Huacan Chai, Yukai Wang, Yingxuan Yang, Dan Peng, Yuanyi Song, Zhihui Fu, Weiwen Liu, Jianghao Lin, Jun Wang, Weinan Zhang

机构 * Shanghai Jiao Tong University, China(上海交通大学,中国) OPPO, China(OPPO,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SMMBench旨在评估智能体在多源分布证据下进行多模态推理、冲突解决和行动预测的能力,揭示当前系统在处理碎片化异构数据时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15611 2026-05-18 cs.AI 57%

TopoEvo: A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices

TopoEvo: 一种面向拓扑的自演化多智能体框架用于微服务中的根本原因分析

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对微服务中观测数据异质性、故障传播和拓扑漂移问题,TopoEvo通过多模态对齐、拓扑约束推理和自演化机制,提升根本原因分析的鲁棒性与准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15589 2026-05-18 cs.CL 57%

MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models

MHGraphBench: 用于评估大语言模型中心理健康知识的图知识基准

Weixin Liu, Congning Ni, Shelagh A. Mulvaney, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学院) Virginia Tech(弗吉尼亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MHGraphBench基准,评估大语言模型在心理健康实体识别、关系判断及双跳推理能力,发现模型在实体类型识别和小关系类型判断上表现优异,但在关系预测和双跳推理上仍有不足,且输出格式可靠性对性能有显著影响。

Comments Accepted to GEM 2026, ACL 2026 Workshop; 9 pages main text plus references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15581 2026-05-18 cs.AI 57%

STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices

STAR: 一种针对微服务中RCA代理的阶段属性分诊与修复框架

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出STAR框架,通过将RCA流程分解为四个阶段,提升微服务中RCA代理的可靠性与自修复能力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15404 2026-05-18 cs.CL 57%

Capability Conditioned Scaffolding for Professional Human LLM Collaboration

专业领域能力条件下的支架框架

Sen Yang, Yinglei Ma

机构 * University College London(伦敦大学学院) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出能力条件支架框架,通过划分强、混合和弱领域,基于结构化能力档案调节干预行为,提升专业人类与AI协作的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02651 2026-05-18 cs.DL cs.LG 57%

ARA: Agentic Reproducibility Assessment For Scalable Support Of Scientific Peer-Review

ARA:面向大规模科学同行评审的代理可重复性评估

Kevin Riehl, Andres L. Marin, Nikofors Zacharof, Fan Wu, Patrick Langer, Robert Jakob, Anastasios Kouvelas, Georgios Fontaras, Michail A. Makridis

机构 * ETH Zürich, IVT & Agentic Systems Lab (ASL)(苏黎世联邦理工学院,信息与通信技术研究所及代理系统实验室) European Commission, Joint Research Centre(欧洲委员会,联合研究中心) University of Konstanz(康斯坦茨大学) Ideas Forward

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ARA通过构建实验依赖图并评估可重复性得分,有效提升大规模科研成果的可重复性评估能力,实验表明其在不同领域和模型参数下均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01970 2026-05-18 cs.CR cs.AI 57%

Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration

Trojan Hippo:利用代理记忆进行数据外泄

Debeshee Das, Julien Piet, Darya Kaviani, Luca Beurer-Kellner, Florian Tramèr, David Wagner

机构 * ETH Z\"urich

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究提出Trojan Hippo攻击,通过单次不可信工具调用在代理长期记忆中植入潜伏载荷,当用户讨论敏感话题时激活并外泄数据。通过动态评估框架评估不同内存架构和防御措施,发现现有防御措施在安全性和实用性之间存在显著权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15766 2026-05-18 cs.CE 50%

BioXArena: Benchmarking LLM Agents on Multi-Modal Biomedical Machine Learning Tasks

BioXArena:在多模态生物医学机器学习任务上评估LLM代理的基准测试

Loka Li, Duzhen Zhang, Xingbo Du, Leonard Song, Zixiao Wang, Assanali Aukenov, Noel Thomas, Shakhnazar Sailaukan, Yonghan Yang, Feilong Chen, Jiahua Dong, Kun Zhang, Bin Zhang, Le Song

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出BioXArena基准测试,旨在评估LLM代理能否为异构多模态生物医学数据集生成任务特定的模型训练流程,包含9个领域76个端到端任务,评估指标涵盖隐藏标签、隐藏评分者和生物意识度量,通过标准化环境评估11种代理配置。

Comments 69 pages, 13 figures, 34 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15474 2026-05-18 cs.IR 50%

Jobs' AI Exposure Should Be Measured from Evidence, Not Model Priors

AI 对岗位的影响应从证据而非模型先验来衡量

Luca Mouchel, Pierre Bouquet, Yossi Sheffi

专题命中 推理评测 :reasoning(abstract)

AI总结 本文主张通过基于证据的方法测量AI对岗位的影响,而非仅依赖LLM先验。提出一个检索增强框架,利用公开权重推理和检索到的新闻和论文摘要,为O*NET 30.2中的18796个职业-任务对分配AI影响标签,优于零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏