arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-01 至 2026-04-01 共收录 83 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2512.05513 2026-04-01 cs.CV 78%

Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning

Know-Show:在时空 grounded 推理上评估视频语言模型的基准测试

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Know-Show基准测试评估视频语言模型在时空 grounded 推理能力,通过五个互补场景揭示现有模型与人类推理的差距,并提出GRAM方法提升模型的细粒度 grounded 推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29878 2026-04-01 cs.IR cs.AI cs.DC 70%

Performance Evaluation of LLMs in Automated RDF Knowledge Graph Generation

对LLMs在自动RDF知识图谱生成中的性能评估

Ioana Ramona Martin, Tudor Cioara, Ionut Anghel, Gabriel Arcas

机构 * Distributed Systems Research Laboratory, Computer Science Department, Technical University of Cluj-Napoca(克卢日-纳波卡技术大学计算机科学系分布式系统研究实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文评估了多种LLM架构和提示策略在自动RDF提取中的性能,通过控制框架和两个处理半结构化日志数据的管道,分析了Few-Shot学习在生成RDF三元组中的有效性,并揭示了不同LLM架构的局限性。

Comments submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29281 2026-04-01 cs.CV cs.AI cs.RO 70%

PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models

PRISM:一个多视角多能力零售视频数据集用于具身视觉-语言模型

Amirreza Rouhi, Parikshit Sakurikar, Satya Sai Reddy, Narsimha Menga, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 PRISM是首个针对真实世界零售环境的多视角多能力视频数据集,通过领域特定的SFT训练提升具身视觉-语言模型的感知能力与空间理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29893 2026-04-01 cs.HC cs.AI cs.CL cs.MA 62%

Perfecting Human-AI Interaction at Clinical Scale. Turning Production Signals into Safer, More Human Conversations

在临床规模上完善人机交互。将生产信号转化为更安全、更人性化的对话

Subhabrata Mukherjee, Markel Sanz Ausin, Kriti Aggarwal, Debajyoti Datta, Shanil Puri, Woojeong Jin, Tanmay Laud, Neha Manjunath, Jiayuan Ding, Bibek Paudel, Jan Schellenberger, Zepeng Frazier Huo, Walter Shen, Nima Shirazian, Nate Potter, Sathvik Perkari, Darya Filippova, Anton Morozov, Austin Mease, Vivek Muppalla, Ghada Shakir, Alex Miller, Juliana Ghukasyan, Mariska Raglow-Defranco, Maggie Taylor, Herprit Mahal, Jonathan Agnew

机构 * Hippocratic AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于真实患者与AI交互数据的框架,通过分析实时信号提升医疗AI的安全性和可靠性,减少ASR错误,提高患者体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29038 2026-04-01 cs.CR cs.AI cs.CL 62%

Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning

Trojan-Speak:通过对抗微调规避宪法分类器无需牢笼突破

Bilgehan Sel, Xuanli He, Alwin Peng, Ming Jin, Jerry Wei

机构 * University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Trojan-Speak方法,通过结合课程学习和GRPO混合强化学习,利用对抗微调规避Anthropic的宪法分类器,实现99%以上的分类器规避,同时保持低的推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG 62%

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29846 2026-04-01 cs.CL 57%

SNEAK: Evaluating Strategic Communication and Information Leakage in Large Language Models

SNEAK:评估大语言模型中的战略沟通与信息泄露

Adar Avsian, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SNEAK通过模拟盟友和间谍两种角色,评估语言模型在信息共享与保密之间的平衡能力,发现当前系统在非对称信息下的战略沟通仍存在挑战,人类表现显著优于模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29373 2026-04-01 cs.CL 57%

Beyond Idealized Patients: Evaluating LLMs under Challenging Patient Behaviors in Medical Consultations

超越理想化患者:在医疗咨询中评估LLM在挑战性患者行为下的表现

Yahan Li, Xinyi Jie, Wanjia Ruan, Xubei Zhang, Huaijie Zhu, Yicheng Gao, Chaohao Du, Ruishan Liu

机构 * University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了医疗咨询中常见的挑战性患者行为,定义了四种行为类别,并提出了CPB-Bench基准测试集,评估了多种LLM在处理这些行为时的表现,发现模型在处理矛盾或医学上不合理的患者信息时存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29318 2026-04-01 cs.AI 57%

PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent

PSPA-Bench:面向智能手机GUI代理的个性化基准

Hongyi Nie, Xunyuan Liu, Yudong Bai, Yaqing Wang, Yang Liu, Quanming Yao, Zhen Wang

机构 * Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Peking University(北京大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PSPA-Bench,用于评估智能手机GUI代理的个性化能力,通过12855条个性化指令和22款移动应用,揭示现有方法在个性化场景下的不足,并提出改进方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29199 2026-04-01 cs.AI 57%

AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction

AEC-Bench:一种用于建筑、工程和施工领域代理系统的多模态基准

Harsh Mankodiya, Chase Gallik, Theodoros Galanos, Andriy Mulyar

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AEC-Bench旨在评估建筑、工程和施工领域代理系统在真实任务中的表现,涵盖图纸理解、跨表单推理和项目级协调任务,通过多模型基准测试提升基础模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29194 2026-04-01 cs.CV cs.AI 57%

Multi-Layered Memory Architectures for LLM Agents: An Experimental Evaluation of Long-Term Context Retention

多层记忆架构用于LLM代理:长期上下文保留的实验评估

Sunil Tiwari, Payal Fofadiya

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多层记忆框架,通过分解对话历史为工作、事件和语义层,提升长期上下文保留与推理稳定性,实验显示在LOCOMO等数据集上性能提升,同时降低虚假记忆率和上下文使用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27942 2026-04-01 cs.CV cs.AI 57%

JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding

JaWildText:面向日文场景文本理解的视觉-语言模型基准测试

Koki Maeda, Naoaki Okazaki

机构 * Institute of Science Tokyo, Tokyo, Japan(东京科学大学,日本东京) Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan(国立信息学研究所大型语言模型研发中心,日本东京)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出JaWildText基准测试,针对日文场景文本理解中的多脚本、垂直书写和字符多样性问题,包含3241个实例和112万字符标注,涵盖STVQA、KIE和手写OCR三个任务,评估14种VLM模型,发现最佳模型在三个任务上的平均得分为0.64。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22846 2026-04-01 cs.AI 57%

CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models

CoMaTrack: 基于竞争的多智能体博弈跟踪与视觉-语言-动作模型

Youzhi Liu, Li Gao, Liu Liu, Mingyang Lv, Yang Cai

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出CoMaTrack,一种基于竞争的多智能体强化学习框架,通过动态对抗环境训练,提升跟踪任务的适应性和鲁棒性,并引入首个开源的CoMaTrack-Bench基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 10 篇

2603.30036 2026-04-01 cs.LG cs.AI 86%

Aligned, Orthogonal or In-conflict: When can we safely optimize Chain-of-Thought?

对齐、正交或冲突:何时可以安全地优化思维链?

Max Kaufmann, David Lindner, Roland S. Zimmermann, and Rohin Shah

机构 * Google DeepMind(谷歌DeepMind)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在训练过程中思维链(CoT)的可监控性受训练影响的问题,提出了一种框架来预测何时以及为何发生冲突,并通过实验验证了正交和冲突奖励项对CoT监控性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28610 2026-04-01 cs.CV cs.AI cs.CL 81%

ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning

ResAdapt:面向高效多模态推理的自适应分辨率

Huanxuan Liao, Zhongtao Jiang, Yupu Hao, Yuqiao Tan, Shizhu He, Ben Wang, Jun Zhao, Kun Xu, Kang Liu

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ResAdapt通过自适应输入分辨率框架,在保持高空间分辨率的同时提升多模态推理效率,尤其在压缩条件下显著提升性能。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22715 2026-04-01 cs.CV cs.AI cs.CL cs.MM 81%

ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering

ReAG:基于推理的生成用于基于知识的视觉问答

Alberto Compagnoni, Marco Morini, Sara Sarto, Federico Cocchi, Davide Caffagni, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学) University of Pisa(比萨大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ReAG通过结合粗粒度和细粒度检索及批评模型过滤无关信息,提升知识密集型视觉问答的准确性和可解释性。

Comments CVPR 2026 - Project page: https://aimagelab.github.io/ReAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29232 2026-04-01 cs.CL cs.AI cs.LG 67%

Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs

长文档问答与结构化思维链及微调大语言模型

Zhuowen Liang, Xiaotian Lin, Zhengxuan Zhang, Yuyu Luo, Haixun Wang, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) EvenUp, USA(美国EvenUp公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LiteCoST框架,通过结构化思维链和微调小语言模型,实现高精度低延迟的长文档问答,采用双支柱方法提升准确性和效率。

Comments 26 pages, 17 figures, 10 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29765 2026-04-01 cs.LG cs.CL 62%

Training-Free Dynamic Upcycling of Expert Language Models

无需训练的动态专家语言模型再利用

Eros Fanì, Oğuzhan Ersoy

机构 * Gensyn

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DUME方法,通过动态添加不同领域训练的密集专家,构建统一的MoE模型,无需额外训练即可保持原有能力,在语言建模和推理任务中表现优异。

Comments Accepted at the ICLR 2026 Workshop on Scaling Post-training for LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29023 2026-04-01 cs.CL cs.AI 62%

Human-Like Lifelong Memory: A Neuroscience-Grounded Architecture for Infinite Interaction

类人终身记忆:一种基于神经科学的架构,用于无限交互

Diego C. Lerma-Torres

机构 * Universidad de Guanajuato(瓜纳华托大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于神经科学的类人终身记忆架构,通过结合互补学习系统理论、认知行为疗法的信念层级、双进程认知和模糊轨迹理论,解决大语言模型在长期交互和情境敏感检索中的记忆不足问题。

Comments 14 pages, 1 figure. Accepted at the MemAgents Workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28773 2026-04-01 cs.IR cs.CL cs.LG 62%

UltRAG: a Universal Simple Scalable Recipe for Knowledge Graph RAG

UltRAG:一种通用简单可扩展的知识图谱RAG配方

Dobrik Georgiev, Kheeran Naidu, Alberto Cattaneo, Federico Monti, Carlo Luschi, Daniel Justus

机构 * Graphcore Research(Graphcore 研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出UltRAG框架,通过神经查询执行模块提升知识图谱问答性能,无需重新训练LLM,在大规模知识图谱上实现高效问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27971 2026-04-01 cs.LG 57%

Principal Prototype Analysis on Manifold for Interpretable Reinforcement Learning

流形上的主原型分析用于可解释的强化学习

Bodla Krishna Vamshi, Haizhao Yang

机构 * University of Maryland College park(马里兰大学帕克分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种自动选择最优原型的方法,用于增强强化学习的可解释性,无需人工定义原型,实验显示其性能与现有方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14565 2026-04-01 cs.RO cs.AI 57%

Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language

掩码逆强化学习:从演示和语言引导的奖励消歧

Minyoung Hwang, Alexandra Forsey-Smerek, Nathaniel Dennler, Andreea Bobu

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出掩码逆强化学习框架,利用大语言模型结合演示和语言信息,提升机器人奖励学习的样本效率和泛化能力。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29692 2026-04-01 cs.CV 50%

SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition

SkeletonContext:基于骨架的零样本动作识别中的骨架侧上下文提示学习

Ning Wang, Tieyue Wu, Naeha Sharif, Farid Boussaid, Guangming Zhu, Lin Mei, Mohammed Bennamoun, zhang liang

机构 * Xidian University(西安电子科技大学) University of Western Australia(西澳大利亚大学) Donghai Lab(东海实验室)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出SkeletonContext框架,通过引入跨模态上下文提示模块和关键部位解耦模块,提升骨架动作识别中上下文信息的利用,实现零样本场景下的高精度动作区分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏