arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-02 至 2026-04-02 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 23 篇

2603.20209 2026-04-02 cs.CL cs.AI 84%

Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs

儿童智力测试对大语言模型构成挑战?KidGym:一种基于二维网格的推理基准测试用于大语言模型

Hengwei Ye, Yuanting Guan, Yuxuan Ge, Tianying Zhu, Zhenhan Guan, Yijia Zhong, Yijing Zhang, Han Zhang, Yingna Wu, Zheng Tian

机构 * ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KidGym,一种基于二维网格的推理基准测试,用于评估大语言模型的执行、感知推理、学习、记忆和规划能力,通过12个独特任务测试模型适应性和发展潜力,揭示当前模型的局限性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00770 2026-04-02 cs.LG cs.AI 81%

Thinking Wrong in Silence: Backdoor Attacks on Continuous Latent Reasoning

沉默中的错误思考:对连续潜在推理的后门攻击

Swapnil Parekh

机构 * Intuit

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ThoughtSteer攻击,通过扰动输入嵌入向量,在连续潜在空间中产生可靠答案,同时规避所有现有防御,揭示了神经坍缩机制在潜在空间中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00493 2026-04-02 cs.CV cs.AI cs.LG 81%

A Reasoning-Enabled Vision-Language Foundation Model for Chest X-ray Interpretation

一种用于胸部X光解读的推理增强视觉-语言基础模型

Yabin Zhang, Chong Wang, Yunhe Gao, Jiaming Liu, Maya Varma, Justin Xu, Sophie Ostmeier, Jin Long, Sergios Gatidis, Seena Dehkharghani, Arne Michalson, Eun Kyoung Hong, Christian Bluethgen, Haiwei Henry Guo, Alexander Victor Ortiz, Stephan Altmayer, Sandhya Bodapati, Joseph David Janizek, Ken Chang, Jean-Benoit Delbrouck, Akshay S. Chaudhari, Curtis P. Langlotz

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CheXOne模型通过生成诊断预测和临床依据的推理轨迹,提升胸部X光解读的可解释性与准确性,在多个评估任务中表现优异。

Comments Codes: https://github.com/YBZh/CheXOne Models: https://huggingface.co/StanfordAIMI/CheXOne

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00568 2026-04-02 cs.CL 79%

A Japanese Benchmark for Evaluating Social Bias in Reasoning Based on Attribution Theory

一个用于评估基于归因理论的社会偏见的日本基准

Taihei Shiotani, Masahiro Kaneko, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) AIST(产业技术综合研究所) NII(国立信息学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文基于归因理论,构建了新的日本基准JUBAKU-v2,用于评估推理中对内群体和外群体行为归因的偏见,通过固定结论来检测模型在文化偏见上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00696 2026-04-02 cs.CV 78%

TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning

TTA-Vid: 视频推理的通用测试时间适应

Soumya Shamarao Jahagirdar, Edson Araujo, Anna Kukleva, M. Jehanzeb Mirza, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Rogerio Feris, James R. Glass, Hilde Kuehne

机构 * University of Tübingen(蒂宾根大学) MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Tuebingen AI Center(蒂宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出TTA-Vid方法,通过测试时间强化学习实现视频推理模型的适应,无需标注数据即可在测试时泛化至新领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21454 2026-04-02 cs.CL 70%

Cross-Context Verification: Hierarchical Detection of Benchmark Contamination through Session-Isolated Analysis

跨上下文验证:通过会话隔离分析进行层次化基准污染检测

Tae-Eun Song

机构 * Daejeon Jungang Cheonggua Co., Ltd.(大田中央青果有限公司)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出跨上下文验证方法,通过多会话分析检测基准污染,发现污染二元性及信息限制机制,验证了结构复杂性非关键。

Comments 11 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20836 2026-04-02 cs.CL cs.AI cs.LG 67%

Structured Prompts Improve Evaluation of Language Models

结构化提示提升语言模型评估

Asad Aali, Muhammad Ahmed Mohsin, Vasiliki Bikia, Arnav Singhvi, Richard Gaus, Suhana Bedi, Hejie Cui, Miguel Fuentes, Alyssa Unell, Yifan Mai, Jordan Cahoon, Michael Pfeffer, Roxana Daneshjou, Sanmi Koyejo, Emily Alsentzer, Christopher Potts, Nigam H. Shah, Akshay S. Chaudhari

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过结构化提示方法评估语言模型,发现其能显著提升性能并改变排名,首次系统整合结构化提示至评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14377 2026-04-02 cs.CL cs.IR cs.LG 62%

PluriHopRAG: Exhaustive, Recall-Sensitive QA Through Corpus-Specific Document Structure Learning

PluriHopRAG: 通过语料库特定文档结构学习实现全面、召回敏感的问答

Mykolas Sveistrys, Richard Kunert

机构 * Turbit Systems GmbH

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PluriHopRAG,通过学习语料库特定文档结构分解查询,改进多跳问答任务的召回敏感性和全面性,在PluriHopWIND和Loong基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00025 2026-04-02 cs.CL cs.AI 62%

Brevity Constraints Reverse Performance Hierarchies in Language Models

简洁性约束在语言模型中逆转性能层级

MD Azizul Hakim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,对大语言模型施加简洁性约束可逆转其在数学推理和科学知识上的性能层级,提升准确率并降低性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00002 2026-04-02 cs.CL cs.AI 62%

Benchmark for Assessing Olfactory Perception of Large Language Models

嗅觉感知基准测试

Eftychia Makri, Nikolaos Nakis, Laura Sisson, Gigi Minsky, Leandros Tassiulas, Vahid Satarifard, Nicholas A. Christakis

机构 * Patina(Patina公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出嗅觉感知基准测试,评估大语言模型对气味的推理能力,发现化合物名称提示优于SMILES表示,揭示LLM主要通过词汇关联而非结构分子推理获取嗅觉知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13129 2026-04-02 cs.CV cs.AI cs.LG 62%

Science-T2I: Addressing Scientific Illusions in Image Synthesis

Science-T2I: 解决图像合成中的科学幻觉

Jialuo Li, Wenhao Chai, Xingyu Fu, Haiyang Xu, Saining Xie

机构 * New York University(纽约大学) University of Washington(华盛顿大学) University of Pennsylvania(宾夕法尼亚大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ScienceT2I数据集,评估18种图像生成模型,发现科学提示能显著提升生成效果,提出SciScore奖励模型和两阶段对齐框架提升科学推理能力。

Comments Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01181 2026-04-02 cs.HC cs.CL cs.CV 57%

True (VIS) Lies: Analyzing How Generative AI Recognizes Intentionality, Rhetoric, and Misleadingness in Visualization Lies

真正的(视觉)谎言:分析生成式AI如何识别意图性、修辞和误导性在可视化谎言中

Graziano Blasilli, Marco Angelini

机构 * Sapienza University of Rome(罗马大学) Link Campus University(Link Campus大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究多模态大语言模型识别和解释误导性可视化的能力,并通过2336条新冠相关推文数据集分析其识别原因和潜在意图性,评估16种前沿模型并对比人类专家行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00438 2026-04-02 cs.CL 57%

TR-ICRL: Test-Time Rethinking for In-Context Reinforcement Learning

TR-ICRL:基于上下文的强化学习中的测试时重新思考

Wenxuan Jiang, Yuxin Zuo, Zijian Zhang, Xuecheng Wu, Zining Fan, Wenxuan Liu, Li Chen, Xiaoyu Li, Xuezhi Cao, Xiaolong Jin, Ninghao Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Meituan(美团) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Xi’an Jiaotong University(西安交通大学) East China Normal University(华东师范大学) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 TR-ICRL通过在推理过程中重新思考来解决ICRL中的奖励估计问题,通过伪标签生成反馈,提升模型在推理和知识密集型任务中的性能。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00375 2026-04-02 cs.CL 57%

Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models

局部自信,全局停滞:扩散语言模型中的质量探索困境

Liancheng Fang, Aiwei Liu, Henry Peng Zou, Yankai Chen, Enze Ma, Leyi Pan, Chunyu Miao, Wei-Chieh Huang, Xue Liu, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Tsinghua University(清华大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了扩散语言模型中质量与探索的矛盾,提出了一种平衡两者的方法,通过优化分布和采样策略提升生成质量与探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08206 2026-04-02 cs.AI 57%

EHRStruct: A Comprehensive Benchmark Framework for Evaluating Large Language Models on Structured Electronic Health Record Tasks

EHRStruct:一个全面的评估框架,用于评估大型语言模型在结构化电子健康记录任务上的表现

Xiao Yang, Xuejiao Zhao, Zhiqi Shen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EHRStruct框架,用于评估大型语言模型在结构化电子健康记录任务上的性能,包含11种临床任务和2200个样本,分析了影响模型性能的关键因素,并提出EHRMaster方法以提升性能。

Comments 28pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00284 2026-04-02 cs.AI cs.MA 57%

Improvisational Games as a Benchmark for Social Intelligence of AI Agents: The Case of Connections

即兴游戏作为AI代理社交智能的基准测试:以Connections为例

Gaurav Rajesh Parikh, Angikar Ghosal

机构 * Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过即兴词游戏Connections探讨AI代理的推理能力,提出该游戏作为测试社交智能的基准,涵盖知识检索、总结及认知状态意识等核心能力。

Comments https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf

Journal ref https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00265 2026-04-02 cs.CV cs.AI 57%

Benchmarking Interaction, Beyond Policy: a Reproducible Benchmark for Collaborative Instance Object Navigation

交互基准测试,超越策略:协作实例物体导航的可重复基准

Edoardo Zorzi, Francesco Taioli, Yiming Wang, Marco Cristani, Alessandro Farinelli, Alberto Castellini, Loris Bazzani

机构 * Sapienza University of Rome(罗马大学) University of Verona(维罗纳大学) Polytechnic of Turin(都灵理工大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Reykjavik University(雷克雅未克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出QAsk-Nav基准,用于评估协作实例物体导航中的导航与协作问答能力,提供轻量级问答协议和高质量数据集,开发出更高效且性能更优的Light-CoNav模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00968 2026-04-02 cs.HC 50%

FlexAI: A Multi-modal Solution for Delivering Personalized and Adaptive Fitness Interventions

FlexAI: 一种多模态解决方案,用于提供个性化和自适应的健身干预

Shivangi Agarwal, Zoya Ghoshal, Bharat Jain, Siddharth Siddharth

专题命中 推理评测 :reasoning(abstract)

AI总结 FlexAI通过整合计算机视觉、生理传感器和大语言模型,提供实时个性化健身指导,显著提升用户参与度和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00818 2026-04-02 cs.CY 50%

Misconception Acquisition Dynamics in Large Language Models

大语言模型中的误解获取动态

Naiming Liu, Xinghe Chen, Richard Baraniuk, Mrinmaya Sachan, Shashank Sonkar

专题命中 推理评测 :reasoning(abstract)

AI总结 研究大语言模型在模拟学生和导师时的误解获取动态,发现学生模型易泛化误解导致解题准确性下降,而导师模型能联合学习多个误解且保持正确性,关键在于推理步骤的监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00677 2026-04-02 cs.CV 50%

CL-VISTA: Benchmarking Continual Learning in Video Large Language Models

CL-VISTA:视频大语言模型持续学习基准测试

Haiyang Guo, Yichen Shi, Fei Zhu, Wenzhuo Liu, Hongbo Zhao, Fanhu Zeng, Shijie Ma, Da-Han Wang, Xu-Yao Zhang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FKLPRIU, School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院福建省模式识别与图像理解重点实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 CL-VISTA通过8个多样化任务诱导分布偏移,评估持续学习方法在性能、效率和内存方面的权衡,揭示无单一最优解的特性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00592 2026-04-02 cs.CV cs.HC 50%

HarassGuard: Detecting Harassment Behaviors in Social Virtual Reality with Vision-Language Models

HarassGuard: 在社交虚拟现实中利用视觉-语言模型检测骚扰行为

Junhee Lee, Minseok Kim, Hwanjo Heo, Seungwon Woo, Jinwoo Kim

机构 * Kwangwoon University(光云大学) ETRI(韩国电子通信研究院) Chungbuk National University(忠北大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出HarassGuard系统,通过视觉输入检测社交VR中的身体骚扰行为,利用提示工程和微调VLMs,在不使用敏感生物数据的情况下实现高准确率的骚扰检测。

Comments To appear in the 2026 TVCG Special Issue on the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (VR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16908 2026-04-02 cs.CV 50%

Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content

Q-REAL:迈向AI生成内容真实性和可信度评估

Shushi Wang, Zicheng Zhang, Chunyi Li, Wei Wang, Liya Ma, Fengjiao Chen, Xiaoyu Li, Xuezhi Cao, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Q-REAL数据集,用于细粒度评估AI生成图像的真实性和可信度,通过标注实体位置和设计判断问题,提升生成模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00075 2026-04-02 q-bio.GN 50%

Large Language Models for Variant-Centric Functional Evidence Mining

基于变体的函数证据挖掘的大型语言模型

Ali Saadat, Jacques Fellay

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出利用大型语言模型挖掘变体功能证据,通过基准测试评估两种模型在文献筛选和证据提取中的表现,开发了AcmGENTIC管道以提升功能证据整理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏