arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-27 至 2026-03-27 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2603.24866 2026-03-27 cs.AI cs.CL cs.CV 86%

How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning

视觉-语言模型距离构建现实世界还有多远?一个物理生成推理的基准测试

Luyu Yang, Yutong Dai, An Yan, Viraj Prabhu, Ran Xu, Zeyuan Chen

机构 * Salesforce AI Research(Salesforce 人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DreamHouse基准测试,评估视觉-语言模型在物理生成推理能力上的不足,通过住宅木构架建造领域验证模型在结构、施工可行性等约束下的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25412 2026-03-27 cs.AI cs.CR 85%

Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models

超越内容安全:大型语言模型推理漏洞的实时监控

Xunguang Wang, Yuguang Zhou, Qingyue Wang, Zongjie Li, Ruixuan Huang, Zhenlan Ji, Pingchuan Ma, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出实时监控方法,识别大型语言模型推理过程中的安全漏洞,定义九类不安全推理行为,并通过实验验证其有效性,展示了推理安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23265 2026-03-27 cs.CV 85%

SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models

SPR-128K:一种多模态大语言模型空间合理性推理的新基准

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出SPR-128K数据集及DPA-GRPO方法,解决图像筛选中多模态大语言模型空间推理能力不足的问题,实验表明小型模型在该任务上优于主流模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25253 2026-03-27 cs.CL cs.AI 81%

MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidation

MolQuest: 一个用于化学结构解析中代理评估归纳推理的基准

Taolin Han, Shuang Wu, Jinghang Wang, Yuhao Zhou, Renquan Lv, Bing Zhao, Wei Hu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MolQuest通过多轮交互任务评估LLM在复杂化学任务中的归纳推理与策略决策能力,揭示当前模型在真实科学场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03345 2026-03-27 cs.AI cs.CL 81%

Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning

语言模型遵循奥卡姆剃刀吗?对归纳和反向推理中简约性的评估

Yunxin Sun, Abulhair Saparov

机构 * Purdue University(普渡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估大型语言模型在归纳和反向推理中是否遵循奥卡姆剃刀原则,通过生成综合推理问题测试其在简单和复杂场景中的表现,发现模型在复杂世界模型中难以生成高质量假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24846 2026-03-27 cs.CV cs.AI cs.LG 81%

NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders

NeuroVLM-Bench:评估用于神经系统疾病临床推理的视觉增强大语言模型

Katarina Trojachanec Dineva, Stefan Andonov, Ilinka Ivanoska, Ivan Kitanovski, Sasho Gramatikov, Tamara Kostova, Monika Simjanoska Misheva, Kostadin Mishev

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了视觉增强大语言模型在神经疾病临床推理中的性能,通过多模态模型在MRI和CT数据集上进行基准测试,发现影像属性基本解决,但诊断推理仍具挑战性。

Comments 53 pages, 12 figures. Manuscript submitted to the BMC Medical Informatics and Decision Making journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24961 2026-03-27 cs.AI cs.CL cs.CV 73%

Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math

能够理解学生的思维吗?解析手写数学中的多模态错误分析

Dingjie Song, Tianlong Xu, Yi-Fan Zhang, Hang Li, Zhiling Yan, Xing Fan, Haoyang Li, Lichao Sun, Qingsong Wen

机构 * Lehigh University(里海大学) Squirrel Ai Learning(松鼠AI学习) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Michigan State University(密歇根州立大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ScratchMath基准测试,用于解释和分类学生手写数学草稿中的错误,评估16种MLLMs显示其在视觉识别和逻辑推理方面存在显著差距,专有模型表现更优。

Comments Accepted by the 27th International Conference on Artificial Intelligence in Education (AIED'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25293 2026-03-27 cs.AI cs.CL 62%

DAGverse: Building Document-Grounded Semantic DAGs from Scientific Papers

DAGverse: 从科学论文构建文档导向的语义DAG

Shu Wan, Saketh Vishnubhatla, Iskander Kushbay, Tom Heffernan, Aaron Belikoff, Raha Moraffah, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DAGverse框架,通过科学论文中的显式DAG图和文本上下文,自动构建文档导向的语义DAG,提升DAG分类和标注的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11687 2026-03-27 cs.CL cs.AI 62%

SemBench: A Universal Semantic Framework for LLM Evaluation

SemBench:一种通用的语义框架用于LLM评估

Mikel Zubillaga, Naiara Perez, Oscar Sainz, German Rigau

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SemBench通过字典词义定义和句子编码器自动生成合成基准,评估LLM的语义能力,无需人工 curated 例句,实现跨语言、多资源的高效评估。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15281 2026-03-27 cs.RO cs.AI cs.CL cs.HC 62%

LLM4AD: Large Language Models for Autonomous Driving -- Concept, Review, Benchmark, Experiments, and Future Trends

LLM4AD:大型语言模型在自动驾驶中的应用——概念、综述、基准测试、实验与未来趋势

Can Cui, Yunsheng Ma, Sung-Yeon Park, Zichong Yang, Yupeng Zhou, Peiran Liu, Juanwu Lu, Juntong Peng, Jiaru Zhang, Ruqi Zhang, Lingxi Li, Yaobin Chen, Jitesh H. Panchal, Amr Abdelraouf, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Institute for Physical Artificial Intelligence (IPAI), Purdue University(普渡大学物理人工智能研究所) Department of Computer Science, Purdue University(普渡大学计算机科学系) InfoTech Labs, Toyota Motor North America(丰田北美信息技术实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了将大型语言模型应用于自动驾驶的潜力,提出LLM4AD概念,构建了评估框架,并通过实验和未来趋势分析揭示了挑战与发展方向。

Comments The paper was accepted by the Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24943 2026-03-27 cs.AI cs.CL 62%

FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol

FinMCP-Bench:基于模型上下文协议的LLM代理在真实金融工具使用中的基准测试

Jie Zhu, Yimin Tian, Boyang Li, Kehao Wu, Zhongzhi Liang, Junhui Li, Xianyin Zhang, Lifan Guo, Feng Chen, Yong Liu, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(阿里云云计算千问点睛团队) YINGMI Wealth Management(盈米财富管理) Soochow University(苏州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinMCP-Bench,用于评估LLM在解决真实金融问题时通过调用金融模型上下文协议的能力,包含613个样本,涵盖10种主要场景和33种子场景,提供真实和合成查询,评估不同任务复杂度下的模型表现。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25613 2026-03-27 cs.CV cs.AI 57%

Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification

多模态大语言模型中的人口公平性:面部验证中性别和种族偏见的基准测试

Ünsal Öztürk, Hatef Otroshi Shahreza, Sébastien Marcel

机构 * Idiap Research Institute(Idiap 研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了九种开源多模态大语言模型在面部验证协议中的表现,揭示了不同种族和性别群体间的偏见差异,发现专用面部模型在性能和公平性上均优于通用模型。

Comments Accepted in CVPR 2026 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25423 2026-03-27 cs.SI cs.AI 57%

From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wild

从操控到怀疑:为野外鲁棒驳斥解释多样化的微视频虚假信息

Zhi Zeng, Yifei Yang, Jiaying Wu, Xulang Zhang, Xiangzheng Kong, Herun Wan, Zihan Ma, Minnan Luo

机构 * School of Computer Science and Technology, MOEKLINNS Lab, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院、教育部机器学习与智能决策网络实验室) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出WildFakeBench基准和FakeAgent框架,通过多模态理解和外部证据分析,提升微视频虚假信息检测的可解释性和鲁棒性。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25322 2026-03-27 cs.MA cs.AI 57%

AD-CARE: A Guideline-grounded, Modality-agnostic LLM Agent for Real-world Alzheimer's Disease Diagnosis with Multi-cohort Assessment, Fairness Analysis, and Reader Study

AD-CARE:一种基于指南、模态无关的LLM代理,用于多队列评估、公平性分析和读者研究的阿尔茨海默病诊断

Wenlong Hou, Sheng Bi, Guangqian Yang, Lihao Liu, Ye Du, Hanxiao Xue, Juncheng Wang, Yuxiang Feng, Yue Xun, Nanxi Yu, Ning Mao, Mo Yang, Yi Wah Eva Cheung, Ling Long, Kay Chen Tan, Lequan Yu, Xiaomeng Ma, Shaozhen Yan, Shujun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院) Amazon(亚马逊) Zhejiang University(浙江大学) Sany AI(三一人工智能) Yantai Yuhuangding Hospital, Qingdao University(青岛大学烟台毓璜顶医院) The University of Hong Kong(香港大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AD-CARE通过整合临床指南和多模态数据,实现了多队列中84.9%的诊断准确率,显著提升诊断效率和公平性,适用于阿尔茨海默病的临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25309 2026-03-27 cs.CL 57%

Separate Before You Compress: The WWHO Tokenization Architecture

在压缩前分离:WHHO标记化架构

Kusal Darshana

机构 * Remeinium Research(Remeinium 研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出WHHO架构和SGPE算法,通过分离语言规则与压缩过程,实现多语言标记化,显著降低复杂Abugida语言的token数量,提升推理效率。

Comments 17 pages, 1 figure, 8 tables. Tokenization Architecture including formal DFA definitions and regular expressions for Sinhala and Devanagari syllabification. Evaluation includes comparisons with OpenAI o200k-base, Llama-4-Scout, and DeepSeek-V3. Source code and datasets: https://github.com/remeinium/WWHO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25133 2026-03-27 cs.AI 57%

RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following

RubricEval: 一种用于LLM评判者的 rubric级元评估基准

Tianjun Pan, Xuan Lin, Wenyan Yang, Qianyu He, Shisong Chen, Licai Qi, Wanqing Xu, Hongwei Feng, Bo Xu, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Donghua University(东华大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RubricEval旨在解决rubric级评估的可靠性问题,通过多样化的指令和响应以及高质量实例,评估评判者在指令遵循中的表现,发现即使GPT-4o在Hard子集也仅达到55.97%的准确率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25105 2026-03-27 cs.CL 57%

OMIND: Framework for Knowledge Grounded Finetuning and Multi-Turn Dialogue Benchmark for Mental Health LLMs

OMIND:面向心理健康大语言模型的知识引导微调与多轮对话基准框架

Suraj Racha, Prashant Harish Joshi, Utkarsh Maurya, Nitin Yadav, Mridul Sharma, Ananya Kunisetty, Saranya Darisipudi, Nirmal Punjabi, Ganesh Ramakrishnan

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出OMIND框架,通过结构化知识检索、模型剪枝和人工审核生成高质量多任务SFT数据集,并引入oMind-Chat多轮对话基准,验证了其在核心能力和对话任务上的优越性能。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25075 2026-03-27 cs.AI 57%

Sparse Visual Thought Circuits in Vision-Language Models

视觉语言模型中的稀疏视觉思维电路

Yunpeng Zhou

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了稀疏自编码器特征在推理中的模块化假设,发现干预任务选择性特征集能小幅提升推理准确率,但联合干预则导致预测漂移和精度下降,揭示了SAE特征组合的边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25056 2026-03-27 cs.CR cs.AI 57%

The System Prompt Is the Attack Surface: How LLM Agent Configuration Shapes Security and Creates Exploitable Vulnerabilities

系统提示是攻击面:LLM代理配置如何影响安全并创造可利用的漏洞

Ron Litvak

机构 * Independent Researcher(独立研究员) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了LLM邮件代理中系统提示配置对安全性和漏洞的影响,发现提示模型交互是关键安全变量,通过不同配置可使钓鱼检测率从低于1%到97%波动,同时提出Safetility指标以平衡检测、可用性和对抗鲁棒性。

Comments 32 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25733 2026-03-27 cs.CV 50%

SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding

SlotVTG: 用于通用视频时间定位的对象中心适配器

Jiwook Han, Geo Ahn, Youngrae Kim, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 SlotVTG通过引入轻量级槽适配器,使MLLMs在最小成本下实现对象中心的输入关联视觉推理,提升跨域鲁棒性的同时保持领域内性能。

Comments Accepted to GRAIL-V workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25089 2026-03-27 cs.CV 50%

THEMIS: Towards Holistic Evaluation of MLLMs for Scientific Paper Fraud Forensics

THEMIS:迈向多模态大语言模型在科学论文欺诈取证中的全面评估

Tzu-Yen Ma, Bo Zhang, Zichen Tang, Junpeng Ding, Haolin Tian, Yuanze Li, Zhuodi Hao, Zixin Ding, Zirui Wang, Xinyu Yu, Shiyao Peng, Yizhuo Zhao, Ruomeng Jiang, Yiling Huang, Peizhi Zhao, Jiayuan Chen, Weisheng Tan, Haocheng Gao, Yang Liu, Jiacheng Liu, Zhongjun Yang, Jiayu Huang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 THEMIS通过真实场景和复杂图像评估多模态大语言模型在学术欺诈推理中的能力,引入了五种欺诈类型和16种细粒度操作,揭示模型在不同核心能力上的优劣。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24696 2026-03-27 cs.CV 50%

LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration

LLaVA-LE:用于月球探索的大型语言和视觉助手

Gokce Inal, Pouyan Navard, Alper Yilmaz

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出LLaVA-LE,一个专为月球表面和地下特征分析设计的多模态模型,通过构建大规模月球数据集LLUCID和两阶段训练方法,提升了行星科学领域的视觉语言模型性能。

Comments Accepted in AI4Space Workshop CVPR2026. Website: https://osupcvlab.github.io/LLaVA-LE/, Dataset: https://huggingface.co/datasets/pcvlab/lucid

详情

展开后加载摘要…

URL PDF HTML 收藏