arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-13 至 2026-03-13 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 16 篇

2603.11987 2026-03-13 cs.AI 88%

LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories

LABSHIELD:一种多模态基准,用于科学实验室中的安全关键推理和规划

Qianpu Sun, Xiaowei Chi, Yuhan Rui, Ying Li, Kuangzhi Ge, Jiajun Li, Sirui Han, Shanghang Zhang

专题命中 推理评测 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 LABSHIELD是一个多模态基准,用于评估MLLM在科学实验室中的安全关键推理和规划能力,揭示了现有模型在专业实验室场景中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11896 2026-03-13 cs.CV cs.AI cs.CL 84%

Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models

边看边想:多轮视频推理的在线流式段级内存

Lu Wang, Zhuoran Jin, Yupu Hao, Yubo Chen, Kang Liu, Yulong Ao, Jun Zhao

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Think While Watching框架,通过段级内存保持多轮视频推理连续性,提升流式视频理解的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11339 2026-03-13 cs.AI cs.CE cs.LG 81%

FinRule-Bench: A Benchmark for Joint Reasoning over Financial Tables and Principles

FinRule-Bench:一个用于金融表和原则联合推理的基准

Arun Vignesh Malarkkan, Manan Roy Choudhury, Guangwei Zhang, Vivek Gupta, Qingyun Wang, Yanjie Fu, Denghui Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 FinRule-Bench是一个评估金融表与原则联合推理能力的基准,通过三个任务测试模型在规则验证、识别和多违规诊断中的表现,揭示LLMs在高风险金融分析中的局限性。

Comments 8 pages + Ethics Statement + References + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07791 2026-03-13 cs.CV 78%

GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models

GTR-Bench:评估视觉-语言模型中的地理时间推理

Qinghongbing Xie, Zhaoyuan Xia, Feng Zhu, Lijun Gong, Ziyue Li, Rui Zhao, Long Zeng

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Peking University(北京大学) Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。

Comments ICLR 2026, 31 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15479 2026-03-13 cs.CL cs.AI 73%

Benchmarking LLMs for Pairwise Causal Discovery in Biomedical and Multi-Domain Contexts

在生物医学和多领域背景下对LLM进行成对因果发现的基准测试

Sydney Anuyah, Sneha Shajee-Mohan, Ankit-Singh Chauhan, Sunandan Chakraborty

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了13个开源LLM在生物医学和多领域背景下进行成对因果发现的能力,发现现有模型在处理复杂因果关系时表现不佳,提出了统一的评估框架并公开数据以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19240 2026-03-13 cs.CL cs.AI cs.LG 67%

LLLMs: A Data-Driven Survey of Evolving Research on Limitations of Large Language Models

LLMs: 一种数据驱动的关于大语言模型局限性研究演变的调查

Aida Kostikova, Zhipin Wang, Deidamea Bajri, Ole Pütz, Benjamin Paaßen, Steffen Eger

机构 * University of Bielefeld(比勒菲尔德大学) University of Technology Nuremberg(纽伦堡技术大学) University of Mannheim(曼海姆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过数据驱动的方法分析了大语言模型局限性研究的演变趋势,揭示了推理、泛化等关键问题的热点及研究进展。

Comments ACM Computing Surveys (CSUR); 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12226 2026-03-13 cs.CL cs.AI 62%

Sparking Scientific Creativity via LLM-Driven Interdisciplinary Inspiration

通过LLM驱动的跨学科灵感激发科学创造力

Priyanka Kargupta, Shuhaib Mehri, Dilek Hakkani-Tur, Jiawei Han

机构 * Siebel School of Computing and Data Science(计算机与数据科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Idea-Catalyst通过系统识别跨学科见解,支持人类和大语言模型的创造性推理,提升科学发现的创新性和洞察力。

Comments Code and dataset provided at https://github.com/pkargupta/idea_catalyst

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04634 2026-03-13 cs.AI cs.LG cs.MA 62%

WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning

WideSeek-R1: 探索通过多智能体强化学习进行广泛信息寻求的宽度扩展

Zelai Xu, Zhexuan Xu, Ruize Zhang, Chunyang Zhu, Shi Yu, Weilin Liu, Quanlu Zhang, Wenbo Ding, Chao Yu, Yu Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 WideSeek-R1通过多智能体强化学习框架,实现广泛信息寻求任务中的宽度扩展,提升多智能体系统的协同与并行执行能力,实验表明其性能优于单智能体模型。

Comments https://wideseek-r1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11924 2026-03-13 cs.LG cs.CL 62%

Chem4DLLM: 4D Multimodal LLMs for Chemical Dynamics Understanding

Chem4DLLM: 4D 多模态大语言模型用于化学动态理解

Xinyu Li, Zhen Zhang, Qi Chen, Anton van den Hengel, Lina Yao, Javen Qinfeng Shi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Chem4DLLM通过整合等变图编码器和预训练大语言模型,旨在提升对4D分子动态轨迹的解释能力,推动化学动态理解和多模态科学推理的研究。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11597 2026-03-13 cs.CL cs.AI 62%

Performance Evaluation of Open-Source Large Language Models for Assisting Pathology Report Writing in Japanese

开源大语言模型在协助日文病历报告写作中的性能评估

Masataka Kawai, Singo Sakashita, Shumpei Ishikawa, Shogo Watanabe, Anna Matsuoka, Mikio Sakurai, Yasuto Fujimoto, Yoshiyuki Takahara, Atsushi Ohara, Hirohiko Miyake, Genichiro Ishii

机构 * Department of Pathology, University of Yamanashi, Chuo, Japan(山梨大学病理科) Division of Pathology, Exploratory Oncology Research & Clinical Trial Center, National Cancer Center, Kashiwa, Japan(国立癌症中心探索肿瘤研究与临床试验中心病理科) Department of Preventive Medicine, Graduate School of Medicine, The University of Tokyo, Tokyo, Japan(东京大学医学部预防医学科) Department of Medical Oncology, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院医学肿瘤科) Department of Thoracic Surgery, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院胸外科)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了开源大语言模型在协助日文病历报告写作中的性能,发现思维模型和医学专用模型在结构化报告和拼写纠正中表现优异,但解释性输出的偏好存在较大差异。

Comments 9 pages (including bibliography), 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11409 2026-03-13 cs.AI cs.CL 62%

Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialogue

说话还是沉默:多方对话中的情境感知发言轮换

Kratika Bhagtani, Mrinal Anand, Yu Chen Xu, Amit Kumar Singh Yadav

机构 * School of Electrical and Computer Engineering, Purdue University, United States(帕克大学电气与计算机工程学院) Ishiki Labs Inc.(Ishiki实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于上下文的情境感知发言轮换方法,通过监督微调和推理痕迹提升模型在多方对话中的发言准确性,发现现有大语言模型在零样本条件下无法有效实现该能力。

Comments Submitted for review to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11078 2026-03-13 cs.SE cs.AI cs.CL 62%

CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents

CR-Bench:评估AI代码审查代理的现实世界效用

Kristen Pereira, Neelabh Sinha, Rajat Ghosh, Debojyoti Dutta

机构 * Nutanix, Inc.(Nutanix公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CR-Bench通过引入基准数据集和细粒度评估流程,评估AI代码审查代理在现实世界中的效用,揭示了问题解决与假发现之间的权衡,为LLM驱动的代码审查代理发展提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11915 2026-03-13 cs.CL 57%

CoMMET: To What Extent Can LLMs Perform Theory of Mind Tasks?

CoMMET:大型语言模型在理论思维任务中能发挥多大作用?

Ruirui Chen, Weifeng Jiang, Chengwei Qin, Cheston Tan

机构 * Agency for Science, Technology and Research (A*STAR)(科技研究局) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州),中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出CoMMET多模态基准数据集,用于评估大型语言模型在多轮对话中的理论思维能力,通过扩展心理状态评估和引入多轮测试,分析模型优劣势并指明未来改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11446 2026-03-13 cs.CL 57%

LLM-Assisted Causal Structure Disambiguation and Factor Extraction for Legal Judgment Prediction

基于大型语言模型的因果结构辨析与因子提取的法律判决预测

Yuzhi Liang, Lixiang Ma, Xinrong Zhu

机构 * School of Information Technology(信息科技学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种结合大型语言模型与统计因果发现的框架,通过改进的因果结构辨析和因子提取方法,提升法律判决预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11414 2026-03-13 cs.CL cond-mat.mtrl-sci 57%

MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models

MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集

Michiko Yoshitake, Yuta Suzuki, Ryo Igarashi, Yoshitaka Ushiku, Keisuke Nagato

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MaterialFigBench是一个评估多模态大语言模型在材料科学问题中图表解读能力的基准数据集,通过137个问题测试模型在视觉理解和数值精度上的表现,揭示了当前模型在图表处理方面的不足。

Comments 27 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10061 2026-03-13 cs.RO 50%

Decision-Aware Uncertainty Evaluation of Vision-Language Model-Based Early Action Anticipation for Human-Robot Interaction

基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估

Zhaoda Du, Michael Bowman, Qiaojie Zheng, Xiaoli Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏