arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-13 至 2026-03-13 共收录 85 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2603.11266 2026-03-13 cs.AI 57%

The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning

消除幻觉:一种动态框架用于评估大语言模型的消除

Raj Sanjay Shah, Jing Huang, Keerthiram Murugesan, Nathalie Baracaldo, Diyi Yang

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种动态框架,用于评估大语言模型消除方法的鲁棒性,通过复杂结构查询揭示消除技术在多跳设置中的脆弱性,并提供可扩展的评估方法。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 16 篇

2603.11987 2026-03-13 cs.AI 88%

LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories

LABSHIELD:一种多模态基准,用于科学实验室中的安全关键推理和规划

Qianpu Sun, Xiaowei Chi, Yuhan Rui, Ying Li, Kuangzhi Ge, Jiajun Li, Sirui Han, Shanghang Zhang

专题命中 推理评测 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 LABSHIELD是一个多模态基准,用于评估MLLM在科学实验室中的安全关键推理和规划能力,揭示了现有模型在专业实验室场景中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11896 2026-03-13 cs.CV cs.AI cs.CL 84%

Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models

边看边想:多轮视频推理的在线流式段级内存

Lu Wang, Zhuoran Jin, Yupu Hao, Yubo Chen, Kang Liu, Yulong Ao, Jun Zhao

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Think While Watching框架,通过段级内存保持多轮视频推理连续性,提升流式视频理解的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11339 2026-03-13 cs.AI cs.CE cs.LG 81%

FinRule-Bench: A Benchmark for Joint Reasoning over Financial Tables and Principles

FinRule-Bench:一个用于金融表和原则联合推理的基准

Arun Vignesh Malarkkan, Manan Roy Choudhury, Guangwei Zhang, Vivek Gupta, Qingyun Wang, Yanjie Fu, Denghui Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 FinRule-Bench是一个评估金融表与原则联合推理能力的基准,通过三个任务测试模型在规则验证、识别和多违规诊断中的表现,揭示LLMs在高风险金融分析中的局限性。

Comments 8 pages + Ethics Statement + References + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07791 2026-03-13 cs.CV 78%

GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models

GTR-Bench:评估视觉-语言模型中的地理时间推理

Qinghongbing Xie, Zhaoyuan Xia, Feng Zhu, Lijun Gong, Ziyue Li, Rui Zhao, Long Zeng

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Peking University(北京大学) Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。

Comments ICLR 2026, 31 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15479 2026-03-13 cs.CL cs.AI 73%

Benchmarking LLMs for Pairwise Causal Discovery in Biomedical and Multi-Domain Contexts

在生物医学和多领域背景下对LLM进行成对因果发现的基准测试

Sydney Anuyah, Sneha Shajee-Mohan, Ankit-Singh Chauhan, Sunandan Chakraborty

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了13个开源LLM在生物医学和多领域背景下进行成对因果发现的能力,发现现有模型在处理复杂因果关系时表现不佳,提出了统一的评估框架并公开数据以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19240 2026-03-13 cs.CL cs.AI cs.LG 67%

LLLMs: A Data-Driven Survey of Evolving Research on Limitations of Large Language Models

LLMs: 一种数据驱动的关于大语言模型局限性研究演变的调查

Aida Kostikova, Zhipin Wang, Deidamea Bajri, Ole Pütz, Benjamin Paaßen, Steffen Eger

机构 * University of Bielefeld(比勒菲尔德大学) University of Technology Nuremberg(纽伦堡技术大学) University of Mannheim(曼海姆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过数据驱动的方法分析了大语言模型局限性研究的演变趋势,揭示了推理、泛化等关键问题的热点及研究进展。

Comments ACM Computing Surveys (CSUR); 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12226 2026-03-13 cs.CL cs.AI 62%

Sparking Scientific Creativity via LLM-Driven Interdisciplinary Inspiration

通过LLM驱动的跨学科灵感激发科学创造力

Priyanka Kargupta, Shuhaib Mehri, Dilek Hakkani-Tur, Jiawei Han

机构 * Siebel School of Computing and Data Science(计算机与数据科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Idea-Catalyst通过系统识别跨学科见解,支持人类和大语言模型的创造性推理,提升科学发现的创新性和洞察力。

Comments Code and dataset provided at https://github.com/pkargupta/idea_catalyst

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04634 2026-03-13 cs.AI cs.LG cs.MA 62%

WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning

WideSeek-R1: 探索通过多智能体强化学习进行广泛信息寻求的宽度扩展

Zelai Xu, Zhexuan Xu, Ruize Zhang, Chunyang Zhu, Shi Yu, Weilin Liu, Quanlu Zhang, Wenbo Ding, Chao Yu, Yu Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 WideSeek-R1通过多智能体强化学习框架,实现广泛信息寻求任务中的宽度扩展,提升多智能体系统的协同与并行执行能力,实验表明其性能优于单智能体模型。

Comments https://wideseek-r1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11924 2026-03-13 cs.LG cs.CL 62%

Chem4DLLM: 4D Multimodal LLMs for Chemical Dynamics Understanding

Chem4DLLM: 4D 多模态大语言模型用于化学动态理解

Xinyu Li, Zhen Zhang, Qi Chen, Anton van den Hengel, Lina Yao, Javen Qinfeng Shi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Chem4DLLM通过整合等变图编码器和预训练大语言模型,旨在提升对4D分子动态轨迹的解释能力,推动化学动态理解和多模态科学推理的研究。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11597 2026-03-13 cs.CL cs.AI 62%

Performance Evaluation of Open-Source Large Language Models for Assisting Pathology Report Writing in Japanese

开源大语言模型在协助日文病历报告写作中的性能评估

Masataka Kawai, Singo Sakashita, Shumpei Ishikawa, Shogo Watanabe, Anna Matsuoka, Mikio Sakurai, Yasuto Fujimoto, Yoshiyuki Takahara, Atsushi Ohara, Hirohiko Miyake, Genichiro Ishii

机构 * Department of Pathology, University of Yamanashi, Chuo, Japan(山梨大学病理科) Division of Pathology, Exploratory Oncology Research & Clinical Trial Center, National Cancer Center, Kashiwa, Japan(国立癌症中心探索肿瘤研究与临床试验中心病理科) Department of Preventive Medicine, Graduate School of Medicine, The University of Tokyo, Tokyo, Japan(东京大学医学部预防医学科) Department of Medical Oncology, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院医学肿瘤科) Department of Thoracic Surgery, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院胸外科)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了开源大语言模型在协助日文病历报告写作中的性能,发现思维模型和医学专用模型在结构化报告和拼写纠正中表现优异,但解释性输出的偏好存在较大差异。

Comments 9 pages (including bibliography), 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11409 2026-03-13 cs.AI cs.CL 62%

Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialogue

说话还是沉默:多方对话中的情境感知发言轮换

Kratika Bhagtani, Mrinal Anand, Yu Chen Xu, Amit Kumar Singh Yadav

机构 * School of Electrical and Computer Engineering, Purdue University, United States(帕克大学电气与计算机工程学院) Ishiki Labs Inc.(Ishiki实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于上下文的情境感知发言轮换方法,通过监督微调和推理痕迹提升模型在多方对话中的发言准确性,发现现有大语言模型在零样本条件下无法有效实现该能力。

Comments Submitted for review to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11078 2026-03-13 cs.SE cs.AI cs.CL 62%

CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents

CR-Bench:评估AI代码审查代理的现实世界效用

Kristen Pereira, Neelabh Sinha, Rajat Ghosh, Debojyoti Dutta

机构 * Nutanix, Inc.(Nutanix公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CR-Bench通过引入基准数据集和细粒度评估流程,评估AI代码审查代理在现实世界中的效用,揭示了问题解决与假发现之间的权衡,为LLM驱动的代码审查代理发展提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11915 2026-03-13 cs.CL 57%

CoMMET: To What Extent Can LLMs Perform Theory of Mind Tasks?

CoMMET:大型语言模型在理论思维任务中能发挥多大作用?

Ruirui Chen, Weifeng Jiang, Chengwei Qin, Cheston Tan

机构 * Agency for Science, Technology and Research (A*STAR)(科技研究局) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州),中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出CoMMET多模态基准数据集,用于评估大型语言模型在多轮对话中的理论思维能力,通过扩展心理状态评估和引入多轮测试,分析模型优劣势并指明未来改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11446 2026-03-13 cs.CL 57%

LLM-Assisted Causal Structure Disambiguation and Factor Extraction for Legal Judgment Prediction

基于大型语言模型的因果结构辨析与因子提取的法律判决预测

Yuzhi Liang, Lixiang Ma, Xinrong Zhu

机构 * School of Information Technology(信息科技学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种结合大型语言模型与统计因果发现的框架,通过改进的因果结构辨析和因子提取方法,提升法律判决预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11414 2026-03-13 cs.CL cond-mat.mtrl-sci 57%

MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models

MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集

Michiko Yoshitake, Yuta Suzuki, Ryo Igarashi, Yoshitaka Ushiku, Keisuke Nagato

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MaterialFigBench是一个评估多模态大语言模型在材料科学问题中图表解读能力的基准数据集,通过137个问题测试模型在视觉理解和数值精度上的表现,揭示了当前模型在图表处理方面的不足。

Comments 27 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10061 2026-03-13 cs.RO 50%

Decision-Aware Uncertainty Evaluation of Vision-Language Model-Based Early Action Anticipation for Human-Robot Interaction

基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估

Zhaoda Du, Michael Bowman, Qiaojie Zheng, Xiaoli Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 8 篇

2603.12176 2026-03-13 cs.CV cs.AI 79%

BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoning

BehaviorVLM: 无需微调的统一行为理解与视觉-语言推理

Jingyang Ke, Weihan Li, Amartya Pradhan, Jeffrey Markowitz, Anqi Wu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 BehaviorVLM通过无需微调的视觉-语言框架,实现了姿态估计和行为理解的统一,利用详细推理步骤减少人工标注,提升多动物行为分析的可扩展性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12038 2026-03-13 cs.LG cs.AI 73%

Slow-Fast Inference: Training-Free Inference Acceleration via Within-Sentence Support Stability

慢-快推理:通过句内支持稳定性实现无需训练的推理加速

Xingyu Xie, Zhaochen Yu, Yue Liao, Tao Wang, Kim-Chuan Toh, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) ByteDance(字节跳动)

专题命中 其他推理 :reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 SFI通过利用句内支持稳定性,将生成过程分为快速低成本步骤和偶尔的密集注意力慢步骤,从而提高解码吞吐量并保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11950 2026-03-13 cs.AI cs.LG 62%

Learning Transferable Sensor Models via Language-Informed Pretraining

通过语言引导预训练学习可迁移的传感器模型

Yuliang Chen, Arvind Pillai, Yu Yvonne Wu, Tess Z. Griffin, Lisa Marsch, Michael V. Heinz, Nicholas C. Jacobson, Andrew Campbell

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SLIP通过语言引导预训练学习可迁移的传感器模型,整合对比对齐与传感器条件标注,支持不同时间分辨率和输入长度,实现跨领域任务的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11682 2026-03-13 cs.LG cs.AI 62%

Entropy-Preserving Reinforcement Learning

熵保持强化学习

Aleksei Petrenko, Ben Lipkin, Kevin Chen, Erik Wijmans, Marco Cusumano-Towner, Raja Giryes, Philipp Krähenbühl

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出熵保持强化学习方法,通过监控和控制熵来维持探索多样性,提升策略性能和可训练性。

Comments Published at ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21599 2026-03-13 cs.IR cs.AI cs.LG 62%

Refine-POI: Reinforcement Fine-Tuned Large Language Models for Next Point-of-Interest Recommendation

Refine-POI: 通过强化微调优化大型语言模型用于下一步兴趣点推荐

Peibo Li, Shuang Ao, Hao Xue, Yang Song, Maarten de Rijke, Johan Barthélemy, Tomasz Bednarz, Flora D. Salim

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Refine-POI通过拓扑感知ID生成和强化微调,解决LLMs在POI推荐中的语义连续性和top-k推荐问题,提升推荐准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11948 2026-03-13 cs.NI 50%

Kraken*: Architecting Generative, Semantic, and Goal-Oriented Network Management for 6G Wireless Systems

Kraken*:为6G无线系统构建生成、语义和目标导向的网络管理

Ian F. Akyildiz, Tuğçe Bilen

专题命中 其他推理 :reasoning(abstract)

AI总结 Kraken*通过整合语义通信、生成式推理和目标导向优化,为6G无线系统提供生成、语义和目标导向的网络管理架构,推动向知识原生6G系统演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11920 2026-03-13 cs.NI 50%

The Network That Thinks: Kraken* and the Dawn of Cognitive 6G

会思考的网络:Kraken* 与认知6G的黎明

Ian F. Akyildiz, Tuğçe Bilen

专题命中 其他推理 :reasoning(abstract)

AI总结 Kraken是一种面向6G的智能网络架构,通过语义通信、生成推理和目标优化实现集体智能,提升自动驾驶、XR服务和基础设施监控的效率与响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06965 2026-03-13 cs.CV 50%

MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images

MedMO:为医学图像构建和理解多模态大语言模型

Ankan Deria, Komal Kumar, Adinath Madhavrao Dukre, Eran Segal, Salman Khan, Imran Razzak

专题命中 其他推理 :reasoning(abstract)

AI总结 MedMO是一种基于通用MLLM架构构建的医学多模态基础模型,通过多阶段训练提升跨模态和任务的性能,超越现有开源基线,在医学图像识别和报告生成中取得显著提升。

Comments 21 pages, 6 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏