arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-12 至 2026-03-12 共收录 30 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 30 篇

2603.09993 2026-03-12 cs.CL cs.AI 81%

CEI: A Benchmark for Evaluating Pragmatic Reasoning in Language Models

CEI:一种评估语言模型隐含推理能力的基准

Jon Chun, Hannah Sussman, Adrian Mangine, Murathan Kocaman, Kirill Sidorko, Abhigya Koirala, Andre McCloud, Gwen Eisenbeis, Wisdom Akanwe, Moustapha Gassama, Eliezer Gonzalez Chirinos, Anne-Duncan Enright, Peter Dunson, Tiffanie Ng, Anna von Rosenstiel, Godwin Idowu

机构 * Kenyon College(肯尼恩学院) US NIST AI Consortium(美国NIST人工智能联合体) Schmidt Science HAVI(施密特科学HAVI)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CEI基准通过300个经人类验证的场景评估语言模型在处理隐含意义复杂语句时的歧义消除能力,涵盖讽刺、混合信号等五种隐含子类型,采用三种权力配置进行测试。

Comments 38 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25426 2026-03-12 cs.AI cs.LG 81%

RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs

RADAR: 为推理LLM进行推理能力与难度感知的路由

Nigel Fernandez, Branislav Kveton, Ryan A. Rossi, Andrew S. Lan, Zichao Wang

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 RADAR通过推理能力与难度感知路由,实现对不同查询的高效模型选择,提升推理性能与可扩展性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17862 2026-03-12 cs.AI cs.CL cs.CV 81%

Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities

Daily-Omni: 向音频-视觉推理迈进:跨模态时间对齐

Ziwei Zhou, Rui Wang, Zuxuan Wu, Yu-Gang Jiang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Daily-Omni提出一个包含684个真实世界视频和1,197个问题的音频-视觉问答基准,评估24个模型在跨模态时间对齐任务上的性能,发现端到端模型在对齐关键问题上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10814 2026-03-12 cs.CV 80%

HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation

HanMoVLM:用于专业艺术绘画评估的大型视觉-语言模型

Hongji Yang, Yucheng Zhou, Wencheng Han, Songlian Li, Xiaotong Zhao, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(SKL-IOTSC、CIS、澳门大学) CSE, Shandong University(山东大学计算机科学与工程学院) Online-Video BU, Tencent(腾讯在线视频事业部)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 HanMoVLM通过引入HanMo-Bench数据集和链式推理机制,实现专业艺术绘画评估,提升中国绘画生成质量。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10858 2026-03-12 cs.RO cs.AI cs.MA 79%

GRACE: A Unified 2D Multi-Robot Path Planning Simulator & Benchmark for Grid, Roadmap, And Continuous Environments

GRACE:一种统一的二维多机器人路径规划模拟器与基准,适用于网格、路网和连续环境

Chuanlong Zang, Anna Mannucci, Isabelle Barz, Philipp Schillinger, Florian Lier, Wolfgang Hönig

机构 * Robert Bosch GmbH, Corporate Research(罗伯特·博世集团,企业研究) Technical University of Berlin(柏林技术大学)

专题命中 推理评测 :planning(title,abstract);分类 cs.AI

AI总结 GRACE是一种统一的二维多机器人路径规划模拟器与基准,通过统一的抽象级别和评估协议,实现跨网格、路网和连续环境的可比性比较,以提升多机器人规划研究的可重复性和应用性。

Comments ICRA 2026, code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10793 2026-03-12 cs.CL 79%

Multilingual Reasoning Gym: Multilingual Scaling of Procedural Reasoning Environments

多语言推理健身房:多语言的程序化推理环境扩展

Konstantin Dobler, Simon Lehnerer, Federico Scozzafava, Jonathan Janke, Mohamed Ali

机构 * Apple(苹果公司) Hasso Plattner Institute & ELLIS Unit Potsdam(霍普夫研究所与波茨坦ELLIS单元)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Multilingual Reasoning Gym通过多语言程序化生成可验证推理问题,支持跨语言大规模数据生成和强化学习研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10175 2026-03-12 eess.AS cs.CL 79%

Calibration-Reasoning Framework for Descriptive Speech Quality Assessment

描述性语音质量评估的校准-推理框架

Elizaveta Kostenok, Mathieu Salzmann, Milos Cernak

机构 * EPFL(苏黎世联邦理工学院) Logitech(洛吉科技)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出校准-推理框架,通过强化学习优化提升语音质量评估的多维描述和缺陷定位精度。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10852 2026-03-12 cs.CV 78%

UltrasoundAgents: Hierarchical Multi-Agent Evidence-Chain Reasoning for Breast Ultrasound Diagnosis

超声波智能体:用于乳腺超声诊断的层次多智能体证据链推理

Yali Zhu, Kang Zhou, Dingbang Wu, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学(大学层面)交叉学科学院,北京,中国) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong(人工智能与机器人中心,香港创新科学研究院,中国科学院,香港)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 UltrasoundAgents通过层次多智能体框架实现乳腺超声诊断中的证据链推理,提升诊断准确性和证据可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10570 2026-03-12 cs.CL 74%

End-to-End Chatbot Evaluation with Adaptive Reasoning and Uncertainty Filtering

端到端对话机器人评估与自适应推理和不确定性过滤

Nhi Dang, Tung Le, Huy Tien Nguyen

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本研究提出一种端到端自动评估器,通过生成问答对和置信度过滤,实现对话机器人评估的自动化和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10101 2026-03-12 cs.LG cs.AI cs.CL 67%

CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR

CLIPO: 在策略优化中通过对比学习推广RLVR

Sijia Cui, Pengyu Cheng, Jiajun Song, Yongbo Gai, Guojun Zhang, Zhechao Yu, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba Institute of Automation, Chinese Academy of Sciences(文勤大模型应用团队,阿里巴巴自动化研究所,中国科学院) Qwen Large Model Application Team, Alibaba(文勤大模型应用团队,阿里巴巴)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CLIPO通过对比学习机制改进RLVR,提升大语言模型的策略优化泛化与鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09996 2026-03-12 cs.CL cs.AI cs.CR cs.LG 67%

There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective

没有愚蠢的问题:从土耳其视角评估离线LLM能力

Edibe Yilmaz, Kahraman Kostas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究从土耳其视角评估了离线LLM在遗产语言教育中的鲁棒性和教学安全性,发现参数范围在8B-14B的模型在成本与安全性之间达到最佳平衡。

Comments 5 pages, 6 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08935 2026-03-12 cs.CV cs.AI cs.CL cs.DL cs.IR 62%

PathoScribe: Transforming Pathology Data into a Living Library with a Unified LLM-Driven Framework for Semantic Retrieval and Clinical Integration

PathoScribe: 将病理数据转化为一个活的图书馆:一种统一的LLM驱动框架,用于语义检索和临床整合

Abdul Rehman Akbar, Samuel Wales-McGrath, Alejadro Levya, Lina Gokhale, Rajendra Singh, Wei Chen, Anil Parwani, Muhammad Khalid Khan Niazi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PathoScribe通过统一的LLM框架实现病理数据的语义检索与临床整合,提升病理档案的活用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10303 2026-03-12 cs.CL cs.AI 62%

Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas

这个想法是否新颖?一种自动化的判断研究想法新颖性的基准

Tim Schopf, Michael Färber

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RINoBench基准,用于评估研究想法新颖性判断,发现LLM生成的推理与人类相似但判断不准确。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01313 2026-03-12 cs.CL cs.AI 62%

Evaluating Long-Horizon Memory for Multi-Party Collaborative Dialogues

评估多方协作对话的长周期记忆

Chuanrui Hu, Tong Li, Xingze Gao, Hongda Chen, Yi Bai, Dannong Xu, Tianwei Lin, Xiaohong Li, Yunyun Han, Jian Pei, Yafeng Deng

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EverMemBench,首个评估多方协作对话长周期记忆的基准,揭示当前系统在多跳推理、时间推理和记忆意识方面的局限性。

Comments 25 pages, 21 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23499 2026-03-12 cs.CV cs.CL cs.LG 62%

Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional

多模态数据光谱:多模态数据集是多维的

Divyam Madaan, Varshan Muhunthan, Kyunghyun Cho, Sumit Chopra

机构 * New York University(纽约大学) GenentechCIFAR(基因泰克CIFAR) New York University Grossman School of Medicine(纽约大学格罗斯曼医学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过多模态大语言模型分析23个视觉问答基准,揭示了不同模态在目标任务中的依赖性差异,发现部分基准因设计缺陷放大了图像依赖性。

Comments Accepted to ICLR 2026. Code available at https://github.com/divyam3897/multimodal-spectrum

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03782 2026-03-12 cond-mat.supr-con cond-mat.str-el cs.AI 57%

Expert Evaluation of LLM World Models: A High-$T_c$ Superconductivity Case Study

专家评估LLM世界模型:一个高温超导体案例研究

Haoyu Guo, Maria Tikhanovskaya, Paul Raccuglia, Alexey Vlaskin, Chris Co, Daniel J. Liebling, Scott Ellsworth, Matthew Abraham, Elizabeth Dorfman, N. P. Armitage, Chunhan Feng, Antoine Georges, Olivier Gingras, Dominik Kiese, Steven A. Kivelson, Vadim Oganesyan, B. J. Ramshaw, Subir Sachdev, T. Senthil, J. M. Tranquada, Michael P. Brenner, Subhashini Venugopalan, Eun-Ah Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过专家评估LLM在高温超导领域的问题回答能力,发现基于RAG的系统在全面性和证据支持方面优于封闭模型。

Comments (v1) 9 pages, 4 figures, with 7-page supporting information. Accepted at the ICML 2025 workshop on Assessing World Models and the Explorations in AI Today workshop at ICML'25

Journal ref Proceedings of the National Academy of Sciences 123, e2533676123 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10764 2026-03-12 cs.CL 57%

HeartAgent: An Autonomous Agent System for Explainable Differential Diagnosis in Cardiology

HeartAgent:一种用于心血管疾病可解释性差分诊断的自主代理系统

Shuang Zhou, Kai Yu, Song Wang, Wenya Xie, Zaifu Zhan, Meng-Han Tsai, Yuen-Hei Chung, Shutong Hou, Huixue Zhou, Min Zeng, Bhavadharini Ramu, Lin Yee Chen, Feng Xie, Rui Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 HeartAgent通过整合定制工具和数据资源,提供可解释的差分诊断支持,显著提升心血管疾病诊断的准确性和解释质量。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10700 2026-03-12 cs.IR cs.AI 57%

Structured Linked Data as a Memory Layer for Agent-Orchestrated Retrieval

结构化链接数据作为代理协调检索的记忆层

Andrea Volpini, Elie Raad, Beatrice Gamba, David Riccitelli

机构 * WordLift

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过结构化链接数据提升代理协调检索的准确性与回答质量,实验表明增强实体页面格式显著提高检索性能。

Comments 33 pages, 7 figures, reproducibility appendix, dataset/evaluation framework/enhanced entity page templates released with the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10640 2026-03-12 cs.CL 57%

Making Bielik LLM Reason (Better): A Field Report

使Bielik LLM推理能力更优:一份领域报告

Adam Trybus, Bartosz Bartnicki, Remigiusz Kinas

机构 * Institute of Philosophy Jagiellonian University(杰洛尼亚大学哲学学院) Bielik.ai (Speakleash Foundation)(Bielik.ai(Speakleash基金会))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文旨在通过评估和提升Bielik的推理能力,使其在快速变化的AI领域保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10600 2026-03-12 cs.AI cs.DB cs.IR 57%

Trajectory-Informed Memory Generation for Self-Improving Agent Systems

基于轨迹的内存生成用于自改进代理系统

Gaodan Fang, Vatche Isahagian, K. R. Jayaram, Ritesh Kumar, Vinod Muthusamy, Punleuk Oum, Gegi Thomas

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于轨迹的内存生成框架,通过提取执行轨迹中的有效信息,提升代理在复杂任务中的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10233 2026-03-12 cs.CL 57%

S-GRADES -- Studying Generalization of Student Response Assessments in Diverse Evaluative Settings

S-GRADES -- 研究学生响应评估在多样化评估环境中的泛化能力

Tasfia Seuti, Sagnik Ray Choudhury

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 S-GRADES通过统一的基准测试平台整合多种学生响应评分数据集,评估大语言模型在不同评分任务中的泛化能力,揭示评分任务中的可靠性与泛化差距。

Comments LREC 2026 Accepted, https://sgrades.eng.unt.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10178 2026-03-12 cs.CV cs.CL 57%

Video-Based Reward Modeling for Computer-Use Agents

基于视频的计算机使用代理奖励建模

Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of Washington(华盛顿大学) MBZUAI(机器智能研究院) Amazon AGI(亚马逊人工通用智能)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出基于视频的计算机使用代理奖励建模方法,通过ExeVR-53k数据集和对抗性指令翻译技术,实现高精度的任务成功预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10057 2026-03-12 cs.CR cs.AI cs.SE 57%

SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation

Petar Radanliev, Carsten Maple, Omar Santos, Kayvan Atefi

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Petar Radanliev, Carsten Maple, Omar Santos, and Kayvan Atefi. 2026. SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation. Digital Threats Just Accepted (March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10034 2026-03-12 cs.CL 57%

A Principle-Driven Adaptive Policy for Group Cognitive Stimulation Dialogue for Elderly with Cognitive Impairment

基于原则的自适应策略用于认知障碍老年人群体认知刺激对话

Jiyue Jiang, Yanyu Chen, Pengan Chen, Kai Liu, Jingqi Zhou, Zheyong Zhu, He Hu, Fei Ma, Qi Tian, Chuan Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于原则的自适应策略,通过GCSD系统解决认知障碍老年人群体对话中的认知刺激问题,提升交互个性化和治疗效果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09827 2026-03-12 cs.CV cs.AI 57%

MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

MA-EgoQA:多智能体视角下的眼动视频问答

Kangsan Kim, Yanlai Yang, Suji Kim, Woongyeong Yeo, Youngwan Lee, Mengye Ren, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) New York University(纽约大学) Samsung Electronics(三星电子) ETRI(电子技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MA-EgoQA旨在解决多智能体视角下的眼动视频问答问题,通过引入多代理眼动问答基准和EgoMAS模型,评估现有方法在处理多眼动流中的不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05271 2026-03-12 cs.CV cs.AI 57%

DeepEyesV2: Toward Agentic Multimodal Model

DeepEyesV2:迈向代理多模态模型

Jack Hong, Chenxiao Zhao, ChengLin Zhu, Weiheng Lu, Guohai Xu, Xing Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DeepEyesV2通过两阶段训练方法实现代理多模态模型,结合数据构建、训练优化和评估,提升现实世界推理与工具调用能力。

Comments Accepted to ICLR2026. Homepage: https://visual-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03114 2026-03-12 cs.SE 50%

PromCopilot: Simplifying Prometheus Metric Querying in Cloud Native Online Service Systems via Large Language Models

PromCopilot: 通过大型语言模型简化云原生在线服务系统的Prometheus指标查询

Chenxi Zhang, Bicheng Zhang, Dingyu Yang, Xin Peng, Miao Chen, Senyu Xie, Gang Chen, Wei Bi, Wei Li

专题命中 推理评测 :reasoning(abstract)

AI总结 PromCopilot通过大型语言模型简化云原生在线服务系统的Prometheus指标查询,首次提出文本到PromQL框架,准确率达69.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10795 2026-03-12 cs.CR cs.ET 50%

Re-Evaluating EVMBench: Are AI Agents Ready for Smart Contract Security?

重新评估 EVMBench:AI代理是否准备好应对智能合约安全?

Chaoyuan Peng, Lei Wu, Yajin Zhou

专题命中 推理评测 :reasoning(abstract)

AI总结 重新评估EVMBench发现AI代理在智能合约安全检测中存在稳定性、真实事件处理和框架依赖性问题,挑战了自动化审计的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10342 2026-03-12 cs.DC 50%

AgentServe: Algorithm-System Co-Design for Efficient Agentic AI Serving on a Consumer-Grade GPU

AgentServe: 为在消费级GPU上高效执行代理AI服务的算法-系统协同设计

Yuning Zhang, Yan Yan, Nan Yang, Dong Yuan

专题命中 推理评测 :reasoning(abstract)

AI总结 AgentServe通过算法-系统协同设计,在消费级GPU上实现高效代理AI服务,提升延迟稳定性并保持吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10029 2026-03-12 cs.GT 50%

Quantal Response Equilibrium as a Measure of Strategic Sophistication: Theory and Validation for LLM Evaluation

量子反应均衡作为战略成熟度的度量:理论与LLM评估中的验证

Mateo Pechon-Elkins, Jon Chun

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于量子反应均衡的理论框架,用于评估大型语言模型的战略成熟度,通过实验验证了模型在不同认知能力上的表现及参数估计的稳健性。

Comments 25 pages, 8 figures, submitted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏