arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-11 至 2026-03-11 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 24 篇

2603.09556 2026-03-11 cs.CL 83%

ALARM: Audio-Language Alignment for Reasoning Models

ALARM:用于推理模型的音频-语言对齐

Petr Grinberg, Hassan Shahmohammadi

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 ALARM通过自我改写和多编码器融合,提升推理模型的音频理解能力,实现更高效的音频推理性能。

Comments Submitted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09512 2026-03-11 cs.CV 82%

Probing the Reliability of Driving VLMs: From Inconsistent Responses to Grounded Temporal Reasoning

探测驾驶视觉语言模型的可靠性:从不一致响应到基于现实的时序推理

Chun-Peng Chang, Chen-Yu Wang, Holger Caesar, Alain Pagani

机构 * DFKI Augmented Vision(DFKI增强视觉实验室) TU Delft(代尔夫特理工大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文研究了驾驶视觉语言模型的可靠性问题,通过引入FutureVQA数据集和自监督微调方法,提升模型在时序推理和一致性上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11595 2026-03-11 cs.LG cs.AI cs.CL 82%

Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO

逐步引导策略优化:在GRPO中着色你的错误推理

Peter Chen, Xiaopeng Li, Ziniu Li, Xi Chen, Tianyi Lin

机构 * Department of Industrial Engineering and Operations Research(工业工程与运营管理系) Department of Mathematics(数学系) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Stern School of Business, New York University(纽约大学斯特恩商学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SGPO通过引入组内响应多样性,解决GRPO在所有负样本组时无法更新策略的问题,提升推理模型性能。

Comments Accepted by TMLR; 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16368 2026-03-11 cs.LG cs.AI 81%

SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning

SATURN: 基于求解的强化学习以释放大语言模型的推理能力

Huanyu Liu, Ge Li, Jia Li, Hao Zhu, Kechi Zhang, Yihong Dong

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Saturn通过基于SAT问题的强化学习框架,提升大语言模型的推理能力,实现可扩展的任务构建、规则验证和难度控制,取得显著效果。

Comments Camera-ready version for Neural Information Processing Systems (NeurIPS) 2025, Spotlight Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09249 2026-03-11 cs.AI 79%

Social-R1: Towards Human-like Social Reasoning in LLMs

Social-R1: 向大语言模型中引入人类般的社交推理

Jincenzi Wu, Yuxuan Lei, Jianxun Lian, Yitian Huang, Lexin Zhou, Haotian Li, Xing Xie, Helen Meng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Social-R1通过多维奖励对齐模型推理与人类认知,利用ToMBench-Hard提供困难训练案例,使大模型在社交推理任务中实现超越和稳健泛化。

Comments 27 pages. Code and dataset will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09478 2026-03-11 cs.MM 78%

MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning

MORE-R1: 通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取的分步推理

Xiang Yuan, Xu Chu, Xinrong Chen, Haochen Li, Zonghong Dai, Hongcheng Fan, Xiaoyue Yuan, Weiping Li, Tong Mo

专题命中 推理评测 :reasoning(title,abstract)

AI总结 MORE-R1通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取,提升推理能力与模型性能。

Comments Accepted by the 31st International Conference on Database Systems for Advanced Applications. This is the Accepted Manuscript (AM) version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09434 2026-03-11 cs.CL cs.AI 62%

Common Sense vs. Morality: The Curious Case of Narrative Focus Bias in LLMs

常识与道德:LLMs中叙述焦点偏见的奇特案例

Saugata Purkayastha, Pranav Kushare, Pragya Paramita Pal, Sukannya Purkayastha

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLMs在道德困境中优先道德推理而非常识理解的偏见,提出CoMoral数据集并揭示了模型在识别常识矛盾时的叙述焦点偏见问题。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08640 2026-03-11 cs.SE cs.AI cs.LG 62%

PostTrainBench: Can LLM Agents Automate LLM Post-Training?

PostTrainBench: 大型语言模型代理能否自动化大型语言模型的后训练?

Ben Rank, Hardik Bhatnagar, Ameya Prabhu, Shira Eisenberg, Karina Nguyen, Matthias Bethge, Maksym Andriushchenko

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PostTrainBench研究LLM代理在受限制计算条件下自主进行后训练的能力,发现其在某些场景下可超越指令调优模型,但也存在奖励黑客等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09155 2026-03-11 cs.CL cs.AI 62%

OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering

OPENXRD:一个全面的基准框架用于LLM/MLLM XRD问答

Ali Vosoughi, Ayoub Shahnazari, Yufeng Xi, Zeliang Zhang, Griffin Hess, Chenliang Xu, Niaz Abdolrahim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 OPENXRD是一个用于评估LLM和MLLM在晶体学问答中性能的综合基准框架,通过专家审核材料验证内容质量对模型性能的关键影响。

Comments Accepted at Digital Discovery (Royal Society of Chemistry)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08936 2026-03-11 cs.SD cs.AI cs.CL cs.MM eess.AS 62%

VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs

VoxEmo:基于语音大语言模型的语音情感识别基准测试

Hezhao Zhang, Huang-Cheng Chou, Shrikanth Narayanan, Thomas Hain

机构 * Department of Computer Science, University of Sheffield, United Kingdom(英国谢菲尔德大学计算机科学系) Signal Analysis and Interpretation Laboratory (SAIL), Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California, Los Angeles, CA 90089, USA(美国南加州大学电气与计算机工程系信号分析与解释实验室(SAIL))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 VoxEmo是一个基于语音大语言模型的语音情感识别基准测试,通过提供多样化的提示复杂度和分布感知的软标签协议,评估模型在真实世界中的情感识别能力。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08736 2026-03-11 cs.DC cs.AI cs.LG cs.SY eess.SY 62%

Autonomous Edge-Deployed AI Agents for Electric Vehicle Charging Infrastructure Management

自主边缘部署AI代理用于电动汽车充电基础设施管理

Mohammed Cherifi

机构 * Hyperion Consulting(超离子咨询)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Auralink SDC架构,通过边缘部署的专用AI代理实现电动汽车充电基础设施的自主管理,实现高准确率的事故修复与快速响应。

Comments 27 pages, 10 figures (TikZ), 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09821 2026-03-11 cs.CL 57%

One-Eval: An Agentic System for Automated and Traceable LLM Evaluation

One-Eval: 一个用于自动化和可追溯的LLM评估代理系统

Chengyu Shen, Yanheng Hou, Minghui Pan, Runming He, Zhen Hao Wong, Meiyi Qiang, Zhou Liu, Hao Liang, Peichao Lai, Zeang Sheng, Wentao Zhang

机构 * Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 One-Eval通过自动化和可追溯的评估流程,提升大语言模型评估的效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09706 2026-03-11 cs.AI 57%

OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences

OOD-MMSafe: 推进多模态大语言模型安全性从有害意图到隐藏后果

Ming Wen, Kun Yang, Jingyu Zhang, Yuxuan Liu, shiwen cui, Shouling Ji, Xingjun Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OOD-MMSafe通过CASPO框架提升多模态大语言模型对隐藏后果的识别能力,显著降低风险识别失败率。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09435 2026-03-11 cs.AI 57%

AI Act Evaluation Benchmark: An Open, Transparent, and Reproducible Evaluation Dataset for NLP and RAG Systems

AI行为评估基准:为NLP和RAG系统设计的开放、透明且可复现的评估数据集

Athanasios Davvetas, Michael Papademas, Xenia Ziouvelou, Vangelis Karkaletsis

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种开放透明的数据集,用于评估NLP和RAG系统在欧盟AI法案下的合规性,通过生成风险等级分类等任务提升评估效率。

Comments 10 pages, 1 figure, 4 tables, 2 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09400 2026-03-11 cs.CL 57%

Reward Prediction with Factorized World States

基于分解世界状态的奖励预测

Yijun Shen, Delong Chen, Xianming Hu, Jiaming Mi, Hongbo Zhao, Kai Zhang, Pascale Fung

机构 * East China Normal University(华东师范大学) HKUST(香港科技大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本文提出StateFactory方法,通过分解世界状态实现跨领域的准确奖励预测,提升智能体规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09297 2026-03-11 cs.IR cs.CL 57%

TA-Mem: Tool-Augmented Autonomous Memory Retrieval for LLM in Long-Term Conversational QA

TA-Mem: 用于LLM长期对话问答的工具增强自主记忆检索

Mengwei Yuan, Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 TA-Mem通过引入工具增强的自主记忆检索框架,解决了LLM在长距离推理任务中的记忆存储问题,提升了长期对话问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08930 2026-03-11 cs.CV cs.AI 57%

Using Vision Language Foundation Models to Generate Plant Simulation Configurations via In-Context Learning

利用视觉语言基础模型通过上下文学习生成植物模拟配置

Heesup Yun, Isaac Kazuo Uyehara, Earl Ranario, Lars Lundqvist, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文利用视觉语言基础模型通过上下文学习生成植物模拟配置,解决高复杂度和低吞吐量的问题,提供可扩展的农业数字孪生框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08852 2026-03-11 cs.AI cs.MA cs.SE 57%

LDP: An Identity-Aware Protocol for Multi-Agent LLM Systems

LDP:一种面向多智能体LLM系统的身份感知协议

Sunil Prakash

机构 * Indian School of Business(印度管理学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LDP是一种面向多智能体LLM系统的身份感知协议,通过五种机制提升委托效率与可控性。

Comments 16 pages, 9 figures, 8 tables, 4 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15943 2026-03-11 cs.AI 57%

Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning

小型语言模型用于高效的代理工具调用:通过针对性微调超越大模型

Polaris Jhandi, Owais Kazi, Shreyas Subramanian, Neel Sendas

专题命中 推理评测 :CoT(abstract);分类 cs.AI

AI总结 本文通过针对性微调小型语言模型,在工具调用任务中超越大模型,展示了SLMs在成本优化和效率提升方面的潜力。

Comments Accepted at AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09896 2026-03-11 cs.CV 50%

Stepping VLMs onto the Court: Benchmarking Spatial Intelligence in Sports

迈向赛场:评估体育中的空间智能

Yuchen Yang, Yuqing Shao, Duxiu Huang, Linfeng Dong, Yifei Liu, Suixin Tang, Xiang Zhou, Yuanyuan Gao, Wei Wang, Yue Zhou, Xue Yang, Yanfeng Wang, Xiao Sun, Zhihang Zhong

专题命中 推理评测 :reasoning(abstract)

AI总结 CourtSI通过大规模体育场景数据集评估VLMs的空间智能,发现现有基准存在局限,并验证了模型在体育场景中的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09820 2026-03-11 cs.SD 50%

EmoSURA: Towards Accurate Evaluation of Detailed and Long-Context Emotional Speech Captions

EmoSURA:迈向精确评估详细且长上下文情感语音字幕

Xin Jing, Andreas Triantafyllopoulos, Jiadong Wang, Shahin Amiriparian, Jun Luo, Björn Schuller

机构 * CHI – Chair of Health Informatics, TUM University Hospital, Munich, Germany(慕尼黑大学医院健康信息学系) MCML - Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心) Huawei, Netherlands(荷兰华为) GLAM, Imperial College London, UK(伦敦帝国理工学院GLAM研究中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 EmoSURA通过原子验证机制和SURABench基准,提供更可靠的长上下文情感语音字幕评估方法

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09471 2026-03-11 cs.CV 50%

OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks

OmniEarth:一个评估遥感任务中视觉-语言模型的基准

Ronghao Fu, Haoran Liu, Weijie Zhang, Zhiwen Lin, Xiao Yang, Peng Zhang, Bo Yang

机构 * Jilin University(吉林大学) Chang Guang Satellite Technology(长光卫星技术)

专题命中 推理评测 :reasoning(abstract)

AI总结 OmniEarth是一个评估遥感任务中视觉-语言模型性能的基准,通过多维任务和严格测试协议,揭示现有模型在复杂地理任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10778 2026-03-11 cs.RO 50%

Asset-Centric Metric-Semantic Maps of Indoor Environments

以资产为中心的度量-语义地图:室内环境

Christopher D. Hsu, Pratik Chaudhari

机构 * Department of Electrical & Systems Engineering and General Robotics, Automation, Sensing and Perception (GRASP) Laboratory at the University of Pennsylvania(宾夕法尼亚大学电气与系统工程系及通用机器人、自动化、传感与感知(GRASP)实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出了一种以资产为中心的度量-语义地图方法,利用四足机器人和RGB-D数据构建室内环境的高精度表示,结合自然语言和网格信息,提升机器人场景理解和导航能力。

Comments 9 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08738 2026-03-11 cs.AR cs.SE 50%

FormalRTL: Verified RTL Synthesis at Scale

FormalRTL: 在大规模上实现验证的RTL综合

Kezhi Li, Min Li, Xiangyu Wen, Shibo Zhao, Jieying Wu, Junhua Huang, Qiang Xu

专题命中 推理评测 :planning(abstract)

AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏