arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-06 至 2026-03-06 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2603.05400 2026-03-06 cs.CL 85%

An Exploration-Analysis-Disambiguation Reasoning Framework for Word Sense Disambiguation with Low-Parameter LLMs

基于低参数LLM的探索-分析-消歧推理框架用于词义消歧

Deshan Sumanathilaka, Nicholas Micallef, Julian Hough

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本研究提出基于低参数LLM的探索-分析-消歧推理框架,通过推理驱动的微调策略,在零样本设置中实现与GPT-4-Turbo相当的词义消歧性能,并展示了对未见词义的稳健泛化能力。

Comments Accepted at LREC 2026, 15 pages, 11 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24210 2026-03-06 cs.CL cs.AI cs.LG 82%

BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models

超越基准:语言模型推理能力的抗污染评估

Gaurav Srivastava, Aafiya Hussain, Zhenyu Bi, Swastik Roy, Priya Pitre, Meng Lu, Morteza Ziyadi, Xuan Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BeyondBench通过算法问题生成提供抗污染的推理评估,揭示语言模型在复杂任务中的推理缺陷。

Comments Accepted to ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00177 2026-03-06 cs.CL cs.AI 81%

PrefDisco: Benchmarking Proactive Personalized Reasoning

PrefDisco:主动个性化推理的基准测试

Shuyue Stella Li, Avinandan Bose, Faeze Brahman, Simon Shaolei Du, Pang Wei Koh, Maryam Fazel, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能联盟)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PrefDisco提出了一种评估方法,通过心理基础的人设将静态基准转化为互动个性化任务,定义PrefAlign作为细粒度的偏好对齐度量,揭示个性化推理需要专门开发而非自然产生。

Comments 65 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05040 2026-03-06 cs.AI 79%

Enhancing Zero-shot Commonsense Reasoning by Integrating Visual Knowledge via Machine Imagination

通过机器想象力整合视觉知识以增强零样本常识推理

Hyuntae Park, Yeachan Kim, SangKeun Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Imagine框架,通过整合视觉知识提升零样本常识推理性能,有效缓解人类报告偏见,增强模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04616 2026-03-06 physics.ed-ph 78%

Chatbot Conversations in Physics Education: Using Artificial Intelligence to Analyze Student Reasoning through Computational Grounded Theory

物理教育中的聊天机器人对话:利用人工智能分析学生推理过程的计算 grounded 理论

Atharva Dange, Ramon E. Lopez

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究利用计算 grounded 理论分析聊天机器人对话数据,揭示学生在物理学习中的常见误解及思维模式,为开发更智能的教育工具提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05218 2026-03-06 cs.AI cs.LG 73%

KARL: Knowledge Agents via Reinforcement Learning

通过强化学习的知识代理:KARL

Jonathan D. Chang, Andrew Drozdov, Shubham Toshniwal, Owen Oertell, Alexander Trott, Jacob Portes, Abhay Gupta, Pallavi Koppol, Ashutosh Baheti, Sean Kulinski, Ivan Zhou, Irene Dea, Krista Opsahl-Ong, Simon Favreau-Lessard, Sean Owen, Jose Javier Gonzalez Ortiz, Arnav Singhvi, Xabi Andrade, Cindy Wang, Kartik Sreenivasan, Sam Havens, Jialu Liu, Peyton DeNiro, Wen Sun, Michael Bendersky, Jonathan Frankle

机构 * Databricks AI Research(Databricks人工智能研究)

专题命中 推理评测 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 KARL通过强化学习训练企业搜索代理,结合多任务学习和定制合成数据,实现高效且高性能的知识代理,在多个复杂任务中表现优异。

Comments 77 pages, 43 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04763 2026-03-06 cs.CV cs.AI cs.LG 73%

Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary

评估GPT-5作为多模态临床推理者的有效性:领域评论

Alexandru Florea, Shansong Wang, Mingzhe Hu, Qiang Li, Zach Eidex, Luke del Balzo, Mojtaba Safari, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院) Department of Biomedical Engineering, Georgia Institute of Technology(生物医学工程系,佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文评估GPT-5在多模态临床推理中的表现,发现其在文本推理和部分视觉问答任务中优于GPT-4o,但在神经放射学和乳腺摄影等专业领域仍显不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03160 2026-03-06 cs.CV cs.AI 70%

SpineBench: A Clinically Salient, Level-Aware Benchmark Powered by the SpineMed-450k Corpus

SpineBench:一种临床显著、层级感知的基准,由SpineMed-450k语料库驱动

Ming Zhao, Wenhui Dong, Yang Zhang, Xiang Zheng, Zhonghao Zhang, Zian Zhou, Yunzhi Guan, Liukun Xu, Wei Peng, Zhaoyang Gong, Zhicheng Zhang, Dachuan Li, Xiaosheng Ma, Yuli Ma, Jianing Ni, Changjiang Jiang, Lixia Tian, Qixin Chen, Kaishun Xia, Pingping Liu, Tongshun Zhang, Zhiqiang Liu, Zhongyan Bi, Chenyang Si, Tiansheng Sun, Caifeng Shan

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 SpineBench通过SpineMed-450k语料库驱动,针对脊柱疾病提供临床显著的层级感知基准,评估模型在多模态数据下的细粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04729 2026-03-06 cs.SE 67%

Behaviour Driven Development Scenario Generation with Large Language Models

基于大语言模型的行为驱动开发场景生成

Amila Rathnayake, Mojtaba Shahin, Golnoush Abaei

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文研究了三种大语言模型在BDD场景生成中的表现,发现Claude 3在人类和模型评估中表现最佳,提示技术和输入质量对生成质量有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04476 2026-03-06 cs.SE cs.PL 67%

iScript: A Domain-Adapted Large Language Model and Benchmark for Physical Design Tcl Script Generation

iScript: 一种领域适应的大型语言模型和基准,用于物理设计 Tcl 脚本生成

Ning Xu, Zhaoyang Zhang, Senlin Shu, Lei Qi, Jiaqi Lv, Wensuo Wang, Tianhao Zhao, Chao Zhang, Zhaoliang Yang, Xiangyu Li, Zhaorui Su, Jingshan Li, Xin Geng

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 iScript 是一种专门用于物理设计 Tcl 脚本生成的领域适应大语言模型,通过多阶段数据合成和两阶段训练策略提升脚本生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04162 2026-03-06 cs.CL cs.AI 62%

Bielik-Q2-Sharp: A Comparative Study of Extreme 2-bit Quantization Methods for a Polish 11B Language Model

Bielik-Q2-Sharp:极端2位量化方法在波兰11B语言模型上的比较研究

Jakub Prejzner

机构 * BitSharp

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Bielik-Q2-Sharp通过比较六种极端2位量化方法,评估其在波兰11B语言模型上的性能,发现QuIP# E8P12在高阶推理保留方面表现更优,同时在规模和效率上具有竞争力。

Comments 17 pages, 13 tables. All models and Hessians available at https://huggingface.co/Jakubrd4

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01209 2026-03-06 cs.AI cs.LG 62%

Agents Learn Their Runtime: Interpreter Persistence as Training-Time Semantics

智能体学习其运行时:解释器持久性作为训练时语义

Victor May, Aaditya Salgarkar, Yishan Wang, Diganta Misra, Huu Nguyen

机构 * Ontocord Carnegie Mellon University(卡内基梅隆大学) MPI-IS Tübingen(图宾根MPI研究所) Tübingen AI Center(图宾根人工智能中心) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨解释器持久性对智能体学习的影响,发现其影响解决方案达成方式而非能否达成,且训练与运行时对齐可提升效率。

Comments Code: https://github.com/mrcabbage972/agents-learn-runtime

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15163 2026-03-06 cs.CL cs.AI 62%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20321 2026-03-06 cs.CL cs.AI eess.AS 62%

Conversational Speech Reveals Structural Robustness Failures in SpeechLLM Backbones

会话语音揭示了SpeechLLM骨干结构鲁棒性失效

Maria Teleki, Sai Janjur, Haoran Liu, Oliver Grabner, Ketan Verma, Thomas Docog, Xiangjue Dong, Lingfeng Shi, Cong Wang, Stephanie Birkelbach, Jason Kim, Yin Zhang, Éva Székely, James Caverlee

机构 * Texas A&M University(德克萨斯大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 会话语音揭示SpeechLLM骨干结构鲁棒性失效,模型在处理不流畅内容时存在结构修复与语义抽象的偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18088 2026-03-06 cs.CL cs.LG 62%

How Quantization Shapes Bias in Large Language Models

量化如何塑造大型语言模型中的偏见

Federico Marcuzzi, Xuefei Ning, Roy Schwartz, Iryna Gurevych

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨量化对大型语言模型偏见的影响,发现量化在减少毒性的同时可能增加刻板印象和不公平性,强调了在应用量化时需平衡效率与伦理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04403 2026-03-06 cs.IR cs.AI cs.CL 62%

FinRetrieval: A Benchmark for Financial Data Retrieval by AI Agents

FinRetrieval:通过AI代理进行金融数据检索的基准测试

Eric Y. Kim, Jie Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 FinRetrieval通过AI代理进行金融数据检索的基准测试,揭示了工具可用性对性能的主导作用及不同代理在推理模式和基础能力上的差异。

Comments 26 pages, 2 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05129 2026-03-06 cs.AI cs.MA 57%

MedCoRAG: Interpretable Hepatology Diagnosis via Hybrid Evidence Retrieval and Multispecialty Consensus

MedCoRAG:通过混合证据检索和多专科共识进行可解释的肝病诊断

Zheng Li, Jiayi Xu, Zhikai Hu, Hechang Chen, Lele Cong, Yunyun Wang, Shuchao Pang

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology(南京理工大学信息科学与工程学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Department of Neurology, China-Japan Union Hospital of Jilin University(吉林大学中日联谊医院神经内科) Department of Anesthesiology, China-Japan Union Hospital of Jilin University(吉林大学中日联谊医院麻醉科) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MedCoRAG通过混合证据检索和多专科共识,提升肝病诊断的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22758 2026-03-06 cs.CL 57%

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

EchoMind: 一种相互关联的多级基准,用于评估共情语音语言模型

Li Zhou, Lutong Yu, You Lyu, Yihang Lin, Zefeng Zhao, Junyi Ao, Yuhao Zhang, Benyou Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EchoMind是一种多级基准,用于评估SLMs在共情对话中的能力,揭示了现有模型在处理高表现性语音线索方面的不足。

Comments Speech Language Models, Spoken Language Understanding, Vocal Cue Perception, Empathetic Dialogue, Benchmark Evaluation; Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20333 2026-03-06 cs.CR cs.AI 57%

GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments?

GhostEI-Bench: 移动代理在动态设备环境中的环境注入鲁棒性研究

Chiyu Chen, Xinhao Song, Yunkai Chai, Yang Yao, Haodong Zhao, Lijun Li, Jie Li, Yan Teng, Gongshen Liu, Yingchun Wang

机构 * Shanghai Jiao Tong University, School of Computer Science(上海交通大学计算机科学学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 GhostEI-Bench通过动态环境注入攻击评估移动代理的鲁棒性,揭示现有模型对欺骗性UI的脆弱性,并提供量化和缓解该威胁的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10689 2026-03-06 cs.AI 57%

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

OmniVideoBench: 向多模态大语言模型的音频-视觉理解评估迈进

Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Wentao Wang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao Ma, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team(南京大学链接团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OmniVideoBench通过大规模基准测试评估多模态大语言模型在音频-视觉理解中的协同推理能力,揭示模型与人类推理间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05075 2026-03-06 cs.CV 50%

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

UniM:一个统一的任意到任意交错多模态基准

Yanlin Li, Minghui Guo, Kaiwen Zhang, Shize Zhang, Yiran Zhao, Haodong Li, Congyue Zhou, Weijie Zheng, Yushen Yan, Shengqiong Wu, Wei Ji, Lei Cui, Furu Wei, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * NUS(新加坡国立大学) SCUT(上海交通大学) NTU(国立科技大学) NJU(南京大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。

Comments 70 pages, 63 figures, 30 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04598 2026-03-06 cs.CV 50%

PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing

PinPoint:评估组合图像检索的综合基准,包含显式负样本、多图像查询和同义词测试

Rohan Mahadev, Joyce Yuan, Patrick Poirson, David Xue, Hao-Yu Wu, Dmitry Kislyuk

专题命中 推理评测 :reasoning(abstract)

AI总结 PinPoint提出一个综合基准测试,通过多正确答案、显式负样本和同义词测试评估组合图像检索的鲁棒性和公平性。

Comments Accepted for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏