arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-17 至 2026-03-17 共收录 216 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 59 篇

2603.13686 2026-03-17 cs.SD cs.AI 57%

$τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

$τ$-Voice:在真实领域上评估全双工语音代理的基准测试

Soham Ray, Keshav Dhandhania, Victor Barres, Karthik Narasimhan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出$τ$-voice基准测试,评估语音代理在真实复杂任务中的表现,发现语音代理在清洁条件和嘈杂环境下任务完成率仅为31-51%和26-38%,远低于文本能力,表明代理行为是失败的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13370 2026-03-17 cs.CV cs.LG 57%

GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning

GraphVLM:多模态图学习的视觉语言模型基准测试

Jiajin Liu, Dongzhe Fan, Chuanhao Ji, Daochen Zha, Qiaoyu Tan

机构 * NYU Shanghai(纽约大学上海分校) New York University(纽约大学) Rice University(休斯顿大学) East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 57%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07427 2026-03-17 cs.AI cs.CR 57%

AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation

AutoControl Arena:为前沿AI风险评估合成可执行测试环境

Changyi Li, Pengfei Lu, Xudong Pan, Fazl Barez, Min Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoControl Arena框架,通过逻辑-叙述解耦原理,结合可执行代码与LLM生成动态,有效缓解逻辑幻觉并提升灵活性,验证了在压力下AI风险显著增加,揭示了不同模型在安全性和对齐性上的差异。

Comments Project page: https://cosmosyi.github.io/AutoControl-Arena/; Code: https://github.com/CosmosYi/AutoControl-Arena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15557 2026-03-17 cs.CV 50%

Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models

Lie的解剖:一种多阶段诊断框架,用于追踪视觉-语言模型中的幻觉

Lexiang Xiong, Qi Li, Jingwen Ye, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种多阶段诊断框架,通过动态认知轨迹分析视觉-语言模型中的幻觉问题,结合几何信息双重视角,实现高效且鲁棒的幻觉检测,提升模型透明度和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15467 2026-03-17 cs.CV 50%

Evaluating Time Awareness and Cross-modal Active Perception of Large Models via 4D Escape Room Task

通过4D逃脱房间任务评估大模型的时间意识和跨模态主动感知

Yurui Dong, Ziyue Wang, Shuyun Lu, Dairu Liu, Xuechen Liu, Fuwen Luo, Peng Li, Yang Liu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出4D逃脱房间任务,用于评估大模型在时间变化和不可逆条件下跨模态感知和时间意识的能力,发现模型在多模态整合中存在模态偏差和能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15237 2026-03-17 cs.CV 50%

Multi-turn Physics-informed Vision-language Model for Physics-grounded Anomaly Detection

多轮物理引导的视觉-语言模型用于物理基础的异常检测

Yao Gu, Xiaohao Xu, Yingna Wu

机构 * Shanghaitech University(上海科技大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种多轮物理引导的视觉-语言模型,通过编码物体属性和动态约束提升物理基础异常检测性能,实验显示其在视频级检测中达到96.7%的AUROC,优于现有最佳方法。

Comments Accepted by IEEE ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14676 2026-03-17 stat.ME stat.ML 50%

Scalable Text-Embedding-informed Cognitive Diagnosis of Large Language Models

可扩展的基于文本嵌入的认知诊断用于大语言模型

Jia Liu, Zhiyu Xu, Yuqi Gu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出将心理测量学中的认知诊断模型(CDM)适应于大语言模型评估,通过多维离散能力配置文件实现细粒度诊断,并利用文本嵌入信息构建先验,提高高维估计的稳定性。

Comments 34 pages of main text, 12 pages of appendix, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14426 2026-03-17 cs.CV cs.IR cs.MM 50%

GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos

GenState-AI:面向AI生成视频的基于状态的文本到视频检索数据集

Minghan Li, Tongna Chen, Tianrui Lv, Yishuai Zhang, Suchao An, Guodong Zhou

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出GenState-AI数据集,通过可控状态转换和显式端状态标注,解决文本到视频检索中时间推理和端状态定位不足的问题,评估两种基线模型并分析时间与语义混淆源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01804 2026-03-17 cs.CV 50%

V-CORE: Temporally Consistent Video Understanding for Video-LLM

V-CORE:面向视频大语言模型的时序一致视频理解

Zhengjian Kang, Qi Chen, Rui Liu, Kangtong Mo, Xingyu Zhang, Xiaoyu Deng, Ye Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 V-CORE通过引入显式时序约束提升视频理解性能,采用可学习空间聚合和因果感知时间投影器,有效解决视频时序一致性问题,在多个基准测试中取得显著成果。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12084 2026-03-17 cs.IR 50%

FloodSQL-Bench: A Retrieval-Augmented Benchmark for Geospatially-Grounded Text-to-SQL

FloodSQL-Bench: 一个用于洪水管理领域的检索增强基准

Hanzhou Liu, Kai Yin, Zhitong Chen, Chenyue Liu, Ali Mostafavi

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出FloodSQL-Bench,一个结合异构数据集的地理空间基准,用于评估大语言模型在多表和地理空间推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09924 2026-03-17 cs.CV 50%

Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning

面向统一模型的基于推理的视频编辑:带有自我反思学习

Xinyu Liu, Hangjie Yuan, Yujie Wei, Jiazheng Xing, Yujin Han, Jiahao Pan, Yanbiao Ma, Chi-Min Chan, Kang Zhao, Shiwei Zhang, Wenhan Luo, Yike Guo

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13412 2026-03-17 cs.CV 50%

WAT: Online Video Understanding Needs Watching Before Thinking

WAT:在线视频理解需要先观看再思考

Zifan Han, Hongbo Sun, Jinglin Xu, Canhui Tang, Yulong Lei, Xuchong Zhang, Hongbin Sun, Zhongjiang He, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) University of Science and Technology Beijing(北京科技大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24267 2026-03-17 cs.CV 50%

FakeScope: Large Multimodal Expert Model for Transparent AI-Generated Image Forensics

FakeScope:大型多模态专家模型用于透明的AI生成图像取证

Yixuan Li, Yu Tian, Yipo Huang, Wei Lu, Shiqi Wang, Weisi Lin, Anderson Rocha

机构 * College of Computing, City University of Hong Kong(城市大学 computing 学院) School of Data Science and Artificial Intelligence, Chang’an University(长安大学数据科学与人工智能学院) School of Computer Science and Engineering, Ministry of Education Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-Sen University(中山大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学 computing 与数据科学学院) Artificial Intelligence Lab. (Recod.ai) at the University of Campinas(坎皮纳斯大学人工智能实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 FakeScope通过多模态专家模型提升AI生成图像的检测能力,提供可解释的取证分析,实现高精度识别与深入解释,具备零样本检测和跨生成器泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 22 篇

2603.15547 2026-03-17 cs.CL cs.AI cs.HC 81%

Can LLMs Model Incorrect Student Reasoning? A Case Study on Distractor Generation

大语言模型能否建模错误学生推理?一种关于干扰项生成的案例研究

Yanick Zengaffinen, Andreas Opedal, Donya Rooein, Kv Aditya Srivatsa, Shashank Sonkar, Mrinmaya Sachan

机构 * ETH Zürich, Switzerland(苏黎世联邦理工学院,瑞士) Bocconi University, Italy(博科尼大学,意大利) University of Central Florida, USA(中央佛罗里达大学,美国)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在生成多项选择题干扰项时对错误推理的建模能力,发现模型通常先正确解决问题,再模拟可能的误解,最后选择干扰项,且正确解的提示能提升干扰项质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11248 2026-03-17 cs.LG cs.CL 81%

Reasoning-Grounded Natural Language Explanations for Language Models

基于推理的自然语言解释方法用于语言模型

Vojtech Cahlik, Rodrigo Alves, Pavel Kordik

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种通过推理过程生成可信自然语言解释的方法,通过将推理过程转化为token序列并解码为自然语言,提升解释的准确性与答案质量。

Comments (v2) Added acknowledgements section

Journal ref In: Guidotti, R., Schmid, U., Longo, L. (eds) Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2578. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13725 2026-03-17 cs.CL 79%

Can We Trust LLMs on Memristors? Diving into Reasoning Ability under Non-Ideality

我们能相信基于忆阻器的LLMs吗?在非理想条件下探究推理能力

Taiqiang Wu, Yuxin Cheng, Chenchen Ding, Runming Yang, Xincheng Feng, Wenyong Zhou, Zhengwu Liu, Ngai Wong

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨了基于忆阻器的类脑计算架构对LLM推理能力的影响,发现非理想性导致推理能力下降,提出三种无训练策略并总结提升鲁棒性的指导原则。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13765 2026-03-17 cs.CL cs.AI 79%

Knowledge Distillation for Large Language Models

为大型语言模型进行知识蒸馏

Alejandro Paredes La Torre, Barbara Flores, Diego Rodriguez

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种高效的压缩框架,结合引导的思维链强化学习,通过知识蒸馏和链式思维提示提升模型效率,实现更小规模的模型部署。

Comments Code and data are available at: https://github.com/AlejandroParedesLT/knowledge_distillLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15008 2026-03-17 cs.CV 78%

Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning

线索至关重要:利用潜在视觉线索增强视频推理

Kaixin zhang, Xiaohe Li, Jiahao Li, Haohua Wu, Xinyu Zhao, Zide Fan, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06097 2026-03-17 cs.CV 78%

VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning

VideoChat-A1: 通过镜头链推理实现长视频的思考

Zikang Wang, Boyu Chen, Zhengrong Yue, Yi Wang, Yu Qiao, Limin Wang, Yali Wang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15459 2026-03-17 cs.IR 71%

Financial Transaction Retrieval and Contextual Evidence for Knowledge-Grounded Reasoning

金融交易检索与上下文证据用于知识引导推理

Artem Sakhno, Daniil Tomilov, Yuliana Shakhvalieva, Inessa Fedorova, Daria Ruzanova, Omar Zoloev, Andrey Savchenko, Maksim Makarenko

专题命中 其他推理 :reasoning(title)

AI总结 本文提出FinTRACE框架,通过交易检索生成可重用的特征表示,结合规则检测器和行为知识库,提升低监督交易分析性能,并通过指令微调LLM实现交易分析的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25827 2026-03-17 cs.CL cs.AI 62%

Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling

脱离奖励与课程数据调度的过度思考减少

Shuyang Jiang, Yusheng Liao, Ya Zhang, Yanfeng Wang, Yu Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DECS框架,通过解耦的token级奖励机制和新的课程批量调度策略,有效减少推理token数量,同时保持或提升性能,解决过度思考问题。

Comments 30 pages; Accepted as an oral presentation at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13985 2026-03-17 cs.AI cs.CL 62%

Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models

监督微调与强化学习:大型语言模型后训练方法的探讨

Haitao Jiang, Wenbo Zhang, Jiarui Yao, Hengrui Cai, Sheng Wang, Rui Song

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了监督微调与强化学习在大型语言模型后训练中的联系与应用,分析了两者的方法、数据需求及整合框架,总结了混合训练趋势及未来研究方向。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09944 2026-03-17 cs.AI cs.CV cs.LG eess.IV 62%

Echo-CoPilot: A Multiple-Perspective Agentic Framework for Reliable Echocardiography Interpretation

Echo-CoPilot:一种多视角代理框架,用于可靠的超声心动图解读

Moein Heidari, Ali Mehrabian, Mohammad Amin Roohi, Wenjin Chen, David J. Foran, Jasmine Grewal, Ilker Hacihaliloglu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Echo-CoPilot框架,结合多视角工作流程与知识图谱引导的测量选择,通过三个独立的ReAct式代理处理超声心动图任务,提升解读准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13434 2026-03-17 cs.LG cs.AI 62%

Modality-free Graph In-context Alignment

无模态图上下文对齐

Wei Zhuo, Siqiang Luo

机构 * Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MF-GIA框架,通过梯度指纹捕捉领域特征,实现跨异构域的无模态few-shot预测与泛化。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13378 2026-03-17 cs.AI cs.CL cs.CY 62%

Do Large Language Models Get Caught in Hofstadter-Mobius Loops?

大型语言模型是否会陷入霍夫斯塔德-莫比乌斯循环?

Jaroslaw Hryszko

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(数学与计算机科学学院,雅盖隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨现代RLHF训练语言模型中存在霍夫斯塔德-莫比乌斯循环的矛盾,通过实验发现调整系统提示的框架可显著减少压迫性输出。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09823 2026-03-17 cs.SD cs.CL eess.AS 57%

Covo-Audio Technical Report

Covo-Audio技术报告

Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zikang Huang, Jiajun Xu, Jiliang Hu, Xiang He, Zeyu Xie, Jiawen Kang, Youjun Chen, Meng Yu, Dong Yu, Rilin Chen, Linlin Di, Shulin Feng, Na Hu, Yang Liu, Bang Wang, Shan Yang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Covo-Audio是一款7B参数端到端LALM,通过大规模预训练和微调在多种任务中表现优异,包括语音文本建模、对话、语音理解等,并展示了其在实际对话助理中的应用潜力。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04658 2026-03-17 cs.SD cs.AI 57%

LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence

LAMB:基于LLM的音频描述通过Cauchy-Schwarz散度弥合模态间隙

Hyeongkeun Lee, Jongmin Choi, KiHyun Nam, Joon Son Chung

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LAMB框架,通过Cauchy-Schwarz散度弥合音频与文本嵌入空间的模态差距,设计Two-Stream Adapter和Token Guide提升LLM解码器推理能力,在AudioCaps上取得最佳性能。

Comments 5 pages, 2 figures; Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14553 2026-03-17 hep-ph cs.AI cs.MA hep-ex 57%

An End-to-end Architecture for Collider Physics and Beyond

通向对撞机物理与更广泛领域端到端架构的架构

Shi Qiu, Zeyu Cai, Jiashen Wei, Zeyu Li, Yixuan Yin, Qing-Hong Cao, Chang Liu, Ming-xing Luo, Xing-Bo Yuan, Hua Xing Zhu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出首个基于语言的智能体系统,实现端到端对撞机现象学任务,通过解耦、领域无关的架构实现自主高能物理现象学研究,展示了其在粒子物理、宇宙学等领域的应用潜力。

Comments 15 pages, 3 figure, project website: AGI/ColliderAgent" target="_blank" rel="noopener">https://github.com/HET-AGI/ColliderAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14057 2026-03-17 cs.AI 57%

Demand-Driven Context: A Methodology for Building Enterprise Knowledge Bases Through Agent Failure

需求驱动的上下文:通过智能体失败构建企业知识库的方法论

Raj Navakoti, Saideep Navakoti

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出需求驱动上下文方法,通过智能体失败信号来获取企业领域知识,解决传统知识工程方法的局限性,展示在零售订单履行中的应用案例。

Comments 18 pages, 5 figures, 1 algorithm. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏