arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-17 至 2026-03-17 共收录 216 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 59 篇

2603.13791 2026-03-17 cs.CL 77%

DeceptGuard :A Constitutional Oversight Framework For Detecting Deception in LLM Agents

DeceptGuard :一个宪法监督框架用于检测LLM代理中的欺骗行为

Snehasis Mukhopadhyay

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出DeceptGuard框架,通过比较三种监控机制,结合Coot-aware和激活探针监控,显著提升检测性能,并提出HYBRID-CONSTITUTIONAL集成方法,实现更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17741 2026-03-17 cs.CV 71%

Reasoning to Attend: Try to Understand How <SEG> Token Works

推理以关注:尝试理解<SEG>标记的作用

Rui Qian, Xin Yin, Dejing Dou

专题命中 推理评测 :reasoning(title)

AI总结 本文研究了<SEG>标记在多模态模型中的作用,通过可视化相似性图揭示其在图像-文本对中的语义相似性贡献,并提出READ方法提升模型的推理能力。

Comments This work has been accepted to CVPR 2025, please refer to https://github.com/rui-qian/READ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15039 2026-03-17 cs.CV 67%

GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents

GUI-CEval: 一种用于移动GUI代理的分层和全面的中文基准

Yang Li, Yuchen Liu, Haoyu Lu, Zhiqiang Xia, Hongzhen Wang, Kaiyang Han, Changpeng Yang, Jinyang Wu, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出GUI-CEval,首个针对中文移动GUI代理的全面基准,涵盖201款主流应用,通过分层结构评估感知、规划、反思、执行和评估五方面能力,验证模型在真实交互中的表现。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08448 2026-03-17 cs.HC cs.AI cs.CL cs.LG 67%

A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic

前瞻性临床可行性研究:一种对话式诊断AI在门诊初级保健诊所中的应用

Peter Brodeur, Jacob M. Koshy, Anil Palepu, Khaled Saab, Ava Homiar, Roma Ruparel, Charles Wu, Ryutaro Tanno, Joseph Xu, Amy Wang, David Stutz, Wei-Hung Weng, Hannah M. Ferrera, David Barrett, Lindsey Crowley, Jihyeon Lee, Spencer E. Rittner, Ellery Wulczyn, Selena K. Zhang, Elahe Vedadi, Christine G. Kohn, Kavita Kulkarni, Vinay Kadiyala, Sara Mahdavi, Wendy Du, Jessica M. Williams, David Feinbloom, Renee Wong, Tao Tu, Petar Sirkovic, Alessio Orlandi, Christopher Semturs, Yun Liu, Juraj Gottweis, Dale R. Webster, Joëlle Barral, Katherine Chou, Pushmeet Kohli, Avinatan Hassidim, Yossi Matias, James Manyika, Rob Fields, Jonathan X. Li, Marc L. Cohen, Vivek Natarajan, Mike Schaekermann, Alan Karthikesalingam, Adam Rodman

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了基于大语言模型的对话式AI在真实临床环境中的可行性,评估了其安全性、质量和临床推理能力,并展示了AI在初级保健中的初步应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14944 2026-03-17 cs.CV 67%

PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs

PuzzleCraft: 为基于谜题的RLVR在VLMs中的探索感知课程学习

Ahmadreza Jeddi, Hakki Can Karaimer, Hue Nguyen, Zhongling Wang, Ke Zhao, Javad Rajabi, Ran Zhang, Raghav Goyal, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk

机构 * AI Center-Toronto(多伦多AI中心) Samsung Electronics(三星电子) University of Toronto(多伦多大学) Vector Institute(向量研究所) York University(约克大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 PuzzleCraft通过轻量级谜题环境和探索信号优化课程学习,提升VLMs的视觉RLVR能力,增强推理一致性与下游表现。

Comments Project page: https://puzzlecraftgrpo.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15615 2026-03-17 cs.CL cs.AI 62%

Mechanistic Origin of Moral Indifference in Language Models

语言模型中道德冷漠的机制起源

Lingyu Li, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示语言模型存在内在道德冷漠,通过构建道德向量并重构其拓扑关系,提升道德推理能力,实现75%的对抗性基准测试胜率。

Comments 24 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14525 2026-03-17 cs.CL cs.AI 62%

MALicious INTent Dataset and Inoculating LLMs for Enhanced Disinformation Detection

恶意意图数据集与增强虚假信息检测的LLM接种

Arkadiusz Modzelewski, Witold Sosnowski, Eleni Papadopulos, Elisa Sartori, Tiziano Labruna, Giovanni Da San Martino, Adam Wierzbicki

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MALINT数据集,通过专家事实核查员标注,用于评估12种语言模型在意图分类任务中的表现,并提出基于意图的接种方法,通过整合意图分析来缓解虚假信息的说服力。

Comments Paper accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13173 2026-03-17 cs.AI cs.CL 62%

Semantic Invariance in Agentic AI

代理AI中的语义不变性

I. de Zarzà, J. de Curtò, Jordi Cabot, Pietro Manzoni, Carlos T. Calafate

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种元测试框架,评估大语言模型代理在语义等效输入变化下的推理稳定性,发现模型规模与鲁棒性无正相关,较小的Qwen3-30B-A3B表现出最高稳定性。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11935 2026-03-17 cs.LG cs.AI 62%

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench: LLMs能否为移动设备编写高效的内核?

Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。

Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08309 2026-03-17 cs.CV cs.AI cs.LG 62%

Concept-Guided Fine-Tuning: Steering ViTs away from Spurious Correlations to Improve Robustness

基于概念引导的微调:引导ViT远离虚假相关性以提高鲁棒性

Yehonatan Elisha, Oren Barkan, Noam Koenigstein

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种引导模型推理至概念层面语义的微调框架,通过优化内部相关性映射对齐空间 grounded 的概念掩码,提升模型在分布偏移下的鲁棒性。

Comments CVPR 2026 ; Project page: https://yonisgit.github.io/concept-ft/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04421 2026-03-17 cs.CL cs.AI cs.MA 62%

Do Mixed-Vendor Multi-Agent LLMs Improve Clinical Diagnosis?

多供应商多智能体大语言模型是否能改善临床诊断?

Grace Chang Yuan, Xiaoman Zhang, Sung Eun Kim, Pranav Rajpurkar

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了多供应商多智能体系统在临床诊断中的表现,发现混合供应商配置在召回率和准确性上优于单一供应商配置,揭示了供应商多样性对诊断系统鲁棒性的重要性。

Comments Accepted as Oral at the EACL 2026 Workshop on Healthcare and Language Learning (HeaLing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00823 2026-03-17 cs.CL cs.AI 62%

A Comprehensive Evaluation of LLM Unlearning Robustness under Multi-Turn Interaction

大语言模型多轮交互下LLM去学习鲁棒性综合评估

Ruihao Pan, Suhang Wang

专题命中 推理评测 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文研究多轮交互环境下LLM去学习的稳定性,发现静态评估可能高估实际效果,强调需确保交互场景下的稳定遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13292 2026-03-17 cs.LG cs.AI 62%

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15121 2026-03-17 cs.LG stat.ML 57%

Establishing Construct Validity in LLM Capability Benchmarks Requires Nomological Networks

在LLM能力基准中建立构念效度需要规范网络

Timo Freiesleben

机构 * Munich Center for Mathematical Philosophy(慕尼黑数学哲学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文探讨了通过规范网络框架建立LLM能力基准的效度问题,指出该框架比因果和推断框架更适合当前研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14911 2026-03-17 cs.CR cs.CL 57%

Fine-tuning RoBERTa for CVE-to-CWE Classification: A 125M Parameter Model Competitive with LLMs

基于RoBERTa的CVE到CWE分类微调:一个125M参数模型与LLMs竞争

Nikita Mosievskiy

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个125M参数的RoBERTa基分类器,通过AI优化的CWE标签构建大规模训练数据集,在27780个样本上达到87.4%的Top-1准确率和60.7%的Macro F1,优于TF-IDF基线。

Comments 9 pages, 2 figures, 6 tables. Dataset: https://huggingface.co/datasets/xamxte/cve-to-cwe Model: https://huggingface.co/xamxte/cwe-classifier-roberta-base

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22680 2026-03-17 cs.AI 57%

Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions

迈向个性化大语言模型驱动的代理:基础、评估与未来方向

Yue Xu, Qian Chen, Zizhan Ma, Dongrui Liu, Wenxuan Wang, Xiting Wang, Li Xiong, Wenjie Wang

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文探讨个性化LLM代理的基础、评估及未来方向,分析了四个核心能力:用户画像建模、记忆、规划与行动执行,并总结了评估指标和应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02046 2026-03-17 cs.CV cs.AI 57%

Agentic Retoucher for Text-To-Image Generation

面向文本到图像生成的代理修复器

Shaocheng Shen, Jianfeng Liang, Chunlei Cai, Cong Geng, Huiyu Duan, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Agentic Retoucher框架,通过感知-推理-行动循环改进文本到图像生成的质量,引入GenBlemish-27K数据集进行评估,提升图像真实感与局部修正可靠性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01716 2026-03-17 cs.DB cs.LG 57%

SemBench: A Benchmark for Semantic Query Processing Engines

SemBench:语义查询处理引擎的基准测试

Jiale Lao, Andreas Zimmerer, Olga Ovcharenko, Tianji Cong, Matthew Russo, Gerardo Vitagliano, Michael Cochez, Fatma Özcan, Gautam Gupta, Thibaud Hottelier, H. V. Jagadish, Kris Kissel, Sebastian Schelter, Andreas Kipf, Immanuel Trummer

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SemBench是一个针对语义查询处理引擎的基准测试,涵盖多场景、多模态和多操作符,评估不同系统在处理多模态数据时的性能。

Comments Accepted to VLDB 2026; Revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12720 2026-03-17 cs.CL cs.CV cs.MM cs.SD 57%

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

Omni-Captioner:多模态信息细粒度感知的数据管道、模型与基准

Ziyang Ma, Ruiyang Xu, Zhenghao Xing, Yunfei Chu, Yuxuan Wang, Jinzheng He, Jin Xu, Pheng-Ann Heng, Kai Yu, Junyang Lin, Eng Siong Chng, Xie Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Omni-Captioner,通过数据管道、模型和基准系统,系统研究多模态细粒度感知,提出Omni-Detective生成高质量数据,实现音频和视频细粒度描述的最优性能。

Comments Accepted by ICLR2026. Open Source at https://github.com/ddlBoJack/Omni-Captioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13201 2026-03-17 q-bio.GN cs.AI cs.MA 57%

Benchmarking LLM-based agents for single-cell omics analysis

对基于大语言模型的代理在单细胞组学分析中的性能评估

Yang Liu, Lu Zhou, Xiawei Du, Ruikun He, Xuguang Zhang, Rongbo Shen, Yixue Li

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出一个评估系统,用于严格评估代理在单细胞组学分析中的能力,发现Grok3-beta在测试框架中表现最佳,多代理框架通过角色分工提升协作与执行效率。

Comments please see clear figures in this version. 6 main figures; 13 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16643 2026-03-17 cs.CV cs.AI 57%

From Evaluation to Defense: Advancing Safety in Video Large Language Models

从评估到防御:推进视频大语言模型的安全性

Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VideoSafety-R1框架,通过创新方法提升视频大语言模型的安全性,实验显示其在多个安全数据集上取得显著提升。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14707 2026-03-17 cs.CV cs.CL 57%

Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents

视觉混淆代理:在计算机使用代理中利用和防御感知失败

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种新的安全防护机制,通过双重通道对比分类来检测计算机使用代理中的视觉感知错误,以提高系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14646 2026-03-17 cs.AI 57%

Dynamic Theory of Mind as a Temporal Memory Problem: Evidence from Large Language Models

动态心智理论作为时间记忆问题:来自大语言模型的证据

Thuy Ngoc Nguyen, Duy Nhat Phan, Cleotilde Gonzalez

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了动态心智理论作为时间延伸表征记忆问题,发现大语言模型在跟踪信念轨迹方面存在挑战,揭示了记忆与干扰机制在社会推理中的影响。

Comments 8 pages, 4 figures, 3 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14597 2026-03-17 q-bio.NC cs.AI 57%

D-MEM: Dopamine-Gated Agentic Memory via Reward Prediction Error Routing

D-MEM:通过奖励预测误差路由的多巴胺门控代理记忆

Yuru Song, Qi Xin

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 D-MEM通过奖励预测误差路由实现多巴胺门控代理记忆,减少token消耗并提升多跳推理和对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14593 2026-03-17 cs.CL 57%

Parameter-Efficient Quality Estimation via Frozen Recursive Models

通过冻结递归模型实现参数高效质量估计

Umar Abubacar, Roman Bauer, Diptesh Kanojia

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了递归机制在低资源语言质量估计中的有效性,发现冻结预训练嵌入能显著提升性能,减少训练参数37倍。

Comments Accepted to LowResLM Workshop @ EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14456 2026-03-17 cs.CL cs.SD 57%

PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark

PARSA-Bench:一个全面的波斯语音-语言模型基准

Mohammad Javad Ranjbar Kalahroodi, Mohammad Amini, Parmis Bathayan, Heshaam Faili, Azadeh Shakery

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PARSA-Bench是首个针对波斯语言和文化评估大音频-语言模型的基准,包含16个任务和8000多个样本,涵盖语音理解、语篇分析和文化语音理解,揭示模型在文化相关任务中的局限性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14257 2026-03-17 cs.CL 57%

Automatic Inter-document Multi-hop Scientific QA Generation

自动跨文档多跳科学问答生成

Seungmin Lee, Dongha Kim, Yuni Jeon, Junyoung Koh, Min Song

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AIM-SciQA框架,通过大语言模型生成多文档多跳科学问答数据集,结合语义对齐和引用信息提升事实一致性,构建IM-SciQA数据集并验证其在检索增强推理中的有效性。

Comments 14 pages, 5 figures, 8 tables. Accepted to the 2026 International Conference on Language Resources and Evaluation (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14171 2026-03-17 cs.LG 57%

TACTIC for Navigating the Unknown: Tabular Anomaly deteCTion via In-Context inference

TACTIC用于未知领域的导航:通过上下文推理进行表格异常检测

Patryk Marszałek, Tomasz Kuśmierczyk, Marek Śmieja

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出TACTIC,一种基于上下文推理的表格异常检测方法,通过预训练异常中心合成先验,实现快速且数据依赖的异常判断,优于传统得分方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13884 2026-03-17 cs.CL 57%

Too Open for Opinion? Embracing Open-Endedness in Large Language Models for Social Simulation

观点过于开放?在大型语言模型中拥抱开放性以进行社会模拟

Bolei Ma, Yong Cao, Indira Sen, Anna-Carolina Haensch, Frauke Kreuter, Barbara Plank, Daniel Hershcovich

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了在大型语言模型中采用开放性文本进行社会模拟的重要性,强调其在提升测量、探索意外观点和减少偏差方面的价值。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08009 2026-03-17 cs.CY cs.AI 57%

The Law-Following AI Framework: Legal Foundations and Technical Constraints. Legal Analogues for AI Actorship and technical feasibility of Law Alignment

遵循法律的AI框架:法律基础与技术限制。AI行为者的法律类比和技术可行性

Katalina Hernandez Delgado

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了O'Keefe等人提出的

Comments Presented at SMU Computational Legal Studies Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏