arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-01 至 2026-04-01 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2407.03004 2026-04-01 cs.CL cs.AI 84%

SemioLLM: Evaluating Large Language Models for Diagnostic Reasoning from Unstructured Clinical Narratives in Epilepsy

SemioLLM:评估用于癫痫诊断推理的大型语言模型在无结构临床叙述中的表现

Meghal Dani, Muthu Jeyanthi Prakash, Filip Rosa, Zeynep Akata, Stefanie Liebe

机构 * University of Tübingen(蒂宾根大学) Technical University of Munich(慕尼黑工业大学) University Clinic Tübingen(蒂宾根大学医院) Hertie Institute for Clinical Brain Research(赫蒂临床脑研究所) Excellence Cluster Machine Learning, Tübingen University(蒂宾根大学机器学习卓越集群) Hertie Institute for AI in Brain Health (Hertie AI)(赫蒂人工智能脑健康研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了八个大型语言模型在癫痫诊断任务中的表现,通过过滤和标准化 seizure 描述短语,将其映射到七个可能的癫痫发作起始区。结果显示,经过提示工程后,多数模型表现接近临床水平,但临床情境下的表现受语言上下文影响显著,需改进模型的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29791 2026-04-01 cs.AI cs.CL cs.LG 82%

Reasoning-Driven Synthetic Data Generation and Evaluation

基于推理的合成数据生成与评估

Tim R. Davidson, Benoit Seguin, Enrico Bacis, Cesar Ilharco, Hamza Harkous

机构 * EPFL(瑞士联邦理工学院洛桑) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Simula框架,通过无种子、代理化方法生成大规模合成数据,提供可解释且可控的生成流程,验证了其在多种数据集上的有效性,为合成数据机制设计和大规模生成评估提供指导。

Comments Accepted to TMLR 2026, J2C Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28021 2026-04-01 cs.SD 82%

Audio Language Model for Deepfake Detection Grounded in Acoustic Chain-of-Thought

基于声学推理的深度伪造检测音频语言模型

Runkun Chen, Yixiong Fang, Pengyu Chang, Yuante Li, Massa Baali, Bhiksha Raj

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract)

AI总结 本文提出CoLMbo-DF,通过整合深度伪造检测与显式的声学推理,利用结构化文本表示提升检测准确性,实验表明其在解释性深度伪造语音检测中取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10788 2026-04-01 cs.AI cs.CL 81%

From Efficiency to Adaptivity: A Deeper Look at Adaptive Reasoning in Large Language Models

从效率到适应性:深入探讨大语言模型中的适应性推理

Chao Wu, Baoheng Li, Mingchen Gao, Yu Tian, Zhenyi Wang

机构 * University at Buffalo(布法罗大学) University of Central Florida(中佛罗里达大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大语言模型中适应性推理的核心方法与贡献,提出适应性推理的控制增强策略优化问题,并构建系统分类法以比较不同策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16635 2026-04-01 cs.MA cs.AI cs.CL cs.HC cs.IR 81%

MA-SAPO: Multi-Agent Reasoning for Score-Aware Prompt Optimization

MA-SAPO:多智能体推理用于评分感知提示优化

Wonduk Seo, Juhyeon Lee, Junseo Koh, Wonseok Choi, Hyunjin An, Jian Park, Seunghyun lee, Haihua Chen, Yi Bu

机构 * Enhans Peking University(北京大学) Fudan University(复旦大学) University of North Texas(北德克萨斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MA-SAPO框架,通过多智能体推理将评估结果与针对性改进联系起来,提升提示优化的可解释性和可控性,实验表明其在多个评估指标上优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29608 2026-04-01 cs.CL 79%

Learning Diagnostic Reasoning for Decision Support in Toxicology

学习毒理学诊断推理以支持决策

Nico Oberländer, David Bani-Harouni, Tobias Zellner, Nassir Navab, Florian Eyer, Matthias Keicher

机构 * Computer Aided Medical Procedures, Technical University of Munich, Germany(德国慕尼黑工业大学计算机辅助医疗程序研究所) Munich Center for Machine Learning (MCML), Germany(德国慕尼黑机器学习中心(MCML)) Department of Clinical Toxicology and Poison Control Center Munich, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院临床毒理学与毒物控制中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出DeToxR,通过强化学习处理毒理学中的多标签预测,结合未结构化和结构化数据提升诊断准确性,优于基线模型和专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28924 2026-04-01 cs.CL 79%

CrossTrace: A Cross-Domain Dataset of Grounded Scientific Reasoning Traces for Hypothesis Generation

CrossTrace:一种跨领域 grounded 科学推理轨迹数据集用于假设生成

Andrew Bouras, OMS-II Research Fellow

机构 * Nova Southeastern University Dr. Kiran C. Patel College of Osteopathic Medicine(诺瓦东南大学基兰·C·帕特尔骨科医学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 CrossTrace 是一个跨领域 grounded 科学推理轨迹数据集,包含 1389 个轨迹,涵盖生物医学研究、AI/ML 和跨领域工作。通过 QLoRA 微调 Qwen2.5-7B-Instruct,显著提升 IAScore 和结构合规性,验证跨领域推理轨迹的有效性。

Comments 14 pages, 1 figure, 8 tables. Dataset and code available at https://github.com/andrewbouras/crosstrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30028 2026-04-01 cs.CY 78%

Can Commercial LLMs Be Parliamentary Political Companions? Comparing LLM Reasoning Against Romanian Legislative Expuneri de Motive

商业大语言模型能成为议会政治伙伴吗?比较大语言模型推理与罗马尼亚立法解释

Iulian Lucău, Adelin-George Voicu

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文通过比较六种大语言模型在罗马尼亚议会法案解释上的表现,探讨其作为政治顾问工具的可靠性,发现前沿模型在语义接近度上表现优异,但所有模型在任务依赖性上均存在编造问题。

Comments 12 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21507 2026-04-01 cs.CV 78%

SVBench: Evaluation of Video Generation Models on Social Reasoning

SVBench:视频生成模型在社会推理中的评估

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

机构 * Tsinghua University(清华大学) Shanda AI Research Tokyo(盛大人工智能研究院东京) Shanghai AI Lab(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05513 2026-04-01 cs.CV 78%

Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning

Know-Show:在时空 grounded 推理上评估视频语言模型的基准测试

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Know-Show基准测试评估视频语言模型在时空 grounded 推理能力,通过五个互补场景揭示现有模型与人类推理的差距,并提出GRAM方法提升模型的细粒度 grounded 推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29878 2026-04-01 cs.IR cs.AI cs.DC 70%

Performance Evaluation of LLMs in Automated RDF Knowledge Graph Generation

对LLMs在自动RDF知识图谱生成中的性能评估

Ioana Ramona Martin, Tudor Cioara, Ionut Anghel, Gabriel Arcas

机构 * Distributed Systems Research Laboratory, Computer Science Department, Technical University of Cluj-Napoca(克卢日-纳波卡技术大学计算机科学系分布式系统研究实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文评估了多种LLM架构和提示策略在自动RDF提取中的性能,通过控制框架和两个处理半结构化日志数据的管道,分析了Few-Shot学习在生成RDF三元组中的有效性,并揭示了不同LLM架构的局限性。

Comments submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29281 2026-04-01 cs.CV cs.AI cs.RO 70%

PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models

PRISM:一个多视角多能力零售视频数据集用于具身视觉-语言模型

Amirreza Rouhi, Parikshit Sakurikar, Satya Sai Reddy, Narsimha Menga, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 PRISM是首个针对真实世界零售环境的多视角多能力视频数据集,通过领域特定的SFT训练提升具身视觉-语言模型的感知能力与空间理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29893 2026-04-01 cs.HC cs.AI cs.CL cs.MA 62%

Perfecting Human-AI Interaction at Clinical Scale. Turning Production Signals into Safer, More Human Conversations

在临床规模上完善人机交互。将生产信号转化为更安全、更人性化的对话

Subhabrata Mukherjee, Markel Sanz Ausin, Kriti Aggarwal, Debajyoti Datta, Shanil Puri, Woojeong Jin, Tanmay Laud, Neha Manjunath, Jiayuan Ding, Bibek Paudel, Jan Schellenberger, Zepeng Frazier Huo, Walter Shen, Nima Shirazian, Nate Potter, Sathvik Perkari, Darya Filippova, Anton Morozov, Austin Mease, Vivek Muppalla, Ghada Shakir, Alex Miller, Juliana Ghukasyan, Mariska Raglow-Defranco, Maggie Taylor, Herprit Mahal, Jonathan Agnew

机构 * Hippocratic AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于真实患者与AI交互数据的框架,通过分析实时信号提升医疗AI的安全性和可靠性,减少ASR错误,提高患者体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29038 2026-04-01 cs.CR cs.AI cs.CL 62%

Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning

Trojan-Speak:通过对抗微调规避宪法分类器无需牢笼突破

Bilgehan Sel, Xuanli He, Alwin Peng, Ming Jin, Jerry Wei

机构 * University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Trojan-Speak方法,通过结合课程学习和GRPO混合强化学习,利用对抗微调规避Anthropic的宪法分类器,实现99%以上的分类器规避,同时保持低的推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG 62%

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29846 2026-04-01 cs.CL 57%

SNEAK: Evaluating Strategic Communication and Information Leakage in Large Language Models

SNEAK:评估大语言模型中的战略沟通与信息泄露

Adar Avsian, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SNEAK通过模拟盟友和间谍两种角色,评估语言模型在信息共享与保密之间的平衡能力,发现当前系统在非对称信息下的战略沟通仍存在挑战,人类表现显著优于模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29373 2026-04-01 cs.CL 57%

Beyond Idealized Patients: Evaluating LLMs under Challenging Patient Behaviors in Medical Consultations

超越理想化患者:在医疗咨询中评估LLM在挑战性患者行为下的表现

Yahan Li, Xinyi Jie, Wanjia Ruan, Xubei Zhang, Huaijie Zhu, Yicheng Gao, Chaohao Du, Ruishan Liu

机构 * University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了医疗咨询中常见的挑战性患者行为,定义了四种行为类别,并提出了CPB-Bench基准测试集,评估了多种LLM在处理这些行为时的表现,发现模型在处理矛盾或医学上不合理的患者信息时存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29318 2026-04-01 cs.AI 57%

PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent

PSPA-Bench:面向智能手机GUI代理的个性化基准

Hongyi Nie, Xunyuan Liu, Yudong Bai, Yaqing Wang, Yang Liu, Quanming Yao, Zhen Wang

机构 * Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Peking University(北京大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PSPA-Bench,用于评估智能手机GUI代理的个性化能力,通过12855条个性化指令和22款移动应用,揭示现有方法在个性化场景下的不足,并提出改进方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29199 2026-04-01 cs.AI 57%

AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction

AEC-Bench:一种用于建筑、工程和施工领域代理系统的多模态基准

Harsh Mankodiya, Chase Gallik, Theodoros Galanos, Andriy Mulyar

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AEC-Bench旨在评估建筑、工程和施工领域代理系统在真实任务中的表现,涵盖图纸理解、跨表单推理和项目级协调任务,通过多模型基准测试提升基础模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29194 2026-04-01 cs.CV cs.AI 57%

Multi-Layered Memory Architectures for LLM Agents: An Experimental Evaluation of Long-Term Context Retention

多层记忆架构用于LLM代理:长期上下文保留的实验评估

Sunil Tiwari, Payal Fofadiya

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多层记忆框架,通过分解对话历史为工作、事件和语义层,提升长期上下文保留与推理稳定性,实验显示在LOCOMO等数据集上性能提升,同时降低虚假记忆率和上下文使用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27942 2026-04-01 cs.CV cs.AI 57%

JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding

JaWildText:面向日文场景文本理解的视觉-语言模型基准测试

Koki Maeda, Naoaki Okazaki

机构 * Institute of Science Tokyo, Tokyo, Japan(东京科学大学,日本东京) Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan(国立信息学研究所大型语言模型研发中心,日本东京)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出JaWildText基准测试,针对日文场景文本理解中的多脚本、垂直书写和字符多样性问题,包含3241个实例和112万字符标注,涵盖STVQA、KIE和手写OCR三个任务,评估14种VLM模型,发现最佳模型在三个任务上的平均得分为0.64。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22846 2026-04-01 cs.AI 57%

CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models

CoMaTrack: 基于竞争的多智能体博弈跟踪与视觉-语言-动作模型

Youzhi Liu, Li Gao, Liu Liu, Mingyang Lv, Yang Cai

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出CoMaTrack,一种基于竞争的多智能体强化学习框架,通过动态对抗环境训练,提升跟踪任务的适应性和鲁棒性,并引入首个开源的CoMaTrack-Bench基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏