arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-20 至 2026-04-20 共收录 116 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 33 篇

2604.15411 2026-04-20 cs.LG cs.AI physics.data-an 62%

PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research

PRL-Bench: 一个全面的基准,评估大语言模型在前沿物理研究中的能力

Tingjia Miao, Wenkai Jin, Muhua Zhang, Jinxin Tan, Yuelin Hu, Tu Guo, Jiejun Zhang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Weiqi Jiang, Yayun Hu, Zixing Lei, Xianghe Pang, Zexi Liu, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Zhiyuan College(智远学院) School of Physics and Astronomy(物理天文学院) Tsung-Dao Lee Institute(李政道研究所) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) Zhejiang Lab(浙江实验室) SciLand DP Technology(DP技术)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PRL-Bench通过理论和计算物理的科研导向评估,系统测试大语言模型执行端到端物理研究的能力,揭示当前LLM在真实科研需求中的不足。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16054 2026-04-20 cs.CV cs.AI 57%

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

Mind's Eye:多模态大语言模型的视觉抽象、转换与组合基准

Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N Balasubramanian, Tanuja Ganu

机构 * CSE Dept., IIT Hyderabad(IIT海得拉巴计算机科学与工程系) Microsoft Research(微软研究院) IIT Hyderabad(IIT海得拉巴)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Mind's Eye基准,通过A-R-T分类评估多模态大语言模型的视觉认知能力,发现人类准确率达80%,而顶级模型低于50%,揭示模型在视觉空间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05523 2026-04-20 cs.SE cs.AI 57%

Capture the Flags: Family-Based Evaluation of Agentic LLMs via Semantics-Preserving Transformations

捕获旗帜:通过语义保持变换进行基于家庭的代理LLM评估

Shahin Honarvar, Amber Gorzynski, James Lee-Jones, Harry Coppock, Marek Rei, Joseph Ryan, Alastair F. Donaldson

机构 * Department of Computing, Imperial College London(帝国理工学院伦敦计算机系) AI Security Institute(人工智能安全研究所) Royal Grammar School Guildford(格里菲斯皇家文法学校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CTF挑战家族,通过语义保持的程序变换生成等效挑战,评估代理鲁棒性和泛化能力,展示了Evolve-CTF工具及13种代理LLM配置的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10198 2026-04-20 cs.CL 57%

HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns

HumanLLM:通过人类认知模式基准测试和改进LLM拟人化

Xintao Wang, Jian Yang, Weiyuan Li, Rui Xie, Jen-tse Huang, Jun Gao, Shuai Huang, Yueping Kang, Yuanli Gou, Hongwei Feng, Yanghua Xiao

机构 * Fudan University(复旦大学) Hello Group(Hello集团) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 HumanLLM通过构建244种心理模式和11359种场景,评估LLM拟人化的有效性,发现认知建模比单纯模拟行为更重要,其8B模型在参数更少的情况下优于Qwen3-32B。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06094 2026-04-20 cs.CL 57%

ConlangCrafter: Constructing Languages with a Multi-Hop LLM Pipeline

ConlangCrafter:基于多跳LLM流水线的语言构建

Morris Alper, Moran Yanuka, Raja Giryes, Gašper Beguš

机构 * Tel Aviv University(特拉维夫大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(伯克利大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ConlangCrafter,通过多阶段流水线实现语言构建,利用LLM的元语言能力生成一致且多样化的构想语言。

Comments Accepted to ACL 2026. Project page: https://conlangcrafter.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15494 2026-04-20 cs.LG cs.CV 57%

ProtoTTA: Prototype-Guided Test-Time Adaptation

ProtoTTA:基于原型的测试时间适应

Mohammad Mahdi Abootorabi, Parvin Mousavi, Purang Abolmaesumi, Evan Shelhamer

机构 * University of British Columbia(不列颠哥伦比亚大学) Queen’s University(女王大学) Vector Institute(向量研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ProtoTTA通过利用中间原型信号提升模型在分布偏移下的鲁棒性,同时恢复原型激活的语义聚焦,改进了标准输出熵最小化方法。

Comments ICLR 2026 Test-Time Updates (TTU) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11374 2026-04-20 cs.CL 57%

Reward Modeling for Scientific Writing Evaluation

科学写作评估的奖励建模

Furkan Şahinuç, Subhabrata Dutta, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab) Department of Computer Science and Hessian Center for AI (hessian.AI) Technical University of Darmstadt(普遍知识处理实验室(UKP实验室)计算机科学系海德堡人工智能中心(hessian.AI)达姆施塔特技术大学) Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(康拉德·祖斯卓越学习与智能系统学校(ELIZA))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出高效的开源奖励模型,通过两阶段训练框架提升科学写作评估的准确性和鲁棒性,实现跨任务泛化和动态评分标准适应。

Comments Accepted to ACL 2026 (Main). Project page: https://ukplab.github.io/acl2026-expert-rm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13131 2026-04-20 cs.AI cs.CV cs.ET cs.NI 57%

MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications

MM-Telco: 电信应用的多模态大语言模型基准与工具

Anshul Kumar, Gagan Raj Gupta, Manish Rai, Apu Chakraborty, Ashutosh Modi, Abdelaali Chaoub, Soumajit Pramanik, Moyank Giri, Yashwanth Holla, Sunny Kumar, M. V. Kiran Sooraj

机构 * IIT Bhilai(比哈尔理工学院) IIT Kanpur(坎pur理工学院) INPT(伊斯兰北方技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MM-Telco,为电信领域设计的多模态基准和模型,旨在解决领域特定挑战,通过基准任务和实验验证提升大语言模型在电信中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05489 2026-04-20 cs.LG 57%

Self-Aligned Reward: Towards Effective and Efficient Reasoners

自对齐奖励:迈向高效且有效的推理器

Peixuan Han, Adit Krishnan, Gerald Friedland, Jiaxuan You, Chris Kong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出自对齐奖励(SAR),通过补充可验证奖励以提升推理准确性和效率,实验表明SAR在4个模型7个基准上提升了4%的准确率并降低了30%的计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02497 2026-04-20 cs.SE cs.AI quant-ph 57%

A PennyLane-Centric Dataset to Enhance LLM-based Quantum Code Generation using RAG

面向增强基于LLM的量子代码生成的PennyLane数据集

Abdul Basit, Nouhaila Innan, Muhammad Haider Asif, Minghao Shao, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

机构 * Center for Quantum and Topological Systems (CQTS)(量子与拓扑系统中心(CQTS)) NYUAD Research Institute(纽约大学阿布扎克研究院) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PennyLang数据集,通过系统化方法提升LLM生成量子代码的性能,验证了RAG框架在增强量子代码生成中的有效性。

Comments 8 pages, 6 figures, 8 tables. Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16198 2026-04-20 cs.SE 50%

Bridging the Gap between User Intent and LLM: A Requirement Alignment Approach for Code Generation

弥合用户意图与大语言模型之间的鸿沟:一种用于代码生成的需求对齐方法

Jia Li, Ruiqi Bai, Yangkang Luo, Yiran Zhang, Wentao Yang, Zeyu Sun, Tiankuo Zhao, Dongming Jin, Lei Li, Zhi Jin

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出REA-Coder方法,通过需求对齐提升大语言模型的代码生成性能,实验表明其在多个编程基准测试中表现优异,平均提升率达7.93%至30.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16099 2026-04-20 cs.CV 50%

DenTab: A Dataset for Table Recognition and Visual QA on Real-World Dental Estimates

DenTab:一个用于真实世界牙科估算表识别和视觉问答的数据集

Laziz Hamdi, Amine Tamasna, Thierry Paquet

机构 * LITIS, Normandy, France(诺曼底大学LITIS实验室) Malakoff Humanis, Paris, France(巴黎Malakoff Humanis机构)

专题命中 推理评测 :reasoning(abstract)

AI总结 DenTab数据集包含2000张牙科估算表图像,用于评估表识别和视觉问答性能,包含2208个问题,涵盖检索、聚合和逻辑一致性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15849 2026-04-20 cs.SD 50%

TinyMU: A Compact Audio-Language Model for Music Understanding

TinyMU:一种用于音乐理解的紧凑音频-语言模型

Xiquan Li, Aurian Quelennec, Slim Essid

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI, Télécom Paris, Institut Polytechnique de Paris) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出TinyMU,一种轻量级音乐语言模型,通过MusicSkills-3.5M数据集训练,实现与大规模LALMs相当的性能,同时保持高效紧凑,适用于边缘设备。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15676 2026-04-20 cs.DB 50%

EvoRAG: Making Knowledge Graph-based RAG Automatically Evolve through Feedback-driven Backpropagation

EvoRAG: 通过反馈驱动的反向传播使基于知识图谱的RAG自动进化

Zhenbo Fu, Yuanzhe Zhang, Qiange Wang, Hao Yuan, Yuehao Xu, Enze Yi, Yanfeng Zhang, Ge Yu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EvoRAG,通过反馈驱动反向传播机制自动优化知识图谱,提升推理准确性,实验显示比现有方法提升7.34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14388 2026-04-20 cs.CV 50%

FoodSense: A Multisensory Food Dataset and Benchmark for Predicting Taste, Smell, Texture, and Sound from Images

FoodSense:一个多感官食物数据集和基准,用于从图像预测味觉、嗅觉、触觉和声音

Sabab Ishraq, Aarushi Aarushi, Juncai Jiang, Chen Chen

机构 * College of Engineering and Computer Science, University of Central Florida(中央佛罗里达大学工程与计算机科学学院) College of Business Administration, University of Central Florida(中央佛罗里达大学商学院) Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出FoodSense数据集,包含66,842个参与者的图像对,用于预测多感官体验,通过图像接地推理轨迹训练模型,展示传统评估指标在视觉感官推断中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 11 篇

2506.08125 2026-04-20 cs.LG cs.CL 88%

Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning

并非所有标记都重要:通过强化学习中的标记重要性实现高效的LLM推理

Hanbing Liu, Lang Cao, Yuanyi Ren, Mengyu Zhou, Haoyu Dong, Xiaojun Ma, Shi Han, Dongmei Zhang

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Qwen Large Model Application Team, Alibaba(阿里云文大模型应用团队) Microsoft(微软) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院 ubiquitous 数据赋能重点实验室)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过标记重要性优化强化学习,减少冗余并提升LLM推理效率和准确性,实验显示响应长度显著缩短且正确性保持或提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15725 2026-04-20 cs.LG cs.AI 81%

Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing

通过语义触发和心理框架针对大推理模型的推理定向劫持攻击

Zehao Wang, Lanjun Wang

机构 * College of Intelligence and Computing(智能与计算学院) School of New Media and Communication(新媒体与传播学院) Shanghai Key Laboratory of Data Science(上海数据科学 key laboratory)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出PRJA框架,通过语义触发选择模块和心理指令生成模块,解决大推理模型推理过程中的安全问题,实验显示在五个问答数据集上攻击成功率达83.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07353 2026-04-20 cs.CL cs.AI cs.CV cs.CY cs.SI 62%

Toxic Memes: A Survey of Computational Perspectives on the Detection and Explanation of Meme Toxicities

有毒的迷因:计算视角下对迷因毒性的检测与解释的综述

Delfina Sol Martinez Pandiani, Erik Tjong Kim Sang, Davide Ceolin

机构 * organization= Centrum Wiskunde \& Informatica , addressline= Science Park 123 , city= Amsterdam , postcode= 1098 XG , country= The Netherlands organization= Netherlands eScience center , addressline= Science Park 402 , city= Amsterdam , postcode= 1098 XH , country= The Netherlands

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了计算视角下对迷因毒性的检测与解释的研究,识别了30多个数据集及毒性分类方法,提出了新的毒性分类体系,并探讨了跨模态推理、低资源语言处理等挑战。

Comments 39 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15750 2026-04-20 cs.LG cs.AI 62%

DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference

DepCap:适应性分块并行解码用于高效扩散语言模型推理

Xiang Xia, Wuyang Zhang, Jiazheng Liu, Cheng Yan, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DepCap框架,通过自适应分块解码提升扩散语言模型推理效率,实现生成质量与速度的平衡,实验表明在多个模型和任务中达到显著加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15143 2026-04-20 cs.AI cs.CL 62%

Protecting Language Models Against Unauthorized Distillation through Trace Rewriting

通过追踪重写保护语言模型免受未经授权的蒸馏

Xinhang Ma, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过追踪重写技术防止未经授权的知识蒸馏,通过反蒸馏和API水印两种方法提升教师模型性能并防止恶意使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12858 2026-04-20 cs.LG cs.AI 62%

Information-Consistent Language Model Recommendations through Group Relative Policy Optimization

通过群体相对策略优化实现信息一致的语言模型推荐

Sonal Prabhune, Balaji Padmanabhan, Kaushik Dutta

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于群体相对策略优化的强化学习框架,旨在提升语言模型在等效提示下的信息一致性,通过熵基帮助性和稳定性奖励优化模型稳定性。

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00739 2026-04-20 cs.AI cs.LG cs.MA 62%

Towards Understanding, Analyzing, and Optimizing Agentic AI Execution: A CPU-Centric Perspective

向理解、分析和优化代理AI执行:一种以CPU为中心的视角

Ritik Raj, Souvik Kundu, Ishita Vohra, Hong Wang, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文从CPU角度分析代理AI工作负载的瓶颈,提出两种优化方法,降低CPU-GPU资源分配偏差,提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16264 2026-04-20 cs.CV cs.LG 57%

Information Router for Mitigating Modality Dominance in Vision-Language Models

信息路由器用于缓解视觉-语言模型中的模态主导问题

Seulgi Kim, Mohit Prabhushankar, Ghassan AlRegib

机构 * OLIVES at the Center for Signal Information Processing CSIP, School of Electrical

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出MoIR信息路由器,通过在融合前减少信息差异,缓解视觉-语言模型中模态主导问题,提升鲁棒性和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16262 2026-04-20 cs.CL 57%

SwanNLP at SemEval-2026 Task 5: An LLM-based Framework for Plausibility Scoring in Narrative Word Sense Disambiguation

SwanNLP 在 SemEval-2026 任务 5:一种基于 LLM 的叙事词义消歧可信度评分框架

Deshan Sumanathilaka, Nicholas Micallef, Julian Hough, Saman Jayasinghe

机构 * Department of Computer Science, Swansea University(Swansea大学计算机科学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于 LLM 的框架,用于叙事文本中同义词消歧的可信度评分,通过结构化推理机制评估词义的可信度,实验表明动态少样本提示的大型参数 LLM 能有效模拟人类判断。

Comments 6 pages, 5 Tables, 1 figure, Accepted to SemEval 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15675 2026-04-20 cs.CL 57%

C-Mining: Unsupervised Discovery of Seeds for Cultural Data Synthesis via Geometric Misalignment

C-Mining:通过几何偏移无监督发现文化数据合成的种子

Pufan Zeng, Yilun Liu, Mingchen Dai, Mengyao Piao, Chunguang Zhao, Lingqi Miao, Shimin Tao, Weibin Meng, Minggui He, Chenxin Liu, Zhenzhen Qin, Li Zhang, Hongxia Ma, Boxing Chen, Daimeng Wei

机构 * Huawei China(华为中国) Huawei Canada(华为加拿大) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出C-Mining框架,通过几何偏移发现文化种子,提升文化理解与推理能力,实验显示在CulturalBench-Hard上提升6.03分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27617 2026-04-20 cs.AI 57%

VeriMoA: A Mixture-of-Agents Framework for Spec-to-HDL Generation

VeriMoA:一种用于规格到HDL生成的代理混合框架

Heng Ping, Arijit Bhattacharjee, Peiyu Zhang, Shixuan Li, Wei Yang, Anzhe Cheng, Xiaole Zhang, Jesse Thomason, Ali Jannesari, Nesreen Ahmed, Paul Bogdan

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 VeriMoA提出一种无需训练的代理混合框架,通过质量引导缓存机制和多路径生成策略,提升规格到HDL生成的准确性和多样性,实验表明在多个基准上性能提升15-30%。

详情

展开后加载摘要…

URL PDF HTML 收藏