arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-07 至 2026-04-07 共收录 162 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 34 篇

2604.03376 2026-04-07 cs.AI cs.CL 62%

VERT: Reliable LLM Judges for Radiology Report Evaluation

VERT:用于放射学报告评估的可靠LLM评判者

Federica Bologna, Jean-Philippe Corbeil, Matthew Wilkens, Asma Ben Abacha

机构 * Cornell University(康奈尔大学) Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VERT作为LLM评判者,通过对比现有指标和实验验证,展示了其在多模态和解剖结构上的鲁棒性及轻量级微调的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21605 2026-04-07 cs.LG cs.AI cs.CR 62%

SoSBench: Benchmarking Safety Alignment on Six Scientific Domains

SoSBench:在六个科学领域中对安全对齐进行基准测试

Fengqing Jiang, Fengbo Ma, Zhangchen Xu, Yuetai Li, Zixin Rao, Bhaskar Ramasubramanian, Luyao Niu, Bo Li, Xianyan Chen, Zhen Xiang, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Georgia(佐治亚大学) WWU(西华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SoSBench针对高风险科学领域设计,通过3000个基于真实法规的提示评估大模型的安全性,揭示了先进模型在处理危险场景时存在严重的安全对齐缺陷。

Comments Project Page: https://sosbench.github.io/; ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04791 2026-04-07 cs.CL 57%

How Far Are We? Systematic Evaluation of LLMs vs. Human Experts in Mathematical Contest in Modeling

我们离目标还有多远?对LLMs与人类专家在数学建模竞赛中的系统评估

Yuhang Liu, Heyan Huang, Yizhe Yang, Hongyan Zhao, Zhizhuo Zeng, Yang Gao

机构 * Beijing Institute of Technology(北京理工大学) Southeast Academy of Information Technology(东南信息技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文系统评估了LLMs与人类专家在数学建模竞赛中的能力差异,揭示了当前先进LLMs在执行阶段存在显著缺陷,需超越模型扩展的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04660 2026-04-07 cs.AI 57%

Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception

Springdrift:一种可审计的持久运行时用于LLM代理,具备基于案例的记忆、规范安全性和环境自我感知

Seamus Brady

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Springdrift通过可审计的执行子系统、基于案例的记忆层和规范安全机制,实现了LLM代理在跨会话任务连续性和环境自我感知方面的突破,展示了无显式指令下的自主诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04347 2026-04-07 cs.AI 57%

RoboPhD: Evolving Diverse Complex Agents Under Tight Evaluation Budgets

RoboPhD:在有限评估预算下演化多样化复杂智能体

Andrew Borthwick, Stephen Ash, Anthony Galczak

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过对比三种优化方法,在四个基准测试中展示了RoboPhD在演化多样化复杂智能体方面的优越性,特别是在抽象推理、云调度、SQL生成和金融问答任务中表现突出。

Comments 20 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04172 2026-04-07 cs.CV cs.AI 57%

GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models

GENFIG1:学术工作的视觉摘要对视觉-语言模型的挑战

Yaohan Guan, Pristina Wang, Najim Dehak, Alan Yuille, Jieneng Chen, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 GENFIG1基准测试要求视觉-语言模型生成能清晰表达论文核心思想的图表,强调科学理解与视觉合成的结合,揭示生成高质量学术图表的难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07943 2026-04-07 cs.AI 57%

IV Co-Scientist: Multi-Agent LLM Framework for Causal Instrumental Variable Discovery

IV共科学家:多智能体LLM框架用于因果工具变量发现

Ivaxi Sheth, Zhijing Jin, Bryan Wilder, Dominik Janzing, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Jinesis AI Lab(Jinesis AI实验室) University of Toronto(多伦多大学) Vector Institute(向量研究所) EuroSafeAI Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨LLM在发现因果工具变量中的作用,提出IV共科学家多智能体系统,通过测试和评估LLM恢复已知工具及避免无效工具的能力,展示LLM在大规模观测数据中发现有效工具的潜力。

Comments Paper accepted at CleaR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03758 2026-04-07 cs.SE cs.AI 57%

AutoReSpec: A Framework for Generating Specification using Large Language Models

AutoReSpec:一种利用大语言模型生成规范的框架

Ragib Shahariar Ayon, Shibbir Ahmed

机构 * Texas State University(德克萨斯州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoReSpec框架,通过动态选择LLM和提示配置,结合协作模型反馈,提升规范生成的准确性和效率,实验显示其在成功概率和完整性上优于现有方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03742 2026-04-07 cs.AI 57%

Structured Multi-Criteria Evaluation of Large Language Models with Fuzzy Analytic Hierarchy Process and DualJudge

结构化多标准评估大型语言模型:基于模糊层次分析法与DualJudge

Yulong He, Ivan Smirnov, Dmitry Fedrushkov, Sergey Kovalchuk, Ilya Revin

机构 * St. Petersburg State University(圣彼得堡国立大学) ITMO University(ITMO大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于模糊层次分析法的结构化评估方法,通过引入置信度感知的模糊AHP扩展,提升对大型语言模型评估的准确性与稳定性,提出DualJudge框架实现直观与 deliberative评估的互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03361 2026-04-07 cs.LG q-bio.QM 57%

The limits of bio-molecular modeling with large language models : a cross-scale evaluation

大语言模型在生物分子建模中的局限性:跨尺度评估

Yaxin Xu, Yue Zhou, Tianyu Zhao, Fengwei An, Zhixiang Ren

机构 * Southern University of Science and Technology(南方科技大学) Pengcheng Laboratory(鹏城实验室) Institute of Mechanics, Chinese Academy of Sciences(中国科学院力学研究所)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.LG

AI总结 本文通过跨尺度生物分子基准测试,揭示了大语言模型在生物分子建模中的性能与机制理解之间的差距,指出链式思维数据对生物任务的有限帮助,混合mamba-注意力架构在长序列中的有效性,以及监督微调对专业化与泛化能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26718 2026-04-07 cs.CY cs.AI cs.MA quant-ph 57%

Toward Evaluation Frameworks for Multi-Agent Scientific AI Systems

迈向多智能体科学AI系统的评估框架

Marcin Abram

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了多智能体科学系统评估的挑战,提出构建抗污染问题、生成可扩展任务家族及多轮交互评估方法,通过访谈量子科学家探讨AI系统交互期望对评估方法的影响。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26567 2026-04-07 cs.SE cs.AI 57%

Beyond Code Snippets: Benchmarking LLMs on Repository-Level Question Answering

超越代码片段:在仓库层面评估大语言模型的问答任务

Yoseph Berhanu Alebachew, Hunter Leary, Swanand Vaishampayan, Chris Brown

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出StackRepoQA数据集,用于评估大语言模型在多项目仓库层面的问答能力,通过对比不同配置下的性能,揭示了模型在处理仓库级程序理解时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03666 2026-04-07 cs.CV cs.AI 57%

ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos

ToG-Bench:面向任务的时空接地在第一人称视频中

Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ToG-Bench,首个面向任务的时空视频接地基准,通过任务导向的接地、显式-隐式双接地和一对一多接地特性,评估多对象和显式-隐式对象接地性能,揭示任务导向时空视频接地的挑战与性能差距。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23883 2026-04-07 cs.AI 57%

Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges

代理AI安全:威胁、防御、评估与开放挑战

Anshuman Chhabra, Shrestha Datta, Shahriar Kabir Nahin, Prasant Mohapatra

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文探讨代理AI系统的安全威胁与防御策略,分析其在自动化中的独特风险,并提出安全设计的开放挑战。

Comments Published in IEEE Access. DOI: https://doi.org/10.1109/access.2026.3675554

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15148 2026-04-07 cs.CV cs.AI 57%

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

XModBench:多模态能力与一致性在多语言模型中的基准测试

Xingrui Wang, Jiang Liu, Chao Huang, Xiaodong Yu, Ze Wang, Ximeng Sun, Jialian Wu, Alan Yuille, Emad Barsoum, Zicheng Liu

机构 * Advanced Micro Devices(超威半导体) Johns Hopkins University(约翰霍普金斯大学) University of Rochester(罗彻斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 XModBench通过大规模三模态基准测试,评估多语言模型在跨模态一致性中的能力,揭示模型在不同模态下的推理偏差和不平衡问题。

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00721 2026-04-07 cs.CV cs.LG 57%

Common Inpainted Objects In-N-Out of Context

常见补全物体在上下文中的内-外场景

Tianze Yang, Tyson Jordan, Ruitong Sun, Ninghao Liu, Jin Sun

机构 * University of Georgia(佐治亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 COinCO数据集通过扩散补全技术生成97722张包含上下文一致和不一致场景的图像,用于研究上下文学习,支持细粒度上下文推理、基于上下文的物体预测和增强的假检测。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04929 2026-04-07 cs.CV 50%

Rethinking Model Efficiency: Multi-Agent Inference with Large Models

重新思考模型效率:基于大模型的多智能体推断

Sixun Dong, Juhua Hu, Steven Li, Wei Wen, Qi Qian

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过分析不同视觉-语言模型的延迟,发现大模型通过减少输出token数量可提升效率,并提出多智能体推断框架以复用小模型的推理token,从而接近大模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04238 2026-04-07 cs.PL 50%

Agentic Code Optimization via Compiler-LLM Cooperation

通过编译器-LLM协作实现代理代码优化

Benjamin Mikek, Danylo Vashchilenko, Bryan Lu, Panpan Xu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出编译器-LLM协作方法,结合传统编译优化与LLM生成,提升代码性能,实验显示比现有方法快1.25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07561 2026-04-07 cs.SE 50%

ComPass: Contrastive Learning for Automated Patch Correctness Assessment in Program Repair

ComPass:基于对比学习的程序修复中自动补丁正确性评估

Quanjun Zhang, Ye Shang, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 推理评测 :reasoning(abstract)

AI总结 ComPass利用对比学习和数据增强解决程序修复中补丁过拟合问题,通过代码转换规则生成语义保持的代码片段,提升补丁正确性评估的准确性。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03610 2026-04-07 cs.SE 50%

DebugHarness: Emulating Human Dynamic Debugging for Autonomous Program Repair

DebugHarness: 模拟人类动态调试以实现自主程序修复

Maolin Sun, Yibiao Yang, Xuanlin Liu, Yuming Zhou, Baowen Xu

专题命中 推理评测 :reasoning(abstract)

AI总结 DebugHarness通过模拟人类动态调试过程,利用LLM实现复杂漏洞的自动修复,其动态调试方法在SEC-bench数据集上实现了90%的修复率,比现有方法提升30%以上。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 22 篇

2604.03571 2026-04-07 cs.AI 83%

Selective Forgetting for Large Reasoning Models

选择性遗忘用于大推理模型

Tuan Le, Wei Qian, Mengdi Huai

机构 * Iowa State University(爱荷华州立大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出一种选择性遗忘框架,通过多语言模型分析推理轨迹,识别并替换敏感内容,以保护一般推理能力,同时解决大推理模型的知识泄露问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04921 2026-04-07 cs.CL cs.CV 79%

TriAttention: Efficient Long Reasoning with Trigonometric KV Compression

TriAttention: 有效长推理的三角KV压缩

Weian Mao, Xi Lin, Wei Huang, Yuxin Xie, Tianfu Fu, Bohan Zhuang, Song Han, Yukang Chen

机构 * MIT(麻省理工学院) NVIDIA(英伟达) ZJU(浙江大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TriAttention通过三角序列利用KV集中性,提升长推理效率,实现2.5倍吞吐量和10.7倍KV内存节省。

Comments Code is available at https://github.com/WeianMao/triattention

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01528 2026-04-07 cs.CY cs.LG 79%

Making Bias Non-Predictive: Training Robust LLM Reasoning via Reinforcement Learning

消除偏见的可预测性:通过强化学习训练鲁棒的大语言模型推理

Qian Wang, Xuandong Zhao, Zirui Zhang, Zhanzhi Lou, Nuo Chen, Dawn Song, Bingsheng He

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Epistemic Independence Training (EIT)框架,通过使偏见提示非预测性来提升大语言模型的推理鲁棒性,实验表明其在对抗性偏见下表现更优,并能泛化至多种偏见类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22095 2026-04-07 cs.CL 79%

Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation

基于推理引导的多模态知识利用的检索专家混合

Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Yishan Li, Yukun Yan, Shuo Wang, Yu Gu, Minghe Yu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MoRE框架,通过动态选择检索专家提升多模态大语言模型的知识利用效率,实验表明在开放领域问答基准上性能提升超过7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03242 2026-04-07 cs.LG 79%

DRAFT: Task Decoupled Latent Reasoning for Agent Safety

草稿:任务解耦的潜在推理用于代理安全

Lin Wang, Junfeng Fang, Dan Zhang, Fei Shen, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出DRAFT框架,通过解耦安全判断为提取器和推理器两个阶段,利用潜在空间证据聚合提升代理安全性,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03796 2026-04-07 cs.MA 79%

When AI Agents Disagree Like Humans: Reasoning Trace Analysis for Human-AI Collaborative Moderation

当AI代理像人类一样产生分歧:用于人机协作 moderation 的推理轨迹分析

Michał Wawer, Jarosław A. Chudziak

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文研究AI代理在仇恨言论 moderation 中的分歧模式,通过推理轨迹分析发现分歧结构比幅度更能预测人类判断需求,提出从共识寻求转向不确定性揭示的多代理设计。

Comments Accepted to the ICLR 2026 Workshop on "From Human Cognition to AI Reasoning: Models, Methods, and Applications (HCAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04372 2026-04-07 cs.CV 78%

Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning

图到帧RAG:面向无训练和可审计的视频推理的视觉空间知识融合

Songyuan Yang, Weijiang Yu, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出G2F-RAG,通过视觉空间知识融合提升视频推理的可解释性和效率,减少认知负担并保留可追溯的证据轨迹。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13193 2026-04-07 cs.RO 78%

Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control

可调节的视觉-语言-动作策略用于具身推理和分层控制

William Chen, Jagdeep Singh Bhatia, Catherine Glossop, Nikhil Mathihalli, Ria Doshi, Andy Tang, Danny Driess, Karl Pertsch, Sergey Levine

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21343 2026-04-07 cs.CL cs.AI cs.LG 67%

Self-Improving Pretraining: using post-trained models to pretrain better models

自我改进预训练:利用后训练模型来预训练更好的模型

Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, Ilia Kulikov, Sainbayar Sukhbaatar, Jason Weston, Xian Li, Olga Golovneva

机构 * FAIR at Meta(Meta FAIR)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新的预训练和中训练方法,通过利用已有的强后训练模型来重写预训练数据并判断策略模型的 rollout,从而在早期训练中引入安全、事实性、生成质量和推理能力等关键行为,提升模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04732 2026-04-07 cs.CL cs.AI 62%

Metaphors We Compute By: A Computational Audit of Cultural Translation vs. Thinking in LLMs

我们通过什么来计算隐喻:对文化翻译与LLM中思维的计算审计

Yuan Chang, Jiaming Qu, Zhu Li

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过创造性写作任务研究LLM的文化包容性,发现模型在特定文化情境下存在刻板隐喻使用和西方默认倾向,表明单纯提示文化身份无法保证文化思维。

详情

展开后加载摘要…

URL PDF HTML 收藏