arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-10 至 2026-04-10 共收录 128 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 11 篇

2601.21872 2026-04-10 cs.AI 79%

WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents

WebArbiter: 一种基于原则的推理过程奖励模型用于网络代理

Yao Zhang, Shijie Tang, Zeyu Li, Zhen Han, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出WebArbiter,一种基于原则的推理过程奖励模型,用于网络导航任务。该模型通过文本生成产生结构化的解释,以指导任务完成。通过两阶段训练流程,提升模型的泛化能力,并在WebPRMBench基准测试中优于现有方法。

Comments Published as a conference paper at ICLR 2026. Extended version with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08322 2026-04-10 cs.CV 78%

Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data

Fundus-R1: 基于公共数据训练具备知识感知推理能力的视网膜图像阅读MLLM

Yuchuan Deng, Qijie Wei, Kaiheng Qian, Jiazhen Liu, Zijie Xin, Bangxiang Lan, Jingyu Liu, Jianfeng Dong, Xirong Li

机构 * Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 本文提出Fundus-R1,通过公共数据集训练具备知识感知推理能力的视网膜图像阅读MLLM,采用RAG方法生成知识感知推理轨迹,并通过过程奖励增强RLVR,实验证明其在三个基准测试中优于多个基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08291 2026-04-10 cs.GT cs.CR cs.OS 78%

VCAO: Verifier-Centered Agentic Orchestration for Strategic OS Vulnerability Discovery

VCAO:以验证者为中心的代理协调用于战略操作系统漏洞发现

Suyash Mishra

专题命中 测试时计算 :verifier(title);reasoning(abstract)

AI总结 VCAO通过博弈论方法优化操作系统漏洞发现,利用多代理系统在资源约束下实现高效漏洞检测,相比传统方法提升漏洞发现效率并降低误报率。

Comments 13 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08369 2026-04-10 cs.AI cs.CL cs.MA 73%

Don't Overthink It: Inter-Rollout Action Agreement as a Free Adaptive-Compute Signal for LLM Agents

不要过度思考:跨回合动作一致性作为LLM代理的自由自适应计算信号

Khushal Sethi

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 TrACE通过测量跨回合动作一致性,实现LLM代理的自适应计算分配,无需训练或外部验证,在多步序列决策任务中提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02535 2026-04-10 cs.CL cs.AI 62%

ModeX: Evaluator-Free Best-of-N Selection for Open-Ended Generation

ModeX:无需评估器的开放生成最佳-N选择

Hyeong Kyu Choi, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ModeX提出一种无需外部评估器的最佳-N选择方法,通过识别主导语义共识的模态输出,提升开放生成任务的鲁棒性与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13993 2026-04-10 cs.CL cs.AI 62%

Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization

片段作为手臂:多臂老虎机引导的长上下文LLM偏好优化采样

Shaohua Duan, Pengcheng Huang, Xinze Li, Zhenghao Liu, Xiaoyuan Yi, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Microsoft Research Asia, China(微软亚洲研究院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系及人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LongMab框架,利用多臂老虎机策略从长上下文中选择最有信息量的片段,生成高质量多样化的响应,用于直接偏好优化训练,提升长上下文推理能力。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07758 2026-04-10 cs.CV cs.AI 57%

DailyArt: Discovering Articulation from Single Static Images via Latent Dynamics

DailyArt: 从单张静态图像中通过潜在动态发现关节

Hang Zhang, Qijian Tian, Jingyu Gong, Daoguo Dong, Xuhong Wang, Yuan Xie, Xin Tan

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 DailyArt通过合成介导推理解决单张图像中关节估计问题,无需多视角输入或显式部分标注,实现关节参数同时恢复和部分级新状态合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08016 2026-04-10 cs.CV cs.LG 57%

Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs

视频并行扩展:聚合多样化的帧子集用于VideoLLMs

Hyungjin Chung, Hyelin Nam, Jiyeon Kim, Hyojun Go, Byeongjun Park, Junho Kim, Joonseok Lee, Seongsu Ha, Byung-Hoon Kim

机构 * EverEx University of Michigan(密歇根大学) KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yonsei University(延世大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Video Parallel Scaling方法,通过并行处理不同帧子集提升VideoLLMs的时序推理能力,实验表明其在不同模型架构和规模上均显著提升性能,且比其他并行方法更高效。

Comments CVPR Findings 2026; code: https://github.com/hyungjin-chung/VPS

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 18 篇

2604.07415 2026-04-10 cs.IR cs.AI cs.CL 84%

SubSearch: Intermediate Rewards for Unsupervised Guided Reasoning in Complex Retrieval

SubSearch:复杂检索中无监督引导推理的中间奖励

Roxana Petcu, Evangelos Kanoulas, Maarten de Rijke

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 SubSearch通过引入内部奖励信号,提升复杂检索中推理的鲁棒性,无需外部监督,实现更高效的多步推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07518 2026-04-10 cs.CL 83%

Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

分解、观察与推理:用于视觉语言模型的强化潜在推理

Mengdan Zhu, Senhao Cheng, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出DLR框架,通过动态分解查询、提取连续视觉潜在表示和基于 grounded rationales 推理,提升视觉语言模型在复杂视觉推理中的表现,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07981 2026-04-10 cs.CL cs.AI cs.LG 82%

A Decomposition Perspective to Long-context Reasoning for LLMs

从分解视角看大语言模型的长上下文推理

Yanling Xiao, Huaibing Xie, Guoliang Zhao, Shihan Dou, Shaolei Wang, Yiting Liu, Nantao Zheng, Cheng Zhang, Pluto Zhou, Zhisong Zhang, Lemao Liu

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) Xi'an Jiaotong University(西安交通大学) Tencent(腾讯) Fudan University(复旦大学) City University of Hong Kong(香港城市大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从分解视角出发,将长上下文推理分解为基本原子技能,并通过伪数据集训练提升模型能力,实验证明该方法在多个基准测试中提升了7.7%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13551 2026-04-10 cs.CL cs.AI 81%

Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models

面向增强大语言模型推理能力的分层多步奖励模型

Teng Wang, Zhangyi Jiang, Zhenqi He, Shenyang Tong, Wenhan Yang, Yanan Zheng, Zeyu Li, Zifan He, Hailei Gong, Zewen Ye, Shengjie Ma, Jianping Zhang

机构 * the University of Hong Kong(香港大学) Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) the Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出分层奖励模型和轻量数据增强策略,解决大语言模型推理中奖励黑客问题,提升多步推理评估的稳定性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07490 2026-04-10 cs.CL cs.AI 81%

Enabling Intrinsic Reasoning over Dense Geospatial Embeddings with DFR-Gemma

通过DFR-Gemma实现对密集地理嵌入的内在推理

Xuechen Zhang, Aviv Slobodkin, Joydeep Paul, Mandar Sharma, Samet Oymak, Shravya Shetty, Gautam Prasad

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DFR-Gemma通过轻量投影器将高维嵌入与LLM潜在空间对齐,使LLM能直接处理地理嵌入进行空间推理,提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08065 2026-04-10 cs.LG 79%

Multimodal Latent Reasoning via Predictive Embeddings

通过预测嵌入进行多模态潜在推理

Ashutosh Adhikari, Mirella Lapata

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Pearl框架,通过学习专家工具使用轨迹在潜在空间中进行多模态推理,无需显式调用工具,优于传统重建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07851 2026-04-10 cs.IR cs.AI 79%

ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning

ReRec:通过强化微调增强的LLM推荐助手

Jiani Huang, Shijie Wang, Liangbo Ning, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 ReRec通过强化微调框架提升LLM在复杂推荐任务中的推理能力,引入双重图增强奖励塑造、推理感知优势估计和在线课程调度器,实验证明其优于现有基线模型。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07645 2026-04-10 cs.AI 79%

PRIME: Training Free Proactive Reasoning via Iterative Memory Evolution for User-Centric Agent

PRIME:通过迭代记忆进化实现无梯度的前瞻性推理以构建以用户为中心的智能体

Prince Zizhuang Wang, Shuli Jiang

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 PRIME通过迭代记忆进化框架,实现无梯度学习,使智能体在多轮人机交互中高效学习用户意图,提升任务执行效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12184 2026-04-10 cs.CV cs.AI 79%

CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs

CompoDistill:多模态大语言模型中基于注意力的知识蒸馏用于组合推理

Jiwan Kim, Kibum Kim, Sangwoo Seo, Chanyoung Park

机构 * KAIST(韩国科学技术院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CompoDistill,通过显式对齐学生与教师模型的视觉注意力,提升多模态大语言模型的组合推理能力,同时保持视觉问答任务的性能。

Comments ICLR'26, Project Page : https://ptkjw1997.github.io/CompoDistill-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07419 2026-04-10 cs.IR 78%

ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment

ReAlign:通过推理引导的细粒度对齐优化视觉文档检索

Hao Yang, Yifan Ji, Zhipeng Xu, Zhenghao Liu, Yukun Yan, Zulong Chen, Shuo Wang, Yu Gu, Ge Yu

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出ReAlign方法,利用VLM推理能力生成细粒度视觉描述作为监督信号,提升视觉文档检索性能,实验表明在不同领域数据集上均取得2%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08510 2026-04-10 cs.CL 70%

What do Language Models Learn and When? The Implicit Curriculum Hypothesis

语言模型学习了什么以及何时?隐式课程假说

Emmy Liu, Kaiser Sun, Millicent Li, Isabelle Lee, Lindia Tjuatja, Jen-tse Huang, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Department of Computer Science, Data Science and AI Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系、数据科学与人工智能研究所) Khoury College of Computer Science, Northeastern University(东北大学Khoury计算机科学学院) Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 研究通过设计简单可组合任务,发现模型技能以可组合顺序出现,且在不同模型间一致,表明预训练过程具有结构性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08260 2026-04-10 cs.CL cs.AI 62%

Behavior-Aware Item Modeling via Dynamic Procedural Solution Representations for Knowledge Tracing

基于动态程序性解决方案表示的行为感知项目建模

Jun Seo, Sangwon Ryu, Heejin Do, Hyounghun Kim, Gary Geunbae Lee

机构 * GSAI, POSTECH(浦项科技大学人工智能研究生院) CSE, POSTECH(浦项科技大学计算机科学与工程系) ETH Zurich, ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BAIM框架,通过整合动态程序性解决方案信息增强项目表示,利用推理语言模型分解问题解决阶段,提升知识追踪的预测性能。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08605 2026-04-10 cs.CL cs.CY cs.HC cs.MA cs.MM 57%

Mina: A Multilingual LLM-Powered Legal Assistant Agent for Bangladesh for Empowering Access to Justice

Mina:一种多语言大语言模型驱动的法律助理代理,用于孟加拉国,以促进获得正义

Azmine Toushik Wasi, Wahid Faisal, Mst Rafia Islam, Md Rizwan Parvez

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 Mina通过多语言嵌入和基于RAG的工具链框架,为孟加拉国提供多语言法律助理服务,实现法律文书、引文和通俗解释的生成,经评估在法律考试中表现优异,成本显著降低。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12374 2026-04-10 cs.SE cs.AI 57%

Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios

超越最终代码:对现实世界GitHub场景中软件开发代理的过程导向错误分析

Zhi Chen, Wei Ma, Lingxiao Jiang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文通过分析3977个解决阶段轨迹和3931个测试阶段日志,揭示了软件开发代理在解决GitHub问题时的错误模式,发现Python执行错误与较低的解决率和更高的推理开销相关,并识别了影响基准公平性的三个bug。

Comments Paper accepted at ICSE 2026, Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07900 2026-04-10 cs.CV cs.AI 57%

AnomalyAgent: Agentic Industrial Anomaly Synthesis via Tool-Augmented Reinforcement Learning

AnomalyAgent:通过工具增强强化学习进行代理工业异常合成

Jiaming Su, Tengchao Yang, Ruikang Zhang, Zhengan Yan, Haoyu Sun, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AnomalyAgent,通过工具增强强化学习生成高语义真实性的工业异常样本,采用闭环优化和两阶段训练框架,实现自我反思与迭代改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07776 2026-04-10 cs.LG 57%

Structured Distillation of Web Agent Capabilities Enables Generalization

结构化蒸馏Web代理能力以实现泛化

Xing Han Lù, Siva Reddy

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 通过结构化轨迹生成框架,利用Gemini 3 Pro生成3000条轨迹并微调学生模型,实现WebArena 41.5%的性能,超越其他模型,且能力迁移至未见环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07487 2026-04-10 cs.AI 57%

CLEAR: Context Augmentation from Contrastive Learning of Experience via Agentic Reflection

CLEAR:通过代理反思进行经验对比学习的上下文增强

Linbo Liu, Guande Wu, Han Ding, Yawei Wang, Qiang Zhou, Yuzhe Lu, Zhichao Xu, Huan Song, Panpan Xu, Lin Lee Cheong

机构 * AWS AI Labs(亚马逊云科技人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 CLEAR通过对比学习经验的代理反思生成上下文,提升任务完成率和奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19559 2026-04-10 cs.CL 57%

Stay Focused: Problem Drift in Multi-Agent Debate

专注:多智能体辩论中的问题漂移

Jonas Becker, Lars Benedikt Kaesberg, Andreas Stephan, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州刑事调查局) University of Vienna(维也纳大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 研究分析多智能体辩论中问题漂移现象,发现生成任务因答案空间主观性导致漂移,提出DRIFTJudge和DRIFTPolicy方法以缓解问题漂移。

Comments accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 26 篇

2512.12623 2026-04-10 cs.CV cs.CL 85%

Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space

思维中的推理:潜在空间中的动态多模态交错

Chengzhi Liu, Yuzhe Yang, Yue Fan, Qingyue Wei, Sheng Liu, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出DMLR框架,通过动态潜在策略梯度优化和视觉注入策略,在潜在空间中实现视觉与文本的动态交错推理,提升多模态推理性能并保持高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07814 2026-04-10 cs.CV 85%

AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models

AgriChain:基于视觉的专家验证推理用于可解释的农业视觉语言模型

Hazza Mahmood, Yongqiang Yu, Rao Anwer

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出AgriChain数据集,通过专家验证的推理链提升农业视觉语言模型的准确性和可解释性,实验表明其在植物病害诊断中优于多个基线模型。

Comments 9 pages

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08266 2026-04-10 cs.CV 82%

Orion-Lite: Distilling LLM Reasoning into Efficient Vision-Only Driving Models

Orion-Lite:将LLM推理能力蒸馏到高效视觉-only驾驶模型

Jing Gu, Niccolò Cavagnero, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出Orion-Lite,通过潜特征蒸馏和真实轨迹监督,在闭环评估中实现高效视觉-only驾驶模型,超越大规模VLA模型ORION,达到Bench2Drive基准的80.6 Driving Score。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08016 2026-04-10 cs.AI cs.LG 81%

Wiring the 'Why': A Unified Taxonomy and Survey of Abductive Reasoning in LLMs

阐明‘为何’:对大语言模型中演绎推理的统一分类和调查

Moein Salimi, Shaygan Adim, Danial Parnian, Nima Alighardashi, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统调研大语言模型中的演绎推理,提出统一的两阶段定义,分类现有工作,并通过基准测试和对比分析揭示当前方法的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏