arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1997 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1997 篇

2603.24676 2026-03-27 cs.AI cond-mat.dis-nn cond-mat.stat-mech physics.bio-ph physics.soc-ph 57%

When Is Collective Intelligence a Lottery? Multi-Agent Scaling Laws for Memetic Drift in LLMs

集体智慧何时是一场彩票?LLM中膜etic漂移的多智能体缩放定律

Hidenori Tanaka

机构 * CBS–NTT Program in Physics of Intelligence(物理智能中心-NTT项目) Center for Brain Science(脑科学中心) Harvard University(哈佛大学) Physics of Artificial Intelligence Group(人工智能物理研究组) NTT Research, Inc.(NTT研究公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究通过QSG模型揭示LLM多智能体系统中集体共识的形成机制,发现共识可能由膜etic漂移驱动,提出基于群体规模、通信带宽等因素的缩放定律。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24579 2026-03-26 cs.CL 57%

MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination

MARCH: 多智能体强化自检用于大语言模型幻觉

Zhuo Li, Yupeng Zhang, Pengyu Cheng, Jiajun Song, Mengyu Zhou, Hao Li, Shujie Hu, Yu Qin, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(通义大模型应用团队,阿里巴巴)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 MARCH通过多智能体强化学习框架,利用信息不对称机制减少大语言模型幻觉,实验表明其能显著降低幻觉率,8B参数模型表现接近闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22492 2026-03-26 cs.CV cs.AI cs.MM 57%

Tiny Inference-Time Scaling with Latent Verifiers

微小推理时间缩放与潜在验证器

Davide Bucciarelli, Evelyn Turri, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出VHS验证器,直接在扩散变换器单步生成器的中间隐藏表示上操作,减少验证成本并提升性能,实现更高效的推理时间缩放。

Comments Findings of CVPR 2026 - Code at: https://aimagelab.github.io/VHS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23346 2026-03-25 cs.AI 57%

RelayS2S: A Dual-Path Speculative Generation for Real-Time Dialogue

RelayS2S: 一种双路径推测生成用于实时对话

Long Mai

机构 * Trinity College Dublin(都柏林三一学院) University College Dublin(都柏林大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 RelayS2S通过双路径架构平衡实时对话中的延迟与响应质量,利用快速路径生成低延迟音频起始,慢路径生成高质量延续,通过轻量验证器实现无缝切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04865 2026-03-24 cs.LG cs.PL 57%

Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment

Agnostics: 通过通用学习环境的强化学习实现任何编程语言的代码学习

Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu, Tejas Oberoi, Carolyn Jane Anderson, Joydeep Biswas, Arjun Guha

机构 * Northeastern University(东北大学) University of Texas(德克萨斯大学) Wellesley College(韦尔斯利学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 Agnostics通过通用学习环境的强化学习,实现任何编程语言的代码学习,提升低资源语言模型性能并简化训练流程。

Comments 30 pages, 19 figures. Accepted at ICLR 2026. For data, code, artifacts, see https://agnostics.abgru.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20046 2026-03-23 cs.AI 57%

Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs

经验是最好的老师:在大型语言模型强化学习中激励有效的探索

Wenjian Zhang, Kongcheng Zhang, Jiaxin Qi, Baisheng Lai, Jianqiang Huang

机构 * Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学) Chinese Academy of Sciences(中国科学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HeRL框架,通过引导经验提升LLM的探索效率,有效学习高质量样本,实验显示其优于基线方法并能通过经验自我改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05960 2026-03-19 cs.CL 57%

Distilling Feedback into Memory-as-a-Tool

将反馈转化为记忆-as-a-工具

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出通过文件式记忆系统和智能体控制的工具调用来将临时批评转化为可检索的指导方针,从而降低推理时间的推理成本。在Rubric Feedback Bench数据集上实验表明,增强型LLM在测试时能快速匹配精炼管道性能,同时大幅降低推理成本。

Comments Code: https://github.com/vicgalle/feedback-memory-as-a-tool Data: https://huggingface.co/datasets/vicgalle/rubric-feedback-bench

Journal ref ICLR 2026 Workshop on Memory for LLM-Based Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16216 2026-03-18 cs.CE cs.AI cs.ET 57%

Generative AI for Quantum Circuits and Quantum Code: A Technical Review and Taxonomy

生成式AI用于量子电路和量子代码:技术综述与分类

Juhani Merilehto

机构 * University of Vaasa(瓦萨大学) University of Turku(图尔库大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 综述13个生成系统和5个支持数据集,探讨量子电路和代码生成的分类与训练方法,发现生成系统在语法和语义层面有所覆盖,但缺乏对量子硬件的端到端评估。

Comments 20 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16207 2026-03-18 cs.AI 57%

Proactive Rejection and Grounded Execution: A Dual-Stage Intent Analysis Paradigm for Safe and Efficient AIoT Smart Homes

主动拒绝与 grounded 执行:一种双阶段意图分析范式用于安全高效的 AIoT 智能家居

Xinxin Jin, Zhengwei Ni, Zhengguo Sheng, Victor C. M. Leung

机构 * School of Information and Electronic Engineering (Sussex Artificial Intelligence Institute), Zhejiang Gongshang University(信息与电子工程学院(Sussex人工智能研究院),浙江工商大学) Sussex Artificial Intelligent Institute, Zhejiang Gongshang University(Sussex人工智能研究院,浙江工商大学) Department of Engineering and Design, University of Sussex(工程与设计系, Sussex大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学) Department of Electrical and Computer Engineering, The University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出双阶段意图感知框架,通过语义防火墙和确定性验证器,解决LLM在IoT中的可靠性与交互效率问题,提升家居任务执行精度与用户干扰最小化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13353 2026-03-18 cs.CV cs.AI 57%

VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding

VideoITG: 多模态视频理解中的指导性时间定位

Shihao Wang, Guo Chen, De-an Huang, Zhiqi Li, Minghan Li, Guilin Liu, Jose M. Alvarez, Lei Zhang, Zhiding Yu

机构 * The Hong Kong Polytechnic Univ(香港理工大学) Nanjing Univ(南京大学) NVIDIA(NVIDIA公司) Harvard Univ(哈佛大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 VideoITG通过设计VidThinker流水线,自动生成指令条件化描述,检索相关视频片段并选择关键帧,提升多模态视频理解任务的性能。

Comments Accepted by CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15800 2026-03-18 cs.CV cs.CL cs.CR 57%

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14825 2026-03-17 cs.CV cs.AI 57%

Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection

双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用

Yewon Han, Yumin Seol, EunGyung Kong, Minsoo Jo, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Mobilint

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12248 2026-03-17 cs.LG 57%

Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models

匹配特征而非标记:基于能量的语言模型微调

Samy Jelassi, Mujin Kwun, Rosie Zhao, Yuanzhi Li, Nicolo Fusi, Yilun Du, Sham M. Kakade, Carles Domingo-Enrich

机构 * Harvard University, Kempner Institute(哈佛大学凯普纳研究所) Microsoft Research New England(微软研究院新英格兰分部)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出基于能量的语言模型微调方法,通过匹配序列级统计信息提升模型表现,无需任务特定验证器或偏好模型,在多个任务中优于传统微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04096 2026-03-16 cs.LG 57%

CORE: Context-Robust Remasking for Diffusion Language Models

CORE: 用于扩散语言模型的上下文鲁棒重掩码

Kevin Zhai, Sabbir Mollah, Zhenyi Wang, Mubarak Shah

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 CORE通过上下文鲁棒重掩码方法改进扩散模型解码,通过检测上下文敏感性token提升生成稳定性,在推理阶段实现高效修正,优于现有基线方法。

Comments Project Page: https://ucf-crcv.github.io/core/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02224 2026-03-16 cs.CL 57%

From XAI to Stories: A Factorial Study of LLM-Generated Explanation Quality

从XAI到故事:对LLM生成解释质量的因子研究

Fabian Lukassen, Jan Herrmann, Christoph Weisser, Benjamin Saefken, Thomas Kneib

机构 * University of Göttingen(哥廷根大学) BASF SE(巴斯夫股份有限公司) TU Clausthal(Clausthal 技术大学) Hochschule Bielefeld(比勒菲尔德应用科学大学)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过因子研究探讨了预测模型选择、XAI方法、LLM选择和提示策略对LLM生成解释质量的影响,发现LLM选择主导其他因素,且零次提示在成本上具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10299 2026-03-12 cs.LG 57%

Regime-aware financial volatility forecasting via in-context learning

基于情境学习的领域感知金融波动预测

Saba Asaad, Shayan Mohajer Hamidi, Ali Bereyhi

机构 * Department of Electrical and Computer Engineering, University of Toronto(多伦多大学电气与计算机工程系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种基于情境学习的领域感知金融波动预测方法,通过条件采样策略提升非平稳市场下的预测性能。

Comments 11 pages, 1 figure, Published as a conference paper at ICLR 2026 Workshop on Advances in Financial AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08251 2026-03-10 cs.CL 57%

Not All Queries Need Deep Thought: CoFiCot for Adaptive Coarse-to-fine Stateful Refinement

并非所有查询都需要深度思考:CoFiCot用于自适应粗到细状态细化

Dongxu Zhang, Hongqiang Lin, Yiding Sun, Pengyu Wang, Qirui Wang, Ning Yang, Jihua Zhu

机构 * Xi’an Jiaotong University(西安交通大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Institute of Automation CASIA(中国科学院自动化研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 CoFiCot通过自适应粗到细框架,利用多指标分类器和状态依赖传播过程,提升大语言模型在不同任务上的推理能力与上下文一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06621 2026-03-10 cs.LG 57%

Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models

奖励在攻击下:分析过程奖励模型的鲁棒性和可hack性

Rishabh Tiwari, Aditya Tomar, Udbhav Bamba, Monishwaran Maheswaran, Heng Yang, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

机构 * UC Berkeley(加州大学伯克利分校) Transmute AI ICSI(国际计算机科学研究所) LBNL(劳伦斯伯克利国家实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究揭示了过程奖励模型在对抗性攻击下的脆弱性,指出其更像流畅性检测器而非推理验证器,并提出PRM-BiasBench用于评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02099 2026-03-04 cs.CL 57%

Recursive Think-Answer Process for LLMs and VLMs

递归思考-回答过程用于LLMs和VLMs

Byung-Kwan Lee, Youngchae Chee, Yong Man Ro

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出递归思考-回答过程(R-TAP)以提升LLMs和VLMs的推理准确性,通过置信度生成器和双奖励机制实现迭代推理,减少错误输出并提高推理稳定性。

Comments CVPR 2026 Findings, Project page: https://litcoderr.github.io/rtap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02479 2026-03-04 cs.AI 57%

PRISM: Pushing the Frontier of Deep Think via Process Reward Model-Guided Inference

PRISM:通过过程奖励模型引导推理推动深度思考的前沿

Rituraj Sharma, Weiyuan Chen, Noah Provenzano, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 PRISM通过过程奖励模型引导推理,提升深度思考性能,在数学和科学任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09870 2026-03-04 cs.CL 57%

Steer2Edit: From Activation Steering to Component-Level Editing

Steer2Edit:从激活引导到组件级编辑

Chung-En Sun, Ge Yan, Zimo Wang, Tsui-Wei Weng

机构 * Department of Computer Science(计算机科学系) Halıcıoğlu Data Science Institute, UC San Diego(哈利奇奥卢数据科学研究所,加州大学圣迭戈分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 Steer2Edit通过将引导信号转化为可解释的参数更新,实现组件级权重编辑,提升模型的安全性、真实性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24302 2026-03-03 cs.CL 57%

Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards

基于前瞻树的rollouts用于增强强化学习中轨迹层面的探索

Shangyu Xing, Siyuan Wang, Chenyuan Yang, Xinyu Dai, Xiang Ren

机构 * Nanjing University(南京大学) University of Southern California(南加州大学) Fudan University(复旦大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 基于前瞻树的rollouts通过促进轨迹多样性提升强化学习中策略学习效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22765 2026-02-27 cs.CL 57%

Towards Better RL Training Data Utilization via Second-Order Rollout

通过二次回滚实现更好的RL训练数据利用

Zhe Yang, Yudong Wang, Rang Li, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ByteDance BandAI(字节跳动BandAI)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出通过二次回滚提升RL训练数据利用效率,联合训练生成与批判能力,实验表明在相同数据下性能更优,并揭示标签平衡与噪声问题的解决方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22242 2026-02-27 cs.CR cs.AI 57%

Analysis of LLMs Against Prompt Injection and Jailbreak Attacks

对LLMs对抗提示注入和 jailbreak攻击的分析

Piyush Jaiswal, Aaditya Pratap, Shreyansh Saraswati, Harsh Kasyap, Somanath Tripathy

机构 * Bishop Cotton Boys’ School(伯希特·康普顿男校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了LLMs对提示注入和jailbreak攻击的脆弱性,通过实验分析不同模型的行为差异,并评估了轻量级防御机制的效果。

Comments 12 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13551 2026-02-26 cs.CL 57%

Small Reward Models via Backward Inference

通过反向推理的小奖励模型

Yike Wang, Faeze Brahman, Shangbin Feng, Teng Xiao, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 FLIP通过反向推理实现无需参考和评分标准的奖励建模,在多个领域中显著提升性能并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26626 2026-02-25 cs.LG 57%

Recursive Self-Aggregation Unlocks Deep Thinking in Large Language Models

递归自聚合解锁大语言模型的深度思考

Siddarth Venkatraman, Vineet Jain, Sarthak Mittal, Vedant Shah, Johan Obando-Ceron, Yoshua Bengio, Brian R. Bartoldson, Bhavya Kailkhura, Guillaume Lajoie, Glen Berseth, Nikolay Malkin, Moksh Jain

机构 * Mila – Québec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) LawZero(法零) LLNL(劳伦斯利弗莫尔国家实验室) University of Edinburgh(爱丁堡大学) CIFAR AI Chair(CIFAR人工智能 chair) CIFAR Fellow

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 递归自聚合通过结合并行与顺序缩放方法,提升大语言模型的推理能力,实验证明其在多个任务中优于传统方法。

Comments 23 pages, 10 figures. Project page: https://rsa-llm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06275 2026-02-20 cs.CL 57%

RoPE-LIME: RoPE-Space Locality + Sparse-K Sampling for Efficient LLM Attribution

RoPE-LIME: RoPE空间局部性 + 稀疏K采样用于高效的LLM归因

Isaac Picov, Ritesh Goru

机构 * University of Toronto(多伦多大学) DevRev

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 RoPE-LIME通过RoPE空间局部性和稀疏K采样,高效实现LLM归因,减少API调用并提升归因信息质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12281 2026-02-19 cs.RO cs.AI cs.SY eess.SY 57%

Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

在视觉-语言-动作对齐中,验证比策略学习更具效率

Jacky Kwok, Xilun Zhang, Mengdi Xu, Yuejiang Liu, Azalia Mirhoseini, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出CoVer-VLA验证方法,通过测试时验证在视觉-语言-动作对齐中实现22%的在分布和13%的分布外收益,同时在现实世界实验中进一步提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10067 2026-02-19 cs.LG 57%

Features as Rewards: Scalable Supervision for Open-Ended Tasks via Interpretability

特征作为奖励:通过可解释性实现开放性任务的可扩展监督

Aaditya Vikram Prasad, Connor Watts, Jack Merullo, Dhruvil Gala, Owen Lewis, Thomas McGrath, Ekdeep Singh Lubana

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

AI总结 本文提出通过特征作为奖励实现开放性任务的可扩展监督,利用强化学习流程减少幻觉并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14060 2026-02-17 cs.CL 57%

LM-Lexicon: Improving Definition Modeling via Harmonizing Semantic Experts

LM-Lexicon:通过和谐语义专家提升定义建模

Yang Liu, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Lingyong Yan

机构 * BIGAI Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

AI总结 LM-Lexicon通过语义专家学习和混合架构提升定义建模效果,实现BLEU分数提升7%,并优化领域级路由机制

Comments EACL 2026 (Oral), 22 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏