arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1997 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1997 篇

2602.14050 2026-02-17 cs.LG 57%

Position Encoding with Random Float Sampling Enhances Length Generalization of Transformers

基于随机浮点采样的位置编码增强变换器的长度泛化能力

Atsushi Shimizu, Shohei Taniguchi, Yutaka Matsuo

机构 * Daiwa Securities(大和证券) The University of Tokyo(东京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出随机浮点采样方法,通过增强位置编码的泛化能力,提升变换器在长序列处理和常识推理任务中的表现。

Comments To appear at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 57%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11596 2026-02-13 cs.AI 57%

MAPLE: Modality-Aware Post-training and Learning Ecosystem

MAPLE: 多模态感知的后训练与学习生态系统

Nikhil Verma, Minjung Kim, JooYoung Yoo, Kyung-Min Jin, Manasa Bharadwaj, Kevin Ferreira, Ko Keun Kim, Youngjoon Kim

机构 * LG Electronics Toronto AI Lab, Toronto, Canada(LG电子多伦多AI实验室) LG Electronics CTO AI Lab, Seoul, Republic of Korea(LG电子CTO AI实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 MAPLE通过模态感知的后训练与学习生态系统,提升多模态强化学习的准确性、收敛速度和稳定性。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08630 2026-02-10 cs.AI cs.CC 57%

Debate is efficient with your time

与时间高效地进行辩论

Jonah Brown-Cohen, Geoffrey Irving, Simon C. Marshall, Ilan Newman, Georgios Piliouras, Mario Szegedy

机构 * Google DeepMind(谷歌DeepMind) UK AI Security Institute(英国人工智能安全研究所) University of Haifa(海法大学) Rutgers University(罗格斯大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 通过辩论实现人工智能安全,证明辩论查询复杂度与电路复杂性密切相关。

Comments 11 Pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06375 2026-02-09 cs.AI 57%

Difficulty-Estimated Policy Optimization

难度估计策略优化

Yu Zhao, Fan Jiang, Tianle Liu, Bo Zeng, Yu Liu, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商务) School of Software Technology, Dalian University of Technology(大连理工大学软件学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 DEPO通过动态难度估计器优化推理对齐的效率和鲁棒性,减少回放成本并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00611 2026-02-04 cs.AI 57%

Structured Self-Consistency:A Multi-Task Evaluation of LLMs on VirtualHome

结构自一致性:基于虚拟家庭的多任务评估

Jiaqi Xu, Tao Huang, Kai Zhang

专题命中 测试时计算 :planning(abstract);分类 cs.AI

AI总结 本文提出结构自一致性方法,评估两种大型语言模型在虚拟家庭任务中的表现,发现不同模型在不同任务中各有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07448 2026-02-03 cs.CL 57%

Large Language Models for Scientific Idea Generation: A Creativity-Centered Survey

用于科学思想生成的大型语言模型:以创造力为中心的综述

Fatemeh Shahhosseini, Arash Marioriyad, Ali Momen, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban, Shaghayegh Haghjooy Javanmard

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型在科学思想生成中的应用,分析了不同方法在创新性与科学合理性之间的权衡,并提出了评估框架以指导未来研究方向。

Comments 75 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01381 2026-02-03 cs.CL stat.ML 57%

On the Power of (Approximate) Reward Models for Inference-Time Scaling

在推理时间扩展中(近似)奖励模型的效能

Youheng Zhu, Yiping Lu

机构 * Department of Industrial Engineering and Management Sciences(工业工程与管理科学系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了近似奖励模型在推理时间扩展中的有效性,通过理论分析表明,当贝尔曼误差被限制在O(1/T)时,结合SMC可将推理复杂度从指数级降至多项式级,显著提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00269 2026-02-03 cs.CV cs.AI 57%

FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering

FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答

Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。

Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10038 2026-02-03 cs.AI 57%

Efficient Thought Space Exploration Through Strategic Intervention

通过战略干预实现高效思维空间探索

Ziheng Li, Hengyi Cai, Xiaochi Wei, Yuchen Li, Shuaiqiang Wang, Zhi-Hong Deng, Dawei Yin

机构 * Baidu(百度)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 HPR框架通过战略干预减少计算成本,在保持高准确率的同时实现高效推理。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26374 2026-02-02 cs.AI 57%

BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning

BOTS:一种用于LLM强化微调中贝叶斯在线任务选择的统一框架

Qianli Shen, Daoyuan Chen, Yilun Huang, Zhenqing Ling, Yaliang Li, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 BOTS通过贝叶斯推断和汤普森采样,提高LLM强化微调中任务选择的效率和性能。

Comments Accepted as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22249 2026-02-02 cs.LG cs.SE 57%

FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation

FunPRM:基于元奖励校正的函数作为步骤过程奖励模型用于代码生成

Ruiyi Zhang, Peijia Qin, Qi Cao, Eric Xue, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 FunPRM通过元学习的奖励校正机制提升代码生成性能,实现更高质量的代码输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22230 2026-02-02 cs.LG 57%

DAJ: Data-Reweighted LLM Judge for Test-Time Scaling in Code Generation

DAJ:用于代码生成测试时缩放的数据重加权LLM评判器

Peijia Qin, Ruiyi Zhang, Qi Cao, Pengtao Xie

机构 * ucsd(加州大学圣地亚哥分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 DAJ通过双层数据重加权学习框架,提升LLM评判器在代码生成测试时缩放中的性能,实现对困难问题和轨迹一致数据的自动强调,取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13547 2026-01-28 cs.CL 57%

ThinkNote: Enhancing Knowledge Integration and Utilization of Large Language Models via Constructivist Cognition Modeling

ThinkNote: 通过建构主义认知建模增强大型语言模型的知识整合与利用

Zhipeng Xu, Zhenghao Liu, Yukun Yan, Shuo Wang, Shi Yu, Zheni Zeng, Chaojun Xiao, Zhiyuan Liu, Ge Yu, Chenyan Xiong

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 ThinkNote通过建构主义认知建模提升大型语言模型的知识整合与利用能力,实验表明其在问答任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17212 2026-01-27 cs.CL 57%

DF-RAG: Query-Aware Diversity for Retrieval-Augmented Generation

DF-RAG:基于查询的多样性检索增强生成

Saadat Hasan Khan, Spencer Hong, Jingyu Wu, Kevin Lybarger, Youbing Yin, Erin Babinsky, Daben Liu

机构 * George Mason University(乔治·马歇尔大学) Capital One

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 DF-RAG通过在检索阶段引入多样性,提升复杂推理问答任务的F1性能,相比传统RAG提升了4-10个百分点,并接近Oracle上限的91.3%

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20304 2026-01-26 cs.CL 57%

Exploring Generative Process Reward Modeling for Semi-Structured Data: A Case Study of Table Question Answering

探索生成过程奖励建模在半结构化数据中的应用:表格问答的案例研究

Lei Tang, Wei Zhou, Mohsen Mesgar

机构 * University of Augsburg(奥格斯堡大学) Institut für Maschinelle Sprachverarbeitung, University of Stuttgart(斯图加特大学机械语言处理研究所) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了生成过程奖励模型在表格问答任务中的应用,发现结合文本和代码验证的PRMs能辅助解决方案选择,但泛化能力有限。

Comments Accepted at EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09345 2026-01-22 cs.CL 57%

Seer Self-Consistency: Advance Budget Estimation for Adaptive Test-Time Scaling

Seer Self-Consistency:面向自适应测试时缩放的先进预算估计

Shiyu Ji, Yixuan Wang, Yijun Liu, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology, China(社会计算与交互机器人研究中心,哈尔滨工业大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 SeerSC通过整合系统1和系统2推理,提升自适应测试时缩放的令牌效率和延迟,实现47%的令牌消耗减少和43%的推理延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07478 2026-01-21 cs.CL 57%

Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy Optimization

通过渐进奖励塑造与基于价值的采样策略优化增强代理强化学习

Jianghao Su, Xia Zeng, Luhui Liu, Chao Luo, Ye Chen, Zhuoran Zhuang

机构 * Xi’an Jiaotong University(西安交通大学) Fliggy Alibaba(阿里飞猪)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PRS和VSPO技术,通过渐进奖励塑造和基于价值的采样策略优化,提升代理强化学习在复杂推理任务中的性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12812 2026-01-21 cs.CL 57%

Do Clinical Question Answering Systems Really Need Specialised Medical Fine Tuning?

临床问答系统真的需要专门的医学微调吗?

Sushant Kumar Ray, Gautam Siddharth Kashyap, Sahil Tripathi, Nipun Joshi, Vijay Govindarajan, Rafiq Ali, Jiechao Gao, Usman Naseem

机构 * University of Delhi(德里大学) Jamia Hamdard(贾迈亚哈马尔德大学) Cornell University(康奈尔大学) Expedia Group(Expedia集团) DSEU-Okhla Center for SDGC(SDGC中心) Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 MEDASSESS-X通过推理时对齐技术,无需领域微调即可提升临床问答系统性能,解决专门化谬误问题。

Comments Accepted at EACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16899 2026-01-21 cs.CL cs.CV 57%

Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image

多模态奖励基准2:评估多模态奖励模型用于交错文本和图像

Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall, Emily Dinan, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。

Comments Code and data available at https://github.com/facebookresearch/MMRB2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11359 2026-01-19 cs.CV cs.AI 57%

Think-Clip-Sample: Slow-Fast Frame Selection for Video Understanding

Think-Clip-Sample: 慢-快帧选择用于视频理解

Wenhui Tan, Ruihua Song, Jiaze Li, Jianzhong Ju, Zhenbo Luo

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 Think-Clip-Sample通过多查询推理和慢-快采样提升长视频理解的效率和效果

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11963 2026-01-08 cs.CL 57%

ToolRM: Outcome Reward Models for Tool-Calling Large Language Models

ToolRM: 用于工具调用大型语言模型的成果奖励模型

Mayank Agarwal, Ibrahim Abdelaziz, Kinjal Basu, Merve Unuvar, Luis A. Lastras, Yara Rizk, Pavan Kapanipathi

机构 * IBM Research(IBM研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 ToolRM通过领域特定建模提升工具调用奖励模型性能,实现25%的改进并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03725 2026-01-08 cs.LG 57%

EDCO: Dynamic Curriculum Orchestration for Domain-specific Large Language Model Fine-tuning

EDCO:面向领域特定大语言模型微调的动态课程编排

Jing-Cheng Pang, Liu Sun, Chang Zhou, Xian Tang, Haichuan Ma, Kun Jiang, Jianlong Wang, Kai Zhang, Sijie Wu, Haoran Cai, Chenwei Wu, Xubin Li, Xin Chen

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 EDCO通过动态课程编排和熵估计提升领域特定大语言模型微调效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02736 2026-01-07 cs.SE cs.AI 57%

Hypothesize-Then-Verify: Speculative Root Cause Analysis for Microservices with Pathwise Parallelism

假设-验证:基于路径并行的微服务推测根本原因分析

Lingzhe Zhang, Tong Jia, Yunpeng Zhai, Leyi Pan, Chiming Duan, Minghua He, Pei Xiao, Ying Li

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 SpecRCA通过假设-验证范式提升微服务系统根本原因分析的准确性和效率。

Comments accepted by ICSE-NIER'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13201 2026-01-06 cs.CR cs.LG cs.MA 57%

CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation

CEE: 通过子空间概念旋转实现体智能中的推断时间劫持防御

Jirui Yang, Zheyu Lin, Zhihui Lu, Yinggui Wang, Lei Wang, Tao Wei, Qiang Duan, Xin Du, Shuhan Yang

机构 * Fudan University(复旦大学) Dalian University of Technology(大连理工大学) Ant Group(蚂蚁集团) Pennsylvania State University(宾夕法尼亚州立大学) Zhejiang University(浙江大学)

专题命中 测试时计算 :planning(abstract);分类 cs.LG

AI总结 CEE通过动态构建子空间并应用SLERP旋转,实现体智能系统中高效的推断时间劫持防御,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23760 2026-01-01 cs.CR cs.AI 57%

Audited Skill-Graph Self-Improvement for Agentic LLMs via Verifiable Rewards, Experience Synthesis, and Continual Memory

通过可验证奖励、经验合成和持续记忆对代理LLM进行审计化技能图自改进

Ken Huang, Jerry Huang

机构 * OWASP Fairfax, VA, USA Kleiner Perkins

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出ASG-SI框架,通过可验证奖励、经验合成和持续记忆实现代理LLM的审计化技能图自改进,以提升安全性和可追溯性。

Comments 11 pages, 4 figures. Includes a complete runnable reference implementation and audit logging framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22398 2025-12-30 cs.AI 57%

Lightweight Inference-Time Personalization for Frozen Knowledge Graph Embeddings

轻量级推理时个性化方法用于冻结的知识图谱嵌入

Ozan Oguztuzun, Cerag Oguztuzun

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 GatedBias通过轻量级推理时个性化方法,实现对冻结知识图谱嵌入的个体用户适应,提升对齐度并保持群体性能,同时验证因果响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20514 2025-12-24 cs.LG 57%

Explainable time-series forecasting with sampling-free SHAP for Transformers

基于Transformer的无采样SHAP可解释时间序列预测

Matthias Hertel, Sebastian Pütz, Ralf Mikut, Veit Hagenmeyer, Benjamin Schäfer

机构 * Institute for Automation and Applied Informatics (IAI)(自动化与应用信息学院) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 测试时计算 :planning(abstract);分类 cs.LG

AI总结 本文提出基于Transformer架构的SHAPformer模型,通过无采样注意力机制实现快速且准确的时间序列预测解释,适用于电力负荷等实际场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19585 2025-12-23 cs.CL 57%

Increasing the Thinking Budget is Not All You Need

增加思考预算并不足以提升性能

Ignacio Iacobacci, Zhaozhi Qian, Faroq AL-Tam, Muhammad AL-Qurishi, Riad Souissi

机构 * Elm Company(埃尔姆公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了思考预算对模型性能的影响,发现增加预算并非最优策略,而自一致性和反思等配置能更有效提升推理准确性。

Comments 4 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05387 2025-12-23 cs.CL 57%

Learning from Self Critique and Refinement for Faithful LLM Summarization

从自我批评与完善学习以实现忠实的大语言模型摘要

Ting-Yao Hu, Hema Swetha Koppula, Hadi Pouransari, Cem Koc, Oncel Tuzel, Raviteja Vemulapalli

机构 * Apple(苹果公司)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

AI总结 本文提出SCRPO方法,通过自监督训练框架提升大语言模型摘要的忠实度,实验表明其在忠实度和整体质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏