arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1997 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1997 篇

2510.22099 2025-10-28 cs.CL 57%

Generalization or Memorization: Dynamic Decoding for Mode Steering

Xuanming Zhang

机构 * Stanford University, Palo Alto, USA(斯坦福大学) Department of Computer Science, University of Wisconsin-Madison, Madison, USA(计算机科学系,威斯康星大学麦迪逊分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19752 2025-10-23 cs.RO cs.AI 57%

Learning Affordances at Inference-Time for Vision-Language-Action Models

Ameesh Shah, William Chen, Adwait Godbole, Federico Mora, Sanjit A. Seshia, Sergey Levine

机构 * UC Berkeley(伯克利大学) Physical Intelligence(物理智能)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 7 pages and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18982 2025-10-23 cs.AI 57%

Test-time Verification via Optimal Transport: Coverage, ROC, & Sub-optimality

Arpan Mukherjee, Marcello Bullo, Debabrota Basu, Deniz Gündüz

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05542 2025-10-22 cs.LG 57%

DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training

Qi Cao, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17771 2025-10-21 cs.AI cs.CV 57%

Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs

Zhining Liu, Ziyi Chen, Hui Liu, Chen Luo, Xianfeng Tang, Suhang Wang, Joy Zeng, Zhenwei Dai, Zhan Shi, Tianxin Wei, Benoit Dumoulin, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Penn State University(宾夕法尼亚州立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 21 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01067 2025-10-20 cs.LG 57%

All Roads Lead to Likelihood: The Value of Reinforcement Learning in Fine-Tuning

Gokul Swamy, Sanjiban Choudhury, Wen Sun, Zhiwei Steven Wu, J. Andrew Bagnell

机构 * Carnegie Mellon University(卡内基梅隆大学) Cornell University(康奈尔大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14853 2025-10-17 cs.CL 57%

Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models

Guinan Su, Yanwu Yang, Li Shen, Lu Yin, Shiwei Liu, Jonas Geiping

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心) University of Tübingen(图宾根大学) Sun Yat-sen University(中山大学) University of Surrey(萨里大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10425 2025-10-16 cs.LG 57%

Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMs

Jingyao Wang, Wenwen Qiang, Zeen Song, Changwen Zheng, Hui Xiong

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09434 2025-10-13 cs.CL 57%

Domain-Adapted Pre-trained Language Models for Implicit Information Extraction in Crash Narratives

Xixi Wang, Jordanka Kovaceva, Miguel Costa, Shuai Wang, Francisco Camara Pereira, Robert Thomson

机构 * Department of Technology, Management and Economics, Technical University of Denmark(技术、管理与经济系,丹麦技术大学) Department of Mechanics and Maritime Sciences, Chalmers University of Technology(机械与航海科学系,查尔姆斯理工大学) Department of Computer Science and Engineering, Chalmers University of Technology(计算机科学与工程系,查尔姆斯理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06189 2025-10-13 cs.AI 57%

Barbarians at the Gate: How AI is Upending Systems Research

Audrey Cheng, Shu Liu, Melissa Pan, Zhifei Li, Bowen Wang, Alex Krentsel, Tian Xia, Mert Cemri, Jongseok Park, Shuo Yang, Jeff Chen, Lakshya Agrawal, Aditya Desai, Jiarong Xing, Koushik Sen, Matei Zaharia, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14342 2025-10-13 cs.IR cs.CL 57%

Chain-of-Retrieval Augmented Generation

Liang Wang, Haonan Chen, Nan Yang, Xiaolong Huang, Zhicheng Dou, Furu Wei

机构 * Microsoft Research(微软研究院) Renmin University of China(中国人民大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08329 2025-10-10 cs.CL 57%

AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming

Muxi Diao, Yutao Mou, Keqing He, Hanbo Song, Lulu Zhao, Shikun Zhang, Wei Ye, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21467 2025-10-10 cs.CL 57%

FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion

Zhanqiu Hu, Jian Meng, Yash Akhauri, Mohamed S. Abdelfattah, Jae-sun Seo, Zhiru Zhang, Udit Gupta

机构 * Cornell University(康奈尔大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06040 2025-10-08 cs.CV cs.AI 57%

VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization

Xinye Cao, Hongcan Guo, Jiawen Qian, Guoshun Nan, Chao Wang, Yuqi Pan, Tianhao Hou, Xiaojuan Wang, Yutong Gao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Minzu University of China(民族大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05421 2025-10-08 cs.LG 57%

Draft, Verify, and Improve: Toward Training-Aware Speculative Decoding

Shrenik Bhansali, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04147 2025-10-07 cs.CL 57%

Self Speculative Decoding for Diffusion Large Language Models

Yifeng Gao, Ziang Ji, Yuxuan Wang, Biqing Qi, Hanlin Xu, Linfeng Zhang

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) University of Science and Technology of China(中国科学技术大学) Xidian University(西安电子科技大学) Shanghai AI Laboratory(上海人工智能实验室) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02850 2025-10-06 cs.AI 57%

Reward Model Routing in Alignment

Xinle Wu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01101 2025-10-03 cs.CL 57%

Self-Consistency Falls Short! The Adverse Effects of Positional Bias on Long-Context Problems

Adam Byerly, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments 25 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25808 2025-10-01 cs.LG 57%

Improving Sampling Efficiency in RLVR through Adaptive Rollout and Response Reuse

Yuheng Zhang, Wenlin Yao, Changlong Yu, Yao Liu, Qingyu Yin, Bing Yin, Hyokun Yun, Lihong Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23746 2025-09-30 cs.CV cs.AI 57%

Poivre: Self-Refining Visual Pointing with Reinforcement Learning

Wenjie Yang, Zengfeng Huang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23738 2025-09-30 cs.AI 57%

GUI-Shepherd: Reliable Process Reward and Verification for Long-Sequence GUI Tasks

Cong Chen, Kaixiang Ji, Hao Zhong, Muzhi Zhu, Anzhou Li, Guo Gan, Ziyuan Huang, Cheng Zou, Jiajia Liu, Jingdong Chen, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University of Technology(浙江工业大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17310 2025-09-27 cs.AI cs.HC 57%

Probing LLM World Models: Enhancing Guesstimation with Wisdom of Crowds Decoding

Yun-Shiuan Chuang, Sameer Narendran, Nikunj Harlalka, Alexander Cheung, Sizhe Gao, Siddharth Suresh, Junjie Hu, Timothy T. Rogers

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20368 2025-09-26 cs.AI 57%

LATTS: Locally Adaptive Test-Time Scaling

Theo Uscidda, Matthew Trager, Michael Kleinman, Aditya Chattopadhyay, Wei Xia, Stefano Soatto

机构 * CREST-ENSAE, IP Paris(CREST-ENSAE,IP巴黎) AWS AI Labs(AWS人工智能实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03136 2025-09-26 cs.CL 57%

Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning

Yinjie Wang, Ling Yang, Ye Tian, Ke Shen, Mengdi Wang

机构 * University of Chicago(芝加哥大学) Princeton University(普林斯顿大学) Peking University(北京大学) ByteDance Seed(字节跳动种子)

专题命中 测试时计算 :CoT(abstract);分类 cs.CL

Comments NeurIPS 2025 Spotlight. Project: https://github.com/Gen-Verse/CURE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20196 2025-09-25 cs.CV cs.LG 57%

Universal Camouflage Attack on Vision-Language Models for Autonomous Driving

Dehong Kong, Sifan Yu, Siyuan Liang, Jiawei Liang, Jianhou Gan, Aishan Liu, Wenqi Ren

机构 * School of Cyber Science and Technology, SUN YAT-SEN UNIVERSITY(中山大学计算机科学与技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Key Laboratory of Education Informatization for Nationalities, Yunnan Normal University(云南师范大学民族教育信息化重点实验室) SCSE, Beihang University(北航软件学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11686 2025-09-25 cs.SE cs.AI 57%

Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models

Jian Wang, Xiaofei Xie, Qiang Hu, Shangqing Liu, Yi Li

机构 * Singapore Management University(新加坡国立管理学院) Nanyang Technological University(南洋理工大学) Tianjin University(天津大学) State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments EMNLP2025-findings https://openreview.net/forum?id=d4ICISW2T4

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15044 2025-09-24 cs.CL 57%

Reward-Shifted Speculative Sampling Is An Efficient Test-Time Weak-to-Strong Aligner

Bolian Li, Yanran Wu, Xinyu Luo, Ruqi Zhang

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17570 2025-09-23 cs.CL 57%

Asking a Language Model for Diverse Responses

Sergey Troshin, Irina Saparina, Antske Fokkens, Vlad Niculae

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments UncertaiNLP workshop, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18216 2025-09-18 cs.SE cs.CR cs.LG 57%

Evaluating and Improving the Robustness of Security Attack Detectors Generated by LLMs

Samuele Pasini, Jinhan Kim, Tommaso Aiello, Rocio Cabrera Lozoya, Antonino Sabetta, Paolo Tonella

机构 * Samuele Pasini Universit\`a della Svizzera italiana, Switzerland Jinhan Kim Universit\`a della Svizzera italiana, Switzerland Tommaso Aiello SAP Labs France, France Rocio Cabrera Lozoya SAP Labs France, France Antonino Sabetta SAP Labs France, France Paolo Tonella Universit\`a della Svizzera italiana, Switzerland

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13154 2025-09-17 cs.CL 57%

LLM Hallucination Detection: A Fast Fourier Transform Method Based on Hidden Layer Temporal Signals

Jinxin Li, Gang Tu, ShengYu Cheng, Junjie Hu, Jinting Wang, Rui Chen, Zhilong Zhou, Dongbo Shan

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏