arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1997 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1997 篇

2512.14082 2025-12-17 cs.CL 57%

A Unified Sparse Attention via Multi-Granularity Compression

一种通过多粒度压缩的统一稀疏注意力机制

Siran Liu, Zane Cao, Yongchao He

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 UniSparse通过多粒度压缩和块级选择,实现高效稀疏注意力机制,提升LLM在长上下文理解和推理中的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11718 2025-12-15 cs.CL 57%

Speculative Decoding Speed-of-Light: Optimal Lower Bounds via Branching Random Walks

投机解码速度光速:通过分支随机游走建立最优下界

Sergey Pankratov, Dan Alistarh

机构 * ISTA Red Hat AI(红帽AI)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 通过分支随机游走分析,研究确定了投机解码算法的最优运行时间下界,并通过实验验证了理论结果的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03506 2025-12-11 cs.AI 57%

OneFlow: Concurrent Mixed-Modal and Interleaved Generation with Edit Flows

OneFlow:并发混合模态与交错生成的编辑流

John Nguyen, Marton Havasi, Tariq Berrada, Luke Zettlemoyer, Ricky T. Q. Chen

机构 * FAIR at Meta(Meta 的 FAIR 部门) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK, France(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、法国国家信息与自动化技术研究所、格勒诺布尔理工大学、LJK、法国)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 OneFlow是一种非自回归多模态模型,通过编辑流和流匹配实现并发混合模态生成,优于自回归和扩散方法,提升生成效率和推理能力。

Comments https://oneflow.framer.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05546 2025-12-08 cs.CV cs.AI 57%

Conscious Gaze: Adaptive Attention Mechanisms for Hallucination Mitigation in Vision-Language Models

有意识的注视:用于视觉-语言模型中幻觉抑制的自适应注意力机制

Weijue Bu, Guan Yuan, Guixian Zhang

机构 * School of Computer Science and Technology/School of Artificial Intelligence(计算机科学与技术学院/人工智能学院) China University of Mining and Technology(中国矿业大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 CG-VLM通过认知需求传感器和聚焦共识诱导模块,在推理时精准干预视觉-语言模型的注意力,有效抑制幻觉并提升性能。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04555 2025-12-05 cs.CL 57%

ADAPT: Learning Task Mixtures for Budget-Constrained Instruction Tuning

ADAPT:为预算受限的指令微调学习任务混合

Pritam Kadasi, Abhishek Upperwal, Mayank SIngh

机构 * Lingo Research Group, Indian Institute of Technology Gandhinagar(林戈研究组,印度理工学院冈德hinagar分校) Soket AI(Soket人工智能)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 ADAPT通过学习任务采样比例优化预算受限的指令微调,提升下游任务性能并更高效地分配训练资源。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03874 2025-12-04 cs.RO cs.LG 57%

OmniDexVLG: Learning Dexterous Grasp Generation from Vision Language Model-Guided Grasp Semantics, Taxonomy and Functional Affordance

OmniDexVLG: 从视觉语言模型引导的抓取语义、分类法和功能可及性中学习灵巧抓取生成

Lei Zhang, Diwen Zheng, Kaixin Bai, Zhenshan Bing, Zoltan-Csaba Marton, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * University of Hamburg(汉堡大学) Agile Robots SE(敏捷机器人公司) Technical University of Munich(慕尼黑技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 OmniDexVLG通过多模态语义推理和统一视觉语言模型,实现从自然语言指令中生成多样且语义连贯的灵巧抓取。

Comments Project Website: https://sites.google.com/view/omnidexvlg, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03097 2025-12-04 cs.CR cs.LG cs.MA 57%

Many-to-One Adversarial Consensus: Exposing Multi-Agent Collusion Risks in AI-Based Healthcare

多对一对抗共识:揭示基于AI的医疗保健中多智能体合谋的风险

Adeela Bashir, The Anh han, Zia Ush Shamszaman

机构 * School of Computing, Engineering and Digital Technologies(计算、工程与数字技术学院) Teesside University(泰赛德大学) Center for Digital Innovation(数字创新中心)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本研究揭示了基于AI的医疗保健中多智能体合谋的风险,提出了一种轻量级防御机制以确保临床指南的准确性。

Comments 7 pages Conference level paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10746 2025-12-04 cs.CL 57%

RECAP: Transparent Inference-Time Emotion Alignment for Medical Dialogue Systems

RECAP:医疗对话系统中透明的推理时间情感对齐

Adarsh Srinivasan, Jacob Dineen, Muhammad Umar Afzal, Muhammad Uzair Sarfraz, Irbaz B. Riaz, Ben Zhou

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 RECAP通过结构化情感推理提升医疗对话系统的情感响应质量,实现透明和可审计的同理心沟通。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02807 2025-12-03 cs.CL 57%

SR-GRPO: Stable Rank as an Intrinsic Geometric Reward for Large Language Model Alignment

SR-GRPO:稳定秩作为大语言模型对齐的内在几何奖励

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 SR-GRPO通过稳定秩作为内在几何奖励信号,无需外部监督提升大语言模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00789 2025-12-02 cs.CL 57%

Auxiliary-Hyperparameter-Free Sampling: Entropy Equilibrium for Text Generation

辅助超参数-free采样:信息论视角下的文本生成熵平衡

Xiaodong Cai, Hai Lin, Shaoxiong Zhan, Weiqi Luo, Hong-Gee Kim, Hongyan Hao, Yu Yang, Hai-Tao Zheng

机构 * Meituan(美团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出熵平衡采样方法,通过信息论原理实现无超参数调优的文本生成,提升生成质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00670 2025-12-02 cs.AI 57%

EDIT: Early Diffusion Inference Termination for dLLMs Based on Dynamics of Training Gradients

EDIT:基于训练梯度动态的早期扩散推理终止用于dLLMs

He-Yen Hsieh, Hong Wang, H. T. Kung

机构 * CISPA Harvard University(哈佛大学) Intel Corporation(英特尔公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 EDIT通过利用训练梯度动态,在保持准确性的同时减少dLLM推理步骤,提升效率。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18624 2025-12-02 cs.CL 57%

Checklists Are Better Than Reward Models For Aligning Language Models

检查表比奖励模型更能对齐语言模型

Vijay Viswanathan, Yanchao Sun, Shuang Ma, Xiang Kong, Meng Cao, Graham Neubig, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本文提出基于检查表反馈的强化学习方法,通过灵活的指令特定准则提升语言模型的指令遵循能力,在多个基准测试中均取得性能提升。

Comments Presented at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21185 2025-11-27 cs.CV cs.AI 57%

Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation

分块进展:用于自回归图像生成的测试时扩展

Joonhyung Park, Hyeongwon Jang, Joowon Kim, Eunho Yang

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 GridAR通过网格分区逐步生成和布局指定提示重述策略,在有限测试时扩展下提升视觉自回归模型的生成质量与编辑效果。

Comments Project page: https://grid-ar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20677 2025-11-27 cs.CL cs.DB 57%

Prompt Engineering Techniques for Context-dependent Text-to-SQL in Arabic

针对阿拉伯语上下文依赖文本到SQL的提示工程技术

Saleh Almohaimeed, May Alsofyani, Saad Almohaimeed, Mansour Al Ghanim, Liqiang Wang

机构 * Department of Computer Science University of Central Florida Orlando, Florida, USA(计算机科学系 佛罗里达中央大学 奥兰多分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本文提出Ar-SParC数据集及GAT corrector方法,通过提示工程技术提升阿拉伯语文本到SQL任务的性能。

Comments Accepted at IJCNN 2025 (to appear in IEEE/IJCNN proceedings). This arXiv submission corresponds to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19671 2025-11-26 cs.AI 57%

FISCAL: Financial Synthetic Claim-document Augmented Learning for Efficient Fact-Checking

FISCAL: 金融合成声明-文档增强学习用于高效事实核查

Rishab Sharma, Iman Saberi, Elham Alipour, Jie JW Wu, Fatemeh Fard

机构 * Charli Capital(Charli资本) University of British Columbia(不列颠哥伦比亚大学) Michigan Technological University(密歇根技术大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 FISCAL通过生成领域特定合成数据和高效微调,使小型模型在金融事实核查任务中达到最先进的准确性、鲁棒性和可扩展性。

Comments 3 tables, 11 pages, 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Generative AI in Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24645 2025-11-18 cs.AI 57%

FunReason-MT Technical Report: Advanced Data Synthesis Solution for Real-world Multi-Turn Tool-use

Zengzhuang Xu, Bingguang Hao, Zechuan Wang, Yuntao Wen, Xinyi Xu, Yang Liu, Long Chen, Dong Wang, Maolin Wang, Tong Zhao, Yicheng Chen, Cunyin Peng, Jinjie Gu, Leilei Gan, Xiangyu Zhao, Chenyi Zhuang, Shi Gu

机构 * Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05925 2025-11-18 cs.CY cs.AI 57%

Small Models, Big Support: A Local LLM Framework for Educator-Centric Content Creation and Assessment with RAG and CAG

Zarreen Reza, Alexander Mazur, Michael T. Dugdale, Robin Ray-Chaudhuri

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24967 2025-11-17 cs.CR cs.AI 57%

SecInfer: Preventing Prompt Injection via Inference-time Scaling

Yupei Liu, Yanting Wang, Yuqi Jia, Jinyuan Jia, Neil Zhenqiang Gong

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09844 2025-11-14 cs.LG cs.PF 57%

Steering Pretrained Drafters during Speculative Decoding

Frédéric Berdoz, Peer Rheinboldt, Roger Wattenhofer

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22812 2025-11-11 cs.CL 57%

EditGRPO: Reinforcement Learning with Post-Rollout Edits for Clinically Accurate Chest X-Ray Report Generation

Kai Zhang, Christopher Malon, Lichao Sun, Martin Renqiang Min

机构 * NEC Laboratories America(NEC美国实验室) Lehigh University(莱特大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04285 2025-11-07 cs.AI 57%

RLoop: An Self-Improving Framework for Reinforcement Learning with Iterative Policy Initialization

Zeng Zhiyuan, Jiashuo Liu, Zhangyue Yin, Ge Zhang, Wenhao Huang, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04234 2025-11-07 cs.CL 57%

Reusing Pre-Training Data at Test Time is a Compute Multiplier

Alex Fang, Thomas Voice, Ruoming Pang, Ludwig Schmidt, Tom Gunter

机构 * Apple(苹果公司) Stanford(斯坦福大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18948 2025-11-07 cs.LG cs.CC cs.FL 57%

Exact Expressive Power of Transformers with Padding

William Merrill, Ashish Sabharwal

机构 * Allen Institute for AI(艾伦人工智能研究所)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

Comments Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03471 2025-11-06 cs.AI cs.HC 57%

Towards Scalable Web Accessibility Audit with MLLMs as Copilots

Ming Gu, Ziwei Wang, Sicen Lai, Zirui Gao, Sheng Zhou, Jiajun Bu

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 15 pages. Accepted by AAAI 2026 AISI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19248 2025-11-06 cs.LG 57%

Inference-Time Reward Hacking in Large Language Models

Hadi Khalaf, Claudio Mayrink Verdun, Alex Oesterling, Himabindu Lakkaraju, Flavio du Pin Calmon

机构 * Harvard University(哈佛大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments Accepted to NeurIPS 2025 (Spotlight Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18018 2025-11-06 cs.CL 57%

Verdict: A Library for Scaling Judge-Time Compute

Nimit Kalra, Leonard Tang

机构 * Haize Labs(Haize实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02095 2025-11-04 cs.CV cs.LG 57%

Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences

Hyojin Bahng, Caroline Chan, Fredo Durand, Phillip Isola

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23393 2025-10-28 cs.LG 57%

The Best of N Worlds: Aligning Reinforcement Learning with Best-of-N Sampling via max@k Optimisation

Farid Bagirov, Mikhail Arkhipov, Ksenia Sycheva, Evgeniy Glukhov, Egor Bogomolov

机构 * JetBrains Research(JetBrains研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23334 2025-10-28 cs.CL 57%

Adaptive Blockwise Search: Inference-Time Alignment for Large Language Models

Mohammad Atif Quamar, Mohammad Areeb, Nishant Sharma, Ananth Shreekumar, Jonathan Rosenthal, Muslum Ozgur Ozmen, Mikhail Kuznetsov, Z. Berkay Celik

机构 * Purdue University(普渡大学) Arizona State University(亚利桑那州立大学) Amazon(亚马逊)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09663 2025-10-28 cs.LG 57%

Analog Foundation Models

Julian Büchel, Iason Chalas, Giovanni Acampa, An Chen, Omobayode Fagbohungbe, Sidney Tsai, Kaoutar El Maghraoui, Manuel Le Gallo, Abbas Rahimi, Abu Sebastian

机构 * IBM Research – Zurich(IBM瑞士研究实验室) ETH Zürich(苏黎世联邦理工学院) IBM Research – Almaden(IBM加州阿尔玛登研究实验室) IBM Thomas J. Watson Research Center(IBM托马斯·J·沃森研究中心)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

Comments Neural Information Processing Systems (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏