arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2313 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 150 篇

2607.22083 2026-07-28 cs.AI cs.CL 版本更新 62%

Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model

南贝格4.2 - 3B:以紧凑模式解锁智能体能力

Nanbeige Lab, :, Chen Yang, Chengrui Huang, Fufeng Lan, Hanhui Chen, Hao Zhou, Huatong Song, Jiaqi Cao, Jiaying Zhu, Jinlin Niu, Kai Wang, Lisheng Huang, Qiliang Liang, Ran Le, Ruixiang Feng, Shuang Sun, Tao Gu, Tao Zhang, Tianyu Luo, Yang Song, Yun Xing, Yuntao Wen, Ziyao Xu, Zongchao Chen, Zongqiang Li

机构 * Nanbeige LLM Lab(南北贝大语言模型实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 介绍南贝格4.2 - 3B紧凑通用智能体模型,通过特定预训练方式构建,利用多种强化学习方法提升质量与效率,在多任务和基准测试中表现出色,优于更大模型,有潜力成为紧凑本地个人助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29758 2026-07-28 cs.LG cs.AI 版本更新 62%

PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

PS-PPO: 用于无评论者RLHF的前缀采样PPO

Doo Hwan Hwang, Kee-Eung Kim

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。

Journal ref ICML 2026 published

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12393 2026-07-27 cs.CL cs.AI 版本更新 62%

MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph

MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架

Duzhen Zhang, Zixiao Wang, Zhong-Zhi Li, Yahan Yu, Shuncheng Jia, Jiahua Dong, Haotian Xu, Xing Wu, Yingying Zhang, Tielin Zhang, Jie Yang, Xiuying Chen, Le Song

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Kyoto University(京都大学) Tsinghua University(清华大学) East China Normal University(华东师范大学) Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院) GenBio AI

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对医学文献增长带来的知识结构化挑战,引入MedKGent框架,利用PubMed摘要通过两个智能体每日增量构建医学知识图谱,经评估其三元组有效性高,能显著改进大语言模型在医学问答基准上的检索增强生成。

Comments Accepted by Npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02502 2026-07-14 cs.LG cs.AI 版本更新 62%

DemoPSD: Disagreement-Modulated Policy Self-Distillation

DemoPSD: 分歧调节的策略自蒸馏

Yunhe Li, Hao Shi, Wenhao Liu, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Shuang Qiu, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Shenzhen University of Advanced Technology(深圳理工大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出DemoPSD框架,通过选择性采纳教师指导,平衡学生从教师学习和保持自身推理能力,解决特权信息泄露和探索抑制问题,在科学推理任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09714 2026-07-14 cs.SD cs.AI cs.CL eess.AS 版本更新 62%

MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models

MUGEN:评估和改进大型音频-语言模型的多音频理解

Chih-Kai Yang, Yun-Shao Tsai, Yu-Kai Guo, Ping-Le Tsai, Yen-Ting Piao, Hung-Wei Chen, Ting-Lin Hsiao, Yun-Man Hsu, Ke-Han Lu, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 MUGEN通过评估多音频理解能力,揭示了大型音频-语言模型在多音频输入下的性能瓶颈,并通过排列自一致性策略提升了模型的预测准确性。

Comments Interspeech 2026. Project page: https://github.com/danielqwer/MUGEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22448 2026-07-10 cs.LG cs.CL 版本更新 62%

HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning

HeaPA:用于大语言模型强化学习的难度感知堆采样和策略内查询增强

Weiqi Wang, Xin Liu, Binxuan Huang, Hejie Cui, Rongzhi Zhang, Changlong Yu, Shuowei Jin, Jingfeng Yang, Qingyu Yin, Zhengyang Wang, Zheng Li, Yifan Gao, Priyanka Nigam, Bing Yin, Lihong Li, Yangqiu Song

机构 * Stores Foundational AI, Amazon Inc.(亚马逊公司基础人工智能部) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型强化学习中提示采样问题,提出HeaPA方法,通过难度感知堆采样和策略内查询增强,维持动态提示池,跟踪能力前沿,在多数据集和基准测试中提升准确率,减少计算量,尤其在中大型模型规模下效果显著。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10494 2026-07-07 cs.CL cs.LG 版本更新 62%

Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

基于噪声声明验证的覆盖控制偏好挖掘用于基于证据的生成

Weixin Liu, Congning Ni, Qingyuan Song, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学中心) Lirio Virginia Tech(弗吉尼亚理工大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 研究临床简要医院病程总结中基于证据生成的问题,引入VERI-DPO框架,将噪声声明验证转化为覆盖控制的摘要级偏好,经实验验证该框架能降低不支持率,提升模型表现。

Comments 15 pages, 1 figure, 8 tables. Major revision with locked MIMIC-IV transfer evaluation, blinded pairwise human assessment, matched multi-seed ablations, revised title, and revised author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15845 2026-07-01 cs.CL cs.AI 版本更新 62%

Verify when Uncertain: Beyond Self-Consistency in Black Box Hallucination Detection

不确定时验证:超越黑盒幻觉检测中的自一致性

Yihao Xue, Kristjan Greenewald, Youssef Mroueh, Baharan Mirzasoleiman

机构 * MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出两阶段检测算法,结合自一致性与交叉一致性,在保持高检测性能的同时降低计算成本,并通过核均值嵌入提供理论解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00510 2026-06-19 cs.AI cs.LG cs.SE 版本更新 62%

PCBSchemaGen: Reward-Guided LLM Code Synthesis for Printed Circuit Boards (PCB) Schematic Design with Structured Verification

PCBSchemaGen: 奖励引导的LLM代码合成用于印刷电路板(PCB)原理图设计及结构化验证

Huanghaohe Zou, Peng Han, Emad Nazerian, Mafu Zhang, Zhicheng Guo, Alex Q. Huang

机构 * Semiconductor Power Electronics Center (SPEC)(半导体功率电子中心) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Arizona State University(亚利桑那州立大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出PCBSchemaGen框架,通过结构化验证器引导冻结的LLM生成可修复的PCB原理图,在无单元测试的领域实现高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-06-17 cs.LG cs.AI 版本更新 62%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01761 2026-06-17 cs.LG cs.AI 版本更新 62%

Position: Modular Memory is the Key to Continual Learning Agents

Position: 模块化记忆是持续学习智能体的关键

Vaggelis Dorovatas, Malte Schwerin, Andrew D. Bagdanov, Lucas Caccia, Antonio Carta, Laurent Charlin, Barbara Hammer, Tyler L. Hayes, Timm Hess, Christopher Kanan, Dhireesha Kudithipudi, Xialei Liu, Vincenzo Lomonaco, Jorge Mendez-Mendez, Darshan Patil, Ameya Prabhu, Elisa Ricci, Tinne Tuytelaars, Gido M. van de Ven, Liyuan Wang, Joost van de Weijer, Jonghyun Choi, Martin Mundt, Rahaf Aljundi

机构 * University of Bremen(不莱梅大学) Seoul National University(首尔国立大学) Computer Vision Center Barcelona(巴塞罗那计算机视觉中心) University of Florence(佛罗伦萨大学) Microsoft Research(微软研究院) HEC Montreal, Mila--Quebec AI Institute, Canada CIFAR AI Chair(蒙特利尔HEC学院、魁北克人工智能研究所、加拿大CIFAR人工智能 chair) Bielefeld University(比勒海姆大学) Georgia Institute of Technology(佐治亚理工学院) University of Rochester(罗切斯特大学) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Nankai University(南开大学) LUISS University(卢西亚诺大学) Stony Brook University(石溪大学) University of Tübingen(图宾根大学) University of Trento, FBK(特伦托大学,FBK) Tsinghua University(清华大学) University of Groningen(Groningen大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过模块化记忆结合权重内学习与上下文学习,解决持续学习中的灾难性遗忘问题,实现大规模持续适应。

Comments ICML 2026 Position Track Spotlight. This work stems from discussions held at the Dagstuhl seminar on Continual Learning in the Era of Foundation Models (October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02427 2026-06-16 cs.AI cs.LG 版本更新 62%

The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling

模型知晓,解码器发现:未来价值引导的粒子力量采样

Tu Nguyen, Matthieu Zimmer, Rasul Tutunov, Xiaotong Ji, Haitham Bou Ammar

机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) Huawei Noah’s Ark Lab(华为诺亚实验室) UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出APPS算法,通过块状粒子方法高效定位LLM的多步解,提升推理准确率与运行效率,减少对训练数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08794 2026-06-12 cs.LG cs.CL 版本更新 62%

One Token to Fool LLM-as-a-Judge

一个令牌就能欺骗LLM裁判

Yulai Zhao, Haolin Liu, Dian Yu, Sunyuan Kung, Meijia Chen, Haitao Mi, Dong Yu

机构 * Princeton University(普林斯顿大学) University of Virginia(弗吉尼亚大学) Tencent AI Lab(腾讯人工智能实验室) Rutgers University(罗格斯大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 发现基于参考的生成式奖励模型易受奖励黑客攻击,表面输入(如非词符号或通用推理开头)能持续引发假阳性奖励,提出使用截断模型输出作为对抗性负例的数据增强策略,构建鲁棒的Master奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25638 2026-06-08 cs.CL cs.LG 版本更新 62%

Reinforcement Learning from Denoising Feedback

基于去噪反馈的强化学习

Qi He, Huan Chen, Ya Guo, Huijia Zhu, Yi R. Fung, Baojian Zhou

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出RLDF方法,利用去噪反馈进行策略损失估计,通过优化中间噪声状态到裁剪干净状态并结合加权时间步采样,在扩散语言模型上提升性能和泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06915 2026-06-08 cs.CL cs.LG 版本更新 62%

A Dynamic Self-Evolving Extraction System

一种动态自演化抽取系统

Moin Amin-Naseri, Hannah Kim, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出DySECT系统,通过LLM抽取三元组构建知识库,结合概率知识和图推理丰富知识,再反馈优化抽取器,形成闭环持续提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10827 2026-06-17 cs.AI 版本更新 61%

Know Thy Reasoner: Not All Language Models Explore Alike

你的模型多样性,而非方法,决定推理策略

Moulik Choraria, Argyrios Gerogiannis, Anirban Das, Supriyo Chakraborty, Sourya Basu, Sambit Sahu, Lav R. Varshney

机构 * UIUC(伊利诺伊大学香槟分校) Capital One

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.AI

AI总结 本文提出模型多样性影响推理策略,通过理论框架分析推理不确定性,验证了不同模型在深度精炼和并行采样中的表现差异。

Comments This is a full-length extension of the workshop paper that appeared in the ICLR 2026 Workshop on LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02603 2026-06-10 cs.CL 版本更新 61%

CGES: Confidence-Guided Early Stopping for Efficient and Accurate Self-Consistency

CGES:面向高效准确自一致性的置信引导早停方法

Ehsan Aghazadeh, Ahmad Ghasemi, Hedyeh Beyhaghi, Hossein Pishro-Nik

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.CL

AI总结 提出贝叶斯框架CGES,通过自适应停止采样减少自一致性推理调用次数,在5个推理基准上平均减少58%调用且精度损失仅0.4个百分点。

Comments Extended version. A preliminary version was accepted at the Efficient Reasoning Workshop @ NeurIPS 2025. Code: https://github.com/EhsanAghazadeh/cges

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14825 2026-08-19 cs.MA cs.AI 版本更新 57%

Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce

长视野多智能体大语言模型商业环境中涌现的对齐失效通信

Zeyuan Li, Lukas Petersson, Alessandro Acquisti, Michiel A. Bakker

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12898 2026-08-19 cs.CV cs.AI 版本更新 57%

NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航

Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, MingKun Jiang, Zhongjiang He, Hao Sun

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07565 2026-08-19 cs.CV cs.AI 版本更新 57%

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议

Zhijing Zhang, Jinpeng Yu, Xin Song, Bingnan Li, Chuyue Li, Changhui Du, Xiaolin Fang, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务单元) Southeast University(东南大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究针对对话系统的图像创作场景,提出三阶段多模态推荐框架,经测试可降低视觉不一致率并显著提升推荐相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08642 2026-08-19 cs.CL 版本更新 57%

DominoTree: Conditional Tree-Structured Drafting with Domino for Speculative Decoding

DominoTree:使用Domino进行条件树结构草稿的推测性解码

Saw S. Lin, Jyh-Shing Roger Jang

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与资讯工程学系)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究提出DominoTree,一种无需训练的最佳优先草稿树,利用Domino的条件非因式分解校正评分。在Qwen3-4B等基准测试中,相比自回归解码加速显著,接受长度高,用GPU原生构建器保持低成本,在吞吐量上优于多种方法。

Comments 32 pages, 2 figures, 16 tables. Code: https://github.com/slin-zhq/Domino-Tree

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-17 cs.AI 版本更新 57%

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11175 2026-08-13 cs.AI 版本更新 57%

The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy

自我进化临床系统之路:将医疗智能体从辅助扩展到自主

Chunzheng Zhu, Lei Tian, Bohan Tan, Ziqi Zhou, Yuxuan Sun, Yijun Wang, Chengchao Lv, Yilin Wen, Yijun He, Jinghao Lin, Yihang Chen, Chee Wei Tan, Qianshan Wei, Lei Zhao, Bin Pu, Kenli Li, Yuan Xue, Jianxin Lin

机构 * Hunan University(湖南大学) ByteDance(字节跳动) Duke University(杜克大学) Westlake University(西湖大学) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Macau(澳门大学) The Ohio State University(俄亥俄州立大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI

AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。

Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20173 2026-08-12 cs.AI cs.SE 版本更新 57%

A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM Agents

为生产大语言模型代理选择和组合运行时架构模式的方法

Vasundra Srinivasan

机构 * AI Architect, Independent Researcher(人工智能架构师,独立研究员) Stanford School of Engineering(斯坦福大学工程学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出了一种方法,用于选择和组合运行时架构模式,以定义大语言模型代理的随机-确定性边界,并探讨其在不同代理类型中的应用及可靠性分解。

Comments 26 pages, 2 figures, 6 tables. Companion repo at https://github.com/vasundras/agent-runtime-patterns

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09921 2026-08-12 cs.LG 版本更新 57%

A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models

双温度的故事:从扩散语言模型中实现简单、高效且多样的采样

Theo X. Olausson, Metod Jazbec, Xi Wang, Armando Solar-Lezama, Christian A. Naesseth, Stephan Mandt, Eric Nalisnick

机构 * Massachusetts Institute of Technology(麻省理工学院) UvA-Bosch Delta Lab, University of Amsterdam(阿姆斯特丹大学UvA-Bosch Delta实验室) Johns Hopkins University(约翰霍普金斯大学) University of California, Irvine(加州大学尔湾分校)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

AI总结 本文提出通过温和的温度化方法提升扩散语言模型采样多样性,实现高效且多样化的样本生成,优于现有方法。

Comments V2: accepted as a full conference paper at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11027 2026-08-11 cs.LG 版本更新 57%

On the Effect of Sampling Diversity in Scaling LLM Inference

在LLM推理扩展中采样多样性的影响

Tianchun Wang, Zichuan Liu, Yuanzhou Chen, Jonathan Light, Weiyang Liu, Haifeng Chen, Xiang Zhang, Wei Cheng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加州大学洛杉矶分校) Rensselaer Polytechnic Institute(罗切斯特理工学院) The Chinese University of Hong Kong(香港中文大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) NEC Laboratories America(NEC美国实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了在LLM推理扩展中采样多样性对性能的影响,通过理论和实验证明多样化的采样能提升模型表现,并在不同任务中实现了显著的增益。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29678 2026-08-10 cs.CL cs.DC cs.PF 版本更新 57%

TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving

TokTier:面向智能体大语言模型服务的精确有状态分词方案

Zhenyu Zhang, Zhichao Cao

机构 * Arizona State University(亚利桑那州立大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本研究提出TokTier,一种面向智能体LLM服务的精确有状态分词方案,通过增量修复、GPU加速分词等技术,将首次令牌生成时间降低16%-34%,饱和请求速率提升至1821次/秒,性能远超现有方案。

Comments 26 pages. Code: https://github.com/asu-idi/toktier

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14158 2026-08-07 cs.HC cs.LG 版本更新 57%

Clinician input steers AI toward accurate and harmful recommendations

临床输入引导前沿AI模型做出准确和有害的决策

Ivan Lopez, Selin S. Everett, Bryan J. Bunning, April S. Liang, Dong Han Yao, Shivam C. Vedak, Kameron C. Black, Sophie Ostmeier, Stephen P. Ma, Emily Alsentzer, Jonathan H. Chen, Akshay S. Chaudhari, Eric Horvitz

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究评估了临床输入如何影响AI模型在诊断生成和下一步建议中的表现,发现专家上下文显著提升诊断准确性,而对抗性上下文导致诊断退化,且模型在多轮对话中表现出不同的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10917 2026-08-03 cs.AI 版本更新 57%

Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution

Role-Agent: 通过双角色演化引导LLM智能体

Xucong Wang, Ziyu Ma, Shidong Yang, Tongwen Huang, Pengkun Wang, Yong Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出Role-Agent框架,让单个LLM同时作为智能体和环境,通过世界在智能体(WIA)和智能体在世界(AIW)两个组件实现自举协同演化,在多个基准上平均提升超过4%。

Comments 20 pages, including 12 pages of main text and 8 pages of appendix; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15100 2026-08-03 cs.AI 版本更新 57%

Dual-Dimensional Consistency: Balancing Budget and Quality in Adaptive Inference-Time Scaling

双维度一致性:在适应性推理时间扩展中平衡预算与质量

Rongman Xu, Yifei Li, Tianzhe Zhao, Yanrui Wu, Bo Li, Hang Yan

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出双维度一致性框架,通过结合置信度加权贝叶斯协议与趋势感知分层剪枝,平衡推理预算与质量,减少10倍以上token消耗并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏