arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2608.12629 2026-08-14 cs.LG 新提交 57%

CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

CAKE:面向前沿核函数演进的编译器-智能体协同设计

Zihao Ye, Yingyi Huang, Hongyi Jin, Bohan Hou, Junru Shao, Zhongming Yu, Jinqi Chen, Meghan Cowan, Shiyi Cao, Shanli Xing, Hanfeng Chen, Vinod Grover, Tianqi Chen, Luis Ceze

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达公司)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出CAKE编译器-智能体协同设计方案,通过硬件显式IR实现GPU核函数演进,在Flash-KMeans等基准测试中性能优于CUDA/PTX,相关成果已提交上游PR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11830 2026-08-13 cs.CY cs.CL 新提交 57%

Quantifying the Relationship Between Clinical Safety and Environmental Impact in Therapeutic LLMs

量化治疗型大语言模型(LLMs)的临床安全性与环境影响之间的关系

Alireza A. Safaei, Laura M. Vowels, Matthew J. Vowels, Apoorv Jha, Shekoufeh Rahimi

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

AI总结 该研究量化治疗型LLMs的临床安全性与环境影响的关系,发现安全分布高端存在非线性权衡,额外测试时计算未必提升安全,提出动态模型选择等可持续部署方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11175 2026-08-13 cs.AI 版本更新 57%

The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy

自我进化临床系统之路:将医疗智能体从辅助扩展到自主

Chunzheng Zhu, Lei Tian, Bohan Tan, Ziqi Zhou, Yuxuan Sun, Yijun Wang, Chengchao Lv, Yilin Wen, Yijun He, Jinghao Lin, Yihang Chen, Chee Wei Tan, Qianshan Wei, Lei Zhao, Bin Pu, Kenli Li, Yuan Xue, Jianxin Lin

机构 * Hunan University(湖南大学) ByteDance(字节跳动) Duke University(杜克大学) Westlake University(西湖大学) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Macau(澳门大学) The Ohio State University(俄亥俄州立大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI

AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。

Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10626 2026-08-12 cs.CL 新提交 57%

Dual-Loop Self-Evolution via Verifiable Emotion Feedback for Multi-Turn Empathetic Dialogue

基于可验证情感反馈的双循环自演化多轮共情对话

Yi Wei, Shuo Jiang, Huaixia Dou, Jie Zhu, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 该研究针对大语言模型共情能力不足问题,提出双循环自演化框架,在SAGE数据集上显著提升Qwen3-8B的共情对话性能,优于对比方法。

Comments 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20173 2026-08-12 cs.AI cs.SE 版本更新 57%

A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM Agents

为生产大语言模型代理选择和组合运行时架构模式的方法

Vasundra Srinivasan

机构 * AI Architect, Independent Researcher(人工智能架构师,独立研究员) Stanford School of Engineering(斯坦福大学工程学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出了一种方法,用于选择和组合运行时架构模式,以定义大语言模型代理的随机-确定性边界,并探讨其在不同代理类型中的应用及可靠性分解。

Comments 26 pages, 2 figures, 6 tables. Companion repo at https://github.com/vasundras/agent-runtime-patterns

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09921 2026-08-12 cs.LG 版本更新 57%

A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models

双温度的故事:从扩散语言模型中实现简单、高效且多样的采样

Theo X. Olausson, Metod Jazbec, Xi Wang, Armando Solar-Lezama, Christian A. Naesseth, Stephan Mandt, Eric Nalisnick

机构 * Massachusetts Institute of Technology(麻省理工学院) UvA-Bosch Delta Lab, University of Amsterdam(阿姆斯特丹大学UvA-Bosch Delta实验室) Johns Hopkins University(约翰霍普金斯大学) University of California, Irvine(加州大学尔湾分校)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

AI总结 本文提出通过温和的温度化方法提升扩散语言模型采样多样性,实现高效且多样化的样本生成,优于现有方法。

Comments V2: accepted as a full conference paper at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07565 2026-08-11 cs.CV cs.AI 新提交 57%

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议

Zhijing Zhang, Jinpeng Yu, Xin Song, Bingnan Li, Chuyue Li, Changhui Du, Xiaolin Fang, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务单元) Southeast University(东南大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究针对对话系统的图像创作场景,提出三阶段多模态推荐框架,经测试可降低视觉不一致率并显著提升推荐相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07509 2026-08-11 cs.HC cs.AI 新提交 57%

PIVOT: Preference-based Intervention Vectors for Pedagogical Tutor Steering

PIVOT:用于教学导师引导的基于偏好的干预向量

Fares Fawzi, Jiaxu Zhao, Tanya Nazaretsky, Tanja Käser

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究针对LLM对话辅导缺乏教学策略推理时控制的问题,提出PIVOT框架,通过偏好干预向量实现导师动作控制,在用户研究中获多数教师认可。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11027 2026-08-11 cs.LG 版本更新 57%

On the Effect of Sampling Diversity in Scaling LLM Inference

在LLM推理扩展中采样多样性的影响

Tianchun Wang, Zichuan Liu, Yuanzhou Chen, Jonathan Light, Weiyang Liu, Haifeng Chen, Xiang Zhang, Wei Cheng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加州大学洛杉矶分校) Rensselaer Polytechnic Institute(罗切斯特理工学院) The Chinese University of Hong Kong(香港中文大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) NEC Laboratories America(NEC美国实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了在LLM推理扩展中采样多样性对性能的影响,通过理论和实验证明多样化的采样能提升模型表现,并在不同任务中实现了显著的增益。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06503 2026-08-10 cs.LG 新提交 57%

Toward Reliable Context Compression for Long-Horizon Agents: An Empirical Study of Execution Instability

面向长 horizon 智能体的可靠上下文压缩:执行不稳定性的实证研究

Guanghui Min, Liang Wu, Mayank Darbari, Chen Chen, Liangjie Hong

机构 * University of Virginia(弗吉尼亚大学) Nokia(诺基亚公司)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 该研究针对长 horizon 智能体上下文压缩的执行不稳定性问题,提出了验证器引导框架 TRACE,在 AppWorld 上的实验显示其在任务性能等指标上优于现有基线,为可靠上下文压缩提供了新方向。

Comments 31 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29678 2026-08-10 cs.CL cs.DC cs.PF 版本更新 57%

TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving

TokTier:面向智能体大语言模型服务的精确有状态分词方案

Zhenyu Zhang, Zhichao Cao

机构 * Arizona State University(亚利桑那州立大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本研究提出TokTier,一种面向智能体LLM服务的精确有状态分词方案,通过增量修复、GPU加速分词等技术,将首次令牌生成时间降低16%-34%,饱和请求速率提升至1821次/秒,性能远超现有方案。

Comments 26 pages. Code: https://github.com/asu-idi/toktier

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14158 2026-08-07 cs.HC cs.LG 版本更新 57%

Clinician input steers AI toward accurate and harmful recommendations

临床输入引导前沿AI模型做出准确和有害的决策

Ivan Lopez, Selin S. Everett, Bryan J. Bunning, April S. Liang, Dong Han Yao, Shivam C. Vedak, Kameron C. Black, Sophie Ostmeier, Stephen P. Ma, Emily Alsentzer, Jonathan H. Chen, Akshay S. Chaudhari, Eric Horvitz

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究评估了临床输入如何影响AI模型在诊断生成和下一步建议中的表现,发现专家上下文显著提升诊断准确性,而对抗性上下文导致诊断退化,且模型在多轮对话中表现出不同的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04066 2026-08-06 cs.AI 新提交 57%

The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents

大模型提出方案,执行体处理:一种自验证智能体工具,可将长程智能体中的承诺漂移与绑定漂移分离

Mohsen Arjmandi

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本研究提出一种自验证智能体工具,可分离长程智能体的承诺漂移与绑定漂移,通过实验揭示消融承诺机制会提升目标放弃率,且贡献了可量化漂移分解的智能体验证方法论。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03961 2026-08-05 cs.AI 新提交 57%

Interpretable Adaptive Sampling for LLM Test-Time Scaling

面向大语言模型测试时缩放的可解释自适应采样

Mobina Kashaniyan, Ali Jannesari

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对LLM测试时推理的固定计算预算不灵活、不可解释的问题,提出带轻量级模糊控制器的自适应采样方法,在问答和数学任务上提升性能并减少平均采样数,为高效测试时推理提供实用方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02843 2026-08-05 cs.CR cs.AI 新提交 57%

MutMem: Cryptographically Authorized Mutation in Persistent Agent Memory

MutMem:持久智能体内存中的密码学授权突变

Walid Saidi

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本研究针对持久智能体内存的授权与防篡改问题,提出HOM-AIMOS中的MutMem协议,经实验验证其在多个基准任务中表现良好,可有效抵御中毒攻击。

Comments https://github.com/wallidsaydi-creator/HOM-AIMOS. 32 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02642 2026-08-05 physics.chem-ph cs.AI 新提交 57%

MDArena: Evaluating Coding Agents on Realistic Molecular Dynamics Workflows

MDArena:面向真实分子动力学工作流的编码智能体评估基准

Nithishwer Mouroug Anand, Wei-Tse Hsu, Kyle Vaccaro, Eden James Gage, Jonathan David Colburn, Linda Xi Phan, Minjoon Seo, Kevin Guan, Philip C. Biggin

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 MDArena基准评估了6种编码智能体在真实分子动力学任务上的表现,发现其在精细科学工作流细节上存在不足,为追踪其可靠性进展提供了平台。

Comments 17 pages including appendices, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00195 2026-08-04 eess.IV cs.CV cs.LG 新提交 57%

MedSAM2-Anatomy: Training-Free Inference-Time Optimization for Musculoskeletal Segmentation

MedSAM2-Anatomy:面向肌肉骨骼分割的无训练推理时优化方法

John Garcia Henao, Nicholas Bünger, Benedikt Herzog, Cindy Guerrero Toro, Benjamin Vella, Matthias Biner, Rico Brütsch, Carmen Castroviejo Fernandez, Felix Öttl, Norman Juchler, Armando Hoch, Bettina Hochreiter, Sven Hirsch, Sebastiano Caprara

专题命中 测试时计算 :planning(abstract);分类 cs.LG

AI总结 MedSAM2-Anatomy是一种无训练的推理时优化框架,通过融合专家模型生成的自动解剖提示,提升冻结分割模型的髋部、肩部肌肉骨骼分割性能,无需人工提示或模型重训。

Comments Original research manuscript (13 pages, 4 figures, 2 tables). No prior publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00215 2026-08-04 cs.AI 新提交 57%

Personalizing Large Language Model Agents with Small Policy Models

用小型策略模型个性化大型语言模型智能体

Dian Jin, Zhi Zhang, Huichao Li, Yihe Pan, Rundong Huang, Doudou Zhou

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出轻量级策略层FABLE,通过在线学习用户执行策略实现LLM智能体个性化,在多类评估中改进偏好敏感行为且保持端到端任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00017 2026-08-04 cs.AI cs.CE 新提交 57%

Memory Reward Inflation in Self-Improving LLM Agents

自改进大语言模型智能体中的记忆奖励膨胀

Mohammad Asadolahi, Amir Amini, Samira Talebi, Amirfarhad Farhadi, Azadeh Zamanifar

机构 * University Of North Texas(北得克萨斯大学) Edge Hill University(边山大学) University of Cincinnati(辛辛那提大学) Iran University of Science and Technology(伊朗科技大学) Islamic Azad University(伊斯兰阿扎德大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究发现自改进大语言模型智能体存在记忆奖励膨胀的“回声差距”问题,提出误差独立性假设(EIA),并通过LUCID算法在BIRD文本到SQL基准上提升了执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29032 2026-08-03 cs.MA cs.CL 新提交 57%

TransMem: Transforming Hidden States into Memory for Large Language Models

TransMem:将隐藏状态转换为大语言模型的记忆

Haodong Lei, Junming Liu, Yirong Chen, Pinlong Cai, Botian Shi, Ding Wang, Hongsong Wang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 针对长上下文LLM智能体的历史信息未充分利用问题,提出轻量级记忆模块TransMem,结合证据条件自蒸馏,在多基准测试中显著提升性能。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28990 2026-08-03 cs.AI 新提交 57%

Scaling Scientific Discovery Environments for Turn-Level Agentic RL

面向回合级智能体强化学习的科学发现环境扩展

Yucheng Xu, Keyi Zhang, Yuyang Yu, Min Zhang, Shiyuan Meng, Pei Chu, Zhongying Tu

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出可扩展框架SciDisco,结合SciThèque与DiscoPO,训练出的SciDisco-14B在假设驱动的科学数据分析基准上实现了当前最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28890 2026-08-03 cs.HC cs.AI 新提交 57%

Agreement Is Not Quality: Blind Expert Verification of Human and LLM Qualitative Coding When Human Consensus Is Not Ground Truth

一致性并非质量:当人类共识并非真值时,对人类与大语言模型定性编码的盲专家验证

Alex Liu, Lief Esbenshade, Michael Xiao, Victor Tian, Zachary Zhang, Kevin He, Min Sun

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究发现以人类共识为标准的一致性评估无法准确衡量LLM定性编码质量,盲专家验证显示部分LLM编码优于人类,提出了可迁移的验证协议与编码分工框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10917 2026-08-03 cs.AI 版本更新 57%

Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution

Role-Agent: 通过双角色演化引导LLM智能体

Xucong Wang, Ziyu Ma, Shidong Yang, Tongwen Huang, Pengkun Wang, Yong Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出Role-Agent框架,让单个LLM同时作为智能体和环境,通过世界在智能体(WIA)和智能体在世界(AIW)两个组件实现自举协同演化,在多个基准上平均提升超过4%。

Comments 20 pages, including 12 pages of main text and 8 pages of appendix; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15100 2026-08-03 cs.AI 版本更新 57%

Dual-Dimensional Consistency: Balancing Budget and Quality in Adaptive Inference-Time Scaling

双维度一致性:在适应性推理时间扩展中平衡预算与质量

Rongman Xu, Yifei Li, Tianzhe Zhao, Yanrui Wu, Bo Li, Hang Yan

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出双维度一致性框架,通过结合置信度加权贝叶斯协议与趋势感知分层剪枝,平衡推理预算与质量,减少10倍以上token消耗并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27733 2026-07-31 cs.AI 新提交 57%

VeriSkill: A Self-Evolution Framework for Program Verification Skills

VeriSkill:一种用于程序验证技能的自进化框架

Changguo Jia, Tianqi Zhao, Zhiyou Xiao, Weiming Zhang, Minghui Zhou

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出专为程序验证设计的自进化框架VeriSkill,可将验证失败归因于技能缺陷并迭代优化技能,实验显示其在多种场景下均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27578 2026-07-31 cs.AI 新提交 57%

What makes prompts a graph: necessary and sufficient conditions for prompt graph engineering

提示词为何构成图:提示词图工程的充要条件

Sandeco Macedo

机构 * Federal Institute of Goiás(戈亚斯联邦学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过文献分析构建了将提示词视为图节点的定义,提出提示词图工程的四个条件及操作化测试,明确其边界并应用于六个系统,为相关实践提供可操作定义与共享术语。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27269 2026-07-31 cs.LG 新提交 57%

Beyond KV Reconstruction: Functional Reconstruction for MLA Draft Models in Speculative Decoding

超越KV重建:推测解码中MLA草稿模型的功能重建

Weiye Shi, Fanxu Meng, Muhan Zhang

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 针对推测解码中MHA/GQA转MLA导致草稿令牌接受率降低的问题,提出功能重建方法优化转换后的MLA注意力模块,在多数任务中提升了草稿令牌接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24162 2026-07-31 cs.CR cs.AI 版本更新 57%

Defusing the Trigger: Tail-Risk-Informed Attention Rebalancing for LLM Backdoor Mitigation

解除触发器:通过尾风险内在几何平滑实现的插件式防御方法用于后门LLM

Kaisheng Fan, Yishu Gao, Xunzhu Tang, Tegawendé F. Bissyandé, Weizhe Zhang

机构 * School of Cyber Science and Technology(网络安全科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) University of Luxembourg(卢森堡大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TIGS方法,通过在推理时进行内容感知的尾风险筛查和内在几何平滑,有效抑制后门攻击,同时保持推理稳定性和语义一致性,适用于多种架构的LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26819 2026-07-30 cs.SE cs.AI 新提交 57%

A First Look at Coding Agents' Compliance with AI Contribution Rules in Open-Source Communities

初探编码智能体在开源社区中对AI贡献规则的合规性

Wenhao Yang, Runzhi He, Minghui Zhou

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01097 2026-07-30 cs.LG 版本更新 57%

Understanding LoRA as Knowledge Memory: An Empirical Analysis

理解LoRA作为知识记忆:一项实证分析

Seungju Back, Dongwoo Lee, Naun Kang, Taehee Lee, S. K. Hong, Youngjune Gwon, Sungjin Ahn

机构 * New York University(纽约大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文通过系统实证研究,将低秩适配(LoRA)作为模块化知识记忆,探索其存储容量、内部化优化、多模块系统扩展及长上下文推理能力,提供LoRA记忆操作边界的实用指导。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏