arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 255 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 255 篇

2606.19468 2026-06-19 cs.CL 新提交 57%

Characterizing Narrative Content in Web-scale LLM Pretraining Data

网络规模LLM预训练数据中的叙事内容特征化

Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

机构 * University of Colorado Boulder(科罗拉多大学波尔德分校) ETH Zürich(苏黎世联邦理工学院) McGill University(麦吉尔大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 首次细粒度研究LLM预训练语料库Dolma的叙事特征,提出涵盖三个核心叙事元素(能动性、场景、事件)的框架,构建NarraBERT模型并发布NarraDolma数据集,揭示叙事结构在异构数据中可测量且分布不均。

Comments 8 pages of main content, 28 total pages. 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18967 2026-06-18 cs.LG 新提交 57%

EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts

EfficientRollout: 面向强化学习推演的感知系统的自推测解码

Minseo Kim, Minjae Lee, Seunghyuk Oh, Kevin Galim, Donghoon Kim, Coleman Hooper, Harman Singh, Amir Gholami, Hyung Il Koo, Wonjun Kang

机构 * FuriosaAI University of California, Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 针对强化学习推演中自回归解码延迟瓶颈,提出感知系统的自推测解码框架,通过量化自推测解码器与感知系统的推测开关策略,在保持模型质量前提下降低推演和端到端延迟。

Comments Project Page: https://github.com/furiosa-ai/EfficientRollout

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18022 2026-06-17 cs.LG 新提交 57%

Recursive Scaling in Masked Diffusion Models

掩码扩散模型中的递归缩放

Alba Carballo-Castro, Julianna Piskorz, Paulius Rauba, Mihaela van der Schaar, Pascal Frossard

机构 * LTS4, EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院LTS4实验室) University of Cambridge, Cambridge, UK(英国剑桥大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

AI总结 提出递归掩码扩散模型(R-MDMs),通过在每个扩散步骤中重复应用同一去噪变换器增加递归深度,实现参数高效缩放,在数独和倒计时等结构化生成任务中,以更少参数匹配非递归基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16723 2026-06-16 cs.AI 新提交 57%

AgentFairBench: Do LLM Agents Discriminate When They Act?

AgentFairBench: LLM智能体在行动时是否存在歧视?

Triveni Morla, Rohith Reddy Bellibaltu, Manpreet Singh, Manmeet Singh Kapoor

机构 * Florida International University(佛罗里达国际大学) Boston University(波士顿大学) Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度帕纳吉印度理工学院计算机科学与工程系)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.AI

AI总结 提出AgentFairBench基准,通过反事实匹配集和偏差传导框架,评估LLM智能体在招聘、贷款和医疗分诊中的行动公平性,发现统计量级不匹配会夸大歧视,而匹配后Claude Haiku无显著人口统计效应。

Comments Submitted to IEEE Access

Journal ref Under Review (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15693 2026-06-16 cs.SE cs.AI 新提交 57%

Imperfect Visual Verification for Code Edition : A Case Study on TikZ

代码编辑的不完美视觉验证:以TikZ为例的案例研究

Charly Reux, Mathieu Acher, Djamel Eddine Khelladi, Clément Quinton, Olivier Barais

机构 * Univ Rennes, Inria, IRISA, INSA(里昂大学、Inria、IRISA、INSA) Univ Rennes, Inria, CNRS, IUF, IRISA(里昂大学、Inria、CNRS、IUF、IRISA) Univ Rennes, Inria, CNRS, IRISA(里昂大学、Inria、CNRS、IRISA) Univ. Lille, CNRS, Inria(里尔大学、CNRS、Inria) Univ. Rennes, IRISA, Inria(里昂大学、IRISA、Inria)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 针对TikZ等视觉代码定制任务,研究不完美验证器在迭代精炼中的有效性,发现即使不完美验证器也能适度准确判断指令是否应用,反馈对弱模型提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15684 2026-06-16 cs.AI 新提交 57%

Multi-agent Framework for Time-Sensitive Complementary Collaboration in Minecraft

Minecraft中时间敏感互补协作的多智能体框架

Juheon Yi, Jinglu Wang, Xiaoyi Zhang, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 提出TickingCollabBench基准和TickingCollab框架,用于评估LLM在动态、实时、异构智能体强制协作任务中的表现,发现LLM因延迟和协调困难而频繁失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14629 2026-06-15 cs.CR cs.AI 新提交 57%

When Good Verifiers Go Bad: Self-Improving VLMs Can Regress on New Tasks

当好的验证器变坏:自我改进的视觉语言模型可能在新任务上退步

Jianzhe Lin

机构 * MetaAI(Meta)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文发现验证器驱动的自我DPO中,验证器质量具有任务特异性,在低准确率任务上会导致学生模型性能退步,并给出机制解释和部署建议。

Comments 12 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12507 2026-06-12 cs.LG 新提交 57%

Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers

基于评分标准的自蒸馏:无需评分标准验证器的后训练

MohammadHossein Rezaei, Anas Mahmoud, Zihao Wang, Utkarsh Tyagi, Advait Gosai, Razvan-Gabriel Dumitru, Aakash Sabharwal, Bing Liu, Yunzhong He

机构 * Scale AI

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 提出RGSD方法,通过将评分标准作为条件蒸馏到学生模型,无需验证器即可实现密集逐令牌学习,在医学和科学领域达到与基于评判的GRPO相当的评分标准满足率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12003 2026-06-11 cs.CL 新提交 57%

Agreement in Representation Space for Open-Ended Self-Consistency

表示空间中的一致性:面向开放式自洽性

Paula Ontalvilla, Gorka Azkune, Aitor Ormazabal

机构 * HiTZ Center - Ixa, University of the Basque Country (UPV/EHU)(HiTZ中心 - Ixa,巴斯克大学(UPV/EHU))

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 针对开放式生成任务,提出基于嵌入的协议(EBA),通过聚类采样生成的嵌入表示来估计自洽性,无需训练即可鲁棒地选择更可靠的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11724 2026-06-11 cs.AI 新提交 57%

Mind the Perspective: Let's Reason Recursively for Theory of Mind

注意视角:递归推理实现心智理论

Chao Lei, Guang Hu, Meng Yang, Yanbei Jiang, Nir Lipovetzky

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算与信息系统学院) SensiLab, Monash University, Australia(蒙纳士大学SensiLab)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出RecToM框架,通过递归视角构建建模嵌套信念,将高阶信念问题转化为实际世界问题,在多个ToM基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11176 2026-06-10 cs.CV cs.CL cs.CY cs.HC 新提交 57%

Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories

数据记者智能体:将数据转化为可验证的多模态故事

Kevin Qinghong Lin, Batu EI, Yuhong Shi, Pan Lu, Philip Torr, James Zou

机构 * University of Oxford(牛津大学) Stanford University(斯坦福大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出多智能体框架Data2Story,通过证据链验证声明并自动生成多模态文章,在18篇文章上评估,证明其在透明性和可审计性上接近人类记者。

Comments Project page: https://data2story.github.io Github: https://github.com/QinghongLin/data2story-skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10875 2026-06-10 cs.CL 新提交 57%

Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and Activation

通过经验知识集成与激活推动LLM工具调用极限

Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 研究如何通过经验知识获取、激活和内化提升LLM多步工具调用性能,提出知识增强工具执行框架KATE,结合宽度扩展推理与知识感知训练,在BFCL-V3和AppWorld上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10662 2026-06-10 cs.MA cs.AI 新提交 57%

Decentralized Multi-Agent Systems with Shared Context

具有共享上下文的去中心化多智能体系统

Yuzhen Mao, Azalia Mirhoseini

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出DeLM框架,通过并行智能体、共享上下文和任务队列去中心化协调,解决集中式MAS的瓶颈,在软件工程和长上下文推理中提升性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08357 2026-06-09 cs.CL 新提交 57%

Forward-Free Diffusion Language Models

无前向过程的扩散语言模型

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07974 2026-06-09 cs.RO cs.AI 新提交 57%

PRISM: PRior-guided Imagination Sampling in world Models

PRISM:世界模型中基于先验引导的想象采样

Yuhai Wang, Jiawei Xia, Rongxuan Zhou, Xiao Hu, Yongliang Shi, Jing Du, Yang Ye

机构 * Northeastern University(东北大学) University of California, Berkeley(加州大学伯克利分校) Qiyuan Lab(启元实验室) University of Florida(佛罗里达大学)

专题命中 测试时计算 :planning(abstract);分类 cs.AI

AI总结 提出PRISM框架,通过从世界模型编码器提取状态条件高斯先验,并利用精度加权高斯乘积更新规划器的采样分布,在不增加架构复杂度的情况下显著提升基于模型的连续控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11076 2026-08-12 cs.CV 新提交 50%

Foundation Model-Enabled Efficient Data Sampling (FEEDS): A label-efficient training strategy for pan-cancer, multi-tracer PET/CT datasets

基于基础模型的高效数据采样(FEEDS):用于泛癌、多示踪剂PET/CT数据集的标签高效训练策略

Biratal Raj Wagle, Bashirul Azam Biswas, Grant Chau, Matthew E. Maeder, Muhammad Azeem Arshad, Michael S. Leapman, James B. Yu, Indrani Bhattacharya

机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心) Yale University(耶鲁大学)

专题命中 测试时计算 :planning(abstract)

AI总结 该研究提出FEEDS策略,利用视觉基础模型嵌入选择信息性和多样性未标注病例,在减少70%标注负担时达到全标注训练性能,解决了PET/CT病灶分割的标签稀缺问题。

Comments Code is publicly available on https://github.com/Image-and-Multimodal-Data-Analytics/FEEDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09344 2026-08-11 cs.CV 新提交 50%

Beyond Global Editing: Per-Instance Disentangled Subspaces for Training-Free Hallucination Mitigation in LVLMs

超越全局编辑:用于LVLMs无训练幻觉缓解的实例级解耦子空间

Ali Cheraghian, Hamidreza Dastmalchi, Hamed Barzamini, Morteza Saberi, Mojtaba Golzan, Shafin Rahman, Hossein Rahmani

机构 * Macquarie University(麦考瑞大学) York University(约克大学) Northern Illinois University(北伊利诺伊大学) University of Technology Sydney(悉尼科技大学) North South University(北南大学) Lancaster University(兰卡斯特大学) Australian National University(澳大利亚国立大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 针对LVLMs现有模型编辑技术采用单一全局子空间无法适配多样幻觉模式的问题,提出无训练的实例级解耦子空间框架,经多基准实验验证其鲁棒性、通用性与效率。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07555 2026-08-11 cs.RO 新提交 50%

You Don't Need To Stay in The Loop: An Agentic Robotics Loop for Robot-Policy Improvement

你无需停留在循环中:用于机器人策略改进的智能体机器人循环

Hang Yu

专题命中 测试时计算 :verifier(abstract)

AI总结 该研究将编码智能体的软件循环架构迁移至机器人策略改进领域,提出AgenticRobotics控制平面,解决机器人工具易失效问题,实现错误提升控制等性能提升。

Comments Agentic Robotics Preview Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06065 2026-08-07 cs.CV 新提交 50%

The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)

Weiwei Li, Junzhuo Liu, Tong Chu, Hengfu Yu, Wen Li

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05592 2026-08-07 cs.CV 新提交 50%

Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs

超越帧选择:用多模态大语言模型重新思考长视频理解

Ziling Huang, Shin'ichi Satoh

机构 * National Institute of Informatics(信息学研究所)

专题命中 测试时计算 :reasoning(abstract)

AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05302 2026-08-07 cs.IR 新提交 50%

Cross-platform epistemic verification for improving factual reliability in AI-generated news summarization

用于提升AI生成新闻摘要事实可靠性的跨平台认知验证

Zhuo Xie, Haoze Ni

专题命中 测试时计算 :verifier(abstract)

AI总结 本研究提出多源证据共识验证(MECV)框架,通过多异构来源证据聚合与多LLM陪审团机制修正AI生成新闻摘要的幻觉,在SummEdits基准上提升了事实一致性,为可信AI与自动化新闻研究提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03534 2026-08-05 cs.CR 新提交 50%

A Challenge-Nonce Freshness Gap in Project Veraison's TPM Reference Schemes, Found by Appraising Application-Layer Action Evidence End-to-End

通过端到端评估应用层行动证据发现Project Veraison的TPM参考方案中存在的挑战随机数新鲜度缺口

Anton Sokolov

专题命中 测试时计算 :verifier(abstract)

AI总结 本文发现Project Veraison的TPM参考方案存在挑战随机数新鲜度缺口,通过端到端测试验证修复方案,使重放Quote的评估结果变为否定,提升了RATS架构的安全性。

Comments 18 pages, 3 figures. Responsible disclosure: veraison/services#427, fixed in PR #432. Artifact and data: doi:10.5281/zenodo.20998730

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00801 2026-08-04 cs.CR 新提交 50%

Hardware-rooted attestation for AI-agent evidence: composing IETF RATS with action evidence packages

AI智能体证据的硬件根证明:将IETF RATS与行动证据包组合

Anton Sokolov

专题命中 测试时计算 :verifier(abstract)

AI总结 本研究提出将IETF RATS架构与行动证据包组合,实现AI智能体的硬件根证明,通过仿真TPM实验验证了该方案的可行性。

Comments 9 pages, 1 figure, 1 table. Technical note. Also deposited at Zenodo: doi:10.5281/zenodo.20818671

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28147 2026-07-31 cs.CR 新提交 50%

Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems

智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用

Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。

Comments This work is currently in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27667 2026-07-31 cs.CV 新提交 50%

Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

证据见证组合:针对闭集多模态答案的单预填充风险检测

Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang

专题命中 测试时计算 :verifier(abstract)

AI总结 该研究提出WEP方法,利用MLLM的白盒预填充路径,无需额外操作即可检测闭集视觉答案的推理风险,在3个MLLM和4个基准上提升了平均错误AP。

Comments 22 pages, 6 figures; includes supplementary material. Code: https://github.com/SouthWinter/WEP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26335 2026-07-30 cs.DC 新提交 50%

The Fabric Is the Cluster Driver: Cross-Layer eBPF Policies for GPU-CXL Fabrics

Fabric 是集群驱动:面向 GPU-CXL Fabric 的跨层 eBPF 策略

Yiwei Yang, Andi Quinn

专题命中 测试时计算 :verifier(abstract)

AI总结 该研究提出 fabric_ext 中间件编译器与运行时,通过语义移动图实现跨 GPU-CXL Fabric 多层的 eBPF 策略,以处理 LLM 预填充等场景下的跨岛数据流需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20310 2026-07-23 q-bio.NC 新提交 50%

Capturing Inner Experience At Scale: An AI Interviewer Co-Developed with the Founder of a Landmark Phenomenological Method

大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者

Jona Carmon, Clara Bersch, Charles Fernyhough, Russell T. Hurlburt, Simone Kühn

专题命中 测试时计算 :reasoning(abstract)

AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16596 2026-07-21 cs.DC 新提交 50%

Cold-Start Model Delivery in Kubernetes Inference Serving: An Empirical Study of OCI-Based Distribution and Its Integrity

Kubernetes推理服务中的冷启动模型交付:基于OCI的分发及其完整性的实证研究

Georgii Kliukovkin

专题命中 测试时计算 :verifier(abstract)

AI总结 研究Kubernetes推理服务中模型冷启动交付问题,通过在KServe平台实现oci+native://和oci+fetch://两条新交付路径进行分析,对比不同交付路径在不同模型大小下的表现,提出服务时完整性设计并验证其对交付时间的影响。

Comments 8 pages, 2 figures, 3 tables. Submitted to IEEE Access. Benchmark harness and data: https://github.com/kliukovkin/oci-model-delivery-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13965 2026-07-16 cs.SE cs.CR 新提交 50%

ProfMalPlus: Agent-Coordinated Detection of Malicious NPM Packages via Static-Dynamic Analysis Synergy

ProfMalPlus:通过静态-动态分析协同实现代理协调检测恶意NPM包

Yiheng Huang, Zhijia Zhao, Bihuan Chen, Susheng Wu, Zhuotong Zhou, Yiheng Cao, Kun Hu, Xin Hu, Xin Peng

专题命中 测试时计算 :reasoning(abstract)

AI总结 研究针对NPM包恶意代码检测问题,提出ProfMalPlus,结合对象敏感行为图与大语言模型推理,经多步骤提取安全切片并评估,对不确定情况增强证据后再评估,最终定位恶意代码,F1分数高且发现多个未知恶意包,性能优于现有检测器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04249 2026-07-07 cs.CV 新提交 50%

Beyond Random Sampling: Distribution-Aware Alignment for Semi-Supervised Medical Image Segmentation

超越随机采样:用于半监督医学图像分割的分布感知对齐

Weihao Yan, Yeqiang Qian, Yi Dong, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Department of Ultrasound, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院超声科)

专题命中 测试时计算 :planning(abstract)

AI总结 研究针对半监督医学图像分割中随机采样策略在低数据量时表征偏差的问题,提出基于分布对齐的高效框架,用分布感知样本选择策略和记忆引导复制粘贴模块,提升分割性能。

Comments 19 pages, 5 figures, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏