arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-16 至 2026-06-16 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 12 篇

2606.15070 2026-06-16 cs.CL 新提交 89%

Stop When Further Reasoning Won't Help: Attention-State Adaptive Generation in Reasoning Models

当进一步推理无益时停止:推理模型中的注意力状态自适应生成

Jiakai Li, Ke Qin, Rongzheng Wang, Yizhuo Ma, Qizhi Chen, Muquan Li, Shuang Liang

机构 * University of Electronic Science and Technology of China(电子科技大学) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省 ubiquitous 智能与可信服务重点实验室)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);test-time compute(abstract)

AI总结 针对大型推理模型过度思考导致冗余和准确率下降的问题,提出无需训练的注意力状态自适应生成方法ASAG,通过推断推理状态动态调整生成策略,在多个基准上平均准确率提升3.2%,生成token减少近40%。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16811 2026-06-16 cs.AI cs.CL 新提交 87%

Scaling LLM Reasoning from Minimal Labels: A Semi-Supervised Framework with a Lightweight Verifier

从最小标签扩展LLM推理:一种带有轻量级验证器的半监督框架

Keizo Kato, Chenhui Chu, Yugo Murawaki, Sado Kurohashi

机构 * Fujitsu Limited(富士通株式会社) Kyoto University(京都大学) National Institute of Informatics(国立信息学研究所)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title);分类 cs.CL、cs.AI

AI总结 提出半监督框架,用轻量级推理正确性分类器和熵过滤从少量标注数据生成高质量伪推理链,在数学和视觉问答任务上达到10-15倍标注数据效果。

Comments LREC 2026. Section 3.3 is updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12279 2026-06-16 cs.CV cs.AI cs.LG 版本更新 84%

UniT: Unified Multimodal Chain-of-Thought Test-time Scaling

UniT:统一多模态思维链测试时扩展

Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Yang, Chunyuan Li, Junzhe Sun, Chu Wang, Serena Yeung-Levy, Felix Juefei-Xu

机构 * Stanford University(斯坦福大学) Meta Superintelligence Labs(Meta超级智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出UniT框架,通过多轮推理、验证和细化实现统一多模态模型的测试时扩展,实验表明短推理轨迹可泛化到长链,顺序思维链比并行采样更高效。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04678 2026-06-16 cs.LG 版本更新 83%

Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers

基于深度条件循环Transformer的ASR测试时计算缩放

Yacouba Kaloga, Shashi Kumar, Shakeel A. Sheikh, Driss Khalil, Petr Motlicek, Ina Kodrasi

机构 * Idiap Research Institute(Idiap研究 institute) EPFL(瑞士联邦理工学院) BUT(布拉格技术大学) Novartis Institute of Biomedical Research(诺华生物医学研究 institute)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 提出LARM模型,通过深度条件循环Transformer将循环编码器深度变为可控的测试时计算轴,结合稀疏CTC检查点、监督时钟嵌入、FiLM深度条件和延迟软后验反馈,在LibriSpeech上随推理循环次数增加提升WER,实现测试时计算缩放从自回归语言模型推理扩展到连续非自回归语音识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16999 2026-06-16 cs.SE cs.CL cs.LG 新提交 62%

Selection Without Signal, Recovery Through Expression: A Measurement Study of Post-Hoc Falsification Operators for Frozen Small Code Models

无信号下的选择,通过表达恢复:冻结小代码模型的事后伪造操作符的测量研究

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(Pytha实验室,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究测量了冻结小代码模型的事后语义操作符(如选择、验证、修复)的有效性,发现它们均未优于Best-of-N,并揭示了覆盖墙、能力剪刀和共识陷阱等机制原因;而表达层恢复(M1)通过鲁棒提取和签名对齐提升了准确率。

Comments 33 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13441 2026-06-16 cs.AI cs.CL 新提交 62%

Why Sampling Is Not Choosing: Intentionality, Agency, and Moral Responsibility in Large Language Models

为什么采样不是选择:大语言模型中的意向性、能动性与道德责任

Joseph Keshet

机构 * Joseph Keshet(约瑟夫·凯舍特)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文论证大语言模型不具备道德责任所需的承诺性能动性,其输出源于概率映射而非内在意向性,随机采样不等于选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02427 2026-06-16 cs.AI cs.LG 版本更新 62%

The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling

模型知晓,解码器发现:未来价值引导的粒子力量采样

Tu Nguyen, Matthieu Zimmer, Rasul Tutunov, Xiaotong Ji, Haitham Bou Ammar

机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) Huawei Noah’s Ark Lab(华为诺亚实验室) UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出APPS算法,通过块状粒子方法高效定位LLM的多步解,提升推理准确率与运行效率,减少对训练数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16723 2026-06-16 cs.AI 新提交 57%

AgentFairBench: Do LLM Agents Discriminate When They Act?

AgentFairBench: LLM智能体在行动时是否存在歧视?

Triveni Morla, Rohith Reddy Bellibaltu, Manpreet Singh, Manmeet Singh Kapoor

机构 * Florida International University(佛罗里达国际大学) Boston University(波士顿大学) Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度帕纳吉印度理工学院计算机科学与工程系)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.AI

AI总结 提出AgentFairBench基准,通过反事实匹配集和偏差传导框架,评估LLM智能体在招聘、贷款和医疗分诊中的行动公平性,发现统计量级不匹配会夸大歧视,而匹配后Claude Haiku无显著人口统计效应。

Comments Submitted to IEEE Access

Journal ref Under Review (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15693 2026-06-16 cs.SE cs.AI 新提交 57%

Imperfect Visual Verification for Code Edition : A Case Study on TikZ

代码编辑的不完美视觉验证:以TikZ为例的案例研究

Charly Reux, Mathieu Acher, Djamel Eddine Khelladi, Clément Quinton, Olivier Barais

机构 * Univ Rennes, Inria, IRISA, INSA(里昂大学、Inria、IRISA、INSA) Univ Rennes, Inria, CNRS, IUF, IRISA(里昂大学、Inria、CNRS、IUF、IRISA) Univ Rennes, Inria, CNRS, IRISA(里昂大学、Inria、CNRS、IRISA) Univ. Lille, CNRS, Inria(里尔大学、CNRS、Inria) Univ. Rennes, IRISA, Inria(里昂大学、IRISA、Inria)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 针对TikZ等视觉代码定制任务,研究不完美验证器在迭代精炼中的有效性,发现即使不完美验证器也能适度准确判断指令是否应用,反馈对弱模型提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15684 2026-06-16 cs.AI 新提交 57%

Multi-agent Framework for Time-Sensitive Complementary Collaboration in Minecraft

Minecraft中时间敏感互补协作的多智能体框架

Juheon Yi, Jinglu Wang, Xiaoyi Zhang, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 提出TickingCollabBench基准和TickingCollab框架,用于评估LLM在动态、实时、异构智能体强制协作任务中的表现,发现LLM因延迟和协调困难而频繁失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10574 2026-06-16 cs.AI 版本更新 57%

LLM Jaggedness Unlocks Scientific Creativity

LLM Jaggedness Unlocks Scientific Creativity

Shray Mathur, J. Anibal Boscoboinik, Esther H. R. Tsai, Kevin G. Yager

机构 * Center for Functional Nanomaterials, Brookhaven National Laboratory(功能纳米材料中心,布鲁赫萨尔国家实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型(LLMs)在科学创意生成中的不规则进步现象,提出了SciAidanBench基准测试集,通过评估不同模型在科学问题上的创意生成能力,揭示了模型在跨任务、提示和领域层面的不均衡表现,并展示了如何通过推理计算、知识聚合和头脑风暴等机制利用这种不规则性来提升科学创造力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14723 2026-06-16 cs.CV 新提交 50%

Disagreement-Based Cross-Model Routing for Implicit Video Question Answering

基于分歧的跨模型路由用于隐式视频问答

Durga Sandeep Saluru

机构 * Independent Researcher(独立研究员)

专题命中 测试时计算 :reasoning(abstract)

AI总结 针对隐式视频问答中单模型精度瓶颈和自一致性策略失效问题,提出无标签无训练的分歧驱动跨模型路由方法,将分歧样本路由至第二模型,在ImplicitQA基准上提升平均准确率1.43%。

详情

展开后加载摘要…

URL PDF HTML 收藏