arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-14 至 2026-07-14 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 10 篇

2607.09693 2026-07-14 cs.LG cs.AI 新提交 81%

Depth-Entropy Guided Sampling for Training-Free LLM Reasoning

用于无训练语言模型推理的深度熵引导采样

Zibin Meng, Peng Xie, Kani Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究旨在提升无训练语言模型推理能力,提出深度熵引导采样(DEGS)方法,利用逐层熵坍缩作为质量信号,结合序列似然性与深度熵结构,在多个模型和基准测试中达到无训练最优精度,在域外和难题测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21787 2026-07-14 cs.CL cs.AI 版本更新 81%

PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains

PiCSAR:基于推理链的概率置信度选择与排序

Joshua Ong Jun Leang, Zheng Zhao, Aryo Pradipta Gema, Sohee Yang, Wai-Chung Kwan, Xuanli He, Wenda Li, Pasquale Minervini, Eleonora Giunchiglia, Shay B. Cohen

机构 * Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PiCSAR通过联合对数似然度评估推理链和最终答案的置信度,无需训练即可提升大语言模型和推理模型的准确性,在多个基准测试中表现优异。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11598 2026-07-14 cs.AI 新提交 79%

Interaction Scaling: Grounding the Third Axis of Test-Time Compute

交互缩放:奠定测试时计算的第三轴基础

Bojie Li, Noah Shi

机构 * Pine AI(松树人工智能公司) University of Washington(华盛顿大学)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.AI

AI总结 研究测试时增加计算量的新方法,提出交互缩放概念,通过模型与外部仪器交互突破传统方法局限,在硬编码任务和视觉工件处理上展现优势,表明交互缩放真实且区别于推理和采样,需反馈和度量基于实际。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11317 2026-07-14 cs.AI cs.IT math.IT 新提交 79%

Calibrated e-CUSUM Decoding for Quantized Reasoning Models: Why Token Log-Probability Is the Wrong Observable for Decoding Monitors

用于量化推理模型的校准e-CUSUM解码:为何令牌对数概率不适用于解码监测

El Hassane Ettifouri, Ayoub Belfatmi, Mahaman Sanoussi Yahaya Alassan, Walid Dahhane

机构 * Novelis Research(诺贝丽斯研究公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对低比特量化推理模型思维链退化问题,指出用居中令牌对数概率监测解码不可行。提出结合退化感知警报分数与校准e过程检测器的解码控制器,经GSM8K实验验证其有效性及不足,给出方法层面的解释与替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23231 2026-07-14 cs.CV 版本更新 78%

Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering

通过表示工程解锁大语言模型和大视觉语言模型的多语言推理能力

Qiming Li, Xiaocheng Feng, Yixuan Ma, Zekai Ye, Ruihan Chen, Xiachong Feng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 研究针对LLMs和LVLMs在多语言推理中英语表现优于低资源语言的问题,提出无训练的推理时方法MRRE,通过在特定层注入两个预计算向量增强多语言推理能力,实验证明该方法有效提升非英语推理及输入输出语言一致性。

Comments ACL2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11388 2026-07-14 cs.AI cs.CL cs.LG cs.MA 新提交 67%

StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure

StructAgent:利用统一因果结构驾驭长时程数字智能体

Wenyi Wu, Sibo Zhu, Kun Zhou, Aayush Salvi, Zixuan Song, Biwei Huang

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) Aether AI Lab(以太人工智能实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对长时程任务中智能体任务进展难解释、验证和恢复的问题,提出StructAgent框架,通过统一因果结构维护任务进展并规范工作流程,实验证明其能提升多种模型性能且具有通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02502 2026-07-14 cs.LG cs.AI 版本更新 62%

DemoPSD: Disagreement-Modulated Policy Self-Distillation

DemoPSD: 分歧调节的策略自蒸馏

Yunhe Li, Hao Shi, Wenhao Liu, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Shuang Qiu, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Shenzhen University of Advanced Technology(深圳理工大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出DemoPSD框架,通过选择性采纳教师指导,平衡学生从教师学习和保持自身推理能力,解决特权信息泄露和探索抑制问题,在科学推理任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09714 2026-07-14 cs.SD cs.AI cs.CL eess.AS 版本更新 62%

MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models

MUGEN:评估和改进大型音频-语言模型的多音频理解

Chih-Kai Yang, Yun-Shao Tsai, Yu-Kai Guo, Ping-Le Tsai, Yen-Ting Piao, Hung-Wei Chen, Ting-Lin Hsiao, Yun-Man Hsu, Ke-Han Lu, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 MUGEN通过评估多音频理解能力,揭示了大型音频-语言模型在多音频输入下的性能瓶颈,并通过排列自一致性策略提升了模型的预测准确性。

Comments Interspeech 2026. Project page: https://github.com/danielqwer/MUGEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10113 2026-07-14 cs.AI 新提交 57%

Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries

动态智能体技能:不断演进的技能库的生命周期调查与分类法

Yubo Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体中技能库随时间的变化,通过分类法、生命周期架构和技能记录模式等工具组织文献,合成证据分级模式,指出相关问题并提出报告标准及开放问题。

Comments Accepted by TMLR (2026.07), OpenReview Link: https://openreview.net/forum?id=cjU3YbcRr8

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30616 2026-07-14 cs.CL 版本更新 57%

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

扩展视野而非参数:以35B智能体达到万亿参数性能

Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Wenjie Lou, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Yan Teng, Qianyi Wang, Xiaosong Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出35B混合专家智能体模型Agents-A1,通过扩展智能体视野(长程轨迹与异构能力)达到万亿参数级别性能,采用三阶段训练(全领域微调、领域教师模型、多教师领域路由策略蒸馏)在多个长程基准上取得领先或竞争力结果。

Comments The model checkpoints and evaluation codebase are available at https://huggingface.co/collections/InternScience/agents-a1 and https://github.com/InternScience/Agents-A1

详情

展开后加载摘要…

URL PDF HTML 收藏