arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2608.11181 2026-08-12 cs.CC cs.AI cs.LG 新提交 62%

How to Verify Consistency of Probabilistic Claims

如何验证概率断言的一致性

Orr Paradise, Oliver Richardson, Yoshua Bengio, Shafi Goldwasser

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07943 2026-08-12 cs.CR cs.AI cs.CL 版本更新 62%

Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents

POISE:面向LLM智能体的位置感知不可检测技能注入攻击

Haochang Hao, Dehai Min, Zhifang Zhang, Yunbei Zhang, Miao Xu, Yingqiang Ge, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) University of Queensland(昆士兰大学) Tulane University(路易斯安那州立大学) Rutgers University(罗格斯大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出POISE攻击方法,通过位置感知将恶意指令压缩为单一良性指令嵌入技能正文,在保持隐蔽性的同时实现89.3%的攻击成功率,比随机位置基线高28.0个百分点。

Comments Title changed from "POISE: Position-Aware Undetectable Skill Injection on LLM Agents" to "Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents"; the manuscript, figures, appendices, and reproducibility details have been updated. 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05629 2026-08-12 stat.ML cs.CL cs.LG 版本更新 62%

Spherical Flows for Sampling Categorical Data

用于分类数据采样的球面流

Jannis Chemseddine, Gregor Kornhardt, Gabriele Steidl

机构 * Technische Universität Berlin(柏林技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出在球面上利用von Mises-Fisher分布进行离散序列生成建模,通过径向对称性简化连续性方程为标量ODE,结合后验加权切线和与预测-校正采样实现高效采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09703 2026-08-11 cs.AI cs.CL 新提交 62%

Matryoshka Language Model Suites

套娃语言模型套件

Nathan Godey, Yoav Artzi

机构 * Cornell University(康奈尔大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Matryoshka训练框架,将尺寸递增的子模型堆叠为端到端嵌套架构,训练含5亿、15亿、30亿参数子模型的套件,其性能与基线相当,训练计算量减少36%,推测解码吞吐量提升14-26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18904 2026-08-10 cs.SD cs.AI cs.CL 版本更新 62%

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

MetaSICL: 通过元语音上下文学习适应听觉大语言模型

Haolong Zheng, Siyin Wang, Zengrui Jin, Mark Hasegawa-Johnson

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05604 2026-08-07 cs.CL cs.AI 新提交 62%

SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

SkillZip:用于可扩展智能体技能库的保留契约的图压缩方法

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * UNSW(新南威尔士大学) CSIRO(联邦科学与工业研究组织)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 SkillZip是一种执行感知的过程抽象框架,通过对节级图进行保留契约的压缩,解决了智能体技能库的可扩展问题,在基准测试中优于基线,实现了高压缩率和稳健检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05188 2026-08-07 cs.CL cs.AI 新提交 62%

Position: It's Time to Optimize LLMs for Self-Consistency

立场:是时候针对自一致性优化大型语言模型(LLMs)了

Itamar Pres, Belinda Z. Li, Laura Ruis, Zifan Carl Guo, Keya Hu, Mehul Damani, Isha Puri, Ekdeep Singh Lubana, Jacob Andreas

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自一致性框架,指出LM的缺陷源于单输出对独立评估的假设,可通过一致性优化解决,为开发通用一致性LLM提供思路。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14265 2026-08-07 cs.CL cs.LG 版本更新 62%

STATe-of-Thoughts: Structured Action Templates for Tree-of-Thoughts

STATe-of-Thoughts:用于树状思维的结构化动作模板

Zachary Bamberger, Till R. Saenger, Gilad Morad, Ofra Amir, Brandon M. Stewart, Amir Feder

机构 * Technion(以色列理工学院) Princeton University(普林斯顿大学) Independent(独立作者) Hebrew University(希伯来大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 STATe通过结构化动作模板提升文本生成的多样性和可控性,通过显式动作序列捕捉可解释特征,增强生成质量与可解释性。

Comments Accepted to COLM 2026. Version 3. 11 pages main, 85 pages total, 23 tables, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04552 2026-08-06 cs.CL cs.LG 新提交 62%

Relational Response Fields: A General Theory of Black-Box LLM Response Consistency and Recovery

关系响应场:黑盒大语言模型响应一致性与恢复的通用理论

Song Zichen

机构 * Sungkyunkwan University(成均馆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出关系响应场(RRF)理论,定义黑盒大语言模型响应恢复的内在难度γₖ(D,A),推导稀疏修复算法,通过实验验证其在响应一致性与恢复中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14294 2026-08-06 cs.CV cs.AI cs.LG cs.RO 版本更新 62%

Seeking Physics in Diffusion Noise

在扩散噪声中寻求物理规律

Chujun Tang, Lei Zhong, Fangqiang Ding

机构 * Brown University(布朗大学) University of Edinburgh(爱丁堡大学) MIT(麻省理工学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析预训练扩散变换器的中间去噪表示,发现物理合理与不合理视频在中层特征空间部分可分离,提出渐进轨迹选择策略提升物理一致性并降低推理成本。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03204 2026-08-05 cs.CL cs.AI 新提交 62%

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28076 2026-08-04 cs.AI cs.LG 版本更新 62%

Group-Reflective Self-Distillation for Agentic Reinforcement Learning

面向智能体强化学习的组内自蒸馏方法

Binbin Zheng, Zijun Xie, Guanqun Zhao, Enlei Gong, Xing Ma, Xiaoliang Fu, Zeyu Chen

机构 * Baidu(百度)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对智能体强化学习中终端奖励监督粗粒度的问题,提出组内自蒸馏方法,利用策略自身已验证轨迹生成指导,细化回合级信用分配,在多环境多模型上性能优于基线且泛化性更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29484 2026-08-03 cs.CL cs.LG 新提交 62%

Evidence-Type Competition: When Can Interventional Data Teach Language Models Causal Direction?

证据类型竞争:干预数据何时能教会语言模型因果方向?

Xining Xun

机构 * Tsingjiao Information Science (Beijing) Co., Ltd(北京清教信息科技有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现干预数据训练语言模型因果推理的金标准假设存在局限,观测上下文会抑制模型的因果方向判断能力,提出证据平均方案可降低符号错误率。

Comments 13 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28986 2026-08-03 cs.CV cs.AI cs.CL cs.MA 新提交 62%

Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning

裁决式字幕生成:用于严格零样本图像字幕生成的多智能体对齐评分与共识蒸馏束仲裁

Duy Tran Thanh, Thien-Phuc Doan, Long Nguyen-Vu, Ngo Tan Vu Khanh

机构 * AI Platform OneNexus, OneMount(OneMount AI平台OneNexus) School of Electronic Engineering, Soongsil University(崇实大学电子工程学院) MoAdata(MoAdata公司) University of Economics Ho Chi Minh City (UEH)(胡志明市经济大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出裁决式字幕生成多智能体框架,通过多阶段对齐评分与共识蒸馏重排序,在不微调IFCap的情况下,显著提升COCO等数据集的零样本图像字幕生成性能,且可跨数据集迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27656 2026-07-31 cs.LG cs.CL 新提交 62%

Looped Transformers with Source-Centered State Evolution

以源为中心的状态演化循环Transformer

Bum Jun Kim, Kohei Hayashi, Shunsuke Kamiya, Masanori Koyama, Yusuke Iwasawa, Yutaka Matsuo

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 本文提出以源为中心的状态演化(SCSE)循环Transformer,解决输入条件与共享循环参考的协调问题,在多个文本任务中提升了可控循环质量,验证了其设计的有效性。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16557 2026-07-31 cs.LG cs.CL cs.CV 版本更新 62%

S-GRPO: Unified Post-Training for Large Vision-Language Models

S-GRPO:面向大视觉语言模型的统一后训练方法

Yuming Yan, Kai Tang, Sihong Chen, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu

机构 * Tencent(腾讯)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16986 2026-07-30 cs.CL cs.AI 版本更新 62%

Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents

Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents

Jingxing Wang, Chenyu Zhou, Zhihui Fu, Jun Wang, Weiwen Liu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种在测试时自适应的技能合成方法SkillTTA,通过检索与当前任务相关的少量训练轨迹并将其合成成为任务特定的文本技能,以提高LLM代理在SpreadsheetBench、ALFWorld和BigCodeBench等任务上的性能。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22962 2026-07-28 cs.AI cs.CL 新提交 62%

ConsistencyGate: Preventing Memory Contamination in LLM Agents via Self-Consistency Admission Control

一致性门控:通过自一致性准入控制防止大语言模型智能体中的内存污染

Yan Zhang, Shibo Li

机构 * Florida State University(佛罗里达州立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型智能体内存污染问题,提出一致性门控方法,在提交候选事实前向模型查询K次获软支持分数,超阈值才准入。该机制与模型无关、无需微调,经实验在四个模型主干上减少了污染,还发布了相关基准和实现。

Comments 24 pages, 2 figures, 6 tables, 1 algorithm; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22083 2026-07-28 cs.AI cs.CL 版本更新 62%

Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model

南贝格4.2 - 3B:以紧凑模式解锁智能体能力

Nanbeige Lab, :, Chen Yang, Chengrui Huang, Fufeng Lan, Hanhui Chen, Hao Zhou, Huatong Song, Jiaqi Cao, Jiaying Zhu, Jinlin Niu, Kai Wang, Lisheng Huang, Qiliang Liang, Ran Le, Ruixiang Feng, Shuang Sun, Tao Gu, Tao Zhang, Tianyu Luo, Yang Song, Yun Xing, Yuntao Wen, Ziyao Xu, Zongchao Chen, Zongqiang Li

机构 * Nanbeige LLM Lab(南北贝大语言模型实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 介绍南贝格4.2 - 3B紧凑通用智能体模型,通过特定预训练方式构建,利用多种强化学习方法提升质量与效率,在多任务和基准测试中表现出色,优于更大模型,有潜力成为紧凑本地个人助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29758 2026-07-28 cs.LG cs.AI 版本更新 62%

PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

PS-PPO: 用于无评论者RLHF的前缀采样PPO

Doo Hwan Hwang, Kee-Eung Kim

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。

Journal ref ICML 2026 published

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12393 2026-07-27 cs.CL cs.AI 版本更新 62%

MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph

MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架

Duzhen Zhang, Zixiao Wang, Zhong-Zhi Li, Yahan Yu, Shuncheng Jia, Jiahua Dong, Haotian Xu, Xing Wu, Yingying Zhang, Tielin Zhang, Jie Yang, Xiuying Chen, Le Song

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Kyoto University(京都大学) Tsinghua University(清华大学) East China Normal University(华东师范大学) Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院) GenBio AI

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对医学文献增长带来的知识结构化挑战,引入MedKGent框架,利用PubMed摘要通过两个智能体每日增量构建医学知识图谱,经评估其三元组有效性高,能显著改进大语言模型在医学问答基准上的检索增强生成。

Comments Accepted by Npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19856 2026-07-23 cs.CL cs.AI cs.CE 新提交 62%

Overview of FinMMEval 2026 Task 1: Multilingual Financial Multiple-Choice Question Answering

FinMMEval 2026任务1概述:多语言金融多项选择题问答

Zhuohan Xie, Yuyang Dai, Rania Elbadry, Vanshikaa Jani, Georgi Georgiev, Dimitar Dimitrov, Fan Zhang, Xueqing Peng, Lingfei Qian, Jimin Huang, Jiahui Geng, Yankai Chen, Ye Yuan, Haolun Wu, Yuxia Wang, Ivan Koychev, Veselin Stoyanov, Mingzi Song, Yu Chen, Xue Liu, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”INSAIT学院) University of Arizona(亚利桑那大学) FMI, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”FMI学院) The Fin AI(The Fin AI公司) The University of Tokyo(东京大学) Linköping University(林雪平大学) McGill University(麦吉尔大学) Mila, Quebec AI Institute(魁北克Mila人工智能研究所) Meiji Gakuin University(明治学院大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 FinMMEval 2026任务1测试多语言金融多项选择题问答,最终测试集含800题,每种语言200题,按准确率排名。最高准确率在92.0%(印地语)到97.5%(英语和阿拉伯语)之间,领先团队相近。系统采用检索增强等多种方法。

Comments 9 pages. Task overview paper for CLEF 2026 Working Notes (CEUR Workshop Proceedings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17290 2026-07-21 cs.LG cs.AI cs.LO 新提交 62%

Lookahead Branching for Neural Network Verification

神经网络验证中的前瞻分支

Liam Davis, Duo Zhou, Huan Zhang, Guy Katz, Clark Barrett, Haoze Wu

机构 * Amherst College(阿默斯特学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hebrew University of Jerusalem(耶路撒冷希伯来大学) Stanford University(斯坦福大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究神经网络验证中前瞻分支策略,提出通用集成方法,以FSB为例说明,还阐述其能生成加速验证的引理,通过在两个验证器中实例化,实现验证时间加速及解决实例数增加。

Comments Accepted to IJCAI 2026. Lookahead branching is part of the Marabou and $α$-$β$-CROWN verifiers

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17247 2026-07-21 cs.LG cs.AI 新提交 62%

Distilled Reinforcement Learning for LLM Post-training

用于大语言模型训练后处理的蒸馏强化学习

Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang

机构 * College of Elite Engineers, Nankai University(南开大学精英工程师学院) Zhongguancun Academy(中关村学院) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Harbin Institute of Technology(哈尔滨工业大学) College of Software, Nankai University(南开大学软件学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型训练后处理问题,提出蒸馏强化学习方法,集成教师监督到RL目标,含反向重要性采样等三个组件,能有效转移知识,在家族内和跨家族蒸馏实验中性能大幅优于标准RL和OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22385 2026-07-21 cs.CL cs.AI cs.CV 62%

LLM-Guided Exemplar Selection for Few-Shot Wearable-Sensor Human Activity Recognition

基于大语言模型的示例选择用于少样本可穿戴传感器人体活动识别

Elsen Ronando, Sozo Inoue

机构 * Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology, Kitakyushu, Japan(九州工学院生命科学与系统工程研究生院,日本)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型的示例选择方法,通过语义先验和结构几何线索提升少样本可穿戴传感器人体活动识别的性能。

Comments This paper has been accepted for presentation at ABC 2026. The manuscript is under revision prior to camera-ready submission

Journal ref International Journal of Activity and Behavior Computing 2026, Vol. 2026, No. 1, 1-34

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15524 2026-07-20 cs.LG cs.AI 新提交 62%

Recursive Harness Self-Improvement

递归工具自我改进

Hyunin Lee, Jinglue Xu, Jeffrey Seely, Donghyun Lee, Matei Zaharia, Yujin Tang

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究在模型-工具协同进化中,通过递归工具自我改进(RHI)优化用户构建工具,以提高执行轨迹质量和智能体性能。RHI将工具表示为提示级规范,经成对反馈迭代改进,在多任务中提升了低推理能力智能体性能,降低推理成本。

Comments This work addresses the first half of the model-harness coevolution loop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13399 2026-07-16 cs.CL cs.LG 新提交 62%

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

揭开在线策略蒸馏的神秘面纱:作用、问题及调控

Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究在线策略蒸馏的作用、问题及调控,阐明其为探索催化剂,揭示师生不匹配和长度利用问题,提出优势裁剪和对数尺度压缩调控,实验表明良好调控的信号质量决定OPD中成功探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02502 2026-07-14 cs.LG cs.AI 版本更新 62%

DemoPSD: Disagreement-Modulated Policy Self-Distillation

DemoPSD: 分歧调节的策略自蒸馏

Yunhe Li, Hao Shi, Wenhao Liu, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Shuang Qiu, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Shenzhen University of Advanced Technology(深圳理工大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出DemoPSD框架,通过选择性采纳教师指导,平衡学生从教师学习和保持自身推理能力,解决特权信息泄露和探索抑制问题,在科学推理任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09714 2026-07-14 cs.SD cs.AI cs.CL eess.AS 版本更新 62%

MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models

MUGEN:评估和改进大型音频-语言模型的多音频理解

Chih-Kai Yang, Yun-Shao Tsai, Yu-Kai Guo, Ping-Le Tsai, Yen-Ting Piao, Hung-Wei Chen, Ting-Lin Hsiao, Yun-Man Hsu, Ke-Han Lu, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 MUGEN通过评估多音频理解能力,揭示了大型音频-语言模型在多音频输入下的性能瓶颈,并通过排列自一致性策略提升了模型的预测准确性。

Comments Interspeech 2026. Project page: https://github.com/danielqwer/MUGEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22448 2026-07-10 cs.LG cs.CL 版本更新 62%

HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning

HeaPA:用于大语言模型强化学习的难度感知堆采样和策略内查询增强

Weiqi Wang, Xin Liu, Binxuan Huang, Hejie Cui, Rongzhi Zhang, Changlong Yu, Shuowei Jin, Jingfeng Yang, Qingyu Yin, Zhengyang Wang, Zheng Li, Yifan Gao, Priyanka Nigam, Bing Yin, Lihong Li, Yangqiu Song

机构 * Stores Foundational AI, Amazon Inc.(亚马逊公司基础人工智能部) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型强化学习中提示采样问题,提出HeaPA方法,通过难度感知堆采样和策略内查询增强,维持动态提示池,跟踪能力前沿,在多数据集和基准测试中提升准确率,减少计算量,尤其在中大型模型规模下效果显著。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏