How to Verify Consistency of Probabilistic Claims
如何验证概率断言的一致性
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
如何验证概率断言的一致性
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。
POISE:面向LLM智能体的位置感知不可检测技能注入攻击
机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) ; University of Queensland(昆士兰大学) ; Tulane University(路易斯安那州立大学) ; Rutgers University(罗格斯大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出POISE攻击方法,通过位置感知将恶意指令压缩为单一良性指令嵌入技能正文,在保持隐蔽性的同时实现89.3%的攻击成功率,比随机位置基线高28.0个百分点。
Comments Title changed from "POISE: Position-Aware Undetectable Skill Injection on LLM Agents" to "Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents"; the manuscript, figures, appendices, and reproducibility details have been updated. 15 pages, 2 figures, 4 tables
用于分类数据采样的球面流
机构 * Technische Universität Berlin(柏林技术大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出在球面上利用von Mises-Fisher分布进行离散序列生成建模,通过径向对称性简化连续性方程为标量ODE,结合后验加权切线和与预测-校正采样实现高效采样。
套娃语言模型套件
机构 * Cornell University(康奈尔大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出Matryoshka训练框架,将尺寸递增的子模型堆叠为端到端嵌套架构,训练含5亿、15亿、30亿参数子模型的套件,其性能与基线相当,训练计算量减少36%,推测解码吞吐量提升14-26%。
MetaSICL: 通过元语音上下文学习适应听觉大语言模型
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。
SkillZip:用于可扩展智能体技能库的保留契约的图压缩方法
机构 * UNSW(新南威尔士大学) ; CSIRO(联邦科学与工业研究组织)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 SkillZip是一种执行感知的过程抽象框架,通过对节级图进行保留契约的压缩,解决了智能体技能库的可扩展问题,在基准测试中优于基线,实现了高压缩率和稳健检索。
立场:是时候针对自一致性优化大型语言模型(LLMs)了
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出自一致性框架,指出LM的缺陷源于单输出对独立评估的假设,可通过一致性优化解决,为开发通用一致性LLM提供思路。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Position Paper Track
STATe-of-Thoughts:用于树状思维的结构化动作模板
机构 * Technion(以色列理工学院) ; Princeton University(普林斯顿大学) ; Independent(独立作者) ; Hebrew University(希伯来大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 STATe通过结构化动作模板提升文本生成的多样性和可控性,通过显式动作序列捕捉可解释特征,增强生成质量与可解释性。
Comments Accepted to COLM 2026. Version 3. 11 pages main, 85 pages total, 23 tables, 21 figures
关系响应场:黑盒大语言模型响应一致性与恢复的通用理论
机构 * Sungkyunkwan University(成均馆大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出关系响应场(RRF)理论,定义黑盒大语言模型响应恢复的内在难度γₖ(D,A),推导稀疏修复算法,通过实验验证其在响应一致性与恢复中的有效性。
在扩散噪声中寻求物理规律
机构 * Brown University(布朗大学) ; University of Edinburgh(爱丁堡大学) ; MIT(麻省理工学院)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 研究通过分析预训练扩散变换器的中间去噪表示,发现物理合理与不合理视频在中层特征空间部分可分离,提出渐进轨迹选择策略提升物理一致性并降低推理成本。
Comments 15 pages
测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。
面向智能体强化学习的组内自蒸馏方法
机构 * Baidu(百度)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对智能体强化学习中终端奖励监督粗粒度的问题,提出组内自蒸馏方法,利用策略自身已验证轨迹生成指导,细化回合级信用分配,在多环境多模型上性能优于基线且泛化性更好。
证据类型竞争:干预数据何时能教会语言模型因果方向?
机构 * Tsingjiao Information Science (Beijing) Co., Ltd(北京清教信息科技有限公司)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究发现干预数据训练语言模型因果推理的金标准假设存在局限,观测上下文会抑制模型的因果方向判断能力,提出证据平均方案可降低符号错误率。
Comments 13 pages, 6 figures, 4 tables
裁决式字幕生成:用于严格零样本图像字幕生成的多智能体对齐评分与共识蒸馏束仲裁
机构 * AI Platform OneNexus, OneMount(OneMount AI平台OneNexus) ; School of Electronic Engineering, Soongsil University(崇实大学电子工程学院) ; MoAdata(MoAdata公司) ; University of Economics Ho Chi Minh City (UEH)(胡志明市经济大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出裁决式字幕生成多智能体框架,通过多阶段对齐评分与共识蒸馏重排序,在不微调IFCap的情况下,显著提升COCO等数据集的零样本图像字幕生成性能,且可跨数据集迁移。
以源为中心的状态演化循环Transformer
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG
AI总结 本文提出以源为中心的状态演化(SCSE)循环Transformer,解决输入条件与共享循环参考的协调问题,在多个文本任务中提升了可控循环质量,验证了其设计的有效性。
Comments 24 pages, 5 figures
S-GRPO:面向大视觉语言模型的统一后训练方法
机构 * Tencent(腾讯)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
机构 * Shanghai Jiao Tong University(上海交通大学) ; OPPO Research Institute(OPPO研究院)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种在测试时自适应的技能合成方法SkillTTA,通过检索与当前任务相关的少量训练轨迹并将其合成成为任务特定的文本技能,以提高LLM代理在SpreadsheetBench、ALFWorld和BigCodeBench等任务上的性能。
Comments 15 pages, 6 figures
一致性门控:通过自一致性准入控制防止大语言模型智能体中的内存污染
机构 * Florida State University(佛罗里达州立大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型智能体内存污染问题,提出一致性门控方法,在提交候选事实前向模型查询K次获软支持分数,超阈值才准入。该机制与模型无关、无需微调,经实验在四个模型主干上减少了污染,还发布了相关基准和实现。
Comments 24 pages, 2 figures, 6 tables, 1 algorithm; includes appendices
南贝格4.2 - 3B:以紧凑模式解锁智能体能力
机构 * Nanbeige LLM Lab(南北贝大语言模型实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 介绍南贝格4.2 - 3B紧凑通用智能体模型,通过特定预训练方式构建,利用多种强化学习方法提升质量与效率,在多任务和基准测试中表现出色,优于更大模型,有潜力成为紧凑本地个人助手。
PS-PPO: 用于无评论者RLHF的前缀采样PPO
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。
Journal ref ICML 2026 published
MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Kyoto University(京都大学) ; Tsinghua University(清华大学) ; East China Normal University(华东师范大学) ; Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心) ; Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院) ; GenBio AI
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对医学文献增长带来的知识结构化挑战,引入MedKGent框架,利用PubMed摘要通过两个智能体每日增量构建医学知识图谱,经评估其三元组有效性高,能显著改进大语言模型在医学问答基准上的检索增强生成。
Comments Accepted by Npj Digital Medicine
FinMMEval 2026任务1概述:多语言金融多项选择题问答
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”INSAIT学院) ; University of Arizona(亚利桑那大学) ; FMI, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”FMI学院) ; The Fin AI(The Fin AI公司) ; The University of Tokyo(东京大学) ; Linköping University(林雪平大学) ; McGill University(麦吉尔大学) ; Mila, Quebec AI Institute(魁北克Mila人工智能研究所) ; Meiji Gakuin University(明治学院大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 FinMMEval 2026任务1测试多语言金融多项选择题问答,最终测试集含800题,每种语言200题,按准确率排名。最高准确率在92.0%(印地语)到97.5%(英语和阿拉伯语)之间,领先团队相近。系统采用检索增强等多种方法。
Comments 9 pages. Task overview paper for CLEF 2026 Working Notes (CEUR Workshop Proceedings)
神经网络验证中的前瞻分支
机构 * Amherst College(阿默斯特学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; Stanford University(斯坦福大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 研究神经网络验证中前瞻分支策略,提出通用集成方法,以FSB为例说明,还阐述其能生成加速验证的引理,通过在两个验证器中实例化,实现验证时间加速及解决实例数增加。
Comments Accepted to IJCAI 2026. Lookahead branching is part of the Marabou and $α$-$β$-CROWN verifiers
用于大语言模型训练后处理的蒸馏强化学习
机构 * College of Elite Engineers, Nankai University(南开大学精英工程师学院) ; Zhongguancun Academy(中关村学院) ; Beijing Institute of Technology(北京理工大学) ; Zhejiang University(浙江大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Harbin Institute of Technology(哈尔滨工业大学) ; College of Software, Nankai University(南开大学软件学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型训练后处理问题,提出蒸馏强化学习方法,集成教师监督到RL目标,含反向重要性采样等三个组件,能有效转移知识,在家族内和跨家族蒸馏实验中性能大幅优于标准RL和OPD。
基于大语言模型的示例选择用于少样本可穿戴传感器人体活动识别
机构 * Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology, Kitakyushu, Japan(九州工学院生命科学与系统工程研究生院,日本)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于大语言模型的示例选择方法,通过语义先验和结构几何线索提升少样本可穿戴传感器人体活动识别的性能。
Comments This paper has been accepted for presentation at ABC 2026. The manuscript is under revision prior to camera-ready submission
Journal ref International Journal of Activity and Behavior Computing 2026, Vol. 2026, No. 1, 1-34
递归工具自我改进
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究在模型-工具协同进化中,通过递归工具自我改进(RHI)优化用户构建工具,以提高执行轨迹质量和智能体性能。RHI将工具表示为提示级规范,经成对反馈迭代改进,在多任务中提升了低推理能力智能体性能,降低推理成本。
Comments This work addresses the first half of the model-harness coevolution loop
揭开在线策略蒸馏的神秘面纱:作用、问题及调控
机构 * The Chinese University of Hong Kong(香港中文大学) ; Tencent AI Lab(腾讯人工智能实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 研究在线策略蒸馏的作用、问题及调控,阐明其为探索催化剂,揭示师生不匹配和长度利用问题,提出优势裁剪和对数尺度压缩调控,实验表明良好调控的信号质量决定OPD中成功探索。
DemoPSD: 分歧调节的策略自蒸馏
机构 * City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DemoPSD框架,通过选择性采纳教师指导,平衡学生从教师学习和保持自身推理能力,解决特权信息泄露和探索抑制问题,在科学推理任务上优于现有方法。
MUGEN:评估和改进大型音频-语言模型的多音频理解
机构 * National Taiwan University(国立台湾大学)
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 MUGEN通过评估多音频理解能力,揭示了大型音频-语言模型在多音频输入下的性能瓶颈,并通过排列自一致性策略提升了模型的预测准确性。
Comments Interspeech 2026. Project page: https://github.com/danielqwer/MUGEN
HeaPA:用于大语言模型强化学习的难度感知堆采样和策略内查询增强
机构 * Stores Foundational AI, Amazon Inc.(亚马逊公司基础人工智能部) ; Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 研究大语言模型强化学习中提示采样问题,提出HeaPA方法,通过难度感知堆采样和策略内查询增强,维持动态提示池,跟踪能力前沿,在多数据集和基准测试中提升准确率,减少计算量,尤其在中大型模型规模下效果显著。
Comments COLM 2026