FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling
FibVLA:一种采用斐波那契采样的高效时序视觉-语言-动作模型
专题命中 测试时计算 :reasoning(abstract);planning(abstract)
AI总结 本文提出FibVLA框架,通过对数事后采样和流匹配等技术,解决了视觉-语言-动作模型时序信息捕捉与推理效率的矛盾,提升了动作性能与实时响应能力。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
FibVLA:一种采用斐波那契采样的高效时序视觉-语言-动作模型
专题命中 测试时计算 :reasoning(abstract);planning(abstract)
AI总结 本文提出FibVLA框架,通过对数事后采样和流匹配等技术,解决了视觉-语言-动作模型时序信息捕捉与推理效率的矛盾,提升了动作性能与实时响应能力。
StructAgent:利用统一因果结构驾驭长时程数字智能体
机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) ; Aether AI Lab(以太人工智能实验室)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对长时程任务中智能体任务进展难解释、验证和恢复的问题,提出StructAgent框架,通过统一因果结构维护任务进展并规范工作流程,实验证明其能提升多种模型性能且具有通用性。
多语言视觉多项选择题中小视觉语言模型的测试时缩放
机构 * ImageCLEF Lab(图像CLEF实验室) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究小型视觉语言模型在多语言视觉多项选择题中的测试时缩放,比较多种方法,发现运行条件重要,可解析性是关键,增加解码预算有帮助,复杂方法贡献小,最佳配置在测试集上表现出色,位居排行榜首位。
Comments 14 pages, 2 figures, accepted at ImageCLEF 2026
思考令牌有助于安全性吗?
机构 * Princeton Language and Intelligence(普林斯顿语言与智能)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现前沿推理模型的安全性行为并非真正基于思考,早期令牌即可预测拒绝/顺从结果,思考过程更像前缀补全而非审慎修订。
PEAR: 置换等变自适应路由多智能体辩论
机构 * University of Edinburgh(爱丁堡大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PEAR协议,通过动态重配置通信角色和稀疏拓扑,消除固定拓扑中的位置偏差,提升多智能体辩论的准确性和鲁棒性。
OCELOT:面向隐私保护LLM代理的推理泄露预算
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。
使用合成理由数据进行监督微调损害真实世界疾病预测
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Merced(加州大学默塞德分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现,在临床预测任务中,使用合成理由数据进行监督微调反而显著降低模型性能,根本原因在于叙事合理性与判别优化之间的结构性冲突。
教它停止,而不仅仅是点击
机构 * Cabal AI ; Para AI
专题命中 测试时计算 :verifier(abstract,comments);分类 cs.AI、cs.LG
AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。
Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source
基于跨难度优化动力学的大语言模型课程学习理解
机构 * Fudan University(复旦大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过分析不同课程调度的优化动力学,提出衡量跨难度知识迁移的Relative Transfer指标,据此推导TDCS方法,经多推理基准实验证明其性能优于代表性调度策略,为课程学习提供统一优化解释。
从测试时缩放的视角理解在线策略蒸馏
机构 * Hong Kong Baptist University(香港浸会大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究从测试时缩放视角分析OPD,发现其主要提升采样效率而非扩展推理能力边界,属于“虚假蒸馏”。
Comments 15 pages, 8 figures
社会思维链:一种基于医学鉴别诊断方法论的多智能体架构
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于医学鉴别诊断方法论的多智能体架构SCoT,通过多轮专家协作提升复杂病例诊断召回率,其优势无法通过单一推理实现。
Comments 14 pages, 9 figures, 6 tables
如何验证概率断言的一致性
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。
套娃语言模型套件
机构 * Cornell University(康奈尔大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出Matryoshka训练框架,将尺寸递增的子模型堆叠为端到端嵌套架构,训练含5亿、15亿、30亿参数子模型的套件,其性能与基线相当,训练计算量减少36%,推测解码吞吐量提升14-26%。
SkillZip:用于可扩展智能体技能库的保留契约的图压缩方法
机构 * UNSW(新南威尔士大学) ; CSIRO(联邦科学与工业研究组织)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 SkillZip是一种执行感知的过程抽象框架,通过对节级图进行保留契约的压缩,解决了智能体技能库的可扩展问题,在基准测试中优于基线,实现了高压缩率和稳健检索。
立场:是时候针对自一致性优化大型语言模型(LLMs)了
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出自一致性框架,指出LM的缺陷源于单输出对独立评估的假设,可通过一致性优化解决,为开发通用一致性LLM提供思路。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Position Paper Track
关系响应场:黑盒大语言模型响应一致性与恢复的通用理论
机构 * Sungkyunkwan University(成均馆大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出关系响应场(RRF)理论,定义黑盒大语言模型响应恢复的内在难度γₖ(D,A),推导稀疏修复算法,通过实验验证其在响应一致性与恢复中的有效性。
测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。
证据类型竞争:干预数据何时能教会语言模型因果方向?
机构 * Tsingjiao Information Science (Beijing) Co., Ltd(北京清教信息科技有限公司)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究发现干预数据训练语言模型因果推理的金标准假设存在局限,观测上下文会抑制模型的因果方向判断能力,提出证据平均方案可降低符号错误率。
Comments 13 pages, 6 figures, 4 tables
裁决式字幕生成:用于严格零样本图像字幕生成的多智能体对齐评分与共识蒸馏束仲裁
机构 * AI Platform OneNexus, OneMount(OneMount AI平台OneNexus) ; School of Electronic Engineering, Soongsil University(崇实大学电子工程学院) ; MoAdata(MoAdata公司) ; University of Economics Ho Chi Minh City (UEH)(胡志明市经济大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出裁决式字幕生成多智能体框架,通过多阶段对齐评分与共识蒸馏重排序,在不微调IFCap的情况下,显著提升COCO等数据集的零样本图像字幕生成性能,且可跨数据集迁移。
以源为中心的状态演化循环Transformer
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG
AI总结 本文提出以源为中心的状态演化(SCSE)循环Transformer,解决输入条件与共享循环参考的协调问题,在多个文本任务中提升了可控循环质量,验证了其设计的有效性。
Comments 24 pages, 5 figures
一致性门控:通过自一致性准入控制防止大语言模型智能体中的内存污染
机构 * Florida State University(佛罗里达州立大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型智能体内存污染问题,提出一致性门控方法,在提交候选事实前向模型查询K次获软支持分数,超阈值才准入。该机制与模型无关、无需微调,经实验在四个模型主干上减少了污染,还发布了相关基准和实现。
Comments 24 pages, 2 figures, 6 tables, 1 algorithm; includes appendices
FinMMEval 2026任务1概述:多语言金融多项选择题问答
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”INSAIT学院) ; University of Arizona(亚利桑那大学) ; FMI, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”FMI学院) ; The Fin AI(The Fin AI公司) ; The University of Tokyo(东京大学) ; Linköping University(林雪平大学) ; McGill University(麦吉尔大学) ; Mila, Quebec AI Institute(魁北克Mila人工智能研究所) ; Meiji Gakuin University(明治学院大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 FinMMEval 2026任务1测试多语言金融多项选择题问答,最终测试集含800题,每种语言200题,按准确率排名。最高准确率在92.0%(印地语)到97.5%(英语和阿拉伯语)之间,领先团队相近。系统采用检索增强等多种方法。
Comments 9 pages. Task overview paper for CLEF 2026 Working Notes (CEUR Workshop Proceedings)
神经网络验证中的前瞻分支
机构 * Amherst College(阿默斯特学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; Stanford University(斯坦福大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 研究神经网络验证中前瞻分支策略,提出通用集成方法,以FSB为例说明,还阐述其能生成加速验证的引理,通过在两个验证器中实例化,实现验证时间加速及解决实例数增加。
Comments Accepted to IJCAI 2026. Lookahead branching is part of the Marabou and $α$-$β$-CROWN verifiers
用于大语言模型训练后处理的蒸馏强化学习
机构 * College of Elite Engineers, Nankai University(南开大学精英工程师学院) ; Zhongguancun Academy(中关村学院) ; Beijing Institute of Technology(北京理工大学) ; Zhejiang University(浙江大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Harbin Institute of Technology(哈尔滨工业大学) ; College of Software, Nankai University(南开大学软件学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型训练后处理问题,提出蒸馏强化学习方法,集成教师监督到RL目标,含反向重要性采样等三个组件,能有效转移知识,在家族内和跨家族蒸馏实验中性能大幅优于标准RL和OPD。
递归工具自我改进
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究在模型-工具协同进化中,通过递归工具自我改进(RHI)优化用户构建工具,以提高执行轨迹质量和智能体性能。RHI将工具表示为提示级规范,经成对反馈迭代改进,在多任务中提升了低推理能力智能体性能,降低推理成本。
Comments This work addresses the first half of the model-harness coevolution loop
揭开在线策略蒸馏的神秘面纱:作用、问题及调控
机构 * The Chinese University of Hong Kong(香港中文大学) ; Tencent AI Lab(腾讯人工智能实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 研究在线策略蒸馏的作用、问题及调控,阐明其为探索催化剂,揭示师生不匹配和长度利用问题,提出优势裁剪和对数尺度压缩调控,实验表明良好调控的信号质量决定OPD中成功探索。
用于智能强化学习的单步异步优化
机构 * Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对异步强化学习中训练稳定性和离策略挑战,提出单步异步优化(SAO)。核心方法是用单步采样取代分组采样,改进单步策略并引入裁剪策略。主要贡献是SAO训练稳定,性能优于GRPO及其变体,在模拟在线学习中有效且成功部署于模型训练。
大语言模型的是非偏差反映答案顺序和措辞,而非道德判断的转变
机构 * Princeton University(普林斯顿大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型在道德困境判断中的是非偏差,通过交叉对称化等心理测量方法区分逻辑判断、词汇等因素,发现前沿模型立场与形式无关,部分模型存在顺序和词汇偏差,最小模型可总结伪像,强调跨框架测量模型重视内容。
具有跨情节记忆和策略蒸馏的自我审查强化学习
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对强化学习中环境反馈稀疏或延迟问题,提出自我审查强化学习框架,通过策略梯度优化自我审查,经选择性蒸馏内化改进到基础策略,用跨情节记忆保留成功审查,在GSM8K基准上评估,该框架优于基线且学习效率更高。
Comments 9 pages, 2 figures
利用离线强化学习学习控制大语言模型智能体的执行框架
机构 * University of Toronto(多伦多大学) ; Emory University(埃默里大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 研究提出将大语言模型智能体的执行框架视为可学习控制层,通过有限 horizon 的框架马尔可夫决策过程,利用离线强化学习训练轻量级控制器,在多领域实验中改进验证行为、提高任务质量,证明框架控制可学习且离线支持有局限。
Comments 17 pages, 7 figures