HKVLM: Faithful Query--Region Binding for Frozen-Detector Visual Grounding
HKVLM:通过将语言查询绑定到冻结检测器实现忠实推理定位
机构 * Bo Ma
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 提出HKVLM框架,通过将定位从语言路径中分离,利用冻结检测器和语言模型,仅训练轻量对齐钩子实现推理定位,在少样本冷启动场景下显著提升定位精度并减少幻觉。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
HKVLM:通过将语言查询绑定到冻结检测器实现忠实推理定位
机构 * Bo Ma
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 提出HKVLM框架,通过将定位从语言路径中分离,利用冻结检测器和语言模型,仅训练轻量对齐钩子实现推理定位,在少样本冷启动场景下显著提升定位精度并减少幻觉。
SEVA: 具有过程奖励的自进化验证代理用于事实归因
机构 * University of Southern California, Los Angeles, USA(美国南加州大学,洛杉矶) ; University of Michigan, Ann Arbor, USA(美国密歇根大学,安娜堡)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SEVA,一种结构化验证代理,通过过程奖励解决多组件输出中的优势崩溃问题,实现自我进化循环,在7B模型上验证了奖励粒度必须匹配输出粒度的原则。
Comments Accepted at AI4GOOD@ICML 2026 and FAGEN@ICML 2026. Code: https://github.com/Justin0504/Verifiable_agent
当更多采样有害时:测试时扩展的模态上限与相关性上限
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文揭示测试时扩展中采样过多会导致选择性能停滞甚至下降,提出模态上限和相关性上限,并给出有效采样数作为停止准则。
Comments 24 pages, 10 figures, 3 tables. Code and data: https://github.com/bay-yearick-lab/sampling-ceilings
用Co-Scientist加速科学发现
机构 * Google Cloud AI Research(谷歌云人工智能研究) ; Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究) ; Stanford University School of Medicine(斯坦福大学医学院) ; Houston Methodist(休斯顿卫理公会医院) ; Sequome ; Fleming Initiative and Imperial College London(弗莱明倡议与伦敦帝国理工学院)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Co-Scientist是一种基于Gemini的多智能体AI系统,通过异步任务框架和竞赛进化过程,提升科学假设生成质量,应用于药物再利用、新靶点发现和抗菌机制解释,验证了其加速科学发现的能力。
Comments 157 pages in total (main 42 pages, supplementary information 115 pages), 4 main figures, 1 main table, 6 extended data figures, 2 extended data tables, 9 supplementary figures, 4 supplementary tables, 37 main references, 117 supplementary references. Nature (2026)
最强的教师并不总是最好的教师:以学生为中心的答案选择
机构 * University of Washington(华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Southern California(南加州大学) ; Independent Researcher(独立研究者) ; National University of Singapore(新加坡国立大学) ; Microsoft(微软) ; Google(谷歌) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Northwestern University(西北大学) ; Allen Institute for AI (AI2)(人工智能研究院(AI2))
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。
思考令牌有助于安全性吗?
机构 * Princeton Language and Intelligence(普林斯顿语言与智能)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现前沿推理模型的安全性行为并非真正基于思考,早期令牌即可预测拒绝/顺从结果,思考过程更像前缀补全而非审慎修订。
PEAR: 置换等变自适应路由多智能体辩论
机构 * University of Edinburgh(爱丁堡大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PEAR协议,通过动态重配置通信角色和稀疏拓扑,消除固定拓扑中的位置偏差,提升多智能体辩论的准确性和鲁棒性。
OCELOT:面向隐私保护LLM代理的推理泄露预算
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。
PRInTS:面向长程信息检索的奖励建模
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PRInTS生成式过程奖励模型,通过密集评分和轨迹摘要提升长程信息检索中工具交互与推理能力,在多个基准上超越前沿模型。
Comments ACL 2026, 19 pages, code: https://github.com/G-JWLee/PRInTS
使用合成理由数据进行监督微调损害真实世界疾病预测
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Merced(加州大学默塞德分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现,在临床预测任务中,使用合成理由数据进行监督微调反而显著降低模型性能,根本原因在于叙事合理性与判别优化之间的结构性冲突。
关于 Max@K 策略梯度的优势估计
机构 * The University of Tokyo(东京大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对稀疏奖励下推理模型后训练困难,提出一种新的优势估计方法 MaxPO,通过 Leave-Two-Out 基线实现中心化优势,降低梯度方差并提升性能。
MesaNet: 通过局部最优测试时训练进行序列建模
机构 * Google(谷歌) ; Paradigms of Intelligence Team(智能范式团队) ; Google DeepMind(谷歌DeepMind) ; MIT CSAIL(麻省理工学院CSAIL)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出一种基于共轭梯度求解器实现局部最优测试时训练的Mesa层,在保持常数推理成本的同时,在语言建模困惑度和下游基准性能上超越现有RNN模型。
Comments Published at ICLR 2026
Agentic AI 在遥感中的应用:技术挑战与研究方向
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 本文指出遥感中的多步分析工作流存在结构性的地理空间约束,提出面向地球观测的原生智能体设计原则,包括结构化地理空间状态、工具感知推理、验证器引导执行和有效性感知学习评估。
Comments 31 pages. Position Paper
并非所有合成数据都适合学习
机构 * ECE Department(电子工程系) ; Apple(苹果公司) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Rice University(里奇大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究无提示、无教师、无验证器、无奖励模型的自训练中,语言模型能否从自身生成的文本中学习,发现合成数据与学生之间的兼容性是关键,并揭示了能力与逐字记忆可分离的现象。
DecomposeRL: 学习提出有用、信息丰富且多样的问题以进行半监督、可追踪的声明验证
机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出DecomposeRL框架,通过GRPO和多面奖励集成将声明分解为可追踪的子问题,在完全监督和半监督设置下实现高精度,且模型规模小4倍仍匹配大模型性能。
SkillSafetyBench:在技能面攻击表面下评估智能体安全性
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; East China Normal University(华东师范大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。
EAGer: 基于熵感知的自适应推理时缩放生成方法
机构 * University of Groningen(格罗宁根大学) ; University of Milan - Bicocca(米兰-比科卡大学) ; Cohere Labs(Cohere实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出一种无需训练的生成方法EAGer,利用逐词熵分布动态分配计算资源,在复杂推理任务中提升性能并减少冗余计算。
在大音频语言模型中学习何时在聆听时思考
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出一种可学习的等待-思考-回答控制机制,通过多奖励强化学习优化大音频语言模型在流式语音交互中的推理时机,在提升准确率的同时减少响应延迟。
Comments 19 pages, 4 figures, 6 tables
HiSpec: 分层推测解码用于大语言模型
机构 * Department of Electrical and Computer Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校电子与计算机工程系)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出HiSpec框架,利用早期退出模型进行低开销中间验证,通过重用键值缓存和隐藏状态提高吞吐量,平均加速1.28倍,最高2.01倍,且不损失准确性。
超越AI委托:安全编码教育中生产性挣扎与评价性判断的提示模式框架
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 本文通过设计科学研究,从计算机科学文献中综合并调整了九种提示工程模式,映射到生产性挣扎和评价性判断两个教学构念,为安全编码课程设计了一个框架,使教师能够精细控制学生与AI的互动,保留学生的推理角色。
PEEK:上下文地图作为长上下文LLM代理的导向缓存
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Stanford University(斯坦福大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出PEEK系统,通过上下文地图缓存和维护导向知识,提升长上下文LLM代理在重复外部上下文中的交互准确性和效率,相比基线方法在推理和上下文学习任务中均取得显著提升。
超越二元奖励:训练语言模型以对其不确定性进行推理
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出RLCR方法,通过联合提升准确性和校准置信度,改进语言模型的推理能力,实验显示其在不同数据集上提升校准效果而不影响准确性。
G-Zero:从零数据开始的自主开放生成自我学习
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) ; University of Virginia(弗吉尼亚大学) ; University of Maryland(马里兰大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 G-Zero通过无验证器的共进化框架实现自主改进,利用Hint-δ内在奖励量化生成模型在无辅助响应与带提示响应间的预测偏移,通过GRPO训练提出者模型持续针对生成器的盲区,同时通过DPO优化生成器内部化提示引导的改进。
在RLVR中采用梯度保持视角实现灵活熵控制
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) ; Meituan(美团)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文从梯度保持裁剪角度出发,提出动态裁剪阈值机制和动态熵控制策略,有效缓解熵崩溃问题并提升多基准性能。
Comments https://github.com/Kwen-Chen/Flexible-Entropy-Control
CXR-ContraBench:医疗视觉语言模型中否定选项吸引力的基准测试
机构 * City University of Hong Kong(香港城市大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
专题命中 测试时计算 :chain-of-thought(abstract);verifier(abstract)
AI总结 研究医疗视觉语言模型在否定选项吸引力问题上的表现,通过CXR-ContraBench基准测试发现模型在面对矛盾图像和问题时易产生极性反转,提出QCCV-Neg方法有效修复极性混淆问题。
通过语义和事件记忆学习:一种反思式智能体适应方法
机构 * Megagon Labs(Megagon实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种基于记忆增强的框架,利用预训练大语言模型生成的批判性反馈,通过语义和事件记忆提升智能体适应能力,实验证明其在多个任务中有效。
Comments 16 pages
在可学习性前沿的学习推理
机构 * DeepSeek-R1 ; Tulu ; OpenAI
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出通过可学习性采样方法优化大语言模型强化学习阶段,提升训练效率和效果,针对高变异性问题进行课程学习。
通过排列感知GRPO缓解大语言模型中的选择偏差
机构 * School of Economics and Management, East China Normal University(东华大学经济管理学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出PA-GRPO方法,通过强制排列一致的语义推理来缓解大语言模型中的选择偏差,实验显示其在七个基准测试中表现优异,有效减少偏差同时保持高性能。
Comments Accepted to ACL 2026 Main Conference. 19 pages, 3 figures, 6 tables
重新审视在线策略蒸馏:经验性失败模式及简单修复
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中科院自动化所) ; School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) ; Fudan University(复旦大学) ; Independent Researcher(独立研究者)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了在线策略蒸馏的失败模式,提出改进方法提升训练稳定性,实验显示改进方法在多个任务中提升性能19.8%。
并非所有回放都有效:在大语言模型强化学习中的回放下采样
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出PODS方法,通过下采样回放来减少策略更新成本,提升学习效率。
Comments 19 pages, 10 figures, TMLR 2026