Aggregating LLM-Based Weak Verifiers for Spatial Layout Generation
基于LLM的弱验证器聚合用于空间布局生成
机构 * Stanford University(斯坦福大学) ; Roblox
专题命中 视觉空间推理 :verifier(abstract);分类 cs.LG
AI总结 提出一种通过聚合LLM生成的弱验证器来构建强验证器的流水线,用于空间布局领域,在3D房间布局和2D海报设计任务中F1分数提升高达7倍。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于LLM的弱验证器聚合用于空间布局生成
机构 * Stanford University(斯坦福大学) ; Roblox
专题命中 视觉空间推理 :verifier(abstract);分类 cs.LG
AI总结 提出一种通过聚合LLM生成的弱验证器来构建强验证器的流水线,用于空间布局领域,在3D房间布局和2D海报设计任务中F1分数提升高达7倍。
零样本3D问答通过层级视图到令牌传输
机构 * Dongsheng Wang(王东生) ; Dawei Su(苏大卫) ; Hui Huang(黄慧)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 提出KeyVT方法,通过层级视图和令牌级输入上下文收集,结合像素特征与相机参数评估视图重要性,并利用最优传输识别代表性令牌,实现零样本3D问答性能提升。
Comments Accepted at ICML 2026. 19 pages, 6 figures
图像生成器是通用视觉学习者
机构 * Google(谷歌)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了图像生成器在视觉理解中的通用学习能力,通过引入Vision Banana模型,展示了图像生成训练如何像语言模型预训练一样,使模型在多种视觉任务中取得最佳性能,证明了图像生成预训练在构建基础视觉模型中的核心作用。
Comments Project Page: http://vision-banana.github.io
AffordanceVLA:一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
机构 * Peking University(北京大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Chinese University of Hong Kong(香港中文大学) ; Knowin AI
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出AffordanceVLA框架,通过引入结构化可供性预测作为任务导向的中间表示,解决VLA模型中语义空间与具身控制策略的结构不匹配问题,实现精确的感知-动作映射。
Comments Preprint. Code and project page are available. Code: https://github.com/Skywalker-yqz/AffordanceVLA Project page: https://skywalker-yqz.github.io/AffordanceVLA/
余弦误导:辅助损失重塑视觉语言模型,而非其潜变量
机构 * National University of Singapore(新加坡国立大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文通过实验发现,在视觉语言模型的潜视觉推理中,余弦相似度等对齐损失与准确性负相关,并引入PRISM诊断工具揭示潜变量被绕过,辅助损失主要通过共享参数重塑语言模型。
Function2Scene: 基于功能规范的3D室内场景布局
机构 * Simon Fraser University(西蒙弗雷泽大学) ; Brown University(布朗大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出Function2Scene框架,通过解析自然语言设计简报中的用户角色和活动,从17个功能约束准则生成布局,并利用LLM和VLM的迭代检查-修复循环优化,在30个专业案例中94.3%的成对比较优于基线方法。
Comments project page: https://function2scene.github.io/
4DPC$^2$hat: 面向动态点云理解的失败感知自举学习
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出首个针对动态点云理解的多模态大语言模型4DPC$^2$hat,通过构建大规模跨模态数据集4DPC$^2$hat-200K和引入Mamba增强的时间推理模块及失败感知自举学习策略,显著提升了动作理解与时间推理能力。
Comments Accept by ICML 2026
StereoPolicy:通过立体视觉改进机器人操作策略
机构 * Stanford University(斯坦福大学) ; Northwestern University(西北大学) ; Lambda, Inc(Lambda公司)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 该研究提出StereoPolicy,一种利用立体视觉提升机器人操作策略的框架,通过同步立体图像对增强几何推理,无需构建显式3D表示,在多个仿真和真实机器人任务中优于RGB、RGB-D、点云等基线方法。
基于归一化流的潜在推理
机构 * University of Pennsylvania(宾夕法尼亚大学) ; UC San Diego(圣地亚哥大学) ; Meta
专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 提出NF-CoT框架,通过归一化流在LLM内部建模连续潜在思维,保留自回归生成、概率采样、KV缓存解码和似然估计等优势,在代码生成任务中提升通过率并降低推理成本。
EVE: 一种生成策略的生成-验证系统
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Toyota Research Institute(丰田研究院) ; Symbotic Inc.(Symbotic公司)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);test-time compute(abstract)
AI总结 本文提出EVE系统,通过生成-验证框架在测试时提升预训练生成策略的性能,利用零样本视觉语言模型验证者进行动作优化,无需额外训练。
摆脱验证者:通过示范学习推理
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RARO方法,通过逆强化学习从专家示范中学习强大的推理能力,无需任务特定的验证者,从而在多个评估任务中实现了显著的性能提升。
MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作
机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) ; Department of Computer Science, Tsinghua University(清华大学计算机系)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出MPCoT框架,通过奖励引导的多路径潜在推理,在保持零推理令牌和原始动作接口的同时,提升长时域和高不确定性控制任务中的VLA策略性能。
Comments 14 pages, 5 figures, submitted to CoRL
面向智能体数据分析的无监督技能发现
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出DataCOPE框架,通过无监督验证器引导从探索轨迹中发现可复用的数据分析技能,在报告式和推理式分析任务上分别提升平均得分9.71%和32.30%。
Comments Work in progress
自承诺延迟:一种用于提示隐式劫持的无奖励探针
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出自承诺延迟指标,通过测量推理上下文对模型自身最终答案的承诺时机,无需奖励信号即可检测提示隐式劫持,在GSM8K数据集上达到AUROC 0.878-0.926。
关于 Max@K 策略梯度的优势估计
机构 * The University of Tokyo(东京大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对稀疏奖励下推理模型后训练困难,提出一种新的优势估计方法 MaxPO,通过 Leave-Two-Out 基线实现中心化优势,降低梯度方差并提升性能。
SkillComposer: 学习演化智能体技能以实现特化与泛化
机构 * Zhejiang University(浙江大学) ; Tongyi Lab(通义实验室) ; National University of Singapore(新加坡国立大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 提出SkillComposer框架,通过创建、改进和合并三种可学习操作,使语言模型在推理时自我演化技能,支持离线、在线和混合部署模式,在多个基准上提升性能。
Comments Under Review
ReasoningFlow: 理解LLM推理轨迹的话语结构
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI
AI总结 提出ReasoningFlow框架,将大推理模型的推理轨迹建模为细粒度有向无环图,通过人工和自动标注分析发现模型间结构相似性、多样化推理行为及错误步骤与最终答案的关系。
通过回滚增强学习视觉-语言模型中的自我纠正
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种基于回滚增强的强化学习框架Octopus,通过重新组合现有回滚生成密集的自我纠正示例,提高样本效率并稳定RL优化,同时引入响应遮蔽策略以解耦自我纠正与直接推理,从而在7个基准测试中实现开源VLM的SOTA性能。
Comments 18 pages
Journal ref ICML 2026
IA-RAG:基于区间代数的动态知识检索时间推理
机构 * East China Normal University(华东师范大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Shanghai for Science and Technology(上海科技大学) ; Harbin Engineering University(哈尔滨工程大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 提出IA-RAG框架,通过区间代数建模时间约束,实现层次化时间检索与推理,在复杂时间问答任务上表现优异。
Comments 22 pages, 10 figures, 13 tables. Code available at https://github.com/xiaoAugenstern/LogicalRAG_TemporalQA
世界-语言-动作模型:统一世界建模、语言推理与动作合成
机构 * SJTU(上海交通大学) ; SII(上海研究院) ; HUST(华中科技大学) ; SCUT(华南理工大学) ; ECUST(东华大学) ; SHU(上海大学) ; NJUPT(南京工业大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 提出世界-语言-动作(WLA)模型,通过自回归Transformer联合预测文本子任务、子目标图像和机器人动作,融合世界建模与语言推理能力,实现多任务和长时域任务的最优性能。
Comments 19 pages, 10 figures
合成对比推理用于多表问答
机构 * Iowa State University(爱荷华州立大学) ; Thoughtworks
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 针对多表问答缺乏推理监督的问题,提出通过异构LLM生成合成对比推理轨迹,并利用对比偏好优化微调模型,在MMQA上提升9.7%-16.3%。
HyperVis:洛伦兹双曲面上的连续潜在视觉关系图用于组合推理
机构 * Data Science and AI, University of Doha for Science and Technology, Qatar(数据科学与人工智能,多哈科学技术大学,卡塔尔) ; Pluralis Research, Australia(Pluralis研究,澳大利亚) ; Department of Electrical and Computer Engineering, North South University, Bangladesh(电气与计算机工程系,北南大学,孟加拉国)
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 针对视觉语言模型在组合推理中理解物体间关系的困难,提出HyperVis方法,通过计算密集视觉关系张量并投影到洛伦兹双曲面,利用空间物理(IoA驱动的蕴含锥和外部角排斥)增强层次结构,在训练时作为正则化器提升生成式VQA性能,在推理时作为关系编码器提升判别式组合评分。
VOLD:通过在线蒸馏将LLM推理能力转移到视觉语言模型
机构 * Tuebingen AI Center(图宾根人工智能中心) ; University of Tuebingen(图宾根大学) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; Inria, École Normale Supérieure, CNRS, PSL Research University(法国国家科学研究院、巴黎-萨克勒大学、École Normale Supérieure、PSL研究大学)
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 本文提出VOLD框架,通过在线蒸馏将文本模型的推理能力转移到视觉语言模型,利用组相对策略优化与在线蒸馏结合,提升推理性能,并验证了冷启动对齐在在线训练中的重要性。
Comments www.walidbousselham.com/VOLD/
利用通用智能体进行情境化时间序列分析
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出TimeClaw框架,通过集成可执行时间工具、经验驱动能力进化和情景多模态记忆,使通用大语言模型智能体具备情境化时间推理能力,在能源、金融等多领域基准上取得性能提升。
Comments Preprint. 38 Pages
EGTR-Review: 基于多智能体教师蒸馏的高效证据支撑科学同行评审生成
机构 * Department of Information Management, Peking University(北京大学信息管理系) ; PKU-WUHAN Institute for Artificial Intelligence, Peking University(北京大学武汉人工智能研究院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出EGTR-Review框架,通过多智能体教师蒸馏和证据加权目标,实现轻量级学生模型的高质量、可溯源同行评审生成。
多模态大语言模型中通过CoRe头的功能稀疏性机制洞察
机构 * Soochow University(苏州大学) ; Peking University(北京大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 通过识别和分析CoRe头,揭示多模态大语言模型在跨模态检索中功能稀疏的结构特性,并验证其必要性及加速推理的潜力。
ProSPy: 面向企业级Text-to-SQL的剖析驱动的SQL-Python智能体框架
机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) ; School of Software Technology(软件技术学院) ; Tencent TEG(腾讯科技集团) ; School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Zhejiang University(浙江大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 提出ProSPy框架,通过自动剖析、模式剪枝、中间视图获取和Python分析四阶段,结合SQL高效性与Python灵活性,解决企业级数据库Text-to-SQL中的模式异构、元数据不完整和复杂分析问题。
Comments 24 pages, 12 figures
当工具失效时:LLM智能体动态重规划与异常恢复的基准测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; East China Normal University(华东师范大学) ; Sochow University(苏州大学) ; Shandong University(山东大学) ; Baidu Inc.(百度公司)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ToolMaze基准,通过有向无环图拓扑复杂度和工具扰动分类法,评估LLM智能体在工具失效时的动态重规划与错误恢复能力,发现模型对隐式语义故障的恢复率下降约37%,且智能体容错性随模型规模增长的速度远慢于基本任务执行。
Agent编排的自适应RAG:结构化与多跳检索的比较研究
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出Agent编排的自适应RAG框架,通过动态查询分解、迭代检索和自反思评估,在结构化领域(DevOps)和多跳推理基准(MuSiQue)上对比发现,查询分解在结构化领域提升性能但降低多跳排名精度,反思机制提高引用准确性但增加延迟,表明Agent增强需根据查询和领域特性选择性应用。
通过强化学习训练一个模型以掌握跨层级的代理行为
机构 * Peking University(北京大学) ; National University of Singapore(新加坡国立大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 本文提出CrossHA,一种统一的代理模型,能够掌握异构的动作空间并自主选择每一步轨迹中最有效的接口,通过结合冷启动监督微调和多轮组相对策略优化(GRPO)算法,实现适应性动作切换,在Minecraft开放世界中超过800个任务上展示了最先进的性能。
Comments Accepted to CVPR 2026 as a Highlight