Thinking with Visual Grounding
视觉锚定思维
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 提出视觉锚定思维方法,让视觉语言模型在推理时交替生成自然语言和视觉锚点(点或框),并通过合成数据管道和锚定感知强化学习训练,在计数和空间推理任务上显著提升性能。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
视觉锚定思维
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 提出视觉锚定思维方法,让视觉语言模型在推理时交替生成自然语言和视觉锚点(点或框),并通过合成数据管道和锚定感知强化学习训练,在计数和空间推理任务上显著提升性能。
EChO-Agent: 用于音频推理的证据链编排智能体
机构 * School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI
AI总结 提出EChO-Agent模块化框架,将复杂音频问答转化为规划、工具执行、证据整合和答案验证流程,在MMAR基准上提升准确率和评分。
Comments 5 pages, 2 figures. Accepted by Interspeech 2026
既非并行也非顺序:DiffusionGemma 实际如何提交令牌
机构 * Transformer Lab
专题命中 推理与问题求解 :language model(abstract);分类 cs.LG
AI总结 通过钩取DiffusionGemma 26B的采样器接受步骤,测量其解码顺序,发现解码既非并行也非块自回归,而是呈现部分从左到右的提交偏差,且块大小是测量尺度的伪影而非架构特性。
边界框作为目标:通过神经符号规划实现语言条件抓取
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 提出GRASP框架,利用预训练VLM将自然语言查询转化为神经符号目标状态,通过边界框检测实现零样本桌面操作,无需任务特定训练。
Comments Project website: https://allisonandreyev.github.io/grasp.github.io/
SpatialClaw:重新思考智能体空间推理的动作接口
机构 * KAIST(韩国科学技术院) ; NVIDIA(英伟达)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 提出SpatialClaw框架,以代码作为动作接口,通过状态化Python内核和感知几何原语,使VLM智能体逐步执行并灵活组合中间结果,在20个3D/4D空间推理基准上平均准确率59.9%,比现有方法高11.2个百分点。
Comments Project page: https://spatialclaw.github.io/
递归智能体框架
机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL
AI总结 提出递归智能体框架(RAH),通过代码优先的框架递归扩展模型递归,在长上下文推理中显著提升编码智能体性能。
ERTS: 通过有界后果空间中的语义扰动进行伦理AI的对抗鲁棒性测试
机构 * Pratyush Chaudhari(普拉蒂什·查德哈里)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI
AI总结 提出伦理鲁棒性测试系统(ERTS),通过有界伦理后果空间、语义扰动和领域自适应评估,测试AI在伦理推理中的对抗鲁棒性,实验表明仅33%模型通过测试。
Comments 8 pages, 10 tables
感知、交互、推理:构建工具增强的视觉智能体用于空间推理
机构 * Tsinghua University(清华大学) ; Virginia Tech(弗吉尼亚理工大学) ; NVIDIA(英伟达)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 提出PERIA智能体,通过视觉感知和交互工具增强VLM的空间推理能力,在13个基准上优于同类模型7.0%-14.8%。
世界模型与物理AI教程
机构 * Department of Computer Science and Artificial Intelligence/CAIIT, Jeonju, Jeonbuk, South Korea(韩国全北全州计算机科学与人工智能系/CAIIT)
专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI
AI总结 本文提出统一框架,区分显式与隐式世界模型,并探讨其在机器人、自动驾驶等物理AI领域的应用,以及迈向通用人工智能的挑战。
Foresight: 关于导航关键线索的迭代推理
机构 * UT Austin(德克萨斯大学奥斯汀分校) ; FieldAI
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 提出Foresight框架,利用微调VLM交替提出和批评图像空间运动计划,通过人类反馈学习奖励模型进行强化学习后训练,实现无地图导航中稀疏语言指令下的迭代运动优化,任务成功率提升37%。
Comments 22 pages, 10 figures, 3 tables
KCSAT-ML: 用全国队列人类难度探测推理模型
机构 * NAVER Cloud AI(NAVER云AI) ; KAIST AI(韩国科学技术院人工智能系)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL
AI总结 提出KCSAT-ML基准(含664道韩国高考数学题及339道带官方错误率的核心题)和难度对齐推理增益(DRG)指标,揭示视觉语言模型在人类高错误率题目上准确率崩溃、测试时缩放非单调以及同一模型族内反缩放与过度思考并存的现象。
Comments 18 pages, 14 figures, 8 tables
DIRECT: 在具身规划器中何时何地分配测试时计算?
机构 * Stanford University(斯坦福大学) ; University of Waterloo(滑铁卢大学) ; NVIDIA(英伟达)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 提出DIRECT路由框架,根据多模态场景上下文按提示分配计算资源,优化成功-成本帕累托前沿,实验表明不同缩放轴带来不同能力增益,在物理机器人上以更低延迟匹配或超越更强模型。
表示空间中的一致性:面向开放式自洽性
机构 * HiTZ Center - Ixa, University of the Basque Country (UPV/EHU)(HiTZ中心 - Ixa,巴斯克大学(UPV/EHU))
专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL
AI总结 针对开放式生成任务,提出基于嵌入的协议(EBA),通过聚类采样生成的嵌入表示来估计自洽性,无需训练即可鲁棒地选择更可靠的输出。
解码多模态线索:揭示仇恨视频背后的隐含意义
机构 * Dalian University of Technology(大连理工大学) ; Tencent(腾讯) ; City University of Hong Kong(香港城市大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.CL
AI总结 提出IARE框架,通过信息增强和推理优化实现可解释的仇恨视频检测,在Ex-HateMM和Ex-ImpliHateVid数据集上达到最优性能。
通过重新标注视觉-动作机器人数据的任务鲁棒性
机构 * Mila — Quebec AI Institute(Mila — 魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; The University of British Columbia(不列颠哥伦比亚大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.LG
AI总结 提出TREAD框架,利用大型视觉语言模型对机器人数据集进行语义子任务分解和多样化指令生成,无需额外数据收集,提升策略在未见任务上的泛化能力。
Comments Project website: https://akuramshin.github.io/tread
面向普惠银行的后量子安全联邦DeFi
机构 * AI FinTech Group, University of Liverpool(人工智能金融科技组,利物浦大学) ; RVA Works and University of Richmond(RVA Works和里士满大学) ; Chain Crunch Labs(Chain Crunch实验室)
专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI
AI总结 提出后量子安全联邦DeFi框架,利用格基全同态加密和NASA-IBM地理空间基础模型,实现银行间加密协作以提升信用不足个体的金融普惠性。
RunAgent SuperBrowser: 基于人类浏览行为的自主网页导航理论
机构 * RunAgent AI
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 提出SuperBrowser自主网页导航代理,通过模仿人类浏览的感知-认知-行动三元机制,在Mind2Web Hard基准上以89.47%成功率超越现有开源研究代理。
Comments 31 pages, 8 figures, preprint/work in progress
稳定基于策略的蒸馏用于多模态大语言模型推理的全局归一化
机构 * OPPO AI Center(OPPO AI中心)
专题命中 推理与问题求解 :post-training(abstract);分类 cs.LG
AI总结 针对策略蒸馏中异常状态导致梯度不稳定的问题,提出全局归一化蒸馏策略优化(GNDPO),通过将KL分数转化为批次级相对优势来稳定优化,提升多模态推理任务的训练鲁棒性和性能。
SpaceVLN:具有在线空间认知记忆与推理的零样本视觉与语言导航智能体
机构 * Shanghai Jiao Tong University(上海交通大学) ; China Telecom(中国电信) ; Central South University(中南大学) ; Jiangsu University(江苏大学)
专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI
AI总结 提出SpaceVLN,通过空间认知记忆和任务引导的空间推理,在零样本设置下实现连续环境中的视觉与语言导航,在多个基准上达到最优性能。
Comments 23 pages, 9 figures, 7 tables
GVC-Seg: 基于几何视觉对应的免训练3D实例分割
机构 * Victoria University of Wellington(惠灵顿维多利亚大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Southern University of Science and Technology(南方科技大学)
专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI
AI总结 提出GVC-Seg,一种免训练的3D实例分割方法,通过几何与视觉特征对应消除多模型集成中的置信度偏差,在多个基准上达到最优性能。
Comments 10 pages, 5 figures
无教师自训练放大但不复合:自由验证器域上的 Pass@$K$ 交叉
机构 * Federal University of Rio de Janeiro(里约热内卢联邦大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.LG
AI总结 在自由验证器域上,使用无教师自训练(STaR)和批评者指导的选择,发现自训练放大模型能力但不复合,通过 Pass@$K$ 交叉诊断证实。
驾驶视觉-语言-动作模型中规划 token 的深度探测与剪枝
机构 * Robert Bosch GmbH(罗伯特·博世有限公司) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 推理与问题求解 :language model(abstract);foundation model(comments)
AI总结 本文针对驾驶 VLA 模型的规划 token,通过探测其 32 个解码器层的信号并剪枝部分层,在误差小幅增加下实现 1.33 倍解码器加速,验证了规划信息早期存在但格式适配问题。
Comments Accepted at the 6th DriveX Workshop (Foundation Models for Autonomous Driving), ECCV 2026. 14 pages, 8 figures, 4 tables
LearnAI:大学跨学科即时AI协同创作
专题命中 推理与问题求解 :prompting(abstract)
AI总结 该研究提出LearnAI两层AI协同创作框架,试点后发现其能帮助不同能力学习者转变对AI的认知,贡献了可实用的AI教育框架及初步证据。
EVADE:带弃权机制的证据验证智能诊断方法
机构 * Monash University(莫纳什大学) ; Murdoch University(默多克大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 该研究针对医学VLMs不可靠问题,提出无需训练的EVADE方法,通过跨图像视图验证一致性并引入弃权机制,在多医学VQA数据集上提升了校准度与选择性风险,同时维持了准确率。
回溯极端事件:在最终状态条件下初始化生成1000成员集合
专题命中 推理与问题求解 :foundation model(abstract)
AI总结 本研究使用非自回归基础模型cBottle-video生成1000成员集合,针对三个极端事件验证了终点约束集合的多样性与有效性,为罕见高影响事件的情景规划提供了高效方案。
Comments 38 pages, 21 figures; includes 17 pages of Supporting Information with 15 figures
GroupForward:通过实例分组前馈高斯溅射构建可参考的3D场景
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
专题命中 推理与问题求解 :language model(abstract)
AI总结 GroupForward是一种实例分组前馈高斯溅射模型,可从稀疏多视图图像重建3D场景,结合RSRF实现复杂3D参考推理,提升了语义重建与参考推理的性能。
ChainSpace:面向空间智能的链式推理范式
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; Li Auto Inc.(理想汽车有限公司)
专题命中 推理与问题求解 :foundation model(abstract)
AI总结 针对现有空间推理方法的缺陷,提出ChainSpace链式推理范式,构建对应基准与训练框架,相关模型在基准上表现最优且可迁移至多类外部基准,为空间智能评估与学习提供有效方案。
PolyLayout:超越矩形房间的分层VLM引导布局生成
机构 * IKEA Retail (Ingka Group)(宜家零售(英卡集团))
专题命中 推理与问题求解 :language model(abstract)
AI总结 PolyLayout提出混合分层VLM引导框架,分三阶段生成非矩形房间布局,在生产数据和不规则拓扑上表现出高感知合理性、低延迟,填补了学术与实际应用的差距。
从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench
机构 * NVIDIA(英伟达) ; Santa Clara University(圣克拉拉大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。
4D-WAM:面向自动驾驶的4D一致世界建模
专题命中 推理与问题求解 :foundation model(abstract)
AI总结 本文提出4D-WAM模型,通过几何基础模型的训练时监督与面向决策的时间步长采样策略,提升自动驾驶中世界-动作模型的4D场景一致性,在NAVSIM-v1、NAVSIM-v2基准上实现最优性能。