Multilingual Reasoning Cascades Need More Context
多语言推理级联需要更多上下文
专题命中 视觉推理 :grounding(abstract)
AI总结 提出上下文感知翻译级联方法,在最终翻译模块的上下文中保留原始问题、英文翻译问题和推理链,以改善多语言推理中的信息丢失,实验表明该方法在多种语言和模型上显著提升开放生成性能。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
多语言推理级联需要更多上下文
专题命中 视觉推理 :grounding(abstract)
AI总结 提出上下文感知翻译级联方法,在最终翻译模块的上下文中保留原始问题、英文翻译问题和推理链,以改善多语言推理中的信息丢失,实验表明该方法在多种语言和模型上显著提升开放生成性能。
SSI-Policy: 学习用于视觉语言机器人操作的结构化场景接口
机构 * Southern University of Science and Technology(南方科技大学) ; Peng Cheng Laboratory(鹏城实验室) ; The University of Hong Kong(香港大学) ; LimX Dynamics
专题命中 视觉推理 :grounding(abstract)
AI总结 提出SSI-Policy框架,通过统一的结构化场景接口(SSI)联合编码单目深度、语言锚定的物体布局和指令条件化的2D运动轨迹,实现从少量演示中学习机器人操作,在LIBERO基准上仅用10个演示即提升15%性能。
Comments Accepted by 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
Cloak: 通过遮蔽末端执行器实现零样本跨本体操作
机构 * Stanford University(斯坦福大学)
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出Cloak训练方法,通过遮蔽腕部相机中的末端执行器,使VLA模型实现零样本跨本体迁移,无需新本体数据。
CulMind:中国文化遗产中的多模态理解与推理基准
机构 * University of International Relations(国际关系学院) ; Kedge Business School(凯致商学院) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Capital Normal University(首都师范大学)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 针对现有基准忽视推理过程的问题,提出CulMind和CulMind-R基准,涵盖50个任务和24个推理子任务,并设计ReaScore指标评估推理质量,揭示答案与推理之间的差距。
LaViSA:语言与视觉结构歧义基准
机构 * Nara Institute of Science and Technology(奈良先端科学技术大学院大学) ; Guardian Robot Project RIKEN(RIKEN守护机器人项目) ; The University of Osaka(大阪大学)
专题命中 视觉推理 :VLM(abstract_cn)
AI总结 提出LaViSA基准,通过七类歧义句及对应图像评估视觉语言模型利用视觉场景解决结构歧义的能力,实验显示现有模型虽能部分利用视觉信息,但在特定歧义类型和细微语义区分上仍有局限。
进化与基础模型:AI共享创意控制
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出一种结合遗传算法与多模态AI基础模型的框架,实现自动化设计3D有机形态,将艺术家角色从直接选择转变为系统设计,加速创意探索。
CoRA: 面向可靠思维链推理的置信度-理由对齐
机构 * Vanderbilt University(范德比尔特大学) ; Vanderbilt University Medical Center(范德比尔特大学医学中心) ; Intuit AI Research(Intuit AI研究)
专题命中 视觉推理 :grounding(abstract)
AI总结 提出GRPO强化学习框架,联合奖励答案正确性、置信度与理由支持度,减少置信度与理由对齐误差,提升推理可靠性。
CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学) ; Tianjin University(天津大学)
专题命中 视觉推理 :vision-language model(abstract)
AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。
Comments Submitted to EMNLP 2026
复杂视觉查询的符号与抽象推理
机构 * Zhejiang University(浙江大学) ; Nanjing University(南京大学) ; Ant Group(蚂蚁集团)
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出复杂视觉查询(CVQ)概念,通过多模态知识图谱合成数据集,并设计两阶段训练框架,提升多模态大语言模型的符号与抽象推理能力。
Comments Work in progress
必要时做梦:通过自适应多模态推理推进世界行动模型
机构 * Tsinghua University(清华大学) ; Manifold AI
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出AdaWAM,通过轻量动态路由器自适应触发文本或视觉推理,提升长时复杂任务中的推理效率和性能。