Evidence-State Rewards for Long-Context Reasoning
证据状态奖励用于长上下文推理
机构 * Aalto University(阿alto大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出Maven框架,通过可编辑证据记忆和动作级状态转移奖励,优化长上下文推理中的证据导航,优于仅结果强化学习和证据识别基线。
Comments Under review
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
证据状态奖励用于长上下文推理
机构 * Aalto University(阿alto大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出Maven框架,通过可编辑证据记忆和动作级状态转移奖励,优化长上下文推理中的证据导航,优于仅结果强化学习和证据识别基线。
Comments Under review
在思考之前,先学会决策:面向高效视觉推理的主动路由
机构 * Xi’an Jiaotong University(西安交通大学) ; ARC Lab, Tencent IEG(腾讯IEG ARC实验室) ; City University of Hong Kong(香港城市大学) ; Institute of Automation, CAS(中国科学院自动化研究所) ; Harvard University(哈佛大学) ; Nanjing University(南京大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL
AI总结 提出主动路由范式PRP,通过联合评估草稿模型和目标模型的能力,实现早期决策,加速多模态推理而不牺牲性能。
Comments 36 pages, 20 figures
通过语言与符号表示之间的模态切换进行空间推理
机构 * Michigan State University(密歇根州立大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究多跳文本空间故事中,将语言推理切换到几何感知模态(如布局或网格)能否提升推理性能,并提出基于可信度和复杂度的切换指标,实现原则性模态选择,使LLM性能提升高达42%。
学习演化场景:用场景图推理人类活动
机构 * Politecnico di Torino(托斯托大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 提出SG-Ego标注集和GLEN模型,通过时空场景图显式建模人-环境交互的动态演化,实现活动驱动的场景变化推理与预测。
Comments Project page at https://francescapistilli.github.io/GLEN
超越文本仓库探索:面向智能体问题解决的双模态结构推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 提出DUALVIEW框架,通过模块耦合图、函数调用图、类层次图和程序依赖图四种图视图,结合视觉与文本响应,使智能体在仓库探索中直接推理代码依赖结构,提升长时域问题解决性能。
SpaceEra++: 面向视频中3D空间推理的统一框架
机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) ; Shenzhen Loop Area Institute(深圳河套学院) ; School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) ; Pengcheng Laboratory(鹏城实验室) ; School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院) ; Zhongguancun Academy(中关村学院) ; City University of Hong Kong(香港城市大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 提出SpaceEra++框架,通过ScenePick帧采样策略缓解输入不足,并利用SpaceAlign对齐绝对坐标与相对空间关系增强推理,在多个基准上超越强基线。
Comments Accepted by IEEE TPAMI 2026
先构建图!通过场景图实现长视频第一人称视频推理
机构 * Politecnico di Milano(米兰理工大学) ; Bocconi University(博科尼大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 提出利用第一人称场景图(EgoSGs)将长视频压缩为紧凑文本表示,在保持语义丰富性的同时大幅减少输入长度,使多模态大模型能在令牌预算内高效推理,在HD-EPIC VQA上取得最优结果。
不要让收益消失:解析强化学习中的策略梯度权重
机构 * FAIR at Meta(Meta FAIR) ; Inria, Ecole Normale Supérieure(法国国家信息与自动化研究所,巴黎高等师范学院) ; University of California, San Diego(加利福尼亚大学圣迭戈分校)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出FADE方法,通过动态调整优势函数的正负和难度权重,解决RL训练不稳定和多样性崩溃问题,在7B和32B模型上分别提前20k和2k步达到最佳pass@1。
SimWorlds: 一个用于动态3D场景创建的多智能体系统
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 视觉空间推理 :verifier(abstract);分类 cs.AI
AI总结 提出多智能体框架SimWorlds,通过规划-编码-审查流程和运行时状态检查工具,从文本生成动态4D场景,并引入基准4DBuildBench评估视觉保真度和物理一致性。
Comments 20 pages, 3 figures. Project page: https://dynsimworlds.github.io
路径级事后指令用于视觉语言导航中的语义探索
机构 * Korea University(高丽大学) ; University of Michigan(密歇根大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出Phi-Nav框架,通过事后推理将指令与智能体实际探索轨迹对齐,利用三阶段双监督循环将语义未标记的运动转化为密集训练信号,在R2R-CE和RxR-CE基准上以少量专家演示取得竞争性能。
Comments Accepted to ECCV 2026
TO-Master:用于自动化拓扑优化的大语言模型智能体框架
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出TO-Master框架,利用大语言模型智能体将有限元拓扑优化转化为对话式工作流,通过自然语言指令自动完成几何处理、网格生成、边界条件设置和优化求解,无需用户编写代码。
Comments 29 pages, 10 figures, 2 tables; submitted manuscript
TabletopGen: 桌面场景生成与机器人操作的交互式仿真
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) ; D-Robotics ; Horizon Robotics
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。
Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/