Intersecting brane world models from D8-branes on (T^2 x T^4/Z_3)/Omega R_1 type IIA orientifolds
专题命中 具身推理 :world model(title)
Comments 30 pages, 7 figures
Journal ref JHEP 0201 (2002) 025
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 具身推理 :world model(title)
Comments 30 pages, 7 figures
Journal ref JHEP 0201 (2002) 025
专题命中 具身推理 :world model(title)
Comments 16 pages
Journal ref Phys.Lett. B522 (2001) 155-165
专题命中 具身推理 :world model(title)
Comments 15 pages, 2 figures, comment and reference added, typos corrected
Journal ref Phys.Rev. D64 (2001) 084022
专题命中 具身推理 :world model(title)
Comments 4 pages, RevTeX
Journal ref Phys.Rev.Lett. 88 (2002) 231802
专题命中 具身推理 :world model(title)
Comments 4 pages, no figure, To appear in Phys. Rev. D
Journal ref Phys.Rev. D60 (1999) 103512
专题命中 具身推理 :world model(title)
Comments 7 pages in LaTeX with the PTP style. No figure. To be published in the proceedings of the workshop "Braneworld -- Dynamics of spacetime with boundary --"
Journal ref Prog.Theor.Phys.Suppl.148:277-283,2003
专题命中 具身推理 :world model(title)
Comments 22 pages, LaTeX file, no figures
Journal ref Phys.Rev.D64:044021,2001
专题命中 具身推理 :world model(title)
Comments 9 pages, see http://www.marc-toussaint.net/
专题命中 具身推理 :world model(title)
Comments 10 pages
专题命中 具身推理 :world model(title)
Comments 11 pages, Latex, to be published in Grav. Cosmol. 7, 241-245 (2001)
Journal ref Grav.Cosmol. 7 (2001) 241-245
专题命中 具身推理 :world model(title)
Comments Impportant modifications. A section has been added to discuss the probability of bulk mode production
生成式上下文与受控状态:可问责纵向临床推理的功能条件
机构 * MyndwareMed(迈恩德韦尔医疗)
专题命中 具身推理 :world model(abstract,abstract_cn);分类 cs.AI
AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。
4D-WAM:通过轨迹场将时空感知注入世界动作模型
专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO
AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。
面向视觉语言模型空间推理的多视图关系蒸馏
机构 * KAIST(韩国科学技术院)
专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV
AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。
ViewMind3D:用于无需训练的3D问答的模块化视图感知推理
专题命中 具身推理 :embodied AI(abstract);robotic(abstract);分类 cs.CV
AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。
LeapBot-WA:通过预测性潜在对齐实现的世界锚定动作模型
专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO
AI总结 研究针对世界动作模型依赖像素级视频生成的瓶颈,提出LeapBot-WA,通过预测性潜在对齐建立新范式,引入ISAE弥合模态差距,设计MoT架构,在多数据集上表现出色,实现高效强大的潜在中心范式及零样本鲁棒性和现实世界迁移。
面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理
机构 * Heritage Institute of Technology(遗产技术学院) ; Kalyani Government Engineering College(卡利亚尼政府工程学院) ; IAIRO ; Intel Corporation(英特尔公司)
专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV
AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。
Comments 14 pages
LAVIFT:用于手术交互识别的潜在动作引导视觉微调
机构 * Arizona State University(亚利桑那州立大学) ; University of California, Merced(加州大学默塞德分校) ; Intel Corporation(英特尔公司)
专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.CV
AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。
EAGOR:全方位的具身推理
机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)
专题命中 具身推理 :embodied agent(abstract);navigation(abstract);分类 cs.RO
AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。
Comments 12 Pages, 7 Figures, 4 Tables
SpaceEra++: 面向视频中3D空间推理的统一框架
机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) ; Shenzhen Loop Area Institute(深圳河套学院) ; School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) ; Pengcheng Laboratory(鹏城实验室) ; School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院) ; Zhongguancun Academy(中关村学院) ; City University of Hong Kong(香港城市大学)
专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.CV
AI总结 提出SpaceEra++框架,通过ScenePick帧采样策略缓解输入不足,并利用SpaceAlign对齐绝对坐标与相对空间关系增强推理,在多个基准上超越强基线。
Comments Accepted by IEEE TPAMI 2026
ReSpace:基于文本的自回归3D室内场景合成与编辑
机构 * Stanford University(斯坦福大学)
专题命中 具身推理 :manipulation(abstract);world model(abstract);分类 cs.CV
AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。
Comments 23 pages, 17 figures, 11 tables (incl. appendix)
PhysiFormer: 在世界空间中学习模拟力学
专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.CV
AI总结 提出PhysiFormer,一种直接在世界坐标下通过去噪扩散过程预测3D物体顶点轨迹的扩散Transformer,无需归纳偏置即可生成物理合理的刚性和弹性运动,并泛化到混合材料、未见几何和更多物体。
Comments Project page: https://yimingc9.github.io/physiformer
GRAFT: 基于部件对应的图结构功能迁移
机构 * Georgia Institute of Technology(佐治亚理工学院) ; NVIDIA(英伟达)
专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 提出GRAFT框架,利用部件级图表示和几何感知对应,通过单次演示实现零样本操作迁移,解决泛化到未见物体的挑战。
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 8746-8755
随流而行:Koopman行为模型作为视觉运动灵巧性的伪规划器
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 具身推理 :world model(abstract,abstract_cn);分类 cs.RO
AI总结 提出统一行为模型(UBM),将灵巧技能建模为耦合动力系统,确保时间一致性;基于Koopman算子实现线性潜空间,通过在线重规划实现反应性和适应性,在模拟和真实任务中达到或超越现有方法。
Comments Website: https://k-ubm.github.io/
面向欧拉-拉格朗日机器人动力学的物理感知稀疏学习与选择性在线自适应
机构 * The University of Manchester(曼彻斯特大学) ; International Institute of Information Technology Hyderabad(海得拉巴国际信息技术学院) ; Delft University of Technology(代尔夫特理工大学) ; Newcastle University(纽卡斯尔大学)
专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO
AI总结 提出一种保结构残差学习框架,将模型误差分解为惯性修正、科里奥利项和广义力残差,通过物理约束学习机械部分,并用稀疏历史依赖潜变量模型和贝叶斯线性回归在线自适应扰动敏感部分,提升多机器人平台动力学预测与轨迹跟踪性能。
Sentinel:具身协同空间推理与规划
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 具身推理 :embodied agent(abstract);navigation(abstract);分类 cs.CV
AI总结 提出Sentinel挑战和CoSaR框架,通过自然语言通信与空间导航算法结合,解决多智能体在城市规模户外环境中的协同空间推理与规划问题。
Comments The first two authors contributed equally
RoboHitch: 从无序关键点学习视觉可供性用于系结
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)
专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 提出RoboHitch框架,利用无序3D关键点和RGB图像从人类演示中学习系结,通过动态图自编码器和卷积自编码器融合特征,预测抓取和放置可供性,实现遮挡下的系结。
AffordVLA: 通过隐式特征对齐将 affordance 表示注入到视觉-语言-动作模型中
机构 * Grasp Lab, School of Mechanical Engineering of Zhejiang University(浙大机械工程学院抓取实验室)
专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 本文提出 AffordVLA 框架,通过隐式特征对齐将以操作为中心的 affordance 表示注入到视觉-语言-动作模型中,以提升动作准确性,实验表明其在仿真和现实中的表现优于现有方法。
Comments 13pages, 10figures
ARIS:面向社交机器人的代理与关系智能系统
机构 * Monash University(墨尔本大学)
专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.RO
AI总结 ARIS通过整合多模态推理、图基社会世界模型和检索增强生成技术,提升社交机器人在多轮交互和社会关系推理中的能力,实验显示其在智能感知和用户亲和力方面表现更优。
用于视觉-语言-动作模型的稳定语言引导
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Lab of Big Data Analysis & Processing(广东大数据分析与处理重点实验室) ; X-Era AI Lab(X-Era AI实验室)
专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 本文提出RSS框架,通过解耦物理 affordance 与语义执行,提升视觉-语言-动作模型在语言扰动下的鲁棒性,实验表明其在多种操作基准测试中达到最优性能。
Comments Accepted to ACL2026 main conference