arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3100 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3100 篇

2603.24835 2026-03-27 cs.CV 57%

DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation

DCARL:一种用于自回归长轨迹视频生成的分而治之框架

Junyi Ouyang, Wenbin Teng, Gonglin Chen, Yajie Zhao, Haiwei Chen

机构 * Institute for Creative Technologies(创意技术研究所) University of Southern California(南加州大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出DCARL框架,通过分而治之策略结合VDMs的高保真生成能力,解决长轨迹视频生成中的视觉漂移和可控性问题,实现高质量且稳定的生成。

Comments 29 pages, 11 figures. Project page: https://junyiouy.github.io/projects/dcarl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22561 2026-03-25 cs.AI 57%

AI Mental Models: Learned Intuition and Deliberation in a Bounded Neural Architecture

AI 心智模型:在有限神经架构中学习的直觉与推理

Laurence Anthony

机构 * Waseda University(早稻田大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文探讨有限神经架构是否能在经典64项演绎推理基准上实现直觉与推理的分工。研究提出双路径架构,通过直觉与推理路径的分离,展示出在交叉验证中推理路径的显著优势,表明模型具备结构化内部计算能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16306 2026-03-18 cs.CV 57%

DriveFix: Spatio-Temporally Coherent Driving Scene Restoration

DriveFix:时空一致的驾驶场景修复

Heyu Si, Brandon James Denis, Muyang Sun, Dragos Datcu, Yaoru Li, Xin Jin, Ruiju Fu, Yuliia Tatarinova, Federico Landi, Jie Song, Mingli Song, Qi Guo

机构 * Zhejiang University(浙江大学) Huawei(华为)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 DriveFix提出一种多视角修复框架,通过交错扩散变换器架构和几何感知损失,实现驾驶场景时空一致性,提升4D世界建模的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13961 2026-03-18 cs.CV 57%

USIS-PGM: Photometric Gaussian Mixtures for Underwater Salient Instance Segmentation

USIS-PGM:用于水下显著实例分割的光度高斯混合

Lin Hong, Xiangtong Yao, Mürüvvet Bozkurt, Xin Wang, Fumin Zhang

机构 * Department of Electronic and Computer Engineering(电子与计算机工程系) The Hong Kong University of Science and Technology(香港科学与技术大学) School of CIT, Chair i6(CIT学院,Chair i6) Technical University of Munich(慕尼黑技术大学) School of CIT(CIT学院) School of Robotics and Advanced Manufacture(机器人与先进制造学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 具身推理 :robotic(abstract);分类 cs.CV

AI总结 本文提出USIS-PGM框架,通过频率感知模块增强边界线索,结合动态加权模块进行内容自适应特征重加权,利用光度高斯混合生成多尺度高斯热图以监督解码器特征,提升水下显著实例分割的定位精度和掩码预测的结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13029 2026-03-18 cs.CV 57%

Think3D: Thinking with Space for Spatial Reasoning

Think3D: 基于空间的思考以实现空间推理

Zaibin Zhang, Yuhan Wu, Lianjie Jia, Yifan Wang, Zhongbo Zhang, Yijiang Li, Binghao Ran, Fuxi Zhang, Zhuohan Sun, Zhenfei Yin, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 具身推理 :manipulation(abstract);分类 cs.CV

AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16253 2026-03-18 cs.CV 57%

Open-Vocabulary Octree-Graph for 3D Scene Understanding

开放词汇八叉树图用于3D场景理解

Zhigang Wang, Yifei Su, Chenhui Li, Dong Wang, Yan Huang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) CASIA TeleAI

专题命中 具身推理 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出Octree-Graph,通过CGSM和IFA算法获取3D实例及语义特征,构建适应性八叉树结构以高效表示场景,实验表明其在多种任务中具有广泛适用性和有效性。

Comments Accepted by ICCV25. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14941 2026-03-17 cs.AI 57%

RS-WorldModel: a Unified Model for Remote Sensing Understanding and Future Sense Forecasting

RS-WorldModel:一种用于遥感理解与未来感知预测的统一模型

Linrui Xu, Zhongan Wang, Fei Shen, Gang Xu, Huiping Zhuang, Ming Li, Haifeng Li

机构 * Central South University(中南大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Guangming Laboratory(光明实验室) South China University of Technology(华南理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 RS-WorldModel通过联合处理时空变化理解和文本引导的未来场景预测,提升遥感任务的跨任务迁移能力,其在1.1 million样本数据集上训练,参数仅2B即可超越多数开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13024 2026-03-17 cs.CV 57%

Learning 2D Invariant Affordance Knowledge for 3D Affordance Grounding

学习2D不变的可供性知识以实现3D可供性定位

Xianqiang Gao, Pingrui Zhang, Delin Qu, Dong Wang, Zhigang Wang, Yan Ding, Bin Zhao

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 本文提出MIFAG框架,通过多视角交互图像提取不变可供性知识,提升3D对象可供性定位的泛化能力。

Comments Accepted by AAAI 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14669 2026-03-17 cs.AI 57%

RenderMem: Rendering as Spatial Memory Retrieval

RenderMem:将渲染作为空间记忆检索

JooHyun Park, HyeongYeop Kang

专题命中 具身推理 :embodied agent(abstract);分类 cs.AI

AI总结 RenderMem通过将渲染作为3D世界与空间推理的接口,使智能体能直接进行视角相关的可见性与遮挡推理,提升空间记忆系统的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14087 2026-03-17 cs.LG cs.CL 57%

Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors

理解下一token预测器中看似无用特征的出现

Mark Rofin, Jalal Naghiyev, Michael Hahn

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 研究探讨了训练中的Transformer模型如何计算看似冗余的抽象特征,并提出方法分析梯度信号对特定特征形成的影响,通过玩具任务和小型模型验证,揭示了预训练语言模型中形式推理领域特征的产生机制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25548 2026-03-17 cs.RO 57%

Using VLM Reasoning to Constrain Task and Motion Planning

利用视觉语言模型推理来约束任务和运动规划

Muyang Yan, Miras Mengdibayev, Ardon Floros, Weihang Guo, Lydia E. Kavraki, Zachary Kingston

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) Department of Computer Science, Rice University(莱斯大学计算机科学系) Ken Kennedy Institute, Rice University(莱斯大学肯尼迪研究所)

专题命中 具身推理 :robotics(abstract);分类 cs.RO

AI总结 本文提出VIZ-COAST方法,利用大预训练视觉语言模型的空间推理能力,提前识别向下细化中的问题,减少规划时间并消除失败。

Comments 9 pages, 7 figures, 1 table. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09346 2026-03-16 cs.RO 57%

How Safe Will I Be Given What I Saw? Calibrated Prediction of Safety Chances for Image-Controlled Autonomy

给我所见的安全性如何?面向图像控制自主系统的校准安全性预测

Zhenjiang Mao, Mrinall Eashaan Umasudhan, Ivan Ruchkin

机构 * Trustworthy Engineered Autonomy (TEA) Lab(可信工程自主性实验室)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 本文提出一种校准的安全性预测框架,用于端到端视觉控制系统,解决部分可观测性和分布偏移下的安全性预测问题,通过无监督域适应和世界模型提升预测鲁棒性。

Comments arXiv admin note: text overlap with arXiv:2308.12252

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26796 2026-03-13 cs.CV cs.GR 57%

See4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting

See4D: 通过自回归视频修复实现无姿态4D生成

Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi, Ziwei Liu

机构 * NUS(新加坡国立大学) HKU(香港大学) CUHK(香港中文大学) THU(清华大学) Shanghai AI Lab(上海人工智能实验室) Horizon Robotics(地平线机器人) NTU(国立科技大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。

Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09285 2026-03-11 cs.CV 57%

Learning Convex Decomposition via Feature Fields

通过特征场学习凸分解

Yuezhi Yang, Qixing Huang, Mikaela Angelina Uy, Nicholas Sharp

机构 * NVIDIA The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出通过特征场学习实现高质量的开放世界凸分解,解决了长期存在的凸分解问题,并实现了首个自监督学习的开放世界模型。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07570 2026-03-10 cs.CV 57%

Efficient RGB-D Scene Understanding via Multi-task Adaptive Learning and Cross-dimensional Feature Guidance

通过多任务自适应学习和跨维度特征引导实现高效的RGB-D场景理解

Guodong Sun, Junjie Liu, Gaoyang Zhang, Bo Wu, Yang Zhang

机构 * School of Mechanical Engineering(机械工程学院) Vehicle Measurement, Control and Safety Key Laboratory of Sichuan Province(四川省车辆测量控制与安全重点实验室) National Key Laboratory for Novel Software Technology(新型软件技术国家实验室) Shanghai Advanced Research Institute(上海先进研究院) Hubei Key Laboratory of Modern Manufacturing Quality Engineering(湖北省现代制造质量工程重点实验室)

专题命中 具身推理 :robotic(abstract);分类 cs.CV

AI总结 本文提出一种高效的RGB-D场景理解模型,通过多任务自适应学习和跨维度特征引导,提升语义分割、实例分割等任务的准确性和效率。

Comments 23 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03718 2026-03-05 cs.CV 57%

Glass Segmentation with Fusion of Learned and General Visual Features

利用学习和通用视觉特征融合的玻璃分割

Risto Ojala, Tristan Ellison, Mo Chen

机构 * Aalto University(奥卢大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 本文提出了一种融合学习和通用视觉特征的玻璃分割架构,通过双主干网络和Mask2Former解码器实现高精度分割,并在多个数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03515 2026-03-05 cs.CY cs.AI 57%

The Controllability Trap: A Governance Framework for Military AI Agents

可控性陷阱:军事AI代理的治理框架

Subramanyam Sahoo

机构 * MARS (Mentorship for Alignment Researchers) 4.0 Fellow(MARS(对齐研究导师计划)4.0 Fellow) Cambridge AI Safety Hub (CAISH) University of Cambridge(剑桥AI安全中心(CAISH)剑桥大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出AMAGF框架,通过预防、检测和纠正三个支柱,解决军事AI代理中的控制失效问题,通过控制质量评分实现持续控制管理。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild. 20 Pages and 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02049 2026-03-03 cs.CV 57%

WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories

WorldStereo: 通过3D几何记忆桥接相机引导的视频生成与场景重建

Yisu Zhang, Chenjie Cao, Tengfei Wang, Xuhui Zuo, Junta Wu, Jianke Zhu, Chunchao Guo

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 WorldStereo通过3D几何记忆模块实现相机引导视频生成与3D场景重建的高效融合,提升多视角一致性与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20550 2026-02-25 cs.CV 57%

The Finite Primitive Basis Theorem for Computational Imaging: Formal Foundations of the OperatorGraph Representation

计算成像的有限原始基定理:操作图表示法的正式基础

Chengshuai Yang

机构 * NextGen PlatformAI C Corp, USA(NextGen平台AI公司)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 该研究提出有限原始基定理,证明所有成像前向模型可表示为由11个标准原语构成的DAG,并通过实验验证其在多种成像模态中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19503 2026-02-24 cs.CV 57%

A Text-Guided Vision Model for Enhanced Recognition of Small Instances

一种基于文本引导的视觉模型,用于提升小实例的识别

Hyun-Ki Jung

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出了一种基于文本引导的改进YOLO-World模型,通过优化主干网络结构提升小物体检测精度和模型轻量化性能。

Comments Accepted for publication in Applied Computer Science (2026)

Journal ref Applied Computer Science, Vol. 22, No. 1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17217 2026-02-20 cs.AI 57%

Continual learning and refinement of causal models through dynamic predicate invention

通过动态谓词发明实现因果模型的持续学习与完善

Enrique Crespo-Fernandez, Oliver Ray, Telmo de Menezes e Silva Filho, Peter Flach

机构 * University of Bristol(布里斯托大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出通过动态谓词发明实现因果模型的持续学习与完善,利用元解释学习提升推理效率,显著提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15384 2026-02-18 cs.AI cs.CL 57%

World-Model-Augmented Web Agents with Action Correction

具有动作修正的世界模型增强型网络代理

Zhouzhou Shen, Xueyu Hu, Xiyun Li, Tianqing Fang, Juncheng Li, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Tencent AI Lab(腾讯AI实验室)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 WAC通过多代理协作和风险感知机制,提升网络代理在复杂任务中的鲁棒性和执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03974 2026-02-05 cs.AI 57%

Active Epistemic Control for Query-Efficient Verified Planning

主动认知控制用于查询高效的验证规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 主动认知控制通过结合基于模型的信念管理和范畴可行性检查,实现查询高效的验证规划,在交互环境中减少重新规划轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17323 2026-01-30 cs.CV 57%

SkyReels-V3 Technique Report

SkyReels-V3 技术报告

Debang Li, Zhengcong Fei, Tuanhui Li, Yikun Dou, Zheng Chen, Jiangping Yang, Mingyuan Fan, Jingtao Xu, Jiahua Wang, Baoxuan Gu, Mingshan Chang, Wenjing Cai, Yuqiang Xie, Binjie Mao, Youqiang Zhang, Nuo Pang, Hao Zhang, Yuzhe Jin, Zhiheng Xu, Dixuan Lin, Guibin Chen, Yahui Zhou

机构 * SkyReels Team(SkyReels 团队)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 SkyReels-V3 提出三种视频生成范式,通过多模态上下文学习框架实现高质量视频生成,涵盖图像到视频、视频扩展和音频引导生成,达到接近闭源系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03762 2026-01-30 cs.CL cs.AI 57%

Brain in a Vat: On Missing Pieces Towards Artificial General Intelligence in Large Language Models

虚拟大脑:迈向大型语言模型中人工通用智能的缺失部件

Yuxi Ma, Chi Zhang, Song-Chun Zhu

机构 * Beijing Insitute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型中人工通用智能的缺失部件,提出智能代理应具备无限任务执行、任务生成、价值系统和现实世界模型等特征,并强调知与行的统一对智能发展的重要性。

Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 47 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19752 2026-01-28 cs.AI 57%

Agentic Design Patterns: A System-Theoretic Framework

代理设计模式:一种系统理论框架

Minh-Dung Dao, Quy Minh Le, Hoang Thanh Lam, Duc-Trong Le, Quoc-Viet Pham, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork Vietnam National University(越南国家大学) IBM Research Ireland(IBM爱尔兰研究) Trinity College Dublin(都柏林三一学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出了一种系统理论框架,通过分解代理AI系统为五个核心功能子系统,提出12种代理设计模式,以解决代理设计中的重复问题,提升自主系统的模块化和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11027 2026-01-28 cs.CV 57%

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Vlaser:具有协同具身推理能力的视觉-语言-动作模型

Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Fudan University(复旦大学) Tsinghua University(清华大学) NUS(新加坡国立大学) Northeastern University(东北大学) Shenzhen University(深圳大学)

专题命中 具身推理 :embodied agent(abstract);分类 cs.CV

AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15281 2026-01-22 cs.CV 57%

StableWorld: Towards Stable and Consistent Long Interactive Video Generation

StableWorld: 向稳定和一致的长交互视频生成迈进

Ying Yang, Zhengyao Lv, Tianlin Pan, Haofan Wang, Binxin Yang, Hubery Yin, Chen Li, Ziwei Liu, Chenyang Si

机构 * PRLab, NJU(南京大学PRLab) HKU(香港大学) UCAS(中国科学技术大学) WeChat, Tencent Inc.(腾讯公司) NTU(国立清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 StableWorld通过动态帧淘汰机制提升长交互视频生成的稳定性和时间一致性,适用于多种生成框架。

Comments 17 pages, 21 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15946 2026-01-19 cs.LG cs.AR hep-ex 57%

AIE4ML: An End-to-End Framework for Compiling Neural Networks for the Next Generation of AMD AI Engines

AIE4ML:一个端到端框架,用于为下一代AMD AI引擎编译神经网络

Dimitrios Danopoulos, Enrico Lupi, Chang Sun, Sebastian Dittmeier, Michael Kagan, Vladimir Loncar, Maurizio Pierini

机构 * Institute of Physics Belgrade, Serbia(塞尔维亚贝尔格莱物理研究所) Physikalisches Institut, Heidelberg University, Germany(德国海德堡大学物理研究所) SLAC National Accelerator Laboratory, Menlo Park, CA, USA(美国Menlo Park加州SLAC国家加速器实验室)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 AIE4ML是一个端到端框架,用于将AI模型自动转换为优化的固件,以在AMD AIE-ML设备上实现高效神经网络执行,同时支持向前兼容新架构,提供高效率和低延迟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14981 2026-01-16 cs.CV 57%

SPATIALGEN: Layout-guided 3D Indoor Scene Generation

SPATIALGEN: 布局引导的3D室内场景生成

Chuan Fang, Heng Li, Yixun Liang, Jia Zheng, Yongsen Mao, Yuan Liu, Rui Tang, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Manycore Tech Inc(Manycore科技公司)

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 SPATIALGEN通过布局引导的多视角多模态扩散模型生成高质量3D室内场景,解决现有方法在视觉质量、多样性及语义一致性方面的不足。

Comments 3D scene generation; diffusion model; Scene reconstruction and understanding

详情

展开后加载摘要…

URL PDF HTML 收藏