arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3100 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3100 篇

2605.09355 2026-05-12 cs.LG 57%

FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning

FLAME:适应性专家混合用于连续多模态多任务学习

Xing Han, Shravan Chaudhari, Tanvi Ranade, Rama Chellappa, Suchi Saria

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 FLAME提出了一种可扩展的专家混合框架,支持多任务预训练和连续学习,通过模态特定路由器处理不同模态的任务,同时利用低秩内存子空间压缩专家知识,提升参数效率和减少灾难性遗忘。

Comments 37 pages, 25 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08956 2026-05-12 cs.AI 57%

Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery

代理式AI科学家并非为自主科学发现而建

Harshit Bisht, Vinay Kumar, Kevin Maik Jablonka, Mausam, N. M. Anoop Krishnan

机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系) Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学有机与大分子化学实验室) Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学能源与环境化学中心) Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena)(耶拿海德堡聚合物能源应用研究所(HIPOLE耶拿))

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文指出,尽管代理式AI科学家能作为合作者,但其设计并非为自主科学发现。挑战包括问题选择偏差、实验室知识缺失、输出多样性压缩及缺乏实验反馈,需重新审视基础设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04899 2026-05-12 cs.LG 57%

A geometric relation of the error introduced by sampling a language model's output distribution to its internal state

语言模型输出分布采样引入的误差与内部状态的几何关系

Albert F. Modenbach

机构 * Department of Mathematics, King's College London, United Kingdom(伦敦国王学院数学系)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 研究揭示语言模型输出分布采样误差与内部状态几何结构的关系,通过几何方法分析token嵌入空间,发现其曲率在棋类任务中反映模型对问题的内部表示。

Comments 12 Pages, 10 Figures, 2 Appendices. To appear in Proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03490 2026-05-11 cs.LG q-bio.NC 57%

Path Integration and Object-Location Binding Emerge in an Action-Conditioned Predictive Sequence Network

路径整合与物体-位置绑定在动作条件预测序列网络中出现

Linda Ariel Ventura, Victoria Bosch, Tim C Kietzmann, Sushrut Thorat

机构 * Sorbonne University(索邦大学) Institute of Cognitive Science(认知科学研究所) Osnabrück University(奥斯纳布吕克大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 研究探讨了动作条件预测序列网络如何通过上下文学习提升预测准确性,并揭示了路径整合和动态绑定在结构化表示中的作用。

Comments 8 pages, 4 figures; accepted at CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07195 2026-05-11 cs.CV 57%

See Tomorrow, Act Today: Foresight-Driven Autonomous Driving

预见未来,立即行动:基于预见的自动驾驶

Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出ForeSight框架,通过生成未来场景并据此规划动作,实现前瞻性决策,实验表明其在动态场景中优于现有方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06334 2026-05-08 cs.CL cs.LG cs.LO 57%

MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

MANTRA: 为使用工具的LLM代理合成经过SMT验证的合规性基准

Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 MANTRA通过自动合成可机检验的合规性基准,解决LLM代理在复杂手册下的合规性验证问题,支持任意领域和长流程手册,并提供可调节的任务复杂度,生成285个任务的基准套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07516 2026-05-08 cs.AI cs.CL 57%

CompassLLM: A Multi-Agent Approach toward Geo-Spatial Reasoning for Popular Path Query

CompassLLM: 一种面向流行路径查询的多智能体方法

Md. Nazmul Islam Ananto, Shamit Fatin, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) University of Utah(犹他大学) Monash University(莫纳什大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 具身推理 :navigation(abstract);分类 cs.AI

AI总结 CompassLLM通过多智能体框架解决流行路径查询问题,结合空间推理能力提升搜索和生成性能,实验显示其在准确性和成本效益方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28980 2026-05-04 cs.CV 57%

Stepper: Stepwise Immersive Scene Generation with Multiview Panoramas

Stepper:基于多视角全景图的分步沉浸式场景生成

Felix Wimbauer, Fabian Manhardt, Michael Oechsle, Nikolai Kalischek, Christian Rupprecht, Daniel Cremers, Federico Tombari

机构 * Google(谷歌) University of Oxford(牛津大学) MCML Technical University of Munich(慕尼黑技术大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 Stepper通过分步扩展多视角全景图,解决传统方法在视觉保真度与可探索性之间的权衡问题,实现高质量沉浸式3D场景生成。

Comments Accepted at CVPR 2026 Findings; Find our project page under https://fwmb.github.io/stepper/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04212 2026-05-04 cs.CL cs.AI 57%

Language Models Struggle to Use Representations Learned In-Context

语言模型在上下文学习的表示使用上面临困难

Michael A. Lepori, Tal Linzen, Ann Yuan, Katja Filippova

机构 * Brown University(布朗大学) Google Research(谷歌研究) New York University(纽约大学) Google DeepMind(谷歌DeepMind)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 研究探讨了语言模型是否能利用上下文学习的表示完成简单下游任务,发现开放权重模型在处理新语义表示时存在困难,即使它们在潜在表示中编码了这些语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27899 2026-05-01 cs.AI 57%

Simulating clinical interventions with a generative multimodal model of human physiology

用生成式多模态模型模拟临床干预

Guy Lutsker, Gal Sapir, Jordi Merino, Smadar Shilo, Anastasia Godneva, Eli Meirom, Shie Mannor, Hagai Rossman, Gal Chechik, Eran Segal

机构 * Department of Computer Science and Applied Mathematics, Weizmann Institute of Science(魏茨曼科学研究所计算机科学与应用数学系) Department of Molecular Cell Biology, Weizmann Institute of Science(魏茨曼科学研究所分子细胞生物学系) NVIDIA Novo Nordisk Foundation Center for Basic Metabolic Research, University of Copenhagen(诺沃维克基金会基础代谢研究中心,哥本哈根大学) Faculty of Medical and Health Sciences, Tel Aviv University(特拉维夫大学医学与健康科学学院) The Jesse Z and Sara Lea Shafer Institute for Endocrinology and Diabetes, National Center for Childhood Diabetes, Schneider Children’s Medical Center of Israel(杰西Z和索菲亚·李·沙弗内分泌学与糖尿病研究所,以色列儿童糖尿病国家中心,施耐德儿童医学中心) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出HealthFormer模型,通过训练人类表型项目数据,生成人类生理轨迹,实现对个体生理变化的预测和干预模拟,提升临床风险评分和疾病预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27576 2026-05-01 cs.LO cs.LG 57%

BAss: Symbolic Reasoning in Abstract Dialectical Frameworks

BAss:基于BDD的抽象辩证框架符号推理

Samuel Pastva, Van-Giang Trinh

机构 * Faculty of Informatics, Masaryk University(马萨里克大学信息学院) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT)(胡志明市技术大学计算机科学与工程学院)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 BAss基于BDD提出新型分析工具,实现抽象辩证框架的所有可接受、完整和优先解释的全符号计算,优于现有工具并在大规模解空间场景中表现优异,推动系统生物学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04978 2026-05-01 cs.AI 57%

Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI

对齐感知、推理、建模与交互:物理AI的综述

Kun Xiang, Terry Jingchen Zhang, Yinya Huang, Jixi He, Zirong Liu, Yueling Tang, Ruizhe Zhou, Lijing Luo, Youpeng Wen, Xiuwei Chen, Bingqian Lin, Jianhua Han, Hang Xu, Hanhui Li, Bin Dong, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(云网智能技术有限公司) Peking University and Beijing International Center for Mathematical Research(北京大学和北京国际数学研究中心)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文综述了物理AI,探讨了理论物理推理与应用物理理解的区别,并分析了基于物理的方法如何提升AI在现实世界中的理解能力,推动更安全、可推广的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25329 2026-04-29 cs.RO 57%

ProDrive: Proactive Planning for Autonomous Driving via Ego-Environment Co-Evolution

ProDrive:通过自我环境共演实现自动驾驶的前瞻性规划

Chuyao Fu, Shengzhe Gan, Zhuoli Ouyang, Yuhan Rui, Xiaowei Chi, Sirui Han, Jiankun Wang, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 ProDrive通过自我环境共演实现自动驾驶前瞻性规划,结合查询导向的轨迹规划器和鸟瞰图世界模型,提升安全性和规划效率。

Comments Accepted to CVPR 2026 GigaBrain Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23278 2026-04-28 cs.AI 57%

Active Inference: A method for Phenotyping Agency in AI systems?

主动推断:一种用于AI系统中表型代理的方法?

Philip Wilson, Axel Constant, Mahault Albarracin, Nicolás Hinrichs, Jasmine Moore, Daniel Polani, Karl Friston

机构 * Independent Researcher Laboratoire d'Analyse Cognitive de l'Information, Universit\' e du Qu\' e bec \` a Montr\' e al, Qu\' e bec, Canada Centre of Excellence for AI Robotics, Sheffield Hallam University, Sheffield, UK Methods Statistical Computing, Max Planck Institute for Human Cognitive Brain Sciences, Leipzig, Germany Department of Computer Science, School of Physics, Engineering Computer Science, University of Hertfordshire, Hatfield, UK Wellcome Centre for Human Neuroimaging, University College London, London, UK Department of Engineering Informatics, University of Sussex, Falmer, Brighton, BN1 9RH, UK

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出基于主动推断的表型代理方法,通过变分框架将信念、偏好和自由能最小化结合,以区分不同代理表型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22618 2026-04-27 cs.LG 57%

Beyond Patient Invariance: Learning Cardiac Dynamics via Action-Conditioned JEPAs

超越患者不变性:通过动作条件化JEPAs学习心脏动力学

Jose Geraldo Fernandes, Luiz Facury, Pedro Robles Dutenhefner, Wagner Meira

机构 * Department of Computer Science(计算机科学系) Universidade Federal de Minas Gerais(巴西联邦大学矿务格里斯矿大学) Belo Horizonte, Brazil(巴西伯洛霍内)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文提出动作条件化世界模型,通过学习疾病进展动力学,区分稳定解剖特征与动态病理力量,提升心电图关键分诊任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19509 2026-04-22 cs.RO cs.MA 57%

Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

评估基于视觉语言模型的非人形机器人语义可及性推理

Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

机构 * Bristol Robotics Laboratory, University of Bristol(布里斯托尔机器人实验室,布里斯托尔大学) University of Bristol(布里斯托尔大学)

专题命中 具身推理 :robotic(abstract);分类 cs.RO

AI总结 本文研究了视觉语言模型在非人形机器人上的语义可及性推理能力,通过混合数据集分析发现模型在不同物体和机器人形态上表现不一,存在保守预测倾向,需结合其他方法以提高性能。

Comments AAMAS 2026 (main track), 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18000 2026-04-21 cs.RO 57%

Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models

揭示视觉-语言-动作模型中具身推理的幻觉

Haiweng Xu, Sipeng Zheng, Hao Luo, Wanpeng Zhang, Ziheng Xi, Zongqing Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) BeingBeyond

专题命中 具身推理 :robotic(abstract);分类 cs.RO

AI总结 本文通过BeTTER基准测试揭示现有VLA模型在动态场景中表现不佳,指出其根本问题在于架构瓶颈导致的语义表示退化,强调需解决高频率控制与高层推理间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11789 2026-04-21 cs.CV 57%

LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation

LMMs 与以物体为中心的视觉:理解、分割、编辑和生成

Yuqian Yuan, Wenqiao Zhang, Juekai Lin, Yu Zhong, Mingjian Gao, Binhe Yu, Yunqi Cao, Wentong Li, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 具身推理 :manipulation(abstract);分类 cs.CV

AI总结 本文探讨了LMMs与以物体为中心的视觉结合,总结了在理解、分割、编辑和生成方面的新进展,提出了开放挑战和未来方向。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13637 2026-04-21 cs.CV cs.MM 57%

Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation

探索互惠的跨模态注意力以实现情境感知的人体可供性生成

Prasun Roy, Saumik Bhattacharya, Subhankar Ghosh, Umapada Pal, Michael Blumenstein

机构 * University of Technology Sydney(技术大学悉尼大学) Indian Institute of Technology, Kharagpur(印度理工学院哈里科特) Indian Statistical Institute, Kolkata(印度统计研究所科契)

专题命中 具身推理 :navigation(abstract);分类 cs.CV

AI总结 本文提出一种互惠的跨模态注意力机制,通过不同模态的空间特征图互相关注,以提升2D场景中人体可供性预测的准确性与效率。

Comments Accepted in The IEEE Transactions on Artificial Intelligence (TAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23421 2026-04-20 cs.CV 57%

DriveLaW:Unifying Planning and Video Generation in a Latent Driving World

DriveLaW:在潜在驾驶世界中统一规划与视频生成

Tianze Xia, Yongkang Li, Lijun Zhou, Jingfeng Yao, Kaixin Xiong, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 DriveLaW通过统一视频生成与运动规划,提升自动驾驶中的预测与规划性能,实现视频生成与轨迹规划的一致性,取得新的state-of-the-art结果。

Comments 18 pages, 6 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10992 2026-04-15 cs.CV 57%

ArtiCAD: Articulated CAD Assembly Design via Multi-Agent Code Generation

ArtiCAD: 通过多智能体代码生成实现可动CAD装配设计

Yuan Shui, Yandong Guan, Zhanwei Zhang, Juncheng Hu, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.CV

AI总结 ArtiCAD通过多智能体系统从文本或图像生成可编辑的可动CAD装配,利用连接器定义连接点和关节参数,提升空间推理能力,通过验证步骤和回滚机制确保输出质量,验证了其在概念设计、物理原型和AI训练资产生成中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10573 2026-04-14 cs.CV 57%

Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images

从未标注的多视角图像中学习3D表示以提升空间智能

Bo Zhou, Qiuxia Lai, Zeren Sun, Xiangbo Shu, Yazhou Yao, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) Communication University of China(中国传媒大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出UniSplat框架,通过双掩码策略、高斯溅射策略和姿态条件重校准机制,解决未标注多视角图像中3D表示学习的几何诱导弱、外观细节不足和几何语义不一致问题,实现鲁棒且通用的3D表示。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10723 2026-04-10 cs.LG 57%

Generalized Spherical Neural Operators: Green's Function Formulation

广义球面神经算子:格林函数公式

Hao Tang, Hao Chen, Chao Li

机构 * University of Dundee, United Kingdom(英国邓迪大学) University of Cambridge, United Kingdom(英国剑桥大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文提出基于可设计球面格林函数及其谐波展开的广义算子设计框架,提出适应非等变系统的GSNO算子,结合多尺度谱模型与球面上下采样构建SHNet,实验证明其在扩散磁共振成像、浅水动力学和全球天气预测中优于现有方法。

Comments ICLR 2026 (International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06339 2026-04-09 cs.CV 57%

Evolution of Video Generative Foundations

视频生成基础的演变

Teng Hu, Jiangning Zhang, Hongrui Huang, Ran Yi, Zihan Su, Jieyu Weng, Zhucun Xue, Lizhuang Ma, Ming-Hsuan Yang, Dacheng Tao

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文综述了视频生成技术的发展,从早期GAN到扩散模型,再到AR和多模态技术,探讨了核心原理、关键进展及未来趋势,旨在为视频生成及其应用提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04723 2026-04-07 cs.CL cs.AI 57%

Individual and Combined Effects of English as a Second Language and Typos on LLM Performance

英语作为第二语言与拼写错误的个体与综合影响

Serena Liu, Yutong Yang, Prisha Sheth, Weixuan Dong, Mingjiao Diao, Xinru Zhu, Nikhil Banga, Oscar Melendez, Arnav Sharma, Minda Zhao, Marina Lin, Mengyu Wang

机构 * Harvard University(哈佛大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 研究探讨了英语作为第二语言和拼写错误对大语言模型性能的影响,发现两者结合时性能下降更显著,且在封闭式任务中表现更一致,而开放式任务结果更混杂。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01359 2026-04-03 cs.AI 57%

Semantic Modeling for World-Centered Architectures

面向世界中心架构的语义建模

Andrei Mantsivoda, Darya Gavrilina

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出世界中心多智能体系统(WMAS)作为传统智能体中心架构的替代方案,通过共享世界模型实现语义一致性、可解释性和长期稳定性,并介绍了Ontobox平台作为其实现。

Comments 15 pages, 1 figure, MathAI conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00558 2026-04-02 cs.CV 57%

STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO

STAR:通过转弯点对齐和段级DPO缓解空间推理中的级联错误

Pukun Zhao, Longxiang Wang, Chen Chen, Peicheng Wang, Fanqing Zhou, Runze Li, Haojian Huang

机构 * Guangdong University of Finance and Economics(广东财经大学) Chongqing University(重庆大学) Westlake University(西湖大学) The University of Hong Kong(香港大学)

专题命中 具身推理 :navigation(abstract);分类 cs.CV

AI总结 本文提出STAR框架,通过拓扑锚点解决复杂拓扑中的级联错误问题,引入RedMaze-23K数据集并采用段级DPO提升长距离导航的自我修正能力,实验表明其32B版本在开源模型中表现最优。

Comments 9 pages, 6 figures, 4 tables, Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18887 2026-04-01 cs.CV 57%

SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World

SafeDrive: 为稀疏世界中的端到端驾驶进行细粒度安全推理

Jungho Kim, Jiyong Oh, Seunghoon Yu, Hongjae Shin, Donghyuk Kwak, Jun Won Choi

机构 * Seoul National University(首尔大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 SafeDrive提出了一种端到端规划框架,通过轨迹条件化的稀疏世界模型进行显式且可解释的安全推理,实现了在开放循环和闭合循环基准上的最佳性能,有效降低了碰撞率。

Comments Accepted to CVPR 2026, 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01342 2026-03-31 cs.CV 57%

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

InternVideo-Next:无需视频-文本监督的通用视频基础模型

Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institutes of Advanced Technology, China(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出InternVideo-Next,通过解耦传统编码器-解码器设计为Encoder-Predictor-Decoder框架,解决像素重建与语义冲突问题,构建语义一致且细节保留的潜在空间,提升视频基础模型的通用性。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26997 2026-03-31 cs.RO cs.HC 57%

ROSClaw: An OpenClaw ROS 2 Framework for Agentic Robot Control and Interaction

ROSClaw: 一种用于代理机器人控制与交互的OpenClaw ROS 2框架

Irvin Steve Cardenas, Marcus Anthony Arnett, Natalie Catherine Yeo, Lucky Sah, Jong-Hoon Kim

机构 * Advanced Telerobotics Research Lab, Kent State University(肯特州立大学先进远程机器人研究实验室) OpenDive Technologies

专题命中 具身推理 :embodied AI(abstract);分类 cs.RO

AI总结 ROSClaw通过整合OpenClaw代理运行时与ROS 2,实现任意基础模型与ROS-enabled机器人之间的交互,支持动态能力发现、多模态观察归一化、预执行动作验证和结构化审计日志,验证了执行层设计对任务完成与安全行为的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏