arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3100 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3100 篇

2501.13428 2026-06-02 cs.CL cs.AI cs.LG 62%

Softplus Attention with Re-weighting Boosts Length Extrapolation in Large Language Models

Softplus注意力与重加权提升大语言模型的长度外推能力

Bo Gao, Michael W. Spratling, Letizia Gionfrida

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种两阶段注意力机制,用Softplus和l1归一化替代Softmax,并引入基于不变熵的动态缩放因子和重加权机制,以提升数值稳定性、缓解注意力下沉现象,并显著改善长度外推性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31251 2026-06-01 cs.CV cs.AI 62%

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

ERGeoBench:多模态大语言模型中具身推理与地理定位的综合基准

Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Materials Science and Engineering(材料科学与工程学院) China Mobile Research Institute(中国移动研究院) College of Computing and Data Science(计算与数据科学学院)

专题命中 具身推理 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 提出ERGeoBench基准,通过单视图、全景视图和具身视图三种渐进设置评估多模态大语言模型在视觉驱动的具身地理定位中的能力,发现当前模型在高层次地理语义推理上表现良好,但在细粒度感知、度量定位和视图间空间一致性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29879 2026-06-01 cs.CV cs.RO 62%

DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding

DGSG-Mind:用于长期场景理解与定位的动态3D高斯场景图

Luzhou Ge, Xiangyu Zhu, Jinyan Liu, Xuesong Li

机构 * School of Computer Science, Beijing Institute of Technology, China(北京理工大学计算机科学学院)

专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出DGSG-Mind,一种混合实例感知的3D高斯动态场景图系统,通过概率体素网格与显式3D高斯结合实现鲁棒的跨模态实例融合和增量语义映射,并构建层次化场景图与3D高斯思维进行多模态推理,在零样本3D视觉定位、开放词汇语义分割和场景重建中取得领先性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22456 2026-05-22 cs.RO cs.AI 62%

Steins;Gate Drive: Semantic Safety Arbitration over Structured Futures for Latency-Decoupled LLM Planning

Steins;Gate Drive: 基于结构化未来语义安全仲裁的延迟解耦LLM规划

Anjie Qiu, Hans D. Schotten

机构 * Institute for Wireless Communication and Navigation(无线通信与导航研究所) RPTU University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出SteinsGateDrive架构,通过延迟解耦规划与运行时架构,在保持安全边界的同时,将有效延迟从+3.07秒减少到-0.01秒,提升了自动驾驶的规划效率。

Comments 10 pages, 2 figures, 5 tables, submitted to IEEE transaction of intelligent vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22089 2026-05-22 cs.CV cs.AI 62%

LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model

LVDrive: 基于潜在视觉表征的视觉-语言-动作自动驾驶模型

Xiaodong Mei, Diankun Zhang, Hongwei Xie, Guang Chen, Hangjun Ye, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaomi EV(小米电动车)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出LVDrive,一种增强视觉-语言-动作能力的自动驾驶模型,通过引入未来场景预测任务,在高维潜在空间中学习语义丰富的场景表示,从而提升闭环驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02060 2026-05-19 cs.CV cs.RO 62%

CompassAD: Intent-Driven 3D Affordance Grounding in Functionally Competing Objects

CompassAD: 基于意图的多功能竞争物体3D affordance 地标

Jingliang Li, Jindou Jia, Tuo An, Chuhao Zhou, Xiangyu Chen, Shilin Shan, Boyu Ma, Bofan Lyu, Gen Li, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University, Singapore(MARS实验室,南洋理工大学,新加坡)

专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究提出了一种新的3D affordance设定,即意图驱动的可混淆地标,旨在预测多物体点云中正确物体的每点affordance掩码,基于隐含的自然语言意图。通过构建CompassAD基准,该研究展示了在具有隐含意图的多物体组合中的先进结果,并在机器人机械臂上验证了其在真实世界抓取中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17923 2026-05-19 cs.DC cs.AI cs.LG 62%

AdaptiveLoad: Towards Efficient Video Diffusion Transformer Training

AdaptiveLoad: 向高效视频扩散变换器训练迈进

Yucheng Guo, Yongjian Guo, Zhong Guan, Haoran Sun, Wen Huang, Wanting Xu, Jing Long, Shuai Di, Junwu Xiong

机构 * Tsinghua University(清华大学) Peking University(北京大学) Tianjin University(天津大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AdaptiveLoad框架,通过双约束自适应负载平衡系统和融合LayerNorm-Modulate CUDA内核,解决视频生成模型中大规模视频扩散变换器(如DiT和MMDiT)训练中的计算不平衡问题,实验显示其在Wan 2.1世界模型上提升了计算效率和训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16412 2026-05-19 cs.RO cs.CV 62%

SCAR: Self-Supervised Continuous Action Representation Learning

SCAR:自监督连续动作表示学习

Hongjia Liu, Fan Feng, Minghao Fu, Xinyue Wang, Haofei Lu, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校) KTH Royal Institute of Technology(皇家理工学院)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SCAR框架,通过自监督学习统一动作表示,提升跨体素和任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14036 2026-05-15 cs.AI cs.CC cs.CL cs.LG 62%

Enhanced and Efficient Reasoning in Large Learning Models

增强和高效的大型学习模型推理

Leslie G. Valiant

机构 * John A. Paulson School of Engineering and Applied Sciences(约翰·A·保罗森工程与应用科学学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种高效且基于原理的推理方法,用于改进大型语言模型,通过预处理和机器学习流程提升推理能力,实现更稳健的逻辑推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04759 2026-05-14 cs.CL cs.AI cs.ET cs.LG 62%

Gyan: An Explainable Neuro-Symbolic Language Model

Gyan:一种可解释的神经符号语言模型

Venkat Srinivasan, Vishaal Jatav, Anushka Chandrababu, Geetika Sharma

机构 * Innospark Ventures & Gyan AI(Innospark Ventures及Gyan AI) Gyan AI Inc.(Gyan AI公司)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 Gyan基于非Transformer架构构建,克服了传统大语言模型的局限性,在多个数据集上取得SOTA表现,展示了可信任且可靠的使命关键任务模型潜力。

Comments also submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17104 2026-05-14 cs.DC cs.AI cs.LG 62%

TStore: Rethinking AI Model Hub with Tensor-Centric Compression

TStore: 以张量为中心的AI模型仓库重新思考

Tingfeng Lan, Zirui Wang, Yunjia Zheng, Zhaoyuan Su, Juncheng Yang, Yue Cheng

机构 * University of Virginia(弗吉尼亚大学) Harvard University(哈佛大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 TStore通过细粒度去重和压缩技术减少存储开销,保留模型可用性和性能,实现实验中显著的存储节省。

Comments 12 pages, 6 figures. Systems paper on AI model storage

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09790 2026-05-12 cs.DC cs.AI cs.LG 62%

Multi-Tier Labeling and Physics-Informed Learning for Orbital Anomaly Detection at Scale

多层级标签与物理引导学习用于大规模轨道异常检测

Yong Fu

机构 * Substratum Labs, Inc(Substring实验室)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多层级标签方法,结合物理规则、IMM-UKF和补充元素校准,实现大规模轨道异常检测,通过Transformer模型提升召回率,探讨神经ODE在轨道世界模型中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09650 2026-05-12 cs.AI cs.LG 62%

Workspace Optimization: How to Train Your Agent

工作区优化:如何训练你的智能体

Elad Sarafian, Gal Kaplun, Ron Banner, Daniel Soudry, Boris Ginsburg

机构 * NVIDIA

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过优化智能体的工作区结构来提升其在多轮任务中的表现,通过模拟权重空间训练方法,利用人工制品、证据、反例和文本反馈来改进智能体的执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03916 2026-05-12 cs.CV cs.CE cs.CL cs.LG 62%

SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?

SpatiaLab: 视觉-语言模型能否在真实环境中进行空间推理?

Azmine Toushik Wasi, Wahid Faisal, Abdur Rahman, Mahfuz Ahmed Anik, Munem Shahriar, Mohsin Mahmud Topu, Sadia Tasnim Meem, Rahatun Nesa Priti, Sabrina Afroz Mitu, Md. Iqramul Hoque, Shahriyar Zaman Ridoy, Mohammed Eunus Ali, Majd Hawasly, Mohammad Raza, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory(计算智能与运筹实验室) Shahjalal University of Science and Technology(沙赫jalal科技大学) BRAC University(BRAC大学) North South University(北南大学) Monash University(墨尔本大学) Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 具身推理 :navigation(abstract);分类 cs.CV、cs.LG

AI总结 SpatiaLab通过真实场景下的空间推理任务评估视觉-语言模型的能力,揭示其在复杂空间关系、深度感知和3D几何方面的不足。

Comments Accepted to ICLR 2026 (https://openreview.net/forum?id=fWWUPOb0CT). 92 Pages. 42 Figures and 29 Tables

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28122 2026-05-01 cs.CV cs.LG 62%

Beyond Gaussian Bottlenecks: Topologically Aligned Encoding of Vision-Transformer Feature Spaces

超越高斯瓶颈:基于拓扑对齐的视觉Transformer特征空间编码

Andrew Bond, Ilkin Umut Melanlioglu, Erkut Erdem, Aykut Erdem

机构 * Department of Computer Engineering, Koç University, Istanbul, Turkey(科克大学计算机工程系,伊斯坦布尔,土耳其) Department of Computer Engineering, Hacettepe University, Ankara, Turkey(哈恰塔佩大学计算机工程系,安卡拉,土耳其) KUIS AI Research Center, Istanbul, Turkey(KUIS人工智能研究中心,伊斯坦布尔,土耳其) Department of Electrical and Electronics Engineering, Koç University, Istanbul, Turkey(科克大学电气与电子工程系,伊斯坦布尔,土耳其)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出S²VAE框架,通过压缩和表示场景的3D状态,包括相机运动、深度和点结构,以提升视觉模型的几何一致性。实验显示,几何对齐的超球面隐空间在高压缩条件下优于传统高斯瓶颈。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01907 2026-04-27 cs.CV cs.AI 62%

Lifting Unlabeled Internet-level Data for 3D Scene Understanding

提升互联网级未标记数据用于3D场景理解

Yixin Chen, Yaowei Zhang, Huangyue Yu, Junchao He, Yan Wang, Jiangyong Huang, Hongyu Shen, Junfeng Ni, Shaofei Wang, Baoxiong Jia, Song-Chun Zhu, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

专题命中 具身推理 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文通过设计数据引擎利用互联网未标记视频生成训练数据,提升3D场景理解模型性能,验证了在不同感知粒度任务中的有效性。

Comments CVPR 2026. Project page: https://sv-pp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00911 2026-04-23 cs.CR cs.AI cs.ET cs.HC cs.LG 62%

Device-Native Autonomous Agents for Privacy-Preserving Negotiations

设备本机自主代理用于隐私保护的谈判

Joyjit Roy, Samaresh Kumar Singh

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于设备的自主代理系统,通过零知识证明和本地推理实现隐私保护的谈判,实验显示在保险和B2B采购场景中成功率高,隐私保护效果显著。

Comments 9 pages, 6 figures, 9 tables. This version updates metadata after publication in IEEE Xplore

Journal ref 2026 IEEE SoutheastCon, Huntsville, AL, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16320 2026-04-21 cs.SE cs.AI cs.LG 62%

How Robustly do LLMs Understand Execution Semantics?

大语言模型如何理解执行语义的鲁棒性?

Claudio Spiess, Prem Devanbu, Earl T. Barr

机构 * University College London(伦敦大学学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过代码输出预测任务评估大语言模型对代码理解的鲁棒性,发现开源模型在代码变换和输入扰动下表现稳定,而前沿模型GPT-5.2表现出显著的脆弱性,且异常处理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02263 2026-04-20 cs.CV cs.AI 62%

Social-JEPA: Emergent Geometric Isomorphism

Social-JEPA:涌现的几何同构

Haoran Zhang, Youjin Wang, Yi Duan, Rong Fu, Dianyu Zhao, Sicheng Fan, Shuaishuai Cao, Wentao Guo, Xiao Zhou

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 Social-JEPA通过让不同视角的独立代理学习环境模型,发现其潜在空间近似线性同构,从而实现跨代理的透明转换与高效迁移学习。

Comments This preprint is withdrawn due to significant errors in the emergent geometric isomorphism results that necessitate full rewriting, coupled with unresolved author disagreement on authorship. A corrected and revised manuscript will be released separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02289 2026-04-03 cs.CV cs.AI 62%

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型

Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu, Xiaoguang Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) Meshy AI

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02097 2026-04-03 cs.CV cs.LG 62%

LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model

LatentUM:通过潜在空间统一模型释放交错跨模态推理的潜力

Jiachun Jin, Zetong Zhou, Xiao Yang, Hao Zhang, Pengfei Liu, Jun Zhu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出LatentUM,通过共享语义潜在空间实现跨模态推理与生成,提升计算效率并减少编码器偏差,取得视觉空间规划基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29572 2026-04-01 cs.GR cs.AI cs.CV 62%

Turbo4DGen: Ultra-Fast Acceleration for 4D Generation

Turbo4DGen: 4D生成的超快加速

Yuanbin Man, Ying Huang, Zhile Ren, Miao Yin

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Turbo4DGen框架,通过时空缓存机制和动态语义感知注意力剪枝,显著减少4D生成中的冗余计算,实现9.7倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06679 2026-04-01 cs.AI cs.CV cs.GR 62%

MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines

MultiGen:扩散游戏引擎中可编辑多人世界的层级设计

Ryan Po, David Junhao Zhang, Amir Hertz, Gordon Wetzstein, Neal Wadhwa, Nataniel Ruiz

机构 * Stanford University(斯坦福大学) Google(谷歌)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出MultiGen,通过引入显式外部内存模块,实现可编辑多人世界中的环境控制与共享推理,提升交互性和一致性。

Comments Project page here: https://ryanpo.com/multigen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03821 2026-03-31 cs.CV cs.AI 62%

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

超越识别:评估视觉语言模型中的视觉视角理解

Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

机构 * University of Warsaw(华沙大学) Polish Academy of Sciences(波兰科学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) IDEAS NCBR Lute

专题命中 具身推理 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文通过144个视觉任务评估VLMs的视觉视角理解能力,发现模型在场景理解上表现优异,但在空间推理和视角理解上存在明显不足。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24581 2026-03-26 cs.CV cs.RO 62%

Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving

潜在世界动作建模:端到端自动驾驶的潜在世界建模

Linbo Wang, Yupeng Zheng, Qiang Chen, Shiwei Li, Yichen Zhang, Zebin Xing, Qichao Zhang, Xiang Li, Deheng Qian, Pengxuan Yang, Yihang Dong, Ce Hao, Xiaoqing Ye, Junyu han, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Latent-WAM框架,通过空间感知和动态感知的潜在世界表示实现高效端到端自动驾驶,实验显示在NAVSIM v2和HUGSIM上取得新的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24541 2026-03-26 cs.CV cs.AI 62%

SEGAR: Selective Enhancement for Generative Augmented Reality

SEGAR:生成增强现实的定向增强

Fanjun Bu, Chenyang Yuan, Hiroshi Yasuda

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) Toyota Research Institute(电装研究院)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 SEGAR结合扩散世界模型与定向修正阶段,实现生成增强现实中的区域特定编辑与安全区域对齐,为未来帧的生成、缓存和定向修正提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05786 2026-03-23 cs.CV cs.AI 62%

How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM

如何使LLM具备3D能力?LLM中空间推理的综述

Jirong Zha, Yuxuan Fan, Xiao Yang, Chen Gao, Xinlei Chen

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guang Zhou)(香港科学与技术大学(广州))

专题命中 具身推理 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文综述了将LLM与3D空间理解结合的方法,提出分类体系,涵盖图像、点云和混合模态方法,并讨论了当前限制与未来研究方向。

Comments 9 pages, 5 figures

Journal ref IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19219 2026-03-20 cs.CV cs.LG 62%

DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding

DriveTok: 3D驾驶场景分词用于统一多视角重建与理解

Dong Zhuo, Wenzhao Zheng, Sicheng Zuo, Siming Yan, Lu Hou, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 DriveTok通过3D变形交叉注意力实现高效多视角重建与理解,整合语义、几何与纹理信息,提升多视角分词效率与一致性。

Comments Project Page: https://paryi555.github.io/DriveTok/ Code: https://github.com/paryi555/DriveTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15558 2026-03-17 cs.CV cs.RO 62%

Panoramic Affordance Prediction

全景 affordance 预测

Zixin Zhang, Chenfei Liao, Hongfei Zhang, Harold Haodong Chen, Kanghao Chen, Zichen Wen, Litao Guo, Bin Ren, Xu Zheng, Yinchuan Li, Xuming Hu, Nicu Sebe, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) MBZUAI(慕尼黑工业大学人工智能研究所) UniTrento(特伦特大学) Knowin

专题命中 具身推理 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出全景 affordance 预测,利用 360 度影像捕捉全局空间关系,通过 PAP-12K 数据集和 PAP 框架解决超高清影像的高分辨率和畸变问题,展现全景感知在具身智能中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05110 2026-03-17 cs.CV cs.LG 62%

BLINK: Behavioral Latent Modeling of NK Cell Cytotoxicity

BLINK:自然杀伤细胞杀伤行为的隐式建模

Iman Nematollahi, Jose Francisco Villena-Ossa, Alina Moter, Kiana Farhadyar, Gabriel Kalweit, Abhinav Valada, Toni Cathomen, Evelyn Ullrich, Maria Kalweit

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 BLINK通过轨迹基于的递归状态空间模型,从部分观测的NK-肿瘤相互作用序列中学习隐式相互作用动力学,预测凋亡增量并提升单细胞水平的NK细胞杀伤行为的定量评估与结构建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏