arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3100 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3100 篇

2605.12053 2026-06-11 cs.RO 版本更新 57%

Closing the Motion Execution Gap: From Semantic Motion Task Constraints to Kinematic Control

弥合运动执行差距:从语义运动任务约束到运动学控制

Simon Stelter, Vanessa Hassouna, Malte Huerkamp, Michael Beetz

机构 * University of Bremen(不莱梅大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 本文提出通过运动状态图实现语义约束与可执行机器人运动的连接,利用统一的可微运动学世界模型实现世界中心的运动规范与跨平台泛化,采用基于lMPC的任务函数方法确保任务切换的平滑过渡。

Comments 9 pages, 8 figures, to be published in IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16689 2026-06-08 cs.LG 版本更新 57%

Predictive Statistics Shape Emergent World Representations of Grid Walkers

预测统计塑造网格行走者的涌现世界表征

Sasha Brenner, Thomas R. Knösche, Nico Scherf

机构 * Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) Leipzig University(莱比锡大学) ScaDS.AI

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 通过约束随机游走实验,发现解码器仅Transformer的第一注意力块提取预测充分统计量,后续层将其转化为预测几何,形成可读的世界模型,而循环网络未分离此阶段。

Comments 24 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04264 2026-06-04 cs.CV 57%

UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation

UniCanvas: 一种基于扩散的图文联合生成统一模型

Zeyuan Yang, Hao-Wei Chen, Xueyang Yu, Yuncong Yang, Haoyu Zhen, Ziqiao Ma, Maohao Shen, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) University of Michigan(密歇根大学) MIT(麻省理工学院)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 提出UniCanvas,通过扩散模型在像素画布上以文本嵌入图像的方式实现图文联合生成,解决现有模型在视觉与文本生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03188 2026-06-03 cs.RO 57%

GeoSem-WAM: Geometry- and Semantic-Aware World Action Models

GeoSem-WAM:几何与语义感知的世界动作模型

Fulong Ma, Daojie Peng, Wenjun Yue, Jiahang Cao, Bintao Wang, Qiang Zhang, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) SDU(山东大学) X-Humaniod

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 提出GeoSem-WAM框架,通过几何和语义监督增强潜在表示,在统一潜在空间中联合捕捉场景动态、空间几何和语义上下文,避免测试时显式未来展开或视频生成,提升动作预测准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29930 2026-06-03 cs.AI cs.CY cs.HC 57%

Toward AI That Understands Self and Others: A World-Model Theory of Cognitive Diversity and Alignment

迈向理解自我与他人的AI系统:人类认知多样性与世界模型对齐的多阶段推理框架

Toru Takahashi

机构 * Human Informatics and Systems Lab, Doshisha University(立命馆大学人机系统实验室) Linked Open Data Initiative, NPO Keio Research Institute at SFC(庆应义塾大学SFC研究所开放数据计划) Stroly Inc(Stroly公司)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 提出多阶段推理框架(MIM),通过阶段形成空间、前景化场、主体特定轮廓状态和状态表示对齐图,形式化异质世界模型的产生,并将世界模型对齐重新定义为使异质表示相互可处理的问题,而非强制一致。

Comments 87 pages. Revised version with a refined abstract emphasizing disagreement as a late-stage phenomenon, target admissibility, processability, and the methodological abstraction used to compare humans, AI systems, and institutional decision procedures under shared information-theoretic constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18954 2026-06-03 cs.CV 57%

VOIC: Visible-Occluded Integrated Guidance for 3D Semantic Scene Completion

VOIC:可见-遮挡联合引导的3D语义场景补全

Zaidao Han, Risa Higashita, Jiang Liu

机构 * Research Institute of Trustworthy Autonomous Systems, Southern University of Science and Technology(可信自主系统研究院,南方科技大学) Department of Computer Science and Engineering, Southern University of Science and Technology(计算机科学与工程系,南方科技大学) School of Computer Science, University of Nottingham Ningbo China(宁波大学计算机学院) Department of Electronic and Information Engineering, Changchun University(电子与信息工程学院,长春大学)

专题命中 具身推理 :robotic(abstract);分类 cs.CV

AI总结 提出VOIC网络,通过解耦可见区域感知与遮挡区域推理,利用离线可见区域标签提取策略和双解码器框架,在SemanticKITTI和SSCBench-KITTI360上实现最先进的3D语义场景补全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02459 2026-06-02 cs.CV 57%

Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models

像鸽子一样主动探索:通过智能视觉语言模型强化空间推理

Wei Deng, Xianlin Zhang, Mengshi Qi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 具身推理 :navigation(abstract);分类 cs.CV

AI总结 提出一种受鸽子认知地图启发的智能视觉语言模型管道,通过动态认知地图和空间断言代码提供密集奖励信号,在MindCube基准上实现80.5%的总体准确率,在Rotation子集上相对提升53.2%。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01520 2026-06-02 cs.AI 57%

TERRA: Task-Embedded Reasoning and Representation Architecture for Cross-Domain Applications

TERRA: 面向跨领域应用的任务嵌入推理与表示架构

Shayan Shokri

机构 * Humanpath Labs Inc.(Humanpath实验室有限公司)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 提出TERRA架构,通过形式化跨领域转移问题,利用松弛双模拟差异和Gromov-Wasserstein距离度量结构状态域间的同态性,推导出预测误差与决策遗憾的转移界,将广泛直觉转化为可检验理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00499 2026-06-02 cs.CV 57%

OptiWorld: Optimal Control for Video World Generation under Physical Constraints

OptiWorld: 物理约束下的视频世界生成最优控制

Yu Yuan, Jianhao Yuan, Xijun Wang, Daiqing Li, Liu He, Lu Ling, Stanley H. Chan

机构 * Purdue University(普渡大学) University of Oxford(牛津大学) SixteenMiles Labs(SixteenMiles 实验室)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 提出OptiWorld框架,在推理时结合经典最优控制与视频生成,通过提取紧凑世界状态、规划最优轨迹并生成条件视频,实现符合物理约束的动态优化。

Comments Porject Page: https://yuyuanspace.com/OptiWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15141 2026-06-02 cs.CV 57%

Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation

Causal Forcing++:用于实时交互式视频生成的可扩展少步自回归扩散蒸馏

Min Zhao, Hongzhou Zhu, Kaiwen Zheng, Zihan Zhou, Bokai Yan, Xinyuan Li, Xiao Yang, Chongxuan Li, Jun Zhu

机构 * Tsinghua University(清华大学) ShengShu(盛数) Renmin University of China(中国人民大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 提出Causal Forcing++框架,通过因果一致性蒸馏(causal CD)实现帧级1-2步自回归扩散蒸馏,在降低延迟和训练成本的同时提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14398 2026-06-02 cs.AI 57%

Coding Agent Is Good As World Simulator

编码智能体作为世界模拟器

Hongyu Wang, Jingquan Wang, Bocheng Zou, Radu Serban, Dan Negrut

机构 * Department of Mechanical & Aerospace Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校机械与航空航天工程系) School of Computer, Data, and Information Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机、数据与信息科学学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 提出一个通过可执行模拟代码构建基于物理的世界模型的智能体框架,协调规划、代码生成、视觉审查和物理分析智能体,迭代修正代码以满足物理约束,在物理准确性、指令忠实度和视觉质量上超越视频模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31476 2026-06-01 cs.RO 57%

IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving

IDOL: 逆动力学引导的未来预测用于端到端自动驾驶

Chenghao Zhang, Timin Li, Dongmei Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 提出IDOL框架,通过逆动力学模型将BEV世界模型预测的未来潜在场景状态转化为规划相关的轨迹增量,实现未来预测与轨迹优化的紧密耦合,在NAVSIM基准上达到最优性能。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31387 2026-06-01 cs.CL cs.RO 57%

Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely

多轮多智能体对话用于协作重建仅略微提升VLM在空间推理上的性能

Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(语言学计算系,语言学系 柏林洪堡大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 具身推理 :robotic(abstract);分类 cs.RO

AI总结 研究通过多轮多智能体对话框架评估视觉语言模型在协作空间推理任务中的表现,发现视觉空间理解仍是主要瓶颈,文本表示和分解图像表示可部分提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31336 2026-06-01 cs.CV 57%

DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory

DecMem:基于解耦记忆的分钟级一致世界生成

Zhenhao Yang, Xiaoshi Wu, Zhengyao Lv, Xiaoyu Shi, Xintao Wang, Pengfei Wan, Kun Gai, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 提出解耦记忆架构DecMem,通过稀疏全局记忆和锚定局部记忆解决长程视频生成中的时空一致性问题,实现分钟级可控长视频生成。

Comments Project page is available at https://jeffreyyzh.github.io/DecMem-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13517 2026-05-29 q-bio.NC cs.LG 57%

A Deep Learning Model of Mental Rotation Informed by Interactive VR Experiments

基于交互式VR实验的心理旋转深度学习模型

Raymond Khazoum, Daniela Fernandes, Aleksandr Krylov, Qin Li, Stephane Deny

机构 * Department of Computer Science, Aalto University, Espoo, Finland(奥卢大学计算机科学系,芬兰埃斯波) Department of Neuroscience and Biomedical Engineering, Aalto University, Espoo, Finland(奥卢大学神经科学与生物医学工程系,芬兰埃斯波)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 提出一个由等变编码器、神经符号对象编码器和神经决策代理组成的深度学习模型,通过VR实验验证,准确模拟人类心理旋转的性能、响应时间和行为。

Comments Version accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28144 2026-05-28 cs.AI 57%

Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning

解构空间复杂性:用于LLM空间推理的层次分解

Yi Wang, Haojie Lu, Zhaofan Zhang, Li Chen, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 具身推理 :navigation(abstract);分类 cs.AI

AI总结 提出一种层次任务分解方法,结合MCTS引导的组相对策略优化(M-GRPO),通过改进中间状态选择和规划能力,显著提升LLM在导航、规划和策略游戏等空间任务中的表现。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25343 2026-05-26 cs.CV 57%

Toward Native Multimodal Modeling: A Roadmap

迈向原生多模态建模:路线图

Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao Yu, Zheng Yuan, Biao Liu, Haopeng Wang, Renzhao Liang, Yixuan Yang, Yunhang Shen, Bo Ke, Keyu Chen, Linhao Luo, Difan Zou, Xiao Huang, Di Yin, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Warwick(沃林汉大学) Monash University(墨尔本大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出从非原生多模态范式向原生多模态建模(NMM)过渡的正式路线图,通过输入-输出二元性分类现有模型,并系统探讨架构协调、数据整理、训练推理及评估的全栈工业级方案。

Comments 52 pages, 5 figures, 3 tables, ~300 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18745 2026-05-26 stat.ML cs.LG cs.NA math.NA math.PR q-fin.MF stat.CO 57%

SURGE: Approximation and Training Free Particle Filter for Diffusion Surrogate

SURGE: 扩散替代模型的近似与免训练粒子滤波

Lifu Wei, Yinuo Ren, Naichen Shi, Yiping Lu

机构 * Department of Mechanical Engineering, Northwestern University, Evanston, IL, United States Institute for Computational \& Mathematical Engineering, Stanford University, Stanford, CA, United States Department of Industrial Engineering \& Management Sciences, Northwestern University, Evanston, IL, United States

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 提出一种基于扩散模型的无偏粒子滤波方法,通过序列蒙特卡洛对扩散轨迹进行重加权和重采样,融合观测数据与模型模拟,实现状态估计的连续校正。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21072 2026-05-21 cs.CV 57%

Q-ARVD: Quantizing Autoregressive Video Diffusion Models

Q-ARVD: 对自回归视频扩散模型进行量化

Siao Tang, Xinyin Ma, Gongfan Fang, Xingyi Yang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文针对自回归视频扩散模型(ARVD)的量化问题,提出了一种新的框架Q-ARVD,解决了帧间量化敏感度不平衡和权重中异质性异常模式的问题,从而提高了模型效率。

Comments Code: https://github.com/tsa18/Q-ARVD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19378 2026-05-20 cs.CV 57%

Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock

视觉扩散变换器中稀疏专家混合路由的稀疏性:从路由崩溃到选择性死锁的诊断、边界校准和进化路线图

Haiying Sha

机构 * Haiying Sha(海ying Sha)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文系统诊断了Token-Choice稀疏混合专家(MoE)在视频扩散变换器中的训练失败模式,通过分析超过6500万个标记的路由决策时间序列,提出了功能冗余假说,并总结了从视觉统一到世界模型的三步进化路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18181 2026-05-19 cs.AI cs.CL 57%

Scalable Environments Drive Generalizable Agents

可扩展环境驱动可泛化的智能体

Jiayi Zhang, Fanqi Kong, Guibin Zhang, Maojia Song, Zhaoyang Yu, Jianhao Ruan, Jinyu Xiang, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * HKUST(GZ)(香港科技大学(广州)) DeepWisdom PKU(北京大学) NUS(新加坡国立大学) SUTD(新加坡科技设计大学) UdeM & Mila(蒙特利尔大学及Mila)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文探讨了可泛化智能体需要通过可扩展环境来适应多样任务和未见环境的问题,提出环境扩展的核心挑战,并提出了统一的分类方法和可扩展环境的构建范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17682 2026-05-19 cs.CV 57%

GEM: Gaussian Evolution Model for Occupancy Forecasting and Motion Planning

GEM:用于占用预测和运动规划的高斯演化模型

Cheng Chen, Hao Huang, Saurabh Bagchi

机构 * Purdue University(普渡大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 该研究提出GEM模型,通过高斯演化模型实现高效的占用预测和运动规划,解决了传统方法在时间灵活性、场景演化和连续时间动态匹配上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17478 2026-05-19 cs.CV 57%

Mamba-VGGT: Persistent Long-Sequence Video Geometry Grounded Transformer via External Sliding Window Mamba Memory

Mamba-VGGT: 通过外部滑动窗口Mamba内存实现持久长序列视频几何 grounded 变换器

Tianchen Deng, Zhenxiang Xiong, Nailin Wang, Fangjinhua Wang, Jiuming Liu, Jianfei Yang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院) Cambridge University(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出Mamba-VGGT框架,通过引入滑动窗口Mamba内存模块,解决传统VGGT在长序列视频中几何遗忘和累积漂移问题,提升3D场景重建的精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17058 2026-05-19 cs.LG 57%

Learning Multi-Timescale Abstractions for Hierarchical Combinatorial Planning

学习多时间尺度抽象以进行分层组合规划

Vivienne Huiling Wang, Tinghuai Wang, Joni Pajarinen

机构 * Department of Electrical Engineering(电气工程系) Automation, Aalto University, Finland(自动化,艾尔沃斯大学,芬兰)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文提出了一种基于模型的分层框架,用于解决序列随机组合决策问题,通过多时间尺度目标结构化潜在动态,实现高效的前瞻规划,并联合学习子目标条件预算策略以支持上下文感知的资源分配。

Comments 34 pages, 8 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16115 2026-05-18 cs.RO 57%

Beyond Collision Avoidance: Multi-Robot Yielding and Spatial Affordance in Emergency Evacuations

超越避障:紧急疏散中的多机器人让路与空间可得性

Ning Zhou, Edmund R. Hunt, Nikolai W. F. Bode

机构 * School of Engineering Mathematics and Technology(工程数学与技术学院)

专题命中 具身推理 :navigation(abstract);分类 cs.RO

AI总结 研究通过虚拟疏散实验探讨多机器人让路策略对人类空间期望的影响,发现主动让路优于冻结和效率优先策略,并揭示环境可得性对认知预期的塑造作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14851 2026-05-15 cs.MA cs.AI 57%

IFPV: An Integrated Multi-Agent Framework for Generative Operational Planning and High-Fidelity Plan Verification

IFPV:一种用于生成性操作规划和高保真计划验证的集成多智能体框架

Zhigao Huang, Zhengqing Hu, Dong Chen, Shaohan Zhang, Zhao Jin, Bo Zhang, Han Wu, Mingliang Xu

机构 * School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Engineering Research Center of Intelligent Swarm Systems, Ministry of Education(教育部智能群体系统工程研究中心) National Supercomputing Center in Zhengzhou(郑州国家超算中心) Henan Research Center for Large Model Technology(河南省大模型技术与新质软件工程研究中心)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 IFPV通过多视角分层智能体和对抗认知仿真引擎,提升复杂战场环境下的规划准确性和验证严格性,实验显示其在任务成功率和运营成本上有显著提升。

Comments Submitted to Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12835 2026-05-14 cs.AI 57%

PROMETHEUS: Automating Deep Causal Research Integrating Text, Data and Models

PROMETHEUS:整合文本、数据和模型的深度因果研究自动化

Sridhar Mahadevan

机构 * Adobe Research and University of Massachusetts, Amherst(Adobe研究院和马萨诸塞大学阿默斯特分校)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 PROMETHEUS通过整合文本、数据和模型构建因果地图,利用局部因果预测状态模型和区域限制图分析研究领域内的因果关系与证据矛盾。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08944 2026-05-14 cs.LG cs.MA 57%

Multi-Agent Decision-Focused Learning via Value-Aware Sequential Communication

多智能体决策导向学习 via 值感知序列通信

Benjamin Amoh, Geoffrey Parker, Wesley Marrero

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯大学泰勒工程学院)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文提出SeqComm-DFL方法,通过值感知序列通信与决策导向学习结合,提升多智能体任务性能。方法引入序列Stackelberg条件生成消息,利用信息论界限证明收敛性,并在协作医疗和StarCraft多智能体挑战中取得显著奖励和胜率提升。

Comments 9 pages, 2 figues, 1 table, neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11550 2026-05-13 cs.CV 57%

The DAWN of World-Action Interactive Models

世界-动作交互模型的黎明

Hongbo Lu, Liang Yao, Chenghao He, Haoyu Wang, Xiang Gu, Xianfei Li, Wenlong Liao, Tao He, Pai Peng

机构 * COWARobot Co. Ltd(COWARobot有限公司) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出WAIMs,通过DAWN模型在语义潜在空间中实现世界预测与动作生成的交互,提升自动驾驶中的规划性能与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10404 2026-05-12 cs.CV 57%

Position: Life-Logging Video Streams Make the Privacy-Utility Trade-off Inevitable

位置:生命记录视频流使隐私与效用的权衡不可避免

Tianyuan Zou, Liang Yue, Yang Liu, Ya-Qin Zhang, Sijie Cheng

机构 * Institute for AI Industry Research, Tsinghua University, Beijing, China(清华大学人工智能产业研究院) RayNeo.AI, Shenzhen, China(深圳RayNeo.AI) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 生命记录视频流虽提升AI系统效用,但暴露敏感信息引发隐私风险,现有保护措施无法兼顾效用与隐私,需进一步研究权衡设计与标准化评估。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏