arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-05 至 2026-06-05 共收录 97 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 34 篇

2606.06128 2026-06-05 cond-mat.mtrl-sci quant-ph 50%

Ferroelectric brightening of spin forbidden dark excitons in a WSe2/hybrid perovskite heterostructure

WSe2/杂化钙钛矿异质结构中自旋禁阻暗激子的铁电增亮

Xinyun Wang, Magdalena Grzeszczyk, Maxim Trushin, Ivan Verzhbitskiy, Dmitrii Litvinov, Yi Wei Ho, Yuan Chen, Zhenyue Wu, Mykola Telychko, Chuanqi Zhang, Andres Granados del Aguila, Kuan Eng Johnson Goh, Xinwei Li, Goki Eda, Shaffique Adam, Maciej Koperski, Kian Ping Loh

专题命中 机器人操作 :manipulation(abstract)

AI总结 利用铁电近邻效应在零磁场下打破WSe2的面内旋转对称性,使自旋禁阻暗激子变亮,并通过扭转角控制铁电耦合强度和谷对比偏振。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05929 2026-06-05 cs.CY 50%

Securing the Sandbox: A Rootless Containerized Framework for Process-Oriented Monitoring in Computer Graphics Education

保护沙箱:计算机图形学教育中面向过程监控的无根容器化框架

Germán Arroyo, Luis López, Juan Carlos Torres

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出VISMATIC框架,通过无根容器隔离和API级用户交互追踪,在计算机科学教育中实现过程监控的同时保障基础设施安全。

Comments 13 pages, 7 figures. Source code: https://github.com/german-arroyo-moreno/VISMATIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05612 2026-06-05 physics.optics 50%

Controlled generation of ultrafast vector vortex beams from a mode-locked fiber laser

从锁模光纤激光器产生超快矢量涡旋光束的控制

Kun Huang, Jing Zeng, Jiwei Gan, Qiang Hao, Heping Zeng

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文报道一种新型锁模光纤激光器,通过控制腔内几何相位实现高阶庞加莱球上任意位置超快矢量涡旋光束的直接生成,具有8.5皮秒脉冲宽度和灵活切换能力。

Journal ref Optics Letters 43, 3933 (2018)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05337 2026-06-05 physics.optics physics.app-ph 50%

Push-Pull acousto-optic modulator based on non-suspended thin-film lithium niobate on silicon substrate

基于非悬浮薄膜铌酸锂硅衬底的推挽式声光调制器

Haorui Ni, Sunil Bhave, Mengyue Xu

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出一种非悬浮内置推挽式声光调制器,利用薄膜铌酸锂硅衬底实现高效率与宽带宽,通过优化X切TFLN的取向增强声光转换,实现了低半波电压-长度积和宽调制带宽。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04899 2026-06-05 cs.CR 50%

DIST-FL: Enhancing Security for TEE-based Aggregation in Federated Learning

DIST-FL:增强联邦学习中基于TEE的聚合安全性

Guanlong Wu, Ju Yang, Zhen Huang, Jianyu Niu, Guoxing Chen, Jianzong Wang, Yinqian Zhang

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对服务器端对手利用TEE局限性(状态回滚和I/O操纵)攻击联邦学习的问题,提出DIST-FL分布式多TEE系统,通过操作线性化和可靠服务器输入实现鲁棒聚合,性能与单TEE相当且吞吐量提升6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13345 2026-06-05 quant-ph 50%

Homodyne Measurement of a Non-Hermitian Qubit Undergoing Fluorescence

非厄米特量子比特的同调测量

Roson Nongthombam, Amarendra K. Sarma

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了通过后选择三能级系统实现非厄米特二能级量子比特,并通过连续同调测量分析后选择引入的衰减与测量反馈之间的相互作用,揭示了测量反馈和非厄米特动力学如何共同塑造开放量子系统的瞬态行为。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 18 篇

2606.06147 2026-06-05 cs.AI 83%

WorldFly: A World-Model-Based Vision-Language-Action Model for UAV Navigation

WorldFly: 基于世界模型的视觉-语言-动作模型用于无人机导航

Shengtao Zheng, Kai Li, Weichen Zhang, Yu Meng, Chen Gao, Xinlei Chen, Yong Li, Xiao-Ping Zhang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) BNRist, Tsinghua University(清华大学北京研究院)

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.AI

AI总结 提出WorldFly框架,通过双分支耦合流匹配机制联合生成未来视频预测和导航动作,解决城市峡谷中严重遮挡和视角剧变下的无人机导航问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05437 2026-06-05 cs.RO cs.CV 81%

Uncertainty-Aware Adaptive Sensor Fusion for Autonomous Navigation

不确定性感知的自适应传感器融合用于自主导航

Simegnew Yihunie Alaba, Yuichi Motai

机构 * IEEE

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 提出一种结合无迹卡尔曼滤波(UKF)的混合深度学习方法,通过不确定性感知的自适应融合视觉和惯性特征,提高自主导航中视觉惯性里程计(VIO)的位姿估计精度。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02192 2026-06-05 cs.RO 79%

Do We Really Need Immediate Resets? Rethinking Collision Handling for Efficient Robot Navigation

我们真的需要立即重置吗?重新思考高效机器人导航的碰撞处理

Shanze Wang, Xinming Zhang, Siwei Cheng, Xianghui Wang, Changwen Chen, Hailong Huang, Wei Zhang

机构 * College of Information Science and Technology, Eastern Institute of Technology(信息科学与技术学院,东部技术学院) Department of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University(航空与航空工程系,香港理工大学) Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学) School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Department of Mechanical Engineering, The Hong Kong Polytechnic University(机械工程系,香港理工大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对机器人导航中每次碰撞立即重置环境的惯例,提出多碰撞重置预算(MCB)框架,通过将局部碰撞终止与全局环境重置解耦,允许智能体在同一回合内重试困难配置,从而提高早期学习效率。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05372 2026-06-05 cs.RO cs.CG 79%

Efficient Computation of Distance Functions for Navigation Vector Fields in Lie Groups

李群中导航向量场距离函数的高效计算

Vinicius M. Gonçalves, João Baião, Felipe Bartelt, Douglas G. Macharet, Gustavo M. Freitas, Héctor Azpúrua, Luciano C. A. Pimenta

机构 * University of São Paulo(圣保罗大学)

专题命中 具身导航 :navigation(title);robotic(abstract);分类 cs.RO

AI总结 针对李群中基于向量场的路径跟踪问题,提出一种利用G-多项式曲线结构将距离计算简化为多项式求根的高效方法,显著降低计算时间并保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17249 2026-06-05 cs.RO 79%

SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation

SEDualVLN:一种空间增强的双系统用于视觉语言导航

Jingzhi Huang, Junkai Huang, Wenxuan Song, Haoyang Yang, Hailong Huang, Haoang Li, Yi Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出SEDualVLN,一种空间增强的双系统框架,用于解决视觉语言导航中的长距离导航和动态推理问题,通过两个系统协同工作实现高效导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05923 2026-06-05 cond-mat.soft 78%

Run and tumble dynamics of a soft robotic cell

软体机器细胞的跑停动力学

Siddhant Mohapatra, Fanny Wéry, Filip Novkoski, Piotr Nowakowski, Ana-Suncana Smith, Nicolas Vandewalle

专题命中 具身导航 :robotic(title);robotics(abstract)

AI总结 通过将可编程活性粒子包裹在可变形膜内,利用膜柔软度作为单一控制参数,实现了从弹道运动到扩散的间歇性跑停动力学,并建立了可编程软活性输运的设计原理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23665 2026-06-05 cs.IR cs.LG cs.SI 74%

Geodesic Semantic Search: Cartographic Navigation of Citation Graphs with Learned Local Riemannian Maps

测地语义搜索:基于学习局部黎曼度量的引文图导航

Brandon Yee, Lucas Wang, Kundana Kommini

专题命中 具身导航 :navigation(title);分类 cs.LG

AI总结 本文提出Geodesic Semantic Search (GSS),通过在引文图上学习节点特定的黎曼度量,实现几何感知的语义检索。不同于传统基于嵌入的检索依赖固定欧几里得距离,GSS在每个节点学习低秩度量张量,诱导局部正定度量,从而在保持模型可计算性的同时保证有效度量。检索过程通过多源Dijkstra算法在学习的测地距离上进行,随后通过最大边际相关性重排序和路径一致性过滤。在包含169,000篇arXiv论文的引文预测基准上,GSS在Recall@20上比SPECTER+FAISS基线提升了23%。我们提供了Bridge Recovery Guarantee,描述了测地检索在定性上优于直接相似性的情况,以及训练损失与检索质量的边际分离结果,并刻画了低秩度量参数化的表达能力。我们的分层粗到细检索方法结合k-means池化,将计算成本降低4倍,同时保持97%的检索质量。

Comments Substantial Revision Required

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06255 2026-06-05 cs.RO cs.CV cs.DC 73%

RadiusFPS: Efficient Farthest Point Sampling on CPUs and GPUs via Spherical Voxel Pruning

RadiusFPS:通过球形体素剪枝在CPU和GPU上实现高效最远点采样

Ziyang Yu, Xiang Li, Qiong Chang, Jun Miyazaki

机构 * School of Computing(计算学院) Institute of Science(科学研究院) Tokyo(东京)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出RadiusFPS框架,利用球形体素剪枝加速最远点采样(FPS),在保持标准更新规则的同时,通过保守几何边界和坐标点跳过测试减少冗余计算,并在GPU上实现融合核,显著提升速度并降低内存占用。

Comments 28 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05677 2026-06-05 cs.CV cs.AI cs.CL 73%

LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video

LongSpace: 从感知到回忆的视频长程空间记忆探索

Shiqiang Lang, Jing Liu, Haoyang He, Peiwen Sun, Yuanteng Chen, Tao Liu, Lan Yang, Longteng Guo, Honggang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 针对长视频中空间记忆的挑战,提出LongSpace框架,通过分块建模、3D结构线索注入和层级感知记忆实现长程空间推理,并在LongSpace-Bench等基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06308 2026-06-05 cs.RO 70%

Attitude-Aided Linear Calibration of Triaxial Accelerometers

三轴加速度计的姿态辅助线性校准

Yongqiang Yu, Tian Huang, Yipeng Yang

机构 * Tsinghua University(清华大学)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种利用姿态信息的三轴加速度计线性校准方法(ALAC),通过构建组合误差矩阵实现线性最小二乘估计,仅需五个任意方向测量即可完成校准,并在静态和准静态实验中验证了其精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26236 2026-06-05 cs.RO 70%

PHUMA: Physically Reliable Humanoid Locomotion Dataset

PHUMA:物理可靠的仿人运动数据集

Kyungmin Lee, Sibeen Kim, Youngdo Lee, Minho Park, Hyunseung Kim, Dongyoon Hwang, Donghu Kim, Hojoon Lee, Jaegul Choo

机构 * KAIST(韩国科学技术院)

专题命中 具身导航 :robotics(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出PHUMA数据集,通过结合物理感知的筛选和物理约束的重定向,整合动作捕捉和网络视频,生成物理可靠的仿人运动数据,提升仿人运动的稳定性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07049 2026-06-05 cs.NE cs.LG 70%

GridPE: A Grid Cell-Inspired Unified Position Embedding for Arbitrary-Dimensional Spaces

GridPE: 一种基于网格细胞的统一位置嵌入方法用于任意维度空间

Boyang Li, Yulin Wu, Nuoxian Huang, Wenjia Zhang

机构 * New York University(纽约大学) Peking University(北京大学) Imperial College London(伦敦帝国学院) Tongji University(同济大学)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.LG

AI总结 本文提出GridPE,一种受哺乳动物空间认知中六边形周期编码启发的新型位置嵌入框架,旨在解决高维时空任务中位置嵌入的理论保障问题,通过结合计算神经科学原理和调和分析,为任意维度空间提供统一的位置嵌入解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06077 2026-06-05 cs.RO cs.LG 62%

3D Underwater Path Planning via Generative Flow Field Surrogates

基于生成流场代理的三维水下路径规划

Zachary Cooper-Baldock, Paulo E. Santos, Russell S. A. Brinkworth, Karl Sammut

机构 * Flinders University(弗林德斯大学)

专题命中 具身导航 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 针对自主水下航行器回收过程中复杂三维螺旋桨尾流的高成本CFD仿真问题,提出用条件生成对抗网络(cGAN)作为替代,结合能量加权A*路径规划,实现快速且有效的路径规划。

Comments 41 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06040 2026-06-05 cs.RO cs.SY eess.SY 61%

Gotta Grow Fast: Design and Benchmarking of a Tip Mount for High-Speed Vine Robots

快速生长:高速藤蔓机器人尖端支架的设计与基准测试

Antonio Alvarez Valdivia, Robert Reeve, Ankush Dhawan, Ciera McFarland, Chad Council, Margaret McGuinness, Nathaniel Hanson

机构 * Massachusetts Institute of Technology(麻省理工学院) Lincoln Laboratory(林肯实验室) Stanford University(斯坦福大学) University of Notre Dame(圣母大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 提出一种三角滚轮尖端支架,通过滚动代替滑动减少生长阻力,实现TPU涂层防撕裂尼龙藤蔓机器人的一致外翻,并建立可重复的基准测试框架。

Comments Accepted to IEEE Robotics & Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06358 2026-06-05 eess.SY cs.SY eess.SP 50%

Impact of RTK Augmentation and INS Integration on GNSS Positioning Accuracy and Continuity: A Benchmarking Study on Inland Waterways

RTK增强与INS集成对GNSS定位精度和连续性的影响:内河航道基准测试研究

Yan-Yun Zhang, Jef Billet, Jan Swevers, Peter Slaets

专题命中 具身导航 :navigation(abstract)

AI总结 本研究通过静态基准测试和闭环路径跟踪实验,评估了RTK增强和INS集成在不同配置下对内河航道GNSS定位性能的影响,发现RTK显著提升精度和一致性,INS在RTK中断时提供短期连续性但可能引入漂移。

Comments 8 pages. 6 figures. Accepted to The 10th IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06004 2026-06-05 cs.CL 50%

The Generator-Eraser Paradox: Community Guidelines for Responsible LLM-Assisted Dialect Resource Creation

生成器-擦除器悖论:负责任的大语言模型辅助方言资源创建的社区指南

Wajdi Zaghouani

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出生成器-擦除器悖论理论框架,推导出12条社区指南,并通过阿拉伯方言案例展示如何在大语言模型辅助方言资源创建中平衡效率与语言多样性保护。

Journal ref Proceedings of the Workshop on Dialects in NLP - A Resource Perspective (DialRes) @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04515 2026-06-05 math-ph math.MP physics.class-ph physics.ed-ph 50%

Discussion on the Physics Problem of a Boat Crossing a River

讨论船渡河的物理问题

Kyle Kou Yuchang, Simon Meng Zimin, Paul Zhang Yixing

专题命中 具身导航 :navigation(abstract)

AI总结 通过构建三种水流模型(恒定流、线性分布、偶次幂函数分布),利用矢量加法、微积分和微分方程推导了固定航向角下船舶空间轨迹的解析表达式,并采用拉格朗日乘子法求解了最短时间控制问题的最优航向角,为内河船舶智能导航系统的路径规划提供了理论支持。

Comments 19 pages for high school students attempt on the optimization problem

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.10725 2026-06-05 physics.bio-ph cond-mat.soft physics.comp-ph 50%

Schrodinger dynamics and Berry phase of undulatory locomotion

薛定谔动力学与蠕动运动的伯尔里相

Alexander E. Cohen, Alasdair D. Hastewell, Sreeparna Pradhan, Steven W. Flavell, Jorn Dunkel

专题命中 具身导航 :robotic(abstract)

AI总结 本文通过实验活体成像数据构建基于模式的线性模型,揭示蠕动运动在线虫、蜈蚣、机器人和蛇中的低维描述,并发现薛定谔方程在模式空间中支配形态动力学,利用格拉姆距离和伯尔里相实现运动行为的高效分类。

Comments title change; additional section and figure on time-dependent effective Hamiltonians and Berry phases; additional biological examples; new numerical analysis added to the SI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 7 篇

2606.06014 2026-06-05 cs.AI cs.RO 81%

PLAN-S: Bridging Planning with Latent Style Dynamics for Autonomous Driving World Models

PLAN-S:通过潜在风格动态桥接规划以实现自动驾驶世界模型

Xiaoyun Qiu, Jingtao He, Yijie Chen, Yusong Huang, Haotian Wang, Yixuan Wang, Xinhu Zheng

机构 * Intelligent Transportation Thrust, Systems Hub, and Center of Seamless Connectivity & Connected Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(智能交通 thrust、系统中心及无缝连接与智能连接研究院,香港科学与技术大学(广州))

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 提出PLAN-S框架,通过从潜在表示解码风格条件语义成本图,解决自动驾驶中潜在世界模型规划的可控性问题,在nuScenes和NAVSIM上降低了碰撞率并提升了驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05979 2026-06-05 cs.RO cs.AI 81%

World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis

世界-语言-动作模型:统一世界建模、语言推理与动作合成

Yi Yang, Zhihong Liu, Siqi Kou, Yiyang Chen, Yanzhe Hu, Jianbo Zhou, Boyuan Zhao, Zhijie Wei, Xiao Xia, Xueqi Li, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海研究院) HUST(华中科技大学) SCUT(华南理工大学) ECUST(东华大学) SHU(上海大学) NJUPT(南京工业大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 提出世界-语言-动作(WLA)模型,通过自回归Transformer联合预测文本子任务、子目标图像和机器人动作,融合世界建模与语言推理能力,实现多任务和长时域任务的最优性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05925 2026-06-05 cs.AI 79%

Towards World Models in Biomedical Research

迈向生物医学研究的世界模型

Guangyu Wang, Jingkun Yue, Siqi Zhang, Yu Liu, Xiaoyu Wang, Mingyuan Meng, Changwei Ji, Zongbo Han, Yulin Wang, Yang Yue, Frank Fu, Ting Chen, Song Wu, Ziwei Liu, Jiangning Song, Ming Li, Gao Huang, Xiaohong Liu, Athanasios Vasilakos, Xingcai Zhang, Ping Zhang, Yong Li

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China(网络与交换技术国家重点实验室,北京邮电大学,北京,中国) Department of Engineering Science, University of Oxford, Oxford, United Kingdom(英国牛津大学工程科学系,牛津,英国) Institute of Medical Artificial Intelligence, South China Hospital, Medical School, Shenzhen University, Shenzhen, Guangdong, China(医学人工智能研究所,南方医院,医学学院,深圳大学,深圳,广东,中国) Zhongguancun Academy & Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村学院及中关村人工智能研究院,北京,中国) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University, 100084, Beijing, China(北京信息科学与技术国家研究中心(BNRist),清华大学,100084,北京,中国) Department of Chemical and Nano Engineering, University of California, San Diego, La Jolla, CA, USA(美国加州大学圣地亚哥分校化学与纳米工程系,La Jolla,CA,美国) Nanyang Technological University, Singapore(新加坡南洋理工大学) Monash Biomedicine Discovery Institute and Department of Biochemistry and Molecular Biology, Monash University, Melbourne, Victoria, Australia(莫纳什大学生物医学发现研究所和生物化学与分子生物学系,墨尔本,维多利亚,澳大利亚) David R. Cheriton School of Computer Science, University of Waterloo, Waterloo, Ontario, Canada(加拿大滑铁卢大学戴维·R·切里顿计算机科学学校,滑铁卢,安大略,加拿大) Department of ICT and Center for AI Research, University of Agder (UiA), Jon Lilletuns vei 9, Grimstad, Norway(挪威阿格德大学(UiA)信息与通信技术系及人工智能研究中心,Jon Lilletuns vei 9,Grimstad,挪威) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出生物医学世界模型作为AI驱动发现的新范式,通过学习分子、细胞、组织和临床状态的潜在表征及干预条件动态,实现未来轨迹模拟,并探讨其在虚拟细胞、类器官、虚拟患者和手术模拟等应用中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01935 2026-06-05 cs.CV 79%

Unified Driving Tokens: Representation- and Geometry-Guided Discrete Tokenizer for Driving World Models and Planning

统一驾驶令牌:面向驾驶世界模型和规划的表示与几何引导的离散分词器

Ziyang Yao, Zeyu Zhu, YunCheng Jiang, Zibin Guo, Huijing Zhao

机构 * Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出一种表示引导与几何增强的离散分词器,通过联合监督学习紧凑令牌,同时优化重建保真度、表示一致性和规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03413 2026-06-05 cs.LG cs.AI 62%

Learning to Theorize the World from Observation

从观察中学习理论化世界

Doojin Baek, Gyubin Lee, Junyeob Baek, Hosung Lee, Sungjin Ahn

机构 * University of Washington(华盛顿大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 受认知科学启发,提出Learning-to-Theorize范式,通过神经理论家(NEO)模型从原始非文本观测中推断显式解释性理论,实现基于解释的泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19312 2026-06-05 cs.LG cs.AI 62%

LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels

LeWorldModel:从像素稳定端到端联合嵌入预测架构

Lucas Maes, Quentin Le Lidec, Damien Scieur, Yann LeCun, Randall Balestriero

机构 * Mila & Université de Montréal(Mila与蒙特利尔大学) New York University(纽约大学) Samsung SAIL(三星SAIL) Brown University(布朗大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LeWorldModel,一种通过仅使用两个损失项从原始像素稳定端到端训练的联合嵌入预测架构,显著减少了可调损失超参数,并在多种2D和3D控制任务中表现出色,同时在物理结构编码和物理不合理的事件检测方面展示了其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏