arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-04 至 2026-05-04 共收录 49 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2605.00080 2026-05-04 cs.RO cs.CV 91%

World Model for Robot Learning: A Comprehensive Survey

机器人学习的世界模型:全面综述

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oier Mees, Marc Pollefeys, Zhuang Liu, Jiajun Wu, Pieter Abbeel, Jitendra Malik, Yilun Du, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) The University of Tokyo(东京大学) University of Oxford(牛津大学) Microsoft(微软公司) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 机器人学习 :robot learning(title,abstract);world model(title,abstract);embodied agent(abstract);navigation(abstract)

AI总结 综述从机器人学习角度系统回顾世界模型的快速发展,探讨其与机器人策略的耦合、作为强化学习模拟器的作用以及机器人视频世界模型的发展,总结关键范式与挑战。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 20 篇

2604.26848 2026-05-04 cs.RO 92%

STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation

STARRY:面向机器人操作的时空动作中心世界建模

Yuxuan Tian, Yurun Jin, Bin Yu, Yukun Shi, Hao Wu, Chi Harold Liu, Kai Chen, Cong Huang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学) East China Normal University(华东师范大学) DeepCybo

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 STARRY通过统一扩散过程联合去噪未来时空潜在表示和动作,提升机器人操作中时空协调的精度与成功率。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00244 2026-05-04 cs.RO cs.CV 88%

Lucid-XR: An Extended-Reality Data Engine for Robotic Manipulation

Lucid-XR:一种用于机器人操控的扩展现实数据引擎

Yajvan Ravan, Adam Rashid, Alan Yu, Kai McClennen, Gio Huh, Kevin Yang, Zhutian Yang, Qinxi Yu, Xiaolong Wang, Phillip Isola, Ge Yang

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) FortyFive Labs(FortyFive实验室) Caltech(加州理工学院) Harvard University(哈佛大学) UC San Diego(南加州大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 Lucid-XR通过XR头显直接运行的物理模拟环境生成多模态数据,实现零样本迁移至复杂环境,支持软材料、松散颗粒和刚体接触的精细操控任务。

Comments Project website: https://lucidxr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00159 2026-05-04 cs.RO 88%

E$^2$DT: Efficient and Effective Decision Transformer with Experience-Aware Sampling for Robotic Manipulation

E$^2$DT:高效且有效的决策Transformer与经验感知采样用于机器人操作

Kaiyan Zhao, Borong Zhang, Yiming Wang, Xingyu Liu, Xuetao Li, Yuyang Chen, Xiaoguang Niu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Lab of Internet of Things for Smart City and Department of Computer Information Science, University of Macau(澳门大学物联网智能城市重点实验室和计算机信息科学系)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文提出E$^2$DT,一种基于决策Transformer的k-确定性点过程采样框架,通过主动塑造经验选择提升机器人操作任务的效率和效果。

Comments ICRA2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21723 2026-05-04 cs.RO 88%

VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation

VLBiMan: 视觉-语言锚定的一次示例演示使通用化双臂机器人操作成为可能

Huayi Zhou, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 VLBiMan通过任务感知分解从单个示例中提取可重用技能,实现双臂机器人操作的通用化,减少演示需求并增强跨平台适应性。

Comments accepted by ICLR 2026. The project link is https://hnuzhy.github.io/projects/VLBiMan/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00307 2026-05-04 cs.RO cs.CV 84%

A Model-based Visual Contact Localization and Force Sensing System for Compliant Robotic Grippers

基于模型的视觉接触定位与力感知系统用于柔顺机械手爪

Kaiwen Zuo, Shuyuan Yang, Zonghe Chua

机构 * Department of Electrical, Computer, and Systems Engineering, Case Western Reserve University(电气、计算机与系统工程系,凯斯西储大学)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 本文提出基于模型的视觉力感知系统,结合迭代接触定位与通用化方法,用于柔顺机械手爪的实时力估计,实验显示其在不同物体和条件下具有较高的精度和鲁棒性。

Comments 8 pages, 6 figures, IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00438 2026-05-04 cs.AI cs.RO 84%

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

文本与图像思考:用于长周期机器人操作的交错视觉-语言推理轨迹

Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Xiaomi Group(小米集团)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出IVLR框架,通过显式轨迹表示交替文本子目标与视觉关键帧,提升长周期机器人操作的逻辑与几何一致性,实验显示在LIBERO和SimplerEnv-WidowX上取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00475 2026-05-04 cs.RO cs.CV 81%

MSACT: Multistage Spatial Alignment for Stable Low-Latency Fine Manipulation

MSACT:多阶段空间对齐用于稳定低延迟精细操控

Xianbo Cai, Hideyuki Ichiwara, Masaki Yoshikawa, Tetsuya Ogata

机构 * Department of Intermedia Art and Science, Waseda University(武藏大学多媒体艺术与科学系) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出MSACT,通过多阶段空间对齐模块提升低延迟精细操控的稳定性,结合预训练ResNet视觉先验,增强视觉到动作的映射稳定性,实验证明在模拟和真实任务中提升了定位稳定性和任务性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00471 2026-05-04 cs.RO 79%

Stereo Multistage Spatial Attention for Real-Time Mobile Manipulation Under Visual Scale Variation and Disturbances

立体多阶段空间注意力用于在视觉尺度变化和干扰下的实时移动操作

Xianbo Cai, Hideyuki Ichiwara, Hyogo Hiruma, Masaki Yoshikawa, Hiroshi Ito, Tetsuya Ogata

机构 * Department of Intermedia Art and Science, Waseda University(媒体艺术与科学系,早稻田大学) SB Intuitions Corp.(SB Intuitions公司) Research and Development Group, Hitachi, Ltd.(日立株式会社研发部) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出一种基于立体多阶段空间注意力的深度预测学习方法,用于实时移动操作,通过层次递归架构整合空间注意力点与机器人状态,提升在视觉尺度变化和干扰下的鲁棒性和任务成功率。

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00664 2026-05-04 cs.CV cs.AI 62%

InpaintSLat: Inpainting Structured 3D Latents via Initial Noise Optimization

InpaintSLat:通过初始噪声优化进行结构化3D潜在映射修复

Jaeyoung Chung, Suyoung Lee, Kyoung Mu Lee

机构 * Seoul National University(首尔国立大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出一种无需训练的可控3D修复方法,通过优化初始噪声提升3D修复的高保真度,引入基于修正流模型的反向传播近似,优化结构化3D潜在映射,实验显示在上下文一致性和提示对齐方面优于基线方法。

Comments project page: https://robot0321.github.io/InpaintSLat/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01267 2026-05-04 cs.RO cs.CV 62%

Certifiable Factor Graph Optimization

可验证因子图优化

Zhexin Xu, Nikolas R. Sanderson, Hanna Jiamei Zhang, David M. Rosen

机构 * Robust Autonomy Lab(鲁棒自主实验室) Institute for Experiential Robotics(体验机器人研究所) Northeastern University(东北大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出将因子图与可验证估计结合的统一框架,通过继承核心数学结构实现高效优化,实验表明其在姿态图优化等任务中性能优异且实现成本低。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00474 2026-05-04 cs.CV 57%

From Local to Global to Mechanistic: An iERF-Centered Unified Framework for Interpreting Vision Models

从局部到全局到机制:一种以iERF为中心的统一框架,用于解释视觉模型

Yearim Kim, Sangyu Han, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出一种以iERF为中心的统一框架,通过点特征向量和实例特定的有效感受野,统一了局部、全局和机制可解释性,提高了解释的准确性和鲁棒性。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2026

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00073 2026-05-04 cs.AI 57%

AgentReputation: A Decentralized Agentic AI Reputation Framework

AgentReputation: 一种去中心化的代理AI声誉框架

Mohd Sameen Chishti, Damilare Peter Oyinloye, Jingyue Li

机构 * Department of Computer Science(计算机科学系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文提出AgentReputation框架,旨在解决去中心化代理AI市场中声誉机制失效的问题,通过分层架构和上下文感知声誉卡片实现声誉管理,同时提供风险驱动的决策引擎。

Comments 5 pages, 1 figure, accepted to FSE 2026, Ideas, Visions and Reflections track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01946 2026-05-04 q-bio.QM cs.LG math.DS q-bio.NC 57%

Characterizing control between interacting subsystems with deep Jacobian estimation

通过深度雅可比估计表征相互作用子系统的控制特性

Adam J. Eisen, Mitchell Ostrow, Sarthak Chandra, Leo Kozachkov, Earl K. Miller, Ila R. Fiete

机构 * Brain and Cognitive Sciences MIT(麻省理工学院脑科学与认知科学系) IBM Thomas J. Watson Research Center(IBM沃森研究中心) International Centre for Theoretical Sciences(国际理论科学研究院) Brown University(布朗大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 本文提出一种基于深度学习的非线性控制理论框架,通过动态雅可比估计表征子系统交互,展示了在高维混沌系统中优于传统方法的性能,并通过多区域RNN模型验证了控制方向的动态变化及行为操控能力。

Comments 10 pages, 6 figures

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00717 2026-05-04 physics.ao-ph 50%

Leveraging Climate Services to Build Climate Resilient Power Systems

利用气候服务构建气候适应性电力系统

Laurent Dubus, Alberto Troccoli, Aron zuiker, Laurens Stoop

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究探讨了气候变化与电力系统规划的相互作用,提出需系统整合气候信息以提高电力系统韧性,通过PECD4.2数据库等工具提升气候信息应用的准确性与效率。

Comments CIGRE 2026 Paris Session C3-PS2 10894

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00481 2026-05-04 cond-mat.soft physics.flu-dyn 50%

Pre-charging polymer surfaces enhances droplet mobility and electrification

预充电聚合物表面增强液滴运动性和电荷化

Shuaijia Chen, Kenta Morita, Dumindu Dassanayaka, Hans-Jürgen Butt, Peter C. Sherrell, Amanda V. Ellis, Joseph D. Berry

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究通过预充电聚合物表面调控液滴行为和固液电荷转移机制,发现表面电荷影响接触角和液滴运动,但高电荷密度导致液滴不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15367 2026-05-04 cs.CR cs.MA 50%

SoK: Security of Autonomous LLM Agents in Agentic Commerce

SoK:自主大语言模型代理在代理商业中的安全性

Qian'ang Mao, Jiaxin Wang, Ya Liu, Li Zhu, Cong Ma, Jiaqi Yan

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文系统分析了自主LLM代理在商业中的安全问题,提出统一的安全框架,识别12种跨层攻击向量,并提出分层防御架构以解决现有协议的授权漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03720 2026-05-04 cond-mat.quant-gas 50%

Control of dynamical phase transitions and non-ergodic relaxation via spinor phases

通过旋量相位控制动态相变和非平衡弛豫

J. O. Austin-Harris, P. Sigdel, C. Binegar, S. E. Begg, T. Bilitewski, Y. Liu

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文通过旋量相位调控研究动态相变和非平衡弛豫,提出提取相演变的方法并定义序参量,展示从单次实验数据推断自旋相互作用的技术,以及通过操控旋量相位实现非平衡热化动力学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05944 2026-05-04 physics.optics physics.app-ph 50%

Programmable skyrmions for robust communication and intelligent sensing

可编程的Skyrmions用于稳健的通信和智能传感

Long Chen, Xin Yu Li, Yijie Shen, Ze Gu, Jian Lin Su, Qiang Xiao, Si Qi Huang, Shi Long Qin, Qian Ma, Jian Wei You, Tie Jun Cui

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出了一种可编程的等离子体Skyrmion平台,用于编码多种Skyrmion拓扑结构,实现了稳健的无线通信和智能传感应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16400 2026-05-04 cs.CR 50%

Physical-Layer Signal Injection Attacks on EV Charging Ports: Bypassing Authentication via Electrical-Level Exploits

物理层信号注入攻击针对电动汽车充电端口:通过电平级漏洞绕过认证

Hetian Shi, Yi He, Shangru Song, Jianwei Zhuge, Jian Mao

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了电动汽车充电协议的安全性,揭示了通过物理信号注入攻击绕过认证的漏洞,并提出PORTulator硬件验证攻击可行性,通过增强认证电路设计提升安全性。

Journal ref Safety and Security, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08521 2026-05-04 quant-ph 50%

Insightful Approach to Quantum Noise Suppression Below the Standard Quantum Limit Using a Single Mirror and Beam Splitter

利用单镜和光束分裂器在标准量子限以下抑制量子噪声的深入方法

Sun-Hyun Youn

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过在光束分裂器未用输入端放置镜面形成驻波,影响相干态的真空波动,从而在BS输出端减少真空噪声,为量子噪声控制提供新方法。

Comments 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 6 篇

2505.06698 2026-05-04 cs.CL 78%

SCAN: Structured Capability Assessment and Navigation for LLMs

SCAN:面向大语言模型的结构化能力评估与导航

Zongqi Wang, Tianle Gu, Chen Gong, Xin Tian, Siqi Bao, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) School of Cyber Engineering, Xidian University(西安电子科技大学电子工程学院) Baidu, Inc(百度公司)

专题命中 具身导航 :navigation(title,abstract)

AI总结 本文提出SCAN框架,通过细粒度评估实现对LLM能力的深入分析,揭示了同一类别下不同子能力的显著性能差异,强调了细粒度评估的重要性。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12339 2026-05-04 cs.LG cs.RO 66%

Value Explicit Pretraining for Learning Transferable Representations

为学习可迁移的表示进行价值显式预训练

Kiran Lekkala, Henghui Bao, Sumedh A. Sontakke, Erdem Biyik, Laurent Itti

机构 * Thomas Lord Department of Computer Science at the University of Southern California(南加州大学汤姆·劳德计算机科学系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.LG;robotics(comments)

AI总结 本文提出价值显式预训练(VEP),通过学习对环境动态和外观变化不变的表示,提升强化学习任务迁移能力。实验表明VEP在未见任务泛化能力、奖励和样本效率上均优于现有方法。

Comments Published in Robotics and Automation Letters (RA-L), January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00059 2026-05-04 cs.RO cs.AI 62%

Dynamic-TD3: A Novel Algorithm for UAV Path Planning with Dynamic Obstacle Trajectory Prediction

动态TD3:一种用于无人机路径规划的新型算法,具有动态障碍轨迹预测

Wentao Chen, Jingtang Chen, Mingjian Fu, Tiantian Li, Youfeng Su, Wenxi Liu, Yuanlong Yu

机构 * Wentao Chen(文涛 岑) Jingtang Chen(敬堂 陈) Mingjian Fu(明健 Fu) Tiantian Li(田田 李) Youfeng Su(友峰 苏) Wenxi Liu(文溪 刘) Yuanlong Yu(元龙 于)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出动态TD3算法,通过将导航建模为约束马尔可夫决策过程,结合自适应轨迹关系进化机制和物理感知门控卡尔曼滤波,提升无人机在动态障碍环境中的安全性和效率。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22189 2026-05-04 cs.RO 61%

Energy-Efficient Multi-Robot Coverage Path Planning of Non-Convex Regions of Interests

非凸目标区域的多机器人节能覆盖路径规划

Sourav Raxit, Jose Fuentes, Paulo Padrao, Abdullah Al Redwan Newaz, Md Tamjidul Hoque, Mark Kulp, Leonardo Bobadilla

机构 * Department of Earth and Environmental Sciences, University of New Orleans(地球与环境科学系,新奥尔良大学) School of Computing and Information Sciences, Florida International University(计算与信息科学学院,佛罗里达国际大学) Providence College, Department of Mathematics & Computer Science(普罗维登斯学院,数学与计算机科学系)

专题命中 具身导航 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出一种针对大非凸目标区域的多机器人节能覆盖路径规划框架,通过全局信息生成、并行扫掠路径、安全缓冲区计算和高效mTSP求解器,提升能效与可扩展性。

Comments Accepted in " Robotics and Automation Letters (RAL)"

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04757 2026-05-04 eess.SP cs.LG 57%

Distance-Aware Error for Spline Networks: A Bottom-Up Approach to Uncertainty

考虑距离的误差:一种自下而上的不确定性方法

Masoud Ataei, Mohammad Javad Khojasteh, Vikas Dhiman

机构 * Department of Electrical and Computer Engineering of University of Maine(缅因大学电气与计算机工程系) Electrical and Microelectronic Engineering Department of Rochester Institute of Technology(罗切斯特理工学院电气与微电子工程系)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 本文提出一种自下而上的距离感知误差界方法,用于刻画样条神经网络的逼近误差,通过分析神经元误差传播得到整体网络误差界,方法确定性高且适用于稀疏激光扫描和无结构环境中的安全导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00425 2026-05-04 quant-ph 50%

Chip-scale superconducting quantum gravimeter combining a SQUID, a transmon, and a nanomechanical resonator

芯片级超导量子重力仪结合SQUID、transmon和纳米机械谐振器

Salman Sajad Wani, Mughees Ahmed Khan, Abrar Ahmed Naqash, Saif Al-Kuwari

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出一种芯片级超导重力仪,利用可调磁通transmon量子比特与高Q值纳米机械梁耦合,通过SQUID磁通调制量子比特频率,实现高带宽重力测量。

Comments 16figs

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 2 篇

2603.28980 2026-05-04 cs.CV 57%

Stepper: Stepwise Immersive Scene Generation with Multiview Panoramas

Stepper:基于多视角全景图的分步沉浸式场景生成

Felix Wimbauer, Fabian Manhardt, Michael Oechsle, Nikolai Kalischek, Christian Rupprecht, Daniel Cremers, Federico Tombari

机构 * Google(谷歌) University of Oxford(牛津大学) MCML Technical University of Munich(慕尼黑技术大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 Stepper通过分步扩展多视角全景图,解决传统方法在视觉保真度与可探索性之间的权衡问题,实现高质量沉浸式3D场景生成。

Comments Accepted at CVPR 2026 Findings; Find our project page under https://fwmb.github.io/stepper/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04212 2026-05-04 cs.CL cs.AI 57%

Language Models Struggle to Use Representations Learned In-Context

语言模型在上下文学习的表示使用上面临困难

Michael A. Lepori, Tal Linzen, Ann Yuan, Katja Filippova

机构 * Brown University(布朗大学) Google Research(谷歌研究) New York University(纽约大学) Google DeepMind(谷歌DeepMind)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 研究探讨了语言模型是否能利用上下文学习的表示完成简单下游任务,发现开放权重模型在处理新语义表示时存在困难,即使它们在潜在表示中编码了这些语义。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 2 篇

2405.14093 2026-05-04 cs.RO cs.CL cs.CV 86%

A Survey on Vision-Language-Action Models for Embodied AI

具身人工智能中视觉-语言-动作模型的综述

Yueen Ma, Zixing Song, Yuzheng Zhuang, Jianye Hao, Irwin King

机构 * Chinese University of Hong Kong(香港中文大学) University of Bristol(布里斯托大学) Huawei Noah’s Ark Laboratory(华为诺亚实验室)

专题命中 机器人基础模型 :embodied AI(title,abstract);embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文综述了具身人工智能中视觉-语言-动作模型的发展,探讨了其在机器人任务中的应用,分类了三种主要研究方向,并讨论了面临的挑战与未来方向。

Comments Project page: https://github.com/yueen-ma/Awesome-VLA

Journal ref IEEE Transactions on Neural Networks and Learning Systems (Early Access), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏