arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-05 至 2026-08-05 共收录 80 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2604.25459 2026-08-05 cs.RO 版本更新 86%

GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning

GS-Playground:一种高吞吐量的视觉真实模拟器用于基于视觉的机器人学习

Yufei Jia, Heng Zhang, Ziheng Zhang, Junzhe Wu, Mingrui Yu, Zifan Wang, Dixuan Jiang, Zheng Li, Chenyu Cao, Zhuoyuan Yu, Xun Yang, Haizhou Ge, Yuchi Zhang, Jiayuan Zhang, Zhenbiao Huang, Tianle Liu, Shenyu Chen, Jiacheng Wang, Bin Xie, Xuran Yao, Xiwa Deng, Guangyu Wang, Jinzhi Zhang, Lei Hao, Zhixing Chen, Yuxiang Chen, Anqi Wang, Hongyun Tian, Yiyi Yan, Zhanxiang Cao, Yizhou Jiang, Hanyang Shao, Yue Li, Lu Shi, Bokui Chen, Wei Sui, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Guyue Zhou

机构 * THU(清华大学) Motphys Dexmal DISCOVER Robotics HKUST(GZ)(香港科技大学(广州)) BIT(北京理工大学) NUS(新加坡国立大学) HITSZ(哈尔滨工业大学) XJTU(西安交通大学) NJU(南京大学) SJTU(上海交通大学) D-Robotics

专题命中 机器人学习 :robot learning(title);embodied AI(abstract);manipulation(abstract);navigation(abstract)

AI总结 GS-Playground通过高吞吐量的多模态模拟框架,结合高效物理引擎和3DGS渲染管道,提升视觉强化学习的效率,降低大规模视觉RL的门槛,实现感知与物理的无缝衔接。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 27 篇

2605.22882 2026-08-05 cs.CV cs.RO 版本更新 89%

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

GEM-4D:用于机器人操作的几何增强视频世界模型

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) Media Lab and EECS(媒体实验室和电子工程与计算机科学系) MIT(麻省理工学院) Princeton University(普林斯顿大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 机器人操作 :world model(title,abstract);manipulation(title,abstract);分类 cs.RO、cs.CV;robotic(comments)

AI总结 提出GEM-4D,通过注入从预训练几何基础模型蒸馏的密集4D对应监督,增强视频世界模型的几何一致性,并引入逆动力学模块将视频滚动转换为可执行机器人轨迹,提升操作成功率。

Comments Robotic World Model, Video Generative Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13040 2026-08-05 cs.RO 版本更新 88%

RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

RoboProcessBench:视觉语言机器人操作中的过程感知理解基准测试

Dayu Xia, Yue Shi, Yao Mu, Huiting Ji, Chaofan Ma, Yingjie Zhou, Hua Chen, Yang Liu, Jiezhang Cao, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) China University of Mining Technology(中国矿业大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 提出RoboProcessBench基准,通过静态监控和动态推理两个维度、12个诊断问题家族,评估视觉语言模型在机器人操作中的过程感知理解能力,并基于58k问答对数据集验证了当前模型的局限性及后训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03701 2026-08-05 cs.RO cs.AI 新提交 87%

LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation

LiLa-WAM:用于机器人操控的轻量级隐式推理世界-动作模型

Fan Yang, Yuting Su, Xiaobo Wang, Yuncheng You, Fugui Fan, Yuting Wu, Minghui Wu, Chenxu Zhao, JiaHong Ning, Peiguang Jing

专题命中 机器人操作 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.AI

AI总结 本研究提出轻量级世界-动作模型LiLa-WAM,通过联合未来状态预测与动作生成的紧凑隐式空间设计实现端到端单GPU训练,结合视觉转换令牌完成任务指定,在RoboTwin等任务上取得90.48%的成功率,提升了机器人操控的效率与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15065 2026-08-05 cs.RO cs.CV cs.LG 版本更新 87%

DriftWorld: Fast World Modeling through Drifting

DriftWorld:通过漂移实现快速世界建模

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 机器人操作 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究针对预测性世界模型生成展开慢的问题,提出基于漂移生成模型的DriftWorld,训练时学习动作条件漂移以快速生成未来帧,在机器人操作基准测试中实现快速准确决策,还能作离线模拟器,性能优于基于扩散的基线。

Comments Website at https://susie-lu.github.io/driftworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02990 2026-08-05 cs.RO 新提交 85%

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

EmbodiedVAE:用于高效可控具身操作的解耦视频变分自编码器

Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) CASIA, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所(CASIA)) Microsoft Research Asia(微软亚洲研究院)

专题命中 机器人操作 :manipulation(title,abstract);world model(abstract);robotic(abstract);分类 cs.RO

AI总结 针对现有潜在扩散模型适配具身操作场景的缺陷,提出EmbodiedVAE视频变分自编码器,通过双编码器架构与最优传输一致性模块实现更优重建质量、压缩率及精确动作控制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03103 2026-08-05 cs.RO cs.AI 新提交 84%

A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varying Forces

针对需要时变力的操作任务的模仿学习的分层方法

Rishabh Shukla, Adithya Santhosh, Shaili Gandhi, Samrudh Moode, Satyandra K. Gupta

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对接触密集拆卸任务中扩散策略的延迟问题,提出DPA-FTG分层方法,解耦高低频控制,在双手电池拆卸任务上性能优于RDP等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03938 2026-08-05 cs.RO cs.SY eess.SY 新提交 79%

Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson

8 GB预算内的双臂操作:入门级Jetson上的零拷贝感知与量化ACT

Ekansh Singh, Eva Samuel, Alessandra Reneau, Ryan Schmeelk, Yashvi Gandhi

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 该研究在8 GB入门级Jetson上实现了双臂操作,采用零拷贝感知、量化ACT,发现ACT在相同演示下优于Diffusion Policy,INT8量化可大幅降低延迟且保留任务成功率。

Comments 9 pages, 8 tables. Work conducted at the Georgia Tech Research Institute (GTRI), Aerospace, Transportation and Advanced Systems Laboratory (ATAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03753 2026-08-05 cs.RO 新提交 79%

GORDON: Graph-based Object-centric Rewards for Decomposition of Long-Horizon Manipulation

GORDON:用于长程操作任务分解的基于图的以对象为中心的奖励框架

Andrea Protopapa, Davide Buoso, Francesca Pistilli, Georgia Chalvatzaki, Giuseppe Averta

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本研究提出GORDON框架,通过无动作视频演示学习以对象为中心的密集奖励,自动分解长程操作任务,在7个基准任务上平均成功率达74.4%,显著优于现有基线。

Comments 9 pages, 6 figures, preprint. Project page: https://andreaprotopapa.github.io/graph-reward-learning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02780 2026-08-05 cs.RO cs.HC 新提交 79%

Semantic Haptic Feedback Enhances Dexterous Robotic Teleoperation

语义力反馈提升灵巧机器人遥操作性能

Bingjian Huang, Sahar Aseeri, Jonas Schmidtler, Joseph Zhang, Sonny Chan, Andrew Doxon, Jom Preechayasomboon, Evan Pezent, Alberto Rigo, Amir Memar, Nicholas Colonnese, Chase Tymms

专题命中 机器人操作 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 本研究提出语义力反馈用于机器人遥操作,通过抽象触觉模式传递机器人状态信息,经实验验证其在双臂任务中性能优于感官触觉与视觉反馈,可降低工作负荷并提升态势感知。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12341 2026-08-05 cs.CV 版本更新 79%

Bridging the Micro--Macro Gap: Frequency-Aware Semantic Alignment for Image Manipulation Localization

弥合微-宏观差距:面向图像操纵本地化的频率感知语义对齐

Xiaojie Liang, Zhimin Chen, Ziqi Sheng, Wei Lu

机构 * School of Computer Science Engineering, Sun Yat-sen University Guangzhou China Engineering, Sun Yat-sen University

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV

AI总结 本文提出FASA框架,通过自适应双频带DCT模块提取操纵敏感频率特征,结合冻结CLIP表示的补丁级对比对齐学习语义先验,实现传统和扩散生成操纵的精准本地化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01586 2026-08-05 cs.CV cs.AI cs.RO 版本更新 75%

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

机构 * Li Auto Inc.(理想汽车) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18933 2026-08-05 cs.RO cs.AI 版本更新 73%

Gated Memory Policy: In-Context Memorization and Adaptation

门控记忆策略

Yihuai Gao, Jeff Jinyun Liu, Shuang Li, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出门控记忆策略,通过学习记忆回溯时机与内容,提升机器人操作任务中对历史信息的利用效率,实现在非马尔可夫任务中性能提升30.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03543 2026-08-05 cond-mat.str-el cond-mat.mtrl-sci 新提交 71%

Manipulation of localized excitons in CrPS$_4$ by temperature and magnetic field

温度和磁场对CrPS$_4$中局域激子的调控

Dipankar Jana, Swagata Acharya, Amit Pawbake, Dmitrii Litvinov, Aljoscha Soll, Zdenek Sofer, Clement Faugeras, Dimitar Pashov, Mark van Schilfgaarde, Kostya S. Novoselov, Marek Potemski, Maciej Koperski

专题命中 机器人操作 :manipulation(title)

AI总结 本研究结合理论计算与光学实验,揭示了CrPS$_4$的电子和激子性质,明确了其磁相变的光学标识,为反铁磁体的激子研究及磁有序调控提供了新方向。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03851 2026-08-05 cs.CV 新提交 70%

LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation

LiteMVS:结合基础模型蒸馏与专家聚合的高效多视图立体匹配

Tianbao Zhang, Zeyu Liu, Shuyu Wu, Fanxing Li, Zhaoxin Fan, Wenjun Wu, Danping Zou

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.CV

AI总结 LiteMVS是集成平面扫描几何推理与单目先验的轻量多视图深度模型,通过MoE和基础模型蒸馏提升重建质量与效率,在ScanNetv2等数据集上表现优异。

Comments CVPR 2026 Workshop accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03127 2026-08-05 cs.RO cs.AI 新提交 62%

DigitCode: Symbolic Tokenization of Hand Motion by Anatomical Units

DigitCode:基于解剖单元的手部运动符号分词

Haoyu Gu, Haotian Lu, Jingrun Du, Xiao-Ping Zhang

专题命中 机器人操作 :robot learning(abstract);分类 cs.RO、cs.AI

AI总结 本文提出DigitCode,沿手部解剖单元层次结构调整HL字母表以构建离散符号表征,将量化误差降低四分之三,发布HandTok测试平台,可用于修复生成的畸形手部及机器人重定向等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02834 2026-08-05 cs.RO cs.SY eess.SY 新提交 61%

Biconvex Optimization for Smooth Minimum-Time Trajectories around Convex Obstacles

凸障碍物周围平滑最小时间轨迹的双凸优化

Peter Werner, Tobia Marcucci, Daniela Rus

机构 * Massachusetts Institute of Technology(麻省理工学院) University of California Santa Barbara(加州大学圣巴巴拉分校)

专题命中 机器人操作 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 本研究提出一种双凸优化方法,用于凸障碍物周围的最小时间运动规划,可保证收敛、支持任意阶导数约束,实验表明其轨迹质量高、鲁棒性强且计算效率与现有方法相当。

Comments 18 pages, 9 figures, 4 tables. Submitted to IEEE Transactions on Robotics. Project page: https://wernerpe.github.io/bmtp-website/ Code: https://github.com/wernerpe/pybmtp

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03295 2026-08-05 cs.RO 新提交 57%

GraspMeanFlow: SE(3)-Equivariant MeanFlow for Few-Step 6-DoF Grasp Generation

GraspMeanFlow:用于少步6自由度抓取生成的SE(3)等变MeanFlow

Jiyong Kwon, Yikun Bai, Amirhossein Mollaali, Guang Lin

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究提出SE(3)等变MeanFlow框架GraspMeanFlow,解决现有6自由度抓取生成方法采样效率低的问题,在ACRONYM数据集上实现少步高效抓取生成并提升成功率,且抓取分布可随物体精确变换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02809 2026-08-05 cs.RO 新提交 57%

Toward Certified Functional Safety for Industrial Humanoid Robots: The Fail-Passive Gap and a Feasibility Study

面向工业人形机器人的认证功能安全:故障被动间隙与可行性研究

Caiwu Ding, Tao Cui, Lingyun Wang, Chengtao Wen

机构 * Siemens Foundational Technologies, Siemens Corporation(西门子基础技术部,西门子公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 该研究针对工业人形机器人功能安全认证的故障被动间隙,通过外部安全链定位间隙,在Unitree G1 EDU上验证方法,分析人形机器人主动安全状态,将间隙定位在SDA与平衡策略的接口处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07622 2026-08-05 cs.RO 版本更新 57%

Continuous and large-scale: ELEANOR, the soft architected arm inspired by the elephant trunk

连续且大规模:受象鼻启发的软结构手臂ELEANOR

Giovanna A. Naselli, Anderson B. Nardin, Seonggun Joe, Ryan Drinkwater, Enrico Donato, Diego Bianchi, Egidio Falotico, Michel C. Milinkovitch, Lucia Beccai

机构 * Soft BioRobotics Perception Laboratory, Istituto Italiano di Tecnologia(软生物机器人感知实验室,意大利理工学院) Department of Autonomous Systems Engineering, Korea Aerospace University(自主系统工程系,韩国航空航天大学) Photocentric Ltd.(Photocentric公司) BRAIR lab, The BioRobotics Institute, Scuola Superiore Sant’Anna(BRAIR实验室,生物机器人研究所,圣安娜高等学院) Laboratory of Artificial and Natural Evolution, Department of Genetics and Evolution, University of Geneva(人工与自然进化实验室,基因与进化系,日内瓦大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO

AI总结 以非洲象鼻为模型,提出注重结构连续性和动态特性的设计方法,通过3D打印构建结合腱驱动的连续体手臂,实现对不同物体的全身抓握,突出了仿生设计在机器人技术中的应用及与生物象鼻的比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08469 2026-08-05 cs.RO cs.SY eess.SY 版本更新 57%

Electrostatic Clutch-Based Mechanical Multiplexer with Increased Force Capability

基于静电离合器的机械多路复用器及其增强的力能力

Timothy E. Amish, Jeffrey T. Auletta, Chad C. Kessens, Joshua R. Smith, Jeffrey I. Lipton

机构 * Dept of Electrical and Computer Engineering, University of Washington(华盛顿大学电气与计算机工程系) US Army Research Directorate, DEVCOM Army Research Laboratory(美国陆军研究署, DEVCOM陆军研究实验室) Mechanical and Industrial Engineering Department of Northeastern University(东北大学机械与工业工程系)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于静电 capstan 离合器的机械多路复用器,实现单电机同时和顺序控制,展示在四自由度腱驱动机器人手中,单电机输出力达212N,垂直抓力提升4.09倍,水平承载力达111.2N。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20381 2026-08-05 cs.CL cs.AI cs.HC 版本更新 57%

The production of meaning in the processing of natural language

自然语言处理中意义产生的机制

Christopher J. Agostino, Quan Le Thien, Nayan D'Souza, Louis van der Elst

机构 * Department of Physics, Indiana University(印第安纳大学物理系) Department of Linguistics, Indiana University(印第安纳大学语言学系) Imperial College London(伦敦帝国学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 研究自然语言处理中意义产生的机制,探讨量子逻辑与经典布尔理论在语义处理中的差异,分析模型在不同参数下的表现及对安全交互的影响。

Comments Accepted to QNLP 2026, 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03169 2026-08-05 cs.CR cs.SE 新提交 50%

Test-time reasoning effort and unauthorized tool use in language-model agents: a prespecified equivalence study

语言模型智能体的测试时推理工作量与未授权工具使用:一项预先指定的等效性研究

Xiaonan Xu, Wenjing Wu

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究在GPT-5.6上开展预先指定的等效性研究,发现调整推理工作量未导致未授权工具使用,且规则探测率上升的模式与针对性搜索假设不符。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03156 2026-08-05 cs.DC 新提交 50%

Trust-Aware Topology Learning for Dynamic Decentralized Federated Learning under Adversaries

面向对抗环境下动态去中心化联邦学习的信任感知拓扑学习

Shubham Vaishnav, Murtaza Rangwala, Ali Beikmohammadi, Sindri Magnússon, Rajkumar Buyya

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对对抗环境下动态去中心化联邦学习的拓扑操纵与模型投毒问题,提出DMTT协议,结合证据深度学习与Beta分布信任模型,在UCI HAR和PAMAP2数据集上实现优于对比方法的鲁棒性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03021 2026-08-05 cs.SD 新提交 50%

MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation

MeloCodec:利用旋律先验实现高保真歌声表征

Yizhong Geng, Wenxin Fu, Kecan Mao, Qifei Li, Yingming Gao, Ruimin Wang, Chunfeng Wang, Hao Li, Ya Li, Wei Chen

专题命中 机器人操作 :manipulation(abstract)

AI总结 MeloCodec是整合旋律先验的新型音频编解码器框架,采用先分词后融合范式与两阶段训练策略,在歌声表征任务中优于基线,提升了音高一致性并实现可控音高操作。

Comments 7 pages, 3 figures, 3 tables. Accepted at IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03333 2026-08-05 physics.optics 新提交 50%

Space-Time Event Scattering and Extension Method (STESEM): A Universal Framework for Scattering in Space-Time Metamaterials

时空事件散射与扩展方法(STESEM):一种用于时空超材料中散射的通用框架

Klaas De Kinder, Amir Bahrami, Christophe Caloz

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对现有时空超材料散射分析方法的局限性,提出通用框架STESEM,通过分解散射过程无需坐标变换,推导典型结构散射响应,为相关超材料设计奠定基础。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06179 2026-08-05 cond-mat.mtrl-sci 版本更新 50%

Advances in Phonons: From Band Topology to Phonon Chirality

声子的进展:从带拓扑到声子手性

Tiantian Zhang, Yizhou Liu, Hu Miao, Shuichi Murakami

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文探讨了拓扑声子和圆极化声子的理论与实验进展,强调声子角动量与Weyl声子的关联,以及未来在量子技术中的应用潜力。

Comments Comments are welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13358 2026-08-05 cs.CR cs.SE 版本更新 50%

GraphQLer: Enhancing GraphQL Security with Context-Aware API Testing

GraphQLer:通过上下文感知API测试增强GraphQL安全性

Omar Tsai, Jianing Li, Tsz Tung Cheung, Lejing Huang, Hao Zhu, Jianrui Xiao, Iman Sharafaldin, Mohammad A. Tayebi

专题命中 机器人操作 :manipulation(abstract)

AI总结 GraphQLer是一款开源GraphQL API安全测试框架,通过构建依赖图合成漏洞链,在多类API上的漏洞检测和覆盖率表现显著优于ZAP、EvoMaster等基线工具。

Comments Publicly available on: https://github.com/omar2535/GraphQLer

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 12 篇

2608.03244 2026-08-05 cs.AI 新提交 85%

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

UniNav:用于视觉导航的统一世界-动作扩散模型

Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);world model(abstract);分类 cs.AI

AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00883 2026-08-05 cs.MM cs.CV cs.SD 版本更新 85%

Audio-Visual World Models: Learning Physically Grounded Multisensory Dynamics

视听世界模型:为具身智能体奠定多感官想象的基础

Jiahua Wang, Leqi Zheng, Jialong Wu, Yaoxin Mao, Shijie Cheng

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 具身导航 :world model(title,abstract);embodied agent(abstract);navigation(abstract);分类 cs.CV

AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏