arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-18 至 2026-08-18 共收录 31 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 31 篇

2608.15938 2026-08-18 cs.RO 新提交 83%

Revisiting Open-Loop Execution in Robotics: Toward Reactive, Higher-Performing Policies

机器人学中的开环执行再探讨:迈向反应式、高性能策略

Michael Zeng, Abhinav Agarwal, Ajay Bati, Brian Lee, Siddharth Ancha, Russ Tedrake

机构 * Massachusetts Institute of Technology(麻省理工学院) Mundane Systems Inc.(芒德系统公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :robotics(title);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究探讨机器人开环执行机制,发现长开环执行主要助短上下文策略模仿非马尔可夫示范,专家非马尔可夫性影响远超复合误差,长上下文下闭环策略更优,推动反应式策略范式发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15427 2026-08-18 cs.SE cs.RO 版本更新 83%

Formalisms for Robotic Mission Specification and Execution: A Comparative Analysis

机器人任务规范与执行的正式方法:比较分析

Gianluca Filippone, Sara Pettinari, Patrizio Pelliccione

专题命中 机器人数据与评测 :robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 本文比较了四种机器人任务规范形式化方法,分析其在任务描述中的适用性、表达能力和工具支持,为设计鲁棒且适应性强的机器人任务提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24476 2026-08-18 eess.SP 版本更新 82%

WiWorld-RealData: A Real-World Multi-Modal Dataset for 6G Wireless World Models

WiWorld-RealData:用于6G无线世界模型的真实世界多模态数据集

Yinyin Jiao, Huixin Xu, Jianhua Zhang, Yuelong Qiu, Jingjing Wang, Shaoyi Liu, Yuxiang Zhang, Li Yu, Xuebin Sun, Guangyi Liu

专题命中 机器人数据与评测 :world model(title,abstract);navigation(abstract)

AI总结 提出WiWorld-RealData数据集,包含3.7 GHz和6.775 GHz的信道冲激响应、多视角图像、全景图像、LiDAR点云、毫米波雷达记录和GNSS轨迹,支持环境辅助的信道预测,路径损耗预测MAE为2.02 dB。

Comments 6 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14713 2026-08-18 cs.RO cs.CV 新提交 81%

SpotlessGS: Relightable 3D Gaussian Splatting under Dynamic Illumination for Robotic Perception

SpotlessGS:面向机器人感知的动态光照下可重光照三维高斯溅射技术

Liang Hong, Jiaxin Wei, Simon Schaefer, Stefan Leutenegger, Jaehyung Jung

机构 * Technical University of Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究针对机器人在差光照环境下感知性能下降问题,提出SpotlessGS方法,通过优化光照参数、引入SH光照模型及MLP-BRDF,实现可重光照三维重建,提升了渲染与感知性能。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16843 2026-08-18 cs.RO 新提交 79%

Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation

基于基础模型的具身智能体的安全性:攻击面、攻击、防御与评估

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

机构 * Wuhan University(武汉大学)

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.RO

AI总结 该研究以信任边界为核心,针对基于基础模型的具身智能体安全,划分了五个层级与十二个攻击面,分析了58种攻击、61种防御的现状,指出部分领域研究不足并提出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15917 2026-08-18 cs.RO cs.AI cs.CV 新提交 75%

Pre-training Visual Dexterity in Simulation

在仿真环境中预训练视觉灵巧性

Sarthak Kamat, Adam Rashid, Satvik Sharma, Aseem Doriwala, Chelsea Finn, Phillip Isola, C. Karen Liu

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Scale AI(Scale AI公司)

专题命中 机器人数据与评测 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究提出SPD仿真预训练框架,采集75小时多任务灵巧操作数据预训练因果Transformer,经微调后在真实任务中优于从头训练的行为克隆策略,为真实世界灵巧操作提供可行预训练来源。

Comments Project page: this https URL (https://spd.bot)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08759 2026-08-18 cs.CV cs.RO 版本更新 73%

Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis

通过技能级评估与诊断解构多模态语言模型的具身能力

Yu Qi, Haibo Zhao, Ziyu Guo, Siyuan Ma, Ziyan Chen, Yaokun Han, Renrui Zhang, Zitiantao Lin, Yizhe Zhu, Shiji Xin, Yijian Huang, Boce Hu, Kai Cheng, Peiheng Wang, Jiazheng Liu, Jiayi Zhang, Yizhe Zhu, Wenqing Wang, Yiran Qin, Haojie Huang, Lawson L.S. Wong

机构 * Northeastern University, Boston, MA, USA The Chinese University of Hong Kong, Hong Kong, China Peking University, Beijing, China Westlake University, Hangzhou, China Harvard University, Cambridge, MA, USA Purdue University, West Lafayette, IN, USA University of Oxford, Oxford, United Kingdom

专题命中 机器人数据与评测 :embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出BEAR基准,通过分解具身任务为14个原子技能进行细粒度评估,发现感知能力是推理失败的主要瓶颈,并提出BEAR-Agent多模态对话代理,显著提升具身技能性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09860 2026-08-18 cs.RO cs.AI 版本更新 73%

RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies

RoboLab:一种高保真模拟基准,用于分析任务通用策略

Jenai Xuning Yang, Rishit Dagli, Alex Zook, Hugo Hadfield, Ankit Goyal, Stan Birchfield, Fabio Ramos, Jonathan Tremblay

机构 * NVIDIA University of Toronto(多伦多大学) The University of Sydney(悉尼大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 RoboLab通过高保真模拟环境评估任务通用策略的真实泛化能力,提供120个任务的视觉、程序和关系能力测试,揭示当前最佳模型的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11426 2026-08-18 cs.RO 版本更新 72%

Grounding Robot Generalization in Training Data via Retrieval-Augmented VLMs

通过检索增强的视觉语言模型实现机器人在训练数据中的泛化

Jensen Gao, Dorsa Sadigh, Sandy Huang, Dhruv Shah

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 机器人数据与评测 :robotics(abstract,comments);manipulation(abstract);分类 cs.RO

AI总结 本文提出RADAR框架,通过检索和视觉语言模型分析,评估机器人策略在不同场景下的泛化能力,验证了其在大规模数据集中的有效性。

Comments IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16715 2026-08-18 cs.RO 新提交 70%

MatchingPolicy: Correspondence-Aware Policy Enables Cross-Object In-Context Learning

MatchingPolicy:具备对应感知能力的策略实现跨物体的上下文学习

Qijin She, Hanyang Yu, Zeming Li, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 该研究提出MatchingPolicy框架,通过解耦演示-场景匹配与策略学习,结合视觉基础模型和两阶段匹配算法,在RLBench及真实操作任务上实现了跨物体的少样本泛化性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16556 2026-08-18 cs.AI 新提交 70%

DeepInsight II: One Trace from Benchmark to Robot

DeepInsight II:从基准测试到机器人的单条轨迹

Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.AI

AI总结 DeepInsight II量化具身层,复现基准结果、通过MotionBench实现仿真到真实机器人的原生迁移,并扩展轨迹定位至带修复动作的交接标签,提供从基准到机器人的经验连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15605 2026-08-18 cs.CV 新提交 70%

AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models

AlloEgo-VLM:在视觉语言模型中消除 allocentric( allocentric 即 allocentric 参考框架,又称 allocentric 坐标系,指以环境为中心的参考框架)与 egocentric( egocentric 即 egocentric 参考框架,又称自我中心坐标系,指以观察者自身为中心的参考框架)参考框架的歧义

Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao, Yu-Chee Tseng, Jen-Jee Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Institute of Computer Science and Engineering(工程与计算机科学学院) College of Artificial Intelligence(人工智能学院)

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 针对VLMs理解空间语义时 allocentric 与 egocentric 参考框架的歧义问题,构建数据集AlloEgo-View并开发框架AlloEgo-VLM,经NVIDIA Isaac Sim平台验证其在具身机器人开放式物体搜索任务中的有效性。

Comments 28 pages, 9 figures. Project page and code available at this https URL (https://github.com/CKL9001/AlloEgo-VLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00801 2026-08-18 cs.AI cs.IR 版本更新 70%

The Synthetic Web: Adversarially-Curated Mini-Internets for Diagnosing Epistemic Weaknesses of Language Agents

合成网络:用于诊断语言代理知识弱点的对抗性定制迷你互联网

Shrey Shah, Levent Ozgur

机构 * Microsoft(微软)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.AI

AI总结 本研究提出合成网络基准测试,通过对抗性内容测试揭示语言代理在处理冲突信息时的弱点,为高风险领域中的可靠代理开发提供评估框架。

Comments This version includes a revised manuscript presentation and formatting, expanded methodological and experimental details, enhanced reproducibility documentation, and improved benchmark framing and evaluation descriptions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15410 2026-08-18 cs.DC cs.AI cs.CV cs.RO eess.SY 新提交 67%

FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge

FloodReasonBench:面向边缘端具身洪水响应的VLM推理分割基准

Rajat Bhattacharjya, Yoomee Jung, Minwoo Kim, Sing-Yao Wu, Eli Bozorgzadeh, Nalini Venkatasubramanian, Nikil Dutt

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 FloodReasonBench针对边缘端具身洪水响应,构建专用数据集并刻画推理分割流水线的性能权衡,为资源受限场景提供任务与系统层面的基准支持。

Comments Paper is currently under review. The code and dataset will be made public upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12407 2026-08-18 cs.RO cs.CV cs.LG 版本更新 67%

MiDAS: A Multimodal Data Acquisition System and Dataset for Robot-Assisted Minimally Invasive Surgery

MiDAS:一种用于机器人辅助微创手术的多模态数据采集系统和数据集

Keshara Weerasinghe, Seyed Hamid Reza Roodabeh, Andrew Hawkins (MD), Zhaomeng Zhang, Zachary Schrader, Homa Alemzadeh

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 MiDAS是一种开源多模态数据采集系统,能够实现机器人辅助微创手术的非侵入式数据采集,并发布首个高保真仿真模型的缝合任务数据集。

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15175 2026-08-18 cs.RO cs.AI 新提交 62%

LAPF: LLM-Agent-Based Path Finder Using the UAVScenes Dataset

LAPF:基于大语言模型智能体的路径查找器,使用UAVScenes数据集

Yousef Emami, Mohammadhossein Homaei, Hao Zhou, Miguel Gutiérrez Gaitán, Atefeh Hajijamali Arani, Rui Zhang

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于LLM智能体的LAPF框架,整合多模块构建闭环认知架构,在城镇级无人机导航中实现了更优路径效率,且无钳位事件,性能优于CoT提示方法。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07084 2026-08-18 cs.RO cs.AI 版本更新 62%

Flow Motion Policy: Manipulator Motion Planning with Flow Matching Models

流运动策略:基于流匹配模型的机械臂运动规划

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

机构 * Zachry Department of Civil and Environmental Engineering, Texas A&M University(德克萨斯A&M大学Zachry土木与环境工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出流运动策略,一种基于流匹配模型的机械臂运动规划方法,通过生成路径分布实现高效推理优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24900 2026-08-18 cs.CV cs.AI 版本更新 62%

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

OpenGPT-4o-Image:用于高级图像生成与编辑的综合数据集

Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

机构 * USTC(中国科学技术大学) Kling Team(Kling团队) HDU(华中科技大学) PKU(北京大学) NJU(南京大学) CASIA(中国科学院自动化研究所) THU(清华大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 该研究构建了涵盖11个领域51个子任务的OpenGPT-4o-Image数据集,经其微调主流模型后,图像编辑任务性能最高提升18%、生成任务最高提升13%,证实系统化数据构建对多模态AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01584 2026-08-18 cs.LG cs.AI cs.CY 版本更新 62%

VirnyFlow: Optimizing ML Pipelines for Accuracy, Fairness, and Stability at Scale

VirnyFlow:面向大规模场景下兼顾准确率、公平性与稳定性的机器学习流水线优化

Denys Herasymuk, Anastasiia Mozghova, Nazar Protsiv, Vladyslav Sydorak, Julia Stoyanovich

机构 * Ukrainian Catholic University(乌克兰天主教大学) New York University(纽约大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 VirnyFlow是兼顾准确率、公平性与稳定性的大规模ML流水线优化系统,可扩展至多节点,在真实数据集上性能优于主流AutoML系统,支持人类在环迭代调整优化目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16859 2026-08-18 cs.CV 新提交 57%

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

HarnessEval-W:将视觉世界评估智能体化

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 该研究提出智能体化评估流程HarnessEval-W,将LLM生态的harness范式应用于世界模型基准测试,对18个世界模型的330个案例评估,其判断与人类偏好一致且提供可验证诊断,已开源并邀社区贡献。

Comments Project Page: this https URL (https://mirros-lab.github.io/HarnessEval-W)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16741 2026-08-18 cs.RO 新提交 57%

Semantic- and Density-Aware Planning for Accessibility-Preserving Multi-Object Placement

面向可访问性保持的多物体放置的语义与密度感知规划

Benno Wingender, Nils Dengler, Nicolas Busch, Sicong Pan, Maren Bennewitz

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 针对在线多物体货架放置场景,提出SDPP方法,结合语义-密度评分与AM,在提升语义放置质量和货架密度的同时,减少可行位姿识别时间,适用于家庭货架存储场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16014 2026-08-18 cs.CV 新提交 57%

Depth-guided Multi-view Exposure Bracketing for HDR Robot Vision

面向机器人视觉的深度引导多视图曝光 bracketing(HDR 成像技术)

Jinnyeong Kim, Juhyung Choi, Woohyeok Kim, Sunghyun Cho, Seung-Hwan Baek

机构 * POSTECH(浦项科技大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 针对多传感器机器人系统 HDR 感知评估基准缺失的问题,构建含真实与合成场景的大规模数据集,提出深度引导多视图曝光 bracketing(DMEB)单帧 HDR 方法,经评估该方法可作为参考基准且具应用潜力。

Comments 14 pages, ECCV 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15594 2026-08-18 cs.AI 新提交 57%

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

TRACE:面向多轮对抗对话评估的轨迹感知推理

Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang

机构 * Texas A&M University(德克萨斯农工大学) Amazon(亚马逊公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15539 2026-08-18 cs.CV 新提交 57%

CrossView: Can Vision-Language Models Reason Across Cameras?

CrossView:视觉-语言模型能否跨相机进行推理?

Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11216 2026-08-18 cs.AI 版本更新 57%

AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri

机构 * Electronic Arts(美国艺电公司) Simon Fraser University(西蒙菲莎大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。

Comments Project page: this https URL (https://electronicarts.github.io/AutoWorldModelBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08860 2026-08-18 eess.SY cs.HC cs.RO physics.med-ph 版本更新 57%

Preview-Based Relative-Motion Control of an Insertion Tool for Neural-Thread Placement in Pulsating Tissue

搏动组织中神经线程放置的插入工具的基于预览的相对运动控制

Yongyan Cao, Xiaobo Li

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 该研究针对搏动组织的神经线程放置,开发基于预览的相对运动控制器,经仿真验证可降低放置误差与接触剪切,提升QP求解可行性,在一定质量失配下保证稳定性,为后续硬件部署提供仿真基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12453 2026-08-18 cs.LG 版本更新 57%

Time-Correlated Video Bridge Matching

时间相关视频桥匹配

Viacheslav Vasilev, Arseny Ivanov, Nikita Gushchin, Maria Kovaleva, Alexander Korotin

机构 * Kandinsky Lab(Kandinsky实验室) Applied AI Institute(应用人工智能研究所) HSE University(高等经济大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出时间相关视频桥匹配框架,解决视频生成中时间相关序列建模问题,通过建模序列间依赖性和时间相关性,提升视频生成质量与重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00600 2026-08-18 cs.RO 版本更新 57%

I-Perceive: A Foundation Model for Active Perception with Language Instructions

I-Perceive:一种基于语言指令的主动感知基础模型

Yongxi Huang, Zhuohang Wang, Wenjing Tang, Xinyu He, Cewu Lu, Panpan Cai

机构 * Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 I-Perceive是一种基于自然语言指令的主动感知基础模型,通过融合视觉-语言模型与几何基础模型,实现了对开放意图场景的有效感知与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03444 2026-08-18 cs.RO eess.SY 版本更新 57%

PerFACT: Motion Policy with LLM-Powered Dataset Synthesis and Fusion Action-Chunking Transformers

PerFACT: 基于LLM驱动的数据集合成与融合动作分块变换器的运动策略

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66机械工程系,德克萨斯A&M大学) Zachry Department of Civil and Environmental Engineering, Texas A&M University(Zachry土木与环境工程系,德克萨斯A&M大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 PerFACT通过LLM驱动的数据集合成和融合动作分块变换器,提升机械臂运动规划的泛化能力和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18898 2026-08-18 cs.CV cs.GR 版本更新 57%

GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling

GestureLSM:基于隐式捷径的时空建模语音同步手势生成

Pinxin Liu, Luchuan Song, Junhua Huang, Haiyang Liu, Junfan Zhu, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Tokyo(东京大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 GestureLSM通过时空建模与改进的流匹配方法,在BEAT2数据集上实现了最优语音同步手势生成,同时大幅缩短推理时间,可用于增强数字人和具身智能体。

Comments Accepted to ICCV 2025. Project Page: this https URL (https://andypinxinliu.github.io/GestureLSM)

详情

展开后加载摘要…

URL PDF HTML 收藏