arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-13 至 2026-08-13 共收录 31 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2606.12406 2026-08-13 cs.RO cs.AI cs.LG cs.SY eess.SY 版本更新 67%

FACTR 2: Learning External Force Sensing for Commodity Robot Arms Improves Policy Learning

FACTR 2: 学习商用机器人手臂的外部力感知提升策略学习

Steven Oh, Jason Jingzhou Liu, Tony Tao, Philip Han, Kenneth Shaw, Satoshi Funabashi, Ruslan Salakhutdinov, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Waseda University(早稻田大学)

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出无需专用力传感器的数据驱动方法NEXT,可在1分钟内从10分钟自由运动数据中训练,实现与专用关节力矩传感器相当的估计,并结合FIRST采样策略提升策略学习性能。

Comments Website at https://jasonjzliu.com/factr2

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 7 篇

2606.17598 2026-08-13 cs.RO cs.CV 版本更新 90%

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation

MuseVLA: 一种用于机器人操作的自适应多模态感知视觉-语言-动作模型

Xingyuming Liu, Ruichun Ma, Heyu Guo, Qixiu Li, Qingwen Yang, Lin Luo, Shiqi Jiang, Chenren Xu, Jiaolong Yang, Baining Guo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.CV

AI总结 提出MuseVLA模型,通过将传感器作为按需工具集成,实现自适应多模态感知;设计传感器图像统一表示,并引入数据合成流水线,在灵巧手操作任务中平均成功率80.6%,显著优于RGB-only和多模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12908 2026-08-13 cs.RO 版本更新 89%

Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models

机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干

Zijian Song, Qichang Li, Jiawei Zhou, Zhenlong Yuan, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) X-Era AI Lab(X-Era人工智能实验室) AMAP, Alibaba(阿里妈妈实验室) Guangdong University of Technology(广东工业大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);world model(abstract);分类 cs.RO

AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11109 2026-08-13 cs.RO 版本更新 83%

FEWT: Frequency-Enhanced Wavelet-based Transformer for Multimodal Wheeled Bimanual Manipulation

FEWT:用于多模态轮式双臂操作的频率增强型小波Transformer

Jiaxin Huang, Hanyu Liu, Yunsheng Ma, Jian Shen, Yilin Zheng, Jiayi Wen, Zhigong Song

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本研究针对轮式双臂操作的空间视觉与物理动力学表示不匹配问题,提出FEWT框架,整合FE-EMA与TS-DWT模块并结合STF传感器,在模拟及真实操作任务中较基准取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09989 2026-08-13 eess.IV cs.CV 版本更新 57%

Algorithmic statistics of retinal images

视网膜图像的算法统计学

Loan Huynh, Ronald Zambrano, Layton Aho, Fabio Lavinsky, Gadi Wollstein, Joel S. Schuman, Andrew R. Cohen

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文针对三维视网膜图像的分析问题,提出结合归一化压缩距离与各向异性结构增强滤波器的度量学习方法,其预测误差优于非度量深度学习方法,还提出归一化压缩向量用于可视化变化模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11952 2026-08-13 cs.RO 版本更新 57%

Deformable In-Hand Slip-Aware Tactile Sensor with Integrated Velocity, Force/Torque, and Pressure Map Sensing

可变形手内滑移感知触觉传感器,集成速度、力/力矩和压力图传感

Gabriel Arslan Waltersson, Yiannis Karayiannidis

机构 * Chalmers University of Technology(查尔姆斯理工大学) Lund University(隆德大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出一种新型触觉传感器,通过可变形接触垫集成速度、力/力矩和压力图传感,实现手内操作的滑移感知控制,并支持快速低成本制造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10822 2026-08-13 cond-mat.mes-hall 版本更新 50%

Strong coupling between antiferromagnetic magnons and spoof surface plasmons

反铁磁磁振子与类表面等离激元的强耦合

Yamin Sun, Ka Shen, H. Y. Yuan

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出一种平面异质结构,通过解析求解耦合方程预测反铁磁磁振子与类表面等离激元在太赫兹波段存在强耦合,为相关杂化系统提供了片上集成的可行平台。

Comments Corrected Figure 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21392 2026-08-13 cs.CR 版本更新 50%

VIPER-MCP: Detecting and Exploiting Taint-Style Vulnerabilities in Model Context Protocol Servers

VIPER-MCP: 检测和利用模型上下文协议服务器中的污点式漏洞

Pengyu Sun, Zifeng Kang, Qishu Jin, Enhao Huang, Xin Liu, Dakun Shen, Song Li

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出VIPER-MCP,一种用于模型上下文协议服务器的端到端自动漏洞审计框架,能够检测污点式漏洞并动态验证其可利用性,通过生成具体的概念验证提示。该框架引入了两种新技术:一种是双阶段静态分析策略中的锚查询,增强了标准污点警报的功能性上下文;另一种是反馈驱动的提示进化机制,通过双变异调度和适应度评分的种子选择,逐步优化自然语言提示以达到易受攻击的sink。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 6 篇

2509.24528 2026-08-13 cs.CV cs.AI 版本更新 79%

CORE-3D: Context-aware Open-vocabulary Retrieval by Embeddings in 3D

CORE-3D: 基于嵌入的上下文感知开放词汇检索

Mohamad Amin Mirzaei, Pantea Amoie, Ali Ekhterachian, Matin Mirzababaei, Babak Khalaj

机构 * Department of Electrical Engineering, Sharif University of Technology(电气工程系,谢里夫大学)

专题命中 具身导航 :robotics(abstract);embodied AI(abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 CORE-3D通过结合上下文感知的CLIP编码和渐进粒度细化,提升3D场景理解中开放词汇检索和语义分割的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12236 2026-08-13 cs.RO cs.AI cs.LG 版本更新 75%

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

TMRL: 差分时间步调节预训练实现高效策略微调的探索

Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

专题命中 具身导航 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10449 2026-08-13 cs.RO 版本更新 70%

PBD-AG: Persistent Baseline-Delta Active Graphs with Uncertainty-Aware Inspection for Long-Horizon Service Robots

PBD-AG:面向长周期服务机器人的具有不确定性感知检查的持久基线-增量主动图

Shuo Bao, Wei Dong, Shuyue Zhang, Ming Shang, Yuchen Huang, Han Yu, Chengjie Xu, Yiheng Bi, Kai Sun, Fuchun Sun, Xinzhou Wang

专题命中 具身导航 :world model(abstract);robotic(abstract);分类 cs.RO

AI总结 针对长周期服务机器人世界模型构建的现有方法存在不足,本文提出PBD-AG框架,通过解耦稳定固定装置与动态对象事件,结合不确定性感知检查,在仿真与物理机器人实验中取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00237 2026-08-13 cs.CV cs.RO 版本更新 62%

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving

隐式质心引导:用于指令对齐自动驾驶的单次无分类器引导

Meibo Hu, Jiamian Wang, Pichao Wang, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) NVIDIA(英伟达公司)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 针对视觉语言自动驾驶模型的指令跟随差距,提出单次引导机制LCS,降低推理延迟约50%,在Bench2Drive和nuScenes基准上提升指令遵循与驾驶性能。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08837 2026-08-13 cs.LG cs.AI 版本更新 62%

Prompt-Driven Exploration

提示驱动的探索

Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Improbable AI Lab(英普罗巴布尔人工智能实验室)

专题命中 具身导航 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03236 2026-08-13 cs.HC cs.CL 版本更新 50%

BLADE: Better Language Answers through Dialogue and Explanations

BLADE:通过对话和解释提升语言答案

Chathuri Jayaweera, Phoebe Huang, Bonnie J. Dorr

机构 * University of Florida(佛罗里达大学)

专题命中 具身导航 :navigation(abstract)

AI总结 BLADE通过引导学习者接触相关教学资源而非直接提供答案,提升学生对课程资源的导航能力和概念理解。

Comments Contains 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 7 篇

2607.00836 2026-08-13 cs.RO cs.AI cs.SY eess.SY 版本更新 90%

From World Models to World Action Models: A Concise Tutorial for Robotics

从世界模型到世界动作模型:面向机器人学的简明教程

Xiaoxiong Zhang, Xiong Zeng, Wei Zhang

专题命中 具身推理 :robotics(title,abstract);world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本教程提出世界模型作为动作条件预测模型的设计空间视图,分类为观测空间和状态空间模型,并引入世界动作模型,总结四种代表性范式,为具身预测与控制提供结构化分类。

Comments Project page: https://clearlab-sustech.github.io/WorldModelSurvey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13840 2026-08-13 cs.RO cs.CV 版本更新 81%

Multi-Agent Embodied Autonomous Driving: From V2X Information Exchange to Shared World Models

多智能体具身自动驾驶:从V2X信息交换到共享世界模型

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Yiqin Deng, Yuguang Fang

机构 * Lingnan University, Hong Kong(岭南大学(香港))

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07303 2026-08-13 cs.LG 版本更新 80%

Bootstrap Theory of Representational Emergence: Explanatory Insufficiency as a Driver of Representation Learning and World Models

表征涌现的自举理论:解释不充分性作为表征学习与世界模型的驱动力

Jacques Raynal, Pierre Slangen, Elsa Raynal, Jacques Margerit

机构 * Laboratory of Bioengineering and Nanosciences (LBN), University of Montpellier(生物工程与纳米科学实验室(LBN),蒙彼利埃大学) EuroMov Digital Health in Motion, University of Montpellier, IMT Mines Alès(EuroMov数字健康运动,蒙彼利埃大学,IMT矿山阿尔勒) Certified Sophrologist, Sensorimotor Practice, Montpellier, France(认证Sophrologist,运动觉实践,蒙彼利埃,法国) Emeritus Professor, University of Montpellier(荣誉教授,蒙彼利埃大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出表征涌现自举理论(TBER),将解释不充分性视为新表征涌现的积极信号,通过五阶段递归过程驱动表征创新,应用于表征学习、世界模型和科学发现。

Comments 27 pages, 25 references, no figures or tables. Conceptual framework on representational emergence and explanatory insufficiency, with implications for representation learning, world models, autonomous AI, and scientific discovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11174 2026-08-13 cs.RO 版本更新 79%

VIScore: Diagnosing Planning-Relevant Quality in Latent World Models

VIScore:诊断潜在世界模型中与规划相关的质量

Haiyu Wu, Randall Balestriero, Morgan Levine

机构 * Altos Labs(阿尔托斯实验室) Brown University(布朗大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 该研究针对潜在世界模型规划成功率与潜在空间属性脱节的问题,提出VIScore指标,覆盖编码器、预测器、规划器,在跨任务场景下斯皮尔曼相关性超0.75,可更好解释规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18064 2026-08-13 cs.AI 版本更新 79%

Towards Human Motion World Models via Executable Behaviour Representations

通过可执行模型理解人类行为

Rimvydas Rubavicius, Manisha Dubey, N. Siddharth, Subramanian Ramamoorthy

机构 * School of Informatics The University of Edinburgh(信息学院爱丁堡大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出EXACT语言,通过可执行神经符号模型分析人类动作,提升动作分割和异常检测的效率与直观性。

Comments Accepted in ECCV2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10915 2026-08-13 cs.AI 版本更新 77%

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

具身融合智能体:以人为中心的智能体人工智能新范式

Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Yao, Kelong Mao, Hao Sun, Zhiyao Luo, Jiankai Tang, Lei Li, Jiadong Guo, Minheng Ni, Weicong Lin, Chenxi Yang, Hongxiang Gao, Zhenghua Chen, Yang Bai, Min Wu, Jun Cheng, Huazhu Fu, Dacheng Tao, Bang Liu

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) Nanjing Medical University(南京医科大学) Nanjing University(南京大学) Renmin University of China(中国人民大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) Southeast University(东南大学) University of Glasgow(格拉斯哥大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(abstract,abstract_cn);embodied agent(abstract);分类 cs.AI

AI总结 该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。

Comments 38 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08023 2026-08-13 cs.RO 版本更新 70%

4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields

4D-WAM:通过轨迹场将时空感知注入世界动作模型

Lishan Yang, Wenxuan Song, Xi Wang, Pingyue Sheng, Zheng Fang, Ziyang Zhou, Junjie He, Haodong Yan, Jiayi Chen, Nan Sun, Qiao Sun, Pengwei Wang, Lingqiao Liu, Yan Wang, Yuxiang Gao, Feras Dayoub, Haoang Li

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 2 篇

2608.09448 2026-08-13 cs.RO cs.CV 版本更新 62%

VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction

VANE:通过未来视觉表示预测实现视觉-语言-动作模型的可靠测试时训练

Hongjin Ji, Guoyang Xia, Luoyang Sun, Fangxiang Feng, Lei Ren

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Li Auto Inc.(理想汽车)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出VANE框架,通过条件提示自适应、未来视觉后果学习及候选更新隔离评估的方法,提升VLA策略在闭环操纵中的可靠性,在SimplerEnv WidowX上将平均成功率提高3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24060 2026-08-13 cs.RO 版本更新 57%

RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation

SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统

Zhuoran Li, Zhiyang Li, Kaijun Zhou, Jinyu Gu

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。

Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 6 篇

2603.11431 2026-08-13 cs.RO 版本更新 80%

A Generalized Theory of Load Distribution in Redundantly-actuated Robotic Systems

冗余驱动机器人系统中载荷分布的通用理论

Joshua Flight, Clément Gosselin

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出冗余驱动机器人系统中载荷分布的通用理论,推导了高效力合成与分析解,并指出现有方法的不足,通过示例展示改进效果。

Comments 23 pages, 15 figures. Submitted to The International Journal of Robotics Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19985 2026-08-13 cs.CV 版本更新 70%

Vision-Reasoning-Guided Occlusion Removal from Light Fields

视觉推理引导的光场遮挡去除

Mohamed Youssef, Oliver Bimber

机构 * Johannes Kepler University(约翰·开普勒大学)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出结合光场积分与视觉语言模型的框架,通过多视图融合和语义先验恢复被遮挡场景,在合成和真实数据上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05474 2026-08-13 cs.CV 版本更新 70%

3D Scene Generation: A Survey

3D场景生成:一项综述

Haozhe Xie, Beichen Wen, Zhaoxi Chen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 本综述系统梳理3D场景生成的四大范式方法,分析其技术基础与挑战,展望物理感知生成等方向,为该领域发展提供参考。

Comments Accepted by IJCV. Project Page: https://github.com/hzxie/Awesome-3D-Scene-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08131 2026-08-13 cs.RO cs.CV 版本更新 62%

UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing

UniGround: 通过无训练场景解析实现通用三维视觉接地

Jiaxi Zhang, Yunheng Wang, Wei Lu, Taowen Wang, Shuning Zhang, Yixiao Feng, Junzhe Xu, Shunwang Sun, Weisheng Xu, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)) Shanghai Normal University(上海师范大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 UniGround通过无训练的视觉和几何推理实现通用三维视觉接地,超越训练数据限制,在ScanRefer和EmbodiedScan上取得新突破。

Comments 30 pages,9 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14615 2026-08-13 cs.CV 版本更新 57%

CalibAnyView: Beyond Single-View Camera Calibration in the Wild

CalibAnyView:超越单视角相机校准的野外应用

Boying Li, Cheng Zhang, Weirong Chen, Guyuan Chen, Daniel Cremers, Jianfei Cai, Ian Reid, Hamid Rezatofighi

机构 * Monash University(蒙纳士大学) Technical University of Munich(慕尼黑技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 CalibAnyView通过多视角几何一致性建模,提升野外多视角相机校准的鲁棒性和精度,适用于复杂场景下的3D重建和机器人感知。

Comments 27 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02038 2026-08-13 cs.CL cs.SD eess.AS 版本更新 50%

Marco-Voice Technical Report

Marco-Voice技术报告

Fengping Tian, Chenyang Lyu, Xuanfan Ni, Haoqin Sun, Qingjuan Li, Zhiqiang Qian, Haijun Li, Longyue Wang, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本研究提出集成语音克隆与情感控制的Marco-Voice语音合成系统,通过说话人-情感解耦等机制构建CSEMOTIONS数据集,实现了表现力与可控性的显著提升。

Comments Technical Report. Our code and dataset are publicly available at https://github.com/AIDC-AI/Marco-Voice and https://huggingface.co/datasets/AIDC-AI/CSEMOTIONS respectively for non-commercial use only

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他机器人 2 篇

2504.20477 2026-08-13 cs.RO 版本更新 83%

Who Is Responsible? Self-Adaptation Under Multiple Concurrent Failures With Unknown Faults in Complex Robotic Systems

谁该负责?在复杂ROS系统中多重同时不确定性的自我适应

Andreas Wiedholz, Rafael Paintner, Alwin Hoffmann, Tobias Huber

机构 * XITASO GmbH(XITASO公司) German Aerospace Center (DLR) Institute of Flight Systems(德国航空航天中心(DLR)飞行系统研究所)

专题命中 其他机器人 :robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 本文提出了一种基于ROS2的自我适应方法,能够处理复杂系统中多重同时不确定性的根本原因分析和策略选择,通过规则集和依赖图实现轻量级适应,提升适应效率与性能。

Comments Accepted at ACSOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏