arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-23 至 2026-04-23 共收录 9 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 9 篇

2604.20246 2026-04-23 cs.RO cs.AI 84%

Cortex 2.0: Grounding World Models in Real-World Industrial Deployment

Cortex 2.0:在真实工业部署中将世界模型接地

Adriana Aida, Walida Amer, Katarina Bankovic, Dhruv Behl, Fabian Busch, Annie Bhalla, Minh Duong, Florian Gienger, Rohan Godse, Denis Grachev, Ralf Gulde, Elisa Hagensieker, Junpeng Hu, Shivam Joshi, Tobias Knoblauch, Likith Kumar, Damien LaRocque, Keerthana Lokesh, Omar Moured, Khiem Nguyen, Christian Preyss, Ranjith Sriganesan, Vikram Singh, Carsten Sponner, Anh Tong, Dominik Tuscher, Marc Tuscher, Pavan Upputuri

机构 * Sereact GmbH(Sereact公司)

专题命中 机器人数据与评测 :world model(title);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 Cortex 2.0通过在视觉潜在空间中生成候选未来轨迹并评分,实现了从反应式控制到计划与行动的转变,展示了在复杂工业环境中可靠的世界模型规划。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20349 2026-04-23 eess.SP 67%

Descriptor: A Hybrid Indoor and Indoor-Outdoor Positioning Multi-Technology Dataset (HYMN)

描述:一种混合室内外定位多技术数据集(HYMN)

Muhammad Ammad, Albrecht Michler, Paul Schwarzbach, Jonas Ninnemann, Hagen Ußler, Oliver Michler

专题命中 机器人数据与评测 :navigation(abstract,abstract_cn)

AI总结 HYMN数据集结合五种定位技术,涵盖室内外过渡场景,支持多传感器融合和无缝定位研究,克服单一技术限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07295 2026-04-23 cs.RO cs.AI 62%

Learning Multi-Modal Whole-Body Control for Real-World Humanoid Robots

多模态全身控制学习用于现实世界的人形机器人

Pranay Dugar, Aayam Shrestha, Fangzhou Yu, Bart van Marum, Alan Fern

机构 * Collaborative Robotics and Intelligent Systems Institute (CoRIS)(协同机器人与智能系统研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种多模态全身控制器,通过统一接口实现多样化的人形机器人行为控制,展示了在仿真和真实世界中的有效性。

Comments Website: https://masked-humanoid.github.io/mhc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19787 2026-04-23 cs.CL cs.AI cs.CY 57%

LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans

LLM代理预测社交媒体反应但不优于文本分类器:使用120,000多个1511人的人设进行基准测试

Ljubisa Bojic, Alexander Felfernig, Bojana Dinic, Velibor Ilic, Achim Rettinger, Vera Mevorah, Damian Trilling

机构 * Institute for Artificial Intelligence Research and Development of Serbia(塞尔维亚人工智能研究与开发研究所) University of Belgrade, Institute for Philosophy and Social Theory, Digital Society Lab(贝尔格莱德大学,哲学与社会理论研究所,数字社会实验室) Complexity Science Hub, Vienna, Austria(维也纳复杂科学中心) Graz University of Technology, Graz, Austria(技术大学格拉茨,格拉茨,奥地利) University of Novi Sad, Faculty of Philosophy, Novi Sad, Serbia(诺维萨德大学,哲学学院,诺维萨德,塞尔维亚) University of Trier, Trier, Germany(特里尔大学,特里尔,德国) Vrije University Amsterdam, Amsterdam, Netherlands(阿姆斯特丹自由大学,阿姆斯特丹,荷兰)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文研究LLM代理预测人类社交媒体反应的准确性,发现其表现不如传统文本分类器,揭示了零样本代理在模拟极化动态中的潜力及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14311 2026-04-23 eess.SY cs.RO cs.SY 57%

Multi-Timescale Model Predictive Control for Slow-Fast Systems

多时间尺度模型预测控制用于慢-快系统

Lukas Schroth, Daniel Morton, Amon Lahr, Daniele Gammelli, Andrea Carron, Marco Pavone

机构 * Institute for Dynamic Systems and Control(动态系统与控制研究所) Department of Aeronautics and Astronautics(航空与航天系) Department of Mechanical Engineering(机械工程系) NVIDIA Research(NVIDIA研究)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出多时间尺度MPC方法,通过切换简化模型和增加积分步长来提升计算效率,应用于机器人控制问题,实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18823 2026-04-23 cs.CV 57%

MSLAU-Net: A Hybrid CNN-Transformer Network for Medical Image Segmentation

MSLAU-Net:一种用于医学图像分割的混合CNN-Transformer网络

Libin Lan, Yanxin Li, Xiaojuan Liu, Juan Zhou, Jianxun Zhang, Nannan Huang, Yudong Zhang

机构 * College of Computer Science and Engineering(计算机科学与工程学院) College of Artificial Intelligence(人工智能学院) Department of Pharmacy(药学部) Department of Prosthodontics(修复学部) Chongqing Key Laboratory of Oral Diseases(重庆口腔疾病重点实验室) Chongqing Municipal Key Laboratory of Oral Biomedical Engineering of Higher Education(重庆市口腔生物医学工程高等教育重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Southeast University(东南大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出MSLAU-Net,结合CNN和Transformer的优势,通过多尺度线性注意力和自上而下特征聚合机制,提升医学图像分割的精度与效率。

Comments 15 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20795 2026-04-23 cs.AI 57%

Automatic Ontology Construction Using LLMs as an External Layer of Memory, Verification, and Planning for Hybrid Intelligent Systems

利用LLMs构建自动本体:作为混合智能系统记忆、验证和规划的外部层

Pavel Salovskii, Iuliia Gorshkova

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 本文提出了一种混合架构,通过扩展LLMs的外部本体记忆层,实现结构化知识图谱的构建与维护,提升多步推理性能并支持生成-验证-修正流程。

Comments Artificial Intelligence; Knowledge Representation and Reasoning; Information Retrieval; Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20760 2026-04-23 cs.CV 57%

Exploring High-Order Self-Similarity for Video Understanding

探索高阶自相似性用于视频理解

Manjin Kim, Heeseung Kwon, Karteek Alahari, Minsu Cho

机构 * POSTECH RLWRLD Inc.(RLWRLD公司) INRIA Grenoble Rhône-Alpes(INRIA格勒诺布尔罗纳-阿尔卑斯研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出多阶自相似模块MOSS,通过学习和整合多阶时空自相似特征,提升视频任务中的运动建模能力,实验表明在动作识别、视频VQA和机器人任务中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19901 2026-04-23 physics.ao-ph 50%

Geometric Correction of Side-Scan Sonar Images with Image-Consistent Attitude Refinement

侧扫声呐图像的几何校正与图像一致姿态细化

Can Lei, Valerio Franchi, Hayat Rajani, Nuno Gracias, Rafael Garcia, Huigang Wang

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本文提出一种侧扫声呐图像几何校正方法,通过图像一致的姿态细化减少图像条带畸变,提升几何一致性与局部结构连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏