arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-12 至 2026-05-12 共收录 157 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 27 篇

2605.10269 2026-05-12 cs.CV cs.RO 62%

Increasing the Efficiency of DETR for Maritime High-Resolution Images

提升DETR在海上高分辨率图像中的效率

Tinsae Yehuala, Hao Cheng, Ville Lehtola

机构 * Dept. of Earth Observation Science, ITC Faculty, University of Twente(地球观测科学系,ITC学院,特文特大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种基于Vision Mamba的改进DETR模型,通过特征金字塔网络和token剪枝提升海上目标检测的效率与精度。

Comments Accepted to IEEE ITSC 2026. Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses. DOI to be added upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12982 2026-05-12 cs.RO cs.AI cs.SE 62%

Out of Distribution Detection in Self-adaptive Robots with AI-powered Digital Twins

具有AI驱动数字孪生的自适应机器人中的分布外检测

Erblin Isaku, Hassan Sartaj, Shaukat Ali, Beatriz Sanguino, Tongtong Wang, Guoyuan Li, Houxiang Zhang, Thomas Peyrucain

机构 * Simula Research Laboratory(Simula研究实验室) University of Oslo(奥斯陆大学) Norwegian University of Science and Technology(挪威科学技术大学) PAL Robotics(PAL机器人)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于数字孪生的ODiSAR方法,用于自适应机器人中检测分布外行为,通过Transformer模型和不确定性量化实现高检测性能,提供可解释性支持自适应调整。

Comments 15 pages, 4 figures, 3 tables

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09317 2026-05-12 cs.CL cs.CV cs.LG 62%

Mem-W: Latent Memory-Native GUI Agents

Mem-W: 基于潜在记忆的原生GUI代理

Guibin Zhang, Yaohui Ling, Fanci Meng, Kun Wang, Shuicheng Yan

机构 * LV-NUS Lab(LV-NUS实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.CV、cs.LG

AI总结 Mem-W通过将记忆作为连续上下文的一部分,改进GUI代理的长期任务执行能力,实验证明其在多个导航基准测试中提升了性能,最高提升达+30.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07209 2026-05-12 cs.RO 61%

Continuum Robot Localization using Distributed Time-of-Flight Sensors

基于分布式飞行时间传感器的连续机器人定位

Spencer Teetaert, Giammarco Caroleo, Marco Pontin, Sven Lilge, Jessica Burgner-Kahrs, Timothy D. Barfoot, Perla Maiolino

机构 * University of Toronto Robotics Institute, Canada(多伦多大学机器人研究所,加拿大) Oxford Robotics Institute, University of Oxford, UK(牛津大学机器人研究所,英国) Toronto Metropolitan University, Canada(多伦多 Metropolitan 大学,加拿大)

专题命中 具身导航 :robotics(abstract,comments);分类 cs.RO

AI总结 本文提出了一种利用小型低分辨率飞行时间传感器进行连续机器人定位的方法,通过融合传感器数据与机器人形状先验信息,实现了在复杂环境中高精度的定位与建图。

Comments Print version, to be published at Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10880 2026-05-12 cs.RO 57%

Safe Aerial 3D Path Planning for Autonomous UAVs using Magnetic Potential Fields

基于磁势场的自主无人机安全三维路径规划

Haechan Mark Bong, Giovanni Beltrame

机构 * Department of Computer Engineering and Software Engineering, Polytechnique Montréal(蒙特利尔理工学院计算机工程与软件工程系) MILA(蒙特利尔人工智能实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出3DMaxConvNet,通过卷积自编码器从LiDAR点云生成障碍物感知的磁势场,实现高效安全的三维路径规划,在不同城市环境中均取得100%成功率,且运行速度显著优于A*和RRT*(3k)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11969 2026-05-12 cs.CV 57%

AstroSplat: Physics-Based Gaussian Splatting for Rendering and Reconstruction of Small Celestial Bodies

AstroSplat:基于物理的高斯散射用于小天体的渲染与重建

Jennifer Nolan, Travis Driver, John Christian

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出AstroSplat,一种基于物理的高斯散射框架,利用行星反射模型提升小天体表面的自主重建和光谱特性分析,通过NASA Dawn任务的真实图像验证了其在渲染性能和表面重建精度上的优势。

Comments 10 pages, 6 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10064 2026-05-12 cs.AI 57%

MAGE: Multi-Agent Self-Evolution with Co-Evolutionary Knowledge Graphs

MAGE:多智能体自进化与共进化知识图谱

Ruiyi Yang, Zechen Li, Hao Xue, Imran Razzak, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 MAGE通过共进化知识图谱实现多智能体自进化,利用冻结弱骨干模型与任务级搜索带宽及技能级路由带宽协同更新,提升冻结学习者在多个领域任务中的表现。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09342 2026-05-12 cs.MA cs.LG 57%

A Cross-Layered Multi-Drone Coordination for Medical Supply Delivery during Disaster Response Management

跨层多无人机协调用于灾难响应管理中的医疗物资配送

Aneesh Calyam, Subrahmanya Chandra Bhamidipati, Zack Murry, Sharan Srinivas

机构 * University of Missouri--Columbia(密苏里大学哥伦比亚分校)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 本文提出CEDA算法,通过联合优化优先级路由、多智能体协调和节能导航,解决灾难响应中医疗物资配送的动态不确定性问题,实现公平且高效的患者服务。

Comments 18 pages, 14 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05516 2026-05-12 cs.RO 57%

EROAS: 3D Efficient Reactive Obstacle Avoidance System for Autonomous Underwater Vehicles using 2.5D Forward-Looking Sonar

EROAS: 3D高效反应性障碍物避障系统:利用2.5D前视声呐的自主水下车辆

Pruthviraj Mane, Allen Jacob George, Rajini Makam, Subhash Gurikar, Rudrashis Majumder, Suresh Sundaram

机构 * Department of Aerospace Eng.(航空航天工程系) Indian Institute of Science(印度科学研究所) Department of Electrical and Electronics Eng.(电子与电气工程系) Birla Institute of Technology and Science(比拉理工学院) Department of Computer Science and Eng.(计算机科学与工程系) Shiv Nadar University(施瓦纳大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出EROAS系统,通过结合2.5D前视声呐与三种模块,实现高效、安全的3D水下障碍物避障,实验验证其在复杂环境中的优势。

Comments Accepted for publication as a Technical Communication, Special Issue on AUV Symposium in the IEEE Journal of Oceanic Engineering (JOE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08952 2026-05-12 cs.CV 57%

FugSeg: Fast Uncertainty-aware Ground Segmentation for 3D Point Cloud

FugSeg:面向3D点云的快速不确定性感知地面分割

Yu Li, Volker Schwieger

机构 * Institute of Engineering Geodesy, University of Stuttgart(斯图加特大学工程大地测量研究所) Daimler Truck AG(戴姆勒卡车公司)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出FugSeg,一种快速且考虑不确定性的地面分割方法,通过极坐标网格地图表示和自适应坡度策略,有效处理反射噪声和孤立地面问题,在多个数据集上实现最高精度和最快速度。

Comments Accepted for publication in IEEE Transactions on Intelligent Transportation Systems

Journal ref IEEE Transactions on Intelligent Transportation Systems (Early Access), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08937 2026-05-12 cs.RO 57%

Raymoval: Raycasting-based Dynamic Object Removal for Static 3D Mapping

Raymoval: 基于射线投射的动态物体移除用于静态3D映射

Daebeom Kim, Seungjae Lee, Seoyeon Jang, Kevin Christiansen Marsim, Hyun Myung

机构 * School of Electrical Engineering, KAIST (Korea Advanced Institute of Science and Technology)(电气工程学院,韩国科学技术院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出基于射线投射的动态物体移除方法,通过射线投射和一致性测试提升静态3D映射的精度与一致性。

Comments 12 pages, 5 figures, 3 tables, Presented at RiTA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08592 2026-05-12 cs.CV 57%

Cross-Modal RGB-D Fusion Transformer for 6D Pose Estimation of Non-Cooperative Spacecraft with Stereo-Derived Depth

用于非合作航天器6D位姿估计的跨模态RGB-D融合Transformer

Yongliang Zhen, Bo LÜ, Hang Yang, Xiaotian WU

机构 * School of Physics, Northeast Normal University(东北师范大学物理学院) Changchun Institute of Optics, Fine Mechanics and Physics, Chinese Academy of Science(长春光学精密机械与物理研究所)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出基于被动立体视觉的6D位姿估计方法,通过TSCA-Stereo网络处理空间图像中的弱纹理和强光问题,并结合跨模态Transformer融合RGB和立体深度信息,实现高精度位姿估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08406 2026-05-12 cs.CL cs.AI 57%

Effective Explanations Support Planning Under Uncertainty

有效解释支持在不确定性下的规划

Hanqi Zhou, Britt Besch, Charley M. Wu, Tobias Gerstenberg

机构 * University of Tübingen(图宾根大学) Technical University Darmstadt(达姆施塔特技术大学) Max Planck Institute for Biological Cybernetics(生物 cybernetics 最大平面研究所) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文提出一种计算模型,将解释转化为行动计划,通过大规模语言模型生成策略先验和价值图,结合规划代理在部分可观测条件下执行,验证了高质量解释能提升导航效率。

Comments CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11630 2026-05-12 physics.optics 50%

Attosecond-level synchronisation of chip-integrated oscillators

芯片集成振荡器的亚秒级同步

Alexander E. Ulanov, Bastian Ruhnke, Theia El Sharkawy, Thibault Wildi, Kemal Şafak, Franz Kärtner, Tobias Herr

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种基于微谐振器孤子振荡器的亚秒级同步方法,利用光纤传输的连续波激光作为双音定时参考,实现25或300GHz脉冲重复率下的高精度同步,适用于大规模设施、数据中心等场景。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07174 2026-05-12 physics.flu-dyn 50%

Spatial dynamics of flexible nano-swimmers under a rotating magnetic field

柔性纳米游泳者在旋转磁场下的空间动力学

Zvi Chapnik, Yizhar Or

专题命中 具身导航 :robotic(abstract)

AI总结 本文研究了柔性纳米游泳者在旋转磁场下的运动特性,通过建立两连杆模型,分析其非线性动力学方程,并获得同步运动的解析解及稳定性分析,为生物医学应用提供理论支持。

Journal ref Physical Review E 113.5 (2026): 055103

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10976 2026-05-12 q-bio.NC 50%

The Homological Brain: Parity Principle and Amortized Inference

同调大脑:奇偶原理与 amortized 推理

Xin Li

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出同调大脑框架,通过奇偶原理将稳定内容与动态上下文分离,利用拓扑结构转换实现低复杂度导航,统一了唤醒-睡眠循环、记忆-语义巩固和双过程理论。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 20 篇

2605.08279 2026-05-12 cs.LG cs.AI 86%

LaWM: Least Action World Models for Long-Horizon Physical Consistency from Visual Observations

LaWM:基于视觉观测的最短作用世界模型用于长时间物理一致性

Qixin Xiao, Maani Ghaffari

机构 * University of Michigan(密歇根大学)

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 LaWM通过在视觉潜在空间中实现最小作用原理,提升长horizon视觉预测的物理一致性,改进了物理不变性、背景一致性、运动平滑度和外观几何预测指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10806 2026-05-12 cs.CV cs.AI cs.LG 82%

PhyGround: Benchmarking Physical Reasoning in Generative World Models

PhyGround:用于生成世界模型中物理推理的基准测试

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。

Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10858 2026-05-12 cs.CV cs.RO 81%

Is Your Driving World Model an All-Around Player?

你的驾驶世界模型是全能选手吗?

Lingdong Kong, Ao Liang, Tianyi Yan, Hongsi Liu, Wesley Yang, Ziqi Huang, Xian Sun, Wei Yin, Jialong Zuo, Yixuan Hu, Dekai Zhu, Dongyue Lu, Youquan Liu, Guangfeng Jiang, Linfeng Li, Xiangtai Li, Long Zhuo, Lai Xing Ng, Benoit R. Cottereau, Changxin Gao, Liang Pan, Wei Tsang Ooi, Ziwei Liu

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出WorldLens基准测试,评估驾驶世界模型在视觉和行为真实性方面的综合表现,揭示现有模型在不同维度上的不足,并引入WorldLens-26K和WorldLens-Agent提升评估的可解释性。

Comments CVPR 2026 VideoWorldModel Workshop; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10564 2026-05-12 cs.CV cs.RO 81%

DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving

DeepSight: 通过潜在状态预测实现长视距世界建模的端到端自动驾驶

Lingjun Zhang, Changjie Wu, Linzhe Shi, Jiangyang Li, Jiaxin Liu, Lei Yang, Hang Zhang, Mu Xu, Hong Wang

机构 * Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团Amap) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过鸟瞰图空间预测连续未来帧的潜在语义特征,实现长视距世界建模,并引入高效适应性文本推理机制提升复杂场景下的驾驶性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11537 2026-05-12 cs.LG cs.AI 81%

Simulus: Combining Improvements in Sample-Efficient World Model Agents

Simulus:结合高效样本世界模型代理的改进

Lior Cohen, Kaixin Wang, Bingyi Kang, Uri Gadot, Shie Mannor

机构 * Technion(技术ion大学) Microsoft Research(微软研究院) ByteDance Seed(字节跳动种子实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Simulus,一种模块化的基于标记的世界模型代理,通过整合灵活的标记化框架、内在动机、优先世界模型回放和回归-分类方法,提升了样本效率,适用于多个基准测试。

Comments Revised version: updated title, abstract, and framing to better reflect our contributions and situate the work within the literature

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09241 2026-05-12 cs.LG cs.AI 81%

Sub-JEPA: Subspace Gaussian Regularization for Stable End-to-End World Models

Sub-JEPA:子空间高斯正则化用于稳定的端到端世界模型

Kai Zhao, Dongliang Nie, Yuchen Lin, Zhehan Luo, Yixiao Gu, Deng-Ping Fan, Dan Zeng

机构 * Shanghai University(上海大学) The University of Manchester(曼彻斯特大学) Nankai University(南开大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 Sub-JEPA通过在多个随机子空间中应用高斯约束,缓解了JEPA训练中的偏差-方差权衡问题,提升了训练稳定性与表示灵活性,实验显示其在连续控制环境中优于LeWM。

Comments https://github.com/intcomp/Sub-JEPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08954 2026-05-12 cs.LG cs.AI 81%

MolWorld: Molecule World Models for Actionable Molecular Optimization

MolWorld: 用于可操作分子优化的分子世界模型

Yang Qiao, Bo Pan, Hao-Wei Pang, Peter Zhiping Zhang, Liying Zhang, Liang Zhao

机构 * Emory University(埃默里大学) Merck & Co., Inc.(默克公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 MolWorld通过分子转移图的序列扩展实现可操作分子优化,通过学习世界模型增强分子结构连接性,提升分子设计的可行性和连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08578 2026-05-12 cs.LG cs.AI 81%

Probing the Impact of Scale on Data-Efficient, Generalist Transformer World Models for Atari

探测数据高效、通用型Transformer世界模型在Atari上的尺度影响

Jooyeon Kim

机构 * Graduate School of Artificial Intelligence(人工智能研究生院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过最小化Transformer世界模型分析Atari 100k基准的缩放行为,发现环境存在不同的缩放区域,联合训练可稳定缩放动态并提升下游控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09886 2026-05-12 cs.RO 79%

Network-Efficient World Model Token Streaming

网络高效的世界模型令牌流

Shatadal Mishra, Ahmadreza Moradipari, Nejib Ammar

机构 * InfoTech Labs, Toyota Motor North America R\&D, Mountain View, CA, USA

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 本文研究了在分布式计算和连接车辆中高效传输离散世界模型状态的方法,提出了一种自适应算法,通过余弦距离优先更新令牌并触发关键帧,从而在带宽受限环境下提升同步效率和下游令牌动态的实用性。

Comments Accepted at IEEE VNC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09701 2026-05-12 cs.CV 79%

DriveFuture: Future-Aware Latent World Models for Autonomous Driving

DriveFuture: 用于自动驾驶的面向未来的潜在世界模型

Yufeng Hong, Xiaotian Zhou, Yingyan Li, Xiangpo Zhou, Lin Liu, Yadan Luo, Shaoqing Xu, Lei Yang, Ziying Song

机构 * Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航) Beijing Jiaotong University(北京交通大学) The University of Queensland(昆士兰大学) University of Macau(澳门大学) Nanyang Technological University(南洋理工大学) School of Artificial Intelligence ( School of Software), Yanshan University(燕山大学人工智能学院(软件学院))

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出DriveFuture,一种面向未来的潜在世界建模框架,通过将未来世界状态条件化于当前潜在状态建模过程,提升自动驾驶轨迹规划性能。

Comments 24pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09131 2026-05-12 cs.AI cs.MA 79%

MCP-Cosmos: World Model-Augmented Agents for Complex Task Execution in MCP Environments

MCP-Cosmos:用于MCP环境复杂任务执行的世界模型增强型智能体

Giridhar Ganapavarapu, Dhaval Patel

机构 * IBM

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 MCP-Cosmos融合世界模型与MCP框架,通过引入生成世界模型提升智能体在复杂任务中的执行能力,实验显示其在工具成功率和参数准确性等方面有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08808 2026-05-12 cs.CV cs.AI cs.LG 75%

Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding

曲率感知的描述生成:利用测地注意力实现3D场景理解

Ziyao He, Yingjie Liu, ZhangYangRui, Mingsong Chen, Xuan Tang, Xian Wei

机构 * East China Normal University(东华大学)

专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出曲率感知描述生成框架,通过非欧几里得测地注意力机制解决定位与上下文化冲突,提升3D场景描述的精度与连贯性。

Comments CVPR2026 Highlight!

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09693 2026-05-12 cs.CV cs.AI cs.LG 67%

Do multimodal models imagine electric sheep?

多模态模型是否想象出电羊?

Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes, Philipp Krähenbühl, Vladlen Koltun

机构 * Apple(苹果公司)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 研究发现多模态模型在解决空间谜题时会形成心理图像,通过微调Qwen3.5 VLM解决多种视觉推理任务,发现动作序列预测能提升解谜准确率,尤其在需要空间推理的任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09790 2026-05-12 cs.DC cs.AI cs.LG 62%

Multi-Tier Labeling and Physics-Informed Learning for Orbital Anomaly Detection at Scale

多层级标签与物理引导学习用于大规模轨道异常检测

Yong Fu

机构 * Substratum Labs, Inc(Substring实验室)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多层级标签方法,结合物理规则、IMM-UKF和补充元素校准,实现大规模轨道异常检测,通过Transformer模型提升召回率,探讨神经ODE在轨道世界模型中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏