arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2606.22749 2026-06-23 cs.CV 新提交 50%

RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation

RaysUp: 基于几何感知射线表示的超轻量通用特征上采样

Yuchuan Ding, Linfei Li, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出RaysUp,一种超轻量、任务无关且VFM无关的特征上采样框架,通过几何感知射线域重建高分辨率特征图,在多种密集预测任务上以16%参数和7倍加速实现最先进性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22168 2026-06-23 cs.CV 新提交 50%

From Convolution to Transformer: A Comparative Study of U-Net Variants for Brain Tumor and Retinal Vessel Segmentation

从卷积到Transformer:用于脑肿瘤和视网膜血管分割的U-Net变体比较研究

Khoa Pham, Sindhuja Penchala, Jiacheng Li, Andy Perkins, Noorbakhsh Amiri Golilarz

机构 * Mississippi State University(密西西比州立大学) The University of Alabama(阿拉巴马大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 比较五种U-Net变体(U-Net 3D、Residual U-Net、Attention U-Net、UNETR、Swin UNETR)在脑肿瘤和视网膜血管分割任务上的性能,发现基于Transformer的Swin UNETR在全局上下文建模中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21398 2026-06-23 cs.RO 新提交 50%

BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation

BIT-Nav: 具身导航的脑启发轨迹记忆

Rithvik Jonna, Aakash Gurram, Man Namgung, Wyatt Mackey, Tinoosh Mohsenin

机构 * Johns Hopkins University(约翰霍普金斯大学) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出BIT-Nav框架,通过轻量级学习轨迹记忆增强冻结的视觉-语言模型导航,解决长序列中帧采样稀疏问题,以恒定token成本编码结构化运动历史。

Comments Accepted to CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21292 2026-06-23 cs.CV 新提交 50%

Lightweight 3D Feature Pretraining by Bayesian Inversion of 2D Foundation Models

轻量级3D特征预训练:基于2D基础模型的贝叶斯反演

Marwane Hariat, Gianni Franchi, David Filliat, Antoine Manzanera

机构 * U2IS, ENSTA – Institut Polytechnique de Paris, Palaiseau, France(U2IS,ENSTA – 巴黎综合理工学院,法国帕莱索) Pôle Recherche, Agence Ministérielle pour l’IA de Défense, Palaiseau, France(研究部,国防人工智能部级机构,法国帕莱索)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Casper3D,一种轻量级概率框架,通过贝叶斯反演将多视图2D基础模型嵌入转换为潜在3D语义表示,实现开放词汇3D理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20888 2026-06-23 cs.CV 新提交 50%

Fine-grained Human Motion Understanding with Language Models

基于语言模型的细粒度人体运动理解

Thomas Markhorst, Zhi-Yi Lin, Jouh Yeong Chew, Jan van Gemert, Xucong Zhang

机构 * Delft University of Technology(代尔夫特理工大学) Honda Research Institute Japan(日本本田研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出LLM模型\methodname,通过显式时间戳编码和多样化姿态/运动级监督,在多个基准上实现SOTA性能,且仅用2D骨骼输入即可超越3D方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19670 2026-06-23 physics.ins-det physics.data-an 新提交 50%

PiMiX 2.0: AI-enhanced Data Fusion for Radiographic Imaging and Tomography

PiMiX 2.0: 人工智能增强的放射成像与断层扫描数据融合

Zhehui Wang, Shanny Lin, Nicholas Amano, Susan S. Glenn, Ramya Gurunathan, Katie Liu, Nathan E. Peterson, Michelle A. Espy, Adam Thompson, Amy J. Clarke, Ray T. Chen

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出AI增强的数据融合框架PiMiX 2.0,集成多实验多模态放射成像与断层扫描,支持自动数据摄取、3D/4D重建及物理感知解释,加速数据处理并提升可重复性。

Comments 9 pages, 4 figures, 1 table. Work presented in the 26th Topical Conference on High Temperature Plasma Diagnostics Conference, Cambridge, MA, USA (June 7 - 11, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08284 2026-06-23 cs.CV cs.RO 新提交 50%

G2G: Exploiting Intra-Group Geometry for Inter-Group Pose Estimation

G2G:利用组内几何进行组间姿态估计

Yufei Wei, Shuhao Ye, Chenxiao Hu, Yiyuan Pan, Dongyu Feng, Rong Xiong, Yue Wang, Yanmei Jiao

机构 * State Key Laboratory of Industrial Control and Technology, Zhejiang University(浙江大学工业控制技术国家重点实验室) Zhejiang Humanoid Robot Innovation Center Co., Ltd.(浙江人形机器人创新中心有限公司) School of Information Science and Engineering, Hangzhou Normal University(杭州师范大学信息科学与工程学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出G2G方法,通过冻结多视图基础模型并添加三个轻量可训练模块(感知器重采样器、跨组桥接模块和多帧姿态头),仅利用相对姿态监督实现组间6-DoF姿态估计,在四个数据集上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08787 2026-06-23 cs.CV 版本更新 50%

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

迷失于体积:CT-SpatialVQA基准用于评估3D医学视觉-语言模型的语义-空间理解

Mashrafi Monon, Umaima Rahman, Asif Hanif, Numan Saeed, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出CT-SpatialVQA基准,评估3D医学视觉-语言模型对3DCT数据的语义-空间理解能力,发现现有模型在语义-空间推理任务中表现不佳,需更深入整合体积证据以确保临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02303 2026-06-23 cond-mat.stat-mech 版本更新 50%

Half-ice, half-fire-driven ultranarrow phase crossover in one-dimensional decorated $q$-state Potts ferrimagnets: An AI-co-led exploration

半冰半火驱动的一维修饰$q$态Potts亚铁磁体中的超窄相交叉:一项AI共同主导的探索

Weiguo Yin

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究利用OpenAI的o3-mini-high模型精确解析了一维修饰$q$态Potts亚铁磁体,发现由隐藏的“半冰半火”态驱动的超窄相交叉在$q>2$时仍存在,并揭示了$q>2$时的独特特征,为低维系统中受控快速状态翻转开关的设计提供了通用框架。

Comments The version accepted for publication, with refined introduction and Appendix A. 9 pages, 7 figures. A sequel to arXiv:2502.11270 and arXiv:2503.23758, a precursor to arXiv:2511.06442. The code and data that support the findings of this article are openly available at https://community.wolfram.com/groups/-/m/t/3489942

Journal ref APS Open Sci. 1, 000047 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16000 2026-06-23 cs.CV 版本更新 50%

SenseExpo: Spatial Exploration and Navigation via Scene Estimation from Expeditious Predictive Operators

SenseExpo: 通过快速预测算子的场景估计进行空间探索与导航

Haojia Gao, Haohua Que, Mingkai Liu, Jiayue Xie, Hoiian Au, Yusen Qin, Qian Zhang, Jiajun Sun, Weihao Shan, Tianle Zhu, Handong Yao, Fei Qiao

机构 * Tsinghua University(清华大学) University of Georgia(佐治亚大学) Peking University(北京大学) D-Robotics(D-机器人) Infinity Robotics(Infinity机器人)

专题命中 视觉空间推理 :planning(abstract)

AI总结 提出轻量级单机器人探索框架SenseExpo,结合紧凑地图预测网络与前沿策略,以709K参数实现优于U-Net和LaMa的预测性能,并在探索实验中显著加速目标覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19383 2026-06-19 cs.RO cs.CV 新提交 50%

3D Scene Graphs: Open Challenges and Future Directions

3D场景图:开放挑战与未来方向

Dennis Rotondi, Francesco Argenziano, Sebastian Koch, Nathan Hughes, Martin Buechner, Johanna Wald, Lukas Rosenberger Schmid, Daniele Nardi, Abhinav Valada, Liam Paull, Federico Tombari, Luca Carlone, Kai O. Arras

机构 * University of Stuttgart(斯图加特大学) IMPRS-IS(马克斯·普朗克研究所-智能系统) Sapienza University of Rome(罗马萨皮恩扎大学) Google(谷歌) MIT(麻省理工学院) University of Freiburg(弗赖堡大学) UTN University of Montreal(蒙特利尔大学UTN分校) Mila TU Munich(慕尼黑技术大学Mila)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文统一综述3D场景图(3DSG)的构建、应用与评估,分析现有建模选择与开放挑战,旨在推动鲁棒部署。

Comments Invited article for the Annual Review of Control, Robotics, and Autonomous Systems Volume 10

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21804 2026-06-19 physics.ins-det hep-ex hep-ph 版本更新 50%

Agentic-AI Detector Co-design and Optimization in Vertically-Integrated Differentiable Full Simulations

Agentic-AI探测器协同设计与优化在垂直集成可微分全模拟中

Wonyong Chung, Qibin Liu, Liangyu Wu, Julia Gonski

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出双层级优化框架,将AI智能体集成到高能物理探测器设计中,通过可微分全模拟联合优化几何、前端数字化和重建算法参数,在竞争性能指标下找到最优设计点。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18112 2026-06-19 cs.RO cs.CV 新提交 50%

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

Qwen-RobotNav 技术报告:为智能体导航系统设计的可扩展导航模型

Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Zhibo Yang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Haoyang Li, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, Xiong-Hui Chen

机构 * Qwen Team(通义实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 提出 Qwen-RobotNav 可扩展导航模型,通过参数化接口支持多种任务模式和可调观测参数,在15.6M样本上训练,联合视觉语言数据防止行为坍缩,在多个导航基准上取得新最优结果,并展示零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16849 2026-06-18 cs.NE cs.GR cs.HC 新提交 50%

Evolution & Foundation: AI Shares Creative Control

进化与基础模型:AI共享创意控制

Dylan Banarse, Stephen Todd, William Latham, Frederic Fol Leymarie

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出一种结合遗传算法与多模态AI基础模型的框架,实现自动化设计3D有机形态,将艺术家角色从直接选择转变为系统设计,加速创意探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17183 2026-06-17 cs.RO 新提交 50%

VL-MemKnG: Hybrid Memory with a Spatio-Temporal Knowledge Graph for Question Answering over Long Egocentric Navigation Trajectories

VL-MemKnG:结合时空知识图谱的混合记忆用于长程自我中心导航轨迹问答

Svetlana Lukina, Mohamad Al Mdfaa, Gloria Haro, Sergey Zagoruyko, Gonzalo Ferrer

机构 * Mobile Robotics Laboratory, Artificial Intelligence Center(移动机器人实验室,人工智能中心) Skoltech(斯科尔科沃科学技术学院) Intelligent Multimodal Vision Analysis Group, Department of Engineering, Universitat Pompeu Fabra(智能多模态视觉分析组,工程系,庞培法布拉大学) Independent Researcher(独立研究员)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出VL-MemKnG混合记忆框架,结合时空知识图谱与片段级上下文记忆,通过混合检索推理模块提升长程自我中心视频导航问答的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15777 2026-06-17 cs.CV 50%

Label tree semantic losses for rich multi-class medical image segmentation

用于丰富多类医学图像分割的标签树语义损失

Junwen Wang, Oscar MacCormac, William Rochford, Aaron Kujawa, Jonathan Shapey, Tom Vercauteren

机构 * School of Biomedical Engineering & Imaging Sciences(生物医学工程与成像科学学院) Department of Neurosurgery(神经外科部门)

专题命中 视觉空间推理 :planning(abstract)

AI总结 提出两种基于标签层次结构的树状语义损失函数,在脑MRI全监督分割和神经外科高光谱成像稀疏标注场景理解中取得一致改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09373 2026-06-17 cs.CV 版本更新 50%

FUSER: Feed-Forward MUltiview 3D Registration Transformer and SE(3)$^N$ Diffusion Refinement

FUSER: 前馈多视图3D配准Transformer与SE(3)^N扩散精化

Haobo Jiang, Jin Xie, Jian Yang, Liang Yu, Jianmin Zheng

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出FUSER,首个前馈多视图配准Transformer,在统一潜在空间中直接预测全局位姿,避免成对匹配;并引入SE(3)^N扩散精化框架FUSER-DF以校正估计。

Comments Accepted to CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15861 2026-06-16 cs.CV 新提交 50%

Object Tokens as a Bridge Between Segmentation and Visual Question Answering in Robotic Surgery

对象标记作为机器人手术中分割与视觉问答的桥梁

Yiping Li, Ronald de Jong, Romy van Jaarsveld, Franco Badaloni, Gino Kuiper, Jelle Ruurda, Josien Pluim, Marcel Breeuwer

机构 * Department of Biomedical Engineering, Eindhoven University of Technology(埃因霍温理工大学生物医学工程系) Department of Electrical Engineering, Eindhoven University of Technology(埃因霍温理工大学电气工程系) Department of Surgery, University Medical Center Utrecht(乌得勒支大学医学中心外科)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出统一框架,联合像素级分割与视觉问答,通过VLM生成对象标记引导答案预测和分割掩码,在RAMIE和EndoVis18数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15681 2026-06-16 cs.CV 新提交 50%

3D Consistency Optimization for Self-Supervised Monocular Video Depth Estimation

自监督单目视频深度估计的3D一致性优化

Yuanye Liu, Ke Zhang, Junzhe Jiang, Li Zhang, Vishal Patel, Xiahai Zhuang

机构 * Fudan University(复旦大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出一种将视频深度估计转化为多视图3D重建的框架,通过光度渲染、世界坐标对齐和多尺度时间梯度一致性约束,实现全局3D结构一致性,在自监督和零样本临床场景中达到最先进的空间精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15275 2026-06-16 cs.CV 新提交 50%

MamBOA: State-Space Architecture for Video Recognition

MamBOA:用于视频识别的状态空间架构

Mustafa Bora Çelik

机构 * Ankara Medipol University(安卡拉梅迪波尔大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出MamBOA框架,通过交错扫描结构将选择性状态空间递归(S6)作为运动合成器,从骨干网络提取的连续特征中编码运动,实现细粒度动作识别的高效时序建模。

Comments 15 pages, 7 figures. Codes available at [https://github.com/BOA-clk/MamBOA]

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04907 2026-06-16 cs.RO 版本更新 50%

WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation

WAM-Nav:面向统一视觉导航的非对称潜在世界-动作建模

Ning Yang, Yan Huang, Kaiwen Peng, Ziheng He, Kai Wang, Cui Miao, Kailin Lyu, Guo Li, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) FiveAges National University of Defense Technology(国防科技大学) Tsinghua University(清华大学) GigaAI

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出WAM-Nav,一种联合学习动作生成与潜在视觉预测的非对称扩散Transformer模型,通过共享扩散Transformer实现长时程动作与短时程视觉预测的联合扩散,并引入双流上下文条件机制和目标对齐模块,在统一策略下支持图像目标、点目标和无目标导航,在ClutterScenes和InternScenes基准上分别提升15.7%和3.3%的成功率,并在真实环境中实现85%的任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01621 2026-06-12 cs.CV cs.RO 版本更新 50%

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation

Goal2Pixel: 将目标锚定到像素以实现视觉语言导航

Muyi Bao, Yuxin Cai, Hang Xu, Zongtai Li, Jinxi He, Jingfan Tang, Chen Lv, Ji Zhang, Yaqi Xie, Wenshan Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Goal2Pixel范式,通过将连续环境中的视觉语言导航(VLN-CE)重新定义为可导航像素锚定,利用图像平面作为统一空间接口,预测可见导航像素并反投影为3D航点,结合可见性感知关键帧记忆和坐标感知辅助损失,在减少VLM调用次数的同时实现竞争性性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17221 2026-06-12 cs.CV cs.RO 版本更新 50%

QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy

QueryOcc:基于查询的3D语义占据自监督方法

Adam Lilja, Ji Lan, Junsheng Fu, Lars Hammarstrand

机构 * Chalmers University of Technology(查尔姆斯理工大学) Zenseact

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出QueryOcc,一种基于查询的自监督框架,通过相邻帧的4D时空查询直接学习连续3D语义占据,利用视觉基础模型或激光雷达数据提供监督,并引入收缩场景表示以在恒定内存下实现远程监督,在Occ3D-nuScenes基准上语义RayIoU提升26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05430 2026-06-12 cs.RO 版本更新 50%

Active Semantic Perception

主动语义感知

Huayi Tang, Pratik Chaudhari

机构 * General Robotics, Automation, Sensing and Perception (GRASP) Laboratory(通用机器人、自动化、传感与感知实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出一种基于紧凑多层场景图和大语言模型的主动语义感知方法,用于高效探索未知环境,在仿真和真实机器人上验证了优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12374 2026-06-11 cs.RO cs.CV 新提交 50%

Semantically-Aware Diver Activity Recognition Framework for Effective Underwater Multi-Human-Robot Collaboration

语义感知的潜水员活动识别框架用于有效的水下多人类-机器人协作

Sadman Sakib Enan, Junaed Sattar

机构 * University of Minnesota(明尼苏达大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出DAR-Net框架,结合Transformer时间推理与像素级场景监督,通过多损失训练对齐全局活动识别与局部人机交互语义,解决低可见度水下环境中的潜水员活动识别问题,并发布首个水下潜水员活动数据集UDA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10478 2026-06-10 cs.CV 新提交 50%

3D-CoS: A New 3D Reconstruction Paradigm Based on VLM Code Synthesis

3D-CoS:基于VLM代码合成的新型3D重建范式

Yuhao Wang, Puyi Wang, Linjie Li, Zhengyuan Yang, Kevin Qinghong Lin, Yu Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Microsoft(微软) University of Oxford(牛津大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 提出3D代码合成(3D-CoS)范式,将3D资产表示为可执行的Blender代码,利用VLM进行程序化重建,实现高可控性和局部编辑能力。

Comments Preprint. 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10468 2026-06-10 cs.CV 新提交 50%

Geometric Coastline Localization using Vision-Language Models

基于视觉语言模型的海岸线几何定位

Rafia Malik, Bernhard Pfahringer, Karin Bryan, Mark Dickson, Eibe Frank

机构 * The University of Waikato(怀卡托大学) The University of Auckland(奥克兰大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出将海岸线提取视为几何边界定位任务,基于GeoChat-7B/LLaVA-1.5架构构建CoastlineVLM-7B模型,直接预测折线而非分割掩码,在几何指标上优于传统分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18765 2026-06-10 cs.RO 版本更新 50%

Goal-oriented Communication for Fast and Robust Robotic Fault Detection and Recovery

面向快速鲁棒机器人故障检测与恢复的目标导向通信

Shutong Chen, Adnan Aijaz, Yansha Deng

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) Bristol Research and Innovation Laboratory, Toshiba Europe Ltd.(托bsd欧洲有限公司布里斯托尔研究与创新实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出目标导向通信框架,通过联合设计通信-计算-控制回路,利用3D场景图检测故障,并微调小语言模型结合知识蒸馏生成恢复动作,实现故障检测与恢复时间降低82.6%,任务成功率提升76%。

Comments Submit to IEEE for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09314 2026-06-09 cs.RO 新提交 50%

KPGrasp: Scalable Keypoint Flow Matching for Dexterous Grasp Generation

KPGrasp: 可扩展的关键点流匹配用于灵巧抓取生成

Yuansen Huang, Jiayi Chen, Haoran Liu, Yubin Ke, Bing Han, Jiangran Lyu, Mi Yan, Li Yi, He Wang

机构 * Peking University(北京大学) Galbot Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出KPGrasp框架,通过全欧几里得手部关键点参数化和Transformer流模型,从大规模数据学习灵巧抓取先验,无需接触损失或测试时优化,在模拟和真实场景中实现高成功率与低穿透深度。

Comments 14 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08688 2026-06-09 cs.RO cs.CV 新提交 50%

PhysAgent: Automating Physics-Based 4D Synthesis via Trajectory-Grounded Multi-Agent Feedback

PhysAgent: 通过轨迹驱动的多智能体反馈实现基于物理的4D合成自动化

Chunji Lv, Jiaxi Ye, Yuchen Jiang, Rexar Lin, Changsheng Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出PhysAgent,首个模拟器在环的多智能体框架,通过解耦材料与外力、利用视觉基础模型提取轨迹并借助LLM常识推理,实现自动化、物理可信的4D运动合成,显著提升生成多样性与物理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏