arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2512.08323 2026-04-29 cs.CV 50%

Detecting Dental Landmarks from Intraoral 3D Scans: the 3DTeethLand challenge

从口内3D扫描中检测牙齿标志:3DTeethLand挑战

Achraf Ben-Hamadou, Nour Neifar, Ahmed Rekik, Oussama Smaoui, Firas Bouzguenda, Sergi Pujades, Niels van Nistelrooij, Shankeeth Vinayahalingam, Kaibo Shi, Hairong Jin, Youyi Zheng, Tibor Kubík, Oldřich Kodym, Petr Šilling, Kateřina Trávníčková, Tomáš Mojžiš, Jan Matula, Jeffry Hartanto, Xiaoying Zhu, Kim-Ngan Nguyen, Tudor Dascalu, Huikai Wu, and Weijie Liu, Shaojie Zhuang, Guangshun Wei, Yuanfeng Zhou

机构 * Department of Oral Maxillofacial Surgery, Radboud University Medical Center, Geert Grooteplein Zuid 10, 6525 GA Nijmegen, Netherlands organization= State Key Lab of CAD\&CG, Zhejiang University, Hangzhou, 310058 , country= China organization= Department of Computer Graphics Multimedia, Brno University of Technology , city= Brno , country= Czech Republic text= National Dental Centre Singapore organization= Guangxi Colleges Universities Key Laboratory of Intelligent Software ,country= Wuzhou University text= National University of Singapore organization= Department of Computer Science , country = University of Copenhagen organization= School of Software, Shandong University , country= China Centre de Recherche en Num\' e rique de Sfax, Laboratory of Signals, Systems, Artificial Intelligence Inria, Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK, France

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出3DTeethLand挑战,通过公开数据集评估牙齿标志检测算法,推动临床应用。挑战引入340个口内3D扫描数据,49支队伍参与,最终6支进入决赛,展示高精度与召回率的平衡方法。

Comments MICCAI 2024, 3DTeethLand, Challenge report, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12971 2026-04-28 cs.RO 50%

INHerit-SG: Incremental Hierarchical Semantic Scene Graphs with RAG-Style Retrieval

INHerit-SG:增量式层次语义场景图与RAG风格检索

YukTungSamuel Fang, Zhikang Shi, Jiabin Qiu, Zixuan Chen, Jieqi Shi, Hao Xu, Jing Huo, Yang Gao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Beihang University(北京航空航天大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出INHerit-SG,通过异步双流架构构建RAG-ready知识库,解决复杂嵌入查询与持续语义图构建问题,实验表明在复杂查询中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22519 2026-04-27 cs.RO 50%

Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding

通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型

Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le

机构 * University of Arkansas(阿拉巴马大学) National University of Singapore(新加坡国立大学) TU Wien(维也纳技术大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) University of Stuttgart(斯图加特大学) University of Liverpool(利物浦大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。

Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20841 2026-04-23 cs.CV 50%

DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation

DeVI:基于物理的灵巧人-物体交互通过合成视频模仿

Hyeonwoo Kim, Jeonghwan Kim, Kyungwon Cho, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 DeVI通过合成视频模仿实现基于物理的灵巧人-物体交互,结合3D人体跟踪与鲁棒2D物体跟踪,提升对未知目标物体的控制能力,优于现有方法。

Comments Project Page: https://snuvclab.github.io/devi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19034 2026-04-22 cs.CV 50%

Explore Like Humans: Autonomous Exploration with Online SG-Memo Construction for Embodied Agents

像人类一样探索:面向具身智能体的在线SG-Memo构建自主探索

Xu Chen, Shichao Xie, Zhining Gu, Lu Jia, Minghua Luo, Fei Liu, Zedong Chu, Yanfen Shen, Xiaolong Wu, Mu Xu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出ABot-Explorer框架,通过在线RGB-only过程统一记忆构建与探索,利用VLMs提取语义导航 affordances,生成结构化SG-Memo以提升探索效率和环境覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18623 2026-04-22 cs.CV 50%

Can We Build Scene Graphs, Not Classify Them? FlowSG: Progressive Image-Conditioned Scene Graph Generation with Flow Matching

我们能否构建场景图,而不是分类它们?FlowSG:基于流匹配的渐进式图像条件场景图生成

Xin Hu, Ke Qin, Wen Yin, Yuan-Fang Li, Ming Li, Tao He

机构 * The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室) Tianfu Jiangxi Laboratory(天斧江西实验室) Monash University(墨尔本大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出FlowSG,将场景图生成视为连续时间传输任务,通过约束感知细化生成图像条件场景图,结合几何与语义,提升场景图生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20530 2026-04-22 cs.RO cs.CV 50%

Memory Over Maps: 3D Object Localization Without Reconstruction

记忆超越映射:无需重建的3D物体定位

Rui Zhou, Xander Yap, Jianwen Cao, Allison Lau, Boyang Sun, Marc Pollefeys

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Microsoft(微软)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出无需重建的3D物体定位方法,通过轻量级视觉记忆实现快速场景索引,显著降低预处理成本,验证了基于图像的场景记忆可替代密集3D重建。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18260 2026-04-21 cs.CV 50%

Geometry-Guided 3D Visual Token Pruning for Video-Language Models

基于几何的3D视觉标记修剪用于视频-语言模型

Han Li, Zehao Huang, Jiahui Fu, Naiyan Wang, Si Liu

机构 * Beihang University(北京航空航天大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17888 2026-04-21 cs.RO 50%

SpaceDex: Generalizable Dexterous Grasping in Tiered Workspaces

SpaceDex:在分层工作空间中的通用灵巧抓取

Wensheng Wang, Chuanjun Guo, Wei Wei, Tong Wu, Ning Tan

机构 * Sun Yat-sen University(中山大学) Stellarobot Company(Stellarobot公司)

专题命中 视觉空间推理 :planning(abstract)

AI总结 SpaceDex提出了一种分层框架,通过视觉-语言模型规划和臂手特征分离网络,提升在受限3D环境中的灵巧抓取性能,实现在100次真实测试中达到63%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17887 2026-04-21 cs.RO 50%

StableIDM: Stabilizing Inverse Dynamics Model against Manipulator Truncation via Spatio-Temporal Refinement

StableIDM:通过时空细化稳定逆动力学模型以对抗机械臂截断

Kerui Li, Zhe Jing, Xiaofeng Wang, Zheng Zhu, Yukun Zhou, Guan Huang, Dongze Li, Qingkai Yang, Huaibo Huang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所GigaAI研究院) Beijing Institute of Technology(北京理工大学) GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出StableIDM,通过时空细化框架提升逆动力学模型在机械臂截断场景下的稳定性,实验表明其在动作准确性和任务成功率上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17422 2026-04-21 cs.CV cs.MM 50%

Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

聚焦何处:用于长视频理解的查询调节多模态关键帧选择

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Xuming Hu, Hui Xiong

机构 * Department of CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Q-Gate框架,通过动态模态路由解决长视频理解中关键帧选择问题,有效抑制模态噪声,提升多模态大语言模型的推理能力。

Comments 9 pages, 7 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02908 2026-04-21 cs.CV cs.HC cs.MM 50%

SentiAvatar: Towards Expressive and Interactive Digital Humans

SentiAvatar:迈向表达性和互动性的数字人类

Chuhao Jin, Rui Zhang, Qingzhe Gao, Haoyu Shi, Dayu Wu, Yichen Jiang, Yihan Wu, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) SentiPulse College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出SentiAvatar框架,通过构建SuSu虚拟角色,解决多模态数据不足、语义到动作映射和动作语调同步问题,实现高精度实时交互。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11988 2026-04-21 cs.CV 50%

CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction

CARI4D:类别无关的人-物体交互4D重建

Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll, Stan Birchfield

机构 * NVIDIA University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 CARI4D提出了一种无需假设物体类别即可从单目RGB视频中重建人-物体交互的4D模型,通过姿态假设选择算法和渲染-比较方法提升重建精度与物理一致性。

Comments CVPR2026 camera ready version. Project page: https://nvlabs.github.io/CARI4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00592 2026-04-21 cs.RO 50%

HAVEN: Hierarchical Adversary-aware Visibility-Enabled Navigation with Cover Utilization using Deep Transformer Q-Networks

HAVEN:基于深度变换器Q网络的分层对抗感知可见性导航与覆盖利用

Mihir Chauhan, Damon Conover, Aniket Bera

机构 * IDEAS Lab, Department of Computer Science, Purdue University(IDEAS实验室,计算机科学系,普渡大学) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种分层导航框架,结合深度变换器Q网络作为高层子目标选择器和模块化低层控制器,通过可见性感知候选生成和潜在场控制器提升导航安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16248 2026-04-20 cs.CV 50%

Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization

视觉-语言模型在何处失效?面向图像地理定位的世界尺度分析

Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文评估了多种先进视觉-语言模型在国家层面图像地理定位中的表现,揭示了模型在粗粒度地理定位中的潜力及当前模型在细粒度地理线索捕捉上的局限。

Comments Accepted to the CVPR EarthVision 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15946 2026-04-20 cs.CV cs.RO 50%

SENSE: Stereo OpEN Vocabulary SEmantic Segmentation

SENSE:立体视图开放词汇语义分割

Thomas Campagnolo, Ezio Malis, Philippe Martinet, Gaétan Bahl

机构 * Centre Inria d’Universite Cote d’Azur, France(法国里莫纳大学信息科学研究中心) NXP Semiconductors, France(法国恩智科半导体公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SENSE,通过立体视觉与视觉语言模型提升开放词汇语义分割的精度,实验显示在PhraseStereo数据集上平均精度提升2.9%,并在Cityscapes和KITTI上取得更好的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15225 2026-04-17 cs.HC 50%

UrbanClipAtlas: A Visual Analytics Framework for Event and Scene Retrieval in Urban Videos

UrbanClipAtlas:面向城市视频中事件和场景检索的视觉分析框架

Joel Perca, Luis Sante, Juanpablo Heredia, Joao Rulff, Claudio Silva, Jorge Poco

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出UrbanClipAtlas框架,结合RAG、实体提取和视频定位技术,实现城市视频中事件和场景的高效检索与解释,通过知识图谱和增强聊天界面提升分析效率。

Comments 12 pages and 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22185 2026-04-17 cs.CV 50%

Beyond Augmentation: Cross-Modal Transformer Fusion with Bi-directional Attention for Low-Data Aneurysm Screening

超越增强:基于双向注意力的跨模态Transformer融合用于低数据动脉瘤筛查

Antara Titikhsha, Divyanshu Tak

机构 * Carnegie Mellon University(卡内基梅隆大学) Artificial Intelligence in Medicine (AIM) Program(医学人工智能(AIM)项目) Mass General Brigham(马萨诸塞总医院) Harvard Medical School(哈佛医学院) Department of Radiation Oncology(放射肿瘤科) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Brigham and Women’s Hospital(布里洛妇产科医院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出CMTF-Net,通过跨模态目标融合框架实现解剖结构化的动脉瘤筛查,采用14个血管区域独立监督,提升低数据场景下的检测精度与可解释性。

Comments We had major improvements in this second draft. Please refer to this version only

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11600 2026-04-17 cs.CV 50%

Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language

几何解析:一种统一形式语言用于平面和立体几何的图表解析

Peijie Wang, Ming-Liang Zhang, Jun Cao, Chao Deng, Dekang Ran, Hongda Sun, Pi Bu, Xuan Zhang, Yingyao Wang, Jun Song, Bo Zheng, Fei Yin, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种统一形式语言,结合平面和立体几何,构建了GDP-29K数据集,通过监督微调与可验证奖励的强化学习提升几何解析性能,提升MLLMs的几何推理能力。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03416 2026-04-17 cs.CV 50%

GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models

GAMBIT:一种用于多模态大语言模型的游戏化突破框架

Xiangdong Hu, Yangyang Jiang, Qin Hu, Xiaojun Jia

机构 * Georgia State University(佐治亚州立大学) Shandong University(山东大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GAMBIT框架,通过分解重组有害视觉语义并构建游戏化场景,使模型在探索和重建意图中主动完成突破,提升攻击成功率。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12358 2026-04-16 cs.CV 50%

Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding

为何及何时视觉标记修剪失效?对多模态大语言模型解码中相关视觉信息转移的研究

Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) NVIDIA

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究了视觉标记修剪在复杂视觉推理任务中的失效原因,提出解码阶段感知标记修剪方法,有效缓解了修剪方法在复杂推理任务中的性能下降。

Comments Preprint, Project : https://ptkjw1997.github.io/DSTP-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01773 2026-04-16 cs.RO 50%

IGen: Scalable Data Generation for Robot Learning from Open-World Images

IGen: 为机器人学习从开放世界图像中实现可扩展的数据生成

Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Beijing University of Chemical Technology(北京化工大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen University of Infomation Technology(深圳信息大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出IGen框架,通过开放世界图像生成高质量的视觉-运动数据,验证了其在机器人学习中的有效性。

Comments 8 pages, 8 figures; Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13708 2026-04-16 eess.SY cs.SY 50%

Homotopy-Guided Potential Games for Congestion-Aware Navigation

基于同调的势游戏用于拥堵感知导航

Mohammed Irshadh Ismaaeel Sathyamangalam Imran, Lasse Peters, Michael Khayyat, Stefano Arrigoni, Francesco Braghin, Laura Ferranti

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种结合同调方法和势游戏的多智能体路径规划框架,通过拓扑结构策略集和递推时间窗设置,提升导航效率与安全性,实验验证其在拥堵场景下的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10946 2026-04-16 cs.CV 50%

Abstract 3D Perception for Spatial Intelligence in Vision-Language Models

抽象3D感知用于视觉-语言模型中的空间智能

Yifan Liu, Fangneng Zhan, Kaichen Zhou, Yilun Du, Paul Pu Liang, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SandboxVLM框架,通过抽象边界框编码几何结构和物理动力学,提升视觉-语言模型在3D任务中的空间智能,实验证明其在零样本设置下显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16445 2026-04-16 cs.RO 50%

FiLM-Nav: Efficient and Generalizable Navigation via VLM Fine-tuning

FiLM-Nav:通过VLM微调实现高效且通用的导航

Naoki Yokoyama, Sehoon Ha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出FiLM-Nav,通过微调预训练VLM作为导航策略,直接利用视觉轨迹历史和导航目标进行探索决策,实现复杂环境中的高效导航与物体定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12966 2026-04-15 cs.CV 50%

Boosting Visual Instruction Tuning with Self-Supervised Guidance

通过自监督指导提升视觉指令微调

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

机构 * Sorbonne Universite, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎75005) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种轻量方法,通过加入少量视觉基础自监督任务提升MLLMs的视觉推理能力,无需人工标注或架构修改,有效提升视觉中心评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10992 2026-04-15 cs.CV 50%

ArtiCAD: Articulated CAD Assembly Design via Multi-Agent Code Generation

ArtiCAD: 通过多智能体代码生成实现可动CAD装配设计

Yuan Shui, Yandong Guan, Zhanwei Zhang, Juncheng Hu, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ArtiCAD通过多智能体系统从文本或图像生成可编辑的可动CAD装配,利用连接器定义连接点和关节参数,提升空间推理能力,通过验证步骤和回滚机制确保输出质量,验证了其在概念设计、物理原型和AI训练资产生成中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12486 2026-04-15 cs.RO 50%

DeCoNav: Dialog enhanced Long-Horizon Collaborative Vision-Language Navigation

DeCoNav:基于对话的长时程协作视觉语言导航

Sunyao Zhou, Yunzi Wu, Tianhang Wang, Xinhai Li, Guang Chen, Lizheng Liu, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI)) China Telecom Fudan University(中国电信复旦大学) Tongji University(同济大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 DeCoNav通过事件触发对话与动态任务分配实现多机器人协作,提升了多机器人系统的长时程协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11538 2026-04-14 cs.HC 50%

ResearchCube: Multi-Dimensional Trade-off Exploration for Research Ideation

ResearchCube: 多维权衡探索用于研究构想

Zijian Ding, Fenghai Li, Ziyi Wang, Joel Chan

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ResearchCube通过多维权衡谱帮助研究者探索和优化构想,提供三维空间交互,提升认知和控制感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10493 2026-04-14 cs.SE 50%

SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents

SWE-Shepherd:推进基于强化学习的代码代理的PRMs

Mahir Labib Dihan, Md Ashrafur Rahman Khan

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SWE-Shepherd框架,通过引入过程奖励模型为代码代理提供密集的步骤级监督,提升代码代理在大型代码库中的交互效率和动作质量。

Comments Code is available at https://github.com/mahirlabibdihan/swe-shepherd

详情

展开后加载摘要…

URL PDF HTML 收藏