arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2512.21284 2026-03-24 cs.CV 50%

Toward Real-Time Surgical Scene Segmentation via a Spike-Driven Video Transformer with Spike-Informed Pretraining

迈向实时手术场景分割的脉冲驱动视频变换器及其基于脉冲的预训练

Shihao Zou, Jingjing Li, Wei Ji, Jincai Huang, Kai Wang, Guo Dan, Weixin Si, Yi Pan

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Alberta(阿尔伯塔大学) School of Medicine, Yale University(耶鲁大学医学院) Southern University of Science and Technology(南方科技大学) Nanfang Hospital Southern Medical University(南方医科大学南华医院) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院) Faculty of Computer Science and Control Engineering, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机科学与控制工程学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SpikeSurgSeg,一种基于脉冲驱动的视频变换器,用于手术场景分割。通过引入基于MAE的脉冲感知预训练策略和多谱知识蒸馏,提升模型在数据稀缺场景下的性能,同时减少推理延迟并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08935 2026-03-24 cs.RO cs.CV 50%

Expand Your SCOPE: Semantic Cognition over Potential-Based Exploration for Embodied Visual Navigation

拓展你的SCOPE:基于潜在探索的语义认知用于具身视觉导航

Ningnan Wang, Weihuang Chen, Liming Chen, Haoxuan Ji, Zhongyu Guo, Xuchong Zhang, Hongbin Sun

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出SCOPE框架,通过利用前沿信息驱动潜在探索,提升具身视觉导航中的决策质量与目标相关性,实验表明其在准确性和泛化能力上优于现有方法。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20310 2026-03-24 cs.CV cs.GR 50%

GraphiContact: Pose-aware Human-Scene Robust Contact Perception for Interactive Systems

GraphiContact: 人体-场景鲁棒接触感知用于交互系统

Xiaojian Lin, Yaomin Shen, Junyuan Ma, Yujie Sun, Chengqing Bu, Wenxin Zhang, Zongzheng Zhang, Hao Fei, Lei Jin, Hao Zhao

机构 * Tsinghua University, China(清华大学, 中国) XR System Application Research Center, Nanchang Research Institute, Zhejiang University, China(浙江大学南昌研究院XR系统应用研究中心, 中国) Beijing University of Posts and Telecommunications, China(北京邮电大学, 中国) University of Chinese Academy of Sciences, China(中国科学院大学, 中国) National University of Singapore, Singapore(新加坡国立大学, 新加坡)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GraphiContact框架,结合单图像3D人体网格重建,利用重建的体几何结构进行接触推理,通过引入SIMU训练策略提升鲁棒性,在五个基准数据集上实现了接触预测和3D人体重建的提升。

Comments 15 pages, 9 figures, Accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19203 2026-03-23 cs.CV 50%

Tinted Frames: Question Framing Blinds Vision-Language Models

着色边框:问题框架使视觉语言模型失明

Wan-Cyuan Fan, Jiayun Luo, Declan Kutscher, Leonid Sigal, Ritwik Gupta

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Vector Institute for AI(人工智能向量研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究视觉语言模型在不同问题框架下的注意力分配问题,发现框架影响其视觉输入处理,提出轻量级提示调优方法提升视觉感知能力。

Comments Preprint. Project page: https://davidhalladay.github.io/tinted_frames_demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18282 2026-03-23 cs.CV 50%

CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning

CycleCap: 通过自监督循环一致性微调提升VLMs的描述性能

Marios Krestenitis, Christos Tzelepis, Konstantinos Ioannidis, Stefanos Vrochidis, Ioannis Kompatsiaris, Georgios Tzimiropoulos, Shaogang Gong, Ioannis Patras

机构 * Queen Mary, University of London(伦敦大学玛丽女王学院) Centre for Research and Technology Hellas(希腊研究中心) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出CycleCap,通过自监督循环一致性训练提升VLMs的图像描述性能,利用GRPO优化策略,基于重建图像与原始图像相似性作为奖励信号,无需标注数据即可提高描述准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19481 2026-03-23 cs.CV 50%

Narrative Aligned Long Form Video Question Answering

叙事对齐的长视频问答

Rahul Jain, Keval Doshi, Burak Uzkent, Garin Kessler

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出NA-VQA基准,评估长视频中的深度时间与叙事推理能力,通过88部完整电影和4.4K开放性问题测试模型整合分散叙事信息的能力,提出Video-NaRA框架提升远距离推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19193 2026-03-20 cs.CV 50%

Reconstruction Matters: Learning Geometry-Aligned BEV Representation through 3D Gaussian Splatting

重建至关重要:通过3D高斯点云学习几何对齐的鸟瞰图表示

Yiren Lu, Xin Ye, Burhaneddin Yaman, Jingru Luo, Zhexiao Xiong, Liu Ren, Yu Yin

机构 * Bosch Research North America \& Bosch Center for Artificial Intelligence (BCAI) Case Western Reserve University Washington University in St. Louis

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Splat2BEV框架,通过3D高斯点云生成几何对齐的鸟瞰图特征,提升自动驾驶中的感知性能。

Comments Project page at https://vulab-ai.github.io/Splat2BEV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19053 2026-03-20 cs.CV cs.GR 50%

SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

SwiftTailor: 基于几何图像表示的高效3D服装生成

Phuc Pham, Uy Dieu Tran, Binh-Son Hua, Phong Nguyen

机构 * Qualcomm AI Research(高通AI研究) Trinity College Dublin(都柏林大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SwiftTailor框架,通过紧凑的几何图像表示统一缝纫图案推理与几何网格合成,提升3D服装生成的效率与精度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12696 2026-03-20 cs.RO cs.CV 50%

HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation

HaltNav: 基于轻量拓扑先验的反应式视觉停止用于鲁棒视觉-语言导航

Zihui Yu, Pingcong Li, Bichi Zhang, Sören Schwertfeger

机构 * SIST, ShanghaiTech University(上海科技大学信息与通信科学核心平台,上海科技大学) Key Laboratory of Intelligent Perception and Human-Machine Collaboration(智能感知与人机协同重点实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出HaltNav框架,结合轻量拓扑先验与局部探索能力,通过反应式视觉停止机制提升视觉-语言导航的鲁棒性,实验表明其在复杂环境下的表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17840 2026-03-19 cs.CV 50%

Video Understanding: From Geometry and Semantics to Unified Models

视频理解:从几何与语义到统一模型

Zhaochong An, Zirui Li, Mingqiao Ye, Feng Qiao, Jiaang Li, Zongwei Wu, Vishal Thengane, Chengzu Li, Lei Li, Luc Van Gool, Guolei Sun, Serge Belongie

机构 * Department of Computer Science(计算机科学系) University of Copenhagen(哥本哈根大学) College of Computer Science(计算机科学学院) Nankai University(南开大学) School of Computer and Communication Sciences(计算机与通信科学学校) EPFL(苏黎世联邦理工学院) Department of Computer Science & Engineering(计算机科学与工程系) Washington University in St. Louis(圣路易斯华盛顿大学) Computer Vision Lab(计算机视觉实验室) University of Würzburg(乌尔姆大学) Computer Science Research Centre(计算机科学研究中心) University of Surrey(萨里大学) School of Electrical, Computer and Telecommunications Engineering(电气、计算机和电信工程学院) University of Wollongong(沃林根大学) Language Technology Lab(语言技术实验室) University of Cambridge(剑桥大学) School of Artificial Intelligence(人工智能学院) Beijing Institute of Technology(北京理工大学) Institute for Computer Science(计算机科学研究所) INSAIT

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文综述了视频理解的发展,从低层几何理解到高层语义理解和统一模型,探讨了时间动态和视觉上下文建模的重要性,并总结了当前研究趋势和挑战。

Comments A comprehensive survey of video understanding, spanning low-level geometry, high-level semantics, and unified understanding models

Journal ref Machine Intelligence Research 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17712 2026-03-19 cs.RO cs.CV 50%

AERR-Nav: Adaptive Exploration-Recovery-Reminiscing Strategy for Zero-Shot Object Navigation

AERR-Nav:面向零样本物体导航的自适应探索-恢复-回忆策略

Jingzhi Huang, Junkai Huang, Haoyang Yang, Haoang Li, Yi Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出AERR-Nav框架,通过自适应探索-恢复-回忆策略和自适应探索状态,解决零样本物体导航中探索与利用的平衡问题,在HM3D和MP3D基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17571 2026-03-19 cs.CV 50%

PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imagery

PanoVGGT:从全景影像进行前馈3D重建

Yijing Guo, Mengjun Chao, Luo Wang, Tianyang Zhao, Haizhao Dai, Yingliang Zhang, Jingyi Yu, Yujiao Shi

机构 * ShanghaiTech University(上海科技大学) Sudo

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出PanoVGGT模型,通过单次前向传递从单或多张全景影像联合预测相机姿态、深度图和3D点云,采用球面感知位置嵌入和全景特定三轴SO(3)旋转增强,解决全局框架模糊问题,并贡献PanoCity大规模户外全景数据集。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15011 2026-03-18 cs.CV 50%

Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing

分子标识视觉提示与可验证强化学习用于化学反应图解析

Jiahe Song, Chuang Wang, Yinfan Wang, Hao Zheng, Rui Nie, Bowen Jiang, Xingjian Wei, Junyuan Gao, Yubin Wang, Bin Wang, Lijun Wu, Jiang Wu, Qian Yu, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Peking University(北京大学) South China Normal University(华南师范大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出IdtVP和Re3-DAPO方法,通过视觉提示和强化学习提升化学反应图解析的准确性和泛化能力,同时发布ScannedRxn基准数据集以评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22896 2026-03-18 cs.RO 50%

DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation

DySL-VLA:通过动态-静态层跳过实现高效的视觉-语言-动作模型推理以用于机器人操作

Zebin Yang, Yijiahao Qi, Tong Xie, Bo Yu, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究所) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出DySL-VLA框架,通过动态跳过视觉-语言-动作层来降低计算成本,提升机器人操作任务的实时性能,实验表明在Calvin数据集上成功长度提升2.1%,参数减少85.7倍,速度提升3.75倍。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15374 2026-03-17 cs.CV 50%

Spectral Rectification for Parameter-Efficient Adaptation of Foundation Models in Colonoscopy Depth Estimation

光谱校正用于结肠镜深度估计中基础模型的参数高效适应

Xiaoxian Zhang, Minghai Shi, Lei Li

机构 * Department of Biomedical Engineering, National University of Singapore, Singapore(新加坡国立大学生物医学工程系) Department of Radiotherapy, The First Affiliated Hospital of Xi'an Jiaotong University, Xi'an, China(西安交通大学第一附属医院放疗科)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SpecDepth框架,通过光谱校正模块提升结肠镜图像处理性能,实现参数高效适应,取得最佳性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14951 2026-03-17 cs.CV 50%

GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM

GT-PCQA: 一种基于多模态大语言模型的几何-纹理解耦点云质量评估方法

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin, Yao Zhao

机构 * Beijing Jiaotong University(北京交通大学) Nanyang Technological University(南洋理工大学) University of Science and Technology Beijing(北京科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GT-PCQA框架,通过2D-3D联合训练和几何-纹理解耦策略,解决点云质量评估中数据量少和模型对几何退化不敏感的问题,实现高效且泛化能力强的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16686 2026-03-17 cs.RO cs.MA 50%

SERN: Bandwidth-Adaptive Cross-Reality Synchronization for Simulation-Enhanced Robot Navigation

SERN:带宽自适应的跨现实同步用于模拟增强的机器人导航

Jumman Hossain, Emon Dey, Snehalraj Chugh, Masud Ahmed, MS Anwar, Abu-Zaher Faridee, Jason Hoppes, Theron Trout, Anjon Basak, Rafidh Chowdhury, Rishabh Mistry, Hyun Kim, Jade Freeman, Niranjan Suri, Adrienne Raglin, Carl Busart, Anuradha Ravi, Nirmalya Roy

专题命中 视觉空间推理 :planning(abstract)

AI总结 SERN通过高保真虚拟双胞胎与物理机器人紧密耦合,实现跨现实同步,提升多机器人在对抗环境中的导航性能,减少延迟并提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13833 2026-03-17 cs.RO 50%

ImagiNav: Scalable Embodied Navigation via Generative Visual Prediction and Inverse Dynamics

ImagiNav:通过生成性视觉预测和逆动力学实现可扩展的具身导航

Jie Chen, Yuxin Cai, Yizhuo Wang, Ruofei Bai, Yuhong Cao, Jun Li, Yau Wei Yun, Guillaume Sartoretti

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出ImagiNav框架,通过解耦视觉规划与机器人动作,利用真实世界导航视频实现零样本迁移,无需机器人演示即可实现通用机器人自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13788 2026-03-17 cs.RO 50%

ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation

ST-VLA:为通用机器人操作实现4D感知的时空理解

You Wu, Zixuan Chen, Cunxu Ou, Wenxuan Wang, Wenbo Huang, Lin Cao, Yangtao Chen, Weichao Qiu, Xingyue Quan, Jieqi Shi, Jing Huo, Yang Gao

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ST-VLA通过统一的3D-4D表示连接感知与动作,利用ST-Human数据集训练时空视觉语言模型,提升复杂3D场景中的鲁棒性和泛化能力。

Comments 25 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13399 2026-03-17 cs.CV 50%

FlowAD: Ego-Scene Interactive Modeling for Autonomous Driving

FlowAD: 无人驾驶中的自体场景交互建模

Mingzhe Guo, Yixiang Yang, Chuanrong Han, Rufeng Zhang, Shirui Li, Ji Wan, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab) Baidu Inc(百度公司)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出FlowAD框架,通过自体场景交互建模提升自动驾驶性能,利用场景流建模动态变化,结合新颖的FCP指标评估场景理解能力,实验表明其在碰撞率和驾驶评分上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13185 2026-03-16 cs.CV 50%

Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos

从单目视频生成时空世界场景图

Rohith Peddi, Saurabh, Shravan Shanmugam, Likhitha Pallapothula, Yu Xiang, Parag Singla, Vibhav Gogate

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出World Scene Graph Generation任务,通过ActionGenome4D数据集,引入三种方法解决未观测物体推理问题,推动视频场景理解向世界中心、时间持久和可解释的方向发展。

Comments https://github.com/rohithpeddi/WorldSGG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12936 2026-03-16 cs.RO cs.CV 50%

MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins

MotionAnymesh:基于物理的运动模拟数字双胞胎生成

WenBo Xu, Liu Liu, Li Zhang, Dan Guo, RuoNan Liu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出MotionAnymesh框架,通过结合物理先验知识和几何物理联合估计,解决静态3D网格转化为可交互数字双胞胎的难题,提升模拟精度和物理可行性。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08881 2026-03-16 cs.CV 50%

SATGround: A Spatially-Aware Approach for Visual Grounding in Remote Sensing

SATGround:一种面向遥感视觉语义的时空感知方法

Aysim Toker, Andreea-Maria Oncescu, Roy Miles, Ismail Elezi, Jiankang Deng

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SATGround方法,通过结构化定位机制提升卫星图像视觉语义理解,结合语言和空间信息增强定位精度,在多个遥感基准测试中取得显著提升,包括比先前方法提升33.2%的视觉语义定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21105 2026-03-16 cs.CV 50%

RLM: A Vision-Language Model Approach for Radar Scene Understanding

RLM:一种用于雷达场景理解的视觉-语言模型方法

Pushkal Mishra, Kshitiz Bansal, Dinesh Bharadia

机构 * University of California San Diego(加州大学圣地亚哥分校) Blue River Technology

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出RadarVLM,通过结构化空间语言监督学习统一的场景表示,改进了雷达场景理解中的空间推理能力,实验显示其在生成描述和车辆分割任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12708 2026-03-16 cs.CV 50%

FSDAM: Few-Shot Driving Attention Modeling via Vision-Language Coupling

FSDAM:通过视觉-语言耦合实现少样本驾驶注意力建模

Kaiser Hamid, Can Cui, Khandakar Ashrafi Akbar, Ziran Wang, Nade Liang

机构 * Texas Tech University(德克萨斯理工大学) Purdue University(普渡大学) Towson University(托逊大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出FSDAM框架,通过90个标注示例实现驾驶注意力预测与结构化解释生成,利用视觉-语言耦合减少标注需求,提升自动驾驶中的人机协作可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12265 2026-03-13 cs.CV 50%

OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams

OmniStream:在连续流中掌握感知、重建与行动

Yibin Yan, Jilan Xu, Shangzhe Di, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, SJTU(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) VGG, Oxford(牛津大学视觉几何组)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 OmniStream通过统一的流视觉骨干网络,实现对视频流中感知、重建和行动的高效处理,展示了在多种任务上的通用性与竞争力。

Comments Technical Report. Project Page: https://go2heart.github.io/omnistream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11447 2026-03-13 cs.RO 50%

Enhancing Lightweight Vision Language Models through Group Competitive Learning for Socially Compliant Navigation

通过群体竞争学习增强轻量级视觉语言模型以实现符合社会规范的导航

Xinyu Zhang, Atsushi Konno, Toshihiko Yamasaki, Ling Xiao

机构 * Hokkaido University(北海道大学) The University of Tokyo(东京大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出群体竞争学习策略,通过协调全局语义与分布正则化,提升轻量级VLMs在社交导航中的推理与决策能力,实现高准确性和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10703 2026-03-12 cs.CV cs.CY 50%

WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

WalkGPT: 基于深度感知的视觉语言对话用于行人导航

Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 WalkGPT通过结合视觉语言模型与深度感知分割技术,实现无障碍导航指导,提供精准的可访问性评估和深度估计。

Comments Accepted by CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09740 2026-03-11 cs.RO cs.CV 50%

Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments

逐步奖励:面向连续环境的视觉语言导航中的步骤感知对比对齐

Haoyuan Li, Rui Liu, Hehe Fan, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,杭州,中国)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SACA框架,通过步骤感知对比对齐提升连续环境中视觉语言导航的性能,解决传统方法在错误恢复和训练稳定性方面的不足。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09538 2026-03-11 cs.CV 50%

Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization

迈向统一多模态交错生成的群体相对策略优化

Ming Nie, Chunwei Wang, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿恒智能科技有限公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出基于强化学习的后训练策略,通过群体相对策略优化框架提升统一多模态模型的交错生成能力,实验表明其在质量与连贯性上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏