arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2604.09862 2026-04-14 cs.CV 50%

FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views

FF3R:从无约束视角实现前馈特征三维重建

Chaoyi Zhou, Run Wang, Feng Luo, Mert D. Pesé, Zhiwen Fan, Yiqi Zhong, Siyu Huang

机构 * Microsoft(微软) Clemson University(克莱姆森大学) Texas A&M University(德克萨斯A&M大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 FF3R提出一种无需标注的前馈框架,统一处理几何与语义推理,解决全局语义不一致和局部结构不一致问题,实验显示其在视图合成、语义分割和深度估计中表现优异。

Comments CVPR 2026 Findings. Project Page: https://chaoyizh.github.io/ff3r_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08921 2026-04-13 cs.CV 50%

TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction

TAIHRI:面向近距离人机交互的任务感知3D人体关键点定位

Ao Li, Yonggen Ling, Yiyang Lin, Yuji Wang, Yong Deng, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Tencent Robotics X(腾讯机器人实验室X) Futian Laboratory(福田实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 TAIHRI是首个针对近距离人机交互的视觉-语言模型,通过任务感知的3D关键点定位实现人机交互中的精准空间定位,提升机器人对任务相关身体部位的识别与响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08771 2026-04-13 cs.HC cs.ET 50%

TeamLLM: Exploring the Capabilities of LLMs for Multimodal Group Interaction Prediction

TeamLLM: 探索LLMs在多模态群体交互预测中的能力

Diana Romero, Xin Gao, Daniel Khalkhali, Salma Elmalaki

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究LLMs在多模态传感器数据中预测群体协调模式的能力,发现LLMs在语言基础行为上比LSTM基线提升3.2倍,细调准确率达96%。同时揭示了文本模型在多模态交互中的局限性及模拟模式的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03370 2026-04-13 cs.CV 50%

ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-based 3D Scene Understanding

ShelfGaussian:基于货架的开放词汇高斯3D场景理解

Lingjun Zhao, Yandong Luo, James Hays, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出ShelfGaussian框架,利用货架监督学习方法,结合多模态高斯变换,提升3D场景理解的开放词汇能力,实验显示其在零样本语义占用预测中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11724 2026-04-10 cs.SE 50%

WebTestPilot: Agentic End-to-End Web Testing against Natural Language Specification by Inferring Oracles with Symbolized GUI Elements

WebTestPilot: 通过符号化GUI元素推断或acles实现基于自然语言规范的端到端Web测试

Xiwen Teoh, Yun Lin, Duc-Minh Nguyen, Ruofei Ren, Wenjie Zhang, Jin Song Dong

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 WebTestPilot通过符号化GUI元素推断隐式或acles,解决自然语言规范下的端到端Web测试中的隐式或acles推断和概率推理挑战,实现99%的任务完成率和高精度召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23322 2026-04-10 cs.CV 50%

Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework

缓解大多模态模型中的视觉上下文退化:一种无需训练的解耦代理框架

Hongrui Jia, Chaoya Jiang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Shandong University(山东大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出无需训练的解耦代理框架DRP,通过让LLM作为策略推理者与LMM作为观察者解耦,有效缓解多模态推理中的视觉退化问题,实验表明其在MathVision基准上准确率优于GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05525 2026-04-08 cs.GR 50%

CrowdVLA: Embodied Vision-Language-Action Agents for Context-Aware Crowd Simulation

CrowdVLA: 一种用于情境感知人群模拟的具身视觉-语言-动作代理

Juyeong Hwang, Seong-Eun Hong, Jinhyun Kim, JaeYoung Seon, Giljoo Nam, Hanyoung Jang, HyeongYeop Kang

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 CrowdVLA通过引入视觉-语言-动作代理,解决了人群模拟中监督不足、控制不稳定和数据偏差等问题,推动模拟从运动导向转向感知驱动的决策制定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05515 2026-04-08 cs.CV 50%

Geometrical Cross-Attention and Nonvoid Voxelization for Efficient 3D Medical Image Segmentation

几何交叉注意力与非空体素化用于高效3D医学图像分割

Chenxin Yuan, Shoupeng Chen, Haojiang Ye, Yiming Miao, Limei Peng, Pin-Han Ho

机构 * organization= Shenzhen Institute for Advanced Study , addressline= University of Electronic Science organization= School of Electrical Electronic Engineering , addressline= Nanyang Technological University , city= Singapore , postcode= 639798 , country= Singapore organization= School of Science Engineering , addressline= The Chinese University of Hong Kong, Shenzhen , city= Shenzhen , postcode= 518172 , state= Guangdong , country= China organization= School of Computer Science Engineering , addressline= Kyungpook National University , city= Daegu , postcode= 37224 , country= South Korea organization= Department of Electrical Computer Engineering , addressline= University of Waterloo , city= Waterloo , postcode= N2L3G1 , state= Ontario , country= Canada

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出GCNV-Net框架,结合3DNVT、GCA和非空体素化模块,通过动态体素划分和几何位置信息融合,提升3D医学图像分割的精度与效率,实现56.13%的FLOPs和68.49%的推理延迟降低。

Comments 20 pages, 13 figures, supplementary material included, submitted to Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05375 2026-04-08 cs.MM 50%

DAT: Dual-Aware Adaptive Transmission for Efficient Multimodal LLM Inference in Edge-Cloud Systems

DAT:双重视觉与带宽感知的自适应传输,用于边缘-云计算系统中高效多模态大语言模型推理

Qi Guo, Zheming Yang, Yunqing Hu, Chang Zhao, Wen Ji

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出DAT方法,通过轻量级边缘模型过滤非目标帧并触发MLLM推理,结合高效微调策略和多流自适应传输优化,实现高效多模态大语言模型推理,提升语义生成质量与低延迟警报性能。

Comments 10 pages, 6 figures. Submitted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05210 2026-04-08 cs.CV 50%

Integration of Object Detection and Small VLMs for Construction Safety Hazard Identification

对象检测与小型视觉语言模型的整合用于建筑安全危险识别

Muhammad Adil, Mehmood Ahmed, Muhammad Aqib, Vicente A. Gonzalez, Gaang Lee, Qipei Mei

机构 * Infrastructure Human Tech (IHT) Lab, Department of Civil and Environmental Engineering, University of Alberta, Edmonton, Alberta, Canada(基础设施人类技术(IHT)实验室,土木与环境工程系,阿尔伯塔大学,埃德蒙顿,阿尔伯塔,加拿大)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出了一种结合对象检测与多模态推理的轻量级框架,以提高建筑工地安全危险识别的准确性和效率,实验表明该方法在多个小型视觉语言模型上均提升了检测性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26788 2026-04-08 cs.RO cs.CV 50%

ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation

ReMemNav:一种重新思考和记忆增强的零样本物体导航框架

Feng Wu, Wei Zuo, Wenliang Yang, Jun Xiao, Yang Liu, Xinhua Zeng

机构 * Fudan University(复旦大学) Tongji University(同济大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ReMemNav通过整合全景语义先验和事件记忆,改进了零样本物体导航中的空间推理和决策,提升了成功率和探索效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04863 2026-04-07 cs.CV 50%

Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器

Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Nguyen Cam-Tu, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan W. Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

机构 * Hanoi University of Science and Technology(河内科技大学) Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。

Comments Accepted at CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00851 2026-04-07 cs.SE 50%

Reliability of Large Language Models for Design Synthesis: An Empirical Study of Variance, Prompt Sensitivity, and Method Scaffolding

大语言模型在设计综合中的可靠性:方差、提示敏感性和方法框架的实证研究

Rabia Iftikhar, Andreas Rausch

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究探讨大语言模型在设计综合中的可靠性,通过方差、提示敏感性和方法框架的实证分析,评估三种LLM在不同提示策略下的表现,发现偏好对齐虽提升设计意图符合度,但无法消除非确定性,模型行为影响设计可靠性。

Journal ref International Conference on Software Architecture 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04009 2026-04-07 cs.SE 50%

Benchmarking and Evaluating VLMs for Software Architecture Diagram Understanding

对软件架构图理解的VLMs基准测试与评估

Shuyin Ouyang, Jie M. Zhang, Jingzhi Gong, Gunel Jahangirova, Mohammad Reza Mousavi, Jack Johns, Beum Seuk Lee, Adam Ziolkowski, Botond Virginas, Joost Noppen

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SADU基准,评估VLMs在理解软件架构图作为结构化软件工程制品上的能力,揭示当前模型在图表推理和视觉关系定位方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03697 2026-04-07 cs.CV 50%

SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding

基于场景图的多模态交通代理:视频理解的模块化框架

Xingcheng Zhou, Mingyu Liu, Walter Zimmer, Jiajie Zhang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SGTA结合结构化场景图与多模态推理,通过检测、跟踪和车道提取构建交通场景图,并利用ReAct处理大语言模型的推理轨迹,实现复杂视频问题的可解释决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03334 2026-04-07 cs.CV 50%

Bridging the Dimensionality Gap: A Taxonomy and Survey of 2D Vision Model Adaptation for 3D Analysis

弥合维度差距:2D视觉模型适应3D分析的分类与综述

Akshat Pandya, Bhavuk Jain

机构 * Independent Researcher(独立研究员)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文综述了将2D视觉模型适应3D分析的策略,分类为数据导向、架构导向和混合方法,探讨了计算复杂度、预训练依赖性和几何归纳偏置的权衡。

Comments VISAPP 2026

Journal ref Proceedings of the 21st International Conference on Computer Vision Theory and Applications - Volume 3: VISAPP 2026; ISBN 978-989-758-804-4; ISSN 2184-4321, SciTePress, pages 353-364

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09573 2026-04-07 cs.CV 50%

More than the Sum: Panorama-Language Models for Adverse Omni-Scenes

全景语言模型:超越拼接的全景场景理解

Weijia Fan, Ruiping Liu, Jiale Wei, Yufan Chen, Junwei Zheng, Zichao Zeng, Jiaming Zhang, Qiufu Li, Linlin Shen, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) Shenzhen University(深圳大学) UCL(伦敦大学学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出全景语言模型PLM,通过全景图像实现超越单目视角的综合推理,同时构建包含恶劣全景场景的PanoVQA数据集,开发可插拔的稀疏注意力模块以提升模型处理全景图像的能力。

Comments Accepted by CVPR 2026. Project page: https://github.com/InSAI-Lab/PanoVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14336 2026-04-07 cs.CV 50%

ArchMap: Arch-Flattening and Knowledge-Guided Vision Language Model for Tooth Counting and Structured Dental Understanding

ArchMap:用于牙齿计数和结构牙科理解的拱形扁平化和知识引导的视觉语言模型

Bohan Zhang, Yiyi Miao, Taoyu Wu, Tong Chen, Ji Jiang, Zhuoxiao Li, Zhe Tang, Limin Yu, Jionglong Su

机构 * Xi'an Jiaotong-Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学) Zhejiang University of Technology(浙江工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出ArchMap,一种无需训练的知识引导框架,通过几何归一化和本体引导的多模态推理,提升3D口腔扫描的结构化分析能力,实现牙齿计数、解剖分区、牙列阶段分类及临床状况识别。

Journal ref In Proceedings of the 2025 IEEE International Conference on Big Data (BigData), pp. 7529-7538, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03139 2026-04-06 cs.RO 50%

FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation

FSUNav: 一种用于快速、安全和通用零样本目标导向导航的脑皮层-小脑架构

Mingao Tan, Yiyang Li, Shanze Wang, Xinming Zhang, Wei Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) College of Information Science and Technology, Eastern Institute of Technology(东方理工学院信息科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出FSUNav架构,通过整合视觉语言模型与小脑-脑皮层模块,实现跨异构平台的零样本目标导航,提升效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03040 2026-04-06 cs.CV 50%

QVAD: A Question-Centric Agentic Framework for Efficient and Training-Free Video Anomaly Detection

QVAD:一种以问题为中心的代理框架,用于高效且无需训练的视频异常检测

Lokman Bekit, Hamza Karim, Nghia T Nguyen, Yasin Yilmaz

机构 * Department of Electrical Engineering, University of South Florida, Tampa, Florida, USA(南佛罗里达大学电气工程系,坦帕,佛罗里达州,美国)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 QVAD提出一种以问题为中心的代理框架,通过动态对话机制提升视频异常检测的效率和性能,无需参数更新即可实现高精度检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02870 2026-04-06 cs.CV 50%

Token Warping Helps MLLMs Look from Nearby Viewpoints

令牌扭曲帮助多模态大语言模型从近处视角观察

Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究令牌扭曲如何帮助多模态大语言模型从近处视角理解场景,发现反向令牌扭曲在视角变化中更稳定且能更好保持语义一致性。

Comments CVPR 2026, Project Page: https://token-warping-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02799 2026-04-06 cs.CV 50%

UNICA: A Unified Neural Framework for Controllable 3D Avatars

UNICA:一种统一的神经框架用于可控的3D人形 avatars

Jiahe Zhu, Xinyao Wang, Yiyu Zhuang, Yanwen Wang, Jing Tian, Yao Yao, Hao Zhu

机构 * Nanjing University(南京大学) State Key Laboratory of Novel Software Technology(计算机软件新技术国家重点实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 UNICA通过动作条件扩散模型和点转换器生成可控的3D人形,实现无需骨骼的统一生成框架,支持自由视角渲染和动态衣物处理。

Comments Opensource code: https://github.com/zjh21/UNICA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02786 2026-04-06 cs.RO 50%

QuadAgent: A Responsive Agent System for Vision-Language Guided Quadrotor Agile Flight

QuadAgent:一种基于视觉-语言引导的四旋翼敏捷飞行响应代理系统

Ao Zhuang, Feng Yu, Tianbao Zhang, Linzuo Zhang, Danping Zou

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 QuadAgent通过异步多代理架构解耦高层推理与低层控制,利用Impression Graph维护场景记忆并结合视觉避障网络确保飞行安全,实现在复杂环境中高速导航与响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02252 2026-04-03 cs.CV 50%

SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation

SPAR:单次通过任意分辨率ViT用于开放词汇分割

Naomi Kombol, Ivan Martinović, Siniša Šegvić, Giorgos Tolias

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SPAR通过单次通过任意分辨率ViT实现高效高分辨率推理,提升开放词汇分割的mIoU性能,无需架构改动或像素级监督。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02020 2026-04-03 cs.CV 50%

Are VLMs Lost Between Sky and Space? LinkS$^2$Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence

VLMs在天空与空间之间迷失了吗?LinkS$^2$Bench用于无人机-卫星动态跨视角空间智能

Dian Liu, Jie Feng, Di Li, Yuhui Zheng, Guanbin Li, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Qinghai Normal University(青海师范大学) Sun Yat-sen University(中山大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出LinkS$^2$Bench,首个评估VLMs跨视角空间智能的综合基准,通过动态无人机视频与高分辨率卫星图像构建17.9k高质量问题-答案对,揭示VLMs在动态跨视角对齐中的性能瓶颈,并提出跨视角对齐适配器提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01678 2026-04-03 cs.CV 50%

Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding

Director: 用于动态场景建模与理解的实例感知高斯点云

Yuheng Jiang, Yiwen Cai, Zihao Wang, Yize Wu, Sicheng Li, Zhuo Su, Shaohui Jiao, Lan Xu

机构 * ShanghaiTech University(上海科技大学) ByteDance(字节跳动)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Director通过联合建模人类性能、高保真渲染和实例级语义,实现动态场景的时空高斯表示,提升动态场景理解的稳定性与准确性。

Comments Project page: https://caiyw2023.github.io/Director/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01421 2026-04-03 cs.CV 50%

EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

EgoFlow:基于梯度的流匹配用于第一人称6自由度物体运动生成

Abhishek Saroha, Huajian Zeng, Xingxing Zuo, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML(慕尼黑机器学习中心) ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出EgoFlow,通过多模态第一人称观察生成物理合理的物体运动轨迹,结合Mamba-Transformer-Perceiver架构和梯度引导推理,提升运动生成的准确性和物理真实性。

Comments CVPR 2026: https://abhi-rf.github.io/egoflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00597 2026-04-02 cs.CV 50%

Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors

面向视角鲁棒的端到端自动驾驶与3D基础模型先验

Hiroki Hashimoto, Hiromichi Goto, Hiroyuki Sugai, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国立信息学研究所)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种无需数据增强的端到端自动驾驶方法,利用3D基础模型的几何先验提升视角变化鲁棒性,实验显示在pitch和高度扰动下性能提升显著。

Comments Accepted at CVPR Workshop on Simulation for Autonomous Driving 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00507 2026-04-02 cs.CV 50%

RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection

RegFormer:可转移的交互关系接地以实现高效的弱监督人类-物体交互检测

Jihwan Park, Chanhyeong Yang, Jinyoung Park, Taehoon Song, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) LG Energy Solution(LG新能源) Korea University(高丽大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 RegFormer通过空间接地信号实现高效的弱监督人类-物体交互检测,无需额外训练即可直接迁移至实例级推理,实验表明其在效率和性能上均优于传统方法。

Comments Accepted at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27183 2026-04-02 cs.CV 50%

Communicating about Space: Language-Mediated Spatial Integration Across Partial Views

关于空间的交流:通过语言介导的空间整合跨部分视图

Ankur Sikarwar, Debangan Mishra, Sudarshan Nikhil, Ponnurangam Kumaraguru, Aishwarya Agrawal

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) IIIT Hyderabad(海得拉巴国际信息技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究探讨多模态大语言模型能否通过对话整合不同视角,发现其在识别共享锚点物体上表现较好,但在关系推理和全局地图构建上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏