arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2605.20837 2026-05-21 cs.CV cs.AI 57%

ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models

ArchSIBench: 评估视觉-语言模型的建筑空间智能

Qirui Shen, Wenda Wang, Jiachen Lu, Zilong Huang, Jin Bai, Lei He, Hongxuan Chen, Weixin Huang

机构 * School of Architecture, Tsinghua University(清华大学建筑学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ArchSIBench,一个基于建筑学、认知科学和心理学视角的建筑空间智能评估基准,通过17个细粒度子任务和3000个问题-答案对,评估多种VLMs在建筑空间感知、推理、导航、转换和配置方面的性能,发现大多数模型在空间转换和配置推理上仍与有建筑训练的人类评估者存在差距。

Comments 51 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20277 2026-05-21 cs.CV cs.AI 57%

Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis

通过轨迹积分反馈调节解剖感知奖励用于体积计算断层扫描分析

Tianwei Lin, Zhongwei Qiu, Jie Cao, Jiang Liu, Wenjie Yan, Bo Zhang, Yu Zhong, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里集团达摩院) Hupan Lab(虎扑实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种新的框架,通过轨迹积分反馈GRPO(TIF-GRPO)来改进医疗视觉语言模型在三维CT分析中的性能,通过引入临床异常基准评估子系统(CABS)来解决优化目标与临床严谨性之间的不匹配问题,提升异常检测和临床准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13646 2026-05-20 cs.RO cs.AI 57%

Causality-Aware End-to-End Autonomous Driving via Ego-Centric Joint Scene Modeling

基于因果性的端到端自动驾驶:通过以自身为中心的联合场景建模

Seokha Moon, Minseung Lee, Joon Seo, Jinkyu Kim, Jungbeom Lee

机构 * Korea University(韩国大学) Kakao Mobility

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出CaAD框架,通过共享潜在场景表示捕捉车辆与周围代理之间的因果依赖关系,以提高端到端自动驾驶的闭环规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17077 2026-05-19 cs.RO cs.AI 57%

How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning

如何指导你的机器人:密集语言标注助力机器人策略学习

Bosung Kim, Ruiyi Wang, David Acuna, Jaehun Jung, Alexander Trevithick, Brandon Cui, Yejin Choi, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过密集语言标注提升机器人策略学习效率,提出DeMiAn方法,利用视觉语言模型生成多方面标注,提升策略和世界模型性能,无需新增演示数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12766 2026-05-19 cs.CL 57%

NaviRAG: Towards Active Knowledge Navigation for Retrieval-Augmented Generation

NaviRAG:迈向检索增强生成的主动知识导航

Jihao Dai, Dingjun Wu, Yuxuan Chen, Zheni Zeng, Yukun Yan, Zhenghao Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Northeastern University(东北大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL

AI总结 NaviRAG通过主动知识导航框架提升检索增强生成的复杂任务处理能力,通过分层知识组织和动态信息检索提高检索准确率和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10825 2026-05-19 cs.AI 57%

CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms

CheeseBench:在啮齿类行为神经科学范式上评估大语言模型

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 视觉空间推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 CheeseBench通过九种经典行为神经科学范式评估大语言模型,发现模型规模、上下文历史、提示方式和架构对性能有显著影响,且当前模型在空间导航等任务上仍低于啮齿类动物基准。

Comments 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16947 2026-05-19 cs.CV cs.AI 57%

LightZeroNav: Zero-Shot Vision Language Navigation in Continuous Environments Based on Lightweight VLMs

LightZeroNav: 基于轻量级VLMs的连续环境中零样本视觉语言导航

Kun Luo, Xiangyu Dong, Xiaoguang Ma, Haoran Zhao, Yaoming Zhou

机构 * Foshan Graduate School of Innovation, Northeastern University(创新研究生院,东北大学) Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学) School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北航) QingniaoAI, China(清北AI,中国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LightZeroNav,通过轻量级VLMs解决连续环境中零样本视觉语言导航的三大瓶颈,无需特定训练或图搜索,在RGB观测和轻量级Qwen3-VL-8B模型下实现与GPT-4o相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02071 2026-05-19 cs.AI 57%

FormuLLA: A Large Language Model Approach to Generating Novel 3D Printable Formulations

FormuLLA:一种用于生成新型3D打印配方的大型语言模型方法

Adeshola Okubena, Yusuf Ali Mohammed, Moe Elbadawi

机构 * School of Biological and Behavioural Sciences, Queen Mary University of London(伦敦女王玛丽大学生物与行为科学学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出FormuLLA方法,利用微调后的大型语言模型推荐3D打印配方的辅料并预测丝材机械性能,揭示了模型选择和参数对性能的影响,指出小模型易遗忘及标准指标无法评估配方可加工性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13169 2026-05-18 cs.CV cs.AI 57%

PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World

PanoWorld:迈向360度全景世界的空间超感知

Changpeng Wang, Xin Lin, Junhan Liu, Yuheng Liu, Zhen Wang, Donglian Qi, Yunfeng Yan, Xi Chen

机构 * Zhejiang University(浙江大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Irvine(加州大学伊维特分校) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PanoWorld,通过构建全景原生理解能力,解决传统多模态大模型在空间感知上的不足,通过全景空间交叉注意力机制提升3D空间推理能力,并建立PanoSpace-Bench基准测试,验证了全景原生监督的有效性。

Comments Project page: https://wcpcp.github.io/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04909 2026-05-18 cs.LG 57%

Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment

在关键领域学习:用于鲁棒偏好对齐的几何锚定

Youngjae Cho, Jongsuk Kim, Ji-Hoon Kim

机构 * PYLER KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 GAPO通过动态几何锚定机制改进偏好对齐,通过局部敏感度自适应调整偏好对重要性,减少噪声影响,提升模型鲁棒性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11405 2026-05-14 cs.LG 57%

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone

20/20 Vision Language Models: 通过数据整理单独提升VLMs的方案

DatologyAI, :, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, Aldo Carranza, Alex Fang, Amro Abbas, Anshuman Suri, Brett Larsen, Daniel Zayas, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Ties Robroek, Tony Jiang, Vidhi Jain, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

机构 * DatologyAI

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文通过数据整理提升VLMs性能,展示在20个公开基准和DatBench九个能力轴上均取得显著提升,同时提升可靠性、OOD泛化和推理效率。

Comments 33 pages, 15 figures. DatalogyAI website for more details: https://www.datologyai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11559 2026-05-13 cs.CV cs.AI 57%

When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs

当观察不足时:视觉注意结构揭示大语言模型中的幻觉

Fanpu Cao, Xin Zou, Xuming Hu, Hui Xiong

机构 * Thrust of Artificial Intelligence, HKUST (Guangzhou)(人工智能前沿 thrust,香港科技大学(广州)) Department of Computer Science and Engineering, HKUST(计算机科学与工程系,香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过分析视觉注意的高频结构揭示大语言模型中的幻觉现象,提出LaSCD解码策略,有效减少幻觉并保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12177 2026-05-13 cs.AI 57%

Floorplan2Guide: LLM-Guided Floorplan Parsing for BLV Indoor Navigation

Floorplan2Guide: 基于LLM的BLV室内导航floorplan解析

Aydin Ayanzadeh, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用基础模型将floor plan转化为可导航的知识图谱,并生成可读的导航指令,通过LLM提取空间信息,提升BLV用户室内导航的精度与安全性。

Comments Accepted for publication in the proceedings of the IEEE International Conference on Big Data (IEEE BigData 2025)

Journal ref IEEE International Conference on Big Data (IEEE BigData 2025), pp. 7477-7485

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16070 2026-05-13 cs.CL 57%

Less Redundancy: Boosting Practicality of Vision Language Model in Walking Assistants

减少冗余:提升视觉语言模型在行走助手中的实用性

Chongyang Li, Zhiqiang Yuan, Hanbo Bi, Zexi Jia, Jinchao Zhang

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出WalkVLM-LR模型,通过优化输出和时间冗余,提升视觉语言模型在行走助手中的实用性,实验表明其在输出简洁性和时间冗余方面表现优异。

Comments ICASSP 2026 Best Industry Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10817 2026-05-12 cs.AI 57%

CLEF: EEG Foundation Model for Learning Clinical Semantics

CLEF:用于学习临床语义的EEG基础模型

Peng Cao, Ali Mirzazadeh, Jong Woo Lee, Aleksandar Videnovic, Dina Katabi

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里奇沃特医院) Massachusetts General Hospital, Harvard Medical School(哈佛医学院麻省总医院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CLEF,一种基于临床场景的长上下文EEG基础模型,通过对比学习将EEG会话与神经科报告和结构化电子健康记录对齐,提升了EEG解读的临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10407 2026-05-12 cs.LG 57%

Identified-Set Geometry of Distributional Model Extraction under Top-$K$ Censored API Access

分布模型提取的识别集几何:在Top-K被剪裁API访问下的研究

Wenhua Nie, ZiCheng Zhu, Jianan Wu, Binhan Luo, Haoran Zheng, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了在Top-K被剪裁API访问下分布恢复的限制,提出了识别集的总变差直径公式,并通过实验展示了不同提取方法在任务性能上的层次结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09993 2026-05-12 cs.LG 57%

Learning Graph Foundation Models on Riemannian Graph-of-Graphs

在黎曼图-图上学习图基础模型

Haokun Liu, Zezhong Ding, Xike Xie

机构 * School of Biomedical Engineering, University of Science and Technology of China (USTC), Suzhou, Jiangsu, China(生物医学工程学院,中国科学技术大学(USTC),苏州,江苏,中国) Data Darkness Lab, Suzhou Institute for Advanced Research, USTC, Suzhou, Jiangsu, China(Data Darkness实验室,苏州市先进研究院,USTC,苏州,江苏,中国) School of Artificial Intelligence and Data Science, USTC, Hefei, Anhui, China(人工智能与数据科学学院,USTC,合肥,安徽,中国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出R-GFM,一种基于黎曼图-图的图基础模型,通过多尺度图-图结构建模,提升结构域泛化性能,在多个数据集上取得最佳表现,下游任务相对提升达49%。

Comments This paper has been accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09679 2026-05-12 cs.CV cs.AI 57%

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) Tongji University(同济大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05045 2026-05-12 cs.CV cs.CL 57%

When Relations Break: Analyzing Relation Hallucination in Vision-Language Model Under Rotation and Noise

关系破裂:在旋转和噪声下的视觉语言模型关系幻觉分析

Philip Wootaek Shin, Ajay Narayanan Sridhar, Sivani Devarapalli, Rui Zhang, Jack Sampson, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了旋转和噪声对视觉语言模型关系推理的影响,发现轻微扰动显著降低模型性能,提示需更鲁棒的几何感知模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08816 2026-05-12 cs.AI cs.CY 57%

Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

镜中镜:视觉语言模型代理是否真的能辨认自己?

Filippo Ziliotto, Ciro Beneduce, Bruno Lepri, Luciano Serafini, Massimiliano Luca, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型是否能通过镜像识别自身,通过设计3D基准测试评估其自我识别能力,发现更强的模型能利用镜像信息进行行动,而较弱的模型则无法正确提取自身相关信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05593 2026-05-08 cs.AI 57%

Causal Probing for Internal Visual Representations in Multimodal Large Language Models

多模态大语言模型内部视觉表征的因果探测

Zehao Deng, Tianjie Ju, Zheng Wu, Liangbo He, Jun Lan, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过激活引导框架系统干预四个视觉概念类别,揭示实体记忆局部化与抽象概念全局分布的差异,发现模型深度对复杂抽象概念编码至关重要,且反向引导揭示感知与生成之间的补偿机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03989 2026-05-08 cs.AI 57%

An Agent-Oriented Pluggable Experience-RAG Skill for Experience-Driven Retrieval Strategy Orchestration

面向经验的可插拔经验型RAG技能:用于经验驱动的检索策略编排

Dutao Zhang, Tian Liao

机构 * Macao Polytechnic University(澳门理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出经验型RAG技能,通过分析场景和经验记忆选择合适检索策略,提升多任务检索效果,实测在多个数据集上优于固定检索基线。

Comments Preprint. 6 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05081 2026-05-05 cs.AI 57%

MedGemma 1.5 Technical Report

MedGemma 1.5 技术报告

Andrew Sellergren, Chufan Gao, Fereshteh Mahvar, Timo Kohlberger, Fayaz Jamil, Madeleine Traverse, Alberto Tono, Bashir Sadjad, Lin Yang, Charles Lau, Liron Yatziv, Tiffany Chen, Bram Sterling, Kenneth Philbrick, Richa Tiwari, Yun Liu, Madhuram Jajoo, Chandrashekar Sankarapu, Swapnil Vispute, Harshad Purandare, Abhishek Bijay Mishra, Sam Schmidgall, Tao Tu, Anil Palepu, Chunjong Park, Tim Strother, Rahul Thapa, Yong Cheng, Preeti Singh, Kat Black, Yossi Matias, Katherine Chou, Avinatan Hassidim, Kavi Goel, Joelle Barral, Tris Warkentin, Shravya Shetty, Dale Webster, Sunny Virmani, David F. Steiner, Can Kirmizibayrak, Daniel Golden

机构 * Google Research and Google DeepMind(谷歌研究与谷歌深Mind)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 MedGemma 1.5 增强了医学影像处理、解剖定位和多时间点胸部X光分析能力,显著提升了3D MRI和CT分类精度,并在病理图像和临床知识推理中取得突破性进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18900 2026-05-04 physics.chem-ph cond-mat.mtrl-sci cs.LG 57%

Foundation Models for Discovery and Exploration in Chemical Space

化学空间发现与探索中的基础模型

Alexius Wadell, Anoushka Bhutani, Victor Azumah, Austin R. Ellis-Mohr, Andrew J. Stier, Kareem Hegazy, Alexander Brace, Hancheng Zhao, Celia Kelly, Anuj K. Nayak, Yuhan Chen, Dimitrios Simatos, Hongyi Lin, Murali Emani, Venkatram Vishwanath, Kevin Gering, Melisa Alkan, Tom Gibbs, Jack Wells, Wesley W. Qian, Richard C. Gerkin, Benjamin Amorelli, Alexander B. Wiltschko, Lav R. Varshney, Bharath Ramsundar, Karthik Duraisamy, Michael W. Mahoney, Arvind Ramanathan, Venkatasubramanian Viswanathan

机构 * Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系) Department of Chemical Engineering, University of Michigan(密歇根大学化学工程系) Department of Electrical and Computer Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) The Santa Fe Institute(圣菲研究所) International Computer Science Institute(国际计算机科学研究所) Department of Statistics, University of California, Berkeley(加州大学伯克利分校统计学系) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) Argonne National Laboratory(阿贡国家实验室) Idaho National Laboratory(爱达荷国家实验室) NVIDIA Corporation(英伟达公司) Osmo Labs, PBC AI Innovation Institute, Stony Brook University(石溪大学AI创新研究所) Brookhaven National Laboratory(布鲁赫斯研究所) Deep Forest Sciences, Palo Alto, CA(帕洛阿尔托的Deep Forest Sciences) Department of Aerospace Engineering, University of Michigan(密歇根大学航空航天工程系) Lawrence Berkeley National Laboratory(伯克利劳伦斯国家实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出MIST模型,通过大规模无标签数据训练,实现对化学空间中多种分子性质的预测,展示了其在多目标电解质溶剂筛选和立体化学推理中的应用,以及在超参数感知贝叶斯神经缩放定律下的高效训练能力。

Comments Main manuscript: 30 pages (including references), 7 tables and 5 figures. Supplementary information: 158 pages (including references), 15 tables and 128 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26488 2026-04-30 cs.CV cs.LG 57%

Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners

从动态3D场景中提取像素特征的线性上下文学习器

Nikita Araslanov, Martin Sundermeyer, Hidenobu Matsuki, David Joseph Tan, Federico Tombari

机构 * Google(谷歌) TU Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出LILA框架,通过线性上下文学习从视频中提取精确像素特征,解决动态场景中像素级表示问题,应用于视频目标分割、表面法线估计和语义分割等任务。

Comments To appear at CVPR 2026 (oral). Project website: https://lila-pixels.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25526 2026-04-29 cs.SE cs.AI 57%

AI as Consumer and Participant: A Co-Design Agenda for MBSE Substrates and Methodology

AI作为消费者和参与者:MBSE子系统与方法论的协同设计议程

Siyuan Ji

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了AI在MBSE模型中的应用问题,指出现有模型未为AI消费设计,提出需协同设计模型与方法论,使其成为可查询的知识子系统,而非仅为人导航的结构化 artifacts。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22875 2026-04-29 cs.CV cs.AI 57%

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00376 2026-04-29 cs.AI 57%

NeuroHex: A Brain-Inspired Hex Coordinate System to Enable Highly Computationally-Efficient World Models for Continuous Online-Adaptive Learning

NeuroHex:一种脑启发的六边形坐标系统,用于构建高效计算的世界模型以支持连续在线自适应学习

Quinn Jacobson, Joe Luo, Jingfei Xu, Shanmuga Venkatachalam, Kevin Wang, Dingchao Rong, John Paul Shen

机构 * NeuroAI Computer Architecture Lab (NCAL)(神经人工智能计算机架构实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 NeuroHex通过六边形坐标系统实现高效世界模型,利用环索引和量化角编码等方法,降低计算成本并支持空间匹配,同时提供OSM2Hex工具将地图数据转换为该坐标系统,提升自主系统空间推理效率。

Comments This is an expanded version of the paper titled "NeuroHex: Highly Efficient Hex Coordinate System for Creating World Models to Enable Adaptive AI" published in the proceedings of the 2026 Neuro Inspired Computational Elements (NICE) [1] conference. This is an archival version of the paper and is currently under review for an ACM journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03269 2026-04-28 cs.CV cs.LG 57%

LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory

LoGeR:长上下文几何重建与混合记忆

Junyi Zhang, Charles Herrmann, Junhwa Hur, Chen Sun, Ming-Hsuan Yang, Forrester Cole, Trevor Darrell, Deqing Sun

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 LoGeR通过混合记忆模块实现长序列的高精度3D重建,无需后优化,有效解决长视频中的上下文一致性问题,优于现有方法。

Comments Project page: https://LoGeR-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17411 2026-04-28 cs.RO cs.LG 57%

SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

SPEAR-1:通过3D理解超越机器人演示

Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel

机构 * INSAIT

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SPEAR-1,通过融合3D感知与语言指导的具身控制,提升机器人基础模型的泛化能力,使用20倍少的机器人演示数据在24个Open X-Embodiment数据集上训练,超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏