arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2606.04389 2026-06-04 cs.CL 57%

When Clients Stop Following: A Cognitive Conceptualization Diagram-driven Framework for Strategic Counseling

当来访者不再跟随:基于认知概念化图的策略性咨询框架

Yihao Qin, Junyi Zhao, Changsheng Ma, Yongfeng Tao, Minqiang Yang, Chang Liu, Bin Hu

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 针对现有评估协议中来访者过度顺从导致评分虚高的问题,提出基于认知行为疗法的抵抗感知框架,通过认知概念化图模拟动态抵抗,并利用强化学习优化策略推理与响应生成,以提升在困难咨询交互中的策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03626 2026-06-03 cs.CV cs.AI cs.CY 57%

TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics

TurtleAI:海龟图形学中视觉编程的多模态模型基准测试

Chao Wen, Jacqueline Staub, Adish Singla

机构 * MPI-SWS(马克斯·普朗克研究所-斯图加特)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出TurtleAI基准,包含823个基于海龟图形学真实任务的视觉编程任务,评估20多个多模态模型发现成功率低于30%,并通过少量种子样本生成合成数据微调Qwen2-VL-72B提升约20%性能。

Comments ACL Findings 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02463 2026-06-02 cs.CV cs.AI 57%

MASER: Modality-Adaptive Specialist Routing for Embodied 3D Spatial Intelligence

MASER: 面向具身3D空间智能的模态自适应专家路由

Hilton Raj, Vishnuram AV

机构 * Boston University(波士顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出MASER框架,通过训练共享VLM骨干的五个模态适配器并学习基于问题选择最佳适配器的神经路由策略,解决具身代理在3D环境中多模态推理时忽略问题语义的问题。

Comments Accepted to CVPR 2026 Foundation Models Meet Embodied Agents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02374 2026-06-02 cs.AI 57%

Spatial Representation Learning Beyond Pixels: Unifying Raster Data and Vector Semantics for Human-Centric Geospatial Foundation Models

超越像素的空间表示学习:统一栅格数据和向量语义以构建以人为中心的地理空间基础模型

Steffen Knoblauch, Hao Li, Gengchen Mai, Konstantin Klemmer, Song Gao, WenWen Li

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出统一栅格感知与向量推理的联合空间表示学习范式,旨在解决当前地球观测基础模型仅依赖栅格模态、忽略向量数据中丰富结构化信息的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00582 2026-06-02 cs.AI 57%

PropLLM: Propagation-Aware Scene Reconstruction for Network Fault Diagnosis

PropLLM:面向网络故障诊断的传播感知场景重建

Zongzong Wu, Ming Zhao, Fengxiao Tang, Nei Kato

机构 * National Natural Science Foundation of China(国家自然科学基金委员会) High Performance Computing Center of Central South University(中南大学高性能计算中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出PropLLM,首次将逐跳场景重建范式与LLM生成推理能力结合,通过双知识图谱和时序因果传播注意力机制,从端点告警回溯定位根因并确定故障类型,在真实Wi-Fi多模态故障数据集上诊断准确率提升3.9%,根因定位准确率提升4.7%,幻觉率降低50.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23500 2026-06-02 cs.CV cs.LG 57%

B-GRTO: Bootstrapped Group Relative Tool Optimization for Referring Segmentation

B-GRTO: 引导式分组相对工具优化用于指代分割

Mario Markov, Stefan Maria Ailuro, Mohammad Mahdi, Luc Van Gool, Danda Pani Paudel

机构 * INSAIT Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·欧赫里迪斯基")

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出B-GRTO框架,通过引导式预训练和分组相对工具优化,联合优化策略与可微分割解码器,显著提升复杂指代分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15231 2026-06-02 cs.AI 57%

RadAgent: A tool-using AI agent for stepwise interpretation of chest computed tomography

RadAgent:一种用于胸部CT逐步解读的工具型AI智能体

Mélanie Roschewitz, Kenneth Styppa, Yitian Tao, Jiwoong Sohn, Jean-Benoit Delbrouck, Benjamin Gundersen, Nicolas Deperrois, Christian Bluethgen, Julia E. Vogt, Bjoern Menze, Farhad Nooralahzadeh, Michael Krauthammer, Michael Moor

机构 * Department of Biosystems Science and Engineering, ETH Zurich(生物系统科学与工程系,苏黎世联邦理工学院) ETH AI Center, Zurich(ETH人工智能中心,苏黎世) Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院) Faculty of Computer Science and Mathematics, Heidelberg University(计算机科学与数学学院,海德堡大学) Stanford Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学人工智能在医学和影像中的中心) Department of Radiology, Stanford University(放射科,斯坦福大学) Department of Quantitative Biomedicine, University of Zurich(定量生物医学系,苏黎世大学) Institute of Computer Science, Zurich University of Applied Sciences(应用科学大学计算机科学研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出RadAgent,一种通过逐步、可解释过程生成CT报告的工具型AI智能体,在临床准确性、鲁棒性和忠实度上优于3D VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23220 2026-06-02 cs.CV cs.AI 57%

Med-Scout: Curing MLLMs' Geometric Blindness in Medical Perception via Geometry-Aware RL Post-Training

Med-Scout: 通过几何感知的强化学习后训练治愈多模态大语言模型在医学感知中的几何盲点

Anglin Liu, Ruichao Chen, Yi Lu, Hongxia Xu, Jintai Chen

机构 * HKUSTGZ-ML4Health-Lab(香港科技大学-ML4Health实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Med-Scout框架,利用无标注医学图像中的内在几何逻辑,通过强化学习和三种代理任务(层次尺度定位、拓扑拼图重建、异常一致性检测)来缓解多模态大语言模型的几何盲点,并在新基准Med-Scout-Bench上提升超过40%的几何感知性能,同时泛化到更广泛的医学理解任务。

Comments 29 pages, 14 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08884 2026-06-02 cs.CV cs.AI cs.GR 57%

ShapeLib: Designing a library of programmatic 3D shape abstractions with Large Language Models

ShapeLib: 利用大型语言模型设计程序化3D形状抽象库

R. Kenny Jones, Paul Guerrero, Niloy J. Mitra, Daniel Ritchie

机构 * Stanford University(斯坦福大学) Adobe Research(Adobe研究) University College London(伦敦大学学院) Brown University(布朗大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ShapeLib方法,利用大型语言模型的先验知识,通过引导式工作流自动设计可泛化的程序化3D形状抽象库,并支持下游形状编辑与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11440 2026-06-01 cs.CV cs.CL 57%

Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation

合成刺激,真实收益:通过完全受控的数据生成重新思考VLM微调

Massimo Rizzoli, Simone Alghisi, Seyed Mahed Mousavi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种完全受控的数据生成与标注流程,用于微调视觉语言模型(VLM),通过平衡分布和干净标注消除偏差,在空间推理任务上仅用130个样本即可实现均匀性能,并在真实世界数据上提升13%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13517 2026-05-29 q-bio.NC cs.LG 57%

A Deep Learning Model of Mental Rotation Informed by Interactive VR Experiments

基于交互式VR实验的心理旋转深度学习模型

Raymond Khazoum, Daniela Fernandes, Aleksandr Krylov, Qin Li, Stephane Deny

机构 * Department of Computer Science, Aalto University, Espoo, Finland(奥卢大学计算机科学系,芬兰埃斯波) Department of Neuroscience and Biomedical Engineering, Aalto University, Espoo, Finland(奥卢大学神经科学与生物医学工程系,芬兰埃斯波)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出一个由等变编码器、神经符号对象编码器和神经决策代理组成的深度学习模型,通过VR实验验证,准确模拟人类心理旋转的性能、响应时间和行为。

Comments Version accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26277 2026-05-28 cs.CV cs.AI 57%

VesselSim: learning 3D blood vessel segmentation without expert annotations

VesselSim: 无需专家标注的3D血管分割学习

Erin Rainville, Melissa Ananian, Tristan Mirolla, Hassan Rivaz, Yiming Xiao

机构 * Department of Computer Science and Software Engineering, Concordia University, Montreal, Canada(计算机科学与软件工程系,康科迪亚大学,蒙特利尔,加拿大) Department of Electrical and Computer Engineering, Concordia University, Montreal, Canada(电气与计算机工程系,康科迪亚大学,蒙特利尔,加拿大)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 提出VesselSim两阶段框架,通过几何驱动的合成血管生成和自监督测试时适应,实现无需真实标注的3D血管分割,在多个临床数据集上达到与有监督方法竞争的性能。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution will be published as part of the MICCAI 2026 proceedings in October

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25010 2026-05-28 cs.RO cs.AI 57%

Performance Comparison of Classical and Neural Sampling Algorithms for Robotic Navigation

经典与神经采样算法在机器人导航中的性能比较

Hichem Cheriet, Badra Khellat Kihel, Samira Chouraqui

机构 * dept. of Economics Oran2 Mohamed BenAhmed University(经济系奥兰2莫哈梅德·本·阿赫迈德大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文在含凸凹障碍物的环境中比较了RRT*、Neural RRT*和Neural Informed RRT*三种算法,发现神经引导规划器能生成更短(最多14%)和更平滑(55-75%)的路径,其中Neural Informed RRT*综合性能最优。

Journal ref Presented at The 3rd Edition of National Conference on Applications of Artificial Intelligence A2I' 26. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28101 2026-05-28 cs.SD cs.AI cs.MM 57%

EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction

EigeNet:几何信息引导的多模态学习用于少样本新视角RIR预测

Chong Jing, Zitong Lan, Junan Zhang, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出EIGENET框架,通过跨视角交替注意力Transformer和几何信息调制块,结合多任务学习,实现少样本新视角房间脉冲响应预测,达到最先进性能。

Comments Code available on https://github.com/FEAfeatherTHER/EigeNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27853 2026-05-28 cs.AI 57%

MolLingo: Molecule-Native Representations for LLM-Powered Scientific Agents

MolLingo:面向LLM驱动的科学智能体的分子原生表示

Thao Nguyen, Heng Ji

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出MolLingo多智能体系统,通过共享内存协调文献、化学家和编排智能体,结合基于BRICS的片段枚举(BFE)表示方法,实现分子块级推理与编辑,在四个基准上优于前沿LLM和专用基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27686 2026-05-28 cs.CV cs.AI 57%

Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers

张量记忆:用于长程Transformer的固定大小循环状态

Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, Antonio Torralba

机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) IBM Research, Cambridge, MA, USA(IBM研究院) University of Toronto, Toronto, Canada(多伦多大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出张量记忆模块,通过固定大小的3D循环张量状态增强Transformer,以解耦状态容量与输入长度,并保持空间归纳偏置,适用于长程视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27595 2026-05-28 cs.CV cs.AI 57%

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

多模态大语言模型在农业图像解释与生成任务中的幻觉行为

Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

机构 * Texas A&M University System(德克萨斯大学系统)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究系统评估了多模态大语言模型在农业图像解释(图像到文本)和生成(文本到图像)任务中的幻觉行为,发现模型存在生物不一致、上下文不准确和农学不合理等错误模式,并通过少样本提示等方法分析了幻觉的残留影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27413 2026-05-28 q-bio.BM cs.AI 57%

Ligand-Conditioned Discrete Diffusion for Protein Sequence-Structure Co-Design

配体条件离散扩散用于蛋白质序列-结构协同设计

Chen Wei, Fanding Xu, Minghao Sun, Zhiyuan Liu, Lin Wang, Tianrui Jia, Yihang Zhou, Yang Zhang

机构 * Xi’an University of Posts & Telecommunications(西安邮电大学) National University of Singapore(新加坡国立大学) Xi’an Jiaotong University(西安交通大学) Institute of Systems Medicine, Chinese Academy of Medical Sciences(中国医学科学院系统医学研究院)

专题命中 视觉空间推理 :self-correction(abstract);分类 cs.AI

AI总结 提出配体条件离散扩散模型ProtLiD²,通过几何感知交叉注意力联合生成氨基酸序列和离散结构令牌,实现配体约束下的蛋白质序列-结构协同设计,显著提升全局折叠置信度和配体感知通过率。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00913 2026-05-28 cs.CV cs.CL 57%

Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment

跨描绘装配指令对齐的视觉-语言模型基准测试与机制分析

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 构建IKEA-Bench基准,评估19个视觉-语言模型在装配图与视频帧对齐任务上的表现,发现视觉编码是提升跨描绘鲁棒性的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22904 2026-05-27 cs.CV cs.AI 57%

Suicide Risk Assessment from AI-powered Video Surveillance: An Interpretable Framework for Prevention in Metro Stations

基于AI视频监控的自杀风险评估:地铁站预防的可解释框架

Safwen Naimi, Wassim Bouachir, Guillaume-Alexandre Bilodeau, Brian Mishara

机构 * Université TÉLUQ(大学TÉLUQ) Polytechnique Montréal(蒙特利尔理工学院) Université du Québec à Montréal(魁北克大学蒙特利尔分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出首个可解释框架,通过行人跟踪、活动识别、站台语义分割和轨迹风险热图建模,从监控视频中评估自杀风险,在真实数据上达到83.2% ROC-AUC。

Comments 9 pages, 6 figures, 1 table. Accepted for Publication in the International Joint Conference of Artificial Intelligence (IJCAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25447 2026-05-26 cs.CL 57%

GeoSVG-RL: Geometry-Aware Reinforcement Learning for Layout-Constrained Text-to-SVG Diagram Generation

GeoSVG-RL:面向布局约束的文本到SVG图表生成的几何感知强化学习

Sifan Li, Yujun Cai, Hongkai Chen, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) The University of Queensland(昆士兰大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 视觉空间推理 :verifier(abstract);分类 cs.CL

AI总结 提出GeoSVG-RL框架,通过强化学习优化策略,利用几何反馈奖励(渲染有效性、画布适配、锚点放置、文本包含、图一致性和代码整洁性)解决文本到SVG图表生成中的结构脆弱性问题,显著提升箭头锚点精度和文本框内率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23764 2026-05-26 cs.CV cs.CL 57%

MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence

MMSI-Bench:多图像空间智能基准

Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 提出MMSI-Bench基准,通过1000道精心设计的VQA问题评估多图像空间推理能力,发现现有模型准确率远低于人类。

Comments ICLR 2026 Camera ready. 38 pages. Project page: https://runsenxu.com/projects/MMSI_Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23898 2026-05-25 cs.AI 57%

SPACENUM: Revisiting Spatial Numerical Understanding in VLMs

SPACENUM: 重新审视视觉语言模型中的空间数值理解

Jianshu Zhang, Yijiang Li, Huifeixin Chen, Haoran Lu, Letian Xue, Bingyang Wang, Han Liu

机构 * Northwestern(西北大学) UCSD(加州大学圣地亚哥分校) USC(南加州大学) GaTech(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出SpaceNum框架,通过Num2Space和Space2Num双向任务评估VLM在动态过渡和静态布局中对空间数值的理解,发现模型依赖浅层空间线索,难以建立稳定的坐标感知表示。

Comments Project page: https://sterzhang.github.io/SpaceNum-Home

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23883 2026-05-25 cs.CV cs.AI 57%

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

PGT: 用于提升多模态大语言模型视觉定位的程序化生成任务

Rim Assouel, Amir Bar, Michal Drozdzal, Adriana Romero-Soriano

机构 * Mila - Qu\'ebec AI Institute FAIR at Meta Superintelligence Labs McGill University Canada CIFAR AI Chair

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出程序化生成任务(PGT)框架,通过叠加几何基元生成密集监督信号,解耦视觉定位能力与语义先验,显著提升多模态大语言模型在细粒度理解任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23771 2026-05-25 cs.CV cs.AI cs.MA 57%

PhotoFlow: Agentic 3D Virtual Photography Missions

PhotoFlow: 智能体式3D虚拟摄影任务

Jiarui Guo, Haojia Wei, Yiming Zhang, Yifei Liu, Yuning Gong, Hongjie Zhang, Xue Yang, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) University of California, Los Angeles(加州大学洛杉矶分校) Cornell University(康奈尔大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出PhotoFlow智能体框架,通过导演-评审-反思闭环搜索机制,在任意Blender场景中根据语言指令自动完成虚拟摄影,并引入VPhotoBench基准,实验表明其在外观质量对齐和成功率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17015 2026-05-25 cs.CV cs.CL 57%

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解

Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang

机构 * FAIR, Meta(FAIR,Meta) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。

Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09583 2026-05-25 cs.RO cs.AI 57%

AirVista-II: An Agentic System for Embodied UAVs Toward Dynamic Scene Semantic Understanding

AirVista-II:面向动态场景语义理解的具身无人机智能体系统

Fei Lin, Yonglin Tian, Tengchao Zhang, Jun Huang, Sangtian Guan, Fei-Yue Wang

机构 * Department of Engineering Science, Faculty of Innovation Engineering, Macau University of Science and Technology(创新工程学院工程科学系,澳门科学技术大学) State Key Laboratory for Management and Control of Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院自动化研究所) State Key Laboratory for Management and Control of Complex Systems, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AirVista-II端到端智能体系统,通过集成智能体任务识别调度、多模态感知和差异化关键帧提取策略,实现零样本下无人机动态场景的通用语义理解与推理。

Journal ref Proc. 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC), pp. 6319-6324, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16416 2026-05-22 cs.CV cs.AI 57%

Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models

Circle-RoPE: 用于大视觉-语言模型的锥形解耦旋转位置嵌入

Chengcheng Wang, Jianyuan Guo, Hongguang Li, Yuchuan Tian, Ying Nie, Chang Xu, Kai Han

机构 * Huawei Noah's Ark Lab.(华为诺亚实验室) City University of Hong Kong.(香港城市大学) University of Sydney.(悉尼大学) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学人工智能国家重点实验室,智能科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Circle-RoPE,通过将图像标记坐标映射到与文本位置轴正交的圆环上,实现跨模态位置解耦,同时保留图像内部空间结构,并通过交替几何编码增强跨模态位置解耦和细粒度图像空间结构保留。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21796 2026-05-22 cs.CV cs.CL 57%

MM-Conv: A Multimodal Dataset and Benchmark for Context-Aware Grounding in 3D Dialogue

MM-Conv: 一种多模态数据集和基准,用于上下文感知的3D对话中指代解析

Anna Deichler, Jim O'Regan, Fethiye Irmak Dogan, Lubos Marcinek, Anna Klezovich, Iolanda Leite, Jonas Beskow

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种多模态数据集和基准,用于在动态3D环境中实现上下文感知的指代解析,通过引入包含6.7小时第一人称VR交互的同步语音、动作、注视和3D场景几何数据的基准,以及一个两阶段的指代解析流水线,改进了对话中的指代解析性能。

Comments Extended version of the paper published at LREC 2026 (Palma de Mallorca, Spain), with expanded VLM baselines and inter-annotator agreement analysis

Journal ref Proceedings of the 15th Language Resources and Evaluation Conference (LREC 2026), Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21622 2026-05-22 cs.AI 57%

TO-Agents: A Multi-Agent AI Pipeline for Preference-Guided Topology Optimization

TO-Agents:一种用于基于偏好的拓扑优化的多智能体AI流水线

Isabella A. Stewart, Hongrui Chen, Faez Ahmed

机构 * Department of Mechanical Engineering Massachusetts Institute of Technology Cambridge, MA, 02139 USA(机械工程系 马萨诸塞理工学院 哥伦布, 马萨诸塞州, 02139 美国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TO-Agents,一种多智能体AI框架,通过将自然语言设计意图与迭代拓扑优化相结合,解决设计者手动转换非直接关联的偏好到求解器设置的问题,并在两个长周期设计任务中验证了其有效性。

Comments Accepted for publication in the Proceedings of the ASME 2026 International Design Engineering Technical Conferences (IDETC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏