arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4109 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 381 篇

2607.21036 2026-07-24 cs.CV 新提交 50%

GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation

GeoThreat:用于遥感图像解释的大型视觉语言模型的可转移目标对抗攻击

Yimin Fu, Yuefeng Bai, Baicheng Pan, Zhunga Liu, Michael K. Ng

机构 * Department of Mathematics, Hong Kong Baptist University(香港浸会大学数学系) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对大型视觉语言模型在遥感图像解释中的对抗攻击问题,提出GeoThreat方法,通过在概念和感知层面调制对抗表示,结合对抗目标相似性梯度等技术,实现可转移目标对抗攻击,实验证明该方法在可转移性和可控性上具有优越性。

Comments The code will be released at https://github.com/fuyimin96/GeoThreat upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21025 2026-07-24 cs.RO 新提交 50%

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

ZONDA:多楼层环境中具有动态避障功能的零样本目标导航

Shaomin Liang, Xuanhong Liao, Shiyao Zhang

机构 * Southern University of Science and Technology(南方科技大学) Guangdong Direct Drive Technology Limited(广东直驱技术有限公司) South China University of Technology(华南理工大学) Great Bay University(大湾区大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 研究针对目标导航任务中现有方法局限,提出ZONDA框架,集成启发式多楼层规划、多视图目标验证、动态行人避障三个核心组件,通过真实机器人及模拟测试取得显著改进结果,在动态基准测试中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20990 2026-07-24 cs.ET 新提交 50%

LivePhys: Transforming Static Physics Problems into Interactive Simulations via a Scan-to-Play Framework

LivePhys:通过扫描即播放框架将静态物理问题转化为交互式模拟

Xiaowei Dai, Ziyu Luo, Xiangwen Zhang, Xiaoming Chen, Juan Wu, Yonghong Ke

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对教科书中静态物理问题学习的高认知负担,提出LivePhys框架,通过多模态处理构建中间表示,用大语言模型推理并由物理引擎执行生成交互式模拟,显著提升模拟性能并降低学习者认知负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19850 2026-07-23 cs.RO 新提交 50%

SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

SOPD-SocialNav:用于视觉语言社交导航的选择性在线策略蒸馏

Xinyu Zhang, Zishuo Wang, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术研究生院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对大规模视觉语言模型难部署、轻量级模型社交推理能力不足的问题,提出SOPD-SocialNav方法,通过基于熵的令牌选择机制及温度控制的散度目标,将社交导航知识从大型教师模型转移到轻量级学生模型,实验证明该方法有效。

Comments This paper has been accepted to 2026 WRC Symposium on Advanced Robotics and Automation (WRC SARA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19370 2026-07-23 physics.ao-ph 新提交 50%

Aircast-Mars: A Mars Foundation Model for Global Weather Forecasting with HEALPix-Aware Convolutions

Aircast-Mars:一种用于全球天气预报的火星基础模型,采用HEALPix感知卷积

Manmeet Singh, Saptarishi Dhanuka, Naveen Sudharsan, Houman Owhadi, Krista M. Soderlund, Alphan Altinok

专题命中 视觉空间推理 :planning(abstract)

AI总结 研究针对火星天气预报,提出基于EMARS v1.0训练的Aircast-Mars系统。采用HEALPix感知二维U-Net架构,结合自定义填充和ConvNeXt残差块。该模型参数少、速度快,验证MSE低,能稳定递归预测,为行星尺度天气预报提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19115 2026-07-22 cs.CV 新提交 50%

CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval

CR-Refiner:用于编辑条件3D场景检索的以对象为中心的最优传输重排器

Hao Wu, Jinjing Zhu, Nanyu Wu, Qianyi Cai, Heyi Lin, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉空间推理 :verifier(abstract)

AI总结 研究编辑条件3D场景检索问题,提出CR-Refiner重排器,通过冻结语言模型解析编辑、不平衡最优传输问题评分候选对象、轴条件结构先验及语言模型验证器细化结果,在不同基础检索器上提升了硬子集检索指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18078 2026-07-21 cs.CV 新提交 50%

VGOcc: Learning Visual-Geometric Gaussians for Vision-Centric 3D Driving Occupancy Prediction

VGOcc:学习视觉几何高斯用于以视觉为中心的3D驾驶占用预测

Junhong Lin, Xianda Guo, Kangli Wang, Yuqi Ye, Xiaoyu Liang, Yanlun Peng, Wei Gao

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究仅视觉3D驾驶占用预测问题,提出VGOcc方法,通过从基础模型学习视觉和几何线索,纳入高斯建模的初始化与细化,实现高效语义占用预测,在nuScenes实验中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17767 2026-07-21 cs.RO 新提交 50%

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

VLN-AVP:用于自动代客泊车的基于混合长短时记忆的零样本视觉语言导航

Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对自主代客泊车依赖预建地图限制可扩展性问题,提出VLN-AVP零样本导航框架,结合BEV模型与VLM,引入混合记忆系统,构建数据集和基准,实验证明该方法在模拟和实际车辆实验中均有良好效果,提升了成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16920 2026-07-21 cs.RO cs.SE 新提交 50%

A BIM-enabled, Agent-based Discrete-event Simulation Platform for Robotic Studies: A Method based on Graph Theory

一种用于机器人研究的基于BIM和智能体的离散事件模拟平台:一种基于图论的方法

Ping Xu, Xinghua Gao

专题命中 视觉空间推理 :planning(abstract)

AI总结 研究针对室内机器人复杂任务中建筑信息利用不足问题,提出基于BIM和智能体的模拟平台,将室内环境映射为图,用图论算法规划导航路径,经模拟验证其有效性,为BIM智能机器人系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16280 2026-07-21 cs.CV 新提交 50%

3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism

3D FaceShell:作为视觉语言模型防御机制的3D人脸头像属性转移

Weston Bondurant, Srijan Das, Hieu Le, Stephanie Schuckers

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对VLM可从3D人脸渲染图像提取敏感属性的隐私挑战,提出3D FaceShell框架,通过可学习高斯壳产生扰动,在保持面部外观的同时引导VLM语义解释,实验证明其能有效提高属性注入和不匹配率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15888 2026-07-20 cs.CY cs.HC 新提交 50%

Red Light, Grey Zone: A Multi-Perspective Interactive Narrative for Autonomous Driving Ethics

红灯,灰色地带:自动驾驶伦理的多视角交互式叙事

Mengyi Wei, Nianhua Liu, Chenyu Zuo, Liqiu Meng

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究自动驾驶伦理这一公共问题,提出多视角交互式叙事方法,通过“红灯,灰色地带”原型展开研究。经探索性用户研究发现,该方法能支持非专家对人工智能系统中的问责、证据和治理进行反思,尤其在责任判断等方面有积极效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15758 2026-07-20 cs.RO 新提交 50%

SkillNav: Score-Level Skill Intervention for Zero-Shot Object Goal Navigation

SkillNav:用于零样本对象目标导航的分数级技能干预

Ruijie Sang, Yiqun Duan, Pinhan Fu, Ruilin Wang, Wei Sui, Xianda Guo

机构 * D-Robotics(D-机器人公司) HAI Center, University of Technology Sydney(悉尼科技大学HAI中心) School of Computer Science, Wuhan University(武汉大学计算机科学学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对VLM智能体零样本对象目标导航存在的问题,提出SkillNav框架,通过分层技能设计及双表示设计,无需训练,在多个数据集上提升成功率,建立新最优成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15054 2026-07-17 cs.CV 新提交 50%

Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding

超越单一专家:在多模态大语言模型中协调多样视觉先验以实现空间理解

Xiao Lin, Xiaohu Huang, Kai Han

机构 * The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究旨在提升多模态大语言模型的空间理解能力,提出ViPS框架,通过高效先验代理和动态先验融合机制,整合不同模型的视觉先验,经实验验证该框架能协调多样先验,在多基准测试中取得新的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14586 2026-07-17 cs.RO 新提交 50%

SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation

SoftNav:将3D场景令牌注入视觉语言模型以进行具身导航

Yi Wu, Junjie An, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, Shuyang Yu, You Wang, Guang Li

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对具身导航中3D场景理解与导航推理协同问题,提出SoftNav方法,通过轻量级投影仪将3D连续表示作为软令牌注入VLM隐藏空间,在HM3D-OVON上超越先前方法,且能零样本转移到其他场景,弥合表征差距实现可转移导航。

Comments 8 pages, 6 figures. Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14497 2026-07-17 cs.CV 新提交 50%

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

通过自我场景增强在多模态大语言模型中强化自我中心空间感知

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。

Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: https://github.com/Chikit-WONG/spatialGraph

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13461 2026-07-16 cs.RO 新提交 50%

Joint On-and-Off Policy Learning for Vision-and-Language Navigation

用于视觉与语言导航的联合在线与离线策略学习

Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

机构 * Joy Future Academy(京东探索研究院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究视觉与语言导航问题,提出JOP-VLN框架,通过三阶段训练流程,协同结合离线策略模仿学习和在线策略探索,采用高熵轨迹采样和纠错优先轨迹排序策略,在相关基准上取得高成功率,创技术新水平。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13245 2026-07-16 cs.CV cs.RO 新提交 50%

Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics

即时场景图增长:应对长期机器人感知饱和

Yue Chang, Rufeng Chen, Yifan Tian, Dazhi Huang, Zhaofan Zhang, Yi Chen, Wenze Zhang, Li Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对长期机器人任务中传统3D场景图构建方式导致感知饱和的问题,提出JITOMA闭环框架,利用任务热图过滤观察、大语言模型解析意图动态唤醒锚点,经JITOMA-Bench评估,该框架有效减小图大小和延迟,保持处理时间稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12429 2026-07-15 cs.CV 新提交 50%

More Than Where You Are: Learning Semantics, Structure, and Geometry from Cross-View Localization

不仅仅是你在哪里:从跨视图定位中学习语义、结构和几何

Mao Chen, Xiangkai Zhang, Zhiyong Liu, Chuankai Liu, Xu Yang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Aerospace Control Center(北京航天飞行控制中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究如何在极端视角变化下通过跨视图定位让模型学习语义、结构和几何。提出CROSS框架,克服现有方法局限,经实验验证该框架在跨视图定位中性能最优,能有效学习多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09716 2026-07-14 cs.RO 新提交 50%

RoboNav-Arm: Agentic AI-Driven Navigation and Obstacle Avoidance for Robotic Manipulator in Cluttered Environments

RoboNav-Arm:杂乱环境中机器人操纵器的智能AI驱动导航与避障

Aachal Sharma, Narendra Kumar Dhar

机构 * Centre for Artificial Intelligence and Robotics (CAIR), Indian Institute of Technology Mandi(人工智能与机器人中心(CAIR),印度曼迪理工学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 针对杂乱环境中机器人操纵器面临的挑战,提出含环境、中央协调和规划模块的安全任务执行框架,能实时检测与定位障碍物,依环境选算法规划轨迹并优化,在Gazebo Classic中评估,展现动态场景鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09169 2026-07-13 cs.CV 新提交 50%

TSR-Ego: Temporally Guided Stereo Refinement Framework for Egocentric 3D Human Pose Estimation

TSR-Ego:用于自中心3D人体姿态估计的时间引导立体细化框架

Md Mushfiqur Azam, John Quarles, Kevin Desai

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对自中心3D人体姿态估计难题,提出TSR-Ego框架,结合短期运动证据与投影引导特征采样,通过因果深度可分离时间卷积和多种自注意力机制细化3D关节查询,实验证明其性能领先,尤其在真实世界序列中优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08798 2026-07-13 cs.GR cs.CV 新提交 50%

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

GReFEM:多模态大语言模型作为用于物理引导的3D网格细化的零样本语义助手

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling(材料系统建模研究所) Helmholtz Zentrum Hereon(海德堡研究中心Hereon) Institute of Material and Process Design(材料与加工设计研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究探索多模态大语言模型能否作为有限元网格细化的零样本几何代理,引入GReFEM框架及orthoViews视图选择模块,经实证评估发现其展示出强大零样本能力,能准确遵循复杂指令,比盲目启发式方法更精确,定义了基础模型在自动模拟中作为语义助手的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07880 2026-07-10 cs.CV 新提交 50%

GIRAF: Towards Generalizable Human Interactions with Articulated Objects

GIRAF:迈向与关节物体的可泛化人类交互

Xiaohan Zhang, Sebastian Starke, Alexander Winkler, Federica Bogo, Samir Aroudj, Yuting Ye

机构 * Meta

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对合成与关节物体的逼真全身人类交互难题,现有模型有局限。本文提出文本条件扩散模型,通过以物体为中心的表示、混合域训练策略和基于接触的增强方案应对挑战,实验证明其对未见物体配置泛化能力强,超越现有方法。

Comments 12 pages, 6 figures, 3 tables. Accepted at the Third Workshop on Human Motion Generation (HuMoGen), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06564 2026-07-08 cs.RO cs.CV 新提交 50%

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Lift3D-VLA:将VLA模型提升到3D几何和动力学感知操纵

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * Peking University(北京大学) CUHK(香港中文大学) AI² Robotics(智平方科技)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对VLA模型在物理环境操纵中几何理解和空间推理不足的问题,提出Lift3D-VLA框架。通过增强2D模型提升策略、GC-MAE自监督框架及分层时间动作建模,提升模型3D几何和动力学感知能力,在模拟和现实任务中取得更好效果。

Comments 14 pages, 7 figures. Project website: https://lift3dvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05348 2026-07-07 cs.CV cs.RO 新提交 50%

Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis

超越孤立对象:基于3D场景图分析的关系感知开放词汇场景理解

Xianhao Chen, Jiarui Hu, Yuanbo Yang, Xiyu Zhang, Tengyue Wang, Hujun Bao, Guofeng Zhang, Zhaopeng Cui

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Zhejiang University(浙江大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对现有开放词汇3D理解方法忽略对象关系的问题,提出RelGraphOV框架,通过3D场景图与自适应门控双流式图注意力网络,提升场景理解性能与泛化性。

Comments Project Page: https://cxavireh.github.io/relgraphov-projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04860 2026-07-07 cs.CV cs.HC 新提交 50%

PAGE: Towards Practical Human-level Gaze Target Estimation

PAGE:迈向实用的人类水平注视目标估计

Zhoutong Ye, Chengwen Zhang, Zhaibin Cui, Mingze Sun, Jiaqi Liu, Xiangwu Li, Qingyang Wan, Chang Liu, Xutong Wang, Huan-ang Gao, Yu Mei, Chun Yu, Yuanchun Shi

机构 * Tsinghua University(清华大学) Jinan University(暨南大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出PaGE模型明确建模场景与头部特征交互,以大ViT-H+骨干模型为教师,在更大更多样未标注数据集上蒸馏轻量级学生模型,提升注视估计性能,缩小人机差距且便于实际部署。

Comments Project page: https://PaGE-26.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04352 2026-07-07 cs.CV 新提交 50%

Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach

无人机的最后一米精确导航:一种扩散细化的空中视觉伺服方法

Yaxuan Li, Jiarui Zeng, Shaofei Huang, Zhedong Zheng

机构 * FST and ICI, University of Macau(澳门大学科技学院及资讯与通信技术研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究无人机最后一米精确导航,提出DreamNav框架,先粗估计旋转,再用预训练世界模型模拟未来视觉观测选轨迹,贡献PairUAV基准测试,实验表明DreamNav性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04057 2026-07-07 cs.CV cs.RO 新提交 50%

PreSIST: Vision-Language-Informed Object Persistence Prediction in Open-World Scenes

PreSIST:开放世界场景中视觉-语言信息的对象持久性预测

Amanda Adkins, Tarunvidyut Ravisankar, Joydeep Biswas

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) National Science Foundation(美国国家科学基金会) ARO(美国陆军研究办公室) Amazon(亚马逊公司) JP Morgan(摩根大通公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究长期部署机器人对环境变化的推理,提出PreSIST方法,通过对象属性和场景上下文估计实例级持久性先验,结合概率持久性过滤器预测对象未来姿态,有两种变体,实验表明优于基线。

Comments 8 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03616 2026-07-07 cs.RO 新提交 50%

ROBOCYCLE: Autonomous Dual-Arm Robotic Manipulation and Coordination for Recycling Applications

ROBOCYCLE:用于回收应用的自主双臂机器人操作与协调

Rubén de J. Hilario-Cruz, Jesus A. García-González, Enrique Coronado, Arturo E. Cerón-López

机构 * Tecnologico de Monterrey, School of Engineering and Sciences, Department of Computer Science(墨西哥蒙特雷理工大学工程学院与科学学院计算机科学系) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 针对城市垃圾处理难题,介绍ROBOCYCLE平台,集成多视图RGB-D感知、基于变压器的实例分割及6自由度抓取规划,有效处理不规则和可变形垃圾,取得高成功率,为现实环境自主垃圾管理提供方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01885 2026-07-07 cs.CV 新提交 50%

Diversity-aware View Partitioning for Scalable VGGT

面向可扩展VGGT的多样性感知视图划分

Jinsoo Park, Donggyu Choi, Ahyun Seo, Minsu Cho, Jeany Son

机构 * POSTECH(浦项科技大学) GIST(光州科学技术院) KAIST(韩国科学技术院) RLWRLD

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对VGGT在大量视图下注意力计算成本高且冗余视图降低性能的问题,提出基于视觉差异和空间分散的图划分方法,将视图组织为多样性感知的平衡块,减少冗余注意力交互,提升相机位姿估计、多视图深度预测和3D重建性能。

Comments 34 pages, 11 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01812 2026-07-03 cs.CE 新提交 50%

TO-Master: an LLM-agent framework for automated topology optimization

TO-Master:用于自动化拓扑优化的大语言模型智能体框架

Haoju Lin, Wenchang Zhang, Weipeng Xu, Xiang Li, Tian Xu, Tianju Xue

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出TO-Master框架,利用大语言模型智能体将有限元拓扑优化转化为对话式工作流,通过自然语言指令自动完成几何处理、网格生成、边界条件设置和优化求解,无需用户编写代码。

Comments 29 pages, 10 figures, 2 tables; submitted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏