arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 193
2608.01635 2026-08-04 cs.CV 新提交

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00694 2026-08-04 cs.CV 新提交

E2Pano: Learning Event-to-Panorama Image Reconstruction

E2Pano:学习从事件数据到全景图像的重建

Zhenyang Li, Zongqi He, Jia Pan, Shijie Lin, Yifan Peng

机构 * The University of Hong Kong(香港大学)

AI总结 提出几何引导的事件到全景图像重建框架E2Pano,结合球面Transformer与频域监督,构建含4370个合成及30个真实场景的PanoScan数据集,实现高质量低计算成本的全景图像重建。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00635 2026-08-04 cs.RO 新提交

FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation

FlowPilot:面向敏捷无人机导航的实时世界-动作建模

Runqing Wang, Ding Yu, Pengyuan Min, Xinhong Zhang, Wei Xiao, Yu Hu, Jie Chen, Fu Zhang, Gang Wang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

AI总结 FlowPilot是一种基于流匹配的紧凑世界-动作模型,采用双流混合Transformer,在三级深度金字塔数据上训练,可实现敏捷无人机实时导航,性能优于基线,能在杂乱环境中以5.5m/s速度运行。

Comments 8 pages, 9 figures, 2 tables, submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00019 2026-08-04 cs.LG cs.AI 新提交

Uncertainty-Aware Simulation-Based Inference for Operations Research with Large Language Models

面向运筹学的基于模拟的不确定性感知大语言模型推理

Liang Guo, Lin Shaochong, Shen Zuo-Jun Max, Zhang Kun

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) The University of Hong Kong(香港大学) School of Information, Renmin University of China(中国人民大学信息学院)

AI总结 本文针对大语言模型用于运筹学建模时的短视策略易引发下游错误的问题,提出一种不确定性感知无训练推理框架,通过短前瞻模拟与重要性重采样提升OR公式生成的可靠性,在多基准上表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29464 2026-08-03 cs.RO cs.SY eess.SY 新提交

Automated Straight-line Sewing of Stretchable Fabrics with Different Lengths

不同长度可拉伸织物的自动直线缝纫

Bingchen Jin, Akinari Kobayashi, Dipankar Bhattacharya, Akira Seino, Fuyuki Tokuda, Norman Chihnan Tien, Kazuhiro Kosuge

机构 * The University of Hong Kong(香港大学) Centre for Transformative Garment Production(创新服装生产中心)

AI总结 本研究针对不同长度可拉伸织物的直线自动化缝纫难题,提出新型机器人缝纫系统DLRoSS,通过四阶段流程实现对齐缝纫,实验验证其可完成不同材料和长度织物的高质量缝纫。

Comments 9 pages. Published in IEEE Robotics and Automation Letters, 2025

Journal ref IEEE Robot. Autom. Lett. 10 (2025) 12165-12172

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28374 2026-07-31 cs.LG 新提交

LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理

Enjun Du, Hange Zhou, Chenxu Du, Siyi Liu, Zirong Chen, Ziyu Zheng, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Tsinghua University(清华大学) University of Sussex(萨塞克斯大学)

AI总结 该研究提出LedgerMind,通过结构化证据账本及三层依据协议等组件,解决多模态智能体推理中最终答案准确率无法反映轨迹可信度的问题,在多模态基准上同时提升了答案准确率与轨迹可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27378 2026-07-31 cs.CV cs.MM 新提交

PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology

PanDent:面向牙科放射学中全面的牙级结构-语言一致性

Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) Imperial College London(帝国理工学院) University of Science and Technology of China(中国科学技术大学) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27248 2026-07-31 cs.AI cs.LG 新提交

Divergence Decoding: Training-Free Capability Fusion

分歧解码:无训练的能力融合

Yimi Wang, Hao Li, Shuo Yang, He Cao, Dechen Zhang, Ziang Wu, Zhiyuan Yan, Fanyang Mo, Li Yuan

机构 * Peking University(北京大学) International Digital Economy Academy (IDEA)(国际数字经济学院) The University of Hong Kong(香港大学)

AI总结 针对通用大模型缺领域知识、专家模型逻辑弱的问题,提出无训练的Divergence Decoding框架,通过Jensen-Shannon散度自适应路由,在科学基准上融合两类模型能力,性能优于单模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25912 2026-07-29 cs.RO cs.AI 新提交

SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

用于视觉-语言-动作模型的SAM3D引导的以对象为中心的表示对齐

Zonghe Liu, Shanyuan Jie, Xiaoquan Sun, Chen Cao, Zetian Xu, Zongsheng Liu, Jiayu Chen

机构 * University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Huazhong University of Science and Technology(华中科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Infiforce(英飞拓)

AI总结 针对视觉-语言-动作模型缺乏目标对象细粒度3D理解的问题,提出以对象为中心的3D表示对齐框架,利用SAM3D提供3D先验,经定位、生成掩码、提取表示等步骤与视觉特征对齐,实验证明其可提升模型性能,尤其在长时操纵场景有效。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25397 2026-07-29 cs.RO 新提交

Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations

分解与重组:利用从示范中学到的原语和视觉运动策略进行规划

Yizhou Chen, Hang Xu, Dongjie Yu, Yupu Lu, Tengye Xu, Zeqing Zhang, Wei Zhang, Yi Ren, Ben M. Chen, Jia Pan

机构 * The University of Hong Kong(香港大学) JD.com (JingDong)(京东) Nanyang Technological University (NTU)(南洋理工大学) Southern University of Science and Technology (SUSTech)(南方科技大学) Huawei Technologies(华为技术有限公司) The Chinese University of Hong Kong (CUHK)(香港中文大学)

AI总结 研究如何使机器人灵巧、长视野操作自动化,提出DR-LfD框架,将视觉运动策略集成到TAMP决策系统,基于接触关系分解示范为原子技能,经实验验证该框架在多类任务中性能强大。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25210 2026-07-29 cs.CV 新提交

ObliCity: A Benchmark and Baseline for Roof-to-Ground Projection Displacement Correction

ObliCity:屋顶到地面投影位移校正的基准和基线

Kai Li, Yupeng Deng, Ligao Deng, Zhihao Xi, Chenhao Wang, Jierui Zhang, Yingrui Ji, Yu Meng, Xiangyu Zhao

机构 * School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) College of Computing, Department of Data Science, City University of Hong Kong(香港城市大学计算学院数据科学系) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电气与计算机工程系)

AI总结 研究斜视图城市遥感影像中屋顶到地面投影位移校正问题,提出将RFOV提取设为独立任务,引入数据集ObliCity,改进DragOSM为DragRoof,实验证明DragRoof性能最优,为投影位移校正奠定基础。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23854 2026-07-28 cs.AI 新提交

Understanding Human-like Solutions in Combinatorial Optimization via Learning and Search

通过学习和搜索理解组合优化中类人解决方案

Haijiang Yan, Jian-Qiao Zhu, Liqiang Huang, Ming Meng

机构 * The University of Warwick(华威大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) South China Normal University(华南师范大学) The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

AI总结 研究欧几里得旅行商问题中人类如何找到接近最优解,通过大规模行为和计算研究,对比人类与基于指针网络的神经策略,发现类人解决方案或源于结构化监督学习、强化学习及测试时搜索的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23514 2026-07-28 cs.CL cs.AI cs.MM 新提交

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

机构 * Hong Kong Baptist University(香港浸会大学) The University of Hong Kong(香港大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23504 2026-07-28 cs.CV 新提交

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

MemVLN:用于视觉与语言导航的情景记忆和程序记忆

Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) LIGHTSPEED(光速) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究连续环境中视觉与语言导航问题,提出MemVLN框架,利用视觉编码器、大语言模型,通过情景记忆管理和程序记忆,实现实时推理,提升导航成功率并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22494 2026-07-27 cs.MM cs.CV 新提交

CARA: Concept-Aware Risk Attention for Interpretable Collision Anticipation

CARA:用于可解释碰撞预测的概念感知风险注意力

Zhishan Tao, Ruoyu Wang, Yucheng Wu, Enjun Du, Yilei Yuan, Sherwin Ho, Yue Su, Jinbo Su, Yi Hong

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Pennsylvania(宾夕法尼亚大学) Renmin University of China(中国人民大学)

AI总结 研究自动驾驶碰撞预测问题,提出CARA框架,从事故叙述中获取风险概念并与视频帧对齐成轨迹,将语义风险因素作为动态证据,结合可解释性与预测过程,实验证明其能提高预测准确性和预警及时性。

Comments Accepted to ACM Multimedia 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21354 2026-07-24 cs.AI 新提交

SPORD: A Simulation-Propose-then-OR-Dispose Approach for Supply Chain Planning

SPORD:一种用于供应链规划的模拟-提出-然后-优化-处置方法

Jiayin He, Yutong Pan, Sen Yang, Ningxuan Kang, Yongzhi Qi, Jianshen Zhang, Wei Qi, Zuo-Jun Max Shen

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) College of Engineering, UC Berkeley(加州大学伯克利分校工程学院) Faculty of Business and Economics, University of Hong Kong(香港大学经管学院)

AI总结 针对电商供应链规划中孤立项目及面临的难题,提出模拟-提出-然后-优化-处置方法(SPORD)及NetSim平台,通过解耦实现加速模拟与操作闭环,应用后提升服务质量、降低履约率并实现碳减排,推动模拟用于主动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19404 2026-07-23 cs.LG cs.AI 新提交

Structured Latent Space Modeling over Multi-Scale Temporal Patches for Multivariate Time Series Forecasting

基于多尺度时间片的结构化潜空间建模用于多元时间序列预测

Xingsheng Chen, Deyu Yi, Siu-Ming Yiu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Innovation Engineering College, Macau University of Science and Technology(澳门科技大学创新工程学院)

AI总结 研究针对多元时间序列预测,提出基于卷积神经网络的M2Patch架构,通过多尺度切片、深度可分离卷积等提取特征并压缩成潜表示,利用尺度内和尺度间约束组织潜空间,在多个基准测试中成绩优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18336 2026-07-22 cs.MM cs.CL cs.LG 新提交

EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation

EmoEUS:对话中多模态情感识别的不确定性监督

Zilong Huang, Kong Aik Lee, Junjie Li, Zhe Li, Man-Wai Mak

机构 * Dept. of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) Speech, Language, and Cognition Laboratory, The University of Hong Kong(香港大学语音、语言与认知实验室)

AI总结 研究对话中多模态情感识别,提出EmoEUS框架,通过动态加权模态执行不确定性感知多模态融合,并引入显式监督损失,实验证明该框架优于现有方法。

Comments Accept by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18242 2026-07-22 cs.AI cs.MA cs.NI 新提交

AI Tool Discovery at Scale: All You Need is DNS

大规模人工智能工具发现:你所需要的只是DNS

Enhao Chen, Yulin Shao

机构 * The University of Hong Kong(香港大学)

AI总结 针对自主人工智能代理时代工具发现难题,提出ToolDNS框架,通过嵌入意图和信任将语义搜索转为轻量级名称解析,引入三项增强。经大规模基准测试验证,其在减少搜索空间和降低延迟方面效果显著,证明可通过利用现有基础设施实现可扩展的AI互操作性。

Comments keywords: AI tool discovery, ToolDNS, Agent, DNS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17810 2026-07-21 cs.CV cs.AI cs.HC 新提交

Vis2Reg: Visibility-Aware Landmark-Free Geometric 3D--2D Registration for Liver Laparoscopy

Vis2Reg:用于肝脏腹腔镜检查的可见性感知无标记几何3D-2D配准

Jiaming Feng, Xukun Zhang, Shahid Farid, Sharib Ali

机构 * AI in Medicine and Surgery Group, School of Computer Science, University of Leeds(利兹大学计算机学院医学与外科人工智能小组) Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院放射诊断学系) Department of HPB and Transplant Surgery, St. James’s University Hospital(圣詹姆斯大学医院肝脏胰胆和移植外科)

AI总结 针对AR引导腹腔镜手术中3D-2D肝脏配准难题,提出Vis2Reg框架,利用掩码一致可见区域约束变形,引入可见性感知自监督,结合刚性初始化模块与隐式神经变形场,在真实数据集上验证了准确性与效率。

Comments 11 pages

Journal ref 29th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI'2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17598 2026-07-21 cs.AI cs.CL cs.SE 新提交

Is Progressive Disclosure All You Need for Long-Context Agents?

长上下文智能体仅靠渐进式披露就够了吗?

Yifeng He, Yinzhe Zhao, Jicheng Wang, Hao Chen

机构 * University of California, Davis(加利福尼亚大学戴维斯分校) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

AI总结 研究长文档问答中智能体获取文档路径自行决定读取内容的模式,通过对照研究,在InfiniteBench上对比原始文档导航、Agent Skills包设计与经典混合检索器,发现不同情况下各方法表现不同,渐进式披露在语料库大时作用关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17593 2026-07-21 cs.CV 新提交

Miles: Metric Learning with Expandable Subspace for Pre-Trained Model-Based Class-Incremental Learning

Miles:基于预训练模型的类增量学习的可扩展子空间度量学习

Kai Jiang, Zisong Lin, Hongyuan Zhang, Xueru Bai, Xuelong Li

机构 * National Key Laboratory of Radar Signal Processing, Xidian University(西安电子科技大学雷达信号处理国家重点实验室) The University of Hong Kong(香港大学) Institute of Artificial Intelligence (TeleAI) of China Telecom(中国电信人工智能研究院)

AI总结 研究基于预训练模型的类增量学习问题,提出Miles方法,通过解耦可学习模块与预训练模型,利用骨干网络中间特征先验信息实现参数空间高效扩展,经实验验证在多种CIL设置中性能领先。

Comments This work has been accepted by IEEE Transactions on Image Processing

Journal ref IEEE Transactions on Image Processing, early access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17093 2026-07-21 cs.CV 新提交

Autoregressive B-Rep Shape Generation with Parametric Surfaces

基于参数曲面的自回归 B-Rep 形状生成

Dafei Qin, Rui Xu, Zeyu Shen, Kaichun Qiao, Hongyang Lin, Qixuan Zhang, Huaijin Pi, Lan Xu, Jingyi Yu, Wenping Wang, Taku Komura

机构 * The University of Hong Kong(香港大学) Deemos Technology Co., Ltd.(迪莫斯科技有限公司) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ShanghaiTech University(上海科技大学) Texas A&M University(德克萨斯A&M大学)

AI总结 研究提出 ParaCAD 自回归框架,用于点云条件 B-Rep 生成,直接在原生参数曲面上运行,通过以曲面为中心的令牌化编码面信息,先生成参数曲面再构建 B-Rep,实验证明其在多方面优于基于点的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16859 2026-07-21 cs.CV 新提交

Dataset Distillation by Influence Matching

通过影响匹配进行数据集蒸馏

Haoru Tan, Wang Wang, Sitong Wu, Xiuzhe Wu, Yangtian Sun, Chirui Chang, Shaofeng Zhang, Xiaojuan Qi

机构 * HKU(香港大学) CUHK(香港中文大学) Stanford(斯坦福大学)

AI总结 从结果角度重审数据集蒸馏,提出影响匹配方法,通过可微估计器量化参数变化,学习合成集使影响与真实数据集匹配,在分类和视觉语言蒸馏任务中表现出色,超越基线。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16851 2026-07-21 cs.AI 新提交

AgentBrew: Lifelong Knowledge Brewing from Strong Teachers to Weak LLM Agents

AgentBrew:从强大教师到弱小语言模型智能体的终身知识酿造

Yangqin Jiang, Chao Huang

机构 * The University of Hong Kong(香港大学)

AI总结 研究语言模型智能体知识酿造问题,提出AgentBrew方法,含失败触发教师和学生感知合成两个组件,无需训练,能将教师交互经验提炼到学生外部记忆,经实验验证可产生强大且可部署的智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15772 2026-07-20 cs.CV 新提交

SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation

SlotMem:用于叙事长视频生成的字符可寻址内部存储器

Yilai Liu, Xin Zhang, Shiyuan Zhang, Hongyang Du

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

AI总结 研究针对叙事长视频生成中保持角色身份的挑战,提出SlotMem框架,通过字符语义探测器定位视觉令牌,记忆编码器压缩记忆,记忆写入器更新记忆,逐角色交叉注意力检索记忆,提升了远程角色一致性与视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15211 2026-07-17 cs.CV 新提交

MAGiSt3R: Multi-Agent Feed-forward 3D Reconstruction from Monocular RGB Videos

MAGiSt3R:基于单目RGB视频的多智能体前馈3D重建

Ziren Gong, Xiaohan Li, Fabio Tosi, Ninghui Xu, Stefano Mattoccia, Jianfei Cai, Matteo Poggi

机构 * University of Bologna(博洛尼亚大学) The University of Hong Kong(香港大学) Southeast University(东南大学) Monash University(莫纳什大学)

AI总结 研究基于单目RGB视频的多智能体3D重建问题,核心方法是用3R家族前馈模型和MAGMA合并模型,并进行姿态图优化,主要贡献是在合成和真实数据集上验证该框架相比现有方法有更高重建和相机跟踪精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15054 2026-07-17 cs.CV 新提交

Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding

超越单一专家:在多模态大语言模型中协调多样视觉先验以实现空间理解

Xiao Lin, Xiaohu Huang, Kai Han

机构 * The University of Hong Kong(香港大学)

AI总结 研究旨在提升多模态大语言模型的空间理解能力,提出ViPS框架,通过高效先验代理和动态先验融合机制,整合不同模型的视觉先验,经实验验证该框架能协调多样先验,在多基准测试中取得新的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15004 2026-07-17 cs.RO 新提交

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking

CosFly-VLA:一种用于无人机跟踪的空间感知视觉-语言-动作模型

Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo, Ji Pei, Da Zhang, Kangli Wang

机构 * Autel Robotics(大疆创新科技有限公司) Northeast Normal University(东北师范大学) Southern University of Science and Technology(南方科技大学) Peking University(北京大学) University of Hong Kong(香港大学)

AI总结 针对复杂城市环境中无人机动态目标跟踪问题,提出CosFly-VLA模型,通过结构化预测接口联合定位目标、估计可见性并生成飞行动作。经多阶段训练,该模型在开环误差和闭环成功率上有显著提升,实现从可见帧模仿到空间基础动作闭环控制的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏