arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 91
2604.25693 2026-07-21 cs.AI 版本更新

RADD: Retrieval-Augmented Discrete Diffusion for Multi-Modal Knowledge Graph Completion

RADD:基于检索的离散扩散用于多模态知识图谱补全

Guanglin Niu, Bo Li

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院)

AI总结 本文提出RADD框架,通过分离检索与重排序过程,提升多模态知识图谱补全的性能,实验表明其在多个基准上表现最佳。

Comments 13 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02808 2026-07-21 cs.CV 版本更新

CMCC-ReID: Cross-Modality Clothing-Change Person Re-Identification

CMCC-ReID: 跨模态服装变化人员重识别

Haoxuan Xu, Hanzi Wang, Guanglin Niu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Informatics, Xiamen University(厦门大学信息学院)

AI总结 本文提出CMCC-ReID任务,解决跨模态和服装变化的人员匹配问题,构建SYSU-CMCC基准数据集,并提出PIA网络,通过DBDL和BPL模块提升重识别性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15079 2026-07-20 cs.AI 版本更新

BrainPilot: Automating Brain Discovery with Agentic Research

BrainPilot:通过智能研究实现大脑发现自动化

Haoxuan Li, Tianci Gao, Jianhe Li, Yang Fan, Runze Shi, Weiran Wang, Tianxiang Zhao, Zezhao Wu, Xiaoyang Jiang, Qihui Zhang, Jia Li, Xiao Xiao, Kai Du, Xiaoxuan Jia, Chao Xie, Lu Mi

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qizhi Institute(上海期智研究院) Business School, Renmin University of China(中国人民大学商学院) School of Physics, Beihang University(北京航空航天大学物理学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Behavioral and Cognitive Neuroscience Center, Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院行为与认知神经科学中心) College of Engineering, Georgia Institute of Technology(佐治亚理工学院工程学院) School of Life Sciences & IDG/McGovern Institute for Brain Research, Tsinghua University(清华大学生命科学学院&清华-IDG/麦戈文脑科学研究院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) Weixian College, Tsinghua University(清华大学未央学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)

AI总结 研究针对脑科学研究整合证据难、人工智能代理有缺陷的问题,提出完全开源的多智能体系统BrainPilot,它有可追溯日志和验证结果,含知识库与技能库,经实验评估,其开源模型以低成本达先进框架性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06818 2026-07-20 cs.LG 版本更新

Rethinking the Global Knowledge of CLIP in Training-Free Open-Vocabulary Semantic Segmentation

重新思考CLIP的全局知识以实现无训练开放词汇语义分割

Jingyun Wang, Cilin Yan, Guoliang Kang

机构 * Beihang University(北航大学)

AI总结 本文提出GCLIP,通过重塑最后块注意力和Value嵌入来提取CLIP的全局知识,提升无训练开放词汇语义分割性能。

Comments TMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01244 2026-07-20 cs.CL 版本更新

Large-Scale Terminal Agentic Trajectory Generation from Dockerized Environments

从Docker化环境生成大规模终端代理轨迹

Siwei Wu, Yizhi Li, Yuyang Song, Wei Zhang, Yang Wang, Riza Batista-Navarro, Xian Yang, Mingjie Tang, Bryan Dai, Jian Yang, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) IQuest Research(IQuest研究) Beihang University(北航大学) Sichuan University(四川大学) Multimodal Art Projection Research Community(多模态艺术投影研究社区)

AI总结 本文提出TerminalTraj,通过Docker化环境生成高质量终端轨迹,提升代理模型在终端任务中的性能表现。

Comments Accepted as a Spotlight paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10999 2026-07-17 cs.CV 版本更新

Conditioning Residuals for Diffusion Models via Representation Feedback

通过表示反馈对扩散模型的残差进行条件设定

Weilai Xiang, Hongyu Yang, Di Huang, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 研究扩散模型中能否利用固有路径路由内部推断语义,提出条件残差这一轻量级反馈机制,通过反馈紧凑特征摘要提供自适应指导,实验显示其提升了生成性能及下游任务表现,还揭示了训练动态和特征结构的改进。

Comments Substantially revised and retitled. Code available at https://github.com/FutureXiang/ddae_plus_plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11245 2026-07-15 cs.SE cs.AI 版本更新

An Empirical Study for Android-to-OpenHarmony GUI Test Migration

从安卓到开源鸿蒙系统的图形用户界面测试迁移实证研究

Yakun Zhang, Xinjia Chen, Yiyun Chen, Yuxia Zhang, Mingyi Zhou, Xiang Gao, Shaokun Zhang, Li Li, Yunming Ye

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) Beihang University(北航) Peking University(北京大学)

AI总结 研究从安卓到开源鸿蒙系统的图形用户界面测试迁移问题,构建数据集,选择并适配两种先进迁移方法进行评估,发现现有方法效果不佳,进而提出增强方法ITeM-HM,显著提升了测试迁移成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09977 2026-07-15 cs.CV 版本更新

INFANiTE: Implicit Neural representation for high-resolution Fetal brain spatio-temporal Atlas learNing from clinical Thick-slicE MRI

INFANiTE:隐式神经表示用于高分辨率胎儿脑空间-时间大体图谱学习从临床厚切片MRI

Xiaotian Hu, Mingxuan Liu, Hongjia Yang, Tongxi Song, Yijin Li, Yifei Chen, Haoxiang Li, Zihan Li, Yingqi Hao, Ziyu Li, Yi Liao, Haibo Qu, Qiyuan Tian

机构 * Beihang University(北航大学) Tsinghua University(清华大学) Sichuan University(四川大学) University of Oxford(牛津大学)

AI总结 INFANiTE通过隐式神经表示方法,实现了从厚切片MRI中高效生成高分辨率胎儿脑空间-时间大体图谱,显著加快了图谱构建过程,提升了图谱的一致性、参考保真度和生物合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25834 2026-07-15 cs.AI cs.IR 版本更新

Action-Aware Generative Sequence Modeling for Short Video Recommendation

面向动作的生成序列建模用于短视频推荐

Wenhao Li, Zihan Lin, Zhengxiao Guo, Jie Zhou, Shukai Liu, Yongqi Liu, Chuan Luo, Chaoyi Ma, Ruiming Tang, Han Li

机构 * Kuaishou Inc.(快手公司) Beihang University(北航)

AI总结 本文提出A2Gen模型,通过时间维度细化用户动作并生成序列,提升短视频推荐的准确性和用户参与度。

Comments We request the retraction of our paper due to discrepancies in the authorship information (https://dl.acm.org/doi/10.1145/3805712.3809728). To ensure accurate representation of contributions, we plan to revise the authorship list and resubmit. Thank you for your understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08765 2026-07-14 cs.CV 版本更新

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

通过几何感知预训练增强上下文全景生成

Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

机构 * Insta360 Research(影石创新研究院) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Wuhan University(武汉大学)

AI总结 该研究提出两阶段框架Canvas360用于上下文全景生成,结合几何感知预训练与微调。通过构建数据集及特定建模方法,增强文本到全景生成,经实验验证其能提高全景图像保真度,在相关指标上表现优异。

Comments Project page: https://zry000.github.io/Canvas360/ Github: https://github.com/Insta360-Research-Team/Canvas360

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-07-14 cs.RO cs.AI cs.CL cs.CV 版本更新

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05235 2026-07-14 cs.CL 版本更新

FedMosaic: Federated Retrieval-Augmented Generation via Parametric Adapters

FedMosaic:通过参数适配器进行联邦检索增强生成

Zhilin Liang, Yuxiang Wang, Zimu Zhou, Hainan Zhang, Boyi Liu, Yongxin Tong

机构 * SKLCCSE Lab Beihang University Beijing China(SKLCCSE实验室 北航) Department of Data Science City University of Hong Kong Hong Kong China(数据科学系 香港城市大学) Beijing Advanced Innovation Center Beihang University Beijing China(北京先进创新中心 北航) Beihang University(北航) City University of Hong Kong(香港城市大学)

AI总结 研究针对隐私敏感领域,解决联邦检索增强生成中高存储通信及适配器聚合问题。核心方法是提出FedMosaic框架,聚类文档成多文档适配器并选择性聚合。主要贡献是准确率提高,存储和通信成本降低,且不共享原始文档。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16395 2026-07-14 cs.AI cs.SE 版本更新

LLM-Driven Collaborative Model for Untangling Commits via Explicit and Implicit Dependency Reasoning

基于显式和隐式依赖推理的大语言模型驱动的提交解缠协作模型

Bo Hou, Xin Tan, Kai Zheng, Fang Liu, Yinghao Zhu, Li Zhang

机构 * State Key Laboratory of Complex \& Critical Software Environment (SKLCCSE), School of Computer Science Engineering, Beihang University Beijing China SKLCCSE, School of Computer Science School of Computing Data Science, The University of Hong Kong Hong Kong SAR China Engineering, Beihang University Data Science, The University of Hong Kong

AI总结 针对开发者常产生的缠结提交问题,提出ColaUntangle协作框架,集成大语言模型驱动智能体,构建显式和隐式上下文捕捉信息,经实验验证,该框架在提交解缠任务中性能优于基线,凸显基于大语言模型协作框架的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20730 2026-07-13 cs.CV 版本更新

Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

循环渲染:通过视觉自反馈生成矢量图形

Guotao Liang, Zhangcheng Wang, Juncheng Hu, Haitao Zhou, Ziteng Xue, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北航软件学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) Paradigm(4Paradigm)

AI总结 本文提出Render-in-the-Loop方法,通过视觉上下文引导矢量图形生成,提升模型对视觉信息的利用效率,实现更高效的SVG生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05559 2026-07-13 cs.AI 版本更新

IFAR: Multi-Perspective and Multi-Level Causal Discovery with LLMs

IFAR:基于大语言模型的多视角多层次因果发现

Jinwei He, Feng Lu

机构 * Beihang University(北航大学)

AI总结 研究针对大语言模型溯因推理中多视角多层次原因这一挑战,提出IFAR框架,结合广义反向推理与正向验证,构建专门数据集,实验表明该框架能提升大语言模型溯因推理性能,在F1分数等方面有显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17361 2026-07-10 cs.LG cs.AI 版本更新

MasFACT: Continual Multi-Agent Topology Learning via Geometry-Aware Posterior Transfer

MasFACT:基于几何感知后验转移的连续多智能体拓扑学习

Xuefei Wang, Jialu Wang, Fengbo Zhang, Yihan Hu, Di Zhang, Yutong Ye, Yikun Ban, Jun Han, Ruijie Wang

机构 * Beihang University(北京航空航天大学)

AI总结 本文提出MasFACT框架,通过几何感知后验转移方法,解决多智能体系统中因新任务适应导致的拓扑遗忘问题,提升连续学习任务的准确性和拓扑稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02871 2026-07-10 cs.AI 版本更新

SimRPD: Optimizing Recruitment Proactive Dialogue Agents through Simulator-Based Data Evaluation and Selection

SimRPD:通过基于模拟器的数据评估和选择优化招聘主动对话代理

Zhiyong Cao, Dunqiang Liu, Qi Dai, Haojun Xu, Huai Yuen Khor, Hao Wang, Huan He, Yafei Liu, Ke Ma, Ruqian Shi, Sicheng Zhou, Sijia Yao

机构 * Zhaopin Limited(智聘有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation,Beijing Institute of Technology(北京理工大学自动化学院) Central University of Finance and Economics(中央财经大学) Beihang University(北航) Independent Researcher(独立研究者)

AI总结 研究针对招聘主动对话代理训练数据稀缺问题,提出SimRPD框架。通过高保真用户模拟器合成数据,基于意图链的评估框架选数据,在所选数据集上训练代理。实验证明该框架优于现有策略,有工业部署价值和其他场景适用性。

Comments Published in the ACL 2026 Industry Track. Oral presentation

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), 2026, pp. 1359-1377

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00860 2026-07-08 cs.LG 版本更新

Policy Improvement Reinforcement Learning

策略改进强化学习

Huaiyang Wang, Xiaojie Li, Xiaohan Wang, Zhixia Zhang, Xiaodong Lu, Zixuan Huang, Jiajun Chai, Guojun Yin, Deqing Wang, Haoyi Zhou, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航) Peking University(北京大学)

AI总结 提出策略改进强化学习(PIRL)框架,通过最大化跨迭代的累积策略改进来替代替代奖励最大化,并基于此设计策略改进策略优化(PIPO)算法,实现闭环优化,在数学推理基准上提升稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08949 2026-07-08 cs.CV 版本更新

Tuned Reverse Distillation: Enhancing Multimodal Industrial Anomaly Detection with Crossmodal Tuners

调谐反向蒸馏:使用跨模态调谐器增强多模态工业异常检测

Xinyue Liu, Jianyuan Wang, Biao Leng, Shuo Zhang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Key Laboratory of Intelligent Bionic Unmanned Systems, Ministry of Education(教育部智能仿生无人系统重点实验室) School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

AI总结 本文针对多模态工业异常检测问题,提出基于多分支设计的调谐反向蒸馏方法,通过为各模态设独立分支及设计跨模态调谐器,增强模态交互,能更精细检测异常,实验验证其在多模态异常检测和定位上达最优性能。

Comments Accepted by TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15135 2026-07-07 cs.CL 版本更新

TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking

TrendFact:自动事实核查中热点感知的基准

Xiaocheng Zhang, Xi Wang, Yifei Lu, Jianing Wang, Zhuangzhuang Ye, Mengjiao Bao, Peng Yan, Xiaohong Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) National University of Defense Technology(国防科学技术大学) Northeastern University(东北大学) East China Normal University(华东师范大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 研究自动事实核查范式在资源受限环境下面临风险不对称挑战,引入TrendFact基准及评估热点感知能力的指标,提出FactISR框架提升热点感知能力和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09740 2026-07-07 cs.CV cs.AI 版本更新

ELBO-T2IAlign: A Generic ELBO-Based Method for Calibrating Pixel-level Text-Image Alignment in Diffusion Models

ELBO-T2IAlign:一种基于通用ELBO的方法,用于校准扩散模型中的像素级文本-图像对齐

Qin Zhou, Zhiyang Zhang, Jinglong Wang, Xiaobin Li, Jing Zhang, Qian Yu, Lu Sheng, Dong Xu

机构 * School of Software, Beihang University(北航软件学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

AI总结 研究利用零样本指称图像分割评估扩散模型像素级图像与文本对齐,分析训练数据偏差导致的不对齐问题,提出ELBO-T2IAlign方法校准像素-文本对齐,无需额外标注等,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23965 2026-07-03 cs.AI cs.LG cs.SE 版本更新

LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs

LGMT:基于逻辑的蜕变测试用于评估LLMs的推理可靠性

Zenghui Zhou, Man Li, Xiaoke Fang, Xinyi Zhou, Weibin Lin, Zheng Zheng

机构 * School of Automation Science and Electrical Engineering, Beihang University(自动化科学与电气工程学院,北京航空航天大学)

AI总结 提出LGMT框架,利用一阶逻辑推导蜕变关系,通过一致性检查评估LLM推理的鲁棒性,揭示传统评估忽略的隐藏缺陷。

Comments Zheng Zheng is the corresponding author

Journal ref Knowledge-Based Systems, Volume 348, 2026, 116324, ISSN 0950-7051

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17450 2026-07-03 cs.SE cs.AI cs.CL cs.CR 版本更新

ContraFix: Skill-Enhanced Contrastive Runtime Analysis for Vulnerability Repair

ContraFix:通过差分运行时证据和技能重用进行代理漏洞修复

Simiao Liu, Fang Liu, Peiding Wang, Taichuan Li, Yinghao Zhu, Xiaoli Lian, Li Zhang

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 本文提出ContraFix框架,通过差分运行时证据和可重用的修复技能,解决大型语言模型代理在自动漏洞修复中的语义误解问题,实现了在SEC-Bench和PatchEval上的高准确率。

Comments Code: https://figshare.com/s/f173c78e44bca88ebaea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29860 2026-07-02 cs.AI 版本更新

Beyond Triplet Plausibility: Relation Set Completion in Knowledge Graphs

超越三元组合理性:知识图谱中的关系集补全

Zihao Zheng, Borui Cai, Yao Zhao, Xin Han, Mengqi Ji

机构 * School of Information Technology, Deakin University(迪肯大学信息技术学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Information Technology, Victoria University(维多利亚大学信息技术学院)

AI总结 提出关系集补全任务,通过关系集嵌入模型RelSetE建模实体与关系的兼容性模式,以推断缺失关系,实验证明其有效性。

Comments After the submission we found that there are some erorrs in the experiments. Therefore, we apply for withdraw of this manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26270 2026-07-02 cs.CR cs.AI cs.SE 版本更新

Knowdit: Agentic Smart Contract Vulnerability Detection with Auditing Knowledge Summarization

Knowdit: 基于审计知识摘要的智能合约漏洞检测框架

Ziqiao Kong, Wanxu Xia, Chong Wang, Yue Xue, Yi Lu, Pan Li, Shaohua Li, Zong Cao, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) National Superior College for Engineers, Beihang University(北京航空航天大学高等工程学院) Bitslab The Chinese University of Hong Kong(香港中文大学)

AI总结 Knowdit利用审计知识摘要和多智能体框架,通过迭代循环检测智能合约漏洞,有效识别高和中严重性漏洞,优于现有基线方法。

Comments Revised with GPT-5.4

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09919 2026-07-01 cs.CV 版本更新

MetricHMSR:Metric Human Mesh and Scene Recovery from Monocular Images

MetricHMSR:基于单目图像的度量人体网格与场景恢复框架

Chentao Song, He Zhang, Haolei Yuan, Haozhe Lin, Jianhua Tao, Hongwen Zhang, Tao Yu

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) Beihang University(北京航空航天大学)

AI总结 本文提出MetricHMSR框架,通过引入bounding camera ray map和HumanMoE模型,实现人体网格和场景的度量恢复,提升单目深度估计的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25399 2026-07-01 cs.CV cs.RO 版本更新

LaMP: Learning Vision-Language-Action Policy with 3D Scene Flow as Latent Motion Prior

LaMP: 以3D场景流作为潜在运动先验的视觉-语言-动作策略学习

Xinkai Wang, Chenyi Wang, Yifu Xu, Mingzhe Ye, Fucheng Zhang, Jialin Tian, Xinyu Zhan, Lifeng Zhu, Cewu Lu, Lixin Yang

机构 * Southeast University(东南大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出LaMP框架,通过门控融合将3D场景流作为潜在运动先验,对齐运动专家与动作专家,提升VLA策略在复杂空间交互中的鲁棒性,在LIBERO等基准上取得最高平均成功率。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24561 2026-07-01 cs.CV 版本更新

RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios

RGBT-GroundBench: 超越RGB的复杂真实世界场景中的视觉定位

Tianyi Zhao, Jiawen Xi, Linhui Xiao, Junnan Li, Xue Yang, Maoxun Yuan, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学人工智能研究院、虚拟现实技术与系统国家重点实验室) Pengcheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出首个大规模RGB-热红外视觉定位基准RGBT-GroundBench,包含4万+图像和3级细粒度标注,统一评估协议支持RGB/热红外/融合输入,揭示低照度下性能显著下降,并引入参考基线RGBT-VGNet。

Comments 40pages, 9figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22536 2026-06-29 cs.CV cs.CL 版本更新

SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation

SpaceDG: 在视觉退化下评估空间智能的基准测试

Xiaolong Zhou, Yifei Liu, Ziyang Gong, Jiarui Li, Qiyue Zhao, Muyao Niu, Yuanyuan Gao, Le Ma, Xue Yang, Hongjie Zhang, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Electronic Science and Technology of China(电子科技大学) Chongqing University(重庆大学) The University of Tokyo(东京大学) Beihang University(北航) Northwestern Polytechnical University(西北工业大学)

AI总结 本文提出SpaceDG,首个针对退化感知空间理解的大型数据集,通过物理基础的退化合成引擎生成9种退化类型,评估多模态大语言模型在视觉退化下的空间推理能力,并展示在退化条件下微调可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏