arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Fudan University(复旦大学)

2026-03-10 至 2026-03-10 共收录 16
2603.08572 2026-03-10 cs.RO cs.AI

MetaWorld-X: Hierarchical World Modeling via VLM-Orchestrated Experts for Humanoid Loco-Manipulation

MetaWorld-X: 通过VLM协调的专家实现人形机器人的分层世界建模

Yutong Shen, Hangxu Liu, Penghui Liu, Jiashuo Luo, Yongkang Zhang, Rex Morvley, Chen Jiang, Jianwei Zhang, Lei Zhang

机构 * University of Hamburg(汉堡大学) School of Information Science and Technology, Beijing University of Technology(信息科学与技术学院,北京理工大学) School of Information Science and Engineering, Fudan University(信息科学与工程学院,复旦大学) University of Alberta(阿尔伯塔大学)

AI总结 MetaWorld-X通过VLM协调的专家实现人形机器人分层世界建模,解决loco-manipulation任务中的控制策略泛化问题。

Comments 8 figures, https://syt2004.github.io/metaworldX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08271 2026-03-10 cs.CV

Prototype-Guided Concept Erasure in Diffusion Models

扩散模型中的原型引导概念擦除

Yuze Cai, Jiahao Lu, Hongxiang Shi, Yichao Zhou, Hong Lu

机构 * Fudan University(复旦大学) National University of Singapore(国立新加坡大学)

AI总结 本文提出通过原型引导的方法在扩散模型中实现更可靠的概念擦除,尤其针对广义概念如性与暴力,提升图像生成的安全性和可控性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08254 2026-03-10 cs.CV

DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous Driving

DynamicVGGT: 为自动驾驶中的4D场景重建学习动态点图

Zhuolin He, Jing Li, Guanghao Li, Xiaolei Chen, Jiacheng Tang, Siyang Zhang, Zhounan Jin, Feipeng Cai, Bin Li, Jian Pu, Jia Cai, Xiangyang Xue

机构 * Fudan University(复旦大学) Huawei(华为) Yinwang Intelligent Technology(依文智能技术) Shanghai Innovation Institute(上海创新研究院) CUHK(香港中文大学)

AI总结 DynamicVGGT通过联合预测当前和未来点图,结合Motion-aware Temporal Attention模块和动态3D高斯点散射头,实现了自动驾驶中4D动态场景的高精度重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01941 2026-03-10 cs.RO

FreeTacMan: Robot-free Visuo-Tactile Data Collection System for Contact-rich Manipulation

FreeTacMan: 无需机器人的人工智能视觉-触觉数据采集系统用于接触密集的 manipulation

Longyan Wu, Checheng Yu, Jieji Ren, Li Chen, Yufei Jiang, Ran Huang, Guoying Gu, Hongyang Li

机构 * Shanghai Innovation Institute(上海创新研究院) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai University(上海大学)

AI总结 FreeTacMan 提出了一种无需机器人的视觉-触觉数据采集系统,通过可穿戴抓取器和高精度光学跟踪系统,实现了高效的数据收集和多模态数据集的构建,推动了机器人 manipulation 的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08075 2026-03-10 cs.CV

TALON: Test-time Adaptive Learning for On-the-Fly Category Discovery

TALON:实时适应学习用于即时类别发现

Yanan Wu, Yuhan Yan, Tailai Chen, Zhixiang Chi, ZiZhang Wu, Yi Jin, Yang Wang, Zhenbo Li

机构 * College of Information and Electrical Engineering(信息与电气工程学院) China Agricultural University(中国农业大学) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Toronto(多伦多大学) Institute of Brain-Inspired Intelligence and Artificial Intelligence(脑启发智能与人工智能研究院) Fudan University(复旦大学) School of Computer and Information Technology(计算机与信息学院) Beijing Jiaotong University(北京交通大学) Department of Computer Science and Software Engineering(计算机科学与软件工程系) Concordia University(Concordia大学)

AI总结 TALON通过实时适应学习实现即时类别发现,结合语义感知原型更新和稳定测试时间编码器更新,有效提升分类性能并缓解类别爆炸问题。

Comments 14 pages, 6 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07769 2026-03-10 cs.CV

MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations

MedQ-Deg:一个多维基准,用于评估医疗图像质量退化下的多模态大语言模型

Jiyao Liu, Junzhi Ning, Chenglong Ma, Wanying Qu, Jianghan Shen, Siqi Luo, Jinjie Wei, Jin Ye, Pengze Li, Tianbin Li, Jiashi Lin, Hongming Shan, Xinzhe Luo, Xiaohong Liu, Lihao Liu, Junjun He, Ningsheng Xu

机构 * Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Imperial College London(伦敦帝国理工学院)

AI总结 MedQ-Deg是一个多维基准,用于评估医疗图像质量退化下多模态大语言模型的性能,揭示模型在不同退化类型下的表现差异及置信度校准问题。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07660 2026-03-10 cs.CV

Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

Holi-Spatial: 将视频流转化为整体3D空间智能

Yuanyuan Gao, Hao Li, Yifei Liu, Xinhao Ji, Yuning Gong, Yuanjun Liao, Fangfu Liu, Manyuan Zhang, Yuchen Yang, Dan Xu, Xue Yang, Huaxi Huang, Hongjie Zhang, Ziwei Liu, Xiao Sun, Dingwen Zhang, Zhihang Zhong

机构 * Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Sichuan University(四川大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 Holi-Spatial通过自动化方法构建大规模多模态3D空间数据集,提升空间推理任务的模型性能。

Comments project page: https://visionary-laboratory.github.io/holi-spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07497 2026-03-10 cs.CV

AMR-CCR: Anchored Modular Retrieval for Continual Chinese Character Recognition

AMR-CCR: 以锚定模块检索实现连续中文字符识别

Yuchuan Wu, Yinglian Zhu, Haiyang Yu, Ke Niu, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

AI总结 AMR-CCR通过锚定模块检索框架实现连续中文字符识别,解决持续类增长和脚本多样性问题,提出轻量级脚本注入模块和多原型字典以提升识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07452 2026-03-10 cs.CR cs.AI

Backdoor4Good: Benchmarking Beneficial Uses of Backdoors in LLMs

Backdoor4Good: 对LLMs中有益后门应用的基准测试

Yige Li, Wei Zhao, Zhe Li, Nay Myat Min, Hanxun Huang, Yunhan Zhao, Xingjun Ma, Yu-Gang Jiang, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

AI总结 Backdoor4Good提出了一种统一的基准和框架,用于在大型语言模型中实现有益的后门应用,通过三元组形式定义触发器、激活机制和效用函数,展示后门在提升安全性和可控性方面的潜力。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01396 2026-03-10 cs.AI cs.CE q-bio.QM

HarmonyCell: Automating Single-Cell Perturbation Modeling under Semantic and Distribution Shifts

HarmonyCell: 在语义和分布偏移下自动化单细胞扰动建模

Wenxuan Huang, Mingyu Tsoi, Yanhao Huang, Xinjie Mao, Xue Xia, Hao Wu, Jiaqi Wei, Yuejin Yang, Lang Yu, Cheng Tan, Xiang Zhang, Zhangyang Gao, Siqi Sun

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Shanghai Innovation Institute(上海创新研究院) University of British Columbia(不列颠哥伦比亚大学)

AI总结 HarmonyCell通过语义统一和自适应搜索机制,在语义和分布偏移下实现单细胞扰动建模的自动化,有效执行率达95%并超越专家基线。

Comments 18 pages total (8 pages main text + appendix), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10932 2026-03-10 cs.CR cs.AI cs.RO

DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models

DropVLA: 对视觉-语言-动作模型的行动级后门攻击

Zonghuan Xu, Jiayu Li, Yunhan Zhao, Xiang Zheng, Xingjun Ma, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身AI重点实验室) City University of Hong Kong(香港城市大学)

AI总结 DropVLA是一种针对视觉-语言-动作模型的行动级后门攻击,通过有限的数据污染实现对特定动作的精准操控,验证了在现实环境中的有效性。

Comments 8 pages, 6 tables, 3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11952 2026-03-10 cs.CV

UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding

UniUGG: 通过几何-语义编码实现统一的3D理解与生成

Yueming Xu, Jiahui Zhang, Ze Huang, Yurui Chen, Yanpeng Zhou, Zhenyu Chen, Yu-Jie Yuan, Pengxiang Xia, Guowei Huang, Xinyue Cai, Zhongang Qi, Xingyue Quan, Jianye Hao, Hang Xu, Li Zhang

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 UniUGG通过几何-语义编码实现3D理解和生成的统一框架,结合大语言模型和潜在扩散模型,提升空间理解和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11093 2026-03-10 quant-ph cs.LG

Simulating Non-Markovian Open Quantum Dynamics with Neural Quantum States

用神经量子态模拟非马尔可夫开放量子动力学

Long Cao, Liwei Ge, Daochi Zhang, Xiang Li, Yao Wang, Rui-Xue Xu, YiJing Yan, Xiao Zheng

机构 * Hefei National Research Center for Physical Sciences at the Microscale, University of Science and Technology of China(合肥微尺度物质科学国家研究中心,中国科学技术大学) Department of Chemistry, Fudan University(复旦大学化学系) Hefei National Laboratory(合肥国家实验室)

AI总结 本文提出一种基于神经量子态和耗散子嵌入量子主方程的方法,用于高效模拟非马尔可夫开放量子动力学,提升计算可扩展性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00643 2026-03-10 cs.CV

Position: Evaluation of Visual Processing Should Be Human-Centered, Not Metric-Centered

位置:视觉处理的评估应以人类为中心,而非以指标为中心

Jinfan Hu, Fanghua Yu, Zhiyuan You, Xiang Yin, Hongyu An, Xinqi Lin, Chao Dong, Jinjin Gu

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) The University of Hong Kong(香港大学) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱孟·奥赫里迪斯』) Shenzhen Loop Area Institute(深圳河套学院) The Chinese University of Hong Kong(香港中文大学) University of the Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文主张视觉处理评估应转向以人类为中心的方法,强调情境感知和细致评估,以更准确反映人类感知和用户需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13347 2026-03-10 cs.CV

$π^3$: Permutation-Equivariant Visual Geometry Learning

π³:排列等变视觉几何学习

Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, Tong He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

AI总结 π³通过排列等变架构实现无需参考视角的视觉几何重建,提升相机姿态和点地图重建的准确性和鲁棒性。

Comments Project page: https://yyfz.github.io/pi3/

详情

展开后加载摘要…

URL PDF HTML 收藏