arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-05-14 至 2026-05-14 共收录 7
2605.13815 2026-05-14 cs.CV cs.RO

OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation

OmniLiDAR:一个多领域3D激光雷达生成的统一扩散框架

Youquan Liu, Weidong Yang, Ao Liang, Xiang Xu, Lingdong Kong, Yang Wu, Dekai Zhu, Xin Li, Runnan Chen, Ben Fei, Tongliang Liu, Wanli Ouyang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computing, Department of Computer Science, National University of Singapore(新加坡国立大学计算机学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Technical University of Munich(慕尼黑技术大学) Nanjing University of Science and Technology(南京理工大学) Shanghai AI Laboratory(上海人工智能实验室) University of Sydney(悉尼大学) The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学(深圳))

AI总结 OmniLiDAR提出一种统一的文本条件扩散框架,生成跨八个领域的3D激光雷达扫描,通过跨域训练策略和特征建模提升多域生成能力,实验显示在数据增强和鲁棒性评估中表现优异。

Comments Preprint; 12 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10755 2026-05-14 cs.CV

MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark

MMRareBench: 一种罕见疾病多模态和多图像医学基准

Junzhi Ning, Jiashi Lin, Yingying Fang, Wei Li, Jiyao Liu, Cheng Tang, Chenglong Ma, Wenhao Tang, Tianbin Li, Ziyan Huang, Guang Yang, Junjun He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

AI总结 本文提出MMRareBench,首个评估多模态和多图像临床能力的罕见疾病基准,包含1756个问题-答案对和7958张医学图像,揭示23个MLLMs在多图像任务中表现低下,存在能力稀释效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17001 2026-05-14 cs.RO

Unify Robot Actions in Camera Frame

在摄像机坐标系中统一机器人动作

Sicheng Xie, Lingchen Meng, Zijie Diao, Haidong Cao, Zhiying Du, Shuyuan Tu, Jiaqi Leng, Qiuyue Wang, Mingsheng Li, Shuai Bai, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司)

AI总结 本文提出CalibAll方法,通过摄像机外参标注统一不同机器人平台的动作表示,提升跨平台学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13058 2026-05-14 cs.RO

MUJICA: Multi-skill Unified Joint Integration of Control Architecture for Wheeled-Legged Robots

MUJICA:多技能统一联合控制架构用于轮腿机器人

Yuqi Li, Peng Zhai, Yueqi Zhang, Xiaoyi Wei, Quancheng Qian, Zhengxu He, Qianxiang Yu, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) Power China Huadong Engineering Corporation Limited(中国电力工程顾问集团华东分公司)

AI总结 本文提出MUJICA框架,通过整合多种低级技能,实现轮腿机器人在复杂环境中的自适应移动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12967 2026-05-14 cs.CV

ImageAttributionBench: How Far Are We from Generalizable Attribution?

ImageAttributionBench: 我们距离可推广的图像归因还有多远?

Tingshu Mou, Zhipeng Wei, Chao Gong, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出ImageAttributionBench,一个涵盖多种语义领域的综合数据集,用于评估图像归因方法在真实场景下的性能,揭示现有方法在鲁棒性和泛化能力上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02022 2026-05-14 cs.AI

ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis

ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断

Yu Li, Haoyu Luo, Yuejin Xie, Yuqian Fu, Zhonghao Yang, Shuai Shao, Qihan Ren, Wanying Qu, Yanwei Fu, Yujiu Yang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) KAUST(卡塔尔人工智能科学中心) East China Normal University(华东师范大学)

AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01908 2026-05-14 cs.CV

Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning

基于推理的编辑:基于假设指令的图像编辑与视觉推理

Qingdong He, Xueqin Chen, Chaoyi Wang, Yanjie Pan, Xiaobin Hu, Zhenye Gan, Yabiao Wang, Chengjie Wang, Xiangtai Li, Jiangning Zhang

机构 * Tencent Youtu Lab(腾讯云图实验室) Sichuan University(四川大学) University of the Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Reason50K数据集和ReasonBrain框架,通过多模态大语言模型和扩散模型实现复杂隐含指令的图像编辑,提升视觉推理能力。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏