arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Fudan University(复旦大学)

2026-03-02 至 2026-03-02 共收录 6
2602.23759 2026-03-02 cs.CV

Learning Accurate Segmentation Purely from Self-Supervision

仅从自监督学习中学习准确的分割

Zuyao You, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

AI总结 Selfment通过自监督学习实现准确分割,无需人工标注,取得多个基准的新SOTA结果,并在伪装检测任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23633 2026-03-02 cs.LG

On the Convergence of Single-Loop Stochastic Bilevel Optimization with Approximate Implicit Differentiation

单环随机双层优化的收敛性研究:近似隐式微分

Yubo Zhou, Luo Luo, Guang Dai, Haishan Ye

机构 * Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) SGIT AI Lab(SGIT人工智能实验室)

AI总结 本文提出单环随机近似隐式微分算法,证明其在O(κ⁷ ε⁻²)复杂度下达到ε-静态点,兼顾多环方法的最优收敛速度与单环的高效计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13585 2026-03-02 cs.CV

Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation

Diff-Aid: 修复文本到图像生成中的推理时间自适应交互去噪

Binglei Li, Mengping Yang, Zhiyu Tan, Junping Zhang, Hao Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

AI总结 Diff-Aid通过自适应调整文本与图像交互提升文本到图像生成质量,提供可解释的调节模式并支持下游应用改进。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05651 2026-03-02 cs.CV

Self-Supervised AI-Generated Image Detection: A Camera Metadata Perspective

自监督AI生成图像检测:从相机元数据视角

Nan Zhong, Mian Zou, Yiran Xu, Zhenxing Qian, Xinpeng Zhang, Baoyuan Wu, Kede Ma

机构 * Department of Computer Science, City University of Hong Kong(城市大学计算机科学系) Department of Computer Science, Fudan University(复旦大学计算机科学系) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) Department of Computer Science and the Shenzhen Research Institute, City University of Hong Kong(城市大学计算机科学系和深圳研究院)

AI总结 通过相机元数据学习特征,提出自监督方法检测AI生成图像,提升检测性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00060 2026-03-02 cs.CV cs.AI cs.RO

Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving

少即是多:一种高效而强大的视觉-语言模型用于自动驾驶

Sheng Yang, Tong Zhan, Guancheng Chen, Yanfeng Lu, Jian Wang

机构 * School of Data Science, Fudan University Shanghai, China(复旦大学数据科学学院) Institute of Automation, Chinese Academy of Sciences Beijing, China(中国科学院自动化研究所)

AI总结 本研究提出Max-V1模型,通过端到端视觉-语言方法实现高效自动驾驶,取得nuScenes数据集上的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23393 2026-03-02 cs.SD cs.CV

Leveraging large multimodal models for audio-video deepfake detection: a pilot study

利用大型多模态模型进行音频视频深度伪造检测:一项试点研究

Songjun Cao, Yuqi Li, Yunpeng Luo, Jianjun Yin, Long Ma

机构 * Tencent Youtu Lab(腾讯优图实验室) Fudan University(复旦大学)

AI总结 本文提出AV-LMMDetect,利用大型多模态模型进行音频视频深度伪造检测,通过监督微调和分阶段训练,在多个数据集上达到新的性能水平。

Comments 5pages,ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏