arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-05-25 至 2026-05-25 共收录 8
2605.23780 2026-05-25 cs.AI

Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

超越二元编辑:基于对抗子空间对齐的鲁棒多模态知识编辑

Haoyuan Wang, Xiaohao Liu, Jiajie Su, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Jiangxi Normal University(江西师范大学)

AI总结 针对多模态大语言模型知识编辑泛化性不足的问题,提出对抗子空间对齐方法(ASAM),通过潜在对抗鲁棒化(LAR)和秩约束子空间学习(RCSL)实现鲁棒的多模态知识编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23672 2026-05-25 cs.CV

RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video

RiGS: 从单目视频中的刚性感知4D高斯泼溅

Chenyu Wu, Wanhua Li, Zhu-Tian Chen, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

AI总结 提出RiGS,通过静态、刚性和瞬态三种高斯原语分别建模不同时间尺度的运动,并利用目标动态掩码和场景流引导实现单目视频动态场景重建,在新视角合成任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23201 2026-05-25 cs.SD cs.MM

MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio

MixFake: 在多样真实混合音频中基准测试和增强音频深度伪造检测

Qingcao Li, Yipeng Lin, Weichen Lian, Zhongjie Ba, Peng Cheng, Zhichao Lian

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, Nanjing, China(南京理工大学信息科学与工程学院) The State Key Laboratory of Blockchain and Data Security, Zhejiang University, Hangzhou, China(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou, China(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 针对真实场景中语音与背景音乐或噪声混合导致检测困难的问题,提出MixFake基准数据集和多流提示微调框架,通过注入信号级先验有效捕获声学伪影,在复杂背景检测中实现7.72%的绝对提升。

Comments Accepted by ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22272 2026-05-25 cs.RO cs.CV

Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors

Imagine2Real: 通过视频生成先验实现零样本人形机器人-物体交互

Jiahe Chen, ZiRui Wang, Feiyu Jia, Xiao Chen, Xiaojie Niu, Weishuai Zeng, Tianfan Xue, Xiaowei Zhou, Jiangmiao Pang, Jingbo Wang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出Imagine2Real框架,利用视频生成先验和4D点轨迹统一表示,通过稀疏关键点跟踪和行为基础模型潜空间,实现零样本人形机器人-物体交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01018 2026-05-25 cs.CV

WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild

WildTableBench:在真实场景中评估多模态基础模型的表格理解能力

Junzhe Huang, Xiaoxiao Sun, Yan Yang, Yuxuan Hou, Ruotian Zhang, Sirui Li, Hehe Fan, Serena Yeung-Levy, Xin Yu

机构 * The University of Queensland(昆士兰大学) Stanford University(斯坦福大学) The Australian National University(澳大利亚国立大学) Zhejiang University(浙江大学) Murdoch University(莫纳什大学) The University of Adelaide(阿德莱德大学)

AI总结 提出WildTableBench基准,包含402张真实场景表格图像和928个问答对,评估21个前沿多模态模型,仅一个模型准确率超50%,揭示模型在结构感知和推理方面的持续弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13893 2026-05-25 cs.CL

InfiGFusion: Graph-on-Logits Distillation via Efficient Gromov-Wasserstein for Model Fusion

InfiGFusion:通过高效Gromov-Wasserstein进行图对逻辑蒸馏的模型融合

Yuanyi Wang, Zhaoyi Yan, Yiming Zhang, Qi Zhou, Yanggan Gu, Fei Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) Daya Bay Technology and Innovation Research Institute(大亚湾技术与创新研究院)

AI总结 提出InfiGFusion,一种结构感知的模型融合框架,通过图对逻辑蒸馏损失显式建模词汇维度间的语义依赖,并利用排序闭式近似将Gromov-Wasserstein距离的计算复杂度从O(n^4)降至O(n log n),在多个基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22878 2026-05-25 cs.AI cs.CL cs.IR cs.LG

SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research

SciAtlas:面向自动化科学研究的大规模知识图谱

Shuofei Qiao, Yunxiang Wei, Jiazheng Fan, Bin Wu, Busheng Zhang, Mengru Wang, Yuqi Zhu, Ningyu Zhang, Keyan Ding, Qiang Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University College London(伦敦大学学院)

AI总结 为应对学术信息爆炸和跨学科整合困难,提出包含4300万论文、1.57亿实体和30亿三元组的多学科知识图谱SciAtlas,并开发神经符号检索算法,实现从语义匹配到确定性关联发现的转变,降低推理成本。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22829 2026-05-25 cs.IR cs.AI

LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding

LFRAG:面向布局的多模态文档理解中的细粒度检索增强生成

Yifan Zhu, Yu Mi, Yue Lu, Yanchu Guan, Zhixuan Chu

机构 * Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Zhejiang University Institute of Blockchain and Data Security(杭州高新技术区(滨江)浙江大学区块链与数据安全研究院)

AI总结 提出LFRAG框架,通过布局分割和语义-布局融合编码器实现从页面级到块级的细粒度检索,提升多模态文档检索精度并减少生成冗余,在LFDocQA基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏