arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Peking University(北京大学)

2026-04-07 至 2026-04-07 共收录 15
2604.04875 2026-04-07 cs.CV cs.AI cs.MM

DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing

DIRECT:通过分层多智能体规划和意图引导编辑实现视频混剪创作

Ke Li, Maoliang Li, Jialiang Chen, Jiayu Chen, Zihao Zheng, Shaoqi Wang, Xiang Chen

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出DIRECT框架,通过分层多智能体规划和意图引导编辑解决视频混剪中多模态协调问题,提出Mashup-Bench基准并验证了方法在客观和主观评估上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04634 2026-04-07 cs.CV cs.AI

Preserving Forgery Artifacts: AI-Generated Video Detection at Native Scale

保留伪造痕迹:在原生尺度上进行AI生成视频检测

Zhengcen Li, Chenyang Jiang, Hang Zhao, Shiyang Zhou, Yunyang Mo, Feng Gao, Fan Yang, Qiben Shan, Shaocong Wu, Jingyong Su

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学)

AI总结 本文提出在原生尺度上进行AI生成视频检测的新方法,通过构建大规模数据集和新型框架,有效保留高频率伪影和时空不一致特征,提升检测性能。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04474 2026-04-07 cs.LG cs.AI

MAVEN: A Mesh-Aware Volumetric Encoding Network for Simulating 3D Flexible Deformation

MAVEN:一种面向网格的体素编码网络,用于模拟3D柔性变形

Zhe Feng, Shilong Tao, Haonan Sun, Shaohan Chen, Zhanxing Zhu, Yunhuai Liu

机构 * Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) School of Computer Science, Peking University(北京大学计算机学院) School of Electrical and Computer Science, University of Southampton(南安普顿大学电气与计算机科学学院)

AI总结 本文提出MAVEN,一种面向网格的体素编码网络,用于模拟3D柔性变形。该网络通过显式建模高维几何网格元素,提高物理模拟的准确性。实验表明,MAVEN在多个数据集和新任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04108 2026-04-07 cs.CV

Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation

假设图细化:基于假设的探索与级联错误校正的具身导航

Peixin Chen, Guoxi Zhang, Jianwei Ma, Qing Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

AI总结 本文提出HGR框架,通过假设节点的可修改性实现具身导航中的定向探索,并通过级联校正系统性地纠正错误。实验显示HGR在GOAT-Bench和QA基准上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01870 2026-04-07 cs.LG cs.SY eess.SY

Towards Intrinsically Calibrated Uncertainty Quantification in Industrial Data-Driven Models via Diffusion Sampler

面向工业数据驱动模型中固有校准不确定性量化的方法 via 扩散采样器

Yiran Ma, Jerome Le Ny, Zhichao Chen, Zhihuan Song

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Electrical Engineering Department, Polytechnique Montreal(蒙特利尔理工学院电气工程系) GERAD State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Guangdong Provincial Key Laboratory of Petrochemical Equipment Fault Diagnosis, Guangdong University of Petrochemical Technology(广东石油化工学院广东省石化装备故障诊断重点实验室)

AI总结 本文提出一种基于扩散的后验采样框架,通过忠实的后验采样实现固有校准的预测不确定性量化,解决了数据驱动方法中不确定性量化难题。

Comments This manuscript has been accepted for publication in IEEE Transactions on Industrial Informatics. Copyright has been transferred to IEEE. Reuse of this material is subject to IEEE copyright restrictions

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10421 2026-04-07 cs.CV

Neural Collapse in Test-Time Adaptation

测试时适应中的神经塌陷

Xiao Chen, Zhongjing Du, Jiazhen Huang, Xu Jiang, Li Lu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peking University(北京大学) Sichuan University(四川大学) Shenzhen Technology University(深圳技术大学)

AI总结 本文基于神经塌陷理论,提出NCTTA方法,通过特征与分类器对齐缓解域偏移影响,实验证明其在ImageNet-C上优于Tent。

Comments Aceepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09299 2026-04-07 cs.CV cs.SD

VABench: A Comprehensive Benchmark for Audio-Video Generation

VABench:音频视频生成的综合性基准

Daili Hua, Xizhi Wang, Bohan Zeng, Xinyi Huang, Hao Liang, Junbo Niu, Xinlong Chen, Quanqing Xu, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence (Peking University)(北京市数据智能重点实验室(北京大学)) Ant Group(蚂蚁集团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出VABench,一个用于评估同步音频视频生成能力的综合性基准,涵盖三种任务类型和15个评估维度,旨在建立新的评估标准以推动视频生成领域的发展。

Comments 24 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14194 2026-04-07 cs.CV cs.AI

VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model

VLBiasBench: 一个用于评估大视觉-语言模型偏见的综合性基准

Sibo Wang, Xiangkui Cao, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen, Wen Gao

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology (ICT)(中国科学院人工智能安全重点实验室,计算技术研究所) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Peking University(北京大学)

AI总结 本文提出VLBiasBench,通过覆盖九种社会偏见类别和两个交叉偏见类别的大规模数据集,评估大视觉-语言模型的偏见问题,基于15种开源和两种闭源模型进行广泛评估,揭示模型中的偏见特征。

Comments Accepted By TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04013 2026-04-07 cs.CL

RUQuant: Towards Refining Uniform Quantization for Large Language Models

RUQuant: 向大语言模型的均匀量化精修迈进

Han Liu, Haotian Gao, Changya Li, Feng Zhang, Xiaotong Zhang, Wei Wang, Hong Yu

机构 * Dalian University of Technology(大连理工大学) Peking University(北京大学) Macao Polytechnic University(澳门理工大学)

AI总结 本文提出RUQuant方法,通过理论分析和两阶段正交变换,解决激活分布非均匀导致的量化精度下降问题,在不需微调的情况下实现高精度量化。

Comments Accepted to KDD 2026. 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03586 2026-04-07 cs.CL

MultiPress: A Multi-Agent Framework for Interpretable Multimodal News Classification

MultiPress:一种用于可解释多模态新闻分类的多智能体框架

Tailong Luo, Hao Li, Rong Fu, Xinyue Jiang, Huaxuan Ding, Yiduo Zhang, Zilin Zhao, Simon Fong, Guangyin Jin, Jianyuan Ni

机构 * New York Institute of Technology(纽约理工学院) University of Arizona(亚利桑那大学) University of Macau(澳门大学) Peking University(北京大学) Juniata College(朱尼亚塔学院)

AI总结 本文提出MultiPress多智能体框架,通过多模块协作和检索增强推理提升多模态新闻分类的准确性和可解释性。

Comments Accepted in International Joint Conference on Neural Networks (IJCNN) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01756 2026-04-07 cs.CV

NeuroSymb-MRG: Differentiable Abductive Reasoning with Active Uncertainty Minimization for Radiology Report Generation

NeuroSymb-MRG:基于主动不确定性最小化的可微推断推理用于放射科报告生成

Rong Fu, Yiqing Lyu, Chunlei Meng, Muge Qi, Yabin Jin, Qi Zhao, Li Bao, Juntao Gao, Fuqian Shi, Nilanjan Dey, Wei Luo, Simon Fong

机构 * University of Macau(澳门大学) Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学) The First People’s Hospital of Foshan(佛山市第一人民医院) Capital Medical University(首都医科大学) Rutgers Cancer Institute, NJ, USA(罗格斯癌症研究所(美国新泽西州);纽约大学朗格尼健康中心(美国纽约州)) and NYU Langone Health, NY, USA(Techno国际新城(印度加尔各答)) Techno International New Town, Kolkata, India

AI总结 本文提出NeuroSymb-MRG框架,结合神经符号推断与主动不确定性最小化,生成结构化且临床可靠的报告。通过图像特征到概率临床概念的映射,构建可微推理链,并通过检索和约束语言模型编辑优化文本输出。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16197 2026-04-07 cs.LG cs.CL cs.MM

ModalImmune: Immunity Driven Unlearning via Self Destructive Training

ModalImmune: 通过自毁式训练实现的免疫驱动反学习

Rong Fu, WeiZhi Tang, Ziming Wang, Jia Yee Tan, Zijian Zhang, Zhaolu Kang, Muge Qi, Shuning Zhang, Simon Fong

机构 * University of Macau(澳门大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) University of Pennsylvania(宾夕法尼亚大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出ModalImmune框架,通过可控地在训练中坍缩选定模态信息,使模型学习到对破坏性模态影响具有鲁棒性的联合表示,提升多模态系统在模态丢失或损坏时的可靠性。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00472 2026-04-07 stat.ML cs.LG math.ST stat.TH

Partially Functional Dynamic Backdoor Diffusion-based Causal Model

部分功能动态后门扩散因果模型

Xinwen Liu, Lei Qian, Song Xi Chen, Niansheng Tang

机构 * YunNan University(云南大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出PFD-BDCM模型,通过动态后门调整和基函数展开,解决时空数据中动态混杂和功能变量的因果推断问题,实验显示其在观测、干预和反事实查询中表现更优。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19487 2026-04-07 cs.CV

SpikeStereoNet: A Brain-Inspired Framework for Stereo Depth Estimation from Spike Streams

SpikeStereoNet:一种受大脑启发的立体深度估计框架,用于从尖峰流中估计立体深度

Zhuoheng Gao, Yihao Li, Jiyao Zhang, Rui Zhao, Tong Wu, Hao Tang, Zhaofei Yu, Hao Dong, Guozhang Chen, Tiejun Huang

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理全国重点实验室) Center on Frontiers of Computing Studies, School of Computer Science, Peking University(北京大学计算机学院计算前沿研究中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Engineering and Applied Science, University of Pennsylvania(宾夕法尼亚大学工程与应用科学学院)

AI总结 本文提出SpikeStereoNet,一种受大脑启发的立体深度估计框架,直接从原始尖峰流中估计立体深度。该模型融合两个视角的原始尖峰流,并通过递归尖峰神经网络更新模块迭代优化深度估计。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21169 2026-04-07 cs.MM cs.AI cs.CL cs.CV

Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction

文档解析揭示:结构信息提取的技术、挑战与前景

Qintong Zhang, Bin Wang, Victor Shea-Jay Huang, Junyuan Zhang, Zhengren Wang, Hao Liang, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

AI总结 本文综述了文档解析研究,系统分类了现有方法,探讨了布局分析、多类型内容识别及VLM驱动的解析模型发展,总结了评估指标与挑战,提出了更准确可扩展的文档智能系统方向。

详情

展开后加载摘要…

URL PDF HTML 收藏