arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Fudan University(复旦大学)

2026-04-10 至 2026-04-10 共收录 6
2604.08540 2026-04-10 cs.CV cs.AI cs.CL

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

AVGen-Bench: 一项面向多粒度评估的文本到音频视频生成任务驱动基准

Ziwei Zhou, Zeyuan Lai, Rui Wang, Yifan Yang, Zhen Xing, Yuqing Yang, Qi Dai, Lili Qiu, Chong Luo

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

AI总结 AVGen-Bench通过11个真实场景的高质量提示,结合轻量专家模型与多模态大语言模型,实现对文本到音频视频生成的多粒度评估,揭示了音频视觉美学与语义可靠性之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08121 2026-04-10 cs.CV cs.AI

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

Uni-ViGU:通过基于扩散的视频生成器实现视频生成与理解的统一

Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能实验室) Fudan University(复旦大学) Independent Researcher(独立研究者) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 Uni-ViGU通过基于扩散的视频生成器统一视频生成与理解,引入统一流方法和模态驱动的MoE框架,实现多模态生成与理解的协同优化。

Comments Page and Code: https://fr0zencrane.github.io/uni-vigu-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07981 2026-04-10 cs.CL cs.AI cs.LG

A Decomposition Perspective to Long-context Reasoning for LLMs

从分解视角看大语言模型的长上下文推理

Yanling Xiao, Huaibing Xie, Guoliang Zhao, Shihan Dou, Shaolei Wang, Yiting Liu, Nantao Zheng, Cheng Zhang, Pluto Zhou, Zhisong Zhang, Lemao Liu

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) Xi'an Jiaotong University(西安交通大学) Tencent(腾讯) Fudan University(复旦大学) City University of Hong Kong(香港城市大学)

AI总结 本文从分解视角出发,将长上下文推理分解为基本原子技能,并通过伪数据集训练提升模型能力,实验证明该方法在多个基准测试中提升了7.7%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07900 2026-04-10 cs.CV cs.AI

AnomalyAgent: Agentic Industrial Anomaly Synthesis via Tool-Augmented Reinforcement Learning

AnomalyAgent:通过工具增强强化学习进行代理工业异常合成

Jiaming Su, Tengchao Yang, Ruikang Zhang, Zhengan Yan, Haoyu Sun, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学)

AI总结 本文提出AnomalyAgent,通过工具增强强化学习生成高语义真实性的工业异常样本,采用闭环优化和两阶段训练框架,实现自我反思与迭代改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07879 2026-04-10 cs.CV cs.AI

FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding

FlowGuard: 通过线性潜在解码实现扩散模型生成过程中的轻量级安全检测

Jinghan Yang, Yihe Fan, Xudong Pan, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

AI总结 FlowGuard通过线性近似和课程学习方法,在生成过程中检测不安全内容,提升扩散模型的安全性和效率,F1分数优于现有方法30%以上,同时显著降低GPU内存占用和投影时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07857 2026-04-10 eess.SY cs.AI cs.SY

Networking-Aware Energy Efficiency in Agentic AI Inference: A Survey

面向网络的代理AI推理能效:综述

Xiaojing Chen, Haiqi Yu, Wei Ni, Dusit Niyato, Ruichen Zhang, Xin Wang, Shunqing Zhang, Shugong Xu

机构 * Shanghai University(上海大学) Nanyang Technological University(南洋理工大学) Edith Cowan University(埃迪斯科文大学) Fudan University(复旦大学) Xi'an Jiaotong-Liverpool University(西交利物浦大学)

AI总结 本文综述了代理AI推理中网络感知能效问题,探讨了计算与通信能耗的统一分类,提出跨层协同设计策略,并指出联邦绿色学习、6G代理AI等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏