arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1920
2605.01197 2026-05-05 cs.SD cs.MM

MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

MG-Former:一种基于Transformer的音乐驱动3D指挥动作生成框架

Ke Qiu, Yawen Qin, Tianzhi Jia, Xiaole Yang, Kaimin Wang, Kaixing Yang

机构 * Malou Tech Inc(Malou科技公司) South-Central Minzu University(西南民族大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Renmin University of China(中国人民大学)

AI总结 本文提出TransConductor框架,通过SMPL参数数据构建流程生成专业指挥动作,结合Transformer编码器和解码器实现音乐驱动的3D指挥动作生成,并引入检索评估模型验证音乐与动作的对应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00839 2026-05-05 cs.AI cs.LG

2026 Roadmap on Artificial Intelligence and Machine Learning for Smart Manufacturing

2026 年人工智能与机器学习在智能制造中的路线图

Jay Lee, Hanqi Su, Marco Macchi, Adalberto Polenghi, Wei Wu, Zhiheng Zhao, George Q. Huang, Kiva Allgood, Devendra Jain, Benedikt Gieger, Vibhor Pandhare, Soumyabrata Bhattacharjee, Ram Mohril, Lingbao Kong, Qiyuan Wang, Xinlan Tang, Sungjong Kim, Chan Hee Park, Byeng D. Youn, Guo Dong Goh, Xi Huang, Wai Yee Yeong, Yung C Shin, He Zhang, Zitong Wang, Fei Tao, Jagjit Singh Srai, Satyandra K. Gupta, Byung Gun Joung, Albin John, John W. Sutherland, Sang Won Lee, Olga Fink, Vinay Sharma, Faez Ahmed, Wei Chen, Mark Fuge, Arild Waaler, Martin G. Skjæveland, Dimitris Kyritsis, Wei Chen, VispiNevile Karkaria, Yi-Ping Chen, Ying-Kuan Tsai, Joseph Cohen, Xun Huan, Jing Lin, Liangwei Zhang, Gregory W. Vogl, Aaron W. Cornelius, Xiaodong Jia, Dai-Yan Ji, Takanobu Minami, Ruoxin Wang

机构 * Center for Industrial Artificial Intelligence, Department of Mechanical Engineering, University of Maryland, College Park(工业人工智能中心,机械工程系,马里兰大学College Park分校) Department of Management, Economics and Industrial Engineering, Politecnico di Milano(管理、经济与工业工程系,米兰理工学院) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(工业与系统工程系,香港理工大学) Centre for Advanced Manufacturing & Supply Chains, World Economic Forum(先进制造与供应链研究中心,世界经济论坛) Department of Mechanical Engineering, Indian Institute of Technology Indore(机械工程系,印度理工学院Indore分校) Future Information Innovative College, Fudan University(未来信息创新学院,复旦大学) Department of Mechanical Engineering, Seoul National University(机械工程系,首尔国立大学) Department of Mechanical and Information Engineering, University of Seoul(机械与信息工程系,首尔大学) Onepredict Corp.(Onepredict公司) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学) Singapore Centre for 3D Printing, Nanyang Technological University(新加坡3D打印中心,南洋理工大学) Mechanical Engineering, Purdue University(机械工程系,普渡大学) Digital Twin International Research Center, International Institute for Interdisciplinary and Frontiers, Beihang University(数字孪生国际研究中心, interdisciplinary and Frontiers 国际研究院,北京航空航天大学) School of Automation Science and Electrical Engineering, Beihang University(自动化科学与电气工程学院,北京航空航天大学) Department of Engineering, University of Cambridge(工程系,剑桥大学) Center for Advanced Manufacturing, University of Southern California(先进制造中心,南加州大学) School of Sustainability Engineering and Environmental Engineering, Purdue University(可持续工程与环境工程系,普渡大学) School of Mechanical Engineering, Sungkyunkwan University(机械工程系,全南大学) Intelligent Maintenance and Operations Systems, EPFL(智能维护与运营系统,苏黎世联邦理工学院) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院) J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66 机械工程系,德克萨斯A&M大学) Department of Mechanical and Process Engineering, ETH Zürich(机械与工艺工程系,苏黎世联邦理工学院)

AI总结 本文探讨人工智能与机器学习在智能制造中的发展现状与未来方向,涵盖基础理论、应用领域及新兴技术,旨在推动创新与产业应用。

Comments This paper has been accepted for publication in the Journal Machine Learning: Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02856 2026-05-05 cs.RO

Rhythm: Learning Interactive Whole-Body Control for Dual Humanoids

Rhythm: 为双人形机器人学习交互式全身控制

Hongjin Chen, Wei Zhang, Pengfei Li, Shihao Ma, Ke Ma, Yujie Jin, Zijun Xu, Xiaohui Wang, Yupeng Zheng, Zining Wang, Jieru Zhao, Yilun Chen, Wenchao Ding

机构 * Fudan University(复旦大学) TARS Robotics(TARS机器人) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出Rhythm框架,通过整合交互感知动作重定向、交互引导强化学习和现实部署系统,实现双人形机器人在复杂物理交互中的鲁棒控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15658 2026-05-05 cs.CL cs.AI cs.IR

SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation

SurGE:科学调查生成的基准和评估框架

Weihang Su, Anzhe Xie, Qingyao Ai, Jianming Long, Xuanyi Chen, Jiaxin Mao, Ziyi Ye, Yiqun Liu

机构 * Tsinghua University(清华大学) Quan Cheng Laboratory(泉城实验室) Renmin University of China(中国人民大学) Fudan University(复旦大学)

AI总结 为科学调查生成任务设计了SurGE基准和评估框架,通过测试实例和学术文献库评估生成质量,揭示LLM在该任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12778 2026-05-05 cs.CL

HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks

HeteroRAG:一种用于医疗视觉语言任务的异构检索增强生成框架

Zhe Chen, Yusheng Liao, Zhiyuan Zhu, Haolin Li, Hongcheng Liu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出HeteroRAG框架,通过异构知识源增强医疗大视觉语言模型,解决异构数据检索问题,提升事实准确性与可靠性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20340 2026-05-05 cs.CL cs.AI

Latent Trajectory Dynamics in Large Language Models: A Manifold Evolution Framework with Empirical Validation

大语言模型中的潜在轨迹动力学:一种具有实证验证的流形演化框架

Yukun Zhang, Qi Dong, Mengkang Li

机构 * The Chinese University Of Hongkong(香港中文大学) Fudan University(复旦大学)

AI总结 本文提出DMET框架,通过轨迹几何指标分析大语言模型生成过程中的潜在表示演化,实验证明其能有效预测文本质量并提升生成控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00689 2026-05-04 cs.CL cs.CR

ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models

ML-Bench&Guard: 政策导向的多语言安全基准与大型语言模型的防护机制

Yunhan Zhao, Zhaorun Chen, Xingjun Ma, Yu-Gang Jiang, Bo Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Fudan University(复旦大学) University of Chicago(芝加哥大学)

AI总结 本文提出ML-Bench和ML-Guard,通过区域法规构建多语言安全基准,并开发基于扩散模型的防护系统,实现文化与法律一致的多语言安全评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00466 2026-05-04 cs.LG cs.AI

PAMod: Modeling Cyclical Shifts via Phase-Amplitude Modulation for Non-stationary Time Series Forecasting

PAMod:通过相幅调制建模周期性位移以实现非平稳时间序列预测

Yingbo Zhou, Yutong Ye, Shuhao Li, Rui Qian, Qiang Huang, Lemao Liu, Li Sun, Dejing Dou

机构 * Fudan University(复旦大学) Beihang University(北航) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 PAMod通过相幅调制在归一化特征空间中建模周期性分布位移,解决非平稳时间序列预测中的均值和方差变化问题,实现高效且低资源的高性能预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00371 2026-05-04 cs.SD cs.AI

GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models

GaMMA:迈向大规模多模态模型中的联合全局-时间音乐理解

Zuyao You, Zhesong Yu, Mingyu Liu, Bilei Zhu, Yuan Wan, Zuxuan Wu

机构 * Fudan University(复旦大学)

AI总结 GaMMA通过融合音频编码器和跨模态学习,实现音乐内容的全面理解,并在MusicBench基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15830 2026-05-04 cs.LG

Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning

将拼图碎片放在关键位置:一种用于强化学习的问题增强框架

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学)

AI总结 本文提出PieceHint框架,通过战略性提供关键推理步骤,解决强化学习中训练易问题过拟合和训练难问题奖励稀疏的问题,实验表明其在数学推理基准上性能优异且保持pass@k多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06540 2026-05-04 cs.CV math.ST stat.AP stat.ME stat.TH

Copula-enhanced Vision Transformer for high myopia diagnosis through OU UWF fundus images

基于Copula的视觉Transformer用于通过OU UWF视网膜图像诊断高度近视

Chong Zhong, Yunhao Liu, Yang Li, Xiang Fu, Jin Yang, Danjuan Yang, Meiyan Li, Jinfeng Xu, Aiyi Liu, Alan H. Welsh, Xingtao Zhou, Bo Fu, Catherine C. Liu

机构 * Department of Applied Biology Chemical Technology, The Hong Kong Polytechnic University Department of Data Science \& AI, The Hong Kong Polytechnic University e2 School of Data Science, Fudan University e1 Department of Applied Mathematics, The Hong Kong Polytechnic University Department of Biostatistics, City University of Hong Kong Eye Institute Department of Ophthalmology, Eye \& ENT Hospital, Fudan University Eunice Kennedy Shriver National Institute of Child Health College of Business Economics, Australian National University

AI总结 本文提出Copula增强的视觉Transformer模型,用于通过OU UWF视网膜图像诊断高度近视,解决双目图像异质性和多任务学习中的条件依赖结构建模问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28078 2026-05-01 cs.CV

AesRM: Improving Video Aesthetics with Expert-Level Feedback

AesRM:通过专家级反馈提升视频美学

Yujin Han, Yujie Wei, Yefei He, Xinyu Liu, Tianle Li, Zichao Yu, Andi Han, Shiwei Zhang, Tingyu Weng, Difan Zou

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of Sydney(悉尼大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出AesRM框架,通过分解视频美学为视觉美学、视觉保真度和视觉合理性三个维度,构建了专家标注的AesVideo-Bench基准,并开发了AesRM-Base和AesRM-CoT模型,提升了视频美学评估的准确性和可解释性。

Comments 37 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17196 2026-05-01 cs.CL cs.AI cs.LG

Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models

理解并改进层次稀疏注意力模型中的长度泛化

Jiaqi Leng, Xiang Hu, Junxiong Wang, Jianguo Li, Wei Wu, Yucheng Lu

机构 * Fudan University(复旦大学) Tencent AI Lab(腾讯AI实验室) Cornell University(康奈尔大学) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) NYU Shanghai(纽约大学上海分校)

AI总结 本文通过系统分析揭示了层次稀疏注意力模型中长度泛化的核心设计原则,提出三种关键组件:非线性Chunk编码器、旁路残差路径和预训练中的稀疏选择,从而在RULER和BABILong数据集上实现了免训练的长度外推。

Comments ICLR 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27691 2026-05-01 cs.AI

When Agents Evolve, Institutions Follow

当智能体进化时,制度随之演变

Chao Fei, Hongcheng Guo, Yanghua Xiao

机构 * Fudan University(复旦大学)

AI总结 本文研究了多智能体系统在集体行动组织中的挑战,通过历史政治制度翻译成可执行架构,发现治理拓扑结构显著影响集体性能,最优架构随模型能力变化而变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27472 2026-05-01 cs.AI cs.LG cs.RO

PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations

PRTS:通过对比表示实现的原始推理与任务系统

Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

AI总结 PRTS通过目标引导强化学习重构预训练过程,学习统一嵌入空间以评估物理可行性,提升机器人任务执行与长期规划能力。

Comments 38 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27453 2026-05-01 cs.CL

From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks

从粗到细:面向写作中心生成任务的基准测试与奖励建模

Qingyu Ren, Tianjun Pan, Xingzhou Chen, Xuhong Wang

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(数据科学上海重点实验室,计算机科学与人工智能学院,复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出WEval评估框架和WRL训练框架,通过细粒度评估和强化学习提升写作生成任务的奖励模型性能,实验显示模型在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27043 2026-05-01 cs.CL

CL-bench Life: Can Language Models Learn from Real-Life Context?

CL-bench Life: 语言模型能否从真实生活情境中学习?

Shihan Dou, Yujiong Shen, Chenhao Huang, Junjie Ye, Jiayi Chen, Junzhe Wang, Qianyu He, Shichun Liu, Changze Lv, Jiahang Lin, Jiazheng Zhang, Ming Zhang, Shaofan Liu, Tao Ji, Zhangyue Yin, Cheng Zhang, Huaibing Xie, Jianglu Hu, Jingcheng Deng, Lincheng Li, Minda Hu, Shaolei Wang, Syrus Zhao, Weichao Wang, Yan Lei, Yang Liu, Yanling Xiao, Yiting Liu, Zenan Xu, Zhen Guo, Ziliang Zhao, Pluto Zhou, Tao Gui, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang, Di Wang, Shunyu Yao

机构 * Hunyuan Team, Tencent(文生图团队,腾讯) Fudan University(复旦大学)

AI总结 CL-bench Life通过405个情境-任务对和5348条验证标准,评估语言模型处理真实生活场景的能力,发现现有模型在复杂、混乱的真实情境推理上仍面临巨大挑战。

Comments 50 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25186 2026-05-01 cs.CV cs.CE cs.MM

FCMBench-Video: Benchmarking Document Video Intelligence

FCMBench-Video:文档视频智能基准测试

Runze Cui, Fangxin Shang, Yehui Yang, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(启赋科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

AI总结 本文提出FCMBench-Video基准测试,用于评估文档视频理解中的文档感知、时间定位和证据推理能力,通过真实场景数据验证系统性能,揭示不同任务的敏感性和能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19606 2026-05-01 cs.AI cs.MA

AblateCell: A Reproduce-then-Ablate Agent for Virtual Cell Repositories

AblateCell: 一个用于虚拟细胞库的可重现后消去代理

Xue Xia, Chengkai Yao, Mingyu Tsoi, Xinjie Mao, Wenxuan Huang, Jiaqi Wei, Hao Wu, Cheng Tan, Lang Yu, Yuejin Yang, Mengdi Liu, Siqi Sun, Zhangyang Gao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of California San Diego(加州大学圣地亚哥分校) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 AblateCell通过可重现后消去方法解决AI虚拟细胞性能归因问题,实现高准确度的代码库验证与属性归因。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25313 2026-04-30 cs.CL cs.AI

Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models

忠实性问答:一个用于训练上下文忠实RAG模型的反事实实体替换数据集

Li Ju, Junzhe Wang, Qi Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

AI总结 本文提出Faithfulness-QA数据集,通过反事实实体替换生成可控的知识冲突,旨在训练上下文忠实的RAG模型并评估其上下文接地行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26614 2026-04-30 cs.CV

State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading

超越外观:诊断并改进基于指针的测量读数中的状态一致性

Yuanze Hu, Gen Li, Yuqin Lan, Qingchen Yu, Zhichao Yang, Junwei Jing, Zhaoxin Fan, Xiaotie Deng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) Beihang University(北航) Fudan University(复旦大学) Peking University(北京大学)

AI总结 本文研究了多模态大语言模型在指针式测量读数任务中的表现问题,发现现有模型在状态一致性上存在缺陷,提出TriSCA框架以提升状态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26365 2026-04-30 cs.CV cs.LG

Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models

超越固定公式:用于高效扩散模型的数据驱动线性预测器

Zhirong Shen, Rui Huang, Jiacheng Liu, Chang Zou, Peiliang Cai, Shikang Zheng, Zhengyi Shi, Liang Feng, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Shandong University(山东大学) Xiamen University(厦门大学) Fudan University(复旦大学)

AI总结 本文提出L2P数据驱动缓存框架,通过学习每时间步的权重替代固定系数,有效降低扩散模型采样成本,实现4.55倍FLOPs减少和4.15倍延迟加速。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26232 2026-04-30 cs.CV cs.AI

DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation

DepthPilot:从可控性到可解释性在结肠镜视频生成中

Junhu Fu, Ke Chen, Weidong Guo, Shuyu Liang, Jie Xu, Chen Ma, Kehao Wang, Shengli Lin, Zeju Li, Yuanyuan Wang, Yi Guo, Shuo Li

机构 * College of Biomedical Engineering, Fudan University, Shanghai 200433, China(复旦大学生物医学工程学院) Key Laboratory of Medical Imaging Computing and Computer Assisted Intervention of Shanghai, Shanghai 200032, China(上海医学影像计算与计算机辅助干预重点实验室) Endoscopy Research Institute, Zhongshan Hospital, Fudan University, Shanghai 200032, China(复旦大学中山医院内窥镜研究所) Shanghai Collaborative Innovation Center of Endoscopy, Shanghai 200032, China(上海内窥镜协同创新中心) Department of Biomedical Engineering, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学生物医学工程系) Department of Computer and Data Science, Case Western Reserve University, Cleveland, OH 44106, USA(凯斯西储大学计算机与数据科学系)

AI总结 本文提出DepthPilot框架,通过几何对齐策略和自适应样条去噪模块,实现结肠镜视频生成的可控性与可解释性,取得高FID分数和临床评估领先成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26031 2026-04-30 cs.CV

Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding

第五届PVUW挑战赛报告:迈向像素级理解中的更多样化模态

Chang Liu, Henghui Ding, Nikhila Ravi, Yunchao Wei, Shuting He, Song Bai, Philip Torr, Leilei Cao, Jinrong Zhang, Deshui Miao, Xusheng He, Dengxian Gong, Zhiyu Wang, Mingqi Gao, Jihwan Hong, Canyang Wu, Weili Guan, Jianlong Wu, Liqiang Nie, Xingsen Huang, Yameng Gu, Xiaogang Yu, Xin Li, Ming-Hsuan Yang, Sijie Li, Jungong Han, Quanzhu Niu, Shihao Chen, Yuanzheng Wu, Yikang Zhou, Tao Zhang, Haobo Yuan, Lu Qi, Shunping Ji, Chao Yang, Chao Tian, Guoqing Zhu, Kai Yang, Zhifan Mo, Haijun Zhang, Xudong Kang, Shutao Li, Jaeyoung Do

机构 * The Institute of Big Data, Fudan University(复旦大学大数据研究院)

AI总结 报告总结了2026年PVUW挑战赛的目标、数据集及顶级方法,通过三个专业赛道评估了在高约束条件下最先进模型的表现,展示了社区最新技术进展和未来研究方向。

Comments Official Report of the 5th PVUW Challenge on CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21459 2026-04-30 cs.LG cs.AI

HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing

HER:面向大语言模型角色扮演的人类级推理与强化学习

Chengyu Du, Xintao Wang, Aili Chen, Weiyuan Li, Rui Xu, Junteng Liu, Zishan Huang, Rong Tian, Zijun Sun, Yuhao Li, Liheng Feng, Deming Ding, Pengyu Zhao, Yanghua Xiao

机构 * Fudan University(复旦大学) MiniMax

AI总结 本文提出HER框架,通过双层推理和人类对齐的奖励模型,提升大语言模型在角色扮演中的认知模拟能力,实验表明其在CoSER和Minimax Role-Play Bench上显著优于基线模型。

Comments Findings of ACL, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20340 2026-04-30 cs.CV

The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection

细节决定成败:通过关键帧驱动的细节注入增强视频虚拟试衣

Qingdong He, Xueqin Chen, Yanjie Pan, Peng Tang, Pengcheng Xu, Zhenye Gan, Chengjie Wang, Xiaobin Hu, Jiangning Zhang, Yabiao Wang

机构 * Tencent Youtu Lab(腾讯优图实验室) TU Delft(代尔夫特理工大学) Fudan University(复旦大学) Western University(西部大学)

AI总结 本文提出KeyTailor框架和ViT-HD数据集,通过关键帧驱动的细节注入策略提升视频虚拟试衣的服装真实性和背景完整性,实验表明其在动态和静态场景中表现更优。

Comments Accepted by CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25299 2026-04-29 cs.CV cs.AI

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

思考像素:多模态扩散潜在中的递归稀疏推理

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

AI总结 本文提出一种递归稀疏混合专家框架,用于提升多模态文本生成任务中视觉token的生成质量,通过递归机制和稀疏参数共享提高生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24832 2026-04-29 cs.LG cs.AI

On the Trainability of Masked Diffusion Language Models via Blockwise Locality

通过块级局部性训练掩码扩散语言模型

Yuxiang Wang, Yu Xiang, Baojian Zhou, Qifang Zhao, Keyue Jiang, Yanghua Xiao, Xiaoxiao Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Alibaba Group, China(阿里巴巴集团,中国)

AI总结 研究通过块级局部性改进掩码扩散语言模型,发现其在结构生成任务中稳定性不足,提出Jigsaw和Scatter模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24820 2026-04-29 cs.AR cs.AI

Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding

Salca:一种面向高效长上下文注意力解码的稀疏性感知硬件加速器

Wang Fan, Wei Cao, Xi Zha, Kedi Ma, MingQian Sun, Jialin Chen, Fengzhe Zhang, Fan Zhang

机构 * Fudan University(复旦大学)

AI总结 本文提出Salca,通过软硬件协同设计,解决长上下文注意力解码中的计算与内存瓶颈,实现3.82倍速度提升和74.19倍能效提升。

详情

展开后加载摘要…

URL PDF HTML 收藏