arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Fudan University(复旦大学)

2026-03-27 至 2026-03-27 共收录 11
2603.25738 2026-03-27 cs.CV

PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow

PSDesigner: 基于人类创意流程的自动化图形设计

Xincheng Shuai, Song Tang, Yutong Huang, Henghui Ding, Dacheng Tao

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院大数据研究所) Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院生成式人工智能实验室)

AI总结 PSDesigner通过模拟人类设计师的创意流程,实现了自动化图形设计,通过设计数据集CreativePSD提升工具使用能力,在多种设计任务中优于现有方法,使非专业人士能轻松创建高质量设计。

Comments CVPR 2026, Project Page: https://henghuiding.com/PSDesigner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25732 2026-03-27 cs.CV

BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation

BizGenEval:一个系统化的商业视觉内容生成基准测试

Yan Li, Zezi Zeng, Ziwei Zhou, Xin Gao, Muzhao Tian, Yifan Yang, Mingxi Cheng, Qi Dai, Yuqing Yang, Lili Qiu, Zhendong Wang, Zhengyuan Yang, Xue Yang, Lijuan Wang, Ji Li, Chong Luo

机构 * Microsoft Corporation(微软公司) Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Fudan University(复旦大学)

AI总结 本文提出BizGenEval基准测试,系统评估商业视觉内容生成模型在文档类型和多约束下的能力,包含20个任务和8000个检查问题,揭示现有模型与专业需求间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25730 2026-03-27 cs.CV cs.AI

PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference

PackForcing:短视频训练足以支持长视频采样和长上下文推理

Xiaofeng Mao, Shaohao Rui, Kaining Ying, Bo Zheng, Chuanhao Li, Mingmin Chi, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,盛大AI研究东京) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出PackForcing框架,通过三部分KV缓存策略有效管理生成历史,实现高效内存使用和长视频生成,展示短视频监督足以支持高质量长视频合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25728 2026-03-27 cs.CV cs.AI

PixelSmile: Toward Fine-Grained Facial Expression Editing

PixelSmile:迈向细粒度面部表情编辑

Jiabin Hua, Hengyuan Xu, Aojie Li, Wei Cheng, Gang Yu, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) StepFun(阶跃星辰)

AI总结 本文提出PixelSmile框架,通过全对称联合训练解耦表情语义,结合强度监督与对比学习实现更清晰可辨的表情生成,提升线性表达控制精度与稳定性,验证了其在连续可控细粒度表情编辑中的有效性。

Comments 21 Pages; Project Page: https://ammmob.github.io/PixelSmile/ Code: https://github.com/Ammmob/PixelSmile

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25672 2026-03-27 cs.RO cs.CV

Can Users Specify Driving Speed? Bench2Drive-Speed: Benchmark and Baselines for Desired-Speed Conditioned Autonomous Driving

用户可以指定驾驶速度吗?Bench2Drive-Speed:用于期望速度条件下的自动驾驶的基准和基线

Yuqian Shao, Xiaosong Jia, Langechuan Liu, Junchi Yan

机构 * Institute of Trustworthy Embodied AI (TEAI), Fudan University(复旦大学可信具身人工智能研究所) NVIDIA(英伟达)

AI总结 本文提出Bench2Drive-Speed基准,通过引入用户期望速度和超车指令,设计了Speed-Adherence Score和Overtake Score等指标,验证了在不增加真实世界数据收集的情况下,通过重新标注常规驾驶数据可实现速度监督。

Comments Project page: https://thinklab-sjtu.github.io/Bench2Drive-Speed/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25133 2026-03-27 cs.AI

RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following

RubricEval: 一种用于LLM评判者的 rubric级元评估基准

Tianjun Pan, Xuan Lin, Wenyan Yang, Qianyu He, Shisong Chen, Licai Qi, Wanqing Xu, Hongwei Feng, Bo Xu, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Donghua University(东华大学) Ant Group(蚂蚁集团)

AI总结 RubricEval旨在解决rubric级评估的可靠性问题,通过多样化的指令和响应以及高质量实例,评估评判者在指令遵循中的表现,发现即使GPT-4o在Hard子集也仅达到55.97%的准确率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12200 2026-03-27 cs.CV

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25072 2026-03-27 cs.CV

GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

GIFT:全局不可替代性帧目标用于高效视频理解

Junpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao, Yue Cao, Hengyu Zeng, Yuxiang Yan, Zhibin Wang, Jun Song, Bo Zheng, Shanghang Zhang, Jian Pu

机构 * Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Zhejiang University(浙江大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

AI总结 GIFT通过评估帧的内在不可替代性选择关键帧,解决视频理解中处理密集帧的高计算成本问题,提升视频分析效率。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24941 2026-03-27 cs.CV cs.CL

Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models

超越注意力幅度:利用层间排名一致性提升高效视觉-语言-动作模型

Peiju Liu, Jinming Liu, Xipeng Qiu, Xuanjing Huang

机构 * Fudan University(复旦大学)

AI总结 本文提出TIES框架,通过层间排名一致性动态平衡注意力幅度,提升视觉-语言-动作模型的效率,实现在CogACT+SIMPLER基准上成功率提升6%并减少78%的token使用。

Comments 10 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11441 2026-03-27 cs.CL

Is Compression Really Linear with Code Intelligence?

压缩与代码智能之间的真实关系是否线性?

Shijie Xuyang, Xianzhen Luo, Zheng Chu, Houyi Li, Siming Huang, Qiufeng Wang, Wanxiang Che, Qingfu Zhu, Shuigeng Zhou

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文通过评估多种开源代码LLM在多语言多任务基准上的表现,发现代码智能与压缩效率之间存在对数关系,挑战了此前线性假设。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15780 2026-03-27 cs.AI cs.CL

TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving

TrustGeoGen: 用于可信多模态几何问题求解的正式验证数据引擎

Daocheng Fu, Jianlong Chen, Renqiu Xia, Zijun Chen, Qi Liu, Yuan Feng, Hongbin Zhou, Renrui Zhang, Shiyang Feng, Peng Gao, Hongyuan Zha, Junchi Yan, Botian Shi, Yu Qiao, Bo Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文提出TrustGeoGen,通过正式验证生成多模态几何数据,提升模型深度几何推理能力,在GeoQA等基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏