arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-08-21 至 2026-08-21 共收录 6
2608.20336 2026-08-21 cs.CV 新提交

WithEveryone: Unified Planning and Identity Grounding for Group Image Generation

WithEveryone:面向群体图像生成的统一规划与身份定位

Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-gang Jiang

机构 * Fudan University(复旦大学) Hunyuan, Tencent(腾讯混元) The University of Hong Kong(香港大学)

AI总结 针对多人物群体图像生成的身份保留难题,提出WithEveryone框架,通过布局定位身份损失等技术,提升了人脸相似度并降低伪影,实现高身份覆盖率与低重复率。

Comments Project Page: this http URL (http://doby-xu.github.io/WithEveryone/);Code will be released: this http URL (http://github.com/Doby-Xu/WithEveryone/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19613 2026-08-21 cs.RO cs.CV 新提交

What Matters for Latent Actions in Robot Learning

机器人学习中隐式动作的关键影响因素

Xizhou Bu, Qingda Hu, Lei Zhou, Lingfeng Zhang, Yingbo Tang, Zihao Liu, Xinyi Tao, Zhiqiang Ma, Qingqiu Huang, Chufeng Tang, Hongbo Wang, Jing Zhang, Jiayi Ma, Hangjun Ye, Wei Li, Xiaoshuai Hao

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Guangdong Provincial Key Laboratory of Computility Microelectronics, Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机微科学与技术学院、广东省计算微电子重点实验室) School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) Suzhou Evans Intelligent Technology Co., Ltd.(苏州伊文斯智能科技有限公司) Morphi Intelligence Technology Co., Ltd.(墨飞智能科技有限公司) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Xiaomi EV(小米汽车)

AI总结 本研究通过统一框架整合代表性隐式动作模型,系统探究41种设计选择,发现用隐式动作微调视觉语言模型主干可为下游机器人操纵策略学习提供更强初始化。

Comments Project page: this https URL (https://carldegio.github.io/latent_action.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18607 2026-08-21 cs.CV 版本更新

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

机构 * Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司)

AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。

Comments 19 pages, 7 figures, 8 tables. Code: this https URL (https://github.com/ShareLab-SII/VA-Judger)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02022 2026-08-21 cs.AI 版本更新

ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis

ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断

Yu Li, Haoyu Luo, Yuejin Xie, Yuqian Fu, Zhonghao Yang, Shuai Shao, Qihan Ren, Wanying Qu, Yanwei Fu, Yujiu Yang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) KAUST(卡塔尔人工智能科学中心) East China Normal University(华东师范大学)

AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13731 2026-08-21 cs.CL 版本更新

Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA

Doc-V*:多页文档视觉问答中的粗到细交互推理

Yuanlei Zheng, Pei Fu, Hang Li, Ziyang Wang, Yuyi Zhang, Wenyu Ruan, Xiaojin Zhang, Zhongyu Wei, Zhenbo Luo, Jian Luan, Wei Chen, Xiang Bai

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus团队) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 Doc-V*提出一种无OCR的智能框架,通过序列证据聚合解决多页文档VQA问题,结合语义检索和目标页面获取,提升回答准确性和证据收集效率,在五个基准测试中优于开源基线,提升领域外性能达47.9%。

Comments Accepted by Association for Computational Linguistics (ACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18305 2026-08-21 cs.CV 版本更新

SwipeGen: Bridging the Execution Gap in GUI Agents via Human-like Swipe Synthesis

SwipeGen: 通过类人滑动合成弥合GUI代理的执行差距

Xuan Wang, Siyuan Su, Quantong Fu, Yongxiang Hu, Yangfan Zhou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室)

AI总结 SwipeGen通过合成类人滑动交互提升GUI代理的执行能力,实验显示其滑动执行准确率较基线提升214%。

Comments Accepted to ACM MM 2026. 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏