arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

共收录 72
2506.21600 2025-06-30 cs.CL cs.AI cs.IR

Structured Attention Matters to Multimodal LLMs in Document Understanding

Chang Liu, Hongkai Chen, Yujun Cai, Hang Wu, Qingwen Ye, Ming-Hsuan Yang, Yiwei Wang

机构 * vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) The University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01493 2025-06-26 cs.CV eess.IV

Learning Adaptive Lighting via Channel-Aware Guidance

Qirui Yang, Peng-Tao Jiang, Hao Zhang, Jinwei Chen, Bo Li, Huanjing Yue, Jingyu Yang

机构 * Tianjin University(天津大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05384 2025-06-13 cs.CV cs.AI cs.MM

Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment

Zhuoxuan Cai, Jian Zhang, Xinbin Yuan, Peng-Tao Jiang, Wenxiang Chen, Bowen Tang, Lujian Yao, Qiyuan Wang, Jinwen Chen, Bo Li

机构 * Fudan University(复旦大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04641 2025-06-06 cs.CV

Text-Aware Real-World Image Super-Resolution via Diffusion Model with Joint Segmentation Decoders

Qiming Hu, Linlong Fan, Yiyan Luo, Yuhang Yu, Xiaojie Guo, Qingnan Fan

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) vivo Mobile Communication Co. Ltd(vivo移动通信有限公司)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01511 2025-06-03 cs.CV

Enhancing Diffusion-based Unrestricted Adversarial Attacks via Adversary Preferences Alignment

Kaixun Jiang, Zhaoyu Chen, Haijing Guo, Jinglun Li, Jiyuan Fu, Pinxue Guo, Hao Tang, Bo Li, Wenqiang Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(上海智能信息处理重点实验室,计算机科学与人工智能学院,复旦大学) Peking University(北京大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18263 2025-06-03 cs.CV

TSD-SR: One-Step Diffusion with Target Score Distillation for Real-World Image Super-Resolution

Linwei Dong, Qingnan Fan, Yihong Guo, Zhonghao Wang, Qi Zhang, Jinwei Chen, Yawei Luo, Changqing Zou

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co. Ltd(Vivo移动通信有限公司) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang Lab(浙江实验室)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21496 2025-05-28 cs.CL cs.CV cs.LG

UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents

Han Xiao, Guozhi Wang, Yuxiang Chai, Zimu Lu, Weifeng Lin, Hao He, Lue Fan, Liuyang Bian, Rui Hu, Liang Liu, Shuai Ren, Yafei Wen, Xiaoxin Chen, Aojun Zhou, Hongsheng Li

机构 * CUHK MMLab(香港中文大学MML实验室) vivo AI Lab(vivo人工智能实验室) CPII under InnoHK(创新科技署下的CPII)

Comments https://github.com/Euphoria16/UI-Genie

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21620 2025-05-27 cs.AI

UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning

Zhengxi Lu, Yuxiang Chai, Yaxuan Guo, Xi Yin, Liang Liu, Hao Wang, Han Xiao, Shuai Ren, Guanjing Xiong, Hongsheng Li

机构 * vivo AI Lab(vivo人工智能实验室)

Comments Updated UI-R1-E-3B

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05446 2025-05-09 cs.CV cs.CL

Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding

Han Xiao, Yina Xie, Guanxin Tan, Yinghao Chen, Rui Hu, Ke Wang, Aojun Zhou, Hao Li, Hao Shao, Xudong Lu, Peng Gao, Yafei Wen, Xiaoxin Chen, Shuai Ren, Hongsheng Li

机构 * CUHK MMLab(香港中文大学MML实验室) vivo AI Lab(vivo人工智能实验室) CPII under InnoHK(创新工场下的CPII) Shanghai AI Lab & Shenzhen Institute of Advanced Technology, CAS(上海人工智能实验室及深圳先进技术研究所,中国科学院)

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06661 2025-05-08 cs.CV

Efficiency Meets Fidelity: A Novel Quantization Framework for Stable Diffusion

Shuaiting Li, Juncan Deng, Zeyu Wang, Kedong Xu, Rongtao Deng, Hong Gu, Haibin Shen, Kejie Huang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20438 2025-05-01 cs.CV

PixelHacker: Image Inpainting with Structural and Semantic Consistency

Ziyang Xu, Kangsheng Duan, Xiaolei Shen, Zhifeng Ding, Wenyu Liu, Xiaohu Ruan, Xiaoxin Chen, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) VIVO AI Lab(VIVO人工智能实验室)

Comments https://hustvl.github.io/PixelHacker

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13807 2025-04-28 cs.CV

Improving Consistency in Diffusion Models for Image Super-Resolution

Junhao Gu, Peng-Tao Jiang, Hao Zhang, Mi Zhou, Jinwei Chen, Wenming Yang, Bo Li

机构 * Tsinghua University(清华大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

详情

展开后加载摘要…

URL PDF HTML 收藏