arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

共收录 72
2602.01554 2026-04-07 cs.LG cs.AI cs.CV

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

InfoTok: 基于信息理论的容量受限共享视觉标记化在统一多模态大语言模型中的应用

Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

AI总结 本文提出InfoTok,一种基于信息瓶颈原理的信息正则化标记化机制,通过互信息约束平衡压缩与任务相关性,提升统一多模态大语言模型的图像理解和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18886 2026-03-19 cs.CV

MagicWorld: Towards Long-Horizon Stability for Interactive Video World Exploration

MagicWorld: 向交互视频世界探索的长时稳定迈进

Guangyuan Li, Bo Li, Jinwei Chen, Xiaobin Hu, Lei Zhao, Peng-Tao Jiang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo蓝影实验室,vivo移动通信有限公司) National University of Singapore(新加坡国立大学)

AI总结 本文提出MagicWorld模型,通过引入流引导运动保留约束和增强交互训练策略,解决复杂环境中运动漂移和长时交互误差累积问题,并构建RealWM120K数据集验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22977 2026-03-19 cs.CV

HyperMotionX: The Dataset and Benchmark with DiT-Based Pose-Guided Human Image Animation of Complex Motions

HyperMotionX:基于DiT的Pose引导人体图像动画的Dataset和Benchmark

Shuolin Xu, Siming Zheng, Ziyi Wang, HC Yu, Jinwei Chen, Huaqi Zhang, Daquan Zhou, Tong-Yee Lee, Bo Li, Peng-Tao Jiang

机构 * Bournemouth University(伯恩茅斯大学) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd(vivo 蓝影实验室,vivo 通信有限公司) Peking University(北京大学) National Cheng-Kung University(国立成功大学)

AI总结 本文提出基于DiT的高效人体动画生成基线和改进的RoPE模块,构建了HyperMotionX数据集和基准,提升了复杂人体运动动画的结构稳定性和外观一致性。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05554 2026-03-09 cs.CV cs.IR

RED: Robust Event-Guided Motion Deblurring with Modality-Specific Disentanglement

RED: 基于事件引导的鲁棒运动去模糊化与模态特定解耦

Yihong Leng, Siming Zheng, Jinwei Chen, Bo Li, Jiaojiao Li, Peng-Tao Jiang

机构 * Xidian University(西安电子科技大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

AI总结 RED通过事件引导的鲁棒运动去模糊化方法,结合模态特定解耦与选择性融合,提升模糊图像的清晰度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09864 2026-03-09 cs.CV

AuthFace: Towards Authentic Blind Face Restoration with Face-oriented Generative Diffusion Prior

AuthFace: 向真实盲脸修复迈进的面向面部生成扩散先验

Guoqiang Liang, Qingnan Fan, Bingtao Fu, Jinwei Chen, Hong Gu, Lin Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Nanyang Technological University(南洋理工大学)

AI总结 AuthFace通过面向面部的生成扩散先验和摄影引导标注,实现高质量盲脸修复,提升面部细节还原和减少关键区域伪影。

Comments ACM MM 25, Codes and datasets are available at https://github.com/EthanLiang99/AuthFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19524 2026-03-05 cs.CV cs.MA

VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

VideoChat-M1: 通过多智能体强化学习实现视频理解的协作策略规划

Boyu Chen, Zikang Wang, Zhengrong Yue, Kainan Yan, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VIVO AI Lab(VIVO人工智能实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Campus of Sun Yat-sen University(孙逸仙大学深圳校区) Shanghai Jiao Tong University(上海交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院)

AI总结 VideoChat-M1通过多智能体强化学习实现视频理解的协作策略规划,显著提升复杂视频任务的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01163 2026-03-03 cs.CV

BeautyGRPO: Aesthetic Alignment for Face Retouching via Dynamic Path Guidance and Fine-Grained Preference Modeling

BeautyGRPO: 通过动态路径引导和细粒度偏好建模实现面部修饰的美观对齐

Jiachen Yang, Xianhui Lin, Yi Dong, Zebiao Zheng, Xing Liu, Hong Gu, Yanmei Fang

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, China(中山大学计算机科学与技术学院,深圳校区) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd., China(vivo蓝影实验室,vivo移动通信有限公司)

AI总结 BeautyGRPO通过动态路径引导和细粒度偏好建模,解决面部修饰中保真度与审美偏好对齐的难题,实现更高质量的图像编辑效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18489 2026-03-03 cs.CV

Mono4DGS-HDR: High Dynamic Range 4D Gaussian Splatting from Alternating-exposure Monocular Videos

Mono4DGS-HDR: 从交替曝光单目视频中重建可渲染的4D高动态范围场景

Jinfeng Liu, Lingtong Kong, Mi Zhou, Jinwen Chen, Dan Xu

机构 * The Hong Kong University of Science and Technology (HKUST)(香港科学与技术大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

AI总结 Mono4DGS-HDR通过两阶段优化方法,从交替曝光单目视频中高效重建可渲染的4D HDR场景。

Comments This paper is accepted by ICLR 2026. Project page is available at https://liujf1226.github.io/Mono4DGS-HDR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16557 2026-03-03 eess.IV cs.AI cs.CV

Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution

面向现实图像超分辨率的时序一步扩散网络

Tianyi Zhang, Zheng-Peng Duan, Peng-Tao Jiang, Bo Li, Ming-Ming Cheng, Chun-Le Guo, Chongyi Li

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) vivo Mobile Communication Co. Ltd(vivo移动通信有限公司) NKIARI, Shenzhen Futian(深圳福田NKIARI)

AI总结 TADSR通过时间感知的变分自编码器和VSD损失,实现现实图像超分辨率的高效一步式生成,平衡保真度与现实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20664 2026-02-25 cs.CV

AnimeAgent: Is the Multi-Agent via Image-to-Video models a Good Disney Storytelling Artist?

AnimeAgent: 多智能体 via 图像到视频模型是否是一个好的迪士尼故事创作艺术家?

Hailong Yan, Shice Liu, Tao Wang, Xiangtao Zhang, Yijie Zhong, Jinwei Chen, Le Zhang, Bo Li

机构 * UESTC vivo Mobile Communication Co. Ltd(vivo移动通信有限公司)

AI总结 AnimeAgent通过基于图像到视频的多智能体框架,提升自定义分镜生成的 consistency、prompt fidelity 和 stylization,首次解决静态扩散模型的动态表现力不足问题。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08582 2026-02-10 cs.CV

SemiNFT: Learning to Transfer Presets from Imitation to Appreciation via Hybrid-Sample Reinforcement Learning

SemiNFT: 通过混合样本强化学习从模仿到欣赏学习转移预设

Melany Yang, Yuhang Yu, Diwang Weng, Jinwei Chen, Wei Dong

机构 * vivo Mobile Communication Co. Ltd(vivo移动通信有限公司) Zhejiang University(浙江大学)

AI总结 SemiNFT通过混合样本强化学习从模仿到欣赏学习,实现更高级的审美理解与色彩润色能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06346 2026-02-09 cs.CV

FlowConsist: Make Your Flow Consistent with Real Trajectory

FlowConsist: 使您的流与真实轨迹一致

Tianyi Zhang, Chengcheng Liu, Jinwei Chen, Chun-Le Guo, Chongyi Li, Ming-Ming Cheng, Bo Li, Peng-Tao Jiang

机构 * VCIP, CS, Nankai University(VCIP、计算机科学、南开大学) vivo Mobile Communication Co. Ltd(vivo移动通信有限公司)

AI总结 FlowConsist通过强制轨迹一致性解决快速流模型中的轨迹漂移和误差积累问题,仅需一次采样步即在ImageNet 256×256上取得新的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05832 2026-02-06 cs.CV

UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents

UI-Mem: 为移动GUI代理在线强化学习中的自演化经验记忆

Han Xiao, Guozhi Wang, Hao Wang, Shilong Liu, Yuxiang Chai, Yue Pan, Yufeng Zhou, Xiaoxin Chen, Yafei Wen, Hongsheng Li

机构 * Multimedia Laboratory (MMLab), The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shenzhen Loop Area Institute(深圳河套学院) Shanghai AI Lab(上海人工智能实验室) vivo AI Lab(vivo人工智能实验室) Princeton University(普林斯顿大学)

AI总结 UI-Mem通过自演化经验记忆提升移动GUI代理在线强化学习性能,实现跨任务经验转移与策略优化。

Comments 23 pages, 16 figures. Project page: https://ui-mem.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01411 2026-02-06 cs.CV

Human Body Restoration with One-Step Diffusion Model and A New Benchmark

一步扩散模型与新基准的人体恢复

Jue Gong, Jingkai Wang, Zheng Chen, Xing Liu, Hong Gu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University, China(上海交通大学) vivo Mobile Communication Co., Ltd, China(vivo移动通信有限公司)

AI总结 本文提出了一种一步扩散模型OSDHuman和新基准数据集PERSONA,用于提升人体恢复的视觉质量和定量指标。

Comments 8 pages, 9 figures. Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04398 2026-02-05 cs.CL cs.AI

Bi-directional Bias Attribution: Debiasing Large Language Models without Modifying Prompts

双向偏见归因:无需修改提示的大型语言模型去偏方法

Yujie Lin, Kunquan Li, Yixuan Liao, Xiaoxin Chen, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) vivo AI Lab, China(vivo AI实验室) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),文化部,中国)

AI总结 本文提出一种无需微调或修改提示的双向偏见归因方法,通过检测刻板印象词汇并归因神经元偏见,有效减少LLM中的偏见同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19742 2026-02-05 cs.CV

HAODiff: Human-Aware One-Step Diffusion via Dual-Prompt Guidance

HAODiff: 人类感知的单步扩散 via 双提示引导

Jue Gong, Tingyu Yang, Jingkai Wang, Zheng Chen, Xing Liu, Hong Gu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

AI总结 HAODiff通过双提示引导方法,针对人类运动模糊和通用噪声问题,提升图像修复的鲁棒性和视觉质量。

Comments 9 pages, 8 figures. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01864 2026-02-03 cs.CV

Trust but Verify: Adaptive Conditioning for Reference-Based Diffusion Super-Resolution via Implicit Reference Correlation Modeling

信任但验证:通过隐式参考相关性建模实现基于参考的扩散超分辨率的自适应条件化

Yuan Wang, Yuhao Wan, Siming Zheng, Bo Li, Qibin Hou, Peng-Tao Jiang

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

AI总结 本文提出Ada-RefSR,通过自适应隐式相关性门控机制,在扩散模型中实现基于参考的超分辨率,提升图像恢复的准确性和鲁棒性。

Comments 26 pages, 19 figures. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20655 2026-01-27 cs.CV

Photography Perspective Composition: Towards Aesthetic Perspective Recommendation

摄影视角构图:迈向审美视角推荐

Lujian Yao, Siming Zheng, Xinbin Yuan, Zhuoxuan Cai, Pu Wu, Jinwei Chen, Bo Li, Peng-Tao Jiang

机构 * vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

AI总结 本文提出摄影视角构图(PPC)方法,通过自动化数据集构建、视频生成和视角质量评估模型,解决视角变换数据稀缺和评估标准模糊的问题,帮助普通用户提升摄影构图能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13695 2026-01-22 cs.CL

OptiSQL: Executable SQL Generation from Optical Tokens

OptiSQL: 从光学令牌生成可执行SQL

Sifan Li, Hongkai Chen, Yujun Cai, Liyang Chen, Qingwen Ye, Yiwei Wang

机构 * University of California, Merced(加州大学默塞德分校) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司) University of Queensland(昆士兰大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 OptiSQL通过紧凑的光学令牌从表格图像和自然语言问题生成可执行SQL,有效减少令牌开销并提升执行准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01149 2026-01-13 cs.AI

A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation

A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估

Yuxiang Chai, Shunye Tang, Han Xiao, Weifeng Lin, Hanhao Li, Jiayu Zhang, Liang Liu, Pengxiang Zhao, Guangyi Liu, Guozhi Wang, Shuai Ren, Rongduo Han, Haining Zhang, Siyuan Huang, Hongsheng Li

机构 * Nankai University(南开大学) vivo AI Lab(vivo 人工智能实验室) SJTU(上海交通大学)

AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08078 2025-12-29 cs.SD cs.LG

Detecting and Mitigating Insertion Hallucination in Video-to-Audio Generation

检测并缓解视频到音频生成中的插入幻觉

Liyang Chen, Hongkai Chen, Yujun Cai, Sifan Li, Qingwen Ye, Yiwei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) The University of Queensland(昆士兰大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司) University of California, Merced(加州大学默塞德分校)

AI总结 本文提出HALCON方法,通过三阶段流程缓解视频到音频生成中的插入幻觉问题,显著降低幻觉的普遍性和持续时间,同时保持音频质量和时间同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19107 2025-12-23 cs.AI

FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning

FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐

Zhe Yang, Xiaoshuang Sheng, Zhengnan Zhang, Jidong Wu, Zexing Wang, Xin He, Shenghua Xu, Guanjing Xiong

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang University(浙江大学)

AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13405 2025-12-16 cs.CL

RealHiTBench: A Comprehensive Realistic Hierarchical Table Benchmark for Evaluating LLM-Based Table Analysis

RealHiTBench: 一个全面的现实感分层表格基准,用于评估基于LLM的表格分析

Pengzuo Wu, Yuhang Yang, Guangcheng Zhu, Chao Ye, Hong Gu, Xu Lu, Ruixuan Xiao, Bowen Bao, Yijing He, Liangyu Zha, Wentao Ye, Junbo Zhao, Haobo Wang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Institute of Computing Innovation, Zhejiang University(浙江大学计算机创新研究院)

AI总结 RealHiTBench是一个用于评估基于LLM的表格分析能力的综合现实感分层表格基准,通过多种输入格式和复杂结构的表格测试,验证了改进LLMs对表格层次结构感知的重要性。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21024 2025-11-27 cs.CV

CameraMaster: Unified Camera Semantic-Parameter Control for Photography Retouching

CameraMaster: 用于摄影修饰的统一相机语义-参数控制

Qirui Yang, Yang Yang, Ying Zeng, Xiaobin Hu, Bo Li, Huanjing Yue, Jingyu Yang, Peng-Tao Jiang

机构 * Tianjin University(天津大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) NUS(国立大学)

AI总结 CameraMaster通过统一相机感知框架实现精确摄影修饰,通过解耦相机指令和参数嵌入,提升多参数控制与语义-参数对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08227 2025-11-25 cs.CV cs.AI

OMGSR: You Only Need One Mid-timestep Guidance for Real-World Image Super-Resolution

OMGSR: 仅需一个中时步引导即可实现真实世界图像超分辨率

Zhiqiang Wu, Zhaomang Sun, Tong Zhou, Bingtao Fu, Ji Cong, Yitong Dong, Huaqi Zhang, Xuan Tang, Mingsong Chen, Xian Wei

机构 * East China Normal University(东华师范大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

AI总结 OMGSR通过预计算中时步和引入LRR损失,提升真实世界图像超分辨率的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14153 2025-11-19 cs.CV cs.AI

LENS: Learning to Segment Anything with Unified Reinforced Reasoning

Lianghui Zhu, Bin Ouyang, Yuxuan Zhang, Tianheng Cheng, Rui Hu, Haocheng Shen, Longjin Ran, Xiaoxin Chen, Li Yu, Wenyu Liu, Xinggang Wang

机构 * vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

Comments Code is released at https://github.com/hustvl/LENS

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12017 2025-11-13 cs.CV cs.CY

Exploring the Adversarial Robustness of Face Forgery Detection with Decision-based Black-box Attacks

Zhaoyu Chen, Bo Li, Kaixun Jiang, Shuang Wu, Shouhong Ding, Wenqiang Zhang

机构 * Shanghai Engineering Research Center of AI & Robotics, Academy for Engineering & Technology, Fudan University, Shanghai 200433, China(上海人工智能与机器人工程研究中心,工程与技术学院,复旦大学,上海) Engineering Research Center of Robotics, Ministry of Education, Academy for Engineering & Technology, Fudan University, Shanghai 200433, China(机器人工程研究中心,教育部,工程与技术学院,复旦大学,上海) Youtu Lab, Tencent, Shanghai 200000, China(优衣库实验室,腾讯,上海) vivo Mobile Communication Co., Ltd, Shanghai 200120, China(vivo移动通信有限公司,上海) Shanghai Key Lab of Intelligent Information Processing, School of Computer Science, Fudan University, Shanghai 200433, China(上海智能信息处理重点实验室,计算机科学学院,复旦大学,上海)

Comments Accepted by Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18094 2025-11-11 cs.CV cs.AI

UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning

Ye Liu, Zongyang Ma, Junfu Pu, Zhongang Qi, Yang Wu, Ying Shan, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) vivo Mobile Communication Co.(vivo移动通信公司) MindWingman Technology (Shenzhen) Co., Ltd.(深圳MindWingman技术有限公司)

Comments NeurIPS 2025 Camera Ready. Project Page: https://polyu-chenlab.github.io/unipixel/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10105 2025-07-01 cs.CV

High-Precision Dichotomous Image Segmentation via Probing Diffusion Capacity

Qian Yu, Peng-Tao Jiang, Hao Zhang, Jinwei Chen, Bo Li, Lihe Zhang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏