arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2402
2509.02460 2026-03-20 cs.CV

GenCompositor: Generative Video Compositing with Diffusion Transformer

GenCompositor:基于扩散变换器的生成视频合成

Shuzhou Yang, Xiaoyu Li, Xiaodong Cun, Guangzhi Wang, Lingen Li, Ying Shan, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) GVC Lab, Great Bay University(Great Bay大学GVC实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出GenCompositor,通过扩散变换器实现自动化视频合成,解决传统方法劳动强度大、成本高的问题,提出轻量背景保存分支、动态元素融合块和ERoPE位置嵌入等创新方法,构建VideoComp数据集并验证方法有效性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13387 2026-03-20 cs.CV

TR2M: Transferring Monocular Relative Depth to Metric Depth with Language Descriptions and Dual-Level Scale-Oriented Contrast

TR2M: 通过语言描述和双级尺度导向对比转移单目相对深度到度量深度

Beilei Cui, Yiming Huang, Long Bai, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出TR2M框架,通过语言描述和图像输入,利用双级尺度导向对比学习,解决相对深度到度量深度的转换问题,实现跨域的零样本性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17826 2026-03-19 cs.SE cs.AI

FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair

FailureMem: 一种面向故障的多模态框架用于自主软件修复

Ruize Ma, Yilei Jiang, Shilin Zhang, Zheng Ma, Yi Feng, Vincent Ng, Zhi Wang, Xiangyu Yue, Chuanyi Li, Lewei Lu

机构 * Nanjing University(南京大学) SenseTime(秒速) The Chinese University of Hong Kong(香港中文大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

AI总结 本文提出FailureMem框架,通过融合工作流代理、主动感知工具和故障记忆库,提升多模态自动程序修复的效率与准确性,实验表明其在GUI修复任务中解决率提升3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15352 2026-03-19 cs.SD cs.AI eess.AS

NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation

NV-Bench:非言语发声合成的基准测试用于表达性文本到语音生成

Qinke Ni, Huan Liao, Dekun Chen, Yuxiang Wang, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出NV-Bench,首个基于功能分类的非言语发声合成基准,包含1651个多语言真实场景语句及人类参考音频,通过双维度评估协议评估TTS模型的可控性和声音真实性。

Comments Submit to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18735 2026-03-19 cs.CV cs.RO

LaS-Comp: Zero-shot 3D Completion with Latent-Spatial Consistency

LaS-Comp:基于潜在-空间一致性的零样本3D补全

Weilong Yan, Haipeng Li, Hao Xu, Nianjin Ye, Yihao Ai, Shuaicheng Liu, Jingyu Hu

机构 * National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出LaS-Comp,利用3D基础模型的几何先验实现零样本3D形状补全。通过双阶段设计,结合显式替换和隐式细化阶段,实现高保真补全,并引入Omni-Comp基准测试,验证了方法的优越性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16963 2026-03-19 q-bio.QM cs.CV

Topology-Guided Biomechanical Profiling: A White-Box Framework for Opportunistic Screening of Spinal Instability on Routine CT

拓扑引导的生物力学分析:一种白盒框架用于常规CT中脊柱不稳定性的机会性筛查

Zanting Ye, Xuanbin Wu, Guoqing Zhong, Shengyuan Liu, Jiashuai Liu, Ge Song, Zhisong Wang, Jing Hao, Xiaolong Niu, Yefeng Zheng, Yu Zhang, Lijun Lu

机构 * Southern Medical University(南方医科大学) The Affiliated Cancer Hospital of Zhengzhou University(郑州大学附属肿瘤医院) The Chinese University of Hong Kong(香港中文大学) Xi'an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学) The University of Hong Kong(香港大学) Westlake University(西湖大学) Guangdong Provincial People's Hospital(广东省人民医院)

AI总结 本文提出一种白盒框架,通过拓扑引导的生物力学分析,解决常规CT中脊柱不稳定性的筛查问题,通过几何创新和可解释的AI方法提高诊断准确性。

Comments 11 pages, 3 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20095 2026-03-19 cs.CV

WPT: World-to-Policy Transfer via Online World Model Distillation

WPT: 通过在线世界模型蒸馏实现世界到策略的迁移

Guangfeng Jiang, Yueru Luo, Jun Liu, Yi Huang, Yiyao Zhu, Zhan Qu, Dave Zhenyu Chen, Bingbing Liu, Xu Yan

机构 * University of Science and Technology of China(科学技术大学) CUHK-SZ(香港中文大学(深圳)) HKUST(香港理工大学) Huawei Foundation Model Department(华为基金会模型部)

AI总结 本文提出WPT方法,通过在线世界模型蒸馏实现策略迁移,提升规划性能并保持实时部署能力,实验表明其在开放环和闭合环基准上表现优异。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16955 2026-03-19 cs.CV cs.LG eess.IV

Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models

邻居GRPO:对比ODE策略优化对齐流模型

Dailan He, Guanlin Feng, Xingtong Ge, Yazhe Niu, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Vivix Group Limited(Vivix集团有限公司) HKUST(香港理工大学) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

AI总结 本文提出Neighbor GRPO,通过扰动ODE初始噪声条件生成候选轨迹,基于softmax距离优化,避免SDE,提升效率与生成质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06396 2026-03-19 cs.AI cs.CR

Efficient LLM Safety Evaluation through Multi-Agent Debate

通过多智能体辩论实现高效的LLM安全评估

Dachuan Lin, Guobin Shen, Zihao Yang, Tianrong Liu, Dongcheng Zhao, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Super Alignment(北京安全人工智能与超对齐重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) CSE, The Chinese University of Hong Kong(香港中文大学电子工程系) University of Chinese Academy of Sciences(中国科学院大学) Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系) Long-term AI(长期人工智能)

AI总结 本文提出多智能体辩论框架,利用HAJailBench基准测试,提升LLM安全评估的可靠性与经济性,验证了少量辩论轮次即可获得显著效果。

Comments 15 pages, 5 figures, 10 tables. Updated abstract to fix an incconsistency issue with the main paper: HAJailBench size (12,000 -> 11,100)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25758 2026-03-19 cs.AI

TheraMind: A Strategic and Adaptive Agent for Longitudinal Psychological Counseling

TheraMind:一种用于长期心理辅导的战略和自适应代理

He Hu, Chiyuan Ma, Qianning Wang, Lin Liu, Yucheng Zhou, Laizhong Cui, Fei Ma, Qi Tian

机构 * Shenzhen University(深圳大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Auckland University of Technology(奥克兰理工大学) University of Science and Technology of China(中国科学技术大学) SKL-IOTSC, CIS, University of Macau(澳门科技研究所、CIS、澳门大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

AI总结 本文提出TheraMind,一种用于可信在线长期心理辅导的战略和自适应代理,通过双循环架构提升对话管理和治疗规划能力,实验证明其在多会话指标上优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19161 2026-03-19 cs.CV

Benchmarking Endoscopic Surgical Image Restoration and Beyond

内窥手术图像修复与更广泛的评估

Jialun Pei, Diandian Guo, Donghui Yang, Zhixi Li, Yuxin Feng, Long Ma, Bo Du, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Dalian University of Technology(大连理工大学) Southern Medical University(南方医科大学) Xidian University(西安电子科技大学) Wuhan University(武汉大学)

AI总结 本文提出SurgClean数据集,用于评估内窥手术场景中的多种图像修复任务,揭示现有算法与临床需求间的差距,并从结构和语义角度分析手术与自然场景的退化差异。

Comments This work has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22179 2026-03-19 cs.CV

High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning

高保真扩散面部交换与ID约束面部条件化

Dailan He, Xiahong Wang, Shulun Wang, Guanglu Song, Bingqi Ma, Hao Shao, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Vivix Group Limited(Vivix集团有限公司) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

AI总结 本文提出了一种ID约束的面部条件化框架,通过解耦条件注入确保身份保持并优化属性对齐,结合身份和对抗损失提升生成质量,在定性和定量评估中均优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22174 2026-03-19 cs.CV

Synergistic Bleeding Region and Point Detection in Laparoscopic Surgical Videos

腹腔镜手术视频中出血区域与点的协同检测

Jialun Pei, Zhangjun Zhou, Diandian Guo, Zhixi Li, Jing Qin, Bo Du, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Southern Medical University(南方医科大学) Wuhan University(武汉大学)

AI总结 本文提出BlooDet模型,通过协同检测腹腔镜手术中的出血区域和点,提升手术成功率。

Comments This work has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16844 2026-03-18 cs.CV

M^3: Dense Matching Meets Multi-View Foundation Models for Monocular Gaussian Splatting SLAM

M^3:密集匹配与多视角基础模型结合的单目高斯点云SLAM

Kerui Ren, Guanghao Li, Changjian Jiang, Yingxiang Xu, Tao Lu, Linning Xu, Junting Dong, Jiangmiao Pang, Mulin Yu, Bo Dai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 本文提出M^3,结合多视角基础模型与单目高斯点云SLAM,通过引入匹配头提升密集对应关系,增强跟踪稳定性,在多种基准上取得优异的位姿估计和场景重建性能。

Comments Project page: https://city-super.github.io/M3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16822 2026-03-18 cs.AI

Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence

Surg$Σ$: 一种大规模多模态数据和基础模型的光谱,用于外科智能

Zhitao Zeng, Mengya Xu, Jian Jiang, Pengfei Guo, Yunqiu Xu, Zhu Zhuo, Chang Han Low, Yufan He, Dong Yang, Chenxi Lin, Yiming Gu, Jiaxin Guo, Yutong Ban, Daguang Xu, Qi Dou, Yueming Jin

机构 * NUS(新加坡国立大学) CUHK(香港中文大学) SJTU(上海交通大学) NVIDIA(英伟达)

AI总结 本文提出Surg$Σ$,通过大规模多模态数据和基础模型提升外科智能,解决现有框架任务特定、泛化能力差的问题,展示统一语义设计和结构化推理标注的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16569 2026-03-18 cs.LG

Deep Tabular Representation Corrector

深度表格表示校正器

Hangting Ye, Peng Wang, Wei Fan, Xiaozhuang Song, He Zhao, Dandan Gun, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Ministry of Education, China(教育部知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) CSIRO’s Data61 and Monash University(CSIRO的数据61与莫纳什大学)

AI总结 本文提出TRC方法,通过两个任务提升深度表格模型的表示,无需修改参数,有效解决表示偏移和冗余问题。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16434 2026-03-18 cs.AI q-fin.TR

From Natural Language to Executable Option Strategies via Large Language Models

从自然语言到可执行期权策略的大型语言模型

Haochen Luo, Zhengzhao Lai, Junjie Xu, Yifan Li, Tang Pok Hin, Yuan Zhang, Chen Liu

机构 * City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Shanghai University of Finance and Economics(上海财经大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出Option Query Language,通过语法规则将期权市场抽象为高层 primitives,使LLM能作为语义解析器生成可执行期权策略,并通过新数据集验证其优于直接生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16211 2026-03-18 cs.CV

Leveling3D: Leveling Up 3D Reconstruction with Feed-Forward 3D Gaussian Splatting and Geometry-Aware Generation

Leveling3D: 通过前馈3D高斯点划法与几何感知生成提升3D重建

Yiming Huang, Baixiang Huang, Beilei Cui, Chi Kit Ng, Long Bai, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 Leveling3D结合前馈3D重建与几何一致生成,解决传统方法在 extrapolated view 中的缺失区域问题,通过几何感知适配器提升3D重建质量,实现生成与重建的同步优化。

Comments 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15618 2026-03-18 cs.CV

Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models

先看再行动:增强视觉基础表示以用于视觉-语言-动作模型

Yulin Luo, Hao Chen, Zhuangzhe Wu, Bowen Sui, Jiaming Liu, Chenyang Gu, Zhuoyang Liu, Qiuxuan Feng, Jiale Yu, Shuo Gu, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Simplexity Robotics(Simplexity机器人公司) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出DeepVision-VLA框架,通过视觉-语言混合变压器提升视觉表示,引入动作引导视觉剪枝技术,实现在模拟和现实任务中提升9.0%和7.5%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17018 2026-03-18 cs.CV

SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward

SophiaVL-R1: 通过思考奖励强化大语言模型的推理能力

Kaixuan Fan, Kaituo Feng, Haoming Lyu, Dongzhan Zhou, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(MMLab,香港中文大学) Shanghai Artifcial Intelligence Laboratory(上海人工智能实验室)

AI总结 SophiaVL-R1通过引入思考奖励信号提升多模态大语言模型的推理能力,采用信任GRPO方法和退火训练策略,有效缓解奖励黑客问题,实验表明其在多个基准测试中表现优异。

Comments ICLR 2026, Project page:https://github.com/kxfan2002/SophiaVL-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02641 2026-03-18 cs.CV cs.AI eess.IV

Deformation-Invariant Neural Network and Its Applications in Distorted Image Restoration and Analysis

变形不变神经网络及其在失真图像恢复与分析中的应用

Han Zhang, Qiguang Chen, Lok Ming Lui

机构 * City University of Hong Kong(香港城市大学) Hong Kong Center for Cerebro-Cardiovascular Health Engineering(香港脑心血管健康工程中心) Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出变形不变神经网络(DINN),通过引入准共形变换网络(QCTN)解决几何失真图像的恢复与分析问题,其核心方法是利用准共形映射控制局部几何失真,提升图像分类和恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15647 2026-03-18 cs.LG cs.AI

Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing

引导冻结的大型语言模型:通过在线提示路由实现适应性社会对齐

Zeyu Zhang, Xiangxiang Dai, Ziyi Han, Xutong Liu, John C. S. Lui

机构 * The Chinese University of Hong Kong(香港中文大学) University of Washington(华盛顿大学)

AI总结 本文提出CCLUB框架,通过系统提示路由实现适应性社会对齐,解决部署时静态策略无法应对动态安全规范的问题,实验显示其在累积奖励和子最优差距上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15555 2026-03-17 cs.CV

Learning Latent Proxies for Controllable Single-Image Relighting

学习可控的单图像照明代理

Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li, Xiaogang Xu, Harry Yang

机构 * HKUST(香港科技大学) HKPolyU(香港理工大学) CUHK(香港中文大学)

AI总结 本文提出LightCtrl,通过物理先验和稀疏提示实现可控单图像照明,利用DPO优化和ScaLight数据集提升光照控制精度与PSNR表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15260 2026-03-17 cs.AI cs.CV

AGCD: Agent-Guided Cross-Modal Decoding for Weather Forecasting

AGCD:面向天气预报的代理引导跨模态解码

Jing Wu, Yang Liu, Lin Zhang, Junbo Zeng, Jiabin Wang, Zi Ye, Guowen Li, Shilei Cao, Jiashun Cheng, Fang Wang, Meng Jin, Yerong Feng, Hong Cheng, Yutong Lu, Haohuan Fu, Juepeng Zheng

机构 * Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Jiangxi Science and Technology Normal University(江西科技师范大学) China Meteorological Administration(中国气象局) Huawei Technologies Co., Ltd(华为技术有限公司) Guangdong-Hong Kong-Macao Greater Bay Area Weather Research Center for Monitoring Warning and Forecasting(粤港澳大湾区气象监测预警与预报研究中心) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua University(清华大学)

AI总结 AGCD通过在解码时注入状态条件化的物理先验,提升天气预报的结构一致性和物理一致性,实验显示在不同分辨率和模型上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13340 2026-03-17 cs.CV

Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition

互补监督的频带路由用于多模态情感识别

Zhexian Huang, Bo Zhao, Hui Ma, Zhishu Liu, Jie Zhang, Ruixin Zhang, Shouhong Ding, Zitong Yu

机构 * Great Bay University(大湾大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Tencent Youtu Lab(腾讯优图实验室)

AI总结 本文提出互补监督多频带专家网络Atsuko,通过多尺度频带分解和专家协作,解决多模态情感识别中模态间互补性不足和粗粒融合的问题,提升情感任务的细粒表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09824 2026-03-17 cs.CV cs.AI cs.MM

Composing Concepts from Images and Videos via Concept-prompt Binding

通过概念提示绑定从图像和视频中组合概念

Xianghao Kong, Zeyu Zhang, Yuwei Guo, Zhuoran Zhao, Songchun Zhang, Anyi Rao

机构 * HKUST(香港科技大学) CUHK(香港大学) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出Bind & Compose方法,通过绑定视觉概念与提示标记实现灵活的视觉概念组合,提升概念一致性和运动质量。

Comments CVPR 2026. Project page: https://refkxh.github.io/BiCo_Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13089 2026-03-16 cs.CV

V-Bridge: Bridging Video Generative Priors to Versatile Few-shot Image Restoration

V-Bridge:将视频生成先验与多功能少样本图像恢复相连接

Shenghe Zheng, Junpeng Jiang, Wenbo Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出V-Bridge框架,将视频生成模型的潜在能力应用于多功能少样本图像恢复任务,通过将图像恢复视为渐进生成过程,利用视频模型实现从退化输入到高保真输出的逐步细化,仅用1000个多任务样本即可实现竞争性性能。

Comments Transfer the prior knowledge of video generative models to image restoration tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00299 2026-03-16 q-fin.MF cs.LG q-fin.PM q-fin.RM

Stochastic Dominance Constrained Optimization with S-shaped Utilities: Poor-Performance-Region Algorithm and Neural Network

具有S型效用的随机支配约束优化:表现差区域算法与神经网络

Zeyun Hu, Yang Liu

机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院)

AI总结 本文研究了在第一和第二阶随机支配约束下S型和非凹效用最大化的问题,提出了一种数值算法解决非凹效用的SSD约束问题,并通过神经网络框架加速收敛。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02108 2026-03-16 cs.CV cs.GR cs.MM

Unveiling Deep Shadows: A Survey and Benchmark on Image and Video Shadow Detection, Removal, and Generation in the Deep Learning Era

揭示深层阴影:深度学习时代图像和视频阴影检测、去除与生成的综述与基准

Xiaowei Hu, Zhenghao Xing, Tianyu Wang, Chi-Wing Fu, Pheng-Ann Heng

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学院) Adobe Research(Adobe研究)

AI总结 本文综述并建立了深度学习时代图像和视频阴影检测、去除与生成的统一基准,揭示了现有研究中的不一致、模型设计依赖性和跨数据集泛化限制,并提出了未来研究方向。

Comments Accepted by International Journal of Computer Vision (IJCV). Publicly available results, trained models, and evaluation metrics at https://github.com/xw-hu/Unveiling-Deep-Shadows

Journal ref International Journal of Computer Vision (IJCV), vol.134, article 158, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12829 2026-03-16 cs.CV

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏