arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2801
2603.00595 2026-03-03 cs.CV

UNICBench: UNIfied Counting Benchmark for MLLM

UNICBench: 多模态多层级计数基准与评估工具包

Chenggang Rong, Tao Han, Zhiyuan Zhao, Yaowu Fan, Jia Wan, Song Guo, Yuan Yuan, Junyu Gao

机构 * Northwestern Polytechnical University(北华大学) Hong Kong University of Science and Technology(香港科技大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Sun Yat-sen University(中山大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 UNICBench是一个统一的多模态计数基准,通过准确的地面真实值和分层报告,评估45种最先进的MLLMs在图像、文本和音频计数任务上的性能,揭示了模型在推理和难分支上的不足。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00526 2026-03-03 cs.CV

Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation

Mesh-Pro: 异步优势引导的排名偏好优化用于艺术家风格的四边形网格生成

Zhen Zhou, Jian Liu, Biwen Lei, Jing Xu, Haohan Weng, Yiling Zhu, Zhuo Chen, Junfeng Fan, Yunkai Ma, Dazhao Du, Song Guo, Fengshui Jing, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文元) Hong Kong University of Science and Technology(香港科技大学)

AI总结 Mesh-Pro通过异步优势引导的排名偏好优化提升3D网格生成的训练效率和生成质量,引入了新的标记化和奖励机制,实现了艺术家风格网格的先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00501 2026-03-03 cs.NI cs.AI eess.SP

WirelessAgent++: Automated Agentic Workflow Design and Benchmarking for Wireless Networks

WirelessAgent++: 无线网络中自主代理工作流设计与基准测试

Jingwen Tong, Zijian Li, Fang Liu, Wei Guo, Jun Zhang

机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港理工大学电子与计算机工程系)

AI总结 WirelessAgent++通过自动化设计无线任务代理工作流,结合MCTS算法和WirelessBench基准测试,实现了高效且稳健的无线网络代理生成。

Comments This manuscript has submitted to a possible Journal for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00443 2026-03-03 cs.CV

SesaHand: Enhancing 3D Hand Reconstruction via Controllable Generation with Semantic and Structural Alignment

SesaHand: 通过语义和结构对齐可控生成增强3D手重建

Zhuoran Zhao, Xianghao Kong, Linlin Yang, Zheng Wei, Pan Hui, Anyi Rao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Communication University of China(中国通信大学)

AI总结 SesaHand通过语义和结构对齐提升可控手部生成,优化3D手重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10478 2026-03-03 cs.CR cs.LG

GPU-Fuzz: Finding Memory Errors in Deep Learning Frameworks

GPU-Fuzz: 在深度学习框架中发现内存错误

Zihao Li, Hongyi Lu, Yanan Guo, Zhenkai Zhang, Shuai Wang, Fengwei Zhang

机构 * Southern University of Science and Technology(南方科技大学) University of Rochester(罗切斯特大学) Clemson University(克莱姆森大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 GPU-Fuzz通过建模运算符参数为形式化约束,高效发现深度学习框架中的内存错误,并在PyTorch、TensorFlow和PaddlePaddle中发现13个未知bug。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06158 2026-03-03 cs.AI

PsyAgent: Constructing Human-like Agents Based on Psychological Modeling and Contextual Interaction

PsyAgent: 基于心理建模和情境交互构建类人代理

Zibin Meng, Kani Chen

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 PsyAgent通过心理建模和情境交互构建类人代理,结合特质-情境接口框架,提升稳定性和情境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19807 2026-03-03 cs.CL cs.AI cs.LG

Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning

Scaf-GRPO:基于 scaffolding 的组相对策略优化以增强大语言模型推理能力

Xichen Zhang, Sitong Wu, Yinghao Zhu, Haoru Tan, Shaozuo Yu, Ziyi He, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 Scaf-GRPO通过渐进式训练框架,在模型学习停滞时提供分层提示,有效提升大语言模型的数学推理能力。

Comments Code: https://github.com/JIA-Lab-research/Scaf-GRPO Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24332 2026-03-03 cs.LG cs.AI

Towards Generalizable PDE Dynamics Forecasting via Physics-Guided Invariant Learning

通过物理引导的不变学习实现通用的PDE动力学预测

Siyang Li, Yize Chen, Yan Guo, Ming Huang, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Alberta(阿尔伯塔大学) Alibaba Cloud(阿里云)

AI总结 本文提出iMOOE方法,通过物理引导的不变学习实现PDE动态预测的通用性和零样本泛化能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23993 2026-03-03 cs.CV cs.RO

Advancing Multi-agent Traffic Simulation via R1-Style Reinforcement Fine-Tuning

通过R1风格强化微调推进多智能体交通模拟

Muleilan Pei, Shaoshuai Shi, Shaojie Shen

机构 * Hong Kong University of Science and Technology(香港理工大学) Voyager Research, Didi Chuxing(Voyager研究,滴滴出行)

AI总结 SMART-R1通过R1风格强化微调提升多智能体交通模拟的现实度与性能

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21835 2026-03-03 cs.LG

On the $ε$-Free Inference Complexity of Absorbing Discrete Diffusion

关于吸收离散扩散的ε-免费推断复杂度

Xunpeng Huang, Yingyu Lin, Nishant Jain, Kaibo Wang, Difan Zou, Yian Ma, Tong Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of California San Diego(加州大学圣地亚哥分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Hong Kong(香港大学)

AI总结 本文提出AATU方法,通过吸收离散扩散的结构优势,实现了ε-TV收敛的O(d ln d)复杂度,消除了传统均匀化推理的分数限制假设,并在时间不变参数化中展示了更高效的推理策略。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21420 2026-03-03 cs.CV

QuadGPT: Native Quadrilateral Mesh Generation with Autoregressive Models

QuadGPT:基于自回归模型的原生四边形网格生成

Jian Liu, Chunshi Wang, Song Guo, Haohan Weng, Zhen Zhou, Zhiqi Li, Jiaao Yu, Yiling Zhu, Jing Xu, Biwen Lei, Zhuo Chen, Chunchao Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Hunyuan(腾讯文元)

AI总结 QuadGPT通过自回归模型和强化学习优化,实现了端到端的四边形网格生成,提升了几何精度和拓扑质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00523 2026-03-03 cs.CV

SenseFlow: Scaling Distribution Matching for Flow-based Text-to-Image Distillation

SenseFlow: 为基于流的文本到图像蒸馏扩展分布匹配

Xingtong Ge, Xin Zhang, Tongda Xu, Yi Zhang, Xinjie Zhang, Yan Wang, Jun Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) SenseTime Research(商汤科技研究院) Vivix AI(维维克斯人工智能) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究所)

AI总结 SenseFlow通过引入隐式分布对齐和段内指导,解决大规模基于流的文本到图像模型蒸馏中的收敛问题,提升蒸馏效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17568 2026-03-03 cs.CR cs.AI cs.SD eess.AS

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

JALMBench: 对音频语言模型中越权攻击的基准测试

Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Zeren Luo, Jingyi Zheng, Wenhan Dong, Xinlei He, Xuechao Wang, Yingjie Xue, Shengmin Xu, Xinyi Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室) University of North Texas(北卡罗来纳州立大学) University of Science and Technology of China(中国科学技术大学) Fujian Normal University(福建师范大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 JALMBench通过评估11,316个文本样本和245,355个音频样本,分析LALMs对越权攻击的安全性,揭示模态和架构对安全性的影响,强调需专门设计的防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23937 2026-03-02 cs.RO cs.CV

Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos

通过真实世界室内游览视频的多模态事件知识增强视觉语言导航

Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Xingxing Zuo, Yaoxian Song, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(马尔代夫 bin Zayed 大学人工智能学院) Hangzhou City University(杭州城市学院)

AI总结 本文提出基于多模态事件知识的视觉语言导航增强方法,通过构建大规模时空知识图谱并结合层次检索机制,提升长视界推理和粗粒度指令处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23645 2026-03-02 cs.CV

BuildAnyPoint: 3D Building Structured Abstraction from Diverse Point Clouds

BuildAnyPoint: 从多样点云构建三维建筑结构抽象

Tongyan Hua, Haoran Gong, Yuan Liu, Di Wang, Ying-Cong Chen, Wufan Zhao

机构 * HKUST(GZ)(香港科技大学(广州)) Xi’an Jiaotong University(西安交通大学)

AI总结 BuildAnyPoint通过Loca-DiT框架从多样点云中生成结构化三维建筑抽象,提升重建的表面准确性和分布均匀性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21157 2026-03-02 cs.RO

HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning

HALO:一种用于具身多模态推理的统一视觉-语言-动作模型

Quanxin Shou, Fangqi Zhu, Shawn Chen, Puxin Yan, Zhengyang Yan, Yikun Miao, Xiaoyi Pang, Zicong Hong, Ruikai Shi, Hao Huang, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 HALO提出了一种统一的视觉-语言-动作模型,通过结合文本推理、视觉子目标预测和增强的动作预测,实现具身多模态链式推理,提升了机器人在复杂环境中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19919 2026-03-02 cs.CL cs.LG

Janus-Q: End-to-End Event-Driven Trading via Hierarchical-Gated Reward Modeling

Janus-Q:通过分层门控奖励建模实现端到端的事件驱动交易

Xiang Li, Zikai Wei, Yiyan Qi, Wanyun Zhou, Xiang Liu, Penglei Sun, Jian Guo, Yongqi Zhang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) International Digital Economy Academy(国际数字经济学院)

AI总结 Janus-Q通过分层门控奖励模型实现端到端事件驱动交易,提升金融新闻事件作为主要决策单元,提高交易决策的稳定性和盈利能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15909 2026-03-02 eess.AS cs.AI cs.DB cs.HC cs.MA cs.SD

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

Resp-Agent:一种基于代理的多模态呼吸声生成与疾病诊断系统

Pengfei Zhang, Tianxin Xie, Minghao Yang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

AI总结 Resp-Agent是一种基于代理的多模态系统,通过主动对抗课程代理和模态编织器提升呼吸声生成与疾病诊断的鲁棒性。

Comments 24 pages, 3 figures. Published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07021 2026-03-02 cs.CV cs.AI

MEGS$^{2}$: Memory-Efficient Gaussian Splatting via Spherical Gaussians and Unified Pruning

MEGS$^{2}$: 通过球形高斯和统一剪枝实现内存高效的三维高斯散射

Jiarui Chen, Yikeng Chen, Yingshuang Zou, Ye Huang, Peng Wang, Yuan Liu, Yujing Sun, Wenping Wang

机构 * HKUST(香港科技大学) SZU(深圳大学) SYSU(南方科技大学) Adobe(Adobe公司) NTU(国立台湾大学) TAMU(德克萨斯大学奥斯汀分校)

AI总结 MEGS$^{2}$通过球形高斯和统一剪枝技术,实现了3DGS的内存高效压缩,显著降低内存占用并保持高质量渲染。

Comments 20 pages, 8 figures. Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23061 2026-03-02 cs.CV

Empowering Small VLMs to Think with Dynamic Memorization and Exploration

赋能小型视觉语言模型进行动态记忆与探索

Jiazhen Liu, Yuchuan Deng, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 DyME通过动态选择记忆与探索策略,提升小型视觉语言模型的推理能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18679 2026-03-02 cs.CV

Efficient Degradation-agnostic Image Restoration via Channel-Wise Functional Decomposition and Manifold Regularization

通过通道级功能分解和流形正则化实现高效的退化无关图像恢复

Bin Ren, Yawei Li, Xu Zheng, Yuqian Fu, Danda Pani Paudel, Hong Liu, Ming-Hsuan Yang, Luc Van Gool, Nicu Sebe

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽德人工智能大学) University of Trento(特伦托大学) ETH Zürich(苏黎世联邦理工学院) HKUST (GZ)(香港科技大学(广州)) Peking University(北京大学) University of California, Merced(加州大学默塞德分校)

AI总结 MIRAGE通过通道级功能分解和流形正则化,在高效性与性能之间取得平衡,实现退化无关图像恢复的先进性能。

Comments Accepted by ICLR'2026, All-in-One Image Restoration, low-level vision, Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23461 2026-03-02 cs.CV

Investigating Text Insulation and Attention Mechanisms for Complex Visual Text Generation

探究文本绝缘与注意力机制用于复杂视觉文本生成

Ying Tai, Nikai Du, Rui Xie, Zhennan Chen, Qian Wang, Zhengkai Jiang, Kai Zhang, Jian Yang

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Jiutian Research(极天研究) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 TextCrafter通过文本绝缘与注意力机制,提升复杂视觉文本生成性能,引入CVTG-2K基准测试集验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.04028 2026-03-02 cs.CV cs.RO

CO^3: Cooperative Unsupervised 3D Representation Learning for Autonomous Driving

CO³:协作无监督3D表示学习用于自动驾驶

Runjian Chen, Yao Mu, Runsen Xu, Wenqi Shao, Chenhan Jiang, Hang Xu, Zhenguo Li, Ping Luo

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Huawei Noah’s Ark Lab(华为诺亚实验室) The Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 CO³通过协作对比学习和上下文形状预测,实现无监督学习户外场景点云的3D表示,提升自动驾驶中的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07463 2026-03-01 cs.AI cs.GT cs.LG

Puzzle it Out: Local-to-Global World Model for Offline Multi-Agent Reinforcement Learning

解开谜题:用于离线多智能体强化学习的局部到全局世界模型

Sijia Li, Xinran Li, Shibo Chen, Jun Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) South China University of Technology(华南理工大学)

AI总结 提出局部到全局世界模型,通过局部预测提升全局状态动态推断,结合不确定性采样机制提升离线多智能体强化学习的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23075 2026-02-27 cs.CL cs.IR

CiteLLM: An Agentic Platform for Trustworthy Scientific Reference Discovery

CiteLLM:一个用于可信科学引文发现的代理平台

Mengze Hong, Di Jiang, Chen Jason Zhang, Zichang Guo, Yawen Li, Jun Chen, Shaobo Cui, Zhiyang Su

机构 * Hong Kong Polytechnic University(香港理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Swiss Federal Technology Institute of Lausanne (EPFL)(洛桑联邦理工学院) Hong Kong University of Science and Technology (HKUST)(香港科学大学)

AI总结 CiteLLM通过在LaTeX编辑器中嵌入LLM工具,实现可信的科学引文发现,确保引文的准确性和可靠性。

Comments Accepted by TheWebConf 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22923 2026-02-27 cs.CV cs.RO

WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents

WaterVideoQA: 以ASV为中心的感知与符合规则的推理 via 多模态智能体

Runwei Guan, Shaofeng Liang, Ningwei Ouyang, Weichen Fei, Shanliang Yao, Wei Dai, Chenhao Ge, Penglei Sun, Xiaohui Zhu, Tao Huang, Ryan Wen Liu, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)人工智能研究所) Hubei Key Laboratory of Inland Shipping Technology (Wuhan University of Technology)(湖北内河航运技术重点实验室(武汉理工大学)) School of Navigation, Wuhan University of Technology(武汉理工大学航海学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Information Engineering, Yancheng Institute of Technology(盐城职业技术学院信息工程学院) School of Engineering, Stanford University(斯坦福大学工程学院) Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院)

AI总结 WaterVideoQA通过多模态智能体系统,实现ASV在复杂水域环境中的感知与规则合规推理,提升自主航行的安全性和精确性。

Comments 11 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06139 2026-02-27 cs.CV

Deforming Videos to Masks: Flow Matching for Referring Video Segmentation

视频变形到掩码:用于指认视频分割的流匹配

Zanyi Wang, Dengyang Jiang, Liuzhuozheng Li, Sizhe Dang, Chengzu Li, Harry Yang, Guang Dai, Mengmeng Wang, Jingdong Wang

机构 * SGIT AI Lab, State Grid Corporation of China(国网信通研究院) University of California, San Diego(加州大学圣地亚哥分校) The Hong Kong University of Science and Technology(香港科技大学) The University of Tokyo(东京大学) University of Cambridge(剑桥大学) Zhejiang University of Technology(浙江工业大学) Baidu(百度)

AI总结 本文提出FlowRVS框架,将指认视频分割视为条件连续流问题,通过学习视频整体表示到目标掩码的直接语言引导变形,在多个基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21965 2026-02-27 cs.CV

PartSAM: A Scalable Promptable Part Segmentation Model Trained on Native 3D Data

PartSAM: 一种可提示的部件分割模型,基于原生3D数据训练

Zhe Zhu, Le Wan, Rui Xu, Yiheng Zhang, Honghua Chen, Zhiyang Dou, Cheng Lin, Yuan Liu, Mingqiang Wei

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Lingnan University(岭南大学) Macau University of Science and Technology(澳门科学理工学院)

AI总结 PartSAM是一种基于大规模3D数据训练的可提示部件分割模型,通过三平面双分支编码器实现可扩展的部件感知表示学习,能够通过单个提示实现高精度部件识别,并自动分解为表面和内部结构。

Comments ICLR 2026. Project Page: https://czvvd.github.io/PartSAMPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16552 2026-02-27 cs.CV cs.RO

ST-GS: Vision-Based 3D Semantic Occupancy Prediction with Spatial-Temporal Gaussian Splatting

ST-GS:基于视觉的3D语义占用预测与空间-时间高斯点划法

Xiaoyang Yan, Muleilan Pei, Shaojie Shen

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

AI总结 ST-GS通过空间-时间高斯点划法提升3D语义占用预测的时空建模能力,实现更优的时间一致性与性能

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22624 2026-02-27 cs.CV cs.AI

Instruction-based Image Editing with Planning, Reasoning, and Generation

基于指令的图像编辑与规划、推理和生成

Liya Ji, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学)

AI总结 本文提出一种多模态模型,通过链式思考规划、编辑区域推理和编辑,提升基于指令的图像编辑能力,以应对更复杂的真实场景。

Comments 10 pages, 7 figures

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025, Page 17506--17515

详情

展开后加载摘要…

URL PDF HTML 收藏