arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2407
2601.00561 2026-01-05 cs.CV

AEGIS: Exploring the Limit of World Knowledge Capabilities for Unified Mulitmodal Models

AEGIS:探索统一多模态模型世界知识能力的极限

Jintao Lin, Bowen Dong, Weikang Shi, Chenyang Lei, Suiyun Zhang, Rui Liu, Xihui Liu

机构 * University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) Huawei Research(华为研究)

AI总结 AEGIS通过多任务基准测试和确定性检查表评估,揭示统一多模态模型在世界知识推理中的不足,并指出简化推理模块可缓解其缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17608 2026-01-05 cs.CV

Test-time generative augmentation for medical image segmentation

测试时生成增强用于医学图像分割

Xiao Ma, Yuhui Tao, Zetian Zhang, Yuhan Zhang, Xi Wang, Sheng Zhang, Zexuan Ji, Yizhe Zhang, Qiang Chen, Guang Yang

机构 * organization= School of Computer Science Engineering, Nanjing University of Science organization= Bioengineering Department Imperial-X, Imperial College London , city= London , postcode= W12 7SL , country= UK organization= Digital Medical Research Center, School of Basic Medical Sciences, Fudan University , city= Shanghai , country= China organization= Shanghai Key Laboratory of MICCAI , city= Shanghai , country= China organization= School of Biomedical Engineering, Shenzhen University , city= Shenzhen , country= China organization= Department of Computer Science Engineering, The Hong Kong University of Science Engineering, The Chinese University of Hong Kong , city= Hong Kong , country= China Lung Institute, Imperial College London , city= London , postcode= SW7 2AZ , country= UK organization= Cardiovascular Research Centre, Royal Brompton Hospital , city= London , postcode= SW3 6NP , country= UK organization= School of Biomedical Engineering \& Imaging Sciences, King's College London , city= London , postcode= WC2R 2LS , country= UK

AI总结 本研究提出TTGA方法,通过生成模型在测试时增强医学图像分割,提升分割精度并提供像素级误差估计。

Comments Accepted for publication in Medical Image Analysis (MedIA). Finalized version. Vol. 109, March 2026

Journal ref Medical Image Analysis, Vol. 109, 103902, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24974 2026-01-01 cs.RO

Hierarchical Deformation Planning and Neural Tracking for DLOs in Constrained Environments

层次变形规划与神经跟踪用于受限环境中的可变形线性物体 manipulation

Yunxi Tang, Tianqi Yang, Jing Huang, Xiangyu Chu, Kwok Wai Samuel Au

机构 * Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(机械与自动化工程系,香港中文大学) Multi-scale Medical Robotics Centre(多尺度医学机器人中心)

AI总结 本文提出了一种结合层次变形规划与神经跟踪的框架,用于在受限环境中高效操控可变形线性物体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24165 2026-01-01 cs.CV

DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models

DiffThinker: 向基于扩散模型的生成多模态推理迈进

Zefeng He, Xiaoye Qu, Yafu Li, Tong Zhu, Siyuan Huang, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 DiffThinker通过基于扩散模型的生成方法,在多模态推理任务中实现了更高效的视觉推理和更精确的空间处理,显著优于现有模型。

Comments Project page: https://diffthinker-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24138 2026-01-01 cs.LG cs.AI cs.CV

GARDO: Reinforcing Diffusion Models without Reward Hacking

GARDO:无需奖励黑客的扩散模型强化

Haoran He, Yuxiao Ye, Jie Liu, Jiajun Liang, Zhiyong Wang, Ziyang Yuan, Xintao Wang, Hangyu Mao, Pengfei Wan, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技) CUHK MMLab(港中文大学MMLab) The University of Edinburgh(爱丁堡大学)

AI总结 GARDO通过自适应正则化和多样性增强,有效缓解扩散模型中的奖励黑客问题,提升生成多样性与样本效率。

Comments 17 pages. Project: https://tinnerhrhe.github.io/gardo_project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24119 2026-01-01 cs.CV

GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation

GeoBench: 通过分层评估重新思考多模态几何问题解决

Yuan Feng, Yue Yang, Xiaohan He, Jiatong Zhao, Jianlong Chen, Zijun Chen, Daocheng Fu, Qi Liu, Renqiu Xia, Bo Zhang, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 GeoBench通过分层评估框架,系统评估几何问题解决能力,揭示任务复杂度对性能的影响及子目标分解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23614 2026-01-01 cs.RO cs.CG

Passage-traversing optimal path planning with sampling-based algorithms

基于采样算法的路径穿越最优规划

Jing Huang, Hao Su, Kwok Wai Samuel Au

机构 * Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学机械与自动化工程系) Multi-Scale Medical Robotics Center, Hong Kong, China(香港医学机器人多尺度中心) Department of Computer Science and Engineering, University of California, San Diego, CA, USA(加州大学圣地亚哥分校计算机科学与工程系) Hillbot Inc., USA(Hillbot公司)

AI总结 本文提出了一种基于采样算法的路径穿越最优规划方法,通过通道检测和自由空间分解提升路径规划的效率和优化能力。

Comments 27 pages, 20 figures, 4 tables, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23361 2026-01-01 cs.CV

OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions

OmniVCus: 基于多模态控制条件的前馈主体驱动视频定制

Yuanhao Cai, He Zhang, Xi Chen, Jinbo Xing, Yiwei Hu, Yuqian Zhou, Kai Zhang, Zhifei Zhang, Soo Ye Kim, Tianyu Wang, Yulun Zhang, Xiaokang Yang, Zhe Lin, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Adobe Research(Adobe研究) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 OmniVCus通过多模态控制条件和改进的嵌入机制实现高效的多主体视频定制。

Comments NeurIPS 2025; A data construction pipeline and a diffusion Transformer framework for controllable subject-driven video customization

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21614 2026-01-01 cs.CL

A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond

大推理模型高效推理的综述:语言、多模态与更远的探索

Xiaoye Qu, Yafu Li, Zhao-Chen Su, Weigao Sun, Jianhao Yan, Dongrui Liu, Ganqu Cui, Daizong Liu, Shuxian Liang, Junxian He, Peng Li, Wei Wei, Jing Shao, Chaochao Lu, Yue Zhang, Xian-Sheng Hua, Bowen Zhou, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Soochow University(苏州大学) Westlake University(西湖大学) Peking University(北京大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文综述了大推理模型在提升推理效率方面的最新研究,聚焦于语言、多模态及未来方向,旨在推动该领域的发展。

Comments Update recent RL papers. Project page: https://github.com/XiaoYee/Awesome_Efficient_LRM_Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.13356 2026-01-01 cs.CV eess.IV

Effective Online Exam Proctoring by Combining Lightweight Face Detection and Deep Recognition

通过结合轻量级面部检测和深度识别实现有效的在线考试监考

Xu Yang, Juantao Zhong, Daoyuan Wu, Xiao Yi, Jimmy H. M. Lee, Tan Lee, Peng Han

机构 * Lingnan University(岭南大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 iExam通过结合轻量级实时面部检测和深度面部识别,有效提升在线考试监考的准确性和效率。

Comments This is a technical report from Lingnan University and the Chinese University of Hong Kong

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23705 2025-12-30 cs.CV

Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation

扩散知道透明:将视频扩散用于透明物体深度和法线估计

Shaocong Xu, Songlin Wei, Qizhe Wei, Zheng Geng, Hong Li, Licheng Shen, Qianpu Sun, Shu Han, Bin Ma, Bohan Li, Chongjie Ye, Yuhang Zheng, Nan Wang, Saining Zhang, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Southern California(南加州大学) Tsinghua University(清华大学) Beihang University(北航) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) European Institute of Innovation and Technology Ningbo(创新与技术欧洲研究所宁波) FNii, The Chinese University of Hong Kong, Shenzhen(FNii,香港中文大学(深圳)) National University of Singapore(新加坡国立大学)

AI总结 本文提出DKT模型,利用视频扩散模型估计透明物体的深度和法线,实现零样本SOTA,提升现实和合成视频中的透明感知性能。

Comments Project Page: https://daniellli.github.io/projects/DKT/; Code: https://github.com/Daniellli/DKT; Dataset: https://huggingface.co/datasets/Daniellesry/TransPhy3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17703 2025-12-30 cond-mat.str-el cond-mat.mtrl-sci cs.LG physics.comp-ph

Revisiting the Broken Symmetry Phase of Solid Hydrogen: A Neural Network Variational Monte Carlo Study

重新审视固态氢的破缺对称相:一种神经网络变分蒙特卡洛研究

Shengdu Chai, Chen Lin, Xinyang Dong, Yuqiang Li, Wanli Ouyang, Lei Wang, X. C. Xie

机构 * Interdisciplinary Center for Theoretical Physics(理论物理交叉中心) Information Sciences (ICTPIS), Fudan University(信息科学(ICTPIS),复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Engineering, University of Oxford(工程系,牛津大学) Beijing National Laboratory for Condensed Matter Physics(北京凝聚态物理实验室) Institute of Physics, Chinese Academy of Sciences(物理研究所,中国科学院) Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学) International Center for Quantum Materials, School of Physics, Peking University(国际量子材料中心,物理系,北京大学) Hefei National Laboratory(合肥国家实验室)

AI总结 本文通过神经网络变分蒙特卡洛方法研究固态氢的破缺对称相,发现其基态结构候选者Cmcm空间群对称性,并验证其稳定性及与实验数据的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22452 2025-12-30 cs.CV

SAM 3D for 3D Object Reconstruction from Remote Sensing Images

SAM 3D用于从遥感图像中进行3D物体重建

Junsheng Yao, Lichao Mou, Qingyu Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) MedAI Technology(MedAI技术)

AI总结 本文提出SAM 3D模型用于遥感图像的3D建筑重建,通过实验验证其在生成几何和边界上的优势,并扩展至城市场景重建,探讨其在城市建模中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22315 2025-12-30 cs.CV cs.AI

VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning

VideoZoomer: 用于长视频推理的强化学习时序聚焦

Yang Ding, Yizhen Zhang, Xin Lai, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 VideoZoomer通过强化学习实现动态时序聚焦,提升长视频推理性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22192 2025-12-30 cs.LG

Frequency Regularization: Unveiling the Spectral Inductive Bias of Deep Neural Networks

频域正则化:揭示深度神经网络的频域归纳偏置

Jiahao Lu

机构 * School of Artificial Intelligence(人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本研究通过频域正则化揭示深度神经网络对低频结构的归纳偏置,展示L2正则化在抑制高频能量和提升鲁棒性方面的优势。

Comments 9 pages, 5 figures. Code available at https://github.com/lujiahao760/FrequencyRegularization

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12974 2025-12-30 cs.SD eess.AS

The CCF AATC 2025 Speech Restoration Challenge: A Retrospective

2025年CCF AATC语音恢复挑战:回顾

Junan Zhang, Mengyao Zhu, Xin Xu, Hui Bu, Zhenhua Ling, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Audio Department, Huawei CBG(华为CBG音频部门) Beijing AISHELL Technology Co., Ltd.(北京艾斯HELL科技有限公司) University of Science and Technology of China(中国科学技术大学)

AI总结 2025年CCF AATC挑战回顾了语音恢复领域的现状,揭示了轻量模型、生成模型权衡及度量差距问题。

Comments Technical Report. Homepage: https://ccf-aatc.org.cn. Code & Data: https://github.com/viewfinder-annn/anyenhance-v1-ccf-aatc

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22118 2025-12-29 cs.CV

ProEdit: Inversion-based Editing From Prompts Done Right

ProEdit: 通过正确提示实现基于反向的编辑

Zhi Ouyang, Dian Zheng, Xiao-Ming Wu, Jian-Jian Jiang, Kun-Yu Lin, Jingke Meng, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) CUHK MMLab(香港中文大学MMLab) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) The University of Hong Kong(香港大学) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(中国教育部机器智能与高级计算重点实验室)

AI总结 ProEdit通过改进注意力和潜在领域,实现更稳定的基于反向的编辑,能有效提升图像和视频编辑的性能和一致性。

Comments Equal contributions from first two authors. Project page: https://isee-laboratory.github.io/ProEdit/ Code: https://github.com/iSEE-Laboratory/ProEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21964 2025-12-29 cs.CV

Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models

感知与校准:分析和增强医疗多模态大语言模型的鲁棒性

Dunyuan XU, Xikai Yang, Yaoqian Li, Juzheng Miao, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, CUHK, Hong Kong, China(计算机科学与工程系,CUHK,香港,中国) Institute of Medical Intelligence and XR, CUHK, Hong Kong, China(医学智能与XR研究所,CUHK,香港,中国)

AI总结 本文提出IMC框架,通过感知和校准原则提升医疗多模态大语言模型的鲁棒性,针对视觉和文本模态分别设计PDC和SMS进行噪声校正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00846 2025-12-29 cs.CV cs.AI

OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks

OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析

Zhihao Peng, Cheng Wang, Shengyuan Liu, Zhiying Liang, Zanting Ye, Minjie Ju, PeterYM Woo, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) Southern Medical University(南方医科大学) Zhongshan Hospital, Fudan University(复旦大学中山医院) Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)

AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16509 2025-12-29 cs.CV

SlowFast-SCI: Slow-Fast Deep Unfolding Learning for Spectral Compressive Imaging

SlowFast-SCI: 慢-快深度展开学习用于光谱压缩成像

Haijin Zeng, Xuan Lu, Yurong Zhang, Qiangqiang Shen, Guoqing Chao, Li Jiang, Yongyong Chen

机构 * Harvard University(哈佛大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiaotong University(上海交通大学) City University of Hong Kong(香港城市大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 SlowFast-SCI是一种双速深度展开框架,通过预训练和自适应模块实现高效自适应的光谱重建,显著提升参数效率和适应速度。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12717 2025-12-29 cs.CL

ToTRL: Unlock LLM Tree-of-Thoughts Reasoning Potential through Puzzles Solving

ToTRL: 通过解谜游戏解锁大语言模型树状思维推理潜力

Haoyuan Wu, Xueyi Chen, Rui Ming, Jilong Gao, Shoubo Hu, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab(Noah's Ark Lab) Huawei(华为) ChatEDA Tech(ChatEDA科技)

AI总结 ToTRL通过解谜游戏训练,提升大语言模型的树状思维推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17260 2025-12-29 cs.DC cs.LG

Robust Federated Learning in Unreliable Wireless Networks: A Client Selection Approach

在不可靠无线网络中实现鲁棒联邦学习:一种客户端选择方法

Yanmeng Wang, Wenkai Ji, Jian Zhou, Fu Xiao, Tsung-Hui Chang

机构 * School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机科学学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 本文提出FedCote方法,通过优化客户端选择概率,在不可靠无线网络中缓解传输故障和数据异质性对联邦学习的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21625 2025-12-29 cs.CL

Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards

重新思考强化学习中的样本极性与可验证奖励

Xinyu Tang, Yuliang Zhan, Zhixun Li, Wayne Xin Zhao, Zhenduo Zhang, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团)

AI总结 本文提出A3PO方法,通过自适应非对称令牌级别优势塑造,提升强化学习中样本极性对推理能力的优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21486 2025-12-29 cs.LG eess.SP

When Bayesian Tensor Completion Meets Multioutput Gaussian Processes: Functional Universality and Rank Learning

当贝叶斯张量补全遇见多输出高斯过程:函数通用性和秩学习

Siyuan Li, Shikai Fang, Lei Cheng, Feng Yin, Yik-Chung Wu, Peter Gerstoft, Sergios Theodoridis

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) School of Science & Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Technical University of Denmark(丹麦技术大学) NoiseLab, University of California, San Diego(加州大学圣地亚哥分校NoiseLab) HERON - Center of Excellence in Robotics, Athena R.C(HERON-机器人卓越中心)

AI总结 本文提出RR-FBTC方法,结合贝叶斯张量补全与多输出高斯过程,实现对连续多维信号的通用近似,并通过变分推断框架高效学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20619 2025-12-29 cs.CV

SemanticGen: Video Generation in Semantic Space

SemanticGen: 语义空间中的视频生成

Jianhong Bai, Xiaoshi Wu, Xintao Wang, Xiao Fu, Yuanxing Zhang, Qinghe Wang, Xiaoyu Shi, Menghan Xia, Zuozhu Liu, Haoji Hu, Pengfei Wan, Kun Gai

机构 * Zhejiang University(浙江大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) CUHK(香港中文大学) DLUT(大连理工大学) HUST(华中科技大学)

AI总结 SemanticGen通过在语义空间中生成视频,提高了长视频生成的效率和质量,优于现有方法。

Comments Project page: https://jianhongbai.github.io/SemanticGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21024 2025-12-25 cs.GT cs.AI

Policy-Conditioned Policies for Multi-Agent Task Solving

基于策略条件的多智能体任务解决

Yue Lin, Shuhui Zhu, Wenhao Li, Ang Li, Dan Qiao, Pascal Poupart, Hongyuan Zha, Baoxiang Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Waterloo(滑铁卢大学) Tongji University(同济大学) Vector Institute(向量研究所)

AI总结 本文提出通过程序化表示和大型语言模型实现多智能体任务解决,引入程序均衡概念并提出PIBR算法,有效解决协调博弈和合作环境问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20954 2025-12-25 cs.CL cs.AI

Reflection Pretraining Enables Token-Level Self-Correction in Biological Sequence Models

反射预训练使生物序列模型实现token级自我修正

Xiang Zhang, Jiaqi Wei, Yuejin Yang, Zijie Qiu, Yuhan Chen, Zhiqiang Gao, Muhammad Abdul-Mageed, Laks V. S. Lakshmanan, Wanli Ouyang, Chenyu You, Siqi Sun

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Stony Brook University(石溪大学)

AI总结 本文提出反射预训练方法,通过生成辅助标记提升生物序列模型的token表达能力,实现token级自我修正和推理能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17019 2025-12-25 cs.CV cs.AI cs.CY

Let Androids Dream of Electric Sheep: A Human-Inspired Image Implication Understanding and Reasoning Framework

让安卓梦见电羊:一种受人类启发的图像隐喻理解和推理框架

Chenhao Zhang, Yazhe Niu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究提出LAD框架,通过三阶段方法解决图像隐喻理解问题,在多个基准测试中取得优异成绩,推动视觉语言推理和人机交互发展。

Comments 19 pages, 9 figures, 7 tables. Code & Dataset: https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00675 2025-12-25 cs.CL

Rethinking Memory in LLM based Agents: Representations, Operations, and Emerging Topics

重新思考基于大语言模型的智能体中的记忆:表示、操作与新兴主题

Yiming Du, Wenyu Huang, Danna Zheng, Zhaowei Wang, Sebastien Montella, Mirella Lapata, Kam-Fai Wong, Jeff Z. Pan

机构 * The Chinese University of Hong Kong Hong Kong China The University of Edinburgh Edinburgh UK The Hong Kong University of Science Huawei Technologies Research \& Development (UK) Limited Edinburgh UK The Chinese University of Hong Kong The University of Edinburgh Huawei Technologies Research \& Development (UK) Limited

AI总结 本文提出基于大语言模型的智能体中记忆的分类框架,涵盖参数型与上下文型记忆,定义六个核心操作,并揭示四个关键研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06244 2025-12-25 cs.CV

Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction

无偏区域-语言对齐用于开放词汇密集预测

Yunheng Li, Yuxuan Li, Quansheng Zeng, Wenhai Wang, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) NKIARI, Shenzhen Futian(深圳福田国家信息研究院) OpenGVLab, Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 DenseVLM通过无偏区域-语言对齐提升开放词汇密集预测性能

Comments Accepted at ICCV 2025. The code is available at https://github.com/HVision-NKU/DenseVLM

详情

展开后加载摘要…

URL PDF HTML 收藏