arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2407
2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03193 2026-01-09 cs.CV cs.AI

UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision

UniCorn:通过自生成监督实现自我改进的统一多模态模型

Ruiyan Han, Zhen Fang, XinYu Sun, Yuchen Ma, Ziheng Wang, Yu Zeng, Zehui Chen, Lin Chen, Wenxuan Huang, Wei-Jie Xu, Yi Cao, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(脑智能基础与应用联合实验室,中国科学技术大学) FDU(复旦大学) ECNU(华东师范大学) CUHK(香港中文大学) NJU(南京大学) SUDA(上海大学)

AI总结 UniCorn通过自生成监督实现统一多模态模型的自我改进,提升多模态生成质量与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21400 2026-01-09 cs.LG cs.IT math.IT math.ST stat.ML stat.TH

Breaking AR's Sampling Bottleneck: Provable Acceleration via Diffusion Language Models

突破生成模型的采样瓶颈:通过扩散语言模型实现可证明的加速

Gen Li, Changxiao Cai

机构 * Department of Statistics and Data Science, Chinese University of Hong Kong, Hong Kong(统计与数据科学系,香港中文大学) Department of Industrial and Operations Engineering, University of Michigan, Ann Arbor, USA(工业与运营管理系,密歇根大学)

AI总结 本文从信息论角度为扩散语言模型提供收敛保证,证明采样误差随迭代次数减少而降低,从而突破自回归模型所需的L步瓶颈,为生成高质量样本提供理论支持。

Comments This is the full version of a paper published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04656 2026-01-09 cs.SD

FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions

FlexiVoice: 通过自然语言指令实现零样本语音合成的灵活风格控制

Dekun Chen, Xueyao Zhang, Yuancheng Wang, Kenan Dai, Li Ma, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 FlexiVoice通过自然语言指令实现零样本语音合成的灵活风格控制,结合LLM核心和PPT方案,实现风格与音色的精准解耦与可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04648 2026-01-09 cs.GT cs.DC cs.LG

Mechanism Design for Federated Learning with Non-Monotonic Network Effects

联邦学习中非单调网络效应的机制设计

Xiang Li, Bing Luo, Jianwei Huang, Yuan Luo

机构 * Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究所) School of Science and Engineering(科学与工程学院) Data Science Research Center(数据科学研究中心) Duke Kunshan University(杜克昆山大学) Shenzhen Key Laboratory of Crowd Intelligence Empowered Low-Carbon Energy Network(深圳 Crowd Intelligence 赋能低碳能源网络重点实验室) CSIJRI Joint Research Centre on Smart Energy Storage(CSIJRI 智能储能联合研究中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出了一种考虑非单调网络效应和应用需求的联邦学习激励机制,通过模型交易和共享框架提升社会福利。

Comments Journal extension of Mobihoc conference version, under review of IEEE TMC

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04616 2026-01-09 cs.LG cs.AI

DeepHalo: A Neural Choice Model with Controllable Context Effects

DeepHalo:具有可控上下文效应的神经选择模型

Shuhan Zhang, Zhi Wang, Rui Gao, Shuang Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Toronto(多伦多大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 DeepHalo是一种能够控制上下文效应阶数的神经选择模型,通过显式控制交互阶数和原则性解释上下文效应,提升决策建模的可解释性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04611 2026-01-09 cs.CL

Character-R1: Enhancing Role-Aware Reasoning in Role-Playing Agents via RLVR

Character-R1: 通过RLVR增强角色感知推理

Yihong Tang, Kehai Chen, Xuefeng Bai, Benyou Wang, Zeming Liu, Haifeng Wang, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology(计算与智能研究所,哈尔滨工业大学) Shenzhen Loop Area Institute (SLAI)(深圳环城研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Baidu Inc.(百度公司)

AI总结 Character-R1通过引入三种核心设计提升角色感知推理能力,有效解决角色扮演代理中的认知一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04343 2026-01-09 cs.SD cs.AI eess.AS

Summary of The Inaugural Music Source Restoration Challenge

音乐源恢复挑战赛概述

Yongyi Zang, Jiarui Hai, Wanying Ge, Qiuqiang Kong, Zheqi Dai, Helin Wang, Yuki Mitsufuji, Mark D. Plumbley

机构 * Independent Researcher(独立研究者) Johns Hopkins University(约翰霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Sony AI(索尼人工智能) King's College London(伦敦国王学院)

AI总结 音乐源恢复挑战赛评估了不同系统在恢复退化音频中乐器声部的性能,揭示了不同乐器恢复难度差异及各系统表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02356 2026-01-09 cs.CV

Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes

Talk2Move: 基于强化学习的文本指令下场景中物体级几何变换

Jing Tan, Zhaoyang Zhang, Yantao Shen, Jiarui Cai, Shuo Yang, Jiajun Wu, Wei Xia, Zhuowen Tu, Stefano Soatto

机构 * AWS Agentic AI(AWS智能AI) Amazon Web Services(亚马逊网络服务) Amazon Robotics(亚马逊机器人技术) CUHK(香港中文大学)

AI总结 Talk2Move通过强化学习实现文本指令下的场景中物体级几何变换,利用组相对策略优化和空间奖励引导模型,提升学习效率并实现精确且一致的物体变换。

Comments Project page: https://sparkstj.github.io/talk2move

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10991 2026-01-09 cs.CR cs.AI

MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AI

MCP-Guard: 一种多阶段纵深防御框架,用于保障代理AI中的模型上下文协议安全

Wenpeng Xing, Zhonghao Qi, Yupeng Qin, Yilin Li, Caini Chang, Jiahui Yu, Changting Lin, Zhenzhen Xie, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学)

AI总结 MCP-Guard通过多阶段防御框架提升LLM与工具交互的安全性,利用E5模型和仲裁器实现高准确率的对抗性提示检测,并通过MCP-ATTACKBENCH验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15361 2026-01-09 cs.CV

Boosting HDR Image Reconstruction via Semantic Knowledge Transfer

通过语义知识迁移提升HDR图像重建

Tao Hu, Longyao Wu, Wei Dong, Peng Wu, Jinqiu Sun, Xiaogang Xu, Qingsen Yan, Yanning Zhang

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院) School of Astronautics, Northwestern Polytechnical University(西北工业大学航天学院) Shaanxi University of Science & Technology(陕西科技大学) Xi’an University of Architecture and Technology(西安建筑科技大学) Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出通过语义知识迁移提升HDR图像重建的方法,利用语义先验知识和自我蒸馏机制改进现有重建模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03956 2026-01-08 cs.RO

CoINS: Counterfactual Interactive Navigation via Skill-Aware VLM

基于技能感知的反事实交互导航:通过技能感知视觉语言模型

Kangjie Zhou, Zhejia Wen, Zhiyong Zhuo, Zike Yan, Pengying Wu, Ieng Hou U, Shuaiyang Li, Han Gao, Kang Ding, Wenhan Cao, Wei Pan, Chang Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) College of Design and Engineering, National University Of Singapore(新加坡国立大学设计与工程学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系)

AI总结 CoINS通过整合技能感知推理与稳健执行,提升机器人在复杂环境中的交互导航能力。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07344 2026-01-08 cs.DC cs.AI

Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding

Venus: 一种高效的边缘内存与检索系统用于基于VLM的在线视频理解

Shengyuan Ye, Bei Ouyang, Tianyi Qian, Liekang Zeng, Mu Yuan, Xiaowen Chu, Weijie Hong, Xu Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(计算机科学与工程学院,中山大学,广州,中国) Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(信息工程系,香港中文大学,香港特别行政区,中国) Shenzhen Smart City Communications Co., Ltd., China(深圳智慧城市通信有限公司,中国)

AI总结 Venus提出了一种高效的边缘内存与检索系统,通过边缘-云解耦架构实现快速的在线视频理解,显著降低系统开销并提升响应速度。

Comments Accepted by IEEE International Conference on Computer Communications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10390 2026-01-08 cs.CL cs.CR

Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts

通过显式有害提示对商用黑盒大语言模型进行劫持

Chiyu Zhang, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang Lab(浙江实验室)

AI总结 本文提出DH-CoT攻击方法,通过整合多种劫持技巧和恶意内容检测框架,有效劫持了包括GPT-5和Claude-4在内的商用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-01-08 cs.CV cs.CL

PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Songyang Zhang, Weijia Li, Bin Wang, Dahua Lin, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Equal contribution: Junyuan Gao, Jiahe Song, Jiang Wu; Corresponding author: Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03671 2026-01-08 cs.CL cs.LG

NeuronScope: A Multi-Agent Framework for Explaining Polysemantic Neurons in Language Models

NeuronScope:一种用于解释语言模型中多义神经元的多智能体框架

Weiqi Liu, Yongliang Miao, Haiyan Zhao, Yanguang Liu, Mengnan Du

机构 * Wuhan University(武汉大学) Hong Kong Baptist University(香港 Baptist大学) New Jersey Institute of Technology(新泽西理工学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 NeuronScope通过多智能体框架迭代优化神经元解释,揭示语言模型中隐藏的多义性并提升解释的激活相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01426 2026-01-08 cs.SE cs.CL

SWE-Lego: Pushing the Limits of Supervised Fine-tuning for Software Issue Resolving

SWE-Lego:推动软件问题解决监督微调的极限

Chaofan Tao, Jierun Chen, Yuxin Jiang, Kaiqi Kou, Shaowei Wang, Ruoyu Wang, Xiaohui Li, Sidi Yang, Yiming Du, Jianbo Dai, Zhiming Mao, Xinyu Wang, Lifeng Shang, Haoli Bai

机构 * Huawei Technologies(华为技术有限公司) NTU(国立新加坡大学) HKU(香港大学) CUHK(香港城市大学)

AI总结 SWE-Lego通过轻量级监督微调方法和改进的测试时扩展技术,在软件问题解决任务中达到最新性能。

Comments Project website: https://github.com/SWE-Lego/SWE-Lego

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09900 2026-01-08 cs.AI cs.CE

Boosting In-Silicon Directed Evolution with Fine-Tuned Protein Language Model and Tree Search

通过微调蛋白质语言模型和树搜索提升硅基定向进化

Yaodong Yang, Yang Wang, Jinpeng Li, Pei Guo, Da Han, Guangyong Chen, Pheng-Ann Heng

机构 * Department of Computer Science(计算机科学与工程系) Engineering, The Chinese University of Hong Kong(香港中文大学) Hangzhou Institute of Medicine, Chinese Academy of Sciences(中国科学院杭州医学研究所)

AI总结 AlphaDE通过微调蛋白质语言模型和树搜索提升硅基定向进化效率

Comments working in progress, 20 pages, 6 figures, 16 tables, updating template

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08849 2026-01-08 cs.CV

Adapting Vision-Language Foundation Model for Next Generation Medical Ultrasound Image Analysis

为下一代医学超声图像分析适应视觉-语言基础模型

Jingguo Qu, Xinyang Han, Jia Ai, Juan Wu, Tong Zhao, Tonghuan Xiao, Sheng Ning, Yuqi Yang, Jing Qin, Ann Dorothy King, Winnie Chiu-Wing Chu, Jing Cai, Michael Tin-Cheung Ying

机构 * Department of Health Technology and Informatics, The Hong Kong Polytechnic University(健康科技与信息学系,香港理工大学) Centre for Smart Health and School of Nursing, The Hong Kong Polytechnic University(智能健康中心及护理学院,香港理工大学) Department of Imaging and Interventional Radiology, The Chinese University of Hong Kong(影像与介入放射学系,香港中文大学) Suzhou Hospital of Traditional Chinese Medicine Affiliated to Nanjing University of Chinese Medicine(南京中医药大学附属苏州中医医院) Department of Ultrasound, The Affiliated Changzhou No. 2 People's Hospital of Nanjing Medical University(南京医科大学附属常州第二人民医院超声科)

AI总结 本文提出混合微调策略,通过频域过滤和多尺度特征聚合提升CLIP模型在超声图像分析中的性能,实现更高效和鲁棒的医学诊断应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22156 2026-01-08 cs.CL

InComeS: Integrating Compression and Selection Mechanisms into LLMs for Efficient Model Editing

InComeS: 将压缩与选择机制整合到LLMs中以实现高效的模型编辑

Shuaiyi Li, Zhisong Zhang, Yang Deng, Chenlong Deng, Tianqing Fang, Hongming Zhang, Haitao Mi, Dong Yu, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Tencent AI Lab(腾讯AI实验室) Singapore Management University(新加坡管理学院)

AI总结 InComeS通过整合压缩和选择机制,提升LLMs处理多编辑任务的效率和性能。

Comments 18 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07960 2026-01-08 cs.CV

VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning

VisualCloze: 一种通过视觉上下文学习实现通用图像生成的框架

Zhong-Yu Li, Ruoyi Du, Juncheng Yan, Le Zhuo, Qilong Wu, Zhen Li, Peng Gao, Zhanyu Ma, Ming-Ming Cheng

机构 * VCIP, CS, Nankai University(VCIP、计算机科学、南开大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 VisualCloze通过视觉上下文学习实现通用图像生成,支持多种任务泛化与反向生成,利用图结构数据集提升任务密度和知识迁移。

Comments Accepted at ICCV 2025. Project page: https://visualcloze.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24067 2026-01-08 cs.LG

TransMamba: A Sequence-Level Hybrid Transformer-Mamba Language Model

TransMamba: 一种序列级混合Transformer-Mamba语言模型

Yixing Li, Ruobing Xie, Zhen Yang, Xingwu Sun, Shuaipeng Li, Weidong Han, Zhanhui Kang, Yu Cheng, Chengzhong Xu, Di Wang, Jie Jiang

机构 * Tencent Hunyuan(腾讯文英) The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学)

AI总结 TransMamba通过共享参数矩阵统一Transformer和Mamba,实现序列级动态切换注意力与SSM机制,提升训练效率和性能。

Comments Accepted by AAAI 2026. Code: https://github.com/Yixing-Li/TransMamba

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02906 2026-01-07 cs.CL

Linear Script Representations in Speech Foundation Models Enable Zero-Shot Transliteration

语音基础模型中的线性脚本表示可实现零样本转写

Ryan Soh-Eun Shim, Kwanghee Choi, Kalvin Chang, Ming-Hao Hsu, Florian Eichin, Zhizheng Wu, Alane Suhr, Michael A. Hedderich, David Harwath, David R. Mortensen, Barbara Plank

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Texas at Austin(德克萨斯大学奥斯汀分校) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 通过在语音基础模型中引入线性脚本表示,实现对语音识别输出脚本的零样本控制,提升多语言转写性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00125 2026-01-07 cs.SE cs.AI cs.DC

A Survey on Failure Analysis and Fault Injection in AI Systems

人工智能系统中故障分析与故障注入的综述

Guangba Yu, Gou Tan, Haojia Huang, Zhenyu Zhang, Pengfei Chen, Roberto Natella, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Federico II University of Naples(那不勒斯费代里科二世大学) Chinese University of Hong Kong(香港中文大学)

AI总结 本研究综述了人工智能系统中故障分析与故障注入的方法,分析了现有技术的现状及改进方向,以提高系统可靠性。

Comments Accepted by TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02036 2026-01-06 cs.LG cs.CV

GDRO: Group-level Reward Post-training Suitable for Diffusion Models

GDRO:适用于扩散模型的组级奖励后训练

Yiyang Wang, Xi Chen, Xiaogang Xu, Yu Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室)

AI总结 GDRO通过组级奖励后训练优化,提升扩散模型奖励分数并增强抗奖励黑客能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08873 2026-01-06 cs.AI

UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Language Models

UCO:一种用于基于大语言模型的自适应教学的多轮交互强化学习方法

Shouang Wei, Min Zhang, Xin Lin, Bo Jiang, Kun Kuang, Zhongxiang Dai

机构 * East China Normal University(东华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 UCO通过多轮交互强化学习方法,利用进展奖励和支架奖励函数,提升大语言模型在教育场景中的自适应教学能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06057 2026-01-06 cs.CL cs.MM

MIND Your Reasoning: A Meta-Cognitive Intuitive-Reflective Network for Dual-Reasoning in Multimodal Stance Detection

注意你的推理:一种用于多模态立场检测双推理的元认知直观-反思网络

Bingbing Wang, Zhengda Jin, Bin Liang, Wenjie Li, Jing Li, Ruifeng Xu, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 MIND通过元认知直观-反思机制,在多模态立场检测中实现双推理,提升立场判断的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01493 2026-01-06 cs.LG math.OC

Accelerating Decentralized Optimization via Overlapping Local Steps

通过重叠局部步骤加速去中心化优化

Yijie Zhou, Shi Pu

机构 * School of Data Science(数据科学学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 OLDSGD通过计算-通信重叠技术,加速去中心化优化,提升收敛速度并保持理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22808 2026-01-06 cs.CV cs.AI

EgoReAct: Egocentric Video-Driven 3D Human Reaction Generation

EgoReAct:基于第一人称视频的3D人体反应生成

Libo Zhang, Zekun Li, Tianyu Li, Zeyu Cao, Rui Xu, Xiaoxiao Long, Wenjia Wang, Jingbo Wang, Yuan Liu, Wenping Wang, Daquan Zhou, Taku Komura, Zhiyang Dou

机构 * THU(清华大学) Brown(布朗大学) Georgia Tech(佐治亚理工学院) Cambridge(剑桥大学) HKU(香港大学) NJU(南京大学) CUHK(香港中文大学) HKUST(香港科技大学) TAMU(德克萨斯大学奥斯汀分校) PKU(北京大学) MIT(麻省理工学院)

AI总结 EgoReAct通过构建HRD数据集,首次实现从第一人称视频实时生成3D对齐的人体反应运动,提升生成的现实感和空间一致性。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18076 2026-01-06 cs.CL

Hybrid and Unitary PEFT for Resource-Efficient Large Language Models

混合与单位元PEFT用于资源高效的大型语言模型

Haomin Qi, Zihan Dai, Chengbo Huang

机构 * Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong(信息工程系,香港中文大学) Department of Electrical and Computer Engineering, University of California San Diego, USA(电气与计算机工程系,加州大学圣地亚哥分校) Department of Computer Science, University of Copenhagen, Denmark(计算机科学系,哥本哈根大学) Department of Electrical Engineering, Columbia University, USA(电气工程系,哥伦比亚大学)

AI总结 本文提出混合与单位元PEFT方法,通过结合BOFT和LoRA-GA的优势,提升LLM微调效率,减少训练时间和内存使用,适用于资源受限场景。

Comments 11 pages, 2 figures and 7 table

Journal ref American Journal of Computer Science and Technology (Volume 8, Issue 4, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏