arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-04-22 至 2026-04-22 共收录 7
2604.19720 2026-04-22 cs.CV

ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis

ReImagine:重新思考通过图像优先合成实现可控高质量人类视频生成

Zhengwentai Sun, Keru Zheng, Chenghong Li, Hongjie Liao, Xihe Yang, Heyuan Li, Yihao Zhi, Shuliang Ning, Shuguang Cui, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Future Network of Intelligence Institute, CUHK-Shenzhen, China(CUHK-深圳智能网络研究院)

AI总结 本文提出通过图像优先合成方法,结合预训练图像模型与SMPL-X运动引导,生成高质量且时间一致的视频,同时释放人类数据集与辅助模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11913 2026-04-22 cs.CL cs.AI

LSTM-MAS: A Long Short-Term Memory Inspired Multi-Agent System for Long-Context Understanding

LSTM-MAS:一种受长短期记忆启发的多智能体系统用于长上下文理解

Yichen Jiang, Jiakang Yuan, Chongjun Tu, Peng Ye, Tao Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出LSTM-MAS多智能体系统,通过模仿LSTM的层次信息流和门控机制,解决长上下文处理中的误差累积和幻觉传播问题,实验表明在多个问答数据集上取得显著提升。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09373 2026-04-22 cs.LG cs.AI cs.CV

LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization

LPO:通过位置偏好优化实现更准确的GUI代理交互

Jiaqi Tang, Yu Xia, Yi-Feng Wu, Yuwei Hu, Yuhui Chen, Qing-Guo Chen, Xiaogang Xu, Xiangyu Wu, Hao Lu, Yanqing Ma, Shiyin Lu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Alibaba Group(阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学) Nanjing University of Science and Technology(南京理工大学) The Hong Kong University of Science and Technology (Guangzhou)(广州香港科学与技术大学)

AI总结 本文提出LPO方法,通过位置偏好优化提升GUI交互精度,利用信息熵预测交互位置并引入动态位置奖励函数,实验表明其在离线和在线评估中均取得最佳性能。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19295 2026-04-22 cs.LG

TEMPO: Scaling Test-time Training for Large Reasoning Models

TEMPO:用于大规模推理模型的测试时训练扩展

Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

机构 * Tianjin University(天津大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 TEMPO通过交替策略优化和周期性批评者重校准提升测试时训练效果,显著提升模型在AIME 2024任务中的表现并保持高多样性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18005 2026-04-22 cs.MA cs.AI cs.CL

Diversity Collapse in Multi-Agent LLM Systems: Structural Coupling and Collective Failure in Open-Ended Idea Generation

多智能体大语言模型系统中的多样性崩溃:结构耦合与开放性创意生成中的集体失败

Nuo Chen, Yicheng Tong, Yuzhe Yang, Yufei He, Xueyi Zhang, Qingyun Zou, Qian Wang, Bingsheng He

机构 * National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究探讨了多智能体系统在开放性创意生成中多样性崩溃的原因,揭示了结构耦合导致的集体失败,强调了在设计创意任务时保持独立性和分歧的重要性。

Comments 56 pages, 15 figures; Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00993 2026-04-22 cs.CV

PhotoFramer: Multi-modal Image Composition Instruction

PhotoFramer:多模态图像构图指令

Zhiyuan You, Ke Wang, He Zhang, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong, Zhoutong Zhang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Adobe Research Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(InnoHK下的CPII) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 PhotoFramer通过多模态框架为用户提供图像构图指导,通过自然语言描述改进方法并生成示例图像,结合文本与图像生成模型提升日常用户构图能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21563 2026-04-22 cs.IR cs.LG

VoteGCL: Enhancing Graph-based Recommendations with Majority-Voting LLM-Rerank Augmentation

VoteGCL: 通过多数投票LLM重排序增强基于图的推荐

Minh-Anh Nguyen, Bao Nguyen, Ha Lan N. T., Tuan Anh Hoang, Duc-Trong Le, Dung D. Le

机构 * Center for AI Research, VinUniversity(越南 Vin 大学人工智能研究中心) The Chinese University of Hong Kong(香港中文大学) RMIT University(皇家墨尔本理工大学) VNU University of Engineering and Technology(越南工程与技术大学)

AI总结 本文提出利用LLM和物品文本描述增强交互数据,通过多数投票生成高置信度合成用户-物品交互,结合图对比学习框架缓解分布偏移和流行度偏差,实验显示提升准确率并减少流行度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏