arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2402
2509.18052 2026-04-07 cs.CL cs.CY

The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies

PIMMUR 原则:确保 LLM 社会集体行为的有效性

Jiaxu Zhou, Jen-tse Huang, Xuhui Zhou, Man Ho Lam, Xintao Wang, Hao Zhu, Wenxuan Wang, Maarten Sap

机构 * Chinese University of Hong Kong(香港中文大学) Johns Hopkins University(约翰斯·霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学) Stanford University(斯坦福大学) Renmin University of China(中国人民大学)

AI总结 本文通过审计39项研究,识别出六个普遍缺陷,指出89.7%的研究违反至少一个原则,导致模拟有效性受损。通过复现实验发现,当遵循PIMMUR原则时,报告的集体现象往往消失或反转,表明许多'涌现'行为可能是方法学伪影而非真实社会动态。

Comments 13 pages, 9 figures, 3 tables; add more papers in our systematic audit (39 in total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03660 2026-04-07 cs.AI

TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables

TableVision:一种大规模基准,用于复杂分层表格上的空间感知推理

Xiaoyu Chen, Lu Dai, Hanqing Wang, Zhuoyu Li, Wenbin Dai, Yanzong Zheng, Zhenggang Xia, Junyong Lin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出TableVision基准,通过量化分析发现复杂表格推理中的感知瓶颈,引入轨迹感知的分层任务分类,结合确定性接地流程生成6799条高保真推理轨迹,提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03645 2026-04-07 eess.IV cs.CV

UniSurgSAM: A Unified Promptable Model for Reliable Surgical Video Segmentation

UniSurgSAM: 一种用于可靠外科视频分割的统一提示模型

Haofeng Liu, Ziyue Wang, Alex Y. W. Kong, Guanyi Qin, Yunqiu Xu, Chang Han Low, Mingqi Gao, Lap Yan Lennon Chan, Yueming Jin

机构 * Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) School of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 本文提出UniSurgSAM,通过视觉、文本或音频提示实现可靠的外科视频分割,采用解耦两阶段框架解决优化干扰问题,并引入三种关键设计提升可靠性。

Comments Extended version of MICCAI 2025 paper (ReSurgSAM2). 13 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01590 2026-04-07 eess.AS cs.SD

PhiNet: Speaker Verification with Phonetic Interpretability

PhiNet:具有语音可解释性的说话人验证

Yi Ma, Shuai Wang, Tianchi Liu, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) LIGHTSPEED Nanjing University(南京大学) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong(香港中文大学(深圳)深圳市大数据研究院)

AI总结 PhiNet通过利用语音证据提升局部和全局可解释性,为说话人验证提供详细的语音级比较,帮助用户手动检查特征并评估验证结果,同时为开发者提供决策理由,简化错误追踪和超参数选择。

Comments Accepted by IEEE Transactions on Audio, Speech and Language Processing. Codes: https://github.com/mmmmayi/PhiNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02877 2026-04-06 cs.CV

Unlocking Positive Transfer in Incrementally Learning Surgical Instruments: A Self-reflection Hierarchical Prompt Framework

解锁增量学习手术仪器中的正向迁移:一种自反思分层提示框架

Yu Zhu, Kang Li, Zheng Li, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出自反思分层提示框架,通过正向和反向知识迁移提升手术仪器增量分割性能,改进现有技能并避免灾难性遗忘。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02867 2026-04-06 cs.CV

HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits

HairOrbit: 从单人像中基于多视角的3D毛发建模

Leyang Jin, Yujian Zheng, Bingkui Tong, Yuda Qiu, Zhenyu Xie, Hao Li

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) SSE, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Pinscreen

AI总结 本文提出HairOrbit框架,利用视频生成模型的3D先验知识,将单视角毛发重建转化为校准的多视角重建任务,并设计两阶段毛发生长算法,实现高质量的3D毛发合成。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02780 2026-04-06 cs.CV

A Unified Perspective on Adversarial Membership Manipulation in Vision Models

视觉模型中对抗性成员操纵的统一视角

Ruize Gao, Kaiwen Zhou, Yongqiang Chen, Feng Liu

机构 * Knowin AI The Chinese University of Hong Kong(香港中文大学) The University of Melbourne(墨尔本大学)

AI总结 本文探讨了视觉模型中对抗性成员操纵现象,揭示其几何特征并提出检测与防御策略,提升模型鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02764 2026-04-06 cs.CV

InverseDraping: Recovering Sewing Patterns from 3D Garment Surfaces via BoxMesh Bridging

逆褶皱:通过BoxMesh桥梁从3D服装表面恢复缝纫图案

Leyang Jin, Zirong Jin, Zisheng Ye, Haokai Pang, Xiaoguang Han, Yujian Zheng, Hao Li

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) FNii-Shenzhen(深圳市未来网络智能研究院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) Pinscreen

AI总结 本文提出通过BoxMesh桥梁从3D服装表面恢复缝纫图案的两阶段框架,通过结构化中间表示减少歧义,提升恢复精度和鲁棒性。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02355 2026-04-06 cs.LG cs.CV

From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation

从广泛探索到稳定合成:基于熵的优化用于自回归图像生成

Han Song, Yucheng Zhou, Jianbing Shen, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学)

AI总结 本文提出基于熵的优化方法EG-GRPO,通过调整不确定性分配提升文本到图像生成的稳定性与质量,实验显示其在标准基准上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02346 2026-04-06 cs.LG cs.AI cs.SE q-bio.BM

DrugPlayGround: Benchmarking Large Language Models and Embeddings for Drug Discovery

DrugPlayGround:大型语言模型和嵌入式在药物发现中的基准测试

Tianyu Liu, Sihan Jiang, Fan Zhang, Kunyang Sun, Teresa Head-Gordon, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院和哈佛大学博德研究所) The Chinese University of Hong Kong(香港中文大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出DrugPlayGround框架,用于评估大型语言模型在生成药物物理化学特性、药物协同作用等文本描述方面的性能,同时通过专家解释验证模型的化学和生物推理能力。

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26535 2026-04-06 cs.AI

PAPO: Stabilizing Rubric Integration Training via Decoupled Advantage Normalization

PAPO:通过解耦优势归一化稳定规则整合训练

Zelin Tan, Zhouliang Yu, Bohan Lin, Zijie Geng, Hejia Geng, Yudong Zhang, Mulei Zhang, Yang Chen, Shuyue Hu, Zhenfei Yin, Chen Zhang, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Oxford(牛津大学) Wuhan University(武汉大学)

AI总结 PAPO通过解耦优势归一化整合过程级评估,解决现有奖励设计的两个局限:Outcome Reward Models(ORM)仅评估最终答案正确性,而Process Reward Models(PRM)虽监督更丰富但易导致奖励黑客。

Comments 16 Pages,9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10419 2026-04-06 cs.LG cs.AI

Equivariant Evidential Deep Learning for Interatomic Potentials

等变证据深度学习用于原子间势能

Zhongyao Wang, Taoyong Cui, Jiawen Zou, Shufei Zhang, Bo Yan, Wanli Ouyang, Weimin Tan, Mao Su

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 本文提出等变证据深度学习框架,用于提升原子间势能预测的准确性和可靠性,通过等变协方差张量实现旋转不变性,提高计算效率和数据利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16255 2026-04-06 astro-ph.IM cs.AI

Category-based Galaxy Image Generation via Diffusion Models

基于类别的银河图像生成:通过扩散模型

Xingzhong Fan, Hongming Tang, Yue Zeng, M. B. N. Kouwenhoven, Guangquan Zeng

机构 * Department of Physics, Xi'an Jiaotong-Liverpool University(西交利物浦大学物理系) Department of Computer Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Department of Physics, The Chinese University of Hong Kong(香港中文大学物理系)

AI总结 本文提出GalCatDiff框架,结合银河图像特征和天体物理属性,通过增强的U-Net和新型Astro-RAB模块提升生成质量,实现高效且物理一致的银河生成。

Comments 23 pages, 10 figures. Accepted by AAS Astronomical Journal (AJ) and has now been published on https://iopscience.iop.org/article/10.3847/1538-3881/ae5064. See another independent work for further reference -- Can AI Dream of Unseen Galaxies? Conditional Diffusion Model for Galaxy Morphology Augmentation (Ma, Sun et al.). Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02289 2026-04-03 cs.CV cs.AI

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型

Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu, Xiaoguang Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) Meshy AI

AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00388 2026-04-03 cs.LG

Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode

扩散模型更安全,但受上下文影响而失效:扩散大语言模型的安全祝福及其失效模式

Zeyuan He, Yupeng Chen, Lang Lin, Yihan Wang, Shenxu Chang, Eric Sommerlade, Philip Torr, Junchi Yu, Adel Bibi, Jialin Yu

机构 * Torr Vision Group, University of Oxford(牛津大学Torr视觉组) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft(微软)

AI总结 研究探讨了扩散大语言模型(D-LLMs)在生成效率上的优势及其安全特性,发现其扩散生成方式增强了对对抗攻击的抵抗力,但存在上下文嵌套等失效模式,首次成功突破Gemini Diffusion的安全防线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13024 2026-04-03 cs.LG math.OC

Fragility-aware Classification for Understanding Risk and Improving Generalization

面向脆弱性的分类:理解风险与提升泛化能力

Chen Yang, Zheng Cui, Daniel Zhuoyu Long, Jin Qi, Ruohan Zhan

机构 * School of Management, Zhejiang University(浙江大学管理学院) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(香港中文大学系统工程与工程管理系) Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系) Department of Marketing and Analytics, University College London(伦敦大学学院市场营销与分析系)

AI总结 本文提出Fragility Index作为新型性能指标,从风险规避角度评估分类器,通过鲁棒满足框架确保在分布不确定性下的鲁棒性,并开发可训练框架以直接优化FI,实验证明其能揭示误差尾部风险并提升决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01765 2026-04-03 cs.CV cs.AI cs.RO

DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning

DriveDreamer-Policy: 一种基于几何的世界-动作模型用于统一生成与规划

Yang Zhou, Xiaofeng Wang, Hao Shao, Letian Wang, Guosheng Zhao, Jiangnan Shao, Jiagang Zhu, Tingdong Yu, Zheng Zhu, Guan Huang, Steven L. Waslander

机构 * GigaAI University of Toronto(多伦多大学) CUHK MMLab(香港中文大学多媒体实验室)

AI总结 本文提出DriveDreamer-Policy,结合深度生成、未来视频生成与运动规划,通过几何感知的世界表示提升生成与规划的连贯性与准确性。

Comments 11 pages, 4 figures; Project Website: https://drivedreamer-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01681 2026-04-03 cs.RO cs.AI

Bridging Large-Model Reasoning and Real-Time Control via Agentic Fast-Slow Planning

通过代理快慢规划弥合大模型推理与实时控制

Jiayi Chen, Shuai Wang, Guangxu Zhu, Chengzhong Xu

机构 * Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong (Shenzhen)(深圳市大数据研究院,香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院) State Key Laboratory of Internet of Things for Smart City (SKL-IOTSC), University of Macau(澳门大学智慧城市物联网国家重点实验室)

AI总结 本文提出一种分层框架,通过感知-决策-轨迹-控制的分离,提升自动驾驶系统在扰动下的鲁棒性,减少侧向偏移和完成时间。

Comments 8 pages, 12figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01569 2026-04-03 cs.CV cs.MM

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

VideoZeroBench: 通过时空证据验证探测视频多模态大语言模型的极限

Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

机构 * PKU(北京大学) WHU(武汉大学) CASIA(中国科学院自动化研究所) BJTU(北京交通大学) CUHK(香港中文大学)

AI总结 VideoZeroBench通过严格验证时空证据,揭示视频多模态大语言模型在长视频问答中的不足,发现即使在标准设置下,模型正确率也低于17%,且在严格约束下性能显著下降,凸显了基于证据的视频理解仍是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00986 2026-04-03 cs.CR cs.AI cs.CL cs.LG

Do Phone-Use Agents Respect Your Privacy?

手机使用代理是否尊重您的隐私?

Zhengyang Tang, Ke Ji, Xidong Wang, Zihan Ye, Xinyuan Wang, Yiduo Guo, Ziniu Li, Chenxin Li, Jingyuan Hu, Shunian Chen, Tongxu Luo, Jiaxi Bi, Zeyu Qin, Shaobo Wang, Xin Lai, Pengyuan Lyu, Junyi Li, Can Xu, Chengquan Zhang, Han Hu, Ming Yan, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) Shanghai Jiao Tong University(上海交通大学) Hunyuan Team, Tencent(腾讯混元团队)

AI总结 研究手机使用代理在完成良性移动任务时是否尊重隐私,通过MyPhoneBench框架评估隐私行为,发现任务成功率、隐私合规完成和后续会话偏好使用是不同能力,无单一模型主导。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12372 2026-04-03 cs.AI cs.CL cs.LG

Efficient Reasoning with Balanced Thinking

高效平衡思考推理

Yulin Li, Tengyao Tu, Li Ding, Junjie Wang, Huiling Zhen, Yixin Chen, Yong Li, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zhongguancun Academy(中关村学院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出ReBalance框架,通过平衡思考提升推理效率,减少冗余并提高准确性,适用于多种推理任务。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23205 2026-04-03 cs.CV

EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents

EmbodMocap: 野外4D人体-场景重建用于具身智能体

Wenjia Wang, Liang Pan, Huaijin Pi, Yuke Lou, Xuqian Ren, Yifan Wu, Zhouyingcheng Liao, Lei Yang, Rishabh Dabral, Christian Theobalt, Taku Komura

机构 * The University of Hong Kong(香港大学) Tampere University(坦佩雷大学) The Chinese University of Hong Kong(香港中文大学) Max-Planck Institute for Informatics(马克斯·普朗克信息学研究所)

AI总结 本文提出EmbodMocap,利用两部移动iPhone实现低成本、便携式的人体-场景重建,通过联合校准双RGB-D序列,在无静态相机和标记的情况下实现日常环境中的度量尺度和场景一致的重建,提升具身智能研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16515 2026-04-03 cs.CV

SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer

SALAD: 通过高效的线性注意微调实现高稀疏性注意

Tongcheng Fang, Hanling Zhang, Ruiqi Xie, Zhuo Han, Xin Tao, Tianchen Zhao, Pengfei Wan, Wenbo Ding, Wanli Ouyang, Xuefei Ning, Yu Wang

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出SALAD,通过并行的稀疏注意与轻量线性注意分支,结合多级静态-动态缩放策略,实现高达90%的稀疏性和1.52-2.03倍的推理加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10779 2026-04-03 cs.LG cs.AI

Unified Optimization of Source Weights and Transfer Quantities in Multi-Source Transfer Learning: An Asymptotic Framework

多源迁移学习中源权重和转移量的统一优化:一种渐近框架

Qingyue Zhang, Chang Chu, Haohao Fu, Tianren Peng, Yanru Wu, Guanbo Huang, Yang Li, Shao-Lun Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

AI总结 本文提出UOWQ框架,通过渐近分析将多源迁移学习建模为参数估计问题,理论证明了合理调整权重时使用全部源样本最优,并通过实验验证了框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01155 2026-04-02 cs.SD

FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining

FineLAP: 通过异质监督驯化细粒度语言-音频预训练

Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎卓越工程师学院) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出FineLAP,一种新型预训练范式,通过异质数据提升CLAP在clip和frame级对齐能力,引入双流sigmoid损失和聚类采样策略,结合大规模合成SED数据集,实现多任务SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01129 2026-04-02 cs.CV

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

ReinDriveGen:强化学习后训练用于分布外驾驶场景生成

Hao Zhang, Lue Fan, Weikang Bian, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(MMLab,香港中文大学) CASIA(中国科学院自动化研究所) SenseTime Research(商汤科技研究院)

AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。

Comments Project page: https://drive-sim.github.io/ReinDriveGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01082 2026-04-02 cs.CV cs.GR

ReMoGen: Real-time Human Interaction-to-Reaction Generation via Modular Learning from Diverse Data

ReMoGen:通过多样化数据的模块学习实现实时的人际交互生成

Yaoqin Ye, Yiteng Xu, Qin Sun, Xinge Zhu, Yujing Sun, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Guangzhou Institute of Energy Conversion, CAS(中国科学院广州能源研究所) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出ReMoGen框架,通过模块化学习生成实时的人际交互反应,利用大规模单人动作数据集学习通用动作先验,并通过Meta-Interaction模块适应不同交互领域,实现高效且高质量的动作响应。

Comments accepted by CVPR 2026, project page: https://4dvlab.github.io/project_page/remogen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01020 2026-04-02 cs.MA cs.AI

OrgAgent: Organize Your Multi-Agent System like a Company

OrgAgent: 以公司式层级结构组织你的多智能体系统

Yiru Wang, Xinyue Shen, Yaohui Han, Michael Backes, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) IBM Research(IBM研究院) CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

AI总结 本文提出OrgAgent框架,通过治理、执行、合规三层结构提升多智能体系统的推理性能,实验显示层级结构在任务稳定性、信息控制和验证方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00969 2026-04-02 cs.CV

DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving

DLWM:双潜在世界模型实现自动驾驶中的整体高斯中心预训练

Yiyao Zhu, Ying Xue, Haiming Zhang, Guangfeng Jiang, Wending Zhou, Xu Yan, Jiantao Gao, Yingjie Cai, Bingbing Liu, Zhen Li, Shaojie Shen

机构 * HKUST(香港科技大学) CUHK-SZ(香港中文大学(深圳)) USTC(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部门)

AI总结 本文提出DLWM,通过双潜在世界模型实现自动驾驶中的整体高斯中心预训练,提升3D占用感知、4D占用预测和运动规划性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00548 2026-04-02 cs.CV

Reliev3R: Relieving Feed-forward Reconstruction from Multi-View Geometric Annotations

Reliev3R: 从多视角几何注释中解脱的前馈重建

Youyu Chen, Junjun Jiang, Yueru Luo, Kui Jiang, Xianming Liu, Xu Yan, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 Reliev3R通过弱监督方法训练前馈重建模型,无需昂贵的多视角几何注释,利用单目相对深度和图像稀疏对应关系进行3D知识学习,提升重建效率与可扩展性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏