arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2402
2506.09984 2026-03-06 cs.CV cs.AI cs.SD

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

InterActHuman: 多概念人类动画与布局对齐的音频条件

Zhenzhi Wang, Jiaqi Yang, Jianwen Jiang, Chao Liang, Gaojie Lin, Zerong Zheng, Ceyuan Yang, Yuan Zhang, Mingyuan Gao, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

AI总结 InterActHuman通过引入布局对齐的音频条件,实现多概念人类动画,支持多身份的精确控制与高质量视频生成。

Comments ICLR 2026 Camera Ready Version. TL;DR: The first multi-person dialogue video generation method from pairs of reference image and audio via explicit layout-aligned condition injection. Project page https://zhenzhiwang.github.io/interacthuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05310 2026-03-06 eess.AS cs.SD

A Large-Scale Probing Analysis of Speaker-Specific Attributes in Self-Supervised Speech Representations

对自监督语音表示中说话人特定属性的大规模探测分析

Aemon Yat Fei Chiu, Kei Ching Fung, Roger Tsz Yeung Li, Jingyu Li, Tan Lee

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong(香港中文大学电子工程系) Independent Researcher(独立研究者) School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学深圳学校数据科学系)

AI总结 本研究通过大规模分析揭示了自监督语音表示中说话人特定属性的编码机制,发现大模型在深层结构中能恢复说话人身份,且中间表示更擅长捕捉动态语调。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04395 2026-03-05 cs.LG physics.ao-ph

Accurate and Efficient Hybrid-Ensemble Atmospheric Data Assimilation in Latent Space with Uncertainty Quantification

在潜在空间中实现准确且高效的混合-集成大气数据同化与不确定性量化

Hang Fan, Juan Nathaniel, Yi Xiao, Ce Bian, Fenghua Ling, Ben Fei, Lei Bai, Pierre Gentine

机构 * Department of Earth and Environmental Engineering, School of Engineering and Applied Sciences, Climate School, Columbia University(地球与环境工程系,工程与应用科学学院,气候学院,哥伦比亚大学) Learning the Earth with Artificial Intelligence and Physics (LEAP) Center, Columbia University(人工智能与物理学习地球中心,哥伦比亚大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学,香港,中国) Department of Computer Science and Technology, Tsinghua University, Beijing, China(计算机科学与技术系,清华大学,北京,中国)

AI总结 本文提出HLOBA方法,在潜在空间中实现高效准确的大气数据同化,结合贝叶斯更新与误差去相关性,提升预测与再分析能力。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04291 2026-03-05 cs.CV cs.AI

CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video

CubeComposer: 从视角视频生成空间-时间自回归4K 360°视频

Lingen Li, Guangzhi Wang, Xiaoyu Li, Zhaoyang Zhang, Qi Dou, Jinwei Gu, Tianfan Xue, Ying Shan

机构 * The Chinese University of Hong Kong(香港中文大学) ARC Lab, Tencent PCG Project lead(腾讯PCG项目负责人)

AI总结 CubeComposer通过空间-时间自回归扩散模型实现4K分辨率360°视频生成,提升VR沉浸体验

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04062 2026-03-05 cs.LG cs.IT eess.SP math.IT

FedCova: Robust Federated Covariance Learning Against Noisy Labels

FedCova: 面对噪声标签的鲁棒联邦协方差学习

Xiangyu Zhong, Xiaojun Yuan, Ying-Jun Angela Zhang

机构 * Department of Information Engineering(信息工程系) The Chinese University of Hong Kong(香港中文大学) National Key Laboratory on Wireless Communications(无线通信国家重点实验室) University of Electronic Science and Technology of China(电子科学与技术大学)

AI总结 FedCova通过提升模型内在鲁棒性,有效应对噪声标签问题,实现联邦学习中的稳健学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03811 2026-03-05 cs.SD cs.MM eess.AS

Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement

鲁棒的基于大语言模型的音频视觉语音识别与稀疏模态对齐和视觉单元引导的细化

Fei Su, Cancan Li, Juan Liu, Wei Ju, Hongbin Suo, Ming Li

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University, China(武汉大学人工智能学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) AI Center, OPPO, China(OPPO人工智能中心) Digital Innovation Research Center, Duke Kunshan University, China(杜克大学昆山数字创新研究中心)

AI总结 本文提出AVUR-LLM,通过稀疏模态对齐和视觉单元引导细化,提升音频视觉语音识别的鲁棒性,在LRS3数据集上取得显著性能提升。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02829 2026-03-05 cs.CV cs.LG

Toward Early Quality Assessment of Text-to-Image Diffusion Models

面向文本到图像扩散模型早期质量评估

Huanlei Guo, Hongxin Wei, Bingyi Jing

机构 * Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本研究提出Probe-Select模块,通过早期评估指导文本到图像扩散模型的生成过程,降低采样成本并提升保留图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21782 2026-03-05 cs.AI

Benchmarking MLLM-based Web Understanding: Reasoning, Robustness and Safety

基于MLLM的网页理解基准测试:推理、鲁棒性与安全性

Junliang Liu, Jingyu Xiao, Wenxin Tang, Zhixian Wang, Zipeng Xie, Wenxuan Wang, Minrui Zhang, Shuanghe Yu

机构 * Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学)

AI总结 本文提出WebRRSBench基准测试,评估多模态大语言模型在网页理解中的推理、鲁棒性和安全性能力,揭示模型在复杂交互任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08184 2026-03-05 cs.CV

Scaling Laws For Diffusion Transformers

扩散变换器的扩展定律

Zhengyang Liang, Hao He, Ceyuan Yang, Bo Dai

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 本文研究了扩散变换器的扩展定律,通过实验验证了模型大小、数据需求与计算预算之间的幂律关系,并展示了预训练损失与生成性能的一致性,为模型性能和数据质量评估提供了可预测的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03198 2026-03-04 cs.RO cs.CL cs.CV

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

ACE-Brain-0:空间智能作为通用具身化体系的共享框架

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of Science(科学技术大学) Fudan University(复旦大学) Xiamen University(厦门大学) East China Normal University(华东师范大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。

Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02985 2026-03-04 cs.CV

The Dresden Dataset for 4D Reconstruction of Non-Rigid Abdominal Surgical Scenes

德里森数据集用于非刚性腹部手术场景的4D重建

Reuben Docea, Rayan Younis, Yonghao Long, Maxime Fleury, Jinjing Xu, Chenyang Li, André Schulze, Ann Wierick, Johannes Bender, Micha Pfeiffer, Qi Dou, Martin Wagner, Stefanie Speidel

机构 * Department of Translational Surgical Oncology, National Center for Tumor Diseases (NCT), NCT/UCC Dresden, a partnership between DKFZ, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology, and Helmholtz-Zentrum Dresden-Rossendorf (HZDR), Dresden, Germany(转化外科肿瘤中心部门,肿瘤疾病国家中心(NCT),NCT/UCC德累斯顿,由DKFZ、医学院和卡尔·戈斯瓦尔德·卡尔医院、德累斯顿技术大学以及德累斯顿-罗斯恩多夫赫尔姆霍兹中心(HZDR)组成的合作机构,德累斯顿,德国) Department of Translational Surgical Oncology, NCT/UCC Dresden, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology(转化外科肿瘤中心部门,NCT/UCC德累斯顿,医学院和卡尔·戈斯瓦尔德·卡尔医院,德累斯顿技术大学) Department for Visceral, Thoracic and Vascular Surgery, Faculty of Medicine and University Hospital Carl Gustav Carus, Technische Universität Dresden(visceral、胸腔和血管外科部门,医学院和卡尔·戈斯瓦尔德·卡尔医院,德累斯顿技术大学) Centre for Tactile Internet with Human-in-the-Loop (CeTI), Technical University Dresden(人机交互触觉互联网中心(CeTI),德累斯顿技术大学) Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程部门,香港中文大学)

AI总结 D4D数据集通过提供高精度结构光几何与内窥镜视频,为非刚性腹部手术场景的4D重建和深度估计方法提供全面评估基准。

Comments 16 pages, 10 figures, accompanying data descriptor for dataset, submitted to Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02907 2026-03-04 cs.CV

Harmonic Beltrami Signature Network: a Shape Prior Module in Deep Learning Framework

调和Beltrami签名网络:深度学习框架中的形状先验模块

Chenran Lin, Lok Ming Lui

机构 * Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系)

AI总结 本文提出HBSN,一种用于提取形状先验信息的深度学习模块,能有效提升分割模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05116 2026-03-04 cs.LG cs.CV

Value Gradient Guidance for Flow Matching Alignment

价值梯度指导下的流匹配对齐

Zhen Liu, Tim Z. Xiao, Carles Domingo-Enrich, Weiyang Liu, Dinghuai Zhang

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) University of Tübingen(图宾根大学) Microsoft Research(微软研究院) The Chinese University of Hong Kong(香港中文大学) Mila – Quebec AI Institute(魁北克AI研究所)

AI总结 VGG-Flow通过价值梯度指导实现流匹配模型的高效微调与先验保留对齐。

Comments Accepted at NeurIPS 2025; 26 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12264 2026-03-04 cs.AI

Reducing Belief Deviation in Reinforcement Learning for Active Reasoning

减少强化学习中的信念偏差以实现主动推理

Deyu Zou, Yongqiang Chen, Jianxiang Wang, Haochen Yang, Mufei Li, James Cheng, Pan Li, Yu Gong

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出$\mathbf{T^3}$方法,通过跟踪信念偏差并截断训练轨迹,提升LLM在主动推理中的训练稳定性与性能表现。

Comments Published as a conference paper at ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16894 2026-03-04 cs.CL

Make LoRA Great Again: Boosting LoRA with Adaptive Singular Values and Mixture-of-Experts Optimization Alignment

让LoRA更出色:通过自适应奇异值和专家混合优化对齐提升LoRA

Chenghao Fan, Zhenyi Lu, Sichen Liu, Chengfeng Gu, Xiaoye Qu, Wei Wei, Yu Cheng

机构 * School of Computer Science \& Technology, Huazhong University of Science The Chinese University of Hong Kong Zhejiang University

AI总结 GOAT通过自适应奇异值和专家混合优化对齐提升LoRA性能,实现在多个任务上的最优表现。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02615 2026-03-04 cs.CL

Think, But Don't Overthink: Reproducing Recursive Language Models

思考,但不要过度思考:重现递归语言模型

Daren Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究通过评估不同递归深度对RLM性能的影响,发现更深层次递归会导致模型过度思考,从而降低性能并增加计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02576 2026-03-04 cs.LG

Wasserstein Proximal Policy Gradient

基于Wasserstein几何的近端策略梯度方法

Zhaoyu Zhu, Shuhan Zhang, Rui Gao, Shuang Li

机构 * Zhiyuan College, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学紫阳学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen, Guangdong, China(香港中文大学(深圳)数据科学学院) McCombs School of Business, The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校麦克拉姆商学院)

AI总结 WPPG通过Wasserstein几何视角提出一种无需计算策略对数密度或梯度的策略梯度方法,实现连续动作空间下的高效强化学习

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00976 2026-03-04 cs.CV

PreciseCache: Precise Feature Caching for Efficient and High-fidelity Video Generation

PreciseCache: 用于高效且高保真的视频生成的精确特征缓存

Jiangshan Wang, Kang Zhao, Jiayi Guo, Jiayu Wang, Hang Guo, Chenyang Zhu, Xiu Li, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Tsinghua University(清华大学) Tongyi Lab, Alibaba(阿里巴巴通义实验室)

AI总结 PreciseCache通过精确检测和跳过冗余计算,实现视频生成的高效且高质量推理。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18833 2026-03-04 cs.SD cs.CV eess.AS eess.IV

PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation

PrismAudio:分解的思维链与多维奖励用于视频到音频生成

Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Peiwen Sun, Rongjie Huang, Xiangang Li, Jieping Ye, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) The Chinese University of Hong Kong (CUHK)(香港中文大学)

AI总结 PrismAudio通过分解思维链与多维奖励,解决视频到音频生成中的目标纠缠问题,实现更高质量的生成效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03215 2026-03-04 cs.CL cs.LG

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

缓存到缓存:大型语言模型之间的直接语义通信

Tianyu Fu, Zihan Min, Hanling Zhang, Jichao Yan, Guohao Dai, Wanli Ouyang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence AI The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) SLAI Shanghai AI Laboratory(上海人工智能实验室)

AI总结 缓存到缓存通过直接语义通信提升大型语言模型的性能和效率,实现比文本通信更高的准确率和更低的延迟。

Comments Published in ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15504 2026-03-03 cs.CV cs.AI

Exploiting Low-Dimensional Manifold of Features for Few-Shot Whole Slide Image Classification

利用特征的低维流形进行少样本全滑动图像分类

Conghao Xiong, Zhengrui Guo, Zhe Xu, Yifei Zhang, Raymond Kai-Yu Tong, Si Yong Yeo, Hao Chen, Joseph J. Y. Sung, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Centre of AI in Medicine, Singapore(新加坡人工智能医学中心) The Hong Kong University of Science and Technology(香港科学大学) Nanyang Technological University(南洋理工大学) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学Lee Kong Chian医学学院) MedVisAI Lab, Singapore(新加坡MedVisAI实验室)

AI总结 本文提出Manifold Residual块,通过几何意识的残差学习方法,解决少样本全滑动图像分类中的过拟合问题,实现更高效的模型性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01720 2026-03-03 cs.CV

Preoperative-to-intraoperative Liver Registration for Laparoscopic Surgery via Latent-Grounded Correspondence Constraints

腹腔手术中基于潜在证据的预手术到手术过程肝脏注册

Ruize Cui, Jialun Pei, Haiqiao Wang, Jun Zhou, Jeremy Yuen-Chun Teoh, Pheng-Ann Heng, Jing Qin

机构 * The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

AI总结 本文提出Land-Reg框架,通过显式学习潜在证据的2D-3D地标对应关系,提升腹腔手术中预手术到术中肝脏的跨模态注册精度与可解释性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01592 2026-03-03 cs.SD

TQCodec: Towards neural audio codec for high-fidelity music streaming

TQCodec:面向高质量音乐流媒体的神经音频编解码器

Lixing He, Zhouxuan Chen, Mingshuai Liu, Xinran Sun, Wucheng Wang, Minfu Li, Lingcheng Kong, Weifeng Zhao, Wenjiang Zhou

机构 * Tencent Music Entertainment(腾讯音乐娱乐) The Chinese University of Hong Kong(香港中文大学) Southeast University(东南大学) Tsinghua University(清华大学)

AI总结 TQCodec是一种针对高质量音乐流媒体设计的神经音频编解码器,通过改进的网络架构和感知驱动的比特分配策略,在高比特率下实现卓越的音频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01502 2026-03-03 cs.CL eess.AS

Anatomy of the Modality Gap: Dissecting the Internal States of End-to-End Speech LLMs

模态差距的解剖:剖析端到端语音大语言模型的内部状态

Ming-Hao Hsu, Xueyao Zhang, Xiaohai Tian, Jun Zhang, Zhizheng Wu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

AI总结 本文研究了端到端语音大语言模型中语音与文本表示的跨层对齐特性,揭示了语音冗余性导致的模态差距问题,并提出未来需在标记或时间粒度上进行优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01454 2026-03-03 cs.CV cs.AI

VidDoS: Universal Denial-of-Service Attack on Video-based Large Language Models

VidDoS:针对基于视频的大语言模型的通用拒绝服务攻击

Duoxun Tang, Dasen Dai, Jiyao Wang, Xiao Yang, Jianyu Wang, Siqi Cai

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) Shenzhen Loop Area Institute, China(深圳环园院) McGill University(麦吉尔大学) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学)

AI总结 VidDoS是一种针对视频大语言模型的通用拒绝服务攻击方法,通过通用优化生成实例无关的触发器,导致模型推理延迟和token扩展显著增加,引发安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01375 2026-03-03 cs.AI cs.LG

Words & Weights: Streamlining Multi-Turn Interactions via Co-Adaptation

词语与权重:通过协同适应流式多轮交互

Chenxing Wei, Hong Wang, Ying He, Zhongxiang Dai, Bo Jiang, F. Richard Yu, Yao Shu

机构 * Shenzhen University(深圳大学) Hong Kong University of Science(香港科学大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) University of Science(科学大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Carleton University(卡尔顿大学)

AI总结 ROSA2通过协同适应词语与权重空间,提升多轮交互的语义清晰度和参数更新效率,实现更高效的交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24080 2026-03-03 cs.AI cs.SD

Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction

人类还是机器?一种语音到语音交互的初步图灵测试

Xiang Li, Jiabao Gao, Sipei Lin, Xuan Zhou, Chi Zhang, Bo Cheng, Jiale Han, Benyou Wang

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Shenzhen Research Institute of Big Data(深圳大数据研究 institute) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文首次对语音到语音系统进行图灵测试,发现现有系统在类人特性上存在显著差距,提出细粒度分类法和可解释模型以提升对话AI的类人能力。

Comments Accepted by ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09285 2026-03-03 cs.CV

Spotlight on Token Perception for Multimodal Reinforcement Learning

多模态强化学习中的token感知聚焦

Siyuan Huang, Xiaoye Qu, Yafu Li, Yun Luo, Zefeng He, Daizong Liu, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Wuhan University(武汉大学)

AI总结 本文提出VPPO算法,通过token感知优化提升多模态强化学习的视觉推理能力。

Comments Accepted by ICLR 2026, project page: https://github.com/huaixuheqing/VPPO-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19653 2026-03-03 cs.AI

Token-Importance Guided Direct Preference Optimization

基于令牌重要性的直接偏好优化

Ning Yang, Hai Lin, Yibo Liu, Baoliang Tian, Guoqing Liu, Haijun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ByteDance(字节跳动) Microsoft Research AI4Science(微软研究院AI4Science) University of Science and Technology Beijing(北京科技大学)

AI总结 本文提出TI-DPO方法,通过混合加权机制和三元组损失实现细粒度语义控制,提升模型对偏好响应的准确性和生成多样性。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏