arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2402
2604.09155 2026-04-13 cs.LG cs.AI

CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation

CORA: 为保障移动GUI自动化设计的符合性风险控制代理

Yushi Feng, Junye Du, Qifan Wang, Zizhan Ma, Qian Niu, Yutaka Matsuo, Long Feng, Lequan Yu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) The University of Tokyo(东京大学)

AI总结 CORA通过统计保障减少有害操作,利用Guardian模型评估行动风险并校准执行/中止边界,结合Goal-Lock机制和Phone-Harm基准验证其在自主GUI执行中的安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08810 2026-04-13 cs.CV cs.LG

R2G: A Multi-View Circuit Graph Benchmark Suite from RTL to GDSII

R2G:从RTL到GDSII的多视图电路图基准套件

Zewei Zhou, Jiajun Zou, Jiajia Zhang, Ao Yang, Ruichao He, Haozheng Zhou, Ao Liu, Jiawei Liu, Leilei Jin, Shan Shen, Daying Sun

机构 * Nanjing University of Science and Technology(南京理工大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 R2G提供了一个标准化的多视图电路图基准套件,通过统一的表示方法和可控的评估协议,解决电路表示不一致和评估协议缺失的问题,提升物理设计任务中图神经网络的应用效果。

Comments Accepted as a poster by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08719 2026-04-13 cs.CV cs.AI cs.RO

LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving

LMGenDrive: 联合多模态理解与生成世界建模以实现端到端驾驶

Hao Shao, Letian Wang, Yang Zhou, Yuxuan Hu, Zhuofan Zong, Steven L. Waslander, Wei Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出LMGenDrive框架,结合LLM多模态理解与生成世界模型,提升自动驾驶的闭环性能,通过视频预测和控制信号生成,增强时空场景建模和指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17310 2026-04-13 q-bio.NC cs.CL cs.NE

PaceLLM: Brain-Inspired Large Language Models for Long-Context Understanding

PaceLLM:用于长上下文理解的脑启发式大语言模型

Kangcong Li, Peng Ye, Chongjun Tu, Lin Zhang, Chunfeng Song, Jiamin Wu, Tao Yang, Qihao Zheng, Tao Chen

机构 * School of Information Science and Technology, Fudan University(复旦大学信息科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 PaceLLM通过引入持久活动机制和皮层专家聚类,解决大语言模型在长上下文中的信息衰减和语义碎片化问题,提升多文档问答和无限基准任务性能,扩展上下文长度至200K tokens。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14756 2026-04-13 cs.LG cs.AI

Task-Distributionally Robust Data-Free Meta-Learning

任务分布鲁棒数据免费元学习

Zixuan Hu, Yongxian Wei, Li Shen, Zhenyi Wang, Baoyuan Wu, Chun Yuan, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Computer Science and AI Institute, University of Central Florida(中佛罗里达大学计算机科学系与人工智能研究所) School of Data Science, the Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen) and Secure Computing Lab of Big Data, Shenzhen Research Institute of Big Data (SBRID)(香港中文大学(深圳)数据科学学院与深圳市大数据研究院大数据安全计算实验室)

AI总结 本文研究数据免费元学习的鲁棒性,发现任务分布偏移和任务分布污染两种漏洞,并提出可信DFML框架以缓解这些问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08537 2026-04-10 cs.LG q-bio.NC

Meta-learning In-Context Enables Training-Free Cross Subject Brain Decoding

基于上下文的元学习实现无训练跨受试者脑解码

Mu Nan, Muquan Yu, Weijian Mai, Jacob S. Prince, Hossein Adeli, Rui Zhang, Jiahang Cao, Benjamin Becker, John A. Pyles, Margaret M. Henderson, Chunfeng Song, Nikolaus Kriegeskorte, Michael J. Tarr, Xiaoqing Hu, Andrew F. Luo

机构 * University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harvard University(哈佛大学) Columbia University(哥伦比亚大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种基于上下文的元学习方法,无需微调即可实现跨受试者的脑解码,通过上下文学习和分层推理提升解码效率与鲁棒性。

Comments Accepted to CVPR 2026, website: https://github.com/ezacngm/brainCodec

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09665 2026-04-10 cs.CV cs.CY cs.LG

OxEnsemble: Fair Ensembles for Low-Data Classification

OxEnsemble:低数据分类中的公平集成

Jonathan Rystrøm, Zihao Fu, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津大学牛津互联网研究所) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对数据稀缺且各群体数据不平衡的公平分类问题,OxEnsemble通过高效训练集成模型并强制公平性,在医学影像等场景中实现更一致的性能和更好的公平性-准确性权衡。

Comments Forthcoming @ MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13551 2026-04-10 cs.CL cs.AI

Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models

面向增强大语言模型推理能力的分层多步奖励模型

Teng Wang, Zhangyi Jiang, Zhenqi He, Shenyang Tong, Wenhan Yang, Yanan Zheng, Zeyu Li, Zifan He, Hailei Gong, Zewen Ye, Shengjie Ma, Jianping Zhang

机构 * the University of Hong Kong(香港大学) Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) the Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出分层奖励模型和轻量数据增强策略,解决大语言模型推理中奖励黑客问题,提升多步推理评估的稳定性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08033 2026-04-10 cs.AI cs.MA cs.NI

IoT-Brain: Grounding LLMs for Semantic-Spatial Sensor Scheduling

IoT-Brain:为语义-空间传感器调度 grounding LLMs

Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin, Jinke Song

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出IoT-Brain系统,通过引入空间轨迹图(STG)解决LLM在语义-空间传感器调度中的表示、推理和优化缺陷,提升任务成功率37.6%并显著降低资源消耗。

Comments To appear in ACM MobiCom 2026; 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07372 2026-04-10 stat.ML cs.IT cs.LG math.IT math.OC

NS-RGS: Newton-Schulz based Riemannian gradient method for orthogonal group synchronization

NS-RGS:基于牛顿-施尔茨方法的黎曼梯度法用于正交群同步

Haiyang Peng, Deren Han, Xin Chen, Meng Huang

机构 * School of Mathematical Sciences, Beihang University(北京航空航天大学数学科学学院) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(香港中文大学系统工程与工程管理学系)

AI总结 本文提出NS-RGS方法,通过替代SVD或QR分解为牛顿-施尔茨迭代,降低计算成本,利用高效矩阵乘法与现代GPU/TPU架构,实现线性收敛并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07048 2026-04-10 cs.CL cs.AI

Search-R3: Unifying Reasoning and Embedding in Large Language Models

Search-R3:在大型语言模型中统一推理与嵌入

Yuntao Gui, James Cheng

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 Search-R3通过统一推理与嵌入生成过程,提升大型语言模型在检索任务中的性能,采用监督学习、强化学习和专用环境机制实现有效嵌入生成。

Comments CHANGELOG: (1) Completed training of Search-R3-Large; (2) Corrected error formulation; (3) Added a `Discussion` section to the appendix. We appreciation to the anonymous reviewers

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23078 2026-04-10 cs.CL

EventWeave: A Dynamic Framework for Capturing Core and Supporting Events in Dialogue Systems

EventWeave:一种动态框架,用于捕捉对话系统中的核心事件和支持事件

Zhengyi Zhao, Shubo Zhang, Yiming Du, Bin Liang, Baojun Wang, Zhongyang Li, Binyang Li, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系学院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Ministry of Education Key Laboratory of High Confidence Software Technologies, CUHK(教育部高可信软件技术重点实验室(香港中文大学))

AI总结 EventWeave通过动态事件图捕捉对话中的核心与支持事件,利用多头注意力机制生成更合适的对话响应,实验表明其在不同对话长度上均表现优异。

Comments Accepted by ACL'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06699 2026-04-09 cs.CL cs.LG

Adaptive Prompt Structure Factorization: A Framework for Self-Discovering and Optimizing Compositional Prompt Programs

自适应提示结构分解:一种自我发现和优化组合提示程序的框架

Haoyue Liu, Zhichao Wang, Yongxin Guo, Haoran Shou, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Taobao and Tmall Group(淘宝天猫集团)

AI总结 本文提出aPSF框架,通过语义因素发现和单因素更新优化提示程序,提升大语言模型的推理可靠性,实验显示在多个基准上准确率提升2.16个百分点,优化成本降低45-87%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06204 2026-04-09 cs.CL cs.AI cs.HC

SensorPersona: An LLM-Empowered System for Continual Persona Extraction from Longitudinal Mobile Sensor Streams

SensorPersona: 一种基于大语言模型的持续性人设提取系统,用于从长期移动传感器流中无感获取

Bufang Yang, Lilin Xu, Yixuan Li, Kaiwei Liu, Xiaofan Jiang, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

AI总结 本文提出SensorPersona系统,通过多模态长期传感器流持续提取稳定用户人设,提升LLM代理的个性化响应质量。系统通过上下文编码、分层人设推理和自适应更新,实现对物理行为、心理特质和生活经验的全面分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05429 2026-04-09 eess.SY cs.AI cs.CL cs.SY

Bridging Natural Language and Microgrid Dynamics: A Context-Aware Simulator and Dataset

连接自然语言与微电网动态:一种上下文感知的模拟器和数据集

Tinko Sebastian Bartels, Ruixiang Wu, Xinyu Lu, Yikai Lu, Fanzeng Xia, Haoxiang Yang, Yue Chen, Tongxin Li

机构 * School of Data Science, The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)数据科学学院) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程学系)

AI总结 本文提出OpenCEM模拟器和数据集,通过整合丰富的非结构化上下文信息与量化可再生能源动态,解决传统能源管理忽视人类生成上下文预测能力的问题,展示其在负载预测和电池充电控制中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04911 2026-04-09 cs.CV

SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing

SpatialEdit:细粒度图像空间编辑基准测试

Yicheng Xiao, Wenhu Zhang, Lin Song, Yukang Chen, Wenbo Li, Nan Jiang, Tianhe Ren, Haokun Lin, Wei Huang, Haoyang Huang, Xiu Li, Nan Duan, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出SpatialEdit-Bench基准测试,结合视角重建和框架分析评估空间编辑的感知合理性和几何精度,并构建了SpatialEdit-500k合成数据集和SpatialEdit-16B基线模型,实现细粒度空间编辑的高效训练与评估。

Comments Code: https://github.com/EasonXiao-888/SpatialEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18978 2026-04-09 cs.CL cs.AI

Low-Confidence Gold: Refining Low-Confidence Samples for Efficient Instruction Tuning

低置信度黄金:用于高效指令微调的低置信度样本精炼

Hongyi Cai, Jie Li, Mohammad Mahdinur Rahman, Wenzhen Dong

机构 * Universiti Malaya(马来亚大学) University of Science and Technology Beijing(北京科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出LCG框架,通过聚类和置信度引导选择精炼低置信度样本,提升指令微调效率与性能,实验显示在MT-bench等指标上表现更优。

Comments Accepted to EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06156 2026-04-08 cs.CV cs.AI cs.CL

MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control

MMEmb-R1: 基于推理增强的多模态嵌入与配对感知选择及自适应控制

Yuchi Wang, Haiyang Yu, Weikang Bian, Jiefeng Long, Xiao Liang, Chao Feng, Hongsheng Li

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) ByteDance(字节跳动)

AI总结 本文提出MMEmb-R1框架,通过引入配对感知推理选择和强化学习,解决多模态嵌入中推理与对比监督不匹配及推理冗余的问题,实验显示其在MMEB-V2基准上达到71.2分,参数更少且推理效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16811 2026-04-08 cs.CV cs.RO

GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation

GeoPredict: 借助预测运动学和3D高斯几何实现精确VLA操作

Jingjing Qian, Boyao Han, Chen Shi, Lei Xiao, Long Yang, Shaoshuai Shi, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hunan University(湖南大学) Voyager Research, Didi Chuxing(滴滴出行沃歌研究)

AI总结 GeoPredict通过引入轨迹级模块和预测3D高斯几何模块,提升VLA模型在3D空间推理中的精度,实验表明其在几何密集和空间要求高的任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00503 2026-04-08 cs.CV

Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models

Diff4Splat:基于潜在动态重建模型的可控4D场景生成

Panwang Pan, Chenguo Lin, Jingjing Zhao, Chenxin Li, Yuchen Lin, Haopeng Li, Honglei Yan, Kairun Wen, Yunlong Lin, Yixuan Yuan, Yadong Mu

机构 * Peking University(北京大学) Xiamen University(厦门大学) CUHK(香港中文大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。

Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05748 2026-04-08 cs.CV

SVC 2026: the Second Multimodal Deception Detection Challenge and the First Domain Generalized Remote Physiological Measurement Challenge

SVC 2026: 第二届多模态欺骗检测挑战赛及首个领域通用远程生理测量挑战

Dongliang Zhu, Zhiyi Niu, Bo Zhao, Jiajian Huang, Shuo Ye, Xun Lin, Hui Ma, Taorui Wang, Jiayu Zhang, Chunmei Zhu, Junzhe Cao, Yingjie Ma, Rencheng Song, Albert Clapés, Sergio Escalera, Dan Guo, Zitong Yu

机构 * Wuhan University(武汉大学) Great Bay University(大湾区大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Hefei University of Technology(合肥工业大学) University of Barcelona(巴塞罗那大学)

AI总结 本文提出SVC 2026挑战赛,旨在通过多模态欺骗检测和远程脉搏波测速估计任务,推动对细微视觉信号的鲁棒表示学习研究。

Comments Accepted by the SVC workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05484 2026-04-08 cs.RO cs.CV

CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment

CoEnv:通过组合环境驱动具身体验多智能体协作

Li Kang, Yutao Fan, Rui Li, Heng Zhou, Yiran Qin, Zhemeng Zhang, Songtao Huang, Xiufeng Song, Zaibin Zhang, Bruno N. Y. Chen, Zhenfei Yin, Dongzhan Zhou, Wangmeng Zuo, Lei Bai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学) CUHK-Shenzhen(香港中文大学(深圳)) Fudan University(复旦大学) Dalian University of Technology(大连理工大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学)

AI总结 本文提出CoEnv框架,通过模拟与现实结合的组合环境,实现多智能体协作的高效执行与安全部署,提升任务成功率和效率。

Comments 31 pages, 8 figures, including supplementary material. Project page: https://faceong.github.io/CoEnv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04982 2026-04-08 cs.IR cs.AI cs.CL cs.LG

CURE:Circuit-Aware Unlearning for LLM-based Recommendation

CURE:基于电路的LLM推荐系统去学习

Ziheng Chen, Jiali Cheng, Zezhong Fan, Hadi Amiri, Yunzhi Yao, Xiangguo Sun, Yang Zhang

机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出CURE框架,通过分离模型组件并按功能分类,解决LLM推荐系统去学习中的梯度冲突问题,提升去学习效果和模型稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13592 2026-04-08 cs.LG cs.CV

Image Diffusion Preview with Consistency Solver

图像扩散预览与一致性求解器

Fu-Yun Wang, Hao Zhou, Liangzhe Yuan, Sanghyun Woo, Boqing Gong, Bohyung Han, Ming-Hsuan Yang, Han Zhang, Yukun Zhu, Ting Liu, Long Zhao

机构 * Google DeepMind(谷歌DeepMind) The Chinese University of Hong Kong(香港中文大学) Seoul National University(首尔大学)

AI总结 本文提出ConsistencySolver,通过强化学习优化的轻量高阶求解器,提升图像扩散预览的质量与一致性,减少推理步骤,提高交互效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04570 2026-04-08 cs.CV cs.CL

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

通过视频思考:视频生成作为一种有前途的多模态推理范式

Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Fudan University(复旦大学)

AI总结 本文提出'通过视频思考'范式,利用视频生成模型实现多模态推理,通过VideoThinkBench评估显示Sora-2在视觉和文本任务中均表现出色,证明视频生成模型在统一多模态理解与生成中的潜力。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04500 2026-04-07 cs.CV

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward

Saliency-R1: 通过显著图对齐奖励增强可解释性和忠实的视觉-语言推理

Shizhan Gong, Minda Hu, Qiyuan Zhang, Chen Ma, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学)

AI总结 Saliency-R1通过显著图对齐奖励提升视觉-语言模型的推理可解释性和忠实性,利用显著图技术高效突出关键图像区域,结合GRPO优化策略增强模型对相关区域的关注,实验显示提升推理忠实性和任务性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04331 2026-04-07 cs.CV cs.AI

GA-GS: Generation-Assisted Gaussian Splatting for Static Scene Reconstruction

GA-GS:基于生成的高斯点散射用于静态场景重建

Yedong Shen, Shiqi Zhang, Sha Zhang, Yifan Duan, Xinran Zhang, Wenhao Yu, Lu Zhang, Jiajun Deng, Yanyong Zhang

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) The Chinese University of Hong Kong(香港中文大学) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

AI总结 本文提出GA-GS方法,通过生成技术辅助恢复动态物体遮挡区域,引入可学习的真实性标量平衡真实背景与生成区域,利用轨迹匹配数据集验证了其在大规模持久遮挡场景中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04184 2026-04-07 cs.CV

AURA: Always-On Understanding and Real-Time Assistance via Video Streams

AURA: 通过视频流实现始终在线的理解与实时协助

Xudong Lu, Yang Bo, Jinpeng Chen, Shuhan Li, Xintong Guo, Huankang Guan, Fang Liu, Dunyuan Xu, Peiwen Sun, Heyang Sun, Rui Liu, Hongsheng Li

机构 * Huawei Research(华为研究院) CUHK MMLab(香港中文大学多媒体实验室)

AI总结 AURA提出一个端到端的视频流交互框架,实现视频大语言模型持续处理视频流并支持实时问答与主动响应,达到流式基准的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04160 2026-04-07 eess.AS cs.SD eess.SP

AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis

AffectSpeech: 一个带有精细文本描述的大型情感语音数据集,用于语音情感描述和合成

Tianhua Qi, Wenming Zheng, Björn W. Schuller, Zhaojie Luo, Haizhou Li

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) Key Laboratory of Child Development and Learning Science (Southeast University), Ministry of Education(教育部儿童发展与学习科学重点实验室(东南大学)) Chair of Health Informatics (CHI), Technical University of Munich(慕尼黑工业大学健康信息学教席) Group on Language, Audio, & Music (GLAM), Imperial College London(帝国理工学院语言、音频与音乐组) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Research Institute of Big Data, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(深圳市大数据研究院,香港中文大学(深圳)人工智能学院)

AI总结 本文提出AffectSpeech数据集,通过精细文本描述提升语音情感建模的表达能力,采用人机协作标注方法,实验表明其在情感描述和合成任务中表现优异。

Comments Submitted to IEEE Transactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04130 2026-04-07 math.OC cs.LG cs.NA math.NA

Primal-Dual Methods for Nonsmooth Nonconvex Optimization with Orthogonality Constraints

非光滑非凸优化中正交约束的对偶方法

Linglingzhi Zhu, Wentao Ding, Shangyuan Liu, Anthony Man-Cho So

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程系) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(香港中文大学系统工程与工程管理系)

AI总结 本文提出一种无退化对偶方法,用于解决具有正交约束的非光滑非凸优化问题,方法单循环且无需求解子问题,具有O(ε^{-3})的迭代复杂度,并通过数值实验验证其高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏