arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-04-07 至 2026-04-07 共收录 8
2604.04500 2026-04-07 cs.CV

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward

Saliency-R1: 通过显著图对齐奖励增强可解释性和忠实的视觉-语言推理

Shizhan Gong, Minda Hu, Qiyuan Zhang, Chen Ma, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学)

AI总结 Saliency-R1通过显著图对齐奖励提升视觉-语言模型的推理可解释性和忠实性,利用显著图技术高效突出关键图像区域,结合GRPO优化策略增强模型对相关区域的关注,实验显示提升推理忠实性和任务性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04331 2026-04-07 cs.CV cs.AI

GA-GS: Generation-Assisted Gaussian Splatting for Static Scene Reconstruction

GA-GS:基于生成的高斯点散射用于静态场景重建

Yedong Shen, Shiqi Zhang, Sha Zhang, Yifan Duan, Xinran Zhang, Wenhao Yu, Lu Zhang, Jiajun Deng, Yanyong Zhang

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) The Chinese University of Hong Kong(香港中文大学) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

AI总结 本文提出GA-GS方法,通过生成技术辅助恢复动态物体遮挡区域,引入可学习的真实性标量平衡真实背景与生成区域,利用轨迹匹配数据集验证了其在大规模持久遮挡场景中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04184 2026-04-07 cs.CV

AURA: Always-On Understanding and Real-Time Assistance via Video Streams

AURA: 通过视频流实现始终在线的理解与实时协助

Xudong Lu, Yang Bo, Jinpeng Chen, Shuhan Li, Xintong Guo, Huankang Guan, Fang Liu, Dunyuan Xu, Peiwen Sun, Heyang Sun, Rui Liu, Hongsheng Li

机构 * Huawei Research(华为研究院) CUHK MMLab(香港中文大学多媒体实验室)

AI总结 AURA提出一个端到端的视频流交互框架,实现视频大语言模型持续处理视频流并支持实时问答与主动响应,达到流式基准的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04130 2026-04-07 math.OC cs.LG cs.NA math.NA

Primal-Dual Methods for Nonsmooth Nonconvex Optimization with Orthogonality Constraints

非光滑非凸优化中正交约束的对偶方法

Linglingzhi Zhu, Wentao Ding, Shangyuan Liu, Anthony Man-Cho So

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程系) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(香港中文大学系统工程与工程管理系)

AI总结 本文提出一种无退化对偶方法,用于解决具有正交约束的非光滑非凸优化问题,方法单循环且无需求解子问题,具有O(ε^{-3})的迭代复杂度,并通过数值实验验证其高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18052 2026-04-07 cs.CL cs.CY

The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies

PIMMUR 原则:确保 LLM 社会集体行为的有效性

Jiaxu Zhou, Jen-tse Huang, Xuhui Zhou, Man Ho Lam, Xintao Wang, Hao Zhu, Wenxuan Wang, Maarten Sap

机构 * Chinese University of Hong Kong(香港中文大学) Johns Hopkins University(约翰斯·霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学) Stanford University(斯坦福大学) Renmin University of China(中国人民大学)

AI总结 本文通过审计39项研究,识别出六个普遍缺陷,指出89.7%的研究违反至少一个原则,导致模拟有效性受损。通过复现实验发现,当遵循PIMMUR原则时,报告的集体现象往往消失或反转,表明许多'涌现'行为可能是方法学伪影而非真实社会动态。

Comments 13 pages, 9 figures, 3 tables; add more papers in our systematic audit (39 in total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03660 2026-04-07 cs.AI

TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables

TableVision:一种大规模基准,用于复杂分层表格上的空间感知推理

Xiaoyu Chen, Lu Dai, Hanqing Wang, Zhuoyu Li, Wenbin Dai, Yanzong Zheng, Zhenggang Xia, Junyong Lin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出TableVision基准,通过量化分析发现复杂表格推理中的感知瓶颈,引入轨迹感知的分层任务分类,结合确定性接地流程生成6799条高保真推理轨迹,提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03645 2026-04-07 eess.IV cs.CV

UniSurgSAM: A Unified Promptable Model for Reliable Surgical Video Segmentation

UniSurgSAM: 一种用于可靠外科视频分割的统一提示模型

Haofeng Liu, Ziyue Wang, Alex Y. W. Kong, Guanyi Qin, Yunqiu Xu, Chang Han Low, Mingqi Gao, Lap Yan Lennon Chan, Yueming Jin

机构 * Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) School of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 本文提出UniSurgSAM,通过视觉、文本或音频提示实现可靠的外科视频分割,采用解耦两阶段框架解决优化干扰问题,并引入三种关键设计提升可靠性。

Comments Extended version of MICCAI 2025 paper (ReSurgSAM2). 13 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01590 2026-04-07 eess.AS cs.SD

PhiNet: Speaker Verification with Phonetic Interpretability

PhiNet:具有语音可解释性的说话人验证

Yi Ma, Shuai Wang, Tianchi Liu, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) LIGHTSPEED Nanjing University(南京大学) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong(香港中文大学(深圳)深圳市大数据研究院)

AI总结 PhiNet通过利用语音证据提升局部和全局可解释性,为说话人验证提供详细的语音级比较,帮助用户手动检查特征并评估验证结果,同时为开发者提供决策理由,简化错误追踪和超参数选择。

Comments Accepted by IEEE Transactions on Audio, Speech and Language Processing. Codes: https://github.com/mmmmayi/PhiNet

详情

展开后加载摘要…

URL PDF HTML 收藏