arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2392
2605.26078 2026-06-09 cs.LG 版本更新

Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning

Wasserstein策略梯度在熵正则化强化学习中的全局收敛性

Zhaoyu Zhu, Rui Gao, Shuang Li

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文通过利用熵正则化强化学习的Bellman结构,证明了Wasserstein策略梯度(WPG)方法的全局收敛性,并建立了分布Polyak-Łojasiewicz条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28831 2026-06-09 cs.CL cs.AI 版本更新

S3Mem: Structured Spatiotemporal Scene-Event Memory for Long-Horizon Interactive Question Answering

S3Mem:用于长时域交互式问答的结构化时空场景-事件记忆

Encheng Su, Jianyu Wu, Jinouwen Zhang, Qiucheng Yu, Chen Tang, Pengze Li, Lintao Wang, Aoran Wang, Xinzhu Ma, Shixiang Tang, Yizhou Wang, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) The University of Sydney(悉尼大学) Beihang University(北航)

AI总结 提出S3MEM框架,通过结构化场景-事件记忆和锚点敏感检索,在长时域交互式问答中实现比通用记忆接口更优的准确率-效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14342 2026-06-09 cs.CV cs.AI 版本更新

AgroOmni: A Large-Scale Multi-view Agricultural Dataset for Cross-Scale Multimodal Reasoning

AgroOmni:一个大规模多视角农业数据集用于跨尺度多模态推理

Jiarui Zhang, Junqi Hu, Zurong Mai, Yang Liu, Yuhang Chen, Shuohong Lou, Henglian Huang, Hong Cheng, Lingyuan Zhao, Jianxi Huang, Yutong Lu, Haohuan Fu, Juepeng Zheng

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出AgroOmni数据集,通过288K视觉问答对覆盖56个专业任务类别,解决多视角跨尺度农业多模态推理中的尺度偏差问题,提出AgroNVILA模型在AgroMind基准上达到62.32%的SOTA成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03106 2026-06-09 cs.CL cs.AI

Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback

Critique-GRPO:通过自然语言和数值反馈提升大语言模型推理能力

Xiaoying Zhang, Yipeng Zhang, Hao Sun, Kaituo Feng, Chaochao Lu, Chao Yang, Helen Meng

机构 * HCCL, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能研究中心,香港,中国) University of Cambridge, Cambridge, United Kingdom(剑桥大学,剑桥,英国) MMLab, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能实验室,香港,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

AI总结 本文提出Critique-GRPO框架,结合自然语言和数值反馈提升LLM推理能力,实验显示其在多个任务中优于传统方法,显著提升推理性能。

Comments Accepted by ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17231 2026-06-09 cs.CL cs.CR 版本更新

Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs

通过从大语言模型到小语言模型的对抗性提示蒸馏实现高效且隐蔽的越狱攻击

Xiang Li, Chong Zhang, Jia Wang, Fangyu Wu, Yushi Li, Xiaobo Jin

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The Chinese University of Hong Kong(香港中文大学) University of Liverpool(利物浦大学)

AI总结 提出对抗性提示蒸馏(APD)框架,将LLM的越狱能力迁移到SLM,实现高效低资源攻击,在GPT-4上达到96.4%攻击成功率,速度提升3.7倍,参数减少11.3倍。

Comments 24 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16584 2026-06-09 cs.SD cs.AI cs.CL cs.MM eess.AS 版本更新

Audio-FLAN: An Instruction-Following Dataset for Unified Audio Understanding and Generation of Speech, Music, and Sound

Audio-FLAN:面向语音、音乐和声音的统一音频理解与生成的指令跟随数据集

Liumeng Xue, Ziya Zhou, Jiahao Pan, Zixuan Li, Shuai Fan, Yinghao Ma, Sitong Cheng, Dongchao Yang, Haohan Guo, Yujia Xiao, Xinsheng Wang, Zixuan Shen, Chuanbo Zhu, Xinshen Zhang, Tianchi Liu, Ruibin Yuan, Zeyue Tian, Haohe Liu, Xingjian Du, Emmanouil Benetos, Ge Zhang, Yike Guo, Wei Xue

机构 * The Hong Kong University of Science(香港科学与技术大学) Inner Mongolia University(内蒙古大学) Beihang University(北京航空航天大学) Queen Mary University of London(伦敦玛丽女王大学) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) University of Surrey(萨里大学) University of Rochester(罗切斯特大学) Independent Researcher(独立研究者)

AI总结 提出Audio-FLAN数据集,包含80种任务和1亿实例,支持统一音频理解与生成的零样本学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21747 2026-06-09 cs.CV 版本更新

MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding

MotionGPT-2:用于运动生成与理解的通用运动-语言模型

Yuan Wang, Di Huang, Yaqi Zhang, Wanli Ouyang, Jile Jiao, Xuetao Feng, Dan Xu, Shixiang Tang

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Intime Department Store(Intime百货) Deepeleph HKUST(香港科技大学)

AI总结 提出MotionGPT-2,一种统一的大规模运动-语言模型,通过预训练大语言模型支持多模态控制条件,实现运动生成、描述和补全等多种任务,并引入Part-Aware VQVAE实现细粒度身体和手部运动表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06795 2026-06-08 eess.AS cs.SD 新提交

BiEAR: A Human Auditory-Inspired Adaptive Binaural Front-end for Multi-Speaker Localisation and Distance Estimation

BiEAR: 一种受人类听觉启发的自适应双耳前端,用于多说话人定位和距离估计

Hanyu Meng, Eliathamby Ambikairajah, Vidhyasaharan Sethu, Qiquan Zhang, Haizhou Li

机构 * The University of New South Wales(新南威尔士大学) Tongyi Speech Lab, Alibaba Group(通义语音实验室,阿里巴巴集团) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳))

AI总结 提出受人类听觉启发的自适应双耳前端BiEAR,通过神经控制器动态调整滤波器组频率选择性,提升多说话人定位和距离估计的准确性与鲁棒性。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07297 2026-06-08 cs.SE cs.CL 新提交

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

SWE-Explore: 基准测试编码智能体如何探索代码仓库

Shaoqiu Zhang, Yuhang Wang, Jialiang Liang, Yuling Shi, Wenhao Zeng, Maoquan Wang, Shilin He, Ningyuan Xu, Siyu Ye, Kai Cai, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出SWE-Explore基准,通过评估编码智能体在给定代码仓库和问题下返回相关代码区域排名列表的能力,衡量其仓库探索性能,覆盖10种编程语言和203个仓库的848个问题。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07030 2026-06-08 cs.SD cs.AI cs.CL cs.LG 新提交

Phonetic Error Analysis of Raw Waveform Acoustic Models

原始波形声学模型的音素错误分析

Erfan Loweimi, Zhengjun Yue, Andrea Carmantini, Zoran Cvetkovic, Steve Renals, Peter Bell

机构 * Centre for Speech Technology Research (CSTR), University of Edinburgh, UK(语音技术研究中心(CSTR),爱丁堡大学,英国) Cisco, UK(思科公司,英国) SLAI & CUHK-SZ, China(SLAI与CUHK-SZ,中国) King's College London, UK(伦敦国王学院,英国)

AI总结 通过分解音素错误率、分析混淆矩阵,发现BLSTM层对过渡依赖类提升最大,WSJ迁移学习对辅音改进约是元音的三倍,且混淆模式反映固有音素相似性。

Comments INTERSPEECH2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07006 2026-06-08 cs.LG cs.CL 新提交

RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning

RASFT: 用于推理的滚动自适应监督微调

Yongliang Miao, Fengyuan Liu, Wei Shi, Yanguang Liu, Fei Sun, Na Zou, Mengnan Du

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) New Jersey Institute of Technology(新泽西理工学院) Institute of Computing Technology, CAS(中国科学院计算技术研究所)

AI总结 提出RASFT框架,通过基于策略rollout的问题级可解性校准专家监督,在模型困难时加强指导、表现可靠时放松模仿并纳入自生成轨迹,同时使用裁剪逆比约束策略漂移,在多个推理基准上优于SFT和RL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06828 2026-06-08 cs.CV cs.LG 新提交

AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO

AdaGRPO: 一种面向基于流的GRPO的能力感知自适应增强方法

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Stanford University(斯坦福大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) CPII under InnoHK(InnoHK下的CPII) Adobe Research(Adobe研究)

AI总结 提出AdaGRPO,通过在线课程过滤策略和跨层级优势融合,解决流模型GRPO中提示选择随机和优势估计缺乏全局视角的问题,提升训练稳定性和性能。

Comments Project Website: https://bujiazi.github.io/adagrpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06559 2026-06-08 cs.SD cs.AI eess.AS 新提交

IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems

IRAF:面向噪声鲁棒的端到端全双工口语对话系统的抗干扰自适应融合

Tao Zhong, Jiajun Deng, Nikita Kuzmin, Yinke Zhu, Tianxiang Cao, Tristan Tsoi, Zhili Tan, Simon Lui, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) AudioLab Hong Kong, Huawei Leibniz Research Center(香港AudioLab,华为Leibniz研究中心) Nanyang Technological University(南洋理工大学)

AI总结 提出IRAF模块,通过逐帧预测可靠性门控来调节用户音频对LLM的贡献,提升全双工对话系统在干扰说话人环境下的响应质量和交互稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05763 2026-06-08 eess.AS cs.SD 版本更新

M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

M2S-AVSR:面向鲁棒视听语音识别的模态感知多视角自监督表示

Fei Su, Cancan Li, Ming Li, Juan Liu

机构 * School of Artificial Intelligence and the School of Computer Science, Wuhan University, China(人工智能学院和计算机科学学院,武汉大学,中国) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(人工智能学院,香港中文大学(深圳),中国) School of Artificial Intelligence, Wuhan University, China(人工智能学院,武汉大学,中国)

AI总结 提出一种模态感知多视角自监督表示框架(M2S-AVSR),通过多视角编码学习视角不变视觉语音表示,并利用模态感知模块进行细粒度融合,以应对视角变化、音频失真和视觉遮挡等挑战,在多个基准上取得最优性能。

Comments submitted to IEEE Transactions on Audio, Speech, and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05761 2026-06-08 cs.AI cs.CL 版本更新

SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents

SubtleMemory: 面向长时程AI智能体的细粒度关系记忆辨别基准

Wenxuan Wang, Haoyu Sun, Fukuan Hou, Mingyang Song, Weinan Zhang, Yu Cheng, Yang Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Xiamen University(厦门大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出SubtleMemory基准,通过构建关系控制的潜在语义伪影并嵌入用户-智能体交互历史,评估长时程AI智能体在后续查询中恢复分布式关系结构的能力。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04874 2026-06-08 cs.CL 版本更新

Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents

Agent规划基准:LLM Agent规划能力的诊断框架

Haoyu Sun, Wenxuan Wang, Mingyang Song, Jujie He, Weinan Zhang, Yang Liu, Yang Yang, Yu Cheng

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) Skywork AI University of California, Santa Cruz(加州大学圣克鲁兹分校) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出Agent规划基准(APB),通过4209个多模态案例和五个设置,诊断LLM Agent在长程规划、工具噪声鲁棒性、校准拒绝和推理时改进方面的系统弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06600 2026-06-08 cs.CL 版本更新

Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video Misinformation

探究多模态大语言模型在中国短视频虚假信息中的认知偏差

Jen-tse Huang, Chang Chen, Shiyang Lai, Wenxuan Wang, Michelle R. Kaufman, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Chinese University of Hong Kong(香港中文大学) University of Chicago(芝加哥大学) Renmin University of China(中国人民大学)

AI总结 本文通过200个短视频数据集评估8种多模态大语言模型在健康领域虚假信息中的表现,发现Gemini-2.5-Pro表现最佳(信念分数71.5/100),而模型易受权威频道ID等社会线索影响。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10832 2026-06-08 cs.CL 版本更新

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents

面向视觉原生多模态深度搜索智能体的在策略数据演化

Shijue Huang, Hangyu Guo, Guanting Dong, Chenxin Li, Junting Lu, Xinyu Geng, Zhaochen Su, Zhenyu Li, Shuang Chen, Hongru Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of Edinburgh(爱丁堡大学)

AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00369 2026-06-08 cs.LG cs.AI 版本更新

InvEvolve: Evolving White-Box Inventory Policies via Large Language Models with Performance Guarantees

InvEvolve:通过具有性能保证的大语言模型进化白盒库存策略

Chenyu Huang, Jianghao Lin, Zhengyang Tang, Bo Jiang, Ruoqing Jiang, Benyou Wang, Lai Wei

机构 * Shanghai University of Finance and Economics(上海财经大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学) Boston College(波士顿大学)

AI总结 提出InvEvolve框架,利用强化学习训练的大语言模型,结合置信区间认证,在线生成具有统计安全保证的白盒库存策略,在合成和真实零售数据上优于经典和深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02029 2026-06-08 cs.AI 版本更新

The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook

潜空间:基础、演化、机制、能力与展望

Xinlei Yu, Zhangquan Chen, Yongbo He, Tianyu Fu, Guanting Dong, Cheng Yang, Chengming Xu, Yue Ma, Xiaobin Hu, Zhe Cao, Jie Xu, Guibin Zhang, Jiale Tao, Jiayi Zhang, Siyuan Ma, Kaituo Feng, Haojie Huang, Youxing Li, Ronghao Chen, Huacan Wang, Chenglin Wu, Zikun Su, Xiaogang Xu, Kelu Yao, Kun Wang, Chen Gao, Yue Liao, Ruqi Huang, Tao Jin, Zhucun Xue, Cheng Tan, Jiangning Zhang, Wenqi Ren, Yanwei Fu, Yong Liu, Yu Wang, Xiangyu Yue, Yu-Gang Jiang, Shuicheng Yan

机构 * National University of Singapore(国立新加坡大学) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学) DeepWisdom(深智科技) Nanjing University(南京大学) Shanghai Jiatong University(上海交通大学) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文深) QuantaAlpha(量子阿尔法) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang Lab(浙江实验室) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学)

AI总结 本文综述潜空间在语言模型中的基础、演化、机制与能力,指出其克服显式空间计算的结构性限制,并展望未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11333 2026-06-08 cs.AI 版本更新

LLM-Augmented Digital Twin for Policy Evaluation in Short-Video Platforms

LLM增强的数字孪生用于短视频平台策略评估

Haoting Zhang, Yunduan Lin, Jinghai He, Denglin Jiang, Zuo-Jun Shen, Zeyu Zheng

机构 * University of California, Berkeley(加州大学伯克利分校) The Chinese University of Hong Kong(香港中文大学) New York University(纽约大学) The University of Hong Kong(香港大学)

AI总结 提出一种LLM增强的四模块数字孪生架构(用户、内容、交互、平台),通过事件驱动执行层和可插拔策略组件,支持在闭环动态下对平台策略(含AI策略)进行可复现的仿真评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01177 2026-06-08 quant-ph cs.IT cs.LG math.IT 版本更新

Privacy Implies Stability: Information-Theoretic Generalization Bounds for Quantum Learning

隐私蕴含稳定性:量子学习的信息论泛化界

Ayanava Dasgupta, Naqueeb Ahmad Warsi, Masahito Hayashi

机构 * Indian Statistical Institute, Kolkata(印度统计研究院,科希玛) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区数据科学学院) International Quantum Academy, Futian District, Shenzhen(深圳未来科技学院) Graduate School of Mathematics, Nagoya University(名古屋大学数学研究生院)

AI总结 提出信息论框架连接量子学习算法的稳定性、隐私与泛化,证明量子差分隐私可直接导出泛化保证,并发现量子非正交性使信息论可容许性与隐私兼容。

Comments 36 pages, 3 figures; The introduction has been substantially rewritten to provide better context, and certain proofs have been relocated from the appendices to the main body of the paper; The core mathematical framework and technical results remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08097 2026-06-08 cs.CL cs.LG 版本更新

AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling

AdaJudge: 自适应多视角评判用于奖励建模

Yongliang Miao, Yangyang Liang, Mengnan Du

机构 * Emory University(埃默里大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出AdaJudge框架,通过门控精化块和自适应多视角池化模块,联合优化表示与聚合,解决奖励建模中静态归纳偏差和表示不匹配问题,在RM-Bench和JudgeBench上超越现有模型。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01362 2026-06-08 cs.LG 版本更新

Directed evolution algorithm drives neural prediction

定向进化算法驱动神经预测

Yanlin Wang, Nancy M Young, Patrick C M Wong

机构 * Brain and Mind institute, The Chinese University of Hong Kong(脑科学与智能技术研究所,香港中文大学) Department of Linguistics and Modern Languages, The Chinese University of Hong Kong(语言学与现代语言系,香港中文大学) Division of Otolaryngology, Ann & Robert H. Lurie Children's Hospital of Chicago(芝加哥安·罗伯特·H·卢里儿童医院耳鼻喉科) Department of Otolaryngology Head & Neck Surgery, Feinberg School of Medicine, Northwestern University(费因伯格医学院耳鼻喉科与头颈外科部,西北大学) Knowles Hearing Center, Department of Communication Sciences and Disorders, Northwestern University(诺里斯听力中心,西北大学沟通科学与障碍系)

AI总结 提出定向进化模型(DEM),模拟生物定向进化试错过程,结合回放缓冲和连续反向传播,在跨域神经预测中提升泛化能力并解决标签稀缺问题。

Comments 43 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06470 2026-06-05 cs.LG cs.AI

PC Layer: Polynomial Weight Preconditioning for Improving LLM Pre-Training

PC层:通过多项式权重预处理改进大语言模型预训练

Senmiao Wang, Tiantian Fang, Haoran Zhang, Yushun Zhang, Kunxiang Zhao, Alex Schwing, Ruoyu Sun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Google LLC(谷歌公司) Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出一种多项式预条件子权重参数化方法(PC层),通过低阶多项式预条件重塑权重矩阵奇异值谱,确保LLM训练中权重条件稳定,且训练后无推理开销,在Llama-1B预训练中优于标准Transformer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06462 2026-06-05 cs.AI

Benchmark Everything Everywhere All at Once

无处不在的基准测试

Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(中大香港实验室) CPII under InnoHK(创新香港 CPII) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Shandong University(山东大学) Huawei Technologies(华为技术)

AI总结 提出Benchmark Agent,一个全自主智能体系统,自动化基准构建流程,以解决现有基准构建劳动密集、难以复用和性能饱和的问题。

Comments Project page: https://benchmarkagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06390 2026-06-05 cs.CV cs.AI

HomeWorld: A Unified Floorplan-to-Furnished Framework for Generating Controllable, Densely Interactive Whole-Home Scenes

HomeWorld:一个统一的从平面图到家具的框架,用于生成可控、密集交互的全屋场景

Wenbo Li, Xiaoliang Ju, Zipeng Qin, Rongyao Fang, Hongsheng Li

机构 * Ace Robotics(Ace机器人公司) CUHK MMLab(香港大学多模态实验室) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出一个统一的分层框架,通过大规模真实平面图数据集训练大语言模型生成全屋平面图,结合图像生成模型和VLM优化器生成家具及小物体布局,并附加物理属性和纹理光照,实现可控、高真实感的全屋场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06342 2026-06-05 stat.ML cs.LG

Symmetric Divergence and Normalized Similarity: A Unified Topological Framework for Representation Analysis

对称散度与归一化相似性:表示分析的统一拓扑框架

Yan Wang, Tianyang Hu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

AI总结 提出对称表示拓扑散度(SRTD)和归一化拓扑相似性(NTS),分别解决现有拓扑散度的非对称性和无界性问题,实现细粒度结构诊断与跨场景标准化评估。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06186 2026-06-05 cs.CV

Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models

对抗攻击已揭示答案:面向视觉语言模型的定向偏差引导测试时防御

Liangsheng Liu, Si Chen, Jiamin Wu, Weiwei Feng, Zhixin Cheng, Xiaotian Yin, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 提出定向偏差引导防御(DBD),利用对抗样本在CLIP特征空间中沿主导方向偏移的现象,通过估计防御方向并采用DB分数双流重建策略恢复鲁棒表示,在15个数据集上实现最先进对抗鲁棒性且保持干净准确率。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06155 2026-06-05 cs.RO cs.CV cs.MM

AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding

AffordanceVLA:一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型

Qize Yu, Jiadi You, Yuran Wang, Jiaqi Liang, Bowen Ping, Yang Tian, Yue Chen, Minghong Cai, Zeying Gong, Ruihai Wu, Yinchuan Li, Junwei Liang, Yingcong Chen

机构 * Peking University(北京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Knowin AI

AI总结 提出AffordanceVLA框架,通过引入结构化可供性预测作为任务导向的中间表示,解决VLA模型中语义空间与具身控制策略的结构不匹配问题,实现精确的感知-动作映射。

Comments Preprint. Code and project page are available. Code: https://github.com/Skywalker-yqz/AffordanceVLA Project page: https://skywalker-yqz.github.io/AffordanceVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏