arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 208
2605.20266 2026-08-04 cs.SD 版本更新

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

大型音频语言模型综述:通用性、可信度与展望

Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) The University of Melbourne(墨尔本大学) North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Fortemedia Singapore(富媒体新加坡) Tencent(腾讯) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese University of Hong Kong(香港中文大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18183 2026-08-04 cs.LG cs.GT 版本更新

NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria

NashPG: 一种通过迭代细化正则化寻找纳什均衡的策略梯度方法

Eason Yu, Tzu Hao Liu, Clément L. Canonne, Yunke Wang, Chang Xu, Nguyen H. Tran, Stefano V. Albrecht

机构 * University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出NashPG算法,通过在策略优化目标中直接引入正则化,解决了多智能体强化学习中两玩家零和不完全信息游戏寻找纳什均衡的挑战,实现了在经典基准游戏和大型领域中的高效收敛与高收益。

Comments Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05842 2026-08-04 cs.RO 版本更新

Expert Knowledge-driven Reinforcement Learning for Autonomous Racing via Trajectory Guidance and Dynamics Constraints

专家知识驱动的强化学习用于自动驾驶赛车:通过轨迹引导和动力学约束

Bo Leng, Weiqi Zhang, Zhuoren Li, Lu Xiong, Guizhe Jin, Ran Yu, Chen Lv

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院)

AI总结 本文提出TraD-RL方法,通过轨迹引导和动力学约束强化学习,提升自动驾驶赛车的性能与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21996 2026-08-04 stat.ML cs.LG 版本更新

A Semiparametric Discrete Hawkes Model with a Collapsed Gaussian-Process Prior

具有坍缩高斯过程先验的非参数离散Hawkes模型

Trinnhallen Brisley, Gordon Ross, Daniel Paulin

机构 * University of Edinburgh(爱丁堡大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出GP-DHP模型,通过高斯过程先验实现离散时间Hawkes过程的非参数化处理,提升预测性能并保持可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20635 2026-08-04 cs.CV 版本更新

iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation

iMontage:统一、多功能、高度动态的多对多图像生成

Zhoujie Fu, Xianfang Zeng, Jinghong Lan, Xinyao Liao, Cheng Chen, Junyi Chen, Jiacheng Wei, Wei Cheng, Shiyu Liu, Yunuo Chen, Gang Yu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) StepFun Shanghai Jiao Tong University(上海交通大学)

AI总结 iMontage通过整合视频模型的先验知识与图像数据的多样性,实现了统一、多功能且动态的多对多图像生成。

Comments Our homepage: https://kr1sjfu.github.io/iMontage-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19849 2026-08-04 cs.AI cs.LG 版本更新

Near-Optimal Reinforcement Learning for Constrained Recurrence Objectives

具有$ω$-正则目标和约束的强化学习

Dominik Wagner, Leon Witzman, Luke Ong

机构 * NTU Singapore(南洋理工大学)

AI总结 本文提出了一种结合$ω$-正则目标与约束的强化学习算法,以解决安全性和性能之间的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21296 2026-08-04 cs.LG cs.AI 版本更新

Fairness in Augmented Graph Learning: A Survey

增强图学习中的公平性:一项综述

Renqiang Luo, Huafei Huang, Ziqi Xu, Xikun Zhang, Enyan Dai, Bo Yang, Feng Xia

机构 * Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) Nanyang Technological University(南洋理工大学) Dalian University of Technology(大连理工大学) University of South Australia(澳大利亚南澳大利亚大学) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本综述针对增强图学习(AGL)的新型交叉公平挑战,系统研究其FairGX范式,梳理偏差源与分类法,分析ML范式对公平性的影响,明确未来研究方向,为构建稳健公平图系统提供路线图。

Comments Accepted in TKDE, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16870 2026-08-03 cs.CV cs.AI 版本更新

Demystifying Video Reasoning

揭秘视频推理

Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hokin Deng, Dahua Lin, Ziwei Liu, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过实验揭示视频扩散模型中的推理主要发生在去噪步骤中,提出链式步骤(CoS)机制,并发现工作记忆、自我修正和感知先行等涌现行为,最后提出一种无需训练的集成策略来提升推理能力。

Comments Homepage: https://www.wruisi.com/demystifying_video_reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18660 2026-08-03 cs.CV 版本更新

So-Fake: Benchmarking and Explaining Social Media Image Forgery Detection

So-Fake:社交媒体图像伪造检测的基准构建与可解释性研究

Zhenglin Huang, Xiangtai Li, Xi Yang, Bei Peng, Xiaowei Huang, Baoyuan Wu, Dacheng Tao, Ming-Hsuan Yang, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Sheffield(谢菲尔德大学)

AI总结 该研究针对社交媒体图像伪造检测的数据集与基准缺口,构建了So-Fake-Set数据集与So-Fake-OOD分布外基准,提出采用强化学习的So-Fake-R1框架,其检测准确率与定位IoU均优于现有方法,为相关研究提供了新基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22932 2026-07-31 cs.LG 版本更新

FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

FORGE: 融合寄存器梯度消除以实现内存高效的大语言模型训练

Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria, Timothy Liu, Aik Beng Ng, Simon See, Bapi Chatterjee

机构 * Puch AI Singapore Institute of Technology(新加坡理工大学) Nanyang Technological University(南洋理工大学) NVIDIA(英伟达) IIIT-Delhi(德里印度理工学院)

AI总结 提出FORGE方法,将优化器步骤融合到反向传播中,逐块在寄存器中应用,消除梯度张量,减少内存占用并加速训练,在微调和持续预训练中速度提升约1.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10396 2026-07-31 cs.AI 版本更新

Verbalizing LLM's Higher-order Uncertainty via Imprecise Probabilities

通过不精确概率实现LLM的高阶不确定性 verbalizing

Anita Yang, Krikamol Muandet, Michele Caprio, Siu Lun Chau, Masaki Adachi

机构 * Lattice Lab Toyota Motor Corporation(丰田汽车公司) Department of Computer Science(计算机科学系) University of Tokyo(东京大学) Rational Intelligence Lab(理性智能实验室) CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) University of Manchester(曼彻斯特大学) Manchester Centre for AI Fundamentals(曼彻斯特人工智能基础中心) EPIC Lab(EPIC实验室) College of Computing & Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

AI总结 本文提出基于不精确概率的新型提示方法,用于更准确地提取LLM的高阶不确定性,以提升其不确定性和决策支持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15684 2026-07-30 cs.CR cs.AI 版本更新

State-Dependent Safety Failures in Multi-Turn Language Model Interaction

多轮语言模型交互中的状态依赖性安全故障

Pengcheng Li, Jie Zhang, Tianwei Zhang, Han Qiu, Zhang kejun, Weiming Zhang, Nenghai Yu, Wenbo Zhou

机构 * School of Cyber Science and Technology, University of Science and Technology of China, China(中国科学技术大学信息科学与技术学院) Nanyang Technological University, Singapore(南洋理工大学) Tsinghua University, Beijing, China(清华大学) Beijing Electronic Science and Technology Institute, Beijing, China(北京电子科技研究所)

AI总结 本文从状态空间视角研究多轮交互中的安全故障,提出STAR框架分析对话历史作为状态转移操作,揭示对齐模型在多轮交互中安全边界穿越的机制。

Comments 9 pages, accepted at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04641 2026-07-30 cs.CR cs.CL cs.LG 版本更新

DP-MGTD: Privacy-Preserving Machine-Generated Text Detection via Adaptive Differentially Private Entity Sanitization

DP-MGTD:通过自适应差分隐私实体净化实现隐私保护的机器生成文本检测

Lionel Z. Wang, Yusheng Zhao, Jiabin Luo, Xinfeng Li, Lixu Wang, Yinan Peng, Haoyang Li, XiaoFeng Wang, Wei Dong

机构 * Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Hengxin Tech(恒心科技)

AI总结 DP-MGTD通过自适应差分隐私实体净化技术,在保障隐私的前提下实现对机器生成文本的高精度检测。

Comments This article is unable to reproduce the experimental results, and we no longer have confidence in the main conclusion of this article

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01043 2026-07-30 cs.LG cs.AI 版本更新

Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities

大语言模型的低精度训练:方法、挑战与机遇

Zhiwei Hao, Jianyuan Guo, Li Shen, Yong Luo, Han Hu, Guoxia Wang, Dianhai Yu, Yonggang Wen, Dacheng Tao

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(网络科学与技术学院,中山大学深圳校区) School of Computer Science, Wuhan University(计算机科学学院,武汉大学) Baidu Inc.(百度公司) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

AI总结 本综述全面梳理大语言模型低精度训练方法,按数值格式分类并探讨相关挑战、鲁棒性及研究方向,助力统一该领域研究视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24016 2026-07-29 cs.CV 版本更新

DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models

DailyBench:用于评估现代生成模型生成和处理的人工智能图像的统一基准

Xin Jiang, Hao Tang, Junyao Gao, Meiqi Cao, Fei Shen, Dongming Zhang, Yongdong Zhang

机构 * People’s Daily Online(人民网) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 研究针对现有生成模型图像检测基准与现实差距问题,提出统一基准DailyBench,含FakeBench和ManipulationBench两个子集,通过实验揭示当前检测器鲁棒性差,凸显其可用于开发更强大的人工智能生成图像检测方法。

Comments Some errors must be corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27351 2026-07-29 cs.CV 版本更新

Feedforward 3D Editing Learns from Semantic-Part Transformation

前馈3D编辑从语义部分变换中学习

Jiawei Weng, Saining Zhang, Zhenxin Diao, Peishuo Li, Henghaofan Zhang, Junhao Chen, Hao Zhao

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

AI总结 提出Pxform数据集和PartFlow网络,通过语义部分变换实现高质量前馈3D编辑,在几何和外观编辑基准上达到最优性能。

Comments 31 pages, 22 figures. Project Page: https://dennis-jwweng.github.io/pxform/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18379 2026-07-29 cs.LG eess.SP physics.geo-ph physics.space-ph 版本更新

Forecasting Ionospheric Irregularities on GNSS Lines of Sight Using Dynamic Graphs with Ephemeris Conditioning

利用动态图与轨道数据条件化预测GNSS视线上电离层不规则性

Mert Can Turkmen, Eng Leong Tan, Yee Hui Lee

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文提出利用动态图和轨道数据条件化预测GNSS视线上电离层不规则性,通过构建动态图结构提升预测精度,实验结果显示模型在BSS和PR-AUC指标上均优于传统方法。

Comments 17 pages, 8 figures, submitted to IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11976 2026-07-28 cs.LG 版本更新

LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention

LiteTopK:利用维度诅咒设计长上下文稀疏注意力中的融合索引器 - TopK 内核

Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao Cong

机构 * Nanyang Technological University(南洋理工大学) ETH Zurich(苏黎世联邦理工学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究针对现有 GPU 索引器 - TopK 内核效率低的问题,利用维度诅咒设计 LITETOPK 内核,通过采样估计得分范围划分候选结果桶,降低内存开销,在实际部署中加速 GLM 5.2 预填充阶段,提升了效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13385 2026-07-28 cs.CR cs.AI cs.CY cs.HC cs.MM 版本更新

Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试

Zihao Wang, Yiming Li, Yutong Wu, Kangjie Chen, Zheyu Liu, Fok Kar Wai, Pin-Yu Chen, Vrizlynn L. L. Thing, Bo Li, Dacheng Tao, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ST Engineering, Singapore(ST工程,新加坡) IBM Research, USA(IBM研究院,美国) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)

AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24411 2026-07-28 cs.AI cs.CL cs.CV cs.HC 版本更新

OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows

OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理

Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。

Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12940 2026-07-28 cs.CV 版本更新

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

循环自回归扩散:全局记忆与局部注意力相结合

Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

机构 * Peking University(北京大学) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学)

AI总结 研究针对超长视频生成中现有模型的不足,提出循环自回归扩散(RAD)框架,结合循环块与局部注意力,解决训练推理差距等问题,在相关数据集实验中展现出长视频生成的优越性。

Comments Published at ECCV 2026. Project page: https://yeyutaihan.github.io/recurrent-autoregressive-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16170 2026-07-28 cs.IR cs.AI 版本更新

EGRA:Toward Enhanced Behavior Graphs and Representation Alignment for Multimodal Recommendation

EGRA:迈向用于多模态推荐的增强行为图和表示对齐

Xiaoxiong Zhang, Xin Zhou, Zhiwei Zeng, Yongjie Wang, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

AI总结 针对多模态推荐现有方法不足,EGRA通过纳入预训练模型生成表示构建的项-项图减轻稀疏性,引入双层动态对齐加权机制提升模态-行为表示对齐,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13335 2026-07-28 cs.CV 版本更新

Deblur-Avatar: Animatable Avatars from Motion-Blurred Monocular Videos

Deblur-Avatar:从运动模糊单目视频生成可动画化头像

Xianrui Luo, Juewen Peng, Zhongang Cai, Lei Yang, Fan Yang, Zhiguo Cao, Guosheng Lin

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) S-Lab for Advanced Intelligence, Nanyang Technological University(南洋理工大学先进智能实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) SenseTime Research(商汤科技研究院)

AI总结 该研究针对运动模糊单目视频输入,提出将基于人类运动的运动模糊模型集成到3D高斯平铺的框架,通过优化轨迹和高斯分布重建高质量可动画化头像,实验证明其在渲染质量等方面显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17770 2026-07-27 cs.AI cs.CL 版本更新

Entropy-Gradient Inversion: Moving Toward Internal Mechanism of Large Reasoning Models

熵梯度反转:迈向大型推理模型的内部机制

Junyao Yang, Chen Qian, Kun Wang, Linfeng Zhang, Quanshi Zhang, Yong Liu, Dongrui Liu

机构 * National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

AI总结 本文发现大型推理模型中令牌熵与logit梯度之间的稳健负相关(熵梯度反转),并提出相关性正则化组策略优化(CorR-PO)将其嵌入强化学习奖励正则化,从而提升推理性能。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01006 2026-07-27 cs.CL cs.CY 版本更新

Can AI Debias the News? LLM Interventions Improve Cross-Partisan Receptivity but LLMs Overestimate Their Own Effectiveness

AI能否去偏新闻?LLM干预提升了跨党派接受度但LLM高估了自身效果

Faisal Feroz, Jonas R. Kunst

机构 * Department of Experimental Psychology, University of Oxford(心理学实验系,牛津大学) Uehiro Oxford Institute, University of Oxford(牛津大学欧胡罗研究所) Psychology Programme, School of Social Sciences, Nanyang Technological University(南洋理工大学社会科学学院心理学项目) Department of Communication and Culture, BI Norwegian Business School(BI挪威商学院传播与文化系)

AI总结 研究探讨LLM对新闻去偏的影响,发现实质性重构干预提升保守派对左派新闻的信任度,但LLM高估自身效果,需人类监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06064 2026-07-27 cs.CV 版本更新

PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers

PersonaGesture: 单参考共语手势个性化用于未见说话人

Xiangyue Zhang, Yiyi Cai, Kunhang Li, Kaixing Yang, You Zhou, Zhengqing Li, Xuangeng Chu, Jiaxu Zhang, Haiyang Liu

机构 * The University of Tokyo(东京大学) Shanda AI Research Tokyo(Shanda AI东京研究所) Nanyang Technological University(南洋理工大学) Renmin University(中国人民大学)

AI总结 本文提出PersonaGesture,一种基于扩散的管道,用于未见说话人的单参考共语手势个性化。通过编码参考视频并分离身份证据与残差统计修正,提升未见说话人的个性化效果。

Comments Needs to be improved

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07025 2026-07-27 cs.CL 版本更新

Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision

面向多语言指令遵循语音大语言模型的语言感知蒸馏:仅使用ASR监督

Shreyas Gopal, Donghang Wu, Ashutosh Anshul, Yeo Yue Heng, Yizhou Peng, Haoyang Li, Hexin Liu, Eng Siong Chng

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) AI Singapore(AI新加坡) National University of Singapore(新加坡国立大学) Institute for Infocomm Research (I$^2$R)(信息通信研究所) A$^{*}$STAR(A*星)

AI总结 本文提出一种语言感知蒸馏方法,通过查询库和门控网络提升多语言指令遵循语音大语言模型的性能,实现在Audio-MLQA基准上比现有基线提升32%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12311 2026-07-27 cs.NI cs.CR cs.HC cs.LG 版本更新

Cross-reality location privacy protection in 6G-enabled vehicular metaverses: an LLM-enhanced hybrid generative diffusion model-based approach

6G赋能车联网元宇宙中的跨现实位置隐私保护:一种基于LLM增强混合生成扩散模型的方法

Xiaofeng Luo, Jiayi He, Jiawen Kang, Ruichen Zhang, Zhaoshui He, Ekram Hossain, Dong In Kim

机构 * School of Automation, Guangdong University of Technology(自动化学院,广东技术大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) Department of Electrical and Computer Engineering, University of Manitoba(电气与计算机工程系,曼尼托巴大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(电气与计算机工程系,成均馆大学)

AI总结 本文提出了一种基于LLM增强混合生成扩散模型的方法,用于6G赋能车联网元宇宙中的跨现实位置隐私保护,通过混合动作优化平衡隐私保护、延迟降低和服务质量维护。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20321 2026-07-24 physics.flu-dyn cs.LG 版本更新

Label-Free Finite-Volume-Residual Training of Attention Graph Neural Networks for Coupled Thermo-Fluid Fields

用于耦合热流体场的注意力图神经网络的无标签有限体积残差训练

Tianyu Li, Zhiwei Cao, Qingang Zhang, Ruihang Wang, Binyang Song, Yonggang Wen

机构 * Interdisciplinary Graduate Programme(交叉学科研究生项目) Nanyang Technological University(南洋理工大学) School of Future Technology(未来技术学院) Fuzhou University(福州大学) College of Computing and Data Science(计算与数据科学学院) Yunnan University(云南大学) School of Mechanical and Aerospace Engineering(机械与航空航天工程学院)

AI总结 研究针对耦合热流体场预测,提出通过最小化FVM残差训练注意力图神经网络的方法,无需标记数据。经四种情况评估,该方法在稳态基准上nRMSE达2.3-2.8%,在瞬态情况中准确性超监督基线且免数据生成成本,降低了模型开发成本。

Comments 51 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏