arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-04-10 至 2026-04-10 共收录 10
2604.08363 2026-04-10 cs.SD

CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation

CapTalk:单语句和对话语音生成的统一语音设计

Xiaosu Su, Zihan Sun, Peilei Jia, Jun Gao

机构 * University of Chinese Academy of Sciences(中国科学院大学) Hello Group Inc.

AI总结 CapTalk提出一种统一的文本-音频自回归框架,实现单语句和对话语音设计,通过分层变分条件模块平衡语音稳定性和上下文适应性,提升表达可控性和上下文恰当性。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08147 2026-04-10 cs.SD cs.CV

Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning

通过教师引导的双路径实现语义噪声削减

Linge Wang, Yingying Chen, Bingke Zhu, Lu Zhou, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Objecteye Inc.(北京眼神科技有限公司)

AI总结 本文提出TG-DP框架,通过分离重建与对齐路径,减少语义噪声,提升音频视频表示学习效果,实现零样本检索性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08088 2026-04-10 cs.CV

Coordinate-Based Dual-Constrained Autoregressive Motion Generation

基于坐标双约束的自回归运动生成

Kang Ding, Hongsong Wang, Jie Gui, Liang Wang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) School of Computer Science and Engineering, Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, Southeast University(东南大学计算机科学与工程学院、教育部新一代人工智能技术及其跨学科应用重点实验室) Purple Mountain Laboratories(紫金山实验室) Engineering Research Center of Blockchain Application, Supervision And Management (Southeast University), Ministry of Education(教育部区块链应用监管工程研究中心(东南大学)) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统全国重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出CDAMD框架,通过坐标输入和双约束因果掩码提升文本到运动的生成质量与语义一致性。

Comments Code is available at: https://github.com/fly-dk/CDAMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07728 2026-04-10 cs.CV cs.GR cs.RO

GEAR: GEometry-motion Alternating Refinement for Articulated Object Modeling with Gaussian Splatting

GEAR: 基于高斯点划法的几何-运动交替优化用于关节物体建模

Jialin Li, Bin Fu, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS(中国科学院人工智能安全重点实验室,中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 GEAR通过交替优化几何与运动,提升关节物体重建的精度和泛化能力,尤其在复杂多关节物体上表现优异。

Comments Accepted to CVPRF2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07664 2026-04-10 cs.CV eess.IV

Monocular Depth Estimation From the Perspective of Feature Restoration: A Diffusion Enhanced Depth Restoration Approach

单目深度估计:从特征修复的角度出发:一种扩散增强的深度修复方法

Huibin Bai, Shuai Li, Hanxiao Zhai, Yanbo Gao, Chong Lv, Yibo Wang, Haipeng Ping, Wei Hua, Xingyu Gao

机构 * School of Software, Shandong University(山东大学软件学院) Shandong University-WeiHai Research Institute of Industrial Technology(山东大学威海工业技术研究院) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) Shandong Institute of Information Technology Industry Development(山东省信息技术产业发展研究院) Research Institute of Interdisciplinary Innovation, Zhejiang Lab(之江实验室交叉创新研究院) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文从特征修复角度提出扩散增强深度修复方法,通过改进编码器特征提升深度估计性能,在KITTI基准上取得显著提升。

Comments Accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06950 2026-04-10 cs.CV

Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation

让 MLLMs 失明:MLLM 内容审核中的对抗走私攻击

Zhiheng Li, Zongyang Ma, Yuntong Pan, Ziqi Zhang, Xiaolei Lv, Bo Li, Jun Gao, Jianing Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京市多模态信息超智能安全重点实验室) Hellogroup University of Washington(华盛顿大学) Jilin University(吉林大学) ShanghaiTech University(上海科技大学)

AI总结 本文揭示了MLLM在内容审核中面临的新威胁——对抗走私攻击,通过SmuggleBench基准测试发现多种模型易受攻击,提出通过感知和推理角度分析其根本原因并探索缓解策略。

Comments Accepted to ACL 2026. 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06747 2026-04-10 cs.AI

TurboAgent: An LLM-Driven Autonomous Multi-Agent Framework for Turbomachinery Aerodynamic Design

TurboAgent:一种基于大语言模型的自主多智能体框架用于涡轮机械气动设计

Juan Du, Yueteng Wu, Pan Zhao, Yuze Liu, Min Zhang, Xiaobin Xu, Xinglong Zhang

机构 * Digital Twin Research Center, Institute of Engineering Thermophysics, Chinese Academy of Sciences(中国科学院工程热物理研究所数字孪生研究中心) National Key Laboratory of Science and Technology on Advanced Light-duty Gas-Turbine, Chinese Academy of Sciences(中国科学院先进轻型燃气轮机科学与技术国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学)

AI总结 本文提出TurboAgent框架,通过大语言模型实现涡轮机械气动设计的端到端自主设计,结合生成设计、性能预测、多目标优化和物理验证,实现数据驱动的协作流程,提升设计效率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04666 2026-04-10 cs.AI cs.CR

Know Thy Enemy: Securing LLMs Against Prompt Injection via Diverse Data Synthesis and Instruction-Level Chain-of-Thought Learning

知彼者智:通过多样化数据合成和指令级推理学习增强大语言模型抗提示注入能力

Zhiyuan Chang, Mingyang Li, Yuekai Huang, Ziyou Jiang, Xiaojun Jia, Qian Xiong, Junjie Wang, Zhaoyang Li, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory, Institute of Software Chinese Academy of Sciences(中国科学院软件研究所综合信息系统技术国家级重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Beijing Forestry University(北京林业大学)

AI总结 本文提出InstruCoT方法,通过多样化数据合成和指令级推理学习提升大语言模型对提示注入攻击的防御能力,实验表明其在行为偏差、隐私泄露和有害输出方面显著优于基线方法。

Comments 19 pages, 6 figures; accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11548 2026-04-10 cs.CR cs.AI

One Shot Dominance: Knowledge Poisoning Attack on Retrieval-Augmented Generation Systems

单文档支配:面向检索增强生成系统的知识污染攻击

Zhiyuan Chang, Mingyang Li, Xiaojun Jia, Junjie Wang, Yuekai Huang, Ziyou Jiang, Yang Liu, Qing Wang

机构 * State Key Laboratory of Intelligent Game(智能游戏国家重点实验室) Science and Technology on Integrated Information System Laboratory, Institute of Software Chinese Academy of Sciences(中国科学院软件研究所综合信息系统技术国家级重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出AuthChain攻击方法,通过单文档污染实现对检索增强生成系统更有效的知识污染攻击,提升攻击成功率并保持隐蔽性。

Comments 15pages, 4 figures; accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20718 2026-04-10 cs.CV cs.AI

MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models

MM-MoralBench: 一种多模态道德评估基准用于大型视觉-语言模型

Bei Yan, Jie Zhang, Zhiyuan Chen, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences(中国科学院大学)

AI总结 为评估大型视觉-语言模型的道德对齐性,提出MM-MoralBench基准,通过多模态场景测试模型在六个道德基础上的判断与分类能力,揭示模型存在显著的道德偏见问题。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏