arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-06-25 至 2026-06-25 共收录 12
2606.25959 2026-06-25 eess.AS cs.AI 交叉投稿

SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios

SE-AGCNet:面向会议场景的联合语音增强与响度控制端到端框架

Jinming Zhang, Wei Rao, Xionghu Zhong, Eng Siong Chng

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Hunan University(湖南大学)

AI总结 提出SE-AGCNet端到端框架,联合优化语音增强和自动增益控制,通过协同作用保留低音量语音并实现目标响度,在会议场景中提升语音质量和ASR准确率。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25706 2026-06-25 cs.RO 新提交

Learning Asynchronous Upper-body Task-space Trajectory Tracking Policy for Humanoid Robots

学习人形机器人异步上肢任务空间轨迹跟踪策略

Yumeng Liu, Dongqi Wang, Jiyu Yu, Yijun Fan, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学)

AI总结 针对规划与执行间的异步问题,提出异步上肢任务空间跟踪框架,通过教师-学生蒸馏初始化策略,结合滑动窗口全局奖励减少帧漂移,并利用MPC模块和自引导约束实现稀疏参考跟踪,仿真与硬件实验验证了低更新率下的优越性能。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25546 2026-06-25 cs.CV 新提交

Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography

面向3D计算机断层扫描的疾病中心视觉语言预训练与混合视觉编码

Bowen Shi, Weiwei Cao, Ruifeng Yuan, Wanxing Chang, Wenrui Dai, Hongkai Xiong, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab, 310023, Hangzhou, China(虎扑实验室,杭州,中国) Shanghai Jiao Tong University, China(上海交通大学,中国) Zhejiang University, China(浙江大学,中国) Fudan University, China(复旦大学,中国)

AI总结 提出一种结合CNN-ViT混合编码器、疾病级对比学习和诊断感知提示的视觉语言预训练框架,在CT-RATE和Rad-ChestCT上取得最优性能,并提升零样本诊断可靠性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25503 2026-06-25 cs.RO cs.CV 新提交

AISPO: Enhancing Depth Reliability for Robotic Manipulation of Non-Lambertian Objects via Affine-Invariant Shape Prior

AISPO: 通过仿射不变形状先验增强非朗伯体物体机器人操作的深度可靠性

Zhiming Chen, Linfang Zheng, Kun Zhang, Hyung Jin Chang, Wei Zhang, Hongyu Yu, Hua Chen

机构 * The Hong Kong University of Science & Technology(香港科技大学) The University of Hong Kong(香港大学) Southern University of Science & Technology(南方科技大学) Zhejiang University(浙江大学) LimX Dynamics

AI总结 提出AISPO深度补全框架,结合多尺度RGB-D特征融合与仿射不变形状先验,提升非朗伯体物体(如透明、高反光表面)的深度可靠性,显著提高机器人抓取成功率。

Comments Published in IEEE Robotics and Automation Letters. 8 pages. Accepted April 2026

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 7996-8003, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25497 2026-06-25 cs.RO 新提交

SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation

SAGE-Nav:利用LLM规划与对齐融合的分层场景图引导导航

Hao Su, Yuehao Huang, Yukai Ma, Yong Liu, Jiajun Lv

机构 * Zhejiang University(浙江大学)

AI总结 提出SAGE-Nav分层框架,结合大语言模型与动态场景图,通过解耦全局语义规划与高频反应控制,实现高效目标导航,在i-THOR和RoboTHOR中达到最优性能。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25278 2026-06-25 cs.CV cs.AI 新提交

Heterogeneous and Adept Snapshot Distillation for 3D Semantic Segmentation

异构与专长快照蒸馏用于3D语义分割

Xiaopei Wu, Yuenan Hou, Junkai Xu, Wenxiao Wang, Binbin Lin, Yu Li, Ping Li, Haifeng Liu, Deng Cai, Wanli Ouyang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 提出异构和专长快照知识蒸馏(HAS-KD),通过信息导向异构蒸馏(IHD)和专长快照蒸馏(ASD)将多模态模型和多个模型专家的知识高效迁移到点云网络,在ScanNetV2和S3DIS上取得最先进结果。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24958 2026-06-25 cs.LG cs.RO math.DS 新提交

Swarm-Inspired Generation of Collective Behaviors in Graph Dynamical Systems

图动力系统中集体行为的群智能启发生成

Ji Chen, Song Chen, Chengzhang Gong, Li Fan, Chao Xu

机构 * Zhejiang University(浙江大学) Huzhou Institute of Zhejiang University(浙江大学湖州研究院) National University of Singapore(新加坡国立大学)

AI总结 提出SIES框架,结合显式动力学与局部智能体,学习可泛化的局部交互规则,实现图上的可控同步控制与异配图表示学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24140 2026-06-25 cs.LG 新提交

A Time-Reparameterized Cumulative Intensity Extrapolation Sampler for Discrete Flow Matching

时间重参数化累积强度外推采样器用于离散流匹配

Feiyang Fu, Hehe Fan

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(计算机科学与技术学院,浙江大学,杭州,中国)

AI总结 提出时间重参数化累积强度外推(TR-CIE)采样器,通过时间重参数化和累积强度外推更新规则,在有限函数评估次数下提升离散流匹配的采样质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07512 2026-06-25 cs.CV cs.AI cs.CL 新提交

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

MemDreamer: 通过分层图记忆和智能体检索机制解耦感知与推理以实现长视频理解

Cong Chen, Guo Gan, Kaixiang Ji, ZhaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua Shen

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

AI总结 提出MemDreamer框架,通过分层图记忆和智能体检索机制解耦感知与推理,将长视频理解转化为智能体探索过程,在四个基准上达到SOTA,推理上下文窗口仅占全量2%且准确率提升12.5点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20183 2026-06-25 cs.CV 版本更新

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

MSAVBench:面向多镜头音频-视频生成的全面可靠评估

Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing, Ruihang Chu, Lingyi Hong, Yefei He, Junjie Zhou, Junqiu Yu, Yang Shi, Difan Zou, Kai Zhu, Shiwei Zhang, Yingya Zhang, Yu Liu, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 提出首个多镜头音频-视频生成基准MSAVBench,通过自适应混合评估框架在四个维度上系统评估19个模型,发现当前系统在导演级控制和细粒度音视频同步上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19297 2026-06-25 cs.CV 版本更新

VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction

VolSplat: 重新思考基于体素对齐预测的前馈式3D高斯泼溅

Weijie Wang, Yeqing Chen, Zeyu Zhang, Hengyu Liu, Haoxiao Wang, Zhiyuan Feng, Wenkang Qin, Feng Chen, Jia-Wang Bian, Zheng Zhu, Donny Y. Chen, Bohan Zhuang

机构 * Zhejiang University(浙江大学) GigaAI University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) The University of Adelaide(阿德莱德大学) Nanyang Technological University(南洋理工大学) Monash University(莫纳什大学)

AI总结 针对前馈式3D高斯泼溅中像素对齐预测的局限性,提出体素对齐的VolSplat方法,通过从预测的3D体素网格直接预测高斯,实现鲁棒的多视图一致性和更优的几何与渲染质量。

Comments ECCV 2026, Project Page: https://lhmd.top/volsplat, Code: https://github.com/ziplab/VolSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11606 2026-06-25 cs.CV 版本更新

Articulat3D: Reconstructing Articulated Digital Twins From Monocular Videos with Geometric and Motion Constraints

Articulat3D: 从单目视频中利用几何和运动约束重建关节式数字孪生

Lijun Guo, Haoyu Zhao, Xingyue Zhao, Rong Fu, Linghao Zhuang, Siteng Huang, Zhongyu Li, Hua Zou

机构 * Wuhan University(武汉大学) Hong Kong Embodied AI Lab(香港具身AI实验室) The Chinese University of Hong Kong(香港中文大学) Peking Union Medical College(北京协和医学院) University of Macau(澳门大学) Zhejiang University(浙江大学)

AI总结 提出Articulat3D框架,通过运动先验初始化和几何运动约束优化,从单目视频重建高保真关节式数字孪生,在合成和真实数据上达到最优性能。

Comments Accepted to ECCV 2026. 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏