arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-04-10 至 2026-04-10 共收录 8
2604.08540 2026-04-10 cs.CV cs.AI cs.CL

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

AVGen-Bench: 一项面向多粒度评估的文本到音频视频生成任务驱动基准

Ziwei Zhou, Zeyuan Lai, Rui Wang, Yifan Yang, Zhen Xing, Yuqing Yang, Qi Dai, Lili Qiu, Chong Luo

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

AI总结 AVGen-Bench通过11个真实场景的高质量提示,结合轻量专家模型与多模态大语言模型,实现对文本到音频视频生成的多粒度评估,揭示了音频视觉美学与语义可靠性之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23727 2026-04-10 cs.SD cs.AI

AudioMoG: Guiding Audio Generation with Mixture-of-Guidance

AudioMoG:通过混合指导引导音频生成

Junyou Wang, Zehua Chen, Binjie Yuan, Kaiwen Zheng, Chang Li, Yuxuan Jiang, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu AI(生数科技) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出AudioMoG,一种改进的采样方法,在无需大量训练资源的情况下提升文本到音频和视频到音频生成质量,同时在多样性保持和生成质量上优于单一指导方法。

Comments Accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08033 2026-04-10 cs.AI cs.MA cs.NI

IoT-Brain: Grounding LLMs for Semantic-Spatial Sensor Scheduling

IoT-Brain:为语义-空间传感器调度 grounding LLMs

Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin, Jinke Song

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出IoT-Brain系统,通过引入空间轨迹图(STG)解决LLM在语义-空间传感器调度中的表示、推理和优化缺陷,提升任务成功率37.6%并显著降低资源消耗。

Comments To appear in ACM MobiCom 2026; 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07957 2026-04-10 cs.AI cs.CV cs.RO

WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models

WorldMAP: 通过生成世界模型提升视觉-语言导航轨迹预测

Hongjin Chen, Shangyun Jiang, Tonghua Su, Chen Gao, Xinlei Chen, Yong Li, Zhibo Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong University(山东大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院)

AI总结 WorldMAP通过生成世界模型与教师-学生框架,将生成的未来场景转化为语义空间结构和规划监督,提升导航轨迹预测的稳定性与准确性,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07837 2026-04-10 cs.AI

SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility

SPARD:通过整合奖励动态和数据效用实现强化学习对齐的自适应课程

Xuyang Zhi, Peilun zhou, Chengqiang Lu, Hang Lv, Yiwei Liang, Rongyang Zhang, Yan Gao, YI WU, Yao Hu, Hongchao Gu, Defu Lian, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书)

AI总结 SPARD通过动态调整多目标奖励权重和数据重要性,提升强化学习对齐效果,实验显示在多个基准上显著增强模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07812 2026-04-10 cs.CV

HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models

HAWK:多模态模型中的头部重要性感知视觉标记修剪

Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua Dong, Xianzhi Yu, Yinfei Pan

机构 * University of Science and Technology of China(中国科学技术大学) ChangXin Memory Technologies, Inc(长鑫存储技术有限公司) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

AI总结 HAWK通过识别不同注意力头在视觉任务中的重要性,有效保留关键视觉标记,提升多模态模型的推理效率与性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07737 2026-04-10 cs.CL

SepSeq: A Training-Free Framework for Long Numerical Sequence Processing in LLMs

SepSeq:一种无需训练的长数值序列处理框架

Jie Sun, Yu Liu, Lu Han, Qiwen Deng, Xiang Shu, Yang Xiao, Xingyu Lu, Jun Zhou, Pengfei Liu, Lintao Ma, Jiancan Wu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) University of Edinburgh(爱丁堡大学) East China Normal University(华东师范大学) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) Ocean University of China(中国海洋大学)

AI总结 针对LLM处理长数值序列性能下降问题,提出SepSeq框架通过插入分隔符令牌缓解注意力分散,提升准确率并减少推理令牌消耗。

Comments 16 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03745 2026-04-10 cs.CV

Dual-level Modality Debiasing Learning for Unsupervised Visible-Infrared Person Re-Identification

双层模态去偏学习用于无监督可见-红外人重识别

Jiaze Li, Yan Lu, Bin Liu, Guojun Yin, Mang Ye

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science, Wuhan University(武汉大学计算机学院)

AI总结 本文提出双层模态去偏学习框架,通过模型和优化层面的去偏策略解决模态偏置问题,提升无监督可见-红外人重识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏