arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

2026-07-17 至 2026-07-17 共收录 5
2607.15198 2026-07-17 eess.AS cs.SD 新提交

SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings

SLT 2026真实TSE挑战:从对话录音中提取真实世界目标说话人

Shuai Wang, Zihan Qian, Ke Zhang, Jiangyu Han, Zikai Liu, Xiaoyang Yu, Haoyu Li, Marc Delcroix, Kai Yu, Lei Xie, Ming Li, Haizhou Li

机构 * Nanjing University(南京大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Brno University of Technology(布拉格技术大学) Northwestern Polytechnical University(西北工业大学) NTT, Inc.(NTT公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 介绍SLT 2026的REAL-TSE挑战,从真实对话录音提取目标说话人,有在线和离线赛道,评估指标多样,描述了任务定义等多方面内容及经验教训。

Comments Overview paper of Real-TSE Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14935 2026-07-17 cs.CV 新提交

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14660 2026-07-17 cs.CV 新提交

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14651 2026-07-17 cs.CR cs.AI 新提交

MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents

MemPoison:揭示大语言模型智能体中持久内存威胁和结构盲点

Jifeng Gao, Kang Xia, Yi Zhang, Xiaobin Hong, Mingkai Lin, Xingshen Wei, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) NARI Group Corporation/State Grid Electric Power Research Institute, China(国网电力研究院/国电电力集团)

AI总结 研究大语言模型智能体持久内存安全漏洞,提出MemPoison框架,含1227个案例,涵盖多种攻击类型等并评估多个模型系列。引入分类法,揭示防御边界及盲点,主张转向自适应、上下文敏感的内存防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00724 2026-07-17 cs.CL 版本更新

MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark

MSQA:一个原生来源的多语言多文化SimpleQA基准

Xianru Chen, Yukai Huang, Mingxiang Chen, Xinping Lei, Fangbing Deng, Jin Chen, Ge Zhang, Wenhao Huang, Jiaheng Liu

机构 * M-A-P ByteDance Seed(字节跳动Seed) Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学)

AI总结 提出MSQA基准,包含1064个原生问题覆盖11种语言和5个文化维度,评估18个LLM发现文化能力随预训练暴露程度下降,且推理时补救措施无效。

Comments Due to the company's data approval issue, we need to withdraw the article

详情

展开后加载摘要…

URL PDF HTML 收藏