arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

2026-06-16 至 2026-06-16 共收录 4
2606.07226 2026-06-16 cs.LG cs.AI cs.CL 版本更新

DEFINED: A Data-Efficient Computational Framework for Fine-Grained Creativity Assessment in Debate Scenarios

DEFINED: 辩论场景中细粒度创造力评估的数据高效计算框架

Tongzhou Yu, Mingjia Li, Hong Qian, Wenkai Wang, Zongbao Zhang, Yaoyu Jiang, Xiangfeng Wang, Aimin Zhou, Jiajun Guo

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学)

AI总结 提出DEFINED框架,通过层次化八维指标体系、预训练语言模型和混合粒度训练策略,在辩论场景中实现数据高效的细粒度创造力自动评估,优于现有方法。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04907 2026-06-16 cs.RO 版本更新

WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation

WAM-Nav:面向统一视觉导航的非对称潜在世界-动作建模

Ning Yang, Yan Huang, Kaiwen Peng, Ziheng He, Kai Wang, Cui Miao, Kailin Lyu, Guo Li, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) FiveAges National University of Defense Technology(国防科技大学) Tsinghua University(清华大学) GigaAI

AI总结 提出WAM-Nav,一种联合学习动作生成与潜在视觉预测的非对称扩散Transformer模型,通过共享扩散Transformer实现长时程动作与短时程视觉预测的联合扩散,并引入双流上下文条件机制和目标对齐模块,在统一策略下支持图像目标、点目标和无目标导航,在ClutterScenes和InternScenes基准上分别提升15.7%和3.3%的成功率,并在真实环境中实现85%的任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16211 2026-06-16 cs.SD 版本更新

NVV-SuperBench: Beyond Words, Beyond Quality-Benchmarking Nonverbal Vocalizations in Speech Generation

NVV-SuperBench:超越语言,超越质量——语音生成中非语言发声的基准测试

Liumeng Xue, Weizhen Bian, Jiahao Pan, Wenxuan Wu, Yilin Ren, Boyi Kang, Jingbin Hu, Ziyang Ma, Shuai Wang, Xinyuan Qian, Hung-yi Lee, Yike Guo

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) National Taiwan University(国立台湾大学)

AI总结 提出NVV-SuperBench基准,包含45类非语言发声的统一分类和多轴评估协议,用于测试语音生成系统在非语言发声控制、放置和感知显著性方面的能力,发现当前系统在低信噪比口部线索和长时情感发声方面存在瓶颈。

Comments Accepted as a long paper at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23014 2026-06-16 cs.CV 版本更新

Planning with Unified Multimodal Models

统一多模态模型规划

Yihao Sun, Zhilong Zhang, Yang Yu, Pierre-Luc Bacon

机构 * Mila - Québec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Nanjing University(南京大学)

AI总结 提出Uni-Plan框架,利用统一多模态模型同时作为策略、动态模型和价值函数,通过自判别过滤避免动态预测幻觉,在具身决策任务中优于VLM方法,无需专家演示且数据可扩展。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏