arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-06-08 至 2026-06-08 共收录 7
2606.07433 2026-06-08 cs.CV cs.AI cs.MM 新提交

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解

Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) CASIA(中国科学院自动化研究所) University of Tokyo(东京大学) University of Liverpool(利物浦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) UC Merced(加州大学默塞德分校)

AI总结 提出人类视角下视频理解的三个功能能力(观看、记忆、推理),构建统一框架分析视频MLLM的感知、记忆、推理和预测,并总结挑战、方法、应用及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07179 2026-06-08 cs.CV cs.MM eess.IV 新提交

EvoGS: Constructing Continuous-Layered Gaussian Splatting with Evolution Tree for Scalable 3D Streaming

EvoGS:基于进化树构建连续分层高斯泼溅以实现可扩展3D流式传输

Yuang Shi, Simone Gasparini, Géraldine Morin, Wei Tsang Ooi

机构 * National University of Singapore(国立新加坡大学) IRIT - University of Toulouse(图卢兹大学IRIT实验室) IPAL, IRL2955(IPAL研究所)

AI总结 提出EvoGS,首个连续分层高斯泼溅表示,通过进化树结构实现父-子细化,消除冗余并支持可扩展3D流式传输,传输负载和显存占用分别降低2.4倍和5.5倍。

Comments Project page: https://yuang-ian.github.io/evogs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07172 2026-06-08 cs.CV cs.AI cs.CL cs.LG 新提交

Textual Supervision Enhances Geospatial Representations in Vision-Language Models

文本监督增强视觉-语言模型中的地理空间表示

Marcelo Sartori Locatelli, Fernando Tonucci, Jea Kwon, Luiz Felipe Vecchietti, Bryan Nathanael Wijaya, Cheng Yaw Low, Virgilio Almeida, Meeyoung Cha

机构 * University of São Paulo(圣保罗大学) National University of Singapore(新加坡国立大学)

AI总结 研究视觉、视觉-语言及多模态模型的地理空间表示能力,发现文本监督能有效提升空间编码,推动地理空间AI发展。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06991 2026-06-08 cs.CV cs.AI 新提交

Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding

不要暂停:面向在线视频理解的流式视频-语言同步

Zhenyu Yang, Kairui Zhang, Shengsheng Qian, Weiming Dong, Changsheng Xu

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出流式视频-语言同步(SVLS)范式,通过帧驱动转换控制器和流式令牌调节器实现视频帧与语言生成的细粒度同步,在不中断感知的情况下进行实时交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06885 2026-06-08 cs.CV cs.AI 新提交

FreeAnimate: Training-Free Human Image Animation with Preview-Guided Denoising

FreeAnimate: 基于预览引导去噪的无训练人体图像动画

Yuan Zeng, Yujia Shi, Zongqing Lu, QingMin Liao

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出FreeAnimate框架,利用图像扩散模型内在能力实现无训练的人体图像动画,通过预览生成策略提供时序和结构先验,结合反演增强注意力和参考锚定自注意力模块,保证时序一致性和身份保持。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06836 2026-06-08 cs.RO cs.AI cs.CV 新提交

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation

像飞行员一样思考:细粒度长时程无人机导航

Xiangyi Zheng, Xiangyu Wang, Qinan Liao, Zimu Tang, Yue Liao, Dongyue Lyu, Guodong Wang, Junjie Liu, Si Liu

机构 * Colab Beihang University(北航) Meituan(美团) National University of Singapore(新加坡国立大学)

AI总结 提出FLIGHT基准和FLIGHT VLA异步架构,通过低频飞行员推理VLM与高频扩散动作模型解耦,实现无人机长时程语义指令下的平滑连续飞行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06805 2026-06-08 cs.RO cs.AI cs.SY eess.SY 新提交

Lane Change Trajectory Planning for Personalized Driving Comfort and Mobility Efficiency

车道变更轨迹规划:个性化驾驶舒适性与移动效率

Haoxuan Dong, Dongjun Li, Ziyou Song

机构 * Department of Mechanical Engineering(机械工程系) Department of Electrical Engineering(电气工程系) National University of Singapore(新加坡国立大学) Computer Science(计算机科学) University of Michigan(密歇根大学)

AI总结 提出一种神经网络驱动的轨迹规划器,结合三阶多项式轨迹生成与学习模块,通过双头共享骨干和基于误差胜者逻辑回归的统计门控机制,实现个性化舒适性与移动效率的平衡。

Comments Accepted by the IEEE Intelligent Vehicles Symposium (IEEE IV 2026), Detroit, MI, United States, June 22_25, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏